Практики даних OpenAI викликають занепокоєння щодо інтелектуальної власності у ChatGPT та Codex
Математики зажадали від OpenAI роз'яснень щодо використання неопублікованих досліджень із ChatGPT та Codex у моделях компанії. OpenAI визнала, що деідентифіковані дані користувачів могли потрапити у навчання, що вимагає негайного аудиту налаштувань приватності даних.

Вплив: Високий
Чому це важливо
Негайно перевірте налаштування телеметрії в ChatGPT та Codex, щоб уникнути витоку пропрієтарних алгоритмів і непублічного коду в навчальні датасети.
TL;DR
- 01OpenAI підтвердила, що не може виключити використання деідентифікованих даних із ChatGPT та Codex для навчання нових моделей.
- 02Деідентифікація прибирає метадані користувача, але залишає в датасеті алгоритмічну логіку, структури коду та математичні ідеї.
- 03Безкоштовні та стандартні акаунти типово передають дані для навчання, якщо функцію не вимкнено або немає корпоративної угоди про незбереження даних.
Ключові факти
- Оголошені математичні результати
- 10 результатів
- Доступ до сесій Нав'є — Стокса
- Спростовано OpenAI
- Використання деідентифікованих даних
- Не виключено OpenAI
Звинувачення у використанні даних для навчання
Математик Андреас Том звинуватив OpenAI у непрозорості після публікації 10 значних математичних результатів, зокрема щодо несофічних груп — нескінченних структур, які неможливо апроксимувати скінченними. За словами Тома, модель відтворила неочевидні техніки, розроблені ним спільно з Габором Куном. Раніше професор Нью-Йоркського університету Трістан Бакмастер також заявив про можливе запозичення його напрацювань через OpenAI Codex під час роботи над рівняннями Нав'є — Стокса разом із дослідником Anthropic Левентом Альпоге.
Проблема деідентифікації даних
У листуванні з дослідниками Себастьяном Бюбеком та Марком Селлке представники OpenAI заперечили прямий перегляд сесій користувачів. Проте компанія офіційно визнала: хоча це малоймовірно, вона не може виключити, що деідентифіковані дані взаємодії з сервісами допомогли покращити моделі. Видалення ідентифікаторів усуває персональні дані акаунта, але зберігає логіку алгоритмів, архітектурні структури та математичні формули в пулах для тренування.
Захист кодової бази та промптів
Інженерам, які використовують агентні IDE та чат-боти для закритих проєктів, варто ретельно контролювати налаштування збору телеметрії. Для чутливих алгоритмів необхідно використовувати робочі простори з гарантією Zero Data Retention або вручну вимикати передачу даних на навчання, оскільки стандартні налаштування часто вмикають тренування за замовчуванням.
Що зробити сьогодні
- Відкрийте налаштування Data Controls у ChatGPT та переконайтеся, що пункт покращення моделей вимкнено для всіх акаунтів команди.
- Перевірте конфігурацію API-ключів та плагінів агентних IDE на активність режиму Zero Data Retention.
- Встановіть внутрішні правила, які забороняють надсилати незакомічені пропрієтарні алгоритми в публічні інтерфейси LLM.
Що каже спільнота
“If I were a business, I wouldn't want my proprietary business information into a hands of a competitor. But CEOs are racing to do it, and (at best) relying in flimsy contractual guarantees...”
“See other post today about where OpenAI keeps flipping the toggle back to “share.” Even if it was technically turned on, the dark patterns that are clearly trying to override the obvious intent...”
Джерела