
Доказательств того, что OpenAI присвоила неопубликованные работы математиков, сейчас нет. Однако компания не дала и проверяемого подтверждения обратного. Ее публичные формулировки исключают прямой доступ исследовательских агентов к конкретным пользовательским данным, но оставляют открытым более важный вопрос: могли ли идеи из частных разговоров попасть в обезличенные наборы данных, повлиять на последующее обучение моделей и вернуться в виде «нового» математического результата.
Именно в этом разрыве между прямым доступом и косвенным влиянием находится суть конфликта. Математик Андреас Том утверждает, что OpenAI продемонстрировала необычно глубокое знание методов из его области после того, как он и его коллеги общались с ChatGPT. Ранее профессор Нью-Йоркского университета Тристан Бакмастер задал похожий вопрос в связи со своей работой и использованием Codex.
Это серьезные основания для проверки, но не доказательство неправомерного использования данных. Совпадение методов может объясняться опубликованными работами, независимым выводом или общим интеллектуальным контекстом. В то же время установить происхождение конкретного поведения модели извне практически невозможно: журналы обработки данных, версии обучающих корпусов и внутренняя история экспериментов находятся у OpenAI. Поэтому требование математиков сводится не к тому, чтобы компания раскрыла все параметры модели, а к тому, чтобы ее отрицание можно было проверить.
Что именно подозревают исследователи
Один из десяти математических результатов, представленных OpenAI, относился к не-софическим группам. В грубом приближении речь идет о бесконечных алгебраических структурах, которые нельзя аппроксимировать конечными структурами определенного типа.
OpenAI признала, что результат в значительной степени опирался на предыдущую работу Андреаса Тома и Габора Куна. По сообщению The Verge, первоначальное описание компании критиковали за отсутствие упоминания их недавнего вклада, после чего текст был незаметно исправлен.
Само по себе позднее добавление ссылки не доказывает использования частных данных. Это может быть обычной, хотя и неприятной, ошибкой атрибуции. Насторожило Тома другое: насколько подробно OpenAI владела техниками, которые, по его оценке, в тот момент не выглядели ни самым очевидным, ни самым перспективным путем к решению.
После этого Том обратился к исследователям OpenAI Себастьяну Бубеку и Марку Селлке. Он хотел выяснить, могли ли его взаимодействия с ChatGPT оказаться частью обучающих данных или быть доступными в процессе получения результата.
По пересказу The Verge, ответ касался возможности непосредственного доступа к разговорам, но не прояснил, могли ли их обезличенные производные использоваться для улучшения моделей. Том назвал такую формулировку как минимум вводящей в заблуждение и заявил: «I take this as dishonesty to say the least».
Здесь важно разделять наблюдение и интерпретацию. Наблюдением является совпадение исследовательской тематики, детальное использование знакомых Тому методов и последующее исправление атрибуции. Интерпретацией остается вывод, что источником обязательно были частные диалоги. Открытые данные пока не позволяют подтвердить эту причинную связь.
Прямой доступ и обучение — не одно и то же
Компания может совершенно точно заявить, что ее исследователи и агенты не открывали конкретный разговор пользователя, но это не отвечает на вопрос о жизненном цикле содержащейся в нем информации.
Условно возможны как минимум четыре разных механизма:
Человек вручную прочитал пользовательский диалог и передал идею исследовательской группе.
2. Система извлекла конкретный разговор во время решения задачи через поиск или иной механизм доступа.
3. Содержание разговора ранее вошло в набор для обучения или дополнительной настройки, после чего повлияло на параметры модели.
4. Из взаимодействий пользователей были получены обезличенные примеры, оценки или другие производные сигналы, которые улучшили модель без сохранения имени автора.
Отрицание первых двух сценариев не исключает третий и четвертый. Деидентификация защищает личность лишь в той мере, в какой действительно удаляет идентификаторы. Она не обязательно уничтожает математическое содержание. Как сформулировал Том, удаление имени не удаляет интеллектуальную идею.
Эта проблема уже проявилась в другом эпизоде. В сообщении о работе над уравнениями Навье — Стокса OpenAI заявила, что исследователи и агенты не видели работу конкурирующей группы до ее публикации и что для решения не использовались конкретные пользовательские данные. Однако компания отдельно признала: хотя это представляется маловероятным, она не может исключить влияние обезличенных данных, полученных из использования ее продуктов, на улучшение моделей.
Такое уточнение выглядит юридически и технически осторожным. Оно не равнозначно признанию использования чужой работы. Но для ученого, который вводил неопубликованные идеи в продукт, практическая разница может оказаться небольшой: интеллектуальное содержание теоретически могло усилить систему, даже если никто в OpenAI не читал исходный чат и не знал имени автора.
Редакционная проверка: какие гипотезы выдерживают имеющиеся факты
Чтобы не подменять расследование подозрением, мы разложили ситуацию на три конкурирующие гипотезы и сопоставили их с фактами, описанными The Verge. Это не технический аудит OpenAI: у нас нет внутренних журналов, версий датасетов или снимков моделей. Метод позволяет лишь определить, какие объяснения публичная информация уже исключает, а какие остаются возможными.
Первая гипотеза — прямое получение неопубликованной работы. Ее подтверждением могли бы стать журналы доступа к конкретным чатам, совпадения с уникальными неопубликованными формулировками или свидетельства участников. Ничего подобного в опубликованном материале нет. Более того, OpenAI отрицает прямой доступ к конкретным пользовательским данным в эпизоде с Навье — Стоксом. На текущем уровне доказательств обвинение в прямой краже не установлено.
Вторая гипотеза — косвенное влияние обезличенных взаимодействий. Ее поддерживает не доказательство, а оставленная самой компанией неопределенность: OpenAI не смогла категорически исключить, что производные от пользовательской активности данные улучшили модели. Ответ Тому, по его словам, также не закрыл этот сценарий. Следовательно, гипотеза остается открытой, но неподтвержденной.
Третья гипотеза — независимое получение результата на основе публичной литературы. Она вполне правдоподобна. Модель и исследовательская команда могли объединить опубликованные методы, включая работы Тома и Куна, без использования частных разговоров. Детальное совпадение подходов повышает интерес к проверке, но в математике оно не обязательно аномально: специалисты, исходящие из одной литературы и работающие над одной задачей, способны прийти к сходным конструкциям.
Есть и промежуточный вариант: публичная статья была в обучающих данных, однако ее влияние оказалось плохо отражено в первоначальной атрибуции. Это проблема научной добросовестности и происхождения результата, но не обязательно нарушение конфиденциальности.
Итог проверки ограничен, но важен: публичные факты не позволяют выбрать между независимым выводом и косвенным влиянием пользовательских данных. Зато они показывают, что заявление «конкретный чат не открывали» недостаточно для снятия вопроса.
Почему доказать отрицание трудно, но возможно проверить процесс
Требование «докажите, что вы не использовали нашу работу» звучит как просьба подтвердить отрицательный факт. В абсолютном виде выполнить его почти невозможно: нельзя перебрать все внутренние состояния большой модели и однозначно указать происхождение каждой идеи.
Но от OpenAI требуется не философское доказательство отсутствия влияния. Компания может представить проверяемую цепочку обращения с данными.
Для эпизода с конкретным математическим результатом такой аудит должен ответить как минимум на следующие вопросы:
— Какие модели и их версии использовались на каждом этапе исследования?
— Какие наборы данных применялись для их обучения, дополнительной настройки и оценки?
— Могли ли пользовательские чаты или производные от них материалы попасть в эти наборы?
— Какие настройки использования данных действовали для аккаунтов исследователей в соответствующие даты?
— Были ли в наборах фрагменты, совпадающие с уникальными формулировками или конструкциями из неопубликованных работ?
— Имели ли сотрудники или программные агенты возможность искать по истории пользовательских взаимодействий?
— Какие публичные статьи и черновики были доступны системе до начала работы?
— Когда именно возникли ключевые элементы доказательства и как они менялись между экспериментами?
Публиковать все пользовательские разговоры или полный обучающий корпус для этого не требуется. Проверку может провести независимая сторона в защищенной среде, а затем выпустить отчет о процедурах, найденных совпадениях и границах уверенности. Для воспроизводимости полезны криптографически зафиксированные перечни датасетов, номера версий моделей и журналы доступа, не раскрывающие содержимое чужих данных.
Даже такой аудит не даст стопроцентной гарантии. Обучающие конвейеры сложны, данные могут проходить через несколько стадий преобразования, а влияние отдельного примера на итоговое рассуждение трудно измерить. Но проверка процесса значительно сильнее категоричного ответа без материалов, на основании которых его можно оценить.
Где проходит граница между плагиатом и влиянием модели
В традиционной научной публикации происхождение идеи отслеживают через цитирование, черновики, переписку и историю совместной работы. С генеративной системой эта схема ломается. Модель может воспроизвести структуру аргумента, не выдавая дословного совпадения и не сохраняя явной ссылки на автора.
Поэтому здесь смешиваются несколько разных претензий.
Первая — нарушение конфиденциальности: частный исследовательский материал использовали не в тех целях, для которых пользователь его предоставил.
Вторая — отсутствие согласия: данные могли пойти на улучшение модели, хотя автор не воспринимал экспериментальный разговор как вклад в обучающий корпус.
Третья — недостаточная атрибуция: публичная работа исследователей повлияла на результат, но ее роль первоначально не обозначили должным образом.
Четвертая — конкурентный конфликт: компания улучшает систему за счет взаимодействий ученых, а затем применяет ее, чтобы опередить тех же ученых в публикации.
Эти нарушения требуют разных доказательств. Исправленная ссылка может подтвердить проблему с атрибуцией, но ничего не говорит о доступе к частному чату. Совпадение математической техники может оправдать аудит, но не устанавливает нарушение условий использования. А включение обезличенного материала в обучение не автоматически означает плагиат: необходимо выяснить, что именно было использовано, на каких условиях и насколько результат зависит от этого материала.
По этой причине заголовки обсуждений на Reddit об «украденной работе» нельзя считать первичным подтверждением. В предоставленных результатах поиска видны только названия публикаций в сообществах r/LocalLLaMA, r/codex и r/ArtificialInteligence. Они отражают общественную реакцию, но не добавляют документов, журналов или технических тестов.
Возражения в пользу OpenAI
Самый сильный контраргумент состоит в том, что необычайное владение методом еще не указывает на утечку. OpenAI могла использовать опубликованные работы Тома и Куна, комбинировать их с другими открытыми результатами и получить решение независимо. Если исходная литература достаточно подробно описывает технику, ее применение моделью не должно считаться подозрительным само по себе.
Не исключена и обычная ошибка коммуникации. Исследователь мог отвечать на узкий технический вопрос о прямом доступе к чатам, тогда как Том интерпретировал ответ как отрицание любого возможного влияния. Это все равно говорит о недостаточной точности формулировки, но не обязательно о намеренной нечестности.
Наконец, требование раскрыть все датасеты может конфликтовать с приватностью других пользователей, коммерческой тайной и лицензиями. Полная публикация корпуса действительно не выглядит реалистичным решением. Однако этот аргумент не отменяет независимого аудита, раскрытия категорий данных и документирования конкретного исследования.
Позицию OpenAI существенно усилили бы датированные записи, показывающие появление основных шагов доказательства до использования релевантных пользовательских данных, либо проверка, подтверждающая отсутствие материалов Тома и Бакмастера в соответствующих конвейерах. Ослабили бы ее найденные совпадения с уникальными неопубликованными конструкциями, следы доступа к чатам или документы, показывающие целенаправленное использование производных данных без согласия авторов.
Что этот спор меняет для науки
Риск выходит за пределы репутации одной компании. По данным The Verge, математиков обеспокоило, что OpenAI занялась задачей Навье — Стокса после слухов о значительном прогрессе другой группы. Заявленный компанией результат еще должен пройти проверку, но сам сценарий создает новый стимул для секретности: даже информация о том, что ученые близки к прорыву, может привлечь технологического конкурента с большими вычислительными и кадровыми ресурсами.
Для исследователей практический вывод неприятен. Пока правила и техническая цепочка обработки данных не прозрачны, частный разговор с облачным ИИ следует считать потенциальным раскрытием материала третьей стороне. Это не означает, что сервис обязательно обучается на каждом введенном тексте. Это означает, что автору трудно независимо проверить обратное.
Университетам и научным группам нужен режим работы с неопубликованными идеями: классификация чувствительных материалов, запрет на отправку отдельных черновиков во внешние сервисы без согласования, фиксация использованных инструментов и сохранение локальной истории возникновения доказательств. Для особенно ценных результатов разумнее применять среды с договорными гарантиями, контролируемым хранением и ясным запретом на использование данных для улучшения общих моделей.
OpenAI, в свою очередь, может превратить нынешний конфликт в стандарт прозрачности: заранее публиковать политику происхождения математических результатов, фиксировать версии моделей и источников, проводить внешний аудит спорных работ и четко разделять «мы не открывали конкретный чат» и «содержание чата никак не повлияло на модель».
Пока компания доказала только более узкое утверждение — по крайней мере в своей публичной формулировке об исследовании Навье — Стокса. Математики требуют ответа на более широкий вопрос. Между ними остается пространство, в котором обвинение еще не доказано, но доверие уже нельзя восстановить одним категоричным заверением.
