Запись архива

OpenDiscoveryTrace: первый датасет трасс AI-учёных раскрывает разницу между «думает» и «угадал»

Исследователи представили OpenDiscoveryTrace — публичный датасет из 558 полных траекторий AI-агентов. Данные показывают, что Claude Opus 4.6 ошибается в 30 раз чаще GPT-5.4, но ошибки у моделей принципиально разные.

OpenDiscoveryTrace: первый датасет трасс AI-учёных раскрывает разницу между «думает» и «угадал»

Что случилось

На arXiv появился препринт OpenDiscoveryTrace — первый открытый датасет, фиксирующий не только результаты работы AI-агентов в научных задачах, но и полные логи их рассуждений. В датасет вошли 558 полных траекторий семи моделей, выполняющих 124 задачи в области drug discovery, материаловедения, геномики и анализа научной литературы.

Почему это важно

Существующие бенчмарки для автономных AI-учёных оценивают только финальный результат: сгенерированный код, гипотезу или статью. Это не позволяет проверить, как именно модель пришла к решению — путём систематических рассуждений или случайного угадывания. OpenDiscoveryTrace решает эту проблему, сохраняя пошаговую трассу с девятью полями на каждый шаг: мысль, вызов инструмента, наблюдение, ошибка, триггер ревизии и самооценка уверенности.

Что показал анализ

Пилотное исследование на 363 траекториях, оценённых LLM, выявило разительные различия между фронтальными моделями:

  • GPT-5.4, Claude Opus 4.6 и Gemini 3.1 Pro показали сопоставимый уровень успешности — 84–89%.
  • Однако количество ошибок на траекторию различалось кардинально: у Claude Opus 4.6 — 2,5 ошибки, у GPT-5.4 — всего 0,08 (p < 0,0001, Cliff's δ = 0,613).
  • Природа ошибок тоже разная: 66,7% ошибок Claude связаны с неправильным использованием инструментов, тогда как 83,6% ошибок GPT-5.4 — логические просчёты.

Структура датасета

OpenDiscoveryTrace включает траектории трёх фронтальных моделей (по 124 траектории каждая, сбалансированные по доменам и сложности) и четырёх открытых моделей: Qwen2.5-7B, Mistral-7B-v0.3, Phi-3.5-mini и Qwen2.5-1.5B (по 30 траекторий). Дополнительно добавлены 60 траекторий с live-retrieval. Каждая трасса содержит структурированные шаги с временными метками, что позволяет воспроизвести ход рассуждений модели.

Практическое значение

Для разработчиков AI-агентов датасет открывает возможность диагностировать, на каком этапе workflow модель сбоит: при выборе инструмента, интерпретации данных или формировании гипотезы. Для исследователей AI-безопасности и governance — это инструмент аудита научной методологии, который ранее был недоступен. Пять бенчмарк-задач с baseline-решениями (логистическая регрессия, random forest, LSTM, Transformer) уже включены в релиз.

Ограничения

Авторы отмечают, что оценка трасс проводилась с помощью LLM-жюри, что может вносить собственные искажения. Датасет покрывает только задачи с чёткими критериями успеха — для открытых исследовательских вопросов методология может потребовать адаптации. Траектории открытых моделей значительно короче, что ограничивает статистическую мощность сравнений.

Источники

  • Препринт: OpenDiscoveryTrace: Process Traces for Evaluating AI Scientist Workflows (arXiv:2609.09203)
  • Репозиторий с датасетом и кодом: CC BY 4.0
  • Verification lead: Anthropic (поскольку Claude Opus 4.6 входит в число протестированных моделей)