Что случилось
На arXiv появился препринт OpenDiscoveryTrace — первый открытый датасет, фиксирующий не только результаты работы AI-агентов в научных задачах, но и полные логи их рассуждений. В датасет вошли 558 полных траекторий семи моделей, выполняющих 124 задачи в области drug discovery, материаловедения, геномики и анализа научной литературы.
Почему это важно
Существующие бенчмарки для автономных AI-учёных оценивают только финальный результат: сгенерированный код, гипотезу или статью. Это не позволяет проверить, как именно модель пришла к решению — путём систематических рассуждений или случайного угадывания. OpenDiscoveryTrace решает эту проблему, сохраняя пошаговую трассу с девятью полями на каждый шаг: мысль, вызов инструмента, наблюдение, ошибка, триггер ревизии и самооценка уверенности.
Что показал анализ
Пилотное исследование на 363 траекториях, оценённых LLM, выявило разительные различия между фронтальными моделями:
- GPT-5.4, Claude Opus 4.6 и Gemini 3.1 Pro показали сопоставимый уровень успешности — 84–89%.
- Однако количество ошибок на траекторию различалось кардинально: у Claude Opus 4.6 — 2,5 ошибки, у GPT-5.4 — всего 0,08 (p < 0,0001, Cliff's δ = 0,613).
- Природа ошибок тоже разная: 66,7% ошибок Claude связаны с неправильным использованием инструментов, тогда как 83,6% ошибок GPT-5.4 — логические просчёты.
Структура датасета
OpenDiscoveryTrace включает траектории трёх фронтальных моделей (по 124 траектории каждая, сбалансированные по доменам и сложности) и четырёх открытых моделей: Qwen2.5-7B, Mistral-7B-v0.3, Phi-3.5-mini и Qwen2.5-1.5B (по 30 траекторий). Дополнительно добавлены 60 траекторий с live-retrieval. Каждая трасса содержит структурированные шаги с временными метками, что позволяет воспроизвести ход рассуждений модели.
Практическое значение
Для разработчиков AI-агентов датасет открывает возможность диагностировать, на каком этапе workflow модель сбоит: при выборе инструмента, интерпретации данных или формировании гипотезы. Для исследователей AI-безопасности и governance — это инструмент аудита научной методологии, который ранее был недоступен. Пять бенчмарк-задач с baseline-решениями (логистическая регрессия, random forest, LSTM, Transformer) уже включены в релиз.
Ограничения
Авторы отмечают, что оценка трасс проводилась с помощью LLM-жюри, что может вносить собственные искажения. Датасет покрывает только задачи с чёткими критериями успеха — для открытых исследовательских вопросов методология может потребовать адаптации. Траектории открытых моделей значительно короче, что ограничивает статистическую мощность сравнений.
Источники
- Препринт: OpenDiscoveryTrace: Process Traces for Evaluating AI Scientist Workflows (arXiv:2609.09203)
- Репозиторий с датасетом и кодом: CC BY 4.0
- Verification lead: Anthropic (поскольку Claude Opus 4.6 входит в число протестированных моделей)