OpenAI представила PaperBench — бенчмарк для оценки способности ИИ воспроизводить AI-исследования
OpenAI запустила PaperBench — бенчмарк, в котором агенты должны воспроизвести 20 докладов ICML 2024 с нуля. Лучший результат показал Claude 3.5 Sonnet — 21%, тогда как PhD-исследователи набрали 41%. Бенчмарк включает 8316 задач и...
Открыть материал →
