Запись архива

Воспроизводимость AI-бенчмарков не гарантирует верификации бизнес-заявлений

Аналитик проверил пять AI-проектов XPRIZE: технические результаты воспроизводились, но бизнес-заявления оказались сложнее. Например, “91,2%” зависели от метода агрегации, а “AI управляет бизнесом” скрывал три разных механизма.

График с расхождением между воспроизводимыми бенчмарками и бизнес-заявлениями AI-проектов
График с расхождением между воспроизводимыми бенчмарками и бизнес-заявлениями AI-проектов
Visit of Ursula von der Leyen, President of the European Commission, to India (P-065755-00-36).jpg | by Europäische Kommission — Audiovisueller Dienst, CE — Service audiovisuel, EC — Audiovisual Service, Dati Bendo | wikimedia_commons | CC BY 4.0

Пользователь Reddit под ником mx883 провёл независимую верификацию пяти AI-проектов из числа финалистов XPRIZE. Результаты оказались неожиданными: технические показатели воспроизводились буквально, но бизнес-заявления требовали существенных уточнений. Разбор опубликован в личном блоге автора.

Проблема агрегации метрик

Один из проектов заявлял о 91,2% точности воспроизведения поведенческо-научных эффектов. Автор запустил публичный код и скрипты подсчёта — результат совпал. Однако выяснилось, что показатель зависел от правила агрегации:

  • Любая из пяти моделей: 91,2%
  • Лучшая отдельная модель: 79,4%
  • Объединённые ответы: 73,5%
  • Большинство моделей: 67,6%

Репозиторий проекта честно указывал, что первое правило — оптимистичный потолок. Вопрос, таким образом, сместился с “фальсифицированы ли данные?” на “что именно измеряет эта метрика?”.

Три механизма под одной вывеской

Другой проект утверждал, что AI ставит на паузу рекламный бюджет, переписывает стратегию еженощно и генерирует тексты для продуктов. Анализ опубликованного кода показал:

  • Пауза рекламы: детерминированные пороги, без вызова модели
  • Стратегия: Claude
  • Тексты продуктов: Gemini

Фраза “AI управляет бизнесом” технически объединяла три совершенно разных механизма, от простого правила до вызова двух разных LLM. Пользователь отмечает, что ни одно из этих утверждений не было ложным — но их интерпретация требовала контекста.

Юридический перевод без юридических данных

Проект в области юридического перевода ссылался на бенчмарк WMT25: 87 документов, 332 сегмента. Проверка официального датасета показала, что он содержит литературные, новостные, социальные и устные тексты. Юридических сегментов — ноль.

Автор подчёркивает, что во всех пяти случаях технические утверждения воспроизводились. Единственное, что не удалось проверить независимо — выручка, количество клиентов и реальное использование, поскольку эти данные не были публичными.

Граница между воспроизводимостью и верификацией

Ключевой вывод mx883: воспроизводимость бенчмарка — необходимое, но недостаточное условие для верификации бизнес-заявления. Даже когда код работает и метрики сходятся, остаются вопросы:

  • Какая часть системы действительно использует AI?
  • Что именно измеряет метрика?
  • На каких данных проводилось обучение и тестирование?
  • Какой объём реального использования подтверждён?

Пользователь формулирует проблему так: “когда AI-бенчмарк воспроизводится точно, что ещё должно быть истинным, чтобы вы назвали заявление независимо верифицированным?”

Практический урок для разработчиков

Ситуация демонстрирует разрыв между технической демонстрацией и продуктовой реальностью. Для команды, внедряющей AI в рабочие процессы, это означает необходимость:

Проверять не только метрики, но и методологию их расчёта

Различать, где в системе действительно работает модель, а где — детерминированные правила
3. Требовать публикации датасетов и кода для независимой верификации

Источники:
— Оригинальный пост на Reddit: https://www.reddit.com/r/artificial/comments/1wiwt4y/
— Полный разбор в блоге автора (ссылка в посте)
— Anthropic (верификационный лид): https://www.anthropic.com/news