
Пользователь Reddit под ником mx883 провёл независимую верификацию пяти AI-проектов из числа финалистов XPRIZE. Результаты оказались неожиданными: технические показатели воспроизводились буквально, но бизнес-заявления требовали существенных уточнений. Разбор опубликован в личном блоге автора.
Проблема агрегации метрик
Один из проектов заявлял о 91,2% точности воспроизведения поведенческо-научных эффектов. Автор запустил публичный код и скрипты подсчёта — результат совпал. Однако выяснилось, что показатель зависел от правила агрегации:
- Любая из пяти моделей: 91,2%
- Лучшая отдельная модель: 79,4%
- Объединённые ответы: 73,5%
- Большинство моделей: 67,6%
Репозиторий проекта честно указывал, что первое правило — оптимистичный потолок. Вопрос, таким образом, сместился с “фальсифицированы ли данные?” на “что именно измеряет эта метрика?”.
Три механизма под одной вывеской
Другой проект утверждал, что AI ставит на паузу рекламный бюджет, переписывает стратегию еженощно и генерирует тексты для продуктов. Анализ опубликованного кода показал:
- Пауза рекламы: детерминированные пороги, без вызова модели
- Стратегия: Claude
- Тексты продуктов: Gemini
Фраза “AI управляет бизнесом” технически объединяла три совершенно разных механизма, от простого правила до вызова двух разных LLM. Пользователь отмечает, что ни одно из этих утверждений не было ложным — но их интерпретация требовала контекста.
Юридический перевод без юридических данных
Проект в области юридического перевода ссылался на бенчмарк WMT25: 87 документов, 332 сегмента. Проверка официального датасета показала, что он содержит литературные, новостные, социальные и устные тексты. Юридических сегментов — ноль.
Автор подчёркивает, что во всех пяти случаях технические утверждения воспроизводились. Единственное, что не удалось проверить независимо — выручка, количество клиентов и реальное использование, поскольку эти данные не были публичными.
Граница между воспроизводимостью и верификацией
Ключевой вывод mx883: воспроизводимость бенчмарка — необходимое, но недостаточное условие для верификации бизнес-заявления. Даже когда код работает и метрики сходятся, остаются вопросы:
- Какая часть системы действительно использует AI?
- Что именно измеряет метрика?
- На каких данных проводилось обучение и тестирование?
- Какой объём реального использования подтверждён?
Пользователь формулирует проблему так: “когда AI-бенчмарк воспроизводится точно, что ещё должно быть истинным, чтобы вы назвали заявление независимо верифицированным?”
Практический урок для разработчиков
Ситуация демонстрирует разрыв между технической демонстрацией и продуктовой реальностью. Для команды, внедряющей AI в рабочие процессы, это означает необходимость:
Проверять не только метрики, но и методологию их расчёта
Различать, где в системе действительно работает модель, а где — детерминированные правила
3. Требовать публикации датасетов и кода для независимой верификации
Источники:
— Оригинальный пост на Reddit: https://www.reddit.com/r/artificial/comments/1wiwt4y/
— Полный разбор в блоге автора (ссылка в посте)
— Anthropic (верификационный лид): https://www.anthropic.com/news
