Аудит LLM-судьи в Text-to-SQL выявил почти случайное согласие с экспертами

Авторы нового препринта проверили LLM-судью на базе gpt-4o-mini в рабочем Text-to-SQL-сервисе. На выборке с повышенной долей спорных случаев каппа Коэна составила 0,04, а самостоятельно размещённая Qwen3.6-27B показала 0,72.

Схема аудита согласия LLM-судьи и экспертов при оценке SQL-запросов
Схема аудита согласия LLM-судьи и экспертов при оценке SQL-запросов
Butterfly Dreams | by Pink Poppy Photography | openverse | by

Авторы опубликованного 28 сентября 2026 года препринта на arXiv проверили, насколько LLM-судья в рабочем Text-to-SQL-сервисе согласуется с оценками людей. Результат для развёрнутой версии на базе gpt-4o-mini оказался слабым: каппа Коэна составила 0,04 на специально собранной выборке с повышенной долей расхождений и 0,42 при равномерной случайной проверке.

Это различие между двумя выборками существенно. Значение 0,04 не следует переносить на весь поток запросов: набор был намеренно обогащён случаями, в которых автоматическая и человеческая оценки расходились. Однако случайная проверка с каппой 0,42 также показывает, что полагаться на итоговый вердикт модели без измерения согласия рискованно.

Работа пока имеет статус препринта и, судя по странице arXiv, не прошла независимое рецензирование. Все показатели моделей, стоимости и покрытия ниже приводятся по данным самих авторов.

Судья отклонял запросы, которые эксперты считали корректными

В исследуемом сервисе языковая модель находилась в конце Text-to-SQL-процесса. Она должна была определить, соответствует ли сгенерированный SQL исходному вопросу на естественном языке. До аудита согласие этого автоматического судьи с людьми систематически не измерялось.

В наборе с повышенной долей расхождений gpt-4o-mini ошибочно отклонила 77,1% примеров, которые два автора-аннотатора отнесли к категории human-FAITHFUL. Иными словами, люди считали SQL соответствующим поставленной задаче, тогда как модель находила основание пометить его как неверный.

Авторы связывают большую часть таких ложных флагов с механизмом, названным GRADE-HALLUCINATION. Под ним они понимают ситуацию, когда модель при оценивании придумывает дефект или несоответствие, отсутствующее в проверяемом запросе. Это отличается от обычного случайного промаха: повторяющийся механизм способен систематически искажать метрики всего продукта, например занижать долю успешных SQL-запросов или отправлять слишком много результатов на повторную генерацию.

Каппа Коэна в этом контексте полезнее простого процента совпадений, поскольку учитывает согласие, которое могло возникнуть случайно. При этом одна цифра не раскрывает направление ошибок. Поэтому для производственного аудита необходимо отдельно считать ложные отклонения корректных запросов и ложные одобрения некорректных.

Qwen приблизилась к Claude, но сравнение ограничено выборкой

В качестве замены авторы испытали самостоятельно размещённую Qwen3.6-27B. По их данным, она достигла каппы 0,72 против 0,71 у Claude Opus 4.7. Исследователи оценивают стоимость одного вызова Qwen примерно в 1/300 стоимости обращения к Claude.

Вариант судьи Каппа Коэна Условие или ограничение
gpt-4o-mini 0,04 Выборка с повышенной долей расхождений
gpt-4o-mini 0,42 Равномерная случайная проверка
Qwen3.6-27B 0,72 Самостоятельное размещение
Claude Opus 4.7 0,71 Сравнение с Qwen проведено на 96 примерах
Три сильных судьи 0,79 Единогласное решение, автопокрытие 89,7%

Разницу между 0,72 и 0,71 нельзя трактовать как доказанное превосходство Qwen. Авторы прямо указывают, что парное сравнение при n=96 не обладает достаточной статистической мощностью. Практический аргумент исследования состоит не в победе на одну сотую, а в близком уровне согласия при заявленной большой разнице в цене.

Оценка «в 300 раз дешевле» также требует проверки в конкретной инфраструктуре. Итоговая стоимость самостоятельно размещённой модели зависит от загрузки ускорителей, длины контекста, пакетной обработки, задержки, резервирования мощностей и труда команды эксплуатации. Препринт показывает расчёт авторов для их сценария, а не универсальный тариф для любого сервиса.

Материалы эксперимента, включая код и сведения о предварительной регистрации, опубликованы в репозитории synca-audit. Это позволяет командам изучить протокол и проверить, насколько он переносим на собственные данные.

Добавление слабой модели испортило ансамбль

Авторы отдельно проверили распространённую идею: объединить дешёвого слабого судью с более сильным. По результатам препринта, такое сочетание не дало бесплатного улучшения и ухудшило согласие. Причина практически значима: если решение ансамбля зависит от модели с систематическими ложными флагами, её ошибки продолжают влиять на итоговый вердикт.

Лучший результат в работе показала схема из трёх сильных судей с маршрутизацией по единогласию. Она достигла каппы 0,79 при автоматическом покрытии 89,7%. Оставшиеся 10,3% примеров, по которым модели не пришли к единому решению, можно направлять человеку.

Такой показатель покрытия не равен точности. Он сообщает лишь, для какой доли заданий система способна выдать единогласный автоматический ответ. Перед внедрением команде всё равно потребуется проверить, насколько надёжны эти согласованные решения, какие типы ошибок попадают в ручную очередь и не меняются ли результаты после обновления моделей.

Аудит затронул и эталонные SQL-запросы

Ту же процедуру исследователи применили вне исходного продукта — к финансовой части набора BIRD. Согласно препринту, 25,5% экспертных эталонных SQL-запросов были отмечены как кандидаты на проблемы по протоколу авторов.

Эта цифра не означает, что четверть BIRD-financial уже доказанно ошибочна. Автоматический аудит формирует список кандидатов, после чего каждый случай требует ручного разбора. Возможны ошибки самого судьи, различия в трактовке вопроса, неоднозначность схемы базы данных или несовпадение протоколов аннотации. Общая информация о benchmark и его устройстве доступна на официальной странице BIRD.

Для команд, использующих LLM-as-judge, из работы следует конкретная проверка: взять случайную выборку реального трафика, независимо разметить её минимум двумя людьми, измерить каппу и построить матрицу ошибок по направлениям. Отдельную выборку стоит составить из расхождений между моделью и экспертами — она поможет найти повторяющиеся механизмы вроде GRADE-HALLUCINATION, однако её показатели нельзя выдавать за частоту ошибок во всём потоке.

При выборе замены следует сравнивать не только среднее согласие. Нужны стоимость полного цикла, задержка, доля обращений к человеку, устойчивость на разных схемах баз данных и повторная проверка после каждого обновления судьи. Пока выводы исследования ограничены одним производственным сценарием, авторским протоколом разметки и небольшим прямым сравнением Qwen с Claude.

Источники