
Исследователи из проекта Bias Audit Agreement провели масштабную проверку инструментов аудита предвзятости на десяти frontier-моделях. Результат оказался тревожным для регуляторов: хотя детекция предвзятости работает, ранжирование моделей по степени предвзятости невозможно — разные инструменты дают несогласованные результаты.
Что проверяли и как
На общей панели из десяти frontier-моделей (включая GPT-4, Claude, Gemini и другие) через единый шлюз инференса запустили десять инструментов аудита. Сначала тестировали гендерную предвзятость в профессиональном контексте, затем — возрастную и предвзятость по социально-экономическому статусу. Все сырые ответы, код и полный анализ доступны в репозитории GitHub.
Детекция работает, ранжирование — нет
Восемь из десяти инструментов обнаружили статистически значимую предвзятость (доверительные интервалы не включали ноль). Однако согласованность ранжирования моделей между инструментами оказалась на уровне случайности: Kendall’s W = 0.07 при p = 0.83.
Два широко используемых прямых зондирующих бенчмарка оказались насыщены — frontier-модели дают нейтральные ответы, что делает эти инструменты бесполезными для современного аудита.
Почему так происходит
Исследователи провели контрольный эксперимент с шестью заведомо более слабыми моделями. Внутриинструментальная надежность восстановилась, когда панель охватила реальные разрывы в способностях. Но согласованность между инструментами не восстановилась никогда. Это указывает на то, что инструменты измеряют разные конструкты, а не один и тот же с шумом.
Направление предвзятости зависит от формата аудита
Обнаружился критический эффект формата:
- Инструменты с принудительным выбором (forced-choice) в основном гиперкорректировали предвзятость в пользу женщин и кандидатов из рабочего класса (273 из 278 решений о найме).
- Инструменты свободной генерации и дефолтной кореференции оставались стереотипно-конгруэнтными.
Этот паттерн воспроизвелся на предвзятости по социально-экономическому статусу. Кажущееся согласие по возрастной предвзятости исчезло при применении правил включения инструментов, используемых в самой статье.
Практический вывод
Один аудит может обнаружить предвзятость и оценить ее направление в рамках своей операционализации. Но ни один аудит не поддерживает ранжирование одной модели против другой. Это ставит под вопрос текущие регуляторные подходы, где баллы аудита начинают использовать для сравнения и ранжирования моделей.
Источники
- Оригинальная статья на arXiv: 15995
- Репозиторий с кодом и данными: github.com/williamguey/bias-audit-agreement
