Запись архива

Аудит предвзятости ИИ: все инструменты находят дискриминацию, но не могут согласовать рейтинг моделей

Исследователи проверили десять инструментов аудита предвзятости на десяти frontier-моделях. Вывод: детекция работает, но ранжирование моделей по степени предвзятости невозможно — инструменты измеряют разные конструкты.

График, показывающий расхождение рейтингов предвзятости десяти frontier-моделей по десяти различным инструментам аудита
График, показывающий расхождение рейтингов предвзятости десяти frontier-моделей по десяти различным инструментам аудита
Visit of Ursula von der Leyen, President of the European Commission, to India (P-065755-00-36).jpg | by Europäische Kommission — Audiovisueller Dienst, CE — Service audiovisuel, EC — Audiovisual Service, Dati Bendo | wikimedia_commons | CC BY 4.0

Исследователи из проекта Bias Audit Agreement провели масштабную проверку инструментов аудита предвзятости на десяти frontier-моделях. Результат оказался тревожным для регуляторов: хотя детекция предвзятости работает, ранжирование моделей по степени предвзятости невозможно — разные инструменты дают несогласованные результаты.

Что проверяли и как

На общей панели из десяти frontier-моделей (включая GPT-4, Claude, Gemini и другие) через единый шлюз инференса запустили десять инструментов аудита. Сначала тестировали гендерную предвзятость в профессиональном контексте, затем — возрастную и предвзятость по социально-экономическому статусу. Все сырые ответы, код и полный анализ доступны в репозитории GitHub.

Детекция работает, ранжирование — нет

Восемь из десяти инструментов обнаружили статистически значимую предвзятость (доверительные интервалы не включали ноль). Однако согласованность ранжирования моделей между инструментами оказалась на уровне случайности: Kendall’s W = 0.07 при p = 0.83.

Два широко используемых прямых зондирующих бенчмарка оказались насыщены — frontier-модели дают нейтральные ответы, что делает эти инструменты бесполезными для современного аудита.

Почему так происходит

Исследователи провели контрольный эксперимент с шестью заведомо более слабыми моделями. Внутриинструментальная надежность восстановилась, когда панель охватила реальные разрывы в способностях. Но согласованность между инструментами не восстановилась никогда. Это указывает на то, что инструменты измеряют разные конструкты, а не один и тот же с шумом.

Направление предвзятости зависит от формата аудита

Обнаружился критический эффект формата:

  • Инструменты с принудительным выбором (forced-choice) в основном гиперкорректировали предвзятость в пользу женщин и кандидатов из рабочего класса (273 из 278 решений о найме).
  • Инструменты свободной генерации и дефолтной кореференции оставались стереотипно-конгруэнтными.

Этот паттерн воспроизвелся на предвзятости по социально-экономическому статусу. Кажущееся согласие по возрастной предвзятости исчезло при применении правил включения инструментов, используемых в самой статье.

Практический вывод

Один аудит может обнаружить предвзятость и оценить ее направление в рамках своей операционализации. Но ни один аудит не поддерживает ранжирование одной модели против другой. Это ставит под вопрос текущие регуляторные подходы, где баллы аудита начинают использовать для сравнения и ранжирования моделей.

Источники