Запись архива

Сравнение методов оценки уверенности LLM

Сравнение популярных методов оценки уверенности больших языковых моделей.

Сравнение методов оценки уверенности LLM
Сравнение методов оценки уверенности LLM
Journalists Protest against rising violence during march in Mexi | by Knight Foundation | openverse | by-sa

Обсуждение на Reddit r/artificial посвящено сравнению различных методов оценки уверенности больших языковых моделей (LLM). Уверенность LLM важна для автоматизации принятия решений, активного обучения и повышения безопасности чат-ботов.

Как оценивают уверенность

Существует два основных подхода: whitebox (требует доступа к весам модели, работает с открытыми моделями) и blackbox (использует токены и их вероятности, подходит для любых моделей). В статье сравниваются 8 blackbox методов и 1 whitebox метод.

Методы оценки

Метод Описание
Вербальная оценка Модель прямо отвечает на вопрос о своей уверенности (например, “на шкале от 0 до 100”). Часто дает высокие оценки из-за RLHF.
Лингвистическая неопределенность Подсчет слов и фраз, выражающих неуверенность (например, “возможно”, “я думаю”).
Длина рассуждений Предполагается, что чем длиннее ответ модели, тем ниже ее уверенность.
P(Answer) Анализ вероятности токена ответа, нормализованный по другим вариантам.
P(True) (Детали не приведены в исходном тексте)

Что остается неясным

Эффективность каждого метода зависит от конкретной модели и задачи. Whitebox методы требуют глубокого понимания внутренней работы LLM, в то время как blackbox методы проще в применении, но могут быть менее точными.

Что проверить дальше

Исследование направлено на выявление наиболее надежных методов оценки уверенности LLM для практического применения. Полное сравнение методов и результаты доступны по ссылке на Reddit.

Источник: Reddit r/artificial. Верификация: https://arxiv.org/