
Обсуждение на Reddit r/artificial посвящено сравнению различных методов оценки уверенности больших языковых моделей (LLM). Уверенность LLM важна для автоматизации принятия решений, активного обучения и повышения безопасности чат-ботов.
Как оценивают уверенность
Существует два основных подхода: whitebox (требует доступа к весам модели, работает с открытыми моделями) и blackbox (использует токены и их вероятности, подходит для любых моделей). В статье сравниваются 8 blackbox методов и 1 whitebox метод.
Методы оценки
| Метод | Описание |
|---|---|
| Вербальная оценка | Модель прямо отвечает на вопрос о своей уверенности (например, “на шкале от 0 до 100”). Часто дает высокие оценки из-за RLHF. |
| Лингвистическая неопределенность | Подсчет слов и фраз, выражающих неуверенность (например, “возможно”, “я думаю”). |
| Длина рассуждений | Предполагается, что чем длиннее ответ модели, тем ниже ее уверенность. |
| P(Answer) | Анализ вероятности токена ответа, нормализованный по другим вариантам. |
| P(True) | (Детали не приведены в исходном тексте) |
Что остается неясным
Эффективность каждого метода зависит от конкретной модели и задачи. Whitebox методы требуют глубокого понимания внутренней работы LLM, в то время как blackbox методы проще в применении, но могут быть менее точными.
Что проверить дальше
Исследование направлено на выявление наиболее надежных методов оценки уверенности LLM для практического применения. Полное сравнение методов и результаты доступны по ссылке на Reddit.