
Исследователи представили метод Chopthin-Consensus Power Sampling (CCPS) — новый подход к декодированию больших языковых моделей (LLM) на этапе инференса, не требующий дообучения. Метод решает проблему потери разнообразия траекторий рассуждения при использовании Sequential Monte Carlo (SMC) с равновесным ресемплингом.
Проблема стандартного SMC
Традиционные SMC-методы для LLM, такие как Power-SMC, на каждом шаге присваивают частицам (траекториям) веса и затем ресемплируют их с равными весами. Это приводит к агрессивному отбрасыванию траекторий с низким весом — даже если они содержат потенциально верные логические шаги. В результате снижается «генеалогическое разнообразие» поискового пространства, и модель может упустить правильный ответ.
Как работает CCPS
Авторы предлагают два ключевых изменения:
Ресемплер Chopthin. Вместо того чтобы обнулять веса и принудительно дублировать частицы, Chopthin устанавливает верхнюю границу отношения между наибольшим и наименьшим весом. Неравные веса сохраняются, что позволяет удерживать больше различных путей рассуждения. Метод гарантирует, что взвешенная SMC-аппроксимация остаётся несмещённой в условном математическом ожидании, и обеспечивает нижнюю границу эффективного размера выборки (ESS) после ресемплинга.
Семантическое мажоритарное голосование. Поскольку после Chopthin остаётся больше траекторий, необходимо корректно агрегировать их финальные ответы. Авторы предлагают: сначала объединить токен-идентичные конечные траектории, затем кластеризовать семантически эквивалентные ответы (например, «5» и «пять»), и вернуть ответ, поддерживаемый наибольшим числом различных траекторий.
Экспериментальные результаты
Исследование проводилось на трёх открытых моделях и пяти бенчмарках рассуждения. Ключевые результаты:
- Chopthin увеличивает oracle coverage (долю задач, где хотя бы одна траектория в популяции содержит правильный ответ) в 13 из 15 настроек.
- В комбинации с семантическим голосованием CCPS достигает или превосходит точность Power-SMC baseline в 14 из 15 настроек.
- Абсолютный прирост точности финального ответа — до 10,6 процентных пункта.
Практические ограничения
Метод ориентирован на задачи рассуждения (math, логика, commonsense). Эффективность на задачах генерации текста или перевода не оценивалась. Требуется дополнительная вычислительная мощность на этапе инференса (хранение и кластеризация траекторий). Код доступен на GitHub, что упрощает воспроизведение и адаптацию.
Почему это важно
CCPS демонстрирует, что сохранение разнообразия на этапе сэмплирования и учёт этого разнообразия при выборе ответа — взаимодополняющие механизмы. В отличие от методов, требующих дообучения (RLHF, DPO), CCPS работает с уже готовой моделью, что делает его привлекательным для продакшн-сценариев, где переобучение невозможно или дорого.
Источники
- ArXiv: arXiv:2609.12243 — Chopthin-Consensus Power Sampling: A Diversity-Preserving Approach to LLM Decoding
- Репозиторий с кодом: github.com/MinooAhmadii/chopthin-consensus-power-sampling
