Запись архива

Chopthin-консенсус: как сохранить разнообразие траекторий при декодировании LLM без дообучения

Метод CCPS (Chopthin-Consensus Power Sampling) предлагает новый подход к сэмплированию на этапе инференса LLM, заменяя агрессивное обнуление весов на их сбалансированное сохранение. Это повышает точность ответов на задачах рассуждения до 10,6 п.п. без дообучения модели.

Схема работы Chopthin-консенсус Power Sampling: сохранение разнообразных путей рассуждения LLM
Схема работы Chopthin-консенсус Power Sampling: сохранение разнообразных путей рассуждения LLM
Student Studying in the Communications Library (11056585003).jpg | by University of Illinois Library | wikimedia_commons | CC BY 2.0

Исследователи представили метод Chopthin-Consensus Power Sampling (CCPS) — новый подход к декодированию больших языковых моделей (LLM) на этапе инференса, не требующий дообучения. Метод решает проблему потери разнообразия траекторий рассуждения при использовании Sequential Monte Carlo (SMC) с равновесным ресемплингом.

Проблема стандартного SMC

Традиционные SMC-методы для LLM, такие как Power-SMC, на каждом шаге присваивают частицам (траекториям) веса и затем ресемплируют их с равными весами. Это приводит к агрессивному отбрасыванию траекторий с низким весом — даже если они содержат потенциально верные логические шаги. В результате снижается «генеалогическое разнообразие» поискового пространства, и модель может упустить правильный ответ.

Как работает CCPS

Авторы предлагают два ключевых изменения:

Ресемплер Chopthin. Вместо того чтобы обнулять веса и принудительно дублировать частицы, Chopthin устанавливает верхнюю границу отношения между наибольшим и наименьшим весом. Неравные веса сохраняются, что позволяет удерживать больше различных путей рассуждения. Метод гарантирует, что взвешенная SMC-аппроксимация остаётся несмещённой в условном математическом ожидании, и обеспечивает нижнюю границу эффективного размера выборки (ESS) после ресемплинга.

Семантическое мажоритарное голосование. Поскольку после Chopthin остаётся больше траекторий, необходимо корректно агрегировать их финальные ответы. Авторы предлагают: сначала объединить токен-идентичные конечные траектории, затем кластеризовать семантически эквивалентные ответы (например, «5» и «пять»), и вернуть ответ, поддерживаемый наибольшим числом различных траекторий.

Экспериментальные результаты

Исследование проводилось на трёх открытых моделях и пяти бенчмарках рассуждения. Ключевые результаты:

  • Chopthin увеличивает oracle coverage (долю задач, где хотя бы одна траектория в популяции содержит правильный ответ) в 13 из 15 настроек.
  • В комбинации с семантическим голосованием CCPS достигает или превосходит точность Power-SMC baseline в 14 из 15 настроек.
  • Абсолютный прирост точности финального ответа — до 10,6 процентных пункта.

Практические ограничения

Метод ориентирован на задачи рассуждения (math, логика, commonsense). Эффективность на задачах генерации текста или перевода не оценивалась. Требуется дополнительная вычислительная мощность на этапе инференса (хранение и кластеризация траекторий). Код доступен на GitHub, что упрощает воспроизведение и адаптацию.

Почему это важно

CCPS демонстрирует, что сохранение разнообразия на этапе сэмплирования и учёт этого разнообразия при выборе ответа — взаимодополняющие механизмы. В отличие от методов, требующих дообучения (RLHF, DPO), CCPS работает с уже готовой моделью, что делает его привлекательным для продакшн-сценариев, где переобучение невозможно или дорого.

Источники

  • ArXiv: arXiv:2609.12243 — Chopthin-Consensus Power Sampling: A Diversity-Preserving Approach to LLM Decoding
  • Репозиторий с кодом: github.com/MinooAhmadii/chopthin-consensus-power-sampling