Запись архива

Модели LLM учатся управлять вычислительными усилиями при решении задач

Новая статья Себастьяна Рашка объясняет, как современные большие языковые модели (LLM) могут адаптировать свои вычислительные ресурсы для решения задач, используя различные режимы "усилия" при рассуждении.

Схематическое изображение, демонстрирующее, как LLM выбирает уровень вычислительных усилий для решения задачи, показывая разные пути обработки.
Схематическое изображение, демонстрирующее, как LLM выбирает уровень вычислительных усилий для решения задачи, показывая разные пути обработки.
Imagen destacada del articulo fuente

В недавней публикации на своем блоге Ahead of AI Себастьян Рашка, доктор наук и известный исследователь в области машинного обучения, подробно рассмотрел концепцию управления вычислительными усилиями в больших языковых моделях (LLM). Эта тема становится всё более актуальной с появлением моделей, способных адаптировать свой подход к решению задач, используя различные уровни “усилия” при рассуждении.

Развитие моделей, способных к рассуждению, стало заметным трендом в индустрии ИИ. После появления OpenAI o1 около двух лет назад и DeepSeek-R1, демонстрировавшего подходы к обучению с подкреплением на основе проверяемых вознаграждений (RLVR), рынок увидел новые разработки. В частности, OpenAI недавно представила семейство моделей GPT-5.6, каждая из которых предлагает от пяти до шести настроек уровня вычислительных усилий. Это указывает на то, что моделирование рассуждений (reasoning models) становится стандартом в современных релизах LLM.

Как работают модели рассуждений?

Рашка поясняет, что термин “модель рассуждений” в контексте ИИ не означает буквальное человеческое мышление. Скорее, это модель, которая генерирует промежуточную “трассу рассуждений” — последовательность шагов, ведущих к конечному ответу. Это отличает их от традиционных LLM, которые обычно выдают только финальный результат.

Существуют два основных способа улучшения производительности моделей в задачах, требующих рассуждений: масштабирование обучения (training scaling) и масштабирование инференса (inference scaling).

Обучение моделей рассуждений

DeepSeek-R1 предложил использовать RLVR для превращения LLM в модели рассуждений. RLVR предполагает предоставление модели сигнала вознаграждения (0 — неправильно, 1 — правильно) на основе проверяемых данных, таких как математические задачи (проверяемые с помощью SymPy или WolframAlpha) или код (проверяемый компиляторами или тестами). Важно отметить, что на начальных этапах разработки сама промежуточная трасса рассуждений не использовалась для обучения модели. Хотя исследователи пытались включить промежуточные ответы в сигнал обучения, они пришли к выводу, что это не принесло пользы. Тем не менее, обучение только на основе финальных наград оказалось достаточным для того, чтобы модель научилась генерировать и использовать промежуточные объяснения, откатываться и корректировать свои ошибки — так называемые “моменты Аха”.

Стоит упомянуть, что, хотя DeepSeek-R1 получила большее признание, аналогичные идеи были представлены и в других работах, например, в Kimi K1.5, опубликованной примерно в то же время. Термин RLVR также был введен ранее в работе над Tülu 3. Отличие DeepSeek-R1 заключается в демонстрации того, что поведение, связанное с рассуждением, может быть достигнуто с помощью чистого обучения с подкреплением (RL), в то время как Tülu 3 и Kimi K1.5 применяли RL поверх моделей, уже прошедших supervised fine-tuning (SFT). Модель DeepSeek-R1-Zero, обученная только с помощью RLVR, показала, что этот метод сам по себе достаточен для обучения модели генерировать и использовать трассы рассуждений, хотя она и уступала в производительности полной версии DeepSeek-R1.

Большинство современных LLM, по сути, уже являются моделями рассуждений, обученными с использованием вариаций RLVR.

Масштабирование инференса

Второй подход к улучшению производительности — это масштабирование вычислительных ресурсов во время использования модели (инференса). Это означает выделение большего количества вычислительной мощности после этапа обучения для получения более точных ответов. Эта концепция лежит в основе моделей с различными режимами вычислительных усилий.

Модели с несколькими режимами усилий

Новейшие разработки, такие как GPT-5.6, предлагают различные уровни вычислительных усилий. Например, модель GPT 5.6 Sol может работать в нескольких режимах: низком, среднем и высоком. Режим “Ultra” использует тот же уровень усилий, что и “Max”, но ускоряет процесс за счет использования четырех суб-агентов. Это позволяет пользователям или разработчикам выбирать оптимальный баланс между скоростью получения ответа и его качеством, в зависимости от сложности задачи и доступных ресурсов.

Значение для разработчиков и исследователей

Внедрение режимов вычислительных усилий в LLM открывает новые возможности для оптимизации работы с моделями. Разработчики могут выбирать режимы, соответствующие их бюджету на вычисления или требованиям к скорости отклика. Исследователи, в свою очередь, получают более тонкий инструмент для изучения того, как LLM обрабатывают информацию и принимают решения. Понимание и контроль над “усилиями” модели при рассуждении может привести к созданию более эффективных, предсказуемых и надежных ИИ-систем.

Ключевые факты
| Аспект | Описание |
|—|—|
| Основная идея | LLM могут адаптировать вычислительные усилия при решении задач, используя разные режимы рассуждений. |
| Методы обучения | RLVR (Reinforcement Learning with Verifiable Rewards) как ключевая техника для обучения моделей рассуждений. |
| Новые модели | GPT-5.6 предлагает несколько режимов вычислительных усилий (низкий, средний, высокий). |
| Практическое применение | Возможность выбора баланса между скоростью и качеством ответа в зависимости от задачи. |

Дальнейшие исследования в этой области, вероятно, будут сосредоточены на тонкой настройке этих режимов, разработке новых методов оценки их эффективности и интеграции с более сложными архитектурами агентов.

Источник: Ahead of AI / Sebastian Raschka – Controlling Reasoning Effort in LLMs (https://magazine.sebastianraschka.com/p/controlling-reasoning-effort-in-llms)

Datos clave

Punto Detalle
Fuente Ahead of AI / Sebastian Raschka
Fecha 2026-07-18T11:16:09+00:00
Tema Controlling Reasoning Effort in LLMs