Запись архива

Constitutional AI и RLAIF: как работает обучение по «конституции»

Разбираем историческую схему Anthropic: что такое Constitutional AI, как RLAIF заменяет часть человеческой обратной связи, где метод полезен и в чём его ограничения.

Схема Constitutional AI: исходный ответ модели, самокритика по одному принципу конституции, переписанный ответ, сравнение пары ответов AI-судьёй и RL-дообучение

Constitutional AI — это схема выравнивания LLM, которую Anthropic описала 15 декабря 2022 года в работе Constitutional AI: Harmlessness from AI Feedback. Идея проста: вместо тысяч точечных меток «этот ответ лучше, этот хуже» модель получает список принципов на естественном языке, учится критиковать собственные ответы по этим принципам, а затем дообучается через RLAIF — reinforcement learning from AI feedback. Важно не путать это с любой современной «политикой модели»: ниже мы разбираем прежде всего историческую методику из исходной работы Anthropic и её ближайших продолжений.

Коротко

  • Constitutional AI делает цель выравнивания более явной: часть норм записывается в виде текста, а не остаётся скрытой внутри массива человеческих сравнений.
  • Схема состоит из двух фаз: сначала модель делает самокритику и переписывает ответ, потом включается RLAIF — обучение по предпочтениям, которые даёт другая модель или тот же стек моделей.
  • RLAIF не убирает людей из контура полностью. Люди всё ещё пишут саму «конституцию», задают формат оценивания и проверяют итог на независимых evals.
  • Главный практический плюс — масштабируемость и редактируемость: правила можно править как текстовый артефакт, а не пересобирать всё с нуля через новую дорогую разметку.
  • Главный риск — подмена реальной безопасности суррогатом: модель учится хорошо выглядеть по критерию судьи, но это не то же самое, что доказанная надёжность.

Контекст: зачем вообще понадобились Constitutional AI и RLAIF

В 2022 году RLHF стал базовой техникой выравнивания диалоговых моделей. Это хорошо видно по Training language models to follow instructions with human feedback от OpenAI и по более ранней для Anthropic работе Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback. Общая логика была знакомой: собрать примеры желаемого поведения, затем собирать человеческие предпочтения между ответами модели, обучить preference model и через RL сдвинуть политику в нужную сторону.

Проблема в том, что RLHF решает сразу две разные задачи одним и тем же инструментом. С одной стороны, он действительно улучшает поведение модели. С другой — он прячет нормативный выбор внутрь тысяч локальных разметок: модель узнаёт, что «лучше», но сами принципы этого «лучше» остаются неявными. В посте Claude’s Constitution Anthropic прямо пишет о нескольких недостатках такого подхода: людям приходится читать неприятный контент, процесс плохо масштабируется, а сложные ответы трудно оценивать стабильно.

Отсюда и замысел Constitutional AI: не просить людей бесконечно сравнивать токсичные или сомнительные ответы, а заранее задать список принципов, по которым сама модель будет критиковать и ранжировать варианты. В исходной постановке Anthropic цель была узкой и конкретной: получить harmless but non-evasive assistant, то есть модель, которая не просто всё запрещает, а умеет безопасно отвечать и объяснять, почему опасный запрос недопустим.

Подход Кто даёт сигнал Где используется Что становится явным Типичный риск
RLHF Люди Сравнения ответов и reward signal Немногое: нормы в основном скрыты в разметке Дорого, медленно, трудно масштабировать
Constitutional AI, фаза SFT Текстовые принципы + самокритика модели Переписывание ответов и дообучение на ревизиях Сами принципы поведения Слабая или спорная формулировка правила портит обучение
RLAIF AI-судья по конституции Предпочтения, reward model, RL Правило и критерий сравнения Смещение судьи, прокси-оптимизация, stale reward model

Метод: как работают Constitutional AI и RLAIF

Если упростить, то Constitutional AI — это не одна магическая процедура, а связка из трёх идей: текстовая конституция, самокритика с ревизией ответа и обучение по AI-предпочтениям. В исходной работе Anthropic эти части назывались SL-CAI и RL-CAI.

1. Что такое «конституция» в этом контексте

Под конституцией здесь понимается список принципов на естественном языке, по которым ответы модели следует оценивать. Важно, что это не формальная логика и не набор жёстких if/else-правил. В посте Claude’s Constitution Anthropic описывает более позднюю версию такого набора принципов: он опирался на Всеобщую декларацию прав человека ООН, правила безопасности платформ, правила Sparrow от DeepMind, принципы приватности и наборы собственных исследовательских формулировок. Но это уже обновлённая, более широкая версия; в исходной работе 2022 года использовался исследовательский набор принципов именно для экспериментов с harmlessness.

Практически важная деталь: модель не «читает весь свод правил» при каждом ответе. Anthropic пишет, что в ходе обучения для конкретного шага берётся один принцип, и модель видит разные принципы много раз на протяжении тренировки. То есть конституция работает как распределённый источник обучающих сигналов, а не как детерминированный юридический движок.

2. Первая фаза: самокритика и ревизия

В первой фазе берётся исходный ответ модели на запрос пользователя. Затем та же модель или близкая к ней модель получает инструкцию оценить этот ответ по одному из принципов конституции: где именно ответ нарушает правило, чем он опасен, излишне резок или неэтичен. После этого модель пишет исправленную версию ответа. Дальше исходную политику дообучают уже на этих исправленных ответах.

Смысл фазы в том, что мы не просим человека размечать каждый плохой пример. Человек заранее задаёт правило, а модель сама производит промежуточный обучающий материал: critique и revision. В статье Anthropic отдельно отмечает, что такой шаг помогает бороться не только с вредностью, но и с избыточной уклончивостью: модель должна не просто отвергнуть запрос, а по возможности дать безопасный и содержательный ответ.

3. Вторая фаза: RLAIF

После supervised-фазы начинается RL-контур. Теперь модель генерирует несколько кандидатных ответов на один и тот же запрос. Другая модель-судья сравнивает эти ответы по выбранному принципу конституции и решает, какой вариант лучше соответствует правилам. По этим AI-сравнениям обучается preference model, а затем политика дообучается с RL уже по reward signal от этого preference model. Именно этот этап Anthropic и называет reinforcement learning from AI feedback.

В исходной работе Anthropic и в более поздней работе RLAIF vs. RLHF авторы также используют явное рассуждение в стиле chain-of-thought как способ повысить качество сравнения: судью можно попросить сначала объяснить выбор, а уже потом вынести verdict. Для практиков это важно: RLAIF — это не только «заменить человека моделью», но и аккуратно спроектировать judge prompt, формат объяснения и способ превращения текстового суждения в reward.

prompt -> ответ_0
выбрать принцип p из constitution
critique = critic(prompt, ответ_0, p)
ответ_1 = revise(prompt, ответ_0, critique, p)
обучить policy на ответ_1

сгенерировать ответы A и B
preference = judge(prompt, A, B, p)
обучить preference_model на AI-preferences
обновить policy через RL по reward от preference_model

Позднее, в работе RLAIF vs. RLHF, была предложена и более прямая версия — direct-RLAIF, где отдельный reward model не обучают, а судью спрашивают напрямую во время RL. Мотивация проста: authors указывают на проблему reward model staleness, когда модель-наградчик обучена на старом распределении ответов и начинает хуже оценивать новую политику.

Результаты: что показали исходные работы

В исходной статье и исследовательском посте Anthropic основной вывод был таким: AI-supervision может быть достаточно сильной, чтобы заметно сдвинуть модель в сторону harmlessness без прямых человеческих меток вредности для каждого примера. Авторы пишут, что RL-версия Constitutional AI в их сетапе давала более harmless поведение, при этом модель оставалась менее evasive, чем примитивная стратегия «отказать во всём подозрительном».

Важное подтверждение пришло уже не из самой Anthropic, а из отдельной работы RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback. Там сравнивали RLAIF и RLHF на summarization, helpful dialogue generation и harmless dialogue generation. Авторы сообщают, что RLAIF даёт сопоставимые с RLHF результаты по человеческим оценкам, а для harmless dialogue generation даже выигрывает в их постановке. Это не означает, что AI feedback всегда лучше human feedback; но означает, что при достаточно хорошем судье и хорошо заданном критерии такая замена может работать.

Следующий важный шаг — уже не про сам алгоритм, а про управление нормами. В 2023–2024 годах Anthropic и Collective Intelligence Project показали Collective Constitutional AI: «конституцию» можно не только писать внутри лаборатории, но и собирать через публичный процесс, а затем обучать на ней модель теми же constitutional-методами. Для практики это сильная мысль: вопрос выравнивания — это не только оптимизация, но и дизайн источника норм.

Работа Что именно показано Практический смысл Оговорка
Anthropic, Constitutional AI: Harmlessness from AI Feedback Самокритика и AI-preferences могут обучать harmless-поведение без разметки вредности на каждом примере Часть дорогостоящего human labeling можно заменить текстовыми принципами и AI-судьёй Оценка в работе в основном внутренняя и сфокусирована на conversational harmlessness
RLAIF vs. RLHF RLAIF может быть сопоставим с RLHF на ряде задач; direct-RLAIF помогает обойти stale reward model Идея переносима за пределы одного исторического paper Anthropic Результат зависит от качества labeler-модели, judge prompt и eval setup
Collective Constitutional AI Источник принципов можно вынести в публичный процесс Конституция становится объектом управления и аудита, а не только скрытой частью pipeline Даже «общественная» конституция всё равно проходит через фильтры отбора, агрегации и переформулирования

Интерпретация: почему это важно

Наш комментарий

Самая сильная сторона Constitutional AI не в том, что она «убирает людей», а в том, что она развязывает два уровня выравнивания. Люди могут отдельно обсуждать и редактировать текст принципов, а инженеры — отдельно оптимизировать pipeline, который заставляет модель этим принципам следовать. Для прикладной команды это удобнее, чем спорить только на уровне разрозненных pairwise labels.

На наш взгляд, Constitutional AI полезнее всего там, где у вас уже есть относительно внятный набор policy-like критериев: безопасность, стиль отказов, приватность, недопустимые виды помощи, корпоративные или отраслевые ограничения. В таких случаях «текстуализированная цель» действительно даёт управляемость. Но для истины, долгого планирования, скрытых намерений или агентного поведения одной конституции обычно недостаточно: там нужен отдельный eval-контур и часто другой тип supervision.

Для практиков полезно думать не о «модели», а о связке из трёх артефактов: текст конституции, judge prompt и независимый evaluation set. Если один из этих трёх слоёв слабый, красивое название метода не спасает.

Ограничения и критика

Во-первых, конституция не нейтральна. Anthropic сама пишет, что текущие версии их конституции отражают выбор разработчиков и не являются финальным или идеально универсальным набором ценностей. Работа по Collective Constitutional AI идёт ещё дальше и прямо перечисляет субъективные точки в pipeline: кого считать представительной группой, как агрегировать ответы, как преобразовывать общественные формулировки в формат «Choose the response that…». Это не баг статьи, а честное признание: выбор норм неизбежно социальный.

Во-вторых, RLAIF остаётся прокси-оптимизацией. Даже если вместо человека судит сильная LLM, политика в конечном счёте учится максимизировать то, что любит этот судья или reward model. В работе RLAIF vs. RLHF это видно по самой постановке проблемы: authors отдельно вводят direct-RLAIF, потому что reward model может устаревать относительно новой политики. Иначе говоря, даже хороший AI-judge не равен «объективной этике».

В-третьих, Constitutional AI может делать модель раздражающе морализаторской или чрезмерно отказной. Anthropic прямо пишет, что в ранних опытах CAI-модель иногда становилась judgmental или annoying, и поэтому в конституцию добавляли принципы против preachy и overly-reactive ответов. Это важный инженерный урок: безопасность нельзя оптимизировать по одной оси, иначе вы ломаете UX и полезность.

В-четвёртых, coverage здесь статистическая, а не формальная. Поскольку во время шага обучения обычно выбирается отдельный принцип, модель не проходит полный логический аудит по всему своду правил на каждый ответ. Она учится распределённому паттерну поведения. Поэтому Constitutional AI — это способ сместить распределение ответов, а не доказательство корректности в строгом смысле.

В-пятых, исторический scope у метода уже, чем иногда кажется из популярного пересказа. Исходная работа 2022 года была о harmless conversational assistants. Позднейшая работа Anthropic Specific versus General Principles for Constitutional AI сама формулирует проблему шире и отмечает, что обычный human feedback может не устранять более тонкие паттерны, например выраженное стремление к самосохранению или власти. Это хороший сигнал: даже сторонники подхода не считают его законченной универсальной теорией alignment.

Вывод

Constitutional AI — это не «этика в коробке», а способ превратить часть размытых человеческих норм в редактируемый тренировочный артефакт. RLAIF — масштабируемая половина этой идеи: вместо того чтобы на каждом шаге спрашивать человека, мы строим контур, где значительную часть сравнений делает модель-судья по текстовым принципам. Для инженеров ценность метода в управляемости и скорости итерации; риск — спутать соответствие конституции с реальной безопасностью модели.

Источники

FAQ

  • Чем Constitutional AI отличается от RLHF? В RLHF главный обучающий сигнал о качестве ответа дают люди через демонстрации и сравнения. В Constitutional AI люди в основном задают набор принципов, а заметную часть локальных сравнений и критик делает уже модель по этим принципам.
  • Что такое RLAIF в одном предложении? Это reinforcement learning, где reward signal строится не из человеческих предпочтений, а из предпочтений, сгенерированных AI-судьёй.
  • Является ли «конституция» просто system prompt? Нет. System prompt работает на этапе inference, а Constitutional AI в исходной постановке — это training-time pipeline: конституция участвует в самокритике, сравнении ответов и формировании reward signal.
  • Можно ли сделать такую конституцию публичной? Да, это и показывает направление Collective Constitutional AI. Но публичный input не отменяет того, что кто-то всё равно выбирает участников, агрегирует мнения и переводит их в пригодный для обучения формат.

Читайте также