COMRAD404 / GLOSSARY

Constitutional AI (CAI)

Constitutional AI

Constitutional AI — это подход Anthropic к выравниванию моделей через письменную «конституцию» принципов, самокритику и пересмотр ответов, а затем обучение на AI feedback.

TL;DR

Подход Anthropic к выравниванию моделей через письменную конституцию принципов, самокритику ответов и обучение на AI feedback.

Constitutional AI (CAI) — это подход Anthropic к выравниванию моделей, где поведение задают через письменную «конституцию» принципов, самокритику ответов и их пересмотр. В опубликованной схеме 2022 года модель учится без человеческих меток вреда: сначала через critique/revision, затем через reinforcement learning from AI feedback (RLAIF). Это не отдельная модель и не готовый фильтр, а метод обучения и направления поведения.

Английский термин: Constitutional AI, сокращение CAI. В русскоязычных текстах чаще оставляют оригинал; устойчивый официальный перевод Anthropic не закрепляла. Слово constitution здесь означает набор принципов для проверки и исправления ответов, а не юридическую конституцию.

Публичная история метода для практиков тоже важна: его представили в декабре 2022 года, в 2023 Anthropic отдельно объясняла прозрачность и различие между общими и детальными принципами, а 22 января 2026 года опубликовала новую версию публичной конституции Claude.

Простыми словами

Грубо говоря, это «редакторская планка» для модели. Вы не просто говорите ассистенту, как отвечать в одном промпте, а задаёте правила, по которым он сам проверяет черновик, находит рискованный или неточный фрагмент и переписывает ответ.

Можно представить это как работу автора и внутреннего редактора: автор написал текст, редактор сверил его с редакционной политикой, после чего текст вышел уже исправленным. Разница в том, что в CAI и автор, и редактор — это модель, а «политика» записана в конституции.

Как это работает

Технически CAI соединяет два шага: critique/revision и обучение на предпочтениях, полученных от другой модели. В 2022 Anthropic описала супервизированный этап с критикой и переписыванием, а затем RL-этап, где AI-оценщик формирует preference data для дальнейшего обучения.

Промпт пользователя → Черновой ответ модели → Проверка по принципам конституции → Критика → Переписывание ответа → AI feedback / preference data → Обучение модели → Поведение ближе к конституции

Для практики важно, что конституция может быть короткой или подробной. Anthropic отдельно показала, что очень общий принцип способен обобщаться в больших диалоговых моделях, но детализированные правила лучше контролируют конкретные типы вреда.

  1. Вы задаёте модели задачу.
  2. Она формирует первичный ответ.
  3. Отдельный проход сверяет ответ с принципами конституции.
  4. Если есть риск, ответ переписывается в более безопасную и полезную форму.
  5. На обучении такие сравнения превращаются в данные предпочтений, чтобы модель в будущем реже уходила в нежелательный стиль.

Где применяется

  • Обучение и steering Claude: публичная конституция Claude обновлена 22 января 2026 года и на live-странице считается финальной конституционной основой для mainline, general-access моделей.
  • Исследования прозрачности: в 2023 Anthropic подчёркивала, что конституция делает ценности явными, а не скрытыми в массе неявной human feedback.
  • Эксперименты с участием сообщества: в Collective Constitutional AI конституцию для исследования курировали с участием людей вне Anthropic.
  • Продуктовые ассистенты, где важны безопасные и предсказуемые ответы, например Notion AI или Continue: CAI полезен как ориентир, даже если сам инструмент его не использует.

Практический пример

Допустим, вы строите ассистента для внутренней базы знаний. На вход приходит запрос, который может затрагивать опасные инструкции или сомнительные утверждения.

  1. Модель пишет первый вариант ответа.
  2. Второй проход сверяет ответ с принципами: не помогать с вредом, не выдавать догадки за факты, признавать неопределённость.
  3. Если есть риск, ответ переписывается в более безопасную и полезную форму.
  4. На обучении такие сравнения превращаются в данные предпочтений, чтобы модель в будущем реже уходила в нежелательный стиль.

Если вы сравниваете офисные ассистенты, полезно посмотреть и на Notion AI vs Google Docs AI: что выбрать: CAI сам по себе не отвечает на вопрос, какой интерфейс удобнее, но помогает понять, как задаётся поведение ассистента под капотом.

Это упрощённая схема для понимания: Anthropic не публикует полный версионированный training stack.

Чем отличается от…

Термин Суть Когда не путать
RLHF Обучение на человеческих предпочтениях. CAI может использовать AI feedback и письменную конституцию, а не только человеческие метки.
Prompt engineering Изменение поведения через промпт на этапе инференса. CAI меняет поведение на уровне обучения и alignment, а не только текста запроса.
Constitutional Classifiers Связанный метод защиты на основе конституции. Это отдельный safeguard-layer, а не сам исходный метод обучения CAI.

Коротко: CAI — это про training-time governance, а не только про prompt-time control.

Ограничения и заблуждения

  • CAI не гарантирует отсутствие ошибок или вреда: это способ сделать поведение более предсказуемым, а не магический щит.
  • Это не юридическая конституция и не замена policy review.
  • Публичные материалы Anthropic не раскрывают полный, версионированный training stack и точные внутренние привязки каждой модели к каждой редакции конституции.
  • Живая страница Claude’s Constitution заявляет, что документ будет дорабатываться, а некоторые специализированные модели могут не полностью ему соответствовать.
  • Заблуждение: один короткий принцип решает всё. На практике Anthropic показала, что очень общий принцип может обобщаться, но детальные правила лучше удерживают контроль над конкретными видами вреда.

Практический вывод: если вы проектируете ассистента, CAI полезен как способ формализовать нормы поведения до обучения. Но по открытым источникам вы не восстановите весь пайплайн Claude один к одному.

Связанные термины, инструменты и исследования

Источники

Вопросы и ответы

  • Что такое Constitutional AI простыми словами? Это способ обучать и направлять модель через набор письменных принципов, самокритику ответов и их пересмотр, а затем через обучение на AI feedback.
  • Это то же самое, что RLHF? Нет. В CAI Anthropic использует конституцию и AI feedback для формирования предпочтений, а RLHF опирается на человеческие метки предпочтений.
  • Чем CAI отличается от фильтров и системных инструкций? Фильтры и инструкции работают на уровне запроса или пост-обработки, а CAI встраивает нормы поведения в обучение и alignment модели.
  • Публичная конституция Claude фиксированная? Нет. Anthropic пишет, что live-страница предназначена для обновления; при этом новая конституция от 22 января 2026 года названа финальной для mainline, general-access Claude models.

Источники

SOURCES

Вопросы и ответы

FAQ
Что такое Constitutional AI простыми словами?

Это способ обучать и направлять модель через набор письменных принципов, самокритику ответов и их пересмотр, а затем через обучение на AI feedback.

Это то же самое, что RLHF?

Нет. В CAI Anthropic использует конституцию и AI feedback для формирования предпочтений, а RLHF опирается на человеческие метки предпочтений.

Чем CAI отличается от фильтров и системных инструкций?

Фильтры и инструкции работают на уровне запроса или пост-обработки, а CAI встраивает нормы поведения в обучение и alignment модели.

Публичная конституция Claude фиксированная?

Нет. Anthropic пишет, что live-страница предназначена для обновления; при этом новая конституция от 22 января 2026 года названа финальной для mainline, general-access Claude models.

Читайте также

LINKS