Constitutional AI (CAI) — это подход Anthropic к выравниванию моделей, где поведение задают через письменную «конституцию» принципов, самокритику ответов и их пересмотр. В опубликованной схеме 2022 года модель учится без человеческих меток вреда: сначала через critique/revision, затем через reinforcement learning from AI feedback (RLAIF). Это не отдельная модель и не готовый фильтр, а метод обучения и направления поведения.
Английский термин: Constitutional AI, сокращение CAI. В русскоязычных текстах чаще оставляют оригинал; устойчивый официальный перевод Anthropic не закрепляла. Слово constitution здесь означает набор принципов для проверки и исправления ответов, а не юридическую конституцию.
Публичная история метода для практиков тоже важна: его представили в декабре 2022 года, в 2023 Anthropic отдельно объясняла прозрачность и различие между общими и детальными принципами, а 22 января 2026 года опубликовала новую версию публичной конституции Claude.
Простыми словами
Грубо говоря, это «редакторская планка» для модели. Вы не просто говорите ассистенту, как отвечать в одном промпте, а задаёте правила, по которым он сам проверяет черновик, находит рискованный или неточный фрагмент и переписывает ответ.
Можно представить это как работу автора и внутреннего редактора: автор написал текст, редактор сверил его с редакционной политикой, после чего текст вышел уже исправленным. Разница в том, что в CAI и автор, и редактор — это модель, а «политика» записана в конституции.
Как это работает
Технически CAI соединяет два шага: critique/revision и обучение на предпочтениях, полученных от другой модели. В 2022 Anthropic описала супервизированный этап с критикой и переписыванием, а затем RL-этап, где AI-оценщик формирует preference data для дальнейшего обучения.
Промпт пользователя → Черновой ответ модели → Проверка по принципам конституции → Критика → Переписывание ответа → AI feedback / preference data → Обучение модели → Поведение ближе к конституции
Для практики важно, что конституция может быть короткой или подробной. Anthropic отдельно показала, что очень общий принцип способен обобщаться в больших диалоговых моделях, но детализированные правила лучше контролируют конкретные типы вреда.
- Вы задаёте модели задачу.
- Она формирует первичный ответ.
- Отдельный проход сверяет ответ с принципами конституции.
- Если есть риск, ответ переписывается в более безопасную и полезную форму.
- На обучении такие сравнения превращаются в данные предпочтений, чтобы модель в будущем реже уходила в нежелательный стиль.
Где применяется
- Обучение и steering Claude: публичная конституция Claude обновлена 22 января 2026 года и на live-странице считается финальной конституционной основой для mainline, general-access моделей.
- Исследования прозрачности: в 2023 Anthropic подчёркивала, что конституция делает ценности явными, а не скрытыми в массе неявной human feedback.
- Эксперименты с участием сообщества: в Collective Constitutional AI конституцию для исследования курировали с участием людей вне Anthropic.
- Продуктовые ассистенты, где важны безопасные и предсказуемые ответы, например Notion AI или Continue: CAI полезен как ориентир, даже если сам инструмент его не использует.
Практический пример
Допустим, вы строите ассистента для внутренней базы знаний. На вход приходит запрос, который может затрагивать опасные инструкции или сомнительные утверждения.
- Модель пишет первый вариант ответа.
- Второй проход сверяет ответ с принципами: не помогать с вредом, не выдавать догадки за факты, признавать неопределённость.
- Если есть риск, ответ переписывается в более безопасную и полезную форму.
- На обучении такие сравнения превращаются в данные предпочтений, чтобы модель в будущем реже уходила в нежелательный стиль.
Если вы сравниваете офисные ассистенты, полезно посмотреть и на Notion AI vs Google Docs AI: что выбрать: CAI сам по себе не отвечает на вопрос, какой интерфейс удобнее, но помогает понять, как задаётся поведение ассистента под капотом.
Это упрощённая схема для понимания: Anthropic не публикует полный версионированный training stack.
Чем отличается от…
| Термин | Суть | Когда не путать |
|---|---|---|
| RLHF | Обучение на человеческих предпочтениях. | CAI может использовать AI feedback и письменную конституцию, а не только человеческие метки. |
| Prompt engineering | Изменение поведения через промпт на этапе инференса. | CAI меняет поведение на уровне обучения и alignment, а не только текста запроса. |
| Constitutional Classifiers | Связанный метод защиты на основе конституции. | Это отдельный safeguard-layer, а не сам исходный метод обучения CAI. |
Коротко: CAI — это про training-time governance, а не только про prompt-time control.
Ограничения и заблуждения
- CAI не гарантирует отсутствие ошибок или вреда: это способ сделать поведение более предсказуемым, а не магический щит.
- Это не юридическая конституция и не замена policy review.
- Публичные материалы Anthropic не раскрывают полный, версионированный training stack и точные внутренние привязки каждой модели к каждой редакции конституции.
- Живая страница Claude’s Constitution заявляет, что документ будет дорабатываться, а некоторые специализированные модели могут не полностью ему соответствовать.
- Заблуждение: один короткий принцип решает всё. На практике Anthropic показала, что очень общий принцип может обобщаться, но детальные правила лучше удерживают контроль над конкретными видами вреда.
Практический вывод: если вы проектируете ассистента, CAI полезен как способ формализовать нормы поведения до обучения. Но по открытым источникам вы не восстановите весь пайплайн Claude один к одному.
Связанные термины, инструменты и исследования
- RLAIF, critique/revision, alignment — базовые понятия, без которых CAI трудно читать.
- Notion AI: ИИ внутри документов и базы знаний Notion — пример ассистента в рабочем интерфейсе, где важны предсказуемость и безопасность ответов.
- Continue — open-source AI-ассистент для VS Code и JetBrains — IDE-ассистент, для которого тоже важны ограничения поведения.
- Notion AI vs Google Docs AI: что выбрать — полезно, если вы сравниваете продуктовые сценарии, а не только метод обучения.
- Related research: Specific versus General Principles for Constitutional AI; Collective Constitutional AI; Constitutional Classifiers.
Источники
- Constitutional AI: Harmlessness from AI Feedback — первичный технический препринт с critique/revision и RLAIF.
- Constitutional AI: Harmlessness from AI Feedback — оригинальное официальное объяснение метода.
- Claude’s Constitution — пост Anthropic о конституции Claude и прозрачности подхода.
- Claude’s new constitution — объявление о новой публичной конституции от 22 января 2026 года.
- Claude’s Constitution — живая публичная версия конституции и её текущий статус.
- Specific versus General Principles for Constitutional AI — сравнение общих и детальных принципов.
- Collective Constitutional AI: Aligning a Language Model with Public Input — вариант с общественным участием в составлении конституции.
- GitHub – anthropics/ConstitutionalHarmlessnessPaper — официальные supplementary materials к работе 2022 года.
- Constitutional Classifiers: Defending against universal jailbreaks — родственный constitution-based safeguard-метод.
Вопросы и ответы
- Что такое Constitutional AI простыми словами? Это способ обучать и направлять модель через набор письменных принципов, самокритику ответов и их пересмотр, а затем через обучение на AI feedback.
- Это то же самое, что RLHF? Нет. В CAI Anthropic использует конституцию и AI feedback для формирования предпочтений, а RLHF опирается на человеческие метки предпочтений.
- Чем CAI отличается от фильтров и системных инструкций? Фильтры и инструкции работают на уровне запроса или пост-обработки, а CAI встраивает нормы поведения в обучение и alignment модели.
- Публичная конституция Claude фиксированная? Нет. Anthropic пишет, что live-страница предназначена для обновления; при этом новая конституция от 22 января 2026 года названа финальной для mainline, general-access Claude models.