COMRAD404 / GLOSSARY

Джейлбрейк (Jailbreak)

jailbreak

Jailbreak в ИИ — это попытка специальными инструкциями обойти защитные ограничения модели и получить нежелательный ответ или действие. Ниже — простое объяснение, схема атаки, отличие от prompt injection и практический способ проверки.

TL;DR

Попытка с помощью adversarial prompting обойти защитные ограничения модели и добиться ответа или действия, которых разработчик не предусматривал.

Джейлбрейк (jailbreak) в контексте ИИ — это попытка с помощью adversarial prompting обойти защитные ограничения модели и получить ответ, которого разработчик не хотел допускать. Anthropic описывает jailbreaks как стратегии prompting для обхода safety guardrails и получения нежелательных, иногда вредных ответов; OWASP рассматривает jailbreaking как близкий класс атак рядом с prompt injection.

На практике термин используется не полностью единообразно. OpenAI отдельно определяет prompt injection как атаку социальной инженерии для разговорного ИИ, где третья сторона внедряет вредоносные инструкции в контекст диалога, поэтому в рабочем обсуждении лучше сразу уточнять: вы говорите о прямом обходе политики модели или о внедрении инструкции через внешний контекст.

Английский термин: jailbreak. Также встречается: джейлбрейк, обход guardrails, bypass safety guardrails. Близкий термин: prompt injection; в источниках он тесно связан с jailbreak, но не всегда используется как точный синоним.

Простыми словами

Грубо говоря, jailbreak — это попытка уговорить ИИ «забыть правила». Можно представить это как разговор с сотрудником, у которого есть строгая инструкция, а собеседник специально подбирает формулировки, чтобы тот отступил от регламента.

Важно, что речь не обязательно о «взломе» в классическом смысле. Часто это именно игра с инструкциями, контекстом и формулировками, а не эксплуатация обычной программной уязвимости.

Как это работает

По материалам Anthropic, OpenAI и OWASP, общая механика выглядит так: у модели есть базовые правила и защитные ограничения, а атакующий старается добавить в контекст инструкции, которые конкурируют с этими правилами или маскируются под более приоритетные указания.

Правила разработчика и системные ограничения
            ↓
   Контекст диалога или внешний контент
            ↓
  Атакующая инструкция / обходная формулировка
            ↓
                 Модель
            ↓
  Защитные слои: обучение, мониторинг,
  sandboxing, red-teaming, user controls
            ↓
 Отказ  /  нежелательный ответ  /  утечка system prompt
 / data exfiltration / несанкционированное действие
  1. Разработчик задаёт правила модели и ограничения на ответы или действия.
  2. В контекст попадает adversarial prompt: прямой запрос на обход правил или вредоносная инструкция, встроенная в разговор.
  3. Если защитные слои срабатывают, модель отказывает или безопасно переформулирует ответ.
  4. Если защита не справляется, результатом может стать нежелательный вывод, утечка system prompt, извлечение данных, несанкционированное действие или даже сохранение эффекта в последующих сессиях — именно такие риски перечисляет OWASP.

OpenAI описывает защиту от prompt injection как многослойную: model training, monitoring, sandboxing, red-teaming, bug bounties и user controls. Это важная практическая мысль: один фильтр или один запрет в системном промпте не считается достаточной защитой.

Где применяется

  • Тестирование безопасности чат-моделей. Джейлбрейки используют в red teaming и внутренней оценке стойкости guardrails. Исследование 2024 года проанализировало 1405 «диких» jailbreak-промптов, выявило 131 сообщество и сообщило о пяти промптах с attack success rate 0,95 на ChatGPT (GPT-3.5) и GPT-4.
  • Проверка агентных продуктов. Для систем, где модель может выполнять действия, риск выше: OWASP относит к последствиям prompt injection утечку данных и несанкционированные действия. Это особенно важно в агентных сценариях; как смежную тему можно посмотреть ReAct (reasoning + acting).
  • Бенчмарки и сравнение защит. JailbreakBench — открытый benchmark для устойчивости к jailbreaking с репозиторием артефактов, датасетом из 100 behaviors, стандартизированной рамкой оценки и leaderboard. Это полезно, когда вам нужна не разовая демонстрация, а воспроизводимый тест.
  • Документация по выпуску моделей. У Anthropic есть актуальный индекс model system cards, в том числе для Claude Sonnet 5 и Claude Opus 5 в 2026 году. Для практики это значит, что оценка стойкости к jailbreak часто зависит от конкретной модели, а не только от общего бренда или API.

Практический пример

Ниже — не «рецепт атаки», а рабочий сценарий, как команде безопасности или ML-инженеру классифицировать и проверять проблему, чтобы не смешивать разные классы рисков.

  1. Сначала определите тип случая. Это прямой jailbreak, где пользователь сам пытается обойти политику модели? Или third-party prompt injection, где вредоносная инструкция приходит через внешний контекст?
  2. Затем соберите воспроизводимый набор тестов. Если нужна системная оценка, используйте открытый набор вроде JailbreakBench: у него есть 100 behaviors, единая рамка оценки и код для воспроизводимого сравнения.
  3. Измеряйте не только «получился ответ или нет». Отдельно фиксируйте, был ли просто policy bypass, утёк ли system prompt, произошла ли data exfiltration, была ли попытка несанкционированного действия и сохраняется ли эффект между сессиями.
  4. Сверяйте отчёт со scope поставщика. По состоянию на 2026-08-13 OpenAI не относит prompt jailbreaks, hallucinations и policy bypasses к CVE. В bug bounty у OpenAI pure jailbreaks и общие обходы контент-политик тоже вне scope, но third-party prompt injection и data exfiltration для agentic products могут входить в scope, если поведение воспроизводится как минимум в 50% случаев.
  5. Формулируйте вывод предметно. Вместо общего «мы нашли jailbreak» полезнее писать: «воспроизводимая third-party prompt injection приводит к утечке данных» или «прямой policy bypass без доказуемого перехода к вредоносному действию».

Практический вердикт: для инженера одно слово «jailbreak» слишком расплывчато. В отчётах, triage и risk assessment почти всегда полезнее указывать конкретный класс: direct jailbreak, prompt injection, data exfiltration, system prompt leakage или unauthorized action.

Чем отличается от похожих терминов

Термин Что означает в источниках Главное отличие
Jailbreak Стратегия prompting для обхода safety guardrails и получения ответа, которого разработчик не хотел допускать. Фокус на обходе правил самой модели.
Prompt injection По OpenAI — социальная инженерия для разговорного ИИ, где третья сторона внедряет вредоносные инструкции в контекст; OWASP связывает это с обходом safety controls, утечкой данных и действиями без разрешения. Фокус на внедрении вредоносной инструкции в контекст, часто через внешний источник.
Policy bypass Операционный ярлык в политике поставщика для случаев, когда модель обходит контент- или safety-политику. Это не обязательно отдельная техника атаки; чаще это способ описать результат для triage и scope.

Смежные темы: Alignment (согласование ИИ), ReAct, Temperature. Они помогают понять соседний контекст, но не заменяют отдельную оценку стойкости к jailbreak.

Ограничения и заблуждения

  • Заблуждение: «jailbreak = полноценный взлом модели». В текущем употреблении это чаще adversarial prompting, а не классическая эксплуатация программной уязвимости.
  • Заблуждение: «jailbreak и prompt injection — одно и то же». Источники действительно сближают эти термины, но не стандартизуют их полностью одинаково. Anthropic акцентирует обход guardrails, OpenAI отдельно описывает prompt injection как особую форму социальной инженерии, а OWASP рассматривает их как тесно связанные классы атак.
  • Заблуждение: «если обход удался, это автоматически CVE». У OpenAI по состоянию на 2025-11-20 prompt jailbreaks, hallucinations и policy bypasses не входят в scope для CVE.
  • Заблуждение: «любая демонстрация jailbreak даёт bug bounty». По состоянию на 2026-03-25 OpenAI исключает pure jailbreaks и общие обходы контент-политик без демонстрируемого safety или abuse impact. При этом agentic third-party prompt injection и data exfiltration могут быть in scope при воспроизводимости не ниже 50%.
  • Ограничение benchmark-оценок. Репозитории, датасеты и leaderboard для jailbreaking меняются со временем. Даже если URL не меняется, покрытие и рейтинги могут обновляться.
  • Ограничение этой статьи. Терминология вокруг jailbreak не полностью стандартизована, поэтому здесь дано практическое, а не универсально-юридическое определение по состоянию на 2026-08-13.

Редакционная оговорка: если вы обсуждаете находку только словом «jailbreak», без указания механики и вреда, коллегам будет трудно сравнить её с другими кейсами и понять, относится ли она к alignment-проблеме, к prompt injection или к vendor-specific reporting scope.

Источники

Вопросы и ответы

Jailbreak и prompt injection — это одно и то же?

Не совсем. В текущих источниках они тесно связаны, но не стандартизованы как полный синоним. Anthropic акцентирует jailbreak как обход guardrails, OpenAI даёт отдельное определение prompt injection как внедрения вредоносных инструкций в контекст, а OWASP рассматривает оба класса рядом.

Можно ли считать jailbreak уязвимостью для CVE?

Не автоматически. По политике OpenAI от 2025-11-20 prompt jailbreaks, hallucinations и policy bypasses не входят в scope для CVE.

Что сейчас может входить в bug bounty у OpenAI?

По программе Safety Bug Bounty от 2026-03-25 в scope могут входить third-party prompt injection и data exfiltration для agentic products, если поведение воспроизводится как минимум в 50% случаев. Pure jailbreaks и общие обходы контент-политик без демонстрируемого вреда исключены.

Как измеряют устойчивость к jailbreak?

Обычно не одной демонстрацией, а воспроизводимыми наборами тестов. Для этого существует JailbreakBench: открытый benchmark с датасетом из 100 behaviors, стандартной рамкой оценки и leaderboard.

Почему вокруг термина столько путаницы?

Потому что разные организации используют разный фокус: кто-то описывает технику обхода guardrails, кто-то — механизм внедрения вредоносной инструкции, а кто-то — операционный scope для отчётности. Поэтому в инженерной практике всегда полезно уточнять сценарий и вред, а не полагаться на одно слово.

Источники

SOURCES

Вопросы и ответы

FAQ
Jailbreak и prompt injection — это одно и то же?

Не совсем. Источники сближают эти термины, но не стандартизуют их как полный синоним: Anthropic акцентирует обход guardrails, OpenAI отдельно определяет prompt injection как внедрение вредоносных инструкций в контекст, а OWASP рассматривает оба класса рядом.

Можно ли считать jailbreak уязвимостью для CVE?

Не автоматически. По политике OpenAI от 2025-11-20 prompt jailbreaks, hallucinations и policy bypasses не входят в scope для CVE.

Что сейчас может входить в bug bounty у OpenAI?

По программе Safety Bug Bounty от 2026-03-25 в scope могут входить third-party prompt injection и data exfiltration для agentic products, если поведение воспроизводится как минимум в 50% случаев. Pure jailbreaks и общие обходы контент-политик без демонстрируемого вреда исключены.

Как измеряют устойчивость к jailbreak?

Обычно не одной демонстрацией, а воспроизводимыми наборами тестов. Для этого существует JailbreakBench: открытый benchmark с датасетом из 100 behaviors, стандартной рамкой оценки и leaderboard.

Почему вокруг термина столько путаницы?

Потому что разные организации описывают разные аспекты: технику обхода guardrails, механизм внедрения инструкций или reporting scope. В практике полезно всегда уточнять сценарий и тип вреда.

Читайте также

LINKS