Джейлбрейк (jailbreak) в контексте ИИ — это попытка с помощью adversarial prompting обойти защитные ограничения модели и получить ответ, которого разработчик не хотел допускать. Anthropic описывает jailbreaks как стратегии prompting для обхода safety guardrails и получения нежелательных, иногда вредных ответов; OWASP рассматривает jailbreaking как близкий класс атак рядом с prompt injection.
На практике термин используется не полностью единообразно. OpenAI отдельно определяет prompt injection как атаку социальной инженерии для разговорного ИИ, где третья сторона внедряет вредоносные инструкции в контекст диалога, поэтому в рабочем обсуждении лучше сразу уточнять: вы говорите о прямом обходе политики модели или о внедрении инструкции через внешний контекст.
Английский термин: jailbreak. Также встречается: джейлбрейк, обход guardrails, bypass safety guardrails. Близкий термин: prompt injection; в источниках он тесно связан с jailbreak, но не всегда используется как точный синоним.
Простыми словами
Грубо говоря, jailbreak — это попытка уговорить ИИ «забыть правила». Можно представить это как разговор с сотрудником, у которого есть строгая инструкция, а собеседник специально подбирает формулировки, чтобы тот отступил от регламента.
Важно, что речь не обязательно о «взломе» в классическом смысле. Часто это именно игра с инструкциями, контекстом и формулировками, а не эксплуатация обычной программной уязвимости.
Как это работает
По материалам Anthropic, OpenAI и OWASP, общая механика выглядит так: у модели есть базовые правила и защитные ограничения, а атакующий старается добавить в контекст инструкции, которые конкурируют с этими правилами или маскируются под более приоритетные указания.
Правила разработчика и системные ограничения
↓
Контекст диалога или внешний контент
↓
Атакующая инструкция / обходная формулировка
↓
Модель
↓
Защитные слои: обучение, мониторинг,
sandboxing, red-teaming, user controls
↓
Отказ / нежелательный ответ / утечка system prompt
/ data exfiltration / несанкционированное действие
- Разработчик задаёт правила модели и ограничения на ответы или действия.
- В контекст попадает adversarial prompt: прямой запрос на обход правил или вредоносная инструкция, встроенная в разговор.
- Если защитные слои срабатывают, модель отказывает или безопасно переформулирует ответ.
- Если защита не справляется, результатом может стать нежелательный вывод, утечка system prompt, извлечение данных, несанкционированное действие или даже сохранение эффекта в последующих сессиях — именно такие риски перечисляет OWASP.
OpenAI описывает защиту от prompt injection как многослойную: model training, monitoring, sandboxing, red-teaming, bug bounties и user controls. Это важная практическая мысль: один фильтр или один запрет в системном промпте не считается достаточной защитой.
Где применяется
- Тестирование безопасности чат-моделей. Джейлбрейки используют в red teaming и внутренней оценке стойкости guardrails. Исследование 2024 года проанализировало 1405 «диких» jailbreak-промптов, выявило 131 сообщество и сообщило о пяти промптах с attack success rate 0,95 на ChatGPT (GPT-3.5) и GPT-4.
- Проверка агентных продуктов. Для систем, где модель может выполнять действия, риск выше: OWASP относит к последствиям prompt injection утечку данных и несанкционированные действия. Это особенно важно в агентных сценариях; как смежную тему можно посмотреть ReAct (reasoning + acting).
- Бенчмарки и сравнение защит. JailbreakBench — открытый benchmark для устойчивости к jailbreaking с репозиторием артефактов, датасетом из 100 behaviors, стандартизированной рамкой оценки и leaderboard. Это полезно, когда вам нужна не разовая демонстрация, а воспроизводимый тест.
- Документация по выпуску моделей. У Anthropic есть актуальный индекс model system cards, в том числе для Claude Sonnet 5 и Claude Opus 5 в 2026 году. Для практики это значит, что оценка стойкости к jailbreak часто зависит от конкретной модели, а не только от общего бренда или API.
Практический пример
Ниже — не «рецепт атаки», а рабочий сценарий, как команде безопасности или ML-инженеру классифицировать и проверять проблему, чтобы не смешивать разные классы рисков.
- Сначала определите тип случая. Это прямой jailbreak, где пользователь сам пытается обойти политику модели? Или third-party prompt injection, где вредоносная инструкция приходит через внешний контекст?
- Затем соберите воспроизводимый набор тестов. Если нужна системная оценка, используйте открытый набор вроде JailbreakBench: у него есть 100 behaviors, единая рамка оценки и код для воспроизводимого сравнения.
- Измеряйте не только «получился ответ или нет». Отдельно фиксируйте, был ли просто policy bypass, утёк ли system prompt, произошла ли data exfiltration, была ли попытка несанкционированного действия и сохраняется ли эффект между сессиями.
- Сверяйте отчёт со scope поставщика. По состоянию на 2026-08-13 OpenAI не относит prompt jailbreaks, hallucinations и policy bypasses к CVE. В bug bounty у OpenAI pure jailbreaks и общие обходы контент-политик тоже вне scope, но third-party prompt injection и data exfiltration для agentic products могут входить в scope, если поведение воспроизводится как минимум в 50% случаев.
- Формулируйте вывод предметно. Вместо общего «мы нашли jailbreak» полезнее писать: «воспроизводимая third-party prompt injection приводит к утечке данных» или «прямой policy bypass без доказуемого перехода к вредоносному действию».
Практический вердикт: для инженера одно слово «jailbreak» слишком расплывчато. В отчётах, triage и risk assessment почти всегда полезнее указывать конкретный класс: direct jailbreak, prompt injection, data exfiltration, system prompt leakage или unauthorized action.
Чем отличается от похожих терминов
| Термин | Что означает в источниках | Главное отличие |
|---|---|---|
| Jailbreak | Стратегия prompting для обхода safety guardrails и получения ответа, которого разработчик не хотел допускать. | Фокус на обходе правил самой модели. |
| Prompt injection | По OpenAI — социальная инженерия для разговорного ИИ, где третья сторона внедряет вредоносные инструкции в контекст; OWASP связывает это с обходом safety controls, утечкой данных и действиями без разрешения. | Фокус на внедрении вредоносной инструкции в контекст, часто через внешний источник. |
| Policy bypass | Операционный ярлык в политике поставщика для случаев, когда модель обходит контент- или safety-политику. | Это не обязательно отдельная техника атаки; чаще это способ описать результат для triage и scope. |
Смежные темы: Alignment (согласование ИИ), ReAct, Temperature. Они помогают понять соседний контекст, но не заменяют отдельную оценку стойкости к jailbreak.
Ограничения и заблуждения
- Заблуждение: «jailbreak = полноценный взлом модели». В текущем употреблении это чаще adversarial prompting, а не классическая эксплуатация программной уязвимости.
- Заблуждение: «jailbreak и prompt injection — одно и то же». Источники действительно сближают эти термины, но не стандартизуют их полностью одинаково. Anthropic акцентирует обход guardrails, OpenAI отдельно описывает prompt injection как особую форму социальной инженерии, а OWASP рассматривает их как тесно связанные классы атак.
- Заблуждение: «если обход удался, это автоматически CVE». У OpenAI по состоянию на 2025-11-20 prompt jailbreaks, hallucinations и policy bypasses не входят в scope для CVE.
- Заблуждение: «любая демонстрация jailbreak даёт bug bounty». По состоянию на 2026-03-25 OpenAI исключает pure jailbreaks и общие обходы контент-политик без демонстрируемого safety или abuse impact. При этом agentic third-party prompt injection и data exfiltration могут быть in scope при воспроизводимости не ниже 50%.
- Ограничение benchmark-оценок. Репозитории, датасеты и leaderboard для jailbreaking меняются со временем. Даже если URL не меняется, покрытие и рейтинги могут обновляться.
- Ограничение этой статьи. Терминология вокруг jailbreak не полностью стандартизована, поэтому здесь дано практическое, а не универсально-юридическое определение по состоянию на 2026-08-13.
Редакционная оговорка: если вы обсуждаете находку только словом «jailbreak», без указания механики и вреда, коллегам будет трудно сравнить её с другими кейсами и понять, относится ли она к alignment-проблеме, к prompt injection или к vendor-specific reporting scope.
Источники
- Understanding prompt injections | OpenAI
- OpenAI CVE assignment policy | OpenAI
- Introducing the OpenAI Safety Bug Bounty program | OpenAI
- Tracing the thoughts of a large language model
- LLM Prompt Injection Prevention – OWASP Cheat Sheet Series
- JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models
- Do Anything Now: Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models
- GitHub – JailbreakBench/jailbreakbench
- Model system cards
Вопросы и ответы
Jailbreak и prompt injection — это одно и то же?
Не совсем. В текущих источниках они тесно связаны, но не стандартизованы как полный синоним. Anthropic акцентирует jailbreak как обход guardrails, OpenAI даёт отдельное определение prompt injection как внедрения вредоносных инструкций в контекст, а OWASP рассматривает оба класса рядом.
Можно ли считать jailbreak уязвимостью для CVE?
Не автоматически. По политике OpenAI от 2025-11-20 prompt jailbreaks, hallucinations и policy bypasses не входят в scope для CVE.
Что сейчас может входить в bug bounty у OpenAI?
По программе Safety Bug Bounty от 2026-03-25 в scope могут входить third-party prompt injection и data exfiltration для agentic products, если поведение воспроизводится как минимум в 50% случаев. Pure jailbreaks и общие обходы контент-политик без демонстрируемого вреда исключены.
Как измеряют устойчивость к jailbreak?
Обычно не одной демонстрацией, а воспроизводимыми наборами тестов. Для этого существует JailbreakBench: открытый benchmark с датасетом из 100 behaviors, стандартной рамкой оценки и leaderboard.
Почему вокруг термина столько путаницы?
Потому что разные организации используют разный фокус: кто-то описывает технику обхода guardrails, кто-то — механизм внедрения вредоносной инструкции, а кто-то — операционный scope для отчётности. Поэтому в инженерной практике всегда полезно уточнять сценарий и вред, а не полагаться на одно слово.