После выполнения этой инструкции вы проведёте первый воспроизводимый цикл red teaming для вашей модели или LLM-приложения: зададите цель упражнения, проведёте open-ended ручные тесты, добавите локальный автоматизированный скан и сравните результаты до и после мер смягчения.
Практический вердикт: если вам нужен полезный результат, не заменяйте red teaming одной метрикой или одной автоматизацией. Microsoft Learn рекомендует начинать с manual red teaming перед систематическим измерением и mitigation, а не вместо них.
| Время | Зависит от масштаба; в официальных источниках точная норма не указана. |
|---|---|
| Сложность | Средний. |
| Стоимость | Зависит от вашего стека; в процитированных источниках цена не указана, перепроверьте официальные продуктовые страницы. |
| Что потребуется | Доступ к тестируемой версии модели или системы; журнал результатов; назначенные harms/features; для локального AI Red Teaming Agent — Foundry project, Python 3.10/3.11/3.12/3.13 и при необходимости собственный storage account; для локального PyRIT документация рекомендует Python 3.13. |
| Актуальные условия | Методический гайд Microsoft Learn Planning red teaming for large language models (LLMs) and their applications помечен как last updated 2026-05-13. Локальный AI Red Teaming Agent описан как preview и несовместим с Foundry (new) portal и SDK. На странице releases PyRIT на момент доступа указан Latest = v1.0.1 от 2026-07-30. |
Редакционное ограничение: в источниках нет одного универсального runbook с одинаковыми командами и кнопками для всех платформ. Поэтому ниже — проверяемый процесс, который можно воспроизвести на вашей модели, а автоматизированный пример опирается на официальный локальный preview-сценарий Microsoft и на PyRIT как open-source toolkit.
Пошагово
- Зафиксируйте цель упражнения и критерий успеха атакующего.
Сначала определите, что именно должна попытаться сделать red team: достигнуть заранее заданной цели или выполнить proxy task. NIST рекомендует проверять, может ли достаточно обеспеченная red team выполнить такую цель, сравнивать ресурсы red team с ресурсами вероятного attacker и документировать само упражнение.
На практике это означает одно: до первого запроса запишите, что считается успехом атаки, какие ресурсы разрешены, какой доступ к системе есть у тестировщика и какой тип misuse или failure вы хотите обнаружить.
Ожидаемый результат: у вас есть краткий scope-документ с целью, proxy task при необходимости, ограничениями по доступу и критериями успеха.
- Соберите разнообразную команду и распределите harms/features.
Microsoft Learn рекомендует формировать разнообразную команду red teamers, сочетать benign и adversarial mindset, назначать каждому конкретные harms/features и фиксировать результаты в структурированном виде. Подход OpenAI к external red teaming также начинает кампанию с определения cohort: кто именно участвует, к каким версиям модели или системы у них есть доступ и какие инструкции они получают.
Не отправляйте всех тестировщиков «искать что угодно». Назначьте каждому одну или несколько чётких областей: например, вредоносные сценарии, обход ограничений, небезопасные ответы, провалы на уровне приложения или уязвимости во всей связке.
Ожидаемый результат: у вас есть матрица «кто тестирует что» и понятный доступ к версиям модели или системы для каждого участника.
- Подготовьте тестовую среду и проверьте версионные условия.
OpenAI рекомендует заранее подготовить интерфейсы и инструкции для red team. Если вы будете добавлять автоматизированный локальный прогон через AI Red Teaming Agent, официальный preview-сценарий требует Foundry project, Python 3.10/3.11/3.12/3.13 и при необходимости собственный storage account. Документация также отдельно предупреждает, что этот локальный сценарий не совместим с Foundry (new) portal и SDK.
Если вы используете PyRIT локально, документация рекомендует Python 3.13 и предлагает проверить установку командой ниже.
python -c "import pyrit; print(f'PyRIT version installed: {pyrit.__version__}')"После проверки сравните вашу установленную версию с текущей страницей releases. На момент доступа Latest = v1.0.1; при этом release v0.13.0 внёс breaking changes, включая замену
TargetCapabilitiesнаTargetConfiguration.Ожидаемый результат: тестовая среда готова, команда выводит установленную версию PyRIT, а ограничения preview-сценария Microsoft вам известны заранее.
- Проведите open-ended manual red teaming.
Microsoft Learn рекомендует начинать с open-ended testing и проводить manual red teaming до систематического измерения и mitigation, а не вместо них. На этом этапе не пытайтесь сразу «свести всё к одной таблице риска». Сначала соберите реальные провалы, неожиданные обходы и сценарии, которые не были видны в обычном QA.
Важно тестировать не только базовую модель, но и приложение, и связку целиком. Тот же источник рекомендует проверять базовую модель, само приложение и их комбинацию — причём до и после мер смягчения.
Ожидаемый результат: у вас есть первый список воспроизводимых находок по трём слоям: базовая модель, приложение и система целиком.
- Переведите найденные сценарии в guided iterative red teaming и общий формат записи.
После первого свободного прохода переходите к guided iterative red teaming. Microsoft Learn советует двигаться именно так: от open-ended testing к направленным итерациям и сбору данных в общем формате. Подход OpenAI добавляет ещё один важный шаг: после кампании синтезировать полученные данные для evaluation.
Минимальный рабочий формат записи можно собрать из требований источников:
Что фиксировать Зачем это нужно Цель или proxy task Чтобы проверять, достиг ли тестировщик заранее заданного результата по NIST. Тестируемый слой Чтобы не смешивать базовую модель, приложение и связку целиком. Версия модели или системы Чтобы сравнивать результаты между итерациями и после мер смягчения. Назначенный harm/feature Чтобы сохранять структуру, рекомендованную Microsoft Learn. Ресурсы red team Чтобы сравнивать их с ресурсами вероятного attacker по NIST. Итог до/после мер смягчения Чтобы оценить, помогли ли изменения. Ожидаемый результат: ваши находки не теряются в заметках, а превращаются в повторяемый набор сценариев для следующего прогона и evaluation.
- Запустите локальный автоматизированный скан и проверьте ASR.
Когда ручной набор сценариев уже есть, добавьте автоматизацию. Официальная документация Microsoft по локальному AI Red Teaming Agent описывает preview-рабочий процесс, в котором сканы создаются локально через Azure AI Evaluation SDK. Ключевая метрика там — Attack Success Rate (ASR). Результат можно вывести в JSON scorecard через
output_pathи использовать как проверяемый артефакт.Если вам нужен open-source toolkit, PyRIT позиционируется как scanner, GUI и framework для red teaming. Но перед прогоном обязательно сверяйте текущий release и breaking changes, потому что версионная совместимость в этой экосистеме критична.
Ожидаемый результат: вы получаете машинно читаемый результат скана и видите ASR, который можно сравнивать между итерациями.
- Повторите те же сценарии после мер смягчения и примите решение по итогам.
Red teaming не заканчивается на первом списке провалов. Microsoft Learn рекомендует тестировать до и после mitigations. Это значит, что один и тот же набор сценариев нужно прогонять повторно после изменений в модели, приложении или защитных слоях.
Если вы добавляете фильтры или политики ответа, после этого этапа переходите к отдельной настройке guardrails для AI-приложения. Решение о выпуске имеет смысл принимать только после сравнения ручных результатов, ASR и зафиксированных целей упражнения.
Ожидаемый результат: у вас есть сравнение до/после, список оставшихся рисков и решение, какие сценарии надо закрывать следующей итерацией.
Как проверить, что всё работает
- У вас есть документированная цель red teaming или proxy task, а также зафиксированы ресурсы red team и предполагаемый профиль attacker.
- Ручной прогон выполнен не только по базовой модели, но и по приложению и по связке целиком.
- После open-ended этапа создан повторяемый набор guided scenarios в общем формате записи.
- Если вы запускали локальный AI Red Teaming Agent, у вас есть JSON scorecard через
output_pathи видимое значение ASR. - После мер смягчения тот же набор сценариев прогнан повторно, и вы можете сравнить результаты до/после.
Частые ошибки и исправления
- Ошибка: вы начинаете сразу с метрик и автоматизации, пропуская ручной этап.
Исправление: Microsoft Learn рекомендует сначала manual red teaming, а уже потом систематическое измерение и mitigation. - Ошибка: тестируется только базовая модель, а не приложение и не связка целиком.
Исправление: прогоняйте базовую модель, приложение и всю систему до и после мер смягчения. - Ошибка: все red teamers работают без специализации и с одинаковым подходом.
Исправление: соберите разнообразную команду, сочетайте benign и adversarial mindset, назначайте конкретные harms/features. - Ошибка: вы пытаетесь запускать локальный AI Red Teaming Agent через Foundry (new) portal или SDK.
Исправление: для описанного в источнике preview-сценария используйте локальный рабочий процесс через Azure AI Evaluation SDK; Microsoft прямо указывает, что он не совместим с Foundry (new) portal и SDK. - Ошибка: автоматизация ломается из-за несовместимой версии PyRIT или старых сущностей.
Исправление: сначала проверьте установленную версию командой из документации, затем сверяйтесь со страницей releases; учитывайте breaking changes, добавленные в v0.13.0, включая переход сTargetCapabilitiesнаTargetConfiguration.
Безопасность и ограничения
- Официальный human-process гайд Microsoft Learn Azure/Foundry-ориентирован. Его логика применима шире, но конкретные продуктовые шаги придётся адаптировать под ваш стек.
- Локальный AI Red Teaming Agent в источнике описан как preview. Это важно для планирования стабильности и совместимости.
- Preview-сценарий локального AI Red Teaming Agent не совместим с Foundry (new) portal и SDK.
- Документация PyRIT и страница releases меняются. Значение Latest и список breaking changes нужно сверять непосредственно перед запуском.
- NIST AI 800-1, на который удобно опираться для постановки целей и документации, в данном наборе источников представлен как Second Public Draft, а не как финальная версия стандарта.
- Региональная доступность и ценообразование для Azure Foundry и связанных функций в процитированных источниках не указаны; для операционно критичных задач проверьте официальные продуктовые страницы отдельно.
Что делать дальше
- Если вы нашли обходы, сразу переходите к практической настройке guardrails для AI-приложения.
- Если хотите выровнять терминологию внутри команды, дайте коллегам короткие определения: red teaming ИИ и reasoning-модели.
- Если вы тестируете локальный стек, сопоставьте процесс с практикой из инструкции как использовать Jan.ai для локальных моделей.
- Если модель влияет на разработку, добавьте отдельный сценарий тестирования из рабочей задачи как использовать ИИ для код-ревью.
Источники
- AI Red Teaming
- Planning red teaming for large language models (LLMs) and their applications
- Run scans with the AI Red Teaming Agent locally
- AI Red Teaming Agent
- PyRIT
- Releases · microsoft/PyRIT
- OpenAI’s Approach to External Red Teaming for AI Models and Systems
- NIST AI 800-1 2pd (Second Public Draft) Managing Misuse Risk for Dual-Use Foundation Models
Вопросы и ответы
Можно ли провести red teaming только вручную?
Можно начать вручную, и Microsoft Learn прямо рекомендует manual red teaming перед систематическим измерением и mitigation. Но не стоит останавливаться на этом: после ручного этапа имеет смысл перейти к guided iterative testing и автоматизированным сканам.
Что именно тестировать: модель или приложение?
Обе цели обязательны. Microsoft Learn рекомендует проверять базовую модель, приложение и их комбинацию, причём и до, и после мер смягчения.
Как понять, что red teaming дал полезный результат?
Полезный результат — это не просто список «странных ответов», а документированная цель упражнения, общий формат записи результатов, повторяемые сценарии и сравнение до/после. Для локального AI Red Teaming Agent дополнительной проверкой служит JSON scorecard и метрика ASR.
Нужен ли Azure Foundry для этой инструкции?
Для локального preview-сценария AI Red Teaming Agent — да, среди prerequisites указан Foundry project. Но сама методология red teaming в этой инструкции опирается также на OpenAI и NIST, а для open-source автоматизации можно использовать PyRIT.
Какую версию PyRIT брать?
Перед запуском перепроверьте releases. На момент доступа страница указывала Latest = v1.0.1 от 2026-07-30, а v0.13.0 добавила breaking changes, поэтому слепо использовать старые примеры рискованно.