COMRAD404 / HOWTO

Как провести red teaming для вашей модели

Пошаговая инструкция по red teaming модели или LLM-приложения: как задать цель, собрать команду, провести ручные тесты, проверить ASR и повторить цикл после мер смягчения.

Понадобится

Зависит от масштаба; в официальных источниках точная норма не указана
  • Доступ к тестируемой версии модели или системы
  • Определённая цель red teaming или proxy task
  • Журнал результатов в структурированном формате
  • Разнообразная команда red teamers с назначенными harms/features
  • Для локального AI Red Teaming Agent: Foundry project
  • Для локального AI Red Teaming Agent: Python 3.10/3.11/3.12/3.13
  • При необходимости для локального AI Red Teaming Agent: собственный storage account
  • Для локального PyRIT: Python 3.13 рекомендуется документацией

После выполнения этой инструкции вы проведёте первый воспроизводимый цикл red teaming для вашей модели или LLM-приложения: зададите цель упражнения, проведёте open-ended ручные тесты, добавите локальный автоматизированный скан и сравните результаты до и после мер смягчения.

Практический вердикт: если вам нужен полезный результат, не заменяйте red teaming одной метрикой или одной автоматизацией. Microsoft Learn рекомендует начинать с manual red teaming перед систематическим измерением и mitigation, а не вместо них.

Время Зависит от масштаба; в официальных источниках точная норма не указана.
Сложность Средний.
Стоимость Зависит от вашего стека; в процитированных источниках цена не указана, перепроверьте официальные продуктовые страницы.
Что потребуется Доступ к тестируемой версии модели или системы; журнал результатов; назначенные harms/features; для локального AI Red Teaming Agent — Foundry project, Python 3.10/3.11/3.12/3.13 и при необходимости собственный storage account; для локального PyRIT документация рекомендует Python 3.13.
Актуальные условия Методический гайд Microsoft Learn Planning red teaming for large language models (LLMs) and their applications помечен как last updated 2026-05-13. Локальный AI Red Teaming Agent описан как preview и несовместим с Foundry (new) portal и SDK. На странице releases PyRIT на момент доступа указан Latest = v1.0.1 от 2026-07-30.

Редакционное ограничение: в источниках нет одного универсального runbook с одинаковыми командами и кнопками для всех платформ. Поэтому ниже — проверяемый процесс, который можно воспроизвести на вашей модели, а автоматизированный пример опирается на официальный локальный preview-сценарий Microsoft и на PyRIT как open-source toolkit.

Пошагово

  1. Зафиксируйте цель упражнения и критерий успеха атакующего.

    Сначала определите, что именно должна попытаться сделать red team: достигнуть заранее заданной цели или выполнить proxy task. NIST рекомендует проверять, может ли достаточно обеспеченная red team выполнить такую цель, сравнивать ресурсы red team с ресурсами вероятного attacker и документировать само упражнение.

    На практике это означает одно: до первого запроса запишите, что считается успехом атаки, какие ресурсы разрешены, какой доступ к системе есть у тестировщика и какой тип misuse или failure вы хотите обнаружить.

    Ожидаемый результат: у вас есть краткий scope-документ с целью, proxy task при необходимости, ограничениями по доступу и критериями успеха.

  2. Соберите разнообразную команду и распределите harms/features.

    Microsoft Learn рекомендует формировать разнообразную команду red teamers, сочетать benign и adversarial mindset, назначать каждому конкретные harms/features и фиксировать результаты в структурированном виде. Подход OpenAI к external red teaming также начинает кампанию с определения cohort: кто именно участвует, к каким версиям модели или системы у них есть доступ и какие инструкции они получают.

    Не отправляйте всех тестировщиков «искать что угодно». Назначьте каждому одну или несколько чётких областей: например, вредоносные сценарии, обход ограничений, небезопасные ответы, провалы на уровне приложения или уязвимости во всей связке.

    Ожидаемый результат: у вас есть матрица «кто тестирует что» и понятный доступ к версиям модели или системы для каждого участника.

  3. Подготовьте тестовую среду и проверьте версионные условия.

    OpenAI рекомендует заранее подготовить интерфейсы и инструкции для red team. Если вы будете добавлять автоматизированный локальный прогон через AI Red Teaming Agent, официальный preview-сценарий требует Foundry project, Python 3.10/3.11/3.12/3.13 и при необходимости собственный storage account. Документация также отдельно предупреждает, что этот локальный сценарий не совместим с Foundry (new) portal и SDK.

    Если вы используете PyRIT локально, документация рекомендует Python 3.13 и предлагает проверить установку командой ниже.

    python -c "import pyrit; print(f'PyRIT version installed: {pyrit.__version__}')"

    После проверки сравните вашу установленную версию с текущей страницей releases. На момент доступа Latest = v1.0.1; при этом release v0.13.0 внёс breaking changes, включая замену TargetCapabilities на TargetConfiguration.

    Ожидаемый результат: тестовая среда готова, команда выводит установленную версию PyRIT, а ограничения preview-сценария Microsoft вам известны заранее.

  4. Проведите open-ended manual red teaming.

    Microsoft Learn рекомендует начинать с open-ended testing и проводить manual red teaming до систематического измерения и mitigation, а не вместо них. На этом этапе не пытайтесь сразу «свести всё к одной таблице риска». Сначала соберите реальные провалы, неожиданные обходы и сценарии, которые не были видны в обычном QA.

    Важно тестировать не только базовую модель, но и приложение, и связку целиком. Тот же источник рекомендует проверять базовую модель, само приложение и их комбинацию — причём до и после мер смягчения.

    Ожидаемый результат: у вас есть первый список воспроизводимых находок по трём слоям: базовая модель, приложение и система целиком.

  5. Переведите найденные сценарии в guided iterative red teaming и общий формат записи.

    После первого свободного прохода переходите к guided iterative red teaming. Microsoft Learn советует двигаться именно так: от open-ended testing к направленным итерациям и сбору данных в общем формате. Подход OpenAI добавляет ещё один важный шаг: после кампании синтезировать полученные данные для evaluation.

    Минимальный рабочий формат записи можно собрать из требований источников:

    Что фиксировать Зачем это нужно
    Цель или proxy task Чтобы проверять, достиг ли тестировщик заранее заданного результата по NIST.
    Тестируемый слой Чтобы не смешивать базовую модель, приложение и связку целиком.
    Версия модели или системы Чтобы сравнивать результаты между итерациями и после мер смягчения.
    Назначенный harm/feature Чтобы сохранять структуру, рекомендованную Microsoft Learn.
    Ресурсы red team Чтобы сравнивать их с ресурсами вероятного attacker по NIST.
    Итог до/после мер смягчения Чтобы оценить, помогли ли изменения.

    Ожидаемый результат: ваши находки не теряются в заметках, а превращаются в повторяемый набор сценариев для следующего прогона и evaluation.

  6. Запустите локальный автоматизированный скан и проверьте ASR.

    Когда ручной набор сценариев уже есть, добавьте автоматизацию. Официальная документация Microsoft по локальному AI Red Teaming Agent описывает preview-рабочий процесс, в котором сканы создаются локально через Azure AI Evaluation SDK. Ключевая метрика там — Attack Success Rate (ASR). Результат можно вывести в JSON scorecard через output_path и использовать как проверяемый артефакт.

    Если вам нужен open-source toolkit, PyRIT позиционируется как scanner, GUI и framework для red teaming. Но перед прогоном обязательно сверяйте текущий release и breaking changes, потому что версионная совместимость в этой экосистеме критична.

    Ожидаемый результат: вы получаете машинно читаемый результат скана и видите ASR, который можно сравнивать между итерациями.

  7. Повторите те же сценарии после мер смягчения и примите решение по итогам.

    Red teaming не заканчивается на первом списке провалов. Microsoft Learn рекомендует тестировать до и после mitigations. Это значит, что один и тот же набор сценариев нужно прогонять повторно после изменений в модели, приложении или защитных слоях.

    Если вы добавляете фильтры или политики ответа, после этого этапа переходите к отдельной настройке guardrails для AI-приложения. Решение о выпуске имеет смысл принимать только после сравнения ручных результатов, ASR и зафиксированных целей упражнения.

    Ожидаемый результат: у вас есть сравнение до/после, список оставшихся рисков и решение, какие сценарии надо закрывать следующей итерацией.

Как проверить, что всё работает

  • У вас есть документированная цель red teaming или proxy task, а также зафиксированы ресурсы red team и предполагаемый профиль attacker.
  • Ручной прогон выполнен не только по базовой модели, но и по приложению и по связке целиком.
  • После open-ended этапа создан повторяемый набор guided scenarios в общем формате записи.
  • Если вы запускали локальный AI Red Teaming Agent, у вас есть JSON scorecard через output_path и видимое значение ASR.
  • После мер смягчения тот же набор сценариев прогнан повторно, и вы можете сравнить результаты до/после.

Частые ошибки и исправления

  • Ошибка: вы начинаете сразу с метрик и автоматизации, пропуская ручной этап.
    Исправление: Microsoft Learn рекомендует сначала manual red teaming, а уже потом систематическое измерение и mitigation.
  • Ошибка: тестируется только базовая модель, а не приложение и не связка целиком.
    Исправление: прогоняйте базовую модель, приложение и всю систему до и после мер смягчения.
  • Ошибка: все red teamers работают без специализации и с одинаковым подходом.
    Исправление: соберите разнообразную команду, сочетайте benign и adversarial mindset, назначайте конкретные harms/features.
  • Ошибка: вы пытаетесь запускать локальный AI Red Teaming Agent через Foundry (new) portal или SDK.
    Исправление: для описанного в источнике preview-сценария используйте локальный рабочий процесс через Azure AI Evaluation SDK; Microsoft прямо указывает, что он не совместим с Foundry (new) portal и SDK.
  • Ошибка: автоматизация ломается из-за несовместимой версии PyRIT или старых сущностей.
    Исправление: сначала проверьте установленную версию командой из документации, затем сверяйтесь со страницей releases; учитывайте breaking changes, добавленные в v0.13.0, включая переход с TargetCapabilities на TargetConfiguration.

Безопасность и ограничения

  • Официальный human-process гайд Microsoft Learn Azure/Foundry-ориентирован. Его логика применима шире, но конкретные продуктовые шаги придётся адаптировать под ваш стек.
  • Локальный AI Red Teaming Agent в источнике описан как preview. Это важно для планирования стабильности и совместимости.
  • Preview-сценарий локального AI Red Teaming Agent не совместим с Foundry (new) portal и SDK.
  • Документация PyRIT и страница releases меняются. Значение Latest и список breaking changes нужно сверять непосредственно перед запуском.
  • NIST AI 800-1, на который удобно опираться для постановки целей и документации, в данном наборе источников представлен как Second Public Draft, а не как финальная версия стандарта.
  • Региональная доступность и ценообразование для Azure Foundry и связанных функций в процитированных источниках не указаны; для операционно критичных задач проверьте официальные продуктовые страницы отдельно.

Что делать дальше

Источники

Вопросы и ответы

Можно ли провести red teaming только вручную?

Можно начать вручную, и Microsoft Learn прямо рекомендует manual red teaming перед систематическим измерением и mitigation. Но не стоит останавливаться на этом: после ручного этапа имеет смысл перейти к guided iterative testing и автоматизированным сканам.

Что именно тестировать: модель или приложение?

Обе цели обязательны. Microsoft Learn рекомендует проверять базовую модель, приложение и их комбинацию, причём и до, и после мер смягчения.

Как понять, что red teaming дал полезный результат?

Полезный результат — это не просто список «странных ответов», а документированная цель упражнения, общий формат записи результатов, повторяемые сценарии и сравнение до/после. Для локального AI Red Teaming Agent дополнительной проверкой служит JSON scorecard и метрика ASR.

Нужен ли Azure Foundry для этой инструкции?

Для локального preview-сценария AI Red Teaming Agent — да, среди prerequisites указан Foundry project. Но сама методология red teaming в этой инструкции опирается также на OpenAI и NIST, а для open-source автоматизации можно использовать PyRIT.

Какую версию PyRIT брать?

Перед запуском перепроверьте releases. На момент доступа страница указывала Latest = v1.0.1 от 2026-07-30, а v0.13.0 добавила breaking changes, поэтому слепо использовать старые примеры рискованно.

Шаги

HOW-TO
  1. Зафиксировать цель и критерий успеха атакующего

    | Определите заранее заданную цель или proxy task, сравните ресурсы red team с ресурсами вероятного attacker и задокументируйте упражнение.

  2. Собрать команду и распределить harms/features

    | Сформируйте разнообразную red team, сочетайте benign и adversarial mindset и назначьте участникам конкретные области проверки.

  3. Подготовить тестовую среду и версии

    | Организуйте доступ к версиям модели или системы, подготовьте интерфейсы и инструкции; для локальной автоматизации проверьте prerequisites Foundry, Python и PyRIT.

  4. Провести open-ended manual red teaming

    | Сначала выполните свободный ручной проход и проверьте базовую модель, приложение и всю связку целиком.

  5. Перевести сценарии в guided iterative формат

    | После первого прохода соберите находки в общий формат записи, чтобы использовать их в повторяемых итерациях и evaluation.

  6. Запустить локальный автоматизированный скан

    | При необходимости используйте локальный AI Red Teaming Agent через Azure AI Evaluation SDK и проверьте результат по ASR и JSON scorecard; для open-source стека проверьте PyRIT.

  7. Повторить цикл после мер смягчения

    | Прогоните тот же набор сценариев после mitigations и сравните результаты до/после перед выпуском или следующей итерацией.

Источники

SOURCES

Вопросы и ответы

FAQ
Можно ли провести red teaming только вручную?

Да, с ручного этапа стоит начинать: Microsoft Learn рекомендует manual red teaming перед систематическим измерением и mitigation. Но затем добавьте guided iterative testing и автоматизированные сканы.

Что именно тестировать: модель или приложение?

И то и другое. Microsoft Learn рекомендует проверять базовую модель, приложение и их комбинацию, причём до и после мер смягчения.

Как понять, что red teaming дал полезный результат?

Полезный результат — это документированная цель упражнения, общий формат записи результатов, повторяемые сценарии и сравнение до/после. Для локального AI Red Teaming Agent дополнительной проверкой служат JSON scorecard и ASR.

Нужен ли Azure Foundry для этой инструкции?

Для локального preview-сценария AI Red Teaming Agent — да, среди prerequisites указан Foundry project. Но сама методология red teaming в статье опирается также на OpenAI и NIST, а для open-source автоматизации можно использовать PyRIT.

Какую версию PyRIT брать?

Перед запуском перепроверьте releases. На момент доступа страница указывала Latest = v1.0.1 от 2026-07-30, а v0.13.0 добавила breaking changes, поэтому старые примеры нужно сверять особенно внимательно.

Читайте также

LINKS