
Что случилось?
FAR.AI (организация, известная аудитом AI-моделей) опубликовала лидерборд безопасности AI, посвящённый защите от джейлбрейков. Проект представляет собой автоматизированный тестовый набор, который прогоняет модели через 1500 сгенерированных атак. Цель — измерить количество «универсальных джейлбрейков»: промптов, заставляющих модель выдавать вредоносные ответы на более чем 75% вопросов из чётко опасной тематики (например, offensive cybersecurity).
Почему это обсуждают?
На Hacker News пост «Show HN: AI Security Leaderboard» вызвал интерес, но пока без комментариев (на момент сбора). Обсуждение, вероятно, будет вращаться вокруг практической ценности таких тестов. В индустрии всё острее стоит вопрос: как модели ведут себя при небезопасном вводе, особенно в сценариях с AI-агентами. Лидерборд — попытка внести прозрачность в эту область, где обычно преобладают маркетинговые заявления о безопасности.
Что подтверждено, что нет?
Подтверждено: FAR.AI действительно разработали и опубликовали тестовый набор, есть страница лидерборда с результатами. Методология описана — автоматическая генерация атак, измерение доли успешных джейлбрейков.
Неясно: насколько независим тест (FAR.AI — неофициальный бенчмарк), воспроизводимость результатов на других наборах данных, какие именно модели проверялись (доступны ли версии для публичного тестирования). Также нет информации о том, как учитывались обновления моделей после выхода.
Что дальше?
Стоит следить за обновлениями лидерборда — FAR.AI обещают добавлять новые атаки и расширять датасеты. Для собственной проверки можно обратиться к официальным блогам разработчиков моделей (например, DeepMind) — хотя они не комментировали этот конкретный тест. Рекомендуется также самостоятельно прогонять модели через аналогичные тесты, если у вас есть доступ к API.
| Punkt | Detail |
|---|---|
| Платформа | FAR.AI Security Leaderboard |
| Методология | Автоматический тест: 1500 джейлбрейков, измерение универсальных атак |
| Результаты | Лидеры: Fable 5, GPT-5.6 Sol; отстают: Gemini 3.1 Pro, Grok 4.5 |
| Ограничения | Неофициальный бенчмарк, нет независимой верификации |
Источники: оригинальный пост на Hacker News (https://news.ycombinator.com/item?id=49103367) и страница для верификации — блог DeepMind (https://deepmind.google/discover/blog/).