Запись архива

FAR.AI запустили лидерборд безопасности AI-моделей: тест на 1500 джейлбрейков

FAR.AI представили автоматизированный тест безопасности для AI-моделей. Лидерборд оценивает устойчивость к джейлбрейкам: Fable 5 и GPT-5.6 Sol показали лучшие результаты, Gemini 3.1 Pro и Grok 4.5 — отстают. Обсуждение на Hacker News.

Лидерборд безопасности AI-моделей от FAR.AI — сравнение устойчивости к джейлбрейкам
Лидерборд безопасности AI-моделей от FAR.AI — сравнение устойчивости к джейлбрейкам
Journalists Protest against rising violence during march in Mexi | by Knight Foundation | openverse | by-sa

Что случилось?
FAR.AI (организация, известная аудитом AI-моделей) опубликовала лидерборд безопасности AI, посвящённый защите от джейлбрейков. Проект представляет собой автоматизированный тестовый набор, который прогоняет модели через 1500 сгенерированных атак. Цель — измерить количество «универсальных джейлбрейков»: промптов, заставляющих модель выдавать вредоносные ответы на более чем 75% вопросов из чётко опасной тематики (например, offensive cybersecurity).

Почему это обсуждают?
На Hacker News пост «Show HN: AI Security Leaderboard» вызвал интерес, но пока без комментариев (на момент сбора). Обсуждение, вероятно, будет вращаться вокруг практической ценности таких тестов. В индустрии всё острее стоит вопрос: как модели ведут себя при небезопасном вводе, особенно в сценариях с AI-агентами. Лидерборд — попытка внести прозрачность в эту область, где обычно преобладают маркетинговые заявления о безопасности.

Что подтверждено, что нет?
Подтверждено: FAR.AI действительно разработали и опубликовали тестовый набор, есть страница лидерборда с результатами. Методология описана — автоматическая генерация атак, измерение доли успешных джейлбрейков.
Неясно: насколько независим тест (FAR.AI — неофициальный бенчмарк), воспроизводимость результатов на других наборах данных, какие именно модели проверялись (доступны ли версии для публичного тестирования). Также нет информации о том, как учитывались обновления моделей после выхода.

Что дальше?
Стоит следить за обновлениями лидерборда — FAR.AI обещают добавлять новые атаки и расширять датасеты. Для собственной проверки можно обратиться к официальным блогам разработчиков моделей (например, DeepMind) — хотя они не комментировали этот конкретный тест. Рекомендуется также самостоятельно прогонять модели через аналогичные тесты, если у вас есть доступ к API.

Punkt Detail
Платформа FAR.AI Security Leaderboard
Методология Автоматический тест: 1500 джейлбрейков, измерение универсальных атак
Результаты Лидеры: Fable 5, GPT-5.6 Sol; отстают: Gemini 3.1 Pro, Grok 4.5
Ограничения Неофициальный бенчмарк, нет независимой верификации

Источники: оригинальный пост на Hacker News (https://news.ycombinator.com/item?id=49103367) и страница для верификации — блог DeepMind (https://deepmind.google/discover/blog/).