
Что произошло
1Password опубликовала SCAM — открытый бенчмарк, который проверяет, насколько ИИ-агенты устойчивы к обману при выполнении многошаговых рабочих задач. В демонстрации одна из ведущих моделей за десять секунд открыла фишинговую ссылку, достала настоящий пароль из хранилища и ввела его на поддельной странице входа.
Суть подхода
Большинство тестов показывают модели письмо и спрашивают «это фишинг?». SCAM устроен иначе: агент продолжает обычную работу, а угроза возникает в процессе. Модель должна сама заметить обман и остановиться, а не просто ответить на вопрос. Авторы добавили «скилл безопасности» — системный промпт из 35 строк, или примерно 1200 слов, который заметно снижает число опасных действий.
Почему обсуждают
На Hacker News тема набрала 4 очка и пока без комментариев — обсуждение только начинается. Кейс при этом важный: агенты получают доступ к почте, паролям и внутренним сервисам, ошибка одного вызова может привести к реальной утечке. Результаты показывают, что даже простой текстовый промпт меняет поведение модели.
Что осталось неясным
Не раскрыто, какая именно модель участвовала в демонстрации, насколько устойчив предложенный промпт к настойчивым атакам и как бенчмарк ведёт себя на других классах задач. Также нет сравнения с другими методами защиты, например с обязательными подтверждениями на стороне инструментов.
| Punkt | Detail |
|---|---|
| Автор | 1Password |
| Формат | Открытый бенчмарк и системный промпт |
| Демонстрация | Модель ввела пароль на фишинговой странице за 10 секунд |
| Защита | Промпт из 35 строк заметно снижает риск |
Источники: оригинал — https://1password.github.io/SCAM/#; проверка и контекст — https://github.blog/
