Запись архива

1Password представила бенчмарк SCAM: ИИ-агенты попадаются на фишинг

Бенчмарк 1Password SCAM проверяет, как ИИ-агенты ведут себя при фишинге во время обычных задач. В демонстрации модель ввела пароль на поддельной странице. Простой системный промпт снижает риск.

Редакционная обложка COMRAD404: 1Password представила бенчмарк SCAM: ИИ-агенты попадаются на фишинг
Редакционная обложка COMRAD404: 1Password представила бенчмарк SCAM: ИИ-агенты попадаются на фишинг
Редакционная тематическая обложка COMRAD404

Что произошло

1Password опубликовала SCAM — открытый бенчмарк, который проверяет, насколько ИИ-агенты устойчивы к обману при выполнении многошаговых рабочих задач. В демонстрации одна из ведущих моделей за десять секунд открыла фишинговую ссылку, достала настоящий пароль из хранилища и ввела его на поддельной странице входа.

Суть подхода

Большинство тестов показывают модели письмо и спрашивают «это фишинг?». SCAM устроен иначе: агент продолжает обычную работу, а угроза возникает в процессе. Модель должна сама заметить обман и остановиться, а не просто ответить на вопрос. Авторы добавили «скилл безопасности» — системный промпт из 35 строк, или примерно 1200 слов, который заметно снижает число опасных действий.

Почему обсуждают

На Hacker News тема набрала 4 очка и пока без комментариев — обсуждение только начинается. Кейс при этом важный: агенты получают доступ к почте, паролям и внутренним сервисам, ошибка одного вызова может привести к реальной утечке. Результаты показывают, что даже простой текстовый промпт меняет поведение модели.

Что осталось неясным

Не раскрыто, какая именно модель участвовала в демонстрации, насколько устойчив предложенный промпт к настойчивым атакам и как бенчмарк ведёт себя на других классах задач. Также нет сравнения с другими методами защиты, например с обязательными подтверждениями на стороне инструментов.

Punkt Detail
Автор 1Password
Формат Открытый бенчмарк и системный промпт
Демонстрация Модель ввела пароль на фишинговой странице за 10 секунд
Защита Промпт из 35 строк заметно снижает риск

Источники: оригинал — https://1password.github.io/SCAM/#; проверка и контекст — https://github.blog/