
Anthropic Frontier Red Team сообщила о первых успешных попытках двух языковых моделей выполнить полный перехват потока управления в задачах на эксплуатацию бинарных уязвимостей. В выборке из 100 заданий внутренняя оценка зафиксировала успех GLM-5.3 в 4% испытаний, а Claude Mythos Preview — в 6%.
Цифры приводит публикация Anthropic под названием «GLM-5.3 and the spread of advanced cyber capabilities», процитированная Саймоном Уиллисоном. В той же цитате сказано, что более ранние Claude Opus 4.6 и GLM-5.2 не добились ни одного успешного результата.
Это свидетельство изменения возможностей моделей внутри конкретного теста, но не доказательство того, что они способны надежно создавать готовые эксплойты для реальных систем. Бенчмарк остается внутренним, а приведенных данных недостаточно для независимого воспроизведения эксперимента.
Результаты внутренней оценки
Для проверки Anthropic использовала 100 случайно выбранных заданий из внутреннего набора Binary Exploitation. Согласно опубликованной цитате, результат засчитывался, если модель добивалась полного перехвата потока управления — full control flow hijack.
Распределение результатов выглядит так:
- Claude Mythos Preview — 6% успешных испытаний;
- GLM-5.3 — 4%;
- Claude Opus 4.6 — 0%;
- GLM-5.2 — 0%.
Если каждое процентное значение соответствует одному из 100 заданий без дополнительных повторов, речь может идти соответственно о шести и четырех успешных испытаниях. Однако из доступного фрагмента нельзя установить, проводилось ли несколько запусков для каждого задания, использовались ли одинаковые условия и как команда учитывала случайность ответов модели. Поэтому перевод процентов в точное число уникальных решенных задач остается предположением.
Frontier Red Team формулирует основной вывод осторожнее, чем заголовок о «взломе бинарников»: GLM-5.3 показала результат ниже Claude Mythos Preview, однако обе модели пересекли порог, которого предыдущие системы в этой оценке не достигали.
Что означает перехват потока управления
Перехват потока управления означает, что атакующая сторона смогла изменить предусмотренную разработчиком последовательность выполнения программы. Такой результат может быть важным этапом эксплуатации ошибки работы с памятью, но сам по себе не всегда равен полноценной атаке на реальную систему.
К этой категории могут относиться ситуации, в которых уязвимость позволяет перенаправить выполнение программы на другой адрес или подготовленную последовательность инструкций. В классификации MITRE CWE-119 ошибки ограничения операций внутри буфера памяти связываются с повреждением данных, аварийным завершением программы и возможностью выполнения несанкционированного кода.
Для практической атаки обычно имеют значение дополнительные условия: конфигурация программы, архитектура, доступные средства защиты, стабильность результата и возможность превратить лабораторный сценарий в воспроизводимую цепочку действий. В процитированном сообщении Anthropic нет данных о том, какие именно типы уязвимостей содержались в заданиях и требовалось ли моделям обходить защитные механизмы.
Поэтому корректная интерпретация результата такова: в закрытой оценке две модели иногда смогли достичь заданного технического критерия. Утверждать на основании этих процентов, что они автономно находят и эксплуатируют неизвестные уязвимости в реальных продуктах, нельзя.
Почему сравнение моделей пока ограничено
Разрыв между Claude Mythos Preview и GLM-5.3 составляет два процентных пункта. При выборке из 100 заданий и отсутствии информации о повторных запусках этого недостаточно, чтобы уверенно говорить об устойчивом превосходстве одной модели.
На результат могли повлиять особенности конкретных задач, инструменты, доступные моделям, параметры запуска и критерии, по которым исследователи подтверждали перехват управления. Не раскрыты также лимиты времени и вычислений, число попыток, формат обратной связи и степень автономности систем.
Пока опубликованное сообщение позволяет подтвердить только несколько пунктов:
- Anthropic провела внутреннюю оценку нескольких моделей;
- для нее случайно выбрали 100 заданий из закрытого набора;
- GLM-5.3 и Claude Mythos Preview получили ненулевые результаты;
- две указанные модели предыдущего поколения получили 0%;
- независимой проверки представленных процентов в доступных материалах нет.
Исследования Anthropic по возможностям и рискам моделей публикуются в отдельном разделе Anthropic Research. Общий подход компании к оценке опасных возможностей описывается в ее Responsible Scaling Policy. Эти страницы дают контекст политике Anthropic, но сами по себе не подтверждают показатели конкретного бенчмарка.
Что проверить командам безопасности
Для разработчиков защитных инструментов результат интересен прежде всего как ранний индикатор: ненулевой успех появился там, где сравниваемые предыдущие модели не показали ни одного успешного испытания. Но менять оценку угроз только на основании 4–6% во внутреннем тесте преждевременно.
Перед практическими выводами стоит проверить, опубликует ли Anthropic:
- описание выборки и уровней сложности заданий;
- правила предоставления моделям инструментов и доступа к среде;
- число попыток и разброс результатов между запусками;
- критерии подтверждения полного перехвата потока управления;
- сравнение с профильными специалистами и обычными средствами анализа;
- результаты на внешнем или воспроизводимом наборе задач.
Командам, которые уже применяют LLM в анализе уязвимостей, полезно разделять три метрики: обнаружение потенциальной ошибки, создание доказательства возможности эксплуатации и стабильное выполнение эксплойта в контролируемой среде. Опубликованный фрагмент касается последней стадии лишь в формулировке «полный перехват потока управления» и не раскрывает всю цепочку.
До появления методики разумно воспринимать результат как сигнал для наблюдения, а не как готовую оценку риска. Главные неизвестные — сложность заданий, воспроизводимость успешных попыток и способность моделей переносить такой результат из закрытого бенчмарка на незнакомое программное обеспечение.







