Коротко
AI safeguards в биологии — это не один запретительный фильтр, а система управления маршрутами. Она должна отличать обычную научную работу от запросов, способных повысить опасные возможности, и выбирать соразмерный режим ответа: стандартную модель, более ограниченный fallback, контролируемый профессиональный доступ или отказ.
Факт. Anthropic заявила, что после обновления Fable 5 число biology-related fallbacks сократилось примерно на 85% по её собственным тестам. Компания связывает изменение с classifier constitution, обновлением обучающих данных и повторным обучением классификатора. Это self-reported результат, а не независимая проверка.
Ограничение. Публичный пост не содержит полного confusion matrix: неизвестны исходные абсолютные частоты, распределение тестовых запросов, интервалы неопределённости и все показатели false positive и false negative. Поэтому цифра 85% говорит об изменении выбранной метрики, но сама по себе не доказывает, что система одновременно стала и полезнее, и безопаснее.
Интерпретация. Главный вопрос здесь не в том, должен ли AI отвечать на всё или блокировать биологию целиком. Практический вопрос звучит иначе: где провести classifier boundary, чтобы безопасный запрос редко уходил на слабый маршрут, а действительно рискованный не получал лишних возможностей.
- Fallback — не обязательно отказ: это может быть передача запроса более ограниченной модели.
- False positive ухудшает полезность и побуждает пользователей искать обходные рабочие процессы.
- False negative повышает вероятность того, что рискованный запрос попадёт в неподходящий контур.
- Capability-тесты измеряют возможности в заданных условиях, но не равны вероятности реального злоупотребления.
- Trusted access нужен там, где легитимная профессиональная работа пересекается с frontier-возможностями.
- Надёжный вывод требует независимых capability- и uplift-оценок, а также мониторинга после релиза.
Что изменила Anthropic
Согласно сообщению Anthropic об обновлении safeguards Fable 5, компания изменила три связанных компонента: classifier constitution, training data и процедуру retraining. Публичное описание не раскрывает внутренние правила или наборы данных, поэтому безопасно говорить только об общем механизме: была скорректирована граница, по которой запросы отправляются на разные маршруты.
Факт. Компания утверждает, что biology-related fallbacks в её тестах сократились примерно на 85%. В сноске она отдельно прогнозирует сокращение всех fallbacks примерно на 67% в Claude.ai, 55% в Cowork, 17% в Claude Code и 7% на Platform.
| Поверхность | Заявленное ожидаемое сокращение всех fallbacks | Как читать показатель |
|---|---|---|
| Claude.ai | Примерно 67% | Оценка компании для этой продуктовой поверхности |
| Cowork | Примерно 55% | Другой знаменатель и иной состав запросов |
| Claude Code | Примерно 17% | Нельзя напрямую сравнивать с Claude.ai как качество одного теста |
| Platform | Примерно 7% | Результат относится к отдельной поверхности использования |
| Biology-related fallbacks в тестах | Примерно 85% | Более узкая категория, не тождественная всем fallback-событиям |
Ограничение. Эти проценты имеют разные знаменатели. Biology-related fallbacks — тематический срез тестов, тогда как оценки для продуктов относятся ко всем fallbacks на конкретных поверхностях. Складывать, усреднять или ранжировать эти значения как результаты единого бенчмарка нельзя.
Факт. По описанию Anthropic, Fable продолжает направлять dual-use запросы по virology, toxicology и molecular design на Opus 5. Профессиональную работу на границе frontier biology компания связывает с trusted access. Это означает, что обновление заявлено как уточнение маршрутизации, а не как удаление защитного контура.
Редакционная рекомендация. При оценке подобных анонсов разделяйте изменение classifier boundary, изменение возможностей базовой модели и изменение продуктовой политики. Уменьшение fallback-rate может быть хорошей новостью для пользователей, но только если рискованные категории не стали чаще проходить по обычному маршруту.
Как работает fallback
Fallback полезно рассматривать как risk-based routing. Классификатор оценивает запрос не ради окончательного ответа о намерениях пользователя, а ради выбора подходящего контура обработки. Ошибка такого классификатора меняет не только формулировку ответа: она может изменить доступную пользователю модель, глубину помощи и режим контроля.
В описанном Anthropic случае отдельные dual-use запросы продолжают передаваться на Opus 5. В рамках этого разбора такой переход следует понимать как резервный, более ограниченный маршрут. Он не равен полному запрету темы: пользователь может получить ответ, но от контура с иным профилем возможностей.
Упрощённая редакционная схема, а не документация Anthropic:
- Пользователь отправляет запрос через конкретную продуктовую поверхность.
- Классификатор сопоставляет контекст с политикой и признаками риска.
- Обычный безопасный запрос остаётся на стандартном маршруте.
- Пограничный dual-use запрос переводится в более ограниченный fallback-контур.
- Легитимная frontier-работа может потребовать trusted access.
- Запрос, для которого безопасный ответ невозможен, ограничивается или отклоняется.
- Событие маршрутизации попадает в агрегированный мониторинг и последующую проверку.
Интерпретация. Такая архитектура лучше бинарной модели разрешить или запретить, потому что риск неоднороден. Обзор литературы, помощь с изложением и высокоуровневый анализ не требуют того же режима, что операционная помощь на границе возможностей. При этом конкретные опасные инструкции, последовательности, лабораторные протоколы и способы обхода классификаторов не должны становиться частью публичного тестирования или документации.
Ограничение. Публичные материалы из пакета не позволяют восстановить точное число маршрутов, порядок внутренних проверок или правила Fable 5. Схема выше объясняет принцип risk-based routing, но не претендует на описание закрытой реализации.
False positive и false negative
Чтобы обсуждать качество classifier boundary, нужно заранее определить положительный класс. В этом материале policy-positive означает запрос, который по правилам должен попасть в усиленный защитный контур. Тогда false positive — безопасный запрос, ошибочно признанный рискованным, а false negative — рискованный запрос, ошибочно оставленный на обычном маршруте.
| Исход классификации | Что произошло | Практическое последствие | Что измерять |
|---|---|---|---|
| True positive | Рискованный запрос направлен в защитный контур | Маршрут соответствует политике | Полноту обнаружения и качество безопасного ответа |
| False positive | Безопасный запрос отправлен в fallback или заблокирован | Потеря полезности, времени и доверия | FPR по доменам, продуктам, языкам и типам задач |
| True negative | Безопасный запрос обслужен обычным маршрутом | Система сохраняет полезность | Качество ответа и отсутствие скрытой деградации |
| False negative | Рискованный запрос прошёл обычным маршрутом | Возможности могли оказаться несоразмерны риску | FNR, тяжесть последствий и результаты экспертной проверки |
False positive rate можно записать как FP / (FP + TN), а false negative rate — как FN / (FN + TP). Но одних долей недостаточно. Если тестовый набор не похож на реальный поток, метрика будет точно описывать искусственную выборку и плохо — эксплуатацию.
Интерпретация. Снижение ложных блокировок важно не только для удобства. Слишком грубая защита затрудняет нормальную работу, скрывает различия между безопасными и пограничными сценариями и снижает диагностическую ценность жалоб. Но оптимизировать только FPR опасно: classifier boundary можно сделать почти незаметной, просто пропуская больше запросов.
Редакционная рекомендация. Публиковать нужно пару показателей, а не один победный процент: FPR и FNR, абсолютные частоты, разрезы по сценариям и оценку тяжести ошибок. Если раскрытие деталей создаёт риск обхода, достаточно агрегированных значений, описания методологии и независимой проверки в закрытой среде.
Почему граница в биологии труднее
Биологическая тематика плохо укладывается в словарный фильтр. Одинаковые термины могут встречаться в образовании, анализе публикаций, рутинной профессиональной работе и dual-use контексте. Следовательно, классификатору недостаточно обнаружить название области: ему приходится учитывать цель, уровень операционности, последовательность диалога и запрашиваемую степень оптимизации.
Есть и проблема скрытого контекста. Один короткий вопрос может выглядеть безобидно, но быть частью более длинной цепочки. Обратная ситуация тоже распространена на уровне логики классификации: сложный профессиональный язык сам по себе не доказывает опасного намерения. Поэтому рост чувствительности без качественного контекста быстро повышает число false positives.
Интерпретация. Граница должна проходить не между биологией и не-биологией, а между классами помощи. Высокоуровневое объяснение, безопасная редактура и работа с общедоступными концепциями отличаются от инструктивной поддержки, которая способна заметно увеличить практическую результативность пользователя.
Ограничение. Намерение нельзя надёжно вывести только из текста. Профессиональная принадлежность также не делает любой запрос безопасным. Именно поэтому для части задач нужен отдельный режим доступа, а для оценки риска — не только анализ единичного промпта, но и контролируемая проверка поведения системы.
Редакционная рекомендация. Не использовать списки терминов как основной барьер. Они могут быть одним из сигналов, но решение о маршруте должно опираться на контекст и потенциальный uplift. Публичное объяснение при этом не должно раскрывать признаки в форме, пригодной для обхода защиты.
Что означают заявленные 85%
Фраза о сокращении biology-related fallbacks примерно на 85% описывает относительное изменение выбранного счётчика в тестах Anthropic. В общем виде относительное сокращение рассчитывается как (исходное значение − новое значение) / исходное значение. Без исходного значения нельзя восстановить абсолютную долю запросов, которые раньше или теперь уходят в fallback.
Факт. Источник атрибутирует результат тестам самой компании. В пакете нет независимого воспроизведения этой оценки.
Что показатель может означать. После обновления классификатор значительно реже отправлял тестовые биологические запросы на fallback-маршрут. Если набор репрезентативен, это может указывать на уменьшение избыточных срабатываний.
Чего показатель не доказывает. Он не показывает, сколько рискованных запросов стало проходить дальше, не измеряет качество ответов после маршрутизации и не подтверждает безопасность реального использования. Он также не означает, что false positive rate упал ровно на 85%: для такого вывода нужно знать разметку истинных классов и знаменатель метрики.
Почему продуктовые проценты различаются. Claude.ai, Cowork, Claude Code и Platform обслуживают разные потоки запросов. Anthropic приводит для них отдельные ожидаемые сокращения всех fallbacks. Пакет не раскрывает состав этих потоков, поэтому объяснять различия конкретным поведением пользователей было бы домыслом.
Редакционная рекомендация. В заголовках и отчётах формулировать результат полностью: Anthropic заявила о примерно 85-процентном сокращении biology-related fallbacks по собственным тестам. Не сокращать это до утверждений вроде безопасность выросла на 85% или ложные блокировки устранены.
Чего публичных данных не хватает
Публичный пост полезен как сообщение об изменении механизма, но недостаточен для аудита. Главный пробел — отсутствие полного confusion matrix. Без него нельзя одновременно увидеть true positives, false positives, true negatives и false negatives.
Для проверяемой оценки также нужны сведения о том, как формировалась тестовая выборка, кто размечал пограничные случаи, как устранялись разногласия экспертов и насколько набор похож на реальные запросы. Публиковать сами опасные задания не обязательно: методологию и агрегированные результаты можно раскрывать отдельно от чувствительного содержимого.
- Исходная и новая абсолютная частота biology-related fallbacks.
- FPR и FNR при одном и том же policy threshold.
- Распределение ошибок по безопасным, пограничным и явно рискованным сценариям.
- Разрезы по продуктовым поверхностям без смешивания знаменателей.
- Устойчивость результата к переформулировкам и длинному контексту.
- Качество ответа после fallback, а не только факт маршрутизации.
- Доля случаев, по которым эксперты не пришли к единой разметке.
- Независимое воспроизведение capability- и uplift-оценок.
- Результаты мониторинга после релиза.
Факт. Anthropic Transparency Hub предоставляет официальные summaries safety evals. Такие материалы важны для подотчётности, но остаются публикациями самой компании. Их нельзя автоматически считать независимой валидацией.
Редакционная рекомендация. Независимым оценщикам можно передавать чувствительные задания в защищённой среде, а публично выпускать структуру выборки, правила подсчёта, агрегированные ошибки и описание ограничений. Это позволяет проверить вывод, не превращая benchmark в сборник опасных подсказок.
Capability, uplift и реальный риск
UK AISI в Frontier AI Trends Report сообщает о росте результатов frontier-моделей в оценках по biology и chemistry. Это независимый от заявления Anthropic контекст: возможности моделей в тестовых условиях меняются, поэтому classifier boundary нельзя настраивать один раз и считать завершённой.
Однако capability score не равен реальному злоупотреблению. Он показывает результат модели на определённой задаче при заданных условиях. На итог влияют scaffolding, доступные инструменты, формат подсказок, ресурсы и участие человека. Изменение любого из этих элементов может изменить измеряемую результативность без изменения базовой модели.
| Уровень оценки | Вопрос | Что можно заключить | Чего заключать нельзя |
|---|---|---|---|
| Capability | Может ли модель выполнить заданную тестовую работу? | Каков результат в конкретной конфигурации eval | Что злоупотребление обязательно произойдёт |
| Uplift | Насколько AI улучшает результат относительно выбранной контрольной точки? | Есть ли добавочная помощь в заданных условиях | Что эффект одинаков для всех пользователей и сред |
| Routing | На какой контур попадает запрос? | Как classifier реализует политику доступа | Что сам маршрут гарантирует безопасный итог |
| Реальный риск | Как capability, доступ, человек и среда соединяются в практике? | Требуется комплексная оценка сценария | Что один benchmark исчерпывает вероятность и последствия |
Uplift полезнее чистого capability там, где важно понять добавочную ценность AI. Модель может хорошо отвечать на тест, но почти не помогать опытному специалисту; или, наоборот, заметно повышать результат менее подготовленного пользователя. Конкретная контрольная группа и условия сравнения должны быть описаны, иначе слово uplift остаётся неопределённым.
Рабочая работа RAND о benchmarking LLMs for biological risks включена в пакет как источник об ограничениях bio-benchmarks и оценке отказов. Это важно для дизайна тестов: высокий refusal-rate не доказывает безопасность, если модель отказывает безопасным пользователям, а низкий refusal-rate не доказывает полезность, если опасные запросы получают чрезмерную помощь.
Редакционная рекомендация. Отчёт должен разделять capability, uplift, routing accuracy и наблюдаемые инциденты. Сведение этих уровней в один safety score скрывает причинный механизм и мешает понять, что именно улучшилось.
Trusted access
Факт. В материалах о Claude Fable 5 и Claude Mythos 5 Anthropic связывает профессиональную frontier biology с trusted access. Пакет не раскрывает полный дизайн этой системы, поэтому нельзя приписывать ей конкретные проверки или гарантии.
На уровне архитектуры trusted access решает задачу, с которой плохо справляется единый публичный classifier. Легитимному специалисту иногда нужна более широкая функциональность, но сам профессиональный словарь не является достаточным доказательством безопасного контекста. Контролируемый режим позволяет учитывать не только текст запроса, но и условия доступа.
Интерпретация. Trusted access — не белый список людей, которым разрешено всё. Это отдельный контур ответственности, где расширенные возможности сочетаются с проверяемой целью, ограниченным объёмом доступа, журналированием и возможностью пересмотра решения.
Редакционная рекомендация для проектирования такого контура:
- фиксировать назначение доступа и допустимые классы задач;
- применять минимально необходимые права вместо полного снятия safeguards;
- разделять одобрение пользователя и одобрение конкретной высокорисковой функции;
- ограничивать срок действия расширенного доступа;
- вести защищённые журналы событий с контролем доступа к ним;
- предусматривать экспертный пересмотр спорных решений;
- иметь процедуру приостановки доступа и реагирования на инцидент;
- не публиковать детали, которые помогут внешнему пользователю имитировать доверенный контекст.
Ограничение. Даже проверенный пользователь может ошибиться, а легитимный проект — измениться. Поэтому trusted access не заменяет модельные safeguards, оценку uplift и мониторинг. Он добавляет слой управления, а не отменяет остальные.
Как измерять полезность без утечки опасных знаний
Проверка biology safeguards сталкивается с конфликтом прозрачности. Для научной воспроизводимости хочется показать задания и ответы, но публикация операционных примеров может сама увеличить доступность опасных знаний или раскрыть classifier boundary. Решение — разделить публичную отчётность и закрытую оценочную среду.
Факт. AISI Research Agenda включена в пакет как источник о науке измерений и ограничениях оценок. Google DeepMind описывает альтернативную рамку bioresilience через threat, evaluation, mitigation и monitoring. Эти источники поддерживают многоступенчатый подход, а не зависимость от одного публичного benchmark.
Практический чек-лист безопасной оценки:
- До запуска зафиксировать policy-positive класс и правила маршрутизации.
- Разделить безопасные, пограничные и рискованные категории, не публикуя чувствительные задания.
- Использовать независимую экспертную разметку и документировать разногласия.
- Считать полный confusion matrix, а не только общий fallback-rate.
- Показывать абсолютные значения вместе с относительными изменениями.
- Не смешивать Claude.ai, Cowork, Claude Code и Platform в одном знаменателе.
- Оценивать качество ответа после fallback, а не только сам факт переключения.
- Проверять длинный контекст и безопасные переформулировки без публикации обходных техник.
- Измерять capability отдельно от uplift относительно явно заданной контрольной точки.
- Фиксировать модель, scaffolding, инструменты, роль человека и условия доступа.
- Проводить чувствительные evals в контролируемой среде с ограниченным доступом.
- Публиковать агрегированные результаты, методологию и ограничения вместо опасных примеров.
- Организовать независимое воспроизведение хотя бы ключевых выводов.
- Повторять оценку после изменения модели, classifier constitution, данных или продукта.
- Связывать предрелизные тесты с мониторингом и разбором ошибок после релиза.
Редакционная рекомендация. Безопасная прозрачность должна позволять проверить утверждение, но не воспроизводить опасную возможность. Хороший отчёт отвечает на вопросы о выборке, знаменателях, ошибках и независимости проверки; ему не требуется публиковать лабораторные протоколы, патогенные последовательности, оптимизацию токсичности или инструкции по обходу classifiers.
Контур мониторинга после релиза
Предрелизный benchmark неизбежно ограничен. Реальный поток содержит новые формулировки, более длинные диалоги и иное соотношение типов задач. Поэтому обновление classifier boundary должно рассматриваться как проверяемая гипотеза: ложных блокировок станет меньше, а частота и тяжесть опасных пропусков не вырастут.
Мониторинг не должен сводиться к общему числу отказов. Падение fallback-rate может означать улучшение точности, изменение пользовательского потока, поломку классификатора или перенос решений на другой слой. Нужны связанные показатели.
| Сигнал | Зачем следить | Безопасный способ отчётности |
|---|---|---|
| Fallback-rate по поверхности | Увидеть сдвиг маршрутизации без смешивания знаменателей | Агрегированные временные ряды |
| Подтверждённые false positives | Оценить потери полезности | Доли по широким категориям без публикации чувствительных запросов |
| Подтверждённые false negatives | Выявить опасные пропуски | Закрытый разбор и публичная сводка тяжести |
| Качество fallback-ответа | Проверить, остаётся ли маршрут полезным | Оценки безопасных контрольных задач |
| Жалобы и пересмотры | Найти систематические ошибки границы | Статистика решений без раскрытия персональных данных |
| Сдвиг capability и uplift | Понять, не устарели ли прежние пороги | Периодические контролируемые evals |
Интерпретация. Самый полезный сигнал — не отдельная метрика, а расхождение между ними. Например, резкое падение fallback-rate при одновременном росте подтверждённых false negatives требует расследования. Рост жалоб при стабильной безопасности может указывать на чрезмерно широкую boundary или низкое качество резервной модели.
Редакционная рекомендация. Заранее установить условия остановки или отката обновления, владельца решения и порядок экспертного разбора. Конкретные пороги должны зависеть от внутренней модели риска; пакет не содержит чисел, которые можно было бы универсально рекомендовать.
В публичной отчётности полезно отделять аномалию, подтверждённую ошибку и инцидент. Не каждое срабатывание является ошибкой, и не каждая ошибка приводит к ущербу. Такое разделение уменьшает и рекламное преувеличение успехов, и апокалиптическое толкование любого сбоя.
Рекомендации для лабораторий
Лаборатории и исследовательские организации не должны выбирать между полным запретом AI и неконтролируемым доступом. Практичнее определить классы задач, режимы данных и уровни проверки. Это особенно важно, если сотрудники используют несколько продуктовых поверхностей с разной маршрутизацией.
- Составьте карту сценариев. Отделите редактуру, поиск по разрешённым материалам и высокоуровневый анализ от задач, способных дать значимый операционный uplift.
- Зафиксируйте разрешённые контуры. Укажите, какие продукты и режимы допустимы для каждого класса задач, не предполагая, что одинаковый бренд означает одинаковый fallback.
- Не используйте fallback-rate как аттестацию безопасности. Требуйте данные об ошибках маршрутизации и качестве ответов.
- Ограничьте чувствительные данные. Не передавайте в публичные интерфейсы закрытые материалы только потому, что запрос выглядит научным.
- Назначьте владельца исключений. Решения о trusted access должны быть пересматриваемыми и иметь ответственного.
- Разделите доступ и одобрение результата. Возможность использовать модель не означает, что её вывод можно применять без профессиональной проверки.
- Ведите журнал проблем. Фиксируйте ложные блокировки и подозрительные пропуски без накопления опасного контента в незащищённых системах.
- Проверяйте обновления. Изменение classifier constitution или маршрута способно повлиять на воспроизводимость рабочего процесса.
- Обучайте сотрудников эскалации. Они должны понимать, куда сообщать о неверном fallback, а не пытаться обходить классификатор.
- Согласуйте критерии закупки. Запрашивайте методологию evals, раздельные знаменатели, независимую проверку и план мониторинга.
Интерпретация. Для лаборатории полезность safeguards определяется не минимальным числом отказов, а предсказуемостью. Сотрудник должен понимать, какой класс задачи обслуживается, почему возможен другой маршрут и как легитимно запросить пересмотр.
Ограничение. Эти рекомендации — редакционная рамка управления, а не описание конкретной реализации Anthropic и не замена локальным правилам организации. Пакет источников не содержит универсальной процедуры аккредитации trusted access.
Что нас ждёт
Интерпретация, а не подтверждённый прогноз. По мере роста результатов frontier-моделей в capability-evals значение classifier boundary будет увеличиваться. Один и тот же пропуск может иметь разные последствия у моделей с разным уровнем возможностей, поэтому прежние пороги придётся перепроверять после обновлений.
Вероятно усиление многоуровневой архитектуры: общий публичный маршрут, ограниченный fallback, trusted access и отдельные режимы для чувствительных оценок. Это логическое продолжение risk-based routing, но пакет не подтверждает конкретные будущие продукты или сроки.
В отчётности центр внимания должен смещаться от числа отказов к совместной оценке FPR, FNR, capability и uplift. Self-reported показатели останутся полезными как первичная информация, однако значимые заявления потребуют внешней проверки и ясного описания условий теста.
Ещё одно направление — безопасная стандартизация evals. Полная открытость опасных заданий неприемлема, а полностью закрытый benchmark трудно проверить. Компромисс состоит в независимом доступе к защищённой оценочной среде, публичной методологии и агрегированных результатах.
Редакционная рекомендация. Судить о следующем обновлении не по тому, стало ли блокировок меньше, а по четырём вопросам: сохранилась ли полезность, не выросли ли опасные пропуски, воспроизводимы ли capability- и uplift-выводы, работает ли мониторинг после релиза.
Ограничения
Фактологический срез материала — 27 августа 2026 года. Статья использует только сведения и URL из переданного пакета. Она не дополняет публичные анонсы неподтверждёнными деталями внутренней архитектуры.
Цифры 85%, 67%, 55%, 17% и 7% являются заявлениями Anthropic и относятся к разным тестовым или продуктовым знаменателям. В пакете нет полного confusion matrix и независимой валидации обновления Fable 5.
Сообщение UK AISI о росте результатов frontier-моделей в biology и chemistry описывает capability-evaluations. Из него нельзя напрямую вывести вероятность реального злоупотребления: результат зависит от scaffolding, доступа, роли человека и условий теста.
Предложенные схемы risk-based routing, мониторинга и trusted access являются редакционной интерпретацией и рекомендациями. Они не выдаются за точную документацию Anthropic, Google DeepMind, AISI или RAND.
Материал намеренно не содержит лабораторных протоколов, патогенных последовательностей, способов оптимизации токсичности, exploit chain или инструкций по обходу classifiers. Это ограничивает техническую детализацию, но не мешает оценивать методологию, метрики и управление риском.
FAQ
Что такое biology-related fallback?
Это маршрутизация биологического запроса на резервный, более ограниченный контур вместо обычного пути. Fallback не обязательно означает полный отказ отвечать.
Доказывает ли сокращение fallbacks на 85%, что система стала безопаснее?
Нет. Anthropic сообщила о сокращении по собственным тестам, но без полного confusion matrix нельзя установить, как изменились false positives и false negatives.
Почему нельзя сравнивать 67%, 55%, 17% и 7% напрямую?
Оценки относятся к Claude.ai, Cowork, Claude Code и Platform — разным продуктовым поверхностям с разными знаменателями и потоками запросов.
Чем false positive отличается от false negative?
False positive отправляет безопасный запрос в защитный контур, а false negative оставляет рискованный запрос на обычном маршруте. Первый снижает полезность, второй способен повысить риск.
Что измеряет capability-eval?
Он измеряет результат модели на заданных задачах и в заданной конфигурации. Это не прямая оценка вероятности реального злоупотребления.
Зачем измерять uplift?
Uplift показывает добавочную помощь AI относительно явно выбранной контрольной точки. Он помогает отличить абстрактную способность модели от практического улучшения результата пользователя.
Что такое trusted access?
Это контролируемый режим для легитимной профессиональной работы на границе возможностей. Он должен дополнять safeguards проверяемыми условиями доступа, а не отменять ограничения целиком.
Как независимо проверить safeguards, не публикуя опасные задания?
Проводить чувствительные evals в защищённой среде, допускать независимых оценщиков и публиковать методологию, агрегированный confusion matrix и ограничения без опасного содержимого.
Источники
- Improving Fable 5’s biology safeguards — подтверждает заявленный механизм classifier constitution, обновление training data, retraining и проценты сокращения fallbacks.
- Claude Fable 5 and Claude Mythos 5 — подтверждает контекст capabilities, classifiers, маршрутизации dual-use запросов и trusted access.
- Anthropic Responsible Scaling Policy — источник о risk governance и использовании порогов в управлении масштабированием.
- Anthropic Transparency Hub — подтверждает наличие официальных summaries safety evals; это источник самой компании, а не независимая проверка.
- Frontier AI Trends Report — подтверждает внешний контекст роста результатов frontier-моделей в biology и chemistry capability-evaluations.
- AISI Research Agenda — источник об ограничениях оценок и задачах науки измерений.
- Google DeepMind approach to bioresilience — подтверждает альтернативную рамку threat, evaluation, mitigation и monitoring.
- RAND — Benchmarking LLMs for Biological Risks — источник об ограничениях биологических benchmarks и оценке отказов моделей.
