21 мая 2024 года Anthropic опубликовала работу Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet на Transformer Circuits. В самой работе отдельно уточняется, что анализировалась именно Claude 3.0 Sonnet, выпущенная 4 марта 2024 года, то есть не абстрактная исследовательская модель, а продакшен-версия семейства Claude 3.
Идея исследования проста по формулировке и сложна по исполнению: можно ли разложить внутренние активации большой языковой модели на разреженный набор признаков, которые человек способен интерпретировать и которыми можно причинно влиять на поведение модели. Для практиков это полезный разбор того, где сегодня реально находится механистическая интерпретируемость (mechanistic interpretability): уже не на игрушечных моделях, но еще и не на уровне полного понимания LLM.
Коротко
- Anthropic масштабировала подход из работы Towards Monosemanticity 2023 года с маленькой модели на Claude 3.0 Sonnet.
- Техническое ядро метода — sparse autoencoder (SAE), обучаемый на активациях residual stream в среднем слое модели.
- По данным самой работы, авторы обучили три SAE размером примерно 1M, 4M и 34M признаков и показали, что сильные активации многих признаков выглядят семантически осмысленными.
- Главный результат не в красивых картинках, а в том, что часть признаков удается каузально проверять: их подавление или усиление предсказуемо меняет ответы модели.
- Но это не «карта всего Claude»: авторы прямо пишут о неполноте набора признаков, отсутствии строгой метрики верности и проблеме cross-layer superposition.
Контекст: зачем вообще искать моносемантические признаки
Классическая проблема интерпретации нейросетей состоит в том, что отдельный нейрон редко отвечает за один чистый смысл. Один и тот же нейрон может срабатывать и на синтаксис, и на географию, и на фрагменты кода. Это свойство обычно называют polysemanticity. Если смотреть на модель по отдельным нейронам, внутренняя логика быстро превращается в шум.
Отсюда возникает идея искать не нейроны, а более удобные единицы анализа — признаки, собранные из нескольких направлений в пространстве активаций. В октябре 2023 года Anthropic опубликовала Towards Monosemanticity: Decomposing Language Models With Dictionary Learning и показала на очень маленьком однослойном трансформере, что такой подход может извлекать осмысленные признаки вроде арабского письма, ДНК-последовательностей или аргументов Python-функций.
Но между игрушечной моделью и Claude 3 Sonnet — пропасть. В майском тексте Mapping the mind of a large language model Anthropic прямо пишет, что пришлось масштабировать метод на много порядков и решить и инженерный, и научный риск: крупные модели не обязаны разлагаться так же аккуратно, как маленькие. Поэтому исторический смысл Scaling Monosemanticity не в том, что авторы нашли еще одну коллекцию интересных фич, а в том, что они проверили саму масштабируемость подхода.
Важно и то, что Claude 3 Sonnet на момент исследования уже была мультимодальной моделью семейства Claude 3. Это означает, что работа исследует не академический прототип, а систему, близкую к реальному продакшен-использованию.
Метод: что именно сделали авторы
Базовая техника называется разреженный автоэнкодер (sparse autoencoder, SAE). Если сильно упростить, авторы берут внутренний вектор активаций модели в одной точке сети и пытаются представить его как сумму небольшого числа «скрытых признаков» из очень большого словаря.
Схема такая:
- Берется активация residual stream в среднем слое Claude 3.0 Sonnet.
- Эта активация нормализуется и подается в SAE.
- Энкодер переводит плотный вектор в огромное пространство потенциальных признаков.
- Штраф за разреженность заставляет модель активировать лишь малую долю признаков на каждом токене.
- Декодер восстанавливает исходную активацию; обучение минимизирует ошибку реконструкции и одновременно поощряет sparsity.
Почему выбран именно residual stream и именно средний слой? Авторы приводят две практические причины. Во-первых, это дешевле вычислительно, чем работа с MLP-активациями. Во-вторых, так можно частично обойти проблему, которую они называют cross-layer superposition: признаки в большой модели могут быть «размазаны» по нескольким слоям, а residual stream уже суммирует вклад предыдущих вычислений.
Еще один важный слой методологии — использование scaling laws не для самой LLM, а для SAE. Авторы сначала исследуют, как потери ведут себя при разных бюджетах вычислений, числе признаков и числе шагов обучения, а затем подбирают крупные запуски через эту зависимость. Иначе говоря, они не просто обучили огромный автоэнкодер, а попытались сделать это compute-aware способом.
Наконец, интерпретируемость проверяется не только визуально. В работе есть несколько режимов проверки:
- специфичность — насколько действительно присутствует предполагаемый смысл в текстах, где срабатывает признак;
- влияние на поведение — меняется ли ответ модели предсказуемо, если признак зажать, усилить или обнулить;
- сравнение с нейронами — дает ли SAE более осмысленные единицы анализа, чем исходные нейроны.
Результаты: что получилось у Anthropic
Ключевой эмпирический факт звучит так: подход не развалился при переносе на большую модель. В paper и майском сопроводительном тексте Anthropic сообщает, что из Claude Sonnet удалось извлечь миллионы признаков, многие из которых выглядят осмысленно и достаточно специфично.
Ниже — основные диагностические числа по данным самой работы. Это не независимая валидация, а те метрики, которые сообщает сама Anthropic для трех SAE.
| Запуск SAE | Число признаков | Среднее число активных признаков на токен | Объясненная дисперсия активаций | Доля dead features |
|---|---|---|---|---|
| Малый | 1,048,576 | < 300 | ≥ 65% | около 2% |
| Средний | 4,194,304 | < 300 | ≥ 65% | около 35% |
| Крупный | 33,554,432 | < 300 | ≥ 65% | около 65% |
Что означают эти числа practically? С одной стороны, даже огромный словарь признаков не делает представление «густым»: на конкретном токене активируется небольшая доля фич. С другой стороны, самая большая модель SAE страдает от большого числа мертвых признаков, и это уже сигнал о технических ограничениях обучения.
Содержательно авторы показывают несколько классов интересных фич:
- конкретные сущности и места — например, признак Golden Gate Bridge;
- тематические области — например, brain sciences;
- инфраструктура и достопримечательности;
- абстрактные признаки — ошибки в коде, сарказм, лесть, скрытность, обман, опасный контент.
Особенно важно, что часть признаков оказывается мультиязычной и мультимодальной. Авторы подчеркивают: SAE обучался на текстовом датасете, но некоторые признаки при этом срабатывают и на изображениях, согласуясь с мультимодальной природой Claude 3. Это не доказывает «единый язык мышления» само по себе, но показывает, что во внутреннем представлении модели есть по крайней мере частично общие концептуальные направления.
Еще один сильный результат — каузальные интервенции. В работе показано, что если искусственно усилить или подавить некоторые признаки, модель начинает вести себя в соответствии с интерпретацией этих признаков. Самый известный пример — усиление признака Golden Gate Bridge, после чего Claude начинает тематически смещать ответ и даже ассоциировать себя с мостом. Есть и более важные для безопасности кейсы: признаки scam emails, sycophantic praise, secrecy and discreteness, dangerous biological content.
Отдельный полезный результат для исследователей интерпретируемости — сравнение с нейронами. По данным самой работы, в случайной подвыборке 1M SAE для 82% признаков наиболее коррелированный нейрон имел корреляцию не выше 0.3. Авторы также пишут, что случайная выборка SAE-признаков в среднем выглядела интерпретируемее и специфичнее, чем случайная выборка MLP-нейронов.
Есть и более тонкое наблюдение: покрытие понятий растет вместе с размером словаря, но не становится полным. В самой статье авторы приводят пример с районами Лондона: даже в 34M SAE они нашли признаки лишь примерно для 60% boroughs, хотя сама Claude умеет перечислять их гораздо лучше. Это хороший индикатор того, что словарь фич пока описывает только часть внутренней географии модели.
Интерпретация: почему эта работа важна
Наш комментарий
Главный вклад Scaling Monosemanticity не стоит сводить к набору красивых демо. Работа делает три более фундаментальные вещи.
Во-первых, она меняет масштаб разговора. После этой публикации стало труднее утверждать, что интерпретируемые фичи — это артефакт маленьких моделей или игрушечных задач. Anthropic показала, что словарь признаков можно строить и на продакшен-LLM, пусть дорого и неполно.
Во-вторых, работа предлагает более пригодную единицу анализа, чем отдельный нейрон. Для инженера по безопасности это важно: если вы хотите мониторить опасные режимы, искать следы sycophancy, bias или jailbreak-переходов, вам нужны не миллиарды нейронов, а более компактные, семантически читаемые объекты.
В-третьих, это исследование стало фундаментом для следующего шага Anthropic. В более поздней работе Tracing the thoughts of a large language model, опубликованной 27 марта 2025 года, компания уже не просто ищет признаки, а пытается связывать их в вычислительные цепочки и прослеживать промежуточные шаги рассуждения внутри Claude. То есть майский paper 2024 года — это не тупиковая ветка, а первый слой более широкой «микроскопной» программы.
Но здесь важно не перепродать вывод. Работа не показывает, что мы уже умеем читать мысли Claude или надежно аудировать все опасные состояния модели. Скорее она показывает, что у нас появилась рабочая, хотя и грубая, ручка для доступа к внутренним представлениям.
Ограничения и критика
Сильная сторона этой работы в том, что авторы довольно честно описывают ограничения. Для практического чтения их стоит держать в голове не меньше, чем сами демо.
- Неполнота словаря. В абстракте paper прямо сказано, что набор признаков неполон. Пример с лондонскими boroughs показывает это очень наглядно: даже крупный SAE покрывает лишь часть понятий, которыми модель явно владеет.
- Нет строгой метрики верности. Авторы признают, что у них нет строгого способа доказать, что извлеченные признаки faithfully capture model computations. Интерпретируемость здесь правдоподобна, но не окончательно верифицирована.
- Одна точка среза вместо всей модели. Анализируется только residual stream среднего слоя. Это разумный инженерный компромисс, но не полная механистическая картина.
- Cross-layer superposition остается открытой проблемой. Если признак распределен по нескольким слоям, SAE на одном слое может видеть лишь проекцию, а не полный механизм.
- Дороговизна. В майском тексте Anthropic пишет, что полный набор признаков текущими методами был бы вычислительно слишком дорог и мог бы потребовать больше вычислений, чем обучение самой модели. Для индустриального мониторинга это пока серьезный барьер.
- Много dead features в крупном запуске. По данным самой работы, у 34M SAE доля неактивных признаков велика. Это не обнуляет результат, но показывает, что масштабирование SAE в 2024 году было технически шероховатым.
- Интервенции не равны естественному поведению. Если принудительно зажать опасную фичу и получить токсичный или мошеннический ответ, это не значит, что модель сама часто входит в это состояние. Авторы сами отдельно предупреждают против такого переобобщения.
- Закрытость исходной модели. Claude 3 Sonnet — проприетарная система; в работе не раскрывается размер модели, у некоторых графиков скрыты единицы измерения, используется упрощенный токенизатор. Это ограничивает внешнюю воспроизводимость.
Если суммировать критику в одной фразе: Anthropic убедительно показала, что у больших LLM есть интерпретируемые направления, но пока не доказала, что найденный словарь является ни полным, ни окончательно верным описанием вычислений модели.
Вывод
Scaling Monosemanticity — важная работа не потому, что она «объяснила Claude», а потому, что впервые показала жизнеспособность feature-based интерпретируемости на современной продакшен-модели. Это аккуратный, технически содержательный шаг от красивой теории superposition к инструментам, которыми действительно можно трогать внутренние состояния LLM.
Если вы занимаетесь безопасностью, интерпретируемостью или внутренним мониторингом моделей, главный takeaway такой: у больших LLM уже есть частично читаемый внутренний слой представлений, но путь от частично читаемого слоя к надежному аудиту поведения все еще длинный.
Источники
- Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet — основной paper с методом, числами и ограничениями.
- Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet — arXiv HTML — архивная публичная версия с датой исходного текста и авторским абстрактом.
- Mapping the mind of a large language model — сопроводительный текст Anthropic о целях, масштабе и историческом контексте работы.
- The engineering challenges of scaling interpretability — инженерный контекст масштабирования интерпретируемости на Claude 3 Sonnet.
- Towards Monosemanticity: Decomposing Language Models With Dictionary Learning — исходная работа 2023 года, на которой строится paper 2024 года.
- Circuits Updates – April 2024 — технические детали о тренировке SAE и scaling laws перед запуском на Sonnet.
- Introducing the next generation of Claude — дата релиза Claude 3 и продуктовый контекст Claude 3 Sonnet.
- Tracing the thoughts of a large language model — более поздняя работа Anthropic, показывающая, как линия feature-based интерпретируемости развивалась дальше.
FAQ
Что такое monosemanticity в контексте LLM?
Это идея, что можно найти такие внутренние признаки модели, которые в основном соответствуют одному связному смыслу, а не множеству несвязанных паттернов сразу.
Почему Anthropic обучала SAE только на среднем слое?
Потому что это дешевле вычислительно и частично смягчает проблему cross-layer superposition. Но это же ограничивает полноту анализа.
Доказывает ли работа, что Claude «думает понятиями»?
Она показывает, что во внутренних активациях можно найти интерпретируемые направления, которые коррелируют с понятиями и иногда причинно влияют на ответ. Но это еще не полная теория мышления модели.
Зачем это нужно для безопасности?
Если опасные режимы вроде лести, манипуляции или опасного контента локализуются в читаемых признаках, появляется шанс их мониторить, диагностировать и, возможно, ослаблять. В 2024 году это скорее исследовательская перспектива, чем готовый guardrail.
