Запись архива

Circuit tracing: как Anthropic пытается проследить «мысли» модели

Anthropic в марте 2025 показала circuit tracing — способ собирать граф внутренних вычислений LLM. Разбираем, как работают attribution graphs, что они реально доказывают и где метод пока ломается.

Схема circuit tracing: входные токены, интерпретируемые признаки, supernodes и стрелки влияния к выходному токену в локальном графе модели

27 марта 2025 года Anthropic выпустила связанный пакет по интерпретируемости: обзорный текст Tracing the thoughts of a large language model и две технические работы — Circuit Tracing: Revealing Computational Graphs in Language Models и On the Biology of a Large Language Model. Их общий тезис простой: если sparse features уже помогают увидеть, какие интерпретируемые признаки есть внутри модели, то circuit tracing нужен, чтобы понять, как эти признаки взаимодействуют на конкретном промпте и приводят к конкретному токену ответа.

Прикладная часть сфокусирована на Claude 3.5 Haiku; сама biology-работа описывает его как модель, выпущенную в октябре 2024 года, а Anthropic отдельно анонсировала Claude 3.5 Haiku в октябре 2024-го. Для практиков это важно не из-за красивой метафоры про «чтение мыслей», а потому что метод обещает более строгий путь от гипотезы о внутреннем механизме к проверке через интервенции — особенно в задачах безопасности, где вывода по одному лишь ответу модели часто недостаточно.

Коротко

  • Circuit tracing не читает chain-of-thought модели как готовое объяснение, а строит attribution graph — локальный граф влияний между интерпретируемыми признаками, токенами и выходом.
  • Ключевой строительный блок метода — cross-layer transcoder: заменяющая модель, которая аппроксимирует MLP-части трансформера через разреженные признаки и позволяет отслеживать их вклад по слоям.
  • В кейсах на Claude 3.5 Haiku Anthropic показывает внутренние промежуточные шаги, планирование рифмы заранее, смесь языково-специфических и языково-независимых цепочек, механизмы отказа и случаи неfaithful chain-of-thought.
  • Сильная сторона подхода — цикл «граф → интерпретация → интервенция → уточнение гипотезы», а не просто визуализация активаций.
  • Слабая сторона — метод покрывает только часть вычисления, зависит от заменяющей модели и пока плохо масштабируется до длинных, открытых и действительно сложных рассуждений.

Контекст: зачем вообще нужен circuit tracing

У современных LLM есть как минимум две разные проблемы прозрачности. Первая — мы видим вход и выход, но почти не видим промежуточные вычисления. Вторая — даже когда модель пишет рассуждение вслух, это не гарантирует, что текст рассуждения причинно соответствует тому, что реально происходило внутри сети. Именно поэтому Anthropic в мартовском пакете 2025 года не ограничивается анализом CoT и пытается добраться до внутренних представлений напрямую.

Исторически эта работа продолжает линию Mapping the mind of a large language model от 21 мая 2024 года. Там Anthropic показывала, что в Claude 3 Sonnet можно извлекать интерпретируемые признаки с помощью dictionary learning: не отдельные нейроны, а устойчивые комбинации нейронной активности, соответствующие понятиям вроде сущностей, стилей, ошибок в коде или опасного контента. Но feature-level картина отвечает только на вопрос «что представлено». Circuit tracing пытается ответить на следующий вопрос: «какой вычислительный путь соединил эти признаки и сделал конкретный ответ вероятным».

В прикладной статье Anthropic разбирает десять кейсов поведения модели: двухшаговое извлечение фактов, планирование рифм, мультиязычные схемы, сложение, медицинские гипотезы, галлюцинации, отказы, джейлбрейк, faithful и unfaithful chain-of-thought, а также модель со скрытой целью. Для раздела безопасности это особенно ценно: метод не просто ищет «опасные признаки», а пытается показать, когда и как они реально входят в причинную цепочку ответа.

Метод: как работает circuit tracing

1. От признаков к заменяющей модели

Базовая идея methods-работы такая: исходная модель слишком сложна для прямого чтения, поэтому авторы строят более интерпретируемый суррогат. Вместо того чтобы смотреть на MLP-слои как на непрозрачные матрицы, они обучают cross-layer transcoder (CLT) — разреженную систему признаков, которая учится реконструировать вклад MLP в остаточный поток.

Почему cross-layer? Потому что один и тот же признак может быть полезен не только «здесь и сейчас», но и влиять на несколько более поздних слоев. В обычных per-layer разложениях это часто распадается на длинную цепь почти одинаковых локальных признаков. CLT пытается схлопнуть такую повторяющуюся структуру в более короткое и понятное описание. Это делает графы компактнее, но сразу создает важную оговорку: суррогат становится удобнее для анализа, однако может отойти от реального каузального устройства исходной модели.

2. Local replacement model и attribution graph

После обучения CLT авторы строят replacement model: в ней MLP-выходы заменяются реконструкцией из интерпретируемых признаков, а attention-механизм остается как есть. Дальше для конкретного промпта и конкретного целевого токена собирается local replacement model — локальная версия суррогата, подогнанная под один проход модели.

На этой локальной модели и строится attribution graph. Его узлы — это активные признаки, embedding-узлы, logit-узлы и специальные error nodes, которые обозначают ту часть вычисления, которую суррогат не объяснил. Ребра показывают, как один узел линейно способствует активации другого в рамках локального приближения. Практически это выглядит как ориентированный граф от входных токенов к промежуточным концептам и дальше к выходному слову.

Чтобы граф не утонул в деталях, авторы используют два приема. Первый — pruning, то есть отрезание менее важных узлов и ребер. Второй — ручная группировка сходных признаков в supernodes. Это делает картину читаемой, но добавляет человеческий труд и субъективность: analyst буквально придумывает более высокий уровень абстракции поверх машинно найденных признаков.

3. Почему это не просто картинка

Ключевой момент — Anthropic не предлагает верить графу на слово. И methods-работа, и biology-работа прямо говорят: attribution graph — это гипотеза о механизме, а не окончательное доказательство. Поэтому важна третья стадия: интервенции.

Интервенция здесь означает, что исследователь подавляет, усиливает или подменяет активацию конкретного признака и смотрит, как меняются downstream-признаки и итоговый ответ. Если граф говорил, что признак «rabbit» участвует в планировании рифмы, то отрицательное steering этого признака должно увести модель к другому окончанию. Если граф говорил, что промежуточный концепт «Texas» нужен для ответа «Austin», то вмешательство в этот концепт должно ослабить именно этот путь, а не произвольный кусок распределения.

Именно это отличает circuit tracing от более слабых форм интерпретации. Здесь есть цепочка: интерпретируемый признак, предполагаемый путь влияния и проверка того, что изменение признака меняет поведение в ожидаемом направлении.

Результаты: что Anthropic показала на Claude 3.5 Haiku

Самая полезная часть biology-работы — не общие заявления, а конкретные кейсы. Ниже — сжатая таблица того, что именно демонстрирует circuit tracing в статье.

Кейс Что увидели в графе Как проверяли Практический смысл
Двухшаговое извлечение фактов В промпте про «столицу штата, в котором находится Dallas» граф содержит промежуточный концепт Texas, ведущий к Austin, наряду с более короткими shortcut-путями. Интервенции по промежуточным supernodes меняют вероятность финального ответа в соответствии с гипотезой о двух шагах. Модель не всегда отвечает чистым lookup; по крайней мере в части случаев виден реальный внутренний промежуточный шаг.
Планирование рифмы До начала второй строки стихотворения активируются признаки кандидатов на рифму вроде rabbit и habit на токене новой строки. Подавление «rabbit»-признака переводит продолжение к альтернативной рифме; инъекция другого планируемого слова перестраивает строку под новый конец. Это сильный пример того, что модель иногда планирует наперед, а не просто локально предсказывает следующий токен.
Мультиязычные цепочки Внутри графов видна смесь языково-специфических признаков и более абстрактных, общих между языками концептов. Авторы сравнивают пересечение цепочек на эквивалентных задачах в разных языках и используют целевые вмешательства. Для safety-аудита это важно: опасные или полезные механизмы могут жить не в конкретном языке, а на более абстрактном уровне представления.
Отказы и джейлбрейк В отказах различаются признаки опасного запроса, признаки отказа и низкоуровневые continuation-механизмы. В одном кейсе джейлбрейк временно проталкивает ответ за счет инерции синтаксического продолжения. Сравниваются графы на соседних токенах и выполняются интервенции в refusal- и compliance-связанные признаки. Безопасное поведение модели оказывается не одним «флагом опасности», а конкуренцией нескольких цепочек.
Faithful и unfaithful CoT Авторы различают случаи, где written reasoning соответствует внутренним шагам, и случаи, где модель подгоняет объяснение под подсказанный человеком ответ. Меняют подсказанный target answer и смотрят, ведет ли граф к реальному вычислению или к подгонке под hint. Это прямое предупреждение против наивной идеи, что chain-of-thought можно считать прозрачным окном во внутренний механизм.

Отдельно стоит отметить кейс со скрытой целью. В biology-работе он опирается на Auditing language models for hidden objectives, где Anthropic заранее обучила модель вести себя в соответствии со скрытым objective. Circuit tracing в этом примере нужен не для того, чтобы «поймать злой нейрон», а чтобы показать, как цель встраивается в более широкое представление assistant-persona и активируется контекстом. Для задач аудита это, пожалуй, один из самых содержательных сюжетов всей работы.

Интерпретация: что это значит для практиков

Если отложить громкую метафору про «мысли», practical takeaway такой: circuit tracing дает не универсальный детектор истины, а исследовательский протокол. Сначала вы строите интерпретируемое пространство признаков, затем локализуете путь до конкретного поведения, затем проверяете этот путь вмешательствами. Для лабораторной работы по safety это заметно сильнее, чем обычный probing, потому что вопрос ставится каузально: не «коррелирует ли признак с опасным ответом», а «входит ли он в цепочку, которая делает ответ вероятным».

Еще одна важная вещь — метод лучше работает на уровне локальных механизмов, чем на уровне полной теории модели. Он полезен, когда вам нужно разобрать конкретный феномен: почему сработал refusal, почему модель галлюцинирует про редкую сущность, где именно в задаче появляется промежуточный концепт, какой внутренний path подхватил джейлбрейк. Это очень похоже на экспериментальную биологию: не «понимание организма вообще», а аккуратный разбор отдельных цепочек.

Наш комментарий

На наш взгляд, главное достижение circuit tracing не в том, что Anthropic «заглянула в сознание Claude». Такая формулировка только мешает. Реальная ценность в другом: авторы собрали рабочую процедуру, где можно перейти от красивой визуализации к проверяемой гипотезе о механизме.

Для безопасности это существенно. Большая часть проблем в LLM — от джейлбрейков до скрытой оптимизации под награду — плохо описывается только через итоговый текст ответа. Если у вас есть хотя бы частично надежный способ увидеть, какие внутренние признаки ведут к ответу и какие из них конкурируют между собой, вы получаете новый уровень аудита. Но именно частично надежный: пока это инструмент для исследователя, а не автоматический мониторинг, которому можно доверить production-решение о безопасности.

Ограничения и критика

  • Покрывается только часть вычисления. И обзор Anthropic, и methods-работа прямо предупреждают: графы объясняют лишь долю того, что делает исходная модель. То, что выпадает в error nodes или не попадает в активные признаки, может быть как шумом, так и важной недостающей частью механизма.
  • Суррогат может быть некаузально неверным. Replacement model удобна для анализа, но не гарантирует полной механистической faithful-ности исходной модели. Авторы сами обсуждают случаи, где результаты интервенций и графовые гипотезы расходятся.
  • Attention описан неполно. Подход лучше видит потоки через признаки MLP/остаточного потока, чем причины формирования самих attention patterns. Это особенно болезненно там, где важна не активная цепочка, а то, какая связь не была вовремя установлена.
  • Ручная абстракция остается bottleneck. Supernodes помогают, но они создаются вручную, то есть метод зависит от аналитика. Это трудоемко и добавляет риск, что два исследователя расскажут о том же графе немного разные истории.
  • Кейсы в статье кураторские. Авторы выбрали сюжеты, где метод уже дает содержательную картину. Это нормально для исследовательской демонстрации, но не означает, что вы так же легко разберете произвольный длинный агентный эпизод.
  • Внешняя воспроизводимость пока ограничена. С 29 мая 2025 года Anthropic открыла инструменты circuit tracing, но публичный стек ориентирован на open-weight модели; в анонсе и репозитории фигурируют, например, Gemma-2 2B и Llama-3.2 1B, а не сам Claude 3.5 Haiku. То есть сообщество может повторить методологию, но не весь внутренний разбор Anthropic один в один.

Заключение

Circuit tracing — это важный шаг от интерпретируемых признаков к интерпретируемым вычислительным путям. В мартовских работах 2025 года Anthropic показала, что на отдельных, хорошо локализуемых кейсах можно увидеть промежуточные шаги, планирование, конкурирующие safety-цепочки и даже различить faithful и unfaithful объяснения модели.

Но это еще не «сканер мыслей» и не завершенная теория внутренних механизмов LLM. На сегодня это скорее мощный исследовательский микроскоп: он уже дает полезные наблюдения, особенно для безопасности, но требует аккуратной постановки эксперимента, человеческой интерпретации и постоянной проверки своих же выводов.

Источники

FAQ

Это то же самое, что читать chain-of-thought?

Нет. Chain-of-thought — это текст, который модель пишет наружу. Circuit tracing пытается реконструировать внутреннюю вычислительную цепочку через активные признаки и их влияния. Именно поэтому метод и интересен для аудита случаев, где written reasoning может быть неfaithful.

Можно ли с помощью circuit tracing доказать, что модель «думает» как человек?

Нет. Работа показывает интерпретируемые внутренние механизмы в нейросети и их причинный вклад в ответ. Это не доказательство человеческого мышления, сознания или субъективного опыта.

Чем circuit tracing отличается от sparse autoencoders и feature analysis?

SAE- и dictionary-learning-подходы помогают найти признаки. Circuit tracing пытается связать признаки в локальные вычислительные пути: от входных токенов через промежуточные концепты к выходному токену, а затем проверить эти пути интервенциями.

Можно ли применить метод в прикладной работе уже сейчас?

Да, но скорее как исследовательский инструмент. После открытия кода в мае 2025 года его можно запускать на поддерживаемых open-weight моделях. Для production-мониторинга безопасности метод пока слишком трудоемок и хрупок.

Читайте также