Запись архива

Claude начал незаметно маркировать текст: зачем Anthropic это делает и что нас ждёт

Claude встраивает в текст машинно-читаемую маркировку. Разбираем, почему она не доказывает авторство ИИ и как изменит работу с текстами.

Схема скрытой маркировки текста Claude и проверки происхождения контента

Anthropic начала встраивать в ответы новых моделей Claude машинно-читаемую маркировку. Человек её не видит, обычное копирование не обязательно её уничтожает, а положительный результат проверки может появиться даже у текста, который изначально написал человек и лишь отдал Claude на корректуру.

На первый взгляд это похоже на долгожданный «детектор ИИ». На деле система лишь показывает, что материал мог пройти через Claude. Она не устанавливает автора, долю машинного вклада и последующую историю текста — принципиальная разница для редакций, университетов и работодателей.

Коротко

  • Anthropic связывает маркировку с требованиями статьи 50 европейского AI Act, которые начали применяться 2 августа 2026 года. Компания подписала добровольный Кодекс практики ЕС, помогающий показать соответствие этим требованиям.
  • В тексте используется незаметный встроенный водяной знак. Anthropic не раскрыла алгоритм, ключи, пороги детектора и частоту ошибок, поэтому говорить о конкретных «невидимых символах» нельзя.
  • Метка означает обработку Claude, а не обязательно генерацию с нуля. Корректура, перевод, пересказ и форматирование человеческого материала также могут оставить сигнал.
  • Копирование и небольшие правки могут сохранить водяной знак. Глубокий рерайт, перевод, смешивание с другим текстом или короткий фрагмент способны ослабить обнаружение.
  • В ближайшие годы водяные знаки станут одним из сигналов происхождения контента, но не самостоятельным доказательством. Надёжная проверка потребует истории версий, редакционной ответственности и подписанных метаданных.

Что именно изменилось в Claude

В официальной справке Anthropic, обновлённой 10 августа 2026 года, компания сообщает о двух механизмах маркировки.

Первый относится к тексту. Ответы Claude получают встроенный водяной знак, незаметный для человека. По описанию Anthropic, он добавляется на уровне модели, переносится при копировании и вставке и способен пережить часть последующего редактирования.

Второй механизм применяется к поддерживаемым файлам. Для SVG, PNG и JPEG Claude может добавлять криптографически подписанные сведения о происхождении по стандарту C2PA — Content Credentials. Они позволяют проверить обработку системой Claude и нарушение целостности файла.

Маркировка распространяется на новые модели Claude, запущенные в Европейском союзе 2 августа 2026 года или позже. По словам Anthropic, она работает не только в ЕС, а по всему миру и охватывает Claude API, пользовательский Claude, Claude Code, Claude Cowork и Claude Tag там, где технология поддерживается. Для более ранних моделей идёт переходный период.

Публичного детектора для всех сценариев пока нет. Anthropic обещает отдельно сообщить, как проверять маркировку, но протокол чтения, пороги уверенности и показатели ошибок ещё не раскрыла.

Это не спрятанные символы в буфере обмена

Фраза «скрытые маркеры» легко создаёт неверную картину: будто Claude вставляет между словами символы нулевой ширины, специальный пробел или технический тег, который можно увидеть в текстовом редакторе. Anthropic этого не утверждает.

Компания называет механизм встроенным водяным знаком на уровне модели. Точная реализация не опубликована. Поэтому любые заявления о конкретных Unicode-символах, служебных байтах или тайном идентификаторе пользователя сейчас были бы спекуляцией.

Исследовательский класс таких методов устроен иначе. Языковая модель выбирает следующий токен — слово, часть слова или знак — из распределения вероятностей. Система может слегка менять предпочтение между допустимыми вариантами, создавая статистический узор. Для читателя фразы остаются обычными, а детектор с нужным ключом ищет отклонение от случайности.

Аналогия: представьте монету, которая выглядит обычной, но на большой серии бросков чуть чаще падает определённой стороной по секретному расписанию. Один бросок ничего не доказывает. Сотни наблюдений уже дают статистический сигнал.

Именно так работают известные академические схемы, включая водяной знак Кирхенбауэра и соавторов и SynthID-Text Google DeepMind. Но переносить детали этих алгоритмов на Claude нельзя: Anthropic не заявляла, что использует один из них.

Чем длиннее и разнообразнее текст, тем больше в нём статистических свидетельств. В короткой дате, коде или точной цитате у модели меньше свободы выбора — и потенциальный сигнал слабее.

Зачем Anthropic маркирует текст

Первая причина — европейское регулирование

Статья 50 Регламента ЕС об искусственном интеллекте требует от поставщиков генеративных систем маркировать синтетические аудио, изображения, видео и тексты в машинно-читаемом формате. Решение должно быть эффективным, совместимым с другими системами, устойчивым и надёжным настолько, насколько это технически возможно.

Эти требования начали применяться 2 августа 2026 года. Европейская комиссия подготовила Кодекс практики по прозрачности ИИ-контента, который даёт компаниям признанный путь демонстрации соответствия. К концу июля его подписали около 190 организаций; среди поставщиков в первой секции указана Anthropic.

Кодекс добровольный, но обязанность закона — нет. Для крупного поставщика маркировка становится частью продуктовой инфраструктуры.

Вторая причина — масштаб генеративного контента

Регулятор связывает новую обязанность с рисками массовой дезинформации, мошенничества, имитации личности и манипуляции. Дешёвая генерация позволяет одному оператору выпускать тысячи публикаций, которые невозможно проверять вручную.

Водяной знак не останавливает злоупотребление, но повышает стоимость массовой анонимной генерации и даёт платформам дополнительный машинный сигнал. Его можно учитывать вместе с жалобами, поведением аккаунта, историей публикаций и другими признаками.

Третья причина — переход от «детектора стиля» к происхождению

Обычные детекторы пытаются угадать авторство по гладкости, предсказуемости и другим свойствам готового текста. Такие признаки не принадлежат конкретной модели и могут встречаться у человека. Поэтому классификатор способен принять аккуратный академический текст, шаблонное деловое письмо или работу неносителя языка за генерацию.

Водяной знак встраивается самим поставщиком во время вывода модели. Это более контролируемая постановка задачи: не «похож ли текст на ИИ», а «есть ли в нём сигнал, который добавляла конкретная система».

Однако цена такой точности — ограниченный охват. Детектор Claude не обязан распознавать Gemini, открытые модели или старые версии Claude. А отсутствие метки не означает человеческое происхождение.

Почему маркировка включается по всему миру

Anthropic не раскрывает бизнес-логику глобального охвата. На наш взгляд, единый режим уменьшает фрагментацию и не даёт тексту менять статус при перемещении между регионами. Это интерпретация, а не заявленный компанией мотив.

Почему человеческий текст после корректуры может получить метку

Это самая важная и потенциально конфликтная часть новой системы. Anthropic прямо предупреждает: если человек написал текст сам, а затем попросил Claude исправить грамматику, перевести, сократить, пересказать или изменить формат, итоговый материал может содержать водяной знак.

С точки зрения системы это не ошибка. Claude действительно обработал и заново вывел последовательность токенов. Но с точки зрения бытового вопроса «кто написал текст?» такой результат легко интерпретировать неправильно.

Здесь полезно разделить два разных вида ошибки:

Ситуация Что означает положительная проверка Чего она не доказывает
Claude написал черновик по короткому запросу В тексте обнаружен сигнал обработки Claude Что весь опубликованный текст сохранился без человеческих правок
Человек написал статью, Claude исправил пунктуацию Итоговая версия могла пройти через Claude Что идеи, аргументы и исходные формулировки принадлежат модели
Claude перевёл человеческий текст Переведённая версия могла быть сформирована Claude Что Claude создал исходный материал
В документ вставлен один абзац из Claude В части документа может сохраниться сигнал Что весь документ сгенерирован ИИ
Метка не найдена Детектор не увидел достаточного сигнала Что ИИ точно не использовался

Частоту статистических ложных срабатываний пока оценить нельзя: Anthropic не опубликовала метрики. Зато уже подтверждена смысловая ошибка: система верно обнаружила обработку, а проверяющий ошибочно назвал её машинным авторством.

Есть и юридическая тонкость. Статья 50 AI Act делает исключение для систем, которые выполняют стандартное редактирование и существенно не меняют входные данные или их смысл. Разъяснения Еврокомиссии отдельно упоминают стандартную редактуру как пример исключения. Тем не менее техническая реализация Anthropic может пометить и такой результат. Получается, продуктовая граница маркировки шире минимальной бытовой и, вероятно, юридической границы понятия «сгенерировано ИИ».

Что водяной знак действительно доказывает

Корректная формулировка выглядит так: в тексте обнаружены признаки того, что он мог быть выведен или обработан поддерживаемой моделью Claude.

Некорректные выводы звучат намного сильнее:

  • «этот человек не писал текст»;
  • «весь документ создан Claude»;
  • «после генерации текст не меняли»;
  • «факты в тексте проверены Anthropic»;
  • «детектор знает автора, аккаунт или исходный запрос».

Документация Anthropic не даёт оснований для этих утверждений. Водяной знак — сигнал технического происхождения, а не сертификат истины, качества или интеллектуального авторства.

То же различие действует для C2PA. Спецификация Content Credentials позволяет криптографически связать файл с подписанными сведениями о его создании и изменениях. Но сам стандарт подчёркивает: он проверяет целостность и источник утверждений о происхождении, а не выносит оценку, «хороший» контент или «плохой» и правдив ли изображённый сюжет.

Переживёт ли метка копирование и редактирование

По данным Anthropic, копирование и вставка сохраняют текстовый водяной знак, а часть редактирования его не уничтожает. Это согласуется с исследованиями статистических водяных знаков: небольшая замена слов разбавляет сигнал, но в длинном тексте может остаться достаточно исходных закономерностей.

В работе On the Reliability of Watermarks for Large Language Models авторы проверяли человеческий и машинный рерайт, а также смешивание размеченного фрагмента с обычным текстом. В их конкретной схеме после сильного человеческого перефразирования для уверенного обнаружения в среднем требовалось около 800 токенов при заданной частоте ложноположительного результата 10⁻⁵. Эта цифра показывает возможную устойчивость класса методов, но не является характеристикой Claude.

Anthropic перечисляет случаи, когда метка может ослабнуть или исчезнуть: глубокий рерайт, перевод, смешивание с другим материалом, слишком короткий фрагмент, использование старой модели или неподдерживаемой функции. Для файлов к этому добавляются удаление метаданных, пересохранение и скриншот.

Получается асимметрия: добросовестная корректура сохраняет сигнал, а мотивированный нарушитель может удалить его глубокой переработкой. Водяной знак полезен для массовой проверки, но слаб как единственное доказательство против человека.

Что нас ждёт дальше

Детекторы станут частью платформ, а не отдельной игрушкой

Первые последствия, вероятно, появятся в корпоративных системах, образовательных платформах, CMS и сервисах модерации: результат проверки будет попадать в журнал происхождения.

Неизвестно, станет ли детектор открытым сервисом, партнёрским API или функцией внутри Claude. До раскрытия деталей нельзя оценить независимость и воспроизводимость проверки.

Один бинарный ярлык сменится цепочкой происхождения

Для текста будет использоваться встроенный статистический сигнал. Для изображений и файлов — C2PA и цифровые подписи. Для редакционных материалов — история версий и ответственное лицо. Для публично значимых публикаций — видимая маркировка там, где её требует закон.

Реалистичная система выглядит как цепочка: исходник человека → обработка инструментом → редакторские изменения → публикация ответственным лицом. Вопрос «ИИ или человек?» уступит более полезному: «что происходило с материалом?»

Появятся конфликты в образовании и найме

Если университет или работодатель приравняет обработку к обману, под подозрение попадут пользователи корректора или переводчика. Особенно уязвимы неносители языка и люди, которым такие инструменты нужны для доступности.

Поэтому правила должны описывать допустимые действия, а не запрещать абстрактный «ИИ». Разница между исправлением опечаток, переписыванием абзаца и генерацией всей работы должна быть закреплена заранее. Положительный детектор может запускать проверку, но не заменять её.

Начнётся гонка устойчивости и удаления

Поставщики будут улучшать водяные знаки, а сервисы обхода — предлагать рерайт, перевод и смешивание текста. Чем сильнее метка влияет на выбор слов, тем выше риск для качества; чем она слабее, тем легче её разбавить.

Устойчивость зависит от длины, жанра и силы редактирования. Поэтому корректный детектор должен возвращать уверенность и ограничения, а не приговор.

Отсутствие метки не станет знаком качества

Старые и открытые модели могут не использовать совместимую маркировку, глубокая переработка — уничтожить сигнал, а пересохранение — удалить метаданные. Человеческий текст тоже бывает ложным и манипулятивным.

Поэтому «не обнаружено» не означает «написано человеком», а «написано человеком» не означает «правда». Происхождение и достоверность — разные задачи.

Что делать авторам, редакциям и разработчикам

Авторам стоит хранить исходный черновик и историю изменений. Если Claude использовался только для корректуры, версия до и после обработки показывает вклад инструмента лучше любого бинарного детектора.

Редакциям полезно завести не один флаг «ИИ», а несколько ролей: исследование источников, генерация черновика, перевод, корректура, фактчек, иллюстрация. Для спорных материалов нужна процедура апелляции. Решение об обвинении автора нельзя принимать по одному сигналу.

Работодателям и учебным заведениям следует заранее определить допустимые сценарии. Запрет «любого ИИ» почти неизбежно столкнётся с функциями коррекции, уже встроенными в редакторы, почту и операционные системы.

Разработчикам на Claude API нужно фиксировать модель, дату и тип преобразования. После появления детектора — также его версию и порог уверенности.

Издателям файлов важно сохранять C2PA-данные в рабочем процессе. Если CMS, графический редактор или оптимизатор изображений удаляет метаданные, подписанная история оборвётся даже без злого умысла.

Специально «отмывать» текст от метки не стоит: это разрушает историю происхождения и может создать регуляторный риск. Надёжнее описать роль инструмента и сохранить доказательства человеческой работы.

Ограничения и критика

  • Нет открытого технического описания Claude-watermark. Не опубликованы алгоритм, ключевая схема, пороги, устойчивость по языкам и жанрам, доля ложных срабатываний и пропусков.
  • Нет общедоступного универсального детектора. Пока нельзя независимо воспроизвести заявление Anthropic на произвольной выборке.
  • Метка шире авторства. Она способна отражать перевод или корректуру и тем самым провоцировать неверные социальные и дисциплинарные выводы.
  • Устойчивость ограничена. Небольшие правки могут оставить сигнал, но сильное преобразование способно его ослабить. Мотивированный обход остаётся возможным.
  • Экосистема фрагментирована. Водяной знак одного поставщика не гарантирует обнаружение текста другого, а единый межплатформенный стандарт для текста ещё не сложился.
  • Происхождение не равно правде. Даже безупречно подписанный файл может содержать ошибочное утверждение, а материал без метки может быть полностью достоверным.

Вывод

Anthropic не создала прибор, который безошибочно отделяет человеческую мысль от машинной. Компания внедрила сигнал, позволяющий обнаруживать участие Claude в обработке контента — иногда даже тогда, когда участие ограничилось обычной корректурой.

Главное последствие новой системы — не конец анонимной генерации, а смена языка. Вместо грубого ярлыка «написано ИИ» придётся обсуждать степень участия модели, историю документа и редакционную ответственность. Если платформы и организации этого не сделают, технически корректная метка станет источником некорректных обвинений.

FAQ

Может ли Claude пометить текст, который написал человек?

Да. Если Claude корректировал, переводил, сокращал, пересказывал или переформатировал человеческий текст, итоговая версия может получить водяной знак. Это подтверждает обработку системой, но не машинное авторство исходника.

Можно ли удалить метку простым копированием?

По заявлению Anthropic, обычное копирование и вставка её сохраняют. Сильный рерайт, перевод, смешивание с другим текстом или слишком короткий фрагмент могут ослабить обнаружение, но точные пороги для Claude не опубликованы.

Доказывает ли метка, что весь текст написал Claude?

Нет. Она не показывает долю машинного вклада, автора идей, исходный запрос и историю правок после обработки. Положительная проверка должна быть началом расследования происхождения, а не финальным вердиктом.

Является ли маркировка слежкой за пользователем?

Опубликованная документация описывает сигнал в контенте, а не передачу личности пользователя или текста запроса. Данных о персональном идентификаторе в маркировке Anthropic не приводит. Окончательно оценить приватность можно будет после раскрытия технической схемы и инструментов проверки.

Источники

Читайте также