SSD Nodes Learn 🎉 VPS от $5.50/мес
Руководства Matt ConnorАвтор: Matt Connor · Обновлено 2026-08-21

Как работают водяные знаки в текстах Claude

Узнайте, как Anthropic внедряет водяные знаки через смещение выбора токенов. Разбираем, почему статистический метод не дает гарантий и почему короткие тексты нельзя проверить.

Что такое водяные знаки в тексте Claude

Водяной знак в тексте Claude — это смещение, применяемое при выборе слов моделью. Это не тег, прикрепленный к файлу, и не последовательность невидимых символов Unicode, которую можно удалить регулярным выражением. Anthropic описывает это в статье Как работают водяные знаки в тексте Claude от 14 августа 2026 года: схема «лишь меняет источник случайности, используемой для выбора слов», применяя секретный ключ и несколько предшествующих слов. Поскольку метка заключается в выборе самих слов, она сохраняется при копировании и вставке, но исчезает при изменении текста.

Из этого следуют два вывода, объясняющие интерес к данной теме. Обнаружение — это статистический тест, требующий большого объема текста для получения значимых результатов, поэтому он не дает полезной информации для одного предложения. Отрицательный результат также ничего не доказывает: справочный центр Anthropic утверждает, что «отсутствие обнаруженной метки не означает, что контент не был сгенерирован или обработан ИИ».

На странице справки Как Claude помечает контент, сгенерированный ИИ, изученной 18 августа 2026 года, перечислены охватываемые платформы: «Claude Platform (API), Claude, Claude Code, Claude Cowork и Claude Tag», включая доступ через AWS, Google Cloud и Microsoft Foundry. Модели, выпущенные 2 августа 2026 года или позже, поддерживают машиночитаемую маркировку с момента запуска, а для более ранних моделей этот процесс находится в стадии реализации. Эта дата не случайна. Статья 50 Закона ЕС об ИИ (EU AI Act) вступает в силу со 2 августа 2026 года и требует от поставщиков систем, генерирующих синтетический текст, помечать выходные данные «в машиночитаемом формате, позволяющем обнаружить, что контент был искусственно создан или изменен». Anthropic заявляет, что применяет маркировку по всему миру, а не только для трафика из ЕС.

С файлами ситуация иная. На странице справки указано, что поддерживаемые сгенерированные файлы («.svg, .png или .jpg») содержат криптографически подписанные метаданные о происхождении в соответствии со стандартом C2PA (Coalition for Content Provenance and Authenticity). Это метаданные, прикрепленные к содержимому файла, а не изменение самого содержимого, поэтому их так легко удалить.

Как водяной знак влияет на выбор токенов

На каждом шаге языковая модель вычисляет вероятность для каждого токена (токеном является слово или его часть), который она может сгенерировать следующим. Сэмплер выбирает один из них, и обычно случайность этого выбора обеспечивается стандартным генератором случайных чисел. Сэмплер с водяным знаком заменяет этот источник на псевдослучайную функцию с ключом. Её входными данными являются секретный ключ и несколько последних токенов, поэтому выбор воспроизводим для любого, у кого есть ключ, и выглядит как обычная вариативность для всех остальных.

Первая широко цитируемая публичная версия — A Watermark for Large Language Models (Kirchenbauer et al., ICML 2023). Перед каждым токеном ключ и предыдущие токены выбирают псевдослучайное «зелёное» подмножество словаря, а сэмплер добавляет небольшой бонус к оценке этих токенов. Никакие варианты не запрещаются, поэтому текст остаётся связным, но «зелёные» токены появляются немного чаще, чем это было бы при случайном выборе.

В публикации Anthropic говорится, что их реализация основана на SynthID-Text, представленном Google DeepMind в журнале Nature в октябре 2024 года как Scalable watermarking for identifying large language model outputs, и что это семейство идей восходит к предложению Скотта Аронсона от 2022 года. SynthID-Text выбирает несколько токенов-кандидатов из собственного распределения модели и проводит между ними турнир на выбывание, где результаты оцениваются функцией с ключом, поэтому выживший токен с большей вероятностью будет тем, который «предпочитает» ключ. Кандидаты берутся из собственного распределения модели, именно поэтому в опубликованных отчетах об оценке не зафиксировано измеримой потери качества.

Важным следствием является энтропия. Смещение работает только там, где у модели был реальный выбор. Если единственным верным следующим токеном является Paris, ни одна схема не сможет изменить его, не сделав текст ошибочным. Anthropic прямо заявляет об этом: водяной знак «менее выражен в фактических отрывках, где меньше вариантов выбора, которые можно сделать без снижения точности текста», а код «обычно содержит меньше водяных знаков, чем другие формы текста», поскольку он, как правило, должен быть точным. Плотность сигнала отслеживает степень свободы модели, поэтому длинный фрагмент свободной прозы несёт сильную метку, в то время как короткий фактический ответ — почти никакой.

Одно честное ограничение для всего вышесказанного. По состоянию на 18 августа 2026 года Anthropic опубликовала семейство, к которому относится их схема, но не параметры или порог детектора. Механика, описанная в этом разделе, взята из цитируемых работ. Воспринимайте их как опубликованный проект, на который ссылается Anthropic, а не как описание точной конфигурации Claude.

Почему обнаружение — это проверка гипотез, а не проставление штампа

Детектор получает на вход текст и ключ. Он анализирует текст, пересчитывает вероятности, которые ключ предпочел бы в каждой позиции, присваивает каждому токену оценку и суммирует их. Нулевая гипотеза заключается в том, что текст был написан без использования этого ключа: в этом случае оценки ведут себя как подбрасывание монеты, а общая сумма находится вблизи ожидаемого значения. Текст с водяным знаком отклоняется от этого значения в большую сторону. Результатом является p-value — вероятность получения такой высокой суммы для текста без водяного знака, а вердикт «обнаружено» выносится путем сравнения этого p-value с выбранным пороговым значением.

Такая архитектура имеет два практических следствия. Уверенность растет вместе с длиной текста, так как каждый дополнительный токен — это еще одно слабое доказательство. Anthropic формулирует это так: «Обнаружение водяного знака также плохо работает на коротких фрагментах, где меньше вариантов выбора слов и, следовательно, меньше информации для анализа». Пороговое значение также является компромиссом. Если установить его достаточно низким для маркировки абзаца, вы начнете случайно помечать тексты, написанные людьми.

Вы пока не можете запустить этот тест самостоятельно. В публикации Anthropic говорится, что компания «вскоре предложит API для обнаружения водяных знаков» и «находится в процессе проработки деталей реализации». Таким образом, по состоянию на 18 августа 2026 года публичного детектора водяных знаков Claude не существует, и никто вне Anthropic не может подтвердить или опровергнуть утверждение о том, что конкретный фрагмент содержит метку.

Этот пробел важен из-за того, к чему люди прибегают вместо него. Коммерческие «AI-детекторы», продаваемые школам и редакторам, представляют собой классификаторы, обученные на стиле письма. У них нет ключа, и они не проводят проверку такого типа. Их режим сбоя задокументирован: GPT-детекторы предвзяты по отношению к авторам, для которых английский не является родным (Liang et al., Patterns, 2023) обнаружили, что широко используемые детекторы помечали более половины эссе TOEFL, написанных не носителями языка, как сгенерированные ИИ, при этом правильно классифицируя работы носителей языка. Детектор водяных знаков и классификатор стиля — это разные инструменты. Не позволяйте никому выдавать второй за первый.

Что удаляет водяной знак

Короткие ответы. Ответ из одной строки содержит слишком мало решений, чтобы повлиять на статистику. Исправления не существует, так как это свойство теста, а не недоработка реализации.

Переписывание. Anthropic утверждает, что легкое редактирование может оставить метку читаемой, тогда как «полное переписывание, при котором заменено каждое слово», удаляет её. Каждое замененное вами слово — это слово, которое ключ больше не может объяснить.

Перефразирование через другую модель. Вторая модель заново выбирает каждый токен с помощью собственного сэмплера и без ключа, поэтому результат несет метку этой модели (если она у неё есть), а не Claude.

Перевод, за одним исключением. Прогон английского текста Claude через другой переводчик разрушает сигнал, так как новый сэмплер выбирает каждое целевое слово. Anthropic отмечает случай, работающий в обратную сторону: «Перевод, выполненный Claude, содержит водяной знак, поскольку в этом случае каждое слово выбирается Claude».

Код, по большей части. Корректный код предлагает мало взаимозаменяемых вариантов. 15 августа 2026 года TechCrunch сообщил, что Anthropic ожидает «незначительного влияния на фактически создаваемый код», при этом метки с большей вероятностью появятся в комментариях. Это сообщение прессы о заявлении компании, а не опубликованная документация, поэтому относитесь к детали о комментариях как к неподтвержденной. Комментарии и имена идентификаторов — это части патча, где действительно есть пространство для выбора.

Удаление метаданных для файлов. Данные о происхождении C2PA находятся рядом с данными изображения, поэтому любое перекодирование файла обычно удаляет их, если не задана команда сохранить их. Это включает оптимизатор изображений при обычной сборке статического сайта. Справочная страница Anthropic перечисляет удаление метаданных среди причин, по которым метка может исчезнуть.

Что на самом деле доказывает обнаруженная метка

Гораздо меньше, чем предполагает слово «водяной знак» (watermark). В публикации Anthropic прямо сказано: «Водяной знак может лишь определить, что Claude, вероятно, был задействован в создании контента на каком-то этапе. Он не позволяет отличить ситуацию "это написал Claude" от ситуации "Claude значительно отредактировал этот текст"». На странице справки добавлено, что «Claude может не являться первоначальным автором», поскольку пользователи применяют Claude для редактирования собственных текстов, а сам контент мог быть изменен уже после участия Claude.

В опубликованных материалах Anthropic нет описания сигнала, привязанного к конкретной учетной записи или пользователю. Метка, согласно документации, указывает лишь на участие модели Claude. Если кто-либо утверждает, что водяной знак позволяет выявить пользователя или API key, с помощью которых был создан фрагмент текста, то это утверждение не подтверждается первичными источниками по состоянию на 18 августа 2026 года.

Меняет ли это публикацию кода, созданного с помощью ИИ, с вашего сервера?

Для кода технический ответ — по большей части нет, по двум уже названным причинам: сигнал в точном коде слаб, а общедоступных детекторов не существует. То, можно ли вам публиковать код, определяется политикой, а политика не изменилась. Проекты с открытым исходным кодом написали собственные правила для вкладов, созданных с помощью ИИ, и эти правила обеспечиваются мейнтейнером, который читает ваш pull request, а не детектором, который анализирует ваши токены.

Для прозы, которую генерирует ваш сервер, ответ — да, в одном конкретном аспекте. Если API-запрос пишет ваши release notes или страницы продукта, то слова принадлежат Claude, поэтому метка в них присутствует. Рендеринг markdown в HTML, минификация, сохранение результата в Postgres и отдача через CDN не меняют слова, поэтому они не меняют и метку. Что её ослабляет, так это редактирование предложений человеком.

Вы не можете убрать водяной знак с помощью промпта. Он накладывается на уровне сэмплирования, под текстом, который создает модель, поэтому инструкция вроде «не ставь водяной знак» ни на что не влияет. Это отличается от обычных причин, по которым агент игнорирует вашу инструкцию, когда инструкция дошла до модели, но уступила чему-то другому. По состоянию на 18 августа 2026 года документированной возможности отказа от этого для клиентов API не существует.

Если вы используете Claude для управления сервером, а не для написания текстов, это почти ничего не меняет. Команды shell и фрагменты конфигурации коротки и ограничены, поэтому они почти не содержат сигнала, и ничто, связанное с маркировкой, не влияет на то, что выполняется на вашей машине. Повседневная работа системного администратора с Claude поднимает другой вопрос: что именно покидает вашу машину. См. что кодинг-агент на самом деле отправляет с вашего сервера.

Что следует раскрывать

Раскрытие информации — это вопрос соблюдения правил, а не обнаружения. Наличие водяного знака не создает обязанности раскрывать информацию и не освобождает от нее. Определите, какие правила обязательны для вас, и следуйте им независимо от того, можно ли вас уличить в их нарушении.

EU AI Act разделяет эту задачу на две части. Статья 50(2) возлагает обязанность по маркировке на поставщика, то есть на Anthropic, и именно этому обязательству соответствует данное внедрение. Статья 50(4) возлагает обязанность на развертывающую сторону: любой, кто публикует текст, созданный ИИ, «для информирования общественности по вопросам, представляющим общественный интерес», обязан раскрыть факт искусственного создания такого текста. В ней предусмотрено исключение, под которое подпадает большинство редакционных команд: если «контент, созданный ИИ, прошел процесс проверки человеком или редакционного контроля, и если физическое или юридическое лицо несет редакционную ответственность за публикацию». Оба положения вступают в силу со 2 августа 2026 года. К отредактированной публикации с указанным редактором отношение иное, чем к ленте, которая публикует контент без участия человека. Это толкование текста регламента, а не юридическая консультация.

Другие правила могут быть строже закона. Ваш трудовой договор, соглашение с клиентом, руководство для участников проекта, в который вы отправляете патчи, и политика издателя, для которого вы пишете, могут требовать большего. Именно эти правила кто-то будет проверять на практике.

Когда вы раскрываете информацию, указывайте, что именно сделала модель и что вы проверили. Фраза «Черновик написан с помощью Claude, каждая команда протестирована на чистой установке Ubuntu 24.04 перед публикацией» сообщает технически грамотному читателю конкретную информацию. Общий значок «Использовался ИИ» не несет смысла, так как часть работы, которую модель не может выполнить за вас, — это проверка.

Не используйте результат проверки водяного знака как обвинение. Положительный результат означает, что модель Claude была задействована в процессе, включая редактирование чьего-либо собственного текста. Отрицательный результат не означает ничего.

FAQ

Можно ли отключить текстовый водяной знак Claude?

По состоянию на 18 августа 2026 года документированная возможность отказа отсутствует. Справочная страница Anthropic описывает маркировку в Claude, Claude Platform (API), Claude Code, Claude Cowork и Claude Tag, включая доступ через AWS, Google Cloud и Microsoft Foundry, и не содержит упоминаний настроек для её отключения. Запрос к модели не добавлять водяной знак в ответ также не дает результата, так как маркер накладывается сэмплером, который выбирает токены, а не самой моделью при выполнении вашей инструкции.

Появляется ли водяной знак в коде, который пишет Claude?

Почти нет. Маркировка работает за счет выбора между вариантами, которые являются равнозначными, а корректный код редко допускает множество вариантов. Anthropic заявляет, что в коде «обычно меньше водяных знаков, чем в других формах текста», поскольку он, как правило, должен быть точным. TechCrunch сообщил 15 августа 2026 года, что Anthropic ожидает незначительного влияния на сам код, при этом маркеры более вероятны в комментариях; это сообщение прессы о заявлении, а не опубликованная документация. Части патча, где есть пространство для вариаций, — это комментарии и имена идентификаторов.

Если детектор не находит водяной знак, доказывает ли это, что текст написал человек?

Нет, и это самая распространенная ошибка при работе с водяными знаками. На собственной странице Anthropic указано, что «отсутствие обнаруженного маркера не означает, что контент не был сгенерирован или обработан ИИ». Текст может быть слишком коротким для проверки, он мог быть отредактирован или перефразирован, он может исходить от модели, выпущенной до внедрения маркировки, или от другого поставщика. Тест является односторонним: он может повысить уверенность в том, что Claude был задействован, но он никогда не может доказать, что Claude не участвовал в создании текста.

Удаляют ли водяной знак перефразирование или перевод?

Перефразирование через другую модель удаляет его, так как эта модель заново выбирает каждое слово своим собственным сэмплером без ключа. Перевод с помощью стороннего инструмента удаляет его по той же причине. Исключение работает в обратном направлении: Anthropic заявляет, что «перевод, выполненный Claude, содержит водяной знак, так как в этом случае каждое слово выбирается Claude», поэтому перевод вашего собственного текста с помощью Claude добавляет маркер, которого там раньше не было.

Могу ли я самостоятельно проверить документ на наличие водяного знака Claude?

Пока нет. Для обнаружения необходим ключ, поэтому это невозможно сделать путем чтения текста или с помощью какого-либо офлайн-инструмента. Anthropic заявляет, что «вскоре предложит API для обнаружения водяных знаков» и все еще прорабатывает детали, поэтому по состоянию на 18 августа 2026 года публичного детектора не существует. Все, что сегодня продается как детектор Claude, является классификатором стиля — это другой механизм с задокументированной проблемой ложноположительных результатов при анализе текстов людей, для которых английский язык не является родным (Liang et al., Patterns, 2023).

#claude#watermarking#ai-detection#provenance#policy