SSD Nodes Learn 🎉 VPS desde $5.50/mes
Guías Matt ConnorPor Matt Connor · Actualizado 2026-08-21

Cómo funciona la marca de agua de texto de Claude

Anthropic empezó a marcar Claude en agosto de 2026: sesga la elección de tokens con una clave secreta, pero detectar una marca no prueba su origen.

Qué es la marca de agua de texto de Claude

La marca de agua de texto de Claude es un sesgo aplicado mientras el modelo selecciona las palabras. No es una etiqueta adjunta al archivo ni una secuencia de caracteres Unicode invisibles que pueda eliminarse con una expresión regular. Anthropic lo describe en Cómo funciona la marca de agua de texto de Claude, con fecha del 14 August 2026: el mecanismo «sólo cambia el origen de la aleatoriedad utilizada para elegir entre las palabras», mediante una clave secreta y las pocas palabras anteriores. Como la marca depende de las palabras seleccionadas, sobrevive a copiar y pegar y desaparece cuando cambian las palabras.

De aquí se derivan dos aspectos que explican por qué se busca información sobre este tema. La detección es una prueba estadística que necesita muchas palabras para que el resultado sea significativo, por lo que puede no aportar información útil sobre una sola oración. Además, un resultado negativo no demuestra nada: el centro de ayuda de Anthropic afirma que «la ausencia de una marca detectada no significa que el contenido no se haya generado o procesado mediante IA».

La página de ayuda Cómo marca Claude el contenido generado por IA, consultada el 18 August 2026, enumera las superficies que cubre: «Claude Platform (API), Claude, Claude Code, Claude Cowork y Claude Tag», incluido el acceso mediante AWS, Google Cloud y Microsoft Foundry. Los modelos lanzados el 2 August 2026 o después admiten la marcación legible por máquina desde su lanzamiento, y Anthropic describe los modelos anteriores como trabajos en curso. Esa fecha no es casual. El artículo 50 de la Ley de IA de la UE se aplica desde el 2 August 2026 y exige que los proveedores de sistemas que generan texto sintético marquen el resultado «en un formato legible por máquina y detectable como generado o manipulado artificialmente». Anthropic afirma que aplica la marcación en todo el mundo, no sólo al tráfico de la UE.

Los archivos funcionan de otra manera. La página de ayuda indica que los archivos generados compatibles («.svg, .png o .jpg») incluyen metadatos de procedencia firmados criptográficamente conforme al estándar C2PA (Coalition for Content Provenance and Authenticity). Se trata de metadatos adjuntos junto al contenido del archivo, no de un cambio en el contenido, por lo que se eliminan con facilidad.

Cómo el watermark sesga la selección de tokens

En cada paso, un modelo de lenguaje calcula una probabilidad para cada token que podría escribir a continuación. Un token puede ser una palabra o una parte de ella. Un sampler selecciona uno, y normalmente la aleatoriedad de esa selección procede de una fuente de números aleatorios convencional. Un sampler con watermarking sustituye esa fuente por una función seudorrandómica con clave. Sus entradas son la clave secreta y los últimos tokens. Por tanto, la selección es reproducible para quien tenga la clave y parece una variación normal para los demás.

La primera versión pública ampliamente citada es A Watermark for Large Language Models (Kirchenbauer et al., ICML 2023). Antes de cada token, la clave y los tokens anteriores seleccionan un subconjunto seudorrandómico «verde» del vocabulario. Después, el sampler añade una pequeña bonificación a la puntuación de esos tokens. No se prohíbe ningún token, por lo que el texto mantiene su fluidez, pero los tokens verdes aparecen algo más a menudo de lo que permitiría el azar.

La publicación de Anthropic indica que su implementación se basa en SynthID-Text, publicado por Google DeepMind en Nature en octubre de 2024 como Scalable watermarking for identifying large language model outputs, y que esta familia de ideas se remonta a una propuesta de Scott Aaronson de 2022. SynthID-Text extrae varios tokens candidatos de la propia distribución del modelo y organiza un torneo eliminatorio entre ellos. La función con clave asigna la puntuación, por lo que el token superviviente tiende a ser uno de los que favorece la clave. Los candidatos proceden de la propia distribución del modelo. Por eso, la evaluación publicada no informa de ninguna pérdida de calidad medible.

La consecuencia importante está relacionada con la entropía. El sesgo sólo puede actuar cuando el modelo tenía varias opciones reales. Si el único token correcto siguiente es Paris, ningún esquema puede cambiarlo sin introducir un error en el texto. Anthropic lo afirma directamente: el watermarking «es más escaso en los pasajes fácticos, donde hay menos opciones que puedan elegirse sin reducir la exactitud del texto», y el código «generalmente tiene menos watermarking que otras formas de texto» porque normalmente debe ser exacto. La densidad de la señal refleja el grado de libertad del modelo. Por eso, un texto extenso y abierto en prosa lleva una marca fuerte, mientras que una respuesta factual breve lleva muy poca.

Hay un límite importante que conviene indicar. A fecha de 18 August 2026, Anthropic ha publicado la familia a la que pertenece su esquema, pero no sus parámetros ni el umbral del detector. La mecánica descrita en esta sección procede de los artículos citados. Debe interpretarse como el diseño publicado que Anthropic menciona, no como una descripción de la configuración exacta de Claude.

Por qué la detección es una prueba de hipótesis y no un sello

Un detector recibe el texto y la clave. Recorre el texto, vuelve a calcular qué habría favorecido la clave en cada posición, asigna una puntuación a cada token y suma todas las puntuaciones. La hipótesis nula es que el texto se escribió sin ese muestreador controlado por clave. En ese caso, las puntuaciones se comportan como lanzamientos de una moneda y el total se mantiene cerca de su valor esperado. El texto con marca de agua se desvía por encima de ese valor. El resultado es un valor p, es decir, la probabilidad de obtener un total tan alto a partir de un texto sin marca de agua. El veredicto «detectado» compara ese valor p con un umbral elegido por alguien.

Este diseño tiene dos efectos que se perciben en la práctica. La confianza aumenta con la longitud, porque cada token adicional aporta una evidencia débil más. Anthropic lo explica así: «La detección de una marca de agua tampoco funciona bien con muestras pequeñas, porque hay menos opciones de palabras y, por tanto, menos información disponible». El umbral también implica un compromiso. Si lo establece lo bastante bajo para marcar un párrafo, empezará a marcar por azar párrafos escritos por personas.

Todavía no puede ejecutar esta prueba por su cuenta. La publicación de Anthropic indica que «pronto ofrecerá una API de detección de marcas de agua» y que está «trabajando en los detalles de su implementación». Por tanto, a fecha de 18 August 2026 no existe un detector público de marcas de agua de Claude y nadie fuera de Anthropic puede confirmar ni refutar que un pasaje concreto contenga la marca.

Esta diferencia importa por lo que algunas personas utilizan en su lugar. Los «detectores de IA» comerciales que se venden a centros educativos y editores son clasificadores entrenados con el estilo de escritura. No contienen ninguna clave ni ejecutan una prueba de este tipo. Su modo de fallo está documentado: los detectores de GPT presentan sesgos contra quienes escriben en inglés como lengua no nativa (Liang et al., Patterns, 2023) constató que detectores de uso extendido clasificaron como generados por IA más de la mitad de un conjunto de ensayos TOEFL escritos por personas no nativas, mientras clasificaban correctamente las muestras de escritores nativos. Un detector de marcas de agua y un clasificador de estilo son máquinas distintas. No permita que alguien le entregue la segunda mientras la presenta como la primera.

Qué elimina la marca de agua

Respuestas cortas. Una respuesta de una sola línea contiene muy pocas decisiones para modificar una estadística. No hay una solución, porque esto es una propiedad de la prueba y no una carencia de la implementación.

Una reescritura. Anthropic afirma que una edición ligera puede dejar la marca legible, mientras que «una reescritura completa en la que se sustituye cada palabra» la elimina. Cada palabra que se sustituye es una palabra que la clave ya no puede explicar.

Paráfrasis mediante otro modelo. Un segundo modelo vuelve a elegir cada token con su propio muestreador y sin una clave. Por tanto, el resultado contiene la marca de ese modelo, si la tiene, y no la de Claude.

Traducción, con una excepción. Traducir el texto en inglés de Claude con otro traductor destruye la señal, porque un nuevo muestreador elige cada palabra del texto de destino. Anthropic señala el caso contrario: «Una traducción producida por Claude lleva una marca de agua, porque en este caso Claude elige cada palabra».

Código, en su mayor parte. El código correcto ofrece pocas alternativas intercambiables. TechCrunch informó el 15 August 2026 de que Anthropic espera «un efecto insignificante en el código producido», y que las marcas aparecerán con más probabilidad en los comentarios. Se trata de un informe periodístico sobre una declaración de la empresa y no de documentación publicada, por lo que el detalle sobre los comentarios debe considerarse no confirmado. Los comentarios y los nombres de identificadores son las partes de un parche que ofrecen un margen real de elección.

Eliminación de metadatos, para archivos. La procedencia C2PA se almacena junto a los datos de imagen. Por eso, cualquier proceso que vuelva a codificar el archivo suele eliminarla, salvo que se le indique que la conserve. Esto incluye el optimizador de imágenes de una compilación normal de un sitio estático. La página de ayuda de Anthropic incluye la eliminación de metadatos entre los motivos por los que desaparece una marca.

Qué demuestra realmente una marca detectada

Menos de lo que sugiere la palabra «marca de agua». La publicación de Anthropic es clara: «Una marca de agua sólo puede determinar que Claude probablemente intervino en algún momento en la creación del contenido. No puede distinguir entre “Claude escribió esto” y “Claude editó esto de forma sustancial”». La página de ayuda añade que «Claude puede no ser el autor original», porque las personas usan Claude para editar textos que han escrito por su cuenta y ese contenido puede haber cambiado después de que Claude lo procesara.

Nada de lo publicado por Anthropic describe una señal asociada a una cuenta o a un usuario concretos. Según la documentación disponible, la marca indica que intervino un modelo de Claude. Si alguien afirma que una marca de agua revela qué usuario o qué API key generó un pasaje, esa afirmación no aparece en las fuentes primarias a fecha de 18 August 2026.

¿Esto cambia la publicación de código asistido por IA desde su servidor?

Para el código, la respuesta técnica es, en general, no, por dos motivos ya explicados: la señal en el código exacto es débil y no existe ningún detector público. Lo que determina si puede publicarlo es la política, y la política no ha cambiado. Los proyectos de código abierto han redactado sus propias reglas para las contribuciones asistidas por IA, y esas reglas las aplica un mantenedor que lee su pull request, no un detector que analiza sus tokens.

Para la prosa que genera su servidor, la respuesta es sí, de una forma concreta. Si una llamada a una API escribe las notas de la versión o las páginas de su producto, las palabras son de Claude, por lo que la marca está en ellas. Convertir markdown a HTML, minimizarlo, almacenarlo en Postgres y servirlo desde una CDN no modifica las palabras, por lo que ninguna de esas operaciones elimina la marca. Lo que la degrada es que un editor humano reescriba las frases.

No puede eliminar la marca de agua mediante un prompt. Se aplica en la capa de muestreo, por debajo del texto que produce el modelo, por lo que una instrucción como "do not watermark this" no tiene ningún efecto. Esta situación es distinta de los motivos habituales por los que un agente ignora una instrucción que usted ha escrito, en los que la instrucción sí llegó al modelo, pero perdió frente a otro elemento. A fecha de 18 August 2026, no existe ningún mecanismo documentado para que los clientes de la API renuncien a esta función.

Si usa Claude para administrar un servidor en lugar de pedirle que escriba por usted, esto cambia muy poco. Los comandos de shell y los fragmentos de configuración son breves y están sujetos a restricciones, por lo que contienen muy poca señal, y el marcado no afecta a lo que se ejecuta en su equipo. El trabajo diario de administración de sistemas con Claude plantea otra cuestión: qué sale de su máquina en primer lugar. Consulte qué envía realmente un agente de programación desde su servidor.

Qué debe divulgar

La divulgación es una cuestión de reglas, no de detección. Una marca de agua no crea la obligación de divulgar, ni la elimina. Determine qué regla le obliga y sígala, independientemente de que alguien pueda detectarlo o no.

El Reglamento de IA de la UE divide esta cuestión en dos partes. El artículo 50(2) impone la obligación de marcado al proveedor, que en este caso es Anthropic, y esa es la obligación que cumple este despliegue. El artículo 50(4) impone una obligación al implementador: quien publique texto generado por IA «para informar al público sobre asuntos de interés público» debe divulgar que se generó artificialmente. Incluye una excepción en la que encaja la mayoría de los equipos editoriales: «cuando el contenido generado por IA haya sido sometido a un proceso de revisión humana o control editorial y una persona física o jurídica asuma la responsabilidad editorial de la publicación». Ambas disposiciones se aplican a partir del 2 August 2026. Un artículo revisado con un editor identificado como responsable se trata de forma distinta a un feed que publica sin que nadie lo lea. Esta es una interpretación del texto del reglamento y no constituye asesoramiento jurídico.

Otras reglas pueden exigir más de lo que exige la ley. Su contrato de trabajo, el acuerdo con su cliente, la guía de contribución del proyecto al que envía parches y la política del editor para el que escribe pueden imponer requisitos adicionales. También son las reglas que alguien comprobará realmente.

Cuando divulgue el uso de IA, indique qué hizo el modelo y qué verificó usted. «Borrador escrito con Claude; todos los comandos se ejecutaron en una instalación limpia de Ubuntu 24.04 antes de publicar» proporciona información real a un lector técnico. Una etiqueta genérica que indique «se utilizó IA» no lo hace, porque la parte que un modelo no puede hacer por usted es la verificación.

No utilice tampoco el resultado de una marca de agua como una acusación. Un resultado positivo indica que un modelo de Claude intervino en algún punto, incluso como editor del texto original de otra persona. Un resultado negativo no demuestra nada.

FAQ

¿Puedo desactivar la marca de agua de texto de Claude?

A fecha de 18 August 2026, no existe ninguna opción documentada para desactivarla. La página de ayuda de Anthropic describe la aplicación de la marca en Claude, Claude Platform (API), Claude Code, Claude Cowork y Claude Tag, incluido el acceso mediante AWS, Google Cloud y Microsoft Foundry, y no menciona ningún ajuste para desactivarla. Pedir al modelo que no añada una marca de agua a su respuesta tampoco sirve, porque la marca la aplica el sampler que selecciona los tokens, no el modelo al seguir la instrucción.

¿La marca de agua aparece en el código que escribe Claude?

Apenas. La marca de agua funciona eligiendo entre opciones que son todas aceptables, y el código correcto rara vez ofrece muchas. Anthropic afirma que el código «generalmente tiene menos marcas de agua que otras formas de texto» porque normalmente debe ser exacto. TechCrunch informó el 15 August 2026 de que Anthropic espera un efecto insignificante en el código en sí, y que las marcas aparecerán con más probabilidad en los comentarios. Se trata de una información de prensa sobre una declaración, no de documentación publicada. Las partes de un parche que permiten variar son los comentarios y los nombres de identificadores.

Si un detector no encuentra ninguna marca de agua, ¿demuestra que lo escribió una persona?

No. Este es el error más habitual con las marcas de agua. La propia página de Anthropic indica que «la ausencia de una marca detectada no significa que el contenido no se haya generado o procesado mediante IA». El texto puede ser demasiado corto para analizarlo, puede haberse editado o parafraseado, puede proceder de un modelo publicado antes de que se incorporara la marca o puede proceder de otro proveedor. La prueba sólo funciona en una dirección: puede aumentar la confianza en que Claude participó, pero nunca puede demostrar que Claude no participó.

¿Parafrasear o traducir elimina la marca de agua?

Parafrasear mediante otro modelo la elimina, porque ese modelo vuelve a elegir cada palabra con su propio sampler y sin la clave. Traducir con una herramienta externa la elimina por el mismo motivo. La excepción funciona en la otra dirección: Anthropic afirma que «una traducción producida por Claude lleva una marca de agua, porque en este caso Claude elige cada palabra». Por tanto, traducir con Claude un texto propio añade una marca que antes no existía.

¿Puedo comprobar personalmente si un documento tiene una marca de agua de Claude?

Todavía no. La detección requiere la clave, por lo que no puede realizarse leyendo el texto ni mediante una herramienta offline. Anthropic afirma que «pronto ofrecerá una API de detección de marcas de agua» y que todavía está definiendo los detalles. Por tanto, a fecha de 18 August 2026 no existe ningún detector público. Cualquier producto que se venda actualmente como detector de Claude es un clasificador de estilo. Utiliza un mecanismo diferente y tiene un problema documentado de falsos positivos al analizar textos escritos por personas cuya primera lengua no es el inglés (Liang et al., Patterns, 2023).

#claude#watermarking#ai-detection#provenance#policy