Claude 텍스트 워터마킹 작동 원리와 탐지 한계
Anthropic이 2026년 8월 도입한 Claude 텍스트 워터마킹의 기술적 원리를 설명합니다. 토큰 선택 편향을 통한 워터마크 삽입 방식과 통계적 탐지의 한계, 그리고 EU AI 법 준수를 위한 전 세계적 적용 범위 및 C2PA 표준 활용 정보를 상세히 정리했습니다.
Claude 텍스트 워터마킹이란 무엇인가
Claude 텍스트 워터마킹은 모델이 단어를 선택할 때 적용되는 편향입니다. 이는 파일에 부착된 태그가 아니며, 정규 표현식으로 제거할 수 있는 보이지 않는 유니코드 문자열도 아닙니다. Anthropic은 2026년 8월 14일 자 Claude의 텍스트 워터마킹 작동 방식에서 이를 설명합니다. 이 방식은 "단어를 선택할 때 사용되는 무작위성의 근원만 변경"하며, 비밀 키와 이전 단어들을 활용합니다. 워터마크가 선택된 단어 자체에 내재되어 있으므로 복사 및 붙여넣기를 해도 유지되지만, 단어가 변경되면 사라집니다.
이로 인해 두 가지 사실이 도출되며, 사람들이 이 주제를 검색하는 이유이기도 합니다. 탐지는 통계적 테스트이므로 의미 있는 결과를 얻으려면 많은 양의 단어가 필요하며, 따라서 단일 문장에 대해서는 유용한 정보를 제공할 수 없습니다. 또한 부정적인 결과는 아무것도 증명하지 못합니다. Anthropic 고객 센터는 "워터마크가 감지되지 않는다고 해서 해당 콘텐츠가 AI로 생성되거나 처리되지 않았음을 의미하지는 않는다"고 명시합니다.
2026년 8월 18일에 확인한 도움말 페이지 Claude가 AI 생성 콘텐츠를 표시하는 방법에는 적용 범위가 나열되어 있습니다. 여기에는 "Claude Platform (API), Claude, Claude Code, Claude Cowork, 그리고 Claude Tag"가 포함되며, AWS, Google Cloud, Microsoft Foundry를 통한 접근도 포함됩니다. 2026년 8월 2일 이후 출시된 모델은 출시 시점부터 기계 판독 가능한 표시를 지원하며, 이전 모델은 현재 진행 중이라고 설명합니다. 이 날짜는 우연이 아닙니다. EU AI 법 제50조는 2026년 8월 2일부터 적용되며, 합성 텍스트를 생성하는 시스템 제공업체는 출력물을 "기계 판독 가능한 형식으로 표시하고 인공적으로 생성되거나 조작되었음을 감지할 수 있도록" 해야 합니다. Anthropic은 이 표시를 EU 트래픽에만 국한하지 않고 전 세계적으로 적용한다고 밝히고 있습니다.
파일은 다르게 작동합니다. 도움말 페이지에 따르면 생성된 지원 파일(".svg, .png, 또는 .jpg")은 C2PA(Coalition for Content Provenance and Authenticity) 표준을 따르는 암호화 서명된 출처 메타데이터를 포함합니다. 이는 파일 내용 옆에 첨부된 메타데이터일 뿐 내용 자체를 변경하는 것이 아니며, 이 때문에 쉽게 제거될 수 있습니다.
워터마크가 토큰 선택에 편향을 주는 방식
언어 모델은 매 단계마다 다음에 올 수 있는 모든 토큰(단어나 단어의 일부)에 대해 확률을 생성합니다. 샘플러는 이 중 하나를 선택하며, 일반적으로 이 선택의 무작위성은 일반적인 난수 생성기에서 나옵니다. 워터마킹 샘플러는 이 생성기를 키가 포함된 의사 난수 함수(pseudorandom function)로 대체합니다. 이 함수의 입력값은 비밀 키와 직전의 토큰 몇 개이므로, 키를 가진 사람은 누구나 선택 과정을 재현할 수 있으며 다른 사람들에게는 일반적인 변동처럼 보입니다.
널리 인용되는 최초의 공개 버전은 A Watermark for Large Language Models(Kirchenbauer 외, ICML 2023)입니다. 각 토큰을 생성하기 전, 키와 이전 토큰들은 어휘 집합에서 의사 난수적인 "녹색" 하위 집합을 선택하며, 샘플러는 해당 토큰들의 점수에 작은 보너스를 더합니다. 금지되는 토큰은 없으므로 텍스트는 여전히 자연스럽지만, 녹색 토큰은 우연히 발생할 확률보다 조금 더 자주 나타나게 됩니다.
Anthropic의 게시물에 따르면, 해당 구현은 2024년 10월 Google DeepMind가 Nature에 발표한 Scalable watermarking for identifying large language model outputs의 SynthID-Text를 기반으로 하며, 이러한 아이디어의 시초는 2022년 Scott Aaronson의 제안으로 거슬러 올라갑니다. SynthID-Text는 모델 자체의 분포에서 여러 후보 토큰을 추출한 뒤 키 기반 함수로 점수를 매겨 토너먼트 방식으로 경쟁시키며, 최종적으로 살아남은 토큰은 키가 선호하는 토큰일 가능성이 높습니다. 후보들은 모델 자체의 분포에서 나오기 때문에, 발표된 평가 결과에서 측정 가능한 품질 저하는 보고되지 않았습니다.
여기서 중요한 결과는 엔트로피입니다. 이 편향은 모델에게 실질적인 선택권이 있을 때만 작동할 여지가 있습니다. 만약 다음에 올 올바른 토큰이 Paris 하나뿐이라면, 텍스트의 정확성을 해치지 않고는 어떤 방식도 이를 변경할 수 없습니다. Anthropic은 이를 명확히 밝히고 있습니다. 워터마킹은 "텍스트의 정확도를 떨어뜨리지 않고 선택할 수 있는 여지가 적은 사실 중심의 구절에서는 더 희소하게 나타나며", 코드의 경우 일반적으로 정확해야 하므로 "다른 형태의 텍스트보다 워터마킹이 적게 적용되는 경향"이 있습니다. 신호 밀도는 모델이 얼마나 자유롭게 선택했는지를 나타내므로, 긴 자유 형식의 산문은 강한 워터마크를 포함하는 반면 짧은 사실 중심의 답변은 거의 워터마크를 포함하지 않습니다.
위 내용에 대한 한 가지 솔직한 제한 사항이 있습니다. 2026년 8월 18일 기준으로, Anthropic은 자사 방식이 속한 계열을 공개했을 뿐 매개변수나 탐지 임계값은 공개하지 않았습니다. 이 섹션의 메커니즘은 인용된 논문들에서 가져온 것입니다. 이 내용을 Claude의 정확한 설정에 대한 설명이 아니라, Anthropic이 명시한 공개된 설계 방식으로 이해해야 합니다.
탐지가 도장이 아닌 가설 검정인 이유
탐지기는 텍스트와 키를 입력받습니다. 텍스트를 순회하며 각 위치에서 키가 어떤 토큰을 선호했을지 재계산하고, 각 토큰의 점수를 매긴 뒤 이를 합산합니다. 귀무가설은 해당 키가 적용된 샘플러 없이 텍스트가 작성되었다는 것입니다. 이 경우 점수는 동전 던지기와 유사하게 동작하며 합계는 기댓값 근처에 머뭅니다. 워터마크가 포함된 텍스트는 이 기댓값보다 높은 값을 보입니다. 출력값은 p-value이며, 이는 워터마크가 없는 텍스트에서 그만큼 높은 합계가 나올 확률을 의미합니다. "탐지됨"이라는 판정은 이 p-value를 사전에 설정한 임계값과 비교하여 결정됩니다.
이러한 설계는 실무에서 두 가지 효과를 나타냅니다. 첫째, 토큰이 추가될 때마다 약한 증거가 하나씩 더해지므로 텍스트가 길어질수록 신뢰도가 높아집니다. Anthropic은 이를 다음과 같이 설명합니다. "워터마크 탐지는 단어 선택의 폭이 좁아 정보량이 적은 짧은 샘플에서는 잘 작동하지 않습니다." 둘째, 임계값 설정은 일종의 트레이드오프입니다. 문단을 탐지할 만큼 임계값을 낮게 설정하면, 우연히 사람이 쓴 문단까지 AI가 쓴 것으로 오탐지하기 시작합니다.
현재 이 테스트를 직접 수행할 수는 없습니다. Anthropic의 게시물에 따르면 "곧 워터마크 탐지 API를 제공할 예정"이며 "구현 세부 사항을 조정하는 과정"에 있습니다. 따라서 2026년 8월 18일 기준으로 공개된 Claude 워터마크 탐지기는 없으며, Anthropic 외부의 누구도 특정 문장에 워터마크가 포함되어 있다는 주장을 확인하거나 반박할 수 없습니다.
이러한 공백은 사람들이 대신 선택하는 도구 때문에 중요합니다. 학교나 편집자에게 판매되는 상용 "AI 탐지기"는 문체 학습을 기반으로 한 분류기입니다. 이들은 키를 가지고 있지 않으며 위와 같은 테스트를 수행하지 않습니다. 이들의 실패 사례는 이미 문서화되어 있습니다. GPT 탐지기는 영어가 모국어가 아닌 작성자에게 편향되어 있다는 연구(Liang et al., Patterns, 2023)에 따르면, 널리 사용되는 탐지기들은 비원어민이 작성한 TOEFL 에세이의 절반 이상을 AI가 생성한 것으로 오분류한 반면, 원어민의 샘플은 정확하게 분류했습니다. 워터마크 탐지기와 문체 분류기는 서로 다른 기계입니다. 누군가 후자를 건네주며 전자라고 부르지 않도록 주의하십시오.
워터마크를 제거하는 방법
짧은 출력. 한 줄짜리 답변은 통계적 수치를 변화시키기에 충분한 결정 정보를 담고 있지 않습니다. 이는 구현상의 결함이 아니라 테스트 자체의 속성이므로 수정할 수 없습니다.
전면 재작성. Anthropic은 가벼운 편집으로는 워터마크가 읽힐 수 있지만, "모든 단어를 교체하는 완전한 재작성"을 수행하면 워터마크가 제거된다고 설명합니다. 단어를 교체할 때마다 해당 단어는 키(key)가 더 이상 설명할 수 없는 영역이 됩니다.
다른 모델을 통한 의역. 두 번째 모델은 자체 샘플러를 사용하여 키 없이 모든 토큰을 다시 선택합니다. 따라서 결과물에는 Claude의 워터마크가 아닌, 해당 모델에 워터마크가 있다면 그 모델의 워터마크가 남게 됩니다.
번역(단, 예외 있음). Claude가 생성한 영어 텍스트를 다른 번역기를 통해 처리하면 신호가 파괴됩니다. 새로운 샘플러가 모든 대상 단어를 새로 선택하기 때문입니다. Anthropic은 반대의 경우를 언급합니다: "Claude가 생성한 번역문에는 워터마크가 포함됩니다. 이 경우 모든 단어를 Claude가 선택하기 때문입니다."
코드의 경우. 올바른 코드는 선택 가능한 대안이 거의 없습니다. TechCrunch는 2026년 8월 15일, Anthropic이 "실제 생성되는 코드에는 영향이 미미할 것"으로 예상하며, 워터마크는 주석에 나타날 가능성이 더 높다고 보도했습니다. 이는 공식 문서가 아닌 기업 성명에 대한 언론 보도이므로, 주석에 관한 세부 사항은 확인되지 않은 정보로 간주하십시오. 주석과 식별자 이름은 패치 내에서 선택의 여지가 있는 실제 영역입니다.
파일의 메타데이터 제거. C2PA 출처 정보는 이미지 데이터 옆에 위치하므로, 파일을 재인코딩하는 모든 작업은 유지하도록 지시하지 않는 한 일반적으로 이를 삭제합니다. 여기에는 일반적인 정적 사이트 빌드 과정의 이미지 최적화 도구도 포함됩니다. Anthropic의 도움말 페이지는 워터마크가 사라지는 이유 중 하나로 메타데이터 제거를 명시하고 있습니다.
탐지된 마크가 실제로 증명하는 것
"워터마크"라는 단어가 암시하는 것보다 훨씬 적은 의미를 갖습니다. Anthropic의 게시물은 다음과 같이 단호하게 밝히고 있습니다. "워터마크는 Claude가 어떤 시점에 해당 콘텐츠에 관여했을 가능성이 높다는 점만 판단할 수 있습니다. 'Claude가 이것을 작성했다'는 것과 'Claude가 이것을 대폭 수정했다'는 것을 구분할 수 없습니다." 도움말 페이지에는 "Claude가 원작자가 아닐 수 있음"이라는 내용이 추가되어 있는데, 이는 사용자가 직접 작성한 글을 수정하기 위해 Claude를 사용하며, Claude가 손을 댄 이후에도 콘텐츠가 변경될 수 있기 때문입니다.
Anthropic이 공개한 자료 중 계정별 또는 사용자별 신호를 설명하는 내용은 없습니다. 문서화된 바와 같이, 이 마크는 Claude 모델이 관여했음을 나타낼 뿐입니다. 누군가 워터마크를 통해 어떤 사용자나 어떤 API key가 특정 문장을 생성했는지 알 수 있다고 말한다면, 2026년 8월 18일 기준 해당 주장은 1차 출처에 근거하지 않은 것입니다.
이 변경 사항이 서버에서 AI 보조 코드를 게시하는 방식에 영향을 줍니까?
코드의 경우, 기술적인 답변은 대체로 '아니요'입니다. 이미 언급된 두 가지 이유 때문입니다. 정확한 코드 내의 신호는 미약하며, 공개된 탐지 도구도 존재하지 않습니다. 게시 가능 여부를 결정하는 것은 정책이며, 정책은 변경되지 않았습니다. 오픈 소스 프로젝트들은 AI 보조 기여에 대한 자체 규칙을 작성했으며, 이러한 규칙은 탐지 도구가 토큰을 읽는 방식이 아니라 관리자가 풀 리퀘스트를 검토하여 강제합니다.
서버가 생성하는 산문(prose)의 경우, 답변은 '예'이며 한 가지 구체적인 방식에 해당합니다. API 호출이 릴리스 노트나 제품 페이지를 작성하는 경우, 그 단어들은 Claude의 것이므로 워터마크가 포함됩니다. 마크다운을 HTML로 렌더링하거나, 미니파이(minifying)하거나, 결과를 Postgres에 저장하고 CDN을 통해 제공하는 과정은 단어 자체를 변경하지 않으므로 워터마크도 그대로 유지됩니다. 워터마크를 약화시키는 것은 인간 편집자가 문장을 다시 작성하는 경우뿐입니다.
프롬프트를 통해 워터마크를 제거할 수는 없습니다. 워터마크는 모델이 생성하는 텍스트 아래의 샘플링 계층에서 적용되므로, "워터마크를 넣지 마라"와 같은 지시 사항은 적용될 대상이 없습니다. 이는 에이전트가 작성한 지시 사항을 무시하는 일반적인 이유와는 다른 상황입니다. 일반적인 경우에는 지시 사항이 모델에 도달했으나 다른 요소에 밀린 것입니다. 2026년 8월 18일 기준으로 API 고객을 위한 공식적인 거부(opt-out) 옵션은 없습니다.
Claude를 사용하여 글을 작성하는 대신 서버를 운영하는 경우, 변경되는 사항은 거의 없습니다. 셸 명령어와 설정 스니펫은 짧고 제약이 많아 신호가 거의 포함되지 않으며, 마킹과 관련된 어떠한 요소도 서버에서 실행되는 내용에 영향을 주지 않습니다. Claude를 활용한 일상적인 시스템 관리 작업은 다른 질문을 제기합니다. 즉, 무엇이 서버 외부로 나가는지에 대한 문제이며, 코딩 에이전트가 실제로 서버에서 무엇을 전송하는지를 확인하십시오.
공개해야 할 사항
공개 여부는 탐지 문제가 아니라 규칙의 문제입니다. 워터마크가 있다고 해서 공개 의무가 생기는 것은 아니며, 워터마크가 없다고 해서 의무가 면제되는 것도 아닙니다. 자신에게 적용되는 규칙이 무엇인지 파악하고, 적발 가능 여부와 관계없이 해당 규칙을 준수하십시오.
EU AI Act는 이 책임을 둘로 나눕니다. 제50조 제2항은 Anthropic과 같은 제공자에게 표기 의무를 부과하며, 이번 배포는 이 의무를 충족합니다. 제50조 제4항은 배포자에게 의무를 부과합니다. "공익과 관련된 사안에 대해 대중에게 알리기 위해" AI가 생성한 텍스트를 게시하는 사람은 해당 텍스트가 인공적으로 생성되었음을 밝혀야 합니다. 여기에는 대부분의 게시 팀이 해당하는 면제 조항이 있습니다. "AI가 생성한 콘텐츠가 인간의 검토나 편집 과정을 거쳤고, 자연인이나 법인이 해당 게시물에 대한 편집 책임을 지는 경우"가 이에 해당합니다. 두 조항 모두 2026년 8월 2일부터 적용됩니다. 편집자의 이름이 명시된 검토된 게시물은 사람이 읽지 않고 게시되는 피드와는 다르게 취급됩니다. 이는 규정 문구에 대한 해석일 뿐 법률 자문이 아닙니다.
다른 규칙들은 법보다 더 넓은 범위를 다룹니다. 고용 계약, 고객 계약, 패치를 제출하는 프로젝트의 기여 가이드, 그리고 글을 기고하는 매체의 정책은 각각 더 많은 것을 요구할 수 있습니다. 또한 이러한 규칙들이야말로 실제로 누군가가 확인하게 될 기준입니다.
공개할 때는 모델이 수행한 작업과 본인이 검증한 내용을 명시하십시오. "Claude로 초안을 작성했으며, 게시 전 모든 명령어를 깨끗한 Ubuntu 24.04 환경에서 실행하여 검증함"과 같은 문구는 기술적인 독자에게 실질적인 정보를 제공합니다. 단순히 "AI 사용됨"이라는 일반적인 배지 표시는 의미가 없습니다. 모델이 대신해 줄 수 없는 부분은 바로 검증이기 때문입니다.
또한 워터마크 결과를 비난의 근거로 사용하지 마십시오. 결과가 양성으로 나왔다면 Claude 모델이 어딘가에 관여했음을 의미하며, 여기에는 누군가의 글을 편집하는 과정도 포함될 수 있습니다. 결과가 음성으로 나왔다고 해서 아무것도 증명되지 않습니다.
FAQ
Claude의 텍스트 워터마크를 끌 수 있습니까?
2026년 8월 18일 기준으로 문서화된 해제 방법은 없습니다. Anthropic의 도움말 페이지는 Claude, Claude Platform(API), Claude Code, Claude Cowork, Claude Tag 전반에 걸친 마킹을 설명하며, 여기에는 AWS, Google Cloud, Microsoft Foundry를 통한 접근도 포함됩니다. 해당 페이지에는 이를 비활성화하는 설정이 명시되어 있지 않습니다. 모델에게 답변에 워터마크를 넣지 말라고 요청해도 아무런 효과가 없는데, 이는 마크가 사용자의 지시를 따르는 모델이 아니라 토큰을 선택하는 샘플러(sampler)에 의해 적용되기 때문입니다.
Claude가 작성한 코드에도 워터마크가 나타납니까?
거의 나타나지 않습니다. 워터마킹은 모두 허용 가능한 여러 옵션 중에서 하나를 선택하는 방식으로 작동하는데, 올바른 코드는 선택의 폭이 거의 없습니다. Anthropic은 코드가 일반적으로 정확해야 하므로 "다른 형태의 텍스트보다 워터마킹이 적게 적용된다"고 밝히고 있습니다. 2026년 8월 15일 TechCrunch는 Anthropic이 코드 자체에 미치는 영향은 미미할 것으로 예상하며, 마크는 주로 주석에 포함될 가능성이 높다고 보도했습니다. 이는 공식 문서가 아닌 성명에 대한 언론 보도입니다. 패치에서 변형의 여지가 있는 부분은 주석과 식별자 이름뿐입니다.
탐지기가 워터마크를 찾지 못하면 사람이 작성했다는 증거가 됩니까?
아니요, 이는 사람들이 워터마크와 관련하여 가장 흔히 저지르는 실수입니다. Anthropic의 자체 페이지에서도 "마크가 탐지되지 않는다고 해서 해당 콘텐츠가 AI로 생성되거나 처리되지 않았음을 의미하지는 않는다"고 명시하고 있습니다. 텍스트가 너무 짧아 테스트할 수 없거나, 수정 또는 의역되었거나, 마킹 기능이 출시되기 전의 모델에서 생성되었거나, 완전히 다른 업체의 모델에서 생성되었을 수 있습니다. 이 테스트는 단방향입니다. Claude가 관여했다는 확신을 높일 수는 있지만, Claude가 관여하지 않았음을 증명할 수는 없습니다.
의역하거나 번역하면 워터마크가 제거됩니까?
다른 모델을 통해 의역하면 워터마크가 제거됩니다. 해당 모델이 자체 샘플러를 사용하여 키 없이 모든 단어를 다시 선택하기 때문입니다. 외부 도구를 사용한 번역도 같은 이유로 워터마크를 제거합니다. 예외는 반대 방향으로 적용됩니다. Anthropic은 "Claude가 생성한 번역에는 워터마크가 포함된다. 이 경우 모든 단어를 Claude가 선택하기 때문이다"라고 밝히고 있습니다. 따라서 사용자가 직접 작성한 글을 Claude로 번역하면 이전에는 없던 마크가 추가됩니다.
문서에 Claude 워터마크가 있는지 직접 확인할 수 있습니까?
아직은 불가능합니다. 탐지에는 키가 필요하므로 텍스트를 읽거나 오프라인 도구를 사용하여 수행할 수 없습니다. Anthropic은 "곧 워터마크 탐지 API를 제공할 예정"이며 세부 사항을 작업 중이라고 밝혔으므로, 2026년 8월 18일 현재 공개된 탐지기는 없습니다. 오늘날 Claude 탐지기로 판매되는 모든 도구는 스타일 분류기(style classifier)입니다. 이는 워터마크와는 다른 메커니즘이며, 영어가 모국어가 아닌 사람들의 글에서 위양성(false positive) 문제가 발생하는 것으로 문서화되어 있습니다(Liang et al., Patterns, 2023).