Cơ chế watermarking văn bản của Claude hoạt động thế nào
Tìm hiểu cách Anthropic dùng bias để đánh dấu token đầu ra của Claude từ tháng 8/2026. Giải thích lý do tại sao kết quả kiểm tra thống kê không thể khẳng định nội dung do AI tạo.
Watermarking văn bản của Claude là gì
Watermarking văn bản của Claude là một độ lệch (bias) được áp dụng trong quá trình mô hình chọn từ. Đây không phải là một thẻ gắn vào file, cũng không phải là chuỗi ký tự Unicode ẩn mà bạn có thể loại bỏ bằng regular expression. Anthropic mô tả cơ chế này trong bài Cách hoạt động của watermarking văn bản trên Claude, ngày 14 tháng 8 năm 2026: phương thức này "chỉ thay đổi nguồn ngẫu nhiên được dùng để chọn từ", sử dụng một khóa bí mật kết hợp với vài từ đứng trước đó. Vì dấu vết nằm ngay trong các từ được chọn, nó vẫn tồn tại khi copy và paste, nhưng sẽ mất đi khi các từ bị thay đổi.
Có hai hệ quả rút ra từ đây, cũng là lý do mọi người tìm kiếm chủ đề này. Việc phát hiện là một bài kiểm tra thống kê cần một lượng từ lớn mới có ý nghĩa, vì vậy nó không thể đưa ra kết luận hữu ích nào cho một câu đơn lẻ. Và kết quả âm tính không chứng minh được gì: trung tâm trợ giúp của Anthropic nêu rõ rằng "việc không phát hiện thấy dấu vết không có nghĩa là nội dung đó không phải do AI tạo ra hoặc xử lý".
Trang trợ giúp Cách Claude đánh dấu nội dung do AI tạo ra, đọc ngày 18 tháng 8 năm 2026, liệt kê các nền tảng được áp dụng: "Claude Platform (API), Claude, Claude Code, Claude Cowork và Claude Tag", bao gồm cả quyền truy cập thông qua AWS, Google Cloud và Microsoft Foundry. Các mô hình ra mắt từ ngày 2 tháng 8 năm 2026 trở đi đều hỗ trợ đánh dấu máy có thể đọc được ngay khi phát hành, còn các mô hình cũ hơn đang trong quá trình cập nhật. Ngày đó không phải là ngẫu nhiên. Điều 50 của Đạo luật AI EU có hiệu lực từ ngày 2 tháng 8 năm 2026, yêu cầu các nhà cung cấp hệ thống tạo văn bản tổng hợp phải đánh dấu đầu ra "ở định dạng máy có thể đọc được và có thể phát hiện là được tạo ra hoặc thao túng bởi AI". Anthropic cho biết họ áp dụng việc đánh dấu này trên toàn cầu thay vì chỉ giới hạn ở lưu lượng truy cập từ EU.
Đối với các file thì cơ chế hoạt động khác biệt. Trang trợ giúp cho biết các file được tạo ra (như ".svg, .png hoặc .jpg") mang metadata về nguồn gốc được ký mã hóa theo tiêu chuẩn C2PA (Coalition for Content Provenance and Authenticity). Đó là metadata được đính kèm bên cạnh nội dung file, không phải là thay đổi đối với chính nội dung đó, đây là lý do tại sao nó rất dễ bị loại bỏ.
Cách watermark làm chệch hướng lựa chọn token
Tại mỗi bước, một mô hình ngôn ngữ tạo ra xác suất cho mọi token (một token là một từ hoặc một phần của từ) mà nó có thể viết tiếp theo. Một bộ lấy mẫu (sampler) sẽ chọn một token, và thông thường tính ngẫu nhiên cho lựa chọn đó đến từ một nguồn số ngẫu nhiên thông thường. Một bộ lấy mẫu có watermark thay thế nguồn đó bằng một hàm giả ngẫu nhiên có khóa. Các đầu vào của nó là khóa bí mật và vài token gần nhất, vì vậy lựa chọn này có thể tái lập bởi bất kỳ ai giữ khóa và trông giống như sự biến đổi thông thường đối với những người khác.
Phiên bản công khai được trích dẫn rộng rãi đầu tiên là A Watermark for Large Language Models (Kirchenbauer và cộng sự, ICML 2023). Trước mỗi token, khóa và các token đứng trước sẽ chọn một tập hợp con "xanh" giả ngẫu nhiên trong từ vựng, và bộ lấy mẫu thêm một phần thưởng nhỏ vào điểm số của các token đó. Không có gì bị cấm, vì vậy văn bản vẫn trôi chảy, nhưng các token xanh xuất hiện thường xuyên hơn một chút so với xác suất ngẫu nhiên.
Bài đăng của Anthropic cho biết việc triển khai của họ dựa trên SynthID-Text, được Google DeepMind công bố trên tạp chí Nature vào tháng 10 năm 2024 với tiêu đề Scalable watermarking for identifying large language model outputs, và rằng nhóm ý tưởng này bắt nguồn từ một đề xuất năm 2022 của Scott Aaronson. SynthID-Text rút ra một vài token ứng viên từ chính phân phối của mô hình và tổ chức một giải đấu loại trực tiếp giữa chúng, được chấm điểm bởi hàm có khóa, vì vậy token sống sót có xu hướng là token mà khóa ưu tiên. Các ứng viên đến từ chính phân phối của mô hình, đó là lý do tại sao các đánh giá được công bố không báo cáo sự sụt giảm chất lượng nào có thể đo lường được.
Hệ quả quan trọng là entropy. Độ chệch chỉ có không gian để hoạt động ở những nơi mô hình có lựa chọn thực sự. Nếu token tiếp theo đúng duy nhất là Paris, không sơ đồ nào có thể thay đổi nó mà không làm cho văn bản trở nên sai lệch. Anthropic nêu trực tiếp điều này: watermark "thưa thớt hơn ở các đoạn văn thực tế, nơi có ít lựa chọn hơn mà không làm giảm độ chính xác của văn bản", và code "thường có ít watermark hơn so với các dạng văn bản khác" vì nó thường phải chính xác. Mật độ tín hiệu theo dõi mức độ tự do của mô hình, vì vậy một đoạn văn xuôi dài mang dấu ấn mạnh mẽ trong khi một câu trả lời thực tế ngắn hầu như không có.
Một giới hạn trung thực về tất cả những điều trên. Tính đến ngày 18 tháng 8 năm 2026, Anthropic đã công bố nhóm mà sơ đồ của họ thuộc về, chứ không phải các tham số hoặc ngưỡng phát hiện. Các cơ chế trong phần này đến từ các bài báo được trích dẫn. Hãy đọc chúng như thiết kế đã công bố mà Anthropic nêu tên, không phải là mô tả về cấu hình chính xác của Claude.
Tại sao phát hiện watermark là kiểm định giả thuyết, không phải là đóng dấu xác nhận
Một bộ phát hiện (detector) nhận văn bản và key. Nó quét qua văn bản, tính toán lại những gì key đã ưu tiên tại mỗi vị trí, chấm điểm từng token, rồi cộng tổng các điểm số đó lại. Giả thuyết không (null hypothesis) là văn bản được viết mà không có sampler chứa key đó: khi đó các điểm số hoạt động giống như tung đồng xu và tổng điểm sẽ nằm gần giá trị kỳ vọng. Văn bản có watermark sẽ có điểm số lệch cao hơn mức này. Kết quả đầu ra là một p-value, tức là xác suất để thấy một tổng điểm cao như vậy từ văn bản không có watermark, và phán quyết "đã phát hiện" là kết quả so sánh p-value đó với một ngưỡng (threshold) do ai đó chọn.
Thiết kế đó có hai hệ quả mà bạn sẽ thấy trong thực tế. Độ tin cậy tăng theo độ dài văn bản, vì mỗi token bổ sung là thêm một bằng chứng yếu. Anthropic diễn đạt điều này như sau: "Việc phát hiện watermark cũng không hoạt động tốt trên các mẫu nhỏ, nơi có ít lựa chọn từ ngữ hơn và do đó có ít thông tin để dựa vào." Ngưỡng phát hiện cũng là một sự đánh đổi. Nếu đặt ngưỡng đủ thấp để gắn cờ một đoạn văn, bạn sẽ bắt đầu gắn cờ nhầm cả những đoạn văn do con người viết.
Hiện tại bạn chưa thể tự chạy kiểm định này. Bài đăng của Anthropic cho biết họ "sẽ sớm cung cấp một API phát hiện watermark" và đang "trong quá trình hoàn thiện các chi tiết triển khai". Vì vậy, tính đến ngày 18 tháng 8 năm 2026, không có bộ phát hiện watermark Claude công khai nào, và không ai ngoài Anthropic có thể xác nhận hay bác bỏ tuyên bố rằng một đoạn văn bản cụ thể có chứa watermark hay không.
Khoảng trống đó rất quan trọng vì những gì mọi người thường tìm đến thay thế. Các "bộ phát hiện AI" thương mại được bán cho trường học và biên tập viên là các bộ phân loại (classifier) được huấn luyện dựa trên phong cách viết. Chúng không giữ key và không chạy bất kỳ kiểm định nào như loại này. Chế độ lỗi của chúng đã được ghi nhận: Các bộ phát hiện GPT có định kiến chống lại những người viết tiếng Anh không phải bản ngữ (Liang và cộng sự, Patterns, 2023) đã phát hiện ra rằng các bộ phát hiện được sử dụng rộng rãi đã gắn cờ hơn một nửa số bài luận TOEFL của những người viết không phải bản ngữ là do AI tạo ra, trong khi phân loại chính xác các mẫu của người viết bản ngữ. Một bộ phát hiện watermark và một bộ phân loại phong cách là hai cỗ máy khác nhau. Đừng để bất kỳ ai đưa cho bạn cái thứ hai trong khi gọi nó là cái thứ nhất.
Điều gì loại bỏ watermark
Đầu ra ngắn. Một câu trả lời chỉ có một dòng chứa quá ít quyết định để làm thay đổi thống kê. Không có cách sửa lỗi nào, vì đây là thuộc tính của bài kiểm tra chứ không phải lỗ hổng trong quá trình triển khai.
Viết lại. Anthropic cho biết việc chỉnh sửa nhẹ có thể vẫn để lại dấu vết, trong khi "viết lại hoàn toàn với mọi từ ngữ được thay thế" sẽ loại bỏ nó. Mỗi từ bạn thay thế là một từ mà key không còn có thể giải thích được nữa.
Diễn giải qua một model khác. Một model thứ hai sẽ chọn lại mọi token bằng bộ lấy mẫu (sampler) của riêng nó và không có key, vì vậy kết quả sẽ mang dấu vết của model đó (nếu có), chứ không phải của Claude.
Dịch thuật, với một ngoại lệ. Chạy văn bản tiếng Anh của Claude qua một trình dịch khác sẽ phá hủy tín hiệu, vì bộ lấy mẫu mới sẽ chọn từng từ mục tiêu. Anthropic lưu ý trường hợp ngược lại: "Bản dịch do Claude tạo ra sẽ mang watermark, vì trong trường hợp này mọi từ ngữ đều do Claude lựa chọn."
Mã nguồn, phần lớn là vậy. Mã nguồn đúng có rất ít lựa chọn thay thế cho nhau. TechCrunch đưa tin vào ngày 15 tháng 8 năm 2026 rằng Anthropic dự đoán "ảnh hưởng không đáng kể đến mã nguồn thực tế được tạo ra", với các dấu vết có khả năng xuất hiện trong phần comment nhiều hơn. Đó là bản tin báo chí về tuyên bố của công ty chứ không phải tài liệu chính thức, vì vậy hãy coi chi tiết về phần comment là chưa được xác nhận. Comment và tên định danh (identifier) là những phần của bản vá có khả năng thay đổi thực sự.
Loại bỏ metadata, đối với tệp tin. Nguồn gốc C2PA nằm bên cạnh dữ liệu hình ảnh, vì vậy bất kỳ thao tác nào mã hóa lại tệp tin thường sẽ loại bỏ nó trừ khi được yêu cầu giữ lại. Điều này bao gồm cả trình tối ưu hóa hình ảnh trong quá trình build trang web tĩnh thông thường. Trang trợ giúp của Anthropic liệt kê việc loại bỏ metadata là một trong những lý do khiến watermark bị mất.
Dấu hiệu được phát hiện thực sự chứng minh điều gì
Ít hơn những gì từ "watermark" (dấu chìm) gợi ý. Bài đăng của Anthropic nói thẳng: "Một watermark chỉ có thể xác định rằng Claude có khả năng đã tham gia vào nội dung tại một thời điểm nào đó. Nó không thể phân biệt được 'Claude đã viết nội dung này' với 'Claude đã chỉnh sửa nội dung này rất nhiều'." Trang trợ giúp bổ sung rằng "Claude có thể không phải là tác giả gốc", vì người dùng sử dụng Claude để chỉnh sửa văn bản do chính họ tạo ra, và nội dung đó có thể đã thay đổi sau khi Claude can thiệp.
Không có tài liệu nào được Anthropic công bố mô tả tín hiệu theo từng tài khoản hoặc từng người dùng. Dấu hiệu này, như đã được ghi nhận, chỉ cho thấy một model Claude đã tham gia. Nếu ai đó nói với bạn rằng watermark tiết lộ người dùng hoặc API key nào đã tạo ra một đoạn văn bản, thì tuyên bố đó không có trong các nguồn tài liệu chính thống tính đến ngày 18 tháng 8 năm 2026.
Việc này có thay đổi cách xuất bản code có hỗ trợ bởi AI từ máy chủ của bạn không?
Đối với code, câu trả lời kỹ thuật phần lớn là không, vì hai lý do đã nêu: tín hiệu trong code chính xác rất yếu và không có công cụ phát hiện công khai nào tồn tại. Điều quyết định việc bạn có được phép xuất bản hay không là chính sách, và chính sách thì không thay đổi. Các dự án mã nguồn mở đã tự viết quy định riêng cho các đóng góp có hỗ trợ bởi AI, và các quy định đó được thực thi bởi người bảo trì (maintainer) khi đọc pull request của bạn, chứ không phải bởi một công cụ phát hiện đọc các token của bạn.
Đối với văn bản do máy chủ của bạn tạo ra, câu trả lời là có, theo một cách cụ thể. Nếu một API call viết ghi chú phát hành (release notes) hoặc trang sản phẩm của bạn, thì các từ ngữ đó là của Claude, vì vậy dấu hiệu nằm trong đó. Việc render markdown sang HTML, minify, lưu kết quả vào Postgres và phục vụ từ CDN đều không làm thay đổi từ ngữ, nên tất cả chúng đều không làm thay đổi dấu hiệu. Điều làm suy giảm dấu hiệu là việc biên tập viên con người viết lại các câu.
Bạn không thể dùng prompt để loại bỏ watermark. Nó được áp dụng ở tầng lấy mẫu (sampling layer), bên dưới văn bản mà model tạo ra, vì vậy một chỉ dẫn như "không watermark nội dung này" không có tác dụng gì cả. Đây là tình huống khác với các lý do thông thường khiến một agent phớt lờ chỉ dẫn bạn viết, nơi mà chỉ dẫn đã đến được model nhưng bị một yếu tố khác lấn át. Không có tùy chọn từ chối (opt-out) nào được ghi nhận cho khách hàng sử dụng API tính đến ngày 18 tháng 8 năm 2026.
Nếu bạn sử dụng Claude để vận hành máy chủ thay vì để viết nội dung cho bạn, điều này thay đổi rất ít. Các lệnh shell và đoạn cấu hình thường ngắn và bị giới hạn, nên chúng hầu như không chứa tín hiệu, và không có gì liên quan đến việc đánh dấu ảnh hưởng đến những gì chạy trên máy của bạn. Công việc quản trị hệ thống hàng ngày với Claude đặt ra một câu hỏi khác, đó là những gì rời khỏi máy của bạn ngay từ đầu: xem những gì một coding agent thực sự gửi ra khỏi máy chủ của bạn.
Những điều bạn cần công khai
Công khai là vấn đề tuân thủ quy định, không phải vấn đề phát hiện kỹ thuật. Watermark không tạo ra nghĩa vụ công khai, và nó cũng không miễn trừ nghĩa vụ đó. Hãy xác định quy tắc nào ràng buộc bạn, sau đó tuân thủ quy tắc đó bất kể có ai phát hiện ra hay không.
EU AI Act chia trách nhiệm thành hai phần. Điều 50(2) đặt nghĩa vụ đánh dấu lên nhà cung cấp, tức là Anthropic, và đây là nghĩa vụ mà bản cập nhật này đáp ứng. Điều 50(4) đặt nghĩa vụ lên người triển khai: bất kỳ ai xuất bản văn bản do AI tạo ra "để thông báo cho công chúng về các vấn đề lợi ích công cộng" đều phải công khai rằng nội dung đó được tạo ra bằng AI. Quy định này có một ngoại lệ mà hầu hết các nhóm xuất bản đều thuộc diện áp dụng, đó là khi "nội dung do AI tạo ra đã trải qua quá trình con người xem xét hoặc kiểm soát biên tập và khi một cá nhân hoặc pháp nhân chịu trách nhiệm biên tập cho ấn phẩm đó". Cả hai đều có hiệu lực từ ngày 2 tháng 8 năm 2026. Một bài viết đã qua kiểm duyệt với biên tập viên cụ thể sẽ được xử lý khác với một nguồn cấp dữ liệu tự động xuất bản mà không có người đọc. Đây là cách hiểu văn bản quy định và không phải là tư vấn pháp lý.
Các quy tắc khác có phạm vi rộng hơn luật định. Hợp đồng lao động, thỏa thuận khách hàng, hướng dẫn đóng góp của dự án mà bạn gửi patch, và chính sách của nhà xuất bản mà bạn viết bài đều có thể yêu cầu nhiều hơn thế. Đó cũng là những quy tắc mà người khác sẽ thực sự kiểm tra.
Khi bạn công khai, hãy nêu rõ model đã làm gì và bạn đã xác minh những gì. "Bản nháp được viết bằng Claude, mọi lệnh đã được chạy trên bản cài đặt Ubuntu 24.04 sạch trước khi xuất bản" cung cấp thông tin thực tế cho người đọc kỹ thuật. Một huy hiệu chung chung kiểu "AI đã được sử dụng" thì không, vì phần mà model không thể làm thay bạn chính là khâu kiểm tra.
Và đừng dùng kết quả watermark làm bằng chứng buộc tội. Kết quả dương tính chỉ cho biết model Claude có tham gia vào đâu đó, bao gồm cả việc làm biên tập viên cho bài viết của chính người dùng. Kết quả âm tính thì không có ý nghĩa gì cả.
FAQ
Tôi có thể tắt watermark văn bản của Claude không?
Tính đến ngày 18 tháng 8 năm 2026, không có tùy chọn nào được ghi nhận để tắt tính năng này. Trang trợ giúp của Anthropic mô tả việc đánh dấu trên Claude, Claude Platform (API), Claude Code, Claude Cowork và Claude Tag, bao gồm cả quyền truy cập thông qua AWS, Google Cloud và Microsoft Foundry, và không đề cập đến bất kỳ cài đặt nào để vô hiệu hóa nó. Việc yêu cầu model không chèn watermark vào câu trả lời cũng không có tác dụng, vì dấu hiệu này được áp dụng bởi sampler chọn token, chứ không phải do model thực hiện theo chỉ dẫn của bạn.
Watermark có xuất hiện trong code do Claude viết không?
Rất ít. Watermarking hoạt động bằng cách chọn giữa các tùy chọn đều chấp nhận được, và code chính xác hiếm khi có nhiều lựa chọn thay thế. Anthropic cho biết code "thường có ít watermark hơn so với các dạng văn bản khác" vì nó thường yêu cầu sự chính xác tuyệt đối. TechCrunch đưa tin vào ngày 15 tháng 8 năm 2026 rằng Anthropic dự đoán tác động lên chính đoạn code là không đáng kể, các dấu hiệu có khả năng xuất hiện trong phần comment nhiều hơn; đây là báo cáo báo chí về một tuyên bố thay vì tài liệu chính thức được công bố. Các phần của một bản patch có khả năng thay đổi là comment và tên định danh (identifier names).
Nếu công cụ phát hiện không tìm thấy watermark, liệu có chứng minh được là con người viết không?
Không, đây là sai lầm phổ biến nhất mà mọi người mắc phải với watermark. Trang chủ của Anthropic nêu rõ "việc không phát hiện thấy dấu hiệu không có nghĩa là nội dung đó không phải do AI tạo ra hoặc xử lý". Văn bản có thể quá ngắn để kiểm tra, có thể đã được chỉnh sửa hoặc diễn giải lại, có thể đến từ một model được phát hành trước khi tính năng đánh dấu được triển khai, hoặc có thể đến từ một nhà cung cấp khác hoàn toàn. Bài kiểm tra này chỉ có giá trị một chiều: nó có thể làm tăng độ tin cậy rằng Claude đã tham gia, nhưng không bao giờ có thể chứng minh rằng Claude không tham gia.
Việc diễn giải lại hoặc dịch thuật có xóa được watermark không?
Diễn giải lại thông qua một model khác sẽ xóa được watermark, vì model đó chọn lại từng từ bằng sampler riêng của nó mà không có key. Dịch thuật bằng một công cụ bên ngoài cũng xóa được watermark vì lý do tương tự. Ngoại lệ xảy ra theo hướng ngược lại: Anthropic cho biết "bản dịch do Claude tạo ra sẽ mang watermark, vì trong trường hợp này mọi từ ngữ đều do Claude chọn", do đó việc dịch văn bản của chính bạn bằng Claude sẽ thêm vào một dấu hiệu vốn không tồn tại trước đó.
Tôi có thể tự kiểm tra tài liệu xem có watermark của Claude không?
Chưa thể. Việc phát hiện cần có key, vì vậy không thể thực hiện bằng cách đọc văn bản hoặc sử dụng bất kỳ công cụ offline nào. Anthropic cho biết họ "sẽ sớm cung cấp API phát hiện watermark" và vẫn đang hoàn thiện các chi tiết, vì vậy tính đến ngày 18 tháng 8 năm 2026, chưa có công cụ phát hiện công khai nào. Bất kỳ thứ gì được bán hiện nay dưới danh nghĩa công cụ phát hiện Claude đều là bộ phân loại phong cách (style classifier), một cơ chế khác với vấn đề dương tính giả đã được ghi nhận trên các bài viết của những người không sử dụng tiếng Anh là ngôn ngữ mẹ đẻ (Liang et al., Patterns, 2023).