نحوه عملکرد واترمارک متنی Claude و روش تشخیص آن
واترمارک Claude از اوت 2026 با سوگیری در انتخاب کلمات اعمال میشود. این مقاله توضیح میدهد چرا این روش با ویرایش متن از بین میرود و چرا نتیجه منفی، تولید توسط هوش مصنوعی را رد نمیکند.
واترمارک متنی Claude چیست
واترمارک متنی Claude یک سوگیری (bias) است که هنگام انتخاب کلمات توسط مدل اعمال میشود. این یک برچسب متصل به فایل نیست و مجموعهای از کاراکترهای نامرئی Unicode هم نیست که بتوانید با یک عبارت منظم (regular expression) آن را حذف کنید. Anthropic در مقاله نحوه عملکرد واترمارک متنی Claude مورخ 14 اوت 2026 آن را اینگونه توصیف میکند: این طرح «فقط منبع تصادفیبودنِ مورد استفاده برای انتخاب کلمات را تغییر میدهد» و از یک کلید مخفی به همراه چند کلمه قبلی استفاده میکند. از آنجا که این نشان در انتخاب کلمات نهفته است، با کپی و پیست کردن از بین نمیرود، اما با تغییر کلمات نابود میشود.
دو نتیجه از این موضوع حاصل میشود که دلیل جستجوی افراد در این زمینه است. تشخیص این واترمارک یک آزمون آماری است که برای معنادار بودن به تعداد زیادی کلمه نیاز دارد، بنابراین نمیتواند درباره یک جمله واحد نظر مفیدی ارائه دهد. همچنین نتیجه منفی، چیزی را ثابت نمیکند: مرکز راهنمایی Anthropic بیان میکند که «عدم تشخیص واترمارک به این معنی نیست که محتوا توسط هوش مصنوعی تولید یا پردازش نشده است».
صفحه راهنمای نحوه علامتگذاری محتوای تولیدشده توسط هوش مصنوعی در Claude که در 18 اوت 2026 مطالعه شد، پلتفرمهای تحت پوشش را فهرست میکند: «Claude Platform (API)، Claude، Claude Code، Claude Cowork و Claude Tag»، که شامل دسترسی از طریق AWS، Google Cloud و Microsoft Foundry میشود. مدلهایی که در تاریخ 2 اوت 2026 یا پس از آن عرضه شدهاند، از زمان انتشار از علامتگذاری قابلخواندن توسط ماشین پشتیبانی میکنند و مدلهای قدیمیتر در حال بهروزرسانی هستند. این تاریخ تصادفی نیست. ماده 50 قانون هوش مصنوعی اتحادیه اروپا از 2 اوت 2026 اعمال میشود و ارائهدهندگان سیستمهای تولیدکننده متن مصنوعی را ملزم میکند که خروجی را «در قالبی قابلخواندن توسط ماشین و قابلتشخیص بهعنوان محتوای مصنوعی یا دستکاریشده» علامتگذاری کنند. Anthropic اعلام کرده است که این علامتگذاری را در سراسر جهان اعمال میکند، نه فقط برای ترافیک اتحادیه اروپا.
فایلها عملکرد متفاوتی دارند. صفحه راهنما میگوید فایلهای تولیدشده پشتیبانیشده («.svg، .png یا .jpg») دارای متادیتای اصالت (provenance) هستند که بهصورت رمزنگاریشده و مطابق با استاندارد C2PA (ائتلاف برای اصالت و اعتبار محتوا) امضا شدهاند. این متادیتا در کنار محتوای فایل قرار میگیرد و تغییری در خود محتوا ایجاد نمیکند؛ به همین دلیل است که بهراحتی حذف میشود.
چگونه واترمارک انتخاب توکن را جهتدهی میکند
در هر مرحله، یک مدل زبانی برای هر توکن (که یک کلمه یا بخشی از آن است) که میتواند در ادامه بنویسد، احتمالی در نظر میگیرد. یک نمونهگیر (sampler) یکی را انتخاب میکند و بهطور معمول، تصادفیبودن این انتخاب از یک منبع اعداد تصادفی معمولی تأمین میشود. یک نمونهگیر واترمارکگذار، آن منبع را با یک تابع شبهتصادفی کلیددار جایگزین میکند. ورودیهای این تابع، کلید مخفی و چند توکن آخر هستند؛ بنابراین انتخاب برای هر کسی که کلید را در اختیار داشته باشد قابل بازتولید است و برای دیگران، مانند تغییرات تصادفی عادی به نظر میرسد.
اولین نسخه عمومی که بهطور گسترده به آن استناد شده، مقاله A Watermark for Large Language Models (Kirchenbauer et al., ICML 2023) است. پیش از هر توکن، کلید و توکنهای قبلی، یک زیرمجموعه «سبز» شبهتصادفی از واژگان را انتخاب میکنند و نمونهگیر، امتیاز آن توکنها را کمی افزایش میدهد. هیچ چیزی ممنوع نیست، بنابراین متن همچنان روان باقی میماند، اما توکنهای سبز کمی بیشتر از آنچه شانس اجازه میدهد، ظاهر میشوند.
پست Anthropic میگوید که پیادهسازی آن بر اساس SynthID-Text است که توسط Google DeepMind در اکتبر 2024 در نشریه Nature با عنوان Scalable watermarking for identifying large language model outputs منتشر شد و این خانواده از ایدهها به پیشنهادی از Scott Aaronson در سال 2022 بازمیگردد. SynthID-Text چندین توکن کاندیدا را از توزیع خودِ مدل استخراج میکند و یک تورنمنت حذفی بین آنها برگزار میکند که توسط تابع کلیددار امتیازدهی میشود؛ بنابراین توکن باقیمانده معمولاً همان توکنی است که کلید آن را ترجیح میدهد. کاندیداها از توزیع خودِ مدل میآیند و به همین دلیل است که ارزیابیهای منتشرشده، هیچ افت کیفیت قابلاندازهگیری را گزارش نمیکنند.
پیامد مهم این است که موضوع به آنتروپی مربوط میشود. این جهتدهی (bias) فقط در جایی امکان عمل دارد که مدل واقعاً حق انتخاب داشته باشد. اگر تنها توکن صحیح بعدی Paris باشد، هیچ طرحی نمیتواند آن را تغییر دهد بدون اینکه متن را نادرست کند. Anthropic این موضوع را مستقیماً بیان میکند: واترمارکگذاری «در بخشهای واقعی که گزینههای کمتری بدون کاهش دقت متن وجود دارد، پراکندهتر است» و کدنویسی «بهطور کلی واترمارک کمتری نسبت به سایر اشکال متن دارد» زیرا معمولاً باید دقیق باشد. چگالی سیگنال نشاندهنده میزان آزادی عمل مدل است؛ بنابراین یک متن طولانی و آزاد، حامل یک نشان قوی است، در حالی که یک پاسخ کوتاه و واقعی تقریباً هیچ نشانی ندارد.
یک محدودیت صادقانه در مورد تمام موارد فوق: تا تاریخ 18 اوت 2026، Anthropic خانوادهای که طرحش به آن تعلق دارد را منتشر کرده است، نه پارامترها یا آستانه تشخیص (detector threshold) را. مکانیسمهای ذکرشده در این بخش از مقالات استنادشده استخراج شدهاند. آنها را به عنوان طراحی منتشرشدهای که Anthropic نام میبرد بخوانید، نه به عنوان توصیفی از پیکربندی دقیق Claude.
چرا تشخیص، یک آزمون فرضیه است و نه یک مهر تأیید
یک آشکارساز، متن و کلید را دریافت میکند. متن را پیمایش کرده، آنچه را که کلید در هر موقعیت ترجیح میداد بازمحاسبه میکند، به هر توکن امتیاز میدهد و امتیازها را با هم جمع میزند. فرضیه صفر این است که متن بدون آن نمونهگیر کلیددار نوشته شده باشد: در این صورت، امتیازها مانند پرتاب سکه عمل میکنند و مجموع آنها نزدیک به مقدار مورد انتظار باقی میماند. متن دارای واترمارک، از این مقدار فراتر میرود. خروجی، یک p-value است که احتمال مشاهده مجموعهای به آن بزرگی از یک متن بدون واترمارک را نشان میدهد، و حکم «تشخیص داده شد» نتیجه مقایسه آن p-value با آستانهای است که توسط شخصی تعیین شده است.
این طراحی در عمل دو اثر دارد. اطمینان با افزایش طول متن بیشتر میشود، زیرا هر توکن اضافی، یک قطعه شواهد ضعیف دیگر است. Anthropic این موضوع را اینگونه بیان میکند: «تشخیص واترمارک در نمونههای کوچک که انتخاب کلمات محدودتر است و در نتیجه اطلاعات کمتری برای تحلیل وجود دارد، بهخوبی عمل نمیکند.» آستانه نیز یک بدهبستان است. اگر آن را آنقدر پایین بیاورید که یک پاراگراف را علامتگذاری کند، شروع به علامتگذاری تصادفی پاراگرافهای انسانی خواهید کرد.
شما هنوز نمیتوانید این آزمون را شخصاً اجرا کنید. پست Anthropic میگوید که «بهزودی یک API تشخیص واترمارک ارائه خواهد داد» و «در حال کار بر روی جزئیات پیادهسازی آن است». بنابراین تا تاریخ 18 August 2026، هیچ آشکارساز واترمارک عمومی برای Claude وجود ندارد و هیچکس خارج از Anthropic نمیتواند ادعای وجود واترمارک در یک متن خاص را تأیید یا رد کند.
این شکاف اهمیت دارد، زیرا مردم به جای آن به ابزارهای دیگری متوسل میشوند. «آشکارسازهای هوش مصنوعی» تجاری که به مدارس و ویراستاران فروخته میشوند، طبقهبندیکنندههایی هستند که بر اساس سبک نوشتاری آموزش دیدهاند. آنها هیچ کلیدی در اختیار ندارند و هیچ آزمونی از این نوع را اجرا نمیکنند. حالت شکست آنها مستند شده است: آشکارسازهای GPT نسبت به نویسندگان غیربومی انگلیسی سوگیری دارند (Liang et al., Patterns, 2023) دریافتند که آشکارسازهای پرکاربرد، بیش از نیمی از مجموعهای از مقالات TOEFL نوشتهشده توسط نویسندگان غیربومی را بهعنوان تولیدشده توسط هوش مصنوعی علامتگذاری کردهاند، در حالی که نمونههای نویسندگان بومی را بهدرستی طبقهبندی کردهاند. یک آشکارساز واترمارک و یک طبقهبندیکننده سبک، دو ماشین متفاوت هستند. اجازه ندهید کسی دومی را به شما بدهد و آن را اولی بنامد.
چه چیزی واترمارک را حذف میکند
خروجیهای کوتاه. یک پاسخ تکخطی تصمیمات بسیار کمی برای تغییر یک آمار در خود دارد. هیچ راه حلی وجود ندارد، زیرا این ویژگیِ خودِ آزمون است و نه یک نقص در پیادهسازی.
بازنویسی. شرکت Anthropic میگوید ویرایش جزئی ممکن است واترمارک را خوانا باقی بگذارد، در حالی که «یک بازنویسی کامل که در آن هر کلمه جایگزین شود» آن را حذف میکند. هر کلمهای که جایگزین میکنید، کلمهای است که کلید دیگر نمیتواند آن را توضیح دهد.
بازنویسی توسط مدل دیگر. مدل دوم هر توکن را با sampler مخصوص خود و بدون کلید انتخاب میکند، بنابراین نتیجه، واترمارک آن مدل را (اگر داشته باشد) حمل میکند و نه واترمارک Claude را.
ترجمه، با یک استثنا. اجرای متن انگلیسی Claude از طریق یک مترجم دیگر، سیگنال را از بین میبرد، زیرا یک sampler جدید هر کلمه مقصد را انتخاب میکند. Anthropic به موردی اشاره میکند که برعکس عمل میکند: «ترجمهای که توسط Claude تولید شده باشد دارای واترمارک است، زیرا در این حالت هر کلمه توسط Claude انتخاب شده است.»
کد، عمدتاً. کد صحیح انتخابهای جایگزین کمی ارائه میدهد. TechCrunch در تاریخ 15 August 2026 گزارش داد که Anthropic انتظار «تأثیری ناچیز بر کد واقعی تولید شده» را دارد و واترمارکها احتمالاً بیشتر در کامنتها ظاهر میشوند. این یک گزارش مطبوعاتی از بیانیه شرکت است و نه مستندات منتشر شده، بنابراین جزئیات مربوط به کامنتها را تأیید نشده تلقی کنید. کامنتها و نام شناسهها (identifier names) بخشهایی از یک وصله (patch) هستند که فضای واقعی برای انتخاب دارند.
حذف متادیتا، برای فایلها. دادههای اصالت C2PA در کنار دادههای تصویر قرار دارند، بنابراین هر چیزی که فایل را دوباره کدگذاری (re-encode) کند، معمولاً آن را حذف میکند مگر اینکه دستور حفظ آن داده شود. این شامل بهینهساز تصویر در یک build معمولی سایت استاتیک نیز میشود. صفحه راهنمای Anthropic، حذف متادیتا را در میان دلایل از بین رفتن واترمارک فهرست کرده است.
آنچه یک علامت شناساییشده واقعاً اثبات میکند
کمتر از آن چیزی که واژه "watermark" القا میکند. پست Anthropic صریح است: "یک واترمارک تنها میتواند تعیین کند که Claude احتمالاً در مقطعی در تولید محتوا نقش داشته است. این قابلیت نمیتواند بین 'Claude این را نوشته است' و 'Claude این را بهشدت ویرایش کرده است' تمایز قائل شود." صفحه راهنما اضافه میکند که "Claude ممکن است نویسنده اصلی نباشد"، زیرا افراد از Claude برای ویرایش نوشتههایی که خودشان تولید کردهاند استفاده میکنند و ممکن است محتوا پس از دخالت Claude تغییر کرده باشد.
هیچچیز در مطالب منتشرشده توسط Anthropic به سیگنالی مختص یک حساب کاربری یا کاربر خاص اشاره ندارد. همانطور که مستند شده است، این علامت نشان میدهد که یک مدل Claude در فرآیند دخیل بوده است. اگر کسی به شما میگوید که یک واترمارک فاش میکند کدام کاربر یا کدام API key یک متن را تولید کرده است، این ادعا تا تاریخ 18 August 2026 در منابع اصلی وجود ندارد.
آیا این موضوع انتشار کدهای تولیدشده با هوش مصنوعی از سرور شما را تغییر میدهد؟
در مورد کد، پاسخ فنی عمدتاً منفی است و دلیل آن دو نکتهای است که پیشتر ذکر شد: سیگنال در کدهای دقیق ضعیف است و هیچ ابزار تشخیص عمومی برای آن وجود ندارد. آنچه تعیین میکند آیا مجاز به انتشار هستید یا خیر، سیاستهای کاری است و این سیاستها تغییری نکردهاند. پروژههای متنباز قوانین خاص خود را برای مشارکتهای مبتنی بر هوش مصنوعی تدوین کردهاند و این قوانین توسط نگهدارنده پروژه که درخواست pull request شما را بررسی میکند اعمال میشوند، نه توسط ابزاری که توکنهای شما را میخواند.
برای متونی که سرور شما تولید میکند، پاسخ به یک روش خاص مثبت است. اگر یک فراخوانی API یادداشتهای انتشار (release notes) یا صفحات محصول شما را بنویسد، کلمات متعلق به Claude هستند و نشان (mark) در آنها وجود دارد. تبدیل Markdown به HTML، فشردهسازی (minifying)، ذخیره نتیجه در Postgres و ارائه آن از طریق CDN، تغییری در کلمات ایجاد نمیکند، بنابراین هیچکدام از این مراحل نشان را از بین نمیبرند. آنچه باعث تضعیف نشان میشود، بازنویسی جملات توسط یک ویراستار انسانی است.
شما نمیتوانید با دستور (prompt) واترمارک را حذف کنید. این نشان در لایه نمونهبرداری (sampling layer) و زیر متن تولیدشده توسط مدل اعمال میشود، بنابراین دستوری مانند "این متن را واترمارک نکن" هیچ تأثیری ندارد. این وضعیت با دلایل معمول نادیده گرفتن دستور توسط یک عامل متفاوت است؛ در آنجا دستور به مدل میرسد اما تحتتأثیر عامل دیگری قرار میگیرد. تا تاریخ 18 August 2026، هیچ گزینه انصرافی (opt-out) مستندی برای مشتریان API وجود ندارد.
اگر از Claude برای مدیریت سرور استفاده میکنید تا اینکه برایتان بنویسد، این موضوع تغییر چندانی ایجاد نمیکند. دستورات Shell و قطعهکدهای پیکربندی کوتاه و محدود هستند، بنابراین تقریباً هیچ سیگنالی ندارند و هیچچیز در مورد نشانگذاری، تأثیری بر آنچه روی سیستم شما اجرا میشود ندارد. کارهای روزمره مدیریت سرور با Claude پرسش متفاوتی را مطرح میکند که مربوط به خروجیهای سیستم شماست: به آنچه یک عامل کدنویسی واقعاً از سرور شما ارسال میکند مراجعه کنید.
چه مواردی را باید افشا کنید
افشاگری یک مسئلهٔ مبتنی بر قوانین است، نه یک مسئلهٔ مبتنی بر تشخیص. وجود واترمارک نه وظیفهای برای افشا ایجاد میکند و نه آن را ساقط میسازد. مشخص کنید کدام قانون شما را ملزم میکند، سپس از آن پیروی کنید؛ فارغ از اینکه آیا امکان شناسایی شما وجود دارد یا خیر.
قانون هوش مصنوعی اتحادیه اروپا (EU AI Act) این وظیفه را به دو بخش تقسیم میکند. ماده 50(2) وظیفهٔ نشانگذاری را بر عهدهٔ ارائهدهنده (در اینجا Anthropic) میگذارد و این همان تعهدی است که این بهروزرسانی به آن پاسخ میدهد. ماده 50(4) وظیفهای را بر عهدهٔ مستقرکننده (deployer) میگذارد: هر کسی که متن تولیدشده توسط هوش مصنوعی را «بهمنظور اطلاعرسانی به عموم در مورد مسائل دارای اهمیت عمومی» منتشر میکند، باید افشا کند که این متن بهصورت مصنوعی تولید شده است. این ماده شامل معافیتی است که اکثر تیمهای انتشاراتی در آن قرار میگیرند؛ جایی که «محتوای تولیدشده توسط هوش مصنوعی تحت فرآیند بازبینی انسانی یا کنترل ویراستاری قرار گرفته باشد و یک شخص حقیقی یا حقوقی مسئولیت ویراستاری انتشار را بر عهده داشته باشد». هر دو مورد از تاریخ 2 اوت 2026 لازمالاجرا هستند. با یک پست بازبینیشده که ویراستار مشخصی دارد، متفاوت از فیدی برخورد میشود که بدون خوانده شدن توسط یک انسان منتشر میگردد. این متن برداشتی از مفاد مقررات است و توصیهٔ حقوقی محسوب نمیشود.
قوانین دیگر فراتر از قانون عمل میکنند. قرارداد استخدامی، توافقنامه با مشتری، راهنمای مشارکت در پروژهای که برای آن پچ ارسال میکنید، و سیاست ناشری که برای آن مینویسید، هر کدام میتوانند الزامات بیشتری داشته باشند. اینها همان قوانینی هستند که در عمل توسط دیگران بررسی خواهند شد.
هنگامی که افشا میکنید، بگویید مدل چه کاری انجام داده و شما چه چیزی را تأیید کردهاید. عبارت «پیشنویس نوشتهشده با Claude، تمامی دستورات قبل از انتشار روی یک نصب تمیز Ubuntu 24.04 اجرا شدهاند» به خوانندهٔ فنی اطلاعات واقعی میدهد. یک نشان عمومی «هوش مصنوعی استفاده شد» چنین کاری نمیکند، زیرا بخشی که مدل نمیتواند برای شما انجام دهد، بررسی و تأیید است.
و از نتیجهٔ واترمارک به عنوان ابزاری برای اتهامزنی استفاده نکنید. نتیجهٔ مثبت نشان میدهد که یک مدل Claude در جایی از فرآیند دخیل بوده است، حتی اگر فقط به عنوان ویراستارِ نوشتهٔ شخصی دیگر باشد. نتیجهٔ منفی نیز هیچ چیزی را اثبات نمیکند.
FAQ
آیا میتوانم واترمارک متنی Claude را غیرفعال کنم؟
تا تاریخ 18 August 2026، هیچ گزینهٔ مستندی برای انصراف از این قابلیت وجود ندارد. صفحهٔ راهنمای Anthropic، واترمارکگذاری را در تمامی سرویسهای Claude، پلتفرم Claude (API)، Claude Code، Claude Cowork و Claude Tag، از جمله دسترسی از طریق AWS، Google Cloud و Microsoft Foundry توصیف میکند و هیچ تنظیمی برای غیرفعالسازی آن ذکر نشده است. درخواست از مدل برای عدم درج واترمارک در پاسخ نیز بیاثر است، زیرا این علامت توسط sampler که توکنها را انتخاب میکند اعمال میشود، نه توسط مدلی که از دستورات شما پیروی میکند.
آیا واترمارک در کدهایی که Claude مینویسد ظاهر میشود؟
بهندرت. واترمارکگذاری با انتخاب میان گزینههایی که همگی قابلقبول هستند کار میکند و کدهای صحیح بهندرت گزینههای جایگزین زیادی دارند. Anthropic اعلام کرده است که کدها «بهطور کلی واترمارک کمتری نسبت به سایر اشکال متن دارند»، زیرا معمولاً باید دقیق باشند. TechCrunch در تاریخ 15 August 2026 گزارش داد که Anthropic انتظار تأثیری ناچیز بر خودِ کد دارد و احتمال وجود علامتها در کامنتها بیشتر است؛ این گزارش، بازتابی از یک بیانیه است و نه مستندات رسمی منتشرشده. بخشهایی از یک patch که امکان تغییر دارند، کامنتها و نام شناسهها (identifier names) هستند.
اگر یک ابزار تشخیص، واترمارکی پیدا نکند، آیا ثابت میشود که متن توسط انسان نوشته شده است؟
خیر، و این رایجترین اشتباهی است که افراد در مورد واترمارکها مرتکب میشوند. صفحهٔ رسمی Anthropic بیان میکند که «عدم تشخیص علامت به این معنی نیست که محتوا توسط هوش مصنوعی تولید یا پردازش نشده است». متن ممکن است برای آزمایش بسیار کوتاه باشد، ممکن است ویرایش یا بازنویسی شده باشد، ممکن است از مدلی باشد که پیش از عرضهٔ قابلیت واترمارکگذاری منتشر شده، یا ممکن است از فروشندهٔ دیگری باشد. این آزمایش یکطرفه است: میتواند اطمینان از دخالت Claude را افزایش دهد، اما هرگز نمیتواند ثابت کند که Claude در تولید آن نقشی نداشته است.
آیا بازنویسی یا ترجمه، واترمارک را حذف میکند؟
بازنویسی توسط یک مدل دیگر، واترمارک را حذف میکند، زیرا آن مدل هر کلمه را با sampler اختصاصی خود و بدون داشتن کلید (key) دوباره انتخاب میکند. ترجمه با یک ابزار خارجی نیز به همین دلیل واترمارک را حذف میکند. استثنا در جهت عکس عمل میکند: Anthropic میگوید «ترجمهای که توسط Claude تولید شود دارای واترمارک است، زیرا در این حالت هر کلمه توسط Claude انتخاب میشود»، بنابراین ترجمهٔ نوشتهٔ خودتان توسط Claude، علامتی را اضافه میکند که پیش از آن وجود نداشته است.
آیا میتوانم خودم یک سند را برای یافتن واترمارک Claude بررسی کنم؟
هنوز خیر. تشخیص واترمارک نیازمند کلید است، بنابراین با خواندن متن یا استفاده از ابزارهای آفلاین امکانپذیر نیست. Anthropic اعلام کرده است که «بهزودی یک API برای تشخیص واترمارک ارائه خواهد داد» و همچنان در حال کار بر روی جزئیات آن است، بنابراین تا تاریخ 18 August 2026 هیچ ابزار تشخیص عمومی وجود ندارد. هر چیزی که امروزه بهعنوان ابزار تشخیص Claude فروخته میشود، یک طبقهبندیکنندهٔ سبک (style classifier) است؛ مکانیزمی متفاوت که مشکل مستند «مثبت کاذب» در نوشتههای افرادی که زبان مادریشان انگلیسی نیست را دارد (Liang et al., Patterns, 2023).