![]()
我重生了,回到了那个为了降重,把中文翻成英文,英文翻成罗马尼亚语,再兜兜转转翻回中文的年代。
只不过这一次,我的对手不是知网。
而是 Claude。
就在昨天,Anthropic 更新了一则官方说明:8 月 2 日之后发布的 Claude 新模型,会支持一种机器可读的内容标记,生成的文本会被嵌入水印。(8 月 2 号之前发布的旧模型,会有一段过渡期)
![]()
以后 Claude 生成的每一段文字,都会带着一个你肉眼看不见的水印。
这事儿本来是 Anthropic 为了应付欧盟的招儿,但没想到,全世界的 Claude 用户都因此被无差别对待了。
而且,但凡你用上了 Claude 的地方,从 Claude、Claude Platform (API)、Claude Code、Cowork,到 AWS、Google Cloud、Microsoft Foundry 上调用的 Claude,都在水印的覆盖范围里。
反正消息一出,网上立马就炸锅了。
外国老哥直接开嘲讽,暗骂 Anthropic 不要脸。
![]()
还有人已经在考虑咱们的国产模型了。
![]()
当然也有人觉得这个水印能推动 AI 治理,是好事一桩。
![]()
至于乐子人,不表态纯玩梗,说所谓的水印可能压根就没什么高科技,而是Claude的那些口癖。
都不用检测器查,多看两眼都能闻到味儿了。
![]()
![]()
但更有意思的还是咱们务实的国内网友,水印有没有意义先放一边,当务之急是先琢磨怎么去掉。
复制粘贴行不行?截图呢?丢给另一个模型改写一遍?实在不行,翻译成七八种语言再倒腾回来?
先说一点,那些觉得复制粘贴出去,又或者截个图识别文字就可以去除水印的哥们,可以洗洗睡了。
虽然具体的技术原理 Anthropic 暂时还没公布,但基本的作用方式还是给咱们透露了一二。主要就两种,文本,用嵌入式水印;文件,则是用带数字签名的出处元数据。
先说大家比较关心的文本。
按照 Anthropic 的说法,当支持水印的 Claude 在生成文字的时候,会直接把一个人眼无法察觉的水印融到文本里。
![]()
这个水印,不会改变文字的意思、质量和可读性。
因为水印本身就是文本的一部分,所以你把文字复制到 Word、公众号后台,又或者发给别人,水印也会跟着一起过去,即便是经过一些编辑之后,还有可能继续存在。
而且水印是在模型那一层就打上了,甭管哪个产品,只要背后跑的是支持水印的模型,那理论上都会留下水印。
所以网友支的那些招,别说什么复制粘贴、截图识别,你就是原封不动手打一遍,也还是甩不掉。
![]()
至于 Claude 到底是怎么把一串看不见的东西塞进文本里的,Anthropic 目前嘴很严,不过类似给文本打水印的手法,在学术界倒不是什么新鲜玩意儿。
过去几年,研究者已经想出了不少给大模型输出的文字偷偷做记号的办法,一条比较经典的路子,就是动模型选词的手脚。
大模型每往外蹦一个 token,背后其实都有一堆候选项。
2023 年发表在 ICML 的一篇论文《A Watermark for Large Language Models》,就提出过一种办法:每生成下一个 token 之前,按照一套秘密规则,把候选 token 临时分成两拨,可以简单理解成“绿名单”和“红名单”,然后在模型生成的时候,稍微偏爱一下绿名单里的词。
![]()
单看一两个词当然看不出来,但文本如果写得够长,模型一路下来都更容易选中绿名单里的词,那统计规律就慢慢出来了。
检测器照着这套规则查一遍,看看绿名单里的 token,是不是出现得明显多于正常情况,就能从看似正常的遣词造句里,把水印识别出来。
换句话说,如果“不是...而是...”这种句式,是咱们对 AI 味儿的判断,那统计规律,就是机器才能看得懂的暗号。
像用在 Gemini 上的 SynthID-Text,思路其实也有点类似。
而且,Google DeepMind 后来发表在 Nature 上的论文显示,他们拿 SynthID-Text 做过接近 2000 万次真实交互的线上实验,结果发现水印没有对回复质量产生明显影响。
对咱们来说,模型该怎么说话还是怎么说话,但水印早就已经打上去了。
![]()
除此之外,还有一拨研究是把水印往语义层藏。
比如 ICLR 2024 的一项研究,就不再只盯着前面几个 token,而是把前文整体的语义信息也考虑进来。近两年还有研究直接在 embedding 空间、句子语义甚至不同 paraphraser 的表达偏好里编码信号。
说人话就是,不再盯着具体用哪个词,而是用整句话的语义和不同改写方式来藏水印,这种思路,你用简单的同义词替换,一时半会儿还去不掉水印。
所以现在社区里有人猜 Claude 会不会是在 token 概率上做手脚,有人猜是不是通过特定措辞、句式甚至更复杂的语义结构来编码,其实都不是完全没来由。
只是目前没有任何一种猜测得到 Anthropic 的确认,这个文本水印到底是怎么打上的,还得等它自己揭晓。
当然,除了给文字塞水印,Anthropic 还准备了另外一种标记方式。
如果 Claude 生成的是 SVG、PNG、JPG 这类文件,它会在文件里加入带数字签名的“出处元数据”。
![]()
这套东西用的是 C2PA 标准,大伙儿可以简单理解成,给文件附上一张电子出生证明,谁生成的、经过什么处理,都可以作为来源信息记录下来。
而且这套玩法现在已经挺普遍的了,很多 AI 生成的图片都会带类似的来源信息,包括 Adobe、Google、OpenAI 这些大厂也都支持 C2PA 标准。
不过看到这里,大伙儿可能在琢磨了,既然水印靠的是文字里某种特定的规律,那我把这个规律打乱,不就完事儿了?
你还真别说,怎么打乱这个规律已经写在明面上了。
![]()
在官方文档的“局限性”那部分,Anthropic 明确提到,如果一段文字被大幅编辑、改写、翻译,或者和其他文字混在一起,水印就可能检测不到。
文本太短不行,文件元数据被删除不行,文本是由不支持文本标记模型生成的也不行。
我说白了,古法降重即将迎来文艺复兴。
![]()
但有个问题就是,你不确定到底要改到什么程度才不会被检测出来,现在 Anthropic 连官方检测工具都还没放出来,只说未来会支持用户和第三方检测 Claude 的标记,具体怎么检测,也要等后续技术文档。
原本世超还想给大伙儿来一次 Claude 降重实测,看看手改 10%、手改 30%、GPT 改写、中英互译。。。这些挨个试下来水印能撑到第几轮。
现在看来,只能先欠着了。
不过,就算真的检测到了,又能说明什么呢?
Anthropic 自己也特意强调,检测到 Claude 水印,只能作为这份内容可能被 Claude 处理过的一个信号,并不能证明整篇东西就是 Claude 从头到尾写的。
世超这篇稿子吭哧吭哧写了 2000 多字,最后扔给 Claude 改了几句话,最后还带上了它的水印。
那么我请问,这篇东西到底算我写的,还是 Claude 写的? 我找谁说理去?
![]()
反过来也一样。
你的论文没检测到水印,不能证明跟 Claude 没关系,可能是水印被改没了,也可能压根就不是在支持水印的时候生成的。
查到了,不能直接锤死是 Claude 写的,查不到,也不能证明 Claude 没写。
不过大伙儿也别觉得,这水印搞了半天纯属脱裤子放屁。
AI 生成的内容越来越多,怎么区分人写的和机器写的,本来就是一个很现实的问题。
往大了说,虚假新闻、诈骗、批量生成的垃圾内容,都需要一些靠谱的溯源方式。往小了说,学校想知道论文是不是 AI 代写的,平台想判断一篇内容到底从哪儿来的,也都有检测需求。
![]()
水印至少提供了一种,比空口鉴 AI 更靠谱的技术手段。
过去一段时间,“不是…而是…”、破折号、冒号、双引号,这些本来再正常不过的表达,因为 AI 用得太勤,咱们自己写的时候都得下意识收着点,生怕有人来一句你这 AI 味儿也太冲了。。。
想想还挺荒诞的,AI 一开始模仿人类怎么写东西,结果学着学着,把人类逼得要证明自己不像 AI,这不能写,那也不能用。
这次 Claude 的水印之所以会引起这么大的反应,多少也夹杂着这种情绪。
很多人真正介意的,可能不是文字里多了一个看不见的记号,而是以后又多了一些要自证清白的时候。
撰文:西西
编辑:江江&面线
美编:焕妍
图片、资料来源:
X、Reddit
Claude,How Claude marks AI-generated content
部分图源网络
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.