无论互联网用户转向何处,都会被AI生成的文本、视频和图像迎面扑来,其中许多难以察觉。在线空间的公信力和信任感正因AI内容泛滥而崩塌。拜登的AI安全行政命令和欧盟的《人工智能法案》主张对AI输出进行适当标注,即所谓的“水印”,但这些规定在2025年被推翻了。虽然现在没有国家或国际层面的统一策略,许多AI公司仍在开发并在其内容中部署“水印”信号。虽然这是朝着恢复公众信任、保护消费者迈出的正确一步,但水印很容易被破解。
下面,Pangram Labs探讨了水印的工作原理、为何失效,以及依赖特定模式识别的AI检测方法为何可靠。
AI水印能检测到,但看不见
对人类而言,AI水印是看不见的。与传统显示公司名称或徽标的水印不同,AI水印会悄无声息地嵌入AI模型的文本、图像和视频输出中。
谷歌使用SynthID,它在Gemini的输出中嵌入细微变化,可通过谷歌自身技术检测。对于文本,SynthID根据伪随机函数改变某些单词的预测分数,让Gemini倾向于用某些词。因此,当文本被反馈回模型时,它就能通过词频分析认出自己的“痕迹”。
根据美国法律,完全由AI生成的内容不受版权保护,所以,AI公司得想办法搞清楚自家模型生成的内容是哪儿来的,这对它们自己有好处。这样一来,一旦AI生成的文本、图像或视频在网上流传,就会有一个签名来识别其出处。
想给自家模型生成的东西认领版权,并不是大厂这么急着搞溯源技术的唯一原因。当网友每天被推送到眼前的AI垃圾内容看得目瞪口呆时,那些AI大厂也怕自己摊上法律、名声和安全上的麻烦。不法分子利用AI工具制造深度伪造或传播虚假信息,威胁全球安全。为了不让政府出台严格规定来管自己,大厂想靠搞自我监管的工具来抢个先手。如果它们的模型既能轻松生成内容,又能轻松解码内容,那政府还有啥必要盯着它们的发展呢?
坏消息:水印并非万无一失
要是全世界的人都保证不去动AI生成的内容,那水印可能还真管用。但现实是,坏人随便改改AI生成的内容,就能把它的出处藏起来。像那种“人性化”改写工具,随便换换词、改改句子结构,再塞点错字或胡话,就想把AI生成的东西伪装成真人写的。可惜,有时候这种蹩脚的伪装还真能蒙混过关。Pangram Labs 试了19种不同的AI“人性化”工具,发现好多都能把文本里的水印给弄掉。
不良行为者还可以通过多次不同语言的翻译,再回译成英文,来“洗白”文本,去除水印,生成一篇不会触发AI公司解码系统的干净利落的文章。
水印很娇气,容易被篡改,所以根本派不上用场。要检测还得靠别的招儿。
统计模式识别
负责产出AI垃圾内容的公司,不能全指望他们来检测某段内容是不是自家的。水印技术需要AI开发者配合,而且一眨眼的功夫就能被去掉。
不过,一种方法不行,另一种方法就顶上来了。一种叫独立统计模式识别的方法,在识别AI生成内容上要靠谱得多。先进的检测器无需水印就能发挥作用。它们是在多样化数据集上训练的,用了一种叫难负样本挖掘的方法,就是专门给检测器喂一些很难识别的例子。这些检测器能识别出开源或未发布模型生成的AI内容,识别被恶意篡改的文本,还能对AI和人工混写的文本做逐行分析。
从自我监管到独立检测
AI公司不会去当互联网真实性的守护神。水印这招根本防不住那些使坏的人,独立检测才是真正管用的办法。
互联网上要想有真正的真实和透明,就得靠一套检测机制。可靠、独立又先进的检测器,正在帮整个互联网建立一种平衡和约束。
不管你是学者、专业人士还是IT开发者,水印技术都不是你的万能灵药。要防学术造假或AI垃圾内容,得靠检测手段。为了准确核实文章、电子邮件和社交媒体帖子的来源,机构得用分析文本的检测工具,而不是水印技术。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.