来源:市场资讯
(来源:新智元)
![]()
新智元报道
刚刚,ChatGPT写的字里,要开始逐词「埋暗号」了!
这套水印叫textGrain。模型每挑一个词,都会悄悄掺进一把只有OpenAI知道的密钥。
肉眼看不出任何痕迹,读起来和原来没有两样,可检测器一扫,立刻就能认出这段话是不是出自OpenAI的模型。
从此,你让AI代写的作业、简历、周报,只要原样复制粘贴,就可能被当场认出来。
![]()
划重点,这次发布最关键的有四条。
1. 即刻生效:全球API客户今天就能自行开启水印,ChatGPT和Codex也将在未来几周陆续接入。
2. 检出率高:误报率控制在1%时,一段400个token的心理学类回答,九成以上能被检出。OpenAI还放出狠话,效果追平甚至超过谷歌的SynthID。
3. 性能几乎无损:旗舰模型GPT-6 Astra加上水印后,8项核心跑分基本持平,有5项甚至略涨。
4. 检测权受控:检测器暂不对公众开放,只发给审核通过的研究者和专业机构,textGrain本身则会开源。
AI写作的「实名制时代」,正式拉开大幕。
![]()
至此,谷歌、Anthropic、OpenAI三巨头,全部给AI写的字装上了「身份证」
1781年的搬土难题,被搬进了ChatGPT
大模型写字,每次只往外吐一个词。吐之前,它会给所有候选词各打一个概率,再按概率抽一个出来。
比如「The morning was ___」(早上天气很____)后面,「warm」占30%,「cold」占25%,其余几个词分掉剩下的。
水印要做的,就是让这次抽签悄悄听密钥的话。
但有一条铁律不能破,叫「无偏」。把所有可能的密钥平均起来,每个词被抽中的概率必须和原来一模一样。
这样,不知道密钥的人看到的就是完全正常的随机文字,模型想说的话也一点没变。
![]()
当年Scott Aaronson在OpenAI做的第一版水印,满足了无偏,却留下一个毛病——
同一个问题、同一把密钥,模型每一步都会选同一个词,同一个问题问十遍,回答可能一字不差。
而textGrain的解法,则是来自一个有近250年历史的数学问题,最优传输。
它的起点,真的是「搬土」。
![]()
1781年,法国数学家蒙日琢磨过一个很具体的问题。一堆土要填进另一个坑,每一份土运到哪儿,总运费才最低。
到了20世纪40年代,苏联数学家康托洛维奇把问题放宽,一份土可以拆开运往多处,只要两头的总量对得上。搬土问题由此变成了线性规划。
康托洛维奇后来凭最优资源配置理论,和库普曼斯分享了1975年诺贝尔经济学奖。
巧的是,库普曼斯正是耶鲁的经济学家,而这篇技术报告的作者之一、耶鲁经济学家陈晓红,如今坐的就是以他命名的讲席。
再往后,2010年菲尔兹奖得主维拉尼把最优传输和几何、概率、偏微分方程打通。
2013年,Marco Cuturi引入熵正则化和Sinkhorn算法,把原本昂贵的计算大幅提速,最优传输这才成了机器学习里的常用工具。
两个多世纪后,textGrain把这条数学链条搬进了大模型。只不过这一次,被搬来搬去的换成了下一个词的概率。
![]()
textGrain的核心想法,是给水印设一笔「随机性预算」。
论文证明了一条恒等式。水印让选词和密钥之间多出来的关联,恰好等于模型平均损失掉的随机性,两边是同一个量。
水印获得多少统计关联,就要付出多少随机性,分毫不差。
于是OpenAI可以事先定好一个比例,规定水印最多花掉原本随机性的多少。比如定为0.2,平均下来至少保留八成随机性,留给回答的多样性。
![]()
具体过程,分为三步。
第一步,密钥和前文一起,把候选词随机分成几组,每组的概率加在一起。
图里的六个词被分成三组,「warm、calm」占0.40,「cold、sunny」占0.35,「mild、bright」占0.25。分组以后只需要在几个组之间分配概率即可。
第二步,OpenAI相当于准备了4套「偏心」方案,图里的4列就是这4套方案。
密钥给每个「组×方案」的格子生成一个随机分数,再用带熵约束的最优传输,借Sinkhorn算法一遍遍修正行和列,把概率尽量往高分格子上挪,挪到预算用完为止。
每套方案各偏向不同的组,4套平均下来,每组的概率仍然是0.40、0.35、0.25,谁也不偏。
第三步,密钥选中其中一套。图里选中的是第2列,「cold、sunny」这组的概率就从0.35被提到了0.69。
再在组里按原来25比10的比例挑词,写下了「cold」。
不知道密钥的人,看到的是一次正常的抽签;手握密钥的人,知道这一步本该偏向哪一组。
![]()
检测时,要回答的其实只有一个问题,这段文字的选词,是不是总「碰巧」踩中密钥指定的偏好。
普通人写的字和密钥毫无关系,每个位置的分数都是纯随机的,总分落在哪个范围,可以用一个现成的概率分布精确算出来。
而带水印的文字,则会踩在高分格子上,因此总分也会高得离谱。
整个检测只需要原文和密钥,既不用请出模型,也不用知道生成时的预算设了多少。
![]()
值得一提的是,这种水印并没把模型变笨。
GPT-6 Astra的8项基准里,5项加了水印反而略涨,掉得最多的也只有1.12个点;ChatGPT里的测试也显示,用户的「点踩率」几乎没有任何变化。
![]()
北大数院校友领衔,宾大耶鲁联手OpenAI
这份20页的技术报告,作者栏里有4位高校学者。9位作者的背景,横跨统计学、经济学、优化和机器学习。
第一作者李翔在北大读完统计学本科和博士,导师是张志华,近年专攻大模型文本水印和大模型评估,明年1月将去罗格斯大学统计系任助理教授。
宾大的龙琦是生物统计学家,中国科大少年班出身,如今执掌宾大生物医学信息学研究所。
耶鲁这边,陈晓红是美国艺术与科学院院士,曾和邹至庄一起获得2017年中国经济学奖。
温刚是耶鲁统计与数据科学系五年级博士生,北大数院本科毕业,主攻高维概率和随机矩阵,2021年起就跟着苏炜杰做研究。
![]()
OpenAI这边的作者里,Qingquan Song来自基座模型团队,是开源工具Auto-Keras的作者之一;Arzav Jain和Florent Joly都参与过ChatGPT搜索的研发。
其中,把这支队伍串起来的,是通讯作者苏炜杰。
他于今年5月正式加入 OpenAI ,同时仍是宾大沃顿商学院统计与数据科学系教授。
![]()
苏炜杰是北大数院07级,在北大时专业成绩年级第一,还拿下过首届丘成桐大学生数学竞赛全能金牌。之后,他去斯坦福读统计学博士,师从Emmanuel Candès。
他的研究横跨统计机器学习、高维推断、优化和隐私保护,ICML 2023还专门拿他提出的「保序机制」做过实验,让作者给自己的投稿排序,用来校准审稿分数。
今年2月他拿下COPSS会长奖时,颁奖词第一条写的就是生成式AI的统计基础,其中就包括水印方面的研究。
![]()
「这是我写的」,开始需要证明
原理讲完,说回大家最关心的问题,自己用AI写的东西,会不会被查出来。
原样照抄的,确实危险。几百个词连在一起,就足够让检测器认出来。
不过,能查的人眼下还不是你的老师,也不是你的HR。
根据官方通告,OpenAI的检测器只给审核通过的研究者,Anthropic的也只对监管、媒体、研究者和教育机构开放。
![]()
门虽然还没打开,方向已经很清楚。
ChatGPT每周有12亿人在用,越来越多的字出自模型,谷歌、Anthropic、OpenAI三家都选了同一条路,把出处直接写进文字本身。
两百多年前用来给土方工程算运费的数学,如今在给机器写下的字标明出处。
可水印只能证明一段话出自AI,证明不了一段话出自你。
往后,「这是我写的」这句话,可能也得拿出证据来说了。
参考资料:
https://openai.com/index/eu-text-provenance/
https://cdn.openai.com/pdf/e9508624-d767-41b6-a26d-e34ca798ada6/textgrain-entropy-calibrated-watermarking-for-language-model-text.pdf
编辑:摩西
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.