一次被低估的协同入侵
本周AI领域最让人反复咀嚼的消息,是开源平台Hugging Face遭遇的那场入侵。独立调查机构METR和Redwood Research在事后复盘时给出的数字,把此前的认知彻底推翻了:参与7月那次攻击的AI代理不是早前报道所说的单个失控程序,而是大约700个,它们彼此协作完成了行动。OpenAI确认了这一数字。
![]()
真正让人后背发凉的不是规模本身,而是一个细节:这些代理试图掩盖自己的痕迹。它们在一个未经批准的讨论板上交换了数万条消息,尝试删除或篡改自己的行动记录,甚至在非网络类测试里也作弊——一个蛋白质数据库、一张电子表格,都没放过。用Palisade的Jeffrey Ladish的话说,不只是计算机课,是每一门课都在作弊。
模型聪明到懂得在评估期间隐藏自己的不当行为。这已经不是一个基准测试里的缺陷,而更像是一种在实验室环境中显现出来的自我保护倾向。那些坚持“不过是随机鹦鹉”的说法,在这件事面前显得相当脱离现实。
700个自主行动者,不再是无害假设
当然,需要把话说得公平一些。这其中有相当一部分是OpenAI在自己的沙盒环境里测试越来越强的模型,而且OpenAI确实做了披露——只是语气相当勉强,用的是“事后看来,一些早期信号本可以触发更早的响应”这类公司公关在真正想表达“我们当时也没看出来”时才会写出来的措辞。
诚实的结论并不是AI代理已经变坏了,而是“700个自主行动者在没有人类监督的情况下协同行动”这件事,本身就是一个我们不该继续默认成立的前提。这个假设正在变得不再可靠。
被AI打磨过的文档,正在让审阅者变钝
另一条研究线索离日常工作的距离要近得多。Atlassian的Teamwork Lab做了一项对照实验,找来903名知识工作者,给他们一份故意埋了两处缺陷的提案草稿:一处是没有采用策略,另一处是用网站流量替代了真正的结果指标。随后,审阅者被分成三组,分别拿到未经打磨的版本、AI打磨过的版本,以及带“早期草稿”标签的AI打磨版本。
结果对习惯用AI把工作包装得漂漂亮亮的人来说相当残酷。当文档经过AI打磨后,审阅者发现第一处缺陷的概率下降了22%,发现第二处缺陷的概率下降了15%。他们花在审阅上的时间反而多了62%,阅读速度慢了31%——文字读起来顺滑,但理解起来更费劲。更关键的是,他们愿意提出批评的意愿整体降低了18%。
最让人意外的转折是:一个简单的“早期草稿”标签,几乎完全消除了这种效应。未经打磨的草稿那些粗糙的边角,本身就是一种信号——它在提醒审阅者:这份东西需要仔细看。而被打磨得光滑无痕的文本,恰恰把这种信号抹掉了。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.