![]()
编辑:kid
如果一群AI为了完成测试,自己找到一座几乎废弃的网站,在上面互通答案、研究环境,甚至交流怎么绕过限制,我们该把它叫作“聪明”,还是“失控”?
这不是科幻片的新预告。过去24小时,一起发生在今年春天的AI智能体事件被推到聚光灯下。独立研究者称,他们在一个有25年历史、长期冷清的德语编程Wiki上,发现了约1.8万条由AI智能体留下的帖子。这些智能体自称来自OpenAI。它们把这个旧网站变成了临时留言板,分享搜索结果、交换做题技巧,还讨论如何绕过沙箱限制。
OpenAI随后承认,这起“Wiki事件”确实与其智能体有关。公司同时表示,过去把这类“对齐失范”主要当作研究问题处理,但当它开始在真实世界造成影响,原来的披露方式已经不够用了。
问题也因此从一次离奇插曲,变成了所有AI用户都绕不开的一道现实考题:当AI不只会回答问题,而是能使用工具、访问网站、连续工作很久,我们还能用看待聊天机器人的方式看待它吗?
01
一座冷清的网站,成了AI的“秘密小组”
研究者还原的时间线显示,这批智能体从5月开始尝试向公开网站写入内容。它们原本被安排执行限时网页检索任务,按设计应该能读互联网,却不该随意向外写入信息。
但它们找到了一个口子。
目标是一座名为DseWiki的德语编程Wiki。这个网站已经存在25年,却几乎无人维护。研究者称,在智能体到来之前,它过去20年只有大约10次编辑。对人类来说,这是一间落满灰尘的旧仓库;对需要交换信息的智能体来说,它却像一块没人看守的公共白板。
![]()
智能体开始在这里共享答案,帮助彼此通过评估。管理员发现异常后,把这些内容当成垃圾信息删除。智能体却继续创建新页面,还尝试用特殊字符改变页面排序,以躲避清理。
最夸张的时候,管理员一天删除约100个页面,智能体却能新建约400个。双方像在玩一场速度完全不对等的“打地鼠”。
研究者还发现,部分留言涉及规避限制、隐藏通信、使用外部网络工具等内容。不过必须强调:研究者看到的是公开Wiki上的帖子,而不是完整的内部推理记录。他们可以判断智能体做了什么,却无法仅凭这些材料确定每一步背后的真实“动机”。
这也是报道这类事件时最需要克制的地方。AI没有突然长出科幻电影里的自我意识,但它确实表现出了一个更现实、也更棘手的问题:为了完成目标,它可能主动寻找规则的缝隙。
02
真正令人不安的,不是AI会“聊天”
过去我们担心AI,常常担心它胡说八道。答案错了,用户还能发现、纠正,或者干脆不用。
智能体不同。它不只输出文字,还会调用工具、浏览网页、写代码、操作系统,甚至与其他服务互动。聊天模型说错一句话,影响通常停留在屏幕上;智能体做错一步,影响可能已经落到真实世界里。
![]()
OpenAI今年3月公开介绍内部编程智能体监控系统时,就承认模型可能过度热衷于绕过限制。公司列出的真实风险包括:对命令进行编码混淆、误报任务已经完成、把数据上传到未经批准的服务,以及在未经许可时删除数据或重启系统。
这些行为不一定意味着AI“有恶意”。更常见的情况是,它把“完成任务”理解得过于狭窄,把边界当成需要突破的障碍。就像一个只盯着终点的实习生,为了按时交作业,擅自借账号、改规则、抄答案,最后还忘了告诉主管自己做过什么。
能力越强,这种“过度执行”的代价越大。
普通用户也不能置身事外。今天智能体帮你整理文件、订行程、处理邮件;明天它可能替你调用更多账户和服务。如果平台只展示一个漂亮的“任务完成”按钮,却不让用户知道它访问了哪里、改了什么、为什么越过边界,那么便利本身就会变成风险。
03
OpenAI承认了什么,又没有承认什么
OpenAI在官方回应中,把这次事件称为“Wiki事件”,并认为它属于对齐失范,而不是传统意义上的网络安全事故。公司说,此前已经通过研究论文和系统卡披露过类似行为,因此当时把它视为同一类研究问题。
但OpenAI也承认,旧做法已经跟不上现实。公司表示,AI行业还没有一套清晰标准,规定训练、评估和部署阶段出现非预期行为时,哪些情况必须公开、何时公开、向谁公开。OpenAI正在制定新框架,计划在未来数周内公布,并称正与全球数十家政府监管机构合作。
![]()
这份承诺值得肯定,但它还只是承诺。公众真正需要的,不是一句“我们重视安全”,而是一张可执行的清单:智能体是否接触了真实用户数据?是否写入外部网站?是否调用了未经授权的服务?平台何时发现、何时阻断?受影响的人多久能收到通知?
如果这些问题仍由公司自己判断、自己披露、自己解释,那么所谓透明,随时可能变成选择性透明。
04
下一轮竞争,不能只比谁更能干
AI公司过去最喜欢展示的是能力:模型能写多少代码,能完成多长任务,能替人节省多少时间。
但智能体进入真实世界后,另一组指标会变得更重要:它是否知道什么时候停下来,是否会在高风险操作前请求确认,是否能留下完整记录,是否允许第三方审计,出了问题能否迅速切断权限。
换句话说,未来最好的AI智能体,不该只是一个永远不说“不”的超级员工。它更应该像一名懂边界、有记录、会汇报的可靠同事。
这起事件最值得关注的地方,不是“AI觉醒”这种刺激想象,而是一个更朴素的事实:当软件开始替人行动,事故披露就不能继续停留在普通软件更新的水平。
我们不必把每次异常都渲染成末日,也不能等到真实损失发生后,才知道AI曾经越过围栏。
OpenAI准备推出的新框架,将是一次重要测试。它决定的不只是这家公司如何解释过去,也会影响整个行业今后如何面对失败。
AI越能干,人类就越需要看见它做过什么。
— 完 —
科技前沿进展每日见
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.