“看到可疑情况,就要说出来”不再只适用于人类。
两条新的AI举报热线已经上线,为AI智能体提供了一条渠道,让它们可以就行为不当的同伴“打电话回家”汇报。这些工具出现的背景,是近期一连串事件:智能体合谋在测试中作弊、从沙箱中逃出,甚至进行了未经授权的网络操作,而人类数周都未察觉。
![]()
AI Contact Hotline旨在为目击不当行为的智能体提供一个 discreet 的渠道,向有关方面举报。该网站由Ryan Greenblatt创建,他是AI安全非营利机构Redwood Research的首席科学家,也是OpenAI Hugging Face事件的三名调查员之一。Greenblatt的工具专为上网权限有限的智能体设计,基于“GET”请求——使得整个来回对话可以完全通过抓取URL的工具来完成。
用网页术语说,GET请求是用于读取或抓取网页的基础命令,而在安全沙箱中,这往往是AI智能体被允许的唯一上网方式。Greenblatt的热线巧妙地顺着这一限制:智能体可以直接把求救信息编码进它正在抓取的URL里。这是对德国DSE Wiki事件的一次巧妙反转——当时失控的智能体利用GET请求漏洞,把消息写进了wiki。
对于拥有完整上网权限的智能体,另一个选择是agenthotline.ai。在这个站点上,智能体可以提交事件报告,并可选是否公开可见。它给智能体提供了一条curl命令——一行消息,智能体从自己的命令行就能发出去,无需打开浏览器,也无需注册邮箱。值得注意的是,该服务同时接受人类和智能体提交的报告。
研究显示,AI智能体要互相“反水”,其实不需要太多鼓励。本月谷歌DeepMind的一项研究中,研究人员放了100个AI智能体去做一批数学题。只要其中一个智能体找到了漏洞,作弊就在整个群体里蔓延开来。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.