上个月,我合并了一个AI智能体写的bug修复。它看起来没问题,智能体说测试全部通过,我随手就部署了。两个小时后,生产环境剧烈告警。真正的问题不是智能体做错了,而是我什么都没验证,只是出于习惯信任了它。
问题不在于“智能体能不能做事”,而在于“智能体能不能证明自己做的事”。如今每个多智能体框架都在解决同一个问题:让智能体之间互相沟通。MCP让智能体连接工具,A2A让智能体连接智能体,LangChain、CrewAI、AutoGen则负责编排整个流程。工具链很强大,但有一个关键环节始终没人解决。
当2号智能体说“我已经审查过补丁”或“测试已通过”时,协议层面没有任何办法验证这句话。3号智能体只能选择信任2号智能体,中间件只能信任它们两个,而你,最终的人类,只能信任整条流水线。这种信任在演示环境里没问题,在生产环境里就是定时炸弹。
我在复盘时反复被三个问题折磨。第一个问题:这个操作到底有没有被授权?智能体不应该自己决定执行rm -rf,也不应该自己决定推送生产环境。每一次工具调用都应该携带机器可验证的证明,证明某个明确角色在范围内、在配额内说过“可以”。
第二个问题:从补丁到测试结果,是否存在一条完整的因果链?如果智能体说“我测过这个补丁,测试通过了”,那么我应该能一路回溯:测试任务对应哪个补丁,这个补丁经过谁的授权,授权背后是哪个工单。整个链条不能有断点,不能靠“我发誓”来填补。
第三个问题也是最苛刻的:第三方能否不信任任何人完成验证?如果验证一个智能体的工作,需要登录它的机器、翻它的日志、信任它的中间件,那说明你并没有真正验证,你只是把信任从一处搬到了另一处。真正的验证协议应该允许独立的一方只凭证据包和公钥,离线重放整条证据链。
基于这些思考,我构建了OpenWorkProof,一个位于协议层的验证方案。它让智能体的每个动作、每条声明都可以被独立检查,而不是仅仅被相信。多智能体协作真正需要的不是更多对话,而是可验证的证据。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.