一个智能体在演示里能给出令人信服的回答。尤其是当问题清晰、文档是最新的、少数几个工具完全按预期运行时,它的回应往往看起来真的有用。这让所有观看者立刻感到惊叹,也对系统在演示之外的表现产生了过多的信心。
然后用户问了一个和演示里很接近、但措辞略有不同的问题。账户记录不完整,某个工具返回了错误,政策上周刚改过。或者智能体触碰到了能力边界——它能读取发票,却无法修改它。真正的工作往往从这里才开始。
![]()
演示之外,智能体项目要难得多
大多数智能体项目比演示所暗示的要困难得多。模型只是服务的一部分,智能体缰绳是其余部分——也就是应用围绕模型搭建的脚手架,用来向模型输送正确的输入并检查它的输出,帮助在失败扩散之前就抓住问题。开发者已经从测试缰绳里熟悉了这个概念:测试缰绳把代码包起来,让它在受控条件下运行。生产环境中的智能体需要同样的包装,这样它才能决定智能体看到什么数据、可以执行哪些动作,以及在必需的事实缺失时会发生什么。
好的模型输出很重要,但它并不能证明一个智能体已经准备好承担真实工作。证明这一点是缰绳的职责:工具契约限制一次错误调用能造成的影响,权限在模型之外强制执行,即使某条指令试图绕过它们;上下文路径和追踪记录让团队真正可以检查;测试则从用户最先会遇到的失败中构建出来。把这些做对,演示里的魔法才会开始在生产环境中存活下来。
模型没有运行上下文
语言模型可以对应用发送给它的任何内容进行推理,但它并不会自带对你业务系统的理解。它无法知道一条记录是否是最新的,或者某个动作是否需要审批,除非周围的系统把这些规则交给它。
设想两个支持智能体。一个根据知识库起草回复。另一个读取账户记录、检索该账户的政策,并把一个例外情况送入审核队列。第二个需要的远不止一个更好的提示词。
许多生产故障也正发生在这里——发生在模型与周围系统之间的交互中。基准分数可以衡量回答质量,但它不会告诉你智能体拉取了错误的客户账户,或者在必需的工具失败后仍然继续运行。
关键是把模型当作缰绳中的一个单独组件。模型提供推理,缰绳则提供模型自身并不具备的边界。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.