AI智能体(AI Agent)在实际应用中频繁出错,根源往往不在模型本身,而在于一个被长期忽视的环节——上下文获取(Context Acquisition)。一篇新论文首次为这个问题定义了目标函数,让智能体的提问行为有了可量化的最优标准。
论文作者指出,当前AI智能体暴露出的诸多问题,包括幻觉(Hallucination)、成本浪费、工具调用不可靠等,很大程度上源于大语言模型(LLM)对任务假设的错误判断。而这一切的起点,是用户提问时常常遗漏关键约束条件。
![]()
上下文获取为何成了"事后补救"?
当用户没有给出完整约束时,智能体只能靠猜。它要么默认一个假设,要么消耗额外的Token去追问澄清问题、发起检索调用、执行工具调用,甚至反复试错。这些行为在现有架构中缺乏统一的优化目标,导致智能体在信息不足时表现飘忽。
论文的核心贡献,是把上下文获取重新定义为"对潜在任务状态的主动推断"(Active Inference over a Latent Task State)。这个框架包含两层循环:内层步骤负责更新信念(Belief),外层步骤则决定下一步动作——是继续获取上下文、执行任务动作,还是直接停止。决策依据是"在成本约束下最小化预期自由能"(Minimize Expected Free Energy under Cost)。
确定性场景下的直接落地路径
在确定性环境中,论文中的认知项(Epistemic Term)可以简化为"预期信息增益"(Expected Information Gain),并可选地按Token成本进行归一化处理。这意味着,这一评分规则在当前技术条件下就能直接实现,不需要等待新的模型架构或推理范式。
研究者将这套方法命名为"最优提问"(Optimal Question Asking)。他们利用精确后验(Exact Posteriors)和动态规划预言机(Dynamic Programming Oracle)构建了理论基准,并在25到300个候选任务的二分类和多分类场景中,对当前前沿模型进行了系统评测。
衡量你的智能体与理论最优的差距
这套基准的核心价值在于:它让开发者第一次能够量化自己的智能体与理论最优之间的差距。过去,我们只能凭感觉判断一个智能体"够不够聪明",现在则有了一个明确的度量标尺。
论文作者认为,如果上下文获取问题得到解决,即便是现有的LLM,其整体性能和效率也会获得显著提升。这一判断基于一个朴素观察:大量推理错误并非源于模型能力不足,而是源于输入信息的不完整或误导。
用户习惯与系统设计的错配
论文特别强调了一个现实困境:用户倾向于在提示词(Prompt)中省略约束条件。这种习惯短期内难以改变,因此智能体必须学会在信息不完整的情况下做出更聪明的决策——要么主动追问,要么在检索和工具调用之间做出更优选择。
当前主流智能体框架把上下文获取当作一个附属环节,缺乏系统性的优化目标。这篇论文试图扭转这一思路,将其提升为与任务执行同等重要的核心问题。
从理论到实践的桥梁
值得注意的是,论文提出的评分规则并不依赖特定的模型架构,这意味着它可以作为现有智能体系统的一个独立模块接入。对于正在构建AI智能体的团队来说,这套方法提供了一个可操作的优化方向:在每次上下文获取动作之前,先计算预期信息增益与Token成本的比值,再决定是否值得执行该动作。
论文的评测范围覆盖了从25到300个候选任务的多种场景,为不同复杂度的应用提供了参考基准。研究者还公开了论文全文(arxiv.org/abs/2608.19202),供技术社区进一步验证和扩展。
智能体性能提升的新视角
这篇论文的价值,不仅在于提出了一个理论框架,更在于它把"提问"这一看似简单的行为,变成了一个可计算、可优化、可基准测试的工程问题。对于饱受幻觉和低效困扰的智能体开发者而言,这或许是一个值得关注的突破口。
当上下文获取从"事后补救"变成"主动推断",智能体的行为模式将发生根本性变化。它不再是被动等待完整指令,而是在信息不完备时主动寻求最优信息路径。这种转变,可能比单纯提升模型参数更能带来实际体验的提升。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.