过去一年,随着大模型推理能力持续提升,人工智能正在从“生成内容”走向“执行任务”。从代码生成、数据分析,到文档处理、业务审核,智能体开始进入企业应用场景,并展现出改变工作流程的潜力。
但从实验环境走向真实生产流程,智能体面临的问题也逐渐显现。企业需要的并不是一个偶尔能够完成任务的AI,而是一个能够长期稳定运行、结果可判断、过程可追溯的智能系统。
换句话说,未来智能体竞争的核心,不只是“谁更聪明”,而是谁能够获得企业持续授权。而这背后,一个关键问题仍未解决:面对大量没有标准答案的复杂业务任务,企业如何确认智能体完成的结果是否正确?
代码可以通过测试,数学题拥有标准答案,但现实世界中的大量业务任务往往缺少天然评价机制。当智能体开始自主规划、调用工具并执行任务,如何建立可信的验证体系,成为其规模化落地的重要前提。
围绕智能体当前发展阶段、核心瓶颈以及企业部署路径等问题,我们专访了澳门大学信息学院教授、博士生导师黄辉。
![]()
从能力展示到可靠执行
智能体仍需跨越稳定性挑战
“局部核心能力已经很强,但稳定的长期自主性仍不可靠”,这是黄辉对当前智能体发展阶段的总体判断。
在数学、代码、数据分析等边界清晰的任务中,大模型已经展现出较强能力。但进入真实业务环境后,企业关注的问题正在发生变化:智能体不仅需要完成任务,更需要保证结果可靠、过程可追溯。
黄辉指出,当前智能体最大的挑战并非单点能力不足,而是在复杂任务执行过程中,系统能否保持稳定。
“模型未必想不出策略,问题往往出在执行环节——它能不能忠实地走完一长串逻辑步骤。”在他看来,智能体执行长流程任务时,早期规划偏差、信息变化、工具调用异常等因素,都可能导致任务不断偏离目标。因此,真正可靠的智能体,不仅需要具备规划能力,更需要具备发现错误、调整路径和重新执行的能力。
他提到,智能体能够独立完成的任务时长正在快速提升,但推动这一变化的并不仅是模型推理能力增强,更是状态管理、反馈机制和工程体系不断完善。
可验证性
成为智能体进入生产环境的关键条件
随着智能体能力不断提升,行业关注点也正在发生变化。
过去,大模型竞争更多围绕参数规模、推理能力展开;而进入智能体阶段,企业更关心的是:这个系统是否能够被放心地接入业务流程。
黄辉认为,限制智能体规模化应用的核心瓶颈,是任务的可验证性。“核心问题不是能不能生成一个看起来合理的答案,而是我们能不能确认它的结果是否正确,如果是错误的成果,是否可以及时发现。”
智能体执行任务通常需要经过多个步骤,即使单个环节准确率较高,随着任务链条不断延长,错误也可能逐步累积,并最终影响整体结果。
更重要的是,智能体进入生产环境后,错误的影响也发生变化。聊天模型输出错误信息,更多带来的是信息风险;而智能体连接企业系统并执行任务后,错误可能进一步转化为真实业务风险。
因此,可验证性并不是智能体的附加能力,而是其进入生产环境的基础条件。
除了结果验证,黄辉还指出,长流程任务中的上下文管理也是智能体稳定运行的重要挑战。如果主要依赖聊天上下文保存执行信息,随着任务复杂度提升,容易出现信息遗漏和上下文污染,行业正在探索更加结构化的记忆管理方式。
从自主执行到可信运行
智能体仍需工程体系支撑
随着智能体逐渐进入真实业务场景,行业对于其能力边界也需要重新认识。
黄辉认为,当前智能体的发展仍存在一定认知偏差:一些能力在演示环境中已经表现突出,但距离长期稳定运行的生产级系统,仍需要补齐工程体系。
在他看来,目前行业对智能体能力的期待,主要集中在三个方面。
首先,是对长期自主工作的期待。演示里连续跑几十步并不难,难的是把流程运行一万次以后仍然稳定,出了问题还能恢复和追责。
其次,是对模型自我纠错能力的期待。黄辉认为,让模型重新检查自己的输出,并不一定能够真正发现错误,有时甚至可能改变原本正确的答案。因此,可靠的纠错仍需要依靠代码测试、规则校验以及人工反馈等外部机制。
第三,是对多智能体协同能力的期待。多个智能体并不天然比一个智能体更聪明,它们也会互相传递错误、重复讨论,甚至不知道什么时候该停。对多个多智能体框架的系统研究也把信息错位和终止机制缺失列为常见失败来源
相比这些容易被关注的能力,黄辉认为,真正支撑智能体进入生产环境的,是上下文管理、工具调用、外部验证、可观测性等工程能力以及人机协作。
“短期最有价值的形态,往往不是完全替代一个岗位,而是让AI负责搜索、整理、生成候选方案和执行低风险步骤,由人负责目标设定和异常判断。”
编排与数据
正在成为企业AI竞争的新资产
对于正在考虑部署智能体的垂直行业企业,黄辉建议,先想清楚自己到底要在AI系统的哪一层投入,而不是急着自研大模型。购买或采用成熟基础模型,把精力投入到编排和集成,把专有数据与评估能力沉淀在自己手里往往更好。
在他看来,真正决定差异化的是编排层(即智能体如何思考如何调用工具、如何管理记忆)和最上层的行业集成。
黄辉指出“对大多数垂直企业来说,基础模型正在快速商品化,真正有价值、也难以复制的资产通常是行业数据知识与规则,以及能够持续评估真实任务的测试集。”
落地路径上,黄辉建议企业从具体业务流程切入。
首先选择高频、结果可判断、价值可量化的任务,从历史业务中提取真实案例,覆盖正常情况和边界情况,再结合通用模型、检索、规则和工具编排进行验证。只有明确通用模型确实无法满足要求后,再考虑模型优化或自研。
与此同时,企业也要理性判断是否真的需要智能体。如果流程高度固定、规则明确,传统软件或自动化工具可能依然更适合。黄辉提醒,目前市场上也存在将聊天机器人或固定自动化流程重新包装为“智能体”的情况。
判断企业是否需要AI,最终要看它能不能在可接受的风险下,持续改善一个已经定义清楚的业务指标。
2026:智能体进入可信执行阶段
随着大模型进入应用阶段,人工智能竞争正在发生变化。过去几年,行业关注的是模型有多强;未来,竞争重点将转向AI系统能否真正进入业务流程。
但从市场数据来看,却呈现“快增长、低渗透”——工业AI智能体市场规模从2025年的约148亿元增长到2026年的约204亿元,渗透率仅从约7.4%升至7.9%。这说明行业热度和投入都在上升,但真正深入生产流程的比例仍然不高。
黄辉认为,2026年是Chat对话的辅助范式正在让位于Agent能办成事的执行范式的一年,而行业级信任,即完全让Agent自己去自主执行完全放权的终极目标,不会由漂亮演示和benchmark(基准测试)建立,只能靠一个个边界清晰、结果可验证的场景最终转化为实际经济价值去体现。
总结
从智能体发展路径来看,当前产业正在经历从能力突破到价值验证的关键阶段。模型能力决定了AI的可能性,而工程体系、验证机制和应用场景则决定了这些能力能否真正转化为生产力。黄辉的判断也提示行业,智能体的未来并不只是让AI完成更多任务,而是建立一套能够被理解、被验证、被信任的运行体系。当AI真正具备稳定交付价值的能力,智能体才会从技术探索走向产业普及。
谭欣迟 红星新闻记者 李伟铭
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.