来源:市场资讯
(来源:AI科技评论)
本篇介绍了关于企业智能体管理的方法论思考。文章并非从技术实现角度出发,而是从组织管理的原点——“个人变快了,组织为什么没有变聪明”——切入,提出了一套将AI智能体纳入企业现有管理体系的系统框架。作者王宁为清华大学工学学士、硕士,清和乐章(北京)文化科技有限公司创始人、CEO。
9月17日,王宁将在合肥以“新一代Agent如何重写企业的成本曲线、组织边界和人才结构”为题分享,详情>>报名丨清数科创·AI+会客厅:Agent实战专场
![]()
员工电脑里的智能体越装越多,个人确实变快了,组织却没有因此变得更聪明。真正缺的,是一套把智能组织起来、管理起来、验证起来的系统——Harness。
01
员工电脑里的智能体
去年下半年开始,很多企业集中做了一件事:给员工装桌面AI助手。统一采购的有,IT部门内测后推广的有,老板在群里转个链接让大家"都用起来"的也有。
装完那几周,确实热闹。写周报从半小时缩到五分钟,三十页的行业报告丢进去两分钟出摘要,PPT初稿也能生成个七八成。群里开始有人晒截图,说"这东西真香"。
三个月后,安静下来了。
不是工具不好用。个人层面的提效是真实的——每个人手边多了一个反应快、不抱怨、随时在线的助手。但回头看组织层面,开会还是那么多,跨部门协作还是那么慢,客户投诉的处理周期没有缩短,报价出错率没有下降。
个人变快了,组织没有变聪明。
仔细看,卡点至少有四层。
第一层,方法留在个人账号里。每个人摸索出来的提示词、参考资料、判断习惯,全在自己的对话窗口里。同事看不到,主管不知道,人一离职,经验就跟着走了。组织让一百个人各自训练了一百套用法,最后什么也没留下。
第二层,数据接不进去。个人智能体能处理的,是能复制粘贴进对话框的东西。真正值钱的业务数据在ERP里、在CRM里、在生产系统里、在需要权限才能打开的内部平台里。智能体够不着这些数据,就只能在外围打转——润色邮件可以,根据客户历史订单生成报价方案,做不到。
第三层,任务流不起来。一个人的活儿变快了,但业务是串起来的。采购等审批、销售等报价、客服等工单流转——这些跨部门的等待、传递和交接,个人工具碰不了。你用AI五分钟写完了方案,然后在OA里等了三天。
第四层,结果没法验证和追溯。智能体给了一个答案,依据是什么?引用了哪些数据?中间做了哪些判断?如果出了错,是哪一步出的?这些问题在个人工具里几乎无解。业务可以容忍周报写得不够精确,但不能容忍报价算错了查不出原因。
企业当然也在想办法。常见的做法有四种,各有各的卡法。
员工自己装个人智能体,上手最快,但方法留在个人手里,组织颗粒无收。IT部门搭集中编排平台,功能强大,但业务人员打开界面就懵了,最后变成IT自己的项目。采购云端智能体服务,上线快,可一涉及内部数据就要打通接口,接口要过安全审批,半年就没了。找外包做单项定制,单点可靠,但做一个是一个,彼此不通,维护成本越滚越大。
每种路径都解决了一部分问题,也都在另一个地方卡住了。
到这里,判断已经比较清楚:企业真正缺的,是一种把智能组织起来、管理起来、验证起来的能力。单点工具再多再聪明,也补不上这一层。
02
智能也需要被管理
换个角度想这件事。
人类组织管理"人的能力",已经管了上百年。一家工厂、一个公司,把几十几百个能力各异的人组织在一起,持续稳定地交付产品和服务,靠的是什么?
岗位分工,让每个人知道自己负责什么。SOP,让做事的步骤和标准不依赖个人经验。流程衔接,让上一个环节的输出能顺畅地变成下一个环节的输入。工具制度,规定什么场景用什么工具、怎么用。档案和知识库,让过去的经验和数据能被后来的人查到。质检,让结果在交付之前被验证。异常预案,让出了问题知道怎么处理、谁来处理。审计,让事后能还原过程、追溯责任。
这些东西听起来像官僚主义,但它们解决的是一个根本问题:个人能力是不稳定的,组织需要把不稳定的个人能力变成稳定的集体交付。
打个比方。一位经验丰富的专家入职,公司不会只丢给他一句话"把这件事搞定"就不管了。会给他明确的岗位职责、工作流程、可用工具、项目档案、交付标准、异常升级路径和留痕要求。
这不是不信任他,是组织运行的基本要求。
现在看看企业怎么对待Agent。
大多数情况是:给它一段提示词,挂一个知识库,然后期待它自动完成复杂业务。演示往往很顺利——场景精心挑选,输入干净,评判宽松。放到真实业务里长期跑,问题很快出现:该做的步骤跳过,调了不该调的工具,聊到一半把关键信息忘了,结果没人验证就往下传,中途断了没法从断点恢复。
这不是模型不够聪明。是没有人管它。
要把这件事讲清楚,需要先理清几个概念。
Model,模型。就是提供理解、生成和推理能力的那个东西。你问它问题,它能回答;你给它材料,它能总结;你让它分析,它能给出判断。可以把它理解为"一颗很强的大脑"。
Tool和Skill,工具和技能。光有大脑不够,还得能动手。工具让模型能去检索数据库、读写文件、调用业务系统、执行计算。没有工具的模型,只能在对话框里说话。
Agent,智能体。它不再是一次问答。围绕一个目标,自己拆分步骤,决定先做什么后做什么,选择调用哪个工具,执行完读取反馈,再决定下一步。它有了自主性。
但自主性带来的问题是:谁来保证它拆的步骤是对的?用的工具是该用的?中间状态丢了怎么办?结果怎么验证?出了错怎么回退?
这就需要第四个概念:Harness。
Harness,直译是"挽具",在这个语境下,它是智能体的运行与治理系统。它把流程规范、任务分工、可用工具、背景知识、质量检查、异常处理和审计记录,接入到Agent的执行循环里去。Agent每走一步,Harness都在旁边:该走哪条路,能用什么工具,要查什么资料,结果合不合格,出了问题怎么兜底。
说得再直接一点:Harness,就是把人类组织管理任务的那套方法,转译成机器智能可以严格执行、持续运行、验证纠错和迭代改进的系统。
Anthropic在讨论受管智能体时提出过一个分层思路:任务的状态和进度(session),模型的推理循环与工具调度(harness),代码和操作的执行环境(sandbox),三层分开管理。任何一层出了问题,不会把整个任务带走。这个分层本身就说明,Agent要可靠运行,不能只靠模型本身聪明,得靠外面有一套结构在托着它。
一个Agent能在演示里完成任务,不代表它能在组织里长期可靠运行。能不能长期跑,取决于Harness管住了什么。
03
管理智能的八个机制
Harness要管什么?可以列成八类机制。这八类不是凭空设计的,每一类都能在人类组织的管理方法里找到原型。组织管人靠制度,管智能靠机制,逻辑是同一套。
第一,任务流程。组织里对应的是SOP和岗位任务书——谁在哪一步做什么,做完交给谁。系统里同样要求:任务拆成步骤和状态,每一步有明确的输入、输出、完成条件和超时规则,当前走到哪里可以查询,可以暂停,可以恢复。缺了这一层,智能体跑长任务就会漏步、跳步、重复执行,跑到一半不知道自己在哪儿。
第二,模型链。组织里对应的是专业分工和分级处理——简单问题前台答,复杂问题转专家,高风险决策上审批。系统里要求同一个任务按步骤的专业度、成本、时延和风险选用不同模型,模型之间有明确的输入输出接口,有降级路线。缺了这一层,全程用一个模型,要么成本失控,要么关键步骤能力不足,想换模型又牵动整个流程。
第三,工具链。组织里对应的是工具制度和系统操作规范——谁能用什么系统,操作顺序是什么,哪些动作不可逆要二次确认。系统里要求统一管理API、数据库、文件、代码沙箱和业务系统的调用,控制调用顺序、权限、超时、幂等和副作用。缺了这一层,工具调用出错无法安全重试,重复写入污染数据,副作用不可逆却没人拦。
第四,上下文系统。组织里对应的是档案室、项目文件夹和组织知识库。系统里要求区分四个层次:即时上下文是本次任务的输入输出,项目记忆是这个项目跨会话的积累,长期记忆是跨项目的经验沉淀,外部知识库是文档、规章和标准。四层按需检索、压缩、做版本管理。缺了这一层,每次任务从零开始,历史经验用不上;或者资料一股脑塞进去,关键信息被淹没;又或者引用了过期的制度,产出一本正经地错。
第五,多Agent调度。组织里对应的是项目组分工和交接制度——谁负责什么,交接物是什么,不是口头说一句"你接着弄"。系统里要求多个Agent有明确角色定义,共享任务状态和工件,交接用结构化工件,调度器决定顺序和并行。缺了这一层,多Agent协作变成多人群聊,信息每传一次失真一次,任务状态混乱,责任说不清。
第六,质量闭环。组织里对应的是质检、复核和复盘。系统里要求生成者与评价者分离,检查完整性、引用、数字、规则符合性和执行结果,测试样例和评价标准随任务维护,运行结果反馈回来更新模板和样例。缺了这一层,自己出题自己判,错误产出直接交付出去,改进全靠偶然撞上。
第七,可靠性。组织里对应的是异常预案和止损返工程序——出了问题先止损,能补救的补救,补救不了的上报。系统里要求有重试、检查点、断点续跑、回退和补偿动作,自动恢复手段用尽后再升级到人工处理。缺了这一层,任何一步失败整个任务从头再来,长任务根本不敢启动。
第八,治理与审计。组织里对应的是内审、合规和经营分析。系统里要求有身份权限管理、调用链日志、成本统计、模型和工具的版本记录、产出的证据链、以及智能体和流程的生命周期管理。缺了这一层,出了问题找不到原因,成本不可控,经验无法沉淀,组织对智能的使用始终是一笔糊涂账。
说完这八条,要补一句实话:不是每个项目都要把八类机制全部建成重型平台。简单任务用线性流程、单模型、少量工具、基础日志就够了;复杂任务才需要状态机、多模型链、多Agent协作、项目记忆、独立评价者和完整恢复机制。Harness该建多重,由任务的复杂度、出错的代价、运行的频率和审计的要求决定。简单的事别过度工程,复杂的事别心存侥幸。
04
五个行业五份需求
八个机制从真实工作场景里长出来。拿五个行业典型任务走一遍,每个场景回答三个问题:单独用Agent会在哪里失控?这个场景对Harness提出了什么要求?任务运行后沉淀了什么资产?
制造质量异常处置
场景示例(虚构企业:某汽车零部件工厂)
产线巡检拍到表面缺陷照片,检测值显示涂层厚度偏离标准。输入有巡检图像、检测数值、原料批次号、设备日志、现行SOP和历史工单。
单独用Agent的失控点:照片拍完不知道谁来启动处置;推理路径依赖经验,一次提示词装不下所有判断逻辑;视觉识别、数据核验、根因分析三个环节顾此失彼;MES、QMS、ERP调用失败不知道该等还是该降级;处置方案没和现行SOP比对,可能违反工艺要求;回写MES超时,整个流程卡住。
Harness要承接八步状态机:触发→识别→核验→归因→方案→SOP比对→确认→回写MES。模型链上,视觉模型识别缺陷,小模型提取结构化数据,大模型做根因推理,规则引擎查SOP库。工具链接MES设备日志、QMS历史工单、批次追溯,回写必须幂等。上下文系统装载巡检图像、该产线近30天异常模式、同类缺陷历史根因、现行工艺标准版本。多Agent调度让识别、核验、归因、方案、评价各司其职,用结构化工件交接。质量闭环两处:评价Agent拿方案和SOP逐条比对,处置结果72小时后回收实际效果。可靠性要求回写前设检查点,失败重试,三次失败回退到人工确认。审计留存原始图像、判定结果、核验快照、回写凭证,可按任务ID复盘。
这套流程跑下来,沉淀出缺陷→原因→处置→实际效果的知识图谱、处置方案模板库、产线异常基线、SOP修订建议清单。
零售补货与调拨
场景示例(虚构企业:某连锁零售企业)
每天对数百家门店、上千个商品生成补货建议,门店之间做调拨,天气突变或促销事件触发临时追加。
单独用Agent的失控点:无法并行处理海量门店数据,顺序执行要跑到下午;生成建议后校验不了仓库库存和物流运力约束;促销叠加天气的组合场景,一次提示词装不下历史经验;直接下推WMS会锁库存,动作不可逆。
Harness要支持定时批量加事件触发两种模式。模型链上,时间序列预测模型处理规律性需求,大模型理解异常事件,规则引擎做约束校验。工具链接POS、WMS、TMS、天气、促销系统,写入用幂等令牌避免重复锁库存。上下文系统装载当日库存销量快照、门店近90天预测偏差、历史促销天气组合经验、各区域策略文档。多Agent调度让预测按品类并行,再经约束校验、调拨优化、审批摘要逐级汇总。质量闭环三层:总量校验、偏离历史均值三倍标异常、次日回收实际销量校准预测参数。可靠性要求单店失败不阻塞其他门店,下推失败进重试队列,批量超时降级为按昨日方案执行。审计形成每日执行报告,记录预测、建议、实际值,按门店和品类归集成本。
这套流程跑下来,沉淀出品类预测偏差档案、门店画像、异常事件响应模板、调拨规则库。
工程变更管理
场景示例(虚构企业:某制造企业)
收到设计变更,需要识别受影响零件和范围,评估供应商交付和成本,做合规检查,走审批路由,跟踪执行进度。输入有变更描述、BOM、PLM图纸、ERP采购记录、供应商系统、行业标准条款。
单独用Agent的失控点:BOM层级深,有些产品零件树超过十层,遍历不了完整依赖关系;PLM、ERP、供应商系统接口超时或数据不一致时不知道该等还是该用旧数据;审批路由规则复杂,根据变更类型、影响范围、风险等级走不同流程容易出错。
Harness要承接八步状态机:变更提交→影响遍历→供应商评估→成本测算→合规检查→风险定级→审批路由→执行跟踪。模型链上,小模型做BOM遍历和结构化提取,大模型做风险评估和条款比对,规则引擎做审批路由。工具链接PLM、ERP、供应商系统,查询只读,测算结果写入用幂等标识。上下文系统装载本次变更描述、该产品线近一年ECN历史、同类变更审批周期、标准条款库版本化快照。多Agent调度让供应商评估和成本测算并行,汇总后进入合规检查。质量闭环体现在与历史相似变更交叉比对,关键条款由第二个Agent独立复核。可靠性要求查询超时用缓存并标记时效降级,审批人超时自动升级。审计留存ECN原文、影响树、评估报告、测算明细、条款匹配、审批时间戳。
这套流程跑下来,沉淀出变更影响知识图谱、审批效率基线、合规检查模板库。
法律合同审查
场景示例(虚构企业:某企业法务部门)
每月处理大量合同,需要条款审查、风险标注、修改建议、审批意见。
单独用Agent的失控点:长文本超出上下文窗口,后半部分关键条款被漏掉;风险判断要对照企业内部政策、历史纠纷和最新法规,一次推理装不下这么多依据;修改建议要精确定位原文位置且和全文保持一致,自然语言生成容易产生冲突。
Harness要按合同类型匹配审查流程和清单。长文本分节加载,同时维持项目级共享记忆,保证后续推理能引用前文。每个风险判断绑定原文位置、政策条款、法规版本号。多Agent分工让条款提取、风险评估、法规比对、修改建议、审批摘要各司其职。生成与评价分离,评价Agent检查必检项覆盖、引用可定位、建议无冲突。可靠性要求单节失败不阻塞其他节,法规库超时用缓存并标记降级,任务超时前自动提醒人工介入。审计让每份合同形成审查档案,原文、拆分结果、引用依据、修改建议、审批意见完整留存。
这套流程跑下来,沉淀出风险条款模式库、交易对手画像、审查清单迭代记录。
金融材料审核
场景示例(虚构企业:某金融机构)
贷款或投资材料审核,OCR识别,字段抽取,多数据源核验,规则匹配,风险标记,结构化输出。输入有扫描件、工商信息、征信报告、内部业务记录、监管数据。
单独用Agent的失控点:OCR识别置信度不稳定,低质量扫描件容易出错;多数据源核验串不起来,工商查完不知道下一步该查征信还是内部记录;关键字段识别错误直接进入后续流程。
Harness要搭建模型链:OCR、字段提取、核验、风险评估模型按序协作。工具链接工商、征信、内部业务、监管数据平台,低置信度字段自动重试或换模型。可靠性要求数据源失败时,字段标记为"未核验",绝不写成确定结论。治理层面,任务状态、模型版本、规则版本、核验记录完整留存,支持回退和材料重核。
这套流程跑下来,沉淀出材料异常模式库、核验规则库、数据源可靠性评分。
五个行业差异很大,智能接入的骨架却相似:任务从哪里进入、智能做到哪一步、谁验证结果、失败怎么办、完成后留下什么。差异集中在错误代价、审批层级和审计要求。制造和金融重可靠性,零售重并发和时效,工程和法律重上下文完整性。这些差异反映在Harness的配置参数、容错策略和审计粒度上,但底层八个机制始终在场。
05
从业务任务反推需求
企业不需要先买一套最复杂的平台。
更可行的路径是:拿一个真实任务出来,回答六个问题。
任务有几步,步骤之间有没有依赖?答案决定任务流程该用线性链、任务图还是状态机。一个"读完邮件写摘要"是线性的,一个"审完合同再决定走快速通道还是专家复核"带分支,一个"持续监控指标、触发条件才行动"需要状态机。别把简单任务塞进复杂编排。
哪些步骤需要不同类型的智能?有的步骤要推理,有的要生成,有的只做格式转换。答案决定模型链怎么配、模型之间怎么路由、某个模型不可用时降级到哪里。
要操作哪些系统,有没有写操作?只读查询和发起付款的风险完全不同。答案决定工具链的权限粒度、幂等设计、超时策略和补偿机制。
任务需要记住多长时间?一次对话结束就丢掉,还是要跨越整个项目周期,还是要沉淀成组织知识?答案决定即时上下文、项目记忆、长期记忆和知识库怎么分层。
任务能不能拆给多个角色?如果能,就要定义每个Agent的职责边界、并行规则、共享状态的范围和交接协议。如果不能,单Agent跑完,省掉协调开销。
怎么证明任务可靠完成?答案决定验证规则写多细、测试样例准备多少、检查点设在哪里、失败了回退到哪一步、日志和审计记到什么粒度。
六个问题问完,交付的不能只是一份"智能体功能清单"。还要有一份Harness需求说明:任务图、模型链、工具链、上下文结构、多Agent协议、验证标准、异常恢复、审计要求。轻量任务配轻量说明,高风险任务配完整说明。说明的厚薄跟着风险走,不跟着技术热情走。
06
模型越强管理越重要
一个常见的预期:模型能力继续提升,这些管理机制是不是就不需要了?
判断相反。模型越强,Harness越重要。但Harness的配置重心会变。
该删的要删。那些为了补偿模型弱点而加的繁琐步骤,应该定期清理。原来要三个模型分工的任务,更强的模型一个就能处理,合并掉。低风险任务原来逐条检查输出,模型稳定之后改成抽样。更大的上下文窗口让机械切片变得多余,拿掉。模型已经稳定解决的防错步骤,继续留着只增加延迟和成本。要定期给Harness"减重",把补偿性设计和结构性设计分开。
该留的必须留。任务进行到哪里,下一步由谁执行,用了什么模型和工具,读了哪个版本的资料,输出有没有经过验证,失败怎么恢复,运行结果怎么进入下一版,整个过程怎么追踪——这些是组织运转的基本问题。它们跟模型强弱无关。一个能力极强的员工,也需要知道自己在哪个流程里、对谁负责、结果交给谁。Agent同理。
还有一点容易混淆:组织化不等于集中化。Agent可以分布在不同部门、不同终端、不同系统里运行。统一的是身份、接口、状态、证据、评价、反馈和生命周期管理。集中治理,分布执行。就像一家公司的员工分散在各地办公,但用同一套身份体系、同一套汇报结构、同一套质量标准。
07
组织每天留下什么
回到一个具体画面。
第二天早上,一位员工发起一个任务。系统根据这位员工的身份和任务类型,调出相关的业务资料、处理方法和检查规则。Agent完成初步处理,标出需要人确认的地方。她确认、修正,结果通过验证规则检查。这次运行留下的修正、样例和更新后的检查规则,进入下一版配置。下一次有人发起同类任务,起点比今天高一格。
这个过程里,模型可以换,供应商可以换,实现方式可以换。留下来的是:业务流程怎么编码,评价标准怎么定义,失败样例怎么积累,权限边界怎么划,审计记录怎么留。这些东西属于组织,不属于任何一个模型或供应商。
组织的智能化,就是把智能纳入组织已有的任务、分工、知识、质量和改进体系。Harness,就是这套体系的管理系统。
判断标准很简单:今天做完的事,有没有让组织明天处理同类问题时,少走一步弯路,多一条可靠依据?
延 伸 讨 论
当智能体开始从辅助工具走进企业运行体系,技术、组织与人才的关系正在悄然变化。从“个人提效”到“组织进化”,中间还隔着哪些认知和能力的断层?新一代智能体的技术特点,将如何重写企业的成本曲线、组织边界和人才结构?
9月17日,本文作者、清华校友王宁将在合肥“AI+会客厅”主题分享中,结合前沿发展与产业实践,系统梳理新一代智能体的演进脉络,企业智能化转型的新趋势,拆解未来组织能力、管理方式与智能生产体系的建设方向。欢迎对AI赋能组织变革感兴趣的校友关注参与。
点击 ↓ 图片进入活动详情
作者简介
![]()
王 宁
清和乐章(北京)文化科技有限公司
创始人、CEO
教育/学术背景
清华大学工学学士、硕士
清华大学多个人工智能课题项目技术专家
清华经管X-lab科创孵化大模型联合创始人
专业资质/认证
工信部人工智能应用工程师(高级)
国家开发银行人工智能专家
亚马逊(AWS)人工智能从业者认证
联合国教科文组织AI治理领域认证
阿里达摩院“高级人工智能训练师” 认证
科大讯飞“提示词专家”认证,LangGPT核心共建者
职业/行业经验
曾担任多家世界500强企业管理岗位
拥有多年资本投资经验,持有注册会计师资格
金牌企业培训讲师,拥有丰富的企业培训和咨询经验,累计服务5000+人次
多家科研团队、创投公司、政企部门AI技术顾问
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.