给Agent加记忆,业界的主流做法是让它记住"用户说过什么"。但工业场景里更缺的记忆,是"这家企业的数据语义"——指标的分子分母是什么,同一个工单号在不同表里有几种写法。
卡奥斯COSMOPlat & 工业智能首席科学家余锦泽博士在QCon上海站"Agent自主进化:从记忆到持续学习"专题中,分享了一个反直觉的实测结果:只注入实体与关系、不带指标口径,回答正确率反而低于完全不注入。模型会更自信地选错表。
他的判断是:企业语义记忆是需要治理的资产——写入有裁决、冲突有消解、经验能沉淀、错误可撤销。
记忆不在对话流里,在数仓和代码里
Mem0、Zep(时序知识图谱)、Letta/MemGPT 等框架解决的是"跨会话记住用户",记忆主要来自对话与交互流。工业多智能体要记的不是用户偏好,而是"直通率的分子分母是什么、工单号在不同表里有几种写法"。
这些语义不产生于对话,藏在数仓表结构、建表代码与工艺文档里,且没有外键、命名晦涩。学界正在讨论记忆污染(memory contamination),企业场景的代价是口径错账。
余锦泽给出的记忆结构包含六要素:对象、关系、事件、指标、动作、场景。每条记忆带证据等级——数据验证(verified)、人工断言(asserted)、缺口(gap)。与业界情景记忆/语义记忆分层的区别在于:置信等级由真实数据裁决产生,不由模型自评。
写入把关:大模型只提议,真实数据裁决
写入侧有四道判据,缺一不可:取值重叠度须过阈值、子键不唯一、父键接近唯一、列名有据可依。通不过的降为候选,不入正式记忆。
踩过的坑之一是时序假象。同一对字段在单日窗口下取值完全重合,看上去就是一条真关系,窗口拉长到一个月即崩塌。因此采样窗口不足一律不予写入。
冲突消解有三招:
- 时间轴校验,排除巧合性重合
- 双源融合,代码中的 JOIN 证据优先于命名推断
- 对抗评审,独立评审多数否决即打回重抽
另一个坑是人工断言冒充数据验证。早期实现允许把人工确认写成 verified,记忆置信被悄悄稀释。现在这条纪律写进接口签名——人审只产生"断言",verified 只能由数据裁决产生。
与业界方案的分工上,时序知识图谱记忆(如 Zep 的双时序边)回答"事实何时有效";这套方案在企业库场景回答"这条记忆该不该写入"。两者是记忆生命周期的两端,可互补。
共享与调度:按对象锚定动态构建上下文
多个智能体读写同一套语义,"工单"在所有 Agent 中是同一个"工单"。写权限唯一收口——大模型唯一的写路径是把自然语言翻译成带类型的受治理操作,预览、人审后落盘,全程可回滚。
使用侧按问句锚定对象,沿已验证关系召回子图,挂上指标口径与术语,成套注入。只注入锚定命中的子图而非全图,兼顾上下文长度与成本。
第三个坑是存而不用:数百条中英术语词典建成后,检索链路曾长期没有消费它。由此提出"消费方审计"——每新增一类记忆,必须答得出"它的消费方在哪"。
记忆还用于指代消解,本体即实体注册表。多轮对话中的指代("它/该产线")显式回填上文命中的对象,不引入通用 NLP 组件。中文表名后缀剥离——"销售订单事实表"须按"销售订单"命中。
答案同屏给出指标口径卡(计算口径、出处表列、血缘入口);实体未在记忆中命中即明确拒答,不做无锚定的自由生成。
经验沉淀:教训固化为代码而非文档
把建模教训做成可插拔的提示词组件注入构建流程。对比实验显示:注入"建模规范"组件后,对象与关系候选大幅收敛、已验证占比明显上升、关系动词全部落入白名单。
踩过的坑各有归宿:时序假象固化为采样窗口判据,断言冒充固化为接口签名,存而不用固化为消费方审计清单,跨引擎模型名错配固化为运行时模型族校验,数据对不上账固化为分层对账检查项。
证据回流路径是:用户反馈→评审队列→记忆修订→下游即时生效。评审否决一条关系,引用它的查询立即被拦截。版本快照与一键撤销保证记忆修订可逆。
持续学习的度量靠自建金标评测集——Spider、BIRD 等公开基准覆盖不了企业口径与脏数据,金标先在库上实跑校准。评测暴露的"记忆的病"往往是数据的病:汇总层与明细层对不上账,处置是把分层对账固化为数据质量检查项。
边界与取舍:什么时候不需要这套记忆
写入把关有覆盖率代价。宁缺勿滥会把部分真知识挡在正式记忆之外,选择是"缺口透明"而非"虚假完整",代价是冷启动阶段记忆覆盖有限。
前置条件是:指标口径要有人拍板,这是管理问题不是技术问题。单表能答、口径唯一的场景,一条 SQL 就够。
共享记忆的写治理成本同样存在:写权限必须唯一收口、高风险改动必须人审,换来一致性与可追责,代价是写入吞吐受限,不适合高频自动写入的场景。
遗忘与审计之间存在张力。错误记忆要能撤销,但审计要求留痕,采用"降级候选+版本快照"而非物理删除,存储与检索都要为历史版本付成本。
判据阈值是工程经验值。取值重叠度、父键唯一性等判据的阈值来自实践调优而非理论最优,跨行业迁移时需要重新标定,且每条判定都要留下依据供复核。自建合成基准可复现、金标可校准,但规模有限,不等于真实客户库表现。
收束成一句:记忆不是缓存,是需要治理的资产。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.