给个人智能体加记忆,加得越多越好?实测数据把这个直觉打翻了。
记忆笔记对智能体的帮助存在一个拐点。用 Claude Haiku 4.5 跑下来,完全不挂记忆时违规率是 77%;挂到 10 行记忆,违规率掉到 20%;但记忆继续加长,违规率又回升到 25% 左右。
![]()
也就是说,相关笔记确实有用,但只在一定长度内有用。超过这个点,多出来的每一行都在让智能体更容易漏掉规则。
该用代码的地方,别用规则
测试里最能说明问题的是计数类任务。像"用用户的名字给文本签名"这种风格要求,写成文字规则是有效的。但换成"记录一笔累计支出"这种需要持续跟踪的活儿,文字规则的表现是——44% 的情况下失败。
同样的任务交给代码来维护那个总数,失败率是 0%。
结论很直接:凡是智能体必须计数、必须跟踪的东西,交给代码;记忆笔记留给风格和偏好这类软性要求,并且保持简短。
让智能体自己改记忆,改到一半就停了
另一条路径是让智能体根据用户抱怨自动重写自己的记忆。这类方法在早期确实能看到改善,但随后就停滞了。
表现最好的方法,最终违规率停在 48% 附近。作为对照,直接把每一条偏好都明确告诉智能体,违规率是 7.1%。
差距摆在这里:自动改写记忆听起来更聪明,实际效果远不如老老实实把偏好讲清楚。个人智能体没法靠记忆笔记学会用户的每一条偏好,笔记堆多了反而更糟。
把记忆写短,把该算的交给代码,把该说的偏好直接说明白——这三条比"记得更多"更管用。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.