DeepLearning.AI与Oracle联合推出的一门新短课程《构建自适应AI智能体》今天正式上线。课程聚焦持续学习与自适应学习,讲解如何让智能体随着时间推移不断变好,以及如何在Oracle AI Database 26ai上实现这一目标。
智能体为什么总在重复交学费
![]()
课程首先点出一个被普遍忽视的问题:智能体最贵的失败不是答错,而是答对了却把答案扔掉。一个会话里辛苦推演出的正确结论,很少能活到下一个会话。有些设置会携带少量项目上下文,但几乎没有任何设置会保留背后的推理过程。
课程用了一个具体场景说明这种浪费。你让智能体在结账流程里加一个字段,它动手之前先搜索“checkout”,打开六个文件确认数据层到底在哪里,再读一遍ORM配置。十二次工具调用,只为重建一份从上周五起就没动过的代码库地图。周二它又重建一次,周三再来一次。上个月的token支出里,有多少花在让智能体重新发现它早就知道的事情上?
同一个错误,第二天原样再犯
更小的例子看得更清楚。智能体针对你的数据库模式写查询,报错ORA-00904:“CREATED_AT”标识符无效。它读模式、发现真正需要的列是DATE_CREATED、修正查询、继续干活。这看起来是智能体在正常工作。但第二天它再次被查询时,新会话从空白上下文窗口开始,没有任何东西提醒它昨天CREATED_AT是错的,于是它从头再推理一遍。同样的失败、同样的token消耗、什么都没学到。
课程指出,这里通常缺少一个反馈回路。智能体昨天学到了有价值的东西,任务结束后就把它连同上下文窗口一起扔掉了。持续学习就是让智能体随时间变好的纪律,范围从复用昨天的轨迹一直延伸到重新训练模型本身。
最便宜的修复在token空间里
课程给出的关键结论是:大部分可获得的收益都位于成本最低的一端。把昨天的轨迹喂回去,让智能体不再为同样的工作付两次钱。最便宜的修复发生在token空间——把过去的轨迹变成可复用技能、重构记忆,完全不需要训练。
课程还探讨了代码知识图谱。相比简单的正则表达式匹配,这种结构能让智能体更快找到正确上下文。课程强调结构胜过关键词。
按需爬升的努力阶梯
权重空间适配,也就是重新训练或微调,属于昂贵层级。只有当上下文注入、处理和操作不再能泛化时,才需要动用这一层。课程给出的最佳实践是一条努力阶梯:从便宜的开始,只在必须时才往上爬。
Nacho在过去几个月里观察智能体以这种方式失败,并研究如何把失败转化为可复用的经验。这门课程正是把这些观察和可用手段系统化的一次尝试。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.