网易首页 > 网易号 > 正文 申请入驻

斯坦福新论文:微调已死,自主上下文当立

0
分享至

时令 发自 凹非寺
量子位 | 公众号 QbitAI

是时候为传统微调献上挽歌了。

一项全新研究,刚刚又给微调致命一击。

来自斯坦福大学、SambaNova Systems公司和加州大学伯克利分校的研究人员,在新论文中证明:

依靠上下文工程,无需调整任何权重,模型也能不断变聪明。



他们提出的方法名为智能体上下文工程ACE

ACE不依赖模型重新训练,而是让上下文自主进化,通过反复生成、反思并编辑自己的提示,直至成为一个自我完善的系统。

在智能体和特定领域的基准测试中,ACE能同时优化离线上下文(如system prompt)和在线上下文(如agent memory),并稳定优于强力基线模型。



下面具体来看。

ACE框架

现在很多AI应用(比如自动处理财务数据的工具、能调用APP的智能助手)都靠 “上下文适配” 来提升能力。

简单来说,就是不给模型改底层参数,而是在输入里加指令、策略或证据,但老方法有两个大问题:

简洁偏置

为了让输入简短,把关键细节丢了。比如只说 “处理财务数据”,却没说 “要按XBRL格式核对数值”,导致模型犯错。

上下文崩溃

反复修改输入时,模型会把之前积累的有用信息越改越短、越改越没用。比如原本有1.8万个token的实用策略,准确率为66.7,改一次就剩122个token,效果却下降到57.1。



ACE就是为了解决这两个问题来的,与将知识压缩为简短摘要或静态指令的方法不同,它将上下文视为不断演化的操作手册,能够随时间不断累积、优化并组织策略。

基于Dynamic Cheatsheet的智能体设计,ACE把模型的 “上下文优化” 拆成分工明确的三个角色。

  • 生成器(Generator):负责生成推理轨迹;
  • 反思器(Reflector):负责从成功和错误中提炼具体见解;
  • 整理器(Curator):负责将这些见解整合到结构化的上下文更新中。



如上图所示,工作流程首先由生成器针对新查询生成推理轨迹,这些轨迹既能呈现有效策略,也会暴露常见错误。

随后,反思器对这些轨迹进行评析,从中提炼出经验教训,并可选择通过多轮迭代加以优化。

接着,整理器将这些经验合成为简洁的增量条目,再经由轻量级的非LLM逻辑,以确定性的方式将其合并至现有上下文中。

由于更新内容被逐项分解并局部化,多个增量得以并行合并,从而实现大规模的批量适应。

此外,ACE还支持多轮次适应机制,即对同一组查询进行反复学习,逐步强化上下文质量。

ACE在两大场景中全面超越基线

实验结果表明,在智能体和财务分析两大场景中,ACE稳定优于Base LLM(无适配)、ICL(少样本演示)、GEPA(主流prompt优化)、Dynamic Cheatsheet(动态备忘单)等方法。

在智能体测试中,研究团队采用的是AppWorld,它是一套自主智能体任务集合,涵盖API理解、代码生成和环境交互。

结果显示,ReAct+ACE相比ReAct+ICL和ReAct+GEPA分别领先12.3%和11.9%,优势显著。这表明,与固定的演示示例或单一优化指令提示相比,结构化、可演进且精细化的上下文能够更有效地促进智能体学习。

这一优势在在线场景中同样得以延续:ACE平均以7.6%的性能提升领先于Dynamic Cheatsheet等现有自适应方法。



在财务分析中,研究者选用FiNER和Formula来测评模型的金融推理能力,其任务依赖可扩展商业报告语言(XBRL)。

  • FiNER要求对XBRL财务文档中的token进行标注,将其归类为139种细粒度实体类型之一,这是在受监管领域进行金融信息抽取的关键步骤。
  • Formula则侧重于从结构化XBRL报告中提取数值,并通过计算回答金融查询,即进行数值推理任务。

在离线环境下,当模型获得训练集中的真实答案作为输入时,ACE以平均10.9%的优势明显超越了ICL、MIPROv2和GEPA。



此外,ACE在降低自适应成本(如尝试次数和token输入/生成的费用)与延迟方面展现出显著优势。

具体而言,在AppWorld的离线自适应任务中,与GEPA相比,ACE将自适应延迟降低了82.3%,并将尝试次数减少了75.1%。

在FiNER的在线自适应场景中,与DC相比,ACE实现了91.5%的自适应延迟降低,并在token输入与生成的相关费用上节省了83.6%。



华人出品

这项研究的两位一作都是华人。



Qizheng Zhang,斯坦福大学计算机科学系四年级博士生。此前在芝加哥大学获得了数学、计算机科学和统计学三个专业的学士学位。

本科期间,他就与Junchen Jiang和Ravi Netravali两位教授合作开展计算机网络研究,专注于面向视频流与分析的网络系统设计。

此外,他还在美国阿贡国家实验室数学与计算机科学部(MCS)和微软研究院实习过。



Changran Hu,本科毕业于清华大学,硕士毕业于加州大学伯克利分校。

20岁时,他就成为了一家AI音乐生成公司DeepMusic的联合创始人,成功获得来自中国顶级企业的1000万美元投资,并与多位中国流行歌手(如周杰伦、李健)建立合作。

随后,他以应用科学家实习生的身份加入微软,并于2021年成为Sambanova Systems研究工程师,随后晋升为技术主管兼经理,主要负责模型后训练与智能体AI相关研发工作。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
CCTV5直播中国女足VS朝鲜队,开球时间确定,米利西奇争小组第1

CCTV5直播中国女足VS朝鲜队,开球时间确定,米利西奇争小组第1

体育大学僧
2026-03-07 12:16:36
中国50后还有多少人?多少人能活到80岁?权威数据告诉你

中国50后还有多少人?多少人能活到80岁?权威数据告诉你

深度报
2026-02-27 21:36:50
杨幂素颜赶路被拍,瘦得让人认不出,她却早把身体当工具用了

杨幂素颜赶路被拍,瘦得让人认不出,她却早把身体当工具用了

老吴教育课堂
2026-03-08 09:48:53
中国早已布局完毕,美专家警告美国,别打伊朗,中国一定笑到最后

中国早已布局完毕,美专家警告美国,别打伊朗,中国一定笑到最后

伴君终老
2026-03-07 20:19:11
日本网红随机采访美国人,让他评价中国人,听他说完直接破防了

日本网红随机采访美国人,让他评价中国人,听他说完直接破防了

世界圈
2026-03-08 10:15:59
物业禁止门口堆鞋?看看广东人的新招!门口干净到发光

物业禁止门口堆鞋?看看广东人的新招!门口干净到发光

巢客HOME
2026-03-08 08:55:03
国家出手抓的3位首富,坑害老百姓、劣迹斑斑,个个不值得原谅

国家出手抓的3位首富,坑害老百姓、劣迹斑斑,个个不值得原谅

老斉科普君
2026-02-19 15:06:15
美国也没想到,转为中国籍仅6年,谷爱凌竟已成美国头号劲敌

美国也没想到,转为中国籍仅6年,谷爱凌竟已成美国头号劲敌

削桐作琴
2026-02-25 18:15:14
我国初中、高中、高等教育三个阶段的学龄人口将分别于2026年、2029年、2032年达峰

我国初中、高中、高等教育三个阶段的学龄人口将分别于2026年、2029年、2032年达峰

大象新闻
2026-03-06 18:47:02
陈昌浩回国后默默无闻,前妻任副部长,儿子却是万人敬仰的大人物

陈昌浩回国后默默无闻,前妻任副部长,儿子却是万人敬仰的大人物

比利
2026-03-04 10:59:11
富商马清铿67岁生日,情妇高调庆生,两人5年生4子女,原配很沉默

富商马清铿67岁生日,情妇高调庆生,两人5年生4子女,原配很沉默

嫹笔牂牂
2026-03-03 07:10:52
复旦研究:二甲双胍或成老年毒药,寿命缩短22%,可信吗?

复旦研究:二甲双胍或成老年毒药,寿命缩短22%,可信吗?

39健康网
2026-03-07 20:20:35
伊朗革命卫队喊话:正等着你们

伊朗革命卫队喊话:正等着你们

观察者网
2026-03-07 16:11:09
海港开门黑!媒体人热议:新赛季定位保级,穆帅或坚持不到年底

海港开门黑!媒体人热议:新赛季定位保级,穆帅或坚持不到年底

奥拜尔
2026-03-07 21:48:00
美伊开战,越南和菲律宾被打醒!特朗普没想到:亚太盟友变天了

美伊开战,越南和菲律宾被打醒!特朗普没想到:亚太盟友变天了

阿芒娱乐说
2026-03-08 04:32:59
特朗普大祸临头!伊朗已公开放话,全球将变得更混乱?

特朗普大祸临头!伊朗已公开放话,全球将变得更混乱?

毛豆论道
2026-03-06 18:26:34
美国人终于发现了:中国的东风导弹,不用击沉我们航母,擦着即伤

美国人终于发现了:中国的东风导弹,不用击沉我们航母,擦着即伤

丁丁鲤史纪
2026-03-05 14:29:27
中国散货船“铁娘子”号通过霍尔木兹海峡,我们去了它在上海浦东的运营公司

中国散货船“铁娘子”号通过霍尔木兹海峡,我们去了它在上海浦东的运营公司

上观新闻
2026-03-07 17:17:07
三盛集团董事长失联

三盛集团董事长失联

地产微资讯
2026-03-08 09:45:03
新婚女子手臂成亮点,“满眼都是xxx”,难道新郎一点都不在乎?

新婚女子手臂成亮点,“满眼都是xxx”,难道新郎一点都不在乎?

仙仙先生
2026-01-30 09:35:22
2026-03-08 11:27:00
量子位 incentive-icons
量子位
追踪人工智能动态
12223文章数 176404关注度
往期回顾 全部

科技要闻

OpenClaw最大的推手是闲鱼和小红书

头条要闻

媒体:伊朗问题要注意普京的动向 其在向美以喊话

头条要闻

媒体:伊朗问题要注意普京的动向 其在向美以喊话

体育要闻

塔图姆298天走完这段路 只用27分钟征服这座城

娱乐要闻

周迅新恋情曝光,李亚鹏等人已成过去

财经要闻

油价要失控?

汽车要闻

华为乾崑全新激光雷达落地 鸿蒙智行同步技术升级

态度原创

本地
时尚
手机
亲子
军事航空

本地新闻

食味印象|一口入魂!康乐烤肉串起千年丝路香

2026春夏一定要拥有的6只包,好看又百搭

手机要闻

麒麟9030产能火力全开!华为Mate 80系列销量激增:已突破400万台

亲子要闻

12岁孩子肠癌晚期,肿瘤年轻化不是开玩笑!

军事要闻

美第三个航母打击群据称准备部署至中东

无障碍浏览 进入关怀版