网易首页 > 网易号 > 正文 申请入驻

办公Agent大战正酣,真正的胜负手却藏在看不见的地方

0
分享至

编辑|Panda

最近,办公 Agent 真是火。

飞书 Aily、WorkBuddy、千问办公轮番上阵,挤破头想要抢占企业办公入口,AI Agent 正以前所未有的速度走进真实工位。写周报、跑数据、处理工单、盯流程……越来越多重复性的办公任务,开始被交到 Agent 手里。热闹背后,一个更根本的问题却容易被忽略:这些每天准时「上班」、反复干着同一类活儿的 Agent,真的会因为干得多而变得更好用吗?

答案往往是不会。而这,正指向了眼下 AI 圈另一个热爆了的话题:持续学习

再强的基座,训练结束、参数冻结、进入部署后,就停止了成长。但 AI 界显然不打算让模型永远停在「毕业」那一刻,让模型像人一样「活到老学到老」正在成为整个行业最烫手的话题。

比如智谱在 GLM-5.2 的规划里明确表示,下一步要攻克的关键技术包括记忆、持续学习和自我评判。年初从 OpenAI 离职的推理模型大佬 Jerry Tworek 离职后便很快创立 Core Automation,直接剑指持续学习。就连图灵奖得主、强化学习之父 Richard Sutton 近日也亲自下场创业,成立 Oak Lab,致力于建立能从自身经验中持续学习和进化的 AI。持续学习,正从少数人的探索演变成行业共识。



那么,问题来了:到底该怎么做持续学习?

放眼这条正在持续变热的赛道,Pyromind(火思动力)已经给出了一个答案:这家成立于 2025 年 10 月的创业公司已经率先把 Agent 后训练产品化,用 AutoRL 打通了从任务反馈到模型更新的完整闭环,还用多项让人眼前一亮的成果证实价值,成为了走得最靠前的那一批。



该公司的定位是一家专注于持续学习与进化的 RLaaS(强化学习即服务)公司,押注的判断也很清晰:Agent 的下一次进步,应该来自于上一次运行的反馈与积累。

而 Pyromind 选择产品化后训练这个切口,正是因为持续学习说起来性感,做起来极难。

让一个 Agent 从任务里持续学习,至少要回答几个环环相扣的问题:哪些真实反馈值得学?学到的东西怎么不破坏原有能力(灾难性遗忘)?怎么把散落在日志、轨迹、评估里的经验变成一次真正的模型更新?又怎么让这一整套流程在企业的算力和成本约束下稳定、可验证地跑起来?

业界给出的答案五花八门。有的靠外挂记忆和外部技能库,有的靠 test-time training 在推理时微调,有的干脆把后训练(尤其是强化学习)搬到部署之后,让真实任务的反馈直接进入训练闭环。路线不同,但指向同一个终点:把「经验」沉淀成「能力」

为此,需要把算法、分布式工程、算力调度、效果验证这些散落的环节,真正组合成一条能在生产环境里稳定跑起来的闭环。而这正是 Pyromind 想做也正在做的事。

要理解 Pyromind 的道路和技术选择,得先看清 Agent 眼下正处在一个什么样的转折点上。

Agent 正在真正转化为生产力

Agent 的使用方式正在发生一次根本性的变化。

当它还停留在 Demo 阶段时,衡量标准很简单:能不能把一件事做完。但当 Agent 开始进入真实业务、长期运行、反复执行同一类任务,标准就变了:能不能在运行中越用越好,稳定性、适应性和长期成本能不能扛得住。

这个转折并不轻松。就在上个月底,IT 服务巨头 Cognizant 宣布成立一个专门的 EMEA(欧洲、中东、非洲)AI 部门。靶心直指一个正困扰整个行业的难题:太多企业的 Agent 项目,卡在了从演示走向生产的那一步

根据其发布报道中引用的 AI 可观测性公司 Fiddler AI 的生产可靠性研究,一些在受控演示里表现优异的企业 Agent,单次运行的成功率约为 60%,可一旦放到生产负载下连续跑 8 次,成功率就跌到了 25%



普林斯顿的研究者评测了 14 个 Agent 后也发现,尽管过去 18 个月里模型能力突飞猛进,可靠性的提升却微乎其微。



前沿模型的可靠性提升落后于准确性提升,来自 arXiv:2602.16666

演示环境看不出问题,是因为它往往用的干净数据、接口文档清晰、流程约束良好;而真实的企业环境往往难以同时满足这些条件。

从演示环境到真实企业环境的转变正在发生,这也同时带来了三个新的产业条件。

其一,模型使用方式从单次调用变成长期运行。Agent 会在生产环境里持续运转、反复处理任务,于是稳定性、对业务变化的适应能力和长期调用成本,都从技术指标变成了实打实的生产问题。

其二,生产环境的反馈开始出现。真实任务每天都在产生成功、失败、人工修正和业务反馈,这些原本被丢弃的数据,却正好是优化模型能力最直接的原料。

其三,优化对象发生变化。企业关心的不再只是一个通用模型有多强,而是 Agent 能不能贴合自己的业务、并在使用中持续提升。

把 Agent 类比成一名员工会更容易理解:大模型给了它基本知识,提供了能力起点;Prompt 和工作流告诉它这次要做什么;而一名员工真正的价值在于把每一次工作的经验沉淀成长期能力,越做越好。今天大部分 Agent 缺的正是这最后一环。

记忆、Prompt 和 SFT 为什么都还不够

要让 Agent 从任务中学习,业界尝试过不少路径,但它们各自解决的问题并不相同,但在生产环境中,都存在明确的局限。

  • 预训练决定了模型的通用智力与知识底座。它赋予 Agent 基础的理解与表达能力,但训练成本极其高昂,且面向的是通用预测,无法直接解决特定企业复杂业务流中的精准决策问题;
  • 上下文工程约束的是当前这次执行怎么做;记忆机制能让它记住上下文里的偏好,但更多是「调取」而非「内化」,如果换一个新的类似场景,能力本身并不会变强;
  • SFT(监督微调)能让模型快速学会复制标准的流程与动作。但它高度依赖静态的高质量专家轨迹,不仅标注成本极高,而且面对真实业务中多步决策的动态报错、延迟反馈和长尾场景时,缺乏自纠错与自我探索的泛化能力。

它们都很有用,但都难以针对长期、多步、动态变化的真实业务做持续优化。一个 Agent 即使执行了海量任务,如果这些任务里的成功与失败没有进入训练和验证,它也不会因此自动变好。

在 Pyromind 看来,自进化和持续学习是解决之道。以强化学习(RL)为代表的后训练可把真实任务中的成功、失败和业务反馈转化为奖励信号,通过持续训练提升模型在单次执行、多步决策和复杂目标上的稳定表现。



可以说预训练决定了 Agent 能力的起点,而后训练决定的是它最终能走多远。

这个判断也正是那些明星团队不约而同的选择。无论是智谱把持续学习写进 GLM-5.2 的技术规划,还是 Sutton 用 Oak Lab 去追求「从运行时经验中实时学习」,抑或 Core Automation 想让模型在生产中直接更新权重,它们的共识都是:静态部署的时代正在过去,真正的进步要来自运行之后。而这条路线的难点在于「怎么把 AI 变成一套能持续运行的系统」。

闭环怎么转

从任务反馈到模型更新

Pyromind 给出的答案是把后训练拆解成一条可以持续运转的闭环链路

在它的设计里,Agent 在真实工作中产生的成功、失败、人工修正和业务反馈,要依次经过采集、分析、奖励生成、模型训练、效果验证和模型更新,最后重新应用回实际任务。并且,这条链路是可以自动运行、反复迭代的。原本分散在不同工具和系统里的后训练环节,被连接成一套完整的学习闭环。



这背后的工程挑战,正是制约行业落地的最大阻碍。比如强化学习开源项目 AReaL 团队曾直言,自进化 Agent 的关键瓶颈不只是模型有多强、算法多先进,而是缺少一套能服务真实 Agent 的在线强化学习基础设施;他们还披露过一个细节:在搜索类 Agent 的训练中,单条轨迹最长的探索时间可能长达一到两小时,这种长尾会把整批数据拖慢、造成大量 GPU 闲置,让训练效率急剧下降。

把这样一条链路工程化、并让它稳定持续地转起来,正是 Pyromind 想跨过的门槛。

Pyromind 在做什么

把后训练产品化

一套能持续运转的后训练闭环,听起来很有前景,但要真要落到产品上却有一个绕不开的问题:强化学习的门槛太高了。

算法、分布式训练、算力调度、奖励设计、效果验证……每一环都需要专门的团队和大量试错。大多数企业其实都想让 Agent 持续学习,但却被这条链路的复杂度挡在了门外。

Pyromind 的产品设计正是为了简化这一切。它把面向开发者和企业的一系列能力,归纳进一个关键词:AutoRL(自动强化学习),其目标用一句话概括就是:把复杂的强化学习过程自动化,让任何团队都能轻松像搭乐高一样开始后训练,而不必自己从零搭建。

这也正是其官网那句 slogan 「RL For Everyone Not Only Experts」所表达的意思:不只是专家,任何人都能做强化学习。



如上图所示,该公司已经在这个方向上做出了一整套产品,但核心都可归因到一件事:Pyromind 就是一个 AutoRL 平台

更具体而言,对于「Agent 持续学习」这一任务,Pyromind 将其划分成了三层层次的能力,从底层能力到上层体验层层递进。

第一层是后训练的基础设施,目标很简单:简化训练。为此,Pyromind 打造了一个可视化工具,只需把核心组件直接拖拽到画布上、简单配置就能连成一条可编辑的训练管线,支持 SFT、GRPO、DPO 等多种训练方式,还能联动机器人仿真沙箱,实时查看训练轨迹、奖励值等关键指标。过去分散在代码和环境配置里的工作,就此被沉淀成清晰、可复用的流程。



第二层是后训练的奖励构建。奖励信号是强化学习的方向盘,直接决定模型往哪儿学。Pyromind 在这一层提供了生成式的奖励构建能力,既能面向准确性的奖励生成建模,也可面向偏好建模,进而帮助企业针对不同任务目标,更高效地设计出合适的奖励。

在这两层之上还有一层是让后训练「无感化」,即把「训练」和「上线」这两个很重要的任务都藏到了用户看不见的地方,但这也是最核心的一层。系统会在日常使用中自动收集会话信息、学习用户习惯,并在后台完成持续训练;训练好的模型再自动发布成推理端点、通过灰度切流平滑地接管线上 Agent。用户要做的,仅仅是设定一个预算上限,就能在预算之内坐享 Agent 效果的持续提升。

这三层之下,Pyromind 还备有一套配套基础设施,包括弹性开发环境、安全仿真沙箱、高性能推理部署和统一存储底座,让数据、模型和训练任务能在整个平台里顺畅流动。

也正是在这个意义上,Pyromind 成为最早把 Agent 后训练产品化的公司之一

把这些拼在一起,Pyromind 想交付的其实是一个开箱即用的后训练平台框架。企业不需要自建强化学习团队、不需要反复趟坑,就能让 Agent 在上线之后持续学习和改进。

这也正是 Pyromind 与赛道上其他玩家最不同的地方。传统云厂商和 MaaS 平台主要提供算力、推理或轻量微调,Agent 开发框架帮助组织和执行任务,它们解决的是「怎么把 Agent 跑起来」;而 Pyromind 聚焦的是 RL 训练的全链路工程化与持续自进化,想解决的是「怎么让 Agent 跑起来之后越用越好」。

更长远地看,Pyromind 的愿景是让每一个 Agent 都拥有从任务中持续学习和进化的能力,进而让每一次任务都成为它下一次能力提升的基础。

面向后训练

Pyromind 实力的技术注脚

「持续学习」的判断是否成立?最终要靠落地来检验。Pyromind 近期已经陆续拿出了几项成果,构成了它「值得被相信」的初步证据。

其中一项是PyroDash,这是一套全新的范式,可将小模型的低成本和大模型的高性能结合在一起。

长期以来,行业普遍认为模型的性能和成本两者无法兼得。而PyroDash 证明了通过精准的后训练与模型协同,完全可以在极低成本下实现甚至超越大模型的表现

在五项数学推理基准上,PyroDash 一边把平均准确率做到超过纯大模型基线,一边把推理成本大幅压低;偏重成本的配置下,总成本可以降低九成以上。对于要长期、高频调用大模型的 Agent 场景来说,这意味着一条更省钱也更可持续的路径。目前 PyroDash 的模型、数据集与测试代码均已开源。在这样的新范式下,大小模型不再是互斥关系,而是协同进化。并且随着落地场景的逐步扩展,后训练也将自然延伸并演进为 Agent 的持续学习。



PyroDash 的协同推理架构(小模型优先,一次性大模型补全)



  • 项目网站:https://Pyromind-Dynamics.github.io/PyroDash
  • 技术报告:https://arxiv.org/abs/2607.20327
  • 开源代码:https://github.com/Pyromind-Dynamics/PyroDash
  • 模型:https://huggingface.co/Pyromind/PyroDash-4B-GRPO-Lambda-0.6

另一项成果R2VLA则把「从经验中学习」的思路延伸到了物理世界。机器人 AI 进入真实产线,第一步不是部署模型,而是要先拿到一批能用于后训练的高质量真机动作数据,但这批数据过去主要靠人工遥操作采集,慢且贵。

R2VLA 的解法是让产线上已有的规则系统先当「老师」,在真实设备上自动生成动作轨迹,再经过时间对齐、自动打标、质量筛选和后训练,形成一条自驱动的数据管线。据介绍,这条管线可以连续 24 小时零人工运行,把整体数采时间降低 50% 以上。本质上讲,R2VLA 是把传统规则系统变成了 AI 的「数据工厂」

更关键的是,模型上线之后,产线仍会持续产生新数据回流进训练,实现下一轮成长。这正是「持续学习」在物理世界里的一次具体印证。

从数字世界的推理成本,到物理世界的数据生产,PyroDash 和 R2VLA 指向的其实是同一件事:无论是屏幕里的数字 Agent,还是产线上的物理 Agent,都能被纳入同一套「持续学习」的框架里,从自己的每一次运行中获得成长

这背后是 Pyromind 更深层的愿景和对下一代 Agent 的长期判断:持续学习不该是某一类 Agent 的专属能力,而应该是所有 Agent 的通用底座。数字世界和物理世界或许形态迥异,但「让 Agent 从经验中变强」却能够共享同一套方法论。

而这些成果,正是 Pyromind 把这个想象一项项变成现实的开始。

支撑这些成果的是一支小却资深的团队。据了解,Pyromind 由阿里云、字节等背景的资深工程师组成,成立至今已完成千万级美元融资,投资方包括高瓴创投、百度风投、蓝驰创投、Atypical Ventures 和 HyperCompute 等多家机构。

在能力验证上,团队在 ICRA 2026 全球具身智能挑战赛中获得第 7 名,是国内唯一以「大模型微调+强化学习后训练」为核心技术路线进入该赛道全球前十的团队;场景侧,Pyromind 已与优必选、欢网、华秋智联等多家客户完成签署,覆盖具身 VLA、端侧 GUI Agent 和电路 EDA 等多个场景。

结语

Agent 正在从演示走向真实生产,竞争的重点也随之从「能否完成任务」转向「能否在任务中持续学习和提升」。这是一个仍在展开的行业命题,也是 Pyromind 从第一天起就锚定的方向。

总结起来,Pyromind 是一家专注于 Agent 持续学习与后训练基础设施的 AI 公司,它用一个 AutoRL 平台,把「让 Agent 从每一次任务中成长」变成了企业开箱即用的能力。它想验证的判断也很简单:如果真实任务中的轨迹、结果和反馈能够顺畅地进入训练、验证与模型更新,任务经验就能稳定地转化为新的能力。

如果这个判断成立,那么衡量一个 Agent 的标准,或许就该从「它做过多少任务」,变成「它从这些任务里学会了多少」。而 Pyromind 想做的,正是让每一个 Agent 都拥有这种从工作中持续成长的能力。

一个 AI 持续进化的未来,似乎正在我们眼前,徐徐展开。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
法庭上杀人犯当场质问法官:“我明明杀了四个女人,你们为什么说我杀了3个?”

法庭上杀人犯当场质问法官:“我明明杀了四个女人,你们为什么说我杀了3个?”

落纸生花创意手工
2026-07-19 12:06:31
好夸张!今天广州多家奶茶店,爆了!

好夸张!今天广州多家奶茶店,爆了!

广州生活美食圈
2026-08-07 15:22:49
257名议员彻底赢了!菲最高法院驳回上诉,莎拉弹劾案进入终局

257名议员彻底赢了!菲最高法院驳回上诉,莎拉弹劾案进入终局

完善法
2026-08-07 02:09:22
金价突然大涨 !中国央行单月增持64万盎司黄金,已连续第21个月增持

金价突然大涨 !中国央行单月增持64万盎司黄金,已连续第21个月增持

每日经济新闻
2026-08-07 21:06:17
以黎会谈被迫结束 美方声称“进展积极”

以黎会谈被迫结束 美方声称“进展积极”

新华社
2026-08-07 20:08:03
唐明杰现状:官司扎堆,单方面宣称销毁胚胎却拿不出完整凭证

唐明杰现状:官司扎堆,单方面宣称销毁胚胎却拿不出完整凭证

石辰搞笑日常
2026-08-07 14:01:49
越南一家中企遭罢工,800多人集体停工,要求涨工资,调整加班费

越南一家中企遭罢工,800多人集体停工,要求涨工资,调整加班费

越南语学习平台
2026-08-07 09:27:20
4比0大胜深圳新鹏城,北京国安不愧为青岛海牛保级的专属贵人

4比0大胜深圳新鹏城,北京国安不愧为青岛海牛保级的专属贵人

姜大叔侃球
2026-08-07 22:19:26
2016年采访被挖出:纽约市长竞选人马姆达尼使用假乌干达口音引争议

2016年采访被挖出:纽约市长竞选人马姆达尼使用假乌干达口音引争议

薛定谔的BUG
2026-08-07 22:02:43
荒唐!俄罗斯都生死攸关之际了,俄官员对中国还是不服气?

荒唐!俄罗斯都生死攸关之际了,俄官员对中国还是不服气?

时负相知
2026-08-06 20:01:11
统一冰火两重天:方便面独撑,饮料全面失速

统一冰火两重天:方便面独撑,饮料全面失速

斑马消费
2026-08-07 08:21:27
大肉签!宇树科技打新,发行价格150.80元/股,中一签有望赚40万以上

大肉签!宇树科技打新,发行价格150.80元/股,中一签有望赚40万以上

东方豪侠
2026-08-07 07:38:38
解放军划下禁区:8月8日7时至18时,坐滩舰拖离进入最后倒计时

解放军划下禁区:8月8日7时至18时,坐滩舰拖离进入最后倒计时

林子说事
2026-08-04 08:53:22
涉嫌严重违纪违法,张玲被查!

涉嫌严重违纪违法,张玲被查!

阜阳发布
2026-08-07 15:15:39
第二个许家印!又一首富栽了!世界500强竟是假的,千亿帝国清零

第二个许家印!又一首富栽了!世界500强竟是假的,千亿帝国清零

蜉蝣说
2026-07-17 09:47:08
泰国辱华事件升级!群殴中国乘客只冰山一角,官媒发声,麻烦大了

泰国辱华事件升级!群殴中国乘客只冰山一角,官媒发声,麻烦大了

古史青云啊
2026-08-07 11:47:01
决战时刻遭弃用!旅美小将邓雨婷5人女篮国家队首秀5中1献6分1板

决战时刻遭弃用!旅美小将邓雨婷5人女篮国家队首秀5中1献6分1板

狼叔评论
2026-08-07 22:08:03
突发!湖北前首富被抓,真正的清算开始了

突发!湖北前首富被抓,真正的清算开始了

销售与管理
2026-08-07 17:48:13
认出5样就不简单了,这10件老物件里,最后那件如今真没几个人叫得出名

认出5样就不简单了,这10件老物件里,最后那件如今真没几个人叫得出名

时尚的弄潮
2026-08-06 11:48:51
宋子文晚年选择吐露实情:西安事变护送蒋介石抵南京当日,叛徒并不是张学良,这个名字藏了35年,再不说就要随同自己入土了

宋子文晚年选择吐露实情:西安事变护送蒋介石抵南京当日,叛徒并不是张学良,这个名字藏了35年,再不说就要随同自己入土了

唠叨说历史
2026-08-04 17:10:49
2026-08-08 01:55:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13699文章数 142712关注度
往期回顾 全部

科技要闻

突然涨价,"只收电费钱"的梁文锋,变了吗

头条要闻

2岁患儿就诊死亡首诊医生获刑 不少医生为其鸣不平

头条要闻

2岁患儿就诊死亡首诊医生获刑 不少医生为其鸣不平

体育要闻

去年信誓旦旦3000万 今年NBA查无此人

娱乐要闻

周也热恋结束,六个字暴露单身状态

财经要闻

腾讯WorkBuddy领跑AI办公 阿里字节急了?

汽车要闻

越7全球首秀 传祺开始进攻方盒子越野

态度原创

时尚
亲子
本地
艺术
旅游

从帆布袋到爱马仕,她们最爱的新包是这些

亲子要闻

西蒙小小班结束,在家整整折磨了我们两天。丈母娘还以为休息两天继续上课呢

本地新闻

课本里的童年,绍兴正上演

艺术要闻

别人画皮他画魂,这个在修道院关了18年的男人,把每一具肉体都画成了圣像

旅游要闻

太邑火把节,非有“玩常”

无障碍浏览 进入关怀版