AI下半场不会只剩一个超级模型。这是Pyromind创始人兼CEO Kevin Ding在最近一期「十字路口」播客里反复强调的判断。他的公司刚完成天使轮融资,投资方包括高瓴、百度风投、蓝驰、Atypical等机构。赛道常被称作RL as a Service,也就是强化学习即服务,或者后训练即服务。
从服务到自动循环管道
![]()
Kevin在节目里说,Service只解决了一半问题。真正要让Agent在生产环境中持续改进,还需要把训练、奖励、反馈、部署和数据回流串成一条可以自动循环的管道。这就是Pyromind正在押注的AutoRL。
他解释,一开始团队认为做到RL as a Service、做成一个扁平的service形态,差不多就能满足Agent部署的要求。后来发现这依然不够。因为service面向的对象终归还是要有一个Developer在那边驱动Agent去改进。真正把RSI跑起来要解决两个问题,一个是Training Infra,一个是奖励。于是奖励被纳入了他们的scope。
GUI Agent客户的两次转变
Kevin举了一个GUI Agent领域的客户例子。这个客户下游有很大的消费级部署量,会不断收集到用户特定需求和产品迭代需求。第一期Pyromind提供的是RL service,给了一个Studio,把通用training pipeline固定下来。客户依然需要不断投入自己的算法工程师去更新Agent本身,Pyromind只把训练这件事解决得很好。
到了第二期,团队把GUI方向的奖励做好后,发现这个loop可以自动化跑起来。只要末端部署的Agent能源源不断收上来用户在真实环境下的反馈,就可以让它自主循环跑起来。于是第二期给客户推了EchoMind这套产品。
4B小模型加协作引擎
Kevin重点分享了新工作PyroDash:一个由4B小模型、强基座模型和协作引擎组成的大小模型协作架构。他认为这背后对应的是一个更大的判断:需求世界是多元的,不是所有问题都应该被收拢到一个中心化大模型里解决。
他个人更偏向服务化路线,认为ASI最终形态会是一个服务化形态,是一个Agent蜂群形态。因为世界上需要被AI解决的问题和场景,从当下时间点看就已经无穷无尽,随着时间推移还会不断产生新场景,而且场景本身也不是静态的。用有限参数的模型去泛化无限场景,至少在Transformer架构上实现还蛮有挑战。
为什么RSI现在才热起来
Kevin观察到,RSI被需要是因为Agent现在开始多起来了。当一个个Agent被嵌入到场景里,对它最终的衡量方式是它得在一定时间轴上表现都符合预期。实现方法就是Agent需要自我迭代,Agent本身需要有自我改进的能力。正常一个人日常带了几十个Agent去做一件事,不可能有精力去维护每一个Agent的演进。
他坦言,第一次进入客户场景时,FDE的工作不可省:要理解数据制式、评价基准、业务流程和奖励信号。但Pyromind追求的是让这部分工作在相似模态和相似场景中逐渐递减,把一次性交付沉淀成可以横向复制的AutoRL管道。
初步跑通PMF
Kevin没有透露具体融资数值,但表示比较振奋人心的一点是,公司初步跑通了PMF。一个方向是证明AutoRL这种方式实现的RSI在生产环境有价值,商业模型至少成立。第二点是可扩展性,在横向场景和客户复制上,工作量逐步递减。
他此前在阿里云做过弹性GPU实例和训练GPU集群,精力放在偏Infra的地方。当时看到模型预训练远远没有到终结的时候,同时注意到2025年下半年,社区、硅谷和国内技术圈都在讨论AI可能要进入下半场。下半场的说法出现了两个方向:一个是继续沿着预训练走,ASI到来的形式会是一个超级庞大的、中心化的模型,能够解决绝大多数场景里的问题;另一个方向是,ASI最终形态会是一个服务化形态,是一个Agent蜂群形态。他个人更偏向后者,因为觉得这个更实际。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.