如果你正在训练跨模态模型,手里同时维护着 Megatron-LM、LeRobot、外加一套扩散模型框架,每个都有自己的一套并行策略和检查点格式——那你大概明白那种想掀桌的冲动。Megatron-LM 在 LLM 上久经考验,但根本没考虑过视觉-语言-动作机器人;LeRobot 和 OpenPI 专为具身模型的研究迭代而生,却扛不住生产级吞吐;扩散模型训练又活在另一个孤岛上。结果就是团队不得不维护三四套代码库,每一套都有自己的并行方案、检查点格式和性能天花板。
这就是 LoongForge 要解决的。百度百舸近日将内部训练加速栈 AIAK-Training-LLM 正式开源,命名为 LoongForge,试图用一个框架把大语言模型(LLM)、视觉语言模型(VLM)、扩散模型和具身智能的训练全部拉通。该栈已在教育、计算机视觉和具身智能等领域的企业客户中跑过生产训练,典型场景下比客户原有基线提速 30%–50%,最大规模跑到了 5000 个以上加速器。仓库已上 GitHub,采用 Apache-2.0 协议,开箱即用覆盖 Pretrain、MidTrain、SFT 和 LoRA 等环节。
![]()
下面拆解一下它真正区别于现有训练框架的几个核心点。
一、为具身模型训练专门做了工程加速
这一点是绝大多数训练框架碰都不碰的地方。LoongForge 直接内置了一个基于 PyTorch 原生的 DDP/FSDP 子系统,服务于 VLA(视觉-语言-动作)和世界-动作模型,包括 Pi0.5、GR00T N1.6、X-VLA、FastWAM、DreamZero、LingBot-VA 等主流策略模型。整个子系统与 Megatron 核心解耦,提供了一套灵活的策略切换:DDP、ZeRO-1、FSDP、HSDP 可随需要切换。如果你在训机器人策略,当下产业里真正够用的生产级吞吐工程方案仍属稀缺品,而 LoongForge 把它嵌进了框架内部。
二、一个框架,四种模态
LLM、VLM、扩散、具身——统合在一套模型抽象之下。VLM 的组装完全由配置驱动:可替换的 ViT 和 LLM 组件通过 YAML 文件拼装在一起,你想换个定制 ViT 搭一个新的 LLM 主干,改一行 YAML 就行,而不需要去 fork 整个框架、再改底层。这种配置化的组装逻辑把多模态实验的迭代门槛压到了相当低的程度。扩散模型的训练也不再需要另外搭一套并行系统,所有模态共享同一套训练调度和加速优化。
三、双硬件后端,代码不动
原生支持 NVIDIA GPU 和昆仑芯 XPU,通过最小侵入式的插件设计实现。同一份训练代码可以不经修改地跑在两种硬件上。对于需要跨硬件平台部署训练任务的团队来说,这意味着不用再维护两套硬件适配层,也不用因为换硬件就重写大部分分布式逻辑。
四、瞄准了那些被各自“专优”框架捆住手脚的团队
LoongForge 真正适合的是做预训练或大规模微调的团队——尤其是那些已经被迫同时维护语言、视觉-语言、扩散和机器人四套不同训练栈的人,并且真正在意吞吐和加速器利用率。整个仓库统一了检查点格式、并行策略、数据加载和加速器通信,把原本散落在 Megatron-LM、扩散训练库、具身框架里的工程能力做了一次聚合。对于已经在生产环境上跑多模态的团队来说,把维护四套代码的精力收拢到一套里,本身就是一笔相当诱人的成本账。
五、反直觉但合理的定位:不试图“包打天下”,而是填上缺口
LoongForge 并没有宣称要取代 Megatron-LM 或 LeRobot,它更像个工程加速层的整合者。在 LLM 这一侧,它继承了 Megatron 的生产验证能力;在具身这一侧,它补上了大多数框架缺失的生产级分布式加速;在扩散上,它让扩散训练第一次可以和语言、视觉语言训练跑在同一套加速栈上。这种补齐短板的思路,比重新造一个“万能框架”要务实得多。
如果你正在这个方向上做训练,库里的具身子系统是开发团队格外希望收到反馈的部分。你希望接下来支持哪些模型?仓库已开放在 GitHub Issues 上收集建议。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.