华为开源盘古openPangu-2.0的预训练、SFT代码和后训练RL代码正式开源上线。openPangu-2.0模型相关组件已陆续上线开源平台。
这次放出的不是单一权重文件,而是三段关键代码:预训练、SFT(监督微调)、后训练RL(强化学习)。对想复现或二次开发大模型的团队来说,这三段基本覆盖了从底座到对齐的主要环节。
![]()
三段代码分别管什么
![]()
预训练代码对应模型从零开始学习语言规律的过程;SFT代码负责把底座模型调成能听懂指令的形态;后训练RL代码则用于进一步对齐人类偏好。三者串起来,是一条完整的训练链路。
华为选择把这条链路整体开源,而不是只放推理接口或部分权重。相关组件已陆续上线开源平台,意味着开发者可以按需取用,而不是等一个打包好的黑盒。
开源节奏在加快
![]()
从权重到代码,大模型开源的门槛正在被一层层拆掉。预训练代码因为涉及数据配比和并行策略,过去往往是各家最不愿公开的部分。这次一并放出,对社区来说省去了大量试错成本。
openPangu-2.0的组件还在陆续上线,后续会有哪些模块跟进,值得继续盯。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.