9月2日,网易科技获悉,前字节跳动强化学习专家、前腾讯Robotics X智能体中心负责人孙鹏正式加入星尘智能,将重点负责机器人强化学习方向的技术研发与应用探索。
孙鹏毕业于清华大学,先后在康奈尔大学和罗格斯大学从事博士后研究,过去十余年的研究与实践围绕强化学习和智能体展开。早期在腾讯AI Lab及Robotics X期间,他担任智能体中心负责人,利用深度强化学习和对抗博弈训练轮式机器人,实现端到端主动目标跟随,并研发《星际争霸》AI智能体TStarBots、TStarBotX。加入字节跳动后,他主导开发强化学习基础设施ByteRL,支撑多款自研游戏AI训练,其团队曾获IEEE CoG 2023策略卡牌AI竞赛冠军,研发的《炉石传说》AI达到击败行业顶尖选手的竞技水平。
大模型兴起后,孙鹏将强化学习积累转向LLM后训练。在字节AI Lab/ByteResearch期间,他作为项目负责人参与发布强化微调方法ReFT(Reinforced Fine-Tuning)及数学推理智能体DeltaProver;在Seed团队深度参与模型RLHF与预训练。
据悉,孙鹏加入星尘智能后,将继续扩充机器人强化学习团队,并参与星尘具身模型、机器人强化学习及后训练体系建设。(袁宁)
