经历了几年断断续续的写作,我终于完成了自己的第一本书:《Reinforcement Learning from Human Feedback: Aligning and Post-training LLMs》,由Manning出版社正式出版。这本书不是心血来潮,而是我多年来在开放模型训练中积累的经验总结,也是我一直想读、却一直没人写的那类书。
这本书最初源于一个网站。当时我想把后训练阶段的关键方法记录下来,因为很多方法——比如拒绝采样、结果奖励模型、角色训练等——几乎没有现成的在线教程能讲清楚。2024年我注册域名时,后训练已经相当热门,但这些内容依然稀缺。直到今天,那个网站依然是少数几个能用基础、直观的方式讨论这些话题的地方,所以它积累了不少读者。
![]()
除了方法梳理,这本书更多在传递直觉和历史。整个LLM行业的核心技术近几年其实变化不大,真正难的是理解它们为什么有效、怎么权衡取舍、以及人们常在哪些误区里打转。为了让数学背后的故事连起来,我重新打磨了Interconnects上一些早期的、奠基性的文章。因此,这本书的行文风格可能比一般教科书更具个人声音。
这本书不是写给初学者的。虽然有很多人还在问我基础的后训练问题,而且这一群体越来越大,但我发现,连业内资深研究者也经常翻阅这本书。它更像是一本为已经上路的从业者准备的实战指南——用简单的语言讲清楚复杂的事,让你少走弯路。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.