有人看完一条11分钟的视频,给出的评价只有一句:比预期好。视频讲的是三个强化学习里的老面孔——PPO、GRPO、DPO。
发帖人的原话更直接:他觉得做不出这种东西的模型,大概是不抽大麻的。这句调侃指向的是视频里那套可视化讲解,把三个算法放在一起对照着讲。
![]()
三个缩写,三种路线
PPO、GRPO、DPO,都是围绕模型偏好对齐展开的方法。视频没有停留在名词解释,而是用可视化把三者的差异摆出来,看完能分清各自在做什么。
发帖人只留下一句"看完你就懂",没有展开技术细节。这条内容本身更像一次推荐,而不是教程。
564次浏览背后的信号
这条帖子发布于9月27日深夜,浏览量564。数字不大,但评论区之外的那句"比预期好",说明可视化讲解这类内容正在被更多人当成理解算法的入口。
对做模型的人来说,PPO、GRPO、DPO不是新词,难的是讲清楚。一条11分钟的视频能做到,本身就是件值得转的事。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.