网易首页 > 网易号 > 正文 申请入驻

新鲜出炉!斯坦福2025 CS336课程全公开:从零开始搓大模型

0
分享至

机器之心报道

编辑:Panda

斯坦福大学 2025 年春季的CS336课程「从头开始创造语言模型(Language Models from Scratch)」相关课程和材料现已在网上全面发布!

  • 课程视频:https://www.youtube.com/watch?v=SQ3fZ1sAqXI&list=PLoROMvodv4rOY23Y0BoGoBGgQ1zmU_MT_
  • 课程主页:https://stanford-cs336.github.io/spring2025/

这是该课程的教职工阵容:

其中,讲师 Tatsunori Hashimoto 现为斯坦福大学计算机科学系助理教授。此前,他是斯坦福大学 John C. Duchi 和 Percy Liang 的博士后,研究机器学习模型平均性能和最差性能之间的权衡。在博士后研究之前,他在麻省理工学院攻读研究生,导师是 Tommi Jaakkola 和 David Gifford。他本科在哈佛大学学习统计学和数学,导师是 Edoardo Airoldi。他的研究成果已总计获得了超 3 万引用。

另一位讲师 Percy Liang 是斯坦福大学计算机科学系副教授,同时也是基础模型研究中心(CRFM)主任,同时也有参与以人类为中心的人工智能(HAI)、人工智能实验室、自然语言处理研究组和机器学习研究组等的研究工作。他本科毕业于 MIT,之后在该校获得工程学硕士学位,导师是 Michael Collins;之后,他在伯克利获得博士学位,导师是 Michael Jordan 和 Dan Klein;后来他进入谷歌从事博士后研究。Percy Liang 是一位引用量超过 10 万的研究大牛,我们此前也曾多次报道他的研究成果。

CS336 课程简介

CS336 课程的目标是「引导学生完成开发自己的语言模型的整个过程,从而帮助他们全面理解语言模型。」该课程借鉴了操作系统课程中从零开始创建完整操作系统的教学方法,引导学生完成语言模型创建的各个环节,包括预训练的数据收集和清理、Transformer 模型的构建、模型训练以及部署前的评估。

该课程包含 5 个单元,分别是基础、系统、扩展、数据、对齐和推理强化学习。

该课程也非常注重实践操作,因此也需要相当多的学习和开发时间。Percy Liang 也在 上简单分享了学生需要实践的内容,包括:

  • 作业 1(使基本流程正常运行):实现 BPE 分词器、Transformer 架构、Adam 优化器,并在 TinyStories 和 OpenWebText 上训练模型。只允许使用 PyTorch 原语(不能直接调用 torch. nn. Transformer 或 torch. nn. Linear)。
  • 作业 2(让 GPU 运行起来):在 Triton 中实现 Flash Attention 2、分布式数据并行 + 优化器分片。
  • 作业 3(Scaling Law):使用 IsoFLOP 拟合 Scaling Law。为了模拟训练运行的高风险,学生会获得一个训练 API [超参数→损失] 和一个固定的计算预算,并且必须选择提交哪些运行来收集数据点。在后台,训练 API 是通过在一系列预先计算的运行之间进行插值来支持的。
  • 作业 4(数据):将 Common Crawl HTML 转换为文本,过滤(质量、有害内容、PII),删除重复数据。这是一项苦差事,却没有得到足够的重视。
  • 作业 5(对齐):实现监督微调、专家迭代、GRPO 和变体,在 Qwen 2.5 Math 1.5B 上运行 RL 以提升在 MATH 上的指标。我们也曾考虑过让学生自己实现推理(inference),但决定(可能是明智的)让人们使用 vllm。

更具体来说,CS336 课程的 5 个单元包含 19 门课。这里简单总结了该课程的目录,你可以在课程主页下载相应的材料:

  • 课程概述和 token 化
  • PyTorch 和资源(包括内存和计算资源)
  • 架构与超参数
  • 混合专家(MoE)
  • GPU
  • Kernel,Triton
  • 并行化
  • 并行化
  • Scaling Law
  • 推理
  • Scaling Law
  • 评估
  • 数据
  • 数据
  • 对齐 ——SFT/RLHF
  • 对齐 —— 强化学习
  • 对齐 —— 强化学习
  • 客座讲座:阿里巴巴达摩院研究员、Qwen 团队技术负责人 Junyang Lin(林俊旸)
  • 客座讲座:Facebook AI 研究科学家、Llama 3 预训练负责人 Mike Lewis

另外,在考虑学习这门课程之前,你应该先具备以下能力:

  • 熟练掌握 Python:大部分课程作业将使用 Python 完成。与大多数其他 AI 课程不同,本课程只会给学生提供极少的脚手架。你编写的代码量将至少比其他课程多一个数量级。因此,熟练掌握 Python 和软件工程至关重要。
  • 有深度学习和系统优化经验:本课程的很大一部分内容是关于如何使神经语言模型在多台机器的 GPU 上快速高效地运行。我们希望学生能够熟练掌握 PyTorch,并了解内存层次结构等基本系统概念。
  • 大学微积分、线性代数(例如 MATH 51、CME 100):你应该能够轻松理解矩阵 / 向量符号和运算。
  • 基础概率与统计(例如 CS 109 或同等课程):你应该了解概率、高斯分布、均值、标准差等基础知识。
  • 机器学习(例如 CS221、CS229、CS230、CS124、CS224N):你应该熟悉机器学习和深度学习的基础知识。

顺带一提,CS336 课程还为完成课程的学生赠送了纪念 T 恤,有如下 4 种图案。你觉得如何呢?

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
特朗普:美国正从委内瑞拉获得数亿桶石油,与委方“关系良好”,大型能源企业已入委开发资源!已卖了1亿桶委石油,赚回出兵成本的37倍

特朗普:美国正从委内瑞拉获得数亿桶石油,与委方“关系良好”,大型能源企业已入委开发资源!已卖了1亿桶委石油,赚回出兵成本的37倍

每日经济新闻
2026-05-05 12:32:23
浏阳爆炸烟花厂附近居民:多名中老年妇女在厂内工作,一女性从围墙洞口逃生

浏阳爆炸烟花厂附近居民:多名中老年妇女在厂内工作,一女性从围墙洞口逃生

鸡蛋bot
2026-05-05 15:44:51
詹姆斯27+6创多项历史第一:空砍全场最高分 提前下场沮丧认输

詹姆斯27+6创多项历史第一:空砍全场最高分 提前下场沮丧认输

醉卧浮生
2026-05-06 11:04:17
把身价打没了!里夫斯16中3复出最差表现 湖媒批恐损失几千万

把身价打没了!里夫斯16中3复出最差表现 湖媒批恐损失几千万

醉卧浮生
2026-05-06 11:17:50
夺冠不到24小时!英球迷质疑艾伦关键球,要求严查 还回冠军

夺冠不到24小时!英球迷质疑艾伦关键球,要求严查 还回冠军

林子说事
2026-05-06 09:42:04
河南九旬奶奶开2元理发店,26年不涨价,每月“净赚不到400元”,本人回应:家有军人传统,不图赚钱,这不是生意,是跟老伴儿的承诺

河南九旬奶奶开2元理发店,26年不涨价,每月“净赚不到400元”,本人回应:家有军人传统,不图赚钱,这不是生意,是跟老伴儿的承诺

极目新闻
2026-05-06 11:26:39
自己废物老公是大神是啥体验?网友:这种梦会害死好多女生的

自己废物老公是大神是啥体验?网友:这种梦会害死好多女生的

解读热点事件
2026-05-06 00:45:30
兰州饭馆挂钱学森袁隆平照片,被投诉,老板反手报警:崇拜,不摘

兰州饭馆挂钱学森袁隆平照片,被投诉,老板反手报警:崇拜,不摘

观察鉴娱
2026-05-05 10:24:44
吴宜泽夺冠,最开心的除了他的父母,可能就是敢扑进冠军怀里的她

吴宜泽夺冠,最开心的除了他的父母,可能就是敢扑进冠军怀里的她

揽星河的笔记
2026-05-05 20:20:47
空房交物业费合理吗?2026年物业费新规:这4种情况一分不掏

空房交物业费合理吗?2026年物业费新规:这4种情况一分不掏

老特有话说
2026-04-15 15:11:16
伟伟道来 | 伊朗的反应为何如此激烈

伟伟道来 | 伊朗的反应为何如此激烈

经济观察报
2026-05-06 11:40:46
女性跑步:暴露这个隐私,是性感吗?

女性跑步:暴露这个隐私,是性感吗?

马拉松跑步健身
2026-05-05 19:18:07
26死!一员工因亲属在浏阳花炮事故中离世请假,获领导暖心批复

26死!一员工因亲属在浏阳花炮事故中离世请假,获领导暖心批复

火山詩话
2026-05-06 10:04:31
为什么发达国家对中国都不友好?

为什么发达国家对中国都不友好?

新浪财经
2026-05-04 07:26:54
活塞1比0骑士:坎宁安不再是一个人了

活塞1比0骑士:坎宁安不再是一个人了

张佳玮写字的地方
2026-05-06 10:22:22
嵩山标语牌上写“爬不动了吧哈哈哈”,因有人质疑其“嘲讽游客”被换下,网友惋惜:原标语生动有梗

嵩山标语牌上写“爬不动了吧哈哈哈”,因有人质疑其“嘲讽游客”被换下,网友惋惜:原标语生动有梗

天津人
2026-05-05 18:57:00
美国要掀桌子了,特朗普准备全球抢劫,留给我们的时间不多了

美国要掀桌子了,特朗普准备全球抢劫,留给我们的时间不多了

一个坏土豆
2026-05-05 19:12:59
阿姨的气质让小哥挡不住

阿姨的气质让小哥挡不住

贵圈真乱
2026-05-06 10:13:32
50万镑奖金如何花?吴宜泽将在英国买一套房,墨菲呼吁向中国学习

50万镑奖金如何花?吴宜泽将在英国买一套房,墨菲呼吁向中国学习

侃球熊弟
2026-05-06 01:24:34
游客坠落前喊了两遍“没绑紧”,视频中有人笑,整个过程不到20秒

游客坠落前喊了两遍“没绑紧”,视频中有人笑,整个过程不到20秒

魔都姐姐杂谈
2026-05-05 22:13:52
2026-05-06 12:16:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
12920文章数 142643关注度
往期回顾 全部

教育要闻

六条逻辑主线替代四个大概念,反映了怎样的理念? | 高中课标修订解读⑥

头条要闻

牛弹琴:高市终于下跪了 中韩等亚洲人内心感到气愤

头条要闻

牛弹琴:高市终于下跪了 中韩等亚洲人内心感到气愤

体育要闻

全世界都等着看他笑话,他带国米拿下冠军

娱乐要闻

神仙友谊!杨紫连续10年为张一山庆生

财经要闻

人形机器人七小龙:谁真能卖 谁在讲故事?

科技要闻

告别废话文学与幻觉!GPT-5.5 Instant发布

汽车要闻

吉利原生新能源越野架构亮相 AI如何带来极致越野

态度原创

家居
游戏
教育
亲子
旅游

家居要闻

大胆前卫 时尚大宅

大爆料!PS6掌机内存规格曝光!几乎不拖累主机性能

教育要闻

孩子摆烂躺平,家长放任不管能靠他自己好起来?

亲子要闻

四个半月大的宝宝过隧道,下一秒表情亮了…… #睡个好觉

旅游要闻

营收同比增长78.64%!东平县五一文旅市场活力迸发

无障碍浏览 进入关怀版