软件工程师日常用大模型写代码、查问题、优化文字,但你知道这些模型是怎么变聪明的吗?
Andrej Karpathy在YouTube上发布的“Deep Dive into LLMs like ChatGPT”视频,把这个过程拆解得相当清楚。他发现,很多人并不了解基础模型和聊天模型之间究竟差在哪一步——这一步恰恰决定了你用的是“自动补全引擎”还是“对话助手”。
基础模型本质上是个随机文本生成器。它没有自我意识,也不具备对话功能,只能根据互联网训练数据做“下一个词预测”。这种模型不会回答你的问题,因为它根本没学会怎么跟人交流。要让模型开口说话,需要第二步——后训练。
后训练阶段,模型会接触大量人类对话样本,学会什么样的回答是符合期待的、什么样的问题不该回答。模型在预训练阶段已经消化了海量互联网知识,后训练的核心任务是教会它用有用的方式把这些信息传达出来。
模型训练离不开算力。Karpathy在视频中解释了为什么数据中心里堆满GPU而不是CPU——GPU能高效处理并行计算,专为训练大模型所需的那类数学运算而生。数据中心提供的是可扩展的计算、内存和网络能力,这也是为什么各家AI公司都在疯狂抢建数据中心。
训练过程本身是一轮一轮迭代的。神经网络每过一遍数据就重新计算全部参数,让预测能力逐步提升。这个过程中有一个关键指标叫损失值,越低说明模型预测越准。一开始模型只会随机猜下一个词,训练结束后它就能写文章、写代码、做研究了。
每次新模型发布,大家讨论参数规模、推理速度、基准跑分,但背后真正变化的,是这个训练流程中某一个或多个环节的优化——可能是数据质量提升,可能是后训练方法改进,也可能是算力规模扩大带来的效果跃迁。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.