网易首页 > 网易号 > 正文 申请入驻

从算法原理看:为什么大语言模型(LLM)是「先例模型」

0
分享至

名字应当从机制里来

大语言模型(LLM)是「先例模型」,这个判断不是修辞,而是可以从算法本身一步步推出来的。

这里特意不用「大模型」这个统称。发现模型将来同样可能以大参数模型的形式出现,两者的区别不在参数规模,而在训练目标和数据来源。本文所说的 LLM,特指以人类文本为语料、以预测下一个词为训练目标的模型。

一个大语言模型(LLM)从诞生到回答你的问题,要经过三个阶段:预训练、对齐、解码生成。每一个阶段的数学目标,都在把模型推向同一个方向——忠实地复现人类已经写下的东西。下面逐一拆开看。


图 1 LLM 的三个阶段:每一步的数学目标,都把输出拉向语料中的先例

预训练:学的是「通常如何」

预训练只有一个目标:给定前文,预测下一个词。写成损失函数,就是在整个语料上最小化负对数似然:


这个目标有一个标准的等价形式:最小化语料真实分布与模型分布之间的 KL 散度。


翻译成白话:训练得越好,模型就越精确地知道「在人类写过的文字里,这种前文后面通常跟着什么」。模型不学习世界本身,它学习的是人类描述世界的方式。

这正是先例的定义。法官查判例,问的是「类似的案子过去怎么判」;模型预测下一个词,问的是「类似的前文过去怎么接」。两者在结构上是同一件事,只是模型的「判例库」是十万亿词量级的人类文本。

对齐:把模型拴在先例附近

预训练之后的模型会续写,但还不会好好回答问题。对齐阶段分两步。

第一步是有监督微调(SFT):用人工写好的「标准答案」继续做最大似然训练。目标函数和预训练完全一样,只是先例库换成了精选的人类示范。

第二步是基于人类反馈的强化学习(RLHF)。它的标准目标形式如下:


这个公式有两项。前一项奖励人类评审者喜欢的回答,而评审者的判断本身,就是以人类既有共识为标尺的。后一项是一根「缰绳」:用 KL 散度惩罚模型偏离参考模型太远,而参考模型正是预训练和微调产出的那个先例分布。

所以对齐不是让模型去探索新东西,而是在「不离先例太远」的前提下,把回答调成人类最认可的样子。从数学上说,这会进一步把输出推向分布的主峰——也就是最主流、最安全的那类先例。

生成:新句子,旧先例

你提问时,模型逐词生成回答。每一步,它先算出词表上每个词的打分 z,再按温度 T 换算成概率去采样:


温度越低,越集中地选最高概率的词;温度调高,只是在先例中次常见的说法里多做一些随机选择。无论怎么调,采样都发生在模型从语料中学到的那个分布里。

这就是为什么「检索」这个词不对,而「先例」是对的。大语言模型(LLM)写出的句子往往确实从未存在过,它并不是把某篇文档原样交还。但句子里的每一个转折、每一个判断,都是在「人类通常会怎么写」的引导下组合出来的。新的是措辞,旧的是依据。

推理模型突破先例了吗

最有力的反驳来自推理模型。它们在作答前先生成长长的思维链,并用可验证的奖励做强化学习,在数学和编程上确实解出了语料里没有的题。这一点应当坦率承认。

但要看清它突破的是什么。思维链的每一步,仍然是从同一个先例分布采样出来的;强化学习做的,是在大量先例式的步骤组合中,筛出能通过验证器的那一条。这是「在先例之间搜索新组合」,而且有一个前提:必须存在一个便宜、可靠、自动化的验证器——证明对不对、代码跑不跑得通。

在药物、医疗、金融风险这些领域,并没有这样的验证器。一个关于靶点的判断对不对,只有回到真实数据里才能检验。更重要的是,推理模型扩展的是搜索能力,而不是数据域。它仍然只在符号和文字的世界里思考。

定位:不止于检索,又未及发现

把大语言模型(LLM)放在两类模型中间看,它的位置就清楚了。只需要问两个问题:输出是不是新的?依据是不是新的?


为什么不只是检索模型。 检索模型的数学形式,是在一个固定的文档集合 C 里,找出与问题 q 打分最高的那篇文档:


它的输出永远是 C 里已经存在的一个元素。大语言模型(LLM)的输出空间却是所有可能的词序列,它能归纳、组合、类比、推理,写出语料里从未出现过的句子。把它叫作检索模型,低估了它。

为什么也不是发现模型。 发现至少需要三个条件:能接触语料之外的证据;当数据支持时,奖励偏离先例的结论;用数据本身而非人类认可来验证。大语言模型(LLM)三条都不满足。它的证据全部来自语料;它的训练目标——最大似然与 KL 约束——恰恰惩罚偏离先例;它的对齐标尺是人类评审者的既有共识。在结构上,它的优化方向与发现是相反的。

所以它是先例模型。 就像一位读遍判例的法官:面对新案子,他能写出一份从未有过的判决书,这比翻出一份旧判决多了一步;但判决书里的每一条理由,都来自已有的判例,而不是来自他亲自去现场取证——这又比发现少了一步。比检索多一步,比发现少一步,这正是「先例」二字的含义。

边界:支撑集之外

把上面三个阶段合起来,可以用一个统计学概念概括大语言模型(LLM)的边界:支撑集。一个分布的支撑集,是它赋予非零概率的那些区域。模型只能对训练语料中有证据的模式给出有意义的判断;在支撑集之外,它只能拿最接近的先例去类比,这就是幻觉的来源之一。


图 2 三类模型的位置:检索模型取回已有的一点,先例模型在已有之间组合出新的一点,发现模型在支撑集之外找到新信号

关键在于:人类最有价值的新知识,恰恰大量落在这个支撑集之外。医院的原始病历表、保险的理赔流水、银行的交易记录,是结构化的、按时间排列的记录,不是文章。它们出于合规原因不会进入任何公开语料,其中藏着的规律也从未被任何人写成文字。

这不是算力或参数规模能解决的问题。模型再大,它拟合的仍然是同一个语料分布;语料里没有的,最大似然估计不出来。

结语:为什么还需要发现模型

从预训练的最大似然,到对齐的 KL 约束,再到解码的高概率采样,大语言模型(LLM)每一步的数学目标都指向同一件事:做一个极其出色的先例模型。这是它的力量所在,也是它的边界所在。

发现模型要解决的是另一个问题:它的起点不是语料,而是原始数据;它的目标不是复现「通常如何」,而是找出偏离先例、又经得起数据检验的信号;它的结论靠回到数据本身来验证,而不是靠人类评审者的认可。

发现模型并非只存在于构想之中。AIGM 开发的新知系统(NKS),是第一批投入实际应用的发现模型之一,正是按上述三个条件设计的。第一,它把计算引擎部署到数据所在的地方,直接处理病历表、理赔流水、交易记录这类从未进入公开语料的原始数据,原始数据不出域。第二,它的目标是找出偏离先例的信号:从研究者给出的初始关键词出发,自动发现数据中隐藏的等价表述;从个体行为在时间轴上的排列中,识别从未被定义过的行为模式。前文 GPR40 靶点的重新判断,就是 NKS 在医药领域的一次应用。第三,它的每一条结论都能回溯到具体的数据记录和版本。

更值得一提的是,NKS 并非为某一个行业定制。它已在医药、保险、金融投资、监管、网红经济、人力资源、能源矿产等领域取得成功案例,展现出广泛的跨领域、泛化通用的知识发现能力。以 NKS 为底座,各个行业的应用都可以很便捷地嫁接或开发出来。这也从另一个角度印证了本文的判断:发现能力来自处理原始数据的方式,而不是来自某个行业的语料。

两者并不互斥。发现模型从数据里找出新东西,先例模型把它翻译成人能读懂的语言。但当问题的答案从未被写下——一个被误判的靶点、一种尚未被识别的欺诈模式——人类需要的不是更大的先例模型,而是一个能在先例之外工作的发现模型。

汤子欧 2026 年 10 月 9 日

汤子欧是哈佛大学博士后和日内瓦大学博士,长期致力于机器学习和深度学习研究。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
酒店里,挤满了偷偷开房的中年夫妻

酒店里,挤满了偷偷开房的中年夫妻

十点读书
2026-10-08 20:13:48
晒一块刹车踏板,岚图前9月交付115481辆

晒一块刹车踏板,岚图前9月交付115481辆

算力游侠
2026-10-08 20:33:17
我已经50岁了,二婚没多久就开始恶心呕吐,去医院一查竟然是怀孕

我已经50岁了,二婚没多久就开始恶心呕吐,去医院一查竟然是怀孕

千秋文化
2026-07-04 19:16:43
我工资9000,发工资时却到账49000,去找老板问,老板却反问:前晚发的通知,你没看?

我工资9000,发工资时却到账49000,去找老板问,老板却反问:前晚发的通知,你没看?

LULU生活家
2026-10-09 16:27:21
24元救命药飙涨到1200元,网友:趁火打劫吧?

24元救命药飙涨到1200元,网友:趁火打劫吧?

东方豪侠
2026-10-09 14:59:31
尊界V800风波继续:尊界宣布升级部件,测试视频多平台被下架,懂车帝或面临被罚

尊界V800风波继续:尊界宣布升级部件,测试视频多平台被下架,懂车帝或面临被罚

桃叶渡春
2026-10-09 19:08:48
两所在京高校领导班子调整

两所在京高校领导班子调整

现代教育报
2026-10-09 19:11:41
太真实!周琦自曝NBA被裁真相:别人拼命留守,他却赌气要面子 天赋白白浪费?

太真实!周琦自曝NBA被裁真相:别人拼命留守,他却赌气要面子 天赋白白浪费?

海阔山遥YAO
2026-10-09 12:36:44
尊界汽车回应制动踏板支架问题 余承东转发声明

尊界汽车回应制动踏板支架问题 余承东转发声明

观点机构
2026-10-09 12:43:28
男子土豆当主食,半年瘦25斤!营养专家:土豆是被严重低估的食材

男子土豆当主食,半年瘦25斤!营养专家:土豆是被严重低估的食材

药师方健
2026-10-02 22:19:37
90年代邵东黑道少年佘智江为何成了KK园缔造者,他表哥却成了大佬

90年代邵东黑道少年佘智江为何成了KK园缔造者,他表哥却成了大佬

睡前讲故事
2025-11-14 13:00:20
后备箱装矿泉水将被罚?央视发声给提醒,网友:确实该罚

后备箱装矿泉水将被罚?央视发声给提醒,网友:确实该罚

青梅侃史啊
2026-10-09 14:29:43
中美终于谈妥,统一成定局,大陆海警进金门水域,民进党当局破防

中美终于谈妥,统一成定局,大陆海警进金门水域,民进党当局破防

云舟史策
2026-10-05 07:07:06
全世界公认的十大健康食品,大蒜排第二,第一名家家都有!(建议收藏)

全世界公认的十大健康食品,大蒜排第二,第一名家家都有!(建议收藏)

诗词天地
2026-09-28 14:09:52
某些无良媒体,你丫还有点良知和节操吗?

某些无良媒体,你丫还有点良知和节操吗?

涛哥锐评
2026-10-06 20:56:04
“去医院时不要乱穿衣服啊!!”哈哈哈哈哈被误诊的风险还挺大!!

“去医院时不要乱穿衣服啊!!”哈哈哈哈哈被误诊的风险还挺大!!

脆皮先生
2026-10-09 21:22:46
银行行长酒后道出实情:普通家庭存款一旦超过65万,别全部存定期

银行行长酒后道出实情:普通家庭存款一旦超过65万,别全部存定期

三农老历
2026-10-07 19:45:54
女局长被举报婚内出轨多人,三个疑问该有答案

女局长被举报婚内出轨多人,三个疑问该有答案

极目新闻
2026-10-09 11:00:35
泽连斯基反驳鲁比奥:“你们不能一面与俄罗斯谈判未来的经济项目,一面说我们陷入外交僵局”

泽连斯基反驳鲁比奥:“你们不能一面与俄罗斯谈判未来的经济项目,一面说我们陷入外交僵局”

政知新媒体
2026-10-09 19:38:01
15999起!iPhone Duo下周开订,京东预约逼近200万,苹果还玩起了当面激活

15999起!iPhone Duo下周开订,京东预约逼近200万,苹果还玩起了当面激活

泡泡网
2026-10-09 11:15:11
2026-10-09 21:56:49
福布斯 incentive-icons
福布斯
《福布斯》中国官方账号
16327文章数 49254关注度
往期回顾 全部

科技要闻

华为小米手机同日涨价,最高涨1000元

头条要闻

新人结婚主持人发现礼炮塞满纸钱和骂人纸条 新郎发声

头条要闻

新人结婚主持人发现礼炮塞满纸钱和骂人纸条 新郎发声

体育要闻

与C罗硬碰硬,一个72岁老人的倔强

娱乐要闻

吴奇隆宣布重要决定,走上谢霆锋老路

财经要闻

时隔12年,公募基金运作办法修订

汽车要闻

舒适体验全面升级/四驱版续航超700km 理想i6将于10月28日上市

态度原创

艺术
教育
健康
游戏
军事航空

艺术要闻

巴斯奇亚24岁画的《古代科学家》,7697.5万!

教育要闻

北京密云千班集结,“班BA”开赛

痘坑留下后,还能填平吗?

猛鬼追魂新作玩家与媒体评价差异巨大!Steam好评如潮

军事要闻

直击南部战区海军某部重装空投训练

无障碍浏览 进入关怀版