名字应当从机制里来
大语言模型(LLM)是「先例模型」,这个判断不是修辞,而是可以从算法本身一步步推出来的。
这里特意不用「大模型」这个统称。发现模型将来同样可能以大参数模型的形式出现,两者的区别不在参数规模,而在训练目标和数据来源。本文所说的 LLM,特指以人类文本为语料、以预测下一个词为训练目标的模型。
一个大语言模型(LLM)从诞生到回答你的问题,要经过三个阶段:预训练、对齐、解码生成。每一个阶段的数学目标,都在把模型推向同一个方向——忠实地复现人类已经写下的东西。下面逐一拆开看。
![]()
图 1 LLM 的三个阶段:每一步的数学目标,都把输出拉向语料中的先例
预训练:学的是「通常如何」
预训练只有一个目标:给定前文,预测下一个词。写成损失函数,就是在整个语料上最小化负对数似然:
![]()
这个目标有一个标准的等价形式:最小化语料真实分布与模型分布之间的 KL 散度。
![]()
翻译成白话:训练得越好,模型就越精确地知道「在人类写过的文字里,这种前文后面通常跟着什么」。模型不学习世界本身,它学习的是人类描述世界的方式。
这正是先例的定义。法官查判例,问的是「类似的案子过去怎么判」;模型预测下一个词,问的是「类似的前文过去怎么接」。两者在结构上是同一件事,只是模型的「判例库」是十万亿词量级的人类文本。
对齐:把模型拴在先例附近
预训练之后的模型会续写,但还不会好好回答问题。对齐阶段分两步。
第一步是有监督微调(SFT):用人工写好的「标准答案」继续做最大似然训练。目标函数和预训练完全一样,只是先例库换成了精选的人类示范。
第二步是基于人类反馈的强化学习(RLHF)。它的标准目标形式如下:
![]()
这个公式有两项。前一项奖励人类评审者喜欢的回答,而评审者的判断本身,就是以人类既有共识为标尺的。后一项是一根「缰绳」:用 KL 散度惩罚模型偏离参考模型太远,而参考模型正是预训练和微调产出的那个先例分布。
所以对齐不是让模型去探索新东西,而是在「不离先例太远」的前提下,把回答调成人类最认可的样子。从数学上说,这会进一步把输出推向分布的主峰——也就是最主流、最安全的那类先例。
生成:新句子,旧先例
你提问时,模型逐词生成回答。每一步,它先算出词表上每个词的打分 z,再按温度 T 换算成概率去采样:
![]()
温度越低,越集中地选最高概率的词;温度调高,只是在先例中次常见的说法里多做一些随机选择。无论怎么调,采样都发生在模型从语料中学到的那个分布里。
这就是为什么「检索」这个词不对,而「先例」是对的。大语言模型(LLM)写出的句子往往确实从未存在过,它并不是把某篇文档原样交还。但句子里的每一个转折、每一个判断,都是在「人类通常会怎么写」的引导下组合出来的。新的是措辞,旧的是依据。
推理模型突破先例了吗
最有力的反驳来自推理模型。它们在作答前先生成长长的思维链,并用可验证的奖励做强化学习,在数学和编程上确实解出了语料里没有的题。这一点应当坦率承认。
但要看清它突破的是什么。思维链的每一步,仍然是从同一个先例分布采样出来的;强化学习做的,是在大量先例式的步骤组合中,筛出能通过验证器的那一条。这是「在先例之间搜索新组合」,而且有一个前提:必须存在一个便宜、可靠、自动化的验证器——证明对不对、代码跑不跑得通。
在药物、医疗、金融风险这些领域,并没有这样的验证器。一个关于靶点的判断对不对,只有回到真实数据里才能检验。更重要的是,推理模型扩展的是搜索能力,而不是数据域。它仍然只在符号和文字的世界里思考。
定位:不止于检索,又未及发现
把大语言模型(LLM)放在两类模型中间看,它的位置就清楚了。只需要问两个问题:输出是不是新的?依据是不是新的?
![]()
为什么不只是检索模型。 检索模型的数学形式,是在一个固定的文档集合 C 里,找出与问题 q 打分最高的那篇文档:
![]()
它的输出永远是 C 里已经存在的一个元素。大语言模型(LLM)的输出空间却是所有可能的词序列,它能归纳、组合、类比、推理,写出语料里从未出现过的句子。把它叫作检索模型,低估了它。
为什么也不是发现模型。 发现至少需要三个条件:能接触语料之外的证据;当数据支持时,奖励偏离先例的结论;用数据本身而非人类认可来验证。大语言模型(LLM)三条都不满足。它的证据全部来自语料;它的训练目标——最大似然与 KL 约束——恰恰惩罚偏离先例;它的对齐标尺是人类评审者的既有共识。在结构上,它的优化方向与发现是相反的。
所以它是先例模型。 就像一位读遍判例的法官:面对新案子,他能写出一份从未有过的判决书,这比翻出一份旧判决多了一步;但判决书里的每一条理由,都来自已有的判例,而不是来自他亲自去现场取证——这又比发现少了一步。比检索多一步,比发现少一步,这正是「先例」二字的含义。
边界:支撑集之外
把上面三个阶段合起来,可以用一个统计学概念概括大语言模型(LLM)的边界:支撑集。一个分布的支撑集,是它赋予非零概率的那些区域。模型只能对训练语料中有证据的模式给出有意义的判断;在支撑集之外,它只能拿最接近的先例去类比,这就是幻觉的来源之一。
![]()
图 2 三类模型的位置:检索模型取回已有的一点,先例模型在已有之间组合出新的一点,发现模型在支撑集之外找到新信号
关键在于:人类最有价值的新知识,恰恰大量落在这个支撑集之外。医院的原始病历表、保险的理赔流水、银行的交易记录,是结构化的、按时间排列的记录,不是文章。它们出于合规原因不会进入任何公开语料,其中藏着的规律也从未被任何人写成文字。
这不是算力或参数规模能解决的问题。模型再大,它拟合的仍然是同一个语料分布;语料里没有的,最大似然估计不出来。
结语:为什么还需要发现模型
从预训练的最大似然,到对齐的 KL 约束,再到解码的高概率采样,大语言模型(LLM)每一步的数学目标都指向同一件事:做一个极其出色的先例模型。这是它的力量所在,也是它的边界所在。
发现模型要解决的是另一个问题:它的起点不是语料,而是原始数据;它的目标不是复现「通常如何」,而是找出偏离先例、又经得起数据检验的信号;它的结论靠回到数据本身来验证,而不是靠人类评审者的认可。
发现模型并非只存在于构想之中。AIGM 开发的新知系统(NKS),是第一批投入实际应用的发现模型之一,正是按上述三个条件设计的。第一,它把计算引擎部署到数据所在的地方,直接处理病历表、理赔流水、交易记录这类从未进入公开语料的原始数据,原始数据不出域。第二,它的目标是找出偏离先例的信号:从研究者给出的初始关键词出发,自动发现数据中隐藏的等价表述;从个体行为在时间轴上的排列中,识别从未被定义过的行为模式。前文 GPR40 靶点的重新判断,就是 NKS 在医药领域的一次应用。第三,它的每一条结论都能回溯到具体的数据记录和版本。
更值得一提的是,NKS 并非为某一个行业定制。它已在医药、保险、金融投资、监管、网红经济、人力资源、能源矿产等领域取得成功案例,展现出广泛的跨领域、泛化通用的知识发现能力。以 NKS 为底座,各个行业的应用都可以很便捷地嫁接或开发出来。这也从另一个角度印证了本文的判断:发现能力来自处理原始数据的方式,而不是来自某个行业的语料。
两者并不互斥。发现模型从数据里找出新东西,先例模型把它翻译成人能读懂的语言。但当问题的答案从未被写下——一个被误判的靶点、一种尚未被识别的欺诈模式——人类需要的不是更大的先例模型,而是一个能在先例之外工作的发现模型。
汤子欧 2026 年 10 月 9 日
汤子欧是哈佛大学博士后和日内瓦大学博士,长期致力于机器学习和深度学习研究。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.