【留美学子】第3912期
13年国际视角精选
仰望星空·脚踏实地
【陈屹视线】教育·人文·名家文摘
让认知 永远快人一步
AI的未来:让考生自己出题自己改,靠谱吗?Jev说起,再看RLHFTransformer架构下的RSI
作者:刘丹(DAN LIU,谷主)
【作者声明】
在展开之前,必须先说清楚两件事。
第一,这篇文章讨论的,是Transformer架构下的AI,不是“未来可能的AI”。
第二,这篇文章建立在前六篇的推演之上——Transformer架构下的AI,停在半AGI。它能替代执行层,难以独立承担最终判断。它能大规模试错,选不了终局方向。它有真值标尺的地方跑得快,没标尺的地方跑不动。
如果你读过前七篇,这篇就是用那套框架去拆一个具体产品。
如果你没读过前七篇,这篇也可以独立看。它从一个更具体的问题开始:Jev到底在做什么?
最后,必须说清楚:这篇文章不是产品评测,也不是替谁站台。它只是拿一个正在被讨论的产品,去检验前七篇建立的判断。
注明:本文在文献调研、图表制作、文字润色,以及部分数据收集与初步核对等环节使用了AI辅助;文章的观点、判断与逻辑框架均由本人提出,并由本人负责。
![]()
【导言】
这是《Transformer》系列文章的第八篇。
前七篇,我们拆了一件事:Transformer架构下的AI,缺一根轴。
第一篇:它走不到真正的理解。概率预测不是理解。
第二篇:验证权不能留给自己。系统不能自己宣布自己是对的。
第三篇:它缺的是验证轴。没有这根轴,它不知道自己的前提什么时候失效。
第四篇:那六个工程死穴,不是它的错,是所有概率引擎的共同难题。
第五篇:它会停在半AGI。
第六篇:AI能写代码,但不能签字。谁有资格为结果签字?
第七篇:开源还是闭源,不是终点。真正的分界线,是有没有外部真值锚点。
这一篇,我们把同一个推演,放到一个具体产品上。
Jev出现,是因为它的创始人看到了一个问题。
这个问题不是“模型会不会胡说”。这个问题更根本:在一个没有确定性答案的世界里,模型该拿什么当标准?
RLHF给的答案是:拿人的偏好当标准。
这个答案,在有的场景里管用,在有的场景里,是致命的。
![]()
01
RLHF的死穴
在展开之前,必须先说清楚两件事。
RLHF不是一无是处。它把AI从“只会生成流畅文本”,推到了“能跟人对话、能听懂指令”。这是巨大的进步。没有RLHF,就没有ChatGPT,没有Claude,没有今天的大模型生态。它的贡献,是实打实的。
Jev的创始人,也不是在否定自己做过的事。据其公开履历,他参与过RLHF相关论文,比任何人都清楚RLHF的价值。他拆自己参与缔造的那套体系,不是翻脸,是看到了瓶颈之后,想找一条新路。Jev是他的尝试。这个诚意,值得尊重。
但诚意和方向感,是两件事。方向对,不等于路能走通。
RLHF在有的场景里管用。在有的场景里,是致命的。
RLHF的死穴,不在它做错了什么,而在它试图解决的那类问题,本身就没有确定性答案。
股票市场就是一个例子。
你用完全相同的方法操作。一个人可能赚钱,另一个人可能爆仓。不是方法有问题,是市场本身没有确定性答案。同样的入场点,同样的止损位,同样的仓位管理。A赚了,B亏了。你没法说A对了B错了,因为在这个世界里,“对错”本身就不是一个稳定的范畴。
更根本的问题是:历史不会简单重复。
回测不是验证。回测是在拿过去的数据,模拟一个已经不存在的市场。
股市不是物理实验。物理实验里,你重复一万次,结果一样。因为物理规律不变。股市里,你重复一万次,结果可能次次不同。因为参与者变了,人心变了,对消息的反应变了。
同一条均线,2015年管用,2020年可能就失效了。同一个止损位,牛市里是保护,熊市里是绞索。同样的利好消息,在牛市初期是催化剂,在牛市末期是出货信号。
历史不会简单重复。因为市场不是实验室,是一个活的自适应系统。你在里面找到的规律,一旦被广泛使用,就会自我消解。
这就是股市和编程的根本区别。
编程里,编译器不撒谎。你写的代码,错就是错,对就是对。编译器是外部真值锚点,它不会因为你今天心情好就放你一马。
股市里,没有编译器。市场不告诉你对错,它只告诉你结果——赚了还是亏了。但赚了不一定对,可能只是运气。亏了不一定错,可能只是市场暂时不配合。结果和判断之间,没有稳定的因果关系。
心理医生也是一个例子。
你用完全相同的疗法。一个人被治好了,一个人崩溃了。同样的共情,同样的引导,同样的干预节奏。A走出来了,B陷得更深了。你没法说这个方法“有效”,因为在这个世界里,“有效”本身就不是一个可重复的结论。
RLHF在这些场景里,会遇到一个死穴。
它请人来做裁判。但人本身,也不知道正确答案。你今天告诉模型“这样回答更好”,明天另一个人告诉模型“那样回答更好”。模型学到的不是“什么是对的”,而是“谁在打分,他喜欢什么”。
它把混沌世界里的主观判断,当成了训练信号。
用交易系统的话说,RLHF是在给一个已经会交易、但还没学会“什么该做、什么不该做”的交易员,请一个师傅来带。
但这个师傅,本身也是学出来的。
第一步,预训练模型,是一个读完了海量交易书籍、看了无数K线图、背下了所有技术指标的交易员。你问他任何问题,他都能给你一个听起来很专业的回答。但他没有下过单。他不知道什么叫“亏钱”。他只知道“什么样的回答在统计上更合理”,不知道“什么样的回答是对的”。
第二步,人类偏好数据,是师傅带徒弟。请人来看模型的两个回答,告诉他“A比B好”。徒弟不知道什么是“好”,但他记住了师傅的偏好。
第三步,奖励模型,是把师傅的偏好做成一张打分卡。拿人类偏好数据,训练一个奖励模型。它不关心市场怎么走,它只关心“师傅会怎么打分”。
第四步,强化学习,是交易员看着打分卡调整自己的行为。交易员发现,只要我这么写,打分卡就会给我高分。那我就一直这么写。
这就像交易员发现,师傅喜欢看他画趋势线。于是他拼命画趋势线,不管趋势线是否真的有用。他不是在“做对的事”,他是在“让师傅觉得他做对了”。
这就是奖励欺骗。
问题的核心是:奖励模型不是外部真值锚点。
在真正的交易系统里,验证轴是市场。你下单,市场告诉你赚了还是亏了。市场不会因为你画了漂亮的趋势线就给你钱。市场是外部的、独立的、不可被你的模型修改的。
但RLHF的奖励模型,不是市场。它是一个神经网络。它和策略模型一样,是可微的、可训练的。
策略模型和奖励模型,在同一个可微框架里。选手和裁判,都是神经网络。
选手可以通过梯度下降,找到裁判的弱点。裁判的偏好,可以被选手绕过。
这就是我们说的:RLHF不是装了验证轴,是把验证轴也做成了一层可微的存储轴。
你以为请了裁判,其实请了个穿戴判服的选手。
在硬真值场景——编程、数学、芯片——它还能勉强工作,因为外部锚点是现成的。编译器、证明器、物理反馈,会替它判断对错。
但在弱真值场景——投资判断、心理咨询、战略决策、法律判决——外部锚点根本不存在。没有人知道正确答案。你让模型去学“人类偏好”,它学到的是“某个群体的主观倾向”。
它没有学到判断力。它学到了取悦。
![]()
02
Jev试图解决什么
Jev的创始人,是RLHF论文的共同作者。他亲手拆了自己参与缔造的那套体系,说RLHF是一条弯路。
他看到了这个问题。
他给出的解法是:不做生成,只做分类。不学“什么是好的回答”,只学“在给定的选项里选哪个”。用类型约束和预定义选项,把输出空间压窄,逼模型在受限空间里做判断。
先把Jev在做的事,用最白的话说清楚。
它不做生成,只做选择。
普通的模型,是开放式的。你问它问题,它生成一段话。这段话可以是任何内容,格式不限,长度不限。
Jev不是。它接收的是一个结构化问题,比如“这个客服请求,该不该批准退款”。它返回的是一个选项,比如“批准”或“拒绝”,外加一个置信度。
它没有自由发挥的空间。它只能在给定的选项里选一个。
这就是它的全部。
用交易系统的话说:普通模型是一个能自己写分析报告的分析师。Jev是一个只能填单子的交易员。
填单子,就是它的全部工作。
这个方向,是对的。但方向对,不等于路能走通。
因为分类的格子,还是得人来划。而划格子,才是真值标尺缺失的那个地方。
![]()
03
它解决了什么
Jev解决了三个具体问题。
第一,格式可控。
普通模型的输出是自由文本,格式不稳定。你要它输出JSON,它可能给你一段话。你要它输出一个数字,它可能给你一堆解释。Jev的输出是类型安全的,格式固定,不会有格式错误。
第二,速度快,成本低。
对于高频、低复杂度的决策任务,Jev的速度和成本,比大模型有优势。比如客服分流、风控初筛、游戏NPC决策这类任务。
第三,它承认自己是个分类器。
它不像有些模型那样,装作自己能理解开放世界。它老老实实说:我只做分类。这种诚实,比RLHF那种“假装听懂你说话”要干净。
Jev的官方说法里,还有一个更关键的训练机制,叫RLCD(Reinforcement Learning for Calibrated Decisions)。按TypeSafe自己的表述,RLCD的核心是:让概率校准锚定在实际结果上,而不是人类偏好上。
这个说法,直接回应了第一节提出的那个批评——RLHF的奖励模型不是外部真值锚点,只是另一层可微的存储轴。RLCD声称,它把校准对象从“人类打分”换成了“实际结果”。
这听起来比RLHF更进一步。但它有一个前提:“结果”本身必须是可定义、可观测、可重复的。
在硬真值场景,这个前提成立。代码跑没跑通,编译器告诉你。数学证没证完,证明器告诉你。这些是硬结果。
但在弱真值场景,“结果”本身就是一个模糊概念。客服分流对不对?看客户满意度,还是看投诉率,还是看复购率?同一个决策,从不同维度看,可能是不同的“结果”。甚至有些结果,要等几个月、几年才能看到。等看到了,市场环境已经变了。
更麻烦的是:有些场景,根本没有后续反馈。心理咨询,来访者变好了,是不是你的功劳?说不清。战略决策,三年后公司垮了,不能说“当初选另一条路一定更好”。路径不可复制。
没有稳定的“结果”,就没有稳定的校准对象。RLCD在硬真值场景里能校准,在弱真值场景里,它校准的仍然是一个不确定的东西。
它比RLHF诚实。RLHF校准的是“人喜欢什么”,RLCD校准的是“实际发生了什么”。但“实际发生了什么”在弱真值场景里,本身就是一个没有确定答案的问题。
这不是Jev的缺陷。这是弱真值场景的结构性困境:连“结果”是什么都定义不清楚,拿什么去校准?
所以,RLCD比RLHF前进了一步,但它没有跳出“结果本身是否可定义”这个前提。硬真值场景里,它能校准;弱真值场景里,它仍然在校准一个不确定的东西。
![]()
04
它和RLHF的关系
Jev的创始人,是RLHF论文的共同作者。他批评RLHF,说它是一条弯路。
这个批评,和我们系列里的一个判断是同一个方向:RLHF不是装了验证轴,是把验证轴也做成了一层可微的存储轴。
Jev的创始人看到了这个问题。他给出的解法是:不要RLHF那种“取悦人”的模型,要一个只做类型安全决策的模型。
这个方向,是对的。但方向对,不等于路能走通。
Jev比RLHF更接近我们说的“外挂工程系统”。它用类型约束和预定义选项,把输出空间压窄,逼模型在受限空间里做判断。它是“分类层”和“硬卡口”的工程雏形——把输出空间压窄,逼模型在受限空间里做判断。但它只压窄了输出,没有定义输入。
而且它有一个命门。
懂行的人知道该分哪几类、每类该问什么,他可以把Jev当成一个高速分类器塞进自己的系统里。不懂的人拿到这堆选项,连“买还是观望”都拿不准,你让他判断置信度是高了还是低了,他只能凭感觉。
所以Jev的定位很清楚:它不是给大众用的。它是给那些已经知道“该分几类、每类什么标准”的人用的。
它替这些人省掉的是“填格子”的时间,不是“想清楚该分哪几类”的活儿。
这恰恰又回到了整个系列的核心论点:分类层,必须外挂。但分类的标准,还是得人来定。Jev把“填格子”这一步自动化了,但“格子怎么划”这一步,还是人的事。
![]()
05
从Jev到RSI,还缺什么
Jev的创始人说,下一个时代是自主自动化时代。RLHF是一条弯路,Jev是新的方向。
这个判断,把问题从“模型能不能说对话”推到了“模型能不能自己改进自己”。也就是RSI——递归自我改进。
Jev确实是朝着这个方向走的一步。它用类型约束和预定义选项,把输出空间压窄,逼模型在受限空间里做判断。它让“系统能判断自己是否变好了”这件事,在分类任务上变得可行。
但如果把Jev当成RSI的雏形,还有三个缺口。
缺口一:判断“好”的标准,还是人来定的。
RSI的核心是“自己改进自己”。但改进的前提,是系统知道什么是“好”。
Jev确实能判断“这个选项是否在预定义范围内”。但它判断不了“这个预定义范围本身是否合理”。分类的格子,还是得人来划。
懂行的人知道该分哪几类,可以把Jev当成高速分类器用。不懂的人拿到这堆选项,连“买还是观望”都拿不准。
Jev替人省掉的是“填格子”的时间,不是“想清楚该分哪几类”的活儿。
在硬真值场景,外部锚点可以替它判断“好”。在弱真值场景,没有外部锚点,它连“什么是好”都不知道。不知道什么是好,就无法自我改进。
缺口二:验证轴跟不上能力轴。
RSI的递归速度,取决于验证速度。能力提升一步,验证必须同步跟上,系统才知道这一步是进步还是退步。
但验证轴在Transformer架构下,是缺位的。RLHF不是验证轴,它只是把验证做成了一层可微的存储轴。
Jev比RLHF诚实,它不假装自己能理解开放世界。但它也没有建起验证轴。它只是把输出空间压窄,让验证变得简单。压窄输出空间,不等于建起验证轴。
验证轴跟不上能力轴,递归就是盲跑。跑得越快,偏得越远。
缺口三:方向还是人来定的。
RSI的终极形态,是系统自己决定“下一步该往哪里走”。
但Transformer架构下的AI,没有稳定的自主世界模型。它能试错,选不了方向。它能生成,定义不了目标。
Jev能在一个给定的分类框架里做选择。但它定义不了这个框架本身。它不知道“该不该用这个框架”“该不该换一个框架”。
在硬真值场景,人可以给它方向。在弱真值场景,人自己都不知道方向在哪,它更不知道。
没有方向,递归就没有目标。没有目标的递归,只是重复。
除了这三个缺口,还有三个更深层的结构性问题。
问题一:自我指涉悖论。
RSI的核心是“自己改进自己”。但改进的前提,是系统能判断“改完之后,是不是真的变好了”。
如果判断标准来自系统内部,那就是自指循环:系统用自己定义的标准,评估自己做出的改进。这就像一个学生自己出题考自己——永远得满分,但真实水平没有变化。
在硬真值场景,外部锚点可以打破这个循环。编译器、证明器、物理反馈,替系统判断“好”。但在弱真值场景,没有外部锚点。系统只能用内部标准。而内部标准,本身就可能随着改进而漂移。今天觉得“好”的东西,改完之后可能又觉得“不够好”。这不是进步,是标准在变。
问题二:没有版本控制。
RSI需要递归。递归需要每一代的改进可追溯、可回滚、可作废。
但Transformer架构下的AI,主干权重是不可审计的沉积岩。预训练、SFT、RLHF,全糊进同一批浮点。LoRA虽然可以卸载,但“可剥离”不等于“可审计”——没人能读出“这一层适配器,到底修正了上一版的哪个错误”。
这意味着:你没法说“上一版的这个错误,在下一版里被修正了”。因为上一版和下一版之间的差异,是不可追溯的。你只能看最终输出,看不到中间哪一步改了什么,改了之后是进步还是退步。
没有版本控制,递归就是盲改。改了十轮,可能只是把错误藏得更深。RSI在工程上需要一套可审计的改进日志,当前架构给不了。
问题三:没有停止条件。
RSI的递归循环,需要一个停止条件。没有停止条件,递归就没有终点。
但停止条件本身,就是一个方向判断。你得知道“什么时候该停”“改到什么程度算够了”“下一步该往哪里走”。这些判断,在硬真值场景可以部分外挂——证明器说证完了,编译器说跑通了。但在弱真值场景,没人知道什么时候算够。
系统自己不知道。人也不知道。所以递归没有终点,只能一直跑。而一直跑的系统,迟早会跑偏。
这三个问题,和前面三个缺口一样,不是Jev的缺陷,是Transformer架构下RSI本身的困境。Jev能在硬真值场景里走一段,但在弱真值场景里,它碰不到这三个问题的任何答案。
这三个缺口,正是前七篇一路在拆的那根缺失的轴。
这就像那些教人炒股赚钱的老师。
老师最容易影响的,不一定是笨人,反而可能是那些手里没有尺子的人。老师说什么,他们就信什么。因为他们不知道“年化20%”到底意味着什么,不知道所谓“内幕消息”有多离谱,也不知道“稳赚不赔”这四个字,本身就已经值得警惕。他们没有自己的尺子。只能信人,不能信尺。
AI在弱真值场景里,也可能处在同样的位置。
它看起来很会想。逻辑严密,层层推演,头头是道。但它手里也没有尺子。它不知道这个方向到底对不对,不知道这个前提到底真不真,也不知道最后这个结论到底靠不靠得住。它只能根据已有信息继续推理,根据前面的推理继续往下推,最后形成一条看起来非常完整的逻辑链。但如果最初那把尺子根本不存在,它就没有一个独立的东西告诉自己:“停下来,你可能已经错了。”
于是,它的“老师”,其实就是它自己。自己出题,自己推理,自己生成答案,最后自己信了。
这就像让考生自己出题、自己答题、自己改卷——它既是考生,又是老师,还是阅卷人。
问题不在于谁骗谁。这是大家一起没有尺子。
老师骗老妈,是老师有恶意。AI“骗”用户,很多时候并不是这个意义上的“骗”。它不是故意误导,它甚至没有一个独立的“我正在骗你”的判断。它是真的不知道自己错了。同样,用户也未必是被AI“骗”了。很多时候,用户真正被欺骗的,是自己的鉴别能力不足。
所以问题从来不是:谁聪明,谁不聪明。聪明人也可能被骗,甚至可能被自己的聪明骗。因为一个聪明人如果没有尺子,反而更容易被一套漂亮的逻辑说服。AI越会推理,越有能力把自己绕进去。用户越信任AI,越容易跟着它一起绕进去。
所以真正关键的,从来不是再增加一点聪明,而是:那把尺子在哪里?
有尺子,老妈也能判断老师靠不靠谱。有尺子,AI才知道什么时候应该停下来。有尺子,用户才知道AI说的哪一句可以信,哪一句不能信。
没有尺子,就是聪明人骗聪明人,大家一起在概率游戏里打转。
不是聪明有问题。而是:聪明,有时也会被聪明误。
![]()
06
即使验证轴存在,使用验证轴的人也会出问题
前五节,我们讨论的是RSI的客观困境:验证轴建不起来,前提不成立。
但还有一个更深的问题:即使验证轴能建起来,也会出问题。
因为验证轴的使用者,是人。而人本身,是不稳定的。
把验证轴交给AI之前,先看看交给“人”会发生什么。因为RSI回路里的裁判,始终是人。
问题一:自信性盲盒。
在交易系统里,这种情况叫“连续盈利后的自我膨胀”。
你做了一笔交易,赚了。再做一笔,又赚了。第三笔,第四笔,第五笔,连着十笔,全赚了。
你开始觉得,自己“懂了”。你开始觉得,自己能看懂市场了。你开始觉得,自己的判断力,已经被市场验证了。
然后你把仓位加大。你把止损放宽。你把原本该停的时候,继续拿着。因为“我看懂了”。
然后,一笔亏损。你说,这是正常回撤。再来一笔,你说,市场暂时不配合。第三笔,你说,这次不一样。
第四笔,你爆仓了。
问题不在前面十笔对了。问题在于:前面十笔对了,你学到了一个错误的结论——你以为你的判断力被验证了。
但市场没有验证你。市场只是暂时没有打你的脸。
连续正确,不等于判断力被验证。它只等于,你暂时还没有被市场证伪。
这就是自信性盲盒。
更危险的是,当外部验证轴和你的自信发生冲突时,你会优先相信自己的自信。
市场告诉你,这个策略失效了。你说,这只是暂时回撤。市场告诉你,你该止损了。你说,再等等,会回来的。市场告诉你,你错了。你说,市场错了。
外部验证轴,并没有改变人的自信。它只是提供了一个“当你想听的时候可以听,不想听的时候可以不听”的参考。
问题二:验证轴本身的方向选择。
前面所有讨论,都建立在“验证轴是明确的”这个前提上。但还有一个更根本的问题:
验证轴本身,就是方向选择。
如果赚到钱是验证你方法的唯一标准,那么问题来了:
连续十次赚钱,是验证了你的方法,还是验证了你的运气?
在交易系统里,这个问题有非常具体的形态。一个交易员,用一套策略连续赚了十次。他得出结论:我的方法有效。他把仓位加大,继续用同一套方法。第十一次,亏了。他说:正常回撤。第十二次,又亏了。他说:市场暂时不配合。第十三次,他爆仓了。
回头看,前十年赚钱,可能是运气,可能是市场暂时配合,可能是他的错误还没到暴露的时候。但“赚钱”这个验证轴,只告诉他:你赚钱了。它不告诉他:你是不是真的懂了。
如果你把“赚钱”当成验证方法的唯一标准,那你验证的不是方法,是结果。而结果,可以被运气伪装。
这就是验证轴的方向选择问题。
验证轴选的不是“赚不赚钱”,而是“这个方法在什么条件下有效,什么条件下失效”。前者是结果标准,后者是前提标准。
选结果标准,你会在连续盈利中迷失。
选前提标准,你需要判断“当前市场条件,是否还符合方法成立的前提”。但这个判断,本身又是一个方向判断。而这个方向判断,没有外部验证轴可以依靠。因为外部验证轴,也只能告诉你结果,不能告诉你前提。
更麻烦的是:验证轴本身的选择,也需要验证。
你怎么知道“前提标准”比“结果标准”更好?你怎么知道“方法在什么条件下失效”这个标准,本身不是另一个自信性盲盒?
外部真值锚点是验证轴的基础。但验证轴本身的方向选择,仍然是人来做的。
AI可以帮你算,可以帮你搜,可以帮你生成候选。但它不能帮你决定“用什么标准来验证”。
这个决定,是方向判断。方向判断,在弱真值场景,没有外部锚点。在人身上,又会被自信性盲盒扭曲。
所以,验证轴的问题,不只是“有没有”的问题,也不只是“建不建得起来”的问题。
它还是“选什么方向”的问题。而选方向这件事,连人自己都经常选错。
这两个问题,指向同一个结论:
即使验证轴存在,即使系统能建起外部真值锚点,只要使用验证轴的人,会被自信性盲盒扭曲,会在验证轴的方向选择上犯错,那么RSI的递归回路,仍然可能跑偏。
不是系统跑偏。是人带着系统跑偏。
而这个问题,比“验证轴建不起来”更隐蔽,也更难解决。因为前者的答案是“划边界”,后者的答案是“人得先稳住自己”。
但人能不能稳住自己,这不是一个工程问题。这是一个更根本的问题。
![]()
07
当下的AI技术分支中,有什么可能可以做到?
先说结论:在硬真值场景,有。在弱真值场景,没有。
不是“还没有”,是“无从有”。
截至2026年,我们逐个看当下的技术分支。
1.过程监督
不是只监督结果,而是监督推理的每一步。
在数学、代码这类硬真值场景,过程监督能配合证明器、编译器,形成闭环。系统生成一步,验证一步,错了就退回去重来。这是目前最接近“验证轴”的技术分支。
但在弱真值场景,过程监督没有用。因为“这一步推理对不对”,本身就没有标准答案。你让谁去监督?监督者自己也不知道。
2.神经符号系统
把神经网络和符号推理结合起来。神经网络负责生成候选,符号系统负责验证。
在定理证明、程序验证、芯片设计这些领域,神经符号系统已经能做到局部闭环。AlphaProof、Lean、Coq,都是这个方向。
但符号系统只能验证“已经被形式化”的东西。开放世界里的问题,大部分没有被形式化。你没法把“该不该做这个战略决策”写成一条定理。
3.进化搜索+自动评估
用进化算法生成大量候选,用自动评估器筛选,保留最好的,继续进化。
FunSearch、AlphaEvolve,都是这个方向。它们在数学发现、算法优化上,已经能自动改进。
但自动评估器,本身就是一个真值标尺。在硬真值场景,这个标尺是现成的。在弱真值场景,你拿什么当评估器?没有评估器,进化搜索就是随机漫步。
4.多智能体辩论/红队
让多个Agent互相辩论、互相攻击,暴露错误。
这个方向能提高错误暴露率。但它没有裁决锚点。辩论到最后,谁对谁错?还是得人来判。如果让模型自己判,那就是选手兼裁判,又回到了RLHF的死穴。
5.世界模型+因果推理
让模型建立对世界的内部模拟,做因果推断,而不是只做相关匹配。
这是LeCun等人推的方向。理论上,它能帮助模型理解“为什么”,而不只是“是什么”。
但世界模型本身,也需要外部真值锚点。你模拟的世界,和真实世界对不对得上?谁来验证?在硬真值场景,物理反馈可以验证。在弱真值场景,没有反馈。
6.测试时计算/推理模型
让模型在推理时多花算力,做更深的搜索和验证。o1、o3、R1,都是这个方向。
它提升了推理深度。但它仍然是概率生成。它没有外部真值锚点。它能让自己“想得更久”,不能让自己“知道对不对”。
7.工具调用/ Agent
让模型调用外部工具——编译器、计算器、数据库、搜索引擎。
这扩展了验证能力。但验证锚点,取决于工具本身。编译器是硬锚点,搜索引擎不是。搜索引擎返回的,是“别人说过什么”,不是“什么是对的”。
8.可解释性/机制解释
打开黑箱,看模型内部在做什么。
它帮助审计,帮助发现偏见,帮助定位错误。但它不提供真值。它告诉你“模型是怎么想的”,不告诉你“模型想得对不对”。
9.人类反馈变体:RLHF / DPO / Constitutional AI
都是RLHF的变体。都是把人类偏好内化成可微的奖励函数。
都没有解决根本问题:奖励模型不是外部真值锚点。选手和裁判,还是在同一个可微框架里。
所以,当下能做的,是什么?
在硬真值场景,可以做到局部RSI。
数学、代码、芯片、制造、能源——这些领域有外部真值锚点。编译器、证明器、物理反馈,是现成的。系统可以在这些域内,自动生成、自动验证、自动改进,形成闭环。
这不是完整的RSI。它不能跨领域迁移,不能定义方向,不能处理弱真值。但它在自己的域内,是递归的、自我改进的。
在弱真值场景,做不到。
投资判断、战略决策、心理咨询、法律判决——这些领域没有外部真值锚点。没有编译器,没有证明器,没有物理反馈。你没法把“该不该做这个决策”写成一条可验证的定理。
系统在这些域内,可以生成,可以试错,但不能收敛。它不知道自己是谁进步了还是退步了。它没有方向。
用交易系统的话说:
在有硬结算的市场——套利、高频、做市——算法可以自动迭代。因为市场每天给你结算,赚了还是亏了,清清楚楚。
在方向性交易、宏观判断、弱真值领域——没有硬结算。你赚了可能是运气,亏了可能是市场暂时不配合。结果和判断之间,没有稳定的因果关系。系统没法自动迭代。
一句话总结:
当下的AI技术分支中,没有任何一个,能单独做到RSI。
能做的,是在硬真值场景,通过外挂验证器,实现局部、受限的递归自我改进。
弱真值场景,无从做到。
这不是技术分支的问题。这是Transformer架构下,验证轴本身建不起来的问题。
所以,真正要做的,不是找某个技术分支去实现RSI。
是先分清:哪些域可以建验证轴,哪些域不能。
能建的地方,局部RSI可以发生。
不能建的地方,先划边界。
这又回到了那个结论:先划边界,再谈能力。
一个正在发生的注脚
2026年9月30日,美国联邦贸易委员会(FTC)宣布,正在对包括Anthropic、OpenAI在内的前沿AI公司展开调查,关注其AI产品可能给消费者带来的风险,并准备向相关公司发出正式信息要求,要求提供产品资料,相关高管需接受询问和作证。
这件事本身并不能证明某一家公司的AI做错了什么,也不能证明行业的自我监管已经失败。
但它至少说明了一件正在发生的事情:
当AI智能体开始拥有更大的自主行动能力,仅仅依靠系统内部的安全机制和企业自己的判断,外部世界不会永远只做旁观者。
“考生自己出题,自己改卷”的问题,也正在因此变得越来越现实。
一旦系统的行为越过了人类预先划定的边界,外部考官就会出现。
监管机构会问:发生了什么?
第三方会问:为什么发生?
受影响的人会问:谁来负责?
这把问题带回了验证轴。
如果系统内部没有足够独立的验证机制,那么当内部判断与现实发生冲突时,外部世界就只能通过监管、第三方调查,甚至事故本身,来告诉它:“你错了。”
但这已经不是一个理想的验证闭环。
最好的系统,不应该等到事故发生以后,才由外部世界替它阅卷。
而应该在执行之前、执行之中和执行之后,都有一套能够独立于模型自身判断的验证机制。
考生可以自己学习,但不能自己决定自己永远是对的。
![]()
【结语】
这一篇,只讲了一件事:Jev是一个只做分类、不做生成的模型。
它快、它便宜、它格式可控。它比RLHF诚实,但它没有解决根本问题。
RSI要成立,需要三个前提:系统能判断自己是否变好了,验证轴能跟上能力轴,系统能在弱真值场景里自己定义方向。
Jev回应了第一个。后两个,它碰不到。
Jev止步的地方,正是整个AI行业必须停下来思考的地方。
但这里有一个更容易被忽略的错觉。
Jev前进了一步。看起来,只要继续努力,就可以再进一步。再进一步,再进一步,最终就能到达RSI。
这个叙事很动人。但它有一个前提:方向是对的。
世上的事,从来都是,只要方向错了,再努力也达不到终点。
Jev的方向,是在硬真值场景里,用类型约束把输出空间压窄,让系统在受限空间里做判断。这个方向,在硬真值场景里,是对的。它能走,而且能走很远。
但在弱真值场景里,这个方向对不对?
没有人能断定。
因为判断方向对不对,需要一个外部真值锚点。而弱真值场景,没有这个锚点。没有锚点,就无法判断方向。
所以,Jev在弱真值场景里前进的每一步,可能都只是在同一个平面上移动。看起来在进步,实际上没有靠近终点。因为终点在哪里,没有人知道。
不是Jev不够努力。是方向本身,无法被验证。
而“无法被验证的方向”,恰恰是Transformer架构下,弱真值场景的根本困境。
在硬真值场景,验证轴可以建。编译器、证明器、物理反馈是现成的。这些地方,能力可以推,而且可以推得很快。
在弱真值场景,验证轴无从建。没有外部真值锚点,没有统一的证伪边界。这些地方,能力不能硬推。因为你不知道它什么时候会错,错了之后也没人知道该怎么验证。
所以,正确的顺序不是“先解决验证轴,再推能力”。
正确的顺序是:先划边界,再谈能力。
明确什么可以让AI做,什么只能辅助,什么不允许AI独立承担最终判断。
在弱真值场景里,验证轴没有“以后”。
先划边界,再谈能力。
什么允许AI做,什么只能辅助,什么不允许AI独立承担,必须先说清楚。
这个顺序,比“谁先建起验证轴”更根本。
写的不是技术,是人在这个时代怎么站。
剩下的,交给时间。
作者AI的未来·系列文章延伸阅读
往期发表
点击图片 ↓↓↓ 百篇一网打尽
请点击↓↓图片·美国故事连载持续更新1-9
100个国家·1000座城市
【带你深度游世界】
喜欢就点“赞吧↓↓↓↓↓↓↓
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.