事情大家都知道了,Jeff Dean 选择离开了 Google。
今天,这位互联网时代最传奇的工程师,在社媒上宣布结束自己长达27年的 Google 生涯,并与另外三名技术大牛共同创办一家名为 Discovery Loop 的公司,推动机器学习、科学和工程的自动化。
![]()
*Discovery Loop 团队,右三为 Jeff Dean
这条消息的分量,很难只用一个职位变化来解释。
在过去的27年里,Jeff Dean 与同事共同设计了 MapReduce、Bigtable 和 Spanner,是初代 TensorFlow 的主要设计者和实现者之一。2011年,他联合创办 Google Brain,并成为 Gemini 项目的重要负责人之一。
除了铸就 Google,这些项目在过去二十多年里启发了全球无数互联网应用、Infra和AI从业者。
![]()
如今 Jeff Dean 创办的这家新公司,属于备受瞩目的 AI 自进化方向。离职消息公布前两个多月,他密集出现在不少场合,谈起了自己对 AI 的认识和判断。
这些内容涉及训练、智能体、数据和算力,也有他的下一个方向,持续学习和自我改进的 AI,放在一起就像一份顶尖工程师对 AI 的判断记事本。我把这些信息读了几遍,整理出 Jeff Dean 对 AI 的 22 个判断。
智能体证明,今天的所有工具都太慢
01 智能体的工作时间从小时变成星期。
在几天前 YC 采访现场,Jeff 提醒台下的技术创业者,人们仍然低估了长时间智能体。只要底层模型足够强,在合适的问题领域里,智能体可以连续运行几天甚至几周,完成复杂任务。
他举的例子是让软件从一种语言重写到另一种语言。过去这件事往往需要团队逐个模块改写。现在 Jeff 观察到,智能体已经能够接手其中相当完整的一段流程:读取原代码,翻译测试,生成新实现,再比较两边行为,直到差异消失。
02 长任务失败的原因。
今天的智能体经常在十几次或几十次工具调用后开始跑偏。Jeff 的解释是,模型会逐渐进入自己缺少经验的区域。它离训练分布越远,性能越容易下降,前面的小错误也会给后面的步骤制造新问题。
这解释了一个常见现象:同一个智能体,前十步看起来像个熟练工程师,到第五十步却开始忘记自己最初要做什么。
03 给智能体做长任务铺一条更熟悉的路。
现在保证智能体做长任务的准确率,Jeff 提出了几种方式。
第一种补救办法,是编写技能和操作指引。技能并不改变模型参数,它把人类解决某类问题的方法写成模型能够调用的步骤,让智能体尽量沿着熟悉、可验证的路径行动。
另一种方法,是让多个智能体尝试不同路径,再由另一个模型评估哪些方向更有希望。失败或跑偏的路径被丢弃,计算资源继续投入那些看起来能走通的方案。
在 Jeff 看来,这是一种通用的推理时搜索。单个智能体不必第一次就做对,系统可以用更多推理计算换取更高的成功率和长流程可靠性。
04 模型只是系统中的一个零件。
Jeff 对“模型能力”的理解很工程化,他认为真正要交付的是一套能解决问题的系统,模型只是其中一部分。系统还要处理检索、记忆、工具调用、任务分解、结果评估,以及不同智能体之间的编排。
同一个基础模型放进不同的工具和上下文系统里,最终表现会相差很大。这些情况我们也在很多 Harness 里见到了。
05 智能体会证明,今天的所有工具都太慢。
模型速度提高之后,瓶颈会转移到它调用的工具上。很多数据库、编译器、网页和企业软件,都是按照人类能够接受的等待时间设计的。人类愿意等几秒,连续工作的智能体却会把这几秒重复成几小时甚至几天。
Jeff 认为,即使模型变得无限快,工具的延迟仍会限制真实工作的加速幅度。Agent 时代需要重做的,远不止模型。
06 代码愈发便宜,选择问题的品味更稀缺。
虽然模型和智能体还有优化空间,但假设每位创始人都能同时调度几百个智能体,代码也主要由智能体完成,稀缺的能力会变成“让它们做什么”。这是一种品味。
一个研究项目执行得再漂亮,如果问题本身无聊,价值仍然有限。人类要负责给大量 AI 计算指方向,判断哪些问题配得上这些时间和算力。模型至少目前未必擅长这件事。
07 品味可以靠提前下注,再回头复盘来训练。
“品味”听起来很玄,Jeff 给了一个可以操作的办法:写下你认为未来 12 个月会变得重要的一批问题。你只需要亲自选择其中一项,但一年后要回头检查其他判断。
哪些问题真的变重要了,哪些被别人做出来了,哪些一直没人碰。这样的复盘会给判断力增加样本,比只复盘自己真正做过的一个项目更快。
下一代AI会怎样学习、计算和改进自己
08 模型处理复杂任务的速度,进步飞快。
Jeff Dean 原本已经对模型相当乐观,但仍然低估了模型处理复杂任务的进步速度。他发现变化也开始越过编程,进入其他能够调用工具、拆分步骤并检查结果的领域。
衡量模型进步,现在只看它能否回答更难的问题已经不够了。更大的变化来自它能否接住一项复杂工作,并把工作继续做下去。
09 持续学习是没攻克的核心问题,今天的模型架构太规整。
持续学习意味着模型可以不断吸收新经验,又不破坏已有能力。Jeff 在两个月前一次 Google 组织的活动中坦言,自己和同事尝试过一些方法,但当时没有找到正确答案。
关于模型架构,他觉得现在的混合专家模型包含许多专家模块,但每个专家的结构通常很相似。Jeff 以为,模型会更早走向一种更有机、结构差异更大的形态。但这个方向还没有真正实现,他仍然认为这种模型架构有价值。
10 AI会把科学方法的循环自动化。
Jeff 关心的自我改进,并不是让模型凭空“变聪明”。他描述的是一套可以执行的循环:提出实验,完成实验所需的实现,运行实验,评估结果,再把结果放回下一轮。
当智能体能够把高层目标拆成子问题,每个子问题都进入自动实验循环,最后再把答案组合起来,机器学习、科学研究和工程设计都会因此加速。
11 更快的评估器,直接改变科学研究的节奏。
关于 AI 自己促进科学试验,Jeff 举过一个量子化学案例。原来的密度泛函理论模拟器评估一种分子构型,需要运行一整夜,后来研究团队用模拟结果训练了一个神经网络近似模型,速度提高约 30 万倍,准确度仍接近完整模拟器。
所以,当 1000 万个候选(潜在分子结构方案)可以在一顿午饭的时间里筛完,实验循环就被重写了。过去要做六个月的筛选,现在可以不断迭代,再把最有希望的少量候选交回昂贵模拟器验证。
这或许和他的下一步创业相关。
12 明年,AI改进AI会有重大成果。
在5月的 Gemini 圆桌上,Jeff 给出了一项很具体的预测:一年后,人们可能已经能指着模型中的某个重大改进说,这是模型与智能体为了自我提升而共同工作,最后生成的成果。
这仍然是预测,不是已经发生的事实。但它把“AI改进AI”从遥远口号压缩成了一个很近的时间表。
对训练模式、数据、算力和能耗的非共识
13 预训练和后训练会逐渐交替进行。
今天的模型通常先预训练,再进入强化学习、指令微调等后训练阶段。Jeff 对这种截然分开的流程并不满意。他设想的系统会在观察数据和使用新知识之间反复交替。
模型可以在模拟环境、机器人世界或软件环境中行动,再根据后果学习。交替次数足够多时,两阶段之间的边界会越来越模糊。
14 数据还没有耗尽。
关于数据,Jeff 最近表示公开文本确实已经被大量使用,但他并不认为数据会很快卡住模型进步。因为,尚未充分利用的视频、科学数据和其他模态仍然很多;合成数据、重复处理已有数据,以及更高效的学习算法,也能继续从现有材料中提取新价值。
因此,他真正关心的是系统能从每份数据里学到多少,远不止“还有没有 token”。
15 和人类相比,AI的学习效率太低。
Jeff 做了一个直观比较:一个大模型看到的数据量,约是一个能力很强的人类的 1000 倍,最后才获得大致相当的能力。有些任务更强,有些任务仍然更弱。
如果模型能从每个样本中多提取几个数量级的信息,AI 的进步就不必只依赖更多数据和更大算力。数据效率仍有巨大的算法空间。
16 搬运数据的能耗,是一次计算的1000倍。
关于硬件,Jeff 也有很多判断。
首先他指出在现代加速器(GPU/TPU)里有个反直觉的事实:把数据从存储器搬到计算单元,往往比真正执行乘法昂贵得多。Jeff 认可的量级差异约为 1000 倍。
这也是批处理存在的重要原因。既然搬一次这么贵,那就让搬来的数据尽量多用几次。
但批处理有代价:要凑够一批数据就得等,攒齐了才开跑,单个用户的请求得在队列里多等一会儿,模型的响应就变慢了。系统设计必须在两者之间取舍。
17 推理硬件会比训练硬件更加专用。
训练追求吞吐,推理还要面对用户等待和智能体连续调用,因此延迟要求更高。推理期间模型权重通常保持不变,数值精度也可以更低,这些特征都给专用芯片留下了空间。
Jeff 设想,未来硬件将直接固定少数几种真正需要的精度,减少数据搬运,也不再承担大量无关的通用功能。
18 模型架构和芯片架构需要一起设计。
当智能体在后台消耗海量 token,仅仅堆更多同类芯片很难解决问题。Jeff 更关心模型与硬件的协同设计:模型采用什么结构,芯片支持什么精度和存储方式,两者一起换取更低延迟、更高每瓦性能和每美元性能。
TPU 的历史已经展示过一次这种思路。未来的推理硬件会把它推得更远。
19 “终身AI”未必要把一切塞进上下文窗口。
Jeff 希望 AI 能调用一个人一生接触过的数字内容,也希望它能理解规模达到百亿行的代码库。但现在把这些内容一次性放进昂贵的注意力窗口,并不现实。
他的方案是级联检索。先从 100 亿份文档中筛出 3 万份,再由轻量模型找出其中最相关的 117 份,最后才交给更大的模型。用户感觉所有资料都在眼前,后台其实完成了多级筛选。
创业者该做些什么,该怎么选
20 创业该找模型成功率为0%或1%的问题。
在他离职前的最后一次采访中,Jeff 谈了不少创业话题。他给创业者的建议是,如果通用模型已经有 20% 的成功率,这项能力往往已经进入模型的上升曲线,未来半年到一年就会快速改善。
完全的失败反而提供了空间。失败的模型通常缺少数据、工具、界面或领域知识,小团队可以围绕其中一项建立更持久的优势。
21 私有数据和专用模型,是小团队的壁垒。
小团队在模型领域还有机会。
第一类机会来自通用模型看不到的数据。一个产品如果得到用户授权,可以理解他的个人文件、邮件或工作记录,通用模型便无法只靠公共训练数据复制同样的体验。
第二类机会来自窄而难的问题。AlphaFold 专注蛋白质结构,材料科学和芯片设计也适合训练小而专用的模型。它们不追求什么都做,只要把一个重要问题做到极高准确率。
22 最好的职业方向。
谈到工作,Jeff 给职业选择设了三个条件:研究自己真正关心的事情;和喜欢、互补的人合作;如果事情做成,它会给世界带来积极影响。
大公司提供平台、算力和大量拥有不同知识的同事,小团队提供更强的自主性和更集中的冒险。两条路都可以选,他到最后会问同一个问题:如果最理想的结果真的发生,世界会不会因此好很多?
如果答案是“嗯,是有点酷,不过也就那样”。Jeff 的建议是:别把时间花在那里。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.