【CSDN 编者按】2017 年,一篇 15 页的论文改变了整个 AI 世界。论文的八位作者中,七人先后成为估值数十亿美元的 AI 公司创始人。只有一个人,从 Google 跳到了 OpenAI,继续做研究,他就是 Łukasz Kaiser。
整理 | 梦依丹
出品 | CSDN(ID:CSDNnews)
超过410,000次引用。
这是 Łukasz Kaiser 在 Google Scholar 上的总被引数字——一位学者的学术生涯能积累到这个量级,在全球计算机科学领域也屈指可数。
![]()
而他参与的那篇《Attention Is All You Need》,单篇就被引用了超过 250,000 次——位列 21 世纪全球被引最高的科学论文之一。
它提出的 Transformer 架构,如今驱动着你手机输入法的预测文本、图像生成、AI 输出的每一个回答。
在 AI 的历史上,极少有一篇论文同时具备这样的理论深度和产业影响力。而它的八位作者——Ashish Vaswani、Noam Shazeer、Niki Parmar、Jakob Uszkoreit、Llion Jones、Aidan Gomez、Illia Polosukhin 和 Łukasz Kaiser ——被业界称为「Transformer 八子」。
几年之后,八子的人生轨迹加速分化。
Aidan Gomez 创办了 Cohere,估值超 55 亿美元。Noam Shazeer 创办了 Character.ai,被谷歌以 27 亿美元收购。Ashish Vaswani 和 Niki Parmar 共同创立了 Adept AI Labs。他们一个接一个地成为了科技商业史上的新贵。
但有一人的轨迹,与所有人不同。
Łukasz Kaiser 是八子之中,唯一至今没有创业、没有募资、依然走在科研一线的人。2021 年,他离开了工作八年的 Google Brain,选择以一名普通研究科学家的身份加入 OpenAI。
加入 OpenAI 之后,Kaiser 的轨迹开始和 GPT 系列深度绑定。他是 GPT-4 技术报告的署名作者之一。他参与开发了 Codex——后来成为 GitHub Copilot 的技术基础以及配套的 HumanEval 编程基准。他还参与了 GSM8K 数学题数据集的研究,这项工作早早展示了「让模型在推理时多算一会儿、多采样几次」可以显著提升准确率。这正是后来推理模型范式的雏形。
2024 年 9 月,OpenAI 发布首个推理模型 o1。Kaiser 是 o1 的研究负责人(research lead)之一。此后,他一路参与到 o3,以及更新的推理范式,直到今天的 GPT-5 系列。从 GPT-4 到 GPT-5,从 o1 到 o3,再到 ChatGPT——他是 OpenAI 这一系列前沿模型的核心共同发明人。
两次预言,两次命中
2021 年,在全球机器学习技术大会(现已升级为奇点智能大会)上,Kaiser 分享了《"青春期"的深度学习:现状与未来展望》。那年,GPT-3 发布刚满一年,ChatGPT 还不存在,「大模型」这个词远没有今天这么热。他站在台上,系统回顾了深度学习过去十年的进展,然后给出了三个方向:
- 多模态——融合图像、文本、视频、声音等多种形式的 AI 能力;
- 更大更好的 Transformer——模型规模和能力的持续提升;
- 模型将以服务形式提供——AI 能力通过 API 和云服务形式普及。
说这些话的时候,台下大多数人在点头,但可能没几个人真正意识到这意味着什么。毕竟那时候,最先进的语言模型还在为「写一首通顺的诗」而努力,多模态更多是论文里的概念,「模型即服务」更像一句口号。
然后,现实追了上来。
2022 年,Diffusion 模型引爆图像生成。2023 年,ChatGPT 席卷全球,GPT-4 发布,原生多模态能力落地。同年,API 和云服务成为 AI 行业的基础设施——从开发者到企业,调用大模型就像调用一个数据库一样自然。
三条预测,全部命中。不是模糊的「趋势判断」,是具体的、可验证的、有时间节点的技术演进方向。
2025 年 10 月,他在全球机器学习大会上又带来了《推理模型的历史、现在与未来》主题分享。彼时 o1 已经发布一年,推理模型从「新概念」变成了行业共识。但 Kaiser 没有停留在「回顾」,他直接抛出了一个更本质的问题:为什么 AI 不能在只看了三篇论文的情况下,就开始做一个科学研究?
他在演讲中画了一条进化弧线:
- 第一阶段,记忆——Transformer。它本质上是一个知识的搬运工。读遍整个互联网,把所有东西记在参数里。你问它「旧金山动物园几点开门」,它告诉你一个背下来的答案。但如果动物园改了营业时间,它不知道。
- 第二阶段,策略——推理模型。它不再死记硬背,而是学会了一种策略:遇到问题,先想一想,需要的话就上网搜一下、拿计算器算一下。它不是在回忆答案,而是在执行一套解题流程。
他举了一个例子:同事把一篇最新出炉的数学论文丢给了 GPT-5 Pro,不是让它总结——是问它「你能改进这篇论文里的一个定理吗?」GPT-5 Pro 想了 17 分钟,仔细读完论文,理解了里面的策略和定义,然后说:可以,在同样的假设下,这个定理能改进。
17 分钟。一个人类数学家写了几个月的东西,它 17 分钟就推进了一步。
- 第三阶段,研究器:一个能并行启动成千上万个思维线程的庞大研究系统,能从任意信息中学习,而不只是那些我们能事先验证对错的数据。
「想象一个模型,不再是单一的思考者,而是能并行启动成千上万个思维线程的庞大研究系统——能从任意信息中学习,而不只是那些我们能事先验证对错的数据。」
他解释说,当前推理模型的最大局限,是它们只能在「可验证」的数据上训练——像数学题,对了就是对了。但现实生活不是数学题。如何让模型从厨房菜谱、个人建议、人生规划这种没有标准答案的信息中学习?这是他眼中机器学习当前最大的挑战,也是他正在攻克的方向。
从「知识的搬运工」到「策略的思考者」再到「科学的合伙人」—— Łukasz Kaiser 描绘的这条弧线,正在成型。
今年 11 月,他会在「2026 奇点智能大会」上,给出离答案最近的那一步。
这也是继 2021 年、2025 年之后,Kaiser 第三次在奇点智能大会上进行分享。
从巴黎到山景城
在加入 Google 之前,Kaiser 的人生轨迹和「硅谷」毫无关系。
他在波兰弗罗茨瓦夫大学读完计算机与数学双硕士,随后前往德国亚琛工业大学攻读博士。他的博士论文研究的是一个极其冷门的方向——「自动结构上的逻辑与博弈」。简单说,他想搞清楚机器如何理解由有限规则定义的无限复杂结构。这更像是数学哲学,而不是工程。
2009 年,Kaiser 获得了 E.W. Beth Dissertation Prize,全球逻辑、语言与信息领域的最高博士论文奖。欧洲学术圈为他铺好了一条清晰的路:去巴黎狄德罗大学做终身研究员,稳定的职位、充足的经费、完全的自由。
2013 年,他辞职了。
他放弃的是多少欧洲学者梦寐以求的终身教职。他奔向的是一个当时在许多人看来还很「虚」的方向——深度学习。
多年后他这样解释自己的选择:「成为一名理论计算机科学家要容易得多,因为你可以在 20 年里做同样的事情。你可能会证明不同的定理,但在宏大的图景中,它是同一件事。深度学习完全不同,每两年,你就要做一件完全不一样的事情。」
把墙推倒的人
Kaiser 加入 Google Brain 的时候,自然语言处理领域正被一个巨大的瓶颈困住。
循环神经网络(RNN)是当时的绝对统治者。它像一个步行的旅人,逐字逐句地阅读文本。问题在于——它太健忘了。当句子变长时,开头的信息就会被遗忘。整个研究界都在试图给 RNN 打补丁,设计更复杂的门控机制。没人想过去推倒这座城墙,建一座新的。
2014 年,一道微光出现了。Ilya Sutskever 等人提出了一种叫「注意力」的机制,允许模型在生成每个词时,动态地回看输入的所有部分。但它只是被贴在 RNN 上当一个补丁。
Kaiser 和团队问了一个所有人都觉得疯狂的问题:如果扔掉 RNN,只留下注意力,会怎样?
这个想法,把 Google Brain 最顶尖的一批头脑聚集到了一起。为了快速迭代这个全新的架构,Kaiser 和当时还是实习生的 Aidan Gomez 开发了一个全新的开源库——Tensor2Tensor。这不仅仅是一个实验工具,它体现了 Kaiser 对降低 AI 门槛的执着:「我们发现人们仍然很难进入机器学习领域,开始他们的第一个模型。」
2017 年,《Attention Is All You Need》发布在 arXiv 上,整个 AI 界感受到了震动。
时任 OpenAI 联合创始人的 Ilya Sutskever 后来回忆,当他读到这篇论文时,立刻意识到「这就是我们需要的全部东西」。
Kaiser 后来用一个非常形象的比喻来解释 Transformer 的革命性。他把 RNN 比作一只蜗牛。它只有一个恒定的内部空间,每处理一个词,只能在同样的空间里打转。它看见下一个词,处理一下,继续走。它的记忆是固定的,没法长大。
而 Transformer,是一只「把一切回忆都背在壳里」的蜗牛。它每看一个新词,就把它装进壳里。壳越长越大。它能看到自己处理过的所有内容,而不是只记住最后一步。更重要的是——它可以并行处理,一口气看完整个句子。
![]()
扫码文末二维码可领取 Kaiser 在 2025 年全球机器学习上的演讲 PPT
这就从一个「步行者」,变成了一个「俯瞰者」。
同一年,Kaiser 还作为主要作者发表了另一篇论文:《One Model To Learn Them All》。这篇论文提出了一个单一模型,能同时处理图像分类、多语翻译、图像描述、语音识别和句法分析等八种完全不同的任务。虽然它在每个单项上都没有超越「特长生」模型,但它是历史上第一次有研究者严肃地证明:一个统一 的深度学习架构,有潜力联合学习多个领域的知识。
![]()
这是他内心深处对通用人工智能(AGI)追求的第一声公开低语。
即将在 2026 奇点智能大会并发表主题演讲
放眼整个「Transformer 八子」,Łukasz Kaiser 是唯一一个没有走创业路、至今还在科研最前线的人。
他选择留在 OpenAI,是因为他还有一个没回答的问题:
- 机器能不能从更少的数据中学到更多?
- 从三篇论文里开始一段科学研究?
- 从一次对话里学会如何让一个人过得更好?
这个问题的答案,正在被他以一代又一代的模型往前推进。
2026 年 11 月 20 日至 21 日,北京。
Łukasz Kaiser 已确认出席 2026 奇点智能大会并发表主题演讲。
去年的演讲里,他画了一条从「蜗牛」到「研究器」的进化弧线。今年他会带来 什么?也许是推理模型的新进展,也许是「从任意数据中学习」的突破,也许是我们还没想到的东西。
但有一件事是确定的:当 Transformer 八子中唯一留在科研前线的那个人与你对话,那些你在论文里反复研读的架构设计、在深夜追问的「大模型下一步」——都有机会听到他自己的答案。
本次奇点智能大会由奇点智能研究院与 CSDN 联合主办,旗下两大核心会议同期举行:
- 奇点智能技术大会:大模型演进、AI Native 研发、多模态与世界模型、具身智能等 9 大专题
- C++ 及系统软件技术大会:现代 C++ 演进、AI 算力优化、高性能低时延、安全可靠等 9 大专题
70 余位全球技术专家 × 18 个前沿专题 × 1000+ 行业精英。Łukasz Kaiser 是首位确认嘉宾,更多重磅嘉宾持续公布中,欢迎大家访问官网查看大会最新动态:https://ml-summit.org/。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.