网易首页 > 网易号 > 正文 申请入驻

斯坦福 Susan Athey 教授:以彼之矛攻彼之盾,用 LLM 的随机性破解因果推断难题 | ICML 2026

0
分享至


随机性是一面镜子,因果推断照见了自己。

作者丨吴思梦

编辑丨岑 峰

7月7日,国际机器学习大会(ICML)在首尔召开。在首日Keynote演讲中,斯坦福大学商学院技术经济学教授、前美国司法部反垄断部门首席经济学家Susan Athey发表了一场跨越经济学、统计学与机器学习边界的演讲,题为“Causal Inference with Transformer Models”(基于 Transformer 模型的因果推断)。


Athey过去二十年来一直站在AI与因果推断的交叉点上。她个人曾同时包揽约翰·贝茨·克拉克奖与约翰·冯·诺伊曼奖,也曾是微软首席经济学家,亲历了搜索引擎推荐系统的因果难题;如今,她将目光投向了一个更棘手的战场:在生成式AI时代,当每个用户看到的每一条回复都独一无二时,我们还能不能做因果推断?

Athey的回答是:能。但必须换一种思路。她提出了一套全新的方法论:“以彼之矛,攻彼之盾”——利用大语言模型(LLM)天生的随机性,来做天然的随机实验。

这一方法有三个颠覆性的特点:

第一,它绕过了传统因果推断中最棘手的步骤——估计倾向得分(Propensity Score)作为用户特征的函数。在Athey的框架里,概率计算只在“用户内部”进行:“这个特定用户,在这次特定查询中,看到A而非B的概率是多少?”这意味着即便不记录用户查询本身,也能得到因果效应。

第二,它巧妙借用了大语言模型的内在随机性。由于LLM在temperature>0时会为同一查询生成不同回复,只需在夜间GPU空闲时重新调用一次API,就能低成本获取反事实曝露。“你不需要额外招募实验对象,你只需要把白天的数据晚上再跑一遍。”

第三,它回答的是一个极其务实的问题:“当系统在两种回复之间近乎无差异时,朝某个方向轻轻推一把——比如让语气更温暖——会有什么效果?”这不是一个学术玩具问题(Toy Problem),是每个AI产品经理每天都在做的决策。

总结而言,Athey的核心洞见是:生成式AI看似让因果推断变得更难,因为内容维度爆炸、每个人看到的东西都不同。但同时也提供了全新的工具:看似维度爆炸的大模型,实则为因果推断送上了最好的武器。

以下是Susan Athey在ICML 2026大会发表的Keynote演讲精编稿,AI科技评论基于原英文演讲内容进行了不改原意的翻译编辑:

“Causal Inference with Transformer Models”

主讲人:Susan Athey,斯坦福大学商学院


01


从搜索引擎到生成式AI:因果推断的二十年

我对AI与经济学交叉领域的兴趣始于2000年代末,当时我加入了微软研究院,帮助创立了跨经济学与计算机科学的New England Lab。同时,我在微软还有一个运营角色,主要关注搜索引擎。那时我试图把此前作为纯经济学家学到的一切,与我在搜索引擎中看到的实际问题结合起来。一个深刻影响我此后职业生涯的洞见是:机器学习与因果推断之间,存在巨大的协同空间。因果推断横跨经济学、统计学、计算机科学和许多其他社会科学。

从那以后,我一直在试图解决一个问题:在一个高度个性化的环境里,如何做因果推断、如何估计因果效应?我们面临一个悖论——你在个性化上做得越好,就越难学会如何个性化。因为如果你对每个人都实现了完美个性化,你就永远看不到他们看到别的东西会有什么反应。

多年来,学界发展了许多方法处理观测数据,即那些并非随机采集、而是推荐系统根据用户特征匹配推送的数据。我和许多同行一直在推进这些方法。但大语言模型和Transformer的出现,把一切推向了极限——也把我们从前那些“勉强能用”的方法推向了“可能失效”的边缘。维度太高了,我们做的事情太复杂了,以至于很难找到抓手。

今天,我要讲两个项目。在这两个项目中,我不仅找到了抓手,而且我们发现:这些方法不仅能解决生成式AI带来的新问题,甚至能让旧世界的答案也变得更好。

02


微型实验:把每个查询变成一次随机对照

首先,我要打破一个我通常会告诫年轻同事的铁律:“永远不要在重要演讲中第一次讲一篇论文。”我觉得今天的演讲应该算重要,但我还是要打破这个规则。这篇论文的主题与我的摘要一致,但具体内容没有写在摘要里——因为我在旅行途中遇到Wi-Fi问题,没赶上arXiv截止时间。所以它目前挂在Zenodo上,但愿明天能上arXiv。这是与Guido Imbens和Zoe Gu的合著。


这篇论文的核心动机是:如何利用大型文本平台生成的观测数据做因果推断?这些平台使用的是“随机算法”(Stochastic Algorithms)。大多数用来给用户推送个性化结果的算法,本质上都是随机的。

在旧世界,比如向用户推荐电影或书籍,因果推断已经很难了。但至少不止一个人看过同一部电影,所以你还有一点希望去学习用户对电影的偏好。但在生成式AI的世界里,如果把推送给用户的回复看作一部“电影”,我们面临的是同样的Netflix问题,只不过现在没有人会看到相同的上下文两次,也没有人会看到相同的回复两次。所以我们需要一种不同的方法。

一种方法是降维:用嵌入(Embedding)来表示内容,为用户估计嵌入向量,然后做匹配。这可以作为不错的近似,能帮你走很远。但在这第一篇论文里,我要追求更少偏差的结果,而代价是回答一个更窄的问题。

我们只关心少数几个特征(Features)的因果效应。我承认,要估计一条回复中每一个元素的因果效应是不可能的,响应面太复杂了,一条回复与另一条回复之间的差异方式太多了。我不会试图估计从内容特征到用户结果的整个函数曲面。相反,我一次只关注少数几个特征。

03


你想知道的因果问题:从情感语气到产品决策


这些特征可以是科学问题。比如,情感语言对消费者反应有什么因果影响?我曾在虚假信息语境下用真实用户做过实验,发现情感语言对于让人们停下来思考自己在网上分享了什么至关重要。但现在,我们可以在更大规模上、无需招募大量用户就能研究情感语言的因果效应。

另一个例子:电商平台可能想知道用户对质量的支付意愿,或者用户是否真的会关注质量信息——这关系到信号理论和提供质量的经济激励。在在线教育中,我们可以利用教育类AI导师的数据来研究不同教学方法的因果效应。

在产业实践中,一个典型问题是:更友好的回复有什么效果?我不知道在座各位的习惯,但可能有人跟我一样——我会告诉聊天机器人:“别闲聊了,别拍我马屁了,直接给我答案。”当然,人们对聊天机器人是否应该寒暄有不同的偏好。所以“是否应该让聊天机器人更友好”本身就是一个需要回答的因果问题。

我们都知道,不同场景使用不同的系统提示(System Prompt)。编程Agent有一套提示,闲聊Bot有另一套。应用开发者每天都在做这些主动决策。我在另一篇论文中研究过微笑照片对P2P借贷平台Kiva的影响——我们发现微笑的借款人更容易获得贷款。那篇论文里,我们用生成式AI修改照片来创建纯随机实验,验证了观测数据的因果估计。

04


反事实暴露:方法的核心

现在让我用一张幻灯片讲完这篇论文的核心。我们引入了一种新的数据结构,命名为“已记录的反事实曝光”(Logged Counterfactual Exposures),名字还在打磨中。来自上下文Bandit文献的朋友会觉得似曾相识,但在我们的设定中有所不同。


通常我们记录的数据是:一个用户、一个查询、一条回复、以及用户的行为反馈(比如点赞或点踩)。我们需要额外记录两样东西:第一,至少一条用户“本可以看到但没看到”的内容;第二,用户看到A而非B的相对概率。

如果你有一个大语言模型,你可以对同一用户查询做多次采样(temperature>0),拿到不同的回复。这就是创建反事实曝光的两种方式。

对于那些不熟悉因果推断的听众,让我解释为什么这很微妙。因果推断的核心挑战是:我能看到你看到的东西的结果,但看不到你没看到的东西的结果。所以它本质上是一个缺失数据问题。在我们的数据增强方法中,我们永远不会看到“你没看到的东西”的结果。那么,为什么还需要知道那个你没看到的东西是什么?

我们的洞见是:把每个用户查询当作一个微型实验。在这个实验里,有一个用户看到的东西和一个用户没看到的东西。然后我像分析一堆微型实验一样分析数据,把它们平均起来。

具体操作流程是:白天记录用户查询和实际回复;晚上GPU空闲时重新调用API获取反事实曝光;然后运行一个分类器来标记两条回复的特征(比如“语气是否温暖”);最后,扔掉所有实际曝光和反事实曝光在目标特征上相同的数据(即“一致对”),只对“不一致对”(Discordant Pairs)做均值差。

05


与传统方法的本质区别

如果与传统离线策略评估(Off-Policy Evaluation)对比,差异就很清楚了。离线策略评估试图估计:如果换一种内容分配策略,会有什么效果?这需要估计倾向得分作为用户特征的函数——而这正是高维空间中最难估计的对象。

我们的方法也需要概率,但概率是在“用户内部”计算的:“这个特定用户,在这次特定查询中,看到不同内容的概率是多少?”我甚至不需要记录用户查询本身。如果担心隐私问题,我可以在拿到反事实曝光后就扔掉用户查询,仍然能得到因果效应。这是与传统因果推断文献的根本性分歧。

我们把每个用户看作一个n=1的实验,然后对所有微型实验求平均。我们最终估计的是:在那些实际经历了特征变化的用户中,该特征的平均因果效应。如果语言模型的temperature较高、两条回复的概率差不多,那甚至不需要加权,直接做简单平均就好。

06


这个因果效应到底回答了什么问题?

听到这里,你可能会觉得我像是在变魔术(即凭空做成了一件不可思议的事),甚至想问:兔子是怎么凭空变进帽子的?(pull a rabbit out of the hat)因为我看似扔掉了传统观测数据因果推断中的许多底层硬性假设。但这个“魔术”的玄机其实在于:我们并没有解决那个庞大的全局难题,而是将视角转向回答了一个范围更窄、更具体的问题。


假设你听了这场演讲后回到实验室,决定试一试。你可以在向用户展示两条备选回复之前,选择那条语气更温暖的。你实际在做的,恰好就是我们估计的那个因果效应。所以这个估计值回答的问题就是:“当系统在两种回复之间近乎无差异时,选择更温暖的那一条,会有什么效果?”

如果你想让这个因果效应与修改系统提示对应起来,可以这样写提示词:“如果你在考虑是否要友好一点,请向友好的方向倾斜。”我们的因果效应衡量的就是这种“轻微推动”(Nudge)的效果——在系统本来就在两种选择之间“犹豫”的边界上,朝某个方向轻轻推一把。

但我们的方法不适合另一种场景:先生成回复,然后在后处理中“强行”让它变温暖。因为那种情况下,你没有在观测数据中见过“本来不温暖却被强行变温暖”的例子,也就无法学到这种干预的因果效应。


07


与负采样文献的关系

在推荐系统领域,有一个与我们的方法精神相近的文献——负采样(Negative Sampling)。它处理的也是“大多数物品没有与大多数用户互动”的问题。研究者从物品目录中采样一些用户没看过的物品作为负样本,然后在增强后的数据集上做分析。

但关键区别在于:负采样文献通常不关心用户到底被曝光了什么,它们用“假零”(Fake Zeros)来补全数据,知道这些估计是有偏的,但作为一个工程妥协,在实践中效果不错——它给我们推荐了让我熬夜追的好电影。

而我们的方法是无偏的。我们保留了真实的0/1结果,但创建的反事实样本来自于“我们知道用户没看到、但本可以看到”的内容。这更接近一种精心设计的实验,而非工程妥协。

08


劳动力市场:用Transformer分解性别工资差距

由于时间关系,第二个项目我只能简要介绍。这是一个高度跨学科的团队,涵盖了经济学、市场营销、计算机科学、工程学和统计学。


我们做的事情是:用Transformer模型对职业序列建模,而非对词语序列建模。这对研究者来说是个很好的实验平台——因为职业词汇表只有330个职业,而不是30000个单词。这意味着我在2022年就能用斯坦福的机器训练一个基础模型。

我们先用抓取的非代表性简历数据预训练基础模型,然后在一个包含工资数据的较小数据集上做fine-tuning。这个数据集有数千名工人、数万次职业转换,来自政府调查数据,任何人都可以下载。

因果推断在这里的应用是性别工资差距分解(Gender Wage Decomposition)。性别工资差距被分解为两部分:一是“如果男女有相同的职业历史,工资差距会是多少?”二是“男女职业历史本身的差异贡献了多少?”这个分解直接指导政策制定。

技术的核心在于改造fine-tuning的目标函数。传统fine-tuning用均方误差(MSE)作为损失函数。我们改用“残差对残差回归”(Residual-on-Residual Regression):先取结果变量减去模型预测结果的残差,再对“性别减去模型预测性别”的残差做回归。这个目标函数有三十年的理论历史,能让你在控制正确混杂因素的前提下得到因果效应。

让我特别兴奋的是:这只是一个例子。你可以通过改变随机梯度下降的目标函数来回答各种因果问题。后训练(Post-Training)一度失宠,但现在它回来了,我一直知道它会回来的。所以,对于那些对训练后调整感兴趣的人来说,这真的是一种有趣的做法,即改变目标函数,使其针对特定的感兴趣参数,并集中精力确保该参数正确。

一个人读论文太孤单,一群人刷顶会才好玩。

ICML 2026召开在即,我们正在召集一波含金量极高的 AI 研究者。群内主打实时论文跟踪与硬核技术探讨,拒绝灌水。

进群传送门:扫码进群或添加微信Vin_Vivid,备注:论文群 + 关注的 AI 方向。


搞科研/搞技术,信息差很重要。

来,一起快人一步!


上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈


未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
属猴人,十月上旬,将有一生中最 大的“横祸”!不是迷信,要小心

属猴人,十月上旬,将有一生中最 大的“横祸”!不是迷信,要小心

叮当当科技
2026-10-02 12:53:08
“我妈要敢在宿舍里这样,我就退学”,一段女家长视频让人力竭了

“我妈要敢在宿舍里这样,我就退学”,一段女家长视频让人力竭了

熙熙说教
2026-09-07 12:52:29
国庆当天,奥委会仅用一条动态,让所有人见识到孙颖莎的真实地位

国庆当天,奥委会仅用一条动态,让所有人见识到孙颖莎的真实地位

阿讯说天下
2026-10-02 09:51:46
红利曼之战对俄军的打击有多大

红利曼之战对俄军的打击有多大

爱竞彩的小周
2026-09-30 14:37:40
王皓总结亚运会:压力大失眠,林诗栋必须打99分,王楚钦仍是王者

王皓总结亚运会:压力大失眠,林诗栋必须打99分,王楚钦仍是王者

帛河体育
2026-10-01 22:55:39
中国未来3大超级工程,外国人直呼不可能,基建狂魔却正在建设

中国未来3大超级工程,外国人直呼不可能,基建狂魔却正在建设

抽象派大师
2026-10-02 03:52:36
就差1小时!2亿直接扔!!43:0啊!这傻子终于醒了...

就差1小时!2亿直接扔!!43:0啊!这傻子终于醒了...

柚子说球
2026-10-02 12:12:51
虎扑女神大赛海选,韩星断层领跑真人赛道,首设虚拟赛道

虎扑女神大赛海选,韩星断层领跑真人赛道,首设虚拟赛道

圆梦的小老头
2026-10-02 03:36:32
南开大学两位教授胡金牛、陈璟因「实诚」简介再次走红

南开大学两位教授胡金牛、陈璟因「实诚」简介再次走红

夏夏回来了随见
2026-10-01 14:52:51
全国最好就业的10所普通大学,毕业极大概率能端上“铁饭碗”,很多人都不知道!家长考生重点了解

全国最好就业的10所普通大学,毕业极大概率能端上“铁饭碗”,很多人都不知道!家长考生重点了解

高三倒计时
2026-10-01 18:00:09
“充电至80%必须离场”,国庆迎汽车充电高峰,多地服务区取号排队;交通运输部:10月5日和6日充电车辆将大增,这些服务区会特别繁忙

“充电至80%必须离场”,国庆迎汽车充电高峰,多地服务区取号排队;交通运输部:10月5日和6日充电车辆将大增,这些服务区会特别繁忙

都市快报橙柿互动
2026-10-02 11:39:44
篮协重磅改革!原42轮扩至46轮,季后赛规则也变,升降级卷土重来

篮协重磅改革!原42轮扩至46轮,季后赛规则也变,升降级卷土重来

体坛小快灵
2026-10-02 08:56:03
杭州商K集体停业,投资2亿的顶端商K豪华门头一片漆黑

杭州商K集体停业,投资2亿的顶端商K豪华门头一片漆黑

Mr王的饭后茶
2026-09-23 09:32:37
金与正回应地雷爆炸事件

金与正回应地雷爆炸事件

第一财经资讯
2026-09-30 08:51:02
东方甄选公开道歉:所有在直播间购买“溜溜凳”的用户,全面退款不退货,金额为货价的二倍

东方甄选公开道歉:所有在直播间购买“溜溜凳”的用户,全面退款不退货,金额为货价的二倍

封面新闻
2026-10-01 12:20:06
关晓彤迎来29岁生日,鹿晗深夜现身,两人的关系早就一目了然了

关晓彤迎来29岁生日,鹿晗深夜现身,两人的关系早就一目了然了

蹲坑看世界
2026-10-01 11:50:46
山东新生入学率腰斩,一个时代真的结束了

山东新生入学率腰斩,一个时代真的结束了

城事堂
2026-09-30 18:19:27
当你负债累累,落魄到亲人也瞧不起你时,请牢记“卖母鸡”思维

当你负债累累,落魄到亲人也瞧不起你时,请牢记“卖母鸡”思维

阿胖读书
2025-06-19 16:16:54
表面是老艺术家,私下贪财又好色,这几位晚节不保一点都不冤

表面是老艺术家,私下贪财又好色,这几位晚节不保一点都不冤

仙味少女心
2026-10-02 08:25:55
安徽合肥杀妻案:妻子带情夫同居,还逼丈夫旁观,结果双双殒命

安徽合肥杀妻案:妻子带情夫同居,还逼丈夫旁观,结果双双殒命

宝哥精彩赛事
2026-10-02 12:14:01
2026-10-02 14:11:00
AI科技评论 incentive-icons
AI科技评论
点评学术,服务AI
7689文章数 20789关注度
往期回顾 全部

科技要闻

“分手”15天后,华为与赛力斯签约新五年

头条要闻

男子近百万买4条机器狗:2"大狗"不交货2"中狗"有问题

头条要闻

男子近百万买4条机器狗:2"大狗"不交货2"中狗"有问题

体育要闻

“今天的表现,我们可以昂首离开球场”

娱乐要闻

奚梦瑶晒四太豪礼!22只龙凤镯近300万

财经要闻

珠宝黑马爆雷,老板全家跑路泰国!

汽车要闻

2027款极氪001将于明年一季度上市 现款猎装同步推新配色

态度原创

时尚
旅游
家居
手机
公开课

秋天真的适合穿格纹长裙,不花哨、不老气,大方高级又复古

旅游要闻

中国文旅看山西丨三晋大地迎国庆 文旅盛景启华章

家居要闻

2026建博会(广州) 公装联探展交流活动

手机要闻

一加16手机官宣首次搭载三频GPS +四频北斗,10月12日发布

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版