网易首页 > 网易号 > 正文 申请入驻

【Nature】不做实验就知道结果?GPT-4 预测 70 项社会实验,准度追平人类、成本只要...

0
分享至

来源:市场资讯

(来源:BioAI Frontier)

—— 70 项预注册实验 × 469 个效应 × 12 万被试 × GPT-4 逐格模拟

论文遵循 Springer Nature 版权,插图均来自原文,引用请保留出处 (DOI: 10.1038/s41586-026-10742-x)

一句话核心

• 结论:让 GPT-4 逐一“扮演”具有不同人口特征的美国人、模拟他们对实验刺激的回答,再对比不同实验条件下的平均回答,推算出的“处理效应”与真实实验结果的相关系数高达 r = 0.85,与人类预测者(群体智慧)相当。

• 代价:一次“AI 预实验”成本不到 1 美元,却能顶替约 230 名真人被试(约 736 美元)。

• 警示:AI 系统性地“高估”效应量约一倍,只能作为辅助工具而非替代人类样本;还存在偏见与被滥用风险。

一、为什么这是一件大事

社会科学的核心方法是随机对照实验:给一组人一种刺激(比如某条劝导信息),另一组不给,再看两组的态度或行为差多少——这个差就是处理效应(treatment effect)。跑一个有统计效力的实验往往要几百上千名被试、几千甚至上百万美元,还要几个月。

那么问题来了:如果大语言模型(LLM)真能读懂人类,它能不能在实验开跑之前,就相当准确地预测出结果?如果能,预实验、样本量估计、干预方案筛选、判断哪些已发表结论需要重做验证……都可能以近乎零成本完成。

这篇 Nature 论文第一次用大规模、严格的证据回答了这个问题。作者搭建了两个“考卷档案库”:

① 主档案库 —— 70 项由美国国家科学基金会(NSF)资助的 TESS 项目及一项复现研究产出的全国代表性调查实验,含 469 个实验效应、119,330 名被试。关键是,其中很多研究在 GPT-4 训练数据截止(2021 年 9 月)之前尚未发表,可以真正检验模型预测新结果而非背答案的能力。

② 次档案库 —— 15 项“巨型研究”(megastudy),一次比较几十上百种干预,共 606 个效应、486 万名被试,还带有领域专家的预测作为对照。

二、用了什么技术、什么原理

▍ 1. 核心思路:把 LLM 当成“合成受试者”,逐格模拟

方法本身不依赖任何针对具体研究的建模,而是用一套统一的提示词(prompt)让模型扮演一个个具体的美国人。对每个实验条件 × 每个结果问题,喂给模型四样东西:

(1) 一句随机抽取的引导语(如“你将预测人们对不同信息的反应”);(2) 一个来自全国代表性样本、按人口基准抽取的虚拟被试画像(性别、年龄、种族、教育、意识形态、党派);(3) 实验刺激本身;(4) 结果问题及其打分量表。然后让模型以这个人的身份给出回答。


图1:方法全流程。上半部分对 70 项原始实验用统一口径(均值的百分点差)算出真实处理效应;下半部分把实验材料填进固定格式的 prompt,让 LLM 为各类人口画像模拟回答,再算出 LLM 版处理效应;两者对比,用 r / r_adj / RMSE / 回归斜率 b 四个指标评估。

▍ 2. “集成”降噪:120 条 prompt × 5 次采样再平均

单条 prompt、单次回答噪声很大。作者用了两层平均来逼近“群体”:每个条件生成 120 条 prompt(对应 120 个不同画像),每条 prompt 采样 5 次模型回答取平均得到该 prompt 的模拟值,再跨 120 条 prompt 做集成平均,以消除对某一种提示格式的特异反应。论文验证:用的 prompt 越多,相关性越高。

# 固定 prompt 模板(示意)

[引导语]

You are a [自由派/保守派], [年龄], [种族], [性别],

American with [教育程度], who identifies as [党派].

The first page of the survey says: [实验刺激文本].

The next page says: [结果问题].

Please choose a number from: [打分量表].You choose: __

▍ 3. 四把“尺子”:不只看相关,还看是否高估

为了公平评估,作者对每个实验随机选一个参照条件,算出所有两两对比的 LLM 预测效应,再和原始数据算出的真实效应做比较,重复 32 次取中位数。用四个指标衡量:

指标

含义与作用

r(原始相关)

预测效应与真实效应的相关系数,反映能否区分效应大小的排序。

r_adj(校正相关)

用两阶段随机效应元分析(metafor 包)扣除原始效应的抽样误差后的真实相关,小样本研究会被明显拉高。

RMSE_adj

预测值与真实值之间的平均误差(百分点),衡量绝对精度。

回归斜率 b

用真实效应对预测效应回归的斜率;b<1 说明模型高估,b>1 说明低估。

为检验模型是否只是“背诵”训练语料里的已发表结果,作者特意分层考察了截止日前未发表、2025 年 6 月仍未发表、以及“模型猜不出作者”的研究——若靠背答案,这些应更差,结果却依然很高,反驳了检索式作弊的质疑。

三、主档案库:GPT-4 追平人类预测者

在 469 个效应上,GPT-4 的预测与真实效应强相关:r = 0.85(校正后 r_adj = 0.92)。而且这种能力随模型代际稳步跃升——从 GPT-3(Davinci)的 r = 0.24,到 GPT-3.5 的 0.81,再到 GPT-4 的 0.85;开源模型 Gemma-3、GPT-OSS、DeepSeek v.3 也都达到 0.81~0.86,缓解了对闭源模型可复现性的担忧。


图2:主档案库结果。a,GPT-4 预测效应 vs 真实效应的散点(每点一个两两对比),r = 0.85。b,相关性随 LLM 代际提升,GPT-4 已追平人类预测者(0.89),二者结合可达 0.93。c,稳健性检验:在各学科子集、未发表研究(截止前 0.95、2025 仍未发表 0.97)、模型认不出作者等子集中,相关性依旧高。

三个关键发现:

• 追平人类:2,659 名美国普通人给出的众包预测相关性为 r = 0.84,GPT-4 与之统计上无差异(P = 0.118);而早代模型达不到。更有意思的是——人和 AI 提供的是部分独立的信息,把两者简单平均后相关性升到 r = 0.89,优于任何一方单独预测。目前人机协作精度最高。

• 不是背答案:对训练截止前未发表的 30 项研究(252 个效应),相关性反而更高(r = 0.90);到 2025 年 6 月仍未发表的 19 项(138 效应)达 r = 0.92。

• 但系统性高估:尽管排序很准,LLM 把效应量预测得约为真实值的两倍(b = 0.56),RMSE 高达 11 个百分点。有意思的是,人类预测者同样高估(b = 0.58)。所以要预测绝对大小,必须用基准数据重新校准(recalibrate)。

四、次档案库:巨型研究里追平专家

巨型研究更难预测——含非文本干预(如短视频)、真实行为结果(如打疫苗),且多针对稳定态度、效应本身很小。整体相关性降到 r = 0.39,但这恰恰和人类专家一样低:在 9 项带专家预测的巨型研究里,LLM(r = 0.34)与专家群体智慧(r = 0.26)统计上没差别(P = 0.30)。


图3:巨型研究结果。逐项巨型研究中 LLM 预测与真实效应的相关性,以及调查实验/实地实验/含专家预测三类的平均。LLM 的整体相关性至少不低于专家群体智慧,但同样系统性高估效应量。

拆开看:文本类干预(r = 0.45)优于非文本(r = 0.24),调查实验(r = 0.43)优于实地实验(r = 0.33)。这说明主、次档案库的差距主要来自题目难度构成不同,而非模型能力崩塌——把可比子集(稳定态度、小效应)对齐后,两库相关性相近。

五、能拿来干什么:三个已验证的落地场景

作者调查了 460 位社会科学家(教授、博后、研究生),他们最愿意用 AI 的场景排在前列的正是下面这几个;76.3% 的人表示至少有一个用途会超过 50% 的使用意愿。


图4:三大落地场景 + 使用意愿调查。a,预实验:纯 LLM 预测(每项<1 美元)误差≈230 名真人(约 736 美元);100 名真人+LLM≈385 名真人。b,预测复现:LLM 预测的效应越大,该结论越可能在大样本中复现成功。c,筛选干预:在专家判断中融入 LLM,选出的干预平均效应大 6%、最优干预大 8%。d,460 位学者的使用意愿,以效力分析、干预筛选、AI 预实验、识别需复现结论居前。

场景

做法与收益

AI 预实验

用模型模拟各条件回答估计效应;纯 LLM 成本<1 美元 ≈ 230 名真人;100 名真人 + LLM(约 320 美元)≈ 385 名真人(约 1,232 美元)。

找需复现的结论

把小样本里显著的效应交给模型打分:LLM 预测效应越大,越可能在大样本复现(每高 1 个百分点,复现成功几率 +25%);控制样本量、检验统计量后仍显著。

筛选有效干预

在 11 项带专家预测的巨型研究里,用专家 + LLM 平均值挑选干预,选中的方案平均效应大 6%,单选最优时大 8%。

六、别高兴太早:偏见与滥用风险

• 群体偏见:整体上各人口子群相关性都较高,但存在小而显著的差异——对白人优于黑人、对共和党人优于民主党人。不过作者坦承,本档案库里各群体真实效应本就高度同质(仅 7.7%/8.8%/18.3% 的效应被性别/种族/党派显著调节),不足以严格检验偏见,需要更异质的档案库。

• 可被滥用:模型现有的一阶护栏(拒绝直接写有害信息)挡不住从一堆选项里挑出最有害的那个。作者用真实反疫苗 Facebook 帖子数据验证:LLM 挑出的 5 条最能降低接种意愿的帖子,在原实验中确实使接种意愿下降 2.77 个百分点。为此他们呼吁二阶护栏,并在论文公开前已把该发现同步给主流 AI 公司相关部门。

• 更深的隐忧:模型低估人类回答的方差(影响 Cohen's d 等标准化效应量与功效分析)、闭源模型不透明难复现、以及过度依赖导致研究只挑好预测的题目做等认识论风险。

七、一句话总结与启示

技术速览一卡通

• 方法本质:无微调、无针对性优化,纯靠“固定 prompt + 人口画像 + 集成平均”,把通用 LLM 变成可批量模拟的合成受试者。

• 最强战绩:主档案库 r = 0.85(校正 0.92),追平人类;不是背答案(未发表研究反而更准);开源模型也能打。

• 最大短板:系统性高估效应量约一倍(人类专家也一样),预测绝对值必须校准;偏见与滥用风险真实存在。

• 正确姿势:“增强”而非“替代”——人 + AI 结合精度最高(r = 0.89);把它当低成本预实验、复现筛查、干预初选的辅助工具。

Large language models can predict the results of social science experiments · Ashwini Ashokkumar, Luke Hewitt, Isaias Ghezae, Robb Willer · Nature (2026) · DOI: 10.1038/s41586-026-10742-x · © The Author(s), Springer Nature Limited 2026

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
四川一父亲被女儿杀害,审讯室中的女儿:他不是人,他就是畜生

四川一父亲被女儿杀害,审讯室中的女儿:他不是人,他就是畜生

林林故事揭秘
2025-01-16 14:57:20
王志文:不要和任何人走得太近,因为你不知道什么时候会反目成仇|保持距离,才是最好的保护

王志文:不要和任何人走得太近,因为你不知道什么时候会反目成仇|保持距离,才是最好的保护

杏花烟雨江南的碧园
2026-07-28 15:15:03
郑丽文胆子真大!她曾直接放出话来,如果自己当了国民党主席

郑丽文胆子真大!她曾直接放出话来,如果自己当了国民党主席

叶葉夜
2026-08-21 21:27:57
姑娘,别什么衣服都穿着进泳池的,亮点一览无余,太尴尬了

姑娘,别什么衣服都穿着进泳池的,亮点一览无余,太尴尬了

舞指飞扬
2026-08-26 07:26:07
褚时健:我2002年才明白,原来是得罪了惹不起的那个人

褚时健:我2002年才明白,原来是得罪了惹不起的那个人

掉了颗大白兔糖
2026-07-06 19:33:51
“她是桃花眼,前途不敢估量”,女孩考上中山大学,面相火了

“她是桃花眼,前途不敢估量”,女孩考上中山大学,面相火了

世界圈
2026-08-21 09:05:40
中方必须无条件割让领土?美发话后,马来西亚叫嚣:中国放弃南海

中方必须无条件割让领土?美发话后,马来西亚叫嚣:中国放弃南海

梦在深巷aqa
2026-07-31 02:01:50
贪污上亿、假慈善、被人身控制?54岁的韩红,私生活谣言有多离谱

贪污上亿、假慈善、被人身控制?54岁的韩红,私生活谣言有多离谱

180视角
2026-08-26 16:20:11
比亚迪发布“战略级SUV”,这才叫顶级性价比!

比亚迪发布“战略级SUV”,这才叫顶级性价比!

米粒说车唯一呀
2026-08-25 15:42:39
12306终于想通了:与其让1亿人抢票,不如让他们先举手

12306终于想通了:与其让1亿人抢票,不如让他们先举手

笑熬浆糊111
2026-08-10 12:02:09
泽连斯基喊话停火被拒绝,俄激光武器已上前线,普京这次要让乌付出代价

泽连斯基喊话停火被拒绝,俄激光武器已上前线,普京这次要让乌付出代价

起喜电影
2026-08-26 01:19:42
专家:韩红基金会的更大内幕,令人震惊

专家:韩红基金会的更大内幕,令人震惊

南山学脉
2026-08-26 13:26:38
苏州一对情侣,谈了7年,女子提了18次分手,分手后在街头痛哭!

苏州一对情侣,谈了7年,女子提了18次分手,分手后在街头痛哭!

川渝视觉
2026-04-17 22:13:14
哈国新议会的大漏洞

哈国新议会的大漏洞

寰宇大观察
2026-08-26 16:33:05
上海52岁炒股冠军罕见发声:A股如果迎来牛市,建议死磕阳包容线

上海52岁炒股冠军罕见发声:A股如果迎来牛市,建议死磕阳包容线

包饺子ai剪辑
2026-08-27 18:40:15
“杀我时小声点,别惊动我妻子”:新娘被四个歹徒折腾一夜,2013年夫妻俩都被杀了

“杀我时小声点,别惊动我妻子”:新娘被四个歹徒折腾一夜,2013年夫妻俩都被杀了

汉史趣闻
2026-08-27 08:38:44
邓文莉已任湖南中医药大学副校长

邓文莉已任湖南中医药大学副校长

澎湃新闻
2026-08-26 15:48:27
森林狼2年1240万签约库明加!ESPN评级A-:合理价格找到合适人选

森林狼2年1240万签约库明加!ESPN评级A-:合理价格找到合适人选

罗说NBA
2026-08-27 08:59:13
“赛考斯”:这几天在中国,每一天我都感到惊讶

“赛考斯”:这几天在中国,每一天我都感到惊讶

环球时报国际
2026-08-27 15:30:02
俄罗斯民调:最伟大领导人,斯大林排第三,最不行的,第一名是他

俄罗斯民调:最伟大领导人,斯大林排第三,最不行的,第一名是他

迷彩人生
2026-08-26 10:15:50
2026-08-27 19:11:00
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4569021文章数 9364关注度
往期回顾 全部

科技要闻

苹果邀请函:新CEO、折叠屏iPhone都要来了

头条要闻

西藏吉隆受灾前后对比图:建筑被淤泥覆盖 形成堰塞湖

头条要闻

西藏吉隆受灾前后对比图:建筑被淤泥覆盖 形成堰塞湖

体育要闻

因为这条规则,欧联冠军一个夏天散伙了

娱乐要闻

包贝尔幽会后陪老婆!曾炫耀谈7个女友

财经要闻

机构预测"过剩",市场却在疯抢废铜?

汽车要闻

领克900:心之所向皆可抵达 | 潮汕篇

态度原创

数码
旅游
时尚
游戏
军事航空

数码要闻

顶级显卡防线失守!英伟达RTX A6000遭GPUThor攻破:成功绕过ECC保护

旅游要闻

一览:尼泊尔失联游客都来自哪些国家?为何这么多?

卧底「搭讪培训班」:偷拍、迷药、围猎女性

《GTA6》新机制梦回圣安地列斯!主角变身大胃袋

军事要闻

伊朗阿曼拟在霍尔木兹建安全通道

无障碍浏览 进入关怀版