网易首页 > 网易号 > 正文 申请入驻

清华初创&UIUC学者用7B模型在预测市场上自我蒸馏,跑赢GPT-5.6和Opus 5

0
分享至

机器之心发布

在社会变化的洪流中,LLM 能不能不断修正自己对社会的认知?

伊利诺伊大学厄巴纳 - 香槟分校(UIUC)的研究者在名为 Social World Model(ICML 2026:https://arxiv.org/abs/2606.11482)的框架中提出并初步探讨了这一问题。他们以Polymarket 和 Kalshi 等预测市场为天然检验场,观察当突发新闻降临时,市场参与者的信念将如何发生偏移。

但这只是第一步。UIUC 联合来自清华的初创团队 Astraculum 决定发起一项更硬核的挑战并获得了一些初步结果:LLM 的认知更新,能否不仅停留在 “训练时(Train-time)” 阶段,而是真正延伸到 “部署(Deployment-time)” 阶段?

换句话说,当 LLM 被置于持续流动的市场数据与实时新闻中,它能否根据不断到来的真实反馈持续学习,让今天经历过的市场变化,真正改变它明天的判断?为了验证这一点,联合团队在长达 390 天的真实数据上进行了滚动训练与持续回测。结果证明了 “持续进化” 的力量:这个在部署后依然不断更新权重的 Model,在同等测试环境下,一举击败了 GPT-5.6、DeepSeek V4 Pro 以及 Claude Opus 5 等一众前沿模型。

什么是 Social World Model?

如果物理世界模型(Physical World Model)能根据物体的 “当前状态(如速度和位置)” 预测它受力后的轨迹;那么当突发新闻降临时,AI 能不能预测人类社会的集体认知会发生怎样的转移?这就是 Social World Model (SWM) 试图解决的问题。

为了量化 “社会认知”,SWM 将目光投向了 Polymarket 和 Kalshi 等预测市场。这是因为预测市场只围绕尚无定论的问题形成,参与者广泛多样,无数普通人真金白银的押注,能最敏锐地反映大众 “集体信念” 的移动,比问卷和社交媒体都更可靠。

在这个框架下,“社会认知如何更新” 被完美映射成了世界模型中最经典的状态转移(State Transition)。以 “美联储九月是否降息” 为例:

  • 状态(State)即 信念(Belief): 也就是大众当前的集体预判与近期走势。比如合约卖 62 美分,意味着大众用钱投票得出了 “62% 的概率”,这就是当前社会系统的信念。
  • 事件(Event): 真实世界刚刚发生的一条突发新闻。它相当于打破现有状态的输入(Input / Action)。

模型的目标不是去预测美联储到底降不降息,而是预测大众在特定情形下的反应:在当前的状态下,刚发生的新闻会将大众的信念改变多少?换句话说,它学习的是:当前信念 + 突发事件 → 下一时刻的信念。

如何在真实世界中部署 Social World Model?

为了把 Social World Model 从离线实验推向真实环境,研究团队让 SWM 直接接入实时新闻源和预测市场盘口。具体来说,在每一个预测时刻,LLM 都可以看到此前的市场状态以及刚刚出现的新闻,然后判断接下来市场的集体信念会朝哪个方向移动。

比如,在 2026 年 2 月 13 日下午 2 点的一条样本中,市场正在预测 “标普 500 是否会触及 6000 点”,当时合约价格为 0.525。此时,Agent 可以看到过去 24 小时的价格走势,同时读取过去一小时内刚刚发布的新闻。它需要在下一小时结果真正发生之前判断这些新信息里,有没有尚未被市场价格充分反映的内容?如果有,它会把市场信念推向哪里?



如果模型参数始终被冻结,那么它今天从市场中看到的经验,并不会自动成为明天模型能力的一部分:每一次预测都由同一个模型作答,上一次的对错与下一次无关。真正的长期部署因此带来了下一层问题:模型能否把部署过程中不断获得的真实反馈重新写回参数,让过去的经历持续改变未来的判断?

如何让 Social World Model 在部署中持续学习?

现实世界中的社会认知和市场逻辑并不是静止的。新闻的重要性会变化,市场参与者的反应模式会变化,宏观环境也会变化。这种变化不由我们安排,也不会提前通知:模型自己不会报告它已经跟不上了。一个参数冻结在某个时间点的模型,很难保证能适应之后潜在的变化。因此,对于 Social World Model 来说,持续学习(Continual Learning)并不仅仅是一种训练技巧,而是长期部署中必须具备的能力。

那么,每小时到来的市场反馈,该让模型学什么?面对预测市场的涨跌,最直觉的做法是让模型直接根据 “价差” 来修正权重。但这会掉入噪声的陷阱。对于突发新闻引发的市场剧变,数字只是一种表象。它告诉模型的是:“市场最后动了多少。” 却没有直接告诉模型:“哪些新闻真正重要?”“为什么这条新闻会改变市场参与者的判断?”“市场究竟是在更新哪一种对世界的理解?” 因此,更可靠的路径是:跳过单纯的数值拟合,直接让模型去学习 “新闻事件” 与 “信念变动” 之间的逻辑推理过程。

引入 SDFT 机制:利用 “特权信息” 指导推理

为此,团队采用了类SDFT(Self-Distillation Enables Continual Learning,https://arxiv.org/abs/2601.19897)的方法来进行推理过程的自蒸馏。这套机制巧妙地利用了 Hindsight 的 “特权信息(Privileged Context)” 来构建师生闭环。特权信息只用来教,不用来答:预测永远由没看过结果的学生独立完成。

具体而言,当一小时后的真实市场结果揭晓时,系统首先会让模型根据真实变化写出一段事后推演。随后,同一个模型在训练中被分为 “老师” 和 “学生” 两角:

  • 老师: 同一个模型,只是上下文里多了这段事后推演(demonstration),作为特权信息(Privileged Context)。它不另外作答,而是用这份上下文给学生的推理逐 Token 打分。
  • 学生: 只能看到当前的新闻和价格,没有任何特权信息的辅助,必须进行直接预测。

在蒸馏阶段,老师逐 Token 地给学生的推理打分,把学生拉向看过结果之后的判断:学生还在说 “继续稳定”,老师已经压向 “正式延期”。这样刻进参数的是 “客观事件 →大众情绪→市场动作” 这条链,而不是某一次的价格数字。



Social World Model 持续学习的效果


为了验证这套机制的实效,团队选取了长达 390 天的真实市场数据,并按月切分为多个窗口。模型在每个月的数据上进行自蒸馏迭代与滚动部署。也就是说,整个实验严格按照时间向前滚动:部署 → 获得真实反馈 → 训练 → 更新模型 → 继续部署。

部署表现:持续学习让 7B 模型跑赢前沿模型 面对真实的资讯洪流,GPT-5.6、DeepSeek V4 Pro 等静态大模型全部跌穿了只看价格、不看新闻的基线。而通过持续自蒸馏的 7B 模型,是全场唯一比价格基线预测得更准的。



制胜关键:跨越周期的稳定性 将全年数据按月拆分后可以看出,性能的提升本质上来源于稳定:静态大模型在遇到特定月份(如 w01、w11)的变动时会集体大幅失分,而 7B 模型十二个月里没有一个月大幅失守。



更新有没有让模型变坏实验也做了检查:每一轮训练后都冻结一份副本作为对照,并在无关任务上探针;十二轮下来,模型的推理长度和质量没有退化。

Social World Model 背后的基础设施

LLM 在预测市场的部署只是冰山一角。 任何想让大模型跳出实验室、在真实世界的动态数据中实现持续学习的团队,都会不可避免地撞上三堵工程高墙:

  • 判断时什么是可知的?在模型下判断的那一刻,如何确保它只能看到 “当下” 的数据,绝对不会提前偷看到可能泄漏的未来?
  • 结果什么时候变得可知?现实世界的反馈往往是碎片化且延迟的。系统必须精确判定,到底要在哪个时间点把 “真实结果” 收集回来,作为给模型对答案的最终标准。
  • 更新到底有没有帮助?模型不断在吸收新数据修改自己的参数,如何确信它是在变得更聪明,而不是发生了灾难性遗忘,或者只是在死记硬背?


为了把这套逻辑跑通,研究团队搭建了TrajOps:一个专为持续学习设计的标准化 MLOps 引擎。从工程落地的角度来看,TrajOps 的核心其实非常务实且简洁:它向上层提供了三个接口:Collect(收集)、Inference(推理)、Train(训练),并直接在底层工作流中适配了标准的 SDFT(Self-Distillation Fine-Tuning,自蒸馏微调)方案。

整个循环在这个引擎上被清晰地串联了起来:

  • Collect 接口负责在事件落定前后,把新闻数据和姗姗来迟的真实市场结果精准抓取回来;
  • Inference 接口负责管理时间视野和持续部署模型;
  • Train 接口则直接调用内置的 SDFT 方案,将抓取回来的结果编译成训练信号,驱动模型权重更新。


目前,这个 7B 模型依然依托于这套 Infra 在真实市场中持续判断,每天写下实盘记录,公开在 trajops.astraculum.com。

以下为这项研究的作者及机构:

  • Haofei Yu、Yining Zhao、Jiaxuan You(伊利诺伊大学厄巴纳 - 香槟分校);
  • Chishang Yang、Junbo Yan、Senquan Gao(Astraculum)

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
去社保局一问,心凉了半截:灵活就业的人,这回真得算算账了

去社保局一问,心凉了半截:灵活就业的人,这回真得算算账了

白米饭怎么吃
2026-09-29 07:44:53
公交车越换越小,算账完才明白:不是公交不行了,这么跑才救得活

公交车越换越小,算账完才明白:不是公交不行了,这么跑才救得活

笔墨V
2026-09-29 12:35:45
刚签4000万就无限期休战!勇士被坑麻了,以为捡宝,却签个诈骗犯

刚签4000万就无限期休战!勇士被坑麻了,以为捡宝,却签个诈骗犯

你的篮球频道
2026-09-29 08:07:50
发现一个残忍真相:极度自律,每天锻炼的人,不一定能长寿,但是,极度自私,不为任何人、任何事操心的人可能长寿

发现一个残忍真相:极度自律,每天锻炼的人,不一定能长寿,但是,极度自私,不为任何人、任何事操心的人可能长寿

品读时刻
2026-09-18 09:08:45
市值蒸发近300亿,昔日大牛股爆雷

市值蒸发近300亿,昔日大牛股爆雷

蒋东文
2026-09-29 22:13:12
穆里尼奥放大招!皇马再挖利物浦头号巨星!复刻科纳特免签神迹

穆里尼奥放大招!皇马再挖利物浦头号巨星!复刻科纳特免签神迹

奶盖熊本熊
2026-09-30 07:26:42
格瑞维亚让利达6万!网友直呼:怎么不早说

格瑞维亚让利达6万!网友直呼:怎么不早说

汽车网评
2026-09-29 14:04:32
骗财骗色、被开除军籍,传了二十年的黑料,原来我们全都被骗了

骗财骗色、被开除军籍,传了二十年的黑料,原来我们全都被骗了

史之韵
2026-09-28 18:12:43
太嚣张!韩国队夺金后再次嘲讽中国女篮,暗示宫鲁鸣严重不合格

太嚣张!韩国队夺金后再次嘲讽中国女篮,暗示宫鲁鸣严重不合格

宗介说体育
2026-09-29 14:15:55
听到王毅划下的两条红线,日方代表对高市早苗,发出一句忠告

听到王毅划下的两条红线,日方代表对高市早苗,发出一句忠告

一口娱乐
2026-09-29 13:47:41
破案了!王楚钦亚运会3次丢金原因曝光,没想到张继科这样评价!

破案了!王楚钦亚运会3次丢金原因曝光,没想到张继科这样评价!

曹说体育
2026-09-30 06:41:19
全世界公认的十大健康食品,大蒜排第二,第一名家家都有!(建议收藏)

全世界公认的十大健康食品,大蒜排第二,第一名家家都有!(建议收藏)

诗词天地
2026-09-28 14:09:52
终于倒闭了?中国曾经最“暴利”行业,嚣张20年后彻底被时代抛弃

终于倒闭了?中国曾经最“暴利”行业,嚣张20年后彻底被时代抛弃

傲傲讲历史
2026-08-17 11:06:25
科学家已确认,在南极几千米厚的冰盖下,还藏着“另一个世界”!

科学家已确认,在南极几千米厚的冰盖下,还藏着“另一个世界”!

抽象派大师
2026-09-30 04:53:56
亏损超1.4亿,于谦尽力了,德云社丢了最后一块遮羞布

亏损超1.4亿,于谦尽力了,德云社丢了最后一块遮羞布

靠谱电影君
2026-09-27 22:36:14
夫妻本是同林鸟,但抱歉,这次刘嘉玲也救不了原形毕露的梁朝伟

夫妻本是同林鸟,但抱歉,这次刘嘉玲也救不了原形毕露的梁朝伟

铁锤妹妹是只猫
2026-08-08 06:26:46
视频来了!台湾岛中央山脉清晰可见,专家:显然是对“台独”分裂势力与日菲勾连的警告

视频来了!台湾岛中央山脉清晰可见,专家:显然是对“台独”分裂势力与日菲勾连的警告

环球时报国际
2026-09-29 18:52:11
韩媒:中国“不借熊猫给日本”,美国已有6只,高市心里不是滋味

韩媒:中国“不借熊猫给日本”,美国已有6只,高市心里不是滋味

观察者网
2026-09-29 17:50:13
当年为什么查办褚时健?

当年为什么查办褚时健?

百晓生谈历史
2025-08-20 21:55:53
日本前高官岩屋毅带50人访华,高市早苗还在赌,王毅划下2条红线

日本前高官岩屋毅带50人访华,高市早苗还在赌,王毅划下2条红线

多多爱探索
2026-09-30 06:45:21
2026-09-30 08:55:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14105文章数 142740关注度
往期回顾 全部

科技要闻

82亿美元收购!李飞飞将与苏姿丰并肩做AI

头条要闻

牛弹琴:全部美军灰溜溜走了 伊拉克举国兴奋放假4天

头条要闻

牛弹琴:全部美军灰溜溜走了 伊拉克举国兴奋放假4天

体育要闻

石雨豪:亚运金牌与背后的十年

娱乐要闻

赌王四房婚礼,何超琼带三房成员现身

财经要闻

中央财政首次贴息房贷 定向支持首套刚需

汽车要闻

搭华为乾崑ADS 5/设计风格换新 2027款纵横G700售30.49万起

态度原创

健康
艺术
房产
教育
数码

洗脸越勤,痘痘反而越多?

艺术要闻

齐白石:没见过的东西,我绝不画!一句话,道出大师封神的秘密!

房产要闻

三亚楼市下半场,被一次交付和一座艺术馆讲透了

教育要闻

平行线中的旋转问题,一个视频学会!

数码要闻

惠普HyperX格斗游戏键盘Clutch Tachi国行上市,1348.9元

无障碍浏览 进入关怀版