网易首页 > 网易号 > 正文 申请入驻

AI最尴尬的短板,中国科学院出手了

0
分享至

允中 发自 凹非寺
量子位 | 公众号 QbitAI

GPT-5.5能写专业论文,DeepSeek-V4-Pro能生成复杂代码,具身机器人能完成基础物理操作,语言智能和工具智能都已经跑出了自己的赛道。

但把同样的AI放进一次家庭聚餐、一场团队会议、一次医患对话,它往往表现得生硬、不合时宜。

不是知识不够,是“读懂人心”的能力还没跟上。这正是社会心智长期缺失带来的真实困境,也是从“任务执行”走向“社会协作”时必须补上的一课。

7月24日,中国科学院计算技术研究所智能算法安全全国重点实验室“知境”团队,正式发布知境社会心智大模型技术体系

这不是又一个大模型刷榜的故事,而是一份关于社会心智如何成为独立工程能力的完整答卷。

知境要做的,正是为现有大模型补上这块短板——给模型增加“情商”与可信任感,让AI在关键场合靠得住、信得过。

先体检,再开方:SoMBench给AI做“社会心智CT”

治病之前先诊断。知境团队做的第一件事,是建立一份足够精细的“体检表”SoMBench

SoMBench把笼统的“懂不懂人”拆解成3大一级维度、17个二级维度、71项细粒度任务,覆盖从基础信念推断到高阶情绪理解、从社会规范到关系建模的完整光谱。



3481道经过十余名人类专家评审、严格保留的实例,构成了一张社会心智的“能力地图”。

更重要的是,SoMBench不仅会告诉你“考了多少分”,还告诉你“错在了哪”。

通过单选、多选、判断、开放题的多题型交叉验证,以及选项扰动、捷径检测、受控改写等手段,SoMBench能精准定位模型的错误模式,例如:是推理链断了?还是靠表面模式蒙对了?这为后续的训练指明了靶子。

20个顶级大模型在SoMBench上测试,最强模型正确率仅72.08%,无一达到90%天花板,社会心智的“无人区”,名副其实。

为什么社会心智这么难?

因为同一场景里,AI要同时处理角色关系、隐含意图、情绪变化、社会规范、未说出口的话等多层推理——普通大模型根本理不清这些弯弯绕绕。



Zing的“训练密码”:让目标随能力一起进化

体检表有了,接下来怎么练?

知境团队没有走“堆数据、堆算力”的老路,而是设计了一套会“自我进化”的训练系统

密码一:FLARE数据飞轮——错题本比课本更重要

传统训练是“准备一批数据,训完拉倒”。

Zing的做法是让评测像导航仪一样指出方向,而不是直接“透题”。

当模型在诊断集上暴露短板时,FLARE会定位到具体认知维度,再针对性合成全新的训练样本——语义、场景、推理路径都与原题不同,但瞄准同一种能力缺陷。

这就好比发现学生几何薄弱,就出套新几何题,而不是反复做同一张卷子。

候选样本还须经过多轮过滤,只保留模型当前无法轻易答对、但经过推理能够学会的中高难度样本。

这就是FLARE的核心逻辑:哪里弱就练哪里,但每次练的都是新题



密码二:两阶段训练——先“通识”,再“专精”

第一阶段:通用社会心智打底

模型首先利用多教师蒸馏构建高质量冷启动数据,通过答案门控、推理深度过滤保留有效推理轨迹;

随后采用Mixed-Reward GRPO强化学习框架,根据任务类型、训练阶段和推理质量,动态组合过程奖励、可验证奖励和拒绝采样——奖励目标随模型能力变化而调整,不是一成不变的KPI

第二阶段:专项能力强化

针对情绪理解、意图推断、社会规范、视角采择等薄弱环节,先用两轮监督微调注入领域知识,再用困难样本持续校准。

目标是:增强专项能力的同时,不丢失已学会的通用推理。

密码三:OPD在线蒸馏——边学新招,边不忘老本

强化学习最大的风险是“学新的,忘旧的”。

Zing的解决方案是OPD(On-Policy Distillation):在在线轨迹上引入教师模型的token级分布约束,让学生模型在探索更优路径的同时,不偏离已验证的有效推理模式。

GRPO负责“往前冲”,OPD负责“别跑偏”。

两者作用于同一批采样轨迹,既鼓励探索,也守住边界

FLARE决定“学什么”,两阶段训练决定“什么时候学”,OPD决定“向谁学、不忘什么”。

Zing构建的不是一个静态训练流程,而是一套随模型能力状态持续自适应的进化系统

数据说话:这套“密码”管用吗?

训练方法再漂亮,最终要拿成绩说话。在5项国际权威社会心智评测基准上,Zing给出了硬核答案。


△知境·Zing在5项社会心智能力评测中的性能对比表

Zing-27B,多模态模型综合均值超越GPT-5.5

Zing-27B五项综合均值,超越GPT-5.5的

尤其在HiToM(+4.08pp)和EmoBench(+5.62pp)上优势明显。

HiToM评测的是“我知道你知道我知道”的递归信念追踪,阶数越高难度指数级增长——Zing-27B是首个在该基准上超越GPT-5.5的百亿参数级公开模型

Zing-32B,文本模型比肩DeepSeek-V4-Pro

Zing-32B综合均值,略超DeepSeek-V4-Pro的

EmoBench上78.13对71.88的6.25个百分点领先尤为突出,证明了专项社会心智训练在情感理解维度上能够形成显著的结构化优势。

Zing-8B/14B,小模型大心智

8B模型在HiToM上达到,14B模型达到,分别超越同尺寸基座模型近12和8个百分点,甚至超过参数量为其数十倍的更大模型。

递归阶数越高,差距越明显——Zing-8B在三阶和四阶信念推理上分别提升21.67和22.08个百分点。

这些结果指向同一个结论:社会心智能力的提升,来自训练方法的结构化设计,而非参数的简单堆砌。


△知境·Zing在高阶信念推理评测中的性能对比表

SoMBench作为知境自研的最难社会心智基准,当前模型仍有较大提升空间——这也正是下一步训练迭代的重点方向。

Actio:把“懂人心”从参数里“捞”出来

模型学会了,部署时怎么不掉链子?

知境的答案是Actio——一个“按需调用、不乱塞”的显式心智状态部署架构。


△知境·Actio系统总览图

真实交互场景中不缺信息,缺的是恰当的信息

Actio以Harness为统一编排核心,根据任务的心智变量和推理需求,选择性激活四类支撑:

  • PRISM:76项分层心理与社交技能(20宏观+56微观),按需路由
  • Starling Memory:显式记录”谁、何时、相信什么”,版本化更新
  • SAGE:跨任务可复用的推理经验,三级回退激活
  • Gated RAG:社会文化知识按需检索,验证信用分配

一次典型推理经历四步:理解任务并识别心智需求 → 并行检索技能、知识与记忆 → 排序裁剪组合后引导推理 → 离线沉淀有效经验。

Actio像经验丰富的社工,知道什么时候该调用哪块能力——而不是把所有信息塞进同一段上下文。

这套机制的核心目标只有一个:让AI在真实场景中不仅“会想”,还能“做对”,配得上用户的托付。

应用前景:从实验室走向真实场景

具身智能——给机器人装“心眼”

物理AI解决“身体”的问题,社会心智AI解决“心眼”的问题。

知境的小参数模型(8B/14B)为端侧部署提供了可能,未来可探索家庭看护、儿童陪伴、协作机器人等需要实时社会推理的场景——让机器不仅会动,还懂得谁需要帮助、什么时候该安静、怎样表达才恰当。

复杂决策推演——重大选择的“预演沙盘”

在事关重大的决策场景中,理解“各方会怎么想、怎么做”往往比算清账目更重要。

知境的社会心智能力未来可应用于政策沟通、危机管理、组织变革等领域的推演,能够帮助决策者在行动前,提前看见不同选择可能引发的连锁反应。

人机共生——统一心智协议

当多个智能体(人类、机器人、AI Agent)需要长期协作时,最大的风险不是能力不足,而是“你以为我懂了,我以为你懂了”的认知错位。

知境的社会心智建模框架,未来可为多智能体系统提供统一的心智状态表达与共享协议,让不同的智能体在同一个社会认知坐标系下协作。

一条新赛道,已经铺好了

知境团队真正想回答的问题是:

社会心智能不能像语言理解、代码生成一样,被定义为一种可以持续测量、训练和改进的工程能力?
  • SoMBench建立了能力坐标系,把“懂不懂人”分解为可定位的认知缺口;
  • Zing依据诊断结果组织自适应训练,让社会推理从提示词诱导的临时行为,转化为模型参数中的稳定能力;
  • Actio则通过技能、心智状态、经验和社会知识的动态组织,为部署提供可选择、可检查的支持。

三者共同指向一条技术路线:社会智能不再只是模型表现出来的一种模糊“情商”,而开始成为具有评测工具、训练方法和运行时接口的工程对象。

当然,这条路才刚刚开始。

训练收益能否跨任务、跨文化迁移,Actio能否在长期真实交互中保持稳定与合宜,仍需要更广泛的验证。

但至少,“懂人心”这件事,终于从玄学走向了系统工程。

符号空间拼智商,物理空间拼行动力,心智空间拼的是“读空气”的能力,这是AI赢得人类信任的关键一跃。

语言智能之后,社会智能正在成为通用人工智能的下一个核心赛道。

知境为这条赛道,提供了从评测到训练到部署的完整工程基础。

知境团队 中国科学院计算技术研究所智能算法安全全国重点实验室
GitHub:https://github.com/Zhijing-AI/Zing (评测基准、模型权重等后续将陆续开源)
项目技术报告:https://zhijing-ai.github.io/Zing/Zing_TechReport.pdf

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
公路车骑行服,熟女骑行穿搭,利落面料勾勒饱满曲线

公路车骑行服,熟女骑行穿搭,利落面料勾勒饱满曲线

只要高兴就好
2026-09-24 11:58:50
15分钟听证会散场,8户人家不签字:深圳光明这份征收方案,把旧改最扎心的一幕摆上了台面

15分钟听证会散场,8户人家不签字:深圳光明这份征收方案,把旧改最扎心的一幕摆上了台面

新浪财经
2026-10-05 02:15:59
汪小菲被目击「带辣妹打球」!Mandy直播揭真相:朋友来跟我通风报信

汪小菲被目击「带辣妹打球」!Mandy直播揭真相:朋友来跟我通风报信

ETtoday星光云
2026-10-05 12:43:28
美国母子经历平行时空?一只2008年北京奥运杯,11年后竟离奇复裂,网友晒出相似经历...

美国母子经历平行时空?一只2008年北京奥运杯,11年后竟离奇复裂,网友晒出相似经历...

北美省钱快报
2026-09-02 04:42:09
丁元英:饭局上,越是那些话少、敬酒不勤、却从不冷场的人,越要深交,他们身上藏着两种你急需的顶级思维

丁元英:饭局上,越是那些话少、敬酒不勤、却从不冷场的人,越要深交,他们身上藏着两种你急需的顶级思维

心理观察局
2026-08-13 07:12:29
全红婵不对劲,不是她以后不比赛了,而是她今年19岁了,居然开始了自己的精致路线

全红婵不对劲,不是她以后不比赛了,而是她今年19岁了,居然开始了自己的精致路线

二胡的岁月如歌
2026-09-30 20:32:42
快扔掉,戴一天,辐射量相当于拍117次胸片

快扔掉,戴一天,辐射量相当于拍117次胸片

北青网-北京青年报
2026-06-22 11:00:34
192GB统一内存塞进笔记本,AMD抢先英伟达一天亮出怪兽芯片

192GB统一内存塞进笔记本,AMD抢先英伟达一天亮出怪兽芯片

码上闲叙
2026-10-05 21:19:22
历史新高!今夜,沸腾!欧美股债“齐飞”

历史新高!今夜,沸腾!欧美股债“齐飞”

证券时报
2026-10-06 22:42:14
史诗级大涨!你手里的人民币,正在以前所未有的速度变"贵"!

史诗级大涨!你手里的人民币,正在以前所未有的速度变"贵"!

户外钓鱼哥阿旱
2026-10-06 04:29:41
蒙古国开始后悔了!当年选择独立,如今面对现实,却多了一份无奈

蒙古国开始后悔了!当年选择独立,如今面对现实,却多了一份无奈

西楼知趣杂谈
2026-10-05 16:33:21
大势不妙!中国友邦或倒戈,22页反华文件曝光,事态已经恶化

大势不妙!中国友邦或倒戈,22页反华文件曝光,事态已经恶化

白日追梦人
2026-10-05 09:46:47
拥有核武器的9个国家中,最穷的巴基斯坦, 是如何获得核武器的?

拥有核武器的9个国家中,最穷的巴基斯坦, 是如何获得核武器的?

文史达观
2025-05-03 06:45:05
马什:曼城违规圈子内心知肚明,他们居然宣称5200万镑签哈兰德

马什:曼城违规圈子内心知肚明,他们居然宣称5200万镑签哈兰德

云隐南山
2026-10-06 10:11:03
陈思诚说,如果《神探之痕迹》成功,他就拍第二部《神探之弹道》

陈思诚说,如果《神探之痕迹》成功,他就拍第二部《神探之弹道》

动物奇奇怪怪
2026-10-06 12:45:51
杭州降39%、广州降32%、上海降31%!并非房子卖光, 而是房东不卖了

杭州降39%、广州降32%、上海降31%!并非房子卖光, 而是房东不卖了

兴趣知识
2026-10-04 05:30:44
也门政府军称收复红海港口城市穆哈

也门政府军称收复红海港口城市穆哈

界面新闻
2026-10-06 06:59:25
外交部:美方应慎重处理台湾问题

外交部:美方应慎重处理台湾问题

环球网资讯
2026-10-06 20:11:06
10月登场!全新腾势N8实力对比竞品,纯电续航1003km,真的香吗?

10月登场!全新腾势N8实力对比竞品,纯电续航1003km,真的香吗?

隔壁说车老王
2026-10-06 07:51:12
消息称DeepSeek接近完成至少800亿元融资,腾讯、宁德时代重金参与

消息称DeepSeek接近完成至少800亿元融资,腾讯、宁德时代重金参与

IT之家
2026-10-06 14:46:39
2026-10-07 00:36:49
量子位 incentive-icons
量子位
追踪人工智能动态
13442文章数 176578关注度
往期回顾 全部

科技要闻

物理学奖揭晓!一位天体物理科学家独享

头条要闻

婚宴14道主菜上错7道 新郎父亲:亲友说菜太差 没面子

头条要闻

婚宴14道主菜上错7道 新郎父亲:亲友说菜太差 没面子

体育要闻

30天30队·雄鹿:没有扬尼斯,重新试错吧

娱乐要闻

身家千万独居的王曼昱,私底下有多壕

财经要闻

杨植麟断腕:Kimi的至暗时刻与远征

汽车要闻

智能化再提升 2027款东风标致、东风雪铁龙新车更人性化了

态度原创

游戏
艺术
健康
数码
军事航空

临时工!PS两款3A大作免费领

艺术要闻

等了20年!李祖原操刀“高雄之门”,正式动工

刷酸祛痘,为什么有人翻车?

数码要闻

穷人救星!AMD锐龙5 5600X3D暴降至1072元:成最便宜X3D处理器

军事要闻

也门政府军称收复红海港口城市穆哈

无障碍浏览 进入关怀版