网易首页 > 网易号 > 正文 申请入驻

AI最尴尬的短板,中国科学院出手了

0
分享至

来源:市场资讯

(来源:量子位)

GPT-5.5能写专业论文,DeepSeek-V4-Pro能生成复杂代码,具身机器人能完成基础物理操作,语言智能和工具智能都已经跑出了自己的赛道。

但把同样的AI放进一次家庭聚餐、一场团队会议、一次医患对话,它往往表现得生硬、不合时宜。

不是知识不够,是“读懂人心”的能力还没跟上。这正是社会心智长期缺失带来的真实困境,也是从“任务执行”走向“社会协作”时必须补上的一课。

7月24日,中国科学院计算技术研究所智能算法安全全国重点实验室“知境”团队,正式发布知境社会心智大模型技术体系

这不是又一个大模型刷榜的故事,而是一份关于社会心智如何成为独立工程能力的完整答卷。

知境要做的,正是为现有大模型补上这块短板——给模型增加“情商”与可信任感,让AI在关键场合靠得住、信得过。

治病之前先诊断。知境团队做的第一件事,是建立一份足够精细的“体检表”SoMBench

SoMBench把笼统的“懂不懂人”拆解成3大一级维度、17个二级维度、71项细粒度任务,覆盖从基础信念推断到高阶情绪理解、从社会规范到关系建模的完整光谱。


3481道经过十余名人类专家评审、严格保留的实例,构成了一张社会心智的“能力地图”。

更重要的是,SoMBench不仅会告诉你“考了多少分”,还告诉你“错在了哪”。

通过单选、多选、判断、开放题的多题型交叉验证,以及选项扰动、捷径检测、受控改写等手段,SoMBench能精准定位模型的错误模式,例如:是推理链断了?还是靠表面模式蒙对了?这为后续的训练指明了靶子。

20个顶级大模型在SoMBench上测试,最强模型正确率仅72.08%,无一达到90%天花板,社会心智的“无人区”,名副其实。

为什么社会心智这么难?

因为同一场景里,AI要同时处理角色关系、隐含意图、情绪变化、社会规范、未说出口的话等多层推理——普通大模型根本理不清这些弯弯绕绕。


体检表有了,接下来怎么练?

知境团队没有走“堆数据、堆算力”的老路,而是设计了一套会“自我进化”的训练系统

密码一:FLARE数据飞轮——错题本比课本更重要

传统训练是“准备一批数据,训完拉倒”。

Zing的做法是让评测像导航仪一样指出方向,而不是直接“透题”。

当模型在诊断集上暴露短板时,FLARE会定位到具体认知维度,再针对性合成全新的训练样本——语义、场景、推理路径都与原题不同,但瞄准同一种能力缺陷。

这就好比发现学生几何薄弱,就出套新几何题,而不是反复做同一张卷子。

候选样本还须经过多轮过滤,只保留模型当前无法轻易答对、但经过推理能够学会的中高难度样本。

这就是FLARE的核心逻辑:哪里弱就练哪里,但每次练的都是新题


密码二:两阶段训练——先“通识”,再“专精”

第一阶段:通用社会心智打底

模型首先利用多教师蒸馏构建高质量冷启动数据,通过答案门控、推理深度过滤保留有效推理轨迹;

随后采用Mixed-Reward GRPO强化学习框架,根据任务类型、训练阶段和推理质量,动态组合过程奖励、可验证奖励和拒绝采样——奖励目标随模型能力变化而调整,不是一成不变的KPI

第二阶段:专项能力强化

针对情绪理解、意图推断、社会规范、视角采择等薄弱环节,先用两轮监督微调注入领域知识,再用困难样本持续校准。

目标是:增强专项能力的同时,不丢失已学会的通用推理。

密码三:OPD在线蒸馏——边学新招,边不忘老本

强化学习最大的风险是“学新的,忘旧的”。

Zing的解决方案是OPD(On-Policy Distillation):在在线轨迹上引入教师模型的token级分布约束,让学生模型在探索更优路径的同时,不偏离已验证的有效推理模式。

GRPO负责“往前冲”,OPD负责“别跑偏”。

两者作用于同一批采样轨迹,既鼓励探索,也守住边界

FLARE决定“学什么”,两阶段训练决定“什么时候学”,OPD决定“向谁学、不忘什么”。

Zing构建的不是一个静态训练流程,而是一套随模型能力状态持续自适应的进化系统

训练方法再漂亮,最终要拿成绩说话。在5项国际权威社会心智评测基准上,Zing给出了硬核答案。


△知境·Zing在5项社会心智能力评测中的性能对比表

Zing-27B,多模态模型综合均值超越GPT-5.5

Zing-27B五项综合均值,超越GPT-5.5的

尤其在HiToM(+4.08pp)和EmoBench(+5.62pp)上优势明显。

HiToM评测的是“我知道你知道我知道”的递归信念追踪,阶数越高难度指数级增长——Zing-27B是首个在该基准上超越GPT-5.5的百亿参数级公开模型

Zing-32B,文本模型比肩DeepSeek-V4-Pro

Zing-32B综合均值,略超DeepSeek-V4-Pro的

EmoBench上78.13对71.88的6.25个百分点领先尤为突出,证明了专项社会心智训练在情感理解维度上能够形成显著的结构化优势。

Zing-8B/14B,小模型大心智

8B模型在HiToM上达到,14B模型达到,分别超越同尺寸基座模型近12和8个百分点,甚至超过参数量为其数十倍的更大模型。

递归阶数越高,差距越明显——Zing-8B在三阶和四阶信念推理上分别提升21.67和22.08个百分点。

这些结果指向同一个结论:社会心智能力的提升,来自训练方法的结构化设计,而非参数的简单堆砌。


△知境·Zing在高阶信念推理评测中的性能对比表

SoMBench作为知境自研的最难社会心智基准,当前模型仍有较大提升空间——这也正是下一步训练迭代的重点方向。

模型学会了,部署时怎么不掉链子?

知境的答案是Actio——一个“按需调用、不乱塞”的显式心智状态部署架构。


△知境·Actio系统总览图

真实交互场景中不缺信息,缺的是恰当的信息

Actio以Harness为统一编排核心,根据任务的心智变量和推理需求,选择性激活四类支撑:

一次典型推理经历四步:理解任务并识别心智需求 → 并行检索技能、知识与记忆 → 排序裁剪组合后引导推理 → 离线沉淀有效经验。

Actio像经验丰富的社工,知道什么时候该调用哪块能力——而不是把所有信息塞进同一段上下文。

这套机制的核心目标只有一个:让AI在真实场景中不仅“会想”,还能“做对”,配得上用户的托付。

具身智能——给机器人装“心眼”

物理AI解决“身体”的问题,社会心智AI解决“心眼”的问题。

知境的小参数模型(8B/14B)为端侧部署提供了可能,未来可探索家庭看护、儿童陪伴、协作机器人等需要实时社会推理的场景——让机器不仅会动,还懂得谁需要帮助、什么时候该安静、怎样表达才恰当。

复杂决策推演——重大选择的“预演沙盘”

在事关重大的决策场景中,理解“各方会怎么想、怎么做”往往比算清账目更重要。

知境的社会心智能力未来可应用于政策沟通、危机管理、组织变革等领域的推演,能够帮助决策者在行动前,提前看见不同选择可能引发的连锁反应。

人机共生——统一心智协议

当多个智能体(人类、机器人、AI Agent)需要长期协作时,最大的风险不是能力不足,而是“你以为我懂了,我以为你懂了”的认知错位。

知境的社会心智建模框架,未来可为多智能体系统提供统一的心智状态表达与共享协议,让不同的智能体在同一个社会认知坐标系下协作。

一条新赛道,已经铺好了

知境团队真正想回答的问题是:

三者共同指向一条技术路线:社会智能不再只是模型表现出来的一种模糊“情商”,而开始成为具有评测工具、训练方法和运行时接口的工程对象。

当然,这条路才刚刚开始。

训练收益能否跨任务、跨文化迁移,Actio能否在长期真实交互中保持稳定与合宜,仍需要更广泛的验证。

但至少,“懂人心”这件事,终于从玄学走向了系统工程。

符号空间拼智商,物理空间拼行动力,心智空间拼的是“读空气”的能力,这是AI赢得人类信任的关键一跃。

语言智能之后,社会智能正在成为通用人工智能的下一个核心赛道。

知境为这条赛道,提供了从评测到训练到部署的完整工程基础。

知境团队 中国科学院计算技术研究所智能算法安全全国重点实验室

GitHub:https://github.com/Zhijing-AI/Zing (评测基准、模型权重等后续将陆续开源)项目技术报告:https://zhijing-ai.github.io/Zing/Zing_TechReport.pdf

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
0比11,拒绝握手+拳打脚踢!14岁乒乓少年的体育精神,碎了一地

0比11,拒绝握手+拳打脚踢!14岁乒乓少年的体育精神,碎了一地

曹老师评球
2026-07-28 23:53:59
社保十年大倒查全面落地!花钱补缴、挂靠参保,这些人全都躲不掉

社保十年大倒查全面落地!花钱补缴、挂靠参保,这些人全都躲不掉

白米饭怎么吃
2026-07-27 08:35:20
“00后”上位,董事会全票通过,李慕牧成上市公司副总

“00后”上位,董事会全票通过,李慕牧成上市公司副总

红星新闻
2026-07-28 18:10:30
美国高管一家8口灭门案曝婚姻内幕!两名中国养女刚随妈妈回国寻根

美国高管一家8口灭门案曝婚姻内幕!两名中国养女刚随妈妈回国寻根

北美省钱快报
2026-07-29 01:39:36
难怪遗产一分不要,73岁迟重瑞现状曝光,原来他和coco是一类人

难怪遗产一分不要,73岁迟重瑞现状曝光,原来他和coco是一类人

冰语历史
2026-07-29 03:47:49
医院因一级甲等医疗事故致患者死亡 涉事医生“卡点考证”被质疑违规

医院因一级甲等医疗事故致患者死亡 涉事医生“卡点考证”被质疑违规

封面新闻
2026-07-28 17:58:30
炮制张氏叔侄十年冤狱,女神探聂海芬,民众为何强烈要求从严追责

炮制张氏叔侄十年冤狱,女神探聂海芬,民众为何强烈要求从严追责

原广工业
2026-07-18 11:06:26
中方打破多年外交惯例,王毅不出席中日韩外长会传递清晰态度

中方打破多年外交惯例,王毅不出席中日韩外长会传递清晰态度

阿器谈史
2026-07-28 15:41:53
爱弓凉 | “最强”G灯高挑熟女,魅力十足且风韵犹存的老A8

爱弓凉 | “最强”G灯高挑熟女,魅力十足且风韵犹存的老A8

吃瓜党二号头目
2026-07-25 10:10:42
武汉大学口腔医院:当事医生已停诊配合调查

武汉大学口腔医院:当事医生已停诊配合调查

南方都市报
2026-07-28 13:17:51
刚刚,西安交警发布通告:停运!

刚刚,西安交警发布通告:停运!

91.6陕西交通广播
2026-07-28 22:41:06
全球爆发粮食战争,各国停止向中国出口粮食,14亿人会挨饿吗?

全球爆发粮食战争,各国停止向中国出口粮食,14亿人会挨饿吗?

聪先生
2026-07-28 13:57:08
谢贤去世的前一天,前女友CoCo竟然说:谢贤就是她最值钱入场券

谢贤去世的前一天,前女友CoCo竟然说:谢贤就是她最值钱入场券

草莓解说体育
2026-07-29 01:03:58
难以置信!江苏一女子哭诉,我只是想跟一个老司机学习开网约车,他竟然想找我开房

难以置信!江苏一女子哭诉,我只是想跟一个老司机学习开网约车,他竟然想找我开房

火山詩话
2026-07-28 07:21:35
1949年,钱穆只问了一句话,便决定南下

1949年,钱穆只问了一句话,便决定南下

熊倌儿
2026-07-28 23:45:39
4-1!穆里尼奥回归皇马首场大胜 巴尔韦德破门 马斯坦托诺建功

4-1!穆里尼奥回归皇马首场大胜 巴尔韦德破门 马斯坦托诺建功

念洲
2026-07-29 06:41:22
菲等来外援,美航母驶入南海,10艘055齐出!携2000发导弹亮剑

菲等来外援,美航母驶入南海,10艘055齐出!携2000发导弹亮剑

董董历史烩
2026-07-28 06:34:33
全美直播暴跌65%,市值蒸发1.6亿 詹姆斯400万撕碎洛杉矶豪门底裤

全美直播暴跌65%,市值蒸发1.6亿 詹姆斯400万撕碎洛杉矶豪门底裤

冷桂零落
2026-07-28 13:25:02
关于王虹留学推荐信、保研等传闻,专访北大数院知情人士

关于王虹留学推荐信、保研等传闻,专访北大数院知情人士

新京报
2026-07-28 20:12:41
70万年薪逼宫!徐杰离队只为顶薪,宏远旧将扎堆野球,王洪泽暖心宠粉

70万年薪逼宫!徐杰离队只为顶薪,宏远旧将扎堆野球,王洪泽暖心宠粉

生活新鲜市
2026-07-29 04:01:14
2026-07-29 07:15:00
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4242663文章数 9076关注度
往期回顾 全部

科技要闻

Kimi K3开放权重,想本地部署,200万元起

头条要闻

博主"听泉赏宝"炒股亏光父母积蓄遭拉黑 称"再玩剁手"

头条要闻

博主"听泉赏宝"炒股亏光父母积蓄遭拉黑 称"再玩剁手"

体育要闻

35岁德甲球星,退役半年后成了一名农民

娱乐要闻

43岁演员王凯去世!独居公寓无人知晓

财经要闻

潘老板的算盘全砸了,欠的25亿跑不了了

汽车要闻

宾利托卡尔重塑百年菱形美学,将于9月全球首秀

态度原创

房产
数码
亲子
教育
公开课

房产要闻

拿下百亩宅地!又一河北民企,重仓海南!

数码要闻

德商德静界推出带屏水冷新品,2.1寸圆屏可自定义

亲子要闻

看看韩国欧巴照顾人的功力怎样? 可以不带娃的一周

教育要闻

鼓楼前200=栖霞前10?家长得知在一个班,心态崩了...

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版