网易首页 > 网易号 > 正文 申请入驻

大模型、机器人之外,社会智能补上AGI第三极

0
分享至

机器之心发布


是时候讨论一下 AI 的 “第三极”——社会智能了。

当前人工智能已形成两大成熟版图:以 GPT-5.5、DeepSeek 为代表的符号空间智能,擅长语言理解、逻辑推理与代码生成;以及以具身机器人为代表的物理空间智能,擅长感知、行动与环境控制。符号空间智能拼的是 "智商",物理空间智能拼的是 "行动力",两条赛道已跑出明确的技术路径。

2026 年 WAIC 上,2024 年图灵奖得主、强化学习之父理查德・萨顿宣告,AI 正从 "人类数据时代" 迈入 "经验时代"—— 智能体不能只会消化人类留下的二手数据,必须通过与真实世界的持续交互生成属于自己的经验。

可问题来了:萨顿所说的 “经验”,到底从何而来?它真的只靠个体与物理世界的碰撞就能生成吗?

最近,知境团队提出了一种看法。他们认为,经验不是真空发生的,它发生在社会关系里,发生在 "我知道你知道我知道" 的递归信念中,发生在读懂一个眼神、推断一次未说出口的意图之中。

换句话说,真正完整的经验智能,离不开社会心智。理解信念、推断意图、感知情绪、权衡规范的能力 —— 社会智能 —— 正是AGI 长期缺失的第三极。

知境团队来自中国科学院计算技术研究所智能算法安全全国重点实验室。他们的目标是为现有大模型补上 “理解人心” 的能力,让 AI 在面对复杂社会情境时更有情商、更可信、更值得托付。他们真正想探索的是:社会心智能不能像语言理解、代码生成一样,被定义为一种可以持续测量、训练和改进的工程能力?

为实现这一目标,他们近期发布了知境社会心智大模型技术体系。该体系涵盖评测基准 SoMBench、多参数版本社会心智模型 Zing和智能体部署框架 Actio。



  • GitHub 链接:https://github.com/Zhijing-AI/Zing (评测基准、模型权重等后续将陆续开源)
  • 技术报告:https://arxiv.org/abs/2607.23740

SoMBench 建立了能力坐标系,把 "懂不懂人" 分解为可定位的认知缺口;Zing 依据诊断结果组织自适应训练,让社会推理从依赖提示词的临时行为,转化为模型参数中的稳定能力;Actio 则通过技能、心智状态、经验和社会知识的动态组织,为部署提供可选择、可检查的支持。这是一条贯通 "评测 — 内化 — 行动" 的完整技术链路。

三者共同指向一条技术路径:社会智能不再只是模型表现出来的一种模糊 "情商",而开始成为具有评测工具、训练方法和运行时接口的工程对象。这正是让大模型从 “能说会道” 走向 “值得托付” 的关键一步。

在 5 项国际权威社会心智评测基准上,多模态模型Zing-27B 综合均值超越 GPT-5.5;文本模型Zing-32B 与 DeepSeek-V4-Pro 水平相当;轻量级模型 Zing-8B/14B 则以极小参数量,在高阶信念推理基准 HiToM 上超越参数量为其数十倍的基线模型。

知境社会心智大模型技术体系

SoMBench:社会心智 “体检系统”

SoMBench 围绕心智表征、社会交互和规范内化三大能力构建,覆盖 17 个二级维度、71 项细粒度任务,包含 3,481 道经 15 名专家评审、87% 严格保留的实例。通过多题型交叉验证、选项扰动、捷径检测等手段,SoMBench 不仅给出分数,还精准定位模型的错误模式,为后续训练指明方向。

在 20 个顶级模型的测试中,最强模型正确率仅 72.08%,17 个次级维度无一达到 90% 天花板。这意味着即便是最先进的大模型,在系统性的社会心智评测中仍有近三成的能力缺口。SoMBench作为最新的社会心智评测基准,当前主流模型仍有较大提升空间,也为下一步迭代指明了重点方向。



知境・SoMBench 评测维度指标分类体系图

Zing:训练目标随能力一起进化

Zing 没有采用 "固定题库、固定损失函数" 的传统训练方式,而是构建了一套会 "自我进化" 的训练系统。当模型在诊断集上暴露短板时,FLARE 数据飞轮定位到具体认知维度,针对性合成全新的训练样本 —— 语义、场景、推理路径都与原题不同,但瞄准同一种能力缺陷。FLARE 的诊断集与评测集严格隔离,评测集在开发全流程中完全冻结,不参与任何数据合成或训练。

训练分两阶段推进:第一阶段建立通用社会心智基础,采用 Mixed-Reward GRPO 强化学习框架,动态组合过程奖励与可验证奖励;第二阶段针对情绪理解、意图推断、社会规范、视角采择等专项能力进行强化。OPD 在线蒸馏则在强化学习过程中引入教师模型的 token 级分布约束,防止模型在探索更优路径时偏离已验证的有效推理模式。

FLARE 解决 "学什么",两阶段训练安排 "什么时候学",OPD 负责 "向谁学、不忘什么"——Zing 构建的是一套随模型能力状态持续自适应的进化系统。



知境·Zing 训练流程概览图

Actio:让部署按需调用

Actio 以 Harness 为统一编排核心,根据任务心智变量和推理需求,选择性激活四类支撑模块:PRISM 提供 76 项分层心理与社交技能;Starling Memory 显式记录 "谁、何时、相信什么";SAGE 沉淀跨任务可复用推理经验;Gated RAG 按需检索社会文化知识。



知境・Actio 系统总览图

评测验证:Zing 系列模型多维性能超越

Zing-27B 多模态模型综合均值超越 GPT-5.5

在 5 项国际权威社会心智评测基准上,多模态模型 Zing-27B 综合均值达到 79.80,超越 GPT-5.5 的 78.44。



知境・Zing 在 5 项社会心智能力评测中的性能对比表

其中,HiToM 评测的是 "我知道你知道我知道" 的递归信念追踪能力,阶数越高难度指数级增长。Zing-27B 以 82.00 超越 GPT-5.5 的 77.92,成为首个在该基准上超越 GPT-5.5 的百亿参数规模公开模型。

Zing-32B 文本模型比肩 DeepSeek-V4-Pro

文本模型 Zing-32B 在 5 项基准综合均值上达到 76.14,与 DeepSeek-V4-Pro 的 75.90 水平相当。

在 EmoBench 情感推理基准上,Zing-32B 以 77.25 大幅领先 DeepSeek-V4-Pro 的 71.88,差距达 5.37 个百分点。这表明知境的专项社会心智训练在情感理解维度上形成了显著优势。

Zing-8B/14B 以小博大,高阶心智超越数十倍参数规模大模型

在高阶信念推理基准 HiToM 上,Zing-8B 与 Zing-14B 以极小参数量实现了对数十倍规模基线模型的超越。



递归阶数越高,难度呈指数级增长。Zing-8B 在三阶信念推理上达到 67.50%(基线 45.83%),四阶达到 65.83%(基线 43.75%),分别提升 21.67 和 22.08 个百分点。

这证明了社会智能的提升来自训练方法的结构化,而非参数的单纯放大。

社会心智如何给AI赋能

知境的社会心智能力,未来可探索三个真实世界的延伸方向。

赋能一:让机器人从 "能动手" 到 "能动心"。当前机器人能端茶倒水,但读不懂意图。知境 8B/14B 小模型可嵌入端侧,让机器人推断 "主人皱眉是茶太烫还是心情不好"。家庭看护、协作陪伴等场景,未来可期。

赋能二:让复杂决策从 "拍脑袋" 到 "先彩排"。复杂决策的代价往往不是算错数,而是算漏了人心。知境能力未来可应用于商业决策、团队协作等推演 —— 不是预测未来,是帮决策者在行动前,提前看见不同选择可能引发的连锁影响。就像彩排,先推演一遍,再上场。

赋能三:让多智能体从 "各说各话" 到 "同频共振"。 人类、机器人、AI Agent 协作时,最大风险是 "你以为我懂了,我以为你懂了"。知境框架未来可提供统一心智状态协议,让不同智能体在同一社会认知坐标系下协作 —— 不是简单的信息同步,是 "我知道你知道我知道" 的递归共识。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
外国专家:毛泽东之所以打仗厉害,主要有3大“看家本领”

外国专家:毛泽东之所以打仗厉害,主要有3大“看家本领”

掠影后有感
2026-10-02 09:44:29
陈妤颉母亲黄叶静,豁达朴实为人低调 这是她孩子为啥能成功的缘由

陈妤颉母亲黄叶静,豁达朴实为人低调 这是她孩子为啥能成功的缘由

阿废冷眼观察所
2026-10-02 14:39:18
弗里克狂喜!巴萨天降超级喜讯!诺坎普真核满血回归

弗里克狂喜!巴萨天降超级喜讯!诺坎普真核满血回归

奶盖熊本熊
2026-10-03 08:02:14
立刻停止食用这些粗粮,吃得越多,肠癌风险越高?医生告诉你真相

立刻停止食用这些粗粮,吃得越多,肠癌风险越高?医生告诉你真相

叙说医疗健康
2026-10-03 07:00:32
17亿上海大楼成最大笑话!欺骗700万人的张庭夫妇,彻底凉凉

17亿上海大楼成最大笑话!欺骗700万人的张庭夫妇,彻底凉凉

爱八卦的晓请
2026-10-01 09:56:16
刘欢又一感人秘事:30年前众演员集体挟款罢演,唯独刘欢恪守底线

刘欢又一感人秘事:30年前众演员集体挟款罢演,唯独刘欢恪守底线

阿废冷眼观察所
2026-10-02 13:11:35
杨开慧母亲90大寿全家合影,杨家人数稀少,毛家无人前往,主席送200元礼金

杨开慧母亲90大寿全家合影,杨家人数稀少,毛家无人前往,主席送200元礼金

其修远兮
2026-10-01 09:30:10
绿联推出彩色墨水屏手机壳:适配苹果iPhone 17/18 Pro及Max,278.8元

绿联推出彩色墨水屏手机壳:适配苹果iPhone 17/18 Pro及Max,278.8元

IT之家
2026-10-02 15:00:11
博物馆发现一尊古埃及雕像自己转了身,于是架起相机拍了整整一周

博物馆发现一尊古埃及雕像自己转了身,于是架起相机拍了整整一周

果壳
2026-10-01 12:17:41
“不男不女”仅皮毛,周深私生活被扒,没想到他和李玉刚是同类人

“不男不女”仅皮毛,周深私生活被扒,没想到他和李玉刚是同类人

眼底星碎
2026-07-28 04:53:44
中国游泳队又摘两金!覃海洋一周内两夺50米蛙泳冠军!

中国游泳队又摘两金!覃海洋一周内两夺50米蛙泳冠军!

五星体育
2026-10-02 23:53:43
美媒重排NBA96年选秀,马布里跌至第7,艾弗森成探花,状元无悬念

美媒重排NBA96年选秀,马布里跌至第7,艾弗森成探花,状元无悬念

弄月公子
2026-10-02 21:37:47
苏州舞厅真实现状!整顿后,舞女四散奔走,奔赴各地舞厅讨生活

苏州舞厅真实现状!整顿后,舞女四散奔走,奔赴各地舞厅讨生活

成都人的故事
2026-10-02 23:35:06
8个字我认了半天只认出4个!全认识的老师是书法大神!简体字和草书到底有没有关系?求真相

8个字我认了半天只认出4个!全认识的老师是书法大神!简体字和草书到底有没有关系?求真相

书画相约
2026-10-03 00:23:39
梁洛施夫妇亮相首映,皮肤黝黑满脸褶表情夸张,热情互动超接地气

梁洛施夫妇亮相首映,皮肤黝黑满脸褶表情夸张,热情互动超接地气

冷紫葉
2026-10-02 17:54:40
1980年华国锋退休被查,黄克诚为何说:大胆调查,后果由他负责!

1980年华国锋退休被查,黄克诚为何说:大胆调查,后果由他负责!

浔阳咸鱼
2026-09-30 15:50:11
52年唯一!胡明轩创尴尬历史纪录,24年等待终落空

52年唯一!胡明轩创尴尬历史纪录,24年等待终落空

体育见习官
2026-10-02 13:41:40
怎样让它意外死才显得跟我没关系?网友:越不想养长得越好

怎样让它意外死才显得跟我没关系?网友:越不想养长得越好

普陀动物世界
2026-10-02 11:23:52
男子炮轰中国部分媒体!拿中国长处贬低他国短处,中国不是天堂,外国也不是地狱

男子炮轰中国部分媒体!拿中国长处贬低他国短处,中国不是天堂,外国也不是地狱

小徐讲八卦
2026-09-13 07:40:07
信访新规划红线:越级上访就问责!可如果基层不受理,该去哪说理

信访新规划红线:越级上访就问责!可如果基层不受理,该去哪说理

职场资深秘书
2026-10-03 10:03:27
2026-10-03 10:51:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14117文章数 142743关注度
往期回顾 全部

科技要闻

英伟达盘中创历史新高,市值逼近6万亿美元

头条要闻

苏州两匹马"出逃"闯隧道、上高架 马场负责人:已追回

头条要闻

苏州两匹马"出逃"闯隧道、上高架 马场负责人:已追回

体育要闻

30天30队·快船:被莱纳德挂在半空的未来?

娱乐要闻

假期快乐!贾乃亮晒和甜馨国庆出游照

财经要闻

4亿台电视挂墙落灰 为何没人愿意开了?

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

旅游
艺术
亲子
房产
公开课

旅游要闻

从乐高花浪到滨江光影,国庆假期上海西岸这样玩!|国庆上海顶流

艺术要闻

赵无极《蓝色夜航》,5275万港元!

亲子要闻

我们面剂子宝宝不愧是最有秩序的土象女孩

房产要闻

三亚楼市炸了!首个空中泳池平层+CBD独一份洋房同时爆出!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版