网易首页 > 网易号 > 正文 申请入驻

大模型、机器人之外,社会智能补上AGI第三极

0
分享至

机器之心发布


是时候讨论一下 AI 的 “第三极”——社会智能了。

当前人工智能已形成两大成熟版图:以 GPT-5.5、DeepSeek 为代表的符号空间智能,擅长语言理解、逻辑推理与代码生成;以及以具身机器人为代表的物理空间智能,擅长感知、行动与环境控制。符号空间智能拼的是 "智商",物理空间智能拼的是 "行动力",两条赛道已跑出明确的技术路径。

2026 年 WAIC 上,2024 年图灵奖得主、强化学习之父理查德・萨顿宣告,AI 正从 "人类数据时代" 迈入 "经验时代"—— 智能体不能只会消化人类留下的二手数据,必须通过与真实世界的持续交互生成属于自己的经验。

可问题来了:萨顿所说的 “经验”,到底从何而来?它真的只靠个体与物理世界的碰撞就能生成吗?

最近,知境团队提出了一种看法。他们认为,经验不是真空发生的,它发生在社会关系里,发生在 "我知道你知道我知道" 的递归信念中,发生在读懂一个眼神、推断一次未说出口的意图之中。

换句话说,真正完整的经验智能,离不开社会心智。理解信念、推断意图、感知情绪、权衡规范的能力 —— 社会智能 —— 正是AGI 长期缺失的第三极。

知境团队来自中国科学院计算技术研究所智能算法安全全国重点实验室。他们的目标是为现有大模型补上 “理解人心” 的能力,让 AI 在面对复杂社会情境时更有情商、更可信、更值得托付。他们真正想探索的是:社会心智能不能像语言理解、代码生成一样,被定义为一种可以持续测量、训练和改进的工程能力?

为实现这一目标,他们近期发布了知境社会心智大模型技术体系。该体系涵盖评测基准 SoMBench、多参数版本社会心智模型 Zing和智能体部署框架 Actio。



  • GitHub 链接:https://github.com/Zhijing-AI/Zing (评测基准、模型权重等后续将陆续开源)
  • 技术报告:https://arxiv.org/abs/2607.23740

SoMBench 建立了能力坐标系,把 "懂不懂人" 分解为可定位的认知缺口;Zing 依据诊断结果组织自适应训练,让社会推理从依赖提示词的临时行为,转化为模型参数中的稳定能力;Actio 则通过技能、心智状态、经验和社会知识的动态组织,为部署提供可选择、可检查的支持。这是一条贯通 "评测 — 内化 — 行动" 的完整技术链路。

三者共同指向一条技术路径:社会智能不再只是模型表现出来的一种模糊 "情商",而开始成为具有评测工具、训练方法和运行时接口的工程对象。这正是让大模型从 “能说会道” 走向 “值得托付” 的关键一步。

在 5 项国际权威社会心智评测基准上,多模态模型Zing-27B 综合均值超越 GPT-5.5;文本模型Zing-32B 与 DeepSeek-V4-Pro 水平相当;轻量级模型 Zing-8B/14B 则以极小参数量,在高阶信念推理基准 HiToM 上超越参数量为其数十倍的基线模型。

知境社会心智大模型技术体系

SoMBench:社会心智 “体检系统”

SoMBench 围绕心智表征、社会交互和规范内化三大能力构建,覆盖 17 个二级维度、71 项细粒度任务,包含 3,481 道经 15 名专家评审、87% 严格保留的实例。通过多题型交叉验证、选项扰动、捷径检测等手段,SoMBench 不仅给出分数,还精准定位模型的错误模式,为后续训练指明方向。

在 20 个顶级模型的测试中,最强模型正确率仅 72.08%,17 个次级维度无一达到 90% 天花板。这意味着即便是最先进的大模型,在系统性的社会心智评测中仍有近三成的能力缺口。SoMBench作为最新的社会心智评测基准,当前主流模型仍有较大提升空间,也为下一步迭代指明了重点方向。



知境・SoMBench 评测维度指标分类体系图

Zing:训练目标随能力一起进化

Zing 没有采用 "固定题库、固定损失函数" 的传统训练方式,而是构建了一套会 "自我进化" 的训练系统。当模型在诊断集上暴露短板时,FLARE 数据飞轮定位到具体认知维度,针对性合成全新的训练样本 —— 语义、场景、推理路径都与原题不同,但瞄准同一种能力缺陷。FLARE 的诊断集与评测集严格隔离,评测集在开发全流程中完全冻结,不参与任何数据合成或训练。

训练分两阶段推进:第一阶段建立通用社会心智基础,采用 Mixed-Reward GRPO 强化学习框架,动态组合过程奖励与可验证奖励;第二阶段针对情绪理解、意图推断、社会规范、视角采择等专项能力进行强化。OPD 在线蒸馏则在强化学习过程中引入教师模型的 token 级分布约束,防止模型在探索更优路径时偏离已验证的有效推理模式。

FLARE 解决 "学什么",两阶段训练安排 "什么时候学",OPD 负责 "向谁学、不忘什么"——Zing 构建的是一套随模型能力状态持续自适应的进化系统。



知境·Zing 训练流程概览图

Actio:让部署按需调用

Actio 以 Harness 为统一编排核心,根据任务心智变量和推理需求,选择性激活四类支撑模块:PRISM 提供 76 项分层心理与社交技能;Starling Memory 显式记录 "谁、何时、相信什么";SAGE 沉淀跨任务可复用推理经验;Gated RAG 按需检索社会文化知识。



知境・Actio 系统总览图

评测验证:Zing 系列模型多维性能超越

Zing-27B 多模态模型综合均值超越 GPT-5.5

在 5 项国际权威社会心智评测基准上,多模态模型 Zing-27B 综合均值达到 79.80,超越 GPT-5.5 的 78.44。



知境・Zing 在 5 项社会心智能力评测中的性能对比表

其中,HiToM 评测的是 "我知道你知道我知道" 的递归信念追踪能力,阶数越高难度指数级增长。Zing-27B 以 82.00 超越 GPT-5.5 的 77.92,成为首个在该基准上超越 GPT-5.5 的百亿参数规模公开模型。

Zing-32B 文本模型比肩 DeepSeek-V4-Pro

文本模型 Zing-32B 在 5 项基准综合均值上达到 76.14,与 DeepSeek-V4-Pro 的 75.90 水平相当。

在 EmoBench 情感推理基准上,Zing-32B 以 77.25 大幅领先 DeepSeek-V4-Pro 的 71.88,差距达 5.37 个百分点。这表明知境的专项社会心智训练在情感理解维度上形成了显著优势。

Zing-8B/14B 以小博大,高阶心智超越数十倍参数规模大模型

在高阶信念推理基准 HiToM 上,Zing-8B 与 Zing-14B 以极小参数量实现了对数十倍规模基线模型的超越。



递归阶数越高,难度呈指数级增长。Zing-8B 在三阶信念推理上达到 67.50%(基线 45.83%),四阶达到 65.83%(基线 43.75%),分别提升 21.67 和 22.08 个百分点。

这证明了社会智能的提升来自训练方法的结构化,而非参数的单纯放大。

社会心智如何给AI赋能

知境的社会心智能力,未来可探索三个真实世界的延伸方向。

赋能一:让机器人从 "能动手" 到 "能动心"。当前机器人能端茶倒水,但读不懂意图。知境 8B/14B 小模型可嵌入端侧,让机器人推断 "主人皱眉是茶太烫还是心情不好"。家庭看护、协作陪伴等场景,未来可期。

赋能二:让复杂决策从 "拍脑袋" 到 "先彩排"。复杂决策的代价往往不是算错数,而是算漏了人心。知境能力未来可应用于商业决策、团队协作等推演 —— 不是预测未来,是帮决策者在行动前,提前看见不同选择可能引发的连锁影响。就像彩排,先推演一遍,再上场。

赋能三:让多智能体从 "各说各话" 到 "同频共振"。 人类、机器人、AI Agent 协作时,最大风险是 "你以为我懂了,我以为你懂了"。知境框架未来可提供统一心智状态协议,让不同智能体在同一社会认知坐标系下协作 —— 不是简单的信息同步,是 "我知道你知道我知道" 的递归共识。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
为啥现在满大街都是零食店?网友:当某一时间同类型的店铺多起来的时候,别怀疑,就是在割韭菜

为啥现在满大街都是零食店?网友:当某一时间同类型的店铺多起来的时候,别怀疑,就是在割韭菜

解读热点事件
2026-07-29 00:05:09
张蓉芳现状:69岁享受退休生活,儿子早已成家,丈夫仍执四川女排

张蓉芳现状:69岁享受退休生活,儿子早已成家,丈夫仍执四川女排

混沌录
2026-07-11 22:03:06
CCTV16直播海港VS泰山!穆斯卡特验货唐田,李新翔冲击依木兰

CCTV16直播海港VS泰山!穆斯卡特验货唐田,李新翔冲击依木兰

刀锋体育
2026-07-29 08:26:20
一位婆婆写给儿媳妇的信,看哭了无数人,真是太让人寒心了

一位婆婆写给儿媳妇的信,看哭了无数人,真是太让人寒心了

千秋文化
2026-07-18 19:02:42
炒股16年的峰哥,终于要亡命天涯了?

炒股16年的峰哥,终于要亡命天涯了?

游戏动力ATK
2026-07-27 23:39:24
菲律宾变天?杜特尔特接班人浮现,对华态度曝光,马科斯坐不住了

菲律宾变天?杜特尔特接班人浮现,对华态度曝光,马科斯坐不住了

领悟看世界
2026-07-29 00:47:20
NBA巨星杜兰特,被一个1米97的土耳其女排姑娘迷得神魂颠倒,整日在社交平台上追着点赞

NBA巨星杜兰特,被一个1米97的土耳其女排姑娘迷得神魂颠倒,整日在社交平台上追着点赞

语妍视频剪辑
2026-07-29 11:23:12
资本主义太可怕了!德国工厂每星期要工作 5 天,一天要干 5 个小时

资本主义太可怕了!德国工厂每星期要工作 5 天,一天要干 5 个小时

蜉蝣说
2026-07-23 10:00:08
弹劾3周拿不下16票!莎拉公开下战书:绝不辞职,马科斯有本事把我踢走!

弹劾3周拿不下16票!莎拉公开下战书:绝不辞职,马科斯有本事把我踢走!

叮当当科技
2026-07-29 12:10:58
朝鲜去年对华贸易占比高达98.2%

朝鲜去年对华贸易占比高达98.2%

俄罗斯卫星通讯社
2026-07-29 15:14:01
难以置信!必胜客一女子打1小时免提电话,指挥业务员干活,引发争议

难以置信!必胜客一女子打1小时免提电话,指挥业务员干活,引发争议

火山詩话
2026-07-29 10:31:37
从1打到5!历史唯一!!

从1打到5!历史唯一!!

柚子说球
2026-07-28 13:31:06
父亲晒200万海归女儿,放话啥男孩才配,网友一句话戳破残酷现实

父亲晒200万海归女儿,放话啥男孩才配,网友一句话戳破残酷现实

阿郎娱乐
2026-07-22 09:58:39
33岁女研究生被配冥婚,警方赶到时女子已合葬,开棺后众人都愣了

33岁女研究生被配冥婚,警方赶到时女子已合葬,开棺后众人都愣了

千秋文化
2026-06-25 20:19:47
嫁给沙溢连生2娃,如今现身法国种植园,50岁身材苗条仍似少女

嫁给沙溢连生2娃,如今现身法国种植园,50岁身材苗条仍似少女

兵卒史
2026-07-29 17:45:29
晚饭是补蛋白黄金期!建议中老年人:吃5款高蛋白晚餐,增强免疫

晚饭是补蛋白黄金期!建议中老年人:吃5款高蛋白晚餐,增强免疫

白米饭怎么吃
2026-07-08 17:11:03
荡秋千的女神:那不是飞翔,是我在摆荡中重新确认自己的重心

荡秋千的女神:那不是飞翔,是我在摆荡中重新确认自己的重心

疾跑的小蜗牛
2026-07-29 17:00:26
商船抵达敖德萨前就挨导弹,多国抗议俄罗斯!北约连续三天击落俄无人机

商船抵达敖德萨前就挨导弹,多国抗议俄罗斯!北约连续三天击落俄无人机

鹰眼Defence
2026-07-27 17:19:30
联盟第1+历史第1!刚加盟76人就创2大纪录,难怪说全联盟都在等他

联盟第1+历史第1!刚加盟76人就创2大纪录,难怪说全联盟都在等他

小路看球
2026-07-29 15:59:36
随着特鲁姆普6-4,斯诺克上海大师赛八强已经诞生4席

随着特鲁姆普6-4,斯诺克上海大师赛八强已经诞生4席

侧身凌空斩
2026-07-28 22:48:57
2026-07-29 18:44:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13632文章数 142706关注度
往期回顾 全部

科技要闻

Kimi K3火爆,奥特曼:开源一定有一席之地

头条要闻

金正恩女儿"高调"亮相 且场合、形式和以往有所不同

头条要闻

金正恩女儿"高调"亮相 且场合、形式和以往有所不同

体育要闻

毫无存在感的NBA状元,最先谢谢惠顾?

娱乐要闻

55岁影帝黄政民出轨

财经要闻

天丝红牛多地检出成分不合格 企业申诉

汽车要闻

24K金LOGO,纯手工打磨腰线,第二代腾势D9暗夜鎏金高定色,一天只能造3台?

态度原创

亲子
家居
游戏
公开课
军事航空

亲子要闻

AI智能浪潮重塑母婴赛道,吸牛裤如何实现 “智能育儿”?

家居要闻

2026建博会(广州) 公装联探展交流活动

网易仙侠《剑心雕龙》首测总结 官方强调纯单机

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

美以领导人会晤后 伊朗发射多枚导弹突袭驻中东美军

无障碍浏览 进入关怀版