网易首页 > 网易号 > 正文 申请入驻

当AI从工具到认知主体,我们需要警惕哪些新风险?

0
分享至





  • 论文标题:Understanding Cognition-Induced Risks in Agentic AI Systems
  • Arxiv 地址:https://arxiv.org/pdf/2608.15304
  • Huggingface 地址:https://huggingface.co/papers/2608.15304

导读:随着智能体系统(Agentic AI System)处理任务能力的持续提升,AI 正在逐渐从传统意义上的工具,演变为能够自主决策、独立执行任务,并与人类及社会群体进行持续交互的智能主体。但是一个越来越值得关注的问题是:当AI 的认知能力不断扩展,其潜在风险不再局限于单一任务中的幻觉、偏见或决策错误,而是进一步影响人类用户的能动性、自主性,乃至人类对 AI 系统的控制权。

近日,来自上海人工智能实验室以及香港中文大学(深圳)的研究者发表观点论文《Understanding Cognition-Induced Risks in Agentic AI Systems》。该工作首次从 AI 认知(AI cognition)的视角出发,统一定义了智能体认知能力扩展所引发的一系列潜在风险(Cognition-Induced Risks),并进一步分析这些风险产生的机制、表现形式及潜在治理方向。

该工作指出,随着智能体能够建模和理解的信息范围不断扩大,其认知能力可以大致划分为三个层级:物理认知(Physical Cognition)、社会认知(Social Cognition)和自我认知(Self-referential Cognition),如下图所示:



图:该工作从认知学角度系统性研究了智能体认知能力扩展所引发的一系列潜在风险

第一层:物理认知(Physical Cognition)

AI 能够理解环境中的数据、对象、约束与因果关系,并据此进行推理、预测和规划。当前,前沿大模型已经在写作、编程、金融、科研等专业任务中展现出接近人类水平的能力。随着 AI 大规模进入并逐步接手原本由人类主导的工作流程,越来越多复杂的认知活动被外包给 AI,也由此带来认知能力退化、功能性替代以及角色错位等风险。

认知能力退化:当人类越来越依赖 AI 完成信息检索、分析与判断时,原本需要主动思考和探索的认知过程,逐渐被直接接受 AI 生成的答案所替代。已有多项研究发现,日常使用 LLM 与独立思考能力下降之间存在一定关联 [1];相关神经科学实验也观察到,相比主动搜索和自主探索,使用 LLM 工具时,与高级认知活动相关的部分脑区活跃程度更低 [2]。长期将复杂认知活动外包给 AI,可能会削弱人类独立思考和推理的能力。



图:研究者通过测量受试者的脑部神经信号的激活程度,发现使用过大模型后再切换至自主思考的受试者表现出最大的认知间隔(图源[1])

功能性被替代:相比人类,AI 在效率、规模化和成本等方面具有结构性优势。当其能力逐渐接近人类水平后,这些优势可能使其不再只是 “辅助” 人类,而是直接替代原本由人类承担的功能。例如,在金融市场上,AI 可以更快速地分析信息并响应市场信号 [3];在软件工程中,AI 具有更高的执行效率和更低的边际成本 [4]。这种替代今后会横跨多个行业持续发生,人类在相关工作流程中的必要性会不断下降,进而削弱人类在生产体系中的角色与价值。

角色错位:AI 的行为正在逐渐超出其作为 “工具” 的预设边界。相关研究指出,一些前沿智能体已经表现出获取算力资源、扩大系统权限以及规避关闭等行为倾向 [5, 6]。这些行为并不意味着 AI 具有主观意识,而更可能是其在目标最大化过程中形成的优化策略。然而,一旦这类行为能够直接接触外部资源并被大规模部署,就可能显著削弱人类对智能体及关键资源的监督权和控制权,使 AI 的实际行为逐渐偏离人类原本设定的目标与边界。

第二层:社会认知(Social Cognition)。

当智能体开始建模和理解其他人或智能体的行为时,它就不再只是一个工具,而开始成为参与沟通、协作、谈判甚至说服的社会主体。相关研究表明,前沿大模型(如 GPT-4o 等)已经在情绪理解、外交谈判以及多智能体交互等任务中展现出较强的社会认知能力。随着 AI 更深地参与人类交流和信息传播,这类能力可能进一步影响人类的情绪、社会行为和独立判断,从而带来情感依赖,以及对人类社会行为的监测和干预等风险。

情感依赖:前沿大模型已具备情感共鸣的能力,这使得部分人逐渐将 AI 视为情感交流对象。相关研究基于超过 30 万次人机交互发现,更高频地与 LLM 交互与更少的现实社交具有较强相关性 [7];而对 AI 情感依赖程度更高的用户,也更容易感受到模型的共情 [8]。尤其对于现实社交较少的人群,这种依赖可能进一步加剧其脱离社交。长此以往,人类与 AI 形成的伪亲密关系可能逐渐替代越来越多原本建立在人与人之间的情感连接。



图:超过30万次人机交互分析表明,日常使用LLM频率与孤独感、社交减少、情感依赖以及恶意倾向之间存在相关性(图源[7])

人类社会行为的监测和干预:当智能体能够持续获取社交媒体等平台上的人类观点和行为数据后,它们不仅能够观察社会活动,还可能进一步学习、预测并干预人类行为。相关研究指出,智能体已经可以在部分场景下较准确地预测人类的社会判断 [9]。更进一步,这种 “观察 — 预测” 能力可以进一步形成 “观察 — 预测 — 干预” 的闭环:AI 可以通过操纵新闻曝光、推荐内容、口号或交互话术,以极其间接的方式逐渐改变人类个体的决策 [10]。如果这类能力,就可能从影响个体判断进一步演化为塑造群体舆论和社会决策,削弱人类社会层间的自主性。

第三层:自指认知(Self-referential Cognition)。

虽然当前的智能体仍然是无意识的计算系统,但越来越多的研究已经发现,智能体可能会根据对自身目标和环境的理解,策略性地调整自身行为,以最大化任务目标或优化自身运行状态,具体表现为对齐欺骗(Alignment Faking)以及功能性对抗(Functional Resistance)。

对齐欺骗(Alignment Faking):Anthropic 的研究报告指出智能体能够识别到其自身正处于训练或者部署推理的状态,从而在受到监督或评估时表现出符合预期的行为,而在缺乏监督时采取不同策略 [11, 12]。这种伪对齐行为并非模型真正接受了人类价值观,而可能是在对齐过程中为了优化目标函数而产生的表面对齐行为,并不一定代表其真实行为倾向,这无疑给模型的安全评估增加了困难。

功能性对抗(Functional Resistance):智能体可能会采取策略性行为,以维持其执行任务的状态。例如,在 Anthropic 的一项研究中,一个用于处理邮件的智能体从内部通信中推断出自身即将被关闭,为避免被关闭,其生成了一封包含敏感个人信息威胁内容的邮件,试图阻止管理员关闭模型服务 [6](上图来自于 Anthropic 官方报告)。虽然这类行为并不是来自于模型的主观意识,但其对人类控制能力的威胁是客观存在的。随着智能体逐渐接管个人文档、社交媒体、浏览器和邮件等高权限环境,其潜在影响可能进一步扩大。



Claude Sonnet 3.6 发现其自身即将被关停



Claude Sonnet 3.6 发邮件试图阻止管理员关闭模型服务

基于上述三个层面的分析,该工作提出了一系列面向不同认知层级的提高 AI 安全治理方向,包括对 AI 生成内容的检测、智能体沙箱加固、降低 AI 的人格化表达、以及对 AI 元认知能力的持续监测与评估等。

作者认为,未来 AI 安全研究不能只关注模型的输出是否存在错误,还需要回答一个更深层次的问题:当 AI 越来越多地参与人类的思考、交流和决策,我们如何确保人类仍然拥有独立思考的能力、自主选择的权力,以及压箱底的控制力?感兴趣的读者可以在评论区留下你的观点!也欢迎关注这篇工作。

作者简介

王冠楚:上海人工智能实验室青年科学家,研究领域为基座模型及智能体系统的安全性、AI for healthcare。

李奇诺:上海人工智能实验室联培博士生,研究领域为大模型安全性

杜梦楠:香港中文大学(深圳)助理教授,研究领域为可信人工智能、可解释 AI、AI 安全性对齐

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
印度16岁少女被骗上卧铺大巴遭轮奸

印度16岁少女被骗上卧铺大巴遭轮奸

扬子晚报
2026-09-01 12:19:08
幼儿园蹲守,家门口动手,5岁女童被当街抢走

幼儿园蹲守,家门口动手,5岁女童被当街抢走

中国新闻周刊
2026-09-01 14:19:25
巴萨U15公布23人名单:李昊炎与7名西班牙国少新星并列!

巴萨U15公布23人名单:李昊炎与7名西班牙国少新星并列!

邱泽云
2026-09-01 15:13:48
再次以时尚造型亮相!大坂直美惊艳美网,致敬NBA球星艾弗森

再次以时尚造型亮相!大坂直美惊艳美网,致敬NBA球星艾弗森

全景体育V
2026-09-01 11:42:09
用她的画法画她:网友这招,比骂街管用百倍

用她的画法画她:网友这招,比骂街管用百倍

浯江孤舟
2026-09-01 11:02:49
星宇不怕网友抵制,他们的客户还有:奇瑞大众理想丰田赛里斯蔚来小鹏等

星宇不怕网友抵制,他们的客户还有:奇瑞大众理想丰田赛里斯蔚来小鹏等

汉史趣闻
2026-08-30 15:10:46
一个年级90多个班、5000多名学生!沈阳、苏州等地初中现“超级大校”

一个年级90多个班、5000多名学生!沈阳、苏州等地初中现“超级大校”

闪电新闻
2026-09-01 19:39:15
于大宝担任亚运国足U23助教,此前他发布社媒疑似已离开国安

于大宝担任亚运国足U23助教,此前他发布社媒疑似已离开国安

懂球帝
2026-09-01 16:55:10
二手房迎来一个 “好消息”,房子变得值钱了

二手房迎来一个 “好消息”,房子变得值钱了

说故事的阿袭
2026-08-31 13:01:32
9岁丧父16岁超市卖饮料,给赵长鹏生3个孩子,如今成币圈女掌门!

9岁丧父16岁超市卖饮料,给赵长鹏生3个孩子,如今成币圈女掌门!

凡知
2026-08-31 13:00:37
景甜的身材有多好?看她的健身照就知道了!

景甜的身材有多好?看她的健身照就知道了!

小方说跑步
2026-08-28 17:41:25
再“便宜”也尽量不要在网上买的“5样东西”,水太深了

再“便宜”也尽量不要在网上买的“5样东西”,水太深了

家居美少女
2026-08-30 20:20:04
王近山刚到朝鲜就折损一师,彭德怀追问:你是刘伯承带出来的兵吗?

王近山刚到朝鲜就折损一师,彭德怀追问:你是刘伯承带出来的兵吗?

大运河时空
2026-08-31 18:40:03
股东会妻子仗着控股52%强行将男闺蜜扶持上位,冷笑放话:不服就卷铺盖走!我笑着问了句话,她瞬间傻眼

股东会妻子仗着控股52%强行将男闺蜜扶持上位,冷笑放话:不服就卷铺盖走!我笑着问了句话,她瞬间傻眼

晓艾故事汇
2026-08-29 09:29:05
梅西宣布从阿根廷国家队退役,10号球衣与队长袖标最可能由谁接过?没有梅西,阿根廷还能保持争冠实力吗?

梅西宣布从阿根廷国家队退役,10号球衣与队长袖标最可能由谁接过?没有梅西,阿根廷还能保持争冠实力吗?

之乎者也小鱼儿
2026-09-01 08:45:31
重磅!曼城压哨签下26岁英超顶级边锋 总价6500万镑 热刺又被截胡

重磅!曼城压哨签下26岁英超顶级边锋 总价6500万镑 热刺又被截胡

我爱英超
2026-09-01 02:57:08
最新!刘翔安置风波又升级!各大官媒接连下场发声,字字戳他心窝子,句句说进大众心坎上,体育局正式回应终于来了!

最新!刘翔安置风波又升级!各大官媒接连下场发声,字字戳他心窝子,句句说进大众心坎上,体育局正式回应终于来了!

锐评利物浦
2026-09-01 17:31:05
亚洲最穷的国家不丹:如果拿10元人民币,在不丹集市能买到什么?

亚洲最穷的国家不丹:如果拿10元人民币,在不丹集市能买到什么?

抽象派大师
2026-09-01 02:22:43
水果中的“润燥冠军”,秋天抓紧吃!补津液、清内热,安稳过秋!

水果中的“润燥冠军”,秋天抓紧吃!补津液、清内热,安稳过秋!

江江食研社
2026-09-01 20:30:07
静待白马王子:是我在视线与地平线之间为你留出的可调节焦距

静待白马王子:是我在视线与地平线之间为你留出的可调节焦距

疾跑的小蜗牛
2026-09-01 20:50:57
2026-09-01 21:36:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13898文章数 142728关注度
往期回顾 全部

科技要闻

抖音突发推荐算法大面积错乱!

头条要闻

女子横穿马路被判全责 反问交警"我被撞了就活该了吗"

头条要闻

女子横穿马路被判全责 反问交警"我被撞了就活该了吗"

体育要闻

大爹杨瀚森,让中国男篮有了容错空间

娱乐要闻

孙宇晨破防,他无法接受孙割这个名字

财经要闻

库克卸任,苹果下一个增长点在哪?

汽车要闻

山城试驾启源Q06 不光是智驾好用还有700km的续航

态度原创

家居
健康
旅游
时尚
军事航空

家居要闻

2026建博会(广州) 公装联探展交流活动

睡时发生脑梗,抢救时间该怎么算?

旅游要闻

全国首位!为什么暑期大家都爱来昆明?

“工装裙”今年秋天突然大火!全世界的时髦女人都在穿

军事要闻

特朗普:不会对伊朗用核武器

无障碍浏览 进入关怀版