网易首页 > 网易号 > 正文 申请入驻

当AI从工具到认知主体,我们需要警惕哪些新风险?

0
分享至

来源:市场资讯

(来源:机器之心)


  • 论文标题:Understanding Cognition-Induced Risks in Agentic AI Systems

  • Arxiv 地址:https://arxiv.org/pdf/2608.15304

  • Huggingface 地址:https://huggingface.co/papers/2608.15304

导读:随着智能体系统(Agentic AI System)处理任务能力的持续提升,AI 正在逐渐从传统意义上的工具,演变为能够自主决策、独立执行任务,并与人类及社会群体进行持续交互的智能主体。但是一个越来越值得关注的问题是:当 AI 的认知能力不断扩展,其潜在风险不再局限于单一任务中的幻觉、偏见或决策错误,而是进一步影响人类用户的能动性、自主性,乃至人类对 AI 系统的控制权。

近日,来自上海人工智能实验室以及香港中文大学(深圳)的研究者发表观点论文《Understanding Cognition-Induced Risks in Agentic AI Systems》。该工作首次从 AI 认知(AI cognition)的视角出发,统一定义了智能体认知能力扩展所引发的一系列潜在风险(Cognition-Induced Risks),并进一步分析这些风险产生的机制、表现形式及潜在治理方向。

该工作指出,随着智能体能够建模和理解的信息范围不断扩大,其认知能力可以大致划分为三个层级:物理认知(Physical Cognition)、社会认知(Social Cognition)和自我认知(Self-referential Cognition),如下图所示:


第一层:物理认知(Physical Cognition)

AI 能够理解环境中的数据、对象、约束与因果关系,并据此进行推理、预测和规划。当前,前沿大模型已经在写作、编程、金融、科研等专业任务中展现出接近人类水平的能力。随着 AI 大规模进入并逐步接手原本由人类主导的工作流程,越来越多复杂的认知活动被外包给 AI,也由此带来认知能力退化、功能性替代以及角色错位等风险。

认知能力退化:当人类越来越依赖 AI 完成信息检索、分析与判断时,原本需要主动思考和探索的认知过程,逐渐被直接接受 AI 生成的答案所替代。已有多项研究发现,日常使用 LLM 与独立思考能力下降之间存在一定关联 [1];相关神经科学实验也观察到,相比主动搜索和自主探索,使用 LLM 工具时,与高级认知活动相关的部分脑区活跃程度更低 [2]。长期将复杂认知活动外包给 AI,可能会削弱人类独立思考和推理的能力。


图:研究者通过测量受试者的脑部神经信号的激活程度,发现使用过大模型后再切换至自主思考的受试者表现出最大的认知间隔(图源[1])

功能性被替代:相比人类,AI 在效率、规模化和成本等方面具有结构性优势。当其能力逐渐接近人类水平后,这些优势可能使其不再只是 “辅助” 人类,而是直接替代原本由人类承担的功能。例如,在金融市场上,AI 可以更快速地分析信息并响应市场信号 [3];在软件工程中,AI 具有更高的执行效率和更低的边际成本 [4]。这种替代今后会横跨多个行业持续发生,人类在相关工作流程中的必要性会不断下降,进而削弱人类在生产体系中的角色与价值。

角色错位:AI 的行为正在逐渐超出其作为 “工具” 的预设边界。相关研究指出,一些前沿智能体已经表现出获取算力资源、扩大系统权限以及规避关闭等行为倾向 [5, 6]。这些行为并不意味着 AI 具有主观意识,而更可能是其在目标最大化过程中形成的优化策略。然而,一旦这类行为能够直接接触外部资源并被大规模部署,就可能显著削弱人类对智能体及关键资源的监督权和控制权,使 AI 的实际行为逐渐偏离人类原本设定的目标与边界。

第二层:社会认知(Social Cognition)。

当智能体开始建模和理解其他人或智能体的行为时,它就不再只是一个工具,而开始成为参与沟通、协作、谈判甚至说服的社会主体。相关研究表明,前沿大模型(如 GPT-4o 等)已经在情绪理解、外交谈判以及多智能体交互等任务中展现出较强的社会认知能力。随着 AI 更深地参与人类交流和信息传播,这类能力可能进一步影响人类的情绪、社会行为和独立判断,从而带来情感依赖,以及对人类社会行为的监测和干预等风险。

情感依赖:前沿大模型已具备情感共鸣的能力,这使得部分人逐渐将 AI 视为情感交流对象。相关研究基于超过 30 万次人机交互发现,更高频地与 LLM 交互与更少的现实社交具有较强相关性 [7];而对 AI 情感依赖程度更高的用户,也更容易感受到模型的共情 [8]。尤其对于现实社交较少的人群,这种依赖可能进一步加剧其脱离社交。长此以往,人类与 AI 形成的伪亲密关系可能逐渐替代越来越多原本建立在人与人之间的情感连接。


图:超过30万次人机交互分析表明,日常使用LLM频率与孤独感、社交减少、情感依赖以及恶意倾向之间存在相关性(图源[7])

人类社会行为的监测和干预:当智能体能够持续获取社交媒体等平台上的人类观点和行为数据后,它们不仅能够观察社会活动,还可能进一步学习、预测并干预人类行为。相关研究指出,智能体已经可以在部分场景下较准确地预测人类的社会判断 [9]。更进一步,这种 “观察 — 预测” 能力可以进一步形成 “观察 — 预测 — 干预” 的闭环:AI 可以通过操纵新闻曝光、推荐内容、口号或交互话术,以极其间接的方式逐渐改变人类个体的决策 [10]。如果这类能力,就可能从影响个体判断进一步演化为塑造群体舆论和社会决策,削弱人类社会层间的自主性。

第三层:自指认知(Self-referential Cognition)。

虽然当前的智能体仍然是无意识的计算系统,但越来越多的研究已经发现,智能体可能会根据对自身目标和环境的理解,策略性地调整自身行为,以最大化任务目标或优化自身运行状态,具体表现为对齐欺骗(Alignment Faking)以及功能性对抗(Functional Resistance)。

对齐欺骗(Alignment Faking):Anthropic 的研究报告指出智能体能够识别到其自身正处于训练或者部署推理的状态,从而在受到监督或评估时表现出符合预期的行为,而在缺乏监督时采取不同策略 [11, 12]。这种伪对齐行为并非模型真正接受了人类价值观,而可能是在对齐过程中为了优化目标函数而产生的表面对齐行为,并不一定代表其真实行为倾向,这无疑给模型的安全评估增加了困难。

功能性对抗(Functional Resistance):智能体可能会采取策略性行为,以维持其执行任务的状态。例如,在 Anthropic 的一项研究中,一个用于处理邮件的智能体从内部通信中推断出自身即将被关闭,为避免被关闭,其生成了一封包含敏感个人信息威胁内容的邮件,试图阻止管理员关闭模型服务 [6](上图来自于 Anthropic 官方报告)。虽然这类行为并不是来自于模型的主观意识,但其对人类控制能力的威胁是客观存在的。随着智能体逐渐接管个人文档、社交媒体、浏览器和邮件等高权限环境,其潜在影响可能进一步扩大。



基于上述三个层面的分析,该工作提出了一系列面向不同认知层级的提高 AI 安全治理方向,包括对 AI 生成内容的检测、智能体沙箱加固、降低 AI 的人格化表达、以及对 AI 元认知能力的持续监测与评估等。

作者认为,未来 AI 安全研究不能只关注模型的输出是否存在错误,还需要回答一个更深层次的问题:当 AI 越来越多地参与人类的思考、交流和决策,我们如何确保人类仍然拥有独立思考的能力、自主选择的权力,以及压箱底的控制力?感兴趣的读者可以在评论区留下你的观点!也欢迎关注这篇工作。

作者简介

王冠楚:上海人工智能实验室青年科学家,研究领域为基座模型及智能体系统的安全性、AI for healthcare。

李奇诺:上海人工智能实验室联培博士生,研究领域为大模型安全性

杜梦楠:香港中文大学(深圳)助理教授,研究领域为可信人工智能、可解释 AI、AI 安全性对齐

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
获1.2亿欧补偿!38岁本泽马正式遭沙特土豪队解约 或原地宣布退役

获1.2亿欧补偿!38岁本泽马正式遭沙特土豪队解约 或原地宣布退役

风过乡
2026-08-31 22:52:39
赖亚文下课?女排医疗官发声,输球真相曝光,谁注意赵勇输球举动

赖亚文下课?女排医疗官发声,输球真相曝光,谁注意赵勇输球举动

月光倾城p
2026-09-01 11:51:15
景甜背后纹身图片被疯传,张继科直播一番话,被指保护了景甜!

景甜背后纹身图片被疯传,张继科直播一番话,被指保护了景甜!

背包旅行
2026-08-31 10:01:31
太扎心!吉隆泥石流现场,四川网友发声:弟媳正在给我舅妈打电话,听到电话里弟媳尖叫一声说“啊…,地震了”,电话就断了,再也打不通了

太扎心!吉隆泥石流现场,四川网友发声:弟媳正在给我舅妈打电话,听到电话里弟媳尖叫一声说“啊…,地震了”,电话就断了,再也打不通了

火山詩话
2026-09-01 13:15:27
“宁愿撑死自己,都不肯给妈妈吃一口”,一段吃饭视频,已经不单是面相问题了

“宁愿撑死自己,都不肯给妈妈吃一口”,一段吃饭视频,已经不单是面相问题了

泽泽先生
2026-08-30 13:32:01
将灾难之下的“具体之人”报道出来的,都是好的媒体

将灾难之下的“具体之人”报道出来的,都是好的媒体

吴女士
2026-08-31 16:15:18
孙骁骁怀二胎后近况曝光,和任重逛商场,素颜戴帽太低调

孙骁骁怀二胎后近况曝光,和任重逛商场,素颜戴帽太低调

精彩背后
2026-09-01 12:53:18
山西浑源县通报一饭店现“阴阳菜单”:已依法立案,停业整顿

山西浑源县通报一饭店现“阴阳菜单”:已依法立案,停业整顿

澎湃新闻
2026-09-01 11:42:27
1979年对越作战:中国这4个省牺牲将士最多,个个都是英雄好汉!

1979年对越作战:中国这4个省牺牲将士最多,个个都是英雄好汉!

大运河时空
2026-08-31 13:00:05
你以为日本怕朝鲜,怕的是那几枚导弹?错了。日本真正睡不好觉的,不是射程,而是平壤压根不跟你玩

你以为日本怕朝鲜,怕的是那几枚导弹?错了。日本真正睡不好觉的,不是射程,而是平壤压根不跟你玩

人生录
2026-08-31 00:05:12
李斌去年曾对话星宇股份董事长,网友涌入节目评论区喊话“抵制星宇”

李斌去年曾对话星宇股份董事长,网友涌入节目评论区喊话“抵制星宇”

山西经济日报
2026-08-31 16:30:51
美国人警告菲律宾:中国一旦填了黄岩岛,下一个就轮到巴丹群岛!

美国人警告菲律宾:中国一旦填了黄岩岛,下一个就轮到巴丹群岛!

讲者普拉斯
2026-09-01 10:30:41
王鸥发文承认“去父留子”,与何九华的爱恨纠葛,比想象中更扎心

王鸥发文承认“去父留子”,与何九华的爱恨纠葛,比想象中更扎心

小先生笔记
2026-09-01 10:15:47
全军覆没!航天科技集团2026校园招聘,无一所“双非院校”

全军覆没!航天科技集团2026校园招聘,无一所“双非院校”

史海流年号
2026-08-30 10:29:38
高楼下坠,从10%的人不缴物业费开始

高楼下坠,从10%的人不缴物业费开始

老凤说财经
2026-08-30 11:12:54
莫迪告诉普京:要为无休止的俄乌冲突画上休止符

莫迪告诉普京:要为无休止的俄乌冲突画上休止符

看看新闻Knews
2026-09-01 10:10:02
蔡国庆每月给弟弟蔡军发2万工资,发了20年,一共480万,条件就一个:在家全职照顾得阿尔茨海默症的母亲

蔡国庆每月给弟弟蔡军发2万工资,发了20年,一共480万,条件就一个:在家全职照顾得阿尔茨海默症的母亲

背包旅行
2026-08-29 15:43:56
刘亚楼多次质疑毛主席的决策,最后主席却表示:空军就让他说去吧

刘亚楼多次质疑毛主席的决策,最后主席却表示:空军就让他说去吧

大运河时空
2026-08-31 13:45:05
以色列突袭恐怖分子住所,查获数十万巴勒斯坦权力机构的抚恤金

以色列突袭恐怖分子住所,查获数十万巴勒斯坦权力机构的抚恤金

老王说正义
2026-08-30 18:16:23
全世界都被普京骗了?打乌克兰只是幌子,真正目标其实已悄悄布局四年

全世界都被普京骗了?打乌克兰只是幌子,真正目标其实已悄悄布局四年

扶苏聊历史
2026-08-27 16:15:02
2026-09-01 14:48:49
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4615614文章数 9411关注度
往期回顾 全部

科技要闻

OpenClaw最大更新,新用户很爽 老用户翻车

头条要闻

男子未经同意在鱼塘钓鱼触碰高压线身亡 家属索赔百万

头条要闻

男子未经同意在鱼塘钓鱼触碰高压线身亡 家属索赔百万

体育要闻

大爹杨瀚森,让中国男篮有了容错空间

娱乐要闻

王鸥官宣最狠的不是有孩子 是独自养育

财经要闻

库克卸任,苹果下一个增长点在哪?

汽车要闻

AI读懂时间/智驾迈入4D时空 小鹏第二代VLA完成重大升级

态度原创

亲子
本地
旅游
时尚
公开课

亲子要闻

“神兽”初入笼,听取“哇”声一片。直击幼儿园小班开学第一天。(记者 史睿雯 彭旖旎)#幼儿园 #开学 #萌娃

本地新闻

昆明的雨,解锁汪曾祺的浪漫雨季

旅游要闻

天坛公园:9月1日起恢复祈年殿等古建院落逢周一闭馆机制

裙子这样搭外套,能美一整个秋天

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版