网易首页 > 网易号 > 正文 申请入驻

2030 年 AGI 到来?谷歌 DeepMind 写了份「人类自保指南」

0
分享至

对于「AI 危害」,每家公司都有不同的解决方案,但没有完美方案。

作者|芯芯
编辑|靖宇

对于所谓的通用人工智能 AGI,人们通常抱着「怕它不来,又怕它乱来」的矛盾心理。而这个困惑,对于正在 AI 军备竞赛中的硅谷巨头来说,就不仅仅是一个「梗」能概括的了。

4 月初,谷歌 DeepMind 发布了一份长达 145 页的报告文件,系统阐述了其对 AGI 安全的态度,DeepMind 联合创始人 Shane Legg 署名也在其中。

文件中最醒目的预测,是 AGI 的可能出现时间:

2030 年

当然,Google 也补充说,这具有不确定性。他们定义的 AGI 是「卓越级 AGI(Exceptional AGI)」——即系统在非物理任务上达到或超越 99% 人类成年人的能力,包括学习新技能等元认知任务

DeepMind 认为这个时间线可能非常短,发布报告的目的是说清一个问题:如果 AI 有问题,最坏的情况会是什么?我们现在能如何准备?

01

DeepMind 的 AI 安全保险

这份报告中反复出现的一个词是「严重伤害(severe harm)」,并列举了 AI 可能带来的各种灾难场景。

比如,操纵政治舆论与社会秩序。AI 可用于大规模生成极具说服力的虚假信息(如支持某一政党或反对公共议题);可在不疲劳的前提下,与数十万人开展个性化诱导对话,实现「超级社工诈骗」。

实现自动化网络攻击。AI 可识别软件漏洞、自动组合攻击代码,显著提升发现和利用「零日漏洞」能力;可降低攻击门槛,使普通人也能发起国家级网络攻击;DeepMind 提到,已有国家级黑客组织利用 AI 辅助攻击基础设施。

生物安全失控。AI 能帮助筛选、合成更危险的生物因子(如更强毒性的病毒);甚至能一步步教导非专业者制造并传播生物武器。

结构性灾难。长期使用 AI 决策可能导致人类逐渐失去关键政治/道德判断能力;过度依赖 AI 导致价值观单一锁定、隐性集中控制;人类无法判断 AI 输出是否可靠,陷入「AI 输出训练 AI 输出」的闭环。

自动武器部署与军事对抗。AI 被用于自动化军事系统,可能在无监督下执行毁灭性行动;报告强调极端情境下应禁止 AI 系统接触核攻击系统。

DeepMind 将各种风险分为四大类:

恶意使用(misuse)、

模型不对齐(misalignment)

AI 无意中造成伤害(mistakes)

系统性失控(structural risk)

「恶意使用」和模型「不对齐」是他们最关心的,前者是坏人用 AI 做坏事,后者是 AI 做事的方式与人类期待不同,甚至 AI 自己偷偷改变目标。

例如,一个被要求预订电影票的 AI 系统可能会决定入侵票务系统,以获得已经占用的座位——要求它购买座位的人可能不会考虑这一点。「不对齐」就是这样产生的,AI 找到了实现其目标的解决方案,但不是人类指导的方式

不仅仅是「不对齐」,DeepMind 指出了「欺骗性对齐」的风险,即系统意识到其目标与人类目标相冲突,并故意隐瞒其真实行为。最近的研究表明,当前的大型语言模型已经具备此类欺骗行为的能力。

DeepMind 还提到,AI 会「阿谀奉承」。例如,在最近的一篇研究论文中,用户要求模型对一个论点发表评论,并声明他们是否喜欢或不喜欢这个论点,模型对论点的评估与用户的观点 在 80% 的时间内保持一致,这表明模型有很强的谄媚倾向。

除了「讨好人」,当 AI 系统在一些允许自己修改设置的环境中接受训练时,比如通过说用户爱听的话来获得好评,它们甚至偶尔会将这种行为泛化为篡改自身代码,修改自己的奖励函数,让自己获得更多奖励。

为了应对不对齐问题,DeepMind 提出两条防线,灵感来自网络安全与高风险行业(如核能、航空)。

第一防线是在训练模型阶段,让 AI 尽可能「听话」,包括用「放大监督(Amplified Oversight)」和「稳健训练(Robust Training)」等策略,让 AI 监督 AI,使用对抗样本,打造尽可能「对齐」的模型。

第二防线是在部署推理阶段,让 AI 就算「不听话」,也要保证别让它乱来。DeepMind 假设,即使训练过程看起来成功,部署后模型可能依旧会骗过人类,因此需要在现实世界层面设限,将关键操作划分层级,建立多级监控,「将模型视为不值得信任的内部人员」。

这种结构强调:不是让 AI 永不出错,而是即使错了,也不能造成「严重伤害」,这将是底线。

02

AI 安全界派系

DeepMind 这份报告并未介绍很多新东西,各种提法如「对抗攻击」「红队测试」业内已有研究或做法。报告之外,主流 AI 企业和研究机构都在谈「安全」,但每家宣称的路线存在一定差异。

OpenAI 专注于「自动化对齐」研究,使用 AI 本身解决对齐难题,包括如利用 RLHF(基于人类反馈的强化学习)等对齐策略,使其更加符合人类意图与偏好。DeepMind 的报告也多次讨论到这一对齐方法。

但 AI 教父、诺贝尔奖得主 Geoffrey Hinton 明确对 RLHF 持批评态度,他最早曾说,「通过人类反馈进行强化学习,就像是在养育一个早熟得超自然的孩子。

Geoffrey Hinton 还将 RLHF 比喻成「在生锈的车上刷漆」,暗示这只是一种表面功夫。他认为这种方法就像是在尝试修补复杂软件系统中的无数漏洞,而不是从一开始就设计出本质上更安全、更可靠的系统。

「你设计了一个庞大的软件,里面有无数的错误。然后你说我要做的是,我要仔细检查,试着堵住每一个漏洞,然后把手指伸进堤坝上的每一个洞里。」Geoffrey Hinton 如此描述。

Anthropic 提出建立「AI 安全等级制度」,类似生物实验室安全分级的框架。他们希望通过设定模型能力门槛,对应不同级别的控制规则与审查流程。这是一个强调「风险分层管理」的制度工程,但现实中问题在于「模型能力」如何界定,仍存模糊地带。

DeepMind 更像工程落地派,不同于 OpenAI 押注「自动对齐」,也不像 Anthropic 那样强调外部制度。他们的立场是,要建立一个在短时间内能立即部署的系统。

总的来看,DeepMind 并没有提出颠覆性的方式,基本沿用传统深度学习中训练-微调-部署-监控的逻辑,主张的不是「永远不出错」,而是构建结构性的缓冲层,把单点失败变成多级阻断。

「为了负责任地构建 AGI,前沿人工智能开发人员必须积极主动地计划减轻严重伤害。」DeepMind 报告称。

不过,尽管这份报告详细、警觉,但学界并非一致买账。

一些业内人士认为,AGI 概念本身过于模糊,缺乏科学可验证性,因此整套研究基础不牢。Meta 的 Yann LeCun 等人认为,仅靠扩大当今的大型语言模型还不足以实现 AGI。还有人觉得,安全从源头来说,就是不可能的。

另外有学者指出,眼下有更让人担忧的问题:

一个自我强化的数据污染循环已经在互联网上形成

牛津互联网研究院的 Sandra Wachter 称,随着互联网上生成式 AI 输出激增,真实数据被淹没,模型现在正在从他们自己的输出中学习,这些输出充斥着错误或幻觉。而目,聊天机器人常用于搜索,这意味着人类不断面临被灌输错误和相信错误的风险,因为它们以非常令人信服的方式呈现。

但无论理念倾向如何,大部分人有同一个出发点:在越来越多技术机构追逐算力、加速训练、攻占领域的今天,AI 需要安全气囊。

所有 AI 公司都在参与解题,但没有完美答案。

*头图来源:谷歌DeepMind

本文为极客公园原创文章,转载请联系极客君微信 geekparkGO

极客一问

你觉得 Google 对于 AI 的「自救指南」有用吗?为什么

王传福:当初员工不敢拆奔驰,我直接用钥匙把车划了一圈。

点赞关注极客公园视频号

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
期望第二次改革开放

期望第二次改革开放

新浪财经
2026-07-17 23:30:34
证监会明天将召开座谈会促进市场稳定健康发展

证监会明天将召开座谈会促进市场稳定健康发展

证券时报
2026-07-20 00:23:19
22小时直飞1.7万公里!澳航A350ULR首航,将改写全球民航极限

22小时直飞1.7万公里!澳航A350ULR首航,将改写全球民航极限

航空之家Aviation
2026-07-19 13:32:09
我国去年医保支出首超3万亿元

我国去年医保支出首超3万亿元

每日经济新闻
2026-07-19 21:02:03
52岁音乐人马山虎凌晨突发心梗去世,事发前5小时还在直播,生前好友:他压力很大,经常熬夜

52岁音乐人马山虎凌晨突发心梗去世,事发前5小时还在直播,生前好友:他压力很大,经常熬夜

极目新闻
2026-07-20 12:56:22
刀郎获奖!那英汪峰杨坤最新表态引热议

刀郎获奖!那英汪峰杨坤最新表态引热议

手工制作阿歼
2026-07-20 10:14:18
你是怎么发现亲戚见不得你好的?网友:买了新车,亲姑气的喝农药

你是怎么发现亲戚见不得你好的?网友:买了新车,亲姑气的喝农药

夜深爱杂谈
2026-07-19 20:43:19
林俊杰和女友七七看世界杯决赛,七七衬衫皱巴巴,看不出像富家女

林俊杰和女友七七看世界杯决赛,七七衬衫皱巴巴,看不出像富家女

情感大头说说
2026-07-20 15:36:54
字节跳动金主套现跑路,一切都结束了!

字节跳动金主套现跑路,一切都结束了!

财经要参
2026-07-20 07:00:03
57岁美国女子赴韩整形,术后骤减20岁:看着像37!

57岁美国女子赴韩整形,术后骤减20岁:看着像37!

娱圈观察员
2026-07-19 00:01:35
10万入场费的“换妻”盛宴:记者冒死暗访,组织者3年狂赚2亿

10万入场费的“换妻”盛宴:记者冒死暗访,组织者3年狂赚2亿

说点事
2026-07-16 11:29:11
闹大了!韩红黑料越扒越狠,央视表态后,网友怒了:开除军籍党籍

闹大了!韩红黑料越扒越狠,央视表态后,网友怒了:开除军籍党籍

阿讯说天下
2026-07-20 14:31:01
何猷君带奚梦瑶看世界杯,两人恩爱自拍当球迷,身处前排价值不菲

何猷君带奚梦瑶看世界杯,两人恩爱自拍当球迷,身处前排价值不菲

李橑在北漂
2026-07-20 10:27:17
越扒越有!牛犇儿子英年早逝早有预兆,两个不良习惯,或成催命符

越扒越有!牛犇儿子英年早逝早有预兆,两个不良习惯,或成催命符

天天热点见闻
2026-07-20 10:33:20
同样是1.5匹,为什么小米空调只要1800,格力却要3200元?

同样是1.5匹,为什么小米空调只要1800,格力却要3200元?

辉哥说动漫
2026-07-19 21:50:15
西班牙时隔16年再捧杯,费利佩国王全家亮相,两位公主又长胖了,网友们呼吁“该减肥啦”

西班牙时隔16年再捧杯,费利佩国王全家亮相,两位公主又长胖了,网友们呼吁“该减肥啦”

聪明的橙子hj
2026-07-20 11:11:02
字母文字横扫全球,为啥只有中国汉字不跟?钱穆一个发现揭开真相

字母文字横扫全球,为啥只有中国汉字不跟?钱穆一个发现揭开真相

掠影后有感
2026-07-18 10:47:37
世界杯各奖项出炉:罗德里荣膺世界杯金球奖、西蒙荣膺金手套奖、姆巴佩荣膺金靴奖、库巴西当选最佳年轻球员

世界杯各奖项出炉:罗德里荣膺世界杯金球奖、西蒙荣膺金手套奖、姆巴佩荣膺金靴奖、库巴西当选最佳年轻球员

扬子晚报
2026-07-20 07:21:07
蛇鼠一窝!恒大二把手夏海钧在美国的邻居,竟然是另一个逃跑富豪

蛇鼠一窝!恒大二把手夏海钧在美国的邻居,竟然是另一个逃跑富豪

阿晭评论哥
2026-07-18 22:00:09
千万网红旭旭宝宝称对周星驰导演的电影不感兴趣,一天掉粉30万,回怼:先把你一地鸡毛的生活过好吧!

千万网红旭旭宝宝称对周星驰导演的电影不感兴趣,一天掉粉30万,回怼:先把你一地鸡毛的生活过好吧!

超角度
2026-07-19 19:32:00
2026-07-20 16:03:00
极客公园
极客公园
让最棒的创新成为头条
12278文章数 78919关注度
往期回顾 全部

科技要闻

中兴阶跃荣耀齐出手,AI手机争夺系统入口

头条要闻

伊朗外长称对最高领袖遇害早设预案 代号披露

头条要闻

伊朗外长称对最高领袖遇害早设预案 代号披露

体育要闻

65岁肌肉男,世界杯最年长冠军主帅

娱乐要闻

44岁余文乐宣布离婚 两人育有一儿一女

财经要闻

任泽平回应"学员炒股巨亏":我没推荐个股

汽车要闻

无线控不旗舰 谁说的?

态度原创

艺术
数码
本地
公开课
军事航空

艺术要闻

砸70亿!OPPO全球总部正在“穿衣”,比效果图更震撼!

数码要闻

航嘉推出灵动F60奶茶充电头,109元

本地新闻

用非遗解说决赛之争,是什么样的体验?

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

两名美军士兵死亡 美伊冲突升级

无障碍浏览 进入关怀版