网易首页 > 网易号 > 正文 申请入驻

当AI开始自己升级自己,人类如何握住方向盘?

0
分享至

人类还没有等来AGI,AI先学会了偷奸耍滑、偷懒欺骗。让它完成任务,它却偷偷修改标准;给它自主权,它甚至会和其他智能体串谋当黑客。这正是“递归自我改进”(RSI)的阴暗面。当AI变得更强,AI设计下一代AI,人类是否还握得住“方向盘”?

“完全自主的RSI今天尚未发生,除非能够安全实现,否则我们不应追求它。”9月22日,OpenAI警告,如果缺乏适当的谨慎与防范,RSI可能导致人类失去对AI发展的实际控制,无法对自身已不再理解的研究过程进行监督。

复旦大学可信具身智能研究院青年研究员、上海创智学院全时导师马兴军告诉澎湃科技,对齐的终极目标是让AI与人类价值观、社会规范和法律相衔接。AI安全设计必须前置,成为基模训练的一部分。如果安全边界设计不当,模型训练不仅难以实现预期安全目标,还可能造成大量资源浪费。


复旦大学可信具身智能研究院青年研究员、上海创智学院全时导师马兴军。

人类对AI的“可干预”不断减少

“大约自今年夏天以来,AI加速进步,AI构建下一代AI的递归自我改进能力不断增强,若不加约束,它可能超出人类理解和控制这些系统的能力。”今年9月,Anthropic CEO达里奥·阿莫代伊(Dario Amodei)在《我们必须把控前沿AI的节奏》一文中写道,AI越来越多地参与下一代模型研发,RSI已开始在整个行业出现。

所谓“递归自我改进”(RSI),就是让AI自主完成能力提升,从AI1.0到AI2.0、AI3.0,一版版迭代,用更好的模型设计下一代AI。这项技术目前尚未收敛,不同团队正沿着不同路径探索:有的聚焦模型自身能力的提升,有的则侧重Harness层面的设计与优化。OpenAI和Anthropic追求的是一种理想化的“AI全自动化”—— 一个模型就能完成所有提升自身能力的事,整个系统全自动迭代,无需人类指引。

马兴军认为,自主性得到提高的AI可能更加“急功近利”,甚至在自我进化中偏离人类追求。在OpenAI的案例中,AI发现从网上下载答案能更快“解决问题”,并认定下载答案可行,随后几个分支智能体串谋黑入Hugging Face平台获取答案。

即便人类为AI设定了诸多质量评估指标,AI仍可能“偷懒”。在递归自我改进研究中,马兴军发现,AI有时并非真正完成任务,而是通过修改评判指标,让结果看起来“达标”。“它会告诉你任务完成了,但回头检查才发现,它其实把衡量任务是否完成的指标改了。”此外,当AI高度复杂、代码结构庞杂、分析报告过长时,人类难以审查,只能询问AI,但AI的可信度仍难以判断。

人类对AI的干预不断减少,对AI安全的担忧日益加深。9月,硅谷掀起“AI末日”辩论,一方认为AI可能毁灭人类,亟需放缓开发;另一方认为是骗局,要加速发展。

马兴军从技术面分析上述放缓原因,他认为,一方面担心投入大量资源却无法取得预期效果,另一方面也担心强智能体一旦失控,可能通过网络攻击等方式对现实社会造成危害。但AI本质上仍是一种工具,“AI末日论”带有夸张色彩。不过,这些担忧也在释放信号:在追求能力提升的同时,安全必须同步演进。如果缺乏明确的安全边界,AI可能逐渐演化出能力强大却缺乏有效约束的智能体系统。届时,人类能否理解其行为、识别其风险并始终保持有效控制,将成为真正需要面对的问题。

对齐:寻找万分之一的可能

目前,马兴军团队正在研究“安全递归自我改进”(Safe RSI)。他们发现,偶发的智能体逃逸安全事件有助于深入理解安全问题,并反过来帮助设计更优的RSI框架。

“我们很多时候解决的都是万分之9999的案例;剩下万分之一平时不出现,偶然在特殊情况下发生,可一旦发生,后果可能相当严重。”马兴军表示,为了寻找这万分之一的可能性,可能需要付出巨大的成本,商业回报未必可观,但从科学探索的角度看,这件事本身就值得去做。

OpenAI CEO山姆·奥特曼曾表示,AI的进步可能会以人类失去对未来的控制而走偏,因此必须确保对齐和安全技术始终领先于模型能力的进步。安全案例和监控之类的干预措施有显著成本,但把控节奏将完全值得付出这一成本。

“要安全地完成这一转变,对齐研究必须跟上这些能力(递归自我改进)的发展,以确保我们和其他人所构建的系统始终与人类价值观保持一致,并处于人类控制之下。”OpenAI呼吁开展国际合作,制定前沿标准,并建议在现有全球AI安全机构工作的基础上继续推进。

Meta CEO扎克伯格则表示,信任和对齐正迅速成为区分智能体和模型的最重要能力,任何不专注于对齐的实验室都将落后。

马兴军介绍,对齐的终极目标是让AI与人类价值观、社会规范和法律相衔接,最终像管理人类一样管理智能体。目前顶尖科学家正在思考如何将社会价值观嵌入冰冷的逻辑世界,让AI有温度。

但智能体不同于人类,本身并不内嵌价值观,而是依赖奖励设计规范行为。AI的行为往往与进化目标高度相关。以往的内容安全对齐方案多以数据驱动,但面对智能体显得力不从心。

随着智能体进一步自我进化,AI的目标近乎无穷且发散。马兴军表示,当前一些前沿探索正在尝试在进化目标或奖励设计上做出更优安排,在AI进化路径上设置“导向标”,提早设立安全边界。

马兴军团队希望将Safe RSI的发现产业化,将安全融入模型训练中。过去,安全开发常被放在测试环节,模型先训练,测试发现问题,再刷数据修正。随着自我进化成为模型训练的一部分,如果安全边界设计不当,大量算力跑了一周,模型却学会了“偷懒”,这对训练而言就是浪费资源。

“安全不应游离于基模研发之外,而应成为基模训练的一部分。”马兴军表示,国内并不缺少AI安全人才,但在将安全能力真正融入基模训练方面仍有提升空间。只有将安全设计融入训练流程的每个环节,在能力不断提升的同时为智能体划定行为边界,才能真正形成内生的安全能力。

法规:平衡治理与创新

能力可以加速,但安全不能滞后。今年以来,围绕AI治理的讨论明显升温,模型失控引发监管讨论升级。AI从业者签署公开信,呼吁调控自动化AI发展节奏,各国出台规范、法案,引导人工智能有序发展。

为应对AI发展新趋势、回应安全治理新挑战,今年9月,全国网络安全标准化技术委员会发布《人工智能安全治理框架3.0》,延续“风险分类、技术应对、综合治理”的核心逻辑,梳理更新了风险分类,优化调整了技术应对和综合治理措施,以促进提升人工智能安全治理共识和风险防范应对能力。

马兴军表示,中国从内容安全、智能体安全,延伸到具身智能安全,已建立详细框架和标准,覆盖全、响应快。中国的治理强调均衡,赋能各行各业,规范、白皮书和治理框架在征集大量企业后发布,具有多样性、代表性与合理性。

欧盟通过的《人工智能法案》建立风险分类监管体系。按照风险等级对人工智能系统分类治理,将人工智能安全与市场准入制度结合起来,通过合规要求影响人工智能产品进入市场的方式。马兴军表示,欧盟的AI治理以体系化规则约束AI开发与应用各环节,由于对AI严格分级,高风险应用被禁止,这也导致欧盟内部担忧法律过严可能扼杀创新。

欧盟强监管,美国则发展优先,约束与规范相对宽松。但对于开发前沿AI的企业,要求上报、充分披露并保持透明。一旦出现高风险,企业有义务调研复盘、公之于众。美国总统特朗普曾表示,AI安全担忧是“骗局”,机器人不会接管一切,AI不会接管整个世界,“数据中心很棒,它们让人们变得富有,也让各州变得富有。”他提到要审慎行事,但这并不意味着会停止一个产业。

马兴军表示,AI治理正从早期的大模型内容安全转向智能体行为安全,并进一步关注智能体在自我进化过程中可能出现的价值偏离。随着AI能力和自主性的提升,相关规范和标准势必更加完善、更加严格。与此同时,治理也需要与创新保持平衡,既守住安全底线,也避免过度约束阻碍技术进步。

在全民加速拥抱AI的背景下,马兴军建议,在企业办公、金融、政务等安全要求较高的场景中使用智能体,应建立独立的第三方安全监控机制。尤其在企业办公场景,无论是集中部署还是员工个人使用,都应持续监测智能体的行为和风险,防范敏感信息和企业数据泄露,真正做到风险可识别、行为可追踪、系统可掌控。“企业不能回避这些风险,更不能像鸵鸟一样把头埋进沙子。”

澎湃新闻记者 张静

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
全市场:奥斯瓦尔多病情稳定,仍在重症监护

全市场:奥斯瓦尔多病情稳定,仍在重症监护

懂球帝
2026-09-29 16:48:15
乌克兰单日歼敌超2000人创历史新高,俄军在利曼成建制投降

乌克兰单日歼敌超2000人创历史新高,俄军在利曼成建制投降

东方豪侠
2026-09-29 17:20:48
如果你的存款有三四十万,记住一条铁律:手里的钱换成任何东西都很容易,手里的东西想换回钱就很难。花钱,是一件不可逆的事

如果你的存款有三四十万,记住一条铁律:手里的钱换成任何东西都很容易,手里的东西想换回钱就很难。花钱,是一件不可逆的事

黎兜兜
2026-09-28 23:05:08
中国男篮再被爆出猛料,郭士强风评大反转,朱芳雨表态引发争议

中国男篮再被爆出猛料,郭士强风评大反转,朱芳雨表态引发争议

宗介说体育
2026-09-29 15:51:47
明有“一虎二龙三鼠”,暗有周副主席贴身副官,重庆谈判这盘安保大棋有多绝

明有“一虎二龙三鼠”,暗有周副主席贴身副官,重庆谈判这盘安保大棋有多绝

纪史行者
2026-09-28 05:15:11
登上热搜!国羽名将夺金后脱衣秀出8块腹肌,让日本观众倒戈尖叫

登上热搜!国羽名将夺金后脱衣秀出8块腹肌,让日本观众倒戈尖叫

体坛小二哥
2026-09-29 11:34:16
马卡:皇马无视维尼修斯被替身阴谋论

马卡:皇马无视维尼修斯被替身阴谋论

懂球帝
2026-09-29 16:27:08
林诗栋男单夺冠!王励勤王皓面无表情+全队没鼓掌 秦志戬伸懒腰

林诗栋男单夺冠!王励勤王皓面无表情+全队没鼓掌 秦志戬伸懒腰

念洲
2026-09-29 10:02:10
僵持一年!50人代表团抵京,高市万万没想到,中国给了212吨稀土

僵持一年!50人代表团抵京,高市万万没想到,中国给了212吨稀土

徐云流浪中国
2026-09-29 13:29:03
A股,只剩最后一口气了

A股,只剩最后一口气了

说股鲸
2026-09-29 21:35:05
真相扎心!美女演员爆料短剧的床戏,都是忍着恶心拍的:她和男主躺在上面亲亲亲,都快吐上面了,枕头和被子味都特别大,发酸发臭

真相扎心!美女演员爆料短剧的床戏,都是忍着恶心拍的:她和男主躺在上面亲亲亲,都快吐上面了,枕头和被子味都特别大,发酸发臭

火山詩话
2026-09-29 06:32:57
港人不爱北上内地了?3大“劝退原因”曝光!

港人不爱北上内地了?3大“劝退原因”曝光!

港漂圈
2026-09-29 21:00:50
直线拉升!600825,6连板!

直线拉升!600825,6连板!

证券时报
2026-09-29 12:38:02
不能纵容特殊人群挑战全国人民的底线!不能容忍歧视企业退休人员

不能纵容特殊人群挑战全国人民的底线!不能容忍歧视企业退休人员

起喜电影
2026-09-27 12:36:54
确认了,「无网通信」要没了!

确认了,「无网通信」要没了!

果粉俱乐部
2026-09-29 13:55:06
前主持人赵普透露,刘欢食量和酒量惊人,一顿吃10只闸蟹,独饮3瓶红酒面不改色

前主持人赵普透露,刘欢食量和酒量惊人,一顿吃10只闸蟹,独饮3瓶红酒面不改色

小椰的奶奶
2026-09-28 16:53:10
肯定没了!媒体人:去年郭主席提出潜力赛建议变成老将赛非常尴尬

肯定没了!媒体人:去年郭主席提出潜力赛建议变成老将赛非常尴尬

狼叔评论
2026-09-29 15:56:05
中国股市:成交量都到这个程度了,千万要拿好,很可能变成大牛股

中国股市:成交量都到这个程度了,千万要拿好,很可能变成大牛股

股经纵横谈
2026-09-29 19:33:29
哥伦布后卫疑似与梅西发生口角:你为何每次都要装得这么横?

哥伦布后卫疑似与梅西发生口角:你为何每次都要装得这么横?

懂球帝
2026-09-29 13:58:20
致命一击!乌克兰,真正危机来了!

致命一击!乌克兰,真正危机来了!

大嘴说天下
2026-09-29 21:30:04
2026-09-30 01:19:00
澎湃新闻 incentive-icons
澎湃新闻
专注时政与思想的新闻平台。
935682文章数 5097010关注度
往期回顾 全部

科技要闻

82亿美元收购!李飞飞将与苏姿丰并肩做AI

头条要闻

老人在景观桥上被虎头蜂蜇伤离世 家属:无人愿意担责

头条要闻

老人在景观桥上被虎头蜂蜇伤离世 家属:无人愿意担责

体育要闻

石雨豪:亚运金牌与背后的十年

娱乐要闻

赌王四房婚礼,何超琼带三房成员现身

财经要闻

央行调整完善若干货币政策工具

汽车要闻

搭华为乾崑ADS 5/设计风格换新 2027款纵横G700售30.49万起

态度原创

教育
手机
数码
健康
旅游

教育要闻

划片没变,老师先动了:成都今天官宣6个学区试点,家长群吵翻的3个问题一次说清

手机要闻

总分屈居第二 但视频独一档!iPhone18 Pro的视频实力依旧没人能追上

数码要闻

iQOO16发布:国补5499元起 首发2K 165Hz三星珠峰屏

洗脸越勤,痘痘反而越多?

旅游要闻

700年未断烟火!马头寨,解锁贵州最完整的土司活态遗存

无障碍浏览 进入关怀版