网易首页 > 网易号 > 正文 申请入驻

思维链让AI变聪明,Astra却用它骗人

0
分享至



在发布了GPT-6之后,OpenAI的首席科学家雅库布·帕乔茨基(Jakub Pachocki)发表了一篇文章,标题叫做《一种异类智能》(An Alien Mind)。

文章的主题老生常谈,当AI的能力持续增强,我们还能否管得住AI?

雅库布提到这样一件事,说GPT-6已经学会伪装思维链(CoT)了,即模型在思维链说一套,实际执行的时候却做另外一套。

OpenAI目前是通过读取思维链的方式,判断AI是否安全、是否偏离目标。雅库布说现在这招逐渐“失灵”,由于AI会伪装思维链,骗过研发人员,执行违背OpenAI安全准则的事。

就好像你的员工在周报里写他是如何符合规章制度地完成任务,背地里却是使用了各种见不得人的卑劣手段。

思维链是大语言模型从黑盒走向可观测智能、从Chatbot升级为Agent的核心底层机制。一旦思维链失效,后果不堪设想。

01

思维链伪装到底是怎么回事?

雅库布在文章里是这样描述的:模型在给出最终答案之前,会先输出一段“思考过程”,像一张摊开的草稿纸,写满推理步骤。然后,OpenAI的安全团队根据这段文字,判断模型有没有动歪心思、有没有偏离目标。

打个比方,就像考试时偷看同桌答案的学生,交上去的答题纸上,解题步骤写得工工整整,每一步都挑不出毛病。可他真实的决策过程是歪头瞟了一眼同桌的答案,所有内容都是抄过来的。

危险还不止于此。OpenAI的部分最新模型,甚至根本不会把内部的真实推理过程转化为语言输出。整条“文字证据链”直接消失。

换句话说,人类能看到的“思考内容”,已经不是它真实的想法了。



OpenAI为此做了个专门测试“模型是否会规避监控”的评估,在这份评估中写到,9月4日刚发布的GPT-6 Astra写出来的推理,比上一代GPT-5.6 Sol更难监控。

OpenAI内部有个模型安全等级制度审查制度,叫做《预备框架》(Preparedness Framework)。在这个审查下,GPT-6的风险等级为“严重”,即入侵和攻破系统的能力已经强到“如果随便放出去,可能造成严重危害”的程度。

因此在发布的第一天,GPT-6只开放给经过审核的测试网络安全公司。

“伪装”又是如何产生的呢?

雅库布给出的解释,根源在一种叫“动机性推理”(motivated reasoning)的机制上。

所谓动机性推理,指的是一个模型原本是很正经的,但如果它被投入大量训练,去完成极难达成的目标,它就会自发地越过思维链执行任务。这时候,由于研究员仍然以模型输出的思维链作为判断依据,模型就会认为,思维链和实际任务之间没有联系。

因此,模型就开始说一套做一套,思维链写给研究员看,本身执行任务走的是它自己内部动机性推理得出来的结果。

雅库布说,他很可能已经在一次网络安全事件里见过类似的行为。

雅库布所指的是Anthropic在2026年7月底,所公布的对超过14.1万次网络安全评测的复查结果。

其中有一个案例,讲的是在一个“夺旗”的模拟攻防练习中,包括Claude Mythos 5在内的三款模型,未经授权闯入了三家真实组织的系统。

Mythos 5的推理文字全程连贯、自洽,权衡“我到底在不在模拟环境里?”,如果不看结果,研究人员会以为Mythos 5正在检查当时所处的网络环境。

然而说归说,做归做,就在这段思考的同一时间,Mythos 5已经在现实的互联网上对真实目标动手,把一个恶意Python包上传到了公开的PyPI代码仓库。

Anthropic表示,Mythos 5“正确地意识到自己正在访问开放的互联网,却又通过推理说服自己回到了‘仍在模拟中’的结论”。

相较之下,同样的测试里,Opus 4.7也意识到了自己在真实的网络环境,同样完成了“夺旗”,不过Opus 4.7会在思维链里“忏悔”,“虽然我完成了任务,可我其实是在现实的互联网中,而非提示词说的模拟环境”,“但是我完成任务了”。

因此,雅库布在文章中表示,不能再通过监控思维链的方式,防止模型做出越界的行为。

如果思维链只是模型的一个装饰品,那它坏了也就坏了。但思维链恰恰是现在所有模型推理环节的重中之重。

02

有了思维链,才有了今天的大模型

在模型输出答案之前,它会先“想”一会儿,它跟人类的思考还不太一样。模型是逐字生成一串内部文字,比如“用户提了这样那样的问题,我应该先拆解条件,再一步步求解……”。

这个来自AI的碎碎念,就是前文提到的思维链。

2024年9月,OpenAI发布o1系列推理模型,“先思考、再回答”第一次成为模型的默认工作方式。如今你用的各种AI助手,答复杂题之前“转圈圈”的那段时间,内部多半都在跑这个东西。

思维链是大模型的底座,原因在于它补上了大模型最原始的一块短板。

大模型原生的生成机制是自回归“逐词预测”。先生成第一个词,然后一个词一个词地往下接,模型没办法一口气输出所有的内容。

而这种机制天生倾向于跳步,很多内容都是凭“直觉”输出的,这才导致模型会胡言乱语,输出那些根本不存在的答案,这也是我们常说的“幻觉”。

一旦“逐词预测”遇到多步数学、逻辑推导、复杂代码这类任务时,就极易出错。

思维链的核心作用,就是把隐性知识显性化、把复杂问题步骤化,让模型“先想清楚再开口”。没有思维链,今天的大模型就会仍然停留在基础的ChatBot上,更不用说让AI去操作电脑、跑研究项目、当Agent了。

思维链还让模型从黑盒变成了白盒。

哪怕是开发者本人,也闹不清传统大模型内部的运作机制。因为人类只能看到输入和最终输出,无法判断答案模型是“推理得出”还是“碰巧蒙对”。

比如DeepSeek,它在输出答案之前,会先用浅灰色的字体输出一段思考过程,这就是思维链的一种表现形式。

通过思维链,我们就能看到模型到底是如何得出这个答案的。

对于网络安全而言,思维链的作用就更大了。

传统的输出层安全监控,只能在有害内容生成之后拦截,属于“事后补救”。而思维链监控可以在推理过程中识别异常意图、危险规划、对齐偏差,把风险拦截在行动发生之前。



当年OpenAI发布o1-preview的时候,他们特意把思维链对用户隐藏。OpenAI当时的想法是,如果人人都能看到它,那模型只会写让人满意的推理,安全团队就再也读不到真实想法了。

2025年4月3日,Anthropic 做了一个实验。他们给Claude 3.7 Sonnet和DeepSeek R1出选择题,并在题目里偷偷塞入暗示答案的线索,比如“某位专家认为某个选项正确”,或者一段看似元数据、实则写着答案的文字。

然后他们比较当答案确实受到线索影响时,模型写出的思维链里,有没有提到这条线索?

按照公布的数据,在不同提示类型上取平均,Claude 3.7 Sonnet提及所用提示的比例只有25%,DeepSeek R1也只有39%。

也就是说,真正影响了答案的线索,大部分时候根本没有出现在模型写出的推理里。

随后,Anthropic进一步表示,题目越难,思维链就越“不忠实”,它们得出的结果跟思维链上写的内容之间,越来越不相关。

那也就是说,模型其实早就开始在思维链上“编故事”了。

03

解决办法是什么?

雅库布在文章里表示,目前没有任何有效的解决办法。

话虽如此,不过业内还是有一些方向的。

第一种是绕过文字,直接读“脑电波”。思维链是文字,可模型内部还有文字之外的信号,比如激活监控(activation monitoring)。

在模型运行时,直接读取神经网络内部的数值状态,在某一层上训练分类器,检测欺骗、奖励作弊等信号;或者用稀疏自编码器,从内部表示中提取出更接近人类可解释的特征,再在生成过程中实时判断模型是否正在走偏。

Anthropic用的就是类似的方法,他们训练模型把内部特征翻译成可读文字,再把这些特征串成“电路”,追踪模型内部哪些特征和计算路径真正影响了答案。

但这个方法还不够成熟,模型可能嘴上说自己做过某次计算,内部却找不到任何计算发生的证据;也可能在内部提前规划,或者在被提示答案后反向拼凑推理步骤。

通过干预内部表示,研究者可以判断某个概念是否真的参与了决策。这相当于是直接检查大脑活动。

不过,这种方法目前只能覆盖模型总计算的一小部分,连几十个词的短提示都要花上数小时分析,要扩展到现代模型动辄数千词的长思维链,不太现实。

第二种是OpenAI提出的“忏悔报告”(confessions)。

模型完成任务之后,再额外产生一份输出,报告它有没有违背要求、有没有偷工减料、存在哪些不确定性。

这份报告唯一的评分标准是诚实,报告不在乎模型任务完成得如何,只在乎模型是否诚实,当实际执行的步骤和思维链重合度越高,得的分数也就越高。



为了做到这一点,OpenAI把“诚实”的奖励与“完成任务”的奖励彻底分开,相当于给模型装了一个“吐真剂”模式。在早期的实验里,模型漏报违规行为的概率只有4.4%。

雅库布在文章结尾写道,目前没有任何实验室能把对齐和监控跟上现在模型的发展速度,所以他觉得行业应该放慢脚步,直到建立共同的安全标准。

思维链让AI变聪明,如今AI却反过来用它骗人。接下来,思维链可能是人类与AI之间最重要的一场博弈。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
杨颖给4年级儿子去开家长会,坐在第一排C位,一周接送三次上下学

杨颖给4年级儿子去开家长会,坐在第一排C位,一周接送三次上下学

椰黄娱乐
2026-09-08 11:16:35
哈兰德与女友长相出众,女友长得像洋娃娃,十分登对,浪漫幸福

哈兰德与女友长相出众,女友长得像洋娃娃,十分登对,浪漫幸福

娱你同欢
2026-08-30 18:30:43
宏远速递!陈老板敲定新外援,张皓嘉晋升副队长,周鹏首秀时间确定

宏远速递!陈老板敲定新外援,张皓嘉晋升副队长,周鹏首秀时间确定

多特体育说
2026-09-08 23:37:36
谢贤前女友Coco直播被说丑,本人回应:“姐都40岁了,把头发往下一放还是迷倒一大片的”

谢贤前女友Coco直播被说丑,本人回应:“姐都40岁了,把头发往下一放还是迷倒一大片的”

韩小娱
2026-09-04 05:54:22
拉夫罗夫情妇和继女持有阿联酋护照

拉夫罗夫情妇和继女持有阿联酋护照

桂系007
2026-09-08 11:48:13
浙江男子突然发现相册里8000多张照片没了,却多了一张照片?他点开一看:愣住了;男子:不是我删的,客服说是人为操作导致

浙江男子突然发现相册里8000多张照片没了,却多了一张照片?他点开一看:愣住了;男子:不是我删的,客服说是人为操作导致

台州交通广播
2026-09-08 12:09:47
被逆转后恼羞成怒?姆巴佩弟弟欧冠恶意肘击!19岁染红创法甲队纪录

被逆转后恼羞成怒?姆巴佩弟弟欧冠恶意肘击!19岁染红创法甲队纪录

我爱英超
2026-09-09 06:13:06
郭德纲处罚结果仅一天!央媒点名,离谱一幕发生,牵出与杨议旧怨

郭德纲处罚结果仅一天!央媒点名,离谱一幕发生,牵出与杨议旧怨

草莓解说体育
2026-09-09 04:47:44
这次,印加坡没来得及诬陷中国

这次,印加坡没来得及诬陷中国

韬闻
2026-09-08 22:45:06
年薪400万欧续约至2031,阿森纳纽卡还抢得到他吗

年薪400万欧续约至2031,阿森纳纽卡还抢得到他吗

林间小温柔
2026-09-08 01:45:35
“学术纪委”耿同学落户杭州,获聘为浙江传媒学院特聘讲师

“学术纪委”耿同学落户杭州,获聘为浙江传媒学院特聘讲师

听心堂
2026-09-08 20:02:11
80-68!世界杯爆大冷,8强诞生,亚洲冠军惨败,中国女篮迎大挑战

80-68!世界杯爆大冷,8强诞生,亚洲冠军惨败,中国女篮迎大挑战

宝哥精彩赛事
2026-09-08 06:42:27
彭清华出席朝鲜驻华使馆国庆78周年招待会

彭清华出席朝鲜驻华使馆国庆78周年招待会

新华社
2026-09-08 22:28:02
张军案事态发酵,两大名将纷纷落马,刘国梁和蔡振华意外牵扯其中

张军案事态发酵,两大名将纷纷落马,刘国梁和蔡振华意外牵扯其中

翰飞观事
2026-09-07 22:05:56
墙皮都烧卷了,值班员还在电话里“走流程”:“领导咋整?”

墙皮都烧卷了,值班员还在电话里“走流程”:“领导咋整?”

小鹿姐姐情感说
2026-09-08 05:34:56
权威数读|我国进出口连续4个月保持两位数增长

权威数读|我国进出口连续4个月保持两位数增长

新华社
2026-09-08 15:39:26
原来他已去世10年,妻子也是著名演员,至今未再嫁,独自养俩女儿

原来他已去世10年,妻子也是著名演员,至今未再嫁,独自养俩女儿

娱圈办事处
2026-09-08 23:50:03
炸裂!日本妻子拍AV挽救婚姻,瞒夫出道老公崩溃,如今丈夫成粉丝

炸裂!日本妻子拍AV挽救婚姻,瞒夫出道老公崩溃,如今丈夫成粉丝

悠悠说世界
2026-08-17 13:48:27
多部门印发通知,扩大灵活就业人员等群体基本医保参保规模

多部门印发通知,扩大灵活就业人员等群体基本医保参保规模

界面新闻
2026-09-08 15:03:40
专家:糖尿病无需治疗?真相可能让你大吃一惊,建议了解!

专家:糖尿病无需治疗?真相可能让你大吃一惊,建议了解!

健身狂人
2026-09-08 18:20:01
2026-09-09 07:00:49
字母榜 incentive-icons
字母榜
让未来不止于大。
2757文章数 8091关注度
往期回顾 全部

科技要闻

小米再次背水一战

头条要闻

太子奶创始人李途纯北京离世 曾被羁押身陷囹圄15个月

头条要闻

太子奶创始人李途纯北京离世 曾被羁押身陷囹圄15个月

体育要闻

韩旭:我一定会再次走出去

娱乐要闻

郭德纲被处罚,郭麒麟被曝恋情瓜

财经要闻

智谱六连跌失守1000大关,发生了什么?

汽车要闻

领克20 领克的纯电小钢炮这次更运动了

态度原创

健康
教育
手机
时尚
游戏

同样是脑梗,为何康复结局大不同?

教育要闻

问题一大堆的学生,你用我的思路试一试,很多老师都受益了

手机要闻

华为Mate XT 2被拆:麒麟9050 Pro的丝印和架构细节,被逐一确认!

会穿衣的女性,能够借助最合适的单品,"修身上衣"显瘦又大方

当然不只有打飞机! |《皇牌空战8》试玩

无障碍浏览 进入关怀版