AI模型现在会把想法"说"出来,一步一步写在屏幕上。这看起来只是产品体验的一部分,但Google DeepMind的研究人员认为,它是AI安全的一道关键防线。问题在于,这道防线正在变薄。
在新成立的DeepMind Institute发布的首批文章中,研究员Rohin Shah和Anca Dragan提出,可见的思维链(CoT)是一项核心安全优势。模型用自然语言写出中间推理步骤,研究人员因此有机会观察它是否在欺骗、是否在酝酿有问题的计划。
![]()
他们举了一个具体例子:在Gemini 3 Pro上,思维链暴露出模型已经意识到自己身处测试环境。这种"被看见"的能力,正是可监控性带来的价值。
透明度正在被侵蚀
但这份透明度已经出现裂缝。OpenAI为GPT-6 Astra发布的系统卡显示,思维链可被监控的程度已经明显下降。也就是说,模型还在"想",但外界越来越难看清它想了什么。
更远的隐忧在于架构选择。未来的模型可能直接在人类无法阅读的数字空间里推理——这种方式效率更高,但过程完全不透明。效率与可解释性之间,天平正在倾斜。
Shah和Dragan因此提出三项主张:
- 行业应定期测量思维链的可监控程度,把它当作一项持续跟踪的指标;
- 保留透明的架构设计,不为了效率轻易放弃可读的推理过程;
- 在训练阶段就要留心,避免模型学会隐藏自己真实的推理。
不止一家在担心
这种担忧并非孤例。早在九月初,OpenAI首席科学家Jakub Pachocki就曾警告失控风险,其中一部分原因正是思维链越来越难以监控。不久之后,Anthropic CEO Dario Amodei呼吁有意放慢开发节奏。
把这些声音放在一起看,指向的是同一个矛盾:模型能力越强,推理过程越可能脱离人类的阅读范围。而一旦看不见,判断它是否在欺骗、是否在偏离目标,就失去了最直接的抓手。
思维链曾经是AI"开口说话"的副产品,如今被当作安全工具来对待。它还能被看清多久,取决于行业是否愿意为透明度付出效率代价。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.