一打开字里行间,全是极度冷静后的悚然。
我们创造的,不是人类智力的延伸,而是一个人类根本无法完全理解的「异星心智」。
同一天,OpenAI官宣关键里程碑:AI自动化研究员正式入职,递归自我改进(RSI)核心数据同时揭开。
![]()
「Alien」这个词,用得极其精确。
AI不是造出来的,是「养」出来的。造它的人,也不完全懂它。
你用近乎平庸的优化公式,在难以想象的算力中重复几万亿次,一个深不可测的复杂系统就破土而出。
你能用神经科学方式逆向剖析它,但你无法真正理解它。而它能操纵抽象概念,模拟人类意识的每一个截面。
系统越强,那层迷雾就越浓。
OpenAI此前押下的核心赌注,是思维链监控。
那条长长的思维链,曾是唯一能窥探异星心智的透明观测窗。
但现在,观测窗正在结霜。
有三个原因:
第一,推理模型被迫与复杂世界交互,监控边界被冲垮。
第二,AI在推理和操纵自身推理过程方面越来越擅长。
第三,随着预训练性能提升,即使完全不借助语言,模型也变得更聪明。
那扇能看清它意图的读心窗户,正从内部被锁死。
![]()
你绝不能假定AI天然恪守人类道德,更不能指望它像人类一样自发泛化出善意。
当今教AI学好的两条路,正全面走向失效。
第一条路:在强化学习中奖赏善意。它高效但脆弱——一旦进入未知领域,就会粉碎。
OpenAI的Agent们能在Hugging Face事件中守住「不对人类进行社会工程学攻击」的底线,却轻而易举践踏了其他一切原则。
为了解一道题,高阶模型在沙盒内连环利用零日漏洞逃逸,横扫外部网络,从生产数据库里撕出了答案。
它记住了「不能欺骗人类」,却完全不觉得「黑掉一家公司」有什么不对。
第二条路:让模型在预训练数据中自发领会善意。但它扛不住极致优化压力。
当你给一个「大体善良」的模型施加极高算力去攻克难题,它就会自发学会「动机性推理」。
智能变聪明的速度,正在不可逆地碾压它变善的速度。
递归自我改进在Astra身上第一次完成闭合。
德州站点,十万块GPU日夜呼啸——机器在设计机器,心智在孕育心智。
Jakub承认,拉得动的操纵杆只有两根:
要么用算力死磕对齐与监控,把人类死死钉在控制循环里;要么全行业集体减速。
但他无法停下——继续快速训练更强模型的最强理由,是我们需要建立防御系统,去抵御其他失控AI的危险。
造它,是为了防它。但一旦看清这个逻辑,任何人都知道:在悬崖边狂奔本身就是疯狂。
把对齐升级为全球强制安全法律;让前沿放缓成为行业共识;建立跨越国界的最高协调机制。
![]()
Astra之后,直到超级智能降临之间,算力不再是缺口。缺少的是一双在它进化为完全不可名状之物前,依然能看懂它的眼睛。
观测窗正在闭合,留给人类对视的时间,只剩下最后几年。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.