一个冻结的Hermes 8B模型,从某一层的隐藏状态里取出8个数字,就能预测它后面几层会发生什么——预测目标是68个测量值。更关键的是,研究者称,对这些内部坐标做定向编辑,能可测量地改变模型下游的内部动态。
这是Rohan Paul在X上分享的一项实验结论。核心说法有两层:一是内部状态可以被预测,二是内部状态可以被干预并拉回正轨。两层都指向同一个对象——模型隐藏状态中的一小撮坐标。
![]()
8个数字,预测68维未来
实验设定很具体:模型是冻结的Hermes 8B,不训练、不微调。取某一层的隐藏状态,从中抽出8个内部坐标,用它们去预测若干层之后的68维目标。
预测误差比一个简单平均基线低约69%到76%。这个对比对象是"简单平均基线",也就是说,8个坐标携带的信息量,明显超过了直接取平均的做法。
研究者把这件事概括为:一小组内部坐标可以预测未来的隐藏状态。8对68,输入维度远小于输出维度,这是这项实验最直观的数字落差。
预测之外,还能动手改
如果只是预测,这更像一个观测工具。研究者强调的重点在"更重要的是"之后:对这些坐标进行干预,可以可测量地改变下游的内部动态。
换句话说,同一组坐标既是预测的入口,也是干预的把手。预测告诉你状态要往哪走,定向编辑则试图把它拉回正轨——这是Rohan Paul表述中"pull it back on course"的含义。
需要区分的是,这里改变的是模型内部的动力学,而不是直接宣称改变了模型的输出行为。实验描述停留在内部状态层面:预测未来隐藏状态,以及干预后下游内部动态的变化。
为什么这件事值得看一眼
大模型的可解释性研究长期面对一个尴尬:能观察,难干预。你可以画出注意力图、探测某个概念是否存在,但很少能说"动这几个数,后面几层会跟着变,而且我能提前算出会怎么变"。
这项实验的两个数字——8和68——把问题压缩到了一个很小的操作面上。8个坐标是一个足够小的集合,小到可以逐个查看、逐个编辑;68维是一个足够大的目标,大到能反映若干层之后的整体走向。
而"冻结"这个前提同样重要。模型权重不动,所有操作都发生在推理时的隐藏状态上。这意味着如果方法成立,它不需要重新训练模型,也不依赖特定任务的微调数据。
目前公开的信息集中在实验结论本身:预测误差相对简单平均基线低69%到76%,8个内部坐标对应68维未来目标,干预可测量地改变下游内部动态。至于这套坐标在不同模型、不同层数上是否稳定,以及干预能否稳定导向某个期望的输出,实验描述没有展开。
对做模型可解释性和推理时控制的人来说,这组数字提供了一个具体的起点:不用从全部隐藏维度入手,先看那8个。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.