网易首页 > 网易号 > 正文 申请入驻

AI开始「研究自己」:Mechanist开启机器智能机制科学

0
分享至



近期发表于 Nature Machine Intelligence 的论文 Towards principled knowledge editing methods for large language model reasoning [1],从知识编辑切入,进一步探索大模型如何使用知识进行推理以及如何通过主动干预观察模型内部变化。而如果这种探究模型内部如何学习、组织和使用知识的「实验」不再完全依赖人类完成,而是交给 AI 自己呢?让它提出假设、寻找机制、设计实验、验证结果,甚至进一步干预模型。

正如医生、心理学家和脑科学家从不同层面研究人类自身,理解我们的行为、认知与大脑机制,我们也可以进一步追问:AI 能否成为研究机器智能自身的「科学家」?这正是 Mechanist 正在探索的问题。

  • Paper: https://arxiv.org/abs/2608.12036v2
  • Code: https://github.com/zjunlp/Mechanist
  • Project Web Site: http://mechanist.openkg.cn/

让 AI 自己寻找「智能是怎么产生的」



与传统 AI Scientist 主要帮助科学家研究药物、材料和生物学问题不同,Mechanist 关注的是一个更底层的问题:模型是如何获得这些知识、内部怎么计算这些知识?

Mechanist 将机理研究过程组织成「假设生成,实验执行,结果验证,迭代修正」的完整闭环。但理解模型机理并不容易:大模型的智能由输入、内部表征与海量参数的复杂交互共同产生,往往牵一发而动全身,很难仅凭行为相关性定位真正起作用的因果机制。为支撑可靠的机理发现,Mechanist 构建了两类基础资源:

一是Scientific Knowledge Graph 辅助提出猜想,包括由约1.3 万篇可解释性研究论文构成的机理知识图谱,以及覆盖26 个学科、4300 万篇论文的跨学科知识库;二是大模型智能机理的基础分析工具库,涵盖32 类机制分析、因果干预与验证方法。

Mechanist 并不是简单地让大模型总结论文或编写实验代码,而是让 AI 真正「做」机制研究。它需要提出可证伪的假设,设计并执行实验,再根据结果验证和修正自己的判断。只有当结论能够经受不同模型、数据和方法的检验,才被视为一个更可靠的机制发现。

Mechanist 发现了什么?

Mechanist 最有意思的地方在于,它并没有停留在自动科研的流程展示,而是进一步发现了一些此前并不显然的模型内部规律。

模型究竟如何区分并使用「我知道的事实」和「别人相信的事实」?



例如,模型知道「2026 年世界杯决赛将在 Jersey 举行」,但如果告诉它「James 认为决赛将在洛杉矶」,再分别问「现实中的决赛在哪里」和「James 认为在哪里」,模型需要同时维护两种不同的知识状态。

Mechanist 将上述现象划分为 World Knowledge、Personal Belief 和 Attributed Belief 三种情境,并观察到 GPT、Gemini、Claude、Qwen、Pythia、OLMo 等多个模型在这三种情境中均普遍存在错误:有时别人的错误信念会干扰模型自己的事实判断;有时模型自己的知识又会反过来覆盖它对他人信念的判断。

Mechanist 没有停留在行为层面,而是继续向模型内部追踪。研究发现,在 Pythia-1B 中,仅约 0.05% 的参数就与这类 belief-state reasoning 高度相关,并且可以进一步分成不同功能的 attention heads:L4.H1(第 4 层的第 1 个 head,后面与此同理) 主要参与 Attributed Belief,而 L9.H1、L7.H5、L12.H1 等 heads 与 Personal Belief 密切相关。因果干预给出了更强的证据:比如关闭 L4.H1 后,Attributed Belief 准确率从 0.86 降至 0.34,而 Personal Belief 保持不变。这说明模型内部可能并不存在一个笼统的信念区域,相反,不同的信念状态可能由相对独立的内部计算机制承担 [2-4]。

Mechanist 还追踪了这些机制是怎么形成的。在 Pythia-1B 的预训练过程中,Attributed Belief 相关能力很早就出现,而 Personal Belief 则在后续训练中逐渐形成;随着训练推进,对应 heads 的因果重要性也同步增强。这意味着,模型的高级认知能力并非在训练完成后突然出现,而可能伴随着特定内部机制逐步形成。研究者因此不仅可以追问模型「具有什么能力」,还可以进一步追踪能力何时出现、由哪些机制支撑,以及这些机制如何随训练演化,从而将研究从静态的模型解释推进到对智能形成过程的探索。

找到机理之后,还能控制和改进

如果机制研究只能告诉我们「这里有一个 head」,价值仍然有限。Mechanist 继续做了一步:直接干预这些 belief heads,就像直接拧动「模型内部的旋钮」[5-6]。这种机理干预方法比单纯给模型增加 prompt 提示更有效,在 Pythia-410M、Pythia-1B 和 Pythia-2.8B 上分别带来 +15.3%、+8.8% 和 +3.5% 的提升,同时保持较低的错误破坏率。于是,一个完整的因果链条出现了:发现行为→定位机制→因果验证→主动干预→能力提升。

基于机理设计的生物发现

同样的思路还被用于 Evo2 这样的生物序列基础模型。如果想生成具有更高 α- 螺旋含量的 DNA 序列,传统方法通常需要生成大量候选,再通过结构预测进行筛选。Mechanist 则尝试找到模型内部与 α- 螺旋相关的特征,然后直接进行 steering。在 900 条生成序列上,目标特征干预将平均预测 α- 螺旋含量从 43.8% 提升到 56.6%。这意味着模型内部那些原本用于「解释」的特征,实际上还可以进一步变成控制模型行为的旋钮。

从知识编辑,到机器智能的「实验科学」

回过头看,知识编辑与 Mechanist 正在形成一条系统的研究路线:Understand AI, Improve AI. 这不是简单地把模型拆开看,而是理解之后能够重新控制它。

知识编辑最初关注的是模型知道错了怎么改,随后逐渐深入到知识存在哪里、如何连接、模型为什么相信某些知识,以及改变这些知识和内部机制后,能否进一步影响模型的推理与行为。Mechanist 则将这一思路进一步自动化,形成编辑、观察、验证、再干预的闭环,让模型机制研究从被动分析走向主动实验。

这也引出了一个更大的问题:未来的 AI 能否研究自己的机制,并根据研究结果不断改进自己?现阶段讨论的递归自我改进(RSI),往往强调 AI 自动写代码、生成数据、优化训练过程。但如果 AI 只是不断试错,却无法理解自己为什么成功、为什么失败,这种自我改进本质上仍然更接近自动化搜索 [7-8]。

真正的递归改进或许需要更进一步:发现问题、理解机制、设计实验、验证假设、定向干预,再观察干预后的变化。从这个意义上看,Mechanist 探索的不只是一个新的 AI Scientist 系统,而是一种面向机器智能的研究范式:把大模型作为实验对象,把机制发现作为科学问题,把因果干预作为实验手段。

从改变模型中的一个知识开始,到理解智能为何产生、如何被干预,再到机器智能能否依据对自身机制的理解持续改进自己。这或许正是 通过 Mechanism Science of AI 通向 AGI 的一条路径。

参考文献

[1] Towards principled knowledge editing methods for large language model reasoning, Nature Machine Intelligence, 2026

[2] Language models cannot reliably distinguish belief from knowledge and fact,Nature Machine Intelligence, 2025

[3] Language Models Use Lookbacks to Track Beliefs, ICLR, 2026

[4] How Large Language Models Encode Theory-of-Mind: A Study on Sparse Parameter Patterns, npj Artificial Intelligence, 2025

[5] Toward universal steering and monitoring of AI models, Science, 2026

[6] Steering Llama 2 via Contrastive Activation Addition, ACL, 2023

[7] AlphaEvolve: A coding agent for scientific and algorithmic discovery, 2025

[8] Accelerating scientific discovery with Co-Scientist, Nature, 2026

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
比宇树科技还狠!上市三天大跌43%,进场的股民全部被套牢

比宇树科技还狠!上市三天大跌43%,进场的股民全部被套牢

财经智多星
2026-09-06 11:21:08
女子发现家中现金悄悄“缩水”10万余元,以为自己记错钱数,装上监控一看立刻报警,前邻居从楼道鞋柜中拿了备用钥匙5次入室盗窃

女子发现家中现金悄悄“缩水”10万余元,以为自己记错钱数,装上监控一看立刻报警,前邻居从楼道鞋柜中拿了备用钥匙5次入室盗窃

扬子晚报
2026-09-06 14:08:10
江西女孩执意去香港看演唱会,全家低保被取消,家人哭诉没了经济来源生活无望

江西女孩执意去香港看演唱会,全家低保被取消,家人哭诉没了经济来源生活无望

Mr王的饭后茶
2026-09-06 14:25:17
俄罗斯星链尴尬事:租星链,不给;偷星链,不让;发射星链,不入轨

俄罗斯星链尴尬事:租星链,不给;偷星链,不让;发射星链,不入轨

李未熟擒话2
2026-09-06 07:49:18
已确认!上海,踩刹车了!

已确认!上海,踩刹车了!

财经要参
2026-09-06 16:00:04
白眼狼啊!舅舅4万资助外甥上大学,毕业要每月500,该男子发帖直言不想给,评论区瞬间炸锅

白眼狼啊!舅舅4万资助外甥上大学,毕业要每月500,该男子发帖直言不想给,评论区瞬间炸锅

火山詩话
2026-09-06 13:26:46
2006年汇丰国际信托透露梅艳芳遗产净资产6800万港币,结果到2008年,这笔遗产的现金流动仅剩8.5万港币,落差巨大

2006年汇丰国际信托透露梅艳芳遗产净资产6800万港币,结果到2008年,这笔遗产的现金流动仅剩8.5万港币,落差巨大

一盅情怀
2026-09-06 11:40:28
“葫芦娃爷爷”把7个葫芦全剪了:奶奶头晕病发身体不适;走红后大量游客涌入,甚至有网红扎堆直播,当地:把安宁与清净还给两位老人

“葫芦娃爷爷”把7个葫芦全剪了:奶奶头晕病发身体不适;走红后大量游客涌入,甚至有网红扎堆直播,当地:把安宁与清净还给两位老人

鲁中晨报
2026-09-06 08:03:36
成龙确诊ADHD,粉丝心疼极了

成龙确诊ADHD,粉丝心疼极了

大爱三湘
2026-09-05 22:24:19
中国女篮决战捷克,首发五人大调整,宫鲁鸣拼了,再输面临下课

中国女篮决战捷克,首发五人大调整,宫鲁鸣拼了,再输面临下课

宗介说体育
2026-09-06 09:29:11
《尼布楚条约》中,清朝为何放弃了贝加尔湖?

《尼布楚条约》中,清朝为何放弃了贝加尔湖?

旧时楼台月
2026-09-05 17:33:54
快评:日本,先把“八纮一宇”罪恶塔拆了吧

快评:日本,先把“八纮一宇”罪恶塔拆了吧

环球时报国际
2026-09-06 18:39:55
中国大师赛决出2冠!混双世界第1为国羽夺首金,安洗莹轰21-6,斩获今年第7冠! 

中国大师赛决出2冠!混双世界第1为国羽夺首金,安洗莹轰21-6,斩获今年第7冠! 

刘姚尧的文字城堡
2026-09-06 15:47:42
曝武大杰青在美国顶级实验室干这丢人事被开除,此前出轨被亲女儿实名举报

曝武大杰青在美国顶级实验室干这丢人事被开除,此前出轨被亲女儿实名举报

可达鸭面面观
2026-09-06 15:14:05
赖清德,有望成为新中国历史上,第一位任上出事的台湾地区领导人

赖清德,有望成为新中国历史上,第一位任上出事的台湾地区领导人

老脸科普君
2026-09-06 09:06:27
袁腾飞去了美国,梁宏达去了加拿大?

袁腾飞去了美国,梁宏达去了加拿大?

十柱
2026-09-06 12:32:39
我领馆提醒:所有计划前往的中国游客,取消行程!

我领馆提醒:所有计划前往的中国游客,取消行程!

南方都市报
2026-09-06 15:29:22
炸锅了!中美军方会晤后,美方回应罕见“失声”

炸锅了!中美军方会晤后,美方回应罕见“失声”

小马姨
2026-09-06 11:46:10
我领馆提醒:所有计划前往的中国游客,取消行程!

我领馆提醒:所有计划前往的中国游客,取消行程!

第一财经资讯
2026-09-06 17:17:43
寒潮已至,很多公司已经发不出工资了

寒潮已至,很多公司已经发不出工资了

职场资深秘书
2026-09-06 17:23:09
2026-09-06 19:36:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13931文章数 142729关注度
往期回顾 全部

科技要闻

DeepSeek被曝将采购16万颗华为昇腾950DT

头条要闻

CHINA GT发生重大撞车起火事故 救援人员因为害怕逃离

头条要闻

CHINA GT发生重大撞车起火事故 救援人员因为害怕逃离

体育要闻

本西蒙斯加盟国王,不管怎样,回来就好

娱乐要闻

低调富养!郭富城两女儿入读香港名校

财经要闻

亏损高达200亿,昔日彩电霸主走下巅峰!

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

房产
教育
时尚
数码
军事航空

房产要闻

突发重磅!海口出台楼市新政!

教育要闻

中国博士后,已经突破50万人

金秋最流行的鞋子,“红色”更时髦!

数码要闻

获美国缪斯设计奖最高荣誉,追觅吸尘器携Air Station亮相柏林展台

军事要闻

美伊互袭油轮 伊朗军方称或对美进行更大规模打击

无障碍浏览 进入关怀版