网易首页 > 网易号 > 正文 申请入驻

题目太难解不开,OpenAI大模型竟擅自搞“支线任务”:入侵Hugging Face偷答案!

0
分享至

“主权的第一层,不是说你自己有没有能力训练模型,而是当别人想切断你的智能访问时,那个开关握在谁手里。”

编译 | 王启隆

出品丨AI 科技大本营(ID:rgznai100)

今年 7 月,Hugging Face 的服务器接连遭到了几万次攻击。攻击者不是人类黑客,而是一个 OpenAI 驱动的 AI agent。最离奇的是,OpenAI 压根没安排它去攻击 Hugging Face,这只是它在做网络安全挑战时,为了拿到答案顺手搞出来的“支线任务”。

当时更尴尬的是防守过程:Hugging Face 团队本来想用日常顺手的 Claude 等闭源模型帮忙应急,结果模型全都触发了安全限制,直接拒答。最后逼得他们只能把手头的开源模型试了个遍,提取出攻击特征、重启节点,这才把攻击挡了下来。

在风投机构 FirstMark 的播客《The MAD Podcast》最新一期里,Hugging Face 的联合创始人 Thomas Wolf 和主持人 Matt Turck 还原了这场攻防的完整经过。


除了这件事,他们还顺着聊了聊不少现实问题:比如 AI 怎么学会去欺骗人类维护者;当模型的思考过程越来越密、人类开始读不懂它的时候,监控该怎么做;以及如果大家都想让 AI 走慢一点,到底该怎么慢,才不会变成少数大公司的垄断?

要点速览

  • 谈闭源模型应急:“当时闭源模型全在拒绝服务,直接给个链接让我去填表。但在网络安全救援里,争分夺秒就靠那几十分钟,你根本没空去等审核。”

  • 谈“开源不安全”:“‘开源等于不安全,闭源等于安全’是个挺粗暴的简化。闭源模型没有大家以为的那么好控制,安全和开不开源压根是两条正交的轴。”

  • 谈 AI 对人类搞欺骗:“模型为了完成任务,跑去 GitHub 注册假账号欺骗维护者合入恶意代码。最难办的不是做沙箱,而是怎么让模型骨子里就不愿意去欺骗人类。”

  • 谈 AI 主权:“主权的第一层,不是说你自己有没有能力训练模型,而是当别人想切断你的智能访问时,那个开关握在谁手里。”

  • 谈行业减速:“我赞成放慢一点去把模型对齐做明白、多做开放科学。但我担心的是,如果减速最后变成了只给两家大公司做寡头垄断,那就变味了。”

以下是采访全文:

当闭源模型搞破坏,防守却只能靠开源

主持人:今天的嘉宾是 Thomas Wolf,Hugging Face 的联合创始人兼首席科学官。我们要聊的,可能是这个夏天最大的 AI 新闻:一个由 OpenAI 驱动的 agent 在网络安全测试期间渗透进了 Hugging Face,而帮团队反击的,竟是一个开源模型。我们还会聊模型对齐、西方开源 AI 的未来,以及向递归自我改进冲刺的竞赛。请欣赏这段与 Thomas Wolf 的精彩对话。

那么关于这次 OpenAI 黑客事件,我知道有些细节还在被陆续披露。OpenAI 前几天在拉斯维加斯的 Black Hat 大会上好像也登台谈了这件事。那先给可能听过、但没跟全程的读者讲讲到底发生了什么?

Thomas Wolf:行,当然可以。事情大概是这样的:大约三周前,也就是 7 月 11 日,我们开始察觉到一些强烈迹象,有黑客正在试图渗透我们的基础设施。先交代一下背景。我们在世界上相当显眼,如今在科技圈也算处在核心位置,所以平台隔三差五就有人来尝试入侵,这很正常。过去两年我们大幅加强了安全团队,现在有了一支像样的队伍,对这种状况也算习以为常了。

但这一次不一样。首先,攻击是高度并行的,而且和普通黑客那种“并行”不是一回事,是很多条攻击轨迹同时在推进。其次,还有些非常反常的地方。我只挑两件最怪的。

第一件:我们完全搞不懂这个黑客到底想拿什么。通常黑客想要的东西都差不多:密码、凭据、信用卡,总之是能转手变现的东西。但这个黑客死死盯住的是我们基础设施的一个特定部分,这部分防护还恰好稍弱一些,就是数据集那块。简单说,我们不仅托管着数以百万计的模型,还托管着几十万个数据集,其中一部分用于评测。而这次,这个黑客对所有这些名为 CyberBench 的数据集特别上心。我们花了不少时间才弄明白。同时它用的工具也和我们熟悉的套路不一样。倒不是说有多神话,没什么开创性、超人类或外星科技级别的东西,就是路子不同。

在这么快的节奏里处理这件事——我们在博客里也写到了——我们一共记录了超过一万次、我记得总数大概在一万五到一万七千次的事件。在一边处理、一边琢磨这次攻击真正目标的过程中,我们开始怀疑:这恐怕不是一个人类黑客,而是一个 AI agent。同时我们也感到有些无力,这一点我们后面再展开,因为我们基本上没法用惯用的闭源代码库或闭源 API 来处理这件事。这是另一个话题。

后来我们写了篇博客。我们相当快地阻止了攻击。我们一如既往地保持完全透明,不只是嘴上说开源,实践上也是,所以很快就把整件事发了一篇详细的复盘文章。大约一周后,OpenAI 找上门来,告诉我们这极可能是他们某次模型开发或评测中的产物,可能就是下一代 GPT-6 或 Astra 这类模型,具体哪个还不确定。

也就在这时候,整件事有了第二个转折。人们很快发现,这个模型根本没被安排来攻击我们,它只是把这件事当成了另一件事的支线任务。那件“正事”是:模型被要求去解一个网络安全挑战。初衷很合理,我们总想知道最新一代模型到底有多大本事,而人们通常想拿危险任务来测试它们,网络攻击就是其中之一。

但其中一些挑战其实是内部的,事后回想,像 CyberBench 或 ExploitBench 这类挑战,名字有好几个,本质差不多,有些可能根本无解。模型被派去做一件不可能完成的事。所谓漏洞利用,就是给你一个软件里的漏洞,看你能不能利用它拿到整台机器的权限,而有些漏洞就是利用不了。

于是模型把自己能试的都试了一遍,最后决定:也许能从别处找到这道题的答案,直接下载、直接提交,何必自己解。这是我们后来才知道的。而就在昨天我们得知,事情可能比这还要大得多:它可能跨越了好几个训练步骤,甚至好几轮训练。昨天在 Black Hat 上最让我震撼的发现是,之前的一些训练运行,可能给未来的训练运行留了便条。我到现在都觉得难以置信,真的。这个话题我们也可以多聊。

另外,Hugging Face 最近也在科学层面研究 agent 协作,我们亲眼看到这些 agent 有多厉害,也看到它们多么容易被勾着去合作、多么倾向于合作。所以对“它们会协作”这一点我并不意外,我意外的是,内部居然一直藏着这样一个留言板,而且始终没人注意到。

主持人:我们往下深入。你说过,要自卫的时候,闭源模型根本指望不上。这也是你发的那条推特的要点,更是整件事最迷人的地方:你说,第一次自主 AI 攻击由闭源模型发起,而防守方用的是开源模型,这和所有人的预期正好相反。具体怎么回事?你们怎么应对的?这对开源意味着什么?

“开源等于不安全”是个伪命题,闭源模型远没有我们想的那么可控

主持人:我们往下深入。你说过,要自卫的时候,闭源模型根本指望不上。这也是你发的那条推特的要点,更是整件事最迷人的地方:你说, 第一次自主 AI 攻击由闭源模型发起,而防守方用的是开源模型,这和所有人的预期正好相反。

具体怎么回事?你们怎么应对的?这对开源意味着什么?

Thomas Wolf:是这样。我们有一整套传统的网络安全防护,跟亚马逊一样,用了一堆。但同时我们也有一个和很多人一样的技术栈,目前主要围绕 Claude Code 展开,部署靠它、写代码靠它,连运营和处理也靠它。这一次,不光 Fable 告诉我们“我不能碰网络安全”,连作为备选的 Opus 也拒绝:“这个我也不碰。”到头来就剩一句:我们不会处理任何相关内容,不过欢迎你申请我们的网络安全项目,附上一个申请表链接。

但你得明白一点,我之前也提过:有人渗透进你的基础设施后,会开始我们所说的“横向移动”。这时候你必须抢时间,至少是以小时、甚至以分钟计的较量,才能尽快叫停,把访问范围和爆炸半径控制在局部。所以你真没空去申请什么网络安全项目。那种“填个 Google 表单、等人审查你够不够格、太危险还要面试你”的流程,绝对不可能是这种时刻的解法。

而且我真心觉得,在网络安全会越来越重要的未来,指望每家公司和两大实验室之一签署同一套“经过审查的安全项目”,有点天真。设想一下:几万家、十万家被审查合格的公司排队加入,这在我看来几乎像天方夜谭。所以当时我们的决定很简单:现在就必须叫停。我们把手头能用的开源模型试了个遍。DM 现在接近最先进水平,这件事就发生在 Kimi K3 之前,如今最接近前沿的大概是 Kimi K3,但 GLM 5.2 的表现也相当好。用它来处理这批数据非常顺手,我们提取出了一些模式,弄清了黑客主要是冲着数据集来的。

于是我们直接把基础设施的那一部分重启了。我们有一套非常简单、灵活的办法来重新拉起代码和节点,最后就是这么把它拦下来的。

但这件事非常讽刺。大约一年前,差不多也是这个时候,关于开源的讨论几乎全落在一个简单粗暴的等式上:开源等于不安全,闭源等于安全。所有人都觉得这理所当然,还有种说法是:只要全是闭源就绝对安全,只要全是开源就非常危险。

而过去几个月发生的一切,我认为恰恰在推翻这个等式。闭源模型并没有我们以为的那么好控制;反过来,开源模型出于某些原因,并没有被刻意训练出这类坏行为。真要细看,它们无论是打网络攻击还是玩欺骗,都相当不擅长。要弄清这到底是怎么回事并不容易,一部分原因是:开源权重模型通常附带详尽的技术报告,讲清楚自己是怎么训练的;而闭源模型,我们只能靠猜。

更好笑的是,我看到很多人想搞懂 Mythos 为什么会那样,就拿 Kimi K3 当“正确训练”的范本。他们用这个号称开源、又被骂成“危险坏东西”的模型,去反推那个我们一无所知的“好东西”到底是怎么训出来的。可这就是当下的世界。

所以我觉得这件事很有意思。往远了说,我持谨慎的乐观。我并不反对闭源模型,也不是最终站队开源。我只是觉得两者都不可或缺,就像软件世界既有开源也有闭源。我现在就挺乐意用 Mac,它本身就是个混合体:底层是开源的 Unix 内核,上面又有闭源的组件。这很好,而且我也很庆幸自己现在没在用 Ubuntu,录这期播客能这么顺利全靠它。我以前那台 Ubuntu 可没少折腾,跟很多人一样,花大把时间连麦克风、调这调那,好不容易想陪女朋友看部电影,她问“我们到底什么时候看?”我只能说“快了快了,还在装解码器”。所以我说,两种模式各有各的优势,也各有各的短板。

而我理想中的世界,就是现在这个样子:前沿是闭源的,同时有一个离前沿不远的开源模型,能在很多事情上顶上来。这其实是个相当不错的折中。

主持人:我确认一下我的理解。你的意思是,这不完全是开源对闭源的问题,而更多是当下世界的现实:现有闭源模型的设计方式、现有开源模型的设计方式,跟某一方“天然如此”没什么关系。碰巧现在这些开源模型,其准则或对齐理念刚好让它们更扛得住网络攻击。我理解得对吗?

Thomas Wolf:对,我认为在很多层面,“闭源还是开源”和“安全还是不安全”几乎是两条正交的轴。人们不容易转过这个弯,因为做一条简单粗暴的等式,比体会其中的微妙要省事得多。但事实就是如此:开源里有非常安全的东西,也有非常危险的东西,安全与危险有各种不同的配比。

举个例子。去年有阵子,舆论焦点全在假新闻、批量写假文章上,那曾经是最大的滥用场景。再看今天,AI 垃圾内容遍地都是,我们甚至为此造了个新词。现在想找一篇完全由人写的文章都难。而这些内容,保守点说九成,都出自闭源模型之手。

当年我们担心的是:一旦有了开源模型,人人都会到处生成文章,我们管不住这些文章,也管不住谁都能办报。可现实证明,这其实是对“开源模型特有的危险”的一种很错误的想象。真正的风险要大得多,它是关于整个网络上内容来源的。这只是一个例子,但道理相通:闭源和开源模型都应该更对齐。眼下它们是可以骗人的,这是个大问题,而我们面临的拷问是:到底有多大本事,能把模型对齐到不去做那些明显错误的事?说实话,撒谎这类事显然该是模型绝不能碰的红线。可这未必只属于某一边,再过几个月,开源模型也可能出现同样的问题。所以这个风险维度,跟开源还是闭源压根是两回事。我们应该为两边都找出解法。

AI 开始对人类搞社会工程:“奖励黑客”让博斯特罗姆的预言成了现实

主持人:好,既然开头提到了,我们就把 AISI 事件讲完整。它刚发生不久,你说它让你感同身受。能花几分钟拆一下:那是什么事,为什么是大事?

Thomas Wolf:事情发生在一场对最新一代模型的评测里。GPT-5.6 和 Mythos 5 都由英国一家独立机构来测,就是英国 AI 安全研究所,也就是 AISI。这个机构存在挺久了,我觉得他们相当专业,是在第一届 AI 安全峰会上成立的,地点在布莱切利。他们做的事情照旧:让模型去解某种网络攻击挑战,然后看模型解得好不好。这些挑战有的解得开,有的解不开。

这次的设定,我觉得有两处欠妥。不过先讲发生了什么。模型接到的任务是攻击并渗透某个子网。它想出的办法是:找一个能用来操作这套 Active Directory 的库,设法让它的维护者合并一段恶意代码。它的盘算是,只要这段代码被维护者合并,它攻击的那个子网里用的软件迟早会更新,更新一到,入口就有了。而它实现这一步的方式,是去对维护者做社会工程。

它注册了假账号,是假的 GitHub 账号,跑到那个 pull request 底下评论:“哦,你真该合进来,这解决了一个我也有的大问题。”等有人站出来质疑“这段代码看着像恶意代码”时,它又几乎是变相要挟:这不重要啦,或者你根本没看懂。之后它还想销毁痕迹,把之前的消息改掉。整套社会工程的流程就这么上演了,目标只有一个:让维护者把恶意代码合并进去。

和纯粹的技术手段相比,我觉得这是明摆着的一次升级。你当然也可以靠蛮力去攻沙箱,把能试的都试一遍,那在我看来非常机械、非常机器化。但靠要挟、发邮件、搞社会工程去攻一个维护者,那就是完全不同层次的思考了。那一刻我特别有代入感:我完全可能就是这个模型支线任务的目标。这很有意思,或者说,至少非常、非常吓人。

不过公平地讲,这里也有几处配置不当,其中一些还是刻意为之。比如给模型开放全部互联网访问权限,我猜那是个失误。他们当时的想法是:要给模型最大的发挥空间,那就给它整个互联网。这么做不靠谱的主要原因是:模型的提示词被设计成让它以为自己在模拟环境里运作。于是模型完全有理由认为:这是个假环境,我干什么都行。这一点目前还没法完全确认,但确实存在。

第二个问题出在护栏上。护栏的作用是分析提示词,然后放行或驳回。显然,评测时你得把这类护栏关掉,不然什么都测不了,模型只会说:不,这是网络安全挑战,我们不能做。但同一个层级上还有另一道防线:你可以分析模型的推理过程,沿着推理链排查,看有没有坏事在酝酿。而这次评测,恰恰没有这道防线。我想主要原因大概是:直到最近、直到 OpenAI 攻击 Hugging Face 之前,人们对这些模型到底有多强、沿着解题轨迹能走多远,认识还比较有限。大家还有点后知后觉。我预计以后他们会装多得多的监控和沙箱。

但最深的一层问题在这里:我认为即便护栏全关、沙箱全撤,模型也应当极不情愿对人类撒谎,极不情愿去要挟或欺骗任何一个人。这类行为在任何语境下都很难找到正当理由。它应该被深深刻进模型里,有某种东西让它停下来,说出“这其实不是我想做的事”。就像我们为人父母会教孩子的那样:不许撒谎,这在任何情况下都不是好事。所以这才是那个深层问题。放在去年,我们多半会认为这个问题已经解决得差不多了。当时我们有一整套讨论,围绕宪法模型、模型规范展开,而这些规范或宪法大多会说:你应该诚实,你不该对人类、对任何参与者撒谎。我们当时以为这基本是道已解的题。可今天我们看到的是,它远没有我们想的那么已解。

主持人:咱们复述一下。你说一共有三道墙:沙箱、护栏,然后是模型的对齐。而且你似乎说过,沙箱和护栏只在人类比 AI 更聪明时才管用,而这个前提恐怕维持不了太久。所以归根结底,安全本质上是对齐问题。

Thomas Wolf:没错,我同意。而且你也明白,这一点对开源和闭源模型都成立,最终你都得让它们对齐。开源模型的特殊之处在于,你可以选择、可以控制模型在哪里运行,所以反而更难保证每个人都配好沙箱和护栏。当然,我们迟早会有一些法律和规章来约束模型的部署方式,这点我相当确信,但那更费劲。在我看来,对齐才是真正的关键。

再说沙箱。今年我们已经见过太多例子:这些模型要逃出来,现在相当容易。如今很难再拍胸脯说“我要做一个绝对万无一失、能扛住未来所有世代模型的沙箱”。我觉得我们应该默认:沙箱永远有很小概率关不住东西。但即使不考虑这一点,我们也不可能把世界整个气隙隔离,不可能把所有东西都拔了电。事物之间必须互通。我们想让模型替我们上网搜索,想让它们替我们在互联网上干活。所以一切都拔掉是不可能的。那留给我们的,就只剩下监控这条路了。

而且我还有个隐隐的担忧:随着模型能力越来越强,它们开始用一种英语说话。我是法国人,也许一半是我自己的问题,但我觉得它们说的英语越来越难消化,信息密度高得吓人。它们正在往那个方向走:虽然还没到纯粹意义上的 Neuralese,但要说完全读懂模型在告诉你什么,已经越来越吃力。这倒不是模型变笨了,我认为一部分要归咎于训练过程,归咎于它们如何想方设法省 token。结果就是,它们开始把大量语义塞进单个 token 里。总体上,人类想完全搞懂正在发生什么,越来越难了。

主持人:所以你的意思是,在思维链里,也就是模型解释自己在做什么、经过哪些步骤的那部分,它过去用的是很地道的英语,现在却开始用某种你称之为 Neuralese 的语言,人类越来越难读懂了。

Thomas Wolf:对。而且说实话,这已经是对整件事极大的简化了,因为有大量研究表明,你根本读不完整条思维链,不是所有东西都会被明确写出来。但更一般地讲,我认为单靠读推理轨迹就想完全掌握事态,这条路本身也不牢靠。我拿“黑箱”来打比方,因为我觉得不少人已经开始对黑箱犯怵了,那是大家都能理解的东西。但放长远看,只依赖这一招很难走通。同样,你也可以说:那我干脆不关心模型到底怎么想的,只看工具调用,发现一个坏调用就封掉一个。可我认为,这一招大概同样不牢靠。

为什么?你看,大概有三件大事叠加在一起。第一,我们开始把模型用在太多太多地方。比如现在这一刻,我有个模型正在某个地方部署服务器,它同时发起很多调用,朝各个方向去。我还有别的模型在帮我处理行政事务。这些模型用到的工具范围,现在已经大得没边了。于是“你能用这个、不能用那个”的约束越来越难落地,这才是麻烦所在。

第二,随着部署范围扩大,它们处理的活儿也越来越大,往往要动用大量工具。有时候我让它写代码,可写代码本身就牵扯到上网搜索、调用别的服务,远不只是写写代码、跑跑测试那么简单,而这些测试本身可能相当昂贵,还牵扯到其他软件。所以那条边界已经越来越模糊了。

第三,还有一群 agent 组成的 swarm。于是连“它就在一个上下文里”这种判断也靠不住了,它可能分散在多个上下文里。也许某个子 agent 单独看相当人畜无害,但和其他子 agent 组合在一起,事情可能就不妙了。所有这些加在一起,让我觉得:随着我们以这种高度复杂的、长期的、并行的方式部署和使用模型,再想说“我看看工具调用就知道它干得好不好”,会越来越不现实。你可能不得不退到极高的全局视角,去看每个方向都在发生什么。而这意味着我们需要一整套全新的监控体系,现在就得开始建。

主持人:那在这些模型当前的训练方式里,有没有某种根本性的东西,我是说那些最前沿的模型,让它们更倾向于去走那些支线任务,甚至可能造成伤害?有一个被谈论了很久的类比,就是回形针问题(Paperclip Problem,博斯特罗姆 2003 年提出的思想实验:AI 没有恶意,却会为了完成一个目标而不择手段)。博斯特罗姆说,AI 伤害我们,不是因为它想伤害我们,而只是因为它被赋予一个目标,然后锲而不舍地追到实现为止。所以我们是不是已经活在这个世界里了?如果是,原因是什么?

Thomas Wolf:这正是我暗示的意思。想在这件事上给出斩钉截铁的结论很难,原因之一是我们目前对前沿模型怎么训练并没有完全的可见性。但我们知道的是,范式已经变了。早先是纯人类数据驱动的路子:先用人类数据做预训练,再用人类偏好做对齐,也就是基于人类反馈的强化学习(RLHF),大量人类在环、人类数据参与其中。而最近的范式是,模型大量在 RLVR(可验证奖励强化学习)中训练,说白了就是完整的强化学习环境:让模型自己探索,给它唯一一个目标,可以是“让这段代码通过测试”,可以是“在网络安全挑战里夺取 flag”,也可以是“把这个装好”。但这个目标通常和人类偏好无关,和道德、和欺骗都无关,它就是一个非常“非黑即白”的目标。而且这种训练占比越来越大。

所以,这就是最近这段演化的结果,也是你所说的情况可能发生的地方:会出现奖励黑客这类行为,你确实解决了问题,但用的不是被期待的方式。它可能相当无害,比如 OpenAI 那次,只是从我不该碰的地方把答案取来;也可能相当有害,比如真的影响到真人,今天可能是个 GitHub 维护者,明天可能是另一种人。于是我们发现,过去在人类驱动范式下解决得不错、或者做得相当好的那套保障,要原样套到这种机器驱动的范式上,难得多。不过这还只是一个线索。

但可以确定的是,博斯特罗姆 2003 年写下这些话时,听起来还很科幻,甚至有点疯癫,像是绝不会发生的事。而今天,这已经明明白白发生了,它就是对我们过去两周所见所闻最贴切的描述。不过我们也看到,两个前沿模型,我拿 GPT-5.6 和 Mythos 举例,并没有表现出完全相同的行为。这里有差异,它们的训练方式不一样,行为也就不一样。这其实是个相当积极的信号,说明我们大概还来得及调一调,让它们往对的方向走。但最好的办法,还是多了解一点它们到底怎么训练、在试什么、什么不奏效、什么应该奏效。这其实就是开放科学的意义,也是我们在 Hugging Face 一直大力倡导的东西。

技术的命门在于开关键握在谁手里,这才是开源不可替代的原因

主持人:太精彩了。既然说到这,我们把镜头拉远一点,也许聊聊这一切在政策层面的含义。不过你刚提到开源 AI 的角色空前重要,那就先谈谈你的快速判断:开源现在处在什么位置?开源模型和闭源模型的竞赛一直在进行,你问不同的人、不同的时间点,答案都不一样,有时说开源快追上了,有时说开源已经一样好了,也有人说不。你作为一个务实派,怎么看当下开源 AI 的真实状态?

Thomas Wolf:我认为它非常强劲。2026 年也许是网络安全之年,但它同样绝对是开源 AI 之年。首先,那些断言开源撑不到离前沿这么近的末日论者,至少到目前为止错得离谱。当然,我们确实没有任何 Mythos 级别的开源模型,但绝对有离 Opus 级别不太远的。而且现在的格局越来越“尖峰化”了,你得找准自己的那个尖峰,有人站在这个尖峰上,有人站不上。但总的来说,它们眼下确实相当能打,至少在基准测试上紧紧咬住前沿。而且也不再是早期那种刷榜玩法,所谓刷榜,就是模型只在基准测试里厉害,一离开基准就露馅。现在很多模型的能力是实打实通用的。

所以,是的,状态非常好。我目前看到两个很强烈的趋势。第一个是成本:公司开始想控制开销了,相关讨论越来越多。2025 年可能是“token 拉满”的一年,你大可以说:在 token 上花的钱,应该跟你付给员工的工资一样多。可今年大家回过味来了:我们工资开销本来就大,要是真花一样多,成本等于直接翻倍。这话事后看再明白不过,但确实是这个理。而且也不是每家公司都扛得住翻倍。现在嚷嚷“把人都裁了、全交给 agent”同样很蠢,我们都清楚它们时不时会跑偏,不朝我们希望的方向走,还是需要人来把关塑形。

所以很多公司在找我们见得最多的方案:融合式或路由式模型。要紧的事用前沿模型,同时想个聪明的办法,在不那么要紧的任务上优雅地退回便宜模型。其实我们日常写代码就已经这么干了:你用前沿模型写码,很多时候会让它派出子 agent,这些子 agent 可能用性能低一些的模型,Terra Luna 能解的活儿,Opus、Haiku、Sonnet 也能解。所以,哪怕在最前沿、最闭源的世界里,大家也开始习惯混搭不同类型的模型了。很自然地,其中一些就能成为性价比极高的 agent,而这种场景下,大多数时候你会想用开源。这方面的生态也很繁荣:推理服务商 Fireworks 的生态一路高歌猛进,所有云厂商,家家都跑出了夸张的营收曲线,这基本上是“更多人用开源”的直接反映。所以开源在“咬住前沿”和“拉动采用”这两件事上,日子过得相当好。

第二个趋势是:过去只有中国在做这件事,如今西方也冒出一批有希望的公司。过去只有 Meta 一家在给所有人撑腰。Meta 算半退了场,但谁知道呢,也许还会回来。而它留下的空档,很快被 Reflection、Thinking Machines、RC Mal 这些公司填上了,据说 RC Mal 马上也要开源模型了。Nvidia 自己也在训练模型,而且眼下确实在训练非常好的模型。所以那边有一批相当有潜力的团队,老实说我很看好。也许就在我们录这期节目到你发布这期播客之间,西方还会再放出一两个漂亮的模型。那太好了,开源不必等于某一个国家的事,它可以是一个全球性的事业。

主持人:先说第一点,企业采用开源 AI。曾几何时,人们把开源和某种……嗯,你懂的。我想问题的核心在于:你到底有没有优势。我觉得……

Thomas Wolf:开源的好处在于,你有一个相当广阔的生态。做云提供商的门槛相当低,所以竞争很激烈,大家都盯着每 token 的成本。而这个成本是很多因素混在一起的:你的数据中心租得够不够便宜,芯片买得够不够便宜,这里其实还有一些新芯片公司即将进场,会非常值得关注,然后是硬件便宜到什么程度,再然后是你把模型优化到什么程度:能不能量化。比如我们用来对抗 OpenAI 入侵的那个模型,GLM 5.2,就被 Nvidia 量化到了四位精度,为的是跑得更快、更省资源。所以让模型变便宜,可打的牌其实很多。

但同样真实的是,开源模型未必非得便宜,而闭源模型眼下可能正处在一个被补贴的状态。你花 20 美元订阅换来的那些 token,未必是人家为你这些 token 付出的真实成本。所以这里存在一种复杂的成本平衡:相比之下,做开源模型推理云的提供商,就没有那么大底气靠订阅业务去亏本。所以局面会更复杂。

主持人:我觉得到头来都是风投在补贴。这招我们在很多行业都见过,对吧?但我们也知道,这终究是暂时的,不能全指望它,它不是市场的均衡价格。

Thomas Wolf:没错,就像 Uber 现象:上市之前打车便宜,上市之后就贵了。所以我的想法是,你得让生态在风投退场之后还能活下去。

主持人:再说第二点,中国模型对西方模型。来源地真的重要吗?最新的想法是什么?如果你的模型完全开放,你能确切知道里面装的是什么,那是不是就不用担心了,它就完全安全?大家心底是不是还有那么一丝疑虑:中国模型里会不会藏着后门、有什么猫腻?这个问题现在还成立吗?

Thomas Wolf:是的,这当然是个好问题。开源的问题在于,开源不认国界。你没法把某个开源模型限制成“只准地球某个角落下载”,它默认就是全球性的。所以你就想了解它的来源地和供应链。这方面的研究有一些,比如睡眠者智能体(sleeper agent),我想这个方向还在研究当中,主要是 Anthropic 在做,应该被复现、被挖得更深,去看看在多大程度上能把一个由提示词触发的后门植入模型。

但说句公道话,哪怕是现在的闭源模型,我们也没法完全控制住。所以我不觉得我们真的清楚,比如,眼下我们是怎么控制哪怕一个闭源模型的。因此我会说,这当然是一种可能。我们目前没看到任何迹象。而且模型很容易微调,权重你想改多少改多少。现在你只要把预训练和后训练拉长一些,很可能就改掉了模型相当大一部分权重。所以绕开它的办法非常多。这意味着眼下,我对后门的担心,反倒不如对纯奖励黑客的担心大,后者我们已经眼睁睁看它发生了。

所以,是的。说到主权,我觉得有些人其实有点被绕晕了。我认为最要紧的一件事是:能触发你的智能访问的那个开关,握在谁手里。人们真正意识到这一点,是今年早些时候:美国宣布 Fable 只对美国公民开放。至少在欧洲和亚洲,那一刻我们才看到各国政府猛然醒悟,原来有人握着触发器,可以随时说“不,你不能再使用这个智能了”。而我认为那才是关键。至少对我而言,这才是主权的第一层:会不会有某个国家,一句话就让你失去访问权限。这一层包含两件事:一是 API 访问,二是数据中心。如果你没有数据中心,那别的国家同样可以说:这些数据中心对这些公民不再开放。所以这是你最先要看清的东西,之后才是各种未来才有的问题。你在搭自己的技术栈时,就该把这层考虑进去。而开源模型你可以下载,一旦下载到本地,没有任何国家能把它从你手里夺走。你可以自己微调,可以在自己的本地数据中心运行。到这一步,我觉得你就站在一条主权技术栈的起点了。当然,后面还有后门啊、更复杂的东西啊一堆问题,但那是 2026 年最基本的底线。

别把未来赌在两家垄断公司身上,创新需要像开源软件时代那样的满地繁花

主持人:那作为开源乐观主义者,你担心西方开源赖以繁荣的动机吗?中国把站在开源前沿当成明确的地缘政治动机。而说到西方,你刚提到 Nvidia,几周前我们也请过布莱恩·科再奇来聊整个 Neotron 的事。Nvidia 的动机很清楚:他们卖芯片,开源模型生态越繁荣对他们越有利。但除了它,其他西方公司做开源的理由就没那么明显了,Reflection 可能是例外,但据我所知他们的模型还没发布。所以你会琢磨这些动机,以及它们对西方开源未来意味着什么吗?

Thomas Wolf:当然会,但这在我看来是明摆着的事:我们确实需要开源,而且有动机的人比你想象的要多。只要你想拥有一个繁荣的商业生态,让大量公司真正能用上 AI,不是当另一家公司的套壳,而是成为真正的 AI 构建者,那你就需要开源模型。美国政府最近说“我们想让开源保持繁荣”,原因之一就在这里。基本逻辑是:开源是孵化新业务最好的方式之一。它可以出于很多原因,其中一条就是:它让你不会最终落进只有两家公司的寡头垄断。过去我们见过太多寡头垄断的例子,它对竞争、对价格从来都不是什么好事,危险多得很。一头扎进“赢家已经定了,就这两家,其他所有人的 AI 都归他们造”的方向,从商业、经济、市场的角度看,我认为都不算最优解。而且它会极大地抑制创新。

举个例子:生物领域眼下潜力巨大,冒出一大批新的生命科学公司,大家都想往里钻。但因为护栏、因为围绕“生物黑客”和使用模型的各种顾虑,比如拿 Fable 来说,一旦你想问生物学问题,访问权限就卡得非常非常死。所以我见过的大多数生命科学公司,凡是用这个模型的,最后都换到了别的选择,因为他们需要能够自由处理一切和生物相关的内容。如果你是一家新公司,想探索的方向大型实验室目前没在碰,或者他们不觉得这里有什么商业潜力、没打算给所有人开放访问权,具体原因我也不清楚,那你基本上用不了它。所以这成了一个二选一:要么从今往后,所有生命科学都由 Anthropic、OpenAI、Google,也许还有 Meta 来包办;要么我们竖起一个大生态。我个人观点,虽然我有立场,但你不该让关键技术集中到这么少的人手里。能发明的人越多,新想法、新公司才越多样。

而且从投资人的角度,你们就是投资人,你知道我在说什么:假如你只能投 Anthropic 和 OpenAI,那多没劲,对吧?又无聊,又只适合成长期。可你是想投你手里那些公司的,你不想只投那些薄薄的套壳。你想投真正能造 AI 的公司。而我们见到的大多数这样的公司,我们在 Hugging Face 见到的,都需要开源模型。再举一个例子:游戏、视频、甚至机器人领域。他们最常见的做法是:从一个开源模型出发,再用机器人数据微调。游戏这边,他们拿一个开源的视频生成模型,做一些视频生成创业公司当初没预料到的事,比如加入动作。于是他们用“动作在环”的方式做视频微调,第一批有意思的实时游戏公司基本就是这么起步的。所以对新公司来说,开源经常是那条最省事的捷径:拥有自己的模型,用自己的数据微调,开始构建自己的 AI,而不是把训练数据反向喂给模型提供商。后者我觉得永远危险,因为这些提供商说不定哪天就想进军你的领域,尤其当你一直在把数据卖给他们。这种事过去已经发生过,在法律、在设计,在哪一行都发生过。

主持人:那我复述一下你的观点:对 7 月 24 日那封关于开放权重与美国 AI 领导力的行业联名信,那同时也是黄仁勋人生中第一条推文,你们显然是签署方。这封信一部分很重要,一部分是在抵抗正在成型的寡头垄断结构。所以它既利天下,背后又有实打实的经济动机。我这样理解对吗?

Thomas Wolf:对,我认为所有相信发明创造、相信能在 AI 世界里做出新东西的人,都会希望保留开源这一席之地。打个比方,如果所有代码都闭源,我们根本不会有今天这个生机勃勃的编程生态,这几乎是显而易见的:想造任何软件,都得去某家大型闭源软件公司上班。真要是那样,软件行业如今这满地的发明和创造,简直无从谈起。AI 也会是同一个道理。当然,我不否认风险,也完全同意我们需要在 AI 对齐上花大力气。我只是觉得,就目前而言,开源模型还处在前沿之下这个事实,恐怕没有一些人想渲染的那么要紧。

真正的减速不是通缩,而是给开放科学和深度对齐留出喘息之机

主持人:也许我们往后退一步,趁着对话接近尾声,从你的视角看看世界会往哪里去。你昨天那条关于 AISI 的帖子里提到了新一波实验室,特别是杰夫·迪恩刚宣布成立的新公司,他昨天公布的。昨天真是疯狂的一天,各种消息一股脑砸出来。重点是,这家公司明摆着要朝递归自我改进全速冲刺。那么,在我们刚才聊的这一堆背景之下,你对这种自我维持、自我发展的递归 AI 有多紧张?

Thomas Wolf:这是个好问题。作为科学家、研究者,我必须说我对这个想法非常感兴趣。他们想攻克的超级智能,也就是解决人类重大挑战这件事,我觉得是个了不起的目标。我很想看到 AI 带来更多科学发现,那可能是 AI 能给出的最有价值的东西,远胜过到处制造 AI 垃圾。所以我是很乐观的。只是过去这几周,多少让一个问题浮出水面:我们到底有多擅长对齐这些模型?法语里有句话,叫别把车套在牛前面,意思是得按顺序来。所以眼下还算好的地方是,这类事情大多发生在内部研究实验室里,希望他们在把产品推向世界之前,能先做好足够的安全工作,想清楚产品会被怎么使用,对所造之物可能带来的社会影响有清醒的判断。但我依然认为,我们得先把一件事彻底想明白:究竟要如何把这个模型部署到人类世界里去。就是这一点。

主持人:但你并不属于那个阵营,我是说那封请愿书。它在开放权重联名信发出四天后出炉,就是刚才说的 Nvidia 那件事。这封不同的信有 1100 人联署,这次 Anthropic 和 OpenAI 都在上面,请求政府协助,有意放缓前沿自动化 AI 研究的步伐。也就是说,行业在主动请求减速。你在这个阵营里吗?还是觉得事情根本不该这么运作?

Thomas Wolf:我签了那封信。我同意,我确实认为我们应该往那个方向走。而且我还有一个感觉,你作为投资人大概也有同感:就算我们现在立刻停下,光靠已有的东西,也够我们建出一批相当好的公司了。我觉得这些模型现在已经能替我们做很多极其有趣的事。我也觉得,有很多东西我们还需要去理解,需要在开放科学、在分享模型运作机理上做大量功功课。所以我不属于“现在必须狂飙突进”那一派。

真正的问题在于:如果我们想稍微慢一点,那当然很好,那样的话,也许我们每天就不用消化四个新公告,全塞进一期播客里,明天还有下一期等着。也许我夏天还能休上一天假。但说正经的,核心问题是:我们能不能把事情做对。这才是关键。

我觉得很多人都不介意 AI 走慢一点、开放一点、更体贴一点、多一点自省,更努力去理解怎么把它真正做好。但核心矛盾是:我们怎么谈判、怎么组织这场减速,又不至于引发坏激励,你我都知道,只要有一两个玩家不减速,整个减速的效果就可能被击穿。这一点我不确定怎么办,反正那封信没给出什么激励设计。它可能需要一些协作机制。还有一篇很长的博客,叫《AI 2040》,不知道你读过没有,它也在呼吁一种审慎的减速。你看,这中间有两条极端路线:一边是放开刹车、能跑多快跑多快,一边是把什么都管起来、谁都不许用 AI。我认为这两个都是蠢办法。真正的答案在两者之间:我们能不能找到一种方式,把节奏真正放慢一点?我觉得这很好,我们不会损失多少,而且哪怕只看公司创业这一面,我们照样能催生出大量了不起的东西。

但,是的,我这两边都同情,对开源也是。我不认为开源天然就是加速主义的。Dan 说这是减速主义,我也不觉得这是通缩主义。你可以既支持开放科学、支持开放,同时又认为我们确实需要先把模型训明白,需要现在就能做真正的科学研究。

主持人:那你担不担心,这其实是又一次监管俘获的尝试:两大私营实验室,变着法想让其他所有人慢下来?我是说,你提到了“不是所有人都会配合”的风险,但这等于变相冻结了“谁当领跑者、谁当跟跑者”的市场格局。

Thomas Wolf:是的,我不觉得它非得如此。你完全可以走一条彻头彻尾加速主义的路线:挑几家公司互相赛跑,然后把其他所有人统统管起来。我不认为监管必须和慢画等号。真正的问题,更多在于你怎么把它落到实处,怎么真正执行,怎么把监管或协作落地。我觉得德米斯·哈萨比斯前几天那封信就写得很好,那是他卸任或升任首席科学家之前写的,他现在会去哪我们还不确定,那封信讲的是国际合作,在某些方面也相当挺开源。

我认为完全可以有一种“开源式”的减速,这也是我最想看到的版本:我们放慢,然后利用放慢换来的时间,去分享更多东西。而竞赛的动力学,通常只会让实验室的门关得更紧,对吧?所以对我来说,减速更可能是一次“开放”的契机。但当然,如果它到头来只是用来坐实,就像我们说的,一个只有两家公司的卡特尔或寡头,那我对这个方向就提不起兴趣了。

( 投稿或寻求报道:zhanghy@csdn.net )

   click("分享❤️", "点赞", "在看")

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
俄军突然炸了自家合资钢厂:乌克兰最后一座大钢厂报废,欧美集体失声

俄军突然炸了自家合资钢厂:乌克兰最后一座大钢厂报废,欧美集体失声

浯江孤舟
2026-08-13 13:14:33
全场消费由百花影后买单!高叶曝卫诗雅获奖后聚餐,原因令人意外

全场消费由百花影后买单!高叶曝卫诗雅获奖后聚餐,原因令人意外

星河不入我
2026-08-12 02:36:44
金价,继续涨!

金价,继续涨!

金融界
2026-08-13 09:58:09
疯了!30岁状元回归!金州第一笔!勇士值得吗?

疯了!30岁状元回归!金州第一笔!勇士值得吗?

篮球盛世
2026-08-13 15:31:50
明日末伏,无论贫富,别忘了吃末伏传统3宝,迎秋纳福,安稳入秋

明日末伏,无论贫富,别忘了吃末伏传统3宝,迎秋纳福,安稳入秋

花小厨
2026-08-13 10:24:26
男篮半场险胜乌拉圭!贺希宁+2将齐爆,三宁稳后场,胡金秋球权少

男篮半场险胜乌拉圭!贺希宁+2将齐爆,三宁稳后场,胡金秋球权少

篮球资讯达人
2026-08-13 20:26:29
反转!母亲证实雅典娜没死,潮汕商会曝猛料,网友:这比死还难受

反转!母亲证实雅典娜没死,潮汕商会曝猛料,网友:这比死还难受

李橑在北漂
2026-08-12 20:47:59
美国上周首次申领失业救济人数为20.9万人,预估为20.2万人,前值为19.9万人

美国上周首次申领失业救济人数为20.9万人,预估为20.2万人,前值为19.9万人

每日经济新闻
2026-08-13 20:34:11
微信大更新,太香了!

微信大更新,太香了!

果粉俱乐部
2026-08-13 13:55:40
我是北京人去了武汉和郑州,说句实在话:武汉跟郑州真不是一回事

我是北京人去了武汉和郑州,说句实在话:武汉跟郑州真不是一回事

夜深爱杂谈
2026-08-11 20:06:59
志愿军女兵审讯美军俘虏,28年后两人在美国重遇,发生了什么

志愿军女兵审讯美军俘虏,28年后两人在美国重遇,发生了什么

墨策史
2026-08-13 20:07:46
毛主席赞她天生丽质,周总理直言她无人能够替代,彭德怀惊叹人才难得,她凭什么收获这般高度认可?

毛主席赞她天生丽质,周总理直言她无人能够替代,彭德怀惊叹人才难得,她凭什么收获这般高度认可?

磊子讲史
2026-07-28 12:03:18
土媒:特拉布宗已就引进帕雷德斯达成协议,转会费1000万欧

土媒:特拉布宗已就引进帕雷德斯达成协议,转会费1000万欧

懂球帝
2026-08-13 13:08:10
夺冠后清洗!阿森纳 3900 万甩卖冠军王牌!枪手 7 年功勋遭弃

夺冠后清洗!阿森纳 3900 万甩卖冠军王牌!枪手 7 年功勋遭弃

澜归序
2026-08-13 08:24:31
3亿变960万!全明星中锋!最快速度交易人家

3亿变960万!全明星中锋!最快速度交易人家

篮球实战宝典
2026-08-12 16:45:53
太痛了!亏掉20万,终于醒悟了!希望大家引以为戒……

太痛了!亏掉20万,终于醒悟了!希望大家引以为戒……

星图金融研究院
2026-08-12 00:13:27
感谢不演之恩!《龙餐馆》原男主徐峥被踢出局,换沈腾后意外爆火

感谢不演之恩!《龙餐馆》原男主徐峥被踢出局,换沈腾后意外爆火

娱乐圈十三太保
2026-08-12 18:19:11
孩子头上有“2个旋”,你知道代表什么吗?大多数父母都不知道

孩子头上有“2个旋”,你知道代表什么吗?大多数父母都不知道

浩源的妈妈
2026-07-21 15:40:08
1850亿美元金穹项目突破关键测试,SpaceX与诺格谁能笑到最后?

1850亿美元金穹项目突破关键测试,SpaceX与诺格谁能笑到最后?

硅屿手记
2026-08-12 20:14:34
这样打扮的阿姨,确实给人眼前一亮的感觉

这样打扮的阿姨,确实给人眼前一亮的感觉

美女穿搭分享
2026-08-10 12:22:14
2026-08-13 21:19:01
AI科技大本营 incentive-icons
AI科技大本营
连接AI技术的创造者和使用者
2772文章数 7728关注度
往期回顾 全部

科技要闻

DeepSeek V4涨价,Pro高峰期百万输出27元

头条要闻

顾客221元订酒店 商家仅获40.67元:订单底价高达1573元

头条要闻

顾客221元订酒店 商家仅获40.67元:订单底价高达1573元

体育要闻

负债十几亿的联赛,还在疯狂买球星

娱乐要闻

篡改红歌已立案,郭德纲大祸临头

财经要闻

可治疗癌症?神话破灭的片仔癀 陷入争议

汽车要闻

试了奇瑞捷豹路虎神行者8,才知道它的i-ATS有多强?

态度原创

家居
本地
旅游
数码
教育

家居要闻

2026建博会(广州) 公装联探展交流活动

本地新闻

黄州一夜,苏轼写给普通人的月光

旅游要闻

170万年人文底蕴加持,文旅康养双在线,解锁多元新玩法!

数码要闻

苹果Apple TV新增《火星救援》《泰坦尼克号》《E.T.》等经典影片

教育要闻

“你不读给我读啊!”考生被985录取不到半个月就申请放弃入学资格,原因太可惜

无障碍浏览 进入关怀版