网易首页 > 网易号 > 正文 申请入驻

埃森哲AI架构师揭秘:让AI学会"看人下菜碟"的省力新招法

0
分享至

这项由埃森哲公司AI架构师主导的研究以预印本形式发布于2026年6月,论文编号为arXiv:2606.08327,有兴趣深入了解的读者可通过该编号查询完整原文。


每一个字都得认真对待,这是语文老师的要求。但对于AI来说,这种"一视同仁"的态度其实相当浪费。你有没有想过,当AI在处理一段文字时,面对"的"、"了"、"吗"这类再普通不过的词,和面对"他到底在指代谁"这种需要联系上下文才能判断的复杂问题,付出的计算代价却是完全一样的?这就好比一个厨师,不管是切一颗葱还是处理一条整鱼,都要花同样的时间和力气——显然不合理。这项研究要解决的,正是这个"大材小用"的问题。

一、为什么AI处理文字会这么"不会省力"

要理解这个问题,先得知道现代AI语言模型的核心机制叫做"自注意力机制"(Self-Attention)。你可以把它理解成一种"全员开会"的工作方式:每当AI处理文字中的某一个词,它都要把这个词和文章里所有其他的词逐一比对,思考"我和你有没有关系",然后综合所有比对结果来理解这个词的含义。

这种全员参与的开会方式非常强大,因为它能捕捉到任意两个词之间的关联,哪怕它们相隔很远。但问题也在这里——这种开会的成本随着文字数量的增加会急剧膨胀。文字数量翻倍,计算量就要翻四倍。更关键的是,很多词根本不需要开全员大会。"的"这个字出现在哪里,含义都差不多,用不着把全文所有词都拉来比对一遍。

这就是研究的出发点:能不能让AI学会"看词下菜碟",对简单的词用简单的处理方式,把昂贵的全员开会只留给真正需要它的复杂词?

二、从明暗对比画法里找到灵感

研究团队给这个新方法起了一个很有意思的名字——CHIAR-Former,灵感来自西方绘画中一种叫做"明暗对比法"(Chiaroscuro)的技术。这种技术在达芬奇、伦勃朗的画作中极为常见:画家只在需要表现的重点区域精雕细琢,用浓重的阴影和明亮的光线塑造立体感,而背景则处理得相对简单。

这个比喻非常贴切地描述了研究的核心思路:把计算资源集中花在"暗处"——那些真正复杂、需要精细处理的词上,而对"明处"的简单词则用更经济的方式快速处理。

为了实现这个思路,研究团队设计了三种不同"处理档位"。第一档叫做DCT频谱混合,是最省力的方式,适合处理简单、规律性强的词。第二档叫做RBF核函数混合,介于中间,适合处理有一定复杂度但仍有局部规律的词。第三档就是完整的自注意力机制,也就是前面说的"全员开会",留给那些真正复杂、需要联系全文才能理解的词。

要让这个系统运转起来,首先要解决的问题是:AI怎么判断一个词应该用哪个档位?

三、用"频率能量分布"来给词的复杂度打分

研究团队提出了一个叫做"频谱熵"(Spectral Entropy)的量化指标,专门用来衡量每个词的复杂程度。这个概念初听起来很抽象,但用音乐来类比就容易理解了。

一段纯净的单音(比如笛子吹出的"哆"),它的能量完全集中在一个频率上,其他频率基本没有能量。而一段嘈杂的噪音或者复杂的和弦,能量则均匀分散在各个频率上。频谱熵就是在衡量这种"能量分散程度"——越集中,熵值越低;越分散,熵值越高。

把这个概念用到文字处理上:每个词在AI内部有一个数字向量(可以理解为这个词的"数字画像")。研究团队对这个数字画像做了一种叫做DCT(离散余弦变换)的数学操作,提取出它的"频率能量分布"。如果一个词的能量高度集中在少数几个频率上,说明这个词结构简单、可预测性强,熵值低,适合用简单的处理方式。如果能量分散在很多频率上,说明这个词复杂多变,熵值高,需要动用全员开会的昂贵方式。

研究团队还从数学角度证明了这三种处理档位各有其理论依据。对于低熵的简单词,DCT处理能保证重建误差被限制在一个可控范围内;对于中等熵的词,RBF核函数能通过一种叫做Bochner定理的数学结论,近似捕捉词与词之间的局部相似性;而对于高熵的复杂词,只有完整的注意力机制,才能通过动态的跨词投影来最小化误差。

四、架构设计:四层楼的"分工合作"

CHIAR-Former整体上是一个四层结构的模型,每一层负责不同的任务,有点像一栋四层楼的工厂,每层流水线做不同的加工。

第一层是"频谱预处理层",固定对所有词使用DCT混合处理。这一层不做复杂的判断,就是给所有词统一做一遍频率域的"底层加工",提取出它们的低频结构信息。你可以把它理解成工厂流水线的第一道工序:先给所有原材料做一次基础清洗和分类。

第二层是"初步分拣层",会根据每个词的频谱熵,决定是继续用DCT处理还是升级用其他方式处理。在原始设计的三档版本里,这里是DCT和RBF二选一;在后来优化的两档版本里,这里变成了DCT和注意力二选一。

第三层的逻辑类似,但面向更高层次的结构。第四层则固定对所有词使用完整的自注意力机制,作为整个流水线的最后精加工环节,确保模型的输出表达能力不打折扣。

在实际路由时,模型计算每个词的频谱熵值,与一个叫做"τ"(tau)的阈值做比较:低于阈值的走便宜通道,高于阈值的走昂贵通道。这个阈值不是随意设定的,而是在训练结束后,统计验证集上所有词的熵值分布,取33%和67%分位数来校准——就像量体裁衣,先量了尺寸再划分档位。

有一个细节值得一提:这个路由判断是完全独立地针对每个词进行的,词与词之间的路由决策互不影响,每个词只根据自己的熵值决定走哪条路,计算效率很高。

五、一个出人意料的发现:三档变两档反而更好

按照原始设计,研究团队准备了三个处理档位——DCT、RBF和注意力。但在实际训练中,出现了一个意外:模型几乎完全拒绝使用RBF这个中间档位,超过98%的词要么走DCT,要么走注意力,留给RBF的份额不到2%。

这种现象在AI领域有一个专门的名词叫"路由坍塌"(Routing Collapse):本来设计了多个可选项,但模型训练后发现只用其中一部分就够了,其余的被自动抛弃。在很多类似的AI系统(比如混合专家模型)里,路由坍塌通常被视为问题,意味着系统没有充分利用所有可用资源。

但研究团队换了一个角度看待这件事:坍塌不是失败,而是发现。模型用实际行动告诉我们,RBF和DCT其实在功能上高度重叠——DCT的低频分量本来就能捕捉词与词之间的局部相似性,而RBF做的也是同样的事情,只是换了一套数学工具。两个工具捕捉的是同一种底层结构,模型当然会自动选择更熟悉、更高效的那个。

顺着这个思路,研究团队直接把RBF从架构中移除,专门设计了一个只有DCT和注意力两个档位的精简版本,并命名为CHIAR DCT+Attn。结果出乎意料地好:这个精简版不仅不比原来的三档版差,反而明显更好——因为它彻底消除了RBF这条冗余路径可能造成的计算浪费。

六、实验结果:大数据集上的惊艳表现

研究团队在四个不同的数据集上测试了CHIAR-Former的表现,每个数据集代表一种不同的应用场景。

最核心的测试在WikiText-103上进行,这是一个包含1.18亿个词的大型维基百科文章数据集,是语言模型领域的标准测试场。衡量语言模型好坏的指标叫"困惑度"(Perplexity,PPL),数值越低说明模型对文字的预测越准确。全注意力的基准模型在验证集上的困惑度是66.62,而CHIAR DCT+Attn版本做到了36.54——降低了45%。同时,注意力计算的运算量减少了62.5%,总体计算量减少了40.8%。

这个结果非常直观:用更少的计算换来了更好的效果。为什么会这样?研究团队认为,DCT作为早期层的"底层加工",能够自动提取出自然语言的低频结构特征——比如句子的语法模板、话题的连贯性、短语级别的规律性。这些都是自然语言中大量存在的"平滑"结构,非常适合DCT处理。当注意力机制在后续层接手这些经过预处理的词表示时,它面对的是已经被梳理过的、结构更丰富的输入,相当于站在更高的起点上继续工作,自然能做得更好。

在训练过程中,所有CHIAR变体都比基准模型收敛得更快,在早期训练阶段就能达到更低的损失值。这进一步印证了DCT提供的归纳偏置效果:模型不需要从零开始学习语言的低频统计规律,DCT已经把这些规律以数学的形式"内置"进来了,释放出了宝贵的学习容量用于更高层次的模式。

七、在情感分析任务上:几乎打平,但少花了很多

研究团队还在IMDB电影评论情感分类任务上做了测试。这个数据集包含2.5万条电影评论,每条平均230个词,任务是判断评论是正面还是负面。

基准的全注意力模型准确率是84.96%,CHIAR DCT+Attn版本是83.72%,差距只有1.24个百分点。研究团队特别指出,这个差距比正常的随机种子实验误差还要小,在统计意义上两个模型可以视为等价的——换句话说,CHIAR用62.5%更少的注意力计算量,做到了和全注意力几乎完全一样的分类效果。

对于一个需要处理长文档的实际应用来说,这是一个相当实用的结果:如果你要部署一个评论分析系统,选择CHIAR意味着计算成本大幅降低,而效果几乎没有损失。

八、两个"失利"同样值得关注

研究团队没有回避那些不太好看的结果,反而认为它们和成功案例同等重要,因为它们清晰地标出了CHIAR-Former的适用边界。

第一个"失利"来自WikiText-2,这是WikiText-103的一个小子集,只有240万个词。在这个小数据集上,全注意力基准模型的测试困惑度是75.19,而CHIAR DCT+Attn是83.81,差了将近12%。研究团队把这个结论归结为数据量不足:当训练数据太少时,模型没有机会见到足够多样的词,路由机制无法学到可靠的"哪类词该走哪条路"的规律。而全注意力机制不需要这种分工学习,它对每个词一视同仁,在小数据上反而能更快地学到有用的模式。

第二个"失利"来自ListOps任务,这是一个合成的符号逻辑任务:给AI一串嵌套的最大值、最小值、平均值操作,让它算出结果,例如"从这堆数里取最大值,再和另一堆数的最小值比较"。全注意力基准模型在这个任务上的准确率高达98.85%,而CHIAR DCT+Attn只有63.35%,差距接近35个百分点。

原因也很清楚:ListOps是一个需要精确符号计算的任务,模型要严格区分"MAX"、"MIN"、"MEDIAN"这些操作符号,以及精确的整数边界。DCT的频谱预处理擅长捕捉"平滑的统计规律",但它会在一定程度上平滑掉这些精确的符号边界——而这恰恰是ListOps最需要保留的信息。全注意力机制没有这种预处理的"干扰",能直接记住这些精确的操作规则。

九、适用边界的"地图"

综合四个数据集的结果,研究团队画出了一张CHIAR-Former的适用"版图"。横轴是数据集规模,纵轴是任务类型(自然语言还是符号逻辑)。在大规模自然语言任务上,CHIAR-Former明显占优;在小数据集的自然语言任务和符号逻辑任务上,全注意力更强。

简而言之,CHIAR-Former适合那些数据量大、文字风格自然的场景,比如大规模文章的语言建模、长文档的情感分析。而对于数据量有限的场景,或者需要精确符号推理的任务,还是应该用传统的全注意力方式。

研究团队还对这套发现提炼出了一个更普遍的方法论原则:当你在AI里设计了多个可选的计算路径,然后发现训练后模型自发地集中在其中某几条路上,不要急着"修复"这个坍塌。先研究一下,坍塌本身可能就是模型在告诉你"哪些操作组合才是真正必要的"。验证这个直觉的方法,是直接把被抛弃的选项移除,设计一个专门实现坍塌配置的精简架构,看看它是否真的更好——CHIAR-Former的实验正是这么做的,结果证明这条路是对的。

十、与同类方法的比较和差异

这项工作和之前已有的一些提高AI效率的研究有明显的差别,研究团队专门对此做了梳理。

在和FNet的比较上:FNet是一个用傅里叶变换替代所有注意力层的方案,它的逻辑是"全部改掉"。CHIAR-Former的逻辑则是"选择性使用",只对那些适合频谱处理的词使用DCT,其余词仍然走注意力。这种选择性的精细分工,带来了比全部替换更好的效果。

在和混合专家模型(MoE)的比较上:MoE的路由坍塌是结构上相似的多个"专家"之间发生的,坍塌往往意味着有些专家的参数被浪费了。CHIAR-Former的路由坍塌是在结构和计算性质根本不同的操作之间发生的——DCT是固定的数学变换,注意力是动态的数据驱动计算,两者本质不同。当这种异质的路由系统发生坍塌,信息量更大,说明的是"在这种任务和模态下,某种类型的计算是冗余的",而不只是"某个参数化实例没被充分利用"。

在和Mixture-of-Depths(按层跳过计算)的比较上:那类方法选择跳过某些层不做计算;CHIAR-Former不跳过任何层,而是在同一层内切换更便宜的计算操作。两者是互补的,理论上可以结合使用。

在和FlashAttention的比较上:FlashAttention是在硬件层面优化注意力计算的执行效率,不减少参与注意力的词的数量;CHIAR-Former则是减少被路由到注意力的词的数量,两个维度的优化互不冲突,未来可以同时应用。

说到底,这项研究做的事情可以用一句话总结:教会AI"省着点用力"。它发现了一个简单但有效的原理——语言里的词有复杂度之分,不同复杂度的词用不同成本的处理方式,既省力又可能更准确。

研究中那个"三档变两档"的意外收获,可能是整篇论文里最有启发性的部分。它告诉我们,当一个系统自发地简化自己,我们应该认真倾听这个信号,而不是强行把它"修复"回复杂的样子。模型的"偷懒"有时候是在揭示一个更简洁的真相。

当然,这套方法目前也有明显的局限:17.4M参数的小模型在现实的大规模部署场景里算是微型产品,在大模型上能不能复现这种效果,还需要进一步验证。阈值校准依赖训练后的数据统计,换一个语料或者换一种分词方式,就需要重新校准。这些都是留给未来的问题。

如果你对这个方向感兴趣,可以通过编号arXiv:2606.08327查阅完整论文,里面有详细的数学推导、实验数据和架构细节,可以对照上面介绍的内容做更深入的了解。

Q&A

Q1:CHIAR-Former的"频谱熵路由"和普通Transformer的注意力机制有什么根本区别?

A:普通Transformer对每个词都用同样昂贵的"全员开会"方式处理,计算量随词数呈平方增长。CHIAR-Former给每个词算一个"复杂度评分"(频谱熵),评分低的词用便宜的DCT数学变换处理,评分高的词才动用完整的注意力机制。核心区别在于,这是基于信号处理理论的按需分配,不是随机跳过,有理论依据保证简单词用DCT不会损失太多信息。

Q2:为什么CHIAR-Former在WikiText-2小数据集上反而更差?

A:CHIAR-Former的路由机制需要从数据中学习"哪类词走哪条路",这本身需要足够多样的训练样本。WikiText-2只有240万词,词的多样性不够,路由器学不到可靠的分工规律。全注意力机制没有这种学习负担,对每个词一视同仁,在小数据上学习效率反而更高。简单说:CHIAR需要足够大的数据集才能发挥"分工"的优势。

Q3:路由坍塌为什么在CHIAR-Former里是好事,但在混合专家模型里是坏事?

A:混合专家模型里,各个"专家"结构相同只是参数不同,坍塌意味着部分专家的参数白白占用内存却没被使用,是资源浪费。CHIAR-Former里,DCT、RBF、注意力三者在数学性质上根本不同,坍塌是模型在告诉我们"RBF和DCT捕捉的是同一种结构,留一个就够了"——这是有信息量的发现,移除RBF后性能反而提升,说明坍塌识别出了真正的冗余。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
续航1480km!上汽新车官宣:8月21日正式上市

续航1480km!上汽新车官宣:8月21日正式上市

科技阿维
2026-08-21 10:45:40
塞尔:撤下德容队长袖标是为了警示,弗里克不喜欢他的态度

塞尔:撤下德容队长袖标是为了警示,弗里克不喜欢他的态度

懂球帝
2026-08-21 09:26:12
深夜暴雷,牧原亏61亿,中国电信下滑15%,48个龙头暴雷

深夜暴雷,牧原亏61亿,中国电信下滑15%,48个龙头暴雷

风风顺
2026-08-21 03:40:04
许家印坑惨的8位大佬,马云才排第7,第一名亏360亿遭悬赏

许家印坑惨的8位大佬,马云才排第7,第一名亏360亿遭悬赏

偷喝一口奶
2026-08-21 08:09:10
美媒:中国首次向埃及部署歼-16战机,埃及或将采购歼-10C

美媒:中国首次向埃及部署歼-16战机,埃及或将采购歼-10C

爱迷彩的老虎
2026-08-21 15:24:29
菲律宾政坛爆发激烈冲突!刚接下莎拉“战书”,马科斯遭致命一击

菲律宾政坛爆发激烈冲突!刚接下莎拉“战书”,马科斯遭致命一击

爱看剧的阿峰
2026-08-21 11:20:12
中国人祖祖辈辈都用“粪水浇菜”,欧洲科学家却才发现,这是为什么?

中国人祖祖辈辈都用“粪水浇菜”,欧洲科学家却才发现,这是为什么?

磊子讲史
2026-08-17 18:31:51
许家印落得人财两空,前妻携小30岁英国新欢居豪宅,资产冻结跑路

许家印落得人财两空,前妻携小30岁英国新欢居豪宅,资产冻结跑路

烽火三月佳人三千
2026-08-19 17:05:40
台媒称,美国人心里其实也不好受,大陆官方视频《制胜》在央视播出后引发海内外媒体强烈关注

台媒称,美国人心里其实也不好受,大陆官方视频《制胜》在央视播出后引发海内外媒体强烈关注

z千年历史老号
2026-08-19 23:24:16
刚刚!第18号台风增强了!江苏大到暴雨

刚刚!第18号台风增强了!江苏大到暴雨

无锡eTV全媒体
2026-08-21 13:07:32
许家印一审判决仅24小时,前妻丁玉梅被扒底朝天,难怪能逍遥国外

许家印一审判决仅24小时,前妻丁玉梅被扒底朝天,难怪能逍遥国外

历史点行
2026-08-21 11:11:15
四方共赢?湖火侠勇交易方案,勇士得锋线悍将,东契奇波神再聚首

四方共赢?湖火侠勇交易方案,勇士得锋线悍将,东契奇波神再聚首

球毛鬼胎
2026-08-21 15:41:08
羚羊礁,不是在跟越南、菲律宾较劲,中国在南海布下的一步先手

羚羊礁,不是在跟越南、菲律宾较劲,中国在南海布下的一步先手

清沐执笔
2026-08-20 19:43:06
赠房产真相大白,窦佳嫄道出所有,高原现状曝光难怪不与窦唯联系

赠房产真相大白,窦佳嫄道出所有,高原现状曝光难怪不与窦唯联系

神颜贩卖机
2026-08-21 08:52:16
啪啪打脸了!“弟弟举报哥哥冒名读大学”案证据出炉,哥哥唐时达陈述的证据,印证弟弟潘峰才是原始的“唐时达”

啪啪打脸了!“弟弟举报哥哥冒名读大学”案证据出炉,哥哥唐时达陈述的证据,印证弟弟潘峰才是原始的“唐时达”

火山詩话
2026-08-20 07:11:25
韩媒:安洗莹迎最坏签表,或将连战韩悦、王祉怡;夺冠劲敌山口茜收获利好赛程

韩媒:安洗莹迎最坏签表,或将连战韩悦、王祉怡;夺冠劲敌山口茜收获利好赛程

林子说事
2026-08-21 11:49:01
伊朗总统承认:石油收入急剧下降,经济恶化,物价飞涨!伊方谴责美国新制裁:美以发动战争未能实现目标后实施的,旨在迫使伊朗人民屈服

伊朗总统承认:石油收入急剧下降,经济恶化,物价飞涨!伊方谴责美国新制裁:美以发动战争未能实现目标后实施的,旨在迫使伊朗人民屈服

鲁中晨报
2026-08-21 10:26:10
央视5套紧急直播!亚锦赛首日曝赛程,中国女排头号大敌提前亮剑

央视5套紧急直播!亚锦赛首日曝赛程,中国女排头号大敌提前亮剑

宝哥精彩赛事
2026-08-21 04:40:34
L3/L4自动驾驶国标发布:10秒接管红线淘汰了哪些智驾方案?

L3/L4自动驾驶国标发布:10秒接管红线淘汰了哪些智驾方案?

轰Party
2026-08-19 22:50:58
007选角冲刺!外媒爆5人候选名单,诺兰《敦刻尔克》男星爆冷领跑

007选角冲刺!外媒爆5人候选名单,诺兰《敦刻尔克》男星爆冷领跑

头号电影院
2026-08-21 08:01:50
2026-08-21 16:07:00
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9599文章数 568关注度
往期回顾 全部

科技要闻

阿里AI的两面:云赚56亿,千问烧掉138亿

头条要闻

辽宁一处长在单位门口遭枪击 女儿被警察配枪护学近1年

头条要闻

辽宁一处长在单位门口遭枪击 女儿被警察配枪护学近1年

体育要闻

46岁小罗抵达意大利 将为拉文纳征战意丙

娱乐要闻

迪丽热巴与陈飞宇的恋情罗生门

财经要闻

三部门发布多条促内需优化政策

汽车要闻

全新长轴距GLE SUV全球首秀 奔驰全品牌矩阵集结蓉城

态度原创

数码
家居
游戏
时尚
公开课

数码要闻

6K游戏实测 RTX 5090都不够用!RTX 5070 Ti直接放弃吧

家居要闻

2026建博会(广州) 公装联探展交流活动

大话西游嘉年华,与它的少侠们完成了一场双向奔赴

带火“活人感”妆容,让刘亦菲也排队等,她到底什么来头?

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版