![]()
这项研究由独立研究者与aiXplain公司的研究人员合作完成,论文于2026年8月3日发布于预印本平台arXiv,编号为arXiv:2608.02703v1,归属计算机科学·计算与语言(cs.CL)方向。有兴趣深入了解的读者可通过上述编号查询完整论文。
一、AI模型的"最后一公里"困境
要理解这项研究解决了什么问题,先得理解大语言模型是怎么工作的。你可以把一个大语言模型想象成一座巨大的工厂,原材料(你输入的文字)经过数十层复杂的流水线加工,最终在工厂出口处产出成品——也就是预测出下一个词是什么。这个"工厂出口"有一个专门的名字,叫做语言模型头(LM-head),或者叫输出投影层。
问题就出在这个出口上。现代大语言模型的词汇表动辄包含十几万个词,这意味着出口处需要一张巨大的"价目表",把工厂最后一道工序输出的信号,分别对应到词汇表中的每一个词,计算出它们各自出现的概率。以研究者测试的Qwen3-8B-Base模型为例,它的词汇表有151,936个词,而隐藏层维度(可以理解为流水线最后产出的信号维度)是4,096。这张"价目表"本身就占据了约1.18GB的存储空间。Gemma-4-E4B的词汇表更大,达到262,144个词,对应的"价目表"占了约1.28GB。
现在,研究者们已经开发出了很多给模型"压缩"的技术,比如GPTQ、AWQ和bitsandbytes NF4,它们的核心思路是把模型内部参数从原来精度较高的BF16格式(可以理解为每个数字用16位精度来表示),压缩到更低精度的整数格式(比如只用4位来表示)。这样可以把模型大小缩减到原来的四分之一甚至更小,让普通消费级显卡也能运行原本只能在服务器上跑的大模型。
然而,这里藏着一个被很多人忽视的漏洞:这些压缩工具通常只压缩模型内部的流水线(即Transformer块),却把那个巨大的"出口价目表",也就是LM-head,原原本本地以BF16格式保留下来。研究团队亲自检查了用AWQ和bitsandbytes NF4压缩过的Qwen3-8B-Base模型,发现两者都把lm_head以完整的BF16格式保留了下来,尺寸是151,936×4,096。换句话说,整个工厂已经被压缩得很小了,但出口这扇门还是原来那么大,占据了将近1.18GB的空间。
为什么大家不直接把这个"出口"也压缩一下呢?原因在于,这个位置太"敏感"了。工厂内部某一道工序出了一点误差,后面还有其他工序来纠正;但出口处的误差,会直接影响到最终输出的每一个词的概率,没有任何后续工序来弥补。粗暴地用低精度整数来表示这张"价目表",会让模型的预测变得混乱,质量急剧下降。
这就是ARCHead要解决的核心问题:如何在不损失太多质量的前提下,优雅地压缩这个"出口"。
二、为什么不能简单压缩——激活分布的秘密
在介绍ARCHead的具体做法之前,研究者特别强调了一件事:普通的压缩方法为什么行不通。
普通的权重压缩(比如简单地把浮点数四舍五入到整数),本质上是在尽量减小"价目表"本身数字的误差。它把"价目表"中的每一行、每一列都视为同等重要,平等地分配压缩误差。这在直觉上很合理——谁的误差都不应该太大。
但现实中,模型处理文字时产生的"最终信号"并不是均匀分布在各个维度上的。可以用一个音乐厅的比喻来理解:模型产生的信号就像音乐厅里的声音,有些方向(维度)声音洪亮、频繁活跃,有些方向却几乎是静默的。如果你要做隔音改造,把精力放在安静的角落里意义不大,关键是那些声音最大、最频繁的方向。
研究者把这种现象称为"激活分布的各向异性"——也就是说,模型最终的隐藏状态在各个维度上的活跃程度是极度不均匀的。在一个频繁被激活的维度上,即使很小的压缩误差,也会同时影响成千上万个词的预测概率;而在一个几乎从不活跃的维度上,就算误差很大,对最终输出的影响也微乎其微。
普通的压缩方法看不到这种区别,只会死板地对所有维度一视同仁。ARCHead的核心创新,就是把这种"激活分布的不均匀性"纳入压缩的考量之中,让压缩误差尽量落在那些不重要的方向上,从而在尽量小的存储代价下,保留最重要的预测精度。
三、ARCHead的"三明治"压缩方案
ARCHead的设计可以用一个三层三明治来理解。这三层分别是:量化低秩核心、整组INT4残差、以及激活度量低秩修正。听起来很复杂,但逐层拆解之后会发现逻辑相当清晰。
第一层,量化低秩核心,是整个压缩方案的骨架。研究者先对原始的"价目表"(维度为151,936×4,096的矩阵)做一个低秩分解——这就像把一张巨大的二维地图,近似地表示为两张更窄的纸条的组合。具体来说,左边那张纸条用5位整数存储,右边那张纸条用8位整数存储。这种分解并不能完美还原原始矩阵,会有误差。
第二层,整组INT4残差,是对第一层误差的粗粒度补偿。第一层做完之后,原始矩阵和近似结果之间存在一个"差值矩阵",这个差值矩阵本身也被压缩存储——用带符号的4位整数(INT4)来表示,并配有量化的组缩放因子。这两层组合在一起,构成了ARCHead所说的"量化核心"(Wd),已经能在很低的存储代价下粗略还原原始矩阵了。
第三层,激活度量低秩修正,是ARCHead最关键的独门秘技。量化核心和原始矩阵之间,仍然存在一个残余误差E。一般的方法到这里就停下了,接受这个误差。但ARCHead选择继续优化这个残差——不过,它用了一种聪明的方式:先用校准数据(一批真实文本)计算出模型"最终信号"的协方差矩阵C(可以理解为描述各维度活跃程度分布的统计描述),然后对残差矩阵E乘以一个根据这个协方差推导出的变换矩阵Tp,再对变换后的矩阵做低秩分解(截断奇异值分解)。这个操作的效果,是让分解出来的低秩近似,在"活跃维度"上更精确,在"不活跃维度"上可以有更大误差。最后,把右边的因子再乘以Tp的逆变换,还原回原始空间,得到两个修正因子Aw和Bw,分别用行级INT8和组级INT8量化后存储。
这三层叠加在一起,就是最终的ARCHead。在推理(实际使用模型生成文字)时,ARCHead先用量化核心计算一个粗粒度的输出,再加上修正因子的贡献,得到最终的词汇概率分布。整个过程不需要还原那张完整的BF16"价目表",所有计算都在压缩的表示下进行。
研究者还为这种修正方式提供了严格的数学保证:在量化核心固定的前提下,这个激活度量低秩修正,是所有同等秩数的修正方案中,在激活度量意义下误差最小的一个。这个结论来自线性代数中的Eckart-Young-Mirsky定理——简单理解就是,在约束条件下,这是数学上能找到的最优解(注意:这个最优性是在修正因子未量化的前提下成立的,量化因子本身会引入额外误差,所以整个ARCHead端到端并不是全局最优的,研究者对此有明确说明)。
此外,ARCHead的设计中还有一个重要的工程细节:模型转换完成后,原始的BF16"价目表"会被彻底丢弃,不在序列化的模型中保留任何一份完整的BF16矩阵副本。这使得存储节省是真实的,而不仅仅是名义上的。
四、真实压缩了多少——存储数据一览
ARCHead的压缩效果,研究者通过直接测量PyTorch注册张量的实际字节数来验证,而不是靠理论位宽推算,这一点非常严谨。
以Qwen3-8B-Base为例,原始BF16的lm_head占用1187MB,而ARCHead的打包模块只占303.96MB,压缩比达到3.905倍。Gemma-4-E4B从1280MB压缩到345.41MB,压缩比3.706倍。VibeThinker-3B从593.5MB压缩到153.23MB,压缩比3.873倍。Mistral-7B-v0.3从256MB压缩到65.61MB,压缩比3.902倍。LFM2.5-8B-A1B从500MB压缩到129.10MB,压缩比3.873倍。五个模型的压缩比都集中在3.7到3.9倍之间,表明这是一个相当稳定的特性,而非特定模型的偶然结果。
换句话说,ARCHead把LM-head的持久存储压缩到了原BF16的约25%至27%。研究者特别强调,这里谈的是"持久存储"和"加载时参数内存",也就是模型文件存到磁盘上的大小,以及把模型加载到GPU时输出头参数本身占用的显存。这与"运行时峰值显存"是不同的概念——后者还包括激活值、KV缓存、CUDA分配器状态等动态内存,不能简单地把持久存储的节省等同于运行时显存的节省。研究者对这一区分有明确、反复的说明,体现了严谨的学术态度。
五、质量损失了多少——与各种方案的横向比较
存储压缩固然漂亮,但如果模型质量大幅下降,那也是白搭。研究者用WikiText-103数据集的16,384个测试词元(token)来评估压缩后的质量,核心指标是困惑度(PPL)和交叉熵(CE)——困惑度可以理解为模型对文字的"茫然程度",越低越好。
在Qwen3-8B-Base上,原始BF16头的困惑度是11.504,相对困惑度定义为1.000(基准)。行级INT8压缩后,相对困惑度升至1.017,轻微上升。但INT8的压缩比只有0.5,也就是只压缩了一半空间。组级INT4压缩后,相对困惑度蹿升至1.151,已经相当明显了,而它的存储比是0.266,和ARCHead的0.256相当。SVD8+INT4(一种结合了低秩分解和INT4残差的朴素方案)更糟糕,相对困惑度达到1.211,交叉熵增加了0.191。ARCHead在同等存储(存储比0.256)下,相对困惑度只有1.007,交叉熵仅增加0.007——在几乎相同的存储预算内,ARCHead把质量损失控制在存储匹配基线的二十分之一以内。
跨模型的对比同样令人信服。在Gemma-4-E4B上,INT4的相对困惑度是1.013,ARCHead是1.010,差距不大;这说明Gemma-4-E4B的LM-head对简单INT4压缩的鲁棒性更强,ARCHead的优势在这里相对有限。在VibeThinker-3B上,INT4的相对困惑度是1.050,ARCHead降到了1.027,有明显改善。这种跨模型差异提示了一个重要事实:不同模型的输出头对压缩的敏感性差异显著,不能一概而论。
研究者还与GPTQ风格的输出头量化做了细致的对比实验,这是一个更专业的基线:GPTQ用二阶信息(Hessian矩阵)来引导权重量化,是目前公认质量最好的PTQ方法之一。实验使用了2K、4K、8K、16K四种校准数据规模,每种规模用三个不同随机种子重复实验,报告均值和标准差。结果显示,在所有测试的校准规模下,ARCHead的平均相对困惑度和平均logit均方误差都低于GPTQ风格量化;从超出基准的相对困惑度来看,ARCHead把GPTQ的退化量分别削减了44.0%、49.3%、33.6%和40.6%。此外,ARCHead的构建速度比GPTQ实现快2.36到2.58倍。在8K校准规模下,GPTQ在三个种子中的某一个上表现略好于ARCHead,但ARCHead在所有条件下都保持了更低的方差,即更稳定的表现。
六、与现有压缩工具的组合使用
ARCHead最实用的价值,在于它能和现有的Transformer块量化工具(AWQ、bitsandbytes NF4等)无缝叠加。工作流程是:先用AWQ或bitsandbytes把模型的Transformer块压缩到4位,再用ARCHead把那个被保留下来的BF16 LM-head也压缩掉。
研究者在Qwen3-8B-Base上验证了这一点。AWQ 4位量化后,相对困惑度从1.000上升到1.0465,替换掉BF16头改用ARCHead后,进一步升至1.0530,额外交叉熵只增加了0.006。bitsandbytes NF4量化后,相对困惑度从1.000升至1.1084,替换为ARCHead后升至1.1170,额外交叉熵只增加了0.007。也就是说,在已经量化的模型基础上,ARCHead用极小的质量代价(0.006到0.007的交叉熵),消除了那个仍占1.18GB的BF16输出头。
研究者还特别强调:ARCHead并不能改善块量化本身带来的质量损失,它只是把块量化器遗留的那个密集BF16头也一并压缩掉,两者的作用域是完全不同的。
七、logit保真度与下游任务表现
除了困惑度,研究者还从多个角度评估了ARCHead对模型输出的保真度。在Qwen3-8B-Base上,ARCHead对原始BF16模型的Top-1词元一致率达到93.05%,而存储相近的基线(组INT4和SVD8+INT4)只有约76%。Top-5一致率达到99.95%,Top-10一致率更是达到100%——换句话说,ARCHead几乎不会把原本排在前10位的词从列表里挤出去。KL散度(衡量概率分布差异的指标)比存储匹配基线低了一个数量级,logit均方误差为7,167,而INT4是107,599,SVD8+INT4是103,015。作为对比,行级INT8的保真度更高(Top-1一致率97.56%,KL散度0.0013),但它的存储比只有0.5,是ARCHead的两倍。
在下游任务上,研究者用lm-evaluation-harness工具在HellaSwag(常识推理)、TruthfulQA MC2(真实性问答)和WinoGrande(常识语言理解)三个标准基准上做了测试。ARCHead在HellaSwag上与BF16头持平,在TruthfulQA MC2和WinoGrande上与其他头变体的差距很小。研究者明确说明,这三个任务的结果只是"合理性检验",用来确认替换输出头没有引发明显的质量退步,并不能证明ARCHead在所有下游任务上都保持了模型的全部能力,也不能证明有所改善。这种诚实的表述值得认可。
八、校准数据量的敏感性和推理速度
一个实用系统的稳定性至关重要。研究者对校准数据量做了从4,096到65,536个词元的扫描,发现Qwen3-8B-Base上ARCHead的相对困惑度在整个范围内稳定在1.0070到1.0076之间,波动极小。这意味着,大约4,000个词元的校准数据就足以估计出模型激活分布的主要方向,不需要海量数据。不过,研究者也明确指出,这一观察不能泛化为"所有模型都只需要少量校准数据"的普遍结论,只是在这个具体实验中观察到的现象。
在推理速度上,所有测试配置下的吞吐量变化都在2%以内。具体数据是:Qwen3-8B-Base密集配置下,BF16头是4468词元/秒,ARCHead是4467词元/秒,几乎无差异。AWQ块配置下,两者分别是3452和3451词元/秒。bitsandbytes NF4配置下,分别是1789和1813词元/秒(小幅正差被视为测量噪声)。VibeThinker-3B密集配置下,分别是7091和6947词元/秒,约差2%。研究者还进行了初步的融合Triton内核评估,结论一致:ARCHead对生成速度没有实质性的负面影响。
九、消融实验——哪一层贡献最大
为了确认ARCHead各组件的必要性,研究者做了消融实验(即逐步去掉某些组件,观察效果变化)。结果非常清晰:只保留量化核心(不加激活度量低秩修正)时,相对困惑度是1.134,存储比0.230;加上激活度量低秩修正后,相对困惑度降至1.007,存储比增至0.256(多了约2.6个百分点的存储,换来了相对困惑度从1.134降到1.007)。这说明,低秩核心本身并不足够,真正起决定性作用的是那个在激活度量空间中拟合的修正分支。这一消融结果直接支持了整篇论文的核心主张。
十、构建流程与使用注意事项
ARCHead的构建流程可以简要描述为:先用WikiText-103训练集收集校准激活值,计算协方差矩阵并做阻尼处理(加入一个小的正则项防止数值不稳定),然后对原始权重矩阵做低秩分解和INT4残差量化,得到量化核心;计算核心误差,对误差做激活度量变换后做截断SVD,将右因子乘以变换的逆回到原始空间,两个修正因子分别用INT8量化后打包;最后注册所有打包张量,彻底丢弃原始BF16矩阵。整个构建过程在一张NVIDIA RTX Pro 6000显卡上完成。
研究者也坦诚列出了ARCHead的局限性:它专门针对LM-head设计,不适用于Transformer内部的MLP或注意力层权重;它的最大收益出现在词汇表投影既大又对普通低位量化敏感的情况下,如果某个模型的LM-head对INT4本就不敏感(比如Gemma-4-E4B),ARCHead的相对优势就会缩小;如果后端本身就能成功量化LM-head,ARCHead不会带来额外改善;三个下游任务只是合理性检验,不能覆盖全部能力和安全属性;持久存储节省不等同于运行时峰值显存节省;融合内核结果是初步的,仅限于单一加速器,生产级内核优化是未来工作。
说到底,ARCHead做的事情用一句话来讲就是:把模型压缩工具一直忽视的那个"巨大出口"也给压掉了,而且压得比之前任何简单方法都要好得多。它不是要替代AWQ或bitsandbytes,而是作为它们的补充,填上了一个实际部署中真实存在的存储缺口。
对于普通用户来说,这项研究意味着,以后当你在本地电脑或消费级显卡上运行量化大模型时,那个之前一直原封不动地占着将近1GB显存的输出层,也可以被压缩到四分之一大小,而模型输出的质量几乎感知不到差别。
当然,这项研究还有未竟之处——更广泛的模型架构、不同语言和领域的校准数据、更多下游任务的系统评估,以及生产级内核的优化,都是值得继续探索的方向。感兴趣的读者可以通过arXiv编号2608.02703v1查阅完整论文,或访问论文中提及的开源代码库进一步了解实现细节。
Q&A
Q1:ARCHead压缩的是模型哪个部分,和AWQ、bitsandbytes这些工具有什么区别?
A:ARCHead专门压缩大语言模型的输出投影层(LM-head),也就是把最终隐藏状态映射到词汇表的那个大矩阵。AWQ和bitsandbytes这类工具主要压缩模型内部的Transformer块权重,但通常把LM-head以原始BF16格式保留下来不动。ARCHead的定位是"补充"而非替代,两者叠加使用可以一并消除被保留下来的BF16输出头。
Q2:ARCHead压缩后模型质量会损失多少?
A:在Qwen3-8B-Base上测试,ARCHead把LM-head压缩到BF16大小的25.6%,相对困惑度只增加了0.7%(从1.000到1.007)。相比之下,同等存储的简单INT4量化会让相对困惑度上升15%以上。结合AWQ或bitsandbytes使用时,ARCHead带来的额外交叉熵损失仅为0.006到0.007,生成速度变化在2%以内,几乎可以忽略不计。
Q3:ARCHead需要多少校准数据,普通用户能自己运行吗?
A:在Qwen3-8B-Base上的实验显示,约4,000个词元的校准数据就能让ARCHead达到稳定效果,从4K增加到64K词元,质量指标的变化极小。研究者使用的是WikiText-103训练集的文本。代码已开源,理论上具备一定技术基础的用户可以自行运行,但需要注意校准数据的来源和模型的使用许可。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.