把更大的模型先训练出来,再剪小,这条路到底值不值得走?来自佐治亚理工学院、得克萨斯大学奥斯汀分校以及苹果的研究者给出了一个明确答案:值得,而且可以做得更好。
这项名为IDEA Prune的工作,把“放大—剪枝”当作一个整体系统来研究。过去的结构化剪枝流程通常只关注怎么把已经训练好的模型变小,但往往忽略了一个前置问题:如果那个更大的模型最终根本不会部署,前期多花算力去预训练它,究竟划不划算。
![]()
研究团队没有绕开这个问题,而是直接把它拆成两个关键追问。第一,即使大模型永远不会上线,是否仍然值得先预训练一个更大的模型?第二,怎样优化从放大、剪枝到恢复的完整流程,才能让剪出来的小模型表现更好。
统一余弦退火调度下的集成流程
论文提出的方案,是把放大模型训练、剪枝和恢复三个阶段,放进同一个余弦退火学习率调度里完成。这个设计针对的是此前朴素“放大—剪枝”流程中的一个明显痛点:学习率上升会带来知识损失。
在传统做法里,剪枝之后往往需要重新调高学习率来恢复模型能力,但这一过程容易冲掉已经学到的知识。IDEA Prune通过把三个阶段统一在一条学习率曲线上,让模型在压缩过程中更平稳地过渡。
配合这一流程的,是一种新的迭代式结构化剪枝方法。它不再一次性删掉大量参数,而是逐步移除,让存活下来的神经元有更多机会重新分配模型容量。研究者的表述是,这样做有助于实现“平滑压缩”,并带来剪枝后模型性能的提升。
2T token预训练规模的压缩实验
实验设置相当重:把2.8B参数的模型压缩到1.3B,预训练数据量最高用到2T token。这个规模已经足以观察放大预训练在token效率上的真实收益。
结果显示,集成方法不仅回答了“放大预训练是否值得”的问题,还在剪枝模型的最终表现上取得了优势。换句话说,先训练大模型再剪枝,不只是理论上有吸引力,在2T token级别的实验中也能看到实际回报。
研究还强调,这种做法的价值不只是最终模型变强,更在于它提供了关于放大预训练token效率的直接证据。对于推理预算有限、又希望模型能力尽量保留的场景,这条路线提供了一种可复用的流程参考。
与现有剪枝研究的关系
论文也把这项工作放在更大的压缩研究背景里。现代神经网络不仅在规模和复杂度上持续增长,推理时间同样在膨胀。通道剪枝作为最有效的压缩技术之一,通过移除卷积权重中的通道来降低资源消耗。
但通道剪枝在多分支模型段落上并不简单,移除通道可能在推理时引入额外的内存拷贝,进而增加延迟。IDEA Prune的迭代式结构化剪枝,正是试图在逐步移除参数的过程中,避免这类压缩副作用对最终推理效率的侵蚀。
此前的研究如PDP(Parameter-free Differentiable Pruning)也关注DNN剪枝在降低模型尺寸、改善推理延迟和减少加速器功耗上的作用,但现有方法在跨视觉/语言任务、跨架构以及结构化剪枝约束上的通用性仍存在局限。IDEA Prune的贡献,更多集中在生成式语言模型预训练阶段,把“放大”这一常被忽略的环节重新纳入剪枝系统。
对推理预算敏感场景的启示
对于需要在有限推理预算内部署大模型的团队来说,这项研究提供了一个新的决策视角:不要只盯着最终部署的模型大小,也要重新评估预训练阶段的资源配置。
如果放大预训练确实能换来更好的剪枝结果,那么前期多投入的算力,可能会在最终小模型的性能上得到补偿。IDEA Prune用2.8B到1.3B、最高2T token的实验,为这个判断提供了具体的数据支撑。
当然,这套流程的实际落地成本仍然不低。统一余弦退火调度和迭代式剪枝,对训练基础设施和工程实现都提出了更高要求。但至少从论文结果看,把放大、剪枝和恢复当作一个整体来优化,比把它们割裂开来处理,更有可能得到性能更好的小模型。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.