网易首页 > 网易号 > 正文 申请入驻

华为 IJCAI 2026 论文盘点:从「规模密度」转向「设计密度」

0
分享至


AI 走向现实场景,系统化工程能力,是瓶颈,也是突破口。

作者丨幸丽娟

编辑丨齐铖湧

IJCAI-ECAI 2026 将于 2026 年 8 月 15 日至 21 日在德国不来梅举行。作为 AI 领域的综合性顶级会议,IJCAI 一直是检验各大厂过去一年前沿研究成果的关键考场:谁在哪个方向上有真进展,哪些技术路线正在形成共识,论文是最直接的答案。

大会召开之际,AI科技评论也正在系统扫描本届顶会收录的论文,从中捕捉技术趋势和行业风向。

一个清晰的趋势是:AI 算力成本居高不下,而参数规模扩张带来的边际收益早已追不上边际成本。这个经济学现实正在重塑技术创新逻辑——从"能不能做得更大"转向"能不能用得更省"。

华为被 IJCAI 2026 收录的四篇论文,为这一转向提供了技术路径参考:用更精巧的架构设计和训练策略,来对冲数据稀缺瓶颈,换取单位算力更高的智能产出。

这种技术取向的转变,也呼应了 AI 落地的深层变化:当技术走出实验室,竞争早已不是某一项能力的单点突破,而是准确性、泛化性、数据、算力之间的系统统筹——每一个环节都可能成为瓶颈,也都可能成为突破口。

下面这四篇论文,恰好从这四个方向,展现了华为的系统化工程能力和技术选择。

01


规模破壁:架构+训练,

改写层次化 ViT 的能力上限

视觉基础模型的规模化竞赛中,一直存在一层隐形的"天花板"。

普通ViT的规模化一路高歌猛进,从6B到22B不断刷新上限。但层次化ViT始终卡在2B参数以下。

不是不想做大,是做不大。层级化模型对数据和训练策略的要求比普通ViT高得多,简单套用普通ViT的规模化方案行不通。

这就导致了一个结构性矛盾——层级化ViT天然擅长多尺度表征和密集预测任务(目标检测、分割、视频理解),但规模上不去,能力的上限就被锁死了。

华为团队的这篇《Distilling and Scaling Hierarchical Vision Transformer to 30B Parameters》,把规模上限从 2B 直接推到了 30B。


怎么做到的?答案是对模型结构和训练策略都进行重新设计,两者缺一不可。

结构上的核心设计是 Efficient Hierarchical ViT 架构。它在保证多尺度特征提取能力的同时,兼顾了计算效率。

基于这一架构,团队训练了从 200M 到5B参数的稠密模型,并引入稀疏专家混合(SMoE)变体,将总参数量推到了30B——这是目前层次化ViT领域已公开的最大参数规模。

训练上,团队设计了一套两阶段流程:

第一阶段,在ImageNet-21K上做MAE自监督预训练,让模型学会视觉表征的基本规律;

第二阶段,在2700万图像数据集上,从多个最先进的通用基础模型中蒸馏知识,实现能力跃迁。

实验结果给出了最有力的证明。在ImageNet-1K线性评测中,总参数30B的MoE模型(EHV-5B-MoE)推理时仅激活67亿参数,就以89.0%的准确率,超越了普通ViT路线下、总参数更大的模型EVA-CLIP-18B。

更重要的是,它的性能提升不局限于图像分类——视频分析和密集预测任务上同样表现优异。这说明EHV学到的不只是分类特征,而是真正高质量、可泛化的视觉表征。

华为团队用这项工作,证明了层次化ViT不仅能做大,而且在推理侧,能用更少的激活参数,达到更高的准确性。

架构设计决定了模型的能力上限,而训练策略则决定了这一上限能在多大程度上被释放。

02


输入前置筛选:

可学习帧选择器的范式革新

模型底座的天花板抬高了,但算力的消耗不仅仅在模型本身,喂给模型的数据,同样在大量吞噬计算资源。

视频-大语言模型(Video-LLMs)处理视频时,计算成本主要消耗在帧编码上。为了控制成本,现有模型几乎都采用均匀采样——等间隔抽帧。

然而,视频里的关键事件从来不会均匀分布。一个重要的动作可能只持续一两秒,如果恰好落在两个采样点之间,就被彻底漏掉了。相反,那些冗长的静态画面却被反复编码,浪费了宝贵的计算资源。

另一种思路是查询驱动的方法——根据具体问题去检索相关的帧。这在视频问答场景下确实有效,但详细视频描述是一个“无查询”任务,这种方法在这里派不上用场。

均匀采样太粗糙,查询驱动的方法又用不了。怎么破?

华为 AI 数据团队提出的可学习的帧选择器 LFS(Learnable Frame Selector),试图来解决这个问题。


论文地址:https://arxiv.org/pdf/2601.14594v1

他们的核心想法很直接:与其靠人工规则选帧,不如让模型自己学会“该看什么” 。


这是一种“以终为始”的训练范式,LFS 不再学“选哪些帧在某个中间得分上更高”,它学的是“选哪些帧能让大模型写出更好的描述”。

具体怎么做的?三个关键设计:

第一,训练一个评分网络,给每一帧打一个“事件重要性”分数。


第二,分段选帧而非全局排序。选帧时不用简单的“得分最高的前K个”,而是把整个视频切成多个时间段,在每个时间段里分别挑最重要的帧。这样既抓住了关键事件,又保证了帧在时间轴上分布均匀。

第三,也是最关键的一步——训练方式。LFS选好帧之后,把它们喂给冻结的Video-LLM生成描述,拿生成的描述和人工标注的标准描述做对比,算出损失,再反向传播去更新帧选择器的参数。整个过程中大语言模型本身一动没动,LFS就像一个即插即用的外挂模块。

此外,研究团队还发现了一个问题:现有的详细视频描述基准和人类真正的认知之间有挺大的差距。因此他们自建了一个新基准ICH-CC,视频全部来源于中国非遗烹饪的真实商业场景(如餐厅后厨、烹饪教学等),所有描述和问答均由人工精心撰写,更贴近真实应用场景。


实验结果怎么样?


LFS在不同模型和不同基准上都带来了普遍且稳定的提升。所有模型的 LFS增强版,在所有测试基准上都高于基线模型,这说明LFS 不仅能在单一基准上取得好成绩,具备一定的通用性。

这也回应了论文的核心命题:与其让模型在均匀采样的帧上“硬算”,不如在输入端做一次智能筛选——选对了帧,下游任务的表现也随之有所提升。


通过 LFS 生成的更优描述,视频问答等下游任务效果也得到提升

03


任务适配:

表征模块化干预取代全模型微调

大语言模型的跨任务泛化能力,一直是个“说起来重要、做起来难”的问题。

现有主流方案是per-token动态路由——每个token在处理时,都要在多个LoRA适配器之间做选择,决定走哪条路。这套机制确实有效,但代价也不小:计算量和显存占用都居高不下,模型跑起来又慢又吃显存。

另一种思路——表征微调(ReFT),则不再动模型参数,而是只编辑前缀和后缀token的表征来实现单任务适配,效率比LoRA高不少。

但它有两个短板:一是token本身的语义就有歧义,只改首尾不够精准;二是缺少一种“自引导”机制,模型面对没见过的新任务时,不知道该改哪一层、改哪个表征。

华为云团队与多所高校合作,提出了表征感知的模块化 RaMod(Representation-Aware Modularity) 框架,把 ReFT 的思路成功扩展到了跨任务泛化场景。


核心做法可以拆成两部分来看:

第一部分是双模块表征与参数微调。ReFT只能动首尾,RaMod 精细得多——从中间层的隐藏表征里挑出一个策略筛选过的子集,来做模块化干预。改哪里、怎么改,都是有选择、有策略的。这样能更精准地引导模型去解决没见过的任务。

第二部分是异步调度器。跨任务泛化最怕显存不够,RaMod设计了一套主动调度机制:需要哪些干预就分配显存,用完了就主动释放。这样一来,存储开销被压到了最低。

效果立竿见影。实验表明,RaMod不仅跨任务泛化效果更好,成本也大幅下降:相较于原始 LLMs,该方法额外预填时间减少了83%,生成延迟降低 100%,显存占用少了79%。

换句话说,RaMod把任务适配从"改模型"变成了"调表征"——不动模型主体,只在关键层的隐藏状态上做定点编辑。

这种思路如果成立,大模型部署的经济学可能会被改写:一个底座模型配上若干轻量级干预模块,就能低成本地服务于截然不同的任务场景,而不必为每个场景单独训练或加载完整副本。

不过在“改写”之前,这种表征微调的方法,仍有一些关键问题需要回答,比如在复杂推理等高难度场景中,是否依然能在大幅节省算力成本的同时守住准确性。

04


数据破局:语言专家各司其职,

渐进训练步步为营

前三篇论文都在解决"怎么更高效地用模型"。但很多任务还有一个更根本的现实挑战:如果连训练数据都不够呢?

语码转换(Code-Switching,CS)语音翻译任务,需要将夹杂多种语言的语音翻译成目标语言。这种任务不仅语义建模复杂,CS 数据的稀缺性,更是一个大问题。

以前的研究主要靠两条路走:要么让模型自己去"悟"语义表征,效果不可控;要么花大价钱做人工标注,成本太高,规模也做不大。

华为翻译服务中心团队,与厦门大学、澳门大学合作的这篇论文,提出了一个新思路:与其让模型自己摸索不同语言的语义表征,不如主动把它们对齐好——为每种语言单独建一个"专家团队",让各团队分别负责各自语言的语义建模,最后再统一对齐。


论文地址:https://arxiv.org/pdf/2511.10670

具体实现方式有两个关键设计:

第一个是MoE(混合专家)语音投影器。传统投影器对所有语言一视同仁,效果自然不理想。MoE版本的做法是给每种语言分配一组专门的"专家",每个专家组只负责一种语言的细粒度语音特征建模。路由机制会自动把语音特征送到对应语言的专家组手里。


为了保证路由不跑偏,论文还引入了两个辅助损失:语言特定损失确保每个专家真正学会对应语言的特征,组内负载均衡损失防止所有token都挤到同一个专家。

第二个是多阶段训练范式。数据不够,就用策略来凑。整个训练分四步走:先用自动语音识别(ASR)数据分别预训练每种语言的投影器,打好语音-文本对齐的基础;然后把各语言的投影器组装成MoE结构,用语言特定损失和负载均衡损失联合优化;接着从ASR 数据逐步过渡到单语语音翻译(ST)数据,用过渡损失平滑迁移;最后从 ST 数据适配到CS语音翻译数据。

这套渐进式设计的精妙之处在于——不是让模型直接硬啃稀缺的 CS 数据,而是先用充足的 ASR 和 ST 数据把基础能力打牢,再一步步转向目标任务。


实验对比了Whisper、SeamlessM4T、LLaST等多个强基线模型。在Fisher和NTUML2021的四个测试集上,该方法均超越了其他模型中表现最突出的 SeamlessM4T,BLEU最高达到39.52,COMET最高达到81.33。

这项工作传递的信号很明确:在数据稀缺的跨语言场景下,精细化的架构设计和渐进式的训练策略,也许比单纯堆数据更管用。

需要注意的是,这项工作在语言数量有限、数据质量可控的场景下,是有效的“尖刀方案”,但在需要覆盖数十种语言的通用多语种翻译系统中,是否具备可扩展性,还需要进一步论证。

05


结束语:

以设计密度,换算力成本

30B层次化ViT重构了模型骨架,让67亿激活参数在ImageNet上超越了180亿的对手;

LFS在输入端做了一道减法,把大量无意义的帧编码开销挡在计算之前;

RaMod把全量微调压缩成表征层的定点编辑,跨任务适配的显存和延迟一起降了下来;

语码转换语音翻译则用MoE分工和渐进式训练,在数据最匮乏的赛道上证明了一个道理:架构的智慧,有时候能够弥补数据的贫瘠。

四篇论文,四个方向,都在指向同一个内核:华为正在用“设计密度”取代“规模密度”。四篇论文分别来自基础研究、AI数据、云服务和翻译服务中心,说明效率优先已不仅仅是某个团队的偏好,这个逻辑被写进了各个环节的技术选择里。

如果把过去两年的AI竞赛比作“拼矿”,那2026年正显露出一个拐点:拼“冶炼技术”的时代已经开始了。稀疏激活、智能筛选、模块化适配、渐进式训练——这些路径不依赖更多的芯片和算力,而依赖对问题本身更深刻的理解。

无论大厂还是创业公司,早已走过了参数军备赛,AI 的下半场,对现实落地问题的理解,以及系统化解决这些问题的工程能力,才是真正的决胜点。

IJCAI 2026 要来了,你还在单打独斗?

为了方便大家抱团交流、互通会议消息,我们专门建了IJCAI 2026 参会群!进群你会解锁这些「福利」

  • 会议情报站投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。

  • 同行茶话会天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。

  • 前沿补给站最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。

  • 现场后援团:(会议期间专属开启):到了会场也不用慌——

    路线导航场馆分布、报告厅怎么走,群里随时问;

    议题共读热门 session、Keynote 现场探讨,错过也能追;

    Poster 汇编现场海报精华整理,一键收藏不遗漏;

    约局广场约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。

进群传送门:扫码进群或添加微信Qvv0909777,备注:IJCAI+ 单位/学校+姓名+方向

搞科研/搞技术,信息差很重要。

来,一起快人一步!

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
特朗普宣布美伊8月3日开启谈判,伊朗公开驳斥美方说辞,局势变数仍存|周期早参

特朗普宣布美伊8月3日开启谈判,伊朗公开驳斥美方说辞,局势变数仍存|周期早参

每日经济新闻
2026-08-03 09:34:10
伊朗的电话被打爆!特朗普想不到,中国两大判断居然全部成真了!

伊朗的电话被打爆!特朗普想不到,中国两大判断居然全部成真了!

可乐爱微笑
2026-08-03 17:53:48
没想到,豪夺菲尔兹奖才几天,王虹竟再因一个举动,赚足全球目光

没想到,豪夺菲尔兹奖才几天,王虹竟再因一个举动,赚足全球目光

娱瓜酱
2026-08-03 14:41:46
美媒:马六甲海峡战略重要性更加凸显

美媒:马六甲海峡战略重要性更加凸显

参考消息
2026-08-03 14:10:16
高雄油厂5月就发现毒油却瞒报,岛内作家痛批:害民众多吃两个月

高雄油厂5月就发现毒油却瞒报,岛内作家痛批:害民众多吃两个月

海峡导报社
2026-08-02 12:26:03
地铁安检到底在防谁?国外多年没有照样过,国内为何层层设防?

地铁安检到底在防谁?国外多年没有照样过,国内为何层层设防?

抽象派大师
2026-07-20 02:07:32
周星驰的剧组,有个不成文的规矩,但没人敢破。吃饭时,场工扯着嗓子喊:“跑龙套的先吃!不限量,热乎的!”

周星驰的剧组,有个不成文的规矩,但没人敢破。吃饭时,场工扯着嗓子喊:“跑龙套的先吃!不限量,热乎的!”

美芽
2026-08-03 14:57:21
俄军144师师长乘坐的装甲车被无人机击中:副手死亡,师长疑似受伤

俄军144师师长乘坐的装甲车被无人机击中:副手死亡,师长疑似受伤

桂系007
2026-08-01 03:28:54
“野莓”创始人塔季扬娜·金被加入乌克兰“和平制造者”的数据库

“野莓”创始人塔季扬娜·金被加入乌克兰“和平制造者”的数据库

山河路口
2026-08-02 19:33:33
003001,一分钟涨停!

003001,一分钟涨停!

中国基金报
2026-08-03 10:27:58
人民币杀疯了!超越美元,三年来最强的一次,中国经济真挺住了!

人民币杀疯了!超越美元,三年来最强的一次,中国经济真挺住了!

飘逸的云朵
2026-08-03 10:31:58
国家带头抵制也没用!LV大佬嚣张放狠话,网友:这就是在针对中国

国家带头抵制也没用!LV大佬嚣张放狠话,网友:这就是在针对中国

小怪吃美食
2026-08-03 17:39:19
从3万跌到1.3万!长沙这5个小区房价跌得最惨,看完吓一跳

从3万跌到1.3万!长沙这5个小区房价跌得最惨,看完吓一跳

石辰搞笑日常
2026-08-03 13:53:45
胚胎案朱女士自曝,离婚女儿最初不愿跟她,分不到财产就开网约车

胚胎案朱女士自曝,离婚女儿最初不愿跟她,分不到财产就开网约车

寒士之言本尊
2026-08-03 18:22:59
3-0中国队!朝鲜女足第二天6点跑早操 宋凯吃惊:连发两个感叹号

3-0中国队!朝鲜女足第二天6点跑早操 宋凯吃惊:连发两个感叹号

念洲
2026-08-03 09:53:08
属兔人,一周之内,可能有让你“痛入骨髓”的消息传来,做好准备

属兔人,一周之内,可能有让你“痛入骨髓”的消息传来,做好准备

智慧生活笔记
2026-08-03 15:20:37
《金特务》苏志燮老婆原来这么辣!「上围包不住」现青龙系列大奖

《金特务》苏志燮老婆原来这么辣!「上围包不住」现青龙系列大奖

ETtoday星光云
2026-08-03 11:31:03
不出5年,城里“3个群体”将会全部回到农村?你也在其中吗?

不出5年,城里“3个群体”将会全部回到农村?你也在其中吗?

生命之泉的奥秘
2026-07-29 11:39:12
央视怒批:戏子误国!这三位明星恶贯满盈,最终下场是咎由自取!

央视怒批:戏子误国!这三位明星恶贯满盈,最终下场是咎由自取!

风月得自难寻
2026-08-02 03:34:46
持续升级!婚外胚胎案丈夫反击,漂亮三姐正脸曝光,细节太讽刺

持续升级!婚外胚胎案丈夫反击,漂亮三姐正脸曝光,细节太讽刺

小鋭有话说
2026-08-03 13:45:13
2026-08-03 19:48:49
AI科技评论 incentive-icons
AI科技评论
点评学术,服务AI
7520文章数 20772关注度
往期回顾 全部

科技要闻

“像魔法一样”的AI,只卖几分钱

头条要闻

3名辅警在非管辖区查醉驾"以罚代刑"致1死 还多次收钱

头条要闻

3名辅警在非管辖区查醉驾"以罚代刑"致1死 还多次收钱

体育要闻

马克龙介入FIFA危机 致电因凡蒂诺勿搞分裂

娱乐要闻

陈璇半蹲采访诺兰惹争议

财经要闻

大婚前夜 450亿基金爆仓

汽车要闻

00后搞钱成功后的第一台车,真的不是BBA

态度原创

健康
艺术
旅游
数码
手机

干细胞和衰老有什么联系?

艺术要闻

这是集王字书法的源头,比《圣教序》还早300年,如今被日本视为“国宝”!

旅游要闻

赛里木湖自驾服务费争议尘埃落定,生态账与民生账如何兼得? 文旅观察

数码要闻

雷神27英寸2K 360Hz显示器开卖!1577元

手机要闻

荣耀Robot Phone手机核心配置曝光,8月12日发布

无障碍浏览 进入关怀版