网易首页 > 网易号 > 正文 申请入驻

华为 IJCAI 2026 论文盘点:从「规模密度」转向「设计密度」

0
分享至


AI 走向现实场景,系统化工程能力,是瓶颈,也是突破口。

作者丨幸丽娟

编辑丨齐铖湧

IJCAI-ECAI 2026 将于 2026 年 8 月 15 日至 21 日在德国不来梅举行。作为 AI 领域的综合性顶级会议,IJCAI 一直是检验各大厂过去一年前沿研究成果的关键考场:谁在哪个方向上有真进展,哪些技术路线正在形成共识,论文是最直接的答案。

大会召开之际,AI科技评论也正在系统扫描本届顶会收录的论文,从中捕捉技术趋势和行业风向。

一个清晰的趋势是:AI 算力成本居高不下,而参数规模扩张带来的边际收益早已追不上边际成本。这个经济学现实正在重塑技术创新逻辑——从"能不能做得更大"转向"能不能用得更省"。

华为被 IJCAI 2026 收录的四篇论文,为这一转向提供了技术路径参考:用更精巧的架构设计和训练策略,来对冲数据稀缺瓶颈,换取单位算力更高的智能产出。

这种技术取向的转变,也呼应了 AI 落地的深层变化:当技术走出实验室,竞争早已不是某一项能力的单点突破,而是准确性、泛化性、数据、算力之间的系统统筹——每一个环节都可能成为瓶颈,也都可能成为突破口。

下面这四篇论文,恰好从这四个方向,展现了华为的系统化工程能力和技术选择。


01

规模破壁:架构+训练,改写层次化 ViT 的能力上限

视觉基础模型的规模化竞赛中,一直存在一层隐形的"天花板"。

普通ViT的规模化一路高歌猛进,从6B到22B不断刷新上限。但层次化ViT始终卡在2B参数以下。

不是不想做大,是做不大。层级化模型对数据和训练策略的要求比普通ViT高得多,简单套用普通ViT的规模化方案行不通。

这就导致了一个结构性矛盾——层级化ViT天然擅长多尺度表征和密集预测任务(目标检测、分割、视频理解),但规模上不去,能力的上限就被锁死了。

华为团队的这篇《Distilling and Scaling Hierarchical Vision Transformer to 30B Parameters》,把规模上限从 2B 直接推到了 30B。


怎么做到的?答案是对模型结构和训练策略都进行重新设计,两者缺一不可。

结构上的核心设计是 Efficient Hierarchical ViT 架构。它在保证多尺度特征提取能力的同时,兼顾了计算效率。

基于这一架构,团队训练了从 200M 到5B参数的稠密模型,并引入稀疏专家混合(SMoE)变体,将总参数量推到了30B——这是目前层次化ViT领域已公开的最大参数规模。

训练上,团队设计了一套两阶段流程:

第一阶段,在ImageNet-21K上做MAE自监督预训练,让模型学会视觉表征的基本规律;

第二阶段,在2700万图像数据集上,从多个最先进的通用基础模型中蒸馏知识,实现能力跃迁。

实验结果给出了最有力的证明。在ImageNet-1K线性评测中,总参数30B的MoE模型(EHV-5B-MoE)推理时仅激活67亿参数,就以89.0%的准确率,超越了普通ViT路线下、总参数更大的模型EVA-CLIP-18B。

更重要的是,它的性能提升不局限于图像分类——视频分析和密集预测任务上同样表现优异。这说明EHV学到的不只是分类特征,而是真正高质量、可泛化的视觉表征。

华为团队用这项工作,证明了层次化ViT不仅能做大,而且在推理侧,能用更少的激活参数,达到更高的准确性。

架构设计决定了模型的能力上限,而训练策略则决定了这一上限能在多大程度上被释放。


02

输入前置筛选:可学习帧选择器的范式革新

模型底座的天花板抬高了,但算力的消耗不仅仅在模型本身,喂给模型的数据,同样在大量吞噬计算资源。

视频-大语言模型(Video-LLMs)处理视频时,计算成本主要消耗在帧编码上。为了控制成本,现有模型几乎都采用均匀采样——等间隔抽帧。

然而,视频里的关键事件从来不会均匀分布。一个重要的动作可能只持续一两秒,如果恰好落在两个采样点之间,就被彻底漏掉了。相反,那些冗长的静态画面却被反复编码,浪费了宝贵的计算资源。

另一种思路是查询驱动的方法——根据具体问题去检索相关的帧。这在视频问答场景下确实有效,但详细视频描述是一个“无查询”任务,这种方法在这里派不上用场。

均匀采样太粗糙,查询驱动的方法又用不了。怎么破?

华为 AI 数据团队提出的可学习的帧选择器 LFS(Learnable Frame Selector),试图来解决这个问题。


论文地址:https://arxiv.org/pdf/2601.14594v1

他们的核心想法很直接:与其靠人工规则选帧,不如让模型自己学会“该看什么” 。


这是一种“以终为始”的训练范式,LFS 不再学“选哪些帧在某个中间得分上更高”,它学的是“选哪些帧能让大模型写出更好的描述”。

具体怎么做的?三个关键设计:

第一,训练一个评分网络,给每一帧打一个“事件重要性”分数。


第二,分段选帧而非全局排序。选帧时不用简单的“得分最高的前K个”,而是把整个视频切成多个时间段,在每个时间段里分别挑最重要的帧。这样既抓住了关键事件,又保证了帧在时间轴上分布均匀。

第三,也是最关键的一步——训练方式。LFS选好帧之后,把它们喂给冻结的Video-LLM生成描述,拿生成的描述和人工标注的标准描述做对比,算出损失,再反向传播去更新帧选择器的参数。整个过程中大语言模型本身一动没动,LFS就像一个即插即用的外挂模块。

此外,研究团队还发现了一个问题:现有的详细视频描述基准和人类真正的认知之间有挺大的差距。因此他们自建了一个新基准ICH-CC,视频全部来源于中国非遗烹饪的真实商业场景(如餐厅后厨、烹饪教学等),所有描述和问答均由人工精心撰写,更贴近真实应用场景。


实验结果怎么样?


LFS在不同模型和不同基准上都带来了普遍且稳定的提升。所有模型的 LFS增强版,在所有测试基准上都高于基线模型,这说明LFS 不仅能在单一基准上取得好成绩,具备一定的通用性。

这也回应了论文的核心命题:与其让模型在均匀采样的帧上“硬算”,不如在输入端做一次智能筛选——选对了帧,下游任务的表现也随之有所提升。



03

任务适配:表征模块化干预取代全模型微调

大语言模型的跨任务泛化能力,一直是个“说起来重要、做起来难”的问题。

现有主流方案是per-token动态路由——每个token在处理时,都要在多个LoRA适配器之间做选择,决定走哪条路。这套机制确实有效,但代价也不小:计算量和显存占用都居高不下,模型跑起来又慢又吃显存。

另一种思路——表征微调(ReFT),则不再动模型参数,而是只编辑前缀和后缀token的表征来实现单任务适配,效率比LoRA高不少。

但它有两个短板:一是token本身的语义就有歧义,只改首尾不够精准;二是缺少一种“自引导”机制,模型面对没见过的新任务时,不知道该改哪一层、改哪个表征。

华为云团队与多所高校合作,提出了表征感知的模块化 RaMod(Representation-Aware Modularity) 框架,把 ReFT 的思路成功扩展到了跨任务泛化场景。


核心做法可以拆成两部分来看:

第一部分是双模块表征与参数微调。ReFT只能动首尾,RaMod 精细得多——从中间层的隐藏表征里挑出一个策略筛选过的子集,来做模块化干预。改哪里、怎么改,都是有选择、有策略的。这样能更精准地引导模型去解决没见过的任务。

第二部分是异步调度器。跨任务泛化最怕显存不够,RaMod设计了一套主动调度机制:需要哪些干预就分配显存,用完了就主动释放。这样一来,存储开销被压到了最低。

效果立竿见影。实验表明,RaMod不仅跨任务泛化效果更好,成本也大幅下降:相较于原始 LLMs,该方法额外预填时间减少了83%,生成延迟降低 100%,显存占用少了79%。

换句话说,RaMod把任务适配从"改模型"变成了"调表征"——不动模型主体,只在关键层的隐藏状态上做定点编辑。

这种思路如果成立,大模型部署的经济学可能会被改写:一个底座模型配上若干轻量级干预模块,就能低成本地服务于截然不同的任务场景,而不必为每个场景单独训练或加载完整副本。

不过在“改写”之前,这种表征微调的方法,仍有一些关键问题需要回答,比如在复杂推理等高难度场景中,是否依然能在大幅节省算力成本的同时守住准确性。


04

数据破局:语言专家各司其职,渐进训练步步为营

前三篇论文都在解决"怎么更高效地用模型"。但很多任务还有一个更根本的现实挑战:如果连训练数据都不够呢?

语码转换(Code-Switching,CS)语音翻译任务,需要将夹杂多种语言的语音翻译成目标语言。这种任务不仅语义建模复杂,CS 数据的稀缺性,更是一个大问题。

以前的研究主要靠两条路走:要么让模型自己去"悟"语义表征,效果不可控;要么花大价钱做人工标注,成本太高,规模也做不大。

华为翻译服务中心团队,与厦门大学、澳门大学合作的这篇论文,提出了一个新思路:与其让模型自己摸索不同语言的语义表征,不如主动把它们对齐好——为每种语言单独建一个"专家团队",让各团队分别负责各自语言的语义建模,最后再统一对齐。


论文地址:https://arxiv.org/pdf/2511.10670

具体实现方式有两个关键设计:

第一个是MoE(混合专家)语音投影器。传统投影器对所有语言一视同仁,效果自然不理想。MoE版本的做法是给每种语言分配一组专门的"专家",每个专家组只负责一种语言的细粒度语音特征建模。路由机制会自动把语音特征送到对应语言的专家组手里。


为了保证路由不跑偏,论文还引入了两个辅助损失:语言特定损失确保每个专家真正学会对应语言的特征,组内负载均衡损失防止所有token都挤到同一个专家。

第二个是多阶段训练范式。数据不够,就用策略来凑。整个训练分四步走:先用自动语音识别(ASR)数据分别预训练每种语言的投影器,打好语音-文本对齐的基础;然后把各语言的投影器组装成MoE结构,用语言特定损失和负载均衡损失联合优化;接着从ASR 数据逐步过渡到单语语音翻译(ST)数据,用过渡损失平滑迁移;最后从 ST 数据适配到CS语音翻译数据。

这套渐进式设计的精妙之处在于——不是让模型直接硬啃稀缺的 CS 数据,而是先用充足的 ASR 和 ST 数据把基础能力打牢,再一步步转向目标任务。


实验对比了Whisper、SeamlessM4T、LLaST等多个强基线模型。在Fisher和NTUML2021的四个测试集上,该方法均超越了其他模型中表现最突出的 SeamlessM4T,BLEU最高达到39.52,COMET最高达到81.33。

这项工作传递的信号很明确:在数据稀缺的跨语言场景下,精细化的架构设计和渐进式的训练策略,也许比单纯堆数据更管用。

需要注意的是,这项工作在语言数量有限、数据质量可控的场景下,是有效的“尖刀方案”,但在需要覆盖数十种语言的通用多语种翻译系统中,是否具备可扩展性,还需要进一步论证。


05

结束语:以设计密度,换算力成本

30B层次化ViT重构了模型骨架,让67亿激活参数在ImageNet上超越了180亿的对手;

LFS在输入端做了一道减法,把大量无意义的帧编码开销挡在计算之前;

RaMod把全量微调压缩成表征层的定点编辑,跨任务适配的显存和延迟一起降了下来;

语码转换语音翻译则用MoE分工和渐进式训练,在数据最匮乏的赛道上证明了一个道理:架构的智慧,有时候能够弥补数据的贫瘠。

四篇论文,四个方向,都在指向同一个内核:华为正在用“设计密度”取代“规模密度”。四篇论文分别来自基础研究、AI数据、云服务和翻译服务中心,说明效率优先已不仅仅是某个团队的偏好,这个逻辑被写进了各个环节的技术选择里。

如果把过去两年的AI竞赛比作“拼矿”,那2026年正显露出一个拐点:拼“冶炼技术”的时代已经开始了。稀疏激活、智能筛选、模块化适配、渐进式训练——这些路径不依赖更多的芯片和算力,而依赖对问题本身更深刻的理解。

无论大厂还是创业公司,早已走过了参数军备赛,AI 的下半场,对现实落地问题的理解,以及系统化解决这些问题的工程能力,才是真正的决胜点。雷峰网雷峰网雷峰网

IJCAI 2026 要来了,你还在单打独斗?

为了方便大家抱团交流、互通会议消息,我们专门建了IJCAI 2026 参会群!进群你会解锁这些「福利」?

  • 会议情报站:投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。

  • 同行茶话会:天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。

  • 前沿补给站:最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。

  • 现场后援团:(会议期间专属开启):到了会场也不用慌——

    路线导航:场馆分布、报告厅怎么走,群里随时问;

    议题共读:热门 session、Keynote 现场探讨,错过也能追;

    Poster 汇编:现场海报精华整理,一键收藏不遗漏;

    约局广场:约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。

? 进群传送门:扫码进群或添加微信Qvv0909777,备注:IJCAI+ 单位/学校+姓名+方向

搞科研/搞技术,信息差很重要。

来,一起快人一步!

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
堪称最离谱的枕边翻车现场,清华学霸杨奇函被女友趁熟睡时蚂蚁搬家式转走百万

堪称最离谱的枕边翻车现场,清华学霸杨奇函被女友趁熟睡时蚂蚁搬家式转走百万

东方不败然多多
2026-08-22 04:34:50
小红书女博主怒批《欢迎来龙餐馆》:通篇辱女脏话,观感炸裂不适

小红书女博主怒批《欢迎来龙餐馆》:通篇辱女脏话,观感炸裂不适

小徐讲八卦
2026-08-24 10:03:17
美国眼里歼-16,只要落地埃及,中东将难以承受这个代价

美国眼里歼-16,只要落地埃及,中东将难以承受这个代价

影孖看世界
2026-08-22 23:05:01
举报后4分钟跑路,5小时飞新加坡!代孕窝点,谁在通风报信?

举报后4分钟跑路,5小时飞新加坡!代孕窝点,谁在通风报信?

李云飞Afey
2026-08-23 22:38:02
全网骂了三天俩女孩"零食占座"背后的“27小时”,当初却没人去想一个最简单的问题

全网骂了三天俩女孩"零食占座"背后的“27小时”,当初却没人去想一个最简单的问题

迷世书童
2026-08-23 09:53:21
巴萨卖便宜了!费兰大巴黎首秀:11分钟进2球,身价5000万欧超值

巴萨卖便宜了!费兰大巴黎首秀:11分钟进2球,身价5000万欧超值

体育知多少
2026-08-24 07:21:11
996模式搬到美国,FBI出动装甲车抓人,华人老板或将面临20年刑期

996模式搬到美国,FBI出动装甲车抓人,华人老板或将面临20年刑期

易玄
2026-08-21 12:10:19
明晚正式开播!又一部好剧来袭!辛芷蕾,陈坤领衔主演

明晚正式开播!又一部好剧来袭!辛芷蕾,陈坤领衔主演

空樽对月花独瘦
2026-08-24 10:39:56
问界口碑为啥突然崩了?这3个真相,老车主看了都沉默

问界口碑为啥突然崩了?这3个真相,老车主看了都沉默

生活魔术专家
2026-08-22 08:09:52
CCTV5直播!中国女排迎最强对手,吴梦洁是期待,赵勇应抓紧练兵

CCTV5直播!中国女排迎最强对手,吴梦洁是期待,赵勇应抓紧练兵

跑者排球视角
2026-08-24 07:28:59
我老公对我真的是生理性喜欢,我俩今年四十五,他每天晚上都要抱着我睡,不是那种敷衍的搭把手,是真抱

我老公对我真的是生理性喜欢,我俩今年四十五,他每天晚上都要抱着我睡,不是那种敷衍的搭把手,是真抱

徐侠客有话说
2026-08-13 11:03:24
唐师曾去世前画面公开,前妻用双手捂脚,徒弟拉着手不放,播放《主祷文》

唐师曾去世前画面公开,前妻用双手捂脚,徒弟拉着手不放,播放《主祷文》

育学笔谈
2026-08-24 16:54:33
日本全面叫停种植牙?种牙潜藏的风险与后遗症,一次为你讲明白

日本全面叫停种植牙?种牙潜藏的风险与后遗症,一次为你讲明白

健康科普365
2026-08-13 14:30:15
宇树IPO:追高、被套,多久能回血?

宇树IPO:追高、被套,多久能回血?

36氪财经
2026-08-24 15:24:18
快讯!美国传来新消息!

快讯!美国传来新消息!

故事终将光明磊落
2026-08-24 08:21:34
拔出萝卜带出泥!许家印风波升级,多位女星被牵连,刘亦菲太无辜

拔出萝卜带出泥!许家印风波升级,多位女星被牵连,刘亦菲太无辜

秋姐居
2026-08-23 19:11:08
黄金涨破4700美元,可以先收割一波了

黄金涨破4700美元,可以先收割一波了

东方豪侠
2026-08-24 13:30:19
央视五套拿下五大联赛全部版权 球迷免费看球时代来临

央视五套拿下五大联赛全部版权 球迷免费看球时代来临

带你逛体坛
2026-08-23 18:45:11
许家印头发全白,科学解释来了:非“一夜白头”,是两笔账一起算

许家印头发全白,科学解释来了:非“一夜白头”,是两笔账一起算

呼呼历史论
2026-08-24 10:07:14
让张丹丹们当智囊?这不仅是悲哀,更是老百姓的灾难!

让张丹丹们当智囊?这不仅是悲哀,更是老百姓的灾难!

娱乐圈见解说
2026-08-24 06:25:14
2026-08-24 21:52:49
雷峰网 incentive-icons
雷峰网
关注智能与未来!
70640文章数 656218关注度
往期回顾 全部

科技要闻

宇树科技,3天跌了1000亿

头条要闻

新加坡总理用中文演讲:新加坡绝不能成为单语社会

头条要闻

新加坡总理用中文演讲:新加坡绝不能成为单语社会

体育要闻

42张照片 珍藏世界杯的热辣滚烫

娱乐要闻

韩沛颖开撕《主角》剧组引发全网热议

财经要闻

宇树IPO:追高、被套,多久能回血?

汽车要闻

智能超混 国民家轿 上汽大众ID. ERA 5S上市 限时8.99万元起

态度原创

亲子
时尚
教育
本地
数码

亲子要闻

儿科医生告诉你,胎儿畸形是怎么形成的?

把睡衣穿出门,是2026年最时髦的事

教育要闻

西山区将新增两所公办九年一贯制学校

本地新闻

《牛来》的一声“妈妈”,到底多少人被精神污染了

数码要闻

消息称Apple Store将改造配件展区,新款HomePod mini、Apple TV和家居中心即将到来!

无障碍浏览 进入关怀版