
华为 IJCAI 2026 论文盘点:从「规模密度」转向「设计密度」
Quick Answer
Huawei's four papers for IJCAI 2026 highlight a shift from 'scale density' to 'design density' in AI, achieving a 30B parameter Hierarchical ViT model that surpasses larger competitors with fewer active parameters.
Quick Take
Their innovations, including a Learnable Frame Selector and a modular adaptation framework, significantly enhance efficiency and performance across various tasks.
Key Points
- Achieved 30B parameters in Hierarchical ViT, outperforming 18B models with 67M active parameters.
- Learnable Frame Selector improves video processing efficiency by intelligently selecting frames.
- RaMod framework reduces cross-task adaptation costs by 83% while maintaining performance.
- MoE structure in speech translation aligns language-specific models, enhancing accuracy in scarce data scenarios.
- Shift towards design density indicates a new era in AI efficiency and deployment strategies.
DeepSignal Analysis
What happened
Huawei's four papers accepted at IJCAI 2026 illustrate a shift in AI research from focusing on increasing model size to enhancing design efficiency. They achieved a 30B parameter Hierarchical ViT model that outperforms larger models with fewer active parameters. Innovations include a Learnable Frame Selector and a modular adaptation framework, which improve efficiency across various tasks.
Key evidence
- Huawei's paper 'Distilling and Scaling Hierarchical Vision Transformer to 30B Parameters' increased the model's capacity from 2B to 30B parameters.
- The Learnable Frame Selector (LFS) improves video processing efficiency by allowing the model to learn which frames to prioritize, rather than using uniform sampling.
- The RaMod framework enhances task adaptation by modifying only specific layers of the model, reducing memory usage by 79% compared to traditional methods.
Why it matters
This transition to 'design density' reflects a broader trend in AI where the focus is on optimizing resource use rather than merely increasing computational power. As AI applications move into real-world scenarios, the ability to efficiently utilize existing resources becomes crucial. Huawei's advancements may influence future research and development priorities across the industry.
📖 Reader Mode
~5 min read
作者丨幸丽娟
编辑丨齐铖湧
IJCAI-ECAI 2026 将于 2026 年 8 月 15 日至 21 日在德国不来梅举行。作为 AI 领域的综合性顶级会议,IJCAI 一直是检验各大厂过去一年前沿研究成果的关键考场:谁在哪个方向上有真进展,哪些技术路线正在形成共识,论文是最直接的答案。
大会召开之际,AI科技评论也正在系统扫描本届顶会收录的论文,从中捕捉技术趋势和行业风向。
一个清晰的趋势是:AI 算力成本居高不下,而参数规模扩张带来的边际收益早已追不上边际成本。这个经济学现实正在重塑技术创新逻辑——从"能不能做得更大"转向"能不能用得更省"。
华为被 IJCAI 2026 收录的四篇论文,为这一转向提供了技术路径参考:用更精巧的架构设计和训练策略,来对冲数据稀缺瓶颈,换取单位算力更高的智能产出。
这种技术取向的转变,也呼应了 AI 落地的深层变化:当技术走出实验室,竞争早已不是某一项能力的单点突破,而是准确性、泛化性、数据、算力之间的系统统筹——每一个环节都可能成为瓶颈,也都可能成为突破口。
下面这四篇论文,恰好从这四个方向,展现了华为的系统化工程能力和技术选择。

01
规模破壁:架构+训练,
改写层次化 ViT 的能力上限
视觉基础模型的规模化竞赛中,一直存在一层隐形的"天花板"。
普通ViT的规模化一路高歌猛进,从6B到22B不断刷新上限。但层次化ViT始终卡在2B参数以下。
不是不想做大,是做不大。层级化模型对数据和训练策略的要求比普通ViT高得多,简单套用普通ViT的规模化方案行不通。
这就导致了一个结构性矛盾——层级化ViT天然擅长多尺度表征和密集预测任务(目标检测、分割、视频理解),但规模上不去,能力的上限就被锁死了。
华为团队的这篇《Distilling and Scaling Hierarchical Vision Transformer to 30B Parameters》,把规模上限从 2B 直接推到了 30B。

怎么做到的?答案是对模型结构和训练策略都进行重新设计,两者缺一不可。
结构上的核心设计是 Efficient Hierarchical ViT 架构。它在保证多尺度特征提取能力的同时,兼顾了计算效率。
基于这一架构,团队训练了从 200M 到5B参数的稠密模型,并引入稀疏专家混合(SMoE)变体,将总参数量推到了30B——这是目前层次化ViT领域已公开的最大参数规模。
训练上,团队设计了一套两阶段流程:
第一阶段,在ImageNet-21K上做MAE自监督预训练,让模型学会视觉表征的基本规律;
第二阶段,在2700万图像数据集上,从多个最先进的通用基础模型中蒸馏知识,实现能力跃迁。
实验结果给出了最有力的证明。在ImageNet-1K线性评测中,总参数30B的MoE模型(EHV-5B-MoE)推理时仅激活67亿参数,就以89.0%的准确率,超越了普通ViT路线下、总参数更大的模型EVA-CLIP-18B。
更重要的是,它的性能提升不局限于图像分类——视频分析和密集预测任务上同样表现优异。这说明EHV学到的不只是分类特征,而是真正高质量、可泛化的视觉表征。
华为团队用这项工作,证明了层次化ViT不仅能做大,而且在推理侧,能用更少的激活参数,达到更高的准确性。
架构设计决定了模型的能力上限,而训练策略则决定了这一上限能在多大程度上被释放。

02
输入前置筛选:
可学习帧选择器的范式革新
模型底座的天花板抬高了,但算力的消耗不仅仅在模型本身,喂给模型的数据,同样在大量吞噬计算资源。
视频-大语言模型(Video-LLMs)处理视频时,计算成本主要消耗在帧编码上。为了控制成本,现有模型几乎都采用均匀采样——等间隔抽帧。
然而,视频里的关键事件从来不会均匀分布。一个重要的动作可能只持续一两秒,如果恰好落在两个采样点之间,就被彻底漏掉了。相反,那些冗长的静态画面却被反复编码,浪费了宝贵的计算资源。
另一种思路是查询驱动的方法——根据具体问题去检索相关的帧。这在视频问答场景下确实有效,但详细视频描述是一个“无查询”任务,这种方法在这里派不上用场。
均匀采样太粗糙,查询驱动的方法又用不了。怎么破?
华为 AI 数据团队提出的可学习的帧选择器 LFS(Learnable Frame Selector),试图来解决这个问题。

论文地址:https://arxiv.org/pdf/2601.14594v1
他们的核心想法很直接:与其靠人工规则选帧,不如让模型自己学会“该看什么” 。

这是一种“以终为始”的训练范式,LFS 不再学“选哪些帧在某个中间得分上更高”,它学的是“选哪些帧能让大模型写出更好的描述”。
具体怎么做的?三个关键设计:
第一,训练一个评分网络,给每一帧打一个“事件重要性”分数。

第二,分段选帧而非全局排序。选帧时不用简单的“得分最高的前K个”,而是把整个视频切成多个时间段,在每个时间段里分别挑最重要的帧。这样既抓住了关键事件,又保证了帧在时间轴上分布均匀。
第三,也是最关键的一步——训练方式。LFS选好帧之后,把它们喂给冻结的Video-LLM生成描述,拿生成的描述和人工标注的标准描述做对比,算出损失,再反向传播去更新帧选择器的参数。整个过程中大语言模型本身一动没动,LFS就像一个即插即用的外挂模块。
此外,研究团队还发现了一个问题:现有的详细视频描述基准和人类真正的认知之间有挺大的差距。因此他们自建了一个新基准ICH-CC,视频全部来源于中国非遗烹饪的真实商业场景(如餐厅后厨、烹饪教学等),所有描述和问答均由人工精心撰写,更贴近真实应用场景。

实验结果怎么样?

LFS在不同模型和不同基准上都带来了普遍且稳定的提升。所有模型的 LFS增强版,在所有测试基准上都高于基线模型,这说明LFS 不仅能在单一基准上取得好成绩,具备一定的通用性。
这也回应了论文的核心命题:与其让模型在均匀采样的帧上“硬算”,不如在输入端做一次智能筛选——选对了帧,下游任务的表现也随之有所提升。


03
任务适配:
表征模块化干预取代全模型微调
大语言模型的跨任务泛化能力,一直是个“说起来重要、做起来难”的问题。
现有主流方案是per-token动态路由——每个token在处理时,都要在多个LoRA适配器之间做选择,决定走哪条路。这套机制确实有效,但代价也不小:计算量和显存占用都居高不下,模型跑起来又慢又吃显存。
另一种思路——表征微调(ReFT),则不再动模型参数,而是只编辑前缀和后缀token的表征来实现单任务适配,效率比LoRA高不少。
但它有两个短板:一是token本身的语义就有歧义,只改首尾不够精准;二是缺少一种“自引导”机制,模型面对没见过的新任务时,不知道该改哪一层、改哪个表征。
华为云团队与多所高校合作,提出了表征感知的模块化 RaMod(Representation-Aware Modularity) 框架,把 ReFT 的思路成功扩展到了跨任务泛化场景。

核心做法可以拆成两部分来看:
第一部分是双模块表征与参数微调。ReFT只能动首尾,RaMod 精细得多——从中间层的隐藏表征里挑出一个策略筛选过的子集,来做模块化干预。改哪里、怎么改,都是有选择、有策略的。这样能更精准地引导模型去解决没见过的任务。
第二部分是异步调度器。跨任务泛化最怕显存不够,RaMod设计了一套主动调度机制:需要哪些干预就分配显存,用完了就主动释放。这样一来,存储开销被压到了最低。
效果立竿见影。实验表明,RaMod不仅跨任务泛化效果更好,成本也大幅下降:相较于原始 LLMs,该方法额外预填时间减少了83%,生成延迟降低 100%,显存占用少了79%。
换句话说,RaMod把任务适配从"改模型"变成了"调表征"——不动模型主体,只在关键层的隐藏状态上做定点编辑。
这种思路如果成立,大模型部署的经济学可能会被改写:一个底座模型配上若干轻量级干预模块,就能低成本地服务于截然不同的任务场景,而不必为每个场景单独训练或加载完整副本。
不过在“改写”之前,这种表征微调的方法,仍有一些关键问题需要回答,比如在复杂推理等高难度场景中,是否依然能在大幅节省算力成本的同时守住准确性。

04
数据破局:语言专家各司其职,
渐进训练步步为营
前三篇论文都在解决"怎么更高效地用模型"。但很多任务还有一个更根本的现实挑战:如果连训练数据都不够呢?
语码转换(Code-Switching,CS)语音翻译任务,需要将夹杂多种语言的语音翻译成目标语言。这种任务不仅语义建模复杂,CS 数据的稀缺性,更是一个大问题。
以前的研究主要靠两条路走:要么让模型自己去"悟"语义表征,效果不可控;要么花大价钱做人工标注,成本太高,规模也做不大。
华为翻译服务中心团队,与厦门大学、澳门大学合作的这篇论文,提出了一个新思路:与其让模型自己摸索不同语言的语义表征,不如主动把它们对齐好——为每种语言单独建一个"专家团队",让各团队分别负责各自语言的语义建模,最后再统一对齐。

论文地址:https://arxiv.org/pdf/2511.10670
具体实现方式有两个关键设计:
第一个是MoE(混合专家)语音投影器。传统投影器对所有语言一视同仁,效果自然不理想。MoE版本的做法是给每种语言分配一组专门的"专家",每个专家组只负责一种语言的细粒度语音特征建模。路由机制会自动把语音特征送到对应语言的专家组手里。

为了保证路由不跑偏,论文还引入了两个辅助损失:语言特定损失确保每个专家真正学会对应语言的特征,组内负载均衡损失防止所有token都挤到同一个专家。
第二个是多阶段训练范式。数据不够,就用策略来凑。整个训练分四步走:先用自动语音识别(ASR)数据分别预训练每种语言的投影器,打好语音-文本对齐的基础;然后把各语言的投影器组装成MoE结构,用语言特定损失和负载均衡损失联合优化;接着从ASR 数据逐步过渡到单语语音翻译(ST)数据,用过渡损失平滑迁移;最后从 ST 数据适配到CS语音翻译数据。
这套渐进式设计的精妙之处在于——不是让模型直接硬啃稀缺的 CS 数据,而是先用充足的 ASR 和 ST 数据把基础能力打牢,再一步步转向目标任务。

实验对比了Whisper、SeamlessM4T、LLaST等多个强基线模型。在Fisher和NTUML2021的四个测试集上,该方法均超越了其他模型中表现最突出的 SeamlessM4T,BLEU最高达到39.52,COMET最高达到81.33。
这项工作传递的信号很明确:在数据稀缺的跨语言场景下,精细化的架构设计和渐进式的训练策略,也许比单纯堆数据更管用。
需要注意的是,这项工作在语言数量有限、数据质量可控的场景下,是有效的“尖刀方案”,但在需要覆盖数十种语言的通用多语种翻译系统中,是否具备可扩展性,还需要进一步论证。

05
结束语:
以设计密度,换算力成本
30B层次化ViT重构了模型骨架,让67亿激活参数在ImageNet上超越了180亿的对手;
LFS在输入端做了一道减法,把大量无意义的帧编码开销挡在计算之前;
RaMod把全量微调压缩成表征层的定点编辑,跨任务适配的显存和延迟一起降了下来;
语码转换语音翻译则用MoE分工和渐进式训练,在数据最匮乏的赛道上证明了一个道理:架构的智慧,有时候能够弥补数据的贫瘠。
四篇论文,四个方向,都在指向同一个内核:华为正在用“设计密度”取代“规模密度”。四篇论文分别来自基础研究、AI数据、云服务和翻译服务中心,说明效率优先已不仅仅是某个团队的偏好,这个逻辑被写进了各个环节的技术选择里。
如果把过去两年的AI竞赛比作“拼矿”,那2026年正显露出一个拐点:拼“冶炼技术”的时代已经开始了。稀疏激活、智能筛选、模块化适配、渐进式训练——这些路径不依赖更多的芯片和算力,而依赖对问题本身更深刻的理解。
无论大厂还是创业公司,早已走过了参数军备赛,AI 的下半场,对现实落地问题的理解,以及系统化解决这些问题的工程能力,才是真正的决胜点。雷峰网(公众号:雷峰网)雷峰网雷峰网
IJCAI 2026 要来了,你还在单打独斗?
为了方便大家抱团交流、互通会议消息,我们专门建了 IJCAI 2026 参会群!进群你会解锁这些「福利」?
会议情报站:投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。
同行茶话会:天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。
前沿补给站:最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。
现场后援团:(会议期间专属开启):到了会场也不用慌——
路线导航:场馆分布、报告厅怎么走,群里随时问;
议题共读:热门 session、Keynote 现场探讨,错过也能追;
Poster 汇编:现场海报精华整理,一键收藏不遗漏;
约局广场:约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。
? 进群传送门: 扫码进群或添加微信Qvv0909777,备注:IJCAI + 单位/学校+姓名+方向。

搞科研/搞技术,信息差很重要。
来,一起快人一步!


上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲PPT
大会报告全文
热门论文解读
学术新星访谈

扫描上方二维码
或点击「阅读原文」关注专区。
雷峰网原创文章,未经授权禁止转载。详情见转载须知。
— Originally published at leiphone.com
Want this in your inbox every morning?
Daily brief at your local 8am — bilingual EN/中文, free.
More from 雷峰网 AI 学术
See more →
AMI Labs 冯雁:AI 迈向现实世界,世界模型不可或缺 | ICML 2026
Pascale Fung at ICML 2026 emphasized the necessity of world models for AI in real-world applications, highlighting JEPA's advantages over generative models like Cosmos. JEPA's smaller parameters and faster inference lead to superior performance in tasks like robotic motion planning, outperforming in physical reasoning benchmarks.

