WAIC 观察:通用具身智能要在有生之年实现,急需「物理 AI 基建狂魔」
Quick Answer
Kuawei Intelligence aims to revolutionize physical AI with its DexVerse simulation engine, enabling the production of high-quality, aligned data for embodied intelligence.
Quick Take
Their Aligned DexWorld dataset features over 2 million samples, addressing the industry's data scarcity and alignment challenges, crucial for achieving general embodied intelligence.
Key Points
- DexVerse is the only simulation engine supporting multi-physical field coupling in .
- Aligned DexWorld dataset includes over 2 million high-quality heterogeneous data samples.
- Cross-dimensional alignment is crucial to avoid negative transfer in robot training.
- Kuawei's technology has been deployed in over 50 real-world scenarios, enhancing commercial viability.
- The focus is on building a comprehensive infrastructure for scalable embodied intelligence.
📖 Reader Mode
~3 min read
编辑丨马晓宁
WAIC 2026 到了最后一天,逛了无数个具身展台,心里不禁有了不少感慨。
柔性抓取可以抓异形物体了,长程任务也更复杂了——技术飞快进步,好像通用具身离我们已经不远。但 Demo 越炫,人气越足,作为一个参加过 n 次的 WAIC“老人”,就越觉得这届 WAIC 似乎少了些什么——模型吹得天花乱坠,底层的数据基建却鲜少有人谈及。
数据,无疑是具身智能行业中“房间里的大象”——在 WAIC 上随便和一位从业者深谈两句,大家都会不约而同地陷入同一种焦虑:实在太缺数据了。
在AI科技评论看来,要构建具身智能的数据基础设施,必须同时回答两个极其硬核的问题:
第一,你能搞到多少数据?
第二,这些异构的、非结构化的数据,能不能被有效地共同学习?
带着这两个问题,在今年的 WAIC 现场,有一家公司展台吸引了 AI 科技评论的关注:跨维智能(以下简称“跨维”)。
用一句话来说:要实现通用的具身智能,跨维想做的,是“物理 AI 基建狂魔”。
要让具身智能通用泛化,首先要做到智能的涌现,去理解复杂多变的真实世界,和人类一样有一种“物理直觉”;其次要能够随机发挥,在不确定的环境中因地制宜、举一反三;最后更要可以自主纠错,减少人工介入,提升容错韧性。
而要达成这个目标,海量的、可对齐的数据,则成了物理 AI 基建中一块必不可少的拼图。

01
批量生产海量数据,
仿真才是超级大杀器
都知道数据量重要,但想要把数据量“堆”出来,却不是一件易事。
靠真实环境里一台台机器人去“死磕”采集,不仅成本高得令人绝望,且要覆盖全部长尾场景,又要耗费无数的时间。
真实世界太有限?机器人在虚拟世界的仿真系统里,一样能采到好用的数据。
在 WAIC 2026 上,跨维的自研仿真引擎 DexVerse,就是为了这个目标闪亮登场。
DexVerse 牛在哪里?剧透一下:它是当前全球唯一一款,支持同场景下多物理场耦合的具身智能仿真引擎。
在 DexVerse 里,刚体、柔体、布料、流体甚至切割动作可以同时发生、相互影响。比如机器人切面包,系统能实时计算出物体拓扑结构的改变与全新的切面;机器人叠衣服,引擎能精确模拟手、衣物和桌面之间持续的接触与形变,而不是粗暴的“视觉穿模”。
很多人知道,做仿真的头部大厂英伟达 NVIDIA 推出的 Isaac Sim 平台很强,但 DexVerse 也有与之一战的实力。Isaac Sim 平台只能同时耦合 2 种材质,DexVerse 则可以同时耦合刚体、软体、布料、流体 4 种材质,能力范围更广。
并且,DexVerse 不仅能实现 Isaac Sim 目前做不到的高保真软体动态切割,彻底告别死板的预设轨迹。在处理复杂的刚体与布料耦合时,更是做到了真正的物理级无穿透,自然堆叠与受力形变的精准度显著领先于英伟达。
Isaac Sim 能力的确不弱,而今天的 DexVerse,或许有能力成为前者在仿真领域一个势均力敌的对手——或者一个好用的国产替代。
有了能把复杂物理世界实时“算”出来的 DexVerse,跨维的下一步,就是批量化地生产具身可用的高质量数据,把机器人的训练,从手工作坊变成数据的“生产线”——这正是“基建狂魔”打下的第一根地桩。
不像物理世界,虚拟世界里,无数的训练可以同时发生,并且迭代更快,成本更低。使用 DexVerse 的生成式仿真,不仅让真机数据采集的消耗大幅降低,更给了客户快速定义新任务、新物体、新场景的权力,并能即时在仿真系统中进行验证。
如果能直接支持机器人训练的数据,能够像图片和视频一样能够被自动化地批量生成,那么具身智能距离通用就又进了一大步。

02
“数据对齐”,
才是内行人真正关注的细节
有了海量数据,就能直接喂给大模型吗?
近期行业内的一系列研究(如阿里的 Qwen-RobotManip 新工作等)不约而同地指向一个残酷的事实:将异构的机器人数据简单混合,往往会引发负迁移——也就是“帮倒忙”。
不同机器人、不同相机视角、不同坐标系的数据,在模型眼里完全是鸡同鸭讲。因此,行业正在形成一个新共识:“Alignment before scale”(对齐是规模化的前提)。
今年六月,跨维智能率先提出 Dexterity-BEV 统一表征技术,系统性地将 BEV 方法论推进到具身智能数据基建层;同月,又拿下 WorldArena 世界模型榜单 Track 2 赛道全球第一。
同月前后,国内外顶尖团队也陆续发布了类似工作,如阿里Qwen-RobotManip、佐治亚理工的 Danfei Xu 老师的 EgoWAM、Rethinking VLA Scaling等。
而到了今年的 WAIC 上,跨维则更进一步,直接端出了百万级时空动作对齐数据集 Aligned DexWorld。
基于Dexterity-BEV的积淀,Aligned DexWorld 让全行业真正拥有了“开箱即用”、能够被有效共同学习的海量物理数据。数据集网站如下:https://dexforce.com/aligned-DexWorld/。
Aligned DexWorld 包含了超 200 万条高质量异构数据样本。这里面非常“五花八门”:有来自不同本体的真机数据(人形机器人与机械臂)、有仿真数据,还有第一人称的人手演示数据。区别于传统仅仅做“格式规整”的数据集,Aligned DexWorld 的核心价值在于“深度物理级对齐”,它让人类数据与机器人数据,真正“说上了同一种物理语言”。
具体来说,跨维对数据进行了三个对齐:

空间对齐: 统一多相机、多设备的三维坐标系,消除观测偏差,让模型专心学习真实场景的物理特征。
动作对齐: 摒弃绑定特定硬件的表征方式,转化为通用物理表征,实现跨机器人、跨设备的数据可迁移与联合训练。
时间对齐: 规整硬件频率、人工操作带来的时序差异。
面对这 200 万条庞大的异构数据,如果全靠人工死磕,成本无疑是天价。跨维展现出了作为“基建狂魔”的工程智慧:
在处理精度上,他们搭建了“人工校准+几何求解+模型辅助+人工核验”的标准化闭环。让每一条数据的对齐逻辑均可追溯、可复现,咬住大规模数据的整体稳定性。
在数据标注上,跑通了全自动标注流程。这套打法不仅大幅削减了人力成本,更高效地产出了标准化的高质量子任务数据,能够显著提升具身模型的泛化能力。
可以说,Aligned DexWorld 为整个机器人行业,实打实地搭建起了一个低成本、可复用的数据生产底座。

03
具身先有底层基建,才有物理直觉
有了强大的数据生产和对齐能力,跨维还需要实际地把数据和训练基础设施用起来,并且验证这一套体系的有效性——除了可以独立服务其他不同机器人企业、研究i机构和模型开发者,跨维智能的旗舰世界模型 DexWorldModel,就成了“数据生产-模型训练-真实场景落地”闭环的最后一块拼图。
人类能够和物理世界交互,需要的是一种“物理直觉”,能够做到长程地、抗干扰地、精确地操作——机器人要越来越接近人类,也必须具备这种“直觉”。
在 WAIC 现场,跨维展台被围得水泄不通的,是一个“机器人商超扫码分拣” Demo。作为展厅里唯一一个还原零售扫码场景的展台,机器人体现出的能力相当全面:不仅要从一筐随机堆放的商品中抓起硬度、外形不一的瓶子,更要扫到瓶身上的条形码,再把瓶子放到指定的位置。
面对非标的、甚至训练集里从未见过的饮料瓶,机器人展现出了极其类人的适应力:它自主涌现出了侧向掏取、扶正后抓取等策略;当抓取滑脱或扫码失败时,它无需人工复位,能够实时感知错误并自主调整策略重新执行。
而在扫码的场景,真正的挑战,甚至不在于 Pick & Place,也不在于扫码,而是“找到条形码”。
找到条形码,是一个复合型的任务——在真实场景中,条形码在瓶身上的位置和朝向都不是标准化的,它可能背对相机、被手遮挡……要找到条形码,机器人必须学习人类的方式,一边调整抓握瓶身的姿态,一边重新规划动作,一边观察寻找条形码,而非机械地执行预设的轨迹。
这种“手、眼、脑”一体的能力,考验的不仅是具身大脑在面对非标问题时的操作、观察和决策能力,更有机器人在面对非标问题时,涌现式的自主“解题”能力。在 WAIC,跨维还展示了一个 Demo,模拟电子制造产线中的常见场景——手机装盒。面对这个需要精准识别、精密操作、抵抗环境干扰和操作失误的工作,不少厂商的 Demo 选择的是遥操的方案,但跨维的 Demo 则是通过世界模型 DexWorldModel 实现,可以直接异地部署。
通过仿真合成数据和真机数据结合训练,DexWorldModel 驱动的具身机器人,不仅能够实时自动识别物料的位置和姿态,还能自主识别漏抓、物料偏移等异常情况,不再只执行预设动作,可以重新规划路径,完成任务。
这种“智能涌现、随机发挥与错误恢复”的能力,正是跨维“基模预训练 + 场景 Finetuning + 世界模型”的实战检验。世界模型在其中扮演了关键角色:在动作发生前,它能在脑海中进行“物理预演”,评估抓取成功率;它能跨视角补全 3D 场景,预测下一个状态。
机器人不再是死记硬背坐标系,而是真正理解了“瓶子”这个物理概念,从而在充满混乱与不确定的真实世界中游刃有余。
同样的毫米级精密操作与抗干扰能力,也在跨维展示的“手机装盒产线 Demo”中得到了印证,充分展现了其面向复杂工业场景的柔性适应力。
这就是为什么要做底层基建的重要原因,当具身机器人拥有了物理直觉,它的上限会被无限提高。

04
结语:具身智能发展的第一性,
到底是什么?
逛完跨维的展台,AI 科技评论最大的感受是:跨维和跟现在的很多具身智能公司,玩的是两套逻辑。
不少公司要么赶着造机器人本体,要么卷大模型,或者拿一堆真机数据死磕某个单一场景的抓取——把一个垂直单点钻深钻透,是他们心中实现物理 AI 落地最直接的路径。
在一众竞逐者中,跨维却显得像个“异类”:他们想要的构建的,是一个体系,涵盖从物理引擎、生成式仿真、世界模型和工业部署的全流程板块,来寻找通往通用具身智能的可能。

让机器人能把一个动作、一个场景做到极致,当然有它的价值;但在跨维看来,第一性的问题,永远是用更低的成本,让机器人完成学习-试错-规模落地的闭环。
技术最终要回归商业本质。跨维同时也实实在在地把优秀的技术向产业输送。截至目前,跨维的技术已在智能制造、文旅服务等领域落地 50+ 真实场景,部署了超 1500+ 具身模型,并实现了非常可观的商业转化。
当其他人望着具身智能灿烂的星空,把头仰得高高的;跨维智能却在“基建狂魔”之路上走得越来越远,把手深深地埋进沃土——他们知道,只有地基足够牢靠,其上的高楼才能在有朝一日,让头顶明亮的星星触手可及。雷峰网(公众号:雷峰网)



— Originally published at m.leiphone.com
Want this in your inbox every morning?
Daily brief at your local 8am — bilingual EN/中文, free.
More from WebSearch (Tavily)
See more →全球AI芯片峰会,9月上海见!
The 2026 Global AI Chip Summit will take place in Shanghai on September 22-23, focusing on the evolving AI chip landscape, including the shift from training to inference, the rise of diverse chip technologies, and the restructuring of industry competition. Notable speakers include experts from leading universities and companies, discussing advancements in AI chip architecture and applications.