
考拉悠然无界再登WorldArena 2.0全球前列,两项核心指标全球第一
Quick Answer
Koala Yuyuan's 'Yuyuan Wujie' model ranked second globally in the WorldArena 2.0 video quality track, achieving first place in Background Consistency and JEPA Similarity metrics, showcasing its advanced capabilities in long-term scene consistency and physical modeling.
Quick Take
This model is now being integrated into industrial inspection solutions, enhancing embodied intelligence applications.
Key Points
- Yuyuan Wujie achieved global second place in WorldArena 2.0's video quality track.
- Ranked first in Background Consistency and JEPA Similarity metrics.
- Demonstrates advanced long-term scene consistency and physical modeling capabilities.
- Integrated into industrial inspection solutions for enhanced embodied intelligence.
- Targets challenges in long-duration operations and unseen environments.
📖 Reader Mode
~2 min read9月16日,WorldArena 2.0全球终榜揭晓,考拉悠然旗下悠然无界世界模型在Track 1视频质量赛道获得全球第二,并在Background Consistency与JEPA Similarity两项核心指标中位列第一。
在雷峰网(公众号:雷峰网)看来,这进一步验证了其在长时场景一致性、状态演化与物理规律建模方面的能力。基于结构化4D世界建模、动态场景记忆等技术,悠然无界正进一步与Geek Mind具身大脑结合,将世界模型能力从榜单评测延伸至工业巡检等真实场景,推动具身智能从“能推演”走向“能执行、能复制”。
9月16日,WorldArena 2.0全球终榜正式揭晓。考拉悠然旗下悠然无界世界模型在Track 1(视频质量赛道)中综合得分位列全球第二。本次评测汇集了来自阿里巴巴、中国科学院等顶尖科技企业、科研机构及具身智能独角兽公司的80个模型,围绕世界模型的视频生成质量、时序一致性与物理演化能力展开统一评估。

在多项核心指标上,悠然无界世界模型同样展现出领先性能。其中,Background Consistency(背景一致性)位列第一。长视频生成最常见的失效是场景漂移——推演到几十帧后,背景的纹理、光照或物体摆放在无声中发生改变;这一指标居首,意味着模型能在整段生成过程中稳定维持全局环境与场景布置。更具含金量的是 JEPA Similarity 位列第一:该指标不比对像素,而是在高层表征空间中度量生成结果与真实世界演化过程的距离,考察场景语义、物体状态与动作变化是否被正确保留。两项第一叠加指向同一个结论——模型不只是画得像,而是学到了物理世界随时间演化的规律。

视频质量赛道比的不是"生成的画面像不像",而是模型在长时推演中能否保持场景几何、纹理外观、物体与交互状态的物理一致性——也就是世界模型最核心的能力:理解物理世界如何随时间演化。考拉悠然的技术路线,是以"世界模型+智能体+场景复制"回应这一转折:底层是悠然无界世界模型,上层是Geek Mind极客心智具身大脑,中间由跨空间、跨任务、跨本体的"三跨"能力打通。
世界模型的胜负手是架构,不是算力
语言模型像"读过万卷书"的学者,靠统计规律预测下一个词;世界模型要做的,是在脑子里先"预演一遍"——给定当前场景与一个动作序列,推演出接下来会发生什么。前者比拼语料与算力规模,后者比拼对物理约束的建模能力。
考拉悠然团队把问题拆成两个具体挑战:长时推演中的误差累积,以及面对未见环境时的分布漂移,并做了两层针对性的架构设计。不仅看生成画面的清晰度,同时从视觉质量、运动质量、内容一致性、物理遵循性、3D空间准确性、可控性等6大维度、15项指标进行综合评估。
一是结构化4D世界建模:协同建模首帧3D场景几何与运动轨迹,把静态空间结构与动态动作过程建立关联,为后续每一帧生成提供持续的几何与运动约束。通俗讲,就是给生成过程装上"定位与惯性导航",抑制物体位置漂移、轨迹发散与误差随时间累积。
二是动态场景记忆:持续保持并更新场景的纹理、外观、布局等关键环境特征。长时生成中,模型容易逐渐"忘记"场景自身的样子,向训练分布回缩;动态记忆相当于不断刷新对当前环境的认知,从而提升长程一致性与域外泛化能力。
训练策略上采用由粗到精两阶段:第一阶段用大规模、多样化数据学习通用场景表征与运动规律,建立基础生成与泛化能力;第二阶段筛选高质量数据精细化微调,强化几何一致性、时序连贯性与运动准确性,完成从广泛学习到精确推演的跃迁。
在Track-1(视频质量赛道)上,悠然无界世界模型在场景、运动与交互层面展现出高度一致的未来推演能力,有效缓解了复杂长程生成中的状态漂移、误差累积与物理失真。具体来看,它能够应对多类高难度具身任务:
分布外泛化任务:面向未见过的场景,模型能够基于初始场景状态与给定动作序列进行未来推演,在长时生成过程中保持场景几何结构、纹理外观及机器人与物体交互的物理一致性。
长程任务:面向长时间、多阶段的连续操作,沿给定动作序列持续推演未来状态,抑制误差累积与状态漂移,保持场景、物体及交互状态的长期一致性。
复杂综合任务:在分布外场景、双臂协同与长程操作的综合挑战下,实现稳定、连续且物理一致的未来推演。
基于悠然无界世界模型构建的GeekMind,已率先实现行业落地
WorldArena回答的是“模型能力能不能被统一验证”,真实场景进一步回答的是“这些能力能不能真正用起来”。在工业巡检中,长期面临人力成本高、危险区域作业受限、人工记录难以标准化等问题。制造企业需要的不是单点检测工具,而是具备自主感知与决策能力的巡检体系。考拉悠然将悠然无界世界模型构建的通用具身智能体 Geek Mind 集成于四足机器人平台,面向大型央企制造车间提供巡检解决方案,核心能力体现为三个层面:
快速部署:方案不依赖产线改造,通过预训练模型与场景自适应机制,实现巡检路线的快速配置与任务切换,缩短从进场到运行的实施周期。
深度推理:基于世界模型驱动的感知—推理闭环,系统不仅采集温度、振动、仪表等状态数据,还能对异常现象进行因果分析,输出可追溯的判定依据,降低误报与漏报。
空间无界:四足平台具备跨楼层、跨地形机动能力,覆盖人工难以抵达的高空、狭小与危险区域,扩展巡检的空间边界。具身智能在工业场景的价值,不在于替代某一岗位,而在于构建一套可复制、可规模化的无人巡检范式。央企制造车间,正在成为这一范式最早验证的场域。

空间智能技术的竞赛才刚开始
空间智能领域三个条件正在同一时间窗口成熟:算力成本下行让边端部署具备可行性,具身硬件供给趋于充足,行业客户从看演示转向算产出。考拉悠然目前握在手里的,是一个架构原创、经国际榜单验证的世界模型底座,一套把技术复用到多本体的"三跨"机制,以及一个把技术变成低门槛产品的平台。真正的考验在于,跨本体泛化的上限能否在更多极端场景中保持稳定——这将决定世界模型从"能推演"走向"能干活、能复制"的速度。
— Originally published at leiphone.com
Want this in your inbox every morning?
Daily brief at your local 8am — bilingual EN/中文, free.
More from 雷峰网机器人
See more →
WAIC深度观察:具身数据,进入「开箱即用」时代
The WAIC forum highlights the urgent need for 'Model-Ready Data' in embodied intelligence, emphasizing high precision, multi-modality, and diversity as essential for effective physical interaction. Companies like JianZhi Robotics are pioneering solutions to bridge existing data gaps, ensuring that data is directly usable without further processing.

