首页 / 资讯详情

考拉悠然无界再登WorldArena 2.0全球前列,两项核心指标全球第一

雷锋网 2026-09-20 03:05 中文

摘要

9月16日,WorldArena 2.0全球终榜揭晓,考拉悠然旗下悠然无界世界模型在Track 1视频质量赛道获得全球第二,并在Background Consistency与JEPA Similarity两项核心指标中位列第一。在雷峰网看来,这进一步验证了其在长时场景一致性、状态演化与物理规律建模方面的能力。基于结构化4D世界建模、动态场景记忆等技术,悠然无界正进一步与Geek Mind具身大脑结合,将世界模型能力从榜单评测延伸至工业巡检等真实场景,推动具身智能从“能推演”走向“能执行、能复制”。 9月16日,WorldArena 2.0全球终榜正式揭晓。考拉悠然旗下悠然无界世界模型在Track 1(视频质量赛道)中综合得分位列全球第二。本次评测汇集了来自阿里巴巴、中国科学院等顶尖科技企业、科研机构及具身智能独角兽公司的80个模型,围绕世界模型的视频生成质量、时序一致性与物理演化能力展开统一评估。 在多项核心指标上,悠然无界世界模型同样展现出领先性能。其中,Background Consistency(背景一致性)位列第一。长视频生成最常见的失效是场景漂移——推演到几十帧后,背景的纹理、光照或物体摆放在无声中发生改变;这一指标居首,意味着模型能在整段生成过程中稳定维持全局环境与场景布置。更具含金量的是 JEPA Similarity 位列第一:该指标不比对像素,而是在高层表征空间中度量生成结果与真实世界演化过程的距离,考察场景语义、物体状态与动作变化是否被正确保留。两项第一叠加指向同一个结论——模型不只是画得像,而是学到了物理世界随时间演化的规律。 视频质量赛道比的不是"生成的画面像不像",而是模型在长时推演中能否保持场景几何、纹理外观、物体与交互状态的物理一致性——也就是世界模型最核心的能力:理解物理世界如何随时间演化。考拉悠然的技术路线,是以"世界模型+智能体+场景复制"回应这一转折:底层是悠然无界世界模型,上层是Geek Mind极客心智具身大脑,中间由跨空间、跨任务、跨本体的"三跨"能力打通。 世界模型的胜负手是架构,不是算力语言模型像"读过万卷书"的学者,靠统计规律预测下一个词;世界模型要做的,是在脑子里先"预演一遍"——给定当前场景与一个动作序列,推演出接下来会发生什么。前者比拼语料与算力规模,后者比拼对物理约束的建模能力。考拉悠然团队把问题拆成两个具体挑战:长时推演中的误差累积,以及面对未见环境时的分布漂移,并做了两层针对性的架构设计。不仅看生成画面的清晰度,同时从视觉质量、运动质量、内容一致性、物理遵循性、3D空间准确性、可控性等6大维度、15项指标进行综合评估。一是结构化4D世界建模:协同建模首帧3D场景几何与运动轨迹,把静态空间结构与动态动作过程建立关联,为后续每一帧生成提供持续的几何与运动约束。通俗讲,就是给生成过程装上"定位与惯性导航",抑制物体位置漂移、轨迹发散与误差随时间累积。二是动态场景记忆:持续保持并更新场景的纹理、外观、布局等关键环境特征。长时生成中,模型容易逐渐"忘记"场景自身的样子,向训练分布回缩;动态记忆相当于不断刷新对当前环境的认知,从而提升长程一致性与域外泛化能力。训练策略上采用由粗到精两阶段:第一阶段用大规模、多样化数据学习通用场景表征与运动规律,建立基础生成与泛化能力;第二阶段筛选高质量数据精细化微调,强化几何一致性、时序连贯性与运动准确性,完成从广泛学习到

阅读原文(雷锋网)→

本站为资讯聚合平台,仅展示标题与摘要,原文版权归原发布方所有;如有侵权请联系我们删除。