首页 / 资讯详情
WRC 2026|生数科技发布最新研究成果,提出通用世界模型五级发展路线
摘要
8 月 19 日下午,世界机器人大会分论坛“具身智能大模型的进化之路:从技术分级到产业落地”在北人亦创国际会展中心举行。生数科技创始人兼首席科学家、ACM/IEEE/AAAI Fellow 朱军发表主旨演讲,发布团队最新研究成果,并系统阐述通用世界模型的五级发展路线。朱军表示:“从大模型发展的视角来看,我们希望构建的,不只是服务于某个任务或场景的专用模型,而是一个能够理解世界、预测未来并采取行动的通用基座模型。”从第一性原理出发,定义通用世界模型世界模型已经延伸到视频生成、环境模拟、机器人决策和动作控制等方向,但行业对“什么样的世界模型才称得上通用”仍缺少共识。人在学习骑自行车或开车时,会从最初的不协调逐渐变得稳定、准确。其重要原因,是大脑在与外部世界持续互动的过程中,形成了一个关于世界如何运行的“内部模型”。通用世界模型同样需要三项彼此关联的能力:“通用世界模型不是单一的生成器、模拟器、机器人动作模型或策略模型,也不是这些能力的割裂片段或简单线性串联,而是三种能力耦合在一起的闭环反馈系统。”朱军强调,行动不仅是模型的输出,还会改变环境、产生新信息,并进入下一轮理解、预测和决策。 数据、架构与算力:构建通用世界模型的三大要素要想构建通用世界模型,仍然离不开大模型的三个基本要素:数据、架构与算力。在数据方面,通用世界模型需要一个由观察逐步走向行动的多层数据金字塔:从海量网络视频开始,逐步扩展到特定领域视频、第一视角人类视频、带动作记录的人类示范,以及真实机器人交互数据。越靠近底层,数据规模越大、覆盖面越广;越靠近顶层,数据虽然更稀缺、成本更高,却能更直接地建立任务、动作与物理结果之间的联系。合成数据可以贯穿金字塔的每一层。同时,“不完美数据”同样具有重要价值:失败尝试、纠正动作和恢复过程都包含有效的学习信号,能够帮助机器人学习如何从失败中恢复。在架构层面,通用世界模型需要统一处理图像、视频、语言和机器人动作等不同模态信息。MoT(Mixture-of-Transformers)通过为不同模态配置专属参数,并以共享注意力实现跨模态信息交互,使环境理解、世界状态预测与动作生成能够在同一模型中协同完成。生数科技的世界动作模型 Motubrain 正是基于这一架构,将理解、预测与行动统一建模,打破传统分模块方案的能力割裂,同时提升异构数据的利用效率和跨任务迁移能力。算力则同时影响大规模预训练和实时部署。离线视频生成可以容忍一定等待时间,但实时交互和机器人控制必须在环境发生变化之前完成预测和决策。因此,训练基础设施、推理加速、模型蒸馏和高效注意力机制,都是通用世界模型走向实际应用的重要支撑。通用世界模型如何进化?五级路线图明确进阶方向从通用基座模型的目标出发,通用世界模型可以划分为五个逐级演进的层级。它们并不是彼此割裂的产品方向,而是随着对世界的理解不断加深、与世界的交互不断增强,模型自主性持续提升的过程。过去几年,生数科技的研发与落地实践已经覆盖其中前三个层级。 L1:世界生成(World Generation)第一步,是让模型学会生成连贯的世界演化过程。视频正是这一阶段最典型的载体,它帮助模型学习对象、运动、空间关系和时序变化,为进一步理解和预测世界奠定基础。2024 年,生数科技推出视频生成大模型 Vidu,通过持续提升视频质量、时序一致性和世界动态建模能力,完成了 L1 阶段的初步实践。L2:与世界交互(Interactive World)在生成能力之上,模型开始接收实时输入,并根据语言、语音或控制信号持续改变后续内容,从“一次生成”走向“持续互动”