首页 / 资讯详情
WRC 2026|原生全模态世界模型:从模拟世界到交互世界
摘要
8月19日,世界机器人大会(WRC 2026)期间,由跨维智能主办、《财经》杂志协办的“物理AI引领者论坛暨2026《财经》中国AI 100榜单启动仪式”在北京举行。论坛以“物理AI进行时”为主题,汇聚具身智能领域的顶尖学者、企业创始人和一线技术负责人,共同探讨通用物理智能的技术演进与产业路径。作为原生全模态世界模型代表企业,智象未来(HiDream.ai)创始人兼CEO梅涛发表了题为《原生全模态世界模型:从“模拟世界”到“交互世界”》的主旨演讲。他从AI大模型的技术演进趋势出发,系统阐述了大模型从多模态走向原生全模态、从模拟世界走向交互世界的核心逻辑,为Physical AI的底层能力建设提供了新的技术视角与路径思考。01 高IQ不等于全能:AI从“理解世界”到“改变世界”梅涛博士在演讲中指出,过去几年AI大模型的发展可谓一日千里。从大语言模型到多模态模型再到具身智能,三条曾经独立演进的技术路线正在加速走向融合,2026年被很多人称为“世界模型的元年”。他分享了一组数据:今年年初,顶级大模型的IQ水平约为130,相当于中科大少年班天才的水平;而到如今,最新大模型的IQ已经接近140。但梅涛特别强调了一个关键观点——“高IQ不代表全能”。就像孩子成绩好不代表综合能力强一样,一个在考试中表现优异的模型,不等于能在真实物理世界中长期、稳定、可靠地完成任务。这正是Physical AI之所以重要的根本原因。大语言模型强在对世界的理解、对知识的压缩和推理;多模态模型强在对世界的生成与预测;具身交互模型则强在与世界的交互。而真正的世界模型,需要同时具备对世界状态的完整表达、对物理规律和因果关系的推演,以及对世界的重构能力。从文本、多模态到具身,过去各自独立演进的三条路线,今天正在加速走向融合。 02.从DiT到UiT:原生全模态架构突破行业上限基于自研UiT(Unified Transformer)架构,智象未来近日正式发布了原生全模态交互式世界模型HiDream-O1-World。该模型首次参评即在权威榜单WBench中登顶Navi分榜榜首。HiDream-O1-World支持文本、图像及交互式操控等多模态输入,具备漫游、编辑、交互三项核心能力,同时支持多种主体与风格化场景构建,可高度还原真实空间,也可生成二次元卡通、3A游戏渲染等风格化世界。从技术底层来看,HiDream-O1-World的核心突破在于长时程的时空一致性与物理一致性,使模型在长时序交互中能够“记住”已探索的场景结构,在复杂交互中保持较高的物理合理性。HiDream-O1-World正在打开全新的产业应用空间:AI互动影游中,用户成为叙事的主动参与者;具身智能仿真中,模型可搭建高保真虚拟训练底座;3D场景生成中,创作者可高效生成结构完整的3D空间,大幅缩短创意到成品的迭代路径。以此为起点,智象未来正围绕世界模型的定义持续拓展边界,逐步完善覆盖图像模型、视频模型及交互式世界模型等方向的模型矩阵。03.数据·模型·智能体·具身:连接物理世界的闭环谈到具身智能的能力底座,梅涛博士将关键关系概括为:“世界模型和具身智能的发展,需要把数据、世界模型、智能体和具身本体连接起来。”其中,数据构建认知,世界模型负责理解世界状态、推演物理规律,智能体基于预测结果进行决策和规划,具身本体完成真实执行,而真实环境反馈又回流成为新的训练数据。由此形成“数据—认知—行动—反馈”的闭环飞轮。梅涛博士表示,世界模型正是这一飞轮中的认知中枢;没有高质量世界模型,仿真难以逼近真实物理,具身智能的数据飞轮也难以真正转动起来