首页 / 资讯详情
原生全模态路线进阶,智象未来发布交互式世界模型HiDream-O1-World
摘要
HiDream-O1-World,一款原生全模态交互式世界模型。HiDream-O1-World 具备漫游、编辑、交互三大功能,支持文本、图像、交互等多模态方式输入。用户可一键生成时空一致、符合物理规律、可长时推演的完整世界。HiDream-O1-World 搭载的是智象自研的原生全模态(UiT)架构。作为核心基座,UiT此次迎来升级,在交互式世界模型领域公认的核心技术挑战——时空一致性与物理一致性上,取得了关键性突破。在新发布的世界模型中,这种突破表现为:当镜头推拉摇移时,场景空间的几何结构保持高度稳定,物体不会消失或变形;物体间的碰撞、遮挡、重力响应高度符合真实世界的因果逻辑,而非随机“猜”出来的画面拼接。智象未来CTO姚霆表示:“交互式世界模型的价值,不在于生成一个逼真的三维场景,而在于AI开始真正理解空间的深度、物体的质感、运动的惯性与光影的逻辑。这是对物理世界运行规律的系统性认知与重塑。HiDreamO1World,正是这场系统性重塑的第一道桥梁——让每一次交互,都通往一个从未抵达的世界。它的突破性效果,既坚定了我们推动原生全模态架构技术路线纵深发展的信心,也为智象持续构建世界模型的核心技术壁垒提供了关键支撑。”不久前,HiDream-O1-World 在第三方评测中交出了首份成绩单。由美团LongCat团队与复旦大学联合推出的交互式视频世界模型评测基准WBench公布了最新榜单。智象HiDream-O1-World在核心的Navi分榜中,以平均分80.9的成绩登顶榜首,其中在物理(Physical)维度以73.3分位列第一,Consistency(一致性)维度达88.0分。两项关键指标均位居前列,成为该榜单中综合表现排名第一的模型。 WBench是业内首个面向交互式世界模型的系统性评测基准,涵盖289个多轮交互案例、共计1058个交互轮次,并基于五大维度、22项指标构建起一套严谨的量化评测体系。评测分为Navi与Full两个榜单,其中Navi分榜聚焦空间导航与视角控制,被业内视为衡量世界模型空间理解能力的核心标尺。HiDream-O1-World首次参评即登顶Navi分榜,刷新交互式世界模型性能上限。这背后,是智象自研UiT架构在时空一致性与物理一致性上的关键突破,让“构建可信交互世界”有了坚实的技术支点。02. 一键生成世界,开启沉浸式交互体验模型支持文本、图像、交互式操控等多模态输入方式,用户只需一段文字描述、一张图片或简单交互,即可一键生成结构完整、质感细腻、风格多元的交互世界。对用户而言,这不只是“进入”一个世界,而是亲手“创造”一个世界。比如,上传一张室内照片,模型便能快速构建出高精度的数字孪生空间,自动补全整间卧室的全景图——空间比例精准协调,画面细节精准且质感十足,令人仿佛置身其中。 在功能上,模型提供了第一人称和第三人称两种视角的漫游体验。用户可自由驱动角色行走并任意调整视角方向。以潜水场景为例,视角移动时,水面光影与海底碎光同步变幻,珊瑚礁色彩分明、鱼群游弋自如。镜头拉近后珊瑚的纹理细节清晰可见,画面全程稳定无漂移。不止于漫游,HiDream-O1-World 赋予用户实时编辑能力。用户可对画面进行实时编辑:驱动角色完成抓取、奔跑、下蹲、跳跃等动作,或调度环境变化,如触发降雨、物体坠落等动态事件。这并非简单的局部微调,而是基于几何、光照、材质到物理逻辑的全局统一,确保每一次交互都真实自洽。强大的泛化能力,是HiDream-O1-World构建多元交互世界的基础。模型支持人类、动物、虚构角色等多种角色的构建。无论是