首页 / 资讯详情

李飞飞押注的空间智能:生成的世界,如何「经得起折腾」?

雷锋网 2026-08-25 02:23 中文

摘要

AI 生成的大多数世界“中看不中用”,根本原因是 AI 少了一本“底账”:一份记住世界里有什么、每次行动改变了什么、并且能被检查和回滚的状态记录。 作者丨刘紫东 编辑丨幸丽娟 李飞飞押注的空间智能,被视为世界模型的主流路线之一。这条路线的基本构想是,让 AI 从识别二维画面,走向理解、推理和生成可进入、可操作、可持续编辑的三维世界。但真正的考验在于:一个“站得住”的世界,是怎样构建出来的?要回答这个问题,不妨先回到一个更基础的追问:当 AI 的交付形态从“画面”变成“三维世界”,互动方式从“观看”变成“进入和操作”,到底意味着什么?它意味着 AI 交付的内容开始拥有时间属性:对象需要在多轮操作中保持身份,规则要承受真实行动,局部修改也要与已经成立的关系相容;系统还得从每一次行动的后果中,修正自己对世界的理解。李飞飞将这组能力概括为 Renderer、Simulator 与 Planner——通俗地说,一个负责把世界“画出来”,一个负责记住“世界现在是什么样、行动之后会变成什么样”,一个负责决定“下一步做什么”;三者之间的连接,尤其是模拟与规划共享的状态层——也就是那本“底账”,直接决定了一个生成世界能否继续运行。然而,维持这一状态层持续运转并非易事。空间世界的开放性和交互组合的无限性,意味着任何预置规则都无法穷尽所有可能情形。系统必须在实际运行中不断遭遇未知、记录冲突并修正假设。说白了,就是让系统从每一次操作中自动学习。当这种“自我纠错”从零散的补丁升级为一整套固定流程时,行业称之为递归自我改进(Recursive Self-Improvement, RSI):系统将“状态—目标—行动—新状态—验证—反馈”保存为完整轨迹;在真实交互中识别能力缺口;自动生成新任务和困难样本;再经独立评测、版本门控与回滚,驱动下一轮迭代。反过来看,空间世界也恰好为这一闭环提供了理想的试验场。它有明确的对象、可执行的动作和可外部核验的结果,使“从可观看世界,到可计算状态,再到持续行动与学习的自主空间智能”不再停留于技术想象,而成为一条可逐步验证的工程路径。01生成式 AI 能造出怎样的世界?生成式 AI 的输出正在获得空间属性:人可以进入、操作,并在其中继续创作。三维世界把感知、推理、代码、物理和交互压进同一项任务,也因此成为前沿模型少见的综合试验场。▎一句话造出能跑、能玩的空间Kimi K3 的官方演示里,一段自然语言最终变成浏览器中的程序化开放世界:骑乘、森林、村庄、山地、水体和天气处于同一运行画面中。它展示了模型将三维推理、代码生成、工具调用和视觉反馈串成一条完整工作流的能力。GPT‑5.6 与 Codex 构建的 MiniTown 则更进一步。房屋和道路之外,分区、居民日程、车辆与昼夜循环也被组织在同一状态里。一幅城市画面由此获得了时间、规则和行为,背后则是资产组织、规则编写、引擎执行和反复检查。所谓“一句话生成”,实际压缩了一条很长的生产链:拆解意图、检索资产、求解空间关系、执行脚本、检查渲染结果,再修复空场景、穿模、对象缺失与状态丢失。时间轴把演示和系统区分开来——桌子移动后仍要保有身份,门的开合需要更新通行区域,局部换材质也应限定影响范围。世界开始接受行动,状态维护随即进入智能系统的核心。【MiniTown 官方画面;分区、道路、居民、车辆与

阅读原文(雷锋网)→

本站为资讯聚合平台,仅展示标题与摘要,原文版权归原发布方所有;如有侵权请联系我们删除。