首页 / 资讯详情
大晓联合香港大学发布StreamPI,让 VLA 真正理解时间,迈向连续物理智能
摘要
当 VLA 模型理解语言、感知环境并直接生成机器人动作,一个更基础的问题开始浮现:机器人如何理解一个持续变化的物理世界?物体从哪里移动而来、杯子此前遮住了什么、机械臂正在接近还是远离目标——真正决定下一步动作的信息,往往不只存在于当前一帧,而存在于连续的时间之中。近日,大晓机器人联合香港大学发布全新的连续物理智能研究成果 StreamPI(Streaming Multimodal Temporal Modeling for Vision-Language-Action Models),直指 VLA 长期存在的“单帧智能”瓶颈,为其补上关键的“时间维度”。不同于传统 VLA 主要依据当前观测独立决策,StreamPI 为模型建立持续的多模态时序上下文,使机器人能够记住过去、理解状态变化、判断任务进程,并利用跨帧信息增强精细空间感知与动作决策。它推动 VLA 从“识别当前状态”,进一步走向“理解一个正在发生的物理过程”。更重要的是,StreamPI 并未依赖额外参数堆叠换取时序能力,而是基于现有 VLA 骨干,通过指令持续锚定、历史信息流式缓存与随机时间间隔训练,实现从单帧决策到连续时序建模的轻量化扩展。真实机器人以及 LIBERO、CALVIN 等实验均显示,StreamPI 在时序记忆、精细空间操作与长程连续任务中取得显著提升。StreamPI 所探索的不只是“让 VLA 多看几帧”,而是让机器人开始同时理解空间、时间与状态演化,为具身基础模型从面向单一时刻的瞬时动作智能迈向真正面向动态世界的连续物理智能提供新的技术路径。VLA 会“看”和“做”,但还需理解“发生了什么”以 π0、π0.5 为代表的新一代 VLA,正不断拓展机器人在开放环境中的泛化边界。π0.5 已能够在训练未见过的家庭环境中完成厨房、卧室清洁等 10-15 分钟的长程多阶段任务,机器人基础模型正在从单一技能执行走向更复杂的开放世界操作。基于 VLA 的机器人操作三种范式对比。 但 StreamPI 直指 VLA 更底层的能力缺口:当前大量模型仍依赖单帧决策,能够判断“眼前是什么”,却难以持续理解“此前发生了什么”。缺少历史上下文,不仅限制机器人的时序记忆,也使其难以利用运动视差、状态变化等跨帧线索形成更准确的三维空间判断。这也是当前流式感知与实时 VLA 研究持续关注的问题。一个最直观的例子是“猜杯子”:物体被藏入杯子并经过多次交换后,答案已不存在于最后一帧,而存在于整个变化过程;面对滚动物体,单帧只能判断“它在哪里”,连续观测才能理解“它正往哪里去”。当关键信息存在于时间之中,机器人需要的不只是看见当下,更要理解过程。不是简单“多看几帧”,而是从窗口式走向流式给 VLA 加入时间信息,最直接的方法是把过去多帧图像组成一个窗口,一次性交给模型。但历史越长,视觉信息越多,不仅需要反复计算已经处理过的画面,推理开销持续增加,任务指令也更容易被大量视觉信息稀释,导致机器人在长程执行中逐渐“忘记目标”。StreamPI 没有简单堆叠历史帧,而是将每个时刻组织为一个完整的“视觉观测 + 任务指令”时序单元。语言指令持续绑定每一次观测,成为贯穿任务始终的语义锚点,让机器人在不断接收新信息的同时,始终明确“正在做什么、目标是什么”。在每个时序单元内部,视觉与语言充分交互;不同时间单元之间,则按照时间顺序持续读取和聚合历史信息。由此,模型既能理解“这一刻看到了什么”,也能追溯“此前发生了什么”,将原本离散的单帧判断连接成连续的时序理解,实现帧内解决“这一刻看到了什么”,帧间解决“此前发生了什么