首页 / 资讯详情

IJCAI 2026 专访:动作指挥计算,VLA 加速不降准 | GAIR Paper 125

雷锋网 2026-08-26 06:09 中文

摘要

将动作从输出端搬到调度端,推理速度提升1.79倍。 作者丨邓哲敏 编辑丨齐铖湧 机器人想要真正走进千行百业、千家万户,有一道绕不开的坎:它得足够快。不说快到能打羽毛球那,至少得快到让人觉得这玩意儿能用。一个机械臂每动一下都要停顿两三秒,哪怕成功率再高,在工业场景里算下来的投入产出比也很难说服人。VLA 模型是当前具身智能领域最受关注的技术路线之一。它把视觉感知、语言理解和动作生成整合进一套模型,让机器人能够依据语言指令完成复杂操作任务。但 VLA 模型有一个部署层面的老大难问题:推理太慢。每个控制时刻,模型都要把一个庞大的视觉语言骨干网络跑一遍,计算量极大,导致延迟居高不下,实时控制频率难以保证。这个问题并不新鲜,学界已经有不少人在尝试解决。今年 IJCAI 收录的一篇论文认为,现有的大多数方案都走偏了一步。AI科技评论(雷峰网公众号)联系到一作于闻达,围绕高效 VLA 方法进行交流。论文原文:https://arxiv.org/abs/2601.1963401大家都在剪视觉,但问题真的在这儿吗现有的高效 VLA 方法,主流路线是在视觉侧做文章,剪掉“不重要”的视觉 token,跳过一些 Transformer 层,或者直接复用上一帧的计算结果。逻辑上听起来合理:视觉信息最占计算,减掉多余的视觉计算,自然就快了。但这里有一个被忽视的矛盾。在机械臂执行任务的过程中,视觉上的复杂程度和操作上需要的精度,并不总是同步的。机械臂接近目标的阶段,画面可能非常简单,但这时候恰好需要全力计算,因为精细的夹取动作容不得误差;反过来,大幅移动阶段画面变化激烈,但其实不需要太多计算资源。换句话说,视觉复杂度不等于控制难度。以视觉信号来决定这一帧算多少,天然就抓错了对象。AC²-VLA 一作于闻达告诉AI科技评论(雷峰网公众号),团队在调研文献时发现了这个矛盾,并意识到 VLA 模型闭环控制过程中,真正能反映当前时刻需要多少计算的,是机器人的动作状态,而不是视觉画面。这个判断很直观,和 VLA 的逻辑也很吻合——V是视觉,L是语言,A是动作,既然VLA的最终产出是动作序列,那用动作来指导计算分配,才是真正贴近这类模型本质的做法。基于这个出发点,他们提出了 AC²-VLA,全称是Action-Context-Aware Adaptive Computation for VLA models,即动作上下文感知的自适应计算框架。两个 AC,一个代表Action Context(动作上下文),一个代表Adaptive Computation(自适应计算),名字里藏着双关。02让动作来“拍板”AC²-VLA 的框架主图展示了整体架构:视觉观测经过视觉编码器,语言指令经过 embedding,加上上一时刻的动作信息,三者共同构成一个动作先验条件向量,输入进一个统一的路由器(router)。这个 router 的输出,决定了当前时刻的计算策略。具体来说,router控制三件事:▎一、cognition caching(认知缓存复用)如果当前动作状态比较稳定,router 认为可以尝试复用上一步的 VLM 骨干网络输出,就会发起复用请求。但这个请求不等于直接复用,还需要看缓存是否能命中,综合判断运动状态是否连续、视觉状态是否匹配。两个条件都满足,才会跳过整个 VLM 骨干

阅读原文(雷锋网)→

本站为资讯聚合平台,仅展示标题与摘要,原文版权归原发布方所有;如有侵权请联系我们删除。