首页 / 资讯详情

Xspark AI 丁文伯:触觉替代不了视觉,但机器人需要一套自己的“脊髓” |物理AI 50人

雷锋网 2026-09-15 07:52 中文

摘要

具身智能进入“触觉时代”,丁文伯提出“脊髓”架构补全机器人物理交互短板。作者:李秋悦编辑:吴彤丁文伯很难被一个词准确“定位”。通信博士、材料学博士后、机器触觉学者,这些标签都对,但都只能解释他的部分经历。2025年,丁文伯又多了一个身份——Xspark AI(无界智航)联合创始人、首席科学家。一个做了多年传感器研究的清华教授出来创业,没有把公司定义成一家“传感器公司”。相反,他认为造出更好的传感器,并不会自动得到一个更聪明的机器人,机器人触觉可能需要一套自己的模型。这个判断首先来自纯视觉的局限。过去两年,具身智能最主流的技术路径仍然延续大模型的Scaling逻辑,即更多视频、更多机器人轨迹、更大的VLA(视觉-语言-动作模型),让机器人沿着“看见—理解—行动”的链条不断提高泛化能力。丁文伯并不反对这条路线,他甚至认为“VLA是一个蛮solid的逻辑,像早期Transformer、diffusion policy一样,一定会在具身智能(历史)长河里留下浓墨重彩的一笔”。但机器人和语言模型最大的不同在于,它最终要伸出手,真正碰到这个世界。在丁文伯看来,视觉其实已经解决了机器人感知世界“99%”的问题,触觉没有必要和视觉竞争。它更像是在视觉失效或者不够确定的时候,补上接触发生之后的信息。杯子有没有开始滑动,手指是不是捏得太紧,机械臂有没有撞到人,一个灵巧动作应该继续用力还是立刻修正。机器人一旦真正进入物理世界,问题就不只是“有没有看见”,还包括接触之后能不能及时感知、修正和避险。问题也由此往前走了一步:如果机器人需要触觉,那么触觉应该以什么方式成为智能?最直接的办法,是把触觉作为一种新的模态塞进现有模型。但丁文伯对此并不完全满意,他认为从第一性原理看,触觉的信息量远没有视觉丰富,却对反馈效率有更高要求。把它直接和整个视觉模型融合,要么产生大量冗余,要么少量关键触觉信息反而被视觉淹没。这也是他开始提出“触觉原生智能”的原因。触觉智能未必需要拥有视觉大模型那样丰富的语义理解能力,相反,它可能应该更轻、更快、更靠近身体。人快要摔倒时,并不会先识别“我正在摔倒”、分析原因,再决定伸手,而是身体先完成反射。丁文伯因此喜欢用人的“脊髓”来类比触觉智能:它处理的信息可以没有那么丰富,但要足够低延迟,能够在滑动、碰撞、失衡等发生的一瞬间做出反应。不过,从“触觉很重要”到真正做出一套触觉智能,中间还有很长的距离。首先是硬件。不同触觉传感器之间的一致性依然很差,即使同一批次生产的设备,性能也可能存在明显差异。模型因此很难像视觉模型一样,在不同硬件之间直接迁移。其次是数据。触觉没有互联网时代天然积累下来的海量图片和视频,同一个动作换一个人、一个传感器甚至一个机器人,数据分布都可能发生变化。再往后还有更基础的问题:触觉到底应该如何Representation和Embedding?不同传感器采集出来的力、温度、剪切、振动,最终有没有可能被转换成某种与具体硬件无关的共同表征?丁文伯把接下来两三年甚至五年的问题概括为三个“跨”——跨传感器、跨模态、跨本体。所以丁文伯并没有声称,一套成熟的“触觉大模型”已经有了答案。他承认,目前更现实的仍然是一条折中路线:短期先把某一种多模态触觉传感器做好,再和现有模型融合;预训练阶段聚焦通用能力构建,触觉信息的引入与融合则放在灵巧操作的后训练和动作修正阶段。至于长期,他才倾向于认为,触觉最终会形成自己的模型和逻辑。Xspark AI提出的“慢脑 VLM—快脑 VTLA+TWAM—脊髓 VTA”三层架构,可以看作前者判断现阶段的一种工程表达。在这套架

阅读原文(雷锋网)→

本站为资讯聚合平台,仅展示标题与摘要,原文版权归原发布方所有;如有侵权请联系我们删除。