首页 / 资讯详情

SeeAct AI穆尧:具身智能终局,一定是从“被训练”走向“自我进化”|物理AI50人

雷锋网 2026-09-24 09:19 中文

摘要

机器人真正缺的,不是数据,而是经验。作者:李秋悦编辑:吴彤那是具身智能最荒芜的时候。没有成熟数据集,没有标准Benchmark,甚至没有一条被验证能走通的技术路线。穆尧南下港大读博,开始研究具身智能。2021年,穆尧进入HKUMMLab,成为该实验室创始人罗平教授和中国人工智能奠基人之一的汤晓鸥教授共同指导的学生。“具身智能会是一个非常 Promising 的方向。”刚入组时导师们的这句话,穆尧一直记到今天。四年后,这个方向的潜力,开始在穆尧自己的研究中得到印证。穆尧主导的RoboTwin,成了中国具身智能圈的事实标准之一,GitHub斩获超过 2900 颗星,蚂蚁集团的LingBot-VA、生数科技的Motubrain都抢着在这个基准上刷新成绩。他本人入选国家级青年人才计划,成为上海交通大学长聘教轨助理教授,谷歌学术引用超过 5000 次。2026年,穆尧做了一个更激进的选择:押注“具身自我进化”,创办SeeAct AI观行智能。他给出一个相当明确的判断:“具身的终局一定会迈向奖励驱动的自我进化。”这个判断,和他2018年在清华读硕士时坚持的东西一脉相承。那一年,自动驾驶行业还在把感知、规划、控制拆开做,穆尧坚持端到端Policy和奖励驱动。后来,特斯拉FSD把整个行业收敛到了端到端,再也没人问他这是不是主流方案。穆尧把这种坚持归结为一个词:taste。这里我们理解不仅是技术品味,更是洞察技术发展的科学直觉。那么穆尧为什么会有这样的直觉?以下是左林右狸频道与穆尧的对话,在不改变原意的基础上做了部分编辑:01 奖励驱动从未离场左林右狸:你第一次系统接触强化学习是在什么时候?穆尧:2017年。当时David Silver在YouTube上有一套很好的强化学习课程,我也系统学习了图灵奖获得者Sutton的《Reinforcement Learning》。那个时候爆发的是围棋智能,我看到Alpha Go通过奖励驱动、自我规划、自我推演,最后能够产生超越人类的智能。我当时觉得,这可能就是人工智能皇冠上的明珠。左林右狸:到了清华做自动驾驶以后,这种判断怎么进入你的研究?穆尧:2018年的时候,我比较笃信两件事情。第一是端到端的Policy。第二是奖励驱动,希望由神经网络来承载这个策略。但是那个时候这个观点还比较超前。自动驾驶整体上分得比较开,感知、决策、规划、控制是分开的,甚至一个公司里面都会分成不同事业部。我还是希望用神经网络来承Policy,希望直接由视觉反馈和奖励驱动来做这件事情。后来做Mixed Reinforcement Learning,也是希望搭建Model-based RL和Model-free RL之间的桥。Model-free更多依赖真实数据,真实世界交互代价比较大;Model-based可以提高样本效率,但是模型自身会有预测误差。所以我们希望根据不断得到的环境反馈,对模型和现实之间的误差进行建模,再不断更新决策系统。左林右狸:为什么后来从自动驾驶转到具身智能?穆尧:硕士阶段我有一个感觉,车虽然也是一个具身智能体,但是它的限制比较大。本质上就是四个轮子在道路上跑,不撞人、遵守交通规则,道路类型和动作空间都比较有限。我就在想,有没有一个更广阔的领域,可以做更多有趣的探索。所以2021年,我去了香港大学MMLab罗平老师组里做具身智能。具身智能的研究对象一下子打开了。末端执行器有夹爪、灵巧手,机器人有双足、四足、轮式、双臂、工业臂。我当时觉得,这个领域太好玩了,有太多问题可以研究。左林右狸:刚进入具身智能的时候,你首先在解决什么问题?穆尧:

阅读原文(雷锋网)→

本站为资讯聚合平台,仅展示标题与摘要,原文版权归原发布方所有;如有侵权请联系我们删除。