首页 / 资讯详情
独家 | 乐聚发布垂域具身模型:一倍工业提效,两项榜单第一
摘要
如果说,基础模型是具身大脑的“大学”通识课;那么,垂域模型则是机器人在工业领域的“专业课”。 作者丨董子博 编辑丨林觉民 今天要做世界模型,所有人都知道要做预训练,来让具身大脑变得更聪明;也知道要做后训练,让机器人可以在专门的任务下得到锻炼、做得更好。和不少公司聊过,AI 科技评论发现,谈到中训练(Mid-train)的公司却很少。而实际上,在具身的实际落地中,却存在一些原有方案不易解决的问题:当预训练的 VLA 模型,没法在具体的场景中发挥全部智能;而后训练却有时间、成本的门槛;在训练技能的环节,也容易出现数采、训练和调试的重复工作——VLA 落地要真正提效,中训练或许才是破局的良方。AI科技评论独家获悉,乐聚机器人将推出面向工业场景构建的“垂域具身智能模型”——KUAVO VLA。据了解,该模型以通用VLA 基础模型为能力起点,使用 600+ 小时KUAVO 同构型真机数据进行了中训练,将本体适配、基础操作和工业场景的共性能力沉淀到模型中。乐聚机器人 KUAVO VLA 赋能下,在不少场景中可以实现大约一倍的提效,在某些任务中甚至可以做到100% 的成功率。模型中训练,会成为具身工业落地的杀手锏吗?在这个仍然充满未知的方向上,乐聚机器人先趟出了一条路。01什么是“垂域具身模型”?面对具体任务,基础模型的智能能够完成指令理解、任务规划、物理世界预测的要求,但要机器人实际可以执行任务,后训练往往需要投入千条以上的数据。而为了填补这个鸿沟,“垂域模型”,是乐聚机器人为KUAVO VLA 做出的全新定义。垂域模型,就是通用基模和具身技能之间的“中间层”,相当于在基模与技能之间插入了一层针对工业场景的一轮中训练。乐聚的思路是:先把 KUAVO 本体能力和工业场景中的共性能力训练进垂域模型,再把具体技能的学习范围收敛到工业场景。模型可以因此获得更高的能力起点——达到相同技能效果时,可以减少重复的数据采集、训练和调试工作,把资源集中用于决定任务成败的关键差异上。新任务的开发逻辑,也因此从"重新学习"转变为"在已有能力上快速适配"。在基模难以实际在本体中发挥智能时,垂域模型可以依靠详细训练过的 100 个“工业共性能力”,包括分拣、搬运、上下料、装配等典型操作,让模型省去繁复的后训练步骤,可以快速依靠“原子动作”,找到完成任务的方式,甚至实现能力的泛化。与跨本体混合训练不同,KUAVO VLA 训练的真机数据全部来自KUAVO 单一构型,使得模型能够持续、集中地学习同一套动作空间、运动特性和控制规律,减少不同本体之间的数据差异对技能学习的干扰。因此,模型的垂域能力能够与本体深度绑定,显著减少了模型在 KUAVO 上的推理误差,让本体的执行效率大幅提升。总结下来,用简单的话来讲:如果说,基础模型是具身大脑的“大学”通识课;那么,垂域模型KUAVO VLA 则是机器人在工业领域的“专业课”——一个人聪不聪明,得看通识课懂的多不多;但他能不能真的在实际场景干活,还得看他的专业课成绩。在工业场景下,垂域具身模型的好处是显而易见的。首先,它能够减少本体适配成本。通用 VLA 覆盖不同机器人本体和多种场景,数据中天然混杂大量跨本体样本;当模型进入 KUAVO 真机时,仍需重新学习本体的动作空间、运动特性和控制规律。其次