AI INSIGHT

清华具身模型登顶全球第一!突围GPT-6、英伟达,不靠外挂和额外数据

AI新闻 量子位 2026-10-09 11:52
AI 摘要

星动纪元选择将视频预测与动作学习分阶段训练,重点不是「视频、动作一锅炖」,而是把两者「解耦」,重新「排序」。

田晏林 发自 凹非寺

量子位 | 公众号 QbitAI

好家伙,世界动作模型(WAM)赛道,中国团队直接冲到了全球第一?!

而且,GPT-6-Astra、Physical Intelligence的π0.5、英伟达GR00T-N1.7等一众全球头部具身模型,这次都被甩在了身后。

出手的是一家中国机器人公司——清华唯一持股的嫡系具身公司,星动纪元。

近日,星动纪元自研的世界动作模型VPP2,一举登顶RoboDojo仿真榜单。

综合平均成功率32.26%,综合平均得分39.26分,两个指标双双第一。

关键是,这场比赛还真不好打。

RoboDojo号称具身智能界的「珠穆朗玛峰」,由香港大学MMLab牵头,全球近20所顶尖学术机构共同建设。

它专挑机器人不擅长的地方出题:换个环境,还会不会干活?东西摆歪了,还能不能抓准?任务做到一半,还记不记得前面发生了什么?

总之,想靠刷熟练度蒙混过关,没那么容易。

结果呢?

星动纪元VPP2不仅拿下综合第一,在泛化能力、精细操作、记忆能力三个维度上,也拔得头筹。

据说,这次VPP2没有额外加数据,也没用Agent RSI等增强手段,仅靠「标准数据集」,就把一众高手给卷了下去。

这代表着VPP2模型本身足够强,性能提升来自预训练,基座足够泛化,因此不靠外挂增强策略,不靠扩充数据「刷分」。

不是,哥们儿,这么夯的模型到底是怎么练出来的啊???

我们往技术路线里扒了扒,你别说,VPP2这次的突破,还真有点东西。

它瞄准了世界动作模型的一道老大难问题:预测错了,动作就跟着错。

VPP2给出的解法,是先把视频预测能力练到足够强,再让机器人在陌生环境里真正动起来。

从预测到行动,两种泛化能力一起提升。

从目前披露的多项测试结果来看,VPP2已经成为世界动作模型WAM赛道中,最有竞争力的选手之一。

具身智能行业有个挺尴尬的现象。

机器人Demo越做越炫,模型榜单分数也越来越高,但真要问一句,谁的机器人更聪明、更能干活?

还真不好回答。

比如让机器人抓杯子。在训练时见过的桌面上,它可能百发百中。结果换个杯子、挪下位置,立刻开始怀疑人生。

更别提那些需要连续执行多个步骤的任务了。

这也是为什么,RoboDojo这套评测值得关注。

它的目标是为具身智能建立统一、可复现的评测标准,仿真测试包含42项双臂操作任务,覆盖泛化、精准操作、长程任务、记忆、开放词汇指令理解五个维度。

说白了,就是把机器人拉出舒适区。

传统机器人模型在熟悉任务上可能接近满分,一旦环境、物体位置、任务组合发生变化,成功率可能明显下降。

RoboDojo专门对这类复杂情况进行考察,看机器人面对变化时,有多少泛化能力。

而VPP2这次交出的成绩单,相当亮眼。

平均成功率32.26%、平均得分39.26分,两个指标均位居榜首。

作为对比,在RoboDojo仿真基准的后训练评测中,GPT-6-Astra的平均成功率为22.48%,平均得分28.97分。

而VPP2分别领先9.78个百分点和10.29分。

论文截图,基线模型数据取自官方排行榜

这里两个指标各有侧重:成功率看机器人能否完整完成任务;平均得分则衡量任务推进到了哪一步,即便没能全部完成,也能体现其阶段性表现。

两项指标均综合了五大能力维度的测试结果。

换句话说,VPP2不仅完成任务的比例更高,面对没能做完的任务,也体现出了更强的阶段性完成能力。

而且,这种领先并不局限于综合成绩。

拆开五项能力维度来看,VPP2在泛化、精准操作、记忆三个维度上,同样拿下第一。

这三项能力对应着机器人进入真实世界的几道难关:换个环境还能不能干活,操作能不能做准,以及连续执行任务时能不能记住前面的步骤。

综合成绩领先,关键能力也能打。

不过,RoboDojo再难,考场终究还是「仿真环境」。真到了物理世界,物体的摩擦、形变、位置偏差,又会陡生变数。

VPP2在仿真里展现出的泛化能力,到了真机上还能成立吗?

星动纪元也做了实验。

这次,团队直接把VPP2部署到真实ALOHA双臂机器人上,测试了抓取、放置、堆叠、折叠、倾倒等10类零样本操作任务。

也就是说,无需针对这些测试任务进行额外微调,机器人就得直接上手。

结果,VPP2再次交出领先成绩:平均成功率58.5%,高于π0.5的40%。

在10类任务里,VPP2拿下了9类最佳成绩。

这下有意思了。

榜单第一,证明的是它在标准评测体系里的能力;真机零样本操作,则进一步考察这些能力能否迁移到真实物理环境。

两份成绩单摆在一起,VPP2的技术优势就更值得深挖了。

要知道,VPP2走的是世界动作模型(WAM)路线。

这类模型的基本思路,是借助视频预测理解物理世界接下来会如何变化,再把这种预测转化为机器人动作。

但这条路线长期存在一个问题:视频预测得漂亮,不代表机器人真的会干活。

VPP2这次,偏偏就冲着这个问题去了。

想理解VPP2的突破,先来看一个简单任务:让机器人把桌上的杯子放进盒子里。

对人类来说,伸手抓住、抬起来、放进去,几乎不用思考。

但机器人得判断杯子的位置、机械臂的运动轨迹、夹爪何时闭合,还要预测整个操作过程中,物理世界会发生什么变化。任何一步出了偏差,都可能翻车。

现有的世界动作模型(WAM),恰恰容易在这里出问题。

一方面,普通视频模型擅长生成画面,但画面看着合理,和符合真实物理规律是两回事。

比如要求抓左边的杯子,模型却预测抓起右边那个。视频照样能生成,机器人执行时却会直接跑偏。

另一方面,直接把动作学习加入视频模型,还可能损伤原本的泛化能力。

结果动作学会了,机器人换个环境却不会做了。

VPP2提出了一个很直接的判断:视频预测的质量,决定了动作的上限。

基于这一思路,星动纪元选择将视频预测与动作学习分阶段训练,重点不是「视频、动作一锅炖」,而是把两者「解耦」,重新「排序」。

星动纪元为此设计了一套三阶段训练策略:

  • 第一阶段,事件级视频继续预训练,让模型学会预测完整操作过程。
  • 第二阶段,固定时长视频后训练与蒸馏,让预测能力跟得上机器人实时执行的速度。
  • 第三阶段,动作专家训练,将视频预测转化为具体动作,同时尽量保住原有的泛化能力。

三个阶段层层递进,最终指向两个核心突破:预测能泛化,行动也能泛化。

VPP2首先要解决的,是机器人能否准确预测陌生任务中的物理变化。

星动纪元以阿里开源的Wan2.1-I2V-14B为基础,整合机器人操作、人类活动、通用视频等多种数据,覆盖不同机器人本体和操作方式。

不过,真正有意思的是它对数据的处理。

团队没有简单地把视频一股脑喂给模型,而是先将操作过程切分成语义完整的片段,再配上详细描述。

比如,不能只告诉模型「把杯子放进盒子」,还要明确是哪只机械臂、哪个杯子、哪个盒子,以及整个操作过程。

因为同一句模糊指令,可能对应无数种动作轨迹。

模型如果连操作对象都没搞清楚,自然很难准确预测未来。

VPP2索性把任务描述得更细,让语言指令和物理操作形成更稳定的对应关系。

更关键的一步,是事件级视频预测训练。

传统短时预测关注接下来几帧会发生什么,而VPP2直接让模型学习一次完整操作从开始到结束的变化。

从机械臂靠近杯子,到抓住杯子,再到放进盒子,模型要理解的是一整件事如何发生。

这样一来,面对新的物体、位置甚至操作任务,它才更有机会预测合理的物理变化。

在机器人操作视频的指令遵循测试中,14B参数的VPP2达到90%的成功率,而64B参数的Cosmos3模型为78%。

14B打赢64B。

这也说明,在物理操作预测中,参数规模并非唯一的胜负手,能否真正理解操作过程同样重要。

不过,预测得再准,机器人动不起来,也白搭。

这里有两道坎,一是速度,二是如何在学会动作的同时,保住视频模型原有的泛化能力。

第一道坎很好理解。如果让机器人干活,每个动作发生前都要花几秒生成视频,那么再强的预测能力也很难派上用场。

星动纪元选择先给预测模型提速。

团队将事件级预测模型进一步调整为固定8秒的视频片段预测,再通过一致性蒸馏,将多步计算压缩为单步生成。

最终,预测未来8秒的视觉变化,计算耗时约0.12秒。

第二道坎,稍微棘手一些。

前面好不容易让视频模型学会了预测陌生任务,结果加入动作训练后,模型反而只会执行熟悉的操作。

动作能力长出来了,泛化能力却丢了?VPP2要做的,就是同时跨过这两道坎。

VPP2引入一个0.9B参数的扩散Transformer(Action DiT),采用MoT架构,学习如何根据预测的未来状态生成机器人动作。

但星动纪元没有直接将视频预测模型(Video DiT)和动作专家一起从头训练。

在动作训练初期,视频模型的基础参数被冻结,仅通过LoRA进行适配,尽量避免动作训练破坏已有的预测泛化能力。

相当于先让机器人理解物理世界怎么变化,再训练它如何把这种「理解」转化为「动作」。

两种能力分阶段生长,又相互配合。

最终,视频预测约耗时0.12秒,动作专家约耗时0.1秒,整体动作片段生成延迟约为0.22秒。

当然,架构再漂亮,也得看最终效果。

前面提到的ALOHA真实机器人零样本测试,已经展现出VPP2将预测能力转化为陌生任务操作的潜力。

另外两套泛化测试,则进一步验证了这条路线。

LIBERO-Pro考察物体位置、任务要求变化后的操作能力,VPP2取得45.0%的总体成功率,其他基线模型最高为11.0%。

LIBERO-OOD则考察组合泛化,将熟悉的物体、布局和任务目标重新组合,形成此前没见过的新任务。

VPP2的总体成功率达到63.9%。

把这些结果放在一起看,VPP2的技术思路就清楚了。

先通过多源数据、详细任务描述和事件级预测训练,让模型更准确地预测物理变化。

再通过蒸馏加速、分阶段动作学习,将这种预测能力转化为实际操作,同时尽量保留原有的泛化能力。

具身智能的性能上限,显然还没到只能靠规模硬堆的地步。

VPP2再次说明,优化数据管线、调整训练范式,这些看似朴素的工程方法,仍然有机会带来可观的模型性能提升。

预测能泛化,行动也能泛化,是VPP2作为世界动作模型WAM,最值得关注的核心突破。

但真实任务往往更加复杂。机器人不仅要知道怎么做,还得判断先做什么、后做什么。

这就需要更高层的认知与规划能力参与进来。

星动纪元这里贡献了一个思路:GPT负责想,VPP2负责做。

前者负责理解、推理和规划,把复杂任务拆解成明确步骤;后者负责预测物理世界如何变化,再将规划转化为具体动作。

这一思路,在VPP2论文中已经有了初步的实验支撑。

团队实际采用的是VLM高层规划器,由其负责语义理解、记忆和任务拆解,再将明确的子任务交给VPP2执行。

结果相当直观。在RoboDojo选定的长程任务测试中,引入VLM子任务规划后,平均成功率从27.6%提升至57.6%。

这意味着,机器人要完成复杂任务,光有强大的动作能力还不够。高层规划与底层执行能否配合,同样影响任务完成效果。

顺着这条思路往后看,GPT+VPP2有望形成一种新的物理AI技术范式:通用认知+通用物理执行。

GPT等通用模型负责理解意图、推理和规划,VPP2这样的WAM负责预测物理变化、生成动作,再通过执行反馈持续调整。

从认知、规划、预测,到执行、反馈,一套完整的物理AI闭环逐渐清晰。

而这,也让WAM的价值有了更大的想象空间。

模型能力要通过本体与物理世界交互,真实使用又会暴露失败、产生反馈,推动模型和硬件继续改进。

星动纪元同时做大脑、本体和灵巧手,「深全栈」的战略可以在这一逻辑中得到解释:公司试图掌握的不仅是训练环节,也包括能力落地与反馈回流的环节。

u1s1,技术路线再漂亮,最终还是得去真实世界里干活。

星动纪元在这方面,已与中国邮政、顺丰等企业开展合作,在全国5个省市、10余个物流中心常态化运营。

物流场景中的货物尺寸、摆放位置、作业流程都可能发生变化。同样一套操作,换个仓库,机器人可能就得重新适应。

这也对机器人的泛化能力提出了更高要求。

模型能否把学过的本事迁移到陌生任务中,直接关系到未来跨场景部署的效率和成本。

当然,已有物流业务的商业化进展,并不意味着VPP2已经实现规模化部署。模型能否在更多真实场景中长期稳定运行,还需要进一步验证。

但VPP2这次的成绩,已经释放出一个值得关注的信号。

世界动作模型的竞争,正在从预测未来,进一步走向把预测转化为通用行动。

回头再看RoboDojo登顶,值得关注的也就不只是一个第一名了。

从仿真到真机,从预测泛化到行动泛化,VPP2的一系列实验结果表明:视频预测与动作学习的分阶段训练,确实能够提升机器人在陌生任务中的操作能力。

而随着GPT等通用认知模型与WAM进一步结合,物理AI也有望形成更完整的能力体系。

说到底,具身智能下一轮比拼的,就是机器人能否把学到的本事,带进更多陌生场景。

预测得准,还要做得到。这才是世界动作模型真正走向物理世界的关键。

PS:VPP2现已开源,感兴趣的朋友可以上手试试,复现一下论文结果。

要是真跑出什么惊喜,记得回来跟我们唠唠~

1.开源代码
:https://github.com/roboterax/video-prediction-policy-2
2.项目主页:
https://robert-gyj.github.io/video-prediction-policy-2

来源:量子位
阅读原文