RSS 2026 Robot World Models Workshop Summary 📅 发布时间:2026/8/20 12:47:39 👁 浏览次数: in Syndey, on July 17th, 2026IntroductionTalk 1: Steering VLAs with Imagined Goals 用想象目标引导机器人行动Laura Smith from Physical IntelligenceLaura Smith是 Physical Intelligence 研究科学家她在加州大学伯克利分校跟随Sergey Levine攻读博士研究真实场景下机器人强化学习曾实现四足机器人仅用 20 分钟学会行走。如今她在 Physical Intelligence 负责 PI0 系列通用机器人策略模型她的报告分享最新的 PI07研究工作。PI07 是一款具备涌现能力、可人为引导的通用机器人基础模型。本次报告重点介绍它的一项核心涌现能力 —— 模型能够重组已有概念与操作技能完成从未专门训练过的任务同时世界模型生成的想象目标能够引导模型实现这类泛化能力。一、PI06存在的问题很多研究者都怀揣同一个愿景打造一台投放至任意真实环境都能广泛适用的机器人。当前的机器人一旦脱离受控实验室场景我们无法预判它会接到什么任务、会遇到哪些物体甚至无法预知机器人本体形态会如何变化。但当前机器人学习系统的搭建模式很难实现这一愿景常规流程是选定单一任务、采集对应数据、微调模型至可用下一个任务再重复整套流程。如果每一项新任务都要单独采集数据、单独微调我们根本无法将机器人落地到真实世界期望它能处理任何出现的问题。二、原理将PI07与世界模型配对。这是任务条件式世界模型它不基于底层机器人动作推演完整轨迹而是以语言指令为条件预测未来观测画面。世界模型就是一个图像生成模型输出和任务相关的未来观测画面输入当前观测画面 描述后续操作的语言指令模型可预测两种画面 —— 约 4 秒后的短期场景或是接近完成子目标的终态画面。这是一个有用的未来状态子目标图像以实现语言中指定的目标。这类图像可以跨任务、跨机器人表示机器人想要达到的未来状态。再把这张图像作为额外条件输入送给同一个VLA视觉-语言-动作模型。VLA模型在海量任务数据中学会了如何根据视觉目标输出对应动作所以世界模型生成的目标图像能够引导模型进行全新的动作组合完成全新任务。但它无法凭空创造 VLA 模型本身不具备的操作能力。为什么想象的视觉目标能带来增益视觉生成模型可以从比机器人策略或VLA策略更广泛的经验中学习包括人类视频没有动作web数据和不与任何类型的动作配对的静态图像。我们的核心假设是世界模型可以把从这些海量素材中学到的先验知识转化为贴合机器人当前场景的具象视觉目标。三、通过5组实验进行研究实验1一个更简单的有偏向的任务。我们采集了大量的收拾餐桌数据但完全不采集反向操作数据 —— 把餐具丢进垃圾桶、垃圾丢进厨余垃圾桶然后我们想看看机器人是否能做反向收拾。但这个任务只包含基础抓取、放置动作。因此即便没有目标图像引导原始 VLA 模型完全可以完成任务目标图像带来的提升微乎其微。实验2图像目标引导可以克服机器人训练数据里存在的偏向性。我们刻意构造存在数据偏向的训练集大量采集机器人从冷冻柜取食物、放入微波炉加热以及其他基础微波炉操作数据但完全不采集反向操作 —— 把食物从微波炉取出的样本。推理阶段我们指令机器人从微波炉取出食物、放回冷冻柜。目标图像生成器生成的图像然后我们将目标图像作为条件输入给训练过的VLA来实现这些目标图像发现这些子目标图像能够引导在所有相同数据上训练的策略去真正完成该项任务。实验3一组物体重排任务中也观察到相同规律任务超出训练数据分布范围的方式是由语言指令决定的比如用训练数据标注里从未出现过的称谓指代物体。当指令贴合训练数据分布时世界模型几乎没有增益但当更复杂指令偏离训练数据分布时目标图像生成器的提升效果非常明显。实验4空气炸锅烤整根红薯、往里加芝士的任务一种更开放的泛化场景机器人能否完成这样的任务从未采集过机器人执行该任务的示范数据但训练数据其他片段里存在相关提示采集大量开放式人类和炸锅交互的数据但没有收集机器人完成整套红薯芝士烤制的示范样本数据。世界模型实时生成的子目标图像模型顺利完成全套任务。所以系统结合了空气炸锅的知识从人类视频、互联网图文里学到空气炸锅的结构与使用逻辑再结合从机器人遥操作数据中掌握的基础操作技能 —— 抓握拉手、拉开舱门、抓取放置物体等自主拼接出全新操作流程。只要有足够多样的底层操作技能集合模型就能自主串联起这些底层操作技能插值完成从未见过的完整任务。实验5这套视觉引导接口能否实现跨机器人本体迁移仅采集弧形机械臂衣物折叠示范数据不采集双臂UR5E 机械臂衣物折叠示范数据但整套系统依靠世界模型视觉引导让双臂 UR5E 零样本完成衬衫折叠操作。四、存在的问题问题一你们如何生成目标图像又如何保证世界模型不会生成超出数据分布的画面我们完全无法保证世界模型不生成分布外图像。事实上某种程度上我们恰恰需要它产出分布外的目标图像整套系统才能实现超越纯语言 VLA 的泛化效果 —— 泛化能力的来源正是这些未见画面。但同时目标画面必须控制在合理偏移范围内这确实是一大挑战。就像我之前说过的视觉生成器无法凭空创造 VLA 本身不具备的操作能力图像生成模型需要生成VLA可以实际完成的目标图像。但我们的实验证明当经过多样的数据训练后搭配目标图像条件的 VLA 泛化能力显著提升可以完成仅靠语言指令无法实现的任务。问题二为什么不把世界模型/图像生成器和 VLA 融合成单一模型非要拆分成独立模块我认为这可能是一个挑战我们暂时无法确认一体化架构是否能带来实际性能增益这需要大量实验验证。To be continue.