GEN 1.5发布:具身基础模型作为单样本学习者 📅 发布时间:2026/8/31 21:21:03 👁 浏览次数: 26年8月Generalist AI发布GEN 1.5 “embodied foundation models as one-shot learner”: https://generalistai.com/blog/gen-1.5。人类拥有惊人的能力仅凭一个或几个例子就能掌握新的物理技能。最新的机器人基础模型 GEN-1.5 也展现出这种能力的雏形它无需梯度更新或微调仅凭一个例子就能在几秒钟内学习一项新任务。它在单样本和少样本演示学习以及零样本物理泛化方面都展现出广泛的能力。尽管这些任务简单且周期短但这是一个能够大规模实现单样本和少样本物理技能学习的模型。这些成果是其构建物理世界通用智能这一使命的重要一步。机器人基础模型的优势显而易见走到机器人跟前它几乎可以立即执行任何任务。无论是零样本、单样本还是少样本学习从能力角度来看关键在于即时性和通用性模型能否快速学习新任务并推广到新的情境对于物理任务而言这种智能水平既要求机器人具备理解任务意图的广泛能力也要求其能够实时、闭环地适应现实世界中意想不到的变化。对于语言模型而言仅凭一个或几个示例就能快速学习新任务的能力是 GPT-3 的标志性功能。在广泛的语言任务中GPT-3 在未经训练的情况下仅凭一次上下文提示就能达到约 45% 的平均准确率而使用少量示例约 100 个示例时准确率最高可达约 65%。在 GPT-3 之前一些模型也展现出零样本学习能力甚至在少量示例学习方面取得了初步成果但 GPT-3 在更广泛的少量示例学习方面表现显著更佳同时在泛化能力方面也实现了当时的巨大飞跃。在机器人领域人们数十年来一直在探索如何开发能够从一次或几次演示中概括任务的系统——其历史至少可以追溯到1954年Unimate专利【3】的“引导式教学”以及1970年麻省理工学院的Copy Demo【4】。大量先前的研究包括其自己的研究【5】都展示了各种形式的上下文学习但这些学习仅限于有限的任务变体或受限于特定的对象、任务类型或感知方式【6,7,8,9,10,11】。仅通过一次或几次演示就能学习闭环物理技能并且能够在没有这些限制的情况下将其应用于广泛的任务这一能力一直被认为遥不可及。这种能力很可能建立在能够实现其他广泛泛化能力的基础之上。1 GEN-1.5 推出开发 GEN-1.5是最新的机器人基础模型。该模型展现了强大的单样本和少样本演示学习能力以及零样本泛化能力例如即兴发挥和使用新工具如刷子、簸箕等。GEN-1.5 是一款大型多模态模型能够处理视频输入30 秒的记忆以及其他传感器、语言和本体感觉输入并生成 100 Hz 的动作轨迹。其功能包括通过上下文提示进行单样本学习。只需 3 到 12 秒的单次演示提示模型即可在几秒钟内学习新任务无需任何训练。将上下文窗口中的感觉运动示例的使用称为“物理提示”。组合泛化。给定两个不同的上下文物理提示模型可以将它们串联成一个持续时间更长的单一行为。零样本仿真到现实迁移。即使预训练过程中不包含任何模拟数据模拟中录制的演示也能作为现实世界任务的物理提示。人机模仿。在某些情况下人可以在机器人摄像头的视野范围内用自己的双手演示任务模型会用机器人的双手重现该任务。基于梯度下降的少样本自适应。模型可以在 1-5 分钟的数据约 10-50 次演示上通过 1-10 个梯度步骤进行微调以适应新的任务。即兴创造新的策略和工具使用方法。模型在行为策略层面具有泛化能力形成全新的路径以达到目标使用未见过的工具例如刷子、簸箕等为使用其他工具演示的任务创造新的解决方案即使在被提示或微调为使用特定手执行任务时也能左右手灵活操作。这些能力似乎直接源于对大量物理交互数据的预训练。其并未针对任何此类任务进行专门训练没有为了促进上下文学习而进行的架构更改没有内部或外部元学习循环【12】迫使模型从最少的数据中进行适应也没有鼓励即兴发挥的辅助目标【13】。令人惊讶的是GEN-1.5 开箱即用就能在广泛的物理任务中做到这一点。在10项不同任务的实验中预训练模型仅需一次上下文提示即可达到平均59%标准差±10%的成功率。而通过少样本学习每个任务使用5分钟数据约50次演示并进行10步梯度训练成功率可提升至83%标准差±9%。在某些情况下上下文学习新任务的性能甚至优于在相同演示数据上进行1-5步梯度训练。尽管这些任务较为简单且周期较短成功率也相对较低但这是一个仅凭一次或几次演示就能学习多种灵巧闭环物理任务的模型。2 机器人预训练的规模化过去两年其一直致力于构建一个预训练引擎用于扩展基于物理经验从零开始训练的具身基础模型同时不断改进算法从而加速发展。正如在九个月前宣布的那样在 GEN-0【14】 发布之前已经开始观察到可预测的扩展规律【15】。五个月后发布 GEN-1【16】该模型展现了在 99% 以上的成功率下进行后训练以掌握任务的能力并初步展现出即兴智能improvisational AI的迹象。GEN-1.5 的初始预训练并行启动——至今已持续训练超过八个月。让它持续运行因为追踪的每个指标都随着引擎的运行而不断提升吸收更多数据、计算扩展效率更高并通过一系列精准的架构和算法改进实现了飞跃式增长。很明显模型正在不断改进而且趋势始终如一新任务的数据效率更高、计算效率更高、通用性更强。随着模型不断训练开始尝试用最少的微调步骤来适应新任务结果发现模型能够从数百步、数十步最终仅需一分钟的数据就能学习新任务。此前从未观察到如此少的梯度步骤就能学习技能。其随后提出疑问该模型能否在不进行训练的情况下完全在上下文中学习新任务且无需梯度步骤这一发现改变了对这些模型用途、潜在影响以及构建通用物理智能未来发展方向的思考。3 上下文中的单样本学习GEN-1.5 可以通过插入到其 30 秒上下文窗口中的单个演示来触发其余时间用于记录滚动观察数据。物理提示是感觉运动示例即传感器数据加上动作轨迹记录方式可以是使用一对手持式机械臂进行操作的人类数据也可以是机器人自身的滚动动作。一旦提示信息被纳入上下文模型便能立即执行任务无需任何训练步骤。单样本学习在上下文中的性能表现一般在包括拉拉链、打开罐子、从钱包里掏钱等在内的各种任务中平均成功率为 59%但令人惊讶的是仅仅在上下文缓冲区中插入一个演示而无需任何训练就能获得可衡量的能力。这极大地加快了达到基本性能水平的速度随后可以进一步精进最终达到精通水平【16】。目前在上下文中学习到的技能比经过微调的模型更脆弱但它们可以泛化到一些扰动进行即兴发挥并从错误中恢复。如图所示物理提示工程采用拖放界面用户可以通过选择要插入模型上下文窗口的演示内容。这段实时录像展示了如何通过物理提示让模型连续学习两项不同的任务i拉开铅笔袋拉链ii从铅笔袋中取出钱。并未对 GEN-1.5 进行明确的上下文学习训练测试任务也并非预先设计在预训练数据中。这是一个通用模型在训练过程中并未考虑预训练数据的分布情况。这种能力为何能从预训练中涌现目前尚难确定。一种假设是类比语言物理观察和动作的分布可能呈现出“突发性”和齐普夫Zipfian结构这种结构与语言模型中的上下文学习密切相关【17】。另一种可能是体力劳动本身就包含自然的重复周期模型可能已经学会了检测和扩展此类模式就像语言模型处理一般序列一样【18】。该模型基于从数据引擎中随机抽取的连续数据跨度记录了家庭、仓库、工厂等场所的活动进行预训练没有使用任何专门的基础设施将样本打包到上下文中——物理提示引入了模型在训练过程中从未遇到过的时间上的不连续跳跃。机器人技术本质上是多模态的就像人类学习一样教机器人学习新事物的方法有很多——对于人类来说最自然的方式或许是a演示或b语言指令【19】。虽然语言足以满足某些任务的描述需求但许多物理动作很难用语言精确描述【20】例如演示如何摆放两块乐高积木远比用语言描述容易得多。在自然观察和动作中提示任务也是对感觉运动理解能力的更全面测试模型必须从演示中推断目标重新利用现有知识并在新的初始条件下进行即兴发挥。基于物理提示工程的组合泛化物理提示也可以组合。例如如果把两个不同任务的演示放在同一个情境中每个演示都是独立录制的彼此之间没有过渡GEN-1.5 可以将它们串联成一个连续的行为执行一个任务后自然过渡到下一个任务。该模型自行连接了两者产生了在两种演示中均未出现的中间运动重新定位、重新抓取、错误恢复。在实践中这开启“物理提示工程”无需收集完整的复合任务演示即可从小型可重用物理提示库中构建该任务。随着模型的改进在特定情境中组合技能可能成为一种编写长期行为的实用方法这类似于语言提示中指令的串联。基于上下文学习的零样本仿真-到-真实迁移上下文学习也跨越了仿真到真实的鸿沟。提示可以完全由模拟经验构成例如来自脚本策略、强化学习智能体或人类远程操控模拟机器人并用于提示真实机器人。需要澄清的是“零样本仿真-到-真实迁移”通常指的是在模拟器中针对特定任务训练策略然后在没有该任务真实世界数据的情况下在真实世界中运行该策略。然而在展示的案例中模型既没有在模拟器中也没有在真实世界中针对该任务进行训练。GEN-1.5 预训练不包含模拟数据既不包含渲染视频也不包含模拟动态但可以通过模拟器的推出来有效地提示模型。然后提示的行为会像其他物理提示的行为一样进行概括到不同的手以及真实场景中的新对象位置和大小。对于任务的子集这意味着不再需要物理地收集演示 - 可以通过模拟器内的任何方式收集它们。人机上下文学习在某些情况下上下文学习完全跨越了具身差距人类用自己的双手演示了一项任务可以通过机器人的相机观察到然后机器人可以立即重现它。3 极少梯度步适应GEN-1.5 能够以极少的梯度步低至 1 到 10 步适应新的物理任务。通常训练之前的机器人模型完成新任务可能需要数万步梯度有时甚至更多但基础模型的一个显著特点是它们只需少量微调即可快速适应新任务【21】。虽然这种机制可以显式地构建例如使用二阶梯度来促进快速适应【12】但GEN-1.5 的预训练基础模型无需任何此类机制也能在极少的梯度步内完成适应。重要的是如此极少的训练步骤所需的特定任务计算量要少几个数量级并且相比繁重的微调它为任务自适应提供了更加灵活的视角。或许更恰当的描述是在极低数据量的情况下进行测试时训练【22】。测试时训练通常使用数十个梯度步骤而 GEN-1.5 仅需 1-10 个步骤就能在 5 分钟的数据上学习一项新的物理任务。10 个步骤对模型在保留任务上的权重影响不到 0.15%这表明微调只是对已有的知识进行轻微的重新配置而不是构建新的表征。在 10 步自适应实验中从 5 分钟的数据中采样序列并使用与预训练类似的超参数通过梯度下降法进行训练。在极端的单步条件下即从 1 分钟的数据中采样模型在保留任务上的成功率为 66.5%并且性能会随着更大的批次大小和更高的学习率而提高。我们没有对这一过程进行调整也没有扫描自适应特有的超参数这些结果大多是开箱即用的。4 物理泛化对于上述每一项任务经过微调的模型都能很好地泛化到演示之外——不仅能泛化到新的物体、实例和环境还能泛化到实现同一目标的截然不同的操作策略例如不同的抓握和运动方式、清除障碍物以及使用微调数据中未包含的工具。新工具使用的即兴发挥。例如演示如何使用刷子将木块扫入碗中并基于 5 分钟的人类演示对模型进行了微调。该模型能够理解如何使用刷子以外的各种其他工具来完成任务。当模型面对香蕉时它会将香蕉当作临时刷子使用。然而当模型面对簸箕时它表现出与演示更大的策略性差异并通过多种方式使用簸箕将木块提起并倒入碗中。无论是微调数据还是预训练数据都没有包含以这种方式使用的簸箕而且最接近的预训练样本与该任务几乎没有相似之处。给模型一个簸箕后它无需任何语言指导就能生成一个全新的接触序列来完成任务。在意外情况下进行即兴发挥的能力似乎是该模型掌握新任务的关键它能够纠正自身的错误有时甚至在错误发生之前就能纠正。最早在 GEN-1【16】 中观察到这种行为的迹象。在 GEN-1.5 中这种行为更加频繁且更加复杂并且随着微调梯度步骤数的减少而增强这可能是因为轻度适应的模型更接近其预训练先验并且在情况偏离演示时可以调用更广泛的行为库。处理障碍物。尽管该模型仅经过微调以将积木放入碗中但它似乎能够移除障碍物例如覆盖在碗上的纸片来完成任务有时还能将纸片放回碗上。在 5 分钟的特定任务数据中该模型仅使用这些数据进行了 1 个梯度步骤的微调碗上并没有纸片而且预训练数据中也没有出现过类似的任务。5 展望未来开启这段旅程之初并非有意构建一个单样本学习器。其团队的大部分时间都致力于构建机器人预训练科学迭代所需的基础架构从基本原理出发首先构建一个数据引擎以便大规模地利用高质量的物理经验来驱动模型科学。GEN-1.5 是一个具有深远科学意义的里程碑这并非因为其更高的成功率而是因为它代表了通用性的新前沿——它挑战了对这些模型在物理交互数据规模下进行预训练时行为方式的理解而这种规模的预训练在以往几乎无人认为能够实现除非采用捷径。GEN-0 和 GEN-1 都更加确信更多也更好的预训练将使适应新任务的数据效率更高。测量的每一项趋势都指向同一个方向更多的预训练使适应更快、更便宜、更通用。目前还无法确定这条曲线的渐近线在哪里。现在显而易见事后看来或许也显而易见预训练达到一定阈值后适应的成本就变得微不足道了。从几秒钟的数据中涌现出的上下文学习或者在一分钟的演示中迈出一个梯度步不再是传统意义上的任务特定训练。它更像是用极少的计算资源让模型回忆起它几乎已经知道的东西。这种方法的有效性改变了对这些模型用途、潜在影响以及构建通用物理智能未来道路的思考。几十年来机器人一直被宣传为“通用”机器理论上可以做任何事情——这与过去单一用途的工厂自动化形成鲜明对比。但这种承诺始终以专家对其进行编程为前提而这需要数月的精力和专业知识。如果与机器人的交互简化为简单地告诉它该做什么那么两件事将发生根本性的变化机器人变得有用的速度几秒钟而不是几个月以及谁可以与机器人一起工作任何人。