BeyondMimic框架突破:人形机器人学会多样动作,迈向环境自适应时代! 📅 发布时间:2026/8/29 9:48:57 👁 浏览次数: 【人形机器人运动新突破】人形机器人要真正进入为人类设计的环境行走只是起点。它们还需完成奔跑、跳跃等一系列高动态动作并在任务变化时自然切换技能且动作要稳定有类似人类的协调性与节奏感。传统方法易产生不自然动作强化学习虽让人形机器人掌握多种行为但缺乏通用性。如今加州大学伯克利分校、斯坦福大学团队提出基于强化学习的运动跟踪框架 BeyondMimic实现了新突破。【BeyondMimic框架揭秘】【目标与阶段概述】BeyondMimic 的目标是让人形机器人在训练阶段未见过的下游任务中合成多样化动作同时保持持续的敏捷性和类人的自然感。该框架包括两个阶段第一阶段使用可扩展的强化学习运动跟踪从多样化人类动作中训练出具备高动态能力的运动技能第二阶段使用统一的潜在状态 - 动作扩散模型将技能整合到同一运动分布中并通过分类器引导在推理阶段根据新目标生成和组合动作。【第一阶段统一学习人类动作】此阶段任务是从人类示范中学习可迁移的运动技能。研究团队让不同参考动作共享同一套运动跟踪公式等在可扩展性与动作自然度间取得平衡能学习不同类型人类动作保留人类水平的敏捷性。还结合了精确的执行器建模等设计认为仿真到现实的迁移能力来自整体配合。训练数据含约 2.5 小时人类动作机器人验证全部动作并将 21 个代表性动作片段部署到真实机器人上总时长约 15 分钟涵盖多种平衡行为和高动态动作以及不同风格和接触模式的技能。【第二阶段潜在扩散模型组合技能】研究团队训练统一的潜在状态 - 动作扩散模型将第一阶段的多种运动技能整合起来。该模型不仅预测动作还能隐式捕捉动作对未来状态的影响为任务适配和技能切换提供基础。其关键能力来自 classifier guidance可将无条件动作生成引导为面向特定目标的条件生成。在预测控制中模型先预测未来状态和动作再修正结果使轨迹朝指定目标收敛。BeyondMimic 将规划与控制放进同一模型允许 classifier guidance 直接在真实硬件上调整机器人能根据指令切换动作实现动作补全。两个阶段部署依赖实时 C 框架实现了较强的仿真到现实迁移。【评估结果敏捷性与自然感兼备】【多样动作与人类水平的敏捷性】研究团队在室外复杂地面测试机器人机器人完成了多种高难度动作。在空中侧手翻时有较高的峰值加速度和角速度落地姿态控制好。还能连续完成多次跳转保持稳定性和动作风格。这表明第一阶段的运动技能能迁移到真实硬件在复杂环境中保持高动态表现。【行走与奔跑的自然程度】研究团队组织 77 名参与者进行用户研究观看 BeyondMimic 与 Unitree 原生控制器的 20 组行走和奔跑片段并选择更自然的。最终获得 1539 次有效选择BeyondMimic 整体获得 70.8% 的偏好行走偏好率为 57.0%奔跑偏好率达 84.7%。机器人行走受外力时能柔顺响应体现对外部干扰的适应能力。【未见任务中的运动切换与技能组合】研究团队测试了速度命令、路径点导航等任务。机器人能生成平滑轨迹到达目标点在受到扰动后继续朝目标移动能在不同速度指令下平滑切换行走和奔跑状态。通过 motion inpainting 测试机器人能从行走平滑过渡到高动态动作再回到原状态。在任务组合实验中机器人能结合路径点跟踪和障碍物躲避成本绕开障碍物到达目标点避障机制在不同成本替换后仍有效。这些结果证明 BeyondMimic 能通过推理阶段的 classifier guidance 切换目标并组合技能。【不足与未来方向】当然BeyondMimic 框架还有很多需要改进的地方。其扩散模型依赖底层状态估计系统质量潜在扩散模型虽对噪声有一定鲁棒性但结合传感器融合或学习式状态估计仍是提升性能的重要方向。当前系统预测时域不足以完成长程规划历史信息可能使模型陷入重复动作模式虽可缓解但可能导致去噪不稳定机器人在动作开始和结束阶段易绊倒。此外当前基于引导的优化对精细控制效果有限仍需调节引导权重。研究团队认为未来可探索监督微调和适配器式控制层支持更细粒度、可组合的轨迹控制减少人工调参需求。BeyondMimic 的价值在于将高质量动作学习等放进同一框架未来有望让人形机器人从“按预设动作执行”走向“根据环境组织行为”。