HuRo:将人类视频转化为机器人数据,实现可扩展的 VLA 预训练
26年8月来自韩国rlwrld.ai公司和延世大学的论文“HuRo: Robotizing Human Videos for Scalable VLA Pretraining”。本文研究如何将人类操作视频转换成机器人训练数据。它的重要贡献是建立并验证了一条大规模数据生产路线;实验支持其预训练价值,但尚不能说明生成的数据具有可靠的物理可执行性。一、论文概述机器人训练面临一个现实问题:真实机器人示范昂贵,人类操作视频却很丰富。但人类与机器人在外观、身体结构、关节和动作空间上存在差异,不能直接把人类视频当作机器人示范。HuRo 的做法是对视频进行“机器人化”:画面转换:擦除人的手臂,再叠加渲染的机器人。动作转换:恢复人手的三维运动,映射为机器人的手腕与手指运动。语言标注:生成描述操作内容的指令。最终得到“图像—语言—机器人状态—动作”配对数据,用于视觉—语言—动作模型(VLA)预训练,再用少量真实机器人示范微调。作者整合五个人类视频数据源,构建了约 63 万条片段、1.422 亿帧、1,317 小时的数据集。如图 1 所示面向现实世界操作任务的 HuRo 预训练概览。利用“视觉机器人叠加”(visual robot overlay)和“动作重定向”(motion retargeting)技术,将海量人类活动视频转化为机器人操作片段。由此生成的片段包含语言指令、机器人状态及动作数据,可用于 VLA 策略的预训练。在经过下游微调后,基于更大规模 HuRo 子集预训练的策略在现实世界操作任务中展现出了更优的性能。二、主要想法:同时对齐“看到的身体”和“要执行的动作”论文认为,仅从人类视频中学习视觉知识,或者只提取动作而保留人类画面,都没有充分解决人机差异。其方法可以概括为:人类视频 → 恢