机器人也有Scaling Law?GE-Act 2.0用数据规模实验给出答案 📅 发布时间:2026/9/19 7:51:19 👁 浏览次数: 2024年底到2025年初几乎每个做具身智能的团队都在盯着同一个问题大语言模型里那条“参数越多、数据越多、效果越好”的Scaling Law曲线搬到机器人身上还成不成立因为从直觉上看机器人数据和文本数据完全是两码事——文本满地都是机器人轨迹却要靠真机一步步采贵得离谱还得考虑每个本体、每个场景的差异。所以很多人的默认判断是机器人领域不太可能有统一的Scaling Law更多是小数据、小模型、特定任务的“手工作坊”。直到智元GE-Act 2.0公开的验证结果出来这个判断被正面撞了一下。GE-Act系列是智元机器人推出的动作执行模型2.0版本的核心不是“加了几个新技能”而是用成规模的对照实验把“数据量增长→动作预测能力提升”这条曲线相对完整地拉了出来。它给出的信号很直接机器人侧确实存在和语言模型类似的规律但触发条件和生效范围都有明显的边界。这篇内容我想把它拆开聊一聊重点说清楚GE-Act 2.0到底验证了什么、怎么验证的、哪些经验可以直接抄走以及哪些地方Scaling Law依然水土不服。1. 语言模型靠涨数据机器人为什么一直涨不动1.1 文本与轨迹的本质差异先回顾一下语言模型里Scaling Law为什么有效。GPT系列、Llama系列反复验证过一件事只要你把参数量、训练数据量、计算量按比例放大下一Token预测的损失就会稳定下降下游任务能力随之上升。文本数据的来源是互联网几乎取之不尽而且信息的密度和分布相对统一清洗和去重之后直接喂给模型就行。机器人侧完全不同。一条有效的机器人轨迹数据至少包含视觉观测、本体状态、动作指令三个维度的对齐信息而且必须是真实的物理交互无法靠“爬虫”批量获取。哪怕在仿真环境里用强化学习疯狂采样sim-to-real的gap又会让模型在真机上表现缩水。这就导致机器人行业长期处于“数据饥饿”的状态几千条轨迹就得拿来训练模型一换场景就失灵更别提像GPT那样动辄用几个T的Token去喂。1.2 小数据时代的“手工作坊”困境数据不足直接决定了过去几年端到端机器人策略的研发范式每个团队都在自己的机器人上采数据然后训练一个只适配特定任务、特定环境、特定本体的模型。放在实验室里Demo很强换个光照、挪个桌子位置、换一台机器人成功率断崖式下跌。行业内把这种模式叫“数据烟囱”——每个场景都是一个独立的烟囱数据和模型彼此隔离无法复用。你花了三个月采的抓取数据换一个机械臂型号就基本作废。这种模式下Scaling Law根本无从谈起因为样本量始终没有逼近“规模效应”的临界点模型能力被数据天花板死死压住。1.3 GE-Act 2.0的切入点把动作变成Token把轨迹变成语料智元这代模型能做出验证起点在于它重新定义了机器人数据的组织方式。GE-Act 2.0不再把动作当作连续的浮点数直接回归而是把高频的动作指令离散化成动作Token再以“视觉观测Token 本体状态Token 动作Token”的序列形式做统一建模。这一步的本质是把机器人轨迹数据“改写”成了语言模型熟悉的序列数据格式。一旦动作变成了Token后面所有语言模型的技术积累——自回归、注意力机制、预训练加微调——都能平移过来。AgiBot World数据集智元开源的大规模真机操作数据集也在这个框架下被重新梳理和利用轨迹不再是孤立的“行为包”而是变成了可参与统计规律学习的语料。这里需要强调一下动作离散化不是GE-Act首创但把它和“规模化数据验证”放在一起做系统实验的GE-Act 2.0确实是目前公开信息里做得比较完整的一个。2. GE-Act 2.0的核心改动三段式结构、异构数据融合与稳定训练2.1 三段式架构VLA不是简单把模型拼一起GE-Act 2.0的架构延续了VLAVision-Language-Action的基本思路但拆得更细视觉编码器负责从图像里提取语义和空间信息语言模型主干负责跨模态推理和任务理解动作解码器负责将推理结果映射为具体关节指令。实际操作中真正难的不是选基座模型而是三个模块之间的对齐。视觉编码器输出的特征能不能被语言模型“读懂”语言模型推理出的意图能不能被动作解码器准确翻译成电机指令这中间只要有一个环节特征空间不匹配整个策略就是废的。GE-Act 2.0给我的感受是它在特征对齐上花费的精力不亚于模型结构设计——这恰恰是很多小团队复现VLA类工作最容易栽跟头的地方。2.2 异构数据融合真机数据、仿真数据与视频数据一起训练机器人数据稀缺是事实但稀缺不等于零。智元的做法是把所有能搞到的数据都纳入训练AgiBot World里百万级的真机轨迹、仿真环境里大规模采样得到的虚拟数据、以及互联网上的操作视频。三类数据的格式和分布差异极大混在一起训练如果不做特殊处理模型很容易被高质量真机数据带偏或者被低质量视频数据干扰。GE-Act 2.0的做法是做“数据混合配比”的动态调整——训练早期以真机数据为主让模型先学到正确的物理交互模式训练后期逐步加入仿真数据和视频数据扩大泛化覆盖面。这个节奏和我之前调多模态模型的经验高度一致数据不是越多越好而是在正确的时间点混入正确的数据才有正向收益。2.3 稳定训练的工程细节动作Token怎么定Loss怎么配比动作Token化的第一个问题是“粒度”。Token太粗动作精度不够机器人抓杯子会一把抓空Token太细序列变得很长训练和推理效率都扛不住。GE-Act 2.0在关节空间做离散化时把频率、加速度这些动态特征也纳入编码避免只看位置导致速度突变。第二个问题是Loss配比。语言模型里只预测Token类别但机器人模型要同时预测动作Token类别、回归动作残差、约束平滑性损失。三者的权重如果没有调好模型会出现“预测对了语义、输出了错误轨迹”这种诡异现象——也就是语言上看起来合理但真机一跑就撞。GE-Act 2.0公开的信息里提到它把动作残差回归的权重放在了比较高的位置这个细节我很认同因为实际部署时平滑性往往比语义正确性更重要。3. 智元拿什么证明Scaling Law成立关键对照实验拆解3.1 固定结构涨数据成功率随数据量近似对数线性增长GE-Act 2.0验证Scaling Law的第一个维度是在固定模型结构的前提下把训练数据从少量逐步扩展到全量观察测试任务成功率的变化。结果展示出近似对数线性的增长趋势数据量每提升一个数量级成功率按一定比例稳定爬升而不是在小数据时增长、大数据时迅速饱和。这条结果的重要性被很多人低估了。它说明机器人策略的能力残差还没被压榨完——当前阶段拼的不是模型小聪明而是数据规模和覆盖面。通俗点说大家都在等一个“数据喂进去、能力长出来”的正反馈循环GE-Act 2.0等于往这个循环里又加了一铲子煤。3.2 固定数据涨参数模型变大确实有收益但边际递减显著第二个维度是固定数据量不变只增大模型参数规模。结果符合预期但不如第一个维度振奋参数量增大能带来一定提升尤其对复杂长程任务“先拿A再放到B最后把C推过来”这类效果明显但简单任务上的收益很快趋于饱和。这背后是数据和模型的不匹配模型容量再大如果训练数据提供的信息量不够参数量只会变成“记住了更多无关模式”而不会转化为真正的泛化能力。这也解释了为什么GE-Act 2.0强调数据建设优先于模型扩建——对大多数机器人团队来说与其无脑堆参数不如先把数据工程做扎实。3.3 最关键的验证跨本体迁移能力随着数据规模的提升而增强衡量Scaling Law是否真正生效不能只看同一个机器人上的成功率还得看模型能否泛化到没见过的本体上。GE-Act 2.0在这轮验证里比较了不同数据规模下的跨本体迁移效果数据规模较小时模型换一个机械臂型号成功率直接腰斩数据规模扩大后跨本体的成功率韧性明显增强新本体的少量微调数据就能激活已有能力。这个结果比“同机成功率”更有说服力因为它说明模型学到的不再是“某台机器的特定轨迹”而是跟任务相关的通用操作模式——夹爪怎么靠近、关节怎么协调、碰到阻力怎么调整。这才是真正意义上“可以跨场景复用”的机器人能力也是Scaling Law在机器人侧成立的最有力证据。4. 哪些规律能直接迁移哪些地方Scaling Law会失效4.1 能迁移的规律数据覆盖度决定泛化上限多模态对齐是隐藏瓶颈从GE-Act 2.0的验证里我能抽出的第一个可迁移规律是数据覆盖度决定泛化上限。语言模型里经常说“数据多样性比数据量更重要”机器人侧更是如此。同样是10万条轨迹如果全部是同一个桌子上的抓取操作学到的东西极其有限但如果覆盖了不同桌面高度、不同物体材质、不同抓取姿态哪怕总量少一些模型的泛化能力反而更强。第二个规律是多模态对齐是隐藏瓶颈。GE-Act 2.0能把Scaling Law跑出来前提是它已经解决了视觉、语言、动作三者的特征对齐问题。如果对齐没做好数据量越大模型反而越混乱。我见过太多团队把精力全扑在数据采集上结果喂给模型后训练不收敛最后查出来是特征空间的映射关系没搞定——这个顺序千万别搞反。4.2 会失效的边界任务分布太散、轨迹质量太差、物理边界不明确Scaling Law不是魔法它的成立有几个前提条件一旦越界就会失效。任务分布过于离散数据里如果同时包含“把杯子放到桌上”“给病人翻身”“焊接钢板”这种任务类型差异过大的轨迹模型几乎无法学到共享规律数据再多也只是在压缩一个高熵分布成功率会被极限稀释。轨迹质量参差不齐机器人数据不同于文本一个错误轨迹的负面影响远大于一条垃圾文本——因为机器人一旦执行错误动作就是物理伤害不像文本输出错误可以轻描淡写地跳过。所以数据清洗在机器人领域的重要性远超NLP领域宁缺毋滥。物理边界不明确模型无法从静态轨迹里学到“关节限位”“电机力矩上限”“避撞约束”这些物理边界信息必须靠额外的约束机制比如安全层、运动学过滤来兜底。数据量再大也不能指望模型自己悟出这些规则。长时序因果依赖极强的任务如果任务要求“先看几秒再决定动作”或者“动作A的结果会动态影响动作B的路径”单纯增大数据量很难解决需要额外的记忆机制和推理能力。4.3 与LLM时代Scaling Law的一个重要区别算力不再是唯一杠杆大语言模型时代Scaling Law的叙事核心是“算力越多模型越强”。但在机器人领域算力只是其中一个维度真正卡脖子的是数据从哪里来、数据质量如何保证、数据如何覆盖物理世界的真实分布。GE-Act 2.0的验证恰好说明了这一点它能在有限的公开数据规模下把规律跑出来靠的更多是数据组织和训练策略的优化而不是简单粗暴地堆GPU。这个区别对中小团队其实是个好消息——意味着大家不需要和巨头比算力只要在数据工程和场景理解上做出差异化依然有机会拿到自己的Scaling曲线。5. GE-Act 2.0对从业者的实际影响开发范式、数据集建设与风险预判5.1 从“任务定制”转向“预训练加微调”过去很多机器人团队的开发流程是接到需求→选型硬件→采集该任务的数据→训练专用模型→交付。这个流程的痛点在于每换一个任务就从头来一遍前期数据采集和特征工程的工作完全无法复用。GE-Act 2.0带动的范式转变是先在一个大规模异构数据集上预训练出通用的VLA基座模型再针对具体场景用少量真机数据做微调。也就是说未来机器人开发者的核心竞争力不再是“给某个任务写代码”而是“怎么在基座模型的约束下设计微调数据、怎么评估模型边界、怎么做快速迭代”。这个转移意味着团队的人员结构也要跟着变——纯算法岗的比例会下降数据工程和评测工程的比例会上升。5.2 数据集建设质量、多样性、协议标准缺一不可如果你决定跟进这个方向数据集建设是最值得优先投入的地方。我的建议是抓住三个核心指标质量每条轨迹都要经过自动筛选和人工抽检剔除异常抖动的、动作中途失败的、相机标定明显偏移的样本。脏数据在机器人训练里的危害至少是文本领域的数倍。多样性刻意覆盖不同环境光照、背景、桌面高度、不同物体材质、形状、重量、不同本体不同品牌型号的机械臂和夹爪。多样性带来的泛化收益远比单纯增加同分布轨迹数量来得快。协议标准提前定义好数据格式、坐标系规范、指令接口否则后续做跨本体训练时光数据对齐就能消耗掉大量人力。5.3 风险预判Scaling曲线的“甜蜜区”可能会很快过去GE-Act 2.0证明了机器人Scaling Law在当前数据规模下是增长的但它没有证明这个增长会永远持续下去。从语言模型的经验看数据规模的上限迟早会出现——当你把世界上所有公开的机器人轨迹都扫完了后续增长依然要靠高质量数据生成仿真合成的物理真实感、真机数据的高效自动化采集来续航。另外一个潜在风险是评测基准的不统一。语言模型有MMLU、GSM8K这些通用基准机器人领域目前还非常碎片化——每个团队有自己的任务集、自己的评测环境、自己的成功率定义导致“Scaling Law成立”这个结论在不同的评价体系下可能差异巨大。所以当你看到其他团队宣称“我们也验证了Scaling Law”的时候务必多看一步它的评测任务是什么数据是怎么划分的成功判定的标准是什么这些变量任何一个不同结论的可比性都会大打折扣。最后聊一点个人体会。我在实际看GE-Act 2.0这套验证的时候最受触动的不是“模型有多强”“榜单有多高”而是它第一次把机器人能力增长这件事从一个“靠玄学调参”的领域往“有规律可循”的方向推了一大步。哪怕它的Scaling曲线只能代表特定数据范围、特定任务类型、特定本体形态下的规律也已经比“每个任务都从零开始”要先进整整一个时代。我自己的做法是在跟进GE-Act 2.0结论的同时先把团队内部的数据采集规范和评测基线定下来等基座模型和开源权重逐步成熟就能第一时间接入而不是临时抱佛脚去补数据。这个思路也建议同行们参考——方向已经清晰比拼的是谁先把基础设施铺到位。