人形机器人被忽略的“小脑派”:运动控制为何比大模型更关键

人形机器人被忽略的“小脑派”:运动控制为何比大模型更关键 朋友前两天在群里转了一段人形机器人视频机器人从货架上取箱、转身、放进搬运车中途有人故意从侧面推了它一下它踉跄半步很快找回平衡。评论区里最高赞的一条是“又是大模型立功了”。这句话让我在屏幕前停了几秒。不是说大模型没用。而是这个场景真正值得复盘的地方并不是机器人“听懂”了指令而是它为什么能在被推之后不摔为什么在负载变化时还能稳住重心为什么十几个关节的力矩输出和脚底接触力可以在一瞬间完成配合。这些能力并不属于大众熟悉的“人工智能叙事”而属于另一个经常被低估的方向。在我追踪具身智能行业的过程里这个方向一直没有一个特别响亮的名字。有人叫它运动控制有人叫它全身控制也有人从脑科学里借了一个词小脑派。写“具身江湖志”这个系列到第五篇我越来越确定一个判断——小脑派可能是离新闻头条最近却又最容易被误解的一个流派。新闻头条常常属于“大脑”但让镜头里那个身体真正动起来、稳住、能落地干活的往往是另一套截然不同的技术栈。1. 镜头里的“智能感”很大一部分是身体层给的1.1 机器人吸引人的那些瞬间往往不是决策瞬间如果你拆解一条爆款机器人视频会发现最容易引发转发的镜头通常是机器人翻了个跟头、跑过斜坡、被绊了一下但没倒或是用双手完成了一个需要精细力道的动作。这些镜头里的确有智能但属于什么智能大众会把它概括成“机器人很聪明”。做技术的人则知道视频里至少要拆成两层才能看懂。第一层是任务规划机器知道“我要把箱子从A拿到B”这是语言模型、视觉模型、规划器在做的事。第二层是身体执行机器人要用双脚保持平衡用手臂调整末端姿态再根据箱子重量动态改变全身关节的发力这是运动控制在做的事。媒体标题会聚焦第一层但真实画面里最能让人产生“这东西真行”感觉的往往是第二层。这里面有一个常见误区看到机器人能跑能跳下意识觉得它的“大脑”一定特别发达。实际正好相反——能听懂复杂指令的机器人越来越多但能稳定地走完一段复杂地形、能在真实干扰下不摔倒的机器人数量远没有新闻标题暗示的那么多。这就是小脑派存在的理由。1.2 大脑负责“想得到”小脑负责“做得到”我们可以做一个更生活化的类比。一个人想从沙发上站起来去倒水这个“想”大概只需要一个念头。但要让“站起来”这件事顺滑发生身体需要同时处理重心迁移、膝盖角度、脚底压力分布、手臂摆动补偿等一系列信号。如果小脑功能受损即使大脑完全清楚“要倒水”身体也没法把那个意图变成连贯动作。人形机器人也是同样的逻辑。你可以给机器人装一个很强大语言模型让它理解“把杯子拿给我”的含义也能让视觉模型找到杯子的位置。但如果缺乏稳定的身体控制它会在伸手触碰杯子的那一瞬间重心偏移然后整个人往前倒。所以对具身智能来说真正的瓶颈不只有“它不知道怎么做”还有“它知道怎么做但身体做不到”。后者恰好是小脑派的射程范围。过去几年大模型把“机器人的大脑”推到了一个前所未有的高度。但机器人终端还是要落回物理世界。物理世界不奖励会聊天的机器人只奖励能稳定完成动作的机器人。2. “小脑派”不是一个门派而是一整套能力栈2.1 先别急着把“小脑派”理解成解剖学概念脑科学里的小脑传统被认为主要负责运动的协调、平衡和精细调节。但具身智能行业里说“小脑派”并不是在严格复刻生物学分类更多是借用这个语义指那些更强调身体控制、运动生成和物理交互的团队和技术路线。和它相对的“大脑派”通常把重心放在语言、视觉、任务规划、推理这些偏认知的能力上。一个比较粗略的划分是大脑派解决“做什么、先做什么、怎么做计划”。小脑派解决“用多大的力、以什么角度、按什么时序真实把动作做出来”。从这个角度看“小脑派”并不是一个人数很少的小圈子而是具身智能里最接近物理世界的那一批工程师。它包含了很多看似不性感的底层工作机器人状态估计、腿部运动规划、全身动力学控制、足底力分配、在斜坡和松软地面上保持平衡、机械臂在接触物体后如何做柔顺控制、机器人在受到外部冲击时如何调整姿态降低伤害。如果不做具身智能普通人一辈子不会听到这些词。但如果哪天你亲眼看到一台双足机器人走成“僵尸步”或者机器人每次抓杯子都会把杯子怼飞你就知道这些“不性感的底层工作”一点都不是小事。2.2 人形机器人为什么没法靠“写死轨迹”解决问题早期的机器人控制在很多限定场景下可以靠“预设轨迹”完成。机械臂在固定的流水线上抓固定位置、放固定位置环境不变轨迹可以提前算好控制任务相对简单。人形机器人真正麻烦的地方在于它被设计成要进入人类生活环境而人类环境是不确定、非结构化、充满实时扰动的。地面上有没有水地毯会不会滑动被人推了一下之后重心偏移多少手里的箱子实际重量是不是和预设一致上一秒还空手下一秒抱起了一个重物腿往下蹲了多少这些问题都没有办法靠一条固定轨迹来应对。这时候需要的是一套能通过传感器反馈实时调整身体状态的控制系统。它要把视觉、惯性测量、关节编码器、脚底力传感器等数据融合起来在几毫秒到几十毫秒的周期里计算出下一组关节力矩。这不是“写死动作”能完成的而是像一个持续的、动态的负反馈过程。这套东西恰恰是小脑派的核心工作。2.3 理解小脑派要避开的三个误区第一个误区以为运动控制只是“调一下PID”。PID只是最基础的控制策略之一。人形机器人要处理多关节耦合、步态切换、接触力变化问题远远超出“调个参数”。它需要运动学、动力学、优化的协同甚至还要引入强化学习来学习复杂策略。第二个误区以为强化学习可以包打一切。现在行业里确实有很多团队用强化学习训练机器人的运动能力比如在仿真里跑步、转身、跳跃再迁移到真机。但强化学习不是魔法。奖励函数怎么设计、仿真和真机之间的“现实差距”怎么弥补、训练出来的策略在没见过的扰动下是否安全这些问题需要大量工程经验。第三个误区以为小脑派和人工智能没关系。小脑派里最前沿的方向恰恰很“AI”。比如用强化学习学控制策略用模仿学习学人类动作用神经网络做状态估计。它不是传统的、和AI无关的控制领域而是“AI必须通过身体与现实世界交互”的那一层。3. 为什么小脑派总被高频率地拉回新闻头条3.1 它服务于人类最能直观感受的维度一个投资人或一个普通用户不一定会被“我们接入了最新大模型”打动但很容易被“机器人跑上天桥”“机器人做后空翻”“机器人在斜坡上被踹也稳得住”打动。因为这些动作是肉眼可见的、有物理冲击力的。新闻生产者特别需要这种视觉锚点。大模型的发布会可以提供庞大的文字说明却没法让观众直观感觉到“智能”在增长。但一台双足机器人在松软草地上连续走十几步视频只有几秒却能把“具身智能在进步”这句话压缩成一个可以反复播放的画面。所以小脑派才“离新闻头条最近”。每当机器人公司要对外展示进展时真正能拿出来给媒体拍的常常是小脑派的工作成果。讽刺的是新闻文案里又不会说清楚这一层。于是观众的归因常常变成这个机器人接了一个很厉害的大模型所以能走能跑。3.2 一旦机器人“动不了”大脑叙事就会破功大模型很适合做“离线智能展示”你可以让它写一篇文章、画一张图、回答一个问题不需要冒任何物理风险。但具身智能的特点是它必须有一个“身体”在真实环境里执行动作。只要身体控制不行前面所有的“聪明”都会功亏一篑。设想一个场景机器人通过大模型规划出了“从桌上拿苹果递给旁边的人”这个行动方案也通过视觉准确定位了苹果。但真的抬起手臂时它没有控制好关节力矩要么用力过猛把苹果打飞要么因为重心偏移往前踉跄。旁观者只会得到一个印象这东西还不成熟。在具身智能领域“想得到”是前提“做得到”才是验收底线。而“做得到”这最后一步永远离不开小脑派。这也是为什么每隔一段时间机器人摔倒、翻车、原地踏步的视频总能在行业群刷屏。观众在那一刻瞬间意识到真正难的不是让机器人听懂得多流畅而是让它在这个真实、粗糙、充满意外的世界里保持优雅。3.3 “离新闻头条最近”的另一面容易产生能力错觉任何一项技术如果经常被大众讨论伴随的一定有过高期待。小脑派也不例外。当一个机器人能在实验室地毯上平稳行走人们会顺理成章认为它也能在雨天的马路上走。当它能在工厂地板上搬运箱子人们又会想象它在下个月就能收拾整个屋子。这种能力外推是大忌。在工程上一个运动控制策略往往是针对特定地形、特定负载、特定环境调出来的。实验室里的地毯、塑胶地面、工厂的环氧地坪看似差不多但摩擦系数、扰动类型、视觉纹理都不同。策略迁移到新环境后很可能出现性能显著下降。所以小脑派非常接近新闻头条但它真正成熟的场景往往又离大众预期很远。这种落差恰恰是这个领域最需要被媒体和从业者一起正视的。4. 别急着站队大脑与小脑的真实关系是“分不清优先级”4.1 江湖传言里的对立本质是资源竞争行业里经常出现两种相互看不上的论调。一种认为“只要大模型足够强机器人什么都能学会”。另一种认为“没有稳健的身体所谓具身智能只是空谈”。两边好像剑拔弩张。其实从小脑派的角度看这种对立更多是创业叙事和资源竞争造成的。大模型团队希望强调智能泛化能力因为这是他们押注的方向控制团队希望强调物理交互难度因为这是他们长期积累的优势。两个立场各有道理但它们原本不是一个层级的竞争。就好比一个建筑的承重结构和里面的智能家居系统你可以争论谁更重要但对最终住进房子的人来说两者缺一不可。人形机器人也是这样大脑决定上限小脑决定下限。可为什么现实中经常被做成二选一因为团队预算有限、人才有限、演示周期有限。一个创业公司不可能同时在两件极难的事上无限投入于是必须在阶段性资源分配上做出排序。4.2 用一张表判断一个项目的真实偏向如果想快速判断一个具身智能团队或项目到底更偏大脑还是更偏小脑我一般会看它“强调什么指标、害怕什么失败”。下面这张表可以做一个粗略参考判断维度更偏大脑派更偏小脑派核心产出决策、规划、任务拆解、多轮交互稳定运动、力位控制、步态生成典型瓶颈训练数据不足、推理不准、规划复杂真实扰动、硬件差异、实时性不足常见演示让机器人理解桌面指令并做出选择让机器人上坡、抗推、在窄道行走被人吐槽的点会说不一定会做会做但不一定理解任务核心人才背景大模型、深度学习、自然语言处理机器人控制、动力学、机械、仿真适合的落地场景需要长程规划、多任务切换的场景需要高强度物理交互、稳定性优先的场景这张表的关键价值不是让你把人分成两派贴标签而是让你在观察一个项目时知道它的风险点在哪儿。如果你发现一个团队的大模型背景极强但对关节控制、动力学响应没有足够积累那它最有风险的风险点很可能是“演示成功率高但用户真正让它干活时频繁中断”。反过来如果一个团队只强调控制有多稳但对任务理解毫无积累那它很容易陷入一种困境动作确实漂亮却不知道“下一件该做什么事”。4.3 从演示到落地排序比口号更重要具身智能最大的挑战其实不是“大脑派赢还是小脑派赢”而是“在你当前的应用场景里先解决哪层问题”。以家庭服务为例比起让机器人理解复杂的对话意图第一步更现实的可能是让它在复杂地面环境里安全移动不撞坏东西、不把人撞到。没有第二个前提再聪明的大脑也没什么用。以工业搬运为例如果机器人已经能在固定路线稳定搬运下一步需要补的才可能是“遇到异常货箱时自主重新规划”。这就是从最小可行场景倒推技术配置的方法。我比较建议的做法是先选一个人能对机器人有明确验收标准的场景把“小脑问题”优先解决到可接受水平再逐步叠加“大脑能力”。如果一上来就追求大而全的通用智能大概率会在无穷无尽的物理边界里反复返工。5. 判断一个具身智能团队时我用的“三层检查法”5.1 先看它是否知道自己正在解哪类问题真正让我对技术团队产生信任的不是它声称“要做通用人形机器人”而是它能清楚地告诉你当前项目里最难的是任务规划还是运动执行。如果一个团队在演示失败后第一反应是“再调大模型提示词”而现场问题是机器人走几步就偏、抬起重物会晃那就说明团队可能还没有建立正确的归因方式。在具身智能里出现异常时最忌讳的是一刀切归因到“AI不够强”。实际落地时大量问题出在输入观测、控制频率、力矩限制、硬件响应、状态估计延迟这些更“身体”的环节。我通常会按这个顺序帮助团队排查先看输出端机器人的动作是偏向、抖动还是完全无响应。再看输入端传感器是否有把数据传错状态估计是否延迟物体位置是否被遮挡。再看身体层关节是否有力矩限制、执行器是否存在响应慢、机械结构是否发生形变。再看控制器频率是不是太低控制参数是否和当前负载匹配。最后才看“大脑”任务理解、规划逻辑、行为选择是否有明显错误。很多现场问题在前面四层就已经能够定位。5.2 再看它的演示是否剔除了“温室条件”很多项目在视频里表现得非常惊人现场一看则完全是另一回事。这不是说团队骗人而是演示本身会天然挑选最有利的条件。我会关注几个细节地面是不是永远平整负载是不是永远固定有没有故意加入额外扰动测试时是否允许随机换一批人下达命令机器人失败了团队是分析原因还是直接重来一次看运气对小脑派来说“重复性”比“高光时刻”更重要。一个控制策略能在同一条件下成功十次不如它能在不同条件下成功七次更有价值。如果一个演示视频只剪出成功镜头而没有统计成功率没有展示失败案例和恢复策略那这个演示距离“能交付”还有很长的路。5.3 最后看它有没有把小脑问题“数据化”传统控制时代工程师会依赖数学建模和经典控制器。AI时代行业越来越依赖在仿真环境里训练策略再迁移到真机。但很多团队会在迁移这一步栽跟头。一个特别值得问的问题是你的控制策略在仿真和真实环境之间的gap有多大如果团队能给出具体的数据比如“仿真中成功率98%真机上只有70%主要差距在脚底传感器噪声和关节延迟”那说明它已经把小脑问题当作一个严谨工程问题对待。如果团队只告诉你“我们用了强化学习效果不错”却拿不出仿真到真机的性能差异分析就要谨慎。小脑派的本质不是热血而是对物理世界负责。6. 行业正在被“标准化”的声音围绕但小脑派仍缺公认指标6.1 为什么大家开始在搜索里找标准体系文件我在整理近期具身智能相关搜索热词时看到一个很有意思的现象很多人开始找《人形机器人与具身智能标准体系(2026版)》这类文件的PDF下载。这个现象反映出行业发展到了一个需要“度量衡”的阶段。过去几年人形机器人公司都在比“谁能做出来”。当一个赛道还处于极早期时各家跑各家的不需要统一标准。但随着产品开始进入工厂、展厅、物流场景用户需要知道一个机器人到底行不行厂商也需要一个相对一致的说法来说清楚自己和别人有什么不同。一套标准体系真正有价值的地方不是把所有人都框进同一种实现方式而是建立一个可以对比的基础框架。比如大家讨论“稳定行走”时到底指在平地走十分钟还是能上下20度斜坡如果“抗扰能力”没有一个统一测试方法厂商说自己“稳”和用户理解的“稳”可能完全是两个概念。不过也要提醒一句我们目前看到的很多标准文件往往是框架性文件或征求意见稿未必已经覆盖所有具体测试方法。拿到一份这类PDF先不要急着奉为圭臬要看它发布机构的权威性、适用范围、测试条件定义以及它到底约束的是接口还是性能指标。6.2 小脑派最需要的是几个可统计的指标从技术角度说小脑派的工作长期缺少又直观又可统计的评价维度。大脑能力可以用任务成功率、回答准确率、多轮规划成功率来衡量。小脑能力呢过去比较常说的是“能走多少分钟”“能跑多快”“能搬多重的物体”。但这些指标过于粗颗粒。我认为更接近小脑派核心的评价指标至少要包括抗扰恢复时间受到突发推力后回到稳定状态需要多长时间。无干预连续运行时长在特定场景下多久需要人工介入一次。能耗效率同样的任务哪个策略消耗更少。跌倒率与保护成功率遇到无法避免的摔倒时是否能保护本体和周围人。操作柔顺度抓取易碎物体、与人协作时接触力能否被控制在安全范围。这些指标不可能由一个热搜文件直接给出但如果从业者能在自己的项目里建立这几种统计口径会更容易发现控制策略的真实水平。6.3 标准之外还要有自己的验收脚本对我自己来说看一个具身智能项目时相比等外部标准落地更相信内部验收沉淀。我通常建议团队在项目开始的时候就建立一套“最小验收环境”不要等到产品快交付了才临时设计测试。这套环境要包含三个层次单任务稳定性测试同一场景连续重复执行记录成功率。边界扰动测试改变负载、改变地面、增加外部推力记录失败模式。长期运行测试让机器人在无人干预下连续运行一段时间记录中断原因。小脑派最怕的不是某一瞬间失败而是失败之后说不清楚为什么失败。有了统一验收脚本每一次失败都能变成可以追溯的问题记录。7. 给想入局的人学“大脑”是追热点学“小脑”是练内功7.1 一条不依赖新闻头条的学习路线如果你是对具身智能感兴趣的学生、工程师或者准备转行的开发者我的建议是不要只按新闻热度选方向。大模型叙事会一直换代但物理世界的基本规律不会。我这里给一个偏向小脑派的学习路线适合用来建立稳定的内功第一层建立物理直觉。不要急着写代码先理解刚体的位置、速度、加速度、力和力矩理解什么是惯性什么是摩擦力。然后拿一个简单的倒立摆模型去推导为什么控制频率很重要为什么模型误差会越积越明显。第二层学会在仿真环境里调试。现在的机器人仿真工具已经比较成熟。你可以从四足或双足模型开始用强化学习或经典控制跑通一个“原地站稳”的任务。这个阶段的关键不是刷高分而是理解奖励函数、状态观测、控制频率和运动效果之间的关系。第三层做真实硬件迁移。如果条件允许尽量尝试把仿真训练出的策略部署到小规模真实设备上。小脑派的很多坑只有真机才会暴露传感器噪声、执行器延迟、机械公差。哪怕只是一条简单的直线前进你也要记录仿真和真机之间的性能差异。第四层培养可靠性工程习惯。记录每一次实验的参数、日志和结果建立“输入-环境-控制策略-失败原因”的映射。一个做过一百次实验并留下规律的人比一个只发过漂亮演示的人的长期价值更大。7.2 适合小脑派的人和不太适合的人小脑派这个方向并不适合所有人。它需要长时间的物理直觉积累需要在反复失败里逼近也需要面对“折腾半天只是让机器人多走了一步”的低成就感时刻。适合小脑派的人通常有一些共同特征愿意和硬件打交道对机械结构有好奇心不排斥数学推导能在仿真和真机之间来回折腾遇到“为什么结果和想的不一样”时不会马上烦躁。不太适合小脑派的人往往希望快速在新闻头条里看到自己学习成果喜欢纯软件式的立即反馈不太愿意面对真实世界中那些说不清道不明的误差来源。这并不是说哪种人更高尚而是技术工种和性格匹配度高长期坚持的成本会更低。7.3 在新闻头条的干扰下保持自己的节奏现在具身智能行业的舆论节奏非常快。每隔几个月就会传来“某某公司发布下一代技术”热搜词也经常在“具身智能学习路线”“机械臂二次开发”“小脑派”之间快速切换。如果你身处这个行业很容易被牵着走。我的心态是新闻头条负责告诉你远方发生了什么小脑派负责提醒你脚下正在发生什么。前者扩展视野后者决定你能不能稳定走下去。真正能在具身智能里做出产品价值的人不是最会追热点的人而是能在一个物理难题前沉下心打磨的人。那个难题可能是摔倒可能是晃动可能是负载变化后的失控也可能是几毫秒的延迟。它不性感但它真实。它不会被一口气啃下来但每迈过一步都会让机器人离“真正能使用”更近一点。写到这里我回想起开头那段朋友转来的视频。如果让我重新评价那条视频我不会说“大模型立功了”。我会说在无数个我们看不见的毫秒里有一个“小脑”在全力工作让镜头里的身体没有摔下去。这正是小脑派最迷人的地方——它不负责说漂亮话它负责让一句话真正变成行动。而具身智能如果真的要走入普通人的生活需要的恰恰就是更多这种“能稳稳前进”的人。