【ICLR 2026】ADP 论文解读:让剪枝跟着机器人动作走的 VLA 推理加速框架|从具身智能效率视角

【ICLR 2026】ADP 论文解读:让剪枝跟着机器人动作走的 VLA 推理加速框架|从具身智能效率视角 摘要本文解读 ICLR 2026 论文《Action-aware Dynamic Pruning for Efficient Vision-Language-Action Manipulation》。该论文提出动作感知动态剪枝 ADP通过融合文本驱动的视觉 token 相关性排序、末端轨迹门控与多视角配额分配让 VLA 模型只在粗操作阶段剪枝、在精细操作阶段恢复全视野其特别之处在于训练无关、即插即用全程不需要任何权重更新。实验表明在 LIBERO 四套件上保留 30%–70% 的 token 仍能维持94.4%–96.3%的平均成功率LLM 侧加速1.13–1.35 倍真机 Kinova Jaco2 上延迟从 76.9 ms 降到51.8 ms1.49×成功率反而从 85.8% 提升到88.3%为 VLA 的实时部署提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机视觉 token 为什么成了 VLA 推理的主要开销已有方法的两条路线与各自的盲点被忽略的那条线索冗余度是动作的函数研究主线从问题到结论基准/方法设计机制一文本驱动的预期式剪枝剪哪些机制二动作感知门控何时剪多视角配额与防塌缩保护分类全景方法细节文本驱动的预期式剪枝动作感知的动态门控复杂度收益从哪来附录里的算法全流程实验设计与结果评测协议LIBERO 仿真结果真机结果消融动态门控在承重为什么随机剪枝会崩结果对比总结关键发现局限性论文自述与可观察到的边界阅读时需要注意的表述问题常见问题FAQADP 需要重新训练 VLA 模型吗ADP 和 VLA-Cache 有什么区别ADP 的判断依据为什么用末端轨迹而不是注意力分数保留率应该设成多少为什么打分层选第 0 层而不是更深的层连续剪枝 3 次就强制恢复全视觉这个规则重要吗参考链接论文基本信息项目内容标题英文Action-aware Dynamic Pruning for Efficient Vision-Language-Action Manipulation标题中文ADP让剪枝跟着机器人动作走的 VLA 推理加速框架作者Xiaohuan Pei共同一作、Yuxing Chen共同一作、Siyu Xu、Yunke Wang、Yuheng Shi、Chang Xu机构悉尼大学 计算机科学学院The University of Sydney会议ICLR 2026arXivhttps://arxiv.org/abs/2509.22093项目网站论文标注vla-adp.github.io当前 404可用 arXiv 版 https://arxiv.org/html/2509.22093v1背景与动机视觉 token 为什么成了 VLA 推理的主要开销主流的 Vision-Language-Action 流水线是「视觉编码器 → 投影层 → LLM」一路场景相机加一路腕部相机的图像被编码成大量 visual token与文本指令、本体感知一起拼成一条很长的多模态序列再送入 LLM 自回归或并行解码出 7 维动作。问题在于这条序列里视觉 token 占了绝大部分长度而长程操作任务每一步都要完整前向一次于是计算量、显存占用与延迟都被视觉 token 主导。更麻烦的是大量视觉 patch 与当前指令只有很弱的关联它们不仅不提供信息还会稀释注意力。已有方法的两条路线与各自的盲点现有工作大致分两派。训练期路线改造架构或压缩参数RoboMamba 用轻量状态空间骨干替代部分注意力DeeR-VLA 做结构化剪枝与动态重参数化Mole-VLA 按任务难度条件化地激活部分层。这类方法收益明显但需要重新训练或微调。推理期免训练路线则完全不碰权重VLA-Cache 在相邻步之间复用信息量低的 token 的 key 与 valueEfficientVLA 与 SparseVLM 用注意力分数做 token 选择FlashVLA 与 SP-VLA 走「先压缩再行动」或调度与剪枝联合优化。ADP 属于这一派。与 ADP 最直接可比的是FastV(OFT)它同样按文本到视觉的注意力给 token 排序同样在 OpenVLA-OFT 上做了复现但它采用一个固定的保留比例对所有操作阶段一视同仁。代价在数字上非常直观——FastV 把 FLOPs 从 7.91 降到 6.37、加速 1.24 倍可是 LIBERO 平均成功率从 97.1% 掉到86.8%长程套件Long更是从 94.8% 掉到73.0%。被忽略的那条线索冗余度是动作的函数ADP 的出发点是一条简单但此前未被系统利用的观察机器人操作不同阶段的视觉冗余程度差别很大而且与动作动力学强相关。搬运、接近这类粗操作阶段以全局运动为主相邻 patch 高度重复冗余高抓取、对准、插入这类精细阶段依赖局部几何与接触细节冗余低。把这条线索与「固定剪枝率」对照就能看出既有方法的系统性缺陷统一的剪枝率要么在粗操作阶段剪得太少省不下计算要么在精细阶段剪得太多掉成功率文中的表述是 prune too little (limited savings) or prune too much (accuracy loss)。ADP 要做的就是把「剪多少」从一个静态超参变成由机器人自身运动状态实时决定的状态量。研究主线从问题到结论图 1ADP 研究主线VLA 视觉 token 开销 → 冗余随阶段变化 → 双机制设计 → LIBERO 与真机验证 → 1.35–1.49× 加速。Mermaid 流程图基准/方法设计ADP 的设计可以概括成两个正交的子问题剪哪些 token与这一步要不要剪。前者由文本指令决定后者由机器人自己的动作轨迹决定。机制一文本驱动的预期式剪枝剪哪些在进入 LLM 之前用文本到视觉的交叉注意力给每个视觉 patch 打一个相关性分数只保留分数最高的 Top-K 个 patch。这里的关键选择是在哪一层打分——ADP 选择第 0 层理由来自层间统计见下文实验部分浅层注意力分布平坦Top-K 排序稳健深层注意力塌缩到少数 token排序容易被局部噪声左右。机制二动作感知门控何时剪用正运动学把刚解码出的动作块积分成末端执行器轨迹计算窗口内的累计弧长作为运动幅度指标再与历史统计比较输出一个二元状态运动幅度大粗操作就开启剪枝运动幅度小精细操作就关闭剪枝、恢复全视觉。多视角配额与防塌缩保护多相机场景下保留配额还要按权重向量分到各视角实验取场景 : 腕部 4 : 6避免任何一路视角被整片剪掉。此外还有两条工程保护前两个窗口强制全视觉作为冷启动如果连续 3 个窗口都在剪枝下一个窗口强制恢复全视觉防止误差累积。图 2动作感知动态剪枝 vs. 静态剪枝——五个过去观测窗口驱动当前窗口的剪枝决策。p1、p3、p5 处于粗操作阶段门控开启剪枝以抑制冗余 tokenp2、p4 为精细阶段剪枝关闭、恢复全视野。曲线为驱动力门控规则的机器人运动量。分类全景图 3ADP 的剪枝决策可拆成四个子问题剪哪些文本 Top-K 相关性、何时剪末端轨迹门控、剪多少保留率与多视角配额、何时不剪冷启动与连续 3 窗复位。Mermaid 流程图方法细节文本驱动的预期式剪枝设某一层的隐状态为 H把它拆成视觉子集与文本子集分别乘上 query 与 key 投影矩阵得到 Q 与 K再算缩放点积相似度矩阵。对注意力头与文本查询取平均就得到每个视觉 token 的全局重要度分数 $\Phi$逐层打分$\Phi(v) \frac{1}{N_h L_{txt}} \sum_h \sum_t A_{h,t,v}$保留配额$k \lfloor \rho \cdot L_{vis} \rfloor$其中 $\rho$ 是保留率多视角分配第 c 路视角分到 $k_c \lfloor \alpha_c \cdot k \rfloor$$\alpha$ 是视角权重且各分量之和为 1直观上这一步等价于用文本指令当「检索 query」在视觉 patch 里做一次 Top-K 检索然后把检索结果重新拼回多模态序列。整个过程复用已有的投影权重不引入任何新的可学习参数。动作感知的动态门控门控的输入是刚解码出的动作块每一步包含三个平移增量、三个旋转增量以及夹爪指令。ADP 用正运动学把这些增量按时间顺序积分成末端执行器的位姿序列取其平移分量得到轨迹点再用窗口内的累计弧长量化这一个窗口的运动幅度轨迹距离$\delta_i \sum_t \lVert p_{t1} - p_t \rVert_2$历史均值规则$s_{i1} 1$ 当且仅当 $\delta_i \ge \bar{\delta}_i$其中 $\bar{\delta}_i$ 是历史窗口的均值相邻极值规则实验采用与最近 $\tau$ 个窗口的最大值 U 和最小值 V 比较大于等于 U 则剪枝、小于等于 V 则全视觉、介于两者之间则保持上一状态均值规则平滑但对突变反应慢相邻极值规则能快速响应局部运动变化因此更适合捕捉粗操作与精细操作之间的切换。复杂度收益从哪来论文给出了显式的复杂度分析。单层 Transformer 的 FLOPs 近似为 $2S^2D 4SD^2 6SDM$其中 $S$ 是序列长度、$D$ 是隐维度、$M$ 是前馈中间维度。ADP 的打分开销只涉及两次投影和一个相似度矩阵记为 $F_{score}$剪枝后序列长度从 $S$ 降到 $S$H 层全部在更短的序列上运行于是总开销是 $F_{score} H \cdot F(S)$。关键点在于剪枝发生在嵌入阶段、只做一次而收益由所有 H 层共享。设任务执行中共有 T 次前向、其中比例 $\gamma$ 走剪枝路径整个 episode 的期望节省量就是 $T \gamma$ 乘以单次前向的节省量——这也解释了为什么保留率越低、加速比越高。附录里的算法全流程论文附录给出了完整算法。主循环中先用正运动学算窗口运动幅度再更新门控状态连续剪枝达到 3 次则强制复位状态为 1 时在第 0 层计算重要度并按视角配额做 Top-K重组序列后前向否则直接走全视觉路径。冷启动、连续剪枝上限、多视角配额三个超参在仿真与真机设置中保持一致。图 4ADP 总览——(a) 动作感知门控由最近的末端轨迹三个平移量、三个旋转量与夹爪状态决定是否剪枝(b) 预期式剪枝在进入 VLA 主干前按注意力相关性保留任务相关视觉 token、丢弃冗余 patch。图 5文本驱动的预期式剪枝——Step 1 从第 l 层取出预训练的 query / key 投影矩阵计算文本与视觉 patch 的相关性Step 2 以文本为引导按排名剪掉视觉 token只把高相关 patch 送入后续融合层。实验设计与结果评测协议仿真使用 LIBERO 基准的四个套件Spatial空间理解、Object物体识别、Goal目标导向、Long长程规划全部设置跟随 OpenVLA-OFT 的公开脚本FastV 由作者在同一环境下复现。窗口大小取 OpenVLA-OFT 的 chunk size 8前两个窗口冷启动全视觉连续 3 窗剪枝后强制复位多视角保留比例场景 : 腕部 4 : 6。真机平台是 Kinova Jaco2 六自由度机械臂配平行夹爪10 Hz 笛卡尔速度控制单目索尼 AX53 相机以 640×480、30 FPS 采集运行在 Ubuntu 20.04 加一张 RTX 4090 上。四个任务覆盖拾取、放置与擦拭把橙色锅放进绿盘、把蓝色方块放到盘上、把胡萝卜放进蓝锅、擦桌子。每个任务用游戏手柄遥操作采集 100–150 条轨迹单独微调 OpenVLA-OFT评测时每任务重复30 次并随机化物体初始位姿物体完全落入目标容器记成功擦桌任务以擦除面积 80% 为准延迟取 100 次前向的平均值。LIBERO 仿真结果方法OpenVLA-OFT 7B / 并行解码平均成功率Long 成功率FLOPs加速比OpenVLA-OFT全视觉基线97.1%94.8%7.911.00×FastV(OFT)86.8%73.0%6.371.24×VLA-ADP保留率 30%94.4%84.2%5.851.35×VLA-ADP保留率 50%96.3%91.2%6.431.23×保留率 50%–70% 时平均成功率只比全视觉基线低 0.8–0.9 个百分点却已经拿到 1.13–1.23 倍加速把保留率压到 30%–40%平均成功率仍有 94.4%–94.8%加速进一步提升到 1.29–1.35 倍。Spatial 套件上 ADP 甚至拿到99.4%超过全视觉基线——这与「简单任务视觉冗余最高」的判断一致。真机结果方法Task1Task2Task3Task4平均成功率延迟 (ms)加速比OpenVLA-OFT基线83.3%93.3%86.7%80.0%85.8%76.91.00VLA-ADP90.0%90.0%90.0%83.3%88.3%51.81.49×真机上 ADP 在 Task1、Task3、Task4 上均超过基线Task2 仅低 3.3 个百分点而延迟从 76.9 ms 降到 51.8 ms。这是最值得注意的一点加速的同时成功率反而提高了 2.5 个百分点——说明按阶段剪枝不只是省算力还过滤掉了干扰注意力的冗余 patch。消融动态门控在承重动态策略SpatialObject平均成功率FLOPsADP相邻极值门控99.4%98.0%96.3%6.43去掉门控w/o D98.2%88.0%93.45%6.23去掉门控 周期切换w/o D PS95.0%81.4%89.9%4.55把门控换成固定周期切换后Object 从 98.0% 掉到 81.4%整整损失 16.6 个百分点Spatial 也掉了 4.4 个百分点——固定节奏必然会撞上精细操作阶段。相对完全去掉门控的版本ADP 只多花 0.20 个 FLOPs 就换回 2.85 个百分点的平均成功率。打分层方面第 0 层表现最好96.3%6.43 FLOPs第 1 层 95.5%6.57第 4 层 95.8%6.89——越深的层不仅更贵排序也更不稳定。为什么随机剪枝会崩随机丢弃 50% 的 token 在 Spatial 与 Goal 上还能撑住但在 Object 上只有73.0%、Long 上只有76.2%。论文给出了解释当目标物体横跨大量 patch 时随机丢弃仍有较大概率保留到关键 patch而当目标物体只占少数 patch 时随机丢弃很容易直接把关键 patch 剪掉导致物体识别错误并沿时间步累积成任务失败。图 6真机实验平台——Kinova Jaco2 六自由度机械臂配平行夹爪单目索尼 AX53 相机固定于桌前覆盖整个工作区所有观测均来自该固定视角。图 7LIBERO 四类任务的剪枝可视化——蓝色掩码标出被剪掉的视觉 token。保留的 token 持续聚焦任务相关物体验证了文本驱动剪枝的有效性在初始化、抓取、放置等关键阶段全视野被恢复体现动作感知动态策略的作用。图 8层间参与度 PR——浅层数值较高说明大量视觉 token 均衡参与、空间覆盖广随层数加深迅速下降并趋于平稳注意力塌缩到少数 token 上。图 9层间熵 H——浅层熵值高、分布平坦Top-K 选择对离群点不敏感深层分布尖锐化并拖出长尾排序容易被局部噪声左右。两张图共同给出了「用第 0 层打分」的定量依据。结果对比总结图 10结果对比FastV 用固定保留率把平均成功率压到 86.8%、Long 仅 73.0%ADP 保留率 50% 时 96.3%/1.23×保留率 30% 时 94.4%/1.35×真机做到 1.49× 且成功率 85.8%→88.3%。Mermaid 流程图关键发现训练无关即可拿到 1.35 倍加速保留率 30% 时 LIBERO 平均成功率 94.4%、FLOPs 从 7.91 降到 5.85、LLM 侧加速 1.35 倍全程没有任何权重更新。门控单独贡献 2.85 个百分点去掉动态门控后平均成功率从 96.3% 降到 93.45%而计算量只多花 0.20 FLOPs换成固定周期切换则进一步掉到 89.9%。固定节奏在精细阶段代价巨大周期切换让 Object 套件从 98.0% 掉到 81.4%−16.6 个百分点说明「什么时候剪」比「剪多少」更关键。随机剪枝在目标物体小的时候失效随机丢弃 50% 在 Object 与 Long 上只有 73.0% 与 76.2%与 ADP 的 98.0% / 91.2% 形成鲜明对照。真机同时拿到速度与成功率延迟 76.9 → 51.8 ms1.49×平均成功率 85.8% → 88.3%四个任务中三个超过基线。打分层越浅越稳第 0 层的平均成功率 96.3%、FLOPs 6.43优于第 1 层95.5%6.57与第 4 层95.8%6.89——参与度与熵的层间塌缩为这一选择提供了机制解释。从创新模式的角度看ADP 命中三条清晰的结构性套路把「剪多少」重述为由运动状态驱动的可判定规则重新表述为可解对象、以最近动作为条件变量而非重新训练通过条件化适配、先刻画静态与随机剪枝的失效边界再针对边界设计机制刻画极限然后超越。三条都落在「机制被切开验证过」这一类而不是单纯的性能数字堆叠。局限性论文自述与可观察到的边界真机平台单薄只在 Kinova Jaco2 加单目固定视角上验证没有装腕部相机因此仿真里那套「场景 : 腕部 4 : 6」的多视角配额策略在真机上并未被检验。门控依赖动作表示的具体约定轨迹距离由动作块经正运动学积分得到隐含了 $R_xR_yR_z$ 的旋转顺序与右乘组合约定换一套机器人或换一种欧拉序都需要相应调整。关键超参仍是手工设定保留率 $\rho$、冷启动窗口数、连续剪枝上限 3 都是人工设定论文没有给出自适应选取方案。任务覆盖面有限四个真机任务都是桌面拾取、放置与擦拭未涉及接触密集的插装、双臂协作或可变形物体。没有给出自回归设置的完整对照摘要提到 25.8% improvements with OpenVLA但正文的 LIBERO 主表只有 OpenVLA-OFT并行解码变体找不到与之对应的行。阅读时需要注意的表述问题摘要主张缺表支撑摘要中的 25.8% improvements with OpenVLA 在正文表格中没有对应数据行读者无法复核这个数字的来源。项目链接失效论文给出的项目页vla-adp.github.io当前返回 404且摘要里的显示文本写作 ADP.com与真实地址不一致。若干笔误摘要中 correlated with the action dynamic 应为 dynamics预备部分 inputs for actions positions 语序不当方法部分的 The remain visual tokens ... is 应为 remaining ... are仿真表格的 LaTeX 标签写作fig:SIMULATION EXPERIMENTS但被当作 table 引用。常见问题FAQADP 需要重新训练 VLA 模型吗不需要。ADP 是训练无关的推理期方法只使用已有的 query / key 投影权重做相关性打分不引入任何新的可学习参数直接插到 OpenVLA 或 OpenVLA-OFT 上即可使用。ADP 和 VLA-Cache 有什么区别VLA-Cache 复用相邻时间步之间信息量低的 token 的 key 与 value减少的是注意力计算ADP 则直接缩短进入 LLM 的输入序列长度收益由所有层共享。两者是同一课题组在同一方向上的互补工作。ADP 的判断依据为什么用末端轨迹而不是注意力分数注意力分数只反映「文本与视觉的相关性」无法表达操作的物理阶段。末端轨迹幅度是一个可直接观测的物理量搬运、接近时幅度大、冗余高抓取、对准、插入时幅度小、细节关键。用轨迹做门控等于引入了注意力之外的第二个信息源。保留率应该设成多少论文给出的经验区间是 50%–70% 优先此时平均成功率只损失 0.8–0.9 个百分点加速 1.13–1.23 倍如果更看重速度压到 30%–40% 仍有 94.4%–94.8% 的平均成功率与 1.29–1.35 倍加速。具体取值取决于任务对精细操作的敏感程度。为什么打分层选第 0 层而不是更深的层浅层注意力分布平坦、参与度高、熵高Top-K 排序对个别离群点不敏感深层注意力塌缩到少数 token、分布尖锐并拖出长尾排序容易被局部噪声左右。而且层越深需要前向的层数越多、FLOPs 越高因此第 0 层在精度与开销上同时占优。连续剪枝 3 次就强制恢复全视觉这个规则重要吗重要。它把剪枝从「可能持续累积误差」的操作变成有界的时序决策与两窗冷启动一起构成安全边界。消融显示去掉门控等价于丧失阶段自适应能力会直接损失 2.85 个百分点说明这类保护与门控本身共同承担了稳定性。参考链接论文 arXiv 摘要页https://arxiv.org/abs/2509.22093论文 HTML 全文arXivhttps://arxiv.org/html/2509.22093v1项目网站论文标注为https://vla-adp.github.io/当前返回 404暂不可访问OpenVLA-OFT本文主线基线https://arxiv.org/abs/2502.19645FastV最接近的免训练剪枝基线ECCV 2024https://arxiv.org/abs/2403.06764VLA-Cache同课题组跨步复用方案https://arxiv.org/abs/2502.02175LIBERO 评测基准NeurIPS 2023https://arxiv.org/abs/2306.03310给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件