【NeurIPS 2025】SAFE:面向视觉-语言-动作模型的多任务失败检测|从机器人安全部署视角

【NeurIPS 2025】SAFE:面向视觉-语言-动作模型的多任务失败检测|从机器人安全部署视角 摘要本文解读 NeurIPS 2025 论文《SAFE: Multitask Failure Detection for Vision-Language-Action Models》。该论文提出多任务失败检测这一新设定并给出SAFE只读视觉-语言-动作模型VLA最后一层的内部特征回归一个失败分数再用功能共形预测把它校准成带概率保证的告警阈值。其特别之处在于检测器与策略解耦——不改 VLA 权重、不做微调训练只需要已见任务的 rollout 级成败标签却能在未见任务上零样本工作。实验表明 SAFE 在 LIBERO、SimplerEnv 与两台真机上平均把未见任务的 ROC-AUC 提升 4–5 个百分点而附加推理时间仅 0.73 ms不到 VLA 推理时间的 1%为通用机器人策略的安全部署提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机研究主线从问题到结论基准/方法设计分类全景方法细节实验设计与结果结果对比总结关键发现局限性常见问题FAQSAFE 需要修改或微调 VLA 模型本身吗为什么不用 token 级不确定性做失败检测多任务失败检测和 OOD 检测有什么区别共形预测在这里起了什么作用SAFE 的实时性如何SAFE 在真机上表现如何参考链接论文基本信息项目内容标题英文SAFE: Multitask Failure Detection for Vision-Language-Action Models标题中文SAFE面向视觉-语言-动作模型的多任务失败检测作者Qiao Gu, Yuanliang Ju, Shengxiang Sun, Igor Gilitschenski, Haruki Nishimura, Masha Itkina, Florian Shkurti机构University of Toronto · UofT Robotics Institute · Vector Institute · Toyota Research Institute会议NeurIPS 2025arXivarXiv:2506.09937项目网站vla-safe.github.io背景与动机通用机器人策略正在改变操作任务的开发方式以 OpenVLA、π0、π0-FAST 为代表的 VLA 模型直接用语言指令驱动机器人在训练过的任务上成功率可以到 80–90%。但一旦换成没见过的任务与陌生环境这些策略的表现会掉到 30–60%而且失败的方式五花八门——抓歪、卡死、把物体掉了、动作抖动失稳。要让机器人在真实世界里安全运行系统必须在失败真正造成损失之前就知道我正在失败然后停下来、回退一步或者请人接管。问题在于已有的失败检测方法几乎都建立在一个任务一个检测器的假设上。FAIL-Detect 这一类工作系统评测了各种失败检测方法并给出了 LogpZO用流匹配建模观测嵌入分布等强基线但评测对象都是单任务策略针对多任务与陌生环境这类方法需要为每个新任务重新采集 rollout、重新训练与校准对通用策略而言成本无法接受。另一条路线尝试做任务无关的检测STAC 通过比较相邻两次推理预测出的动作块的一致性来判断策略是否还在正常推进效果不错但需要采样多个动作——论文实测中它用了 256 个样本对算力本就吃紧的大模型策略意味着显著的实时开销还有一些方法选择查询额外的大视觉语言模型来做判断同样难以满足控制频率要求。现成的不确定性量化UQ工具也不能直接搬来用。token 级不确定性与采样一致性是 LLM 幻觉检测的常用手段但机器人失败不等于模型没信心——策略完全可能非常自信地做错。基于 OOD 检测的方法则假设偏离成功分布即为失败这在通用策略上并不成立新任务本身就偏离训练分布但新任务并不等于失败。因此本文要回答的问题是能否训练一个检测器只在已见任务上学习却能对未见任务做出既准确又及时的失败判断并且附加开销小到可以忽略作者给出的答案是 SAFEScAlable Failure Estimation其出发点是一个被测量出来的经验事实VLA 的内部特征空间里失败的轨迹会聚进同一片区域而且这片区域跨越任务与指令——失败检测所需要的知识策略自己已经编码好了。研究主线从问题到结论基准/方法设计SAFE 的设计起点不是模型结构而是一次可视化实验。作者把 π0-FAST 在 LIBERO-10 上执行时的内部特征做 t-SNE 降维发现失败的轨迹会落入同一片区域论文称之为 failure zone并且这片区域跨任务、跨指令、跨环境保持一致更关键的是特征随时间的移动反映了任务的推进正常执行时停在区域外一旦抓取失败或物体掉落特征就走进区域。基于这个观察SAFE 只做三件事抽取特征、回归分数、校准阈值。特征来自 VLA 最后一层在解码成 token logits 或速度场之前的隐状态再沿 token、动作块长度、流匹配步等维度聚合成一个定长向量分数由一到两层的 MLP 或 LSTM 输出阈值由功能共形预测在校准集上给出。整套流程不需要访问 VLA 的损失函数也不需要修改任何权重——只要策略是白盒的、能读到内部特征即可。分类全景把论文对比的方法按信号从哪里来排开可以看出 SAFE 的位置它既不像 token 不确定性那样只读单次前向的概率分布也不像采样一致性那样依赖多次采样更不像嵌入距离那样只看几何量而是把 VLA 内部特征当作监督学习对象用学到的判别结构替代手工度量。方法细节SAFE 由三个组件构成。特征提取负责把 VLA 的内部张量压成定长向量对 OpenVLA 与 π0-FAST特征是最后一个 transformer block 在解码成 token logits 之前的隐状态token 数就是聚合维度π0-FAST 还额外对比了最终 RMS 归一化层之前encoded与之后pre-logits取特征的差别。对用流匹配输出连续动作的 π0 与 π0∗特征是三维张量需要沿动作块长度与流匹配步两个维度分别聚合。所有聚合方式都按已见任务验证集的表现挑选。分数回归刻意做得极小MLP 只有两层、隐维 256对每个时刻独立打分再累加因此分数范围落在 $0 s_t t$LSTM 只有一层、隐维 256把整条特征序列映射成归一化概率。两者的训练目标对应各自的输出形式——MLP 用 L1 损失把失败轨迹的分数推高到接近 $t$、把成功轨迹压到接近 $0$LSTM 用逐时刻二元交叉熵。由于成功与失败 rollout 数量不均衡损失按类别频率的倒数加权并附加 L2 权重正则。阈值校准是方法里最讲究的一步。功能共形预测构造一条时变预测带 $C_\alpha$单边形式取 $\mathrm{upper}_t \mu_t h_t$其中 $\mu_t$ 是时变均值、$h_t$ 是带宽校准只在成功轨迹上进行。在可交换性假设下任意一条新的成功轨迹其分数在全部时刻都落在带内的概率至少是 $1-\alpha$因此把阈值取为 $\delta_t \mathrm{upper}_t$成功轨迹上的误报率就被限制在 $\alpha$ 以内。相比固定阈值时变带宽能跟随分数随时间的自然增长避免跑得久就被判失败的伪告警。换句话说SAFE 把阈值该取多少翻译成误报率允许是多少让安全阈值成为可配置、可辩护的工程参数。实验设计与结果实验覆盖四个基准、三类 VLA、仿真与真机。LIBERO-10 是仿真里最难的十任务长程套件OpenVLA、π0、π0-FAST 都采用官方权重随机留 3 个任务作未见任务SimplerEnv 上评测 π0 的复现版本 π0∗在 Google Robot 与 WidowX 两个 embodiment 上分别训练与评测每个任务 100 条 rollout真机上π0-FAST 的 DROID 检查点直接部署在 Franka Emika Panda 上覆盖 13 个任务、每任务 30 条成功与 30 条失败另外还用 OpenVLA 在 WidowX 上采集 8 个任务共 532 条 rollout244 成功 / 288 失败。评测分两类以 max-so-far 分数的 ROC-AUC 衡量排序能力以及由共形预测阈值给出的 TPR、FPR、平衡准确率与平均检测时刻T-det。所有指标都在多个随机种子、不同见/未见任务划分下取平均。论文还特别处理了一个评测陷阱LIBERO 的失败 rollout 总是跑满最大步数若不干预检测器只要学会数时间步就能拿高分因此评测统一截断到每个任务的最短 rollout 长度。基准任务数见/未见训练 rollout未见任务评测 rolloutLIBERO3 个 VLA7 / 3210150π0∗ SimplerEnvGoogle Robot2 / 2198100π0∗ SimplerEnvWidowX2 / 2198100真机 Franka10 / 3450180真机 WidowX6 / 2250149仿真基准上未见任务的 ROC-AUC 主表如下数值取自论文 Table 1− 表示方法在该设置下不适用方法未见任务 ROC-AUCOpenVLAπ0-FASTπ0π0∗Token max prob.53.869.4−−Cosine dist. k-NN69.584.670.371.3LogpZOFAIL-Detect 最佳52.983.173.274.7STAC需多次采样−85.347.962.2SAFE-LSTM72.584.571.180.1SAFE-MLP73.580.473.384.8真机上是同样的排序SAFE-MLP 在 π0-FAST Franka 与 OpenVLA WidowX 两套实验里都拿到最好的成绩WidowX 未见任务上比马氏距离基线高 18.4 个百分点。方法真机 ROC-AUCFranka 见Franka 未见WidowX 见WidowX 未见Max prob.53.748.650.854.3Mahalanobis dist.75.553.982.470.0Euclid. k-NN80.460.372.053.6LogpZO64.452.262.951.3SAFE-LSTM77.358.784.371.8SAFE-MLP86.864.289.188.4补充的消融实验给出两条结论其一训练任务数越多未见任务表现越好——在 OpenVLA LIBERO 上SAFE-MLP 用 1 个任务训练时未见任务 ROC-AUC 为 63.8用 3 个任务为 67.05 个任务为 68.27 个任务升到 73.5其二起作用的必须是 VLA 自己的特征把末层特征换成 DINOv2、CLIP 或两者拼接后真机上的表现明显下降例如 MLP 未见任务从 64.2 掉到 59.5 以下。结果对比总结关键发现失败检测的知识已经在策略内部把 π0-FAST 的内部特征做无监督 t-SNE 就能看到跨任务共享的 failure zone说明成败信息不需要额外的大模型来提供。token 不确定性几乎无效在 OpenVLA 上 token 最大概率的未见任务 ROC-AUC 只有 53.8接近随机采样一致性类方法虽有提升但需要多次采样对实时控制不友好。嵌入距离强但不最优余弦距离 k-NN 在 π0-FAST 上达到 84.6是 SAFE 之外最强的基线但它只是几何量缺少学到的判别结构换到别的 VLA 就掉到 70 上下。零样本跨任务才是关键指标在四个仿真基准上SAFE 系方法在未见任务上平均比最佳基线高 4–5 个百分点并保持已见任务的最好或并列最好表现。告警往往早于人类判断与人工标注的需要接管时刻相比SAFE-MLP 常常更早报警在 π0-FAST LIBERO 上40% 的失败在 rollout 的第一个时刻就被预测出来。开销可以忽略SAFE-LSTM 只有 230 万参数、附加推理 0.73 ms而 π0 本体是 33 亿参数、单次推理 149 ms——检测成本不到策略的 1%。局限性只覆盖操作任务论文只讨论机械臂操作的多任务失败检测跨 embodiment、sim2real 以及无动作视频的泛化能力尚不清楚。只用了最后一层特征如何融合多层特征仍是开放问题而且不同模型的最佳层可能不同需要逐模型搜索通用性有待验证。仍然需要成败数据训练检测器必须先部署策略并采集成功与失败 rollout冷启动阶段拿不到检测能力这是代价前置。真机上的分离度有限π0-FAST Franka 的特征在 t-SNE 上看不出明显分离未见任务 ROC-AUC 上限只有 64.2说明真机失败的语义比仿真更分散。共形预测的假设并不严格成立校准集与测试集来自不同任务分布可交换性只是近似论文也观察到部分基准的 TNR 偏离 1−α 这条理论线。常见问题FAQSAFE 需要修改或微调 VLA 模型本身吗不需要。SAFE 只读取 VLA 最后一层在解码成 token logits 或速度场之前的内部特征不改权重、不做微调因此对任何白盒神经策略都适用它新增的只是一个 230 万参数的小网络。为什么不用 token 级不确定性做失败检测因为不确定性衡量的是策略对自己输出的信心而失败与信心并不同步策略完全可能非常自信地做出错误动作。论文实验中 token 不确定性方法在最差的设置上 ROC-AUC 只有 53.8接近随机。多任务失败检测和 OOD 检测有什么区别OOD 检测把偏离成功分布当作失败信号但通用策略在未见任务上本身就偏离训练分布却不一定失败。SAFE 直接从成功与失败 rollout 中学习失败的判别特征属于有监督失败检测而不是用 OOD 分数代理失败。共形预测在这里起了什么作用它把阈值选择变成一个带统计保证的问题校准只在成功轨迹上进行给定显著性水平 α新成功轨迹的分数以 1−α 的概率始终不越界于是成功轨迹上的误报率被控制在 α 以内。SAFE 的实时性如何可以忽略SAFE-LSTM 附加推理时间 0.73 ms相对 π033 亿参数、149 ms/次推理不到 1%相比之下STAC 需要采样 256 个动作论文实测 π0 生成 10 个动作样本就比 1 个慢 152%。SAFE 在真机上表现如何π0-FAST Franka 与 OpenVLA WidowX 两套真机实验中SAFE-MLP 在已见与未见任务上都拿到最好的 ROC-AUCWidowX 未见任务比马氏距离高 18.4 个百分点但真机整体上限不高Franka 未见任务最高 64.2说明真机失败语义更分散。参考链接论文 arXiv 摘要页arXiv:2506.09937 — SAFE: Multitask Failure Detection for Vision-Language-Action Models项目网站含视频与代码vla-safe.github.ioSTAC 基线动作一致性运行时监控Unpacking Failure Modes of Generative PoliciesOpenVLAarxiv.org/abs/2406.09246π0arxiv.org/abs/2410.24164π0-FASTarxiv.org/abs/2501.09747评测基准 LIBEROarxiv.org/abs/2306.03310SimplerEnvarxiv.org/abs/2405.05941给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件