AffordVLA:通过隐特征对齐将Affordance表征注入视觉-语言-动作(VLA)模型 📅 发布时间:2026/9/15 8:41:49 👁 浏览次数: 26年5月来自浙大和杭州Torch Kernel 公司的论文“AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment”。核心思想可以用一句话概括:不在推理阶段显式告诉 VLA“应该抓哪里”,而是在训练阶段用一个 Affordance Teacher 教会 VLA 自己形成“应该抓哪里/作用在哪里”的内部视觉表征。这是这篇工作的价值所在。1. 论文到底解决什么问题?传统 VLA 的基本形式是:(Image, Language, Robot State) → Action例如:“Use the knife to cut the banana.”VLA 能够知道:这是 knife;这是 banana;任务是 cut;但这并不意味着它真正理解:knife 的 handle 是应该 grasp 的地方,而 blade 是应该接触 banana 的地方。当前 VLA 的一个关键弱点在于:VLM 预训练主要学习的是global semantics / object appearance,因此视觉注意力容易散布在整个物体甚至背景,而机器人操作真正需要的是 task-conditioned functional interaction region。这实际上是:Object Recognition ≠ Manipulation Understanding比如看到锅:“这是 skillet”不等于:“为了拿起 skillet,应该抓 handle”\text{“为了拿起 skillet,应该抓 handle”论文 Fig.1 就是在表达这个问题:普通 VLA 的视觉注意力较为 diffuse,而 AffordVLA 希望把注意力集中到 task-relevant functional region。这也是作者引入 Affordance(可供性/功能可供性) 的原因。2. 什么是这里的 Affordance?这篇论文里的 affordance 最好不要简单理解为“物体功能”。它实际上是:在给定任务条件下,物体上与当前动作相关的功能性交互区域。也就是:A=f(I,L)其中:I:图像L:任务语言A:task-conditioned affordance同一个物体由于任务不同,affordance 可以不同。例如 hammer:“pick up the hammer” → handle“strike the nail” → hammer head/handle 的任务相关结构因此它不是简单的 segmentation:Image→ObjectMaskImage \rightarrow Object\ Mask而更接近:(Image,Task) → FunctionalInteractionRepresentation(Image,Task)作者特别强调,机器人中的 affordance 是 task-relevant functional interaction regions。3. 为什么不直接把 Affordance Mask 输入 VLA?这恰恰是论文比较有意思的地方。最直接的方案其实是:RGB → AffordanceDetector → Mask → VLA → Action但是作者认为这种 Explicit Affordance Injection 有三个问题:需要大量 affordance annotation;inference 时依赖额外 detector,前级错误会传播到 VLA;detector 增加推理延迟。论文的实验很好地说明了第 3 点:所以作者的思路不是:“让 VLA 每次推理都调用一个 affordance detector