前言
长时域机器人操作不仅要求机器人能够可靠地执行单个技能,还要求其在长时间任务中将这些技能连贯地串联起来。大多数分层视觉-语言-动作(VLA)模型在一次前向传播中就做出每一个此类决策,从而缺乏一种在遇到困难或高风险选择时分配额外计算资源的机制
本文要介绍的 τ0-VLA,是一种分层机器人基础模型,将高层子任务的生成通过世界模型引导的测试时计算,表述为一个计算可扩展的推理问题(为方便大家更好的理解,我画了个架构图,可能 很多 你还看不明白,没事 看完下文 就了然了)
- 在每个推理步中,高层策略利用执行记忆生成一个子任务,并在需要时在多个候选方案之间进行搜索
- 然后,一个低层策略会在多种机器人形态上执行所生成的子任务
第一部分 τ0-VLA: a Hierarchical Robot Foundation Modelwith World-Model-Guided Test-Time Computation
1.1 引言、相关工作、预备知识
1.1.1 引言
如原论文所述,视觉-语言-动作(Vision-Language-Action,VLA)模型通过将预训练视觉-语言模型的语义表示与连续动作生成相结合,为长时程机器人控制提供了一种自然的基础 [5, 43, 19, 28, 3, 32]
- 分层 VLA 进一步将子任务作为显式接口暴露出来,用于分解和执行多阶段行为 [18, 2, 35, 27, 13, 14, 32, 33]
许多分层系统在做每一次高层决策时仍然使用固定的推理预算,直接将当前观测和执行历史映射为下一个子任务
在这一设定下,模型既不会比较备选子任务,也不会通过这些子任务预期产生的物理状态来对其进行评估
包括有的世界模型 不会针对未来视觉状态 做多种推演,也就不涉及到对多种预演进行打分/评估,从而选择最好的一种预演 - 近期的一些系统改为使用高层树搜索或递归子目标细化 [30, 40, 42],这引出了作者在此研究的问题:如何在一个通用的真实机器人分层体系中,将开放式的语言-子任务搜索与视觉结果预测和执行记忆相耦合
在缺乏执行前评估的情况下,错误决策通常只会在执行已经改变环境之后才被发现,此时虽然可以通过重新规划进行响应,但无法挽回先前错误承诺所带来的代价
因此,在长时程执行中,核心瓶颈不再是是否具备分层动作接口,而是用于生成下一个子任务的推理过程
作者将“生成下一个子任务”重新表述为一个推理时(inference-time)的推理问题,从而使计算量能够随每个决策的难度而扩展,正如测试时(test-time)计算在语言模型中所体现的那样 [29, 9]
子任务是进行这种推理的自然单元。动作级搜索可以解决局部控制上的歧义,但往往只暴露出局部的物理后果[26, 20, 8, 38, 15, 41]。仅依赖语言的推理可以在更长的时间尺度上运作,但它是在未将候选方案与其所产生的物理状态相联系的情况下进行比较
子任务处于这两种极端之间:
- 一方面,它们足够稀疏,从而值得投入额外计算;
- 另一方面,它们又在时间上具有足够的延展性,可以在环境中引发有意义且可区分的变化
因此,在执行之前比较候选子任务,需要预测每个候选子任务会产生的状态。对未来观测的生成式建模恰好提供了这一能力 [10, 4,11, 12, 24],使得我们可以在下发执行之前,通过子任务预期的物理后果来评价这些候选子任务
对此,来自的研究者提出了τ0 -VLA,这是一种层次化的VLA 系统,实现了这种方法。在每个推理步骤中,一个带有记忆增强的高层策略利用当前观测和执行记忆来生成合适的子任务
即如上图所示,高层策略在测试时利用由世界模型引导的计算,对子任务序列进行搜索
- 在每一步扩展中,先后执行:P W V,一个 VLM 提出候选子任务,世界模型预测这些子任务的视觉结果,价值模型则对由此产生的任务进度进行评估
- 束搜索保留有前景的分支,随后一个反思模型基于保留下来的候选子任务及其预测后果,决策并执行下一个子任务
图中展示的是在 N = 3 情况下的单次候选扩展;为了简洁起见,省略了深度为 D 的递归束扩展
- 其paper地址为:τ0-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation
- 其项目地址为:tau0-vla.github.io
其GitHub地址为:github.com/sii-research/tau-0-vla
具体而言
- 当高层策略足够自信时,直接采用其生成的子任务提案;否则,由 token 级置信度统计触发额外的推理过程
该过程遵循“提案–预测–评估”的循环:提案模型生成开放式的候选子任务;
世界模型预测每个候选子任务所诱导的终止观测;
价值模型根据这些预测结果对候选质量进行评分
通过束搜索递归扩展有前景的候选,使推理预算可以通过分支因子、束宽和搜索深度进行扩展
随后,一个反思模型在保留的搜索分支上进行条件生成,产出最终子任务
该输出可以与某个提案重合,但并不局限于候选集合
本体层策略随后执行生成的子任务
————
由此产生的真实观测会在下一次推理步骤被写入执行记忆,从而闭合预测后果与实际后果之间的循环 - 为支持在长时执行过程中进行可靠推理,作者训练记忆机制去修正其自身状态
具体而言,作者对来自现有演示的记忆进行扰动,并训练高层策略去修复那些落后于、超前于或以其他方式错误反映机器人真实进度的记录,而这一过程无需任何额外标注
一旦子任务被生成,每个子任务都由一个通用的低层策略来执行,该策略将预训练的视觉-语言主干网络与一个由多个 Transformer 动作专家组成的混合模型(Mixture-of-Transformers)相结合
该策略在一个统一的 40 维状态与动作空间上运行,覆盖末端执行器、机械臂关节、夹爪、腰部以及移动底座。借助这种统一表示,单一模型即可在多种机器人形态上支持固定基座操作、双臂协同以及移动全身控制。作者在大约 40,000 小时、来源异构的机器人数据上对该策略进行训练,并结合多模态协同训练数据,从而获得一个以语言为条件的执行接口,而无需为各个子任务设计专用控制器
且作者宣称,他们的实验证明了分层(高层决策-低层执行)的测试时推理大幅提升了任务成功率,并提高了下一子任务预测的准确率
1.1.2 相关工作
τ0-VLA 融合了三条研究路线:
- 用于低层次控制的通用 VLA 模型
- 用于子任务级决策的分层机器人策略
- 以及在测试时进行计算以评估候选决策的世界模型
首先,对于视觉-语言-动作模型
视觉-语言-动作(Vision-Language-Action, VLA)模型将视觉观测和语言指令映射为机器人动作,通常通过对预训练的视觉-语言主干网络进行适配来实现连续控制
- 早期工作建立了可扩展的、由语言条件化的机器人学习框架,并实现了从视觉-语言预训练到机器人控制的迁移 [5, 43]
后续研究将这一范式拓展到更丰富的任务和不同形态的机器人平台 [19, 28];而最新的一些通用模型则以连续控制、开放世界泛化以及跨形态迁移为目标 [3, 32, 27, 39, 1, 14] - 与之互补的工作则研究了紧凑而高效的部署方案 [36]
跨形态策略还必须调和异构的控制接口
RDT-1B 提出了一个具有物理可解释性的统一动作空间
而Being-H0.5 则将异构控制映射到语义对齐的槽位中[22, 25]
这一系列工作主要在改进控制表示、训练规模,以及在任务和机器人形态之间的迁移能力。作者的低层策略遵循相同的通用 VLA 范式。而作者的主要关注点是互补的:将高层子任务生成显式化,并将其设定为一个可按算力扩展的推理问题
其次,对于分层机器人策略
分层策略将时间跨度较长的决策与连续控制相分离
- 先前的工作将语言模型的决策与学习到的机器人可供性相结合 [18],通过语言来表示动作层级结构 [2],并通过显式指令、潜在表征或分阶段推理,将较慢的语义推理与较快的视觉—运动控制连接起来 [35, 13, 27, 14, 32]
- 最新的系统更明确地处理长时间跨度的状态跟踪和适应性问题
MemER在为低层 VLA 生成指令之前,先检索与任务相关的历史关键帧(相当于回顾历史)
而 Goal2Skill 则在高层 VLM 与低层 VLA的层级结构中,结合了结构化记忆、结果验证与反思机制 [37, 23]
Anticipation-VLA 自适应地递归生成子目标
而 VISTA 则使用世界模型作为高层策略来生成文本和视觉形式的子目标序列 [42, 24] - 在通用分层基础模型中,π0.7 也将语义高层策略、世界模型和低层策略耦合在一起 [33]。其世界模型会为高层策略已经生成的子任务生成子目标图像
在τ0-VLA 中,则是在承诺执行之前进行视觉预测,并通过价值引导的搜索和反思来支持在多个候选子任务之间进行比较。因此,在 π0.7 中,视觉预测决定了已生成子任务将如何被执行,而在 τ0-VLA 中,视觉预测则用于决定应执行哪一个子任务。我们的高层策略同样维持了一种可纠正的执行机制
- τ₀-WM 管"动作级靠谱"(RCS/LAR 修低层动作)
- τ₀-VLA 管"决策级靠谱"(beam search 修高层子任务)
理论上可以套娃:τ₀-VLA 的高层+τ₀-WM 作低层
最后,对于世界模型与测试时计算
世界模型在候选行为下预测未来状态,从而支持规划与策略学习 [16, 17]
- 在机器人操作中,生成的图像或视频已被用作逆动力学和低层控制的目标[10, 4],与动作进行联合建模 [7, 6],并被纳入搜索或迭代式计划修正中 [11]
Reflective Planning 使用想象的未来状态迭代地修订 VLM 规划 [12]
与之不同,τ0-VLA的搜索方法维护多条语言子任务分支,并在进行反思式生成之前,通过专门的价值模型对其进行剪枝
在动作层面,会通过采样、验证或价值引导的选择来分配额外推理预算 [26, 20, 8] - FOREWARN 预测低层动作计划的潜在结果,并使用VLM 在这些结果中进行选择;而 VLA-Reasoner 则在动作轨迹上执行由世界模型引导的蒙特卡洛树搜索 [38, 15]
WLA-0 联合预测文本子任务、未来图像和动作,并在测试时的扩展模式中,利用想象的未来帧和价值模型在动作块之间进行选择 [41] - 搜索也被应用于高层级的机器人决策。VINE 在二维场景图上提出子目标转换,从成功与失败的演示中预测其成功概率,并在执行前剪枝可行性较低的分支 [30]
Seeing Farther and Smarter 结合了预测视觉动力学、价值引导的束搜索、基于置信度的路由,以及对操作规划的多路径反思 [40]
这些方法是与τ0-VLA工作最为接近的基于搜索的机制之一
VINE 使用可行性评分在结构化场景图转换上进行搜索,而 Seeing Farther and Smarter 则在离散操作规划上通过一个学习到的评估器进行搜索
相比之下,τ0-VLA 搜索开放式的语言子任务,并通过其预测的终止图像来评估每个候选方案。它在可纠正的执行记忆上对后续决策进行条件建模,然后使用一个反思模型,从保留的分支中生成最终子任务
1.1.3 预备知识
考虑由语言指令ℓ指定的机器人任务。在推理步骤时
- 一个视觉-语言-行动(VLA)策略将当前的多视角观测
- 本体感受状态
- 以及语言指令
映射为一个H 步的动作片段 - 它还接收文本形式的控制元数据
,用于指定具身形式、控制模式以及全身配置
其具体的文本序列化形式在附录C-B 中给出:
其中θ 表示策略参数,H 是动作块的时间范围。在直接执行中,完整的任务指令在整个过程中都被使用,因此。因此,策略必须在生成相应的运动动作时推断任务的当前阶段
分层VLA 将高层子任务生成与低层动作生成分离。在每个推理步骤中,高层策略首先生成一个子任务,然后低层策略在其条件下生成动作
- 令µ 表示高层策略,令
表示初始的空执行记忆,并令
。在推理步骤
,
形成高层决策上下文
其中是被保留的执行记忆,
是前一个推理步骤生成的子任务
- 该策略将执行记忆更新至最新状态,并为当前观测生成子任务:
这里总结了截至
为止所观察到的执行历史,因此尚未包含执行
的结果,而
是为当前观测生成的子任务
- 生成的子任务被用作语言指令,
,从而得到
在执行完动作块之后,得到的真实观测会在下一次推理步骤中使用。在每一次推理步骤中,低层策略都会以生成的子任务为条件进行决策
- 如果它保持与
相同,则继续执行当前子任务
- 如果发生变化,低层策略则开始执行新生成的子任务
1.2 τ0-VLA的完整方法论
如原论文所述,τ0-VLA 在每一个逻辑推理步骤中顺序应用两个组件
- 高层策略负责维护执行记忆、决定何时调用额外的测试时(test-time)计算,并生成当前的子任务
- 低层策略则将当前观测和生成的子任务映射为机器人动作
这样的分层结构在不修改底层控制接口的前提下,支持长时间跨度的进度跟踪以及具备后果意识的规划。图 2 给出了整体概览
- a) 在高层推理步骤
,proposal 模型
以最新的多视角观测
、任务指令
、继承的执行记忆
,以及先前生成的子任务
作为条件
它生成与观测对齐的记忆和一个直接 proposal
- b)低层策略以生成的子任务
、多视角观测
、本体感受状态
,以及文本控制元数据
作为条件
一个视觉-语言骨干网络和Mixture-of-Transformers(MoT)动作专家通过条件流匹配,从一个带噪声的动作片段生成在时间范围内的动作片段
- c)在 TTC 路线上
针对每个被保留的分支,提案模型被调用 N 次以生成 N 个候选方案
给定该分支的head-camera图像和某个候选方案,世界模型预测其终止时刻的head-camera图像
而价值模型在条件化任务指令、候选方案以及预测图像的基础上,为该候选方案分配一个质量评分
Beam search(束搜索)根据累计得分在全局范围内保留得分最高的 B 个分支,并将其递归扩展到深度 D
图中示例展示了在 N = 3 且 B = 2 时的根节点扩展情形,此时局部得分与累计得分相同。为便于说明,省略了更深层次的扩展
随后,反思模型在条件化和最终的分支摘要
的基础上生成最终子任务
该输出可能与某个被保留的提案相一致,但并不局限于保留集合中的提案,并会被传递给低层策略以执行
接下来的小节将分别定义这两类策略,并描述它们的联合推理过程
1.2.1 高层策略
与传统的固定计算量高层策略不同,后者通过一次前向传播就对一个子任务作出承诺,这里的高层策略 µ 通过在测试时采用预算自适应的计算(TTC,test-timecomputation)过程来生成下一个子任务
在预测存在不确定性时,TTC 会在可能的子任务序列上执行由世界模型引导的束搜索。它会扩展候选分支,预测并打分其视觉结果,并将保留的 beam 传递给一个反思模型,该模型生成最终子任务。该过程通过在测试时分配额外的计算量,使策略能够改进对下一子任务的预测
相应地,高层策略由提案模型 P、世界模型W、价值模型 V 以及反思模型 F 组成。它们的推理接口定义如下
第一,对于提案模型
在推理的第步开始时,提案模型接收上节中定义的上下文
(即
),更新执行记忆,并生成一个直接子任务提案
:
提案模型从、先前生成的子任务
以及当前观测
中更新记忆。通过同一次前向传播产生的token 置信度,自适应路由器计算
。其中
选择快速路径
- 而
调用TTC
路由规则在附录C-J 中定义
第二,对于世界模型和值模型
对于束搜索中的一个通用候选项,令表示头戴相机的RGB 图像,
表示候选子任务
- 世界模型预测终止时的头戴相机图像
- 而价值模型对该结果进行评分
因此,世界模型始终基于单个前置摄像头图像运行。价值模型接收全局任务指令、候选子任务
,以及预测的终止图像
,并返回一个标量的候选质量
第三,对于测试时搜索
当时,高层策略调用算法1 中的SEARCH 操作:
该操作在候选子任务序列上执行束搜索。正整数N, B 和D 分别表示分支因子、束宽和搜索深度
一个分支b 存储
- 一个提议上下文
,即proposal context(提议上下文,给提议模型看的输入)
- 一个有序的想象子任务序列
,即这条分支已想象的子任务序列(有序路径)
- 一个累积分数
以及
- 对于非根分支
一个终止预测图像,即仅非根分支有:该分支末端被想象出的头相机图像
- 然后用一个单一的
根分支b root 初始化其上下文为
,即当前真实的多视角观测
+ 任务指令 + 执行记忆 + 上一步子任务
其路径为空序列
其得分为
ps,因为立足真实观测,不需要世界模型预测图像,所以没有
我帮大家解释下,这里的
根分支是"机器人当前的真实处境",非根分支是"世界模型想象出来的假设未来"
根分支
非根分支
视觉输入
当前真实观测
世界模型想象图像
子任务路径
空
已累积的想象子任务序列
初始得分
0
沿路径累计的价值模型打分
数量
每步搜索只有 1 个
展开产生,由 beam width
截断保留 top-
在每一层深度,对每个保留的分支
独立地调用提议模型 N 次:
这里表示提议模型的解码分布。样本索引
保持重复的文本提议彼此区分,并将每个提议与其分支局部记忆关联起来
- 对于根分支,
,因此提议模型接收当前多视角观测
- 对于每一个非根分支,
的视觉部分是
——世界模型想象图像,即为该分支想象的终端头摄像机图像。搜索过程中来自提议调用的路由决策被忽略
进一步,作者将记作通过将子任务
附加到分支
而得到的子分支。它的路径
是有序序列
后接
。如此,当有了子分支之后,可令
为当b = b root时在
中的头部摄像机图像,否则为
——世界模型想象图像。对于每个带索引的proposal,世界模型和值模型计算
子节点保留相应的记忆和预测图像。其累积得分和用于下一次扩展的上下文为
且在搜索中产生的所有记忆都是分支局部的,并且从不会覆盖持久执行记忆
在深度 d 处,所有子节点的索引集合为
在剪枝之前,包含N 个子节点,而之后的每次扩展最多产生
个子节点。top-B 操作根据累积得分对所有子节点进行全局排序。每个被保留子节点的预测图像和分支本地记忆共同定义其下一次扩展的上下文。该过程重复进行直到深度D
最终的 beam 由已建立索引的集合汇总得出
其中是设想的子任务路径,
是其终端预测的头戴相机图像
第四,对于反思模型
在推理步骤t 的TTC 路径末端,反思模型以保留的分支摘要和与观测对齐的真实上下文
为条件。它生成传递给低层策略的最终子任务:
其输出可能复现某个已保留的提案,但并不局限于候选集合。反思模型不会更新持久执行内存
1.2.2 低层策略
低层策略将视觉-语言骨干网络与一个 Mixture-of-Transformers(MoT)动作专家耦合在一起。在每一层全注意力层中,动作 token 与骨干网络 token 通过联合注意力进行交互,同时分别由参数独立的Transformer 分支进行处理
该策略在多视角观测、本体感受状态以及语言指令的条件下工作。动作专家通过条件流匹配(conditional flow matching)进行训练,从噪声到动作块分布学习一个速度场
在推理阶段,通过对该速度场进行积分来生成可执行动作
- 统一的状态与动作空间
作者在一个共享的40 维状态与动作空间中表示异构的具身形式。对每个样本的状态和动作使用掩码来选择有效通道,而控制元数据则给出控制参数化的具体形式
通过这一接口,同一个策略即可同时支持定座(fixed-base)控制和全身(whole-body)控制,而无需具身形式特定的输出头
完整的布局和动作编码见附录 C-B - 掩码流匹配
由于不同具身形式在统一动作空间中占据的通道不同,作者对流路径及其训练目标都施加掩码
设表示动作维度
为对角动作掩码矩阵
其中当通道 i 处于激活状态时,,否则
对动作块中的每一个动作向量都使用相同的矩阵
对每个,令
其中为
维单位矩阵
且作者采用 π_0[3] 中线性流路径的反时间参数化方式,与本文评估的任务特定checkpoint 保持一致
一个流时间在整个动作块中共享,其中
表示噪声,
表示干净动作
插值后的动作和目标速度为
给定完整的含噪声块,动作专家联合预测所有H 动作标记的速度。作者仅监督激活的通道,并在每次速度场评估之前以及在最终输出时投影未激活的通道。附录C-B 提供了完整的损失和采样细节
1.2.3 系统推理
在推理时,高层策略和低层策略形成一个闭环。在每个逻辑推理步骤中,proposal 模型更新执行记忆并生成
- 当
时,这个直接proposal 成为最终子任务
- 当
时,测试时搜索产生
,并且反思模型从与观测对齐的上下文和保留的分支总结中生成
然后低层策略在以为条件的情况下生成并执行一个动作块。由此产生的真实观测会在下一个推理步骤被纳入记忆中
算法 1 以顺序化过程的形式给出了这些逻辑依赖关系。在部署时,高层策略和低层策略以异步方式进行流水线处理,更多细节见附录 C-F
且跨不同任务使用相同的路由统计量,并在留出数据上为各任务校准特定阈值。在直接执行模式下,系统绕过高层策略,直接以作为条件输入低层策略
为方便大家更好的理解,我还是再逐行解读下
class Tau0VLAAgent: def __init__(self, models, config): self.P = models.proposal_model # 高层提案与记忆模型 self.W = models.world_model # 视觉世界模型 self.V = models.value_model # 视觉价值评估模型 self.F = models.reflective_model # 决策反思模型 self.pi = models.low_level_policy # 低层VLA动作模型 self.cfg = config1. 状态感知与记忆对齐(Context & Memory Update)
在每个推理周期
开始时:
def step(self, obs, state, task_inst, memory, last_subtask): # --- 阶段 1:构建上下文并更新记忆 --- ctx = HighLevelContext(l=task_inst, M=memory, z_prev=last_subtask, o=obs) z_dir, updated_memory, token_stats = self.P(ctx) ctx.M = updated_memory # 映射 Line 4-5:对齐真实视觉后的最新记忆
机器人获取当前的多视角视觉图像
与关节/末端位姿状态
提案模型(Proposal Model,
)结合任务目标
即l=task_inst
上一时刻的执行记忆
即M=memory
上一步执行的子任务
即z_prev=last_subtask
以及最新视觉
即o=obs
生成最新的对齐记忆即updated_memory,和一个直接子任务提案
即z_dir
这一步确保了高层模型能准确追踪“任务已经做到哪一步”,修复潜在的记忆失真(如抓取失败或物体滑落)
2. 自适应路由决策:快慢思考切换(Adaptive Routing)
算法并不是对所有步骤都消耗巨量算力去“思考”,而是通过 Token 置信度进行动态分流:
提案模型生成
时,系统会统计其输出 Token 的平均概率与 Logit Margin
# --- 阶段 2:自适应路由判断(快/慢思考分流) --- g_t = self.router.should_search(token_stats) # 映射 Line 6快路径(Fast Route,
):若模型对直接提案非常自信,则无需搜索,直接将
作为最终子任务
下发给底层
# --- 阶段 3:高层决策决策生成 --- if g_t == 0: # Fast Route:模型自信,直接采纳提案 (Line 8-9) z_star = z_dir慢路径/搜索路径(Search Route,
):若判定当前决策存在歧义或高不确定性(如面对新物体配置、复杂多步骤节点),则触发测试时计算(TTC)
else: # Search Route:启动世界模型引导的束搜索 (Line 10-12) searched_branches = self.beam_search(ctx)3. 测试时计算与世界模型预演(TTC & Consequence-Aware Search)
当进入慢路径时,高层策略启动基于世界模型的束搜索(Beam Search):
展开提案(Propose):提案模型
针对当前状态采样生成
个候选子任务
def beam_search(self, ctx): # 映射 Line 11 (SEARCH 过程) beam = [Branch(context=ctx, path=[], score=0.0)] for depth in range(self.cfg.D): candidates = [] for branch in beam: # 1. 提案 N 个候选 subtasks = self.P.sample(branch.context, num_samples=self.cfg.N)后果预测(Predict):视觉世界模型(World Model,
)输入当前图像branch.img,和候选子任务z,预测该子任务执行完毕后的终端视觉图像
即hat_o
for z in subtasks: # 2. 世界模型预测未来视觉终端图像 hat_o = self.W(branch.img, z)价值打分(Evaluate):价值模型(Value Model,
)结合全局目标ctx.l、候选子任务z,及预测的终态图像hat_o,对其可行性与完成度打分(
)
# 3. 价值模型给预测图像打分 score = self.V(ctx.l, z, hat_o) candidates.append(branch.expand(z, hat_o, score))束搜索剪枝(Beam Pruning):全局保留累计得分最高的
个分支,并递归拓展至指定深度
# 4. 保留 Top-B 最佳分支 beam = select_top_b(candidates, B=self.cfg.B) return summarize_beam(beam)反思承诺(Reflect & Commit):反思模型(Reflective Model,
)综合分析保留的最佳分支摘要
与真实视觉上下文,生成最终承诺的子任务指令
(它可以直接采纳搜索出来的最佳选项,也可以在此基础上修正生成更优的指令)
z_star = self.F(ctx, searched_branches) # 反思模型生成最终承诺指令4. 底层动作映射与闭环执行(Low-Level Action Execution)
确定子任务
后,高层将其下发给底层 VLA 策略(
)
底层策略(基于 Qwen3.5-2B + MoT 动作专家结构)结合当前本体状态
、多视角图像
及控制元数据
,通过条件流匹配(Conditional Flow Matching)生成一个
步(
)的连续动作块
# --- 阶段 4:低层动作生成 (Line 14) --- action_chunk = self.pi(obs=obs, state=state, subtask=z_star, meta=self.cfg.meta)机器人物理执行该动作块,环境状态随之改变,进入下一个周期
return action_chunk, updated_memory, z_star
// 待更