π0.5 模型解析
摘要π0.5 是一款面向家庭移动操作场景的视觉-语言-动作VLA模型通过预训练加后训练的两段式流程将高层推理与低层执行融进同一个模型。它结合离散与连续动作表示在全新真实住宅中展现出强大的多阶段任务泛化能力并显著优于现有 VLA 模型。引言想象一下一台机器人走进陌生的厨房听到“把碗放进水槽”的指令后能自己规划步骤、伸手抓取、稳稳移动一气呵成。这背后靠的不只是机械臂的精准控制更是一个能同时“看懂画面、听懂语言、想好动作”的智能大脑。今天要介绍的是VLA模型中大名鼎鼎的 π0.5正是这样一款面向家庭移动操作场景的视觉-语言-动作VLA模型。它把高层推理与低层执行融进同一个模型用预训练加后训练的两段式流程让机器人在全新环境中也能完成多阶段任务。接下来我们从模型总览、架构设计到实验结果一步步拆解它是如何做到的。原文《π0.5: a Vision-Language-Action Model with Open-World Generalization》论文https://arxiv.org/pdf/2504.16054代码https://github.com/Physical-Int1.模型总览预训练生成一个VLM模型(视觉语言模型)用于训练模型的数据包括1语言任务2多模态数据以及机器人数据3任务提示词 。 机器人相关数据通过FAST动作分词器转化为离散标记。旨在使模型适应各种机器人任务后训练对预训练模型进行针对性优化使其能够在低级和高级层面上进行推理以适用于移动操作场景。 用流匹配技术来表示动作分布实现高效的实时推理并且能处理连续的动作序列。推理阶段在推理阶段模型首先为机器人生成一个高级子任务然后根据这个子任务来进行推理。通过动作专家来预测低级别的动作。总体来说预训练是通过大量的数据训练的一个比较广泛的模型但是执行具体任务的话需要进行进一步的后训练包括采集对应的数据以及进行模型微调。执行自己的人物的话只部署预训练模型以及其他任务的后训练模型并不能取得很好的部署效果尤其在真机部署。2.模型架构2.1.pi05 架构解析2.1.1.分层架构这个架构最大的亮点是把决策分为两层但用同一个模型来实现高层推理高级推理模型接收当前观察o_t和总体任务ℓ比如“收拾碗碟”然后输出一个文字形式的高级子任务ℓ^比如“拿起盘子”。这相当于模型在“思考”下一步该做什么。低层执行低级推理模型在知道了“拿起盘子”这个指令后再结合当前的观察生成具体的动作序列a_t : tH比如机械臂在接下来几秒内每个关节转动的角度。2.1.2.多模态数据处理(Transformer)为了让模型能同时处理图像、文字和机器人关节数据架构做了专门设计输入x_1:N很“混搭”输入是一串Token但这里的token是广义的既包括传统的文字和图像块也包括连续的机器人动作数据比如关节角度的数值。不同内容不同专家ρ路由模型内部有“专家权重”。文字走文字编码器图像走视觉编码器动作数据则被线性投影后交给专门的“动作专家”网络处理。这就像一家公司不同部门处理不同业务。注意力机制A更灵活不像传统的语言模型只能“向前看”因果注意力这里的图像、文字提示和动作数据可以使用“双向注意力”这意味着模型在处理某一部分时可以同时参考上下文左右两侧的信息理解更全面。2.1.3分流输出一边说话一边动手输出分流一边说话一边动手模型的输出端f的输出也被清晰地分成了两路前M个输出对应文字令牌的logits概率用于生成文本比如回答“盘子在哪儿”或者输出刚才提到的子任务“拿起盘子”。后H个输出由“动作专家”生成再通过线性映射直接变成连续的、具体的机器人控制信号比如扭矩或位置增量。2.2.结合离散与连续动作表示方式π0.5它通过移动机械臂MM、不同环境中的非移动机器人ME、实验室条件下收集的交叉身体数据CE、高级子任务预测HL和多模态网络数据WD进行预训练。在训练后阶段我们还使用口头指令VI省略实验室交叉身体数据CE将模型重点放在移动操作和多样化环境上。图中展示了每个类别任务的典型子集。流批配来预测模型最终的连续动作动作在进行VLA训练时离散token要快得多但不适合实时推理因为需要自回归解码进行推理而自回归的成本很高理想的模型设计应训练离散化动作但仍允许使用流匹配在推理时产生连续动作。2.3预训练预训练的数据包括1.多样化的移动操作器数据MM大约 400 小时的数据这些数据来自在约 100 种不同的家庭环境中执行家务任务的移动操作任务.2.多样化的多环境非移动机器人数据ME: 在各种家庭环境中收集了非移动机器人的数据这些机器人可能拥有单臂或双臂。这些机器人被固定在表面或安装平台上3.交叉形态实验室数据CE: 我们收集了在实验室中进行的各种任务的数据这些任务包括搬桌子、折叠衬衫等简单操作。这些任务中有一些与我们评估的目标非常相关例如将餐具放入收纳箱而另一些则不太相关例如研磨咖啡豆。这些数据涵盖了单臂和双臂操作器以及固定式和移动式操作平台。我们还包含了开源的 OXE 数据集。4.高级子任务预测HL: 将高级任务指令如“打扫卧室”分解为更短的子任务例如“调整毯子”和“捡起枕头”。这种方式类似于语言模型中的思维链提示方式。这样可以帮助训练有素的策略模型理解当前场景并更好地决定下一个行动。在需要完成多个子任务的机器人任务中我们会手动为所有数据添加子任务的语义描述然后对其进行训练。5.多模态网络数: 我们包含了多种网络数据其中包括图像描述任务的数据2.4后训练在使用离散标记对模型进行 280k 个梯度步长的预训练之后我们进入第二阶段训练称之为“后训练阶段”。这一阶段的目的是使模型更加适应我们的应用场景家庭中的移动操作任务并引入一个动作专家该专家能够通过流匹配来生成连续的动作序列。这一阶段同时进行了下一token预测的训练以保持文本预测能力而动作专家的训练则通过流匹配来实现在训练后阶段开始时该专家的初始权重是随机分配的。我们额外进行了 80k 个梯度步长的优化。后训练的动作数据集包括 MM 和 ME 机器人的数据这些数据经过筛选只保留那些符合特定长度阈值的成功场景。此外我们还加入了网络数据以保留模型的语义和视觉能力同时也包含了与多环境数据集相对应的 HL 数据片段。为了提升模型对高级任务的预测能力我们收集了由专家用户提供的口头指令演示。这些演示是通过让机器人实时接收语言指令来完成的专家用户会选择合适的子任务命令指导机器人逐步执行移动操作任务。这些示例实际上是通过让机器人实时接收语言指令来完成任务而获得的从而展示了经过训练后的低级策略在高级任务中的表现。3.实验结果不同数量训练环境对性能的影响评估。在四个测试任务——“碗在水槽中”、“物品在抽屉里”、“洗衣篮中的物品”、“整理床铺”中随着训练环境的增加性能得到了提升。虚线绿色曲线和绿色条形图表示了一个包含测试房屋的基线模型。与这个模型相比我们的最佳模型尽管没有接触到测试房屋的数据但仍然取得了类似的性能表现。不同训练位置数量对语言遵循能力的评估。我们评估了语言遵循的准确率以及用户指示的物品被拾起并放入抽屉或水槽的成功率。这些评估是基于已见过物体类别“分布内”和未见过物体类别“分布外”进行的。随着训练位置数量的增加性能逐渐提升。结果总结π0.5 在 全新真实住宅 中具有强大的多阶段任务泛化能力。增加训练环境数量 能持续提升任务性能和语言遵循能力。跨实体数据ME、CE和网络数据WD 对泛化至关重要。高层推理和子任务预测数据 对性能有显著贡献。π0.5 显著优于现有 VLA 模型并验证了混合训练流程的有效性。
上一篇/下一篇内容由系统自动关联
返回资讯列表 →