尧图精选

LeRobot 中的 MolmoAct2 策略:VLM 驱动的机器人动作推理模型训练、评测与部署实战指南

🕒 发布时间:2026/9/10 20:27:27 📁 来源:尧图网络
LeRobot 中的 MolmoAct2 策略VLM 驱动的机器人动作推理模型训练、评测与部署实战指南【免费下载链接】lerobot LeRobot: Making AI for Robotics more accessible with end-to-end learning项目地址: https://gitcode.com/GitHub_Trending/le/lerobotMolmoAct2 是 Allen Institute for AIAi2提出的动作推理模型Action Reasoning Model它将 Molmo 视觉语言骨干与逐层流匹配flow-matching动作专家action expert结合通过端到端学习实现连续动作生成。本文以仓库文档 docs/source/policy_molmoact2_README.md 为骨架结合 src/lerobot/policies/molmoact2 下的配置、建模与处理器源码系统讲解如何在 LeRobot 中完成 MolmoAct2 的安装、微调、LIBERO 基准评测、真实机器人部署以及它与原始官方实现之间的关键差异。读完本文你将掌握从 Hugging Face 原始权重或 LeRobot 已保存检查点两种路径出发的完整训练/评测命令、全部核心策略参数的含义与默认值、混合精度与编译策略背后的原理并能在 SO-100 等真实机器人上通过lerobot-rollout直接部署。一、MolmoAct2 与 LeRobot 的集成概况MolmoAct2 是 Ai2 于 2026 年发布的面向真实世界部署的动作推理模型Action Reasoning Models for Real-world Deployment。LeRobot 仓库将其移植为标准的molmoact2策略类型从而完整复用 LeRobot 的训练循环、数据集接口、检查点保存与日志记录体系。从源码结构看策略实现集中在以下文件configuration_molmoact2.py定义MolmoAct2Config继承PreTrainedConfig、策略本地优化器MolmoAct2AdamW与余弦退火调度器MolmoAct2CosineWithWarmupSchedulerConfigmodeling_molmoact2.py把 vendored 的 HF 模型封装进PreTrainedPolicy接口实现流匹配损失、离散动作 token 损失、select_action与predict_action_chunkprocessor_molmoact2.py构建多模态 prompt图像 离散化状态 任务文本的预处理/后处理流水线molmoact2_hf_model随仓库携带的 Hugging Face 模型实现含action_tokenizer.py、modeling_molmoact2.py、video_processing_molmoact2.py等。在 factory.py 中MolmoAct2Config通过PreTrainedConfig.register_subclass(molmoact2)注册因此只需要在训练配置中指定--policy.typemolmoact2即可启用该策略。测试文件 tests/policies/molmoact2/test_molmoact2.py 中的test_molmoact2_policy_registration验证了get_policy_class(molmoact2)与配置类型的注册关系。需要说明的两点边界当前 LeRobot 实现支持普通 MolmoAct2 模型的训练与评测支持自适应深度推理的MolmoAct2-Think 尚未移植官方标注为coming soon论文实验使用的原始训练代码位于 allenai/molmoact2 仓库本文介绍的是 LeRobot 移植实现。二、环境要求与安装2.1 硬件与系统要求运行 MolmoAct2 需要NVIDIA GPU。仓库官方在 Ubuntu 22.04 上完成测试。精度与显存策略方面当前混合精度路径把完整的动作专家保存在 fp32而大型 VLM 矩阵保存在 bf16policy.compile_modeltrue可选地对动作专家块启用编译而 VLM、视觉塔vision tower、连接器connector与策略包装器保持 eager 执行。文档说明这一边界通过了同起点输出、梯度与优化器更新一致性parity检查而编译 bf16 VLM 路径则未通过因此刻意不做整模型编译。2.2 安装可选依赖使用uv安装带 MolmoAct2 可选依赖的 LeRobotuv sync --locked --extra molmoact22.3 多卡训练现状通过accelerate的多卡训练可以提升吞吐与全局 batch size。该路径曾在两节点、八卡 GB200上实际运行过但本移植没有暴露原始 MolmoAct2 的fsdp_devices模型并行训练路径。官方还给出了一个单卡 GB200 回放的实现级检查结果在两个真实 prompt 宽度下产生了一个无 graph break 的编译动作图峰值显存与 eager 模式同为 55.15 GiB稳态速度有适度提升。文档明确提示这些应视为实现检查结果而非可移植的吞吐或 ETA 声明。三、模型架构与运行原理源码级解读3.1 三层结构从 modeling_molmoact2.py 模块开头 docstring 可见MolmoAct2 的策略主体由三层组成Molmo 视觉语言骨干VLM backbone负责理解图像、任务语言与离散化状态逐层流匹配动作专家per-layer flow-matching action expert在每个 Transformer 层上并行执行连续动作的流匹配生成是训练时每个 flow timestep 都要被评估的热点路径可选的离散动作 token 头discrete action token head保留离散动作生成能力供action_modediscrete或both模式使用。3.2 损失函数的分支逻辑_forward_impl根据config.action_mode分发三种训练目标modeling_molmoact2.pydiscrete仅计算离散动作的交叉熵损失CE与可选的 z-losscontinuous仅计算逐层联合流匹配损失action_flow_lossboth同时计算流匹配损失与离散 CE 损失并求和作为显式的联合消融选项。推理侧predict_action_chunk则通过inference_action_mode决定走连续流匹配生成、离散自回归解码还是连续模式下RTC 实时控制路径。3.3 优化器与调度器官方 MolmoAct2 与 LeRobot 共享 trainer 的差异在于梯度裁剪粒度。MolmoAct2AdamWconfiguration_molmoact2.py实现了按参数组独立裁剪LLM、ViT、连接器与动作专家四组各自用optimizer_grad_clip_norm裁剪而不是整模型单一范数裁剪同时实现 BF16 更新补偿Kahan 式残差以保留小于一个 BF16 ULP 的 VLM 更新该补偿张量按需惰性分配冻结参数不产生额外开销。测试test_molmoact2_optimizer_clips_each_component_independently验证了这一行为。调度器MolmoAct2CosineWithWarmupSchedulerConfig复刻官方warmup 余弦退火节奏余弦时间从 warmup 结束后的第 0 步起算避免 LeRobot 共享 Pi0 调度器在绝对全局步上的学习率跳变。测试覆盖了 warmup 连续性、提前停止时钟保持与检查点恢复一致性。3.4 序列长度推断处理器模块 processor_molmoact2.py 定义了固定 token 预算常量如每图像 196 个图像 token、固定 prompt 预算 80、任务 token 预算 32、序列长度余量 32 等infer_molmoact2_max_sequence_length依据图像数、状态维度、动作维度、动作视界与是否含离散动作推断序列上限批内文本/动作序列在插入 BOS 前被左填充到 8 的倍数MOLMOACT2_SEQUENCE_BUCKET_MULTIPLE 8至多增加 7 个掩码 token显著减少因形状变化触发的编译预热。四、训练实战两条权重初始化路径MolmoAct2 可以从两种来源初始化并微调二者使用相同的 LeRobot 训练循环、数据集变换、检查点保存与日志区别仅在于初始权重与处理器状态的加载方式加载方式参数适用场景原始 HF 检查点policy.checkpoint_path如allenai/MolmoAct2、allenai/MolmoAct2-LIBERO从官方发布的权重开始微调LeRobot 检查点policy.path本地pretrained_model目录或 Hub 仓库续训已由 LeRobot 保存的检查点重要前提图像增强LeRobot 默认关闭数据集图像增强MolmoAct2 训练命令必须显式开启--dataset.image_transforms.enabletrue。原始 MolmoAct2 的变换配方并非 LeRobot 通用变换默认值因此首个命令还要显式固定其 95% 裁剪、5 度旋转与颜色抖动原始配方中概率 0.2 的高斯模糊无法用 LeRobot 通用的RandomSubsetApply表达会偶尔丢弃三个必需变换之一故不纳入。重要提示量化统计不要用lerobot/libero近似元数据分位数替代官方发布的norm_stats.json——两者的 q01/q99 数值并不相同。4.1 从官方 MolmoAct2 权重开始全量微调以下命令在合并的 LIBERO 数据集上从allenai/MolmoAct2基础检查点全量微调使用 bf16 模型加载、8 个流匹配时间步、官方 LIBERO 分位数统计、图像增强以及 LeRobot 的检查点/日志体系accelerate launch \ --num_processes8 \ --mixed_precisionbf16 \ -m lerobot.scripts.lerobot_train \ --dataset.repo_idlerobot/libero \ --dataset.root/path/to/lerobot/libero \ --dataset.video_backendpyav \ --dataset.image_transforms.enabletrue \ --dataset.image_transforms.max_num_transforms3 \ --dataset.image_transforms.random_orderfalse \ --dataset.image_transforms.tfs{crop:{weight:1.0,type:RandomResizedCrop,kwargs:{size:[256,256],scale:[0.9025,0.9025],ratio:[1.0,1.0]}},rotation:{weight:1.0,type:RandomRotation,kwargs:{degrees:[-5.0,5.0],interpolation:2}},color:{weight:1.0,type:ColorJitter,kwargs:{brightness:0.2,contrast:[0.8,1.2],saturation:[0.8,1.2],hue:0.05}}} \ --policy.typemolmoact2 \ --policy.checkpoint_pathallenai/MolmoAct2 \ --policy.devicecuda \ --policy.action_modecontinuous \ --policy.norm_taglibero \ --policy.norm_stats_path/path/to/MolmoAct2-LIBERO/norm_stats.json \ --policy.train_mode_vlmfft \ --policy.chunk_size10 \ --policy.n_action_steps10 \ --policy.setup_typesingle franka robotic arm in libero \ --policy.control_modedelta end-effector pose \ --policy.image_keys[observation.images.image,observation.images.image2] \ --policy.dtypebfloat16 \ --policy.num_flow_timesteps8 \ --policy.gradient_checkpointingtrue \ --policy.compile_modeltrue \ --policy.freeze_embeddingtrue \ --policy.normalize_gripperfalse \ --policy.enable_knowledge_insulationfalse \ --policy.push_to_hubfalse \ --wandb.enabletrue \ --wandb.entitywandb_entity \ --wandb.projectwandb_project \ --job_namejob_name \ --output_diroutputs/job_name \ --steps10000 \ --batch_size32 \ --num_workers4 \ --log_freq20 \ --env_eval_freq-1 \ --save_checkpointtrue \ --save_freq20004.2 从 LeRobot 已保存权重继续训练使用policy.path时LeRobot 会恢复保存的策略配置、模型权重、处理器与归一化统计。训练期选项如batch_size、steps、policy.action_mode仍可覆盖但检查点加载是严格的并保留已保存的 FFT 或 LoRA 拓扑因此使用policy.path时不要覆盖policy.train_mode_vlm。若想启动一个新的 LoRA 训练应改用policy.checkpoint_path从 HF 权重初始化accelerate launch \ --num_processes8 \ --mixed_precisionbf16 \ -m lerobot.scripts.lerobot_train \ --dataset.repo_idallenai/MolmoAct2-LIBERO-Dataset \ --dataset.root/path/to/lerobot/data/allenai/MolmoAct2-LIBERO-Dataset \ --dataset.video_backendpyav \ --dataset.image_transforms.enabletrue \ --policy.path/path/to/pretrained_model \ --policy.devicecuda \ --policy.action_modecontinuous \ --policy.chunk_size10 \ --policy.n_action_steps10 \ --policy.dtypebfloat16 \ --policy.num_flow_timesteps8 \ --policy.gradient_checkpointingtrue \ --policy.compile_modeltrue \ --wandb.enabletrue \ --wandb.entitywandb_entity \ --wandb.projectwandb_project \ --job_namejob_name \ --output_diroutputs/job_name \ --steps10000 \ --batch_size32 \ --num_workers4 \ --log_freq20 \ --env_eval_freq-1 \ --save_checkpointtrue \ --save_freq20004.3 常见实践建议在相对较小的数据集上微调如单个 LIBERO suite或演示数少于 200 条的真实数据集全局 batch size 从 1632 起步是良好起点小数据集上推荐policy.train_mode_vlmlora默认值通常能取得与fft相当甚至更好的性能policy.train_mode_vlmfreeze也是实用选择在所有模式下动作专家始终保持完全可训练——这是官方实验中被证明对模型性能至关重要的设计对于更大的微调数据集通常倾向于更大的全局 batch size 与 VLM 全量微调fft。4.4 学习率与调度参数MolmoAct2 使用参数组学习率以对齐官方微调实验全量微调policy.optimizer_lr1e-5VLM、policy.optimizer_vit_lr5e-6视觉塔、policy.optimizer_connector_lr5e-6图像连接器、policy.optimizer_action_expert_lr5e-5动作专家LoRA 模式VLM、视觉、连接器的 LoRA 参数组统一为5e-5动作专家仍以policy.optimizer_action_expert_lr全量微调冻结 VLM 模式freeze只训练动作专家使用optimizer_action_expert_lr5e-5policy.optimizer_grad_clip_norm对 LLM、视觉塔、图像连接器与动作专家四个参数组分别独立应用并非整模型梯度范数。调度器默认scheduler_warmup_steps200、scheduler_decay_steps24000、scheduler_decay_lr1e-6其中 24000 步的衰减视界对齐官方train_lerobot.py配方。上述学习率与调度参数均可通过同名配置项覆盖。五、核心策略参数全解下表整合文档与 configuration_molmoact2.py 中的默认值/取值约束参数含义默认值/可选值policy.checkpoint_path原始 MolmoAct2 HF 检查点用于官方发布权重allenai/MolmoAct2policy.pathLeRobot 已保存检查点本地目录或 Hub无policy.action_mode训练目标continuous/discrete/both官方机器人微调用continuouspolicy.train_mode_vlmVLM 微调模式动作专家始终全量训练fft/lora/freeze默认lorafreeze要求action_modecontinuouspolicy.enable_knowledge_insulation为 true 时在动作损失前分离动作专家上下文 K/V 状态默认falsepolicy.chunk_size动作视界LIBERO 用 10会覆盖检查点max_action_horizon默认 30需 ≥ 1policy.n_action_steps每次查询策略前消费的动作步数LIBERO 设为等于chunk_size默认 30需 ≤ chunk_sizepolicy.setup_type写入 prompt 的机器人/场景描述文本如single franka robotic arm in libero空字符串policy.control_mode写入 prompt 的动作空间描述如delta end-effector pose、absolute joint pose空字符串policy.image_keys传入处理器的有序图像观测键空列表policy.dtypePi0.5 风格精度开关bfloat16VLM 矩阵 bf16 存储、动作专家与敏感模块 fp32float32全模型 fp32bfloat16policy.compile_model块级torch.compile仅编译动作专家块VLM/ViT/连接器保持 eager默认falsepolicy.num_flow_timesteps训练时每个样本采样的流匹配时间步数默认 8policy.num_inference_steps推理时连续动作生成的步数覆盖默认无policy.gradient_checkpointingVLM/动作路径激活重计算降低激活显存默认falsepolicy.freeze_embedding冻结输入嵌入默认truepolicy.normalize_gripper是否将夹爪维度纳入状态/动作分位数归一化默认falsepolicy.normalize_language构造 prompt 前是否归一化任务字符串默认truepolicy.mask_action_dim_padding是否在流损失中掩码填充的动作维度默认true发布检查点用expected_max_action_dim32policy.max_sequence_length手动序列上限不设置时按图像/状态/动作/视界/离散模式推断默认无policy.expected_max_action_dim发布检查点固定值加载时校验固定 325.1policy.dtypebfloat16的精度细节这是 Pi0.5 风格的低显存精度剖面AdamW 动量跟随各参数的存储 dtype因此大型 bf16 VLM 参数的动量也是 bf16。全量微调时会为每个有梯度的 bf16 参数惰性分配一个bf16 补偿张量把小于单个参数 ULP 的更新带入后续步骤——注意这不是 fp32 master copy。LoRA 适配器、动作专家与明确敏感的模块保留 fp32 参数与优化器状态LoRA 模式下冻结的 VLM 参数不分配任何补偿张量。5.2policy.compile_modeltrue的编译边界全量微调与 LoRA 都只编译动作专家 Transformer 块VLM/ViT/连接器 eager 执行以避免编译器引起的 BF16 激活与梯度漂移同时保住每个流时间步都要评估的动作路径加速Inductor 被指示在融合算子之间保留 eager 的 BF16 降/升精度边界动作块使用 PyTorch 自动形状策略配合梯度检查点时只有可变的编码器上下文序列维度被标记为动态batch size、动作视界与流时间步数保持静态该模式下会禁用 Dynamo 图缓存重排与额外的 DDP 图拆分器保证反向重计算选中与正向相同的块图——这对应源码中_set_dynamo_lru_cache与_disable_dynamo_ddp_optimizer的实现modeling_molmoact2.py。六、数据集分位数统计MolmoAct2 默认对状态与动作特征采用分位数归一化。若数据集尚未带分位数统计可用仓库脚本补上python src/lerobot/scripts/augment_dataset_quantile_stats.py \ --repo-idyour_dataset注意录制、续写与合并会从逐 episode 摘要聚合分位数因此meta/stats.json中保存的是保守包络q 50取minq 50取max而非全数据集分位数。若想估算后者可用运行直方图扫描每个 episodepython src/lerobot/scripts/augment_dataset_quantile_stats.py \ --repo-idyour_dataset \ --overwrite \ --skip-images--skip-images保留已有图像统计仅在需要重算STATE/ACTION时避免下载/解码视频--root可读取本地数据集而非 Hub直方图估计存在离散化与重分箱误差与保守包络不同会改变 MolmoAct2 的归一化目标进而影响损失尺度已保存在检查点内的统计不受影响。也可以改用均值/标准差归一化训练 MolmoAct2--policy.normalization_mapping{ACTION: MEAN_STD, STATE: MEAN_STD, VISUAL: IDENTITY}七、LIBERO 评测实战评测同样支持 LeRobot 保存的检查点与原始 MolmoAct2 HF 检查点两种来源。复现 LIBERO 时需要固定 EGL 渲染环境并使用policy.per_episode_seedtrue。关键提醒官方发现num_steps_wait10不能可靠地让 LIBERO 场景稳定下来会拉低测得的成功率。本实现报告的所有 LIBERO 评测结果均使用num_steps_wait50。7.1 评测 LeRobot 权重使用policy.path时处理器与归一化统计随模型一起恢复export MUJOCO_GLegl export PYOPENGL_PLATFORMegl export OMP_NUM_THREADS1 export MKL_NUM_THREADS1 lerobot-eval \ --policy.pathallenai/MolmoAct2-LIBERO-LeRobot \ --policy.inference_action_modecontinuous \ --policy.dtypebfloat16 \ --policy.enable_inference_cuda_graphtrue \ --policy.devicecuda \ --policy.per_episode_seedtrue \ --policy.eval_seed1000 \ --env.typelibero \ --env.tasklibero_10,libero_goal,libero_object,libero_spatial \ --env.camera_name_mapping{agentview_image:image,robot0_eye_in_hand_image:wrist_image} \ --eval.batch_size1 \ --eval.n_episodes50 \ --seed10007.2 直接评测原始 HF 权重无需先转换为 LeRobot 检查点即可直接评测官方发布权重此时设置policy.checkpoint_path并提供policy.norm_tag。对于 LIBEROpolicy.norm_taglibero会从检查点的norm_stats.json加载动作/状态归一化统计、动作视界、prompt 元数据与图像键顺序export MUJOCO_GLegl export PYOPENGL_PLATFORMegl export OMP_NUM_THREADS1 export MKL_NUM_THREADS1 lerobot-eval \ --policy.typemolmoact2 \ --policy.checkpoint_pathallenai/MolmoAct2-LIBERO \ --policy.norm_taglibero \ --policy.inference_action_modecontinuous \ --policy.dtypefloat32 \ --policy.enable_inference_cuda_graphtrue \ --policy.devicecuda \ --policy.per_episode_seedtrue \ --policy.eval_seed1000 \ --env.typelibero \ --env.tasklibero_goal \ --env.camera_name_mapping{agentview_image:image,robot0_eye_in_hand_image:wrist_image} \ --eval.batch_size1 \ --eval.n_episodes50 \ --seed1000把--env.task换成libero_10,libero_goal,libero_object,libero_spatial即可跑完整 LIBERO 套件。同一命令适用于其他已发布的 MolmoAct2 检查点只要其norm_stats.json中存在所请求的policy.norm_tag。7.3 常用评测参数参数说明policy.inference_action_moderollout 必需continuous走流匹配推理discrete走动作 token 推理须与检查点中保存的训练期action_mode兼容policy.pathLeRobot 检查点路径或 Hub 仓库policy.checkpoint_path原始 HF 检查点配合policy.typemolmoact2与policy.norm_tagpolicy.norm_tag从原始检查点norm_stats.json选择归一化统计、prompt 元数据、图像键顺序与动作视界policy.dtype存储/autocast 剖面常规 GPU 评测用bfloat16仅在需要全 fp32 推理时用float32policy.enable_inference_cuda_graph启用推理 CUDA 图路径加速重复的连续动作 rolloutpolicy.per_episode_seed/policy.eval_seed让随机连续动作生成按 episode 确定性执行便于复现env.task逗号分隔的 LIBERO 套件或单个套件env.camera_name_mapping将 LIBERO 相机名映射为策略处理器期望的图像键7.4 LIBERO 基准结果为对比验证 LeRobot 移植官方在 8 张 H100 上以每卡 batch size 32 对allenai/MolmoAct2-LIBERO额外微调了 10k 步与原始 MolmoAct2 参考结果对比如下基准LeRobot 实现MolmoAct2 原始LIBERO Spatial98.4%97.8%LIBERO Object100.0%100.0%LIBERO Goal98.0%97.8%LIBERO 1096.6%93.2%平均98.25%97.20%LeRobot 微调检查点allenai/MolmoAct2-LIBERO-LeRobot与其训练数据集allenai/MolmoAct2-LIBERO-Dataset均已在 Hub 发布可按上文 LIBERO 评测章节复现。要完全复现论文数字文档建议使用 v0.5.1 固定的官方molmoact2-hf-inference分支该分支与报告数字所用的原始评测设置一致。八、真实机器人部署lerobot-rolloutLeRobot 格式的检查点可直接用于lerobot-rollout。每个检查点使用特定的相机键名必须与你的机器人相机配置匹配相机名不同时用--rename_map映射检查点相机键说明MolmoAct2-LIBERO-LeRobotimage,wrist_imageLIBERO 仿真相机MolmoAct2-BimanualYAM-LeRobottop,left,rightYAM 三相机设置MolmoAct2-DROID-LeRobotcam0,cam1外部相机 腕部相机MolmoAct2-SO100_101-LeRobotcam0,cam1主视角 副视角SO-100 机器人使用顶部与侧向相机的示例lerobot-rollout \ --policy.pathlerobot/MolmoAct2-SO100_101-LeRobot \ --rename_map{observation.images.top: observation.images.cam0, observation.images.side: observation.images.cam1} \ --robot.typeso100_follower \ --robot.port/dev/ttyACM0 \ --robot.cameras{ top: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30}, side: {type: opencv, index_or_path: 2, width: 640, height: 480, fps: 30} } \ --taskpick up the red cube --duration30改用腕部相机只需修改映射--rename_map{observation.images.top: observation.images.cam0, observation.images.wrist: observation.images.cam1}8.1 关节坐标系变换SO-100/101 零样本警告MolmoAct2-SO100_101检查点训练所用的关节标定约定与 LeRobot ≥ 0.5.0 不同。不做坐标系校正时机械臂可能朝错误方向运动。这同时影响零样本部署与从原始检查点微调——预训练权重期望旧约定所有关节数据观测与动作都必须变换以匹配。已转换的 LeRobot 检查点lerobot/MolmoAct2-SO100_101-LeRobot在其处理器流水线中已包含该校正。若自行转换或微调该检查点需在策略配置configuration_molmoact2.py中设置joint_signs:[1, -1, 1, 1, 1, 1]翻转 shoulder_lift 方向joint_offsets:[0, 90, 90, 0, 0, 0]将 shoulder_lift 与 elbow_flex 平移 90°configuration_molmoact2.py 中joint_signs/joint_offsets默认均为 None不变换且二者必须同时设置、长度一致。标定变更细节参见 docs/source/backwardcomp.mdx。九、与原始实现的差异本移植的目标是在复用 LeRobot 数据集、训练、评测、检查点与日志基础设施的前提下尽量对齐 MolmoAct2 行为。主要差异优化器状态精度原始论文训练栈保留 fp32 master 参数并在 bf16 AMP 下训练本移植用policy.dtypebfloat16降低显存——大 VLM 矩阵存 bf16动作专家与数值敏感模块保持 fp32合格算子走 bf16 autocast。bf16 更新补偿张量能减少全量微调中的参数舍入损失但 bf16 Adam 动量仍无法精确复现原始 fp32 优化器状态分布式训练原始仓库使用自有 FSDP/模型并行路径本移植使用标准 LeRobot/Accelerate 路径尚未经多节点训练测试序列打包原始仓库支持序列打包本移植每个 item 训练一个 LeRobot 样本使用批内填充与推断出的最大序列长度保护工程约定遵循 LeRobot 的优化器、调度器、检查点保存、数据集变换、图像增强与 Weights Biases 日志约定混合动作视界原始训练路径支持按max_action_horizon填充并掩码动作专家自注意力中的填充视界槽位便于跨不同控制频率的数据集训练本移植当前面向单数据集微调policy.chunk_size覆盖检查点max_action_horizon视界掩码尚未实现官方标注为计划中。十、引用与许可引用论文arXiv: 2605.02881可使用仓库提供的 BibTeXmisc{fang2026molmoact2actionreasoningmodels, title{MolmoAct2: Action Reasoning Models for Real-world Deployment}, author{Haoquan Fang and Jiafei Duan and Donovan Clay and Sam Wang and Shuo Liu and Weikai Huang and Xiang Fan and Wei-Chuan Tsai and Shirui Chen and Yi Ru Wang and Shanli Xing and Jaemin Cho and Jae Sung Park and Ainaz Eftekhar and Peter Sushko and Karen Farley and Angad Wadhwa and Cole Harrison and Winson Han and Ying-Chun Lee and Eli VanderBilt and Rose Hendrix and Suveen Ellawela and Lucas Ngoo and Joyce Chai and Zhongzheng Ren and Ali Farhadi and Dieter Fox and Ranjay Krishna}, year{2026}, eprint{2605.02881}, archivePrefix{arXiv}, primaryClass{cs.RO}, }模型采用 Apache 2.0 许可面向研究与教育用途并遵循 Ai2 的 Responsible Use Guidelines。仓库内对应实现与文档位于 src/lerobot/policies/molmoact2、docs/source/molmoact2.mdx 与 tests/policies/molmoact2/test_molmoact2.py可直接作为继续深入阅读的入口。【免费下载链接】lerobot LeRobot: Making AI for Robotics more accessible with end-to-end learning项目地址: https://gitcode.com/GitHub_Trending/le/lerobot创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联 返回资讯列表 →