尧图精选

PhysicalRSI 1.0:用于扩展具身技能的递归自-驾驭机制

🕒 发布时间:2026/10/1 2:55:35 📁 来源:尧图网络
26年9月来自港大MMlab的网页介绍“PhysicalRSI 1.0: Recursive Self-Harness for Scaling Embodied Skills” https://mmlab.hk/research/PhysicalRSI。1方法的核心可以用一个循环理解执行任务 → 记录失败 → 提出程序修改 → 在环境中测试 → 保留有效版本 → 继续迭代。这里需要区分两类能力完成任务的能力感知、规划、调用动作技能、控制机器人。改进系统的能力分析失败原因修改工具、记忆、技能及其调用方式。如果底层模型权重保持不变改进主要发生在 harness即连接模型、工具、记忆和执行流程的驾驭运行框架。那么系统是在通过积累和修改可执行程序学习而不一定通过重新训练神经网络学习。它的实际吸引力在于把一次推理得到的经验保存为以后能够直接执行的规则。例如“抓取失败后重定位再尝试”可以从临时建议变成带触发条件和结果检查的恢复程序。它的核心是两层循环双系统负责“当前任务如何完成”Embodied Self-Harness 负责“下一版系统如何做得更好”。两者连接起来使大模型的反思能够变成后续实际运行的控制代码。如图所示其双-系统共-演化框架2创新点具身学习落实到四个具体层面这使其研究对象比“优化一个提示词”更丰富它试图在可执行程序空间中积累具身能力。 一个失败可以引发新的状态变量、子任务、控制分支或技能组合。贡献的重心在可修改的智能体结构以及经验如何进入下一版结构。 双系统提供分工self-harness 提供持久更新的载体。叠衣服示例中系统保留“记录下降轨迹并反向撤回”的程序但每回合重新测量轨迹和关节姿态。这比保存一段固定动作序列更有意义继承的是一种操作方法执行时再绑定当前场景的数据。其潜在泛化来源可以明确解释为保留可复用的程序结构重新估计本次执行的状态。网页还展示了跨任务复用坐标转换模块以及将识别、求解、抓取、移动、放置组合起来。这些都是具体的软件层能力复用。不过仍需区分三件事程序能够适应输入变化已有模块能够被复用系统能自主发现新任务所需的抽象与组合。前两项有展示第三项需要完整生成记录和迁移实验才能确认。大模型生成机器人策略代码已有 Code as Policies依据执行反馈修改运行框架已有 Self-Harness冻结基础策略并演化具身检查与恢复机制也有 Zetta。所以 PhysicalRSI 更有说服力的创新主张应当是将表征、状态、规划和控制都纳入可继承的具身程序改进过程并在多类机器人任务中验证这种组织方式。这可以是一项有价值的系统贡献。但仅凭“双系统反思环境选择”的框架还不能确认存在新的核心优化算法也不能确认相对已有工作的独特增量有多大。尤其是“原生双-系统协同进化”这个表述需要进一步证明联合修改两者的协作机制确实优于只改执行技能或只改高层规划。否则观察到的主要收益仍可能来自自动改进控制程序。叠衣服图中的记录为网页附带的数据说明明确指出展示的是选出的节点不是全部搜索历史完整开发历史中存在退化也存在更高的开发集成绩正式评估端点没有提供对应场景组与策略版本身份不能将其视为同一评估群体上的正式学习曲线这组记录不主张证明泛化、模型调用减少或实际运行加速。这应当同时得到两种评价积极的一面是作者披露了比较边界限制的一面是图中向上的节点连接不能证明每一轮改进都有效、性能持续单调增长或后代越来越善于自我改进。它支持“某些程序版本取得了更好的开发集结果”距离“稳定的递归改进规律”还有明显证据差距。如图所示其实现框架3可能的问题与不足1视频和技能图谱更适合解释机制不能替代因果验证。网页注明视频是选取的执行回合部分对比视频来自独立运行。叠衣服演化视频中的版本也不与图表节点逐一对应播放说明还包含部分阶段加速及静止片段省略。因此视频能够帮助判断某个版本确实展现了相应动作程序修改对应怎样的行为变化成功或失败发生在哪个阶段。但它无法单独判断该修改是否显著提高总体成功率改进是否由系统自主提出两个对比是否控制了相同初始条件新程序是否在未见场景中更可靠。同样网页的技能图谱包含 212 个提取的视频片段、覆盖 40 个任务其位置是示意布局。不能将它解读为“自动发现了 212 个独立可迁移技能”也不能把图中的空间关系当作学得的技能表示。2其泛化问题已经有具体迹象但不能过度归因。网页任务表中有些标准场景与随机场景差距很大。例如叠碗标准场景成功率约 75%随机场景为 0%向杯中倒液体标准场景约 94%标为估计值随机场景为 9%。这些结果说明成功的程序结构尚未消除场景变化带来的脆弱性。但仅凭分数无法断言原因就是硬编码。问题也可能来自感知、定位、抓取技能、控制鲁棒性或不同场景的难度。后续最值得研究的是系统能否判断一个技能的适用条件条件不满足时能否重新估计状态、切换策略或触发新的改进过程。否则技能积累可能逐渐变成大量局部有效的程序。3目前最大的缺口自主改进过程尚不够可审计网页已经比纯演示项目更具体但要确认其“自进化”贡献还需要把完整因果链连接起来哪个失败触发了修改 → 模型看到了什么 → 自动产生了哪些候选 → 人是否介入 → 如何评估淘汰 → 最终版本在未见任务上怎样。当前最关键的缺失证据不是更多成功视频而是固定基础模型、工具和预算只改变是否允许自改进的对照完整候选与失败历史而不只是选出的版本人工编写、人工筛选与自动修改的贡献划分隔离的最终测试集和跨任务迁移将搜索、仿真、失败验证都计入的总成本新一代是否更善于改进自身的专门实验。可以说它是一个有具体机制、有一定行为与评估证据的具身程序自改进原型。 它最有价值的启发是将机器人学习扩展到表征、状态、规划和控制程序的持久修改现有网页还不足以确认开放世界持续学习、双-系统协同进化的独立收益以及改进能力本身的递归增强。4 关于Dual-system / 双-系统的工作网页中的 System 1 和 System 2 是一种功能分工不宜直接等同于人类认知机制也不必理解成两个独立训练的神经网络。一个容易忽视的细节是System 1 也包含决策逻辑。 它不只是被动执行一串固定动作还可以根据观察和当前状态选择技能、检查条件、更新状态。网页给出的表达是(a_t, m_t1) H_k(o_t, g, m_t; S, T)这里o_t当前观察g任务目标m_t当前回合的状态(S, T)技能与工具(a_t)输出动作k当前运行框架的版本。因此System 2 可以把一部分原本需要每次重新推理的判断写入 System 1 的程序。例如“物体仍被夹持时继续搬运否则重新抓取”可以成为运行时的条件分支。网页展示的技能类型也不只有 VLA还包括代码策略、π₀.₅以及带稀疏记忆的 π₀.₅。双系统的直接价值是将较慢的任务推理与较快的动作执行分开。网页标注了约 0.1–1 Hz 的规划与约 20–50 Hz 的动作控制但明确说明这些只是示意估计而且控制频率不同于模型推理频率不能拿来证明实际部署的实时性。5 这个双-系统比普通“规划器执行器”多了什么普通分层系统中规划器决定“调用哪个已有技能”。PhysicalRSI 还允许 System 2 修改“技能本身以及技能如何被组织”。以插钥匙为例网页将控制结构拆成接近 → 对齐 → 插入三个阶段可以采用不同的目标与终止条件。我的理解是这种结构使系统能够分别处理“接近路径不合适”“姿态没对齐”“插入动作失败”等问题避免把整个任务看成一个无法定位错误的动作黑箱。进一步修改对象可以位于不同层次。网页列出四类例子这说明它搜索的空间不只是动作参数而是从感知表征到控制流程的一整段程序结构。不过“协同进化”的含义需要谨慎界定网页允许基础模型 F 保持不变所以不能据此说 System 2 的模型权重也在学习。更准确的理解是System 1 的执行程序以及 System 2 使用信息和调度执行的方式可以随运行框架一起改变。6 关于Embodied Self-Harness 框架的运行这里的 harness 可以理解为智能体的“运行与控制的驾驭框架”。“具身自-驾驭”强调的是智能体修改自己的工作方式。网页把第 k 代智能体定义为A_k Agent(F, H_k)并写成H_{k1} Improve_A_k(H_k, tau_k)其中 tau_k 包含具身交互中的观察、动作、成功与失败。网页的主循环可以整理为用当前框架 Hₖ 组成智能体 AₖSystem 2 理解任务并产生计划System 1 执行得到交互轨迹 τₖAₖ 根据 Hₖ 和 τₖ 生成多个候选框架将父代与候选子代放入评估选择一个存活版本继承它的框架进入下一轮其核心是提出变体–〉评估–〉选择–〉继承网页称之为 Darwinian Self-Harness。它是由模型引导的程序变异与环境选择而不是完全随机的程序搜索。这里有三个关键点。第一反思产生的是候选修改不是已经被证明的改进。“我认为这样更好”只负责提出假设。改动是否保留要靠后续环境表现决定。这个区分非常重要因为语言模型可以给出很有说服力、却在物理执行中无效的解释。第二父代也参与选择。这使算法能够拒绝较差的子代。但它只能在有限的评估样本上比较优劣保留父代并不自动保证真实泛化性能单调提升。噪声、偶然成功与评估过拟合仍可能导致错误选择。第三网页中的简化公式不是完整实现规范。网页另写了H_{k1} F(H_k, E_k, E_k-)其中 E_k与 E_k-是成功和失败证据。结合主算法应把它理解为对“依据证据修订程序”的简写实际保留下来的下一代还经过候选评估与选择。网页尚未详细说明候选数量、变异约束、选择统计标准、停止条件等所以目前能够确认的是算法框架不能据此还原完整实现。7 主要价值点继承技能刷新状态网页中的叠衣服例子很好地解释了“它到底记住什么”。程序大意是在本回合记录机械臂接近时的关节姿态放下衣物的过程中记录下降轨迹松开夹爪沿记录的下降轨迹反向撤回返回本回合记录的接近姿态。跨回合保留的是“记录当前轨迹并利用它撤回”的技能程序。每个回合重新产生的是本次实际测得的姿态与轨迹。这是程序性知识与回合状态的分离。它避免把某一次执行的绝对坐标直接当成永久经验。这种抽象只提供了泛化的可能性并不保证泛化。反向路径是否合适还取决于环境有没有变化、衣物是否缠绕、释放是否成功等。真正可靠的技能仍需要执行中的观察和条件检查。网页还展示了另一种继承插充电器任务复用抓取任务的像素到世界坐标转换模块。这证明了模块复用的具体形式但尚不能独立证明系统会自动发现任意任务之间可迁移的技能。8 其算法的价值和难点可以从五个方面评价。1它将推理结果转化为持久的执行能力。如果每回合都让大模型重新推导相同的步骤成本高也容易产生不一致。将有效规则写成代码能够减少重复推理并使中间状态和执行条件更加明确。这可以理解为一种把经验转化为程序的过程。不过只有当程序保留了适当的输入、反馈和适用条件时经验才可能复用否则只是将一次成功固化成脆弱脚本。2它用环境筛选程序缓解了语言反思不可靠的问题。环境评估比“模型自行打分”更接近任务的真实要求。但难题转移到了评估设计怎样判断一个修改优于父代要重复多少次才能排除偶然成功局部成功是否牺牲了其他任务筛选所用任务与最终测试是否分离因此这套方法的可靠性很大程度上由 select_on_eval 决定而网页对这一环节的描述仍然较抽象。3程序结构提供可解释性也带来搜索复杂度。程序修改能够定位到具体模块表征、记忆、规划或控制。但一次失败可能由多个环节共同导致。例如插入失败可能来自视觉定位误差、抓取后物体滑动、标定偏差、对齐阈值不合理或控制器不适合接触过程。只看最终失败视频未必能够准确归因。如果一次修改多个模块即使性能变好也难以判断真正原因。小步修改、单独验证与必要的回归测试会直接影响搜索效率。4双-系统协作需要解决“什么时候接管”的问题。高层规划正确并不意味着执行过程中不会发生意外。需要明确System 1 遇到什么情况应继续局部恢复什么情况应请求 System 2 重新规划什么情况应停止当前技能System 2 正在推理时System 1 如何处理新的变化网页描述了观察反馈与反思循环但没有充分给出这些调度规则。因而它目前展示的“双系统”更像清楚的架构原则实时协作机制仍需要实现和实验细节支持。5“程序越来越好”与“越来越善于改进程序”仍需分别验证。公式中的Improve_A_k 暗示当前智能体参与产生自己的下一代具有递归结构。但要支持更强的递归自我改进主张应证明新一代不仅任务执行更好也更善于提出有效修改、筛掉无效候选或用更少预算解决新任务。最关键的对照是固定同一个改进器持续优化任务程序与允许改进器的工作方式一起变化比较二者在未见任务上的改进效率。9 总结首先让机器人把执行经验转化成可验证、可复用的程序具有明确的工程价值“递归自我改进”这一更强主张则需要独立测试、严格对照和改进效率的证据。其次 其关键贡献是它把双系统分工、可执行技能、状态管理和环境选择组织成一个可以继承的闭环。 更强的“协同进化”“开放世界泛化”和“递归改进能力提升”则还需要更完整的实现披露与针对性实验来支撑。
上一篇/下一篇内容由系统自动关联 返回资讯列表 →