尧图精选

宇树机器人跳舞是遥控还是AI?拆解预编排与实时控制

🕒 发布时间:2026/9/30 11:11:25 📁 来源:尧图网络
1. 从舞台效果倒推技术栈那段舞蹈到底难在哪第一次在开幕式上看到宇树那几台人形机器人整齐划一地打拳、翻跟头、跳群舞我身边一个做工业机器人的朋友脱口而出“这肯定是提前编好的轨迹跟遥控没区别。”我当时没接话因为我知道这个判断对了一半也错了一半。对的部分是——这类舞台表演确实有大量预编排成分错的部分是——把“预编排”等同于“遥控”是对当下人形机器人技术路线最大的误解之一。先把结论摆出来开幕式级别的机器人舞蹈绝大多数情况下是**“离线编排 在线执行 底层实时平衡控制”**三层结构叠加的产物。它既不是纯遥控也不是很多人想象中的“机器人自己听着音乐即兴发挥”。理解这三层结构是理解宇树这类人形机器人能力边界的关键。为什么这个区分重要因为热搜词里同时出现了“强化学习”“具身智能”“集群协同”这些词说明大众的期待已经被拉到了“通用智能”的高度。但真实工程里舞台表演和通用智能之间隔着一条很宽的河。我见过太多团队在演示视频下面争论“这是不是AI”其实双方说的根本不是同一件事。一方说的是决策层的智能另一方说的是执行层的稳定性而舞台效果恰恰是这两者被精心调和后的结果。这篇文章我想做一件事把“机器人跳舞”这个看起来很玄的现象拆成几个可以理解、甚至可以自己复现的技术模块。我会讲清楚预编排和实时控制各自负责什么、强化学习在人形机器人里到底用在哪一层、激光雷达和集群协同在舞台场景里是不是必需品以及如果你自己想搭一个类似的小demo应该从哪一步开始。适合对人形机器人、强化学习、具身智能感兴趣但被各种营销话术绕晕的读者。2. 预编排与实时控制的边界谁在决定机器人抬哪条腿2.1 舞台动作的“剧本”是怎么写出来的先讲预编排。人形机器人跳群舞最朴素的做法是在仿真环境里把每一台机器人在每一时刻的关节角度、质心位置、落脚点全部算好生成一条参考轨迹然后让真机去跟踪这条轨迹。这条轨迹就是“剧本”。写剧本的工具通常是运动学规划加动力学优化。举个具体例子机器人要做一个单腿支撑的转身动作工程师会先确定转身的角度、时间、支撑脚位置然后用模型预测控制MPC或者轨迹优化求解出一整段关节角度序列。这个过程在仿真里可能要跑几十次甚至上百次才能得到一条既好看又不摔的轨迹。这里有个很多人不知道的细节舞台动作的“好看”和“稳定”经常是矛盾的。比如一个快速甩手的动作视觉上很帅但它会给机器人一个反作用力矩如果底盘补偿跟不上机器人就会晃。所以编排的时候工程师往往要在动作幅度和稳定性之间反复妥协。我见过一个团队为了让一个挥手动作更“有力”把角速度提高了30%结果真机上机器人直接往后仰最后只能加一个微小的前倾补偿才勉强稳住。预编排的核心优势是可预测、可复现、可批量。八台机器人跳同一支舞只要每台机器人的初始位置和轨迹偏移量设定好理论上可以做到高度同步。这也是为什么大型开幕式偏爱这种方式——它不依赖现场环境的实时感知出错概率低。2.2 真机执行时底层在疯狂“救场”但预编排只解决了“应该怎么动”没解决“实际动的时候会不会摔”。真机执行时底层控制器在干一件极其辛苦的事实时平衡。人形机器人的平衡控制本质是一个高频的反馈回路。IMU惯性测量单元以几百赫兹的频率读取躯干姿态关节编码器读取每个关节的实际角度然后控制器在几毫秒内算出每个关节需要输出多大的力矩才能让机器人既不倒、又能跟上参考轨迹。这个回路的频率通常在500Hz到1kHz之间比人类神经反射快得多。所以你在舞台上看到的“机器人跳舞”表面上是它在执行剧本实际上是底层控制器在每一毫秒都在微调。如果地面有一点点不平或者某个关节的摩擦力比仿真时大底层会立刻补偿。这就是为什么同一套动作在仿真里完美在真机上可能完全不是一回事。提示判断一段机器人舞蹈是纯预编排还是有实时控制参与可以看它在受到扰动后的反应。如果被轻轻推一下能自己恢复说明底层有实时平衡如果一推就倒或者动作明显卡顿那可能只是开环播放轨迹。2.3 遥控到底参与了多少回到最初的问题遥控参与了吗答案是——在正式表演中遥控通常只负责“启动”和“急停”不负责“实时操控动作”。因为人形机器人的关节太多宇树H1有几十个自由度靠人实时遥控每一个关节是不现实的。遥控器能做的是发送“开始第3套动作”“切换到待机姿态”这类高层指令。真正需要人实时介入的场景反而是调试阶段。工程师会用一个手柄或者上位机界面在机器人做动作的时候实时调整参数比如“这个转身再慢一点”“落地再软一点”。这些调整最终会被固化进轨迹里正式表演时就不需要人了。所以“遥控编排”这个说法准确的理解应该是动作是提前编排的执行是自动的人在编排阶段介入在表演阶段基本不介入。把它说成“遥控”就像说电影是“遥控拍出来的”一样忽略了背后大量的离线工作。3. 强化学习在人形机器人里到底用在哪一层3.1 为什么舞台表演很少直接用强化学习热搜词里“强化学习”出现频率极高很多人一看到机器人跳舞就默认是强化学习的功劳。这里必须泼一盆冷水大型舞台表演直接用强化学习从零训练一套舞蹈动作的案例非常少。原因很实际。强化学习训练一个人形机器人走路在仿真里可能要跑几百万甚至上千万步训练时间从几小时到几天不等。训练出来的策略往往对初始状态、地面摩擦、机器人质量分布极其敏感。你换一台机器人、换一块地板策略可能就失效了。而舞台表演要求的是高确定性、高可复现这两点和强化学习的“概率性、敏感性”天然冲突。那强化学习在人形机器人里到底用在哪主要用在底层运动控制尤其是** locomotion移动**这一块。比如让机器人学会在不确定的地面上保持平衡、学会从摔倒中恢复、学会上下楼梯。这些任务用传统控制方法写规则极其复杂而强化学习可以通过大量试错找到一个还不错的策略。3.2 强化学习训练人形机器人的真实流程如果你真的想用强化学习训练一个人形机器人做动作流程大致是这样的搭建仿真环境用 MuJoCo、Isaac Gym 或 PyBullet 建立机器人的动力学模型。这一步的精度直接决定训练结果能不能迁移到真机。定义奖励函数这是最考验经验的部分。比如训练走路奖励通常包括“前进速度”“躯干高度保持”“关节力矩不要太大”“脚不要打滑”等多项加权。选择算法人形机器人常用 PPO近端策略优化或 SAC软演员-评论家。PPO 稳定但样本效率低SAC 样本效率高但调参难。域随机化在训练时随机改变地面摩擦、机器人质量、电机延迟等参数让策略更鲁棒。这一步是**仿真到真机迁移sim-to-real**的关键。真机微调把仿真训练好的策略部署到真机通常还需要少量在线微调因为仿真永远和现实有差距。我自己的经验是摩擦力的建模是最大的坑。仿真里地面摩擦系数设成0.8真机上可能是0.6也可能是1.0机器人走起来的感觉完全不同。很多团队在仿真里训练得很好一到真机就“滑冰”就是因为摩擦没做域随机化。3.3 强化学习和预编排怎么配合实际工程里两者不是二选一而是分层配合。上层用预编排决定“做什么动作”下层用强化学习或传统控制保证“动作能稳定执行”。举个例子机器人要做一个跳跃动作。上层规划给出“起跳时间、腾空高度、落地位置”这些宏观参数下层控制器负责在起跳瞬间协调腿部各关节的力矩在落地瞬间吸收冲击。下层如果用的是强化学习策略它可能已经在上百万次仿真中学会了“落地时膝盖弯曲多少度最稳”。这种分层的好处是上层可以快速修改动作编排下层不需要重新训练。你想让机器人跳得更高改上层参数就行你想让机器人适应更滑的地面重新训练下层策略就行。两者解耦工程上可控得多。注意如果你看到某个演示号称“完全端到端强化学习”先问一句“训练了多久、用了多少台机器、失败率多少”。端到端不是不可能但代价通常极高而且离产品化还有距离。4. 激光雷达和集群协同舞台场景里的真实角色4.1 激光雷达在舞台表演中其实很尴尬热搜词里“激光雷达”“速腾16线激光雷达”“激光雷达SLAM”频繁出现容易让人以为机器人跳舞靠的是激光雷达定位。但舞台场景有个特殊性环境是已知的、结构化的。激光雷达的核心价值在于未知环境下的定位与建图SLAM。比如机器人在一个陌生仓库里自主导航它需要激光雷达扫描周围环境实时构建地图并确定自己的位置。但开幕式舞台的地面是平的、边界是固定的、机器人初始位置是精确摆放的。这种情况下用激光雷达做SLAM属于“杀鸡用牛刀”而且激光雷达在舞台灯光、烟雾、反光地板面前还可能受干扰。那舞台表演靠什么定位通常是外部动捕系统或者预设的初始位置 里程计。动捕系统在舞台周围布置多个红外摄像头机器人身上贴反光标记点可以做到毫米级定位。这套方案比激光雷达贵但精度高、延迟低适合需要高度同步的群舞。当然激光雷达也不是完全没用。如果机器人需要在舞台和观众区之间自主移动或者需要在非结构化环境里做避障激光雷达就有价值了。但纯舞台表演它通常不是核心传感器。4.2 集群协同的难点不在通信在时间同步“集群协同”是另一个容易被神化的词。八台机器人跳群舞听起来很“集群”但实际的技术难点和无人机集群不太一样。无人机集群的核心是位置协同——每台无人机知道自己在编队中的位置然后飞过去。人形机器人集群的核心是时间协同——每台机器人要在同一时刻做同一个动作误差不能超过几十毫秒。因为人眼对动作同步极其敏感两台机器人相差100毫秒看起来就像“没对齐”。时间同步怎么做常见方案是统一时钟源 动作触发信号。所有机器人通过有线或无线网络连接到一个主控电脑主控在动作开始时广播一个时间戳每台机器人根据本地时钟和网络延迟补偿计算出自己应该在什么时刻执行动作。这个补偿算法需要处理网络抖动否则同步精度会下降。我见过一个团队用WiFi做同步结果现场观众的手机信号干扰了网络导致两台机器人动作延迟了200毫秒肉眼可见地“抢拍”。后来他们换成了有线同步问题才解决。所以舞台表演的通信方案可靠性比带宽重要得多。4.3 具身智能在舞台场景里的真实水位“具身智能”是这两年最热的词之一。它的理想状态是机器人通过身体与环境的交互自主学习和适应任务。但舞台表演离这个理想还有相当距离。当前舞台表演里的“智能”更多体现在底层自适应上。比如机器人能感知到地面稍微有点滑自动调整步态能感知到电机温度升高自动降低功率。这些是反应式智能不是规划式智能。它不会自己决定“今天跳个新舞”也不会根据观众反应调整动作。真正的具身智能需要机器人具备任务级理解和自主决策能力。比如你告诉它“去把那个箱子搬过来”它能自己分解任务、规划路径、处理意外情况。这个能力目前在实验室里有一些demo但离舞台表演这种高可靠性场景还很远。所以我的判断是宇树开幕式舞蹈展示的是优秀的工程整合能力而不是通用具身智能的突破。它把预编排、实时控制、集群同步这三件事做到了很高的完成度这本身就非常了不起。但把它等同于“机器人有了自主意识”就过度解读了。5. 如果你想自己复现一个简化版从仿真到真机的路径5.1 先想清楚你要复现的是哪一层很多人一上来就想“我也要让机器人跳舞”但没想清楚自己要做的是编排层、控制层还是同步层。这三层的难度和所需资源完全不同。编排层在仿真里设计动作轨迹输出关节角度序列。需要运动学、动力学基础工具用 MuJoCo 或 Isaac Sim。控制层让真机跟踪轨迹并保持平衡。需要控制理论、强化学习或MPC经验工具用 ROS2 实时控制器。同步层多台机器人时间对齐。需要网络编程、时钟同步经验工具用 ROS2 的tf2和自定义同步协议。我的建议是从编排层开始用仿真验证动作可行性再考虑上真机。直接上真机调动作摔一次可能就修不起了。5.2 仿真环境搭建的最小可行方案如果你有一台还不错的电脑可以这样起步安装 MuJoCo 或 Isaac Gym。MuJoCo 轻量、免费适合入门Isaac Gym 支持GPU并行适合强化学习训练。找一个现成的人形机器人模型。宇树、Unitree 官方有提供 URDF 模型可以直接导入。写一个简单的PD控制器让机器人保持站立。PD参数需要调先调重力补偿再调姿态保持。设计一个简单动作比如“抬左手”。用关键帧插值生成关节角度序列让机器人跟踪。观察仿真里机器人是否稳定。如果不稳检查质心位置和支撑多边形的关系。这个流程跑通你就理解了预编排的基本逻辑。接下来可以尝试用强化学习替换PD控制器看看训练出来的策略和手工调参有什么区别。5.3 真机部署时最容易忽略的三件事第一电机延迟。仿真里电机是瞬时响应的真机有几十毫秒延迟。这个延迟会让高频控制回路失稳。解决办法是在仿真里加入延迟模型或者降低控制频率。第二关节摩擦。仿真里摩擦是理想化的真机上每个关节的摩擦都不一样而且随温度变化。这会导致同样的力矩指令实际角度不同。解决办法是做摩擦辨识或者在控制里加积分项补偿。第三通信抖动。如果你用无线通信延迟抖动可能达到几十毫秒。对于需要精确同步的动作这个抖动是致命的。能用有线就用有线不能用有线就做时间戳补偿。提示真机调试时永远先让机器人做“最小动作”——比如只动一个关节幅度很小速度很慢。确认没问题再逐步加大。我见过太多团队一上来就跑全套动作结果机器人直接拍在地上。6. 关于“真智能还是遥控编排”的最终判断回到标题那个问题。我的判断是宇树开幕式舞蹈是“预编排为主、实时控制为辅、集群同步为保障”的工程作品不是遥控也不是通用智能。它展示的核心能力是在高度结构化的环境里让多台高自由度机器人精确、稳定、同步地执行复杂动作。这个能力本身非常有价值它是人形机器人从实验室走向实际场景的必经之路。但它和“机器人自己决定跳什么舞”是两回事。如果你关注的是具身智能的长期发展那舞台表演只是一个能力展示窗口不是技术路线的终点。真正值得关注的是这些机器人在非结构化环境里能不能自主移动、能不能处理意外、能不能理解任务。这些问题的答案目前还在实验室里慢慢积累。我自己在这个领域踩过的最大坑就是把演示效果等同于技术成熟度。早期看到一段机器人后空翻视频兴奋得不行觉得通用机器人马上要来了。后来自己上手调才发现那段视频背后可能是几百次失败、几十次维修、一个团队几个月的调试。演示是冰山一角水面下的工程量才是真相。所以下次再看到机器人跳舞你可以欣赏它的工程完成度但不必急着给它贴上“智能”或“遥控”的标签。技术的事拆开看比站队有意思得多。
上一篇/下一篇内容由系统自动关联 返回资讯列表 →