现场去体验了觅蜂的Ego和UMI产品后,发现最关键的不是硬件。
今天我们去了觅蜂2w套 MEgo 下线的现场。一方面我们想亲手看看 Ego 这类设备戴起来、跑起来到底怎么样UMI 形态的产品能不能把人的动作顺滑地采下来另一方面我们也想看下这两万套终端出去之后数据的回流和infra现在搭建的如何了。这次见到了很多熟人姚卯青、茂青觅蜂的VP、还有力哥觅蜂技术负责人。除了设备数量这家成立刚半年的公司还累计生产了超过 100 万小时真实世界数据。虽然具身圈里各家都在扩大数据规模。但半年做了这么快推进速度依然不多见。原文链接现场去体验了觅蜂的Ego和UMI产品后发现最关键的不是硬件。01 姚卯青说物理AI可能需要的数据在亿级行业正在形成一个共识大模型在互联网里吃到了海量文本和图像机器人却没有一座可以随手取用的「物理世界互联网」。每一次抓取、拧转、推拉和接触都要重新采集场景、物体或机器人本体一变数据分布也会跟着变化。觅蜂董事长姚卯青在现场判断物理 AI 所需数据很可能以千万小时、甚至上亿小时计。问题也随之而来这么多数据从哪里来觅蜂给出的路径是先把采集设备铺进真实世界再用一套完整的数据管线把人的操作经验转成机器可以学习的样本。姚卯青这次把它比作物理 AI 的「数据电网」。这个比喻挺有意思场景和数采员织起来的网。02 他们的Gripper和Ego设备目前行业里最常见的无本体数采大致有两类Ego 和 UMI。觅蜂自研的两套设备正好沿着这两条路线展开MEgo View 对应 EgoMEgo Gripper 对应 UMI。一个负责把真实场景的规模化展开一个负责让采集动作更接近机器人。我们现场试戴了MEgo View一个头环2个腕部设备组成头环有3个相机两个腕部则是各一个相机负责采集手与物体交互/动作的细节。两个视角合在一起能够减少开放环境中的遮挡也让模型知道这只手是在什么场景里、为了什么任务、对哪个物体做出了动作。还有MEgo Gripper。它沿用了 UMI 的夹爪形态并在此基础上加入触觉采集。我们现场测试了下三个相机中间是鱼眼直接拿着夹爪抓取杯子设备会同步记录夹爪动作、末端轨迹与接触过程。人手的操作经验也因此更早一步被转成接近机器人末端的数据形态。现场试了下他们的UMI设备茂青在现场用四个词概括这套设备的设计思路以人为中心、随行、轻量、无界。在产品设计上他们就是主打无线、尽量减少束缚以及支持快速更换电池。这些听起来像体验问题却会直接影响采集者愿意戴多久、设备能进入多少种环境。只有设备得先跟着人进入真实世界后面的数据网络才铺得开。03 这些设备在真实场景是怎么用的模态是怎么样的那真的到场景现场设备怎么用的比如UMI和Ego类产品。觅峰给出了一个参考这 100 万小时目前由三部分组成纯Ego数据占约 50 万小时EgoWrist 腕部数据约 35 万小时EgoUMI 夹爪数据约 15 万小时。三种形态一层层往机器人真实任务靠近。Ego 裸手负责把场景铺开EgoWrist 补上腕部视角与连续轨迹EgoUMI 再把动作拉近机器人夹爪并加入触觉信息。采集粒度越往后越细数据也越接近机器人真正执行任务时的状态。形态变了但还有一个关键问题多模态能不能对齐。整套 MEgo 体系会采集 RGB、Depth、IMU、触觉和音频等信息。按照觅蜂披露各通道通过硬件级同步实现亚毫秒级对齐。而要让这样的数据持续产生设备就得离开实验室。茂青说目前两万套设备已经进入家庭、办公、零售、生产、餐饮等真实环境采集的数据都是真实的。设备规模有了那后面的问题就是采回来的数据究竟够不够真实、够不够多样04 还有任务派发平台现场还看到了他们正在内测中的「觅蜂派」App。前端面对的是分散在不同场景里的采集人员今天采什么任务、用哪一种设备、需要完成多少次都要在这里被拆成可以执行的工单。我们和现场的产品经理开玩笑也许后面这个会像美团 or 滴滴这种方式。让有兴趣、有需要的人都参与进来。在具身里这个平台既能向采集人员分发具体任务也能回看采集与治理进度。这个环节没有 Gripper 和多目相机那么抢眼却决定了两万套设备能不能真正连成一张网络。规模一上来任务定义、人员调度、数据回传和质量状态便很难继续靠微信群和表格维持。05 后面给模型的数据分布应该是怎么样的这个问题其实是在前端和平台问题解决之后需要重点关注的。因为场景数据采集后就到模型那边了。模型能否泛化全靠这些。按照觅蜂披露这 100 万小时数据中82% 来自居住、办公、零售、生产、仓储、餐饮、文娱休闲、交通出行八类高频场景其余数据分布在公共服务、物流、医疗、教育、养老、文旅、汽车服务、农业生产等 14 类长尾场景。整个数据集覆盖 22 大类场景、1 万余个真实环境、5 万余类物体和 500 余种细分任务。高频场景提供通用动作的密度长尾场景补充任务分布的宽度。真实采集只是第一道门槛能否覆盖足够多的物体、动作、遮挡和失败情况才决定模型最终能从中学到多少。06 数据是怎么保证可以被模型消费掉任何一个真正做过具身数据的人都知道数据「采下来」和「能训练」之间还有很长一段距离。麻烦恰恰来自真实世界。人的手会高速运动会被物体遮挡会和别人的手交叉也可能戴着厚手套。光照在变视角在变任务进度也不会像实验室脚本那样整整齐齐。采集规模越大脏数据、时序漂移和标注误差也会被同步放大。所以在现场我们一直在关注 MEgo Engine。数据技术负责人刘力把它概括为一套数据全链路技术体系底层是「RGB-D X」RGB 与深度提供视觉和空间信息X 则按任务继续叠加 IMU、触觉、音频等模态。往后MEgo Engine 覆盖数据处理、感知、标注和质量评估并通过位姿重建与动作映射把手部、身体、头部、机器人末端和环境信息转成统一的空间数据。而任务派发端与运维平台则负责把设备、采集人员、任务和数据回流串起来。从这个角度看采集硬件只是入口。觅蜂交付的是一条从任务下发、数据回流、自动治理到最终交付的流水线。还有一个很有意思的是他们的HandPose 高精度手部重建技术。这套方案把五目全景感知、鲁棒手部追踪、三目深度融合、参数化手部重建和轨迹恢复串在一起用来处理开放环境中的遮挡、多人交互与快速运动。按照觅蜂现场披露的测试结果其七项核心指标达到 SOTAPA-MPJPE 重建误差较测试中的次优方案降低 62%Jitter 帧间抖动降低 93%。这组指标展示的是算法结果更能说明问题的还是它要面对的具体场景。现场还有几个有意思的例子。在美甲场景里系统需要区分采集者与服务对象两双不断交互的手制作奶茶时手部会被杯具大面积遮挡。觅蜂称在手部可见率低于 30% 的情况下系统仍能完成亚厘米级三维重建并保持零跟踪丢失。给宠物洗护时快速运动造成的模糊和泡沫引起的外观变化会同时出现到了模具维修操作者戴着厚工业手套系统依然要估计稳定的手部姿态。开放世界里是否可以解决这些最常见的难点比如遮挡、模糊、多人交互、外观变化以及非标准动作等。往往决定了我们把具身放到“物理世界”中这个命题是真是伪。07 两家大客户一个是腾讯一个是京东发布会现场的两项合作很有代表。一个是面向模型一个是面向场景。京东是场景侧。现场第 20,000 套 MEgo 正式交付京东现场姚卯青也与京东副总裁何贺进行了一场对谈。设备最终会落到哪个具体业务环节发布会没有展开我们不替它预设答案。可以确认的是京东能够提供实验室难以复制的真实流程、真实物体和持续变化的工作现场。对一家数采公司来说这类场景入口往往比一次采购本身更重要。腾讯 Robotics X 实验室则是模型侧。这次达成的是无本体数据业务合作觅蜂将为腾讯的具身模型建设提供数据支持。一端持续产生真实任务一端提出模型需求中间由采集设备、数据治理和运营系统连接起来。觅蜂所说的「数据电网」这里才真正出现供给方和使用方。08 还有一些未解决的问题现场我们发现了一些没有解决的问题茂青来展开的。一类是拧螺丝等高精度任务。这类操作对末端轨迹、力与触觉的要求更高。另一类是 whole-body 数据。很多移动操作任务需要同时知道头、手、躯干和脚在做什么现有产品对全身协同的覆盖还不完整。这两点很重要虽然现在没有解决但现场透露他们已经有面向 whole-body 数据设备的研发在推进了。百万小时已经很大但和姚卯青判断的千万乃至上亿小时需求相比行业仍处在早期。重磅全网首个具身智能开源知识库来啦技术/产业/投融资/上下游推荐阅读真机强化入门的一套完整教程pi*0.6复现方案我们用低成本的机械臂完成pi0/pi0.5/GR00T/世界模型等VLA任务具身智能的WAM与世界模型一份完整指南一览具身智能的行业全局从产品经理的角度出发VLARL方向首个系统教程来啦Online RL/Offline RL/test time RL等好用高性价比面向具身科研领域打造的轻量级机械臂VLA/VLA触觉/VLARL/具身世界模型等具身大脑小脑算法与实战全栈路线来啦~从零训练你的足式机器人让你的足式机器人真正动起来~1v1 科研论文辅导来啦重磅具身智能之心论文辅导来啦近20方向顶会/顶刊/SCI/EI/中文核心/申博等
上一篇/下一篇内容由系统自动关联
返回资讯列表 →