尧图精选

第三视角视频如何生成3D GT与动作Token:FSQ与Scaling Law实践

🕒 发布时间:2026/10/1 5:53:08 📁 来源:尧图网络
1. 从第三视角视频里抠出可扩展的监督信号第三视角视频说白了就是别人拿手机或相机在旁边拍你干活。它便宜、量大、几乎无处不在但一直有个尴尬画面里全是像素没有机器人能直接用的动作标签。你想拿它训练一个能操作机械臂或者虚拟角色的模型第一道坎就是——监督信号从哪来。Light-O1 这份技术报告想解决的就是这件事。它的核心主张很直接把第三视角视频当作可规模化scaling的监督来源用一套自动化的管线从原始视频里同时抽出 3D 几何真值3D GT和离散化的动作 token再让模型在这两路信号上一起学。关键词里的3D GT、action tokenizer、FSQ和scaling law基本就是这条链路上的四个关键节点。我先把这条链路用一句话串起来方便你建立全局感视频进来先估计出每一帧的 3D 几何结构作为真值锚点再用一个动作分词器把连续的运动压成有限词表里的离散 token最后观察模型规模、数据规模、token 词表大小这些变量和性能之间是否呈现可预测的幂律关系——也就是 scaling law。这套思路适合谁看如果你在做具身智能、机器人模仿学习、视频驱动的角色动画或者单纯对如何把无标注视频变成训练数据这件事感兴趣那这篇拆解会对你有用。它不要求你手上有真机一台能跑推理的机器加上公开视频数据集就能起步。下面我按为什么这么设计—每一步怎么做—哪里会翻车—怎么验证的顺序把这份报告背后的工程逻辑摊开讲。2. 为什么第三视角视频是块难啃但必须啃的骨头2.1 第一视角数据的瓶颈到底卡在哪做模仿学习的人都知道最理想的数据是动作-观测成对的。第一视角遥操作能提供这种配对操作者动一下机械臂跟着动摄像头记录下画面动作指令同步存下来。干净、直接、因果明确。但它的成本结构很糟糕。每一条轨迹都要占用一台设备、一个熟练操作员、一段真实时间。你想把数据量从一万条推到一百万条成本是线性甚至超线性增长的。更麻烦的是场景多样性——遥操作台通常固定在实验室里光照、背景、物体摆放都高度同质化训出来的策略一到真实杂乱环境就掉点。第三视角视频正好反过来。网上、家庭录像、教学视频里到处都是人在做事的画面视角是旁观者成本接近于零场景多样性天然拉满。问题只有一个没有动作标签也没有精确的 3D 结构。所以核心矛盾就是——如何用算法把缺失的监督信号补出来且补得足够准、足够一致让 scaling 成立。2.2 3D GT 在这里扮演的是什么角色很多人第一反应是直接从视频预测动作不就行了为什么要绕道 3D我的理解是3D GT 起的是几何锚的作用。第三视角视频有个先天歧义同一个二维像素运动可能对应完全不同的三维运动。你看到手在画面里往右移可能是手真的往右伸也可能是相机在往左转。如果模型只学 2D 到动作的映射它会把相机运动和物体运动混在一起学出一个对视角极度敏感、换个机位就崩的表示。引入 3D GT 之后模型被强制在一个视角无关的空间里理解场景物体的三维位置、朝向、手部的三维轨迹。这样不同机位拍同一件事抽出来的监督信号是一致的。一致性是 scaling 的前提——如果标签本身随视角乱跳你堆再多数据也只是在拟合噪声。注意这里的 3D GT 不是激光扫描那种毫米级真值而是从视频估计出来的伪真值。它的价值不在于绝对精度而在于跨帧、跨视角的相对一致性。这一点在后面的误差分析里会反复出现。2.3 scaling law 为什么值得单独拿出来说scaling law 的本质是一句经验判断性能随规模模型参数、数据量、算力呈幂律改善且这种改善在跨越几个数量级时依然可预测。它之所以重要是因为它把要不要继续加数据从玄学变成了工程决策。对第三视角视频这条路线scaling law 要回答的问题更具体当我从 1 万段视频加到 100 万段动作预测误差会怎么降降的斜率受什么影响是受 3D GT 的质量限制还是受 action tokenizer 的词表大小限制如果某个环节先饱和那它就是整条链路的瓶颈继续堆数据就是浪费。Light-O1 报告里把 scaling 拆成几个可控维度来观察这个做法我认为是对的——不把 scaling 当成一个笼统的越大越好而是逐项定位瓶颈。3. 3D GT 的获取从视频估计几何的完整链路3.1 单目几何估计的现实精度从单目视频恢复 3D 结构主流做法是先用一个几何基础模型比如基于 Transformer 的重建网络逐帧或逐片段估计深度、相机内参和相机位姿再把多帧的点云对齐到一个统一坐标系。这条链路听起来成熟实际用起来精度参差。我实测下来的经验是静态场景的几何估计相当可靠动态物体和手部是重灾区。原因不难理解——大多数几何模型是在静态或准静态数据上训的遇到快速运动的手、被手遮挡又露出的物体深度会出现跳变位姿估计会漂移。而操作类视频里恰恰是手和被抓物体最关键。所以 Light-O1 这类工作通常不会直接用原始估计结果而是加一层时序平滑和一致性约束。常见做法包括对相邻帧的深度做滑动窗口中值滤波对相机位姿做光束法平差bundle adjustment式的全局优化对手部区域单独用一个手部先验模型做修正。3.2 把估计结果变成可用的真值原始几何估计出来是一堆带噪声的深度图和位姿不能直接当标签。要变成 3D GT中间要做几件事坐标系归一化把所有帧对齐到一个以场景中心或某个参考物体为原点的规范坐标系消除绝对位置带来的尺度歧义。尺度对齐单目估计没有绝对尺度需要用已知物体尺寸或人体先验把尺度锚定下来否则不同视频之间的1 米根本不是同一个 1 米。关键点提取从几何里抽出真正要监督的量比如手部关节的三维坐标、被操作物体的 6DoF 位姿、接触点位置。置信度标注给每个估计值打一个置信度低置信度的样本在训练时降权或丢弃。这一步很多人会省但它是控制噪声传播的关键阀门。提示置信度阈值不要一刀切。我一般按分位数设比如丢掉置信度最低的 15%而不是设一个固定数值。因为不同视频的置信度分布差异很大固定阈值要么在某些视频上丢太多要么在另一些上几乎不丢。3.3 几何噪声如何影响下游这里有个容易被低估的连锁反应3D GT 的噪声不会老老实实待在几何模块里它会顺着管线污染 action tokenizer 的训练再污染最终策略。举个具体例子。假设手部三维轨迹估计有 2 厘米的抖动噪声。当 action tokenizer 去学这段运动对应哪个 token时它会把抖动也当成运动的一部分编码进去。结果就是同一个真实动作因为估计噪声不同被分到了不同的 token。词表被噪声撑大token 的语义变得模糊模型学到的动作表示自然就散了。这也是为什么报告里强调 3D GT 的一致性而非绝对精度。绝对精度差一点没关系只要同一动作在不同视频里被一致地估计出来tokenizer 就能学到稳定的映射。4. Action Tokenizer 与 FSQ把连续运动压成离散词4.1 为什么非要做离散化连续动作回归不是挺好吗为什么要费劲离散化这是我在很多讨论里被问到的问题。答案有两层。第一层是多模态问题。同一个观测下合理的动作往往不止一个——杯子可以从左边拿也可以从右边拿。连续回归模型倾向于输出这些合理动作的平均值而平均值可能是一个谁都不合理的动作比如直接穿过杯子。离散 token 配合分类式的预测天然能表达要么选 A 要么选 B的多峰分布。第二层是和语言模型的架构统一。现在主流的做法是把动作当成一种外语和文本 token 一起喂给同一个 Transformer。离散化之后动作预测就变成了标准的下一 token 预测可以直接复用为语言模型打磨多年的一整套训练和推理基础设施。这个工程收益非常大。4.2 FSQ 相比 VQ 的取舍动作分词器的主流技术路线是向量量化VQ那一套学一个码本把连续向量映射到最近的码字。但 VQ 有个老大难问题——码本坍缩。训练中往往只有一小部分码字被用到大部分码字成了死权重词表利用率极低还得靠各种辅助损失commitment loss、codebook reset、EMA 更新去救。FSQFinite Scalar Quantization有限标量量化换了个思路不学码本而是把连续向量的每一维直接量化到固定的几个离散档位上。比如每一维量化成 {-1, 0, 1} 三档一个 8 维向量就有 3^8 6561 种组合词表大小直接由维度和档位数算出来不需要学。这个设计的好处很实在维度VQ 路线FSQ 路线码本需要学习可能坍缩无需学习天然满利用辅助损失通常需要多项基本不需要词表大小超参需调由维度×档位直接算出训练稳定性对超参敏感明显更稳表达上限受码本容量限制受维度与档位限制我自己的体会是FSQ 最大的价值不是性能上限更高而是把调分词器这件事的复杂度砍掉了一大半。VQ 调码本大小、调 commitment 权重、调 EMA 衰减每一项都能让你debug一整天。FSQ 你只需要决定维度和每维档位数剩下的基本不用管。4.3 词表大小与动作分辨率的权衡FSQ 的词表大小是维度和档位的乘积。维度越高、档位越多能表达的动作越精细但词表也越大模型要学的分类头越宽每个 token 分到的训练样本越少。这里有个反直觉的点词表不是越大越好。动作本身的有效自由度其实不高——一只手的关节运动去掉噪声后真正独立的变化维度可能就十几维。如果你的 tokenizer 用了 32 维、每维 5 档词表爆炸到 5^32但其中绝大多数组合对应的是物理上不可能或毫无意义的动作。这些空 token会稀释训练信号。Light-O1 报告里把词表大小作为一个 scaling 维度来扫我认为正是想找到这个甜点词表小到能保证每个 token 有足够样本大到能区分开真正不同的动作。4.4 分词器训练中的几个实操坑重建损失和 token 预测损失要平衡。分词器本身要能重建原始动作否则信息丢太多但重建太好又可能过拟合噪声。我一般让重建损失占主导token 相关的正则项权重压得很低。归一化必须在分词之前做。不同视频的动作幅度差异巨大不归一化的话分词器会把幅度当成主要区分特征而不是动作类型。验证集要按视频划分不能按帧划分。按帧划分会让相邻帧同时出现在训练和验证集里指标虚高得离谱这个坑我踩过不止一次。5. Scaling Law 的观察维度与瓶颈定位5.1 三个可控变量模型、数据、词表要谈 scaling先得明确扫哪些轴。Light-O1 这条路线里至少有三个独立变量值得单独观察模型规模Transformer 的参数量从几千万到几十亿。数据规模第三视角视频的段数或总时长。词表规模action tokenizer 的 token 数量。这三个变量的 scaling 行为不一定同步。模型和数据通常呈现比较干净的幂律词表则往往先升后平——太小欠拟合太大样本稀释。5.2 怎么判断哪一环先饱和判断瓶颈的方法其实很朴素固定其他两个变量单独扫第三个看性能曲线什么时候拐弯。如果扫数据量时性能在某个点之后明显变平而同时模型还在欠拟合训练损失仍高于验证损失那瓶颈可能在模型容量。反过来如果模型加大后性能不动但训练损失已经很低那瓶颈可能在数据质量或标签噪声。我特别想强调的是在第三视角视频这条路上瓶颈大概率不在模型而在 3D GT 的质量和一致性。因为几何估计的误差是有下限的这个下限会像天花板一样压住整条链路。你模型再大也学不出比标签更准的东西。5.3 幂律拟合的注意事项拟合 scaling law 曲线时有几个细节决定了你的结论可不可信对数坐标下拟合。幂律关系 y a·x^(-b) 在对数坐标下是直线直接线性拟合即可别在原始坐标下硬拟合。样本点要跨足够数量级。只在 1 倍到 3 倍之间扫拟合出来的斜率基本是噪声。至少要跨一个数量级理想是两个。报告置信区间。单条曲线没有误差棒说明不了任何问题。每个配置至少跑几个随机种子把方差画出来。警惕指标选择。用训练损失拟合出来的 scaling 曲线通常很漂亮但那只是说明模型在拟合训练集。真正有意义的是下游任务指标比如动作预测的准确率或任务成功率。注意如果你的 scaling 曲线漂亮得不像话先怀疑是不是数据泄漏或者指标选错了。真实的 scaling 曲线总是带点毛刺的。6. 从报告到复现一份可落地的实施清单6.1 数据准备阶段的关键动作想复现这条路线数据准备是第一道硬仗。我的建议是按这个顺序推进先小规模跑通全链路。挑 50 到 100 段视频把几何估计、3D GT 生成、分词器训练、策略训练全部走一遍。这一步的目标不是性能是确认管线没有断点。建立数据质量筛查。自动过滤掉几何估计置信度过低、相机运动过于剧烈、遮挡严重的片段。宁可少而干净不要多而脏。统一坐标系和尺度。这一步做不好后面所有跨视频的监督都是错的。划分训练/验证/测试集。按视频来源划分确保同一来源的视频不跨集。6.2 分词器与策略的联合调试分词器和策略虽然是两个模块但调试时最好一起看。我常用的诊断方法是把分词器的重建误差和策略的动作预测准确率画在同一张图上。如果重建误差很低但预测准确率上不去说明 token 的语义和策略要学的目标不匹配。统计 token 使用分布。如果少数几个 token 占了绝大多数使用量说明词表冗余或动作多样性不足。可视化几个典型样本的原始动作、重建动作和预测动作。肉眼看一遍往往比看指标更快发现问题。6.3 常见翻车点与规避翻车点表现规避方法几何估计漂移长视频后半段 3D GT 整体偏移分段处理每段重新锚定坐标系尺度不一致不同视频动作幅度无法比较用人体或已知物体先验锚定尺度词表坍缩少数 token 占绝大部分使用改用 FSQ或加码本均衡正则数据泄漏验证指标虚高严格按视频来源划分数据集scaling 假象曲线过于平滑多随机种子报告方差6.4 评估指标怎么选才不骗自己评估这块我想多说两句因为它是整个流程里最容易自欺欺人的环节。不要只看动作重建误差。重建误差低不代表动作有用可能只是分词器把噪声也重建了。要看下游任务指标。如果这条路线最终是为了驱动机械臂或虚拟角色那就得看任务成功率、轨迹跟踪误差这类端到端指标。要做跨视角测试。第三视角视频的核心卖点就是视角无关性那就必须拿训练时没见过的机位来测。如果换个机位性能就崩说明 3D GT 没起到应有的作用。要做跨场景测试。训练集里没有的物体、没有的背景性能掉多少直接反映泛化能力。7. 我对这条路线的一点个人判断把第三视角视频当成可扩展监督源方向我认为是对的因为它绕开了遥操作数据的成本天花板。但这条路上真正的难点不在模型架构而在标签生成的质量控制。3D GT 的噪声、尺度的歧义、分词器的词表设计每一个环节都在给最终性能设上限。FSQ 的引入是个很务实的工程选择它把分词器从需要精细调参的组件变成了基本不用管的组件让注意力能集中到几何和 scaling 上。而 scaling law 的价值与其说是预测性能不如说是帮你定位瓶颈——当你知道哪一环先饱和就知道该往哪里投人力。如果你打算上手我的建议是从小规模全链路跑通开始别一上来就堆数据。先把 3D GT 的一致性和分词器的 token 分布这两件事看明白再谈规模。这两件事没搞对数据堆得越多你离正确答案越远。
上一篇/下一篇内容由系统自动关联 返回资讯列表 →