自动驾驶视觉CVPR风向:端到端、世界模型与数据评测成焦点
CVPR论文列表放出来那天我的消息群基本是炸的。做自动驾驶视觉的同行都在刷同一件事今年哪些方向值得追哪些方向开始退潮。说实话自动驾驶在CVPR里的存在感一年比一年强前几年大家还在卷BEV感知现在端到端、世界模型这些工作已经直接往最佳论文上冲了。我花了一整周把近几届CVPR主会议和workshop的自动驾驶相关论文捋了一遍再结合arXiv上那些热乎的预印本基本能画出接下来这个周期的焦点版图。这篇文章不整虚的直接按方向讲清楚哪些是真热点、哪些是噱头、哪些值得你上手复现、哪些属于看了标题就可以跳过的。方向比较多建议收藏后按自己手头的工作流挑着看。1. 从论文风向看自动驾驶视觉研究的重心迁移1.1 BEV感知从“独家热点”变成“基本功”如果你从2021年左右开始做自动驾驶视觉应该记得当时BEVBirds Eye View鸟瞰视角出现的时候大家有多兴奋。用Lift-Splat-Shoot、BEVFormer那一套把多目相机特征统一投影到BEV空间一下解决了前后帧时序、跨传感器对齐、以及下游规划器输入空间统一的问题。那时候一篇BEV相关的论文特别好中因为大家都在探索怎么做深度估计、怎么处理投影过程中的特征粘连。但到了现在这个周期BEV已经不算卖点了。打开CVPR的投稿系统标题里还写着“BEV-based xxx”的稿子第一轮审稿就会被质疑novelty不足。不是BEV没用了而是它成了行业基本功。就像你会写SQL才配叫后端工程师一样现在做视觉感知如果还不会构建BEV特征基本等于没入行。论文里再拿BEV当核心创新审稿人只会觉得你在炒冷饭。1.2 端到端范式全面上位模块化方案转入防守同样是近三届CVPR端到端自动驾驶的声量涨幅非常明显。UniAD拿下CVPR 2023最佳论文之后大家算是彻底看清了风向把感知、预测、规划全部放进一个可微分的神经网络里用规划loss反传整个系统不再是天方夜谭而是许多人默认的研究前提。VAD、SparseDrive这些后续工作又把端到端往“稀疏化”“高效部署”方向推了一大截。模块化方案的处境变得微妙。感知出障碍物、预测出轨迹、交给后端的规划器去解优化问题这套流程工程上依然扎实很多量产车也确实是这么做的。但从学术创新角度看模块化工作越来越难在CVPR这种顶会上拿到高分因为每个模块独立优化之后整体性的一致性证明变得很难讲清楚。说白了审稿人也喜欢听一个“整个系统端到端学出来”的故事哪怕工程上落地还有点距离。1.3 数据与评测重新变成必争之地还有一个值得关注的变化数据集的权重在回升。过去大家把数据集当成“顺手做的事”论文核心还是模型结构。但这两年风向变了大家发现模型结构大家都在趋同真正让效果拉开差距的反而是数据覆盖度和评测协议的严谨程度。CVPR的workshop里数据竞赛和benchmark paper的占比逐年增加。这背后的逻辑很简单端到端模型的数据饥饿效应非常强你喂给它一万小时驾驶数据和喂给一千小时效果差距是质的。于是“如何构造更好的自动驾驶数据集”不再是辅助工作而是单独成篇的学术贡献。后面我会单独拿出一节讲这件事。2. 自动驾驶数据集与评测基准新一轮军备竞赛2.1 主流开源数据集的能力边界对比现在做自动驾驶视觉研究绕不开几个老牌数据集。nuScenes有1000个场景每条场景20秒波士顿和新加坡两个城市传感器带激光雷达、毫米波雷达和多目相机最难得是它的标注非常细23类目标、8类属性评测指标用nuScenes Detection ScoreNDS来综合距离误差和类别精度。Waymo Open Dataset则是另一个量级场景更多、激光雷达线数更高且提供了跨多帧的一致性标注适合做时序建模。Argoverse 2的优势在于高精地图和运动预测任务弱化感知强项聚焦轨迹预测。这里放一张表方便你对照选型数据集场景数传感器重点擅长任务典型局限nuScenes1000相机激光毫米波3D检测、跟踪、轨迹场景规模小天气单一Waymo Open超1000片段高线束激光相机3D检测、运动预测采集区域集中交通流偏西式Argoverse 21000双相机激光轨迹预测、地图模式单一场景丰富度有限ONCE/SODA100万帧级相机激光长尾场景、中国式交通标注质量参差任务覆盖窄选数据集这事我踩过几次坑。早先做实验图省事直接拿nuScenes的3D检测指标当模型好坏的标准结果模型在open-set场景下表现很拉。后来才明白nuScenes这类数据集的测试集和训练集分布高度接近你刷的NDS再高也只能说明模型在这一个城市、这几种光照、这几种交通密度下的能力。真到了落地上路遇到暴雨、逆光、非标准车辆完全又是另外一回事。2.2 新数据集的三个创新方向这一轮的数据集军备竞赛方向其实非常聚焦。第一是“破坏鲁棒性测试集”。有些团队开始专门做corruption benchmark在原有数据集上人为注入传感器噪声、运动模糊、曝光异常用来检验模型的“抗造”能力。这个方向我个人很看好因为真实驾驶里传感器是会脏的、镜头是会糊的而这些情况传统数据集往往干干净净完全没覆盖。第二是“长尾场景挖掘”。SODA这类数据集就是专门去收集中国式城市交通里的稀有目标比如三轮车、翻斗车、施工堆、电动自行车逆行种类多达数十类。相比传统数据集里轿车、卡车、行人的“老三样”长尾数据集逼着模型去面对真实世界的不规则性。第三是“带语言标注的多模态数据”。现在大模型这么火自动驾驶也在往这个方向靠。给图像和视频配上自然语言描述比如“前方卡车正在变道左侧有行人准备横穿”这样的数据可以直接用来训练视觉语言模型让车不仅能检测、还能“理解”场景语义。2.3 数据集使用的实操心得给想上手数据集的人几句实在话。第一别只盯训练集指标。真要评估模型的泛化能力单独留出一部分跨季节、跨城市的场景做盲测结果保准比你在官方测试集上看到的更真实。第二注意样本平衡。很多数据集里晴天直路占了大部分雨天、夜间、交叉口场景少得可怜直接拿来训练会让模型变成“晴天直路专用模型”。第三清洗标注比加数据更重要。我见过不少人在一个标注噪声很大的数据集上费劲调参效果还是上不去后来发现是标注框错了大片数据清洗花两天指标直接涨了7个百分点。提示如果你在做一个新方向的实验别一上来就上Waymo那种重数据集。先用小规模数据集把pipeline跑通再把数据规模扩上去能省掉大量排错时间。3. 端到端范式与World Model从感知到决策的合流3.1 端到端模型的训练范式到底发生了什么变化端到端这个词现在有点被用烂了。这里我讲清楚大家说的端到端通常指从传感器原始数据输入到规划轨迹输出中间不经过手工定义的中间表示比如不产出一堆3D框再交给下游。UniAD之所以拿最佳论文就是因为它把tracking、occupancy、motion forecasting全塞进一个统一的transformer架构里用规划目标来联合优化这些任务。VAD这种工作的贡献在于“开环训练、闭环友好”。它不依赖昂贵的高线束激光雷达真值直接用视觉车道线拓扑和动态目标运动状态构造基于轨迹的规划候选集训练时用行为克隆学习专家轨迹。推理时再来一个基于规则的安全检查保证基本不越线。说实话这套方案的工程味道很浓量产落地的可行性强很多。训练范式的变化更值得琢磨。以前是“先训感知、再训预测、最后调规划”每步的监督信号来自真值标注。现在的做法是“直接拿最终轨迹偏差当loss”感知任务变成了辅助监督甚至可以不显式存在。这么做的好处是模型不会把力气花在和最终规划无关的感知细节上训练资源利用效率更高。坏处是如果中间状态崩了你很难判断是感知错了、还是规划器抽风debug难度陡增。3.2 World Model在自动驾驶里的真正用途World Model世界模型是最近刷屏最多的概念但很多讨论都跑偏了。很多人以为它只是个“生成视频”的玩具实际上在自动驾驶里它的定位要硬核得多学一个关于驾驶环境的动态演化模型输入当前状态预测未来若干帧会发生什么。UniWorld这类工作做了一件事用world model把多帧点云和多帧图像统一到一个future prediction space在配准过程中自动生成跨传感器的监督信号。这直接缓解了自动驾驶里一个老大难问题——标注成本太高。waymo、nuScenes里的标注都是人工一帧帧画的world model可以生成大量免费的伪未来真值用来自监督学习。另外world model也被用来做闭环训练的“虚拟考官”。传统开环评测只看你这一帧规划得准不准但驾驶是连续决策问题。用world model搭出一个可交互环境让模型在里面连续开几千公里比单纯刷几帧的规划误差更能说明问题。说白了world model是让模型“先在心里把路跑一遍”的能力对应到人身上叫想象力对应到车上叫安全预判。注意World Model目前还不适合直接作为端到端规划器的主干。原因是它在长尾场景下的预测置信度很难保证一旦预测错了反而会把策略带偏。当前比较稳的做法是让它做数据扩充和预训练真正决策还是交给带安全约束的规划器。3.3 大模型与视觉语言模型进入自动驾驶CVPR这两年的自动驾驶论文里多模态大模型的身影越来越重。DriveVLM、DriveLM这类工作尝试用视觉语言模型做场景理解和决策解释。“前方路面上有一摊油渍可能导致轮胎打滑需要减速避开”这种自然语言形式的推理链条比单纯输出一个障碍物框要丰富得多。我个人判断这条线短期落地难度大原因是推理耗时和不确定性都还压不住。但作为研究的价值不容小觑尤其是可解释性这一块。传统黑盒模型出事之后很难追溯如果模型能用语言描述自己的推断依据至少能给安全团队一个debug的抓手。4. 决策延迟32.8毫秒为什么这个数字能震动行业4.1 “32.8毫秒”代表什么水平热词里有个数字特别显眼决策延迟32.8毫秒。很多人不知道这个数字意味着什么我拆开讲。自动驾驶从传感器曝光到车辆执行控制中间要经过感知、融合、预测、决策、规划、控制一长串环节。传统模块化架构这一整套跑下来通常要150到300毫秒。端到端系统因为绕开了多个中间表示可以把延迟压到50毫秒以内。32.8毫秒这个量级已经属于系统架构和推理引擎都优化得相当到位的水准。为什么大家对延迟这么敏感算一笔账就知道。假设车速72km/h也就是每秒20米。每100毫秒延迟就是2米的额外行驶距离。高速上两车相对靠近2米可能就是生与死的区别。所以决策延迟不是性能指标是安全指标。4.2 延迟在哪几个环节溜走的我梳理过自己参与过的实车系统延迟的大头基本在三个地方。第一是传感器时钟同步。不同传感器的采样时刻和曝光时间不一样如果对齐做得糙光这一步就能吃进去20毫秒。很多团队为了提高精度把图像和激光做精细时间戳插值这个过程很贵。第二是模型推理。大transformer在GPU上跑一次前向算上数据预处理和TensorRT优化不到位的情况30到50毫秒很常见。第三是控制指令链路。规划器算出的轨迹要通过CAN或以太网发到执行器线控底盘的转向电机和制动系统本身还有执行延迟这段物理世界的时间省不掉。4.3 压延迟的几个真正有效的操作降延迟这块我试过不少方案排个序给你参考。先把模型导出成TensorRT并开启FP16这个改动最简单通常能把推理时间砍半。然后开启CUDA Graph把固定的计算图capture起来省掉kernel launch开销对transformer这类小算子密集的模型收益很大。再然后是模型蒸馏用一个轻量模型去模仿大模型的行为小模型跑起来快得多但需要花精力做数据收集和训练。还有一招挺脏但很实用异步流水线。把感知、规划放在不同帧率上跑感知可以低一些比如15Hz规划和控制跑到30Hz以上。这样整体延迟不至于被感知帧率焊死。当然这么做会让下游拿到的是“上一帧”的感知结果需要额外做运动补偿不然车一动起来就有偏差。提示低延迟只是第一步延迟稳定性同样重要。如果端到端延迟平均30毫秒但偶尔抖到200毫秒这简直比特斯拉的幽灵刹车还可怕。做系统时要特别关注p999延迟99.9%分位延迟确保极端情况下也不超标。5. 仿真环境与数据闭环欧卡2自动驾驶插件给研发的启发5.1 自动驾驶研发为什么离不开仿真真实路测的成本高且危险场景难以复现想靠实车把天气、事故、违章这种极端case都撞一遍时间和金钱都不可接受。仿真环境的定位就是在虚拟世界里把长尾场景快速批量跑完把模型训练好、策略调稳了再放到实车上做验证。产业级的仿真方案有CARLA、MetaDrive、nuPlan还有各家车企自研的场景引擎。分层来看SIL软件在环用来跑纯算法逻辑HIL硬件在环把控制器硬件接进来测指令链路VIL车辆在环则是实车和虚拟场景混合。做研究和工程的同学至少把SIL这层用好很多问题都能提前暴露。5.2 从“欧卡2自动驾驶插件”能学到什么有一个容易被当成玩梗、但其实挺有启发意义的项目欧洲卡车模拟2ETS2里的自动驾驶插件。这游戏里的环境是模拟的车辆动力学大幅简化但“感知-决策-控制”的闭环链路一样不少。玩家社区里有人在游戏里实现了车道保持辅助用视觉方式提取车道线信息再通过控制算法让卡车自动保持在车道中央。这件事最大的价值是低成本验证。你在真实车上不敢做的激进实验在仿真和游戏环境里可以随便试。学生在学校没有实车条件完全可以拿这类环境建立起“传感器输入到控制输出”的整体直觉。我认识不止一个算法工程师入行前就是在游戏simulator里玩自动驾驶插件、做车道保持因为这种正反馈来得非常快对培养手感和兴趣非常有帮助。当然要说清楚边界。ETS2的物理引擎不是为自动驾驶仿真设计的轮胎模型、传感器噪声、光照动态都和真实世界差得很远。你在游戏里调好的PID参数直接搬进实车必然翻车。把它当教学工具和思维训练工具没问题当研发验证环境就有大问题。5.3 搭一个最小仿真验证环境的完整步骤想快速搭一个能跑通的自动驾驶视觉闭环仿真环境可以参考我下面这套组合。环境用CARLA 0.9.x配合ROS 2 Humble做中间层通信。模型方面用简单的视觉车道线检测先不急着上大模型。第一步安装CARLA并启动服务端。下载好版本后直接运行./CarlaUE4.sh推荐带-quality-levelLow参数省显卡资源。第二步拉取carla-ros-bridge包把CARLA里的传感器数据转发成ROS话题。第三步在ROS 2里写一个节点订阅图像话题跑车道线检测算法输出车道中心线的横向偏差。第四步再写一个控制节点用PID把横向偏差拉回零输出油门和方向盘转角。第五步加载一个城镇地图设置天气晴朗无风画一条三车道道路把车速限定在30km/h以下开始闭环测试。下面是一段车道线检测节点的伪代码思路# python import cv2 import numpy as np def process_image(image): # 假设 image 是 BGR 格式resize 到固定尺寸 gray cv2.cvtColor(image, cv2.COLOR_BGR2GRAY) blur cv2.GaussianBlur(gray, (5, 5), 0) edges cv2.Canny(blur, 50, 150) # ROI 区域只保留车道线附近区域避免把天空和路边杂迹当车道线 roi edges[300:600, :] lines cv2.HoughLinesP(roi, 1, np.pi/180, threshold50, minLineLength50, maxLineGap100) # 按线段的斜率分成左车道和右车道分别拟合出车道中心 left_xs, right_xs [], [] for line in lines: x1, y1, x2, y2 line[0] slope (y2 - y1) / max(x2 - x1, 1e-6) # 左车道斜率为负右车道斜率为正图像坐标 y 向下 if slope -0.3: left_xs.append((x1 x2) / 2) elif slope 0.3: right_xs.append((x1 x2) / 2) if left_xs and right_xs: center_x (np.mean(left_xs) np.mean(right_xs)) / 2 return center_x - image.shape[1] / 2 # 返回横向偏差 return None这段代码不是生产级方案但能帮你理解闭环里“偏差计算”这一步是怎么来的。在跑通之后你可以慢慢往里面加干扰项比如改雨天、调亮度、加前车障碍让模型一步步接受真实世界的毒打。仿真环境最大的好处就是这个——你想让天气一分钟变八次都可以。6. 安全性与可解释性决定自动驾驶能否落地的最后一公里6.1 自动驾驶安全评价不能只看感知精度很多人在CVPR上刷榜刷习惯了以为mAP、NDS高了就等于功能成熟。实际做落地的都知道真正决定一个自动驾驶系统能不能上的是安全指标。ODD设计运行域先划清楚这辆车在什么道路、什么天气、什么速度范围内允许自动驾驶超出这个域必须安全接管或最小风险操作。如果系统在ODD内都能稳那才叫及格。安全评价常用的是接管率、MPI平均接管里程、碰撞率这些闭环指标。和开环指标不同闭环指标算的是“系统在真实或仿真道路连续开多久不出事”。我在团队里做测试时会强调一点只看平均指标会骗自己要把场景按类型切分来评估高速巡航、城市交叉口、夜间低照明、雨中反光每个切片单独看。如果你的系统只在晴天干路表现好其他场景全面拉胯平均指标还是会被优秀的那部分拉上去这时候分段报告才能暴露真相。6.2 异常感知失效的测试思路感知系统在真实世界的失效模式远比想象中丰富。镜头脏污、逆光炫光、传感器部分遮挡、激光雷达在大雨里的噪点这些都可能导致感知短暂性失灵。更麻烦的是那种“似乎有检测结果但结果完全错误”的情况比如把路边的广告牌上的人像识别成真人或者在阴影里漏检了一辆黑色车。针对这些失效模式常规做法是对抗样本和损坏数据注入。在仿真里可以主动给图像加噪声、给点云加随机噪点、模拟相机曝光异常然后观察系统是否还能做出合理决策。我建议在做这类测试时把“安全兜底机制”当作一个单独功能去测试而不是只看感知模块的分数。比如感知置信度低于阈值时系统是否会自动降级是减速慢行还是直接请求接管降级策略的触发条件和响应时间比感知本身更重要。6.3 可解释性在debug实战中的具体价值黑盒模型出了事故工程团队往往只能对着时间戳回放数据很难定位问题根因。可解释性方法提供了另一种思路通过注意力可视化和saliency map观察模型关注哪些区域。比如在夜间场景如果模型主要注意力停留在路灯上而不是路面的动态目标基本能判断出它对低光照目标的建模有问题需要补这类场景的训练数据。我在实际中更常用的是“决策轨迹回放语言解释”的组合。系统的规划模块会输出候选轨迹集合评估每条轨迹的代价函数比如碰撞代价、变道代价、舒适性代价。如果某次决策异常直接查看各条轨迹的代价变化能很快定位是哪一项代价权重出了问题。这一套原始的可解释性手段比上大模型分析要可靠得多。还有一个容易被忽略的点评测指标本身要可解释。你报的每一项指标都要能落到具体场景和具体模块上。如果OTA版本更新之后正面碰撞率低了你要能回答出是哪个模块的修改带来的改善。答不出来那这个系统你还没理解到位量产是不可接受的。7. 一点个人经验总结盯完这波趋势之后我给自己的时间分配做了一个调整。至少要花四成精力在数据和评测上以前我会花八到九成在模型结构上刷分现在意识到那个时代过去了。模型结构大家都在趋同真正的区分度在于数据质量和评测设计。建议你也做一个动作选一个你最有场景感的方向不一定是端到端这么宏大的命题哪怕是“给已有数据集加一组夜间坏境测试用例”也值得拉开一个项目周期认真做。把数据、训练、评测、闭环验证这一整条链路跑通比什么热门论文都更有增量价值。技术这东西迭代快是常态但底盘是稳的。最终能留下的一定是那些用系统工程思维把事情做到位的人。共勉。
上一篇/下一篇内容由系统自动关联
返回资讯列表 →