尧图精选

G‑MARK:基于知识图谱的协同自动驾驶接地多智能体推理框架

🕒 发布时间:2026/10/1 9:29:01 📁 来源:尧图网络
G‑MARK:基于知识图谱的协同自动驾驶接地多智能体推理框架论文来源:arXiv:2608.19964v1摘要自动驾驶系统运行在部分可观测环境下,安全关键目标可能被遮挡,仅能被周边联网车辆观测。车‑车协同可以降低这种不确定性,但现有协同驾驶方法大多将多智能体证据压缩为隐式特征或者多模态隐藏状态。该处理方式会丢失关键信息:哪个智能体观测到该目标、自车是否可以看到该目标、冲突证据如何影响下游决策。本文提出G‑MARK,一套接地多智能体推理框架,将协同的以目标为中心的观测转换为具备来源溯源能力的知识图谱(KG)。生成的知识图谱完整保存目标假设以及对应的来源归属、自车‑协作车可见性、不确定性、证据冲突、空间关系、规划相关上下文。G‑MARK从知识图谱导出共享特征表示,通过轻量任务头支持目标推理、运动预测、控制选择、轨迹预测。与SOTA基线相比:G‑MARK遮挡推理精度提升42.2%,控制选择误差下降13.1%;在轨迹规划精度接近的前提下,结构化通信载荷降低25.6倍。本文全部代码已开源。关键词:协同自动驾驶;多智能体知识图谱;车车通信;运动规划1 引言自动驾驶系统需要基于不完备、视角依赖的观测做出安全关键决策。对规划至关重要的物体可能被遮挡、处于自车视场之外,只能被其他联网协作车辆观测。车‑车(V2V)协同可以在多智能体之间共享互补的场景观测,缓解部分可观测问题。但当自车需要推理自身没有直接观测到的物体时,系统不能只保存物体假设本身,还需要保留溯源信息:哪个智能体观测该物体、观测可靠性、该物体对下游规划的影响原因。现有协同感知分为早期融合、晚期融合、特征级融合,目标是聚合多智能体观测得到更优感知输出,通常把共享证据压缩为隐式特征图或者最终检测结果。压缩过程会丢失下游推理所必需的证据结构,下游模块无法获知:哪一个智能体支撑该目标假设、自车是否直接观测物体、目标估计还残留多大不确定性。近期基于大语言模型、视觉语言模型的驾驶系统,通过视觉问答、解释生成、行为规划、语言条件控制开展高层驾驶推理。V2V‑LLM、V2V‑GoT将该范式拓展到多智能体推理,但中间状态一般是提示词、生成文本、自由文本推理、隐式多模态特征,不是结构化、面向目标的协同证据,对于依赖协作车辆观测的安全关键决策,可追溯能力不足。能力协同感知/V2X融合语言/VLM驾驶推理结构化场景知识图谱推理协同语言推理G‑MARK(本文)多智能体证据✓△—✓✓目标来源溯源——△△✓自车/协作车可见性—△—△✓不确定性/冲突证据—△△△✓规划相关性△✓△✓✓跨任务可复用—✓△✓✓通信效率△△—△✓✓:显式建模;—:没有显式暴露;△:部分支持本文提出G‑MARK,接地多智能体推理框架,将协同驾驶场景表示为具备溯源能力的知识图谱。运行在感知层之上,接收处理完成的多智能体观测,把兼容观测关联为共享目标假设;对弱匹配、未匹配观测不直接丢弃,保留为不确定候选。生成图谱显式存储来源智能体支撑、自车‑协作车可见性、不确定性、智能体之间证据冲突、空间关系、运动线索、规划上下文。基于知识图谱的任务头查询图谱,支持目标接地、遮挡推理、隐藏目标发现、运动预测、控制选择、轨迹预测。在V2V‑GoT‑QA协同驾驶基准开展评测,对比V2V‑GoT基线:遮挡推理提升42.2%,隐藏目标发现提升12.3%,控制选择误差降低13.1%;未来轨迹预测平均L2误差接近基线,但结构化通信开销降低约25.6倍。本文主要贡献构建具备溯源能力的协同知识图谱:保存目标假设、来源智能体支撑、可见性、不确定性、证据冲突、空间关系、运动线索、规划上下文。提出任务条件延迟证据融合策略:保留仅来自协作车的弱观测,交由下游任务自行判断证据相关性。仅依靠紧凑结构化通信,实现目标推理、运动预测、控制选择、未来轨迹预测多项任务。2 相关工作2.1 协同感知与V2X融合通过共享原始观测、目标预测、学习特征、BEV表征、稀疏空间消息提升单自车之外的场景理解,代表工作Where2Comm、V2X‑ViT、CoBEVT。该类方案感知主干效果很强,但融合输出很少将来源支撑、自车/协作车可见性、不确定性、证据冲突作为可复用的目标级证据对外暴露。2.2 语言与VLM驾驶推理语言、多模态大模型被用于驾驶问答、解释、规划、控制,将自动驾驶评测从感知准确率拓展到推理任务:目标接地、场景理解、决策解释、规划。但大多是自车视角,不面向协同V2V证据。2.3 结构化场景与知识图谱推理结构化场景表示、知识图谱用显式实体‑属性‑关系完成视觉推理与决策;DriveLM、KLDrive证明结构化场景事实可以支撑可解释、面向规划的推理。现有驾驶知识图谱大多面向自车场景、语言问答高层事实,不处理V2V协同证据。2.4 协同语言驱动推理LangCoop、CoLMDriver、V2V‑LLM、V2V‑GoT将语言推理拓展至多智能体驾驶。与G‑MARK任务范围最接近,但中间状态一般是语言消息、生成答案、推理轨迹、多模态隐激活,而不是显式目标级证据。G‑MARK使用溯源知识图谱,下游预测可以追溯到来源智能体、可见性事实、不确定性与支撑观测。3 G‑MARK框架G‑MARK是运行在协同感知流水线之上的协同推理层。输入是处理完毕的多智能体场景工件:目标检测/跟踪、智能体位姿、置信度、规划上下文;不直接读取原始相机、激光雷达数据流,把已经处理完成的协同感知证据抽象为结构化图谱表示。核心设计原则:不可逆的证据融合延迟到下游推理任务确定之后执行。不会直接把全部智能体观测合并成单一目标列表;将观测智能体、局部观测、目标假设表示为相互连接的图谱实体。不同推理任务头可以查询同一份协同证据,侧重各自任务关心的因素。G‑MARK四个执行阶段:协同知识图谱生成:每台联网自动驾驶汽车(CAV)感知输出实例化为局部证据知识图谱,包含智能体节点、观测节点、目标假设节点,还没有跨车关联;保守关联:自车侧将不同车辆的兼容局部证据链接为共享目标假设,挂载观测节点作为支撑,保留弱的未匹配候选;协同上下文增强:为每一条假设补充溯源信息、智能体相对可见性、不确定性、证据冲突、空间关系、运动线索、规划相关性;统一KG任务头:增强后的协同知识图谱被任务头查询,完成目标级推理、运动预测、轨迹规划。3.1 协同知识图谱生成G‑MARK将每台联网车辆处理后的感知输出,构建局部证据图谱,再组装成初始协同知识图谱,而不是直接坍缩为扁平化融合目标列表。记ttt时刻可用联网智能体集合At={ a1,…,aNt}\mathcal{A}_{t}=\{a_{1},\dots,a_{N_{t}}\}At​={a1​,…,aNt​​}。智能体aia_iai​在ttt时刻输出Mi,tM_{i,t}Mi,t​条局部观测:Ot(i)={ ot,1(i),…,ot,Mi,t(i)}\mathcal{O}^{(i)}_{t}=\{o^{(i)}_{t,1},\dots,o^{(i)}_{t,M_{i,t}}\}Ot(i)​={ot,1(i)​,…,ot,Mi,t​(i)​}单条观测:ot,j(i)=(xt,j(i),τt,j(i),ct,j(i),ai,t,ηt,j(i))o^{(i)}_{t,j}=\left(\mathbf{x}^{(i)}_{t,j},\tau^{(i)}_{t,j},c^{(i)}_{t,j},a_{i},t,\boldsymbol{\eta}^{(i)}_{t,j}\right)ot,j(i)​=(xt,j(i)​,τt,j(i)​,ct,j(i)​,ai​,t,
上一篇/下一篇内容由系统自动关联 返回资讯列表 →