尧图精选

ExpVG: Investigating the Design Space of Visual Grounding in Multimodal Large Language Model

🕒 发布时间:2026/9/13 20:05:16 📁 来源:尧图网络
ExpVG论文总结与关键部分翻译一、文章主要内容本文围绕多模态大语言模型(MLLMs)中的视觉接地(VG)问题展开,以广泛使用的LLaVA-1.5为基准模型,系统探究影响MLLMs视觉接地性能的设计选择,最终提出优化方案并显著提升模型性能。研究聚焦两大核心方向:视觉接地范式设计:系统考察边界框(bbox)相关设计,包括预测格式(十进制、整数、位置令牌等五种)、归一化类型(归一化/非归一化)、监督格式(独热编码、等标签平滑等四种)、边界框格式(左上角右下角坐标等三种)。实验发现,整数预测格式(如“[61, 36, 92, 83]”)、基于图像分辨率的归一化、独热标签结合交叉熵损失、左上角右下角坐标的边界框格式,是最优范式组合。视觉接地数据设计:研究多任务训练协同效应、对话数据组织方式(去重/原始/缩放原始)、对话轮次上限(1-10轮)及训练轮次(1-7轮)对性能的影响。结果表明,仅使用视觉接地数据(而非结合VQA数据的多任务训练)、去除对话中重复答案样本、设置3轮对话上限、训练4轮,能实现最佳数据利用效率与模型性能。最终,整合所有最优设计后,模型在RefCOCO/+/g数据集上较LLaVA-1.5分别提升5.6%、6.9%、7.0%,为MLLMs视觉接地能力的后续发展提供明确指导。二、文章创新点系统性设计空间探索:填补现有研究中MLLMs视觉接地设计缺
上一篇/下一篇内容由系统自动关联 返回资讯列表 →