InternVL Mantis评测实战:交错图像文本理解能力测试
InternVL Mantis评测实战交错图像文本理解能力测试【免费下载链接】InternVL[CVPR 2024 Oral] InternVL Family: A Pioneering Open-Source Alternative to GPT-4o. 接近GPT-4o表现的开源多模态对话模型项目地址: https://gitcode.com/GitHub_Trending/in/InternVLInternVL 是接近 GPT-4o 表现的开源多模态对话模型CVPR 2024 Oral。本文带你用官方评测脚本完成 Mantis 评测——一套专门测试「交错图像文本理解」能力的基准一条命令跑通新手友好。️ 什么是 Mantis-Eval交错图文理解基准Mantis-Eval 与普通 VQA 最大的不同一道题里会出现多张图片问题需要跨图关联——例如Image-1 里的动物比 Image-2 里的离镜头更近吗。这类交错图像文本interleaved image-text问题考验的不是看图说话而是模型在多视觉输入与文本指令之间来回指代、比较和推理的能力。以仓库内置的两张示例图为例评测时模型会被要求同时理解并对比两张图的信息数据集自带两种题型multi-choice单选模型只需输出选项字母short-answer简答模型用单个词或短语回答 Mantis 评测一键运行从克隆仓库到出分步骤 1获取代码与安装依赖git clone https://gitcode.com/GitHub_Trending/in/InternVL cd InternVL/internvl_chat pip install -r ../requirements/internvl_chat.txt步骤 2运行 Mantis 评测评测数据集会从 HuggingFace 的TIGER-Lab/Mantis-Evaltest 分片自动下载缓存到data/mantis_eval目录无需手动准备数据# 8 卡推荐写法 GPUS8 sh evaluate.sh ${CHECKPOINT} mantis --dynamic # 或直接用 torchrun torchrun --nproc_per_node8 eval/mantis_eval/evaluate_mantis.py --checkpoint ${CHECKPOINT} --dynamic⚠️ 官方特别强调测试 InternVL 1.5 / 2.0 / 2.5 及更新版本时务必加--dynamic开启动态高分辨率推理结果才有可比性。 单卡显存放不下大模型加上--auto官方的 split_model 会自动把 LLM 各层切分到多张 GPU视觉编码器固定在 0 号卡。⚙️ 评测流程解析图片标记、判分逻辑与结果输出评测主脚本 evaluate_mantis.py 的处理链路非常直白加载数据读取 Mantis-Eval 的 test 分片自动下载并缓存图片标记把题干中的image依次替换为Image-1、Image-2并在问题前拼接Image-1: image前缀让模型明确每张图的身份见 evaluate_mantis.py#L52-L100附加提示词单选题追加Answer with the options letter...简答题追加Answer the question using a single word or phrase.自动判分选择题同时接受选项字母与选项原文简答题做大小写不敏感的精确匹配输出结果终端打印 Multi-choice / Short-answer / Overall 三项 Accuracy逐题明细以 JSONL 保存到results/目录。整个推理由 torchrun 启动多进程InferenceSampler将样本均匀切分到各 GPU最后 all_gather 汇总天然支持多卡加速无需自己写分布式逻辑。 Mantis 评测关键参数速查表参数类型默认值说明--checkpointstr模型权重路径--datasetsstrMantis-Eval评测数据集--dynamicflagFalse动态高分辨率切块1.5 版本必开--max-numint6动态分辨率最大切块数--load-in-8bitflagFalse8-bit 量化加载省显存--autoflagFalse大模型自动切分到 8 卡--out-dirstrresults结果输出目录完整参数说明见 eval/mantis_eval/README.mdmantis分支的入口在 evaluate.sh#L491-L499。 读懂评测结果与常见坑结果文件results/Mantis-Eval_时间戳.jsonl每行包含 question / pred / answer / correct 字段方便逐题复盘错因三项指标Multi-choice Accuracy、Short-answer Accuracy、Overall Accuracy 直接打印在终端可用来横向对比不同模型显存不足优先--load-in-8bit其次--auto最后再考虑换更小的 checkpoint版本对比陷阱不同 InternVL 版本若一个开动态分辨率、一个没开分数不可比——对比前统一--dynamic开关。Mantis 之外仓库eval/目录还内置了 MMMU、ScienceQA、VQA、MMBench 等几十个基准全部通过同一个 evaluate.sh 统一调度。把 Mantis 与其他基准拼在一起就能拼出模型完整的评测画像类似的雷达图可以一眼看出各维度的能力轮廓按上面的步骤跑完一轮 Mantis 评测你就掌握了 InternVL 交错图像文本理解能力的量化测试方法——这也是评估多模态模型时最容易区分看图说话与真多图文推理的基准之一。【免费下载链接】InternVL[CVPR 2024 Oral] InternVL Family: A Pioneering Open-Source Alternative to GPT-4o. 接近GPT-4o表现的开源多模态对话模型项目地址: https://gitcode.com/GitHub_Trending/in/InternVL创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联
返回资讯列表 →