尧图精选

InternVL CLIP Benchmark使用指南:一键跑通20+基准测试

🕒 发布时间:2026/9/15 17:02:47 📁 来源:尧图网络
InternVL CLIP Benchmark使用指南一键跑通20基准测试【免费下载链接】InternVL[CVPR 2024 Oral] InternVL Family: A Pioneering Open-Source Alternative to GPT-4o. 接近GPT-4o表现的开源多模态对话模型项目地址: https://gitcode.com/GitHub_Trending/in/InternVLInternVL CLIP Benchmark 是 InternVL 开源多模态模型内置的标准化评测套件基于 clip_benchmark/ 目录实现可一键完成 20 个数据集的零样本图像分类与零样本文本-图像检索测试支持中、英、日、阿、意多语言评测。它对应 InternVL 1.0 论文 4.3 节的官方评测流程是衡量接近 GPT-4o的开源视觉编码器性能的核心工具。本文带你从零环境到出分数全程只需几条命令。 评测套件能测什么CLIP Benchmark 围绕两大核心任务构建任务参数值说明典型数据集零样本图像分类zeroshot_classification不给模型任何标注直接对类别名打模板打分ImageNet 系列、CIFAR、Flowers、Cars零样本文本-图像检索zeroshot_retrieval计算图文匹配 Recall1/5/10Flickr30K、COCO、多语言 XTD覆盖的数据集超过 20 个ImageNet-1K/A/R/V2/Sketch、ObjectNet 6 大鲁棒性变体加上 CIFAR-10/100、MNIST、STL-10、Caltech-101、SUN397、Food-101、Pets、DTD、EuroSAT、Country-211、VOC2007、VTABFlowers、Resisc45等全部测试命令都已封装在 test_internvl_c_classification.sh 脚本里21 个数据集一次性异步跑完。下图是 CLIP Benchmark 官方的各模型平均排名表数字越小排名越好评测结果就是汇入这张总表的⚙️ 三步完成环境安装第 1 步克隆仓库git clone https://gitcode.com/GitHub_Trending/in/InternVL cd InternVL第 2 步按照根目录的 INSTALLATION.md 完成 Python、PyTorch 等基础环境安装。第 3 步安装 CLIP Benchmark 专属依赖并注册包cd clip_benchmark pip install -r requirements.txt python setup.py develop # 或者手动把当前目录加入 PYTHONPATH # export PYTHONPATH${PYTHONPATH}:$(pwd)依赖清单见 requirements.txt其中tensorflow、task_adaptation、webdataset分别对应 TensorFlow 数据集、VTAB 数据集和 WebDataset 格式的支持缺一不可。 模型权重准备评测需要 13B 视觉编码器权重二选一下载到clip_benchmark/pretrained/目录权重文件格式大小适用模型名internvl_c_13b_224px.pthPyTorch25.4 GBinternvl_c_classification/internvl_c_retrievalInternVL-14B-224px/HuggingFace27.7 GBinternvl_g_retrieval_hf等 HF 系列目录结构如下pretrained ├── internvl_c_13b_224px.pth └── InternVL-14B-224px/模型加载逻辑集中在 clip_benchmark/models/internvl.py按--model参数自动路由到 PyTorch 或 HuggingFace 版本无需任何额外配置。 一键跑通 20 分类基准测试单数据集评测只需一条命令以 ImageNet-1K 零样本分类为例入口为 clip_benchmark/clip_benchmark/cli.pyCUDA_VISIBLE_DEVICES0 python3 clip_benchmark/cli.py eval --model_type internvl --language en \ --task zeroshot_classification --dataset imagenet1k --dataset_root ./data/imagenet-1k/ \ --model internvl_c_classification --pretrained ./pretrained/internvl_c_13b_224px.pth --output result.json关键参数解读--task选zeroshot_classification或zeroshot_retrieval--dataset数据集名20 个可选如cifar10、sun397、vtab/flowers--languageen/cn/jp/ar/it直接切换多语言评测--output结果 JSON 文件包含 acc1、acc5 等指标想全部跑完执行封装脚本即可它会自动把 21 个数据集异步分发到 GPU 上集群用户可修改PARTITION环境变量bash test_internvl_c_classification.sh评测所用的真实图像就是下面这种自然场景照片模型仅凭类别名文本模板即可给出预测 零样本图文检索与多语言 XTD 测试检索评测的命令结构与分类完全一致只改--task和--modelCUDA_VISIBLE_DEVICES0 python3 clip_benchmark/cli.py eval --model_type internvl --language en \ --task zeroshot_retrieval --dataset flickr30k --dataset_root ./data/flickr30k \ --model internvl_c_retrieval --pretrained ./pretrained/internvl_c_13b_224px.pth --output result.json一键脚本覆盖了四组场景脚本内容test_internvl_c_retrieval.shFlickr30K、COCO 中英双语检索共 4 项test_internvl_c_xtd.shXTD 多语言检索EN/ES/FR/ZH/IT/KO/RU/JP 八种语言test_internvl_g_imagenet.shInternVL-G 权重的 ImageNet 系列评测test_internvl_g_retrieval.shInternVL-G 的 Flickr30K / COCO 检索数据集会自动下载到--dataset_root指定目录若下载失败可参考 clip_benchmark/datasets/builder.py 手动放置。 官方评测成绩一览跑完测试后你的结果可以对照 clip_benchmark/README.md 中记录的官方分数验证正确性ImageNet 系列零样本分类平均 82.4IN-1KIN-AIN-RIN-V2IN-SketchObjectNet83.283.895.577.373.980.6Flickr30K / COCO 检索平均 86.6 / 89.0模型Flickr30K 平均COCO 平均InternVL-C86.689.0InternVL-G88.890.9XTD 八语言检索平均InternVL-C 95.1InternVL-G 96.6——其中英文高达 97.398.6中文表现也非常接近。 进阶probe_benchmark 与结果可视化除了跑测试仓库还内置了科研向的 probe_benchmark/ 子目录用于复现论文中的 scaling 实验图表运行python probe_benchmark/scaling_experiments.py收集数据运行python probe_benchmark/generate_table.py生成论文表格各实验原始数据见 scaling_experiment_data2.json完整流程说明在 probe_benchmark/PROBES.md。所有历史评测结果汇总在 benchmark/README.md可用 benchmark/results.ipynb 交互式查看各模型的完整排名表。✅ 常见问题速查测试中断后如何续跑批量评测支持--skip_existing参数自动跳过已完成的数据集。想同时评多个模型把模型列表写入benchmark/models.txt每行model,pretrained格式配合--pretrained_model文件参数即可批量评测输出命名模板化{dataset}_{pretrained}_{model}_{language}_{task}.json。显存不够怎么办13B 权重推理建议单卡显存 ≥ 24GB用CUDA_VISIBLE_DEVICES指定空闲 GPU批量脚本本身已按数据集拆分为多进程可分时段执行。照着以上流程走从克隆仓库到拿到 20 基准测试的完整分数表整个过程就是装依赖 → 放权重 → 跑脚本三步InternVL CLIP Benchmark 把论文级评测压缩成了几行命令的事。【免费下载链接】InternVL[CVPR 2024 Oral] InternVL Family: A Pioneering Open-Source Alternative to GPT-4o. 接近GPT-4o表现的开源多模态对话模型项目地址: https://gitcode.com/GitHub_Trending/in/InternVL创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联 返回资讯列表 →