尧图精选

多模态大模型选型不踩坑:Awesome-Multimodal-Large-Language-Models 实测、看懂、微调完整指南

🕒 发布时间:2026/9/9 19:55:37 📁 来源:尧图网络
多模态大模型选型不踩坑Awesome-Multimodal-Large-Language-Models 实测、看懂、微调完整指南【免费下载链接】Awesome-Multimodal-Large-Language-Models:sparkles::sparkles:Latest Advances on Multimodal Large Language Models项目地址: https://gitcode.com/GitHub_Trending/aw/Awesome-Multimodal-Large-Language-Models手头有一段一小时的视频要处理想挑一个多模态大模型别急着看宣传稿——Awesome-Multimodal-Large-Language-Models 把 MLLM 的论文清单、评测基准、训练数据集都收在了一个仓库里。接下来三步你会知道模型怎么测、方向怎么看、数据怎么挑。这个项目到底能帮你干什么项目由南大 MiG Lab 维护说实话它是进入多模态大模型领域的入场券。它能干的具体事情5分钟看懂领域演进从 2022 年的 PaLM-E、2023 年的 BLIP-2 到 2024 年的 GPT-4V、Gemini哪些模型开源了权重、哪些闭源时间线标得清清楚楚按任务定位评测基准图像理解有 MME、POPE、MMBench视频分析有 Video-MME、V-Bench高分辨率真实场景有 MME-RealWorld一张表对比上百篇论文按指令微调、幻觉、上下文学习、思维链、视觉推理等 8 大方向组织每篇都带发表信息、日期和代码/Demo 链接直接拿训练数据预训练对齐LAION-400M、ShareGPT4V、指令微调LLaVA-Instruct-150K、SVIT、RLHFVLFeedback三类数据集分门别类盯住三个前沿方向实时语音视觉交互VITA 系列、百万 token 长视频Long-VITA、统一理解与生成UfM核心能力拆解只讲最有用的 3 个点论文清单我就不逐条念了讲三个你日常干活最会用到的。实测用 MME 基准给模型做个体检它解决什么问题宣传稿写得再好你也得有个能离线跑出来的基准判断模型到底行不行。怎么实现的MME 把多模态能力拆成感知和认知两大块感知下挂 14 个子任务存在性、颜色、计数、位置、场景、海报、OCR 推理、动作识别等认知下挂 2 个子任务常识推理、数值计算总共 1400 道题。项目提供了数据集和离线评测工具Evaluation 分支的 tools/eval_tool.zip引文格式直接看 images/bib_mme.txtMME-Survey 还把 100 多个 MLLM 基准按时间线做了分类选基准的时候不用一篇篇翻。git clone https://gitcode.com/GitHub_Trending/aw/Awesome-Multimodal-Large-Language-Models # MME 数据集在 HuggingFace评测工具在 Evaluation 分支: tools/eval_tool.zip看懂VITA-1.5 和 Long-VITA实时交互与长视频它解决什么问题你的场景不是发一张图等一句话而是模型得实时看、实时听、还能吞下整段长视频。怎么实现的VITA-1.5 是 NeurIPS 2025 Highlight 工作把视觉和语音统一进同一个 LLM单个模型同时做图像理解和语音对话本地 demo 可以按 1 倍实时速率响应——相当于给模型打视频电话。Long-VITA 则把大模型上下文扩展到 100 万 token同时保持短上下文任务上的领先精度一小时级别的长视频不用抽 32 帧然后祈祷。# VITA-1.5 开源代码与本地 demo: VITA-MLLM/VITAREADME 顶部有链接 # Long-VITA 官方代码: VITA-MLLM/Long-VITA论文表中有链接 # 1M token 上下文适合会议录像这类长视频任务微调按用途挑指令微调和 RLHF 数据集它解决什么问题想微调一个垂直场景的模型却不知道数据从哪拿、怎么挑。怎么实现的项目的 Awesome Datasets 部分把数据按用途分了预训练对齐、指令微调、RLHF 三大类每个数据集都对应到出处论文。指令微调从 LLaVA-Instruct-150K 入门要大规模就选 SVIT4.2M覆盖对话、详细描述、复杂推理和指代问答做偏好对齐的话VLFeedback 是 AI 标注的偏好数据训练方法看 Multimodal RLHF 列表 里的 MM-RLHF 和 Silkie 偏好蒸馏。# 指令微调入门数据: LLaVA-Instruct-150KHuggingFace 可下 # 大规模: SVIT4.2M 条 # 偏好对齐: VLFeedback我实际跑的时候踩的坑现象clone 下来发现仓库里就一个 README以为拿错版本了。原因这是个资源索引仓库不是代码仓库。模型、数据集、评测工具分散在各自官方仓库和 HuggingFace 上。解法别指望clone 完直接跑。README 表格每行都有 Code 和 Demo 列顺着链接找就行MME 评测工具在 Evaluation 分支的 tools/eval_tool.zip。现象模型 MME 分数挺高一到高分辨率图和真实场景就拉胯。原因MME 是 1400 道感知加认知的选择题分数高只说明基本功在线测不出真实部署时的短板。解法多基准交叉验证。POPE 专测物体幻觉EMNLP 2023MME-RealWorld 测高分辨率真实场景Video-MME 测长视频CVPR 2025。Evaluation 论文清单 有 40 多个条目别被单一分数骗了。现象想微调数据集不知道选哪个上来就下最大的那个。原因不同用途的数据集差别很大预训练对齐、指令微调、RLHF 各是一套路数选错浪费一周 GPU 时间。别问我怎么知道的。解法去 Awesome Datasets 部分 按用途找指令微调先用 LLaVA-Instruct-150K要规模和任务多样性上 SVIT需要偏好对齐上 VLFeedback。接下来往哪走想系统补领域知识→ 看 Multimodal Instruction Tuning ( Latest Works) 清单从 BLIP-2 到最新论文全在这README 头部三篇综述MME-Survey、统一理解与生成综述、MLLM 综述适合当书读想搭自己的评测体系→ Benchmarks for Evaluation 收了 40 多个基准覆盖感知、推理、幻觉、视频、图表理解配合 MME-Survey 的分类图给场景锁定基准组合想微调垂直模型→ Datasets of Multimodal Instruction Tuning 有 30 多个指令数据集配上 Multimodal RLHF 里的对齐方法数据和方法都齐了想做统一理解与生成→ 这个方向的模型演进脉络综述图里一张图说清楚了这个仓库不生产研究只做一件事把多模态大模型领域的门一直给你开着——论文、基准、数据集分门别类链接全部现成。想查完整清单或看最新收录直接读仓库里的 README.md那是最全的入口。【免费下载链接】Awesome-Multimodal-Large-Language-Models:sparkles::sparkles:Latest Advances on Multimodal Large Language Models项目地址: https://gitcode.com/GitHub_Trending/aw/Awesome-Multimodal-Large-Language-Models创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联 返回资讯列表 →