尧图精选

LISA

🕒 发布时间:2026/9/25 18:08:53 📁 来源:尧图网络
1. 提出的新任务Reasoning Segmentation和传统 Referring Segmentation 很像但最大的区别在于 query。普通 referring segmentation用户已经明确告诉模型目标“the trash can”Reasoning Segmentation模型需要自己推理“something that the garbage should be put into”garbage should be put into → trash can所以这个任务实际上要求两个能力理解隐式指令 产生像素级 mask2. 为什么普通多模态 LLM 不够像 LLaVA 这样的模型可以image text → text它能回答“The object is an orange.”LLM 本身并不擅长直接输出 segmentation mask 这种 dense prediction。因此论文的问题变成怎么把 LLM 的语义/推理能力接到 segmentation 上3. LISA 最核心的设计SEGtoken作者在 LLM 的词表里加入一个特殊 tokenSEG比如模型接收到What is the food with the most Vitamin C? Please output segmentation mask.LLM 可能生成It isSEG.真正关键的不是SEG本身而是它在 LLM 最后一层对应的 hidden embedding把这个 embedding 取出来再经过一个 MLP这个可以理解成LLM 对“当前到底要分割什么”的内部语义表示。与此同时图像还会经过一个视觉 backbone得到 dense visual features。最后 decoder 同时接收和生成 mask也就是LLM负责 What Vision Backbone负责视觉信息 Decoder负责 Where这就是论文所谓的Embedding-as-Mask。4. 整个网络可以理解成两条支路第一条推理支路负责“用户究竟想分割什么”第二条视觉支路负责“图像中各个位置、边界、局部特征是什么”然后二者汇合所以本质上并不是让 LLM 自己画 mask而是让 LLM 产生一个指导 segmentation 的语义 query5. 为什么不让 LLM 直接输出 mask前面的 VisionLLM 有一种方案坐标序列然后让 LLM 自己生成这样 mask 就被转换成 token 序列了。但问题是polygon 序列可能很长精细边界很难用有限坐标表示LLM 不擅长精确预测大量空间坐标训练代价很高。LISA 的思路更简单LLM 不需要学“怎么画边界”。LLM 只要告诉 segmentation decoder“要找的是哪个目标”让专业的视觉 decoder 负责精细 mask。6. 训练数据怎么构造作者主要用了三类数据。第一类是Semantic Segmentation例如 ADE20K、COCO-Stuff 等。原始数据可能是Image pixel\ label作者改造成Can you segment the table?回答It isSEG.然后用 table 的真实 mask 做监督。第二类是Referring Segmentation例如 refCOCO、refCOCO、refCOCOg。比如原来的描述“the lady with the blue shirt”转换为Can you segment the lady with the blue shirt?第三类是VQA 数据。VQA 数据本身没有 mask但保留下来主要是为了避免模型在训练 segmentation 后丢失原有的对话能力、图像理解能力、文本生成能力论文的 Figure 4 就是在展示这三类数据的统一训练形式。7. Loss 怎么设计模型有两种输出一种是语言输出所以有即普通 autoregressive cross-entropy。另一种是 mask所以有用最后总 loss因此训练时既保证模型还会说话又保证SEGembedding 能真正用于生成 mask。8. 很有意思的一点最开始甚至没有 Reasoning Segmentation 训练数据这是这篇论文比较重要的发现。模型一开始只用SemanticSeg ReferringSeg VQA 这些数据训练。里面其实没有“维生素 C 最高的食物”这种真正的 reasoning segmentation 样本。但模型仍然能够 zero-shot 做 ReasonSeg。作者想说明LLM 预训练阶段已经具备一定 reasoning / world knowledge 而他们真正要学的是怎么把这种能力连接到 pixel mask。后来再加入只有239 条 ReasonSeg 训练数据性能还能明显进一步提升。9. 还构建了 ReasonSeg benchmark因为之前没有专门评估 reasoning segmentation 的 benchmark所以作者构建了ReasonSeg共1218 个 image-instruction-mask 样本。其中train239、val200、test779query 包含 short query 和 long query两者都要求一定的常识或推理。10. 实验结果说明了什么传统模型OVSeg26.1GRES21.3X-DecoderSEEM24.3Grounded-SAM在 ReasonSeg 上表现都比较差。而 LISA-7B 已经能达到36.8换成更强的 LLaVA1.5 48.7再换 13B 并加入 reasoning fine-tuning61.3 提升非常明显尤其是在 long query 上更明显。7B → 13B这说明这个任务的瓶颈很大程度上不是“mask画不准”而是“问题有没有理解对”所以更强的语言理解 / reasoning 模型会直接提高 segmentation 表现。11. 和“两阶段方法”相比为什么更好一个很自然的方法是也就是说LLM 先输出文字答案然后 segmentation 模型根据文字找目标。论文也做了这个 baselineLLaVA1.5 OVSeg但效果明显不如 LISA。作者认为主要有两个原因第一两阶段方法是完全分开的没有 end-to-end optimization。第二中间只通过文本“orange” 来传递信息会丢掉很多 LLM 内部已经形成的信息。LISA 直接用hidden embedding里面可能保留了更丰富的图像、语言和上下文信息。12. 这篇论文最值得记住的是什么我觉得不是某一个网络细节而是这个思路以前 segmentation 研究更多关心怎么把物体边界分得更准而 LISA 开始关心模型到底有没有理解“我要分割什么”它实际上把问题从pixel perception推进到了reasoning → grounding → pixels整篇论文可以压缩成一句话用 MLLM 理解和推理目标用 segmentation model 把目标落到像素上而SEGhidden embedding就是连接这两个世界的接口。它不是单纯设计了一个更好的 segmentation backbone而是在解决“高层语义/推理能力如何 grounding 到 dense prediction”这个问题。
上一篇/下一篇内容由系统自动关联 返回资讯列表 →