尧图精选

clipp

🕒 发布时间:2026/10/2 12:09:28 📁 来源:尧图网络
伪装场景COD的难点就在于“目标与背景高度融合”。而 BLIP 这类图像描述模型是在常规数据集如 COCO上训练的它的习惯是寻找图像中最显著、最突出的物体。目标不显著伪装物体如雪地里的白狐、草丛里的狮子、竹节虫本身就是为了“隐身”。BLIP 很容易只描述背景比如生成 There is snow 或 A forest scene完全忽略目标。描述过于泛化可能只生成 There is an animal无法提供具体的类别和细节。产生幻觉Hallucination有时会生成图像中根本不存在的物体比如把树叶看成鸟。图文不符正如你之前担心的如果 caption 错了Mamba 提取的 text embedding 就会变成“错误的语言提示”直接误导 SAM Decoder导致分割出错误的区域。论文MM-SAM其实也意识到了这个问题。图 2 中的例子 There is a fox in the snow 是一个非常理想的结果。在实际操作中作者并没有对 BLIP 进行微调而是依赖 BLIP 的视觉特征Vision Prompt来兜底。注意图 2 的结构BLIP 不仅输出 Caption还输出Vision prompt视觉特征。这个视觉特征包含了丰富的像素级信息即使 Caption 写得不好视觉特征依然能帮助 SAM 找到目标。这也是为什么论文要提出Multi-Level Adapter把视觉特征注入 SAM 的每一层 Transformer。方案二引导式 CaptionPrompt Engineering在调用 BLIP 时不要让它自由发挥而是给它模板提示python# 不要直接 processor(img) # 改成带提示的 inputs processor(img, textDescribe the camouflaged object, its color, texture, and background., return_tensorspt)这样生成的 Caption 会更关注伪装线索。方案三直接改用 BLIP 的文本编码器既然 Caption 质量可能不高外挂 Mamba 又增加了参数量和显存。你可以直接试试用BLIP 自带的 text encoder提取 Caption 的 text embedding。优点省去 Mamba 模型加载显存降低速度变快。缺点BLIP 的文本编码器较短BERT-base语义提取能力可能不如 Mamba。但既然 Caption 本身就短且可能不准确用 Mamba 提取“错误句子的深度语义”反而可能放大错误。这是一个值得做的对比实验。方案四Caption Dropout训练时强制忽略文本在训练时以 10%-20% 的概率把text_features置零或者替换成通用的 An image。这样模型就不会过度依赖可能出错的 Caption而是被迫从 BLIP 的 Vision prompt 和 SAM 自身的图像特征中寻找目标。这能显著提升模型在 Caption 错误时的鲁棒性。方案五微调 BLIP如果有算力如果你有 COD 数据集的文本标注比如 A white fox is camouflaged in the snow可以用 LoRA 微调 BLIP 的文本解码器让它生成更符合伪装场景的描述。但这对算力要求较高。CVC-ColonDB 是结肠镜图像色彩分布特殊偏红/偏暗BLIP caption 质量可能很差。建议检查一下 BLIP 生成的 captionpython# 在 eval_saliency 里临时加打印 if step 3: print(fCaption: {description})如果 caption 是 a a the the 这种垃圾说明 BLIP 对结肠镜图像无效Focal Loss 又放大了这种误差。
上一篇/下一篇内容由系统自动关联 返回资讯列表 →