尧图精选

vlm clip-llava

🕒 发布时间:2026/9/14 12:58:36 📁 来源:尧图网络
准备录制cs336-assign 1下午和朋友讨论了一下上班梳理了CLIP,image encoder采用的是ViT或者是resnettext encoder采用的是transformer的decodermask attention换成了自注意力机制llava 就是极简风视觉层接一个线性层投影层我习惯叫它对齐层就接入llm。进行指令微调。llava1.5就是将图片更好的处理使用高分辨率的图像并全局和局部融合llava1.6则是采用了更好的融合策略而且对分辨率没有要求这里感觉有点像qwen2.5-vl 动态分辨率的雏形
上一篇/下一篇内容由系统自动关联 返回资讯列表 →