尧图精选

jina-reranker-v3.5:通过混合注意力与自蒸馏实现更快的列表式重排序

🕒 发布时间:2026/10/1 10:05:17 📁 来源:尧图网络
作者来自 Elastic Elastic https://jina.ai/一款 0.6B 参数的列表式重排序模型在 BEIR 上超越 Qwen3-Reranker-4B重排序速度最高比 v3 快 1.56 倍并且在半结构化检索上的 nDCG10 提升了 9.6。查看 demo: GitHub - liu-xiao-guo/jina-reranker-v3.5 · GitHub今天我们发布 jina-reranker-v3.5这是一款 0.6B 参数的列表式重排序模型。它保留了 jina-reranker-v3 的last but not late交互方式同时让它在企业实际搜索的数据上运行得更快、能力也强大得多。它在BEIR 上达到 63.20 nDCG10以大约少 7 倍的参数量领先于Qwen3-Reranker-4B在长文档上其重排序速度最高比 v3快 1.56 倍。它最大的提升出现在半结构化检索上在字段约束的记录上相比 v3nDCG10 提升了 9.6。我们通过三项改动实现了这些提升。第一采用混合注意力调度用滑动窗口替代大多数全局层同时将最后一层固定为全局注意力。第二根据法律、医疗、金融、多语言和结构化检索中的失败模式精心构建训练数据混合。第三采用三阶段自蒸馏方案其中教师模型和学生模型大小相同唯一的区别在于注意力模式。下面展示了四种基准测试场景中模型质量与参数量之间的关系。jina-reranker-v3.5 在全部四种场景中都处于 Pareto 前沿在我们评估的模型中没有任何模型能够同时做到参数更少且效果更好。在 BEIR 的 13 个数据集上进行英文零样本检索并以对 jina-embeddings-v5-text-small 返回的前 100 个候选结果进行重排序后的 nDCG10 作为衡量指标。红线表示 Pareto 前沿阴影区域表示被支配区域对于其中的每一个模型都存在其他模型在参数量更少、效果更好或两者兼具。jina-reranker-v3.5 以 63.20 的成绩直接定义了这条前沿高于参数量为 1.5B 的 mxbai-rerank-large-v262.45以及参数量为 4B 的 Qwen3-Reranker-4B62.28。在我们评估的模型中没有任何参数量更大的模型能够在 BEIR 上获得比它更好的检索效果。在 MIRACL 的 18 种语言上进行多语言检索采用相同的前 100 个候选结果重排序方案。 jina-reranker-v3.5 以 74.11 的成绩占据 Pareto 前沿中 0.6B 参数量这一位置是所有紧凑型模型中的最佳成绩而 Qwen3-Reranker-4B 则以 76.56 的成绩占据 4B 参数量这一位置。与 jina-reranker-v3 相比单语言提升最大的是约鲁巴语4.4、波斯语3.1和法语3.0。在 RTEB 上进行专业领域检索涵盖法律、金融、编程和医疗语料库。 jina-reranker-v3.5 达到 70.95超过了相同参数规模的 Qwen3-Reranker-0.6B68.41以及参数量为 1.5B 的 mxbai-rerank-large-v270.81而自身仅有 0.6B 参数。在与 Qwen3-Reranker-4B 的 77.68 之间剩余的差距主要集中在少数法律和医疗任务上。在 Struct-IR 上进行半结构化检索采用受控的候选文档池将所有真实文档与第一阶段检索中最难区分的 30 个干扰文档一起注入候选池从而使该评测能够独立衡量字段约束下的区分能力而不受检索覆盖率的影响。 jina-reranker-v3.5 达到 48.3相比 jina-reranker-v3 提升 9.6 个百分点是此次发布中单项最大提升。请注意这一评测方案与 SSRB 检索排行榜不可直接比较。架构列表式重排序会在一次前向传递中为每个候选文档进行评分因此对包含 100 个文档的列表进行完整的自注意力计算会呈二次增长并使 KV 缓存膨胀。显而易见的解决方案是滑动窗口注意力。但在 LBNL 交互机制下这个显而易见的解决方案反而会破坏模型。在 LBNL 中查询和所有候选文档构成一个因果序列而查询嵌入 token 位于序列的最末端。为了构建能够感知跨文档信息的表示它必须一路向前关注到第一个候选文档。有限的窗口会切断这种依赖关系。因此我们始终将最后一层固定为全局注意力这样查询和文档嵌入 token 在提取时都能看到完整的候选上下文。将这一层替换为滑动窗口会严重降低列表式排序效果而仅保留这一层为全局注意力则可以在不使用完全全局注意力堆栈的情况下保留联合编码能力。对于剩余的 27 层我们测试了 1L1G、1L2G、3L2G 和 5L1G 四种调度方案。3L2G表现最佳连续使用三层滑动窗口注意力然后使用两层全局注意力并不断重复这一模式最终在窗口大小为 1,024 个 token 的情况下得到 17 个局部层和 11 个全局层。局部层将注意力计算成本从 O(L²) 降低到 O(L·w)而每三步出现的全局层则会在每个深度刷新长期的跨候选文档信号。更密集的调度方案并没有带来更高的吞吐量而更加激进的 5L1G 在复杂的多文档任务上表现出变差的趋势。左基于 3L2G 混合 Qwen3-0.6B 主干网络的 LBNL 列表式编码。查询和所有候选文档共享一个因果上下文L 层使用 1,024 个 token 的滑动窗口G 层使用全局注意力而末端层 G* 始终固定为全局注意力因此位于序列末尾的查询嵌入可以看到整个列表。MLP 将表示投影到共享空间然后通过余弦相似度生成排序结果。右三阶段训练方案其中第一阶段的全注意力教师模型保持冻结并在第三阶段对学生模型进行指导。跨注意力差异的自蒸馏这里的蒸馏方式比较特殊。我们并不是将一个大型模型压缩成小型模型。教师模型和学生模型都是 0.6B 参数唯一的区别在于注意力模式。教师模型使用完整注意力计算成本呈二次增长学生模型则使用 3L2G。如果同时强迫学生模型切换注意力掩码并匹配教师模型的输出模型会在这两方面都表现不佳因此该训练方案将这两种压力解耦阶段 I——全注意力教师模型。从公开的 jina-reranker-v3 checkpoint 开始在完整的 v3.5 数据混合上对教师模型进行全面微调不施加滑动窗口限制。它建立了这一参数规模下的质量上限。阶段 II——稀疏注意力适配。学生模型从阶段 I 的权重初始化并启用 3L2G。首先我们只训练注意力投影层同时冻结其他所有参数让稀疏掩码学习如何路由信息而不会破坏在全注意力下学习到的表示。然后解冻所有参数使学生模型重新适应新的注意力几何结构。在这一阶段学生模型已经可以部署并且速度更快但在 BEIR、RTEB-legal 和 MIRACL 上仍然与教师模型存在稳定的差距。阶段 III——教师指导的蒸馏。冻结教师模型同时从四个层面让学生模型与教师模型对齐对经过 softmax 归一化的分数分布进行列表式 KL 散度计算、对绝对分数进行 MSE 计算、对最后一层隐藏状态进行 MSE 计算以及对投影后的嵌入进行余弦损失计算此外还加入上下文内相似度和离散度正则化项。训练顺序很重要。仅进行阶段 II 会留下明显的差距因为学生模型必须先在较弱的掩码下改变信息路由方式然后才能安全地模仿教师模型的分数和状态。阶段 III 随后弥合了大部分差距这说明一旦几何结构完成适配全注意力的能力就可以迁移到稀疏注意力学生模型中。该方案是针对 3L2G 编写的但这一思路同样可以推广到其他注意力调度不匹配的情况。训练数据v3 的数据混合在通用检索方面表现良好但在专业领域上的表现较差。我们没有简单地增加更多数据而是在 RTEB 和 STARK 开发集上进行错误分析并构建每个新的数据分片使其精准覆盖通用模型容易失败的检索模式。困难负例同时来自多个检索器BM25、Jina、BGE、GTE、E5、ColBERT因此模型无法学习某一个检索器的特定捷径。法律数据分片结合了 EUR-Lex 多语言数据、CLERC、AILA、加拿大案例法、瑞士案例摘要和 EuroVoc并对其进行过采样因为法律文本通常包含大量引用且篇幅较长。医疗数据分片针对临床措辞和实体密集型段落。金融数据分片重点关注数值陈述、监管语言以及能够感知表格结构的段落。多语言覆盖范围也超出了 MIRACL 和 mMARCO通过 WebFAQ 覆盖 50 多种语言并加入 SWIM-IR 跨语言负例和 Ruri-v3 日语对。结构化数据获得了最高的采样权重因为它处于标准基准测试所假设的自由文本分布之外。对记录和表格的相关性判断依赖于相等性、数值和日期范围、列表成员关系以及跨字段的逻辑组合而不是词汇重叠。早期实验在这一领域的表现最差因此我们直接合成了包含大量约束条件的数据对。用于字段约束检索的合成监督数据。我们从一个锚点记录中采样带类型的约束条件然后让 LLM 将这些约束改写成查询随后对一个或两个受约束字段进行扰动构建一个近重复的困难负例使其保持相同的表面形式但违反某个约束条件。密集检索会进一步添加候选结果而 LLM 评审器则筛选出真正匹配的结果、优化过于宽泛的查询并丢弃存在歧义的案例然后将这些结果反馈到查询生成过程中。右侧的示例展示了为什么词汇重叠在这里毫无用处正例和困难负例除了一个字段不同之外完全是相同的字符串。实验结果所有数据均采用统一的 MTEB v2 流程对 jina-embeddings-v5-text-small 返回的前 100 个候选结果进行重排序因此这些数据可能与厂商报告的结果存在轻微差异。论文中提供了完整的按数据集和按语言划分的结果表。ModelParamsBEIRMIRACLRTEBStruct-IRjina-embeddings-v5-text-small (1st stage)0.5B56.2665.1564.60–mxbai-rerank-base-v20.5B59.5864.9061.4430.4Qwen3-Reranker-0.6B0.6B56.9467.1268.4141.9mxbai-rerank-large-v21.5B62.4569.6570.8143.0Qwen3-Reranker-4B4.0B62.2876.5677.6855.6jina-reranker-v30.6B62.1072.2068.0138.7jina-reranker-v3.50.6B63.2074.1170.9548.3v3.5 在相同参数规模下在所有基准测试类别中都优于 v3其中半结构化检索的提升最大。RTEB 的提升主要集中在训练数据混合所针对的领域与 v3 相比AILA-Statute 提升了 14.0 个百分点AILA-Case 提升了 11.7 个百分点FinQA 达到 86.91是所有测试模型中的最佳成绩。在 STARK 上v3.5 在全部三个官方指标上都优于 v3并取得了整体最佳的 Hit5。关于 Struct-IR需要说明一个评测方案上的问题。该基准测试会针对每个 schema 索引数百万个对象而第一阶段检索在 schema 内的 Recall5 约为 0.04因此端到端的“检索后重排序”几乎完全受召回率限制也就很难有效区分不同的重排序模型。我们改为将所有真实文档与第一阶段检索中最难区分的 30 个干扰文档一起注入候选池从而独立衡量字段约束下的区分能力而不受检索覆盖率的影响。基于这一候选池得到的数据不能与 SSRB 检索排行榜进行比较。效率在单张 NVIDIA A100 上进行测量batch size 为 1使用前 100 个候选文档的列表式输入并启用 FlashAttention-2。短上下文场景下在 BEIR Natural Questions 中基于 254 个计时查询查询和文档的平均长度分别为 10.3 和 145.5 个 token。前 100 个候选文档的列表式重排序平均延迟从 371 ms 降至 305 ms速度提升了 1.22 倍同时文档吞吐量从 270 docs/s 提升至 328 docs/s。长上下文场景下在 RTEB AILACasedocs 中基于 48 个计时查询查询和文档的平均长度分别为 689.8 和 1,904.0 个 token。平均延迟从 16.1 s 降至 10.3 s速度提升了 1.56 倍同时预填充吞吐量从 11.9k 提升至 18.6k tokens/s。当候选文本较长时混合注意力带来的收益最大。由于生产环境中的列表式重排序主要由针对一组全新候选文档执行的一次预填充过程所主导因此在固定的服务预算下这些延迟降低可以直接转化为更长的候选列表以及更大的文档。开始使用通过 Jina Search Foundation APIcurl -X POST \ https://api.jina.ai/v1/rerank \ -H Content-Type: application/json \ -H Authorization: Bearer *** \ -d { model: jina-reranker-v3.5, query: trail-running shoes under $150, rated 4.5, released since 2022, documents: [ ..., ... ], return_documents: false }通过 Elastic Inference Servicejina-reranker-v3.5 从 Stack 9.3 开始即可在 Elastic Inference ServiceEIS上使用因此你可以在托管 GPU 上执行重排序而无需自行托管该模型。创建一个引用该模型的 inference endpoint然后像调用其他rerank任务一样调用它。PUT _inference/rerank/eis-jina-reranker-v3-5 { service: elastic, service_settings: { model_id: jina-reranker-v3.5 } }POST _inference/rerank/eis-jina-reranker-v3-5 { query: trail-running shoes under $150, rated 4.5, released since 2022, input: [ ..., ... ] }响应会返回一个按相关性排序的rerank数组其中每个条目都包含候选文档的原始索引及其分数。由于它是一个标准的 inference endpoint因此可以直接在搜索查询的text_similarity_rerankerretriever 中引用inference_id。通过 transformersfrom transformers import AutoModel model AutoModel.from_pretrained( jinaai/jina-reranker-v3.5, dtypeauto, trust_remote_codeTrue, ) model.eval() query What are the health benefits of green tea? documents [ Green tea contains catechins that may help reduce inflammation., El precio del cafe ha aumentado un 20% este ano., 绿茶富含儿茶素等抗氧化剂可以降低心脏病风险。, Le the vert est riche en antioxydants., ] for r in model.rerank(query, documents): print(f{r[relevance_score]:.4f} {r[document][:70]})结论jina-reranker-v3.5 的实际主张是明确且可验证的在 0.6B 参数规模下有针对性的训练能够缩小与 4B 通用型重排序模型之间的大部分差距在 BEIR 上则完全弥合了这一差距同时运行速度还快于它所替代的模型。对于企业级检索而言这意味着与默认选择可用的最大模型相比更值得在紧凑型骨干模型上投入针对性的监督训练。有两个局限性值得明确说明。列表式重排序模型仍然存在点式模型和后期交互模型可以避免的输入限制尤其是候选文档数量和候选文档总长度存在固定的上限。此外在 RTEB 的法律和医疗任务、受控候选池的 Struct-IR以及 MIRACL 的低资源语言上与 4B Qwen 之间仍然存在重要差距。这些都是困难案例我们选择明确指出它们而不是用平均值将它们掩盖。原文https://jina.ai/news/jina-vlm-small-multilingual-vision-language-model/
上一篇/下一篇内容由系统自动关联 返回资讯列表 →