重排序模型对比

生产环境往往混用 cross-encoder、listwise 模型、late-interaction 以及指令式 API。2026 年最值得注意的一点是:参数量不再预测质量 —— 0.6B 的 listwise 模型(Jina v3)在 BEIR 上超过 Qwen3-Reranker-4B,149M 的 cross-encoder 在 Hit@1 上与 1.2B 打平,而 Qwen3 自己的 4B 也略胜 8B。下表对比架构、延迟、语言与成本,凡评测协议不一致处均如实标注。

重排序模型对比:架构、类型、适用场景、语言、延迟、价格与 BEIR 分数
模型 架构 类型 最适合 语言 典型延迟 50 条文档 价格 BEIR NDCG@10 试用
Qwen3-Reranker-4B Cross-encoder Apache 2.0Qwen3 最佳档位 多语言开源自托管最强(需 GPU) 100+ langs · 32K ctx GPU required 免费(自建) MTEB-R*
Qwen3-Reranker-8B Cross-encoder Apache 2.0 Qwen3 最大档 —— 但 BEIR 上 4B 更好 100+ langs · 32K ctx GPU / multi-GPU 免费(自建) MTEB-R*
Qwen3-Reranker-0.6B Cross-encoder Apache 2.0 最轻 Qwen3;舒适运行仍需 GPU 100+ langs · 32K ctx 建议 GPU 免费(自建) MTEB-R*
bge-reranker-v2-m3 Cross-encoder Open weights 经过验证的自建默认;CPU 友好 100+ 种语言 200–500 ms CPU
20–50 ms GPU
免费(自建) 55.36*
mxbai-rerank-large-v1 Cross-encoder Open weights
Browser ✓
上一代;xsmall 仍驱动浏览器 Demo 英文 150–400 ms CPU
~30 ms GPU
免费(自建) 49.32*
mxbai-rerank-large-v2 Cross-encoder Open weights多语言 mxbai 最强一代;支持多语言,含中文 100+ 种语言 建议 GPU 免费(自建) 57.49*
mxbai-rerank-base-v2 Cross-encoder Open weights多语言 v2 代中体积与质量的最佳平衡 100+ 种语言 CPU 可运行;GPU 更快 免费(自建) 55.57*
Jina Reranker v3 Listwise 开源 + 托管优于 Qwen3-4B 0.6B listwise;64 篇文档共享 131K 上下文 100+ 种语言 API or GPU self-host 免费额度 + 按量付费 61.94*
jina-reranker v1 tiny Cross-encoder Open weights
Browser ✓
浏览器 / 边缘;驱动本站 Demo 英文 30–80 ms CPU (browser) 免费(自建) 48.54*
Cohere Rerank 4 Pro Cross-encoder Hosted API 成熟的多语言 API;32k 上下文 100+ 种语言 API $0.0025/search† not published*
Cohere Rerank 4 Fast Cross-encoder Hosted API 面向吞吐与延迟调优的同系版本 100+ 种语言 API $0.002/search† not published*
Voyage rerank-2.5 Cross-encoder Hosted APIInstruction 支持指令跟随;32k 上下文 多语言 API $0.05/M tokens† not published*
Voyage rerank-2.5-lite Cross-encoder Hosted API 更便宜的档位;同样 32k 上下文 多语言 API $0.02/M tokens† not published*
Voyage rerank-3 Cross-encoder 托管 API预览版 2.5 的预览版继任者;带免费 token 额度 多语言 API $0.05/M token† (前 2 亿免费) not published*
Voyage rerank-3-lite Cross-encoder 托管 API预览版 更便宜的预览档位;同样 32k 上下文 多语言 API $0.02/M token† (前 2 亿免费) not published*
gte-reranker-modernbert-base Cross-encoder Open weightsCompact 仅约 149M,Hit@1 却与 nemotron-1b 打平 英文 Fast GPU / CPU-friendly 免费(自建) Hit@1 ≈ nemotron*
llama-nemotron-rerank-1b-v2 Cross-encoder Open + NIM API 1.2B;在不计延迟时精度居首 多语言(MIRACL / MLQA 评测) GPU / NIM NIM / self-host Hit@1 83.0*
ms-marco MiniLM-L6 (browser) Cross-encoder Open weights
Browser ✓
经典基线;三个 Demo 模型里体积最大 英文 50–150 ms browser WASM 免费(自建) 48.64*
Contextual AI Rerank v2 Instruction Hosted API 指令跟随 / 策略型相关性 英文 API Contact vendor† 不适用
ColBERTv2 Late-interaction Open weights Token MaxSim;1.5 阶段而非完整 CE 英文 大规模快速重打分 免费(自建) 不适用

最近核对:2026 年 10 月(bge-reranker-v2-m3 由查不到出处的 ~60.1 改为 BAAI 自己公布的 55.36*;Jina v1 tiny 与 ms-marco MiniLM-L6 现在显示 Jina 为它们公布的 BEIR 分数;9 月已将 mxbai-rerank-large-v1 由没有来源的 ~62.1 修正)· 下次复核:2026 年 11 月。* 各家跑 BEIR 的方式都不一样 —— BAAI 用 15 个数据集、对 bge-large-en-v1.5 召回的前 100 条重排,Jina 用 13 个数据集、对 jina-embeddings-v3 的前 100 条重排,mixedbread 用自己选的一套 —— 所以本列每个 BEIR 数字都带 *,鼠标悬停可见其评测方法。差距并不小:Jina 的评测里 bge-reranker-v2-m3 是 56.51,BAAI 自己测的是 55.36;mxbai-rerank-large-v2 在 Jina 那边是 61.44,mixedbread 自己测的是 57.49。请把这一列当作大致的档位,而不是精确到小数的排名。其余带 * 的格子用的是 MTEB-R 或任务特定指标。厂商未公布可比数字时,我们写「未公布」而不去猜。† 注意计价单位不同:Cohere 按每次检索(一个 query + 最多 100 篇文档)计费,Voyage 按 token 计费。我们的成本计算器可以算出在你的量级下哪家更便宜。可在 Demo 中运行的仅有:mxbai xsmall、Jina tiny、ms-marco MiniLM。

资料来源: Qwen3-Reranker · jina-reranker-v3 论文 · jina-reranker-v1 · Voyage 重排序器 · mxbai-rerank · nemotron-rerank · MTEB · BEIR · BAAI 评测 · GTE ModernBERT · Qwen 指南 · 指令跟随 · ColBERT

如何选择

Open · GPU

Qwen3-Reranker

多语言开源权重最优 —— 从 4B 起步

  • 0.6B / 4B / 8B,全部 Apache 2.0,全部 32K 上下文
  • 4B 是甜点档 —— 8B 更贵,分数却不更高
  • 厂商给的是 MTEB-R 数字,请在你自己的标注集上复核
Open · CPU

bge-reranker

GPU 有限时的最佳免费自建

  • 零按次成本 —— 跑在你自己的基础设施上
  • 强多语言质量(v2-m3 覆盖 100+ 种语言)
  • 与 sentence-transformers、LangChain、LlamaIndex 即插即用
API

Cohere Rerank 4

最省事的托管 API;在 Pro 与 Fast 间二选一

  • Python、Node、Java、Go 官方 SDK —— 一行代码接入
  • 两个版本都是 32k 上下文、100+ 语言
  • Pro 重精度,Fast 重吞吐 —— 每次检索 $0.0025 对 $0.002
Open + API

Jina Reranker v3

单卡就能跑,BEIR 却在第一梯队

  • 0.6B 拿到 61.94 BEIR nDCG@10 —— 胜过体量 6 倍的 Qwen3-Reranker-4B
  • Listwise:64 篇文档共享同一个 131K token 的上下文
  • v1-tiny 仍可在浏览器跑(本站 Demo)
API

Voyage rerank-2.5

可用指令引导相关性,按 token 计费

  • 用自然语言指令引导打分,无需微调
  • rerank-2.5 与更便宜的 -lite 都是 32k 上下文
  • 预览版 rerank-3 现在带着 2.5 当初发布时的那份 2 亿免费 token 额度;走 Batch API 还能再打 67 折
Open

mxbai-rerank

Apache 2.0 开源权重;v2 新增 100+ 种语言支持

  • 宽松的 Apache 2.0 协议 —— 可商用、无限制
  • v1 的 xsmall 变体可在浏览器中运行(驱动本站实时 Demo)
  • v2(base/large)支持多语言,包括中文 —— v1 仅支持英文

实时体验一个 cross-encoder

看看这些模型会如何重排你的检索结果 —— Demo 在你的浏览器里运行。

打开 Demo →