重排序模型对比

生产环境往往混用 cross-encoderlistwise 模型、late-interaction 以及指令式 API。2026 年最值得注意的一点是:参数量不再预测质量 —— 0.6B 的 listwise 模型(Jina v3)在 BEIR 上超过 Qwen3-Reranker-4B,149M 的 cross-encoder 在 Hit@1 上与 1.2B 打平,而 Qwen3 自己的 4B 也略胜 8B。下表对比架构、延迟、语言与成本,凡评测协议不一致处均如实标注。

模型 架构 类型 最适合 语言 典型延迟 50 条文档 价格 BEIR NDCG@10 试用
Qwen3-Reranker-4B Cross-encoder Apache 2.0Qwen3 最佳档位 多语言开源自托管最强(需 GPU) 100+ langs · 32K ctx GPU required 免费(自建) MTEB-R*
Qwen3-Reranker-8B Cross-encoder Apache 2.0 Qwen3 最大档 —— 但 BEIR 上 4B 更好 100+ langs · 32K ctx GPU / multi-GPU 免费(自建) MTEB-R*
Qwen3-Reranker-0.6B Cross-encoder Apache 2.0 最轻 Qwen3;舒适运行仍需 GPU 100+ langs · 32K ctx 建议 GPU 免费(自建) MTEB-R*
bge-reranker-v2-m3 Cross-encoder Open weights 经过验证的自建默认;CPU 友好 100+ 种语言 200–500 ms CPU
20–50 ms GPU
免费(自建) ~60.1
mxbai-rerank-large-v1 Cross-encoder Open weights
Browser ✓
经典 BEIR 强;Demo 用 xsmall 英文 150–400 ms CPU
~30 ms GPU
免费(自建) ~62.1
Jina Reranker v3 Listwise 开源 + 托管优于 Qwen3-4B 0.6B listwise;64 篇文档共享 131K 上下文 100+ 种语言 API or GPU self-host 免费额度 + 按量付费 61.94
jina-reranker v1 tiny Cross-encoder Open weights
Browser ✓
浏览器 / 边缘;驱动本站 Demo 英文 30–80 ms CPU (browser) 免费(自建) 旧版 tiny
Cohere Rerank 4 Pro Cross-encoder Hosted API 成熟的多语言 API;32k 上下文 100+ 种语言 API $0.0025/search† not published*
Cohere Rerank 4 Fast Cross-encoder Hosted API 面向吞吐与延迟调优的同系版本 100+ 种语言 API $0.002/search† not published*
Voyage rerank-2.5 Cross-encoder Hosted APIInstruction 支持指令跟随;32k 上下文 多语言 API $0.05/M tokens† not published*
Voyage rerank-2.5-lite Cross-encoder Hosted API 更便宜的档位;同样 32k 上下文 多语言 API $0.02/M tokens† not published*
gte-reranker-modernbert-base Cross-encoder Open weightsCompact 仅约 149M,Hit@1 却与 nemotron-1b 打平 英文 Fast GPU / CPU-friendly 免费(自建) Hit@1 ≈ nemotron*
llama-nemotron-rerank-1b-v2 Cross-encoder Open + NIM API 1.2B;在不计延迟时精度居首 多语言(MIRACL / MLQA 评测) GPU / NIM NIM / self-host Hit@1 83.0*
ms-marco MiniLM-L6 (browser) Cross-encoder Open weights
Browser ✓
经典基线;Demo 默认 英文 50–150 ms browser WASM 免费(自建) ~55.0
Contextual AI Rerank v2 Instruction Hosted API 指令跟随 / 策略型相关性 英文 API Contact vendor† 不适用
ColBERTv2 Late-interaction Open weights Token MaxSim;1.5 阶段而非完整 CE 英文 大规模快速重打分 免费(自建) 不适用

最近核对:2026 年 8 月(Cohere Rerank 4、Voyage rerank-2.5、Jina v3 的 BEIR、nemotron-1b)· 下次复核:2026 年 11 月。标 * 的列使用 MTEB-R、厂商或任务特定协议,不同于 bge / mxbai / Jina 行所用的经典 BEIR 18 数据集均值。厂商未公布可比数字时,我们写「未公布」而不去猜。 注意计价单位不同:Cohere 按每次检索(一个 query + 最多 100 篇文档)计费,Voyage 按 token 计费。可在 Demo 中运行的仅有:mxbai xsmall、Jina tiny、ms-marco MiniLM。

资料来源: Qwen3-Reranker · jina-reranker-v3 论文 · Voyage 重排序器 · nemotron-rerank · MTEB · BEIR · BAAI · GTE ModernBERT · Qwen 指南 · 指令跟随 · ColBERT

如何选择

Open · GPU

Qwen3-Reranker

多语言开源权重最优 —— 从 4B 起步

  • 0.6B / 4B / 8B,全部 Apache 2.0,全部 32K 上下文
  • 4B 是甜点档 —— 8B 更贵,分数却不更高
  • 厂商给的是 MTEB-R 数字,请在你自己的标注集上复核
Open · CPU

bge-reranker

GPU 有限时的最佳免费自建

  • 零按次成本 —— 跑在你自己的基础设施上
  • 强多语言质量(v2-m3 覆盖 100+ 种语言)
  • sentence-transformers、LangChain、LlamaIndex 即插即用
API

Cohere Rerank 4

最省事的托管 API;在 Pro 与 Fast 间二选一

  • Python、Node、Java、Go 官方 SDK —— 一行代码接入
  • 两个版本都是 32k 上下文、100+ 语言
  • Pro 重精度,Fast 重吞吐 —— 每次检索 $0.0025 对 $0.002
Open + API

Jina Reranker v3

单卡就能跑,BEIR 却在第一梯队

  • 0.6B 拿到 61.94 BEIR nDCG@10 —— 胜过体量 6 倍的 Qwen3-Reranker-4B
  • Listwise:64 篇文档共享同一个 131K token 的上下文
  • v1-tiny 仍可在浏览器跑(本站 Demo)
API

Voyage rerank-2.5

可用指令引导相关性,按 token 计费

  • 用自然语言指令引导打分,无需微调
  • rerank-2.5 与更便宜的 -lite 都是 32k 上下文
  • 每个账号前 2 亿 token 免费;走 Batch API 再打 67 折
Open

mxbai-rerank

Apache 2.0 开源权重,浏览器可运行的 xsmall

  • 宽松的 Apache 2.0 协议 —— 可商用、无限制
  • xsmall 变体可在浏览器中运行(驱动本站实时 Demo)
  • 大参数版本在本表中 BEIR 分数最高

实时体验一个 cross-encoder

看看这些模型会如何重排你的检索结果 —— Demo 在你的浏览器里运行。

打开 Demo →