读懂 reranker,再亲眼看它在你的浏览器里运行。
重排序器(reranker)会对检索得到的候选重新打分,让最相关的段落浮到最前面。在这里了解它的原理、对比主流模型,并实时体验一个 cross-encoder —— 零 API 成本,数据全程不离开你的设备。
基于 transformers.js · 100% 在客户端运行 · 无需密钥
从这里开始
三篇短指南,带你从“什么是 reranker?”一路走到在 RAG 流水线中真正可用的重排序环节。
什么是 reranker?
两阶段检索范式、排序为何重要,以及重排序在其中的位置。
reranker 联合对 (query, document) 对打分 —— 远比单独做余弦相似度准确。
Cross-encoder vs bi-encoder
为什么 bi-encoder 快、cross-encoder 准,以及如何把两者结合使用。
bi-encoder 负责大规模召回,cross-encoder 负责精准排序。把它们组合成两个阶段来使用。
如何为 RAG 加重排序
宽召回、重排序、保留最优。含代码、top-k 取值建议与延迟取舍。
召回 50+ 个候选,重排序,保留 5 个 —— 更好的答案,更少的 token 送进 LLM。
现在就在你的浏览器里重排序
粘贴一个查询和几段候选文本。一个真实的 cross-encoder 只需下载一次并缓存,之后在本地对每一对打分 —— 你能看到排名在毫秒间重新洗牌。没有服务器、没有 API 密钥,数据不离开页面。
- 通过 transformers.js + ONNX Runtime Web 加载真实模型权重
- 零 API 成本、零滥用风险 —— 一切都在你的设备上完成
- 直观看到分数如何重新排列你的检索结果
对比主流重排序模型
2026 开源 SOTA 候选(Qwen3-Reranker)、Jina v3 listwise、经典 bge/mxbai、托管 Cohere/Voyage —— 以及 late-interaction 与指令 API。
Qwen3-Reranker
0.6B / 4B / 8B 的 Apache 2.0 家族 —— 多语言 GPU 自托管首选。从 4B 起步,而不是 8B。
bge-reranker
智源(BAAI)开源权重。仍是 CPU 友好的多语言默认。
Cohere Rerank 4
成熟的托管 API,分 Pro 与 Fast 两档 —— 32k 上下文、100+ 语言,按「次检索」计费。
Jina Reranker v3
0.6B 的 listwise 模型,BEIR 达 61.94 —— 优于 Qwen3-Reranker-4B。v1-tiny 仍在驱动我们的 Demo。
Voyage rerank-2.5
可以用自然语言指令来引导的托管重排序器。32k 上下文,按 token 计费。
mxbai-rerank
Apache 2.0 开源权重,含可在浏览器运行的 xsmall 变体 —— 本表中 BEIR 分数最高。