Qwen3-Reranker
Open weights2026 SOTA*GPU recommended
Qwen3-Reranker 家族(0.6B / 4B / 8B)是 2026 开源重排序主线:多语言、偏长上下文,常居社区开源榜前列。公开 MTEB-R / BEIR 类数字仅作方向性参考 —— 替换 bge 或托管 API 前务必用自有标注验证。
模型变体
| 模型 | 规模 | 最适合 |
|---|---|---|
Qwen/Qwen3-Reranker-0.6B | ~0.6B | 最轻量;仍建议 GPU |
Qwen/Qwen3-Reranker-4B | ~4B | 质量优先时的默认自建选择 |
Qwen/Qwen3-Reranker-8B | ~8B | 开源质量顶配;VRAM / 延迟最高 |
建议:单卡现代 GPU 从 4B 起步。内存紧再降 0.6B;仅当标注评测显示明确 NDCG 收益时再上 8B。
分数与诚实说明
公开文章常报中大型 Qwen3 在 MTEB-R / 多语言 rerank 套件约 ~70+,8B 居开源榜前列。这些数字不能保证与表中 bge(~60)、mxbai(~62)的经典 BEIR 18 数据集均值同协议。
- 不同套件、语言与预处理 → 不同数字。
- 部分纯英文产品基准上,紧凑模型(如 ModernBERT-GTE)Hit@1 可超过 4B,成本却低得多。
- 因此本站 对比表 给 Qwen 分数标了 *。
快速上手
Hugging Face / transformers
# Check the model card for the recommended stack (transformers / vLLM / SGLang).
# IDs (examples):
# Qwen/Qwen3-Reranker-0.6B
# Qwen/Qwen3-Reranker-4B
# Qwen/Qwen3-Reranker-8B
from sentence_transformers import CrossEncoder # if card supports CE API
# Prefer the loading recipe on the official model card — Qwen3 may use
# a chat-style scoring template rather than a plain CrossEncoder pair.
model_id = "Qwen/Qwen3-Reranker-4B"
# model = CrossEncoder(model_id, max_length=8192) # only if supported
# scores = model.predict([(query, d) for d in docs])
生产服务常见 vLLM / OpenAI 兼容 /v1/rerank。务必按当前 Qwen 文档使用正确 prompt 模板 —— 模板错了会静默毁掉质量。
在 RAG 流水线中
# Pseudocode — same two-stage pattern as any cross-encoder
candidates = vector_db.search(query, top_k=80) # or hybrid
scores = qwen3_rerank(query, candidates) # official template
top = sorted(zip(scores, candidates), reverse=True)[:8]
answer = llm.complete(context=top, query=query)
何时选 Qwen3
- 适合:有 GPU、需要多语言质量、要开源权重且零按次 API 成本。
- 适合:长段落 / 长上下文重要,且能负担 4B–8B 显存。
- 不太适合:仅 CPU 或边缘 —— 优先 bge-v2-m3、mxbai,或 Demo 用 Jina tiny。
- 不太适合:策略/指令型相关性 —— 见 指令跟随 rerank。
优缺点
优点
- 2026 开源叙事领先(0.6B–8B 阶梯)
- 多语言 + 长上下文定位强
- 自托管后零按次成本
- 生态活跃(HF、vLLM、社区方案)
缺点
- 舒适运行需要 GPU(或强量化)
- 打分模板 / 服务栈比 MiniLM 更绕
- 公开榜数字与经典 BEIR 均值非 1:1
- 体量过大,无法进本站浏览器 Demo