Jina Reranker

权重 + 托管 API · Jina AI(现属 Elastic)·

托管 API权重:仅限非商用v3.5 listwise浏览器 tiny

Jina 目前的旗舰是 2026 年 8 月发布的 jina-reranker-v3.5:一个基于 Qwen3-0.6B 的 0.6B listwise 重排序器,可直接替换 v3 —— API 相同、131K token 上下文,速度快 1.22–1.56 倍。在 Jina 自己的评测里,它的 BEIR nDCG@10 为 63.20*,以约七分之一的体量略高于 Qwen3-Reranker-4B;不过在多语言、专业领域和结构化数据检索上,仍是 4B 领先。自建部署要注意:v2、v3 和 v3.5 的权重采用 CC BY-NC 4.0 —— 仅限非商用。v1-tiny(Apache 2.0)仍是本站浏览器 Demo 所用的模型。

模型变体

模型参数量语言许可证说明
jina-reranker-v3.50.6B多语言CC BY-NC 4.0旗舰 —— listwise、混合注意力、131K 上下文,BEIR 63.20*
jina-reranker-v30.6B100+ 种语言CC BY-NC 4.0上一代旗舰 —— listwise,131K 上下文内 64 篇文档。Jina 现在建议新项目改用 v3.5
jina-reranker-m02.4B多语言CC BY-NC 4.0多模态:可对页面截图等视觉文档排序
jina-reranker-v2-base-multilingual278M100+ 种语言CC BY-NC 4.0成对打分的 cross-encoder;API 每篇文档接受 1,024 token,更长的会自动分块
jina-reranker-v1-turbo-en38M英文Apache 2.0旧版;比 tiny 稍大的同系列模型
jina-reranker-v1-tiny-en33M英文Apache 2.0旧版;浏览器 / 边缘端;驱动本站 Demo

参数量与许可证取自各模型的 Hugging Face 页面(2026 年 10 月)。此前列在这里的 jina-reranker-v1-base-en 已不再在 Hugging Face 上公开。

Listwise 的 v3 与 v3.5 改了什么

经典 cross-encoder 对每个 (query, doc) 独立打分。Listwise 模型一次看到整批候选,在多段共享词汇时有助于相对排序。代价是更高显存,以及与 MiniLM 成对打分不同的服务路径。

v3 引入了 Jina 所说的 last but not late 交互:query 与所有候选文档作为同一个序列做因果自注意力,每篇文档的分数是特殊 token 位置上投影向量之间的余弦相似度 —— 所以文档是放在彼此的上下文里评判的,而不只是对着 query。v3.5 保留了这一点,并把统一的全局注意力换成「三层滑动窗口(窗口 1,024 token)+ 两层全局」的交替结构,最后一层始终是全局的。它还加入了法律、医疗、金融和结构化数据的训练,并从同等体量的全注意力教师模型蒸馏而来。Jina 测得短文本延迟降低 1.22 倍、长文本降低 1.56 倍(A100,每次 100 个候选)。详见 v3.5 论文和 v3 论文。

谁测的分数?

为了 v3.5,Jina 用同一套方法把所有模型重新测了一遍:13 个 BEIR 数据集、覆盖 18 种语言的 MIRACL、RTEB(法律、金融、代码、医疗)以及 Struct-IR,每项都是对 jina-embeddings-v5-text-small 召回的前 100 个候选重排。

模型参数BEIRMIRACLRTEBStruct-IR
jina-reranker-v3.50.6B63.2074.1170.9548.3
mxbai-rerank-large-v21.5B62.4569.6570.8143.0
Qwen3-Reranker-4B4.0B62.2876.5677.6855.6
jina-reranker-v30.6B62.1072.2068.0138.7
mxbai-rerank-base-v20.5B59.5864.9061.4430.4
Qwen3-Reranker-0.6B0.6B56.9467.1268.4141.9

指标为 nDCG@10,取自 jina-reranker-v3.5 模型卡。Struct-IR 用的是受控候选池(全部正确文档加上最难的 30 个干扰项),因此不能和其他 Struct-IR 排行榜直接比较。

v3.5 在 BEIR 上领先,但不到一分;另外三项都是 4B 领先,Jina 自己的文章也直说了这一点。v3 论文在 2025 年用另一个第一阶段召回模型测过一次,当时 v3 是 61.94,Qwen3-Reranker-4B 是 61.16 —— 本站直到 2026 年 10 月都在重复的「v3 超过 Qwen3-Reranker-4B」就出自这里;在新的评测里,这个结论已经不成立。同一家厂商测的两次结果里,Qwen3-Reranker-4B 就差了一分多,这正说明 BEIR 均值应当当作档位来看,而不是精确排名。

许可证:哪些能自建部署

v2、v3、v3.5 和 m0 的权重采用 CC BY-NC 4.0 发布:可以免费下载和评估,但不能商用。生产环境有三条路:Jina 的托管 API,按 token 计费;v3.5 还可以走 Elastic Inference Service(Elastic Stack 9.3 及以上);或者购买商用许可,现在由 Elastic 的销售团队负责。Jina 还把 v3 上架到了 Azure 和 Google Cloud 的应用市场。只有旧版的 v1 英文模型是 Apache 2.0。

如果你需要水平相近、又允许商用的开源权重,Qwen3-Reranker、mxbai-rerank-v2 和 bge-reranker-v2 都是 Apache 2.0。

价格

Jina 的重排序 API 按 token 计费,和他们的其他 API 共用同一个余额。新的 API key 附带免费 token 供试用;之后需要购买 token 包。Jina 在 2025 年 5 月 6 日调整过定价,而且他们网站上的当前价格要在浏览器里加载完页面才显示,所以这里不写具体数字 —— 做预算前请到 jina.ai/reranker 查看。

API key每分钟请求数每分钟 token 数
免费100100K
付费5002M
高级5,00050M

速率限制取自 jina.ai/reranker 的 FAQ,与 Embeddings API 共用。v3 和 v3.5 的 API 每次请求最多接受 131,072 token(query 加全部文档),超出部分会被截断。延迟方面,同一份 FAQ 给出的数字是:100 篇 256 token 的文档加 64 token 的 query 约 150 毫秒;文档增至 4,096 token 时约 3.5 秒;query 也增至 512 token 时约 7 秒。

快速上手

托管 API(Python)

import requests

def rerank(query: str, documents: list[str], top_n: int = 5) -> list[str]:
    resp = requests.post(
        "https://api.jina.ai/v1/rerank",
        headers={"Authorization": "Bearer YOUR_KEY", "Content-Type": "application/json"},
        json={
            "model": "jina-reranker-v3.5",  # or jina-reranker-v3; same request schema
            "query": query,
            "documents": documents,
            "top_n": top_n,
        },
    ).json()
    return [documents[r["index"]] for r in resp["results"]]

自建部署(transformers)

除非已获得商用许可,否则仅限非商用 —— 见上文。

from transformers import AutoModel

model = AutoModel.from_pretrained(
    "jinaai/jina-reranker-v3.5",
    dtype="auto",
    trust_remote_code=True,
)
model.eval()

# Listwise: all documents are scored together, in one forward pass
results = model.rerank(query, documents, top_n=5)
for r in results:
    print(f"{r['relevance_score']:.4f}  {r['document'][:80]}")

浏览器 / 边缘端使用

v1-tiny 模型(3300 万参数)通过 transformers.js 在浏览器中运行。在一台 4 核的 GitHub Actions 机器上,Demo 的首次运行(下载加打分 10 段)用了 4.4 秒,之后打分 10 段用 429 ms,30 段用 1,283 ms。手机或较旧的笔记本会更慢;Demo 会在你自己的设备上显示每次运行的耗时。本站 Demo 用的就是它:

// transformers.js (ES module in the browser)
import { AutoTokenizer, AutoModelForSequenceClassification }
  from "https://cdn.jsdelivr.net/npm/@huggingface/transformers@4";

const tokenizer = await AutoTokenizer.from_pretrained(
  "jinaai/jina-reranker-v1-tiny-en", { dtype: "q8" }
);
const model = await AutoModelForSequenceClassification.from_pretrained(
  "jinaai/jina-reranker-v1-tiny-en", { dtype: "q8" }
);

const inputs = tokenizer([query, query], {
  text_pair: [doc1, doc2],
  padding: true, truncation: true,
});
const { logits } = await model(inputs);
const scores = logits.sigmoid().tolist();

优缺点

优点

  • 0.6B 参数在 Jina 自己的测试里拿到 63.20* BEIR nDCG@10
  • Listwise:一次前向计算里,文档彼此对照打分
  • 同一批模型既有托管 API,也有可下载的权重
  • v3.5 可在 Elastic Inference Service 上使用(Stack 9.3+)
  • v1-tiny 采用 Apache 2.0,可在浏览器里运行(本站 Demo)

缺点

  • v2、v3 和 v3.5 的权重仅限非商用 —— 生产环境自建部署需要购买许可
  • 在多语言、法律 / 医疗和结构化数据检索上,Qwen3-Reranker-4B 仍然领先
  • 自建部署需要 trust_remote_code=True
  • Listwise 调用对全部候选的总长度有上限(131K token)
  • API 价格没有以文字形式公开 —— 做预算前请先确认

jina-reranker-v1-tiny 驱动了这个 Demo

在浏览器里实时看它为你自己的段落打分 —— 无 API 密钥,数据不离开页面。

打开 Demo →

其他模型