Qdrant 探索 Jev:通用分类器如何重塑检索重排与结果多样性

ADK Qdrant官方 / ADK编译 2026-10-08 5 分钟 65 次浏览
速览导读 / Summary

Qdrant 团队深入测试了 TypeSafe 推出的 Jev 模型,验证其在无需任务特定训练的情况下,如何解决大语言模型(LLM)在分类任务中成本高、速度慢及输出不可控的问题。文章重点展示了 Jev 在检索重排(Reranking)和减少重复结果(Diversity)方面的实测数据,证明其能以极低的推理成本(单次请求)提供优于传统交叉编码器(Cross-encoders)和基础向量检索的 nDCG 指标,同时保持毫秒级响应。

重排性能提升 (nDCG@10) +0.0665 Jev Score 相对于 BGE-small 的基准提升
单次请求次数 1 Jev Score 模式每查询仅需 1 次 API 调用
重复结果对数 0.04 采用 Jev 辅助 MMR 后,每页近重复对数量
最终相关性 (nDCG@10) 0.723 MMR 去重 + Jev 重排后的综合得分

Key Insights / 核心看点

  • 1 Jev 模型无需任务特定训练,即可在分类任务中实现‘描述即使用’,完美解决 LLM 成本高、速度慢及输出不可控的问题。
  • 2 在检索重排(Reranking)场景中,Jev Score 仅需 1 次请求,nDCG@10 提升 +0.0665,性能优于传统交叉编码器且成本极低。
  • 3 通过将 Jev 评分作为信号输入 MMR 算法,成功在消除重复结果的同时保持高相关性(nDCG@10 达 0.723),解决了搜索结果多样性难题。
  • 4 实测证明,在重排任务中,简单的单次请求(Score)往往比复杂的迭代请求(Iterative)更具性价比,性能提升微乎其微。

Qdrant 深度实测:Jev 如何以通用分类器重塑检索体验

在机器学习的漫长演进中,分类问题一直是核心挑战之一。从传统的训练专用分类器,到依赖零样本(Zero-shot)的预训练模型,再到如今广泛使用的提示工程(Prompting)大语言模型,开发者一直在寻找平衡点:如何在保持灵活性的同时,解决 LLM 在分类任务中响应慢、成本高以及输出不受控的痛点。

随着 TypeSafe 推出的 Jev 模型通过 OpenRouter 服务化,这一格局发生了根本性变化。Qdrant 团队在其官方博客《Jevjitsu》中,通过一系列严谨的实验,验证了 Jev 作为“通用分类器”在检索增强生成(RAG)和搜索优化中的巨大潜力。

核心突破:无需训练,即插即用

Jev 的核心哲学是延续“描述它,无需训练它”(describe it, don't train it)的理念,同时解决了 LLM 在分类场景下的三大硬伤:

  1. 速度:Jev 直接返回数值评分,无需生成文本,推理速度极快。
  2. 成本:相比调用大模型进行多轮对话或复杂推理,Jev 的单次请求成本极低。
  3. 可控性:输出严格约束在候选标签范围内,天然符合分类任务需求。

实测一:重排(Reranking)的性价比革命

在混合搜索(Hybrid Search)中,初步检索往往能召回有用结果,但排序至关重要。传统的 LLM 重排虽然智能,但代价高昂;而本地交叉编码器(Cross-encoders)虽快,却缺乏灵活性。

Qdrant 团队在 NFCorpus 基准上进行了 100 次查询测试,对比了 Jev 的三种模式与 BGE-small 基础检索及本地交叉编码器。

  • Jev Score:仅需 1 次请求,nDCG@10 提升 +0.0665。
  • Jev Choice:仅需 1 次请求,nDCG@10 提升 +0.0583。
  • Jev Iterative:需 10 次请求,nDCG@10 提升 +0.0746。

关键发现:尽管 Iterative 模式得分最高,但其成本是 Score 模式的 10 倍,且性能提升微乎其微(差距小于 0.02)。相比之下,Jev Score 以极低的单次请求成本,就提供了超越基础向量检索和传统交叉编码器的性能。这证明了在重排场景中,灵活性、延迟和成本的平衡至关重要。

实测二:解决“重复结果”的多样性难题

另一个常见痛点是搜索结果缺乏多样性。例如,搜索"iPhone"可能返回大量同型号变体,导致用户感到厌倦。

团队在 WANDS 基准上测试了减少重复对结果多样性的影响。实验显示,仅靠 Qdrant 内置的最大边际相关性(MMR)算法,虽然消除了重复对,但相关性(nDCG@10)下降了 0.12。

创新方案:将 Jev 的评分作为 MMR 算法中的相关性信号。

  • 组合策略:先进行 MMR 去重,再用 Jev 重排。
  • 效果:在保持极低重复率(近重复对降至 0.04)的同时,nDCG@10 依然保持在 0.723 的高水平。

这一结果表明,Jev 不仅能排序,还能作为信号引导多样性算法,实现“既相关又多样”的理想搜索结果。

总结与展望

Jev 的引入标志着从“大模型万能论”向“具体方法论”的回归。对于开发者而言,这意味着无需为每个分类任务单独微调模型,即可获得高性能、低延迟的解决方案。Qdrant 的实验数据有力地证明了,在检索优化的关键链路中,专用且高效的分类模型往往比通用的生成式模型更具实用价值。

未来,团队计划进一步探索 Jev 在文档分块(Chunking)和更复杂搜索决策中的应用,持续推动这一通用分类器生态的发展。

“Jev is the next step in making models usable without task-specific training. Pretrained transformers meant you no longer trained a model from scratch for each task, and LLMs let you describe what you want. Jev keeps 'describe it, don't train it' while addressing what makes LLMs awkward for classification: slow responses, high costs, and answers outside your options.”

— Andrei Cristea & Chadha Sridi, Qdrant Blog

同主题深度资讯

查看更多 →
AI 工具 2026-10-31

中信建投国际 2027 秋招深度解读:港股中资券商本科可投,投行与量化门槛差异显著

中信建投国际 2027 届秋招面向本科及以上应届生开放,作为香港中资券商平台,其核心亮点在于提供跨境金融业务入口。然而,该招聘存在明显的岗位分化:投行分析师与量化研究助理对财务建模、编程及英文能力要求极高,而财富管理类岗位更侧重沟通与执行。文章强调,受限于“最多投递 2 个岗位”的规则,求职者需精准匹配自身背景(如金融、量化、计算机背景),避免盲目海投。同时,详细拆解了从网申到录用的七轮流程及准备策略,为 2027 届求职者提供决策依据。

超级简历官方 / ADK编译 5 分钟
AI 工具 2026-10-08

RESEMBLE.AI 发布 2026 年 10 月深度伪造监控周报:AI 语音诈骗与法律应对

RESEMBLE.AI 发布 2026 年 10 月深度伪造监控周报,揭露 AI 语音克隆被用于制造五小时绑架诈骗,导致受害者损失 5400 美元。同时报道意大利总理注册声纹商标以应对政治深度伪造,以及索尼音乐在六个月间处理超过 26 万次 AI 音乐侵权下架请求。文章强调了当前法律滞后性与生成技术即时性之间的结构性矛盾,呼吁建立源头溯源基础设施。

RESEMBLE.AI官方 / ADK编译 4 分钟
模型发布 2026-10-08

Pixmax 发布全链路游戏素材生成平台,覆盖研发至买量全阶段

Pixmax 正式发布专为游戏行业打造的 AI 素材生成平台,深度理解游戏开发工作流,支持从研发立绘、场景贴图到宣发买量素材的全链路生产。平台通过“上传 - 生成 - 批量 - 适配”四步流程,解决风格统一与批量产出难题,显著降低美术成本与试错周期,助力中小团队提升生产效率。

Pixmax官方 / ADK编译 3 分钟
AI 工具 2026-10-08

AdsTurbo 发布 Temu GIF 转视频广告工具:15 秒内重构电商素材

AdsTurbo 推出针对 Temu 平台优化的 GIF 转视频广告工具,旨在将静态循环动图重构为具备叙事性的 15 秒短视频。该工具不仅进行格式转换,更通过 AI 提取关键帧、生成解说词与字幕、匹配多平台导出规范,帮助商家将零散的产品证据转化为高转化率的垂直视频素材,显著提升广告素材的复用性与合规性。

AdsTurbo AI官方 / ADK编译 3 分钟