Qdrant 深度实测:Jev 如何以通用分类器重塑检索体验
在机器学习的漫长演进中,分类问题一直是核心挑战之一。从传统的训练专用分类器,到依赖零样本(Zero-shot)的预训练模型,再到如今广泛使用的提示工程(Prompting)大语言模型,开发者一直在寻找平衡点:如何在保持灵活性的同时,解决 LLM 在分类任务中响应慢、成本高以及输出不受控的痛点。
随着 TypeSafe 推出的 Jev 模型通过 OpenRouter 服务化,这一格局发生了根本性变化。Qdrant 团队在其官方博客《Jevjitsu》中,通过一系列严谨的实验,验证了 Jev 作为“通用分类器”在检索增强生成(RAG)和搜索优化中的巨大潜力。
核心突破:无需训练,即插即用
Jev 的核心哲学是延续“描述它,无需训练它”(describe it, don't train it)的理念,同时解决了 LLM 在分类场景下的三大硬伤:
- 速度:Jev 直接返回数值评分,无需生成文本,推理速度极快。
- 成本:相比调用大模型进行多轮对话或复杂推理,Jev 的单次请求成本极低。
- 可控性:输出严格约束在候选标签范围内,天然符合分类任务需求。
实测一:重排(Reranking)的性价比革命
在混合搜索(Hybrid Search)中,初步检索往往能召回有用结果,但排序至关重要。传统的 LLM 重排虽然智能,但代价高昂;而本地交叉编码器(Cross-encoders)虽快,却缺乏灵活性。
Qdrant 团队在 NFCorpus 基准上进行了 100 次查询测试,对比了 Jev 的三种模式与 BGE-small 基础检索及本地交叉编码器。
- Jev Score:仅需 1 次请求,nDCG@10 提升 +0.0665。
- Jev Choice:仅需 1 次请求,nDCG@10 提升 +0.0583。
- Jev Iterative:需 10 次请求,nDCG@10 提升 +0.0746。
关键发现:尽管 Iterative 模式得分最高,但其成本是 Score 模式的 10 倍,且性能提升微乎其微(差距小于 0.02)。相比之下,Jev Score 以极低的单次请求成本,就提供了超越基础向量检索和传统交叉编码器的性能。这证明了在重排场景中,灵活性、延迟和成本的平衡至关重要。
实测二:解决“重复结果”的多样性难题
另一个常见痛点是搜索结果缺乏多样性。例如,搜索"iPhone"可能返回大量同型号变体,导致用户感到厌倦。
团队在 WANDS 基准上测试了减少重复对结果多样性的影响。实验显示,仅靠 Qdrant 内置的最大边际相关性(MMR)算法,虽然消除了重复对,但相关性(nDCG@10)下降了 0.12。
创新方案:将 Jev 的评分作为 MMR 算法中的相关性信号。
- 组合策略:先进行 MMR 去重,再用 Jev 重排。
- 效果:在保持极低重复率(近重复对降至 0.04)的同时,nDCG@10 依然保持在 0.723 的高水平。
这一结果表明,Jev 不仅能排序,还能作为信号引导多样性算法,实现“既相关又多样”的理想搜索结果。
总结与展望
Jev 的引入标志着从“大模型万能论”向“具体方法论”的回归。对于开发者而言,这意味着无需为每个分类任务单独微调模型,即可获得高性能、低延迟的解决方案。Qdrant 的实验数据有力地证明了,在检索优化的关键链路中,专用且高效的分类模型往往比通用的生成式模型更具实用价值。
未来,团队计划进一步探索 Jev 在文档分块(Chunking)和更复杂搜索决策中的应用,持续推动这一通用分类器生态的发展。