Qdrant Constella 预览:无需重嵌入即可动态切换查询模型

ADK Qdrant官方 / ADK编译 2026-09-29 5 分钟 125 次浏览
速览导读 / Summary

Qdrant 发布 Constella 预览版,允许用户在无需重新嵌入文档向量的情况下,根据查询负载动态切换三种不同规模的查询模型(Zero、Nano、Full)。该方案基于 4 亿参数的 Stella 文档编码器,通过蒸馏技术实现了极轻量级的查询处理,在保持检索精度的同时,将查询速度提升了数百倍,显著降低了边缘设备与高并发场景下的计算成本。

Nano 参数规模 34.5M 相比 Full Stella 大幅缩减
Nano 检索精度保留率 ~91% 相对于 Full Stella 的平均 nDCG@10
Zero 查询速度提升 480x 相比 Full Stella 在 M5 Pro CPU 上的加速比
评估数据集 15 BEIR 涵盖科学论文、问答、事实核查等任务

Key Insights / 核心看点

  • 1 无需重新嵌入文档向量,即可根据查询负载在 Zero、Nano、Full Stella 三种模型间动态切换。
  • 2 Nano 模型仅保留 3450 万参数,却保留了 Full Stella 约 91% 的平均检索精度。
  • 3 Zero 模型在暖启动后查询速度极快(0.081ms),比 Full Stella 快约 480 倍,适合实时搜索。
  • 4 支持离线部署与混合搜索策略,显著降低边缘设备与高并发场景下的算力成本。

Qdrant Constella 预览:无需重嵌入即可动态切换查询模型

随着查询流量的激增,嵌入查询的算力成本急剧上升。在低功耗设备上,大型模型可能无法完全载入内存,而小型查询模型虽能降低成本,但传统切换方式往往意味着需要重新对文档进行嵌入,这在数据量巨大时效率极低。

Qdrant 推出了 Constella 预览版,旨在解决这一痛点。Constella 提供了一套基于 Hugging Face 的模型家族,核心是 Stella(4 亿参数英文嵌入模型),用于编码文档向量。而在查询侧,用户可以根据需求灵活选择 Zero、Nano 或 Full Stella 三种查询编码器,所有模型均针对同一个 Qdrant 集合进行检索。

核心突破:一种索引,三种查询模型

Constella 的核心设计理念是“文档侧重计算,查询侧灵活选择”。

  • 文档向量复用:文档向量一旦生成,可服务于成千上万次搜索。
  • 查询模型热插拔:Zero 和 Nano 被训练用于复现 Stella 的查询嵌入,使得查询编码器可以随请求热切换,而存储的文档向量保持固定不变。

三种查询模型详解

模型名称 架构特点 适用场景
Constella Zero 学习到的词袋(Bag of Tokens):通过查找、池化和归一化生成向量。 极低延迟、极简计算场景。
Constella Nano 3450 万参数 Transformer:结合上下文与位置信息,融合多层特征。 需要上下文感知但算力受限的场景。
Full Stella 4 亿参数 Transformer:该家族中整体检索得分最高的模型。 对检索精度要求极高的核心业务。

性能实测:速度与精度的极致平衡

Qdrant 在 15 个 BEIR 数据集上进行了全面评估,结果令人印象深刻。

1. 检索精度 (nDCG@10)

在平均 15 个数据集的测试中,Nano 保留了 Full Stella 约 91% 的平均得分,但其参数量仅为 Stella 的十二分之一。

  • Zero 的表现:虽然整体得分略低于 Nano,但在 FEVER、HotpotQA 和 Climate-FEVER 等特定数据集上表现优异。
  • 混合搜索优势:建议将 Zero 与 BM25 结合使用进行混合搜索,实验表明这种组合在提升检索质量方面比 Nano 更有效,且无需引入 Transformer 架构。

2. 查询速度 (Apple M5 Pro CPU)

在相同硬件环境下,查询编码速度差异巨大:

  • Zero: 暖启动后仅需 0.081 ms(比 Full Stella 快约 480 倍)。
  • Nano: 仅需 3.13 ms(比 Full Stella 快约 12 倍)。
  • Full Stella: 约 38.95 ms。

这意味着在需要毫秒级响应的实时搜索场景中,Zero 和 Nano 提供了巨大的性能红利。

开发者能构建什么?

Constella 为多种创新应用提供了可能:

  1. 离线低算力搜索:在服务器上用 Stella 编码知识库,将文档向量与轻量级查询模型(Zero/Nano)打包分发至边缘设备,实现断网环境下的本地搜索。
  2. 高并发检索 API:利用 Zero 处理高频低精度的查询,仅在需要高相关性时调用 Nano 或 Full Stella,实现成本与体验的最优解。
  3. 边输入边搜索 (Search as you type):利用 Zero 对用户每输入一个字符进行即时反馈,待用户停顿或提交时再切换至 Nano 进行最终检索。Qdrant 的本地宝可梦演示项目已采用此模式。

“Constella 让我们能够在不重新嵌入整个集合的情况下,根据查询负载动态调整计算资源,这是构建高效、低成本 AI 搜索系统的关键一步。” —— Qdrant 团队


注:评估数据基于 BEIR-15 数据集,部分数据集(如 FiQA, ArguAna 等)存在训练数据泄露情况,相关分数应视为家族内部对比参考。完整评估代码与实验记录已开源至 GitHub。

“Constella lets you make that switch. It's a family of models on Hugging Face built around Stella, a 400M-parameter English embedding model.”

— Qdrant Blog Post

同主题深度资讯

查看更多 →
模型发布 2026-10-08

PyTorch 原生集成 Spyre 加速器:打造企业级推理新范式

PyTorch 官方宣布通过 `torch-spyre` 库将 IBM 的 Spyre 数据流 AI 加速器打造为 PyTorch 的原生设备。此次更新实现了从设备身份、内存分配器到编译图的全链路映射,支持 `tensor.to("spyre")` 等标准操作。核心突破在于利用 Spyre 的独立计算与数据移动流水线,在保持 PyTorch 易编程性的同时,实现了极低延迟的推理加速,为 IBM Z 及 Power 系统上的企业级 AI 应用提供了统一且高效的执行路径。

PyTorch官方 / ADK编译 5 分钟
模型发布 2026-10-08

Pixmax 发布全链路游戏素材生成平台,覆盖研发至买量全阶段

Pixmax 正式发布专为游戏行业打造的 AI 素材生成平台,深度理解游戏开发工作流,支持从研发立绘、场景贴图到宣发买量素材的全链路生产。平台通过“上传 - 生成 - 批量 - 适配”四步流程,解决风格统一与批量产出难题,显著降低美术成本与试错周期,助力中小团队提升生产效率。

Pixmax官方 / ADK编译 3 分钟
AI 工具 2026-10-08

AdsTurbo 发布 Temu GIF 转视频广告工具:15 秒内重构电商素材

AdsTurbo 推出针对 Temu 平台优化的 GIF 转视频广告工具,旨在将静态循环动图重构为具备叙事性的 15 秒短视频。该工具不仅进行格式转换,更通过 AI 提取关键帧、生成解说词与字幕、匹配多平台导出规范,帮助商家将零散的产品证据转化为高转化率的垂直视频素材,显著提升广告素材的复用性与合规性。

AdsTurbo AI官方 / ADK编译 3 分钟
AI 工具 2026-10-08

AdsTurbo AI 发布无拍摄电商视频广告 SOP:单图生成 12 变体测试矩阵

AdsTurbo AI 推出针对独居电商卖家的‘无拍摄视频广告工作流’,旨在通过单一产品图和核心卖点,快速生成 12 种不同变体的短视频广告。该 SOP 强调结构化输入与模块化脚本,利用 3x2x2 组合矩阵实现高效 A/B 测试,帮助卖家在不依赖传统拍摄团队的情况下,快速验证不同钩子(Hook)、证明点(Proof)和行动号召(CTA)的转化率,大幅降低试错成本。

AdsTurbo AI官方 / ADK编译 3 分钟