终结合成数据时代:Qdrant 发布互联网级向量搜索基准
在向量搜索领域,长期存在一个痛点:许多所谓的“生产级”基准测试实际上依赖于封闭的、合成数据或受限的私有云服务。这些测试往往无法反映企业级应用面临的真实挑战——即处理数十亿向量、应对每秒数千次请求(RPS)且要求毫秒级延迟的场景。
为了解决这一行业难题,Qdrant 联合云计算合作伙伴 Vultr,于 2026 年 9 月正式发布了Qdrant-FineWeb-10B数据集,并开源了构建该基准的核心引擎Supernova。这一组合标志着向量搜索评估从“合成近似”向“真实规模验证”的重大转变。
核心突破:Qdrant-FineWeb-10B
Qdrant-FineWeb-10B 是目前社区中最大的开源向量搜索基准数据集,其规模令人瞩目:
- 数据规模:包含约 24.47 TB 的向量数据,以及 28.66 TB 的源文本和元数据。
- 向量构成:基于 Hugging Face 的 FineWeb 语料库,利用
gte-multilingual-base模型生成,涵盖 100 亿 (10B) 稠密向量和稀疏向量。 - Ground Truth 验证:团队利用 GPU 原生引擎,对 10 万 个查询进行了精确的 top-1000 最近邻计算。这一过程涉及超过 10^15 (一 quadrillion) 次距离计算。
该数据集不仅提供了稠密向量,还包含了稀疏向量和过滤条件,旨在全面覆盖现代生产架构中复杂的混合检索需求。
技术引擎:Supernova 开源框架
为了打破基准测试的垄断,Qdrant 开源了Supernova,这是一个专为大规模数据集生成和验证设计的高性能分布式框架。Supernova 自动化了构建向量搜索基准的四个核心阶段:
- Embedding Generation (嵌入生成):通过
nova-embed模块,统一支持 SentenceTransformers、FastEmbed 及 OpenAI API 等多种后端,并兼容 Hugging Face、S3 及 Cloudflare R2 等存储系统。 - Brute-Force Ground Truth (暴力穷举验证):通过
nova-bf模块,在 GPU 加速硬件上并行执行精确的最近邻搜索,无需依赖索引近似即可获得真实结果。 - Database Loading (数据库加载):高效处理海量数据导入。
- Evaluation Benchmarking (评估基准):提供标准化的性能评估接口。
Supernova 采用无状态设计,每个工作节点独立处理数据分区,实现了在云环境和 HPC 集群上的线性扩展。
扩展生态:多模态与医疗领域数据集
除了核心的 FineWeb 数据集,Qdrant 还发布了两个补充数据集,以展示 Supernova 的跨模态能力:
- PubMed-Multi-Vector:基于
BGE-M3模型,针对医疗领域生成稠密、稀疏及 ColBERT 风格的多向量表示,包含超过 83.7 亿个多向量 token,用于测试混合检索方法。 - Coyo-Vector-Embeddings:基于
Qwen3-VL-Embedding-2B模型,将 LLaVA 数据集中的图像 - 文本对投影到统一的嵌入空间,专注于多模态检索场景。
实际价值与应用场景
对于开发者和企业而言,这一发布具有深远意义:
- 可复现性:不再依赖黑盒的私有服务,开发者可以在本地基础设施上复现并验证自己的 RAG 系统性能。
- 真实压力测试:100 亿向量的规模迫使系统必须在高并发下保持亚 100ms 的 p99 延迟,这直接对应电商、市场平台等对实时性要求极高的场景。
- 标准制定:Qdrant 通过开源工具链,推动了行业对“生产级”基准测试标准的统一,让评估结果更具说服力。
正如 Qdrant 团队所言:"依赖百万级向量和合成数据的时代已经结束。这里有了真实的数据、真实的 Ground Truth,以及您运行它所需的开源基础设施。"
随着 Supernova 的普及,未来我们将看到更多基于真实互联网规模数据的模型评估,推动向量搜索技术向更严谨、更实用的方向发展。