Qdrant 发布 FineWeb-10B 数据集与 Supernova 开源基准引擎,终结合成数据时代

ADK Qdrant官方 / ADK编译 2026-09-01 5 分钟 169 次浏览
速览导读 / Summary

Qdrant 联合 Vultr 发布业界首个互联网规模开源向量搜索基准数据集 Qdrant-FineWeb-10B,包含 100 亿向量及海量真实文本。同时开源高性能基准引擎 Supernova,支持亿级向量的并行计算与精确 Ground Truth 验证。此举旨在解决现有基准测试依赖合成数据、门槛过高的问题,为生产级 RAG 系统提供可复现、高吞吐的评估标准。

数据集规模 10B Vectors / 24.47 TB Qdrant-FineWeb-10B 核心向量数据量
查询数量 100,000 Queries 用于 Ground Truth 验证的查询总数
计算量 1 Quadrillion+ Ops 并行执行的距离计算次数
模型支持 gte-multilingual-base, BGE-M3, Qwen3-VL 支持的嵌入模型列表

Key Insights / 核心看点

  • 1 发布 Qdrant-FineWeb-10B:首个包含 100 亿向量及 28TB 文本的开源互联网级基准数据集。
  • 2 开源 Supernova 引擎:支持亿级向量并行计算的分布式框架,实现精确的暴力穷举验证。
  • 3 覆盖多模态与医疗领域:新增 PubMed-Multi-Vector 和 Coyo-Vector-Embeddings 数据集。
  • 4 解决合成数据痛点:提供可复现、高吞吐的生产级 RAG 系统评估标准。

终结合成数据时代:Qdrant 发布互联网级向量搜索基准

在向量搜索领域,长期存在一个痛点:许多所谓的“生产级”基准测试实际上依赖于封闭的、合成数据或受限的私有云服务。这些测试往往无法反映企业级应用面临的真实挑战——即处理数十亿向量、应对每秒数千次请求(RPS)且要求毫秒级延迟的场景。

为了解决这一行业难题,Qdrant 联合云计算合作伙伴 Vultr,于 2026 年 9 月正式发布了Qdrant-FineWeb-10B数据集,并开源了构建该基准的核心引擎Supernova。这一组合标志着向量搜索评估从“合成近似”向“真实规模验证”的重大转变。

核心突破:Qdrant-FineWeb-10B

Qdrant-FineWeb-10B 是目前社区中最大的开源向量搜索基准数据集,其规模令人瞩目:

  • 数据规模:包含约 24.47 TB 的向量数据,以及 28.66 TB 的源文本和元数据。
  • 向量构成:基于 Hugging Face 的 FineWeb 语料库,利用 gte-multilingual-base 模型生成,涵盖 100 亿 (10B) 稠密向量和稀疏向量。
  • Ground Truth 验证:团队利用 GPU 原生引擎,对 10 万 个查询进行了精确的 top-1000 最近邻计算。这一过程涉及超过 10^15 (一 quadrillion) 次距离计算。

该数据集不仅提供了稠密向量,还包含了稀疏向量和过滤条件,旨在全面覆盖现代生产架构中复杂的混合检索需求。

技术引擎:Supernova 开源框架

为了打破基准测试的垄断,Qdrant 开源了Supernova,这是一个专为大规模数据集生成和验证设计的高性能分布式框架。Supernova 自动化了构建向量搜索基准的四个核心阶段:

  1. Embedding Generation (嵌入生成):通过 nova-embed 模块,统一支持 SentenceTransformers、FastEmbed 及 OpenAI API 等多种后端,并兼容 Hugging Face、S3 及 Cloudflare R2 等存储系统。
  2. Brute-Force Ground Truth (暴力穷举验证):通过 nova-bf 模块,在 GPU 加速硬件上并行执行精确的最近邻搜索,无需依赖索引近似即可获得真实结果。
  3. Database Loading (数据库加载):高效处理海量数据导入。
  4. Evaluation Benchmarking (评估基准):提供标准化的性能评估接口。

Supernova 采用无状态设计,每个工作节点独立处理数据分区,实现了在云环境和 HPC 集群上的线性扩展。

扩展生态:多模态与医疗领域数据集

除了核心的 FineWeb 数据集,Qdrant 还发布了两个补充数据集,以展示 Supernova 的跨模态能力:

  • PubMed-Multi-Vector:基于 BGE-M3 模型,针对医疗领域生成稠密、稀疏及 ColBERT 风格的多向量表示,包含超过 83.7 亿个多向量 token,用于测试混合检索方法。
  • Coyo-Vector-Embeddings:基于 Qwen3-VL-Embedding-2B 模型,将 LLaVA 数据集中的图像 - 文本对投影到统一的嵌入空间,专注于多模态检索场景。

实际价值与应用场景

对于开发者和企业而言,这一发布具有深远意义:

  • 可复现性:不再依赖黑盒的私有服务,开发者可以在本地基础设施上复现并验证自己的 RAG 系统性能。
  • 真实压力测试:100 亿向量的规模迫使系统必须在高并发下保持亚 100ms 的 p99 延迟,这直接对应电商、市场平台等对实时性要求极高的场景。
  • 标准制定:Qdrant 通过开源工具链,推动了行业对“生产级”基准测试标准的统一,让评估结果更具说服力。

正如 Qdrant 团队所言:"依赖百万级向量和合成数据的时代已经结束。这里有了真实的数据、真实的 Ground Truth,以及您运行它所需的开源基础设施。"

随着 Supernova 的普及,未来我们将看到更多基于真实互联网规模数据的模型评估,推动向量搜索技术向更严谨、更实用的方向发展。

The era of relying on 1-million vector datasets, production hearsay, and synthetic approximations is over. Here is the real data, the real ground truth, and the open-source infrastructure you need to run it yourself.

Qdrant Labs Team

同主题深度资讯

查看更多 →
产品动态 2026-09-15

Topview 发布 Codex 插件工作流:在 ChatGPT 生态内实现 AI 视频生成

Topview 正式宣布其插件工作流集成至 OpenAI 的 Codex 代理系统,支持在本地桌面端或 CLI 中直接调用生成式模型创建 AI 视频。文章详细区分了 ChatGPT 网页版插件目录与 Codex 本地代理的架构差异,明确了安装路径、OAuth 认证流程及 Canvas 画布工作流。该更新旨在解决开发者在 ChatGPT 生态内调用视频生成模型(如 Seedance, Wan 3.0 等)的碎片化问题,强调 Pro 及以上订阅计划对自动化工作流的必要性。

Topview官方 / ADK编译 5 分钟
产品动态 2026-09-06

Adobe Photoshop 与 Upscale.media 联手:AI 驱动图像超分辨率技术深度解析

Adobe Photoshop 与 AI 图像增强工具 Upscale.media 宣布深度整合,旨在为专业用户提供更高效的图像超分辨率解决方案。此次合作利用先进的 AI 算法,在不依赖复杂软件学习曲线的情况下,实现从低分辨率到高清图像的无损转换。文章详细阐述了该技术在保留细节、修复模糊以及支持多格式处理方面的核心优势,并展示了从上传到下载的完整操作流程,标志着图像增强领域向更智能化、便捷化方向迈出了重要一步。

Upscale.media官方 / ADK编译 4 分钟
产品动态 2026-09-06

Adobe Photoshop 2025 图像分辨率优化指南:超分辨率与智能放大技巧

Adobe Photoshop 2025 在图像分辨率处理上带来了显著优化,重点介绍了如何利用内置的“超分辨率”功能无损放大 JPEG 图像。本文详细解析了从基础图像尺寸调整到高级 Camera Raw 滤镜应用的完整流程,帮助设计师和摄影师在保持画质的前提下提升输出质量。

Upscale.media官方 / ADK编译 4 分钟
产品动态 2026-09-06

Upscale.media 发布智能图像增强方案:AI 驱动高清修复与细节重构

Upscale.media 推出全新图像增强指南,详解如何利用 AI 技术将低分辨率图片转化为高清视觉内容。文章解析了图像上采(Upscaling)的核心原理,涵盖分辨率、锐度、色彩准确性等关键质量指标,并展示了该工具在商业展示、印刷输出及个人创作中的实际应用价值,旨在帮助用户摆脱像素化困扰,实现无损画质提升。

Upscale.media官方 / ADK编译 4 分钟