Qdrant 1.19 发布:TurboQuant 四倍压缩与统一内存层级架构升级
Qdrant 官方于 2026 年 8 月 5 日发布了 1.19.0 版本,此次更新聚焦于存储效率革命与内存管理简化两大核心方向。在向量数据库面临海量数据存储成本与检索延迟的双重压力下,Qdrant 通过引入 TurboQuant Datatype 和统一的 Memory Tiers 机制,为开发者提供了更极致的性价比与更清晰的架构配置。
核心突破:TurboQuant Datatype 实现 9 倍存储压缩
Qdrant 此前在 1.18 版本中推出的 TurboQuant 量化技术,仅作为 HNSW 遍历的辅助层,保留了全精度副本以确保召回率。而在 1.19 中,Qdrant 将这一理念延伸至存储层本身,正式推出了 Turbo4 Datatype。
- 存储压缩率提升 9 倍:Turbo4 仅使用 4-bit 的 TurboQuant 压缩表示存储向量,彻底摒弃了全精度(float32)副本。相比传统的 36-bit 每维(12-bit 全精度 + 4-bit 压缩),存储空间直接缩减至 4-bit,实现9 倍的存储压缩。
- I/O 性能飞跃:大幅减少的数据读写操作显著提升了吞吐量,尤其对于 ColBERT 风格的 Multi-vector 集合,收益更为显著。
- 适用场景明确:该特性适用于对存储成本敏感、且能接受轻微召回损失的场景。若追求极致召回率,仍需保留全精度副本。
架构简化:统一 Memory Tiers 参数
过去,Qdrant 中向量、索引、稀疏索引等组件各自拥有独立的内存配置参数(如 on_disk, always_ram 等),导致配置碎片化。1.19 版本通过引入单一的 memory 参数,实现了全组件的统一内存层级管理。
该参数支持三种层级:
- pinned:组件数据完全加载至内存,永不驱逐(适用于高频访问的 HNSW 图链接)。
- cached:数据驻留磁盘,启动时预填充 OS 缓存,平衡速度与空间。
- cold:懒加载,仅在首次访问时从磁盘读取。
此外,稀疏索引和量化向量也获得了独立的层级控制能力,进一步增强了灵活性。
多租户优化:租户级 IDF 统计
在多租户部署中,传统的 IDF(逆文档频率)计算基于整个数据集,导致不同租户间的词汇差异被模糊,严重影响 BM25 搜索的准确性。Qdrant 1.19 允许将 IDF 统计范围收窄至特定租户,使术语稀有度更真实地反映该租户的语料分布,从而显著提升多租户环境下的混合搜索(Hybrid Search)效果。
检索增强:前缀匹配与切片过滤
- 关键词字段前缀匹配:支持在 Keyword Index 上直接进行前缀过滤(如
prefix: "https://qdrant"),无需全量扫描或依赖文本索引,速度媲美其他索引过滤。 - Slice 切片过滤:新增
slice条件,将集合划分为确定性、互斥的子集。这使得并行处理、分片滚动查询等复杂模式成为可能,为大规模数据的高效遍历提供了新路径。
开发者价值总结
Qdrant 1.19 不仅解决了存储成本与性能之间的矛盾,更通过统一的配置模型降低了运维复杂度。对于构建大规模向量检索系统、多租户 SaaS 应用或需要极致性价比的 AI 基础设施团队而言,此次更新提供了关键的架构升级选项。
"我们致力于让向量数据库在存储效率与检索速度之间找到最佳平衡点,Turbo4 和 Memory Tiers 正是这一愿景的具象化体现。" —— Qdrant 官方团队