Lucy 构建 280 万份财报检索层:Qdrant TurboQuant 量化与混合搜索实战
在金融 AI 领域,准确性意味着金钱。Lucy 是一家专注于构建金融数据基础设施的公司,其核心挑战是将美国 SEC EDGAR 系统与韩国 DART 系统中长达 10 年(2016-2026)的 280 万+份监管文件,转化为 AI 系统可检索、可推理的结构化数据。
这些文件涵盖 10-K、10-Q、8-K 等 27 种申报类型,单份文件长达 200 页,包含复杂的表格、图像及交叉引用。Lucy 的愿景是:利用精心构建的检索层,让轻量级开源模型在回答特定财务问题时,表现优于依赖网络搜索的顶级大模型(Frontier Models)。
为什么通用大模型在金融领域“失灵”?
分析师和投资者普遍发现,直接询问 ChatGPT 或 Claude 关于公司财报的具体问题时,模型常返回错误答案。在金融领域,一个数字的错误可能导致数百万美元的损失,因此标准不是“大致正确”,而是“可追溯至原始申报文件”。
构建这一检索层面临两大难题:
- 数据质量:如何将 200 页的文档转化为保留原始表格结构、标准化 XBRL 事实且带有来源链接的文本块?
- 检索精度:在数百万文档中,如何确保正确的片段排在首位,而非仅仅依赖语义相似度?
Qdrant 的核心价值:混合搜索与极致量化
Lucy 选择 Qdrant 并非偶然,而是基于三个关键需求:
1. 原生 Payload 过滤
财务查询携带大量结构化信号(如 CIK 编号、表单类型、特定条款)。Qdrant 的 Payload Filtering 允许在查询执行时直接应用这些过滤条件,而非在向量检索后二次筛选,极大提升了检索效率。
2. 混合搜索(Hybrid Search)
财务文本包含大量专有名词和表格项,仅靠嵌入向量(Embeddings)容易遗漏。Lucy 采用 Dense Vectors(语义匹配)与 Sparse Vectors(BM25 精确匹配)结合的混合搜索策略,并通过 Reciprocal Rank Fusion (RRF) 融合排名,确保召回率。
3. TurboQuant 量化技术
随着语料库规模扩大,存储成本成为瓶颈。Lucy 评估了 Qdrant 的 TurboQuant 技术,发现其能在几乎不损失检索质量的前提下大幅降低内存占用。
关键性能指标与实测数据
Lucy 在 FinanceBench 等基准测试中取得了显著成果:
- 内存压缩效率:在 1,536 维度的 10-K 语料库上,4 位 TurboQuant 将内存占用从约 52 GB 降至 10.7 GB,压缩比高达 4.9 倍。
- 检索质量保持:在去除元数据过滤的测试中,混合检索(Dense + BM25)的 Recall@20、MRR 和 nDCG@20 指标相比纯稠密检索分别提升了 0.2%、0.1% 和 0.1%,证明稀疏侧有效弥补了量化带来的稠密侧损失。
- 最终评测表现:Lucy 的检索层在 FinanceBench 上实现了 Recall@20 超过 94%,仅靠检索优化就带来了 0.16 的回答准确率提升。
Lucy 工程师 Jongbok Lee 指出,对于韩语 DART 文件,他们采用了更激进的 2 位量化以节省空间,而针对 SEC 文件则保守使用 4 位量化,这种策略平衡了成本与精度。
总结
Lucy 的案例证明了在垂直领域,一个精心设计的检索层(RAG)结合高效的向量数据库(Qdrant),能够超越通用大模型。通过 TurboQuant 解决存储瓶颈,通过混合搜索解决精度痛点,Lucy 为金融 AI 提供了可信赖的“事实来源”层。