拜耳构建企业级多模态搜索引擎:Qdrant 助力 150 万消息处理与合规云架构
背景:从“AI 侧项目”到组织核心杠杆
拜耳(Bayer)是一家全球性的生命科学公司,其愿景是“为所有人提供健康,消除饥饿”。在这一宏大目标下,AI 不再被视为边缘实验,而是贯穿药物研发、患者护理及全球粮食生产的核心杠杆。然而,将 AI 转化为服务于 116,000 名员工的生产级系统,面临着巨大的基础设施挑战:
- 高并发与低延迟:检索系统必须在持续高负载下保持极速响应。
- 数据 grounding:需将大语言模型(LLMs)锚定在真实数据上,以抑制幻觉(Hallucinations)。
- 严格合规:必须满足生命科学行业的严苛合规要求,确保数据不出域。
- 架构演进:系统需从简单的聊天机器人平滑过渡到复杂的自主智能体(Autonomous Agents)。
核心突破:myGenAssist 平台的崛起
拜耳 AI/ML 高级总监 Hooman Sedghamiz 指出,随着 ChatGPT 的普及,AI 从专家工具变成了全员工具。拜耳迅速响应,在三个月内推出了内部生成式 AI 平台 myGenAssist。
该平台已成长为全公司通用的基础设施层:
- 规模:服务全公司,每月处理超过 150 万条消息。
- 数据量:已索引超过 450,000 份上传文档。
- 用户体验:对用户而言,复杂的 RAG(检索增强生成)流程被完全隐藏,仅需简单的文件上传。
技术选型:为何选择 Qdrant?
三年前,拜耳在评估向量搜索引擎时,最初尝试基于 Redis 的原型,但因扩展性不足而放弃。最终,Qdrant 凭借其独特优势脱颖而出:
- 开源与敏捷性:无需繁琐的采购流程,团队可快速测试与迭代。
- Rust 原生性能:基于 Rust 编写,提供了拜耳所需的内存效率与可预测的性能表现,这对生命科学工作负载至关重要。
- 价格性能比:在有限的预算下提供了最优的延迟与吞吐比。
架构演进:混合云与多模态未来
面对合规压力,拜耳放弃了纯自托管模式,转而采用 混合云(Hybrid Cloud) 架构。利用 Kubernetes Operator,拜耳将数据保留在受控的私有环境中以满足合规性,同时将集群管理的重负载卸载至云端。
当前部署规模令人瞩目:
- 集群规模:4 节点 Qdrant Hybrid Cloud 集群。
- 数据量:存储约 1.35 亿个向量点,分布在 7 个集合中。
- 混合向量:最大的用户文件存储集合包含 9100 万个点,采用密集(Dense)与稀疏(Sparse)混合向量技术。
挑战与应对
随着数据模型向多模态(Omnimodal)演进,系统需支持视频、音频及各类资产。拜耳面临的最大工程挑战并非 Qdrant 本身,而是数据同步管道:
- 持续同步:用户将平台视为“文件驱动器”,频繁上传与修改文档,要求向量库与源文档实时一致。
- 解析负载:文档解析前的预处理是主要负载来源,团队需不断优化解析与向量化流程。
“以前人们只看向量数据库用于 RAG 应用,现在他们正在解决企业搜索问题。没有人拥有这样一个全模态搜索引擎,可以搜索视频、音频以及公司生成的所有资产。我们意识到 Qdrant 正在成为那个引擎。”
—— Hooman Sedghamiz, Bayer Senior Director AI/ML
应用价值总结
拜耳的案例展示了 Qdrant 如何从单一的向量检索工具,演变为支撑企业级多模态搜索与智能体系统的基石。通过混合云架构与高性能向量存储,拜耳成功平衡了合规性、扩展性与开发效率,为其他大型组织提供了宝贵的参考范式。