Exacluster:Exa AI 以 144 张 H200 GPU 集群重塑下一代搜索模型训练
在 Web 检索领域,神经方法正逐步取代传统方案成为主流。为了支撑这一趋势,Exa AI 近期斥资 500 万美元购置了一套全新的 GPU 集群——Exacluster。这套集群不仅是硬件的堆叠,更是其机器学习(ML)团队并行工作流的动力核心。
核心硬件规格:从 A100 到 H200 的跨越
Exacluster 由 18 个节点组成,全面升级了 Exa 自 2021 年创立以来使用的旧版集群(10 个节点,80 张 A100 GPU)。新集群在关键指标上实现了数量级的提升:
- GPU 算力:搭载 144 张 NVIDIA H200-141 GB GPU,相比旧集群的 80 张 A100,理论 FP16 算力从约 25 PFLOPs 跃升至 143 PFLOPs,综合算力达 168 PFLOPs。
- 显存容量:总 GPU 显存从 6.4 TB 扩充至 20 TB,极大提升了大模型微调与推理的并行度。
- 存储与内存:配备 270 TB Gen-4 NVMe SSD 和 36 TB DDR5-5600 系统内存,确保海量网页数据的快速加载与处理。
- 网络互联:采用 Mellanox ConnectX-7 NIC 与 BlueField-3 DPUs,支持 GPUDirect RDMA 和 RoCE,实现低延迟的数据传输。
性能对比概览
| 指标 | 旧集群 (A100) | Exacluster (H200) | 综合集群 |
|---|---|---|---|
| 节点数 | 10 | 18 | 28 |
| GPU 总数 | 80 | 144 | 224 |
| 总 GPU 显存 | 6.4 TB | 20 TB | 26.4 TB |
| CPU 核心数 | 960 | 3,456 | 4,416 |
| 系统内存 | 10 TB | 36 TB | 46 TB |
| 本地 NVMe | 80 TB | 270 TB | 350 TB |
| FP16 算力 | ~25 PFLOPs | ~143 PFLOPs | ~168 PFLOPs |
这一升级意味着原本需要一周才能完成的训练任务,现在仅需 约 1 天 即可完成。算力瓶颈已被大幅突破,使得 Exa 能够更高效地进行模型迭代与实验验证。
基础设施架构:五层自动化栈
将 18 台裸机服务器转化为统一的计算巨兽,Exa AI 构建了一套严密的五层自动化栈,确保系统的可重复性、一致性与可审计性。
1. Pulumi:代码即基础设施
Exa 摒弃了传统的脚本式配置,采用 Pulumi 进行基础设施即代码(IaC)管理。
- Python 原生控制:工程师使用熟悉的 Python 语法(循环、函数、测试)编写配置,而非 YAML。
- 类型安全:利用 Pulumi 的强类型 API 和
mypy进行验证,在资源部署前即可捕获错误。 - 可回滚机制:通过
plan与apply工作流,任何变更都会生成清晰的差异报告,支持一键回滚。
2. Ansible + Kubespray:裸机到 Kubernetes 的自动化
Pulumi 负责整体编排,而具体的节点初始化则由 Ansible 和 Kubespray 完成。
- 系统准备:自动配置 BIOS、存储布局、操作系统及内核模块。
- K8s 部署:利用 Kubespray 角色快速部署控制平面和工作节点,配置 CNI(Calico)。
- 健康检查:自动标记节点并验证状态,确保所有节点无缝加入集群。
3. NVIDIA GPU & Network Operators:全栈统一管控
NVIDIA 提供的 Kubernetes 操作符(Operators)消除了手动 SSH 和节点特定脚本的依赖,实现了硬件与软件的深度集成。
- GPU Operator:自动管理驱动、CUDA Toolkit 和容器运行时,支持 MIG 分区,并将 DCGM 指标暴露给 Prometheus。
- Network Operator:部署 OFED,配置 GPUDirect RDMA 和 RoCE,确保网络请求(如
rdma/rdma_network)的便捷获取。
这种容器化的管理方式确保了每个节点运行完全相同的软件栈,即使重启或升级也不会出现配置漂移。新的 CUDA 版本发布时,只需将节点隔离、升级并测试,即可平滑推进至生产环境。
结语
Exacluster 的上线标志着 Exa AI 在 Web 检索大模型训练能力上的重大飞跃。通过引入 H200 硬件与高度自动化的运维架构,Exa 不仅解决了算力瓶颈,更为未来处理海量网页数据、训练更精准的检索模型奠定了坚实基础。正如团队所言,这不仅是硬件的升级,更是从"拥有 GPU"到"高效利用 GPU"的范式转变。