Exa AI 发布 Exacluster:144 张 H200 GPU 集群重塑下一代搜索模型训练

ADK Exa AI官方 / ADK编译 2025-05-15 5 分钟 109 次浏览
速览导读 / Summary

Exa AI 正式推出其新一代训练集群 Exacluster,配备 144 张 NVIDIA H200 GPU、3,456 个 CPU 核心及 270 TB NVMe 存储。该集群旨在应对 Web 检索模型训练的巨大算力需求,相比旧版 A100 集群,训练效率提升约 14 倍(从一周缩短至一天)。文章详细阐述了基于 Pulumi 与 Ansible 的自动化基础设施架构,以及 NVIDIA GPU 与网络操作符如何实现裸机服务器的统一管理与高效调度。

GPU 型号 NVIDIA H200 144 张,141 GB 显存
集群算力 168 PFLOPs FP16 理论峰值算力
训练效率提升 14x 任务完成时间从 1 周缩短至 1 天
存储容量 270 TB Gen-4 NVMe SSD
CPU 核心数 3,456 Xeon 处理器

Key Insights / 核心看点

  • 1 Exacluster 配备 144 张 NVIDIA H200 GPU,总显存达 20 TB,相比旧集群算力提升约 14 倍,训练效率从一周缩短至一天。
  • 2 构建基于 Pulumi 与 Ansible 的五层自动化基础设施栈,实现裸机服务器到 Kubernetes 集群的标准化、可审计部署。
  • 3 利用 NVIDIA GPU 与 Network Operators 实现硬件统一管控,支持 MIG 分区、自动驱动升级及零漂移运维。
  • 4 集成 270 TB Gen-4 NVMe 存储与 BlueField-3 DPUs,为海量网页数据的快速嵌入与高吞吐训练提供底层支撑。

Exacluster:Exa AI 以 144 张 H200 GPU 集群重塑下一代搜索模型训练

在 Web 检索领域,神经方法正逐步取代传统方案成为主流。为了支撑这一趋势,Exa AI 近期斥资 500 万美元购置了一套全新的 GPU 集群——Exacluster。这套集群不仅是硬件的堆叠,更是其机器学习(ML)团队并行工作流的动力核心。

核心硬件规格:从 A100 到 H200 的跨越

Exacluster 由 18 个节点组成,全面升级了 Exa 自 2021 年创立以来使用的旧版集群(10 个节点,80 张 A100 GPU)。新集群在关键指标上实现了数量级的提升:

  • GPU 算力:搭载 144 张 NVIDIA H200-141 GB GPU,相比旧集群的 80 张 A100,理论 FP16 算力从约 25 PFLOPs 跃升至 143 PFLOPs,综合算力达 168 PFLOPs。
  • 显存容量:总 GPU 显存从 6.4 TB 扩充至 20 TB,极大提升了大模型微调与推理的并行度。
  • 存储与内存:配备 270 TB Gen-4 NVMe SSD36 TB DDR5-5600 系统内存,确保海量网页数据的快速加载与处理。
  • 网络互联:采用 Mellanox ConnectX-7 NIC 与 BlueField-3 DPUs,支持 GPUDirect RDMA 和 RoCE,实现低延迟的数据传输。

性能对比概览

指标 旧集群 (A100) Exacluster (H200) 综合集群
节点数 10 18 28
GPU 总数 80 144 224
总 GPU 显存 6.4 TB 20 TB 26.4 TB
CPU 核心数 960 3,456 4,416
系统内存 10 TB 36 TB 46 TB
本地 NVMe 80 TB 270 TB 350 TB
FP16 算力 ~25 PFLOPs ~143 PFLOPs ~168 PFLOPs

这一升级意味着原本需要一周才能完成的训练任务,现在仅需 约 1 天 即可完成。算力瓶颈已被大幅突破,使得 Exa 能够更高效地进行模型迭代与实验验证。

基础设施架构:五层自动化栈

将 18 台裸机服务器转化为统一的计算巨兽,Exa AI 构建了一套严密的五层自动化栈,确保系统的可重复性、一致性与可审计性。

1. Pulumi:代码即基础设施

Exa 摒弃了传统的脚本式配置,采用 Pulumi 进行基础设施即代码(IaC)管理。

  • Python 原生控制:工程师使用熟悉的 Python 语法(循环、函数、测试)编写配置,而非 YAML。
  • 类型安全:利用 Pulumi 的强类型 API 和 mypy 进行验证,在资源部署前即可捕获错误。
  • 可回滚机制:通过 planapply 工作流,任何变更都会生成清晰的差异报告,支持一键回滚。

2. Ansible + Kubespray:裸机到 Kubernetes 的自动化

Pulumi 负责整体编排,而具体的节点初始化则由 Ansible 和 Kubespray 完成。

  • 系统准备:自动配置 BIOS、存储布局、操作系统及内核模块。
  • K8s 部署:利用 Kubespray 角色快速部署控制平面和工作节点,配置 CNI(Calico)。
  • 健康检查:自动标记节点并验证状态,确保所有节点无缝加入集群。

3. NVIDIA GPU & Network Operators:全栈统一管控

NVIDIA 提供的 Kubernetes 操作符(Operators)消除了手动 SSH 和节点特定脚本的依赖,实现了硬件与软件的深度集成。

  • GPU Operator:自动管理驱动、CUDA Toolkit 和容器运行时,支持 MIG 分区,并将 DCGM 指标暴露给 Prometheus。
  • Network Operator:部署 OFED,配置 GPUDirect RDMA 和 RoCE,确保网络请求(如 rdma/rdma_network)的便捷获取。

这种容器化的管理方式确保了每个节点运行完全相同的软件栈,即使重启或升级也不会出现配置漂移。新的 CUDA 版本发布时,只需将节点隔离、升级并测试,即可平滑推进至生产环境。

结语

Exacluster 的上线标志着 Exa AI 在 Web 检索大模型训练能力上的重大飞跃。通过引入 H200 硬件与高度自动化的运维架构,Exa 不仅解决了算力瓶颈,更为未来处理海量网页数据、训练更精准的检索模型奠定了坚实基础。正如团队所言,这不仅是硬件的升级,更是从"拥有 GPU"到"高效利用 GPU"的范式转变。

What this means is that a run that used to take a week to complete can now finish in ~1 day. No longer compute-bound! (as much)

Carlos Marques, Technical Staff at Exa AI

同主题深度资讯

查看更多 →
产品动态 2026-09-15

Topview 发布 Codex 插件工作流:在 ChatGPT 生态内实现 AI 视频生成

Topview 正式宣布其插件工作流集成至 OpenAI 的 Codex 代理系统,支持在本地桌面端或 CLI 中直接调用生成式模型创建 AI 视频。文章详细区分了 ChatGPT 网页版插件目录与 Codex 本地代理的架构差异,明确了安装路径、OAuth 认证流程及 Canvas 画布工作流。该更新旨在解决开发者在 ChatGPT 生态内调用视频生成模型(如 Seedance, Wan 3.0 等)的碎片化问题,强调 Pro 及以上订阅计划对自动化工作流的必要性。

Topview官方 / ADK编译 5 分钟
产品动态 2026-09-06

Adobe Photoshop 与 Upscale.media 联手:AI 驱动图像超分辨率技术深度解析

Adobe Photoshop 与 AI 图像增强工具 Upscale.media 宣布深度整合,旨在为专业用户提供更高效的图像超分辨率解决方案。此次合作利用先进的 AI 算法,在不依赖复杂软件学习曲线的情况下,实现从低分辨率到高清图像的无损转换。文章详细阐述了该技术在保留细节、修复模糊以及支持多格式处理方面的核心优势,并展示了从上传到下载的完整操作流程,标志着图像增强领域向更智能化、便捷化方向迈出了重要一步。

Upscale.media官方 / ADK编译 4 分钟
产品动态 2026-09-06

Adobe Photoshop 2025 图像分辨率优化指南:超分辨率与智能放大技巧

Adobe Photoshop 2025 在图像分辨率处理上带来了显著优化,重点介绍了如何利用内置的“超分辨率”功能无损放大 JPEG 图像。本文详细解析了从基础图像尺寸调整到高级 Camera Raw 滤镜应用的完整流程,帮助设计师和摄影师在保持画质的前提下提升输出质量。

Upscale.media官方 / ADK编译 4 分钟
产品动态 2026-09-06

Upscale.media 发布智能图像增强方案:AI 驱动高清修复与细节重构

Upscale.media 推出全新图像增强指南,详解如何利用 AI 技术将低分辨率图片转化为高清视觉内容。文章解析了图像上采(Upscaling)的核心原理,涵盖分辨率、锐度、色彩准确性等关键质量指标,并展示了该工具在商业展示、印刷输出及个人创作中的实际应用价值,旨在帮助用户摆脱像素化困扰,实现无损画质提升。

Upscale.media官方 / ADK编译 4 分钟
search · 免费
★ 5.0 · 120评测
E

Exa AI

专门为AI模型设计的搜索引擎平台

Exa AI是专门为AI模型设计的搜索引擎平台。为 AI 构建的一个搜索引擎,而非为人类构建一个新的搜索引擎,也就是 Google for AI。采用先进的向量数据库和嵌入模型技术,实现深度语搜索,超越关键词匹配,直接预测并提供相关链接。Exa AI的搜索引擎通过端到端Transformer架构优化,过滤SEO干扰,为AI代理提供准确、实时的互联网信息访问,支持大规模数据检索,助力AI的决策支持和深度学习。该公司已完成2200万美元融资,投资者包括英伟达等,致力于整合世界知识,服务于AI的未来。

查看 Exa AI 使用教程与功能