DeepMind 发布 AlphaGenome:突破百万碱基长序列预测,重塑基因组功能理解
更新背景:破解基因组“阅读”的终极谜题
基因组被视为生命的细胞指令手册,包含指导生物体从外观到繁殖的所有 DNA 信息。然而,如何解读这些分子层面的指令,以及微小的 DNA 变异如何影响基因表达和疾病易感性,仍是生物学界最大的未解之谜之一。
在此背景下,DeepMind 于 2025 年 6 月 25 日正式发布了 AlphaGenome。这是一款全新的统一 DNA 序列模型,旨在更准确、全面地预测人类 DNA 序列中的单点变异(variants)或突变对广泛生物过程的影响。该模型现已通过 AlphaGenome API 向非商业研究项目开放预览。
核心突破:长序列与高分辨率的完美平衡
AlphaGenome 的核心突破在于解决了现有模型在“序列长度”与“预测分辨率”之间难以兼顾的痛点。
- 超长上下文窗口:模型能够处理长达 100 万个碱基对(base-pairs) 的 DNA 序列。这对于覆盖调控基因的区域至关重要,因为基因调控往往发生在距离基因座数公里远的地方。
- 单碱基分辨率:尽管输入序列极长,模型仍能输出针对单个碱基的高精度预测。这种高分辨率对于捕捉细微的生物学细节和罕见疾病变异的影响不可或缺。
- 架构演进:AlphaGenome 在之前的 Enformer 模型基础上进行了优化。它利用卷积层检测局部模式,利用 Transformer 架构在序列全范围内传递信息,并最终将模式转化为多模态预测。训练过程分布在多个互联的 Tensor Processing Units (TPUs) 上。
关键技术指标与性能表现
| 指标项 | 具体表现 | 意义 |
|---|---|---|
| 输入长度 | 高达 1,000,000 bp | 覆盖全基因组尺度的调控区域 |
| 预测分辨率 | 单碱基 (Base-resolution) | 捕捉细微的分子变化 |
| 训练时长 | 约 4 小时 | 相比 Enformer 显著降低计算成本 |
| 计算资源 | 仅需 Enformer 一半的算力预算 | 大幅降低科研门槛 |
| 训练数据 | ENCODE, GTEx, 4D Nucleome, FANTOM5 | 基于大规模公共 Consortium 数据 |
核心功能特性
1. 全面的预测模态 (Comprehensive Multimodal Prediction)
AlphaGenome 能够同时预测数千种分子特性,包括:
- 基因在不同细胞类型和组织中的起始与终止位置。
- RNA 剪接(splicing)的具体位置及表达水平。
- RNA 产量。
- DNA 碱基的可及性、邻近性以及特定蛋白质的结合情况。
2. 高效的变异评分 (Efficient Variant Scoring)
模型不仅能预测属性,还能在秒级时间内评估遗传变异的影响。通过对比突变序列与未突变序列的预测差异,AlphaGenome 能够高效地总结变异对各类分子属性的影响,这对于药物靶点发现至关重要。
3. 创新的剪接位点建模 (Novel Splice-junction Modeling)
针对许多罕见遗传疾病(如脊髓性肌萎缩症、囊性纤维化等)由 RNA 剪接错误引起的情况,AlphaGenome 首次能够直接从序列中显式建模剪接连接的位置和表达水平,提供了关于基因变异后果的更深层洞察。
实际价值与应用前景
AlphaGenome 的发布标志着生物计算领域的一个重要里程碑。它不仅是对 AlphaMissense(专注于编码区)的互补,更是对那占基因组 98% 的非编码区域提供了全新的解读视角。
对于科研人员和开发者而言,AlphaGenome 意味着:
- 加速药物研发:快速筛选致病突变,识别潜在的药物靶点。
- 精准医疗:深入理解个体基因组差异对疾病易感性的影响。
- 降低门槛:相比训练 Enformer 所需的巨大算力,AlphaGenome 的训练成本大幅降低,使得更多实验室能够开展前沿研究。
DeepMind 表示,AlphaGenome 将成为科学界的宝贵资源,帮助科学家更好地理解基因组功能,推动新的生物学发现和新疗法的开发。随着该模型的持续迭代,我们有理由期待其在解读生命密码方面发挥更大的作用。
注:该研究已发表于《Nature》,完整论文及模型访问链接可参考官方更新。