Augment Code 发布 Cosmos 平台:AI Agent 将事故调查效率提升 81%
背景:AI 原生组织的新瓶颈
随着编程与代码审查在 AI 原生组织中的高度自动化,Incident Management(事故管理) 已成为新的主要瓶颈。在小型、快节奏的团队中(通常 2-5 人),轮值工程师(On-call)往往无法在轮值期间有效贡献于功能开发,运营负担直接拖慢了工程速度。
即使拥有现代的可观测性工具,事故响应仍要求工程师在高压下重建上下文:关联部署、搜索 Slack 线程、检查仪表盘、识别所有权并重新发现过往事故。当警报触发时,工程师通常需要在 PagerDuty、Slack、仪表盘、日志、指标、GitHub 和过往事故之间跳跃,试图回答几个核心问题:
- 到底发生了什么?
- 最近的部署是否导致了此问题?
- 受影响服务的负责人是谁?
- 这是已知问题吗?
- 下一步该怎么做?
大多数工作都是重复性的调查工作。Augment Code 的目标是让 Agent 驱动重复性的事故调查,而将人类主要保留用于判断、优先级排序和修复决策。
核心突破:Cosmos 平台与 Incident Investigator
今年早些时候,Augment Code 内部推出了 Cosmos,这是专为自动化软件工程工作流设计的操作系统。Cosmos 旨在利用长期运行的专家 Agent 跨整个软件开发生命周期(SDLC)工作,并与人类协作。
本次更新聚焦于 Cosmos 中的 Incident Investigator(事故调查员) 专家 Agent:
1. 自动化根因分析 (RCA)
Incident Investigator 直接在事故响应的 Slack 通道内运行。它接收 PagerDuty 警报,执行结构化的调查,并在人类查看警报之前,就在线程中发布初步的 RCA 和推荐的修复行动(代码修复、回滚、升级或仅监控)。
- 工作流程:调查员遵循固定的运营工作流,涵盖排查、调查、沟通、修复建议和事后总结。
- 人类介入点:人类仅需扫描 RCA,可选提问,并对修复行动做出判断。对于平均警报,人类仅需不到一分钟即可介入。这是人类唯一深度参与的时刻。
2. 高质量 RCA 的生成机制
为了确保生成的分析质量高于普通开发人员,Incident Investigator 被赋予了与值班工程师相同的全套工具访问权限:
- 数据源:日志、指标、近期部署记录、GitHub 历史、代码上下文、所有权映射及近期变更。
- 交互能力:Agent 不仅能生成报告,还能回答工程师的后续问题(如“这个警报是否会自动解决?”、“是否影响其他租户?”等),并基于人类反馈记录学习经验。
3. 闭环自动化
该 Agent 形成了一个更广泛的运营闭环:
- 调查失败的根本原因和影响
- 提出修复方案
- 回答疑问
- 生成代码修复(并移交 PR Author 专家)
- 撰写解决总结和事后报告
- 记录来自人类互动的学习
实际价值与指标
这一变革的核心在于将人类从重复的调查中解放出来。在 Augment Code 的小型团队中,资深工程师原本需要处理 20% 的警报,而新工程师平均花费 30 分钟处理一次事故排查,每天被打断 5 次。
通过 Cosmos 平台的实施,团队实现了以下关键成果:
- 效率提升:人类在事故调查上的努力减少了 81%。
- 速度提升:工程师在功能开发上的速度显著加快。
- 质量提升:生成的 RCA 报告质量更高,结构更清晰,减少了人为误判。
结语
正如 Augment Code 团队所言,他们正在构建一个系统,其中 Agent 处理繁琐的调查工作,而人类专注于关键的判断和生产级决策。这不仅是工具链的升级,更是组织运作模式的根本性转变。
"Our goal is to have agents drive the repetitive investigation of incident management while pulling humans in primarily for judgment, prioritization, and remediation decisions."
—— Augment Code 官方团队