CREAO 发布自修复 Agent 测试框架:重构 AI 产品的 QA 与评估闭环
在 AI 原生应用开发领域,交付速度已不再是唯一的竞争壁垒,质量与稳定性成为了决定生死的关键。CREAO 近期宣布了一项重大架构变革:正式发布“自修复 Agent 测试框架”(Self-Healing Agent Harness)。这一系统的诞生,源于 CREAO 内部从“99% 代码由 AI 生成”到“每日发布 3-8 次”的极速迭代过程中,所面临的严峻挑战——“谁来测试它?”
背景:传统 QA 模式在 AI 时代的失效
过去,软件公司的评估(Evaluation)与质量保证(QA)通常由不同团队在物理空间上分离:数据科学团队负责监控模型表现,工程团队负责修复 Bug。然而,对于 AI Agent 平台而言,这种割裂是致命的。
- 评估关注:模型在实时流量中是否给出好答案?
- QA关注:产品在生产环境中是否正常工作?
在 AI 应用中,这两者本质上是同一个问题。一个糟糕的 Agent 回复,既是需要监控的指标,也是需要立即修复的Bug。CREAO 发现,传统的 QA 流程(如人工阅读转录稿、手动打分)无法跟上 AI 代码生成的速度,成为了新的瓶颈。
核心突破:自修复闭环的三大支柱
CREAO 的自修复框架不再依赖人工 QA 团队,而是构建了一个自动化的“评分 - 分诊 - 修复 - 验证”闭环。该系统包含三个核心组件:
1. 三法官评分器 (The Tri-Judge Panel)
这是框架的“眼睛”。它取代了人工审核和离线基准测试,通过异步评分端点(不增加用户延迟)对每个 Agent 回复进行打分。
- 结果导向:CREAO 强调“评估结果,而非推理路径”。即使 Agent 走了看似奇怪的路径,只要最终产出正确,就不应被惩罚。
- 非竞赛性:评分器不是为了排名模型,而是为了发现系统性问题(如提示词错误、工具合同漂移、基础设施抖动等)。
- 触发机制:每个 Agent 回复都会触发评分,针对主导模型采样 10%,针对实验性模型 100%,确保全面覆盖。
2. 自动化工程流水线 (The Engineering Pipeline)
当评分器发现低分(即失败)时,系统不会止步于数据看板。它会立即启动自动化流程:
- 将低分自动转化为 Linear 工单。
- 生成草稿 PR (Pull Request)。
- 验证修复方案。
- 这彻底替代了手动分诊、冲刺规划和回归测试环节。
3. AI 门禁灰度发布 (The Bridge)
这是连接评估与发布的桥梁。新的代码只有在通过评分器验证后,才能进入灰度发布阶段。
- 质量门禁:评分器的分数直接决定代码是否允许上线。
- 替代传统环境:消除了对传统 Staging 环境的依赖,实现了真正的“代码即质量”。
实际价值:从月级构建到小时级交付
CREAO 指出,当 AI 将构建时间从“月”缩短到“小时”时,任何滞后的下游环节都会成为瓶颈。自修复框架将评估与 QA 合并,使得:
- 故障定位加速:无需等待人工分析,系统能立即识别是模型幻觉、工具调用失败还是基础设施抖动。
- 工程效率提升:工程师不再花费时间在手动打标签和分诊上,而是专注于解决核心逻辑问题。
- 交付频率质变:实现了每日多次的稳定发布,彻底摆脱了传统软件开发的“发布恐惧症”。
“对于初创公司来说,争论评估方法是否严谨是奢侈品。我们的目标是快速识别产品中的重复性问题。一个能触发今天修复的‘足够好’的信号,胜过下个季度才发布的完美基准测试。” —— CREAO 团队
结语
CREAO 的自修复 Agent 测试框架标志着 AI 应用开发范式的重大转变:评估不再是独立的科研任务,而是工程交付的核心基础设施。 通过将 QA 流程完全自动化并嵌入开发流水线,AI 原生应用终于具备了与人类代码同速迭代的稳定性。对于开发者而言,这意味着可以更安全、更快速地利用 AI 能力构建复杂系统,无需再为“谁来测试”而焦虑。