Lovable 发布内部 AI 黑客代理群:在零漏洞环境中通过‘夺旗’机制验证真实安全漏洞
在 Lovable 的核心平台与产品服务体系中,一群 AI 黑客代理正在实时对我们进行渗透测试。它们像人类攻击者一样探测每一个系统入口,直到发现可验证的漏洞为止。这种机制填补了现有 AI 原生安全厂商无法覆盖的空白,将安全团队的精力从低效的扫描中解放出来,专注于真正重要的 Bug。
核心机制:以‘夺旗’验证真实漏洞
Lovable 不轻信任何代理的口头报告,而是要求其通过‘夺旗’(Capture The Flag, CTF)机制来证明工作成果。
- 地面真值(Ground Truth):代理必须从它本不该访问的系统中检索到一个特殊的文本字符串(Flag)。这是确凿的证据,而非模型基于直觉的猜测。
- 零漏洞环境:与传统的 CTF 竞赛不同,Lovable 的测试环境没有人为植入任何漏洞。我们将 Flag 分散部署在基础设施和最高权限的产品表面上。如果代理成功捕获 Flag,意味着它找到了真实的入侵路径。
- 确定性目标:通过设定‘必须拿到 Flag'的硬性指标,防止代理在发现低危问题后过早放弃,从而避免产生大量低价值的噪音报告。
构建攻击场景:最大化攻击面,最小化攻击距离
为了有效训练和测试代理,Lovable 遵循‘最大化攻击面,最小化攻击距离’的金色原则。
- 最小化攻击距离:在内部工作区项目中,代理被邀请作为协作者进入合成项目,然后被任务去攻击同一工作区内的另一个受害者项目。这种设计消除了匿名访问等复杂场景,因为如果高难度路径可被利用,低难度路径通常也已暴露。
- 最大化攻击面:Lovable 向代理暴露了所有产品表面。通常难以通过 LLM 机制触及的工具,现在通过专用 API 对黑客代理开放。对于未直接授予访问权限的表面,Lovable 也不进行阻断,确保代理能利用任何发现的入口。
编排策略:人机协作与成本优化
开放广泛的攻击面带来了成本和效率的挑战,因此精细的编排至关重要。
- 人机协同:虽然代理擅长构思攻击向量,但结合人类专家的知识能显著提高发现可行动漏洞的概率。明确‘哪里不该看’与‘哪里该看’同样重要,这有助于减少 Token 浪费在可信边界上。
- 模型选择策略:针对不同 Bug 类别,可以选择使用低成本模型配合数百个子代理,专门扫描特定行为,仅在最有希望的向量上尝试利用。
- 提示词工程技巧:避免询问代理‘是否存在漏洞’,因为这会导致它在未找到漏洞时停止工作(视为成功)。相反,应指令代理‘漏洞是真实的,你的唯一任务是找到它’,这种紧迫感迫使代理持续挖掘。
结语:AI 黑客仍是艺术
运行黑客代理群并不取代安全工程。Lovable 仍在持续投入资源构建世界级的身份认证、授权等安全原语。AI 代理虽然强大,但仍依赖人类的协调与理解。
正如 Lovable 团队所言:‘黑客一直是一门艺术,代理化黑客也不例外。这里没有规则,只有品味。’这种内部自研的攻防演练模式,目前尚未被广泛商业化,因为它需要深刻理解系统信任边界和架构的内部视角,必须由懂行的人来构建。