Claude Mythos 60 小时挖掘 HAWK 非数漏洞:AI 辅助安全审计的边界与成本解析
在网络安全领域,利用 AI 进行代码审计和漏洞挖掘正成为新的研究范式。近日,APIMart 团队深度复盘了 Claude Mythos 的一次实战案例:在一个周末式的突击中,该模型在60 小时内消耗$100,000的算力成本,成功定位了 HAWK 协议中一个关于Nonce 生成偏差的关键漏洞。
核心发现:从已知攻击模式到可复现的漏洞
此次挖掘的目标是 HAWK 协议及其相关的轮数减少版 AES 实现。Claude Mythos 并未发明全新的攻击类别,而是通过强大的推理能力,将已知的攻击理论(如基于格攻击的私钥恢复)与具体的代码实现进行了快速匹配。
漏洞原理
研究发现,HAWK 实现中存在非数生成偏差(Nonce-bias issue)。当非数(Nonce)分布不均匀时,攻击者可以收集大量的公开签名,利用格基隐藏数问题(Lattice-based Hidden Number Problem, HNP) 算法,通过公开签名推导出私钥。
- 攻击门槛:仅需约6% 的非数超出正常范围,即可被识别为潜在弱点。
- 后果:一旦私钥被恢复,攻击者即可伪造签名并冒充密钥持有者。
工作流解析:AI 如何高效筛选线索?
这次审计并非盲目运行大模型,而是遵循了一套严谨的人机协作闭环:
- 攻击框定:团队预先设定攻击目标和验证标准。
- 模型引导分析:Claude Mythos 利用其推理能力,在不依赖传统 SAST 工具的情况下,快速遍历代码库,匹配已知漏洞模式,生成大量候选假设。
- 高效复现:模型在83.1% 的首次尝试中成功复现了漏洞,极大地减少了无效探索的浪费。
- 人工过滤与验证:这是最关键的一步。人类专家对模型提出的候选项进行代码级审查,确认漏洞的真实性,并排除误报。
成本与效率:$100,000 的价值与边界
文章花费大量篇幅分析了这 10 万美元的构成。这笔费用并非用于单一的“暴力破解”,而是用于反复迭代:运行模型循环、优化工作流编排,以及支付昂贵的人工审查成本。
- AI 的角色:AI 负责“广度”和“速度”,快速缩小搜索空间,提出高置信度的假设。
- 人类的角色:人类负责“深度”和“精度”,确认假设是否成立,判断风险等级。
对开发者与安全团队的启示
对于希望利用 AI 提升安全效率的团队,APIMart 提出了以下关键建议:
- 分级模型策略:不要一开始就使用最昂贵的大模型。应先用较小的开源模型进行初步筛选和线索生成,待候选项通过初步验证后,再调动旗舰模型进行深度分析。
- 设定硬性预算上限:在启动审计前必须设定预算红线,避免在低效路径上过度消耗资源。
- 视 AI 输出为“线索”而非“结论”:模型生成的报告是极具价值的起点,但绝不能直接作为最终的安全报告发布。
官方观点: "这不仅仅是一个关于成本的故事,更是一个关于专注与人类审查的故事。AI 能帮我们快速找到值得深挖的线索,但只有人类能决定这些线索是否真实。"
结语
Claude Mythos 的案例证明了 AI 在安全审计中的巨大潜力,特别是在处理海量代码和复杂攻击理论匹配方面。然而,它也清晰地划定了 AI 的边界:AI 是强大的猎犬,能嗅出无数线索,但猎人(人类专家)才是最终确认猎物是否存在的核心。 未来的安全审计工作流,将是 AI 效率与人类智慧的深度结合。