Anthropic 宣布与 Accenture 合作,启动前沿 AI 模型‘嵌入式评估’新范式
在 CEO 关于“我们必须放缓前沿”的论述背景下,Anthropic 正式宣布与全球顶尖咨询公司 Accenture 建立战略合作伙伴关系,共同开展前沿 AI 模型的独立评估工作。这一举措不仅是企业间的首次深度安全合作,更标志着 AI 安全验证模式的一次历史性转变。
从外部审计到‘嵌入式评估’的范式转移
本次合作的核心在于引入嵌入式评估者(Embedded Evaluators)。与传统的外部审计不同,这些评估者将被允许进入 AI 公司内部,享有接近员工的访问权限。他们不仅能观察模型的训练过程,还能追踪决策制定流程,并直接与内部员工沟通。
这种‘嵌入式’模式旨在解决当前 AI 安全评估中的两大痛点:
- 信息不对称:外部评估者往往只能看到模型上线后的结果,无法洞察训练细节和潜在风险。嵌入式评估者拥有‘上帝视角’,能识别内部可能存在的监管盲区。
- 责任可验证性:Anthropic 强调,独立评估者不会削弱公司的问责制,反而通过透明化流程,使安全承诺更具可验证性。
合作规模与长期愿景
双方承诺在未来五年内,各投入至少 10 亿美元 用于构建评估能力。Accenture 将发挥其专长,负责模型评估、红队测试(Red-teaming)、对齐评估及安全测试。
Anthropic 表示,目前尚缺乏关于嵌入式评估者应获取何种信息以及如何报告的统一标准,也没有成熟的独立评估资金体系。因此,Anthropic 决定直接资助 Accenture 的工作,并正与 METR 等非营利组织探讨试点合作。长远来看,行业期望建立由多方参与的评估生态系统,并推动资金来源于公共池或政府拨款。
对开发者与行业的影响
此次合作具有极强的示范效应:
- 非排他性:Anthropic 明确表示,此合作非独家,未来将与其他评估机构合作;Accenture 也将同时服务于其他 AI 开发者。
- 透明度提升:Anthropic 选择公开这一早期努力,旨在向开发者和公众展示其内部安全流程,并邀请行业共同监督。
- 安全标准演进:随着前沿实验室的增多,行业正从单一公司的自我监管,转向多方协作的标准化安全体系。
“独立嵌入式评估者不会减少我们的问责制,但有助于使其更具可验证性。我们模型的安全性仍是我们自己的责任。” —— Anthropic 官方声明
随着 AI 技术的快速迭代,这种将安全评估‘内嵌’至研发流程中的模式,将成为未来构建可信 AI 基础设施的关键路径。