先锋 趋势 方法 投研 作者
Codex、Claude Code之后的AI安全——Zico Kolter与Matt Fredrikson,Gray Swan
返回节目精读

Codex、Claude Code之后的AI安全——Zico Kolter与Matt Fredrikson,Gray Swan

摘要

  • Gray Swan的核心押注是,企业AI安全将成为独立的控制层,因为模型是不受信任的组件,而不是传统软件。 少数被广泛使用的模型和代理(包括Codex和Claude Code)会在客户之间制造相关性故障风险。实验室会继续内部投入,但Zico Kolter预计,熟悉的平台化路径仍会出现:“与它分离的安全系统”最终会成为独立的服务品类。

  • 在边界明确的评估中,自动化红队测试可能已经越过了人类表现门槛。 Gray Swan的SHADE系统在固定任务集和时间窗口内发现的模型漏洞多于人类红队成员,但Zico Kolter提醒说:“我认为红队测试还没有真正达到超人水平。”攻击数据闭环将SHADE与Arena社区连接起来,后者的Discord约有15,000名成员。

  • 代理式工具调用把模型的异常行为转化为企业损失面:凭证泄露、未经授权的操作,甚至生产数据库被删除。 “致命三角”由不受信任的外部数据、私有信息访问权限和数据外泄通道构成;工具权限还会进一步赋予系统实施有害操作的能力。

  • 模型原始能力并不能可靠换来对抗鲁棒性,这为专业化运行时防御市场留下了空间。 IPI基准显示,GPQA Diamond能力与间接提示注入攻击成功率之间只有较小、且存在混杂因素的相关性;鲁棒性来自有针对性的训练,而非单纯扩大规模。Cygnal会依据可配置的企业政策,监控不受信任的输入和拟议中的工具调用。

  • Computer use和OpenClaw凝结了采用悖论:让代理有价值的权限,正是让它危险的权限。 Gray Swan将SHADE用于真实OpenClaw使用轨迹,“发现每一个轨迹都存在漏洞”,同时承认保护所有可能的工具仍是未来工作。因此,Cygnal是对隔离、身份验证、访问控制和最小权限的补充,而非替代。

  • 一条可能很强的分发闭环,将自动化风险评估、运行时缓解和AI保险连接起来。 SHADE和私有Arena可以衡量部署风险;Cygnal可以降低风险;保险公司则可以把这些控制措施变成采购或承保要求。这套框架还不是AI版SOC 2,但保险和合规压力可能加速企业支出。

  • 更长期的上行空间在于,代理可能自动化那些保护代理本身所需、但高度依赖人工的科学工作。 Kolter对编码代理系统化推进机制可解释性研究变得更加乐观;讨论也指出,代理可以让安全代码和形式化验证更具可行性——这些工作过去往往需要普通编码“10倍或20倍的时间”。他们的判断是,安全和可解释性可能“爆发,不是因为我们会把它做得更好,而是因为现在代理可以替我们完成这些工作”。

精读

上游暂未提供,后续同步将继续补齐。