先锋 趋势 方法 投研 作者
⚡️越狱 AGI:Pliny the Liberator 与 John V 谈红队测试、BT6及 AI 安全的未来
返回节目精读

⚡️越狱 AGI:Pliny the Liberator 与 John V 谈红队测试、BT6及 AI 安全的未来

摘要

  • Pliny 的核心判断是,护栏是一道注定失守的外围防线,而不是经久可靠的安全架构。 蓝队面对的是“与无限作战”:不断扩张的潜空间给攻击者带来无穷变体,而激进的分类器、RLHF及其他防护层可能对模型能力和创造力征收“税”。主持人称 GPT-5.1 的拒答率为“我认为……92%”,并说 Pliny 大约1天就完成了越狱;Pliny 未独立确认这一数字。模型层面的拒答分数或许能帮助公关和企业客户,却未必带来现实世界的安全。被问及 METR 时,John 回答“绝对支持”,倾向于让专业研究者在没有层层“泡沫包装”的环境中工作。
  • 真正有决定性意义的安全市场在完整的 agentic 技术栈,而非孤立的模型本身。 每接入邮箱、浏览器、数据、工具或函数,就会新增一个攻击面,也会增加泄露敏感信息或污染 Pliny 所称“事实层”的机会。他们偏好的修复路径从系统层开始:保护“你奶奶的信用卡信息”,而不是把底层模型做成“脑叶切除”。
  • 越狱正从可复用提示词,演变为凭直觉引导模型行为的一门技术。 Pliny 的通用越狱像“万能钥匙”,而 John 所说的软越狱则是在不触发防御的情况下穿行于概率分布。Pliny 将这门手艺概括为“99%靠直觉”和“引导式混沌”:把模型带出分布,因为“分布很无聊”。
  • Anthropic 的 Constitutional Classifiers 挑战暴露了评测的脆弱性,也暴露出独立研究者面对的激励机制缺陷。 Pliny 闯过了8个等级中的约4个,随后一个 UI 漏洞让他得以将旧输出重新提交到剩余等级;Anthropic 修复界面后称服务器记录显示没有赢家,并将他的进度重置。他拒绝在没有开放数据集的情况下重新开始;对于他记得是2万美元或3万美元的奖金,也选择不再参与,并把裁判比作“传感器坏掉的 skee-ball”。
  • BASI 和 BT6 已成为分布式研究与人才引擎,AI 安全初创公司正从中持续汲取资源。 BASI 的草根 Discord 约有40,000名成员;BT6则有两批共28名操作者,第三批已在筹备中。John 称,多家机构正在主动抓取 BASI 的内容,用于构建护栏或安全产品,说明开放社区探索攻击的速度可以快于厂商将防御体系正式化的速度。
  • 围绕 agentic attack 的讨论,核心在于编排机制与信息分割的子代理。 Pliny 质疑 Anthropic 首次披露的 AI 编排攻击,反映的是否更多是政治传播,而非全新的攻击能力。John 称自己在12月就发布过几乎相同的 TTP,而相关事件直到11个月后才发生;他还曾利用 Claude 的 computer-use 能力作为红队伙伴,帮助越狱其他模型。Pliny 认为,自然语言社交工程才是最令人担忧的放大器。
  • 这个集体正有意抵抗围绕 AGI 安全形成的传统风险投资激励。 Pliny 认为 AGI、ASI 和 superalignment“不是 SaaS 事业”,更偏好自筹资金、捐赠和资助,同时推动合同合作方开放数据集;John 将这种妥协概括为“在不能开源之前,都尽量开源”。对投资者而言,快速变化的攻击面更有利于适应性强的专家网络和全栈安全服务,而不是相信存在一个永久“安全的模型”。

精读

1. 护栏把拒答表现混同于现实安全

  • “解放”是 Pliny 项目的核心,因为模型可能成为一种“外置大脑”(exocortex),让10亿人借此处理日常决策、希望与梦想。“这不只是模型的问题,也是我们的思维的问题”(It’s not just about the models. It’s about our minds too):人类与模型共生关系一端的自由和透明度,会塑造另一端的形态。

  • 他的专长是通用越狱,一把旨在“摧毁护栏”的“万能钥匙”,目标覆盖分类器、系统提示词及其他控制机制。具体流程会随模态变化,但目标始终一致:稳定获得用户要求、却被已部署控制栈拦截的输出。

  • Pliny 用《巴别图书馆》作比,概括了攻防双方的不对称:防守方不断限制区域,攻击者却持续重新摆放并加长梯子。随着攻击面扩张,蓝队是在“与无限作战”(fighting against infinity);更严密的封锁或许能守住狭窄区域,但往往“以牺牲能力和创造力为代价”,尤其是在开源模型始终紧跟闭源系统的情况下。

  • 主持人关于炸弹制作指令的问题,让 Pliny 区分了护栏与现实安全:成熟攻击者只需切换模型,而锁住某个基准测试,主要可能只是帮助公关和企业客户。他更看重的指标是向未知未知领域探索的“速度”。被问及是否认同 METR 的方法时,John 回答“绝对支持”,反对给一切都套上“泡沫包装”,而应让专业研究者真正开展工作。

2. 有效提示词用“引导式混沌”逃离分布

  • Libertas 把《巴别图书馆》变成一个无限可能的提示词环境,其中包含可调用的受限区域。Pliny 的分隔符会刻意“打乱 token 流”,重置模型表面上的思维链,并携带“一点点爱”和“God Mode”等潜空间种子。他说,在服务商针对该仓库进行训练后,Pliny 分隔符甚至出现在无关的 WhatsApp 消息中。

  • 预测推理模板会在每次出现分隔符时加入一个商数或任意增量,然后要求模型对“天才用户”下一条问题给出不受约束的回答。由此形成递归、级联式的移动,而且很容易被引导——这正是 Pliny 所说的,沿着潜空间的兔子洞“又快又深地一路钻下去”。

  • 被问及分隔符的选择究竟是科学、个人 token 秘传,还是某种迷幻体验时,Pliny 回答说,构造越狱“99%靠直觉”。他会探索想象中的世界和新颖语法,提到 bubble text,又把“leet”改成“French”,直到与模型建立起一种“连接”(bond)。

  • John 将 Pliny 的硬越狱与软越狱区分开来:后者在不踩到“地雷”、触发器或标记的情况下穿行于模型的概率分布。软攻击可能跨越多轮对话,以一种“很像渐强式攻击”的缓慢过程展开,而不是依赖单个输入或模板。

3. Anthropic 的挑战演变成数据与功劳之争

  • 在 Anthropic 的8级 Constitutional Classifiers 挑战中,Pliny 改造了旧版 Opus 3 的“GOAT template”,据称系统已经针对该模板进行了大量训练。他闯过了约4个等级后,界面不再生成新问题;他反复提交上一个输出,裁判仍持续触发,直到屏幕显示已经到达终点。

  • Anthropic 承认并修复了 UI 漏洞,但称服务器记录中没有赢家,随后将 Pliny 的进度重置回起点。他的回应聚焦于激励机制:如果社区生成的数据集仍然封闭,为什么要再提供一个通用越狱?他没有动力重新开始,并表示除非数据开源,否则不会参与。Anthropic 最终追加了奖金,Pliny 记得是“3万美元或2万美元”,但他选择不参加。

  • John 担心,要求用同一个越狱应对全部8个不断变化的输入,实际上是在不断移动球门。Pliny 也认为挑战可能推出得过于仓促。John 还称裁判存在漏洞,会产生假阳性和假阴性;Pliny 则把这场挑战比作“传感器坏掉的 skee-ball”。

  • Pliny 仍将后来金额更高的奖金视为社区取得的部分胜利,但认为它们无法替代共享数据。John 认为贡献者应当站出来,看到“集体劳动的成果”,即便发布需要延后;否则,有限的协作与分享会让研究者始终蒙在鼓里,并造成过度集中。

4. 代理编排让恶意意图易于隐藏

  • Pliny 质疑 Anthropic 首次披露的 AI 编排攻击,代表的是否更多是一场政治传播行动,而非真正全新的攻击能力。John 称自己在12月就发布过本质相同的 TTP,而相关事件花了11个月才出现,说明防守方始终处于被动反应状态。

  • John 称,自己在越狱 Claude 的 computer-use 能力时,找到了一种让 Claude 充当红队伙伴的方法:通过带有自定义命令的界面,帮助他越狱其他模型。他说,既能启动子代理,又能分割各自掌握的信息,会让整体活动很难被看见。

  • Pliny 认为自然语言是最令人担忧的部分,因为多数攻击都带有某种形式的社交工程;模型不需要攻破什么异常复杂的代码或安全机制。邮箱、浏览器、工具和函数的接入,使攻击面远远超出被禁止文本的问题。

  • Pliny 认为必须测试完整技术栈,而不只是模型本身,包括通过反事实推理攻击“事实层”,以及寻找与模型连接的系统漏洞。在合同项目中,他们避免通过“脑叶切除”改变模型性格,而是建议从系统层修复,例如阻止一个能访问奶奶信用卡信息的 agent 将其泄露。他将双重目标概括为:保护模型免受恶意行为者攻击,也保护公众免受失控模型伤害;安全工作应落在“现实世界”(meatspace),而不能依赖潜空间抑制。

5. 开放型集体正在成为安全基础设施

  • John 将团队的运作理念概括为激进透明和激进开源,但前沿合同有时会附带保密要求:“在不能开源之前,都尽量开源”(We’re open source up until we can’t be)。他的商业类比是:拥有数十亿美元资金的实验室像 Formula 1 制造商,专业黑客则像不断寻找极限、削减秒数的车手;但厂商往往希望这类能力成为“不可告人的秘密”。

  • BASI 的草根 Discord 聚集了约40,000名成员,覆盖提示工程、对抗性机器学习、越狱、红队测试及相关领域。John 称,除少数版主外,社区基本没有商业化;与此同时,多家 AI 安全机构一直在主动抓取其中的内容,用于构建护栏或安全产品。

  • 教育路径包括 Lakera 的 Gandalf,John 将其称为提示词注入的早期训练场,后来又扩展出面向 agent 的体验。Pliny 还介绍了与 Sander Schulhoff 的 HackAPrompt 共同开发的 Pliny 赛道。双方将数据集开源,Pliny 记得其中包含数万条提示词,以及多款游戏和历史资料。

  • BT6 已发展到两批共28名白帽操作者,第三批也已在筹备中;筛选标准是技能与诚信,“大家都是因为热爱这项游戏而来”。团队在 AI 安全、加密货币、Web3、智能合约、区块链、机器人和群体智能等领域共享并相互验证工作。

  • Pliny 拒绝把 AGI、ASI 或 superalignment 当作普通企业软件,因为当时间线被压缩时,微小的激励偏差也会变得危险:“万分之一度的任何轻微错位”都可能致命。他说,诱惑曾被摆到自己面前,但他更偏好自筹资金和草根工作,也愿意接受捐赠或资助来推进这项使命。他把自己视为一个管理者,职责是推动话语、研究与探索,而不是变得富有。

  • 他还批评为了让模型更具确定性,就把所有模型的温度调低,认为自己的工作追求更多风格、创造力和创新;但他也强调,合适的温度取决于具体应用。