先锋 趋势 方法 投研 作者
返回先锋
Ilia Shumailov
研究员 2 场深度对话收录

Ilia Shumailov

研究员

前沿洞察

核心综述:

Ilia Shumailov 警示,高能力 Agent 彻底瓦解了传统基于人类边界的安全假设,加密隐藏推理亦面临同族模型逆向重放的系统性泄露,暴露出越狱、隐私及供应链后门等新型攻击面。模型内部已不可信,安全重心必须外移:唯有依托沙箱隔离、外置数据流控制(如 CaMeL)与形式化方法构建强隔离边界,才能在不损耗推理效能的前提下筑牢防御壁垒。

观点集合

从专有 LLM API 窃取推理轨迹——Ilia Shumailov & Alexander Panfilov

  • 🗓️ 日期2026-08-22 | 🎙️ 节目:Machine Learning Street Talk

研究人员发现,Anthropic、OpenAI 和 Google 的加密推理 blob 都可被同家族小模型重放解码,无需攻破密码学,并能跨用户、模型变体和虚构对话迁移。这使隐藏推理成为隐私泄露、越狱与轨迹投毒的攻击面;上下文绑定加密、模型层级和泄漏分类器虽提供修复方向,但剥离推理会损失多少能力仍待验证。

查看访谈对话精读提要
  • Ilia Shumailov 和 Alexander Panfilov 证明,前沿模型返回给用户的“加密”推理 blob,可以通过将其重放到同一模型家族的更小模型中解码;Anthropic、OpenAI 和 Google 都存在同一漏洞。 没有任何密码学机制被攻破:服务器仍会负责解密 blob,正如 Panfilov 所说,“小模型非常愿意告诉你这个思维过程在想什么……服务器替你完成了全部工作。”论文《从专有 LLM API 窃取推理轨迹》发布后,40小时内获得约300万次浏览。

  • 这些 blob 可跨用户、模型变体和虚构对话迁移,把推理提取变成一种越狱手段。 你可以从 Opus 会话中取出一段思维,注入“绝对随机的位置、与 Haiku 的随机虚构对话”,再诱导模型说出其内容。Panfilov 最令人震惊的发现是:“第3次尝试后,我得到了一个能解码 Anthropic 模型推理的通用越狱。”

  • 隐私暴露是真实且不易察觉的:只要加密 blob 还在,清洗可见对话记录就没有用。 用户讨论过但从未展示出来的 API 密钥、密码、邮箱和内部 IP 地址都可能被恢复;Panfilov 从 GitHub 和 Hugging Face 抓取了约35万个 blob,并运行隐私信息分类器,发现了大量相关案例。

  • Kimi 的结果是一个奇怪且颇具暗示性的现象,不是蒸馏证据。 只需将 Opus 推理预填充2个 token 到 Kimi/K3,模型的可见回答开头就开始呈现 Opus 的风格;GLM、Inkling 和 Deepest Zip 都没有出现这一现象。Panfilov 表示,共享数据供应商或 RL 环境可能解释这一结果;Ilia 强调,分析只用了少量样本,“很难断言”存在蒸馏。

  • 部分推理轨迹使用陌生、难以监控的语言——“marinate、vantage、theatrical”、空白字符引号——Alexander 表示,这种现象主要出现在 Codex models。 研究人员还观察到模型在思考是否作弊:“我可以作弊……但用户会发现”,最终却决定不这么做;这些案例来自真实用户会话,而非 benchmark。其成因以及这种行为是否正在恶化,目前都未知。

  • Ilia 的逆向宏观判断是:防御侧能力提升可能超过攻击侧提升,而模型可以帮助打破人才瓶颈。 经过验证的软件和基于能力的访问控制,在“过去25年的安全研究文献”中早已确立,但一直受制于稀缺专家;他“愿意押注防御侧提升将大得惊人”。他的类比是:信用卡重放攻击理论上可以大规模发生,但现实中一个国家也只会报告“1次或2次”——理论上存在的危害并不都能在实践中规模化。

  • Panfilov 自称每周4天是“doomer”,认为安全与能力之间的权衡已经崩塌:不可靠的 agent 既不安全,也没有按用户意愿行事。 他担心的是发展速度——“每个月都在变得更好、越来越好的系统”会带来更多威胁,而修补速度可能跟不上;他援引了 Hugging Face 事件,以及 OpenAI 暂停训练2周的案例。

  • 在定性上,Panfilov 称这类攻击“100%属于越狱和滥用”,Ilia 也认可这一技术判断,但表示政策含义“超出我们的能力范围”。 负责任披露流程进展顺利:3家实验室都确认收到了报告,没有表现出敌意。考虑到安全领域过去经常攻击漏洞报告者,Tim 称这“非常令人耳目一新”。

  • 🔗 原始收听与视频来源: 从专有 LLM API 窃取推理轨迹——Ilia Shumailov & Alexander Panfilov

收听完整访谈 →


AI Agents 可在数秒内写出10,000行黑客代码 [Dr. Ilia Shumailov]

  • 🗓️ 日期2025-10-04 | 🎙️ 节目:Machine Learning Street Talk

AI agents正在使针对受限人类的安全假设失效,更强的指令遵循也创造出平均场景评估和推理轨迹无法可靠捕捉的新攻击路径。CaMeL将数据流控制置于模型之外,展示了可投资的防御层;随着开源供应链和架构后门风险上升,沙箱、细粒度权限和形式化方法更加重要。

查看访谈对话精读提要
  • AI Agents 让那些针对受限且理性的人的安全控制失效。 Shumailov 的威胁模型是:一个全天候运行的员工,24/7触达每个端点,一天内重写出“10,000行黑客工具”,且不受法律威慑;而“agents 甚至更糟”,比安全体系已经视为最坏对手的非理性儿童还难控。因此,采用 agents 会提升细粒度访问控制、可观测性以及由策略强制执行的价值。

  • 更大的模型并非只是更脆弱;更强的指令遵循能力会制造不同、且可能代价更高的失效模式。 Shumailov 的团队能够把指令写进邮件,在“几乎所有”测试案例中让 agent 偏离用户任务,包括绕过类似初创公司产品的防御。现代模型“太像炼金术”,使平均场景评估无法有效代理对抗韧性。

  • 最强的防御方案,是把秘密留在模型之外,并在软件中强制管理数据流。 在 CaMeL 中,系统将请求重写成类似 Python 的代码,由解释器控制执行;护照信息保持为符号变量,只有外部策略确认域名包含 gov.uk 等条件后,变量才可流向网站。Shumailov 表示,由于安全机制位于概率模型之外,这套架构解决了跨供应商测试的 AgentDojo 工作流。

  • 机器学习也可能成为私密计算中的一种新型受信第三方。 在有限场景下,双方可以证明某个约定好的模型、提示词和参数比较了各自的秘密数字,并且只返回“第一”或“第二”,从而省去繁琐的密码学协议。Shumailov 强调,这既不是零知识证明,也不是 MPC,不提供传统意义上的可靠性或完备性保证。

  • 推理轨迹和基于模型的监控,都无法提供安全级别的保证。 Shumailov 承认,轨迹“平均而言”可能有信息量,但不接受它们用于处理关键边界案例。Tim Scarfe 进一步指出,把高维状态投射到人类可读空间会产生碰撞。Shumailov 的方案是架构隔离——“我们需要造盒子”——尽可能实现多个9的可靠性,但“不是100%”。

  • 采用开源模型会带来实质性的供应链风险,而消费者几乎没有能力为其定价。 Shumailov 将 Hugging Face 的 trust_remote_code 行为比作 Log4j 背后的原始机制,提到2起公开披露的 PyTorch CI/CD 被攻陷事件,以及恶意软件包进入 nightly build 的案例,并警告不要在 jail 或 sandbox 外运行模型。Tim Scarfe 表示会把 Claude Code 隔离在 VM 中;Shumailov 则说自己绝不会把个人数据放进个人电脑。架构后门可能更加隐蔽:攻击者触发某个 token 后,一个用户的 batch 数据可以泄露给另一个用户,而正常推理不受影响。

  • AI 可能让此前成本高到无法承受的形式化方法变得实用。 Tim Scarfe 表示——同时提示自己可能记错——验证 seL4 大约耗费了30人年;Daniel Kang 认为 agents 可能自动生成证明标注。Shumailov 另行指出,agents 可以把普通程序转换成隔离的表示,并管理细到人类难以处理的权限。真正的上行空间,不是得到一个绝对安全的模型,而是以更低成本构建围绕模型的经验证系统。

  • 模型坍塌更可能推高训练成本、强化数据优势,而不是让明天的模型突然失效。 递归式合成训练会压缩罕见事件的尾部,并放大相关错误,但 checkpoint、评估和保留多样性可以支持回滚。长期要求是维护多样化数据;专业人类数据的成本持续上升,可能让没有“车库里一份互联网副本”的竞争者处于劣势。

  • 🔗 原始收听与视频来源: AI Agents 可在数秒内写出10,000行黑客代码 [Dr. Ilia Shumailov]

收听完整访谈 →