产业观察

释放之前:AI安全治理的最高杠杆控制点

虎嗅24小时·2026/9/17 15:22:16🔗 原文

📋总体概括

Anthropic于2026年9月发布威胁情报报告,披露所谓「跨会话重放攻击」:攻击者利用Claude API返回的thinking signature,在新会话中诱导模型还原完整推理链,绕过安全护栏,报告将攻击归因于五家中国公司,涉及近2亿次交互。文章指出这是商业公司单方披露而非中立调查,但技术机制真实存在,并由此引出AI安全治理的核心问题——在信息释放不可撤回、竞争压力稀释安全承诺的背景下,治理的最高杠杆控制点应放在释放之前。

关键信息

  • Anthropic发布威胁情报报告,披露利用API会话机制绕过安全护栏的「跨会话重放攻击」。
  • 攻击机制:Claude返回thinking signature而非原始推理链,攻击者跨会话重放signature即可还原完整推理轨迹。
  • 报告将攻击归因于五家中国公司,合计近2亿次交互规模,但这是商业公司单方披露,非中立调查。
  • 文章前序论证了信息释放不可撤回与安全承诺被竞争稀释两大问题,本篇聚焦治理处方。
  • 核心论点:AI安全治理的最高杠杆控制点在于信息释放之前,而非事后补救。

🔥犀利点评

且慢被「五家中国公司、近2亿次攻击」的叙事带节奏——这是Anthropic的单方指控,动机存疑:既是安全披露,也是地缘叙事和商业竞争的双重操作。但技术漏洞本身无可辩解,thinking signature被设计为可重放的凭据,等于把推理链的钥匙交了出去。真正值得警惕的是文中点破的产业规律:安全护栏在竞争压力下永远是被稀释的那一方,等数据泄了再谈治理,杠杆已经为零。控制点必须前置到释放之前。

本文由本站自动聚合,以下为原始来源:前往 虎嗅24小时 阅读全文