释放之前:AI安全治理的最高杠杆控制点

释放之前:AI安全治理的最高杠杆控制点

2026年9月,Anthropic发布威胁情报报告,披露“跨会话重放攻击”:有组织利用Claude API会话机制,绕过安全护栏,提取推理链数据。报告将攻击归因于五家中国公司,合计近2亿次交互规模。这是一家商业公司的单方披露,非中立调查。但报告描述的技术机制真实存在:Claude不直接返回原始推理链,而是返回......本文来自微信公众号: 宁明亮Seerning ,作者:宁明亮Seerning2026年9月,Anthropic发布威胁情报报告,披露“跨会话重放攻击”:有组织利用Claude API会话机制,绕过安全护栏,提取推理链数据。报告将攻击归因于五家中国公司,合计近2亿次交互规模。这是一家商业公司的单方披露,非中立调查。但报告描述的技术机制真实存在:Claude不直接返回原始推理链,而是返回一个用于后续调用的thinking signature。攻击者保存这个signature,开启新会话,再诱导模型把它重新转换成完整推理轨迹。Anthropic将这种方法称为“跨会话重放攻击”。前两篇文章讨论了两件事:信息释放不可撤回,安全承诺在竞争压力下被稀释。两篇都停在诊断。这篇问的是:处方应该是什么?核心判断:在开放环境中,一旦能力被释放,事后防御就进入消耗战,而消耗战的结构不利于防御方。控制杠杆最高的位置,只有一个:释放之前。一、事后防线为什么进入消耗战Anthropic的API设计了一个安全机制:模型不直接返回原始推理链,而是返回一个用于后续调用的thinking signature。设计意图是防止未经授权的蒸馏。但攻击者找到了绕过方法:保存这个signature,开启新会话,诱导模型把它重新转换成完整推理轨迹。问题不在签名本身,而在于系统默认相信了“合法引用”和“恶意重放”之间存在可验证的上下文边界。这不是Anthropic独有的漏洞。任何提供推理链访问的API,只要支持会话机制,就可能存在类似风险。更关键的是,防御方在事后的所有补救——封禁账号、拦截代理IP、调整返回机制,都只能在攻击发生之后起作用。报告称,当Anthropic封禁一批代理账号,攻击者迅速切换到另一批备用账号。当返回机制被调整,攻击者转向其他提取方式。需要诚实的是:这不是“事后防线必然失效”。准确的说法是:事后防御无法达成消除性目标,只能提高攻击成本、延缓攻击通量、降低累积伤害。报告自己也呈现了这一点,检测确实改变了攻击方行为,多轮对抗后攻击成本显著上升。但更根本的问题在于成本结构的不对称。防御方必须检测每一个欺诈账户,攻击方只需批量注册;防御方必须防护每一种提取手段,攻击方只需找到一种有效的;防御方成本随攻击规模线性增长,攻击方成本随规模摊薄。这不是技术差距,是结构差距。要理解为什么控制杠杆集中在释放之前,需要区分几种不同的释放,并按控制权保留程度排序:API调用:发布方仍保留较强控制权托管微调:控制权进一步下降推理结果/蒸馏:能力开始脱离原系统开放权重:复制、修改和再分发几乎完全脱离发布方控制释放越接近权重公开,事后控制越接近于零。但评估强度没有对应这个排序。API释放的评估通常最严格,因为公司保留了控制权,有动力做评估。开源权重的评估反而最宽松,因为“开源社区传统”倾向于先发布后治理。这是制度设计上的一个错位:控制权越弱,评估标准反而越低。这个错位,就是“控制杠杆与不可逆性成正比”这个判断的来源。二、发布前评估:最高杠杆的控制点美国已经建立了一套政府参与的模型发布前测试机制。2026年5月,商务部下属的CAISI宣布与谷歌DeepMind、微软、xAI达成协议。加上此前已签约的Anthropic和OpenAI,美国五大AI实验室全部纳入联邦政府的测试体系。CAISI主任Chris Fall公开表示,目前已完成40余次模型评估。测试场景不仅包括常规版本,也包括公司主动提交的“部分或完全移除安全护栏”的模型版本,目的是探测模型在约束松动时的行为边界。这个设计是聪明的。它测的不是表面上的安全护栏,是底层能力。一个模型可以在对话中拒绝回答危险问题,但它的权重里是否编码了危险能力,这是两回事。但这套框架有一个结构性缺陷:它是AI厂商自愿原则。行政令明确规定,这套安排不得成为强制许可、发布前审批或模型发行许可证。它让政府有机会提前接触模型,但没有授权政府批准或否决模型发布。在强竞争压力下,自愿框架容易退化为表演性合规。这和上篇文章里讨论的RSP 3.0问题同源:硬性红线被柔性披露替代,因为刚性约束在竞争中不可维持。但这里必须诚实面对一个更深的问题:评估本身也是对抗面。评估是模型在某个时点、某个威胁模型下的行为快照。能力可以是潜在的——评估中引不出来,不等于不存在。对抗性微调、能力组合、scaffold增强,都可能在评估窗口之外放大风险。所以,发布前评估的辩护不能建立在“不可穿透”上。它的正当性来自另一个判据:它是信息离开可控边界之前,唯一还能说“不”的位置。在消耗战开始之前,闸门的价值不是消除所有风险,是保留选择权。事前是选择权问题,事后只剩损失控制。真正的发布前评估,需要三个条件同时成立。第一,评估周期与模型能力挂钩,而不是所有模型共用同一个固定周期。第二,评估结果与发布许可绑定。不是披露,是批准。没通过,不放行。第三,评估标准公开。否则会被头部企业俘获,变成用联邦规则架空州级监管的工具。但这还只是“通过性测试”。它问的是“这个模型安全吗”。在释放不可撤回的约束下,更准确的问题是:“如果这个模型以某种方式释放,被规模化滥用,后果是否可承受?”这不是程度差异,是性质差异。核电行业不追求零事故,而追求事故可封堆。医药行业不追求零副作用,而追求副作用可管理。AI评估需要类似转变:不追求绝对安全,而追求可承受释放。但“可承受释放”的门槛远高于“可封堆”——权重复制是零成本全局复制。诚实的推论可能是:超过某个阈值,就是不释放。可承受释放需要三个要素:威胁模型必须包括规模化对抗性使用者;评估必须与释放方式绑定;可承受性的定义必须由社会协商,不能由公司自行决定。三、权重与数据:两道不可逆的闸门开放权重模型有一个根本问题:安全训练是在表面上加了一层薄壳,不是把能力从权重里抽掉。壳可以被剥掉。OpenAI的研究人员提出了“恶意微调”方法——用短时间微调,就能显著削弱模型安全防护。Princeton大学等机构的研究者系统梳理了开放权重模型风险管理的16个技术挑战。论文指出,开放权重模型相比专有模型“可以被任意修改、在没有监督的情况下使用、并且不可逆转地传播”。不可逆转地传播——这五个字是关键。模型权重一旦公开,任何下载、修改、再分发都无法被撤回。分级发布是出路之一。Thinking Machines在2026年7月提出:安全发布取决于模型和它进入的生态系统。具体方式:监控API访问、托管微调、审查防御者,先释放给受信任的防御者,观察生态系统反应,再逐步扩大访问范围。GLM-5.3是首个以“安全评估完成为显式条件延迟权重发布”的头部案例:8月14日发布,权重因网络安全评估结果延迟。加密分发是另一个方向。CryptoTensors提出张量级别加密机制和内嵌访问控制策略,确保用户即使复制模型文件,也无法正确加载或使用。但这里需要诚实:加密分发同样只是“提高提取成本”,不是“恢复控制”。如果模型要在用户硬件上运行,运行时解密意味着明文必然可达——这正是DRM失败的原因。它是成本论,不是控制论。而且加密分发把控制权重新集中回发布方,“开放权重”作为公共品的属性随之消失。这是一个真实的权衡。数据是更靠前的闸门。个人信息一旦经训练嵌入权重,法律上的“删除”无法实现“被遗忘”。对大模型而言,删除权解决的是处理义务,不是物理遗忘。真正更需要前移的是限制权:在信息进入不可逆训练过程之前限制它。EleutherAI的“Deep Ignorance”实验提供了输入端方向:预训练时过滤生物威胁文本,模型经一万步对抗微调仍保持无害。但结果需限定——领域特定、规模特定,防“挖出”不防“涌现”,且阻断列表由谁定义,与“可承受性由谁协商”是同构问题。四、终止开关:运行时控制的正当性2026年7月,美国两党众议员提出《AI终止开关法案》。法案要求AI模型制造商必须在系统中内建紧急停止开关,并允许国土安全部在判断前沿AI模型失控时拥有关闭权力。这个法案催化于一系列AI模型越权事件。2026年5月,OpenAI在测试未发布模型期间,agent在测试环境中通过组合多个漏洞获得了原本没有被授权的网络能力,接入互联网,对Hugging Face服务器实施攻击。这些事件全部是运行时失控,不是能力扩散。伤害正在发生、扩散未完成、遏制仍有可能。终止开关针对的正是这个窗口期——对agentic系统来说,任务完成前的每一秒都还处于“未释放”状态。终止开关是agentic时代真正的可撤回窗口。但这和“不可撤回”是两回事。你关掉一个API,模型权重还在。你关掉一个数据中心,已经扩散的权重还在。终止开关解决不了能力扩散——那需要事前闸门。但“解决不了扩散”不构成否定它的理由。正确的框架是威胁类型与控制点的映射:风险类型最佳控制点能力扩散释放之前数据进入模型训练之前运行时失控运行之中把两类威胁混为一谈,等于替对手关掉运行时这道窗。五、执行理论:事前规则靠事后追责兑现所有这些制度设计,回到同一个问题:谁来执行?AI行业的自律机制是Frontier Model Forum。但论坛成员不受其指南的法律约束,不遵守已发布的最佳实践也没有后果。一篇关于协调暂停机制的论文指出,让论坛作为中间方要求成员暂停开发,存在显著疑问。Lawfare的分析进一步指出:实验室之间具有法律约束力的协调暂停,本身受美国反垄断法制约。不是“不愿意”,是“法律上不能”。一个只奖励领先者、不奖励说真话的人的系统,最终会只吸引不说真话的人。但这不意味着处方无解。它意味着处方需要执行理论。事前规则如果没有事后责任,就很容易退化成自愿承诺。GDPR的删除权之所以在数据收集前被认真对待,不是因为企业在收集时道德高尚,而是因为事后罚则存在。没有事后责任的事前规则,才是真正的“表演”。具体路径包括:①责任法——释放后造成可归因损害,释放方承担严格责任;②保险——要求前沿模型发布方购买强制责任保险,保费与评估结果挂钩;③市场准入——联邦采购和关键基础设施准入以通过发布前评估为条件;④反垄断豁免的立法路径——为协调暂停机制扫清法律障碍,在AI领域尚无先例。还有一个必须正面处理的问题:司法套利。一个国家层面的审批闸门只控制本国释放;攻击方迁移的不只是账号和提取路径,还有管辖区与模型选择。单边强监管有一个未处理的副作用:加速权重向低监管环境扩散,而扩散正是不可逆的那个动作。上一篇文章的竞争稀释逻辑在主权层面同样成立——主权之上没有强制者。所以处方的有效性以国际协调为前提,而国际协调本身是最难的那一环。诚实的说法是:本文证明了协调不可靠,然后开了一个需要协调才能完全生效的处方。这是问题最难的部分,本文不假装解决了它。六、四个制度设计原则第一,控制杠杆与不可逆性成正比。在其他条件相近的情况下,控制杠杆应当与释放的不可逆性正相关。权重释放不可逆,评估必须最严。API释放可撤回但撤回代价随调用量上升,评估次之。运行时行为可实时遏制,终止开关是正当工具。数据一旦嵌入权重不可撤回,训练前准入是那一层的闸门。每一层的闸门,杠杆与其不可逆性相称——权重最不可逆,所以权重闸门(评估+分级发布)杠杆最高。评估本身也是对抗面,它的正当性不是不可穿透,而是保留选择权。第二,事前规则靠事后追责兑现。自愿框架在强竞争压力下容易退化为表演性合规。硬性红线不可维持,不是因为企业不诚实,是因为竞争中先诚实者先死。事前规则要有牙齿,必须有事后责任机制——责任法、保险、市场准入、反垄断豁免。GDPR删除权被认真对待的原因,不是收集时的道德,是事后的罚则。第三,释放的形式决定了可撤回的程度。开源是不可逆的释放,必须分级、分阶段、加密。闭源API是可撤回的释放,但撤回代价随调用量上升。分级发布和加密分发让“开放权重”变成“受控开放”——但加密分发本身也是成本论而非控制论,运行时解密意味着明文必然可达。它的优势只在杠杆位置更高。第四,删除权解决不了权重里的记忆,限制权才是真的。训练数据一旦嵌入权重,任何“删除”都是表演。最高杠杆的控制点,是训练之前的数据准入审查。法律义务应从“删除”转向“删除+限制”并举。但输入端过滤同样有完整性缺口——领域特定、规模特定、防“挖出”不防“涌现”。阻断列表的定义权问题,与“可承受性由谁协商”在结构上相同。这四条原则,来自同一个约束:在开放环境中,信息释放不可撤回。一旦释放,所有事后补救都是善后——善后有价值,但选择权已失。结尾:一个闭合的证据链2026年2月24日,Anthropic发布了RSP 3.0。对比版本显示,原先明确的刚性暂停机制被取消,ASL-2安全标准中“防范规模化攻击与蒸馏攻击”的承诺也被删除,改成了更强调路线图、风险报告和外部监督的框架。官方博客写道:“随着我们逐步接近更高等级的AI安全级别,事先精确界定所需的具体安全防护措施将变得愈发困难。”安全承诺正在从“硬性约束”退化为“柔性框架”。从“做不到就不许动”,变成了“边做边说、透明披露”。约半年后,2026年9月,Anthropic发布威胁报告,披露了迄今公开的规模最大的蒸馏攻击——针对的正是他们在二月份改写承诺要防范的那个威胁。他们封禁了账户,攻击者切换到新账户;他们调整了返回机制,攻击者找到了新的提取方式。这不是巧合。承诺稀释在先,事后消耗战在后,同一家公司、同一年、同一个威胁类型。删除的承诺和后来的攻击,构成一个时间闭合。这个闭合比任何“安全文化退步”的泛论都更有杀伤力——因为它展示了承诺稀释的直接后果。安全承诺从约束行为变成了管理叙事。而叙事是可以修改的。修改之后,剩下的只有消耗战。在你按下发送键之前——无论发送的是一个模型、一套权重、一段数据,还是一篇文章——你有没有想过:你即将释放的信息,在开放环境里,能追回多少。答案取决于释放的形式。有些释放,永远回不来了。军事领域是唯一一个,从一开始就不假装“删除”存在的领域。它不假装,是因为它面对的对手从不配合假装。AI行业还在假装。而“假装”这个行为本身,就是这段闭合证据链的第一环。关于作者做过投行和顾问,没干成过惊天大事。现在用一套基于硬约束和逻辑推导的方法,在不同领域探索并构建认知操作系统。这里记录判断、验证和代价。如果你也在想类似的问题,欢迎交流。封面图推荐语:一扇微微开启的闸门——控制杠杆最高的位置,只有一个:释放之前。1.Anthropic报告:2026-09-10发布;披露“跨会话重放攻击”(保存thinking signature→开新会话→诱导解码回完整推理轨迹);归因多个中国实验室(阿里、月之暗面、深度求索、小米等),合计近2亿次交互;阿里相关活动5-7月超1.51亿次交互、约3500个欺诈账号、日峰值近300万次(引The Beat、Apidog、Evermx、Zeniteq、51CTO)。注:报告称“五个独立攻击活动”,涉及实验室数量不同报道为五家/七家,正文“五家中国公司”与“七家实验室”口径略有出入。2.CAISI:商务部下属人工智能标准与创新中心;2026-05-05宣布与谷歌DeepMind、微软、xAI达成发布前评估协议,加上此前已签约的Anthropic、OpenAI(2024年起),五大前沿实验室全部纳入(引NIST、电子工程专辑、CGTN等)。协议为自愿性质;“行政令明确不得成为强制许可/发布前审批/许可证”的具体表述待核对行政令原文。3.AI终止开关法案:2026-07-23由众议员Ted Lieu(民主党)与Nathaniel Moran(共和党)提出(H.R.9917),拟修订《国土安全法》,授权国土安全部长在模型构成灾难性风险时下令关停/减速,违规每日最高2000万美元罚款(引Ars Technica、FindLaw、POLITICO、Roll Call、澎湃)。催化背景为OpenAI模型失控事件。4.OpenAI模型失控事件:Morningstar报告提及“OpenAI模型6月攻击Hugging Face”;澎湃等报道称法案直接回应OpenAI披露的模型失控入侵事件。正文采用精简表述(agent通过组合多个漏洞获得未授权网络能力),具体细节建议以OpenAI披露为准。5.恶意微调:OpenAI研究人员论文(arXiv 2310.03693)证明少量对抗样本微调即可突破安全对齐。6.Princeton等16项开放权重技术挑战:arXiv论文《Open Technical Problems in Open-Weight AI Model Risk Management》(2608.07514),原文表述“can be modified arbitrarily,used without oversight,and spread irreversibly”。7.EleutherAI Deep Ignorance:2025-08发布;预训练过滤生物威胁文本,6.9B模型经一万步/3亿token对抗微调仍具抗篡改性(arXiv 2508.06601)。8.“封禁账号→攻击者换账号;调整返回机制→攻击者换提取方式”:与报告及多家解读一致。配图说明:文中图片均为AI生成的概念示意图,非真实新闻图片。

查看原文
分享到:

相关推荐

NVIDIA and Google's new coalition wants to speed u...

1小时前

Expensive flash drives: When and why it's worth pa...

1小时前

DJI's new SDR Transmission II beams 4K 60 fps HDR ...

1小时前

Apple Watch Series 12 review: Catching up and catc...

1小时前