三天之内,Anthropic 防护做得最严的 AI 模型上线、被宣称已经越狱、被指偷偷把用户降级去用弱模型,然后被美国政府关掉。以下是 Claude Fable 5 从旗舰走到停用的整个过程,以及它暴露出来的两件事:AI 安全实际上是怎么运作的,还有一个前沿模型上线之后,到底谁说了算。
这是我们那篇较短的 Fable 5 停用为什么值得你关心 的深入版。
第一天:一个刻意做成难攻破的模型
Anthropic 在 6 月 9 日放出 Fable 5,说它是自己交到公众手上的最强模型,同时在安全上讲得很重。它的设计值得先看清楚,因为后面发生的事都压在这上面。每个请求先经过分类器,那是一批小模型,专门认出网络安全、生物、化学这类敏感话题。其中一个触发时,请求不会被拒绝,而是被悄悄交给更旧、更弱的 Claude Opus 4.8 去回答。Anthropic 说这发生在不到 5% 的对话里。
所以这层安全机制从来不是一道锁上的门,它是一个分流器。多数时候你拿到的是完整的 Fable 5;有些时候,凭一次猜测,你拿到的是弱模型,而回答你的到底是哪一个,你未必知道。
上线 48 小时:Fable 5 的越狱声称
越狱是一种把模型推过自己安全规则的手法。上线两天内,一位名叫 Pliny 的研究者声称他攻破了 Fable 5。按他的说法,那是一叠技巧叠起来的:把一个被禁的请求拆到多个步骤和多个 agent 上,让单看每一步都不像有害;再把这些碎片包进学术或者虚构的外壳;还用角色扮演的花招绕过过滤。他也声称把模型完整的系统提示词泄了出来。截图传得很快。
Anthropic 反驳了这个说法。它说这不是真的越狱,只是把模型哄着继续回答、越过它自己的拒绝,那是几乎每个大语言模型都有的毛病,而且没有任何真正危险的东西被解锁。它划了一条线:窄越狱是在特定设置里撬出特定信息,通用越狱是把防护整片击穿。按它的说法,没有人找到 Fable 5 的通用越狱。
两边可以同时成立。这个手法大概没有把真武器交到谁手上,但它暴露了这类安全机制的根本弱点:把一个有害的请求切成一小段一小段看起来无辜的步骤,你就能绕过那些直接问会被拦下的过滤。每一步读起来都人畜无害,只有整体是危险的,而分类器判的是步骤。这就是今天 AI 对齐的水平,也就是让模型待在它自己界线里的那份工作。比去年好。但不是墙。
6 月 12 日:政府拔掉插头
接着这件事就不再只关于 Anthropic 和它的用户了。6 月 12 日,美国政府发出一道出口管制命令,理由是一个窄越狱,就是让模型去读一份代码库、找出软件漏洞的那种。命令针对的是外国人的访问权,而唯一的合规做法,是替全球每一个客户关掉 Fable 5 和它的兄弟型号 Mythos 5。那道命令的完整来龙去脉,写在我们另一篇讲停用的文章里。
Anthropic 就停止 Fable 5 与 Mythos 5 访问权一事发出的公开声明。来源:Anthropic
上线三天,Anthropic 出过的最强模型没了。
捅出这件事的是对手,以及它意味着什么
这道命令包着一层国家安全的说法,但之后被报道出来的现实要古怪得多。据《华尔街日报》,让政府警觉的那个越狱,是 Anthropic 大股东 Amazon 的研究员找到的,据报他们把它交给了商务部,而不是先交给 Anthropic。最早的猜测指向 OpenAI。而在此之前,政府已经要求 Anthropic 推迟上线并被拒绝,所以这份报告成了把模型拦下来的那根杠杆。
很难不把这读成:一个竞争对手借政府的手,把同行的旗舰下架。虽然没有人正式这么说过。Anthropic 主张这个漏洞是窄的,但一个模型一旦被框成国家安全风险,事情就轮不到工程师来定。这让前沿模型不太像一件普通产品,更像一项战略资产,可以在一夜之间因为跟它的代码毫无关系的理由被关掉。这是出口管制命令头几次把一个商业模型从全球拔掉,而这条路以后还会再走。我们会继续跟进。



