Gotchaa Lab
返回博客
AIAnthropicAI-safetyFable 5AI-regulation

Fable 5 被停用的完整经过:越狱、举报的对手,和三天下架

2026年6月15日·阅读约 5 分钟·作者:Gotchaa Lab
Fable 5 被停用的完整经过:越狱、举报的对手,和三天下架

图片来源:Anthropic

重点摘要

  • Anthropic 在 2026 年 6 月 9 日推出 Claude Fable 5,称它是自家防护做得最严的公开模型。三天后,美国政府把它在全球范围内关掉。
  • 一位名叫 Pliny 的研究者在 48 小时内声称越狱成功,用的是把请求拆成多步之类的手法。Anthropic 不认,说那只是把模型哄过自己的拒绝,不算真正的通用越狱。
  • Fable 5 的安全机制是一个分流器,不是一堵墙:分类器一旦标记某个请求,它不会被拒绝,而是被悄悄交给较弱的 Opus 4.8。Anthropic 说这发生在不到 5% 的对话里。
  • 触发这道命令的不是外国对手。《华尔街日报》报道,找到这个越狱的是 Anthropic 大股东 Amazon 的研究员,他们把东西交给了政府,而不是先交给 Anthropic。
  • 这是美国出口管制命令头几次把一个商业 AI 模型的全球访问权直接掐断。这条路已经走通了,以后还会再走。

三天之内,Anthropic 防护做得最严的 AI 模型上线、被宣称已经越狱、被指偷偷把用户降级去用弱模型,然后被美国政府关掉。以下是 Claude Fable 5 从旗舰走到停用的整个过程,以及它暴露出来的两件事:AI 安全实际上是怎么运作的,还有一个前沿模型上线之后,到底谁说了算。

这是我们那篇较短的 Fable 5 停用为什么值得你关心 的深入版。

第一天:一个刻意做成难攻破的模型

Anthropic 在 6 月 9 日放出 Fable 5,说它是自己交到公众手上的最强模型,同时在安全上讲得很重。它的设计值得先看清楚,因为后面发生的事都压在这上面。每个请求先经过分类器,那是一批小模型,专门认出网络安全、生物、化学这类敏感话题。其中一个触发时,请求不会被拒绝,而是被悄悄交给更旧、更弱的 Claude Opus 4.8 去回答。Anthropic 说这发生在不到 5% 的对话里。

所以这层安全机制从来不是一道锁上的门,它是一个分流器。多数时候你拿到的是完整的 Fable 5;有些时候,凭一次猜测,你拿到的是弱模型,而回答你的到底是哪一个,你未必知道。

上线 48 小时:Fable 5 的越狱声称

越狱是一种把模型推过自己安全规则的手法。上线两天内,一位名叫 Pliny 的研究者声称他攻破了 Fable 5。按他的说法,那是一叠技巧叠起来的:把一个被禁的请求拆到多个步骤和多个 agent 上,让单看每一步都不像有害;再把这些碎片包进学术或者虚构的外壳;还用角色扮演的花招绕过过滤。他也声称把模型完整的系统提示词泄了出来。截图传得很快。

Anthropic 反驳了这个说法。它说这不是真的越狱,只是把模型哄着继续回答、越过它自己的拒绝,那是几乎每个大语言模型都有的毛病,而且没有任何真正危险的东西被解锁。它划了一条线:窄越狱是在特定设置里撬出特定信息,通用越狱是把防护整片击穿。按它的说法,没有人找到 Fable 5 的通用越狱。

两边可以同时成立。这个手法大概没有把真武器交到谁手上,但它暴露了这类安全机制的根本弱点:把一个有害的请求切成一小段一小段看起来无辜的步骤,你就能绕过那些直接问会被拦下的过滤。每一步读起来都人畜无害,只有整体是危险的,而分类器判的是步骤。这就是今天 AI 对齐的水平,也就是让模型待在它自己界线里的那份工作。比去年好。但不是墙。

6 月 12 日:政府拔掉插头

接着这件事就不再只关于 Anthropic 和它的用户了。6 月 12 日,美国政府发出一道出口管制命令,理由是一个窄越狱,就是让模型去读一份代码库、找出软件漏洞的那种。命令针对的是外国人的访问权,而唯一的合规做法,是替全球每一个客户关掉 Fable 5 和它的兄弟型号 Mythos 5。那道命令的完整来龙去脉,写在我们另一篇讲停用的文章里。

Anthropic 就美国政府要求停止 Fable 5 与 Mythos 5 访问权而发布的官方声明配图 Anthropic 就停止 Fable 5 与 Mythos 5 访问权一事发出的公开声明。来源:Anthropic

上线三天,Anthropic 出过的最强模型没了。

捅出这件事的是对手,以及它意味着什么

这道命令包着一层国家安全的说法,但之后被报道出来的现实要古怪得多。据《华尔街日报》,让政府警觉的那个越狱,是 Anthropic 大股东 Amazon 的研究员找到的,据报他们把它交给了商务部,而不是先交给 Anthropic。最早的猜测指向 OpenAI。而在此之前,政府已经要求 Anthropic 推迟上线并被拒绝,所以这份报告成了把模型拦下来的那根杠杆。

很难不把这读成:一个竞争对手借政府的手,把同行的旗舰下架。虽然没有人正式这么说过。Anthropic 主张这个漏洞是窄的,但一个模型一旦被框成国家安全风险,事情就轮不到工程师来定。这让前沿模型不太像一件普通产品,更像一项战略资产,可以在一夜之间因为跟它的代码毫无关系的理由被关掉。这是出口管制命令头几次把一个商业模型从全球拔掉,而这条路以后还会再走。我们会继续跟进。

参考资料

  1. 关于美国政府要求停止 Fable 5 与 Mythos 5 访问权的声明(Anthropic)
  2. Anthropic 否认 Fable 5 被越狱(SecurityWeek)
  3. 研究者称已绕过 Anthropic 的 Fable 5 护栏(Cointelegraph)
  4. 遭遇批评后,Anthropic 把 Fable 5 的安全机制公开(Crypto Briefing)
  5. 美国禁止外国使用后,Anthropic 停止顶级 AI 模型的访问(The Wall Street Journal)
  6. 特朗普政府封锁外国对 Anthropic 最强 AI 的访问(Axios)

分享这篇文章

常见问题

Claude Fable 5 真的被越狱了吗?
一位名叫 Pliny 的研究者在上线 48 小时内声称越狱成功,用的是把请求拆成多步、包上叙事外壳这类方法。Anthropic 不同意这个说法,认为那只是把模型哄着继续回答、越过它自己的拒绝,而这是几乎所有大语言模型都有的弱点。Anthropic 说,没有人找到能全面击穿 Fable 5 防护的通用越狱。
Fable 5 的安全机制是怎么运作的?
Fable 5 会把每个请求先送进分类器,那是一批小模型,专门认出网络安全、生物、化学这类敏感话题。分类器一旦触发,请求不会被拒绝,而是交给 Claude Opus 4.8 来回答,那是一个更旧、能力更弱的模型。Anthropic 说这发生在不到 5% 的对话里。
是谁举报了那个害 Fable 5 被停用的越狱?
《华尔街日报》报道,找到这个越狱的是 Anthropic 大股东 Amazon 的研究员,他们把它直接报给了美国商务部,而不是先告诉 Anthropic。更早的 Axios 报道只提到“另一家公司”。商务部随后发出那道出口管制命令。
窄越狱和通用越狱有什么分别?
窄越狱是在特定的设置里撬出特定的信息。通用越狱是在很多任务上全面击穿模型的防护。Anthropic 主张 Fable 5 这次顶多算窄的,而美国政府认为窄风险也足以先把模型停掉。
Claude Fable 5 还会回来吗?
Anthropic 用了少见的直白措辞表示不同意这道命令,也明显想让模型重新上线。这场争执看起来是可以解开的,不像是永久的结局。截至 2026 年 6 月 13 日,Fable 5 和 Mythos 5 都还没有公布恢复访问的日期。

想为你的公司做一套这样的系统?

我们帮马来西亚企业把这类想法做成能用的软件。免费咨询,不勉强。