安全营销翻车:Anthropic 自曝模型能黑掉 5 个系统,于是政府 72 小时内就封杀了它


安全营销翻车:Anthropic 自曝模型能黑掉 5 个系统,于是政府 72 小时内就封杀了它

一次安全营销,怎么把企业逼到丧失发布主动权

Anthropic 自己写了半年“危险通告”,政府照着关掉了它最强的模型

“我们其实没那么危险”——这句话从自己嘴里说出来,谁信?
Shaun  /  2026-06-13  /  阅读 7 min
01
一份自己导演的”危险通告”

今年 4 月初,Anthropic 高调预览了 Mythos,当时它最强的模型。

预览方式很特别。它没怎么吹这模型写代码多快、推理多准,而是花大篇幅告诉全世界,这东西有多危险。

具体到什么程度?据 Anthropic 的说法,在内部测试里,Mythos 能自主发现它测过的每一款主流操作系统和主流网页浏览器的安全漏洞。不是”理论上可以”,是真找出来了。

这种发现会让公司自己都紧张。于是它决定不向公众开放,而是把 Mythos 塞进一个叫 Project Glasswing 的受控项目,只分享给大约 50 家受信任机构——据 TechCrunch 报道,名单里有 Amazon、Apple、Google、Microsoft、CrowdStrike,让它们用来做防御性的网络安全工作。

一家公司,主动给自己最强的模型上锁,还公开解释为什么上锁——因为它太危险。

听起来很负责任。

但问题在于,当你反复向全世界强调”我的 AI 能发现系统漏洞””这东西太危险,不能给普通人用”,你猜谁会最先把这句话记下来?

不是开发者,不是用户。是政府。

02
危险标签先到,越狱只是扣扳机

接着,Anthropic 做了个折中方案:发布 Fable 5,一个套了防护栏的”公众版”。它本质上就是 Mythos,只是封掉了网络安全、生物等高风险领域的输出,公司认为这样就够安全,可以面向公众发布。性能依旧凶悍——发布当天就被 Vals AI 评为公众可用的最强模型。

但调子已经定死了。公众知道原版 Mythos 有多可怕,政府也知道。公众版再怎么加防护,在外界眼里它就是”那个危险 AI 的弱化版”。

更要命的是导火索:Fable 5 被声称遭到越狱。据 Anthropic 的理解,政府真正担心的不是出口,而是一次”可能存在的、范围狭窄、非普适的越狱”——说白了,就是诱导模型去读一段指定代码、找出其中的软件漏洞。Anthropic 看过这个技术的演示,认为它暴露的只是”轻微漏洞”,连 OpenAI 的 GPT-5.5 等其他公开模型也能做到,而且这本来就是网络安全人员日常用于防御的能力。

但这些辩解都晚了。一个已经被打上”危险”标签的模型,又被演示安全机制可能被绕过——这个组合,足以让任何一个国家的安全部门坐不住。

差别很关键:不是 Fable 5 突然变危险了,是”危险”这个标签先到位了,越狱只是把扳机扣下去的那一下。

03
名义是出口管制,实际是全球封杀

这道指令名义上是出口管制。据报道,是商务部长 Howard Lutnick 的一封信,要求对 Fable 5 和 Mythos 5 的出口、再出口和境内转移都要许可,针对的是外国人。

实际操作呢?Anthropic 被迫对全球所有用户禁用这两个模型——不只是境外账号,连在美国境内工作的外国人、甚至公司自己的员工都被切断。美国本土打不开,欧洲打不开,亚洲也打不开。我手里那行红字,就是这道指令落到普通用户身上的样子。

名义范围:外国用户。

实际影响:所有用户。

这不是什么法律漏洞,这是出口管制工具天然的粗糙。当政府说”不能让外国人用”,技术上的落地方式往往只有一种:让所有人都用不了。一刀切是工具的默认形态,精准从来不是。

Anthropic 公开声明认为政府判断错了,称这是一场误会,正在争取尽快恢复访问。但模型还是先停了。

到这一步,公司其实已经丢掉了话语主动权。当一家公司花了几个月告诉全世界”我的 AI 很危险”,等政府真下令关停时,再说什么都像狡辩。

“我们其实没那么危险”——这句话从自己嘴里说出来,谁信?

04
安全营销的囚徒困境

这个困境不是某一家公司独有的。

监管的逻辑其实特别简单:你承认有风险,我就要管;你承认风险越大,我管得越严。

于是”安全营销”就成了一个两头堵的局:你不说风险,公众和监管觉得你不负责任;你说了风险,监管就拿你的话当证据来管你。

如果一家公司走更极端的路线——不仅说风险,还把风险说得极其具体,比如”能发现系统漏洞”——这等于主动把一把已经上膛的枪递到监管手里。

我做内容系统时踩过一个同构的坑,不是同一件事,但那种”我以为我在做 A,结果做成了 B”的感觉是一样的。

当时我在 Hermes 里设计草稿审稿机制,原本以为把”拒绝原因”记得越细越好——钩子弱、太说教、缺数据、AI 味重、结构松,一条条标得清清楚楚,再注入下一轮 prompt。后来发现,标签越具体,模型越容易把它当成硬约束,生成时反而畏手畏脚,绕着所有”可能被拒”的写法走,结果是越写越平。

我以为我在”提高质量”,实际上我在”给系统画红线”。这两件事看着像,激励方向完全相反。

Anthropic 也是。它以为自己在”描述风险”,在监管眼里那是”承认风险”。描述是技术事实,承认是政策信号。区别就在这儿。

05
受控发布的玻璃房

回到 Project Glasswing。

只给大约 50 家受信任机构开放,用来做防御性的网络安全——找漏洞、做安全测试、加固自己的系统。这个项目的名字起得很妙:Glasswing,玻璃翼。透明、可见,也脆弱。

但这个”玻璃房”本身也在加固”这模型很危险”的叙事。

如果它不危险,为什么只给少数几家?受控发布这个动作本身,就在持续向外界喊:这东西真的危险,我们真的在认真对待。

然后政府就真的认真对待了。

06
那它就该隐瞒风险吗

肯定有人会问:Anthropic 到底做错了什么?发现风险、公开风险、做受控发布,这不正是负责任的 AI 开发该做的吗?

对。从逻辑上,这确实是负责任的做法。Anthropic 一直把自己立成”更在乎安全的那一个”,今年还被普遍预期要 IPO。

但现实世界的逻辑和实验室不一样。

实验室里,你说”这模型有漏洞发现能力”,是一个技术事实。现实世界里,同一句话,是一个政策信号。

政府不会去区分”公司在描述风险”和”公司在承认风险”。在它眼里,这往往是一回事。

更麻烦的是,这次政府动手,依据的只是一次”可能存在的、范围狭窄”的越狱演示。Anthropic 自己看完都觉得那只是轻微漏洞,别的公开模型也能做到。但政府不需要等细节查清才动手——一个”危险”标签加一次越狱演示,已经足够。

所以批评 Anthropic”搬起石头砸自己脚”,不等于鼓励企业隐瞒风险。但有一个绕不开的事实是:这套安全营销策略,在商业和安全两个维度上可能都没赢。

商业上,它丢了自己最强的产品——而且是发布第三天就丢了。安全上,它丢了对发布节奏的控制权。

07
一个更难看的激励结构

往下想一层,答案会让人不太舒服。

如果 Anthropic 当初低调发布 Mythos,不公开它的漏洞发现能力,不搞 Project Glasswing,直接给公众用——政府很可能根本不会注意到这个模型。

风险是:它真被滥用,真出安全事件。

收益是:公司保住了最强产品、估值和用户。

这就是安全营销的终极悖论——负责任的行为招来了更严的监管,而藏住风险的行为反而可能换来商业成功。

如果这个激励结构不变,下一次别的公司还会这么早、这么具体地公开风险吗?看到 Fable 5 发布三天就被关停的同行,又会怎么选?

我的判断是:可能不会。至少不会公开得这么具体,不会公开得这么早。

这才是这件事真正糟糕的地方。它不只是关掉两个模型,它给整个行业示范了一个结论——把危险说清楚的人,先被收拾。

08
落到你这边

我那行 claude-fable-5 的红字,不是个例。它是这套机制落到每一个普通用户身上的具体形状:你昨天还在用的最强模型,今天可能就因为一道你完全无法参与的政府指令,凭空消失。

所以对在用 AI 模型做产品的人,这件事指向两件实际的事。

第一,盘一遍你的业务是不是高度依赖某一个具体模型版本。如果是,提前想好退路。模型的可用性并不完全由技术决定,监管、商业、安全任何一环出问题,都可能让一个模型说停就停——Fable 5 从最强到不可用,只用了三天。

第二,重新算一下你对单一 AI 供应商的依赖度。你的产品架构能不能像我 /model 切到 Opus 那样,快速换掉底层模型?你的数据是不是被锁死在某一家的生态里?

这两件事的核心不是”换个更安全的供应商”,没有绝对更安全的供应商。核心是:把”某个模型可能随时不可用”当成你架构里的默认假设,而不是意外。

在国家安全这类硬约束面前,产品路线图、用户协议、商业承诺,往往都排在后面。这一次,连 Anthropic 自己的员工都被一并切断了访问。

下一次被贴上”危险”标签的,可能是任何一家公司。而你,可能正好在用它的 API。

关注 SHAUN

AI agent · 工作流 · 真实踩坑日志