Fable 5 发布:最强 Claude 来了,包月时代即将结束
作者按
彭老师最近在和芬兰、新加坡的几位学者合作做一项关于 Vibe Coding 心流体验 的研究。如果你使用过 Claude Code、Codex、Cursor 等 AI 编程工具,希望能帮忙填写一份匿名问卷(约 5–8 分钟)。
链接在文末,提交后评论参与赠书活动。

最近网上流传着一张关于 Fable 5 的梗图。
有人把 Claude Code 的模型切换到刚发布的 Fable 5,然后问了一个 AI 圈经典老题:“strawberry 里有几个 R?”
Fable 5 的回复大意是:“你认真的?我都快成神了,你拿 2023 年的脑筋急转弯来测我?这个问题大概花了你 5 美元,说实话还应该更贵一点。答案是 3,满意了吗?”

当然,这张图是 P 的,是个段子。但它之所以能够迅速传播,是因为精准踩中了这次发布中一个非常真实的变化:这是第一次,你问 Claude 一个问题,可能真的需要按 Token 单独付费。
今天想聊聊 Fable 5 到底是什么、为什么它会主动回退,以及那张梗图背后真正值得关注的信号。
一、Fable 5 :被“管”起来的最强模型
6 月 9 日,Anthropic 发布了阉割版 Mythos 模型 —— Claude Fable 5。
它并不属于我们熟悉的 Opus、Sonnet、Haiku 产品线,而是一个全新的层级——Mythos-class。官方给出的定位非常直接:能力位于 Opus 之上,而且任务越长、越复杂,它相对于其他模型的优势就越明显。
更值得注意的是,Fable 5 与此前仅向极少数网络安全和基础设施伙伴开放的 Mythos 5,本质上是同一个底层模型。两者最大的区别不在能力,而在安全限制的松紧程度。这一点其实非常重要,因为它直接关系到 Anthropic 这次发布背后的整体策略,后面还会专门展开。
先看它到底强在哪里。

在编码能力方面,Stripe 在早期测试中使用 Fable 5 完成了一次 5000 万行 Ruby 代码库迁移,并在一天内完成了原本需要数周甚至数月才能完成的工作。与此同时,包括 Cursor、GitHub、Cognition 在内的多家工具厂商都提到了同一个关键词:长程任务(Long-Horizon Tasks)。也就是那些需要持续工作数小时、跨越大量步骤、过程中不能跑偏的复杂任务,这恰恰是过去大模型最容易失控的地方,而 Fable 5 在这一领域表现出了明显优势。

视觉能力同样令人印象深刻。此前 Claude 想玩《宝可梦》,通常需要地图、导航系统以及各种外部状态信息作为辅助,而 Fable 5 在实验中仅依靠游戏截图,就完成了《宝可梦 火红》的通关。没有地图,没有导航,也没有额外状态接口。除此之外,它还能够根据网页截图反推出应用源码,这种跨模态推理能力相比此前几代模型也有明显提升。
另一个有意思的实验来自《杀戮尖塔》。研究人员给模型提供了一份可以持续读写的记忆文件,让它在游戏过程中记录自己的经验和策略。结果显示,相比 Opus 4.8,Fable 5 的表现提升达到三倍,进入最终幕的成功率也提升到了原来的三倍左右。这说明它不仅能记住信息,更重要的是已经开始学会利用自己的历史经验改善后续决策。
从公开测试数据来看,无论是金融推理还是交易分析等知识工作场景,Fable 5 都处于当前公开模型中的第一梯队。
这些能力当然重要,但如果只是“更强”,Fable 5 还不至于成为最近几天讨论最多的 Claude。
真正让它与此前所有 Claude 不同的,是另外两件事:它会主动回退,以及它开始单独收费。
二、为什么你会被“回退给 Opus”
如果最近在使用 Fable 5,你可能会遇到一个新现象:某些问题它不会直接回答,而是提示你:
此请求将由 Claude Opus 4.8 回答。
这不是 Bug,而是设计。

Anthropic 的逻辑其实很简单。随着模型能力不断提升,一些领域开始出现典型的“双用途(Dual Use)”问题。同一种能力,在安全研究员手里可能是防御工具,在恶意攻击者手里则可能变成武器。
因此,他们在 Fable 5 外部增加了一层独立的安全分类器。当系统判断某个请求涉及高风险领域时,会自动将任务转交给能力稍弱但限制更多的 Opus 4.8 处理,并明确告知用户发生了回退。

目前主要涉及三类场景:
- 1. 网络安全:包括漏洞发现、漏洞利用、攻击链设计等能力;
- 2. 生物与化学:涉及危险病原体、生物武器或高风险实验设计等内容;
- 3. 模型蒸馏:大规模提取 Claude 能力并训练竞品模型的行为。
Anthropic 在技术报告中也坦承,为了能够尽快发布,这套安全系统目前调得偏保守,因此会误伤一部分正常请求。但根据他们公布的数据,超过 95% 的会话不会触发回退。换句话说,对于绝大多数普通用户而言,Fable 5 与 Mythos 5 的实际体验几乎没有区别。
有意思的是,Anthropic 在报告里同时写下了两件事。一方面,他们进行了超过 1000 小时的外部漏洞赏金测试,没有发现能够稳定突破系统限制的通用越狱方案;另一方面,英国 AISI 的测试团队在一个较短的测试窗口中,确实朝着通用越狱方向取得了一定进展。
这种同时公开成绩与风险的做法,反而让我对这份报告增加了一些信任感。毕竟,一个会主动把自己“调笨”的模型听起来有些别扭,但这恰恰是它能够公开发布的重要前提。
三、顶配模型开始按量收费
现在回到那张 strawberry 梗图。
它真正讽刺的其实并不是模型能力,而是价格。
Anthropic 给订阅用户安排了一个分阶段计划:
- 6 月 9 日至 6 月 22 日,Fable 5 免费包含在订阅套餐中;
- 6 月 23 日起,从套餐中移除;
- 后续容量充足时,再重新纳入标准订阅服务。
很多人的第一反应是:
先让你免费体验两周,等你回不去 Opus 了,再开始收费。
这个调侃当然很好笑,但我觉得重点其实不在这里。

重点在于,一个定价为 $10 / 1M Token 输入 、$50 / 1M Token 输出 的模型,本来就很难被固定价格的订阅长期覆盖。
事实上,过去两年 AI 行业一直存在一个有些奇怪的现象:用户购买的是固定价格的订阅服务,而厂商承担的却是不断波动的算力成本。
对于 Sonnet 这类主力模型来说,这种模式尚且成立,因为绝大多数用户的调用量都在可预测范围内。但对于 Fable 5 这样的顶级模型,情况开始发生变化。一次复杂任务可能持续运行数十分钟,消耗数百万 Token;一个重度用户一天消耗的算力成本,甚至可能超过普通用户一个月的订阅费用。
从这个角度看,Anthropic 这次的做法更像是在承认一个现实:最强模型与固定订阅之间的矛盾,已经开始变得无法忽视。
我特别认同这样一个判断:
一个单次任务成本动辄几美元的模型,本来就很难被“包月无限”覆盖。
当模型强到一定程度,按量计费可能不再是商业选择,而是成本现实。
因此,与其说这是一种营销策略,不如说它释放出一个更值得关注的信号:包月时代能够覆盖“够用”的模型,却未必能够覆盖“最强”的模型。
顺带一提,这次还有一个容易被忽略的变化。对于 Mythos 级模型,Anthropic 要求所有请求保留 30 天日志,用于安全分析和误伤修正。官方强调这些数据不会用于训练,并会在到期后删除。但从中也能看出另一个趋势:模型能力越强,围绕它建立的治理机制也会越复杂。
四、Anthropic 的分级开放策略
如果把镜头拉远一点,这次发布真正有意思的地方并不只是 Fable 5 本身,而是 Anthropic 正在逐渐形成的一套开放策略。
记住一句话:
Fable 5 和 Mythos 5 是同一个模型。
区别只在于,不同用户能够解锁不同能力。
今天的结构大致是这样的:
- Mythos 5:面向网络安全合作伙伴开放,解除网络安全限制,主要通过与美国政府合作的 Project Glasswing 项目部署;
- Fable 5:面向公众开放,保留完整安全分类器;
- 未来的生物医药研究计划:面向受信研究机构开放,解除部分生物与化学限制,用于药物研发和科研工作。
本质上,这是一种“同一个模型,不同权限等级”的设计。
Anthropic 表示,这一价格已经不到 Mythos Preview 阶段的一半。
从这里能够明显感觉到,Anthropic 正在走一条非常谨慎的钢丝。一方面,模型能力仍在快速提升;另一方面,开放策略却变得越来越精细化。不同人群、不同领域、不同时间窗口,对应不同的能力边界。
某种意义上,这也是大模型产业逐渐成熟的表现。过去讨论的是“能不能做出来”,现在开始讨论“应该开放给谁,以及开放到什么程度”。
五、从包月时代到分层算力时代
我不太愿意把这件事简单理解成“AI 巨头的收费策略变化”。
如果把时间拉长一点看,会发现 Anthropic 真正面对的问题其实非常简单:当模型能力持续提升时,成本也在同步上升,而这两者未必能够继续被一个固定价格的订阅体系所覆盖。
目前能够确定的事情其实只有几件。
Fable 5 确实是目前最强的 Claude;按量计费会让使用顶级模型开始变成一件需要算账的事情;但与此同时,Anthropic 也明确表示,未来容量足够时仍然会考虑重新纳入订阅套餐。因此,现在就断言“以后最强模型一定全面收费”,其实还为时尚早。
不过我觉得,Fable 5 确实提出了一个越来越重要的问题。
过去两年,AI 行业讨论最多的是:
谁能做出最强的模型?
而从 Fable 5 开始,另一个问题正在变得越来越重要:
当最强模型的成本已经无法被包月订阅轻松覆盖时,我们应该如何使用它?
也许未来的大模型产品会越来越像今天的云计算服务。日常工作交给便宜、稳定、足够好的模型;真正复杂、真正重要的问题,再调用最强的那个。不同能力对应不同成本,不同场景对应不同模型。
如果这个判断成立,那么 Fable 5 的意义可能不仅仅是一款新模型。
它或许正在释放一个信号:
AI 正在从“全民包月时代”,逐步走向“分层算力时代”。
而那张关于 strawberry 的梗图,只是提前把这个问题摆到了所有人面前。
写在最后
顺便分享一件最近在做的事。
我正在和芬兰、新加坡的几位学者一起开展一项关于 Vibe Coding 心流体验 的研究。我们想研究的问题很简单:当人和 AI 一起写代码时,那种“手感特别顺、时间突然消失”的状态,到底由什么决定?
如果你使用过 Claude Code、Cursor、Windsurf、Cline、Roo Code 或其他 AI 编程工具,欢迎花 5–8 分钟填写这份匿名问卷:
https://link.webropol.com/s/vibecodingpjt
填写完成后,在本文评论区附上提交成功截图(带提交时间),即可参与抽奖。我会从有效参与者中抽取 1 位,赠送一本《Claude Code 实战》。
开奖时间:6 月 12 日晚。
问卷仅用于学术研究,数据完全匿名。明显敷衍或无效的问卷会在数据清洗阶段剔除。如果你身边也有在使用 AI 写代码的朋友,也欢迎转发给他们。
数据多一份,结论就稳一分。
感谢支持。
本文首发于微信公众号「彭靖田」,转载请注明出处。