Claude Opus 4.8 发布:更诚实的 AI 和 75 万行代码的真实案例
这次升级的重点不在跑分。
本文尝试做一篇实战派视角的完整解读:包括 Opus 4.7 “翻车”原因,Opus 4.8 新功能、真实落地案例和选型建议。
📌 本文要点(太长不看版)
- 加量不加价:Opus 4.8 与 4.7 同价(每百万 token 输入 5 美元 / 输出 25 美元),但工程可靠性明显更高;
- 最大亮点是"诚实":让自己写的代码缺陷"蒙混过关"的概率约为 4.7 的 1/4,对齐水平逼近最强的 Mythos 预览版;
- 三个新功能:努力程度控制(按需调档、更省额度)、动态工作流(一次性调度数百个并行子代理)、快速模式(2.5 倍速、还便宜了 3 倍);
- 一个炸场案例:有人用动态工作流把 Bun 从 Zig 重写成 Rust——75 万行代码、99.8% 测试通过、11 天从提交到合并;
- “遥遥领先”的跑分:多数基准超过 GPT-5.5 和 Gemini 3.1 Pro,唯独 agentic 终端编码 GPT-5.5 仍领先;
- 文末有我的选型建议,以及 244 页 Claude System Card 的领取方式。
一个神奇的预测
昨天晚上,我和公司同事还在群里日常探讨大模型选型。同事问我最近推荐哪个模型,我果断安利了我一直在高频使用的 Opus 4.6。至于上个月刚发、被寄予厚望的 Opus 4.7?我断言:
“4.7的harness engineering有大bug,回天乏力了,马上4.8也要来了。”

未曾想 5 小时后,Anthropic 真的官方正式发布了 Claude Opus 4.8。
巧合归巧合。今天不展开聊我是怎么"蒙中"的,而是把 Opus 4.8 这次到底更新了什么、好在哪、坑在哪,给大家讲清楚。
这次升级里最戳我的,不是跑分,而是诚实。Anthropic 在一份长达 244 页的 System Card 里摊开了数据:4.8 让自己写的代码缺陷"蒙混过关"的概率,大约只有 4.7 的四分之一;欺骗、配合滥用这类错位行为显著下降,对齐水平已经逼近他们目前最强的 Mythos 预览版。说白了——一个肯说"我不确定"的 AI,比一个永远信誓旦旦的 AI 靠谱得多。
📌 获取完整版 System Card,请 关注公众号,私信「Claude 4.8」
Opus 4.7 到底为什么"翻车"
要理解 Opus 4.8 为什么这么快就来,得先知道 4.7 的问题出在哪。
它的麻烦不在"不够聪明",而在工程可靠性:注释冗长、工具调用不稳定。对只是聊聊天、写写文案的人来说这无所谓;但对跑 agent、做长链路自动化的人来说,工具调用一旦不稳,整条流水线就不可靠——这种结构性问题靠小版本补丁很难修,只能等新版本重训重调。

这不是我一个人的体感。Anthropic 这次发布稿里,做 Devin 的 Cognition、做 Cursor 的 Anysphere 等一线 agent 厂商都直接背了书:他们的原话大意是,4.8 修掉了 4.7 上那些注释冗长、工具调用低效的毛病,工具调用更干净、步数更少、还能把端到端的任务真正跑完。换句话说,4.8 是一次面向"自动化可靠性"的修复式升级,而不是单纯堆跑分。

所以这次发布的关键词,不是"更强",而是"更靠谱"。
Opus 4.8 这次更新了什么
价格先放结论:常规调用和 4.7 完全持平,每百万输入 token 5 美元、输出 25 美元,模型 ID 是 claude-opus-4-8。在涨价是常态的当下,"加量不加价"本身就是个好消息。下面挑几个真正影响日常工作流的点展开。
1. 诚实度:学会说"我不确定"
这是 Anthropic 自己点名的"最显著改进",也是我个人最看重的一点。
AI 最大的坑从来不是"不会",而是不会还装会——明明证据不足,却信誓旦旦说自己搞定了。官方说 4.8 更愿意主动标记不确定、更少给出没有依据的结论;在他们的评估里,让自己写的代码里的缺陷"蒙混过关"的概率,大约只有 4.7 的四分之一。
配套的对齐评估也给了很高的评价:在"支持用户自主、为用户最大利益着想"这类亲社会特质上达到新高,欺骗、配合滥用等错位行为显著低于 4.7,水平接近他们目前对齐最好的 Mythos 预览版。这些细节,写在了一份长达 244 页的 System Card 里。

对生产环境来说,一个肯说"这里我没把握"的模型,比一个永远自信满满的模型安全得多。它离"能托付的审查搭档"又近了一步——注意,是近了一步,不是替代测试和 code review。
2. 努力程度控制(Effort Control)—— 所有人都用得上
这是最接地气的更新。现在在 claude.ai 和 Claude 桌面客户端里,模型选择器旁边多了一个努力程度开关:
- 高努力:思考更频繁、更深入,回答质量更高;
- 低努力:响应更快,而且更省你的额度(rate limit 消耗更慢)。

4.8 默认就是高努力——Anthropic 判断这是质量和体验的最佳平衡点,而且在编码任务上,默认高努力花的 token 和 4.7 的默认档差不多,性能却更好。再往上还有"extra"(在 Claude Code 里叫 xhigh)和"max"两档,官方建议难题和长时间异步任务用"extra"。为配合更高的 token 消耗,Claude Code 里的 rate limit 也相应调高了。全套餐可用,不是企业版专属。
实战建议:日常问答用默认或低努力省额度。
跑复杂重构、长链路 agent 时手动拉满。
这次改进相等于把"算力预算"的控制权交回到了用户手里。
3. 动态工作流(Dynamic Workflows)—— 这次真正的大招
如果说前两个是体验优化,这个就是能力跃迁。目前是研究预览,在 Claude Code 里使用。

先说它到底是什么,因为这点很多报道没讲清楚:动态工作流本质上是一段由 Claude 自己写出来的 JavaScript 编排脚本。你描述任务,Claude 写脚本,一个 runtime 在后台执行它,而你的会话全程保持响应。最关键的设计是——整个计划和中间结果活在脚本变量里,而不是 Claude 的上下文窗口里,只有最终答案才回到你的会话。这正是它和普通 subagents、skills 的本质区别:上下文不会被几百个子任务撑爆。
它怎么跑:Claude 把任务拆成子任务,并行派发给一群子代理,让它们从不同角度进攻同一个问题;然后再让另一批代理去反驳、证伪前面的结论,反复迭代直到答案收敛,验证通过才并入结果。这是一种内置的"对抗式审查"。

几个硬限制值得记住:单次运行最多 16 个并发代理、累计上限 1000 个代理;编排脚本本身碰不了文件系统和 shell,只有代理能读写、执行命令;进度会随时保存,任务中断后能在同一会话里续跑。要触发它,可以在 prompt 里带上 workflow 这个词,或者打开 ultracode(= xhigh 努力 + 自动编排),Claude Code 还内置了一个 /deep-research 工作流。需要 Claude Code v2.1.154 及以上,CLI、桌面端、VS Code 插件都能用,Max / Team / Enterprise 套餐开放(Max 和 Team 默认开启,Enterprise 要管理员手动启用)。
官方给的标杆例子很离谱:可以完成跨数十万行代码的代码库级迁移,从启动到合并,拿现有测试套件当验收标准。这个案例我放到第四部分细讲。
4. 快速模式:同样的 Opus,快 2.5 倍,便宜 3 倍
需要先澄清一个误解:快速模式不是另一个更弱的模型,它是 Opus 的高速运行配置,智能水平完全不变,只是输出 token 速度快 2.5 倍。在 Claude Code 里用 /fast 开关切换,激活时会有个 ↯ 小图标。
价格是这次的一大亮点:4.7 和 4.6 的快速模式要 30/150 美元每百万 token,4.8 直接便宜了三倍(约 10/50 美元)。注意它走的是账户里的 usage credits,不占套餐内的常规额度,适合快速迭代和实时调试;长时间自动跑、对成本敏感的任务,还是用标准模式更划算。
5. 给开发者:Messages API 支持中途插 system
一个不起眼但很香的更新:现在可以在 messages 数组里插入 system 条目(紧跟在一轮用户消息之后,有放置规则限制),从而在任务进行中动态更新 Claude 的指令,而不破坏 prompt 缓存、也不用伪装成一轮用户对话。对长时间运行的 agent 来说,这意味着可以在代理运行过程中动态调整权限、token 预算、环境上下文。做框架的人会懂这有多省心。
6. 一些容易被忽略的规格
4.8 默认支持 100 万 token 上下文窗口(Claude API、Amazon Bedrock、Vertex AI;Microsoft Foundry 上是 20 万),最大输出 12.8 万 token,自适应思考(会根据任务难度自动决定花多少"脑力"),可缓存 prompt 的最低门槛也降到了 1024 token。跑分上,官方称 4.8 在多数基准超过 4.7、GPT-5.5 和 Gemini 3.1 Pro——唯一的例外是 agentic 终端编码,GPT-5.5 仍然领先;在计算机操作(Online-Mind2Web)上拿到 84%,相比 4.7 和 GPT-5.5 是个明显的跳跃。

大家用Opus 4.8 做了什么
发布一天,已经有不少真实战报。挑两个最有信息量的。
案例一:用动态工作流,把 Bun 从 Zig 重写成 Rust
这是 Anthropic 重点拎出来的案例,主角是 Bun 的作者 Jarred Sumner。他用动态工作流,把 Bun 这个 JavaScript 运行时从 Zig 整体移植到了 Rust。一组数字感受一下:
- 产出约 75 万行 Rust 代码;
- 通过了现有测试套件的 99.8%;
- 从第一次提交到合并,总共 11 天。
过程很能说明动态工作流的玩法:先用一个工作流给每个结构体字段推导出正确的 Rust 生命周期;下一个工作流再把每个 .rs 文件写成行为等价的移植版本;数百个代理并行干活,每个文件配两个审查代理,最后一个修复循环不断驱动编译和测试,直到全绿。
需要泼一盆冷静的水:这个结果目前还没进生产。但它清晰地展示了一件事——AI 写代码,正在从"帮你写一个函数",走向"你当甲方,它当包工头,自己管理一整个由几百个子代理组成的工地"。这是范式层面的变化。
案例二:早期实测——它强在哪,又卡在哪
光看官方和大案例容易上头,所以我特意找了拿到早期访问权限的独立测评者的反馈,更接近真实手感:
- 强在:从零起步的原型、一次成型的新功能、快速执行——这类"绿地"任务,4.8 又快又利落;
- 卡在:最后那 10% 的打磨、已有大型代码库里的边界情况,以及偶尔的幻觉;
- 有意思的是,有测评者表示,在数据密集的战略和路线图类工作上,他目前还是更倾向于用 4.7。
这和 Anthropic 自己的定调其实一致:这是一次"温和但实在"的升级,不是颠覆。它把可靠性、诚实度、长任务的协调能力往上推了一截,但该测的还得测,该审的还得审。
我的实战建议
如果你问我现在该怎么选:
- 日常和重度 agent 工作流:直接上 Opus 4.8。工具调用更稳、更诚实,是目前最值得迁过去的版本;
- 预算敏感的批量任务:标准模式 + 低努力档;要快速迭代、实时调试,再开快速模式;
- 大型代码迁移 / 代码库级重构:重点研究动态工作流,这是这次最被低估、也最有想象空间的能力;
- 数据密集的深度分析:可以新旧版本对照着用,别盲目全切。
一句话总结这次发布:这一代的竞争,正在从"谁更聪明"转向"谁更靠谱、更敢承认自己不知道"。 对真正把 AI 用在生产里的人来说,后者其实更重要。
你现在主力在用哪个版本?4.8 上手后有没有踩到什么坑?评论区聊聊。
本文首发于微信公众号「彭靖田」,转载请注明出处。
