(来源:AI信息Gap)
四天前我说,Claude Opus 4.8 已经在筹备中。
![]()
而今天,就在刚刚,Claude Opus 4.8 就这么,突然,来了。
42 天,一代新模型。
七项基准测试,六项第一。其中编程基准 SWE-Bench Pro Claude Opus 4.8 拿下 69.2%,GPT-5.5 只有 58.6%。
![]()
价格不变,快速模式价格降到了之前的三分之一。
Anthropic 同时发布了「动态工作流」。几百个 AI 同时写代码,互相审阅、挑错。
SWE-Bench Pro,给 AI 一个真实的 GitHub issue,让它自己修复、跑通测试。Claude Opus 4.8 准确率 69.2%,比上一代 Opus 4.7(64.3%)提升近 5 个百分点,甩开 GPT-5.5 超过 10 个百分点。Gemini 3.1 Pro 更是还在后面。
电脑操控基准 OSWorld-Verified,83.4%。AI 像真人一样操控电脑桌面,点击、输入、跨应用操作。GPT-5.5 78.7%,Gemini 3.1 Pro 76.2%。
知识工作评测 GDPval-AA,Claude Opus 4.8 1890 分,这一项提升最大,差距也最大。覆盖 9 大行业 44 个职业的真实任务,比如分析财报、写文献综述。Opus 4.7 1753,GPT-5.5 1769,Gemini 3.1 Pro 1314。
「人类最后一场考试」Humanity's Last Exam(HLE),全球专家出的 2500 道跨学科难题,专治 AI 背答案。不用工具 49.8%,带工具 57.9%,两项都是第一。金融分析 Finance Agent v2,从上市公司年报里抠数字做估值计算,53.9%,还是第一。
Claude Opus 4.8 唯一没拿第一的是终端编程 Terminal-Bench 2.1,测试 AI 在命令行里独立完成复杂工程任务。GPT-5.5 78.2% vs Claude Opus 4.8 74.6%。
「动态工作流」(Dynamic Workflows),和 Claude Opus 4.8 同时发布。
你给 Claude Code 一个超级复杂的任务。它会自己写编排脚本,拆解成子任务,启动几十到几百个 Agent 并行工作。一组 Agent 负责解题,另一组专门挑错、试图推翻结论。反复迭代,直到结果收敛,它再汇总一份验证后的结果交给你。
![]()
以前是一个 AI 帮你写代码。现在是一个 AI 带着几百个 AI 一起写。
进度实时保存。任务中途断了,下次接着来,不用从头开始。
大规模代码迁移、安全审计、「错了代价很高」的关键决策,这些以前按季度规划的工作,现在几天就能完成。
目前「动态工作流」是研究预览阶段,面向 Claude Max、Team、企业和 API 用户开放使用。用的时候,直接让 Claude 创建一个工作流,或者在 effort 菜单里打开 ultracode。
Anthropic 官方提醒,「动态工作流烧的 token 比普通会话多得多。」
功能虽然香,使用还得谨慎啊。
开发者工具 Bun 去年底被 Anthropic 收购。创始人 Jarred Sumner 用「动态工作流」,把 Bun 从 Zig 重写成了 Rust。
75 万行 Rust 代码。花了 11 天。从第一个 commit 到合并进主分支。通过了 99.8% 的原有测试。
Sumner 把重写任务拆分成了几个自动化工作流。几百个 Agent 并行移植代码,每个文件配两个 Agent 审阅。修复循环反复运行构建和测试套件,直到全部通过。合并之后又启动了一个隔夜工作流,自动处理不必要的数据拷贝,每个优化单独开 PR 供人工审阅。
有人问 Sumner,Rust 版是不是也靠 Claude 维护。他说,「已经是了。我们已经好几个月没有自己写代码了。」
Claude Opus 4.8 这次主打一个「诚实」。以前的模型写完代码,有 bug 也不会主动提。Claude Opus 4.8 放过 bug 的概率,降到了 Claude Opus 4.7 的四分之一。
对齐评估的数据也说明了问题。Claude Opus 4.8 的异常行为得分降到了 1.8,与 Claude Mythos Preview 持平。Opus 4.7 是 2.5,Sonnet 4.6 是 2.6。越低越好。
这意味着,这个模型不太会骗你了。
![]()
Claude 官方说,「Claude Opus 4.8 在 Claude Code 里像个编程老手,不用盯,不用催。你把新功能或者 bug 交给它,自己去忙别的就行。长任务也能自动完成。」
Claude Opus 4.8 目前已经全面上线。
Claude 网页端、Claude Code、API 都能用,模型 ID claude-opus-4-8。标准版 API 价格每百万输入 token 5 美元、输出 25 美元,和 Claude Opus 4.7 一样。快速模式 10 美元 / 50 美元,速度快 2.5 倍。
重点来了,Claude Opus 4.8 只是个前菜,后面还有大的。
Anthropic 官宣,「Claude Mythos 级别的模型将在几周内面向所有用户开放。」
![]()
上次爆料我写道,Claude Mythos 1 已经在 Claude 里露过脸了。
现在不只是露脸了。
三个月前,马斯克还在骂 Anthropic「邪恶」。
今天,他回复了一句,「干得漂亮」。
![]()
我是木易,Top2 + 美国 Top10 CS 硕,现在是 AI 产品经理。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.