就在刚刚,OpenAI 与 Anthropic 几乎同时推出新模型:OpenAI 推出 GPT-6 Sol 与 GPT-6 Luna;Anthropic 则发布性能直逼 Fable 5.1 的 Claude Opus 5.5。
OpenAI 表示,GPT-6 Sol 与 GPT-6 Luna 脱胎于此前顶级的 GPT-6 Astra 底座,重点是将 Astra 的核心推理与多模态优势下放,重构出更轻量、吞吐量更高的运行版本。也就是说,GPT-6 Astra 承担的是能力探索角色,而 Sol 和 Luna 则承担能力规模化应用的任务。
![]()
价格方面则直接「腰斩」,与 GPT-5.6 的促销价相比,Sol 与 Luna 的价格直接降低了 50%。
随后,Sam Altman 在社交平台发文,强调这是 OpenAI 推动「智能普及化」的必经之路 —— 让开发者不再受制于昂贵的算力账单。
「尤其是按照单任务成本(per-task pricing)来比较 —— 而这才是我们认为真正应该关注的指标 —— 我认为目前市场上没有任何产品具备真正的竞争力。
我们希望人们能够大量使用 AI,因为这对于探索眼前这场新的「文艺复兴」非常重要。只有让更多人能够广泛使用 AI,才能真正释放这一轮技术变革带来的可能性。」
![]()
而 Anthropic 拿出的则是 Claude Opus 5.5。
![]()
作为 Claude 系列中的高性能模型,Opus 5.5 延续了 Anthropic 在复杂任务、代码生成和企业工作流领域的重点布局。
Anthropic 表示,相比 Opus 5,Opus 5.5 在典型任务中的成本降低约 40%,输出速度提升超过 30%。
下面具体来看一下。
OpenAI 发布 GPT-6 Sol、Luna:
将 Astra 能力推向规模化应用、价格「腰斩」
OpenAI 表示,本月早些时候推出了 GPT-6 Astra,这是全球最智能、对齐程度最高的模型,但考虑现实中的工作存在不同规模、不同节奏以及不同预算需求。因此推出 GPT-6 Sol 和 GPT-6 Luna。
如果说,GPT-6 Astra 开启了新一代智能模型,而这两个模型则通过提升成本效率,让更多人能够获得这种智能能力。
OpenAI 认为,模型能力提升固然重要,但单位任务成本同样成为企业部署 AI 时的重要考量。因此此次重点优化了缓存机制和推理效率,并将节省的成本反馈给用户。
- 博客链接:https://openai.com/index/introducing-gpt-6-sol-and-luna/
相较于 GPT-5.6,GPT-6 Sol 和 Luna 的 API 价格降低了 50%。
- GPT-6 Sol:输入价格从每百万 token 4 美元降低到 2 美元;输出价格从每百万 token 20 美元降低到 10 美元。
- GPT-6 Luna:输入价格从每百万 token 0.20 美元降低到 0.10 美元;输出价格从每百万 token 1.20 美元降低到 0.50 美元。
![]()
价格下来了,但性能依旧能打。
在 AutomationBench 测试中(该测试评估跨应用的企业工作流),GPT-6 Sol 在最高推理强度(xhigh effort)下超过了 Claude Opus 5 的最高强度表现,而每个任务成本仅为 Opus 5 的 9%。
而在高推理强度下,GPT-6 Luna 相比上一代模型提升了 5.4 个百分点,同时每个任务成本降低 58%。
![]()
同时,GPT-6 Sol 也以更低成本超过 Claude Fable 5.1,同时甚至超过了低推理强度下的 GPT-6 Astra。
![]()
而在内部事实准确性测试中,该测试基于经过匿名处理的真实用户对话(用户曾标记模型错误),GPT-6 Sol 的错误数量约为上一代模型的一半,接近 Astra 级别的可靠性,同时成本更低。
GPT-6 Luna 也取得明显提升:在更高推理强度下,它能够以约百分之一的成本达到 GPT-5.6 Sol 的水平。
![]()
另一个重要变化则出现在软件开发领域,随着 Coding Agent 开始承担越来越复杂的任务,持续运行成本成为开发团队的重要考量。
编程能力上,OpenAI 表示 GPT-6 Sol 和 Luna 在保持强大代码能力的同时,通过更低 API 价格,让开发者拥有更多试验空间,也让团队能够更加大胆地使用 Codex 执行复杂任务。
在 FrontierCode 测试中,GPT-6 Sol 相比 GPT-5.6 Sol 有明显提升,并以更低成本达到 Claude Fable 5.1 xhigh 的水平。
![]()
在 DeepSWE v1.1 测试中:GPT-6 Sol 在最高推理强度下获得 68.8% 分数,仅比 Claude Fable 5 的最高成绩 69.9% 低 1.1 个百分点。但 GPT-6 Sol 每个任务成本降低约 80%。GPT-6 Luna 在最高推理强度下获得 66.6%,接近 Claude Opus 5 和 Fable 5 的中等推理强度表现。
在这些比较中:Luna 相比 Opus 5,每任务成本降低 93%;相比 Fable 5,每任务成本降低 96%。
这或许是在说明 OpenAI 的目标并不是简单制造一个更强模型,而是在寻找单位智能成本最低的模型。
![]()
计算机操作能力上,GPT-6 Sol 和 Luna 相比上一代模型提供了更高成本效率。
在 OSWorld 2.0 offline 测试中,GPT-6 Sol 在最高推理强度下达到与 Claude Opus 5 中等推理强度相近的成绩:
- GPT-6 Sol:60.5%
- Claude Opus 5:60.3%
但 GPT-6 Sol 每任务成本降低约 80%,GPT-6 Luna(max)则能够超过 GPT-5.6 Sol(medium),同时成本仅为其十分之一。
![]()
而除了模型价格下降,OpenAI 还针对 Agent 长任务场景优化了缓存机制,改进了 GPT-6 的 Prompt Caching,使默认缓存命中率更高,从而帮助 Agent 复用更多上下文、更快响应、对缓存输入 token 读取享受 90% 折扣。
这意味着,未来模型竞争不仅是模型本身的能力竞争,也包括整个推理基础设施效率竞争。
Anthropic:Opus 5.5 来了,Fable 级能力
OpenAI 发布的另一边,Anthropic 这次同样非常强调「效率」。
Claude Opus 5.5 是 Claude 5.5 系列的第一款模型。Anthropic 给它的定位非常直接:大多数任务达到 Claude Fable 5.1 的水平,但相比 Opus 5,典型任务运行成本降低约 40%,输出速度则提高超过 30%。
- 博客链接:https://www.anthropic.com/claude-opus-5-5/
先看能力。
在 Anthropic 公布的 headline comparison table 中,Opus 5.5 在列出的项目上全部高于 Fable 5.1。
Terminal-Bench 4.0 上,Opus 5.5 达到 66.4%,Fable 5.1 为 55.8%;FrontierCode v1.1 Main 为 54.4% 对 50.3%;面向真实知识工作的 GDPval-AA v2.1,则是 1846 对 1735。
Agentic coding、知识工作、计算机操作,基本都是这代 Opus 主要的能力提升方向。Anthropic 官方发布也将其称为相比 Opus 5 的一次明显升级。
![]()
这当然不意味着「Opus 5.5 已经全面超过 Fable 5.1」。不同 benchmark 使用的 harness、工具和推理强度并不完全一致;就在 Anthropic 自己的表格中,GPT-6 Astra 也仍然在 AutomationBench 和 Terminal-Bench-Science 等项目保持更高成绩。
但能明显看到,Opus 和 Fable 之间原本清晰的能力差距,正在迅速缩小。
而从 API 定价来看就更明白 Anthropic 的意思了。
Opus 5.5 每百万输入、输出 Token 分别为 4 美元和 20 美元,而 Fable 5.1 为 10 美元和 50 美元,后者正好是前者的 2.5 倍。两者都拥有 100 万 Token 上下文窗口和最高 128K 的常规输出能力。
![]()
所以这次 Anthropic 没有把 Opus 5.5 描述成一次简单的「性能升级」,而一直在强调单位任务成本。
不再让 Opus「拼命想」
还有一个设置挺有意思。Opus 5.5 的 Adaptive Thinking 永远开启,开发者可以调节推理强度,默认设为 medium;相比之下,Fable 5.1 默认是 high。
这和 Anthropic 公布的一组数据正好对应:在 FrontierCode v1.1 Main 上,Opus 5.5 medium 得分约 54.6%,单任务成本约 0.8 美元;到了 max,成本升至约 6.19 美元,得分反而只有 54.4%。
也就是说,多花近 7.7 倍的钱,并没有换来更高分数。
![]()
原因之一在于 FrontierCode 会惩罚超出任务范围的修改,即使这些改动本身有益。推理预算提高后,模型反而可能多做一些无用功,因此更多 test-time compute 并不一定带来更好的任务结果。
第三方的实际测试验证了这个说法。CodeRabbit 在自己的多步骤 Code Review 工作流中发现,Opus 5.5 medium 已经可以达到或超过 Opus 5 high 的表现,同时只使用大约一半的 Token。
Token 只便宜 20%,为什么任务能便宜 40%?
Anthropic 给出的解释是,单个 Token 的价格并不能直接代表最终任务成本。
Opus 5.5 相比 Opus 5,普通输入、输出 Token 价格只下降约 20%,但 Cache Read 从每百万 Token 0.50 美元降到 0.20 美元,降幅达到 60%。对于 Claude Code 这类需要反复读取代码和历史上下文的长任务,缓存降价会被持续放大。
再加上 Opus 5.5 完成同一任务所需的 Token 和步骤更少,Anthropic 测得默认设置下,典型任务的总成本最终可降低约 40%。
「每百万 Token 多少钱」不适合单独计算,更合理的方式是放到实际任务中,看看真正做完要花多少钱。
这和 OpenAI 这轮发布的思路,惊人地一致。
能力之外,价格当然很重要
把两家放在一起看,这轮发布好像都很在意一个问题,那就是用户到底愿意为提升的那部分智能付多少钱。
OpenAI 在 7 月底发布过一篇博客,《Building abundant intelligence》。文中提到,客户真正购买的并不是 Token,而是「任务被完成」。因此更合理的衡量方式,应该是一次成功结果的总成本,其中还要算上重试、人工监督、时间和错误带来的代价。
- 博客链接:https://openai.com/index/building-abundant-intelligence
换句话说,就是「最后事情做完花多少钱」比 Token 计费更贴近用户心理。
Anthropic 这边,其实已经从企业用户那里收到过一次很直接的价格反馈。
Fable 5 发布后,Ramp 对企业模型支出的追踪显示,这款 Anthropic 当时最贵、能力最强的模型,只占 Anthropic 企业 Token 使用量约 6%。Ramp 将其视为一个价格上限信号,企业并不会因为模型更强,就无限接受更高价格。
随后 Fable 5.1 就做了一些调整。Anthropic 在发布时明确说,新版本是在回应客户对价格、数据留存和安全措施的反馈;虽然输入和输出标价没有下降,但 Cache Read 直接降了 75%,使典型工作负载成本下降约 25%,高度 Agentic 任务最高可降约 45%。
更有意思的是,Anthropic 自己的开发者文档甚至建议:大多数任务先从 Opus 5 开始,只有高 effort 的 Opus 仍然不够时,再考虑 Fable 5.1。
连官方都承认,旗舰模型已经不再是默认选项,而更像是专门留给高难度、长周期任务的昂贵资源。
市场已经开始告诉厂商,仅仅把最强模型继续做强,并不足以让企业持续升级。
当日常任务用 Opus 就已经够好,企业为什么还要支付 Fable 的价格?当 Luna 已经能覆盖越来越多正式工作,为什么每一步都要调用 Astra?
这可能也是两家公司现在共同面对的问题,前沿能力当然还要继续往上发展,但真正想扩大企业使用规模,还是要结合价格来看。
就在 Opus 5.5 发布前三天,路透报道称,Anthropic 正考虑推出新模型,应对 GPT-6 Astra 在企业市场快速获得份额。
OpenAI 和 Anthropic 的这场竞争,恐怕还远没有到休息的时候。
这次两边的发布公告只相差一个小时,甚至有消息称,Fable 5.5 将在 OpenAI 的 DevDay 当天亮相。
而 OpenAI 和 Anthropic 此次的相似操作,似乎也是释放出一个共同信号:AI 正从能力突破阶段进入规模化应用阶段,未来,真正决定 AI 普及速度的,不只是模型 IQ,而是单位任务成本。下一阶段的大模型战争,或许不再只是争夺最高智能峰值,而是谁能够让智能,以最低成本持续创造价值。
对此,广大网友们也是喜闻乐见大家「打起来」。
「我希望它们彼此竞争,最终把智能的价格打到低得离谱。」
![]()
那么你呢,如何看待?欢迎在评论区留言、交流!
参考链接:
https://x.com/OpenAI/status/2102460975790137662
https://x.com/i/trending/2102466579913138274
https://x.com/sama/status/2102465143997440308
https://www.anthropic.com/claude-opus-5-5
https://x.com/claudeai/status/2102435511222890900
https://x.com/theojaffee/status/2102454423041818786
https://x.com/FanShifu/status/2102441095066165440
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.