网易首页 > 网易号 > 正文 申请入驻

编程能力从 10% 飙到 70%,Anthropic 新模型却遭遇灵魂拷问:我什么时候才会用它?

0
分享至


作者 | Tina

Anthropic 又发新模型了。

距离 Claude Opus 5.5 发布还不到一周,Anthropic 于 9 月 28 日推出 Claude Sonnet 5.5。这是 Claude 5.5 家族的第二款模型,Haiku 5.5 也将在未来几周内登场。

Anthropic 宣称,新模型的输出速度提升超过 30%,完成多数任务所需的 Token 更少,因此单任务成本最高可降低 30%。

Claude Code 创建者 Boris Cherny 还发布了一段演示,展示 Sonnet 5.5 通过 Claude Code 修复一个 Bug,并配文称:“速度提升 30%,使用量减少 30%。”

不过,Sonnet 5.5 虽然把 Sonnet 这个“中档模型”推到了接近 Opus 的位置,但当推理强度拉到最高,它对 Token 的消耗也达到了一个惊人的水平。

Sonnet 5.5 最明显的升级,就是编程

从 Anthropic 公布的数据看,Sonnet 5.5 的核心提升发生在 Coding Agent 场景。


其中变化最明显的是 Terminal-Bench 4.0。Sonnet 5.5 从上一代的 10.3% 跃升到 70.6%,还超过了 Opus 5.5 公布的最佳成绩。这项测试要求模型在命令行环境中自主使用工具,完成复杂的多步骤任务,考察的已经不只是代码补全能力,而是完整的 Agentic Coding 能力。


CursorBench 更接近日常开发。它使用来自 Cursor 编辑器真实编程会话的任务,包含需求模糊、跨文件修改和理解现有代码库等情况。Sonnet 5.5 在这项测试中得到 55.5%,与 Opus 5.5 的 57.8% 只差约两个百分点。

Anthropic 称,早期测试者最明显的感受,是 Sonnet 5.5 理解代码库的速度更快。它也更倾向于把多个工具调用批量执行,减少模型与终端之间来回交互的次数。对于 Claude Code 这类需要反复搜索、读取、修改、测试和验证的 Coding Agent,减少一步往往意味着同时减少等待时间、Token 消耗和中途出错的机会。

Lovable 的测试提供了一个更具体的观察:Sonnet 5.5 完成编程任务所需的工具调用减少约三分之一,Shell 执行次数大约减半。Base44 在 118 次真实应用构建中发现,Sonnet 5.5 平均经过 3.6 轮迭代完成一个应用,Opus 5 则需要 7.7 轮;新模型的工具调用失败次数也是所有参测模型中最少的。

这些变化比单纯的生成速度更重要。Coding Agent 的成本来自整条执行链:理解代码库、选择文件、调用工具、运行测试、发现错误,再回到代码中继续修改。Sonnet 5.5 的提升主要体现在这条链路变短了。

“单任务最高省 30%”,但有前提

Sonnet 5.5 延续了 Sonnet 5 的价格:每百万输入 Token 2 美元、输出 Token 10 美元、缓存读取 0.2 美元、缓存写入 2.5 美元。


与 Opus 5.5 相比,Sonnet 5.5 的输入、输出和缓存写入价格均低一半,缓存读取价格相同。

但 Artificial Analysis 的测试显示,当推理强度调到 Max 时,Sonnet 5.5 每项 Intelligence Index 任务平均生成约 19.3 万个输出 Token,是该机构测试过的模型中最高的。


这个数字比 Opus 5.5 Max 和 Sonnet 5 Max 高约 60%,约为 GPT-6 Astra Max 的 7 倍。Sonnet 5.5 Max 的单任务成本达到 7.60 美元,比 Sonnet 5 高约 50%。

作为交换,Sonnet 5.5 Max 在 Artificial Analysis Intelligence Index 中得到 56 分,只比 Opus 5.5 Max 低两分。

也就是说,Anthropic 所说的“单任务成本最高降低 30%”针对的是多数任务,并不代表把推理强度调到 Max 后仍然更省。

值得注意的是,Sonnet 5.5 在 FrontierCode 1.1 中使用 Max 设置时得到 46.2%,反而低于 Xhigh 的 52.1%。Anthropic 在脚注中称,Sonnet 5.5 在 Max 设置下更容易触发由多个子 Agent 执行的代码审查。Cognition 检查的两个案例中,出现了超时或任务范围外的额外修改,最终被 FrontierCode 扣分。

谁需要 Sonnet 5.5?

Sonnet 5.5 发布后,一名 Hacker News 用户提出了一个很现实的问题:Opus 5.5 的效率已经很高,即使同时运行两三个会话,Max 5x 套餐的额度也完全足够日常工作。“所以,我想知道自己什么时候才会使用 Sonnet 5.5”。


“至少目前,我自己的工作需求似乎已经快被模型能力完全满足了。当然,我可以把所有请求都调到 Max Effort,单纯为了消耗 Token,但这显然没有意义。”

他的评论点出了 Sonnet 5.5 一个略显尴尬的位置。Claude Max 目前分为每月 100 美元的 5x 套餐和每月 200 美元的 20x 套餐。对已经订阅 Max、日常额度又足够的人来说,Opus 5.5 能处理最难的任务,未必有场景需要我们切换到 Sonnet 5.5。


还有一名 Hacker News 用户问得也很直接:“Opus 5.5 使用 Low 设置时,看起来比 Sonnet Medium 更聪明、更便宜、速度也更快,那 Sonnet 存在的意义是什么?”

另一名用户勉强找出了一个场景:Claude Code 的子 Agent 会继承主 Agent 的 Thinking Level。如果想让不同子 Agent 使用不同强度的推理,就需要换用不同模型,因此他偶尔会选择 Sonnet。但他自己也承认:“这算不上一个特别好的理由,只是我目前唯一会使用 Sonnet 的场景。”

这种困惑也与付费方式有关。Max 用户支付的是固定月费,只要套餐额度还够用,继续使用 Opus 5.5 并不会立刻增加支出,Sonnet 5.5 的低单价自然缺少吸引力。

API 用户面对的情况不同。模型在多轮对话和工具调用过程中产生的输入、输出 Token 都会计入账单,Sonnet 5.5 的输入和输出单价只有 Opus 5.5 的一半。对于需要批量修复 Bug、补充测试、处理 CI 问题或者并行运行多个 Agent 的团队,只要任务边界清晰,Sonnet 5.5 使用 Medium 或 High 设置就能把价格优势真正体现出来。

但把推理强度调到 Max 后,这项优势又很快消失。Artificial Analysis 测得,Sonnet 5.5 Max 的单任务成本达到 7.60 美元,跑 10 个任务就是 76 美元,跑 100 个就是 760 美元。它虽然获得了接近 Opus 的性能,成本也随之进入了另一个区间。

因此,Sonnet 5.5 最清晰的使用场景集中在高频、明确、可验证的 API 任务上。对于 Max 订阅用户,如果 Opus 5.5 已经能在现有额度内完成工作,确实很难找到切换的迫切理由。

更复杂的是,即使开发者选择了 Sonnet 5.5,最终处理请求的也可能是 Sonnet 5。

Sonnet 5.5 是首款加入网络安全分类器和模型回退机制的 Sonnet,其网络安全能力已经接近 Opus 5,因此 Anthropic 为它采用了相同级别的防护措施。

这套检测分为三个阶段:系统首先通过探针读取模型的内部激活状态,随后由运行在 Sonnet 5.5 上的轻量级分类器检查,最后再由一个单独训练的 LLM 分类器决定是否拦截对话。如果请求被判定为高风险网络安全任务,系统可能停止使用 Sonnet 5.5,将请求交给能力较弱的 Sonnet 5。

在 Claude 应用中,用户会看到模型切换提示。API 开发者则需要主动启用服务器端 fallback;启用后,部分因网络安全或前沿模型限制而被拒绝的请求会自动交给 Sonnet 5,没有启用时,请求将直接返回拒绝。

Artificial Analysis 在测试 Sonnet 5.5 的五档推理强度时,均启用了 Anthropic 的默认回退机制。约 0.1% 的 Intelligence Index 任务触发了回退,主要集中在 Terminal-Bench 4.0,所有触发回退的请求最终都由 Sonnet 5 处理。

因此,“选择 Sonnet 5.5”包含了两个问题:它是否比 Opus 更适合当前任务,以及这项请求最终是否真的由 Sonnet 5.5 完成。Artificial Analysis 观察到的回退比例只有约 0.1%,但这个数字仅来自其基准测试,不能代表真实生产环境中的整体回退率。

https://www.anthropic.com/claude-sonnet-5-5

https://artificialanalysis.ai/articles/claude-sonnet-5-5

声明:本文为 InfoQ 编译,不代表平台观点,也不构成投资建议,未经许可禁止转载。

会议推荐

本届大会聚焦 Harness AI 时代的工程实践,从「构建 AI」到「驾驭 AI」,围绕AI Native 架构、Agent Runtime、AI Infra、Agent 安全与可观测、Loop Engineering、具身智能与世界模型等热门技术方向,将邀请 100+ 全球技术社区与产业一线实践者,共同分享 AI Native 时代最具价值的工程经验。限时 9 折优惠立减 680!查看更多详情可扫码或联系票务经理 18514549229 进行咨询。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
杭州女孩天天坐高铁去上海上班,每天通勤6小时每月花3000元,她算了一笔账……

杭州女孩天天坐高铁去上海上班,每天通勤6小时每月花3000元,她算了一笔账……

都市快报橙柿互动
2026-09-29 16:22:10
中国加大对精英富裕阶层的税收征管力度

中国加大对精英富裕阶层的税收征管力度

风向观察
2026-09-29 11:19:00
日产高管警告:中国车企两三年内将在北美建厂,比亚迪们杀到美国门口

日产高管警告:中国车企两三年内将在北美建厂,比亚迪们杀到美国门口

不掉线电波
2026-09-29 22:53:14
10月1日起房贷贴息1%,最高省5万:现在连财政都开始替你付利息了,可想而知...

10月1日起房贷贴息1%,最高省5万:现在连财政都开始替你付利息了,可想而知...

大何日拱一卒
2026-09-29 22:23:35
香港男星罕见与妻子同框,承认夫妻长期分房睡,婚姻关系名存实亡

香港男星罕见与妻子同框,承认夫妻长期分房睡,婚姻关系名存实亡

东方不败然多多
2026-09-30 09:39:52
40岁纽约时报总监遭7旬华裔岳父母枪杀,案发原因疑为不满女儿外孙遭受家暴,老夫妇轮流开枪,杀人后平静离开现场

40岁纽约时报总监遭7旬华裔岳父母枪杀,案发原因疑为不满女儿外孙遭受家暴,老夫妇轮流开枪,杀人后平静离开现场

大风新闻
2026-09-29 15:50:25
按照党中央部署,29个省份正在开展整省试点

按照党中央部署,29个省份正在开展整省试点

政知新媒体
2026-09-29 22:33:11
恒安集团发布讣告:施文博逝世

恒安集团发布讣告:施文博逝世

政知新媒体
2026-09-30 07:42:30
易会满,受贿数额特别巨大

易会满,受贿数额特别巨大

新京报
2026-09-30 10:18:52
爆料!华人持绿卡入境,被问是否放弃绿卡,拒绝后进“小黑屋”,连钱包夹层都被翻查

爆料!华人持绿卡入境,被问是否放弃绿卡,拒绝后进“小黑屋”,连钱包夹层都被翻查

华人生活网
2026-09-30 02:31:22
赖清德最新民调惊人,国民党在台北全面失守,蒋万安处境很危险?

赖清德最新民调惊人,国民党在台北全面失守,蒋万安处境很危险?

零洛浮华
2026-09-29 13:30:19
全国外卖单量从2亿跌到1.1亿,美团单量断崖式下滑,骑手和商家最先扛不住

全国外卖单量从2亿跌到1.1亿,美团单量断崖式下滑,骑手和商家最先扛不住

帝都观日记
2026-09-29 14:35:08
知名投资人曝刘欢真正死因!大家都猜错了,8月他在餐厅状态不错

知名投资人曝刘欢真正死因!大家都猜错了,8月他在餐厅状态不错

陌冷紫a
2026-09-29 12:59:57
亮瞎了!还得是巴特勒,媒体日又整活了……

亮瞎了!还得是巴特勒,媒体日又整活了……

体育新角度
2026-09-29 16:51:57
张雪称赞“特别漂亮”的浙江老板娘要IPO了,17年前她破格录用这位机车少年

张雪称赞“特别漂亮”的浙江老板娘要IPO了,17年前她破格录用这位机车少年

都市快报橙柿互动
2026-09-30 00:33:17
陈妤颉强势逆转!亚运会混合4×100接力决赛:中国队0.09秒优势夺金

陈妤颉强势逆转!亚运会混合4×100接力决赛:中国队0.09秒优势夺金

全景体育V
2026-09-29 19:56:04
日媒怒批!剑指“二曼”组合,而对日本选手则选择性沉默

日媒怒批!剑指“二曼”组合,而对日本选手则选择性沉默

史海流年号
2026-09-29 22:17:42
北理工裴轶被解聘,她老公换马甲挣外快的事更该严查

北理工裴轶被解聘,她老公换马甲挣外快的事更该严查

历史总在押韵
2026-09-29 21:45:04
金鹰奖成功收官!3人升咖,2人被骂,1人颗粒无收,他最可怜

金鹰奖成功收官!3人升咖,2人被骂,1人颗粒无收,他最可怜

卷史
2026-09-30 00:18:39
刘欢何错之有?

刘欢何错之有?

老唐有话说
2026-09-29 16:20:09
2026-09-30 10:48:49
InfoQ incentive-icons
InfoQ
有内容的技术社区媒体
13005文章数 52080关注度
往期回顾 全部

科技要闻

OpenAI凌晨大上新!新助手dots迎战Muse

头条要闻

媒体:菲方新海图包含南海多岛 可否把日本列岛也划入

头条要闻

媒体:菲方新海图包含南海多岛 可否把日本列岛也划入

体育要闻

石雨豪:亚运金牌与背后的十年

娱乐要闻

金鹰这夜,演员争辉,有惊喜,反差

财经要闻

中央财政首次贴息房贷 定向支持首套刚需

汽车要闻

5.1米大车跑云南盘山路,海狮08试驾体验超预期

态度原创

教育
亲子
本地
家居
公开课

教育要闻

已知∠BEC为60度,求三角形BCE的面积是多少?

亲子要闻

超长长长长蛋挞店的规则~老板也太有爱心啦!

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版