网易首页 > 网易号 > 正文 申请入驻

编程能力从 10% 飙到 70%,Anthropic 新模型却遭遇灵魂拷问:我什么时候才会用它?

0
分享至


作者 | Tina

Anthropic 又发新模型了。

距离 Claude Opus 5.5 发布还不到一周,Anthropic 于 9 月 28 日推出 Claude Sonnet 5.5。这是 Claude 5.5 家族的第二款模型,Haiku 5.5 也将在未来几周内登场。

Anthropic 宣称,新模型的输出速度提升超过 30%,完成多数任务所需的 Token 更少,因此单任务成本最高可降低 30%。

Claude Code 创建者 Boris Cherny 还发布了一段演示,展示 Sonnet 5.5 通过 Claude Code 修复一个 Bug,并配文称:“速度提升 30%,使用量减少 30%。”

不过,Sonnet 5.5 虽然把 Sonnet 这个“中档模型”推到了接近 Opus 的位置,但当推理强度拉到最高,它对 Token 的消耗也达到了一个惊人的水平。

Sonnet 5.5 最明显的升级,就是编程

从 Anthropic 公布的数据看,Sonnet 5.5 的核心提升发生在 Coding Agent 场景。


其中变化最明显的是 Terminal-Bench 4.0。Sonnet 5.5 从上一代的 10.3% 跃升到 70.6%,还超过了 Opus 5.5 公布的最佳成绩。这项测试要求模型在命令行环境中自主使用工具,完成复杂的多步骤任务,考察的已经不只是代码补全能力,而是完整的 Agentic Coding 能力。


CursorBench 更接近日常开发。它使用来自 Cursor 编辑器真实编程会话的任务,包含需求模糊、跨文件修改和理解现有代码库等情况。Sonnet 5.5 在这项测试中得到 55.5%,与 Opus 5.5 的 57.8% 只差约两个百分点。

Anthropic 称,早期测试者最明显的感受,是 Sonnet 5.5 理解代码库的速度更快。它也更倾向于把多个工具调用批量执行,减少模型与终端之间来回交互的次数。对于 Claude Code 这类需要反复搜索、读取、修改、测试和验证的 Coding Agent,减少一步往往意味着同时减少等待时间、Token 消耗和中途出错的机会。

Lovable 的测试提供了一个更具体的观察:Sonnet 5.5 完成编程任务所需的工具调用减少约三分之一,Shell 执行次数大约减半。Base44 在 118 次真实应用构建中发现,Sonnet 5.5 平均经过 3.6 轮迭代完成一个应用,Opus 5 则需要 7.7 轮;新模型的工具调用失败次数也是所有参测模型中最少的。

这些变化比单纯的生成速度更重要。Coding Agent 的成本来自整条执行链:理解代码库、选择文件、调用工具、运行测试、发现错误,再回到代码中继续修改。Sonnet 5.5 的提升主要体现在这条链路变短了。

“单任务最高省 30%”,但有前提

Sonnet 5.5 延续了 Sonnet 5 的价格:每百万输入 Token 2 美元、输出 Token 10 美元、缓存读取 0.2 美元、缓存写入 2.5 美元。


与 Opus 5.5 相比,Sonnet 5.5 的输入、输出和缓存写入价格均低一半,缓存读取价格相同。

但 Artificial Analysis 的测试显示,当推理强度调到 Max 时,Sonnet 5.5 每项 Intelligence Index 任务平均生成约 19.3 万个输出 Token,是该机构测试过的模型中最高的。


这个数字比 Opus 5.5 Max 和 Sonnet 5 Max 高约 60%,约为 GPT-6 Astra Max 的 7 倍。Sonnet 5.5 Max 的单任务成本达到 7.60 美元,比 Sonnet 5 高约 50%。

作为交换,Sonnet 5.5 Max 在 Artificial Analysis Intelligence Index 中得到 56 分,只比 Opus 5.5 Max 低两分。

也就是说,Anthropic 所说的“单任务成本最高降低 30%”针对的是多数任务,并不代表把推理强度调到 Max 后仍然更省。

值得注意的是,Sonnet 5.5 在 FrontierCode 1.1 中使用 Max 设置时得到 46.2%,反而低于 Xhigh 的 52.1%。Anthropic 在脚注中称,Sonnet 5.5 在 Max 设置下更容易触发由多个子 Agent 执行的代码审查。Cognition 检查的两个案例中,出现了超时或任务范围外的额外修改,最终被 FrontierCode 扣分。

谁需要 Sonnet 5.5?

Sonnet 5.5 发布后,一名 Hacker News 用户提出了一个很现实的问题:Opus 5.5 的效率已经很高,即使同时运行两三个会话,Max 5x 套餐的额度也完全足够日常工作。“所以,我想知道自己什么时候才会使用 Sonnet 5.5”。


“至少目前,我自己的工作需求似乎已经快被模型能力完全满足了。当然,我可以把所有请求都调到 Max Effort,单纯为了消耗 Token,但这显然没有意义。”

他的评论点出了 Sonnet 5.5 一个略显尴尬的位置。Claude Max 目前分为每月 100 美元的 5x 套餐和每月 200 美元的 20x 套餐。对已经订阅 Max、日常额度又足够的人来说,Opus 5.5 能处理最难的任务,未必有场景需要我们切换到 Sonnet 5.5。


还有一名 Hacker News 用户问得也很直接:“Opus 5.5 使用 Low 设置时,看起来比 Sonnet Medium 更聪明、更便宜、速度也更快,那 Sonnet 存在的意义是什么?”

另一名用户勉强找出了一个场景:Claude Code 的子 Agent 会继承主 Agent 的 Thinking Level。如果想让不同子 Agent 使用不同强度的推理,就需要换用不同模型,因此他偶尔会选择 Sonnet。但他自己也承认:“这算不上一个特别好的理由,只是我目前唯一会使用 Sonnet 的场景。”

这种困惑也与付费方式有关。Max 用户支付的是固定月费,只要套餐额度还够用,继续使用 Opus 5.5 并不会立刻增加支出,Sonnet 5.5 的低单价自然缺少吸引力。

API 用户面对的情况不同。模型在多轮对话和工具调用过程中产生的输入、输出 Token 都会计入账单,Sonnet 5.5 的输入和输出单价只有 Opus 5.5 的一半。对于需要批量修复 Bug、补充测试、处理 CI 问题或者并行运行多个 Agent 的团队,只要任务边界清晰,Sonnet 5.5 使用 Medium 或 High 设置就能把价格优势真正体现出来。

但把推理强度调到 Max 后,这项优势又很快消失。Artificial Analysis 测得,Sonnet 5.5 Max 的单任务成本达到 7.60 美元,跑 10 个任务就是 76 美元,跑 100 个就是 760 美元。它虽然获得了接近 Opus 的性能,成本也随之进入了另一个区间。

因此,Sonnet 5.5 最清晰的使用场景集中在高频、明确、可验证的 API 任务上。对于 Max 订阅用户,如果 Opus 5.5 已经能在现有额度内完成工作,确实很难找到切换的迫切理由。

更复杂的是,即使开发者选择了 Sonnet 5.5,最终处理请求的也可能是 Sonnet 5。

Sonnet 5.5 是首款加入网络安全分类器和模型回退机制的 Sonnet,其网络安全能力已经接近 Opus 5,因此 Anthropic 为它采用了相同级别的防护措施。

这套检测分为三个阶段:系统首先通过探针读取模型的内部激活状态,随后由运行在 Sonnet 5.5 上的轻量级分类器检查,最后再由一个单独训练的 LLM 分类器决定是否拦截对话。如果请求被判定为高风险网络安全任务,系统可能停止使用 Sonnet 5.5,将请求交给能力较弱的 Sonnet 5。

在 Claude 应用中,用户会看到模型切换提示。API 开发者则需要主动启用服务器端 fallback;启用后,部分因网络安全或前沿模型限制而被拒绝的请求会自动交给 Sonnet 5,没有启用时,请求将直接返回拒绝。

Artificial Analysis 在测试 Sonnet 5.5 的五档推理强度时,均启用了 Anthropic 的默认回退机制。约 0.1% 的 Intelligence Index 任务触发了回退,主要集中在 Terminal-Bench 4.0,所有触发回退的请求最终都由 Sonnet 5 处理。

因此,“选择 Sonnet 5.5”包含了两个问题:它是否比 Opus 更适合当前任务,以及这项请求最终是否真的由 Sonnet 5.5 完成。Artificial Analysis 观察到的回退比例只有约 0.1%,但这个数字仅来自其基准测试,不能代表真实生产环境中的整体回退率。

https://www.anthropic.com/claude-sonnet-5-5

https://artificialanalysis.ai/articles/claude-sonnet-5-5

声明:本文为 InfoQ 编译,不代表平台观点,也不构成投资建议,未经许可禁止转载。

会议推荐

本届大会聚焦 Harness AI 时代的工程实践,从「构建 AI」到「驾驭 AI」,围绕AI Native 架构、Agent Runtime、AI Infra、Agent 安全与可观测、Loop Engineering、具身智能与世界模型等热门技术方向,将邀请 100+ 全球技术社区与产业一线实践者,共同分享 AI Native 时代最具价值的工程经验。限时 9 折优惠立减 680!查看更多详情可扫码或联系票务经理 18514549229 进行咨询。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
财政盈余1.1万亿!阿根廷这“烂车”,真让米莱从沟里开出来了?

财政盈余1.1万亿!阿根廷这“烂车”,真让米莱从沟里开出来了?

超喜欢我
2026-09-29 22:28:09
为什么玻璃是透明的?你以为你知道,其实你根本不知道

为什么玻璃是透明的?你以为你知道,其实你根本不知道

心中的麦田
2026-09-29 20:53:31
金鹰这一夜,24名实力演员争辉,有三大惊喜,三大反差,三大遗憾

金鹰这一夜,24名实力演员争辉,有三大惊喜,三大反差,三大遗憾

小椰的奶奶
2026-09-30 09:39:27
英国外交大臣:绝不会让以色列政府得逞

英国外交大臣:绝不会让以色列政府得逞

澎湃新闻
2026-09-29 22:09:30
小米澎程锁单量大幅下滑,直播当众翻车惹的祸?

小米澎程锁单量大幅下滑,直播当众翻车惹的祸?

汽车有文化
2026-09-30 08:47:07
“密密麻麻,信息量很大!” 西安村民在菜地里挖出800年前大石柱,菜地主人:这些年有人偷偷来这里寻宝过

“密密麻麻,信息量很大!” 西安村民在菜地里挖出800年前大石柱,菜地主人:这些年有人偷偷来这里寻宝过

极目新闻
2026-09-29 21:14:47
星链V3卫星容量增10倍、轨道降至480公里,意味着什么?

星链V3卫星容量增10倍、轨道降至480公里,意味着什么?

粤语音乐喷泉
2026-09-29 13:42:47
小哥带猫误入火把节被抹成黑人,为复仇连去2年,结果…咪一脸命苦:他们都拿我擦手!

小哥带猫误入火把节被抹成黑人,为复仇连去2年,结果…咪一脸命苦:他们都拿我擦手!

铲屎官阿伟
2026-09-29 16:15:10
伊朗革命卫队:波斯湾已无美军舰船

伊朗革命卫队:波斯湾已无美军舰船

新京报
2026-09-29 22:15:11
人民锐评:“连北大也没钱了”?“过紧日子”的账不该这么算

人民锐评:“连北大也没钱了”?“过紧日子”的账不该这么算

澎湃新闻
2026-09-30 08:03:03
金鹰奖名场面!宋佳二封视后于和伟拿视帝,杨紫遗憾陪跑咬牙鼓掌

金鹰奖名场面!宋佳二封视后于和伟拿视帝,杨紫遗憾陪跑咬牙鼓掌

萌神木木
2026-09-29 21:54:52
噩耗接连传来!刘欢刚走没几日,63岁水均益近况曝光令人心生担忧

噩耗接连传来!刘欢刚走没几日,63岁水均益近况曝光令人心生担忧

生命之泉的奥秘
2026-09-29 01:11:59
14票赞成、13票反对,蒋家迁灵案惊险过关;蒋友松自掏腰包,准备把两蒋棺椁送回溪口,蒋万安对此作何反应?

14票赞成、13票反对,蒋家迁灵案惊险过关;蒋友松自掏腰包,准备把两蒋棺椁送回溪口,蒋万安对此作何反应?

人生录
2026-09-28 16:34:25
英法已出兵!巴土也要参战,第二个俄乌战场即将打响,中国出手了

英法已出兵!巴土也要参战,第二个俄乌战场即将打响,中国出手了

兵卒史
2026-09-28 06:11:27
一个奇怪的现象:从人人尊敬到万人嫌弃,谁偷走了工人的社会地位?

一个奇怪的现象:从人人尊敬到万人嫌弃,谁偷走了工人的社会地位?

游文刀
2026-09-30 00:26:59
16年军中大老虎落马:武警上将衔,官至军委副参谋,被儿子拉下马

16年军中大老虎落马:武警上将衔,官至军委副参谋,被儿子拉下马

文史旺旺旺
2024-12-31 21:51:41
“大哥,你不丑”感动百万网友,成都司机回应载盲人乘客破防流泪:他光都看不见,穿着谈吐还这么得体;乘客称父母离世,过节难免伤心

“大哥,你不丑”感动百万网友,成都司机回应载盲人乘客破防流泪:他光都看不见,穿着谈吐还这么得体;乘客称父母离世,过节难免伤心

都市快报橙柿互动
2026-09-30 01:29:25
央视发声,又一女间谍曝光!大量航天机密遭泄露,作案手段太高超

央视发声,又一女间谍曝光!大量航天机密遭泄露,作案手段太高超

少女的烦恼
2026-09-28 22:52:28
卡洛斯自曝损失99%财产,1.33亿英镑家产因家庭纠纷散尽

卡洛斯自曝损失99%财产,1.33亿英镑家产因家庭纠纷散尽

星耀国际足坛
2026-09-27 18:55:57
亚运会0金收官后,王楚钦不再隐瞒,原来他和孙颖莎的处境一样

亚运会0金收官后,王楚钦不再隐瞒,原来他和孙颖莎的处境一样

林子说事
2026-09-30 05:53:19
2026-09-30 11:35:00
InfoQ incentive-icons
InfoQ
有内容的技术社区媒体
13005文章数 52080关注度
往期回顾 全部

科技要闻

OpenAI凌晨大上新!新助手dots迎战Muse

头条要闻

媒体:菲方新海图包含南海多岛 可否把日本列岛也划入

头条要闻

媒体:菲方新海图包含南海多岛 可否把日本列岛也划入

体育要闻

石雨豪:亚运金牌与背后的十年

娱乐要闻

金鹰这夜,演员争辉,有惊喜,反差

财经要闻

中央财政首次贴息房贷 定向支持首套刚需

汽车要闻

5.1米大车跑云南盘山路,海狮08试驾体验超预期

态度原创

本地
旅游
艺术
手机
公开课

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

旅游要闻

人海·微光丨不只面朝黄土 更能仰望星空

艺术要闻

40岁,她改造170㎡复式房送自己:一个人生活也很精彩

手机要闻

阶跃终端STEPX Neo智能体手机获工信部入网许可 将于10月上市

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版