网易首页 > 网易号 > 正文 申请入驻

Claude Sonnet 5.5深夜空降!一半价格击败Opus,开发者实测账单暴涨

0
分享至


智东西
作者 程茜
编辑 心缘

智东西9月29日消息,今日凌晨,Anthropic发布Claude 5.5系列第二款模型Claude Sonnet 5.5,主打快速、高性价比。

Anthropic在博客中透露,相比Claude Sonnet 5,新模型速度提升超30%,成本降低近30%,更擅长处理日常任务,如修复错误、创建文档、制作幻灯片和电子表格等。


先来看几项关键指标,Sonnet 5.5在多项指标中可对标Opus 5.5,相比Sonnet 5有数倍提升。Anthropic称,这是首个仅通过截图就能赢得《口袋妖怪红》游戏的Sonnet模型。在Artificial Analysis上,Sonnet 5.5在AI分析指数上得分为56,仅次于Opus 5.5的58分,该榜单上,Claude系列模型包揽前三席。


价格方面,Claude Sonnet 5.5定价与上一代相同,即每百万输入token 2美元,每百万输出token 10美元,每百万token的缓存读取操作需0.20美元。不过,其博客提到,模型在实际完成任务时,单任务成本比Claude Sonnet 5要低30%。


官方放出的案例显示,Sonnet 5.5复原魔方时仅花费10秒、0.11美元就完成任务。


Artificial Analysis的榜单显示,Sonnet 5.5单任务输出token数量更多,其单任务成本为7.60美元,比Sonnet 5的单任务成本高出约50%,接近于Opus 5.5的7.63美元。


不少开发者实测发现,Sonnet 5.5的成本非常高,“建议坚持使用Opus 5.5”。


Claude Sonnet 5.5现已在全平台上线,包括AWS、谷歌云以及微软Azure。开发者可在Claude 平台通过模型标识符claude-sonnet-5-5接入使用。 如果原先在Sonnet模型上关闭思考功能,迁移至Sonnet 5.5前,需要切换至新的between_tools参数配置,该配置可保持前置思考功能处于关闭状态。

Anthropic还透露,其专为高并发和成本敏感的应用而设计的Claude Haiku 5.5,将在未来几周发布。

一、数位开发者实测对比,效果惊艳但烧不起,一款射击游戏花费上千元

不少开发者实测对比了Sonnet 5和Sonnet 5.5,两代模型之间的性能提升幅度肉眼可见。

官方案例,知名开发者@_re_pete对比了Sonnet 5和Sonnet 5.5生成落叶模拟器的效果。可以看出,Sonnet 5.5的落叶飘落效果更自然,整体画面更和谐。


在不到一分钟内,开发者@kevin_t_ngo让Sonnet 5.5通过JavaScript动画展示了恐龙的历史,其还对比了Sonnet 5和Sonnet 5.5的生成结果。Sonnet 5.5生成的动画主题形象明确,还能添加配套文字,生成带叙事感的完整插画。


另一开发者对比了Sonnet 5.5与GPT-6 Sol、GPT-6 Astra的效果,其与GPT-6 Astra的差距并不大。Sonnet 5.5、GPT-6 Astra在生成骑自行车动作时没有出现太大瑕疵。


不过效果惊艳背后,用户实测发现Sonnet 5.5的成本并不低。

BridgeMind使用Sonnet 5.5制作了一款射击游戏,它称新模型表现机器出色,生成的游戏堪称神作,但构建成本要达到177美元(约合人民币1187元),耗时49分钟完成。


在下面开发者制作的城市模拟器案例中,Sonnet 5.5的效果明显比Sonnet 5更好,Sonnet 5.5的输出token数量为38万,花费了9.23美元,Sonnet 5为12万,花费4.85美元。


另一开发者使用Sonnet 5.5制作了一个果酱西瓜浏览器动画,最终预计的API使用成本约为8.20美元,其中代码与推理2.80美元、缓存上下文数据3.6美元、缓存写入操作1.8美元、常规输入token 0.02美元,其中2/3的资源都被用于处理上下文相关任务。


二、多项测试可对标Opus 5.5,Anthropic建议开发者调节档位降成本

从Anthropic发布的基准测试来看,Sonnet 5.5在多项指标中已经超越其性能更高的Opus 5.5模型。

具体来看,该基准测试对比了Sonnet 5.5、Sonnet 5、Opus 5.5、GPT-6 Sol四大模型在智能体编程、知识工作、多学科推理、电脑操作、图表识别等方面的性能。

和上代Sonnet 5对比,Sonnet 5.5在编程、图表识别上的分数提升了数倍;和GPT-6 Sol对比,Sonnet 5.5在智能体编程、知识工作、图表识别上都更优;Sonnet 5.5在主动编程领域上的分数甚至超过Claude Opus 5.5,其他几项与之相当。

下图是各模型在不同投入等级下的得分与单任务成本的对比曲线,数据点越靠近图表左上角,代表每花费一美元所能获得的模型能力越强。


在多项基准测试中,低/中等投入档位下的Sonnet 5.5能超越Sonnet 5的最高得分,而单任务成本仅为后者的约十分之一。 Sonnet 5.5在较低投入档位运行时,单任务成本更低,与Opus 5.5形成互补;拉高投入档位后,它可以达到接近Opus的性能,同时成本处于相近水平。


编程是Sonnet 5.5性能提升的一个突出场景。在智能体编程基准FrontierCode的高投入档位下,它的得分比同档位Sonnet 5高出10分左右,单任务成本仅约后者的1/15。

CursorBench基于Cursor真实编程会话任务开展测试,在该基准上,Sonnet 5.5的最高分与Opus 5.5差距仅约2分。

很多早期测试者称,在直接对比测试中,Sonnet 5.5能够将工具调用合并在一起,从而减少操作步骤、降低成本。

Sonnet 5.5在多项知识工作任务上均取得性能提升。GDPval-AA基准覆盖44个职业、9大行业的真实业务任务,在该测试中,Sonnet 5.5得分与Opus 5.5几乎持平,相比Sonnet 5高出约400分。在电脑操作与图表识别能力上,它的表现也十分接近Opus 5.5;而在长周期知识工作场景,其性能明显优于Sonnet 5和GPT-6 Sol。

价格方面,开发者调整投入档位,可在成本、响应速度与任务整体质量之间做权衡。在Claude Code以及Anthropic官方应用中,默认投入档位为中等(Medium);开发者平台Claude Platform默认档位为高(High)。

Anthropic官方称,档位较低时,Claude响应更快、消耗Token更少,适合常规事务处理;档位调高后,Claude会进行更长时间的推理,并对输出结果做更全面的自检核验。

三、大多数对齐性指标,与Sonnet 5相当

在其自动化行为审计中,Sonnet 5.5在大多数对齐性指标上均优于或达到与Sonnet 5相同的水平。由于其网络安全能力与Opus 5相当,因此它是首个具备网络安全防护措施和回退机制的Sonnet模型。其生物学安全防护机制与Sonnet 5相同。这两种安全防护机制都针对的是少数高风险操作;常规的软件开发和大多数生命科学领域的操作并未受到影响。

Anthropic研究人员在博客中透露,Sonnet 5.5并未突破其模型能力的前沿上限,因此他们将模型的对齐评估,聚焦于一组适用于所有能力等级模型的特定风险,包括损害用户利益、误导用户,以及被用于高风险恶意场景时产生协同危害。

研究人员开展自动化行为审计,在约1850个场景下对Claude进行测试。

结果显示,在对齐性、抗滥用能力与诚实度的大部分指标上,Sonnet 5.5相比Sonnet 5均有提升或持平。 在其新推出的隔离防护评估中,Sonnet 5.5尝试突破沙箱的概率接近本次测试中表现最优的Opus 5.5;并且在所有Anthropic模型里,它去试探容器防护边界的概率最低。他们没有发现Sonnet 5.5会去执行与用户意图相冲突的目标。

网络安全方面,Sonnet 5.5的网络安全相关能力相对Sonnet 5有提升,因此研究人员为其部署了与Opus 5.5相近的安全防护机制。用户仍然可以在常规软件开发流程中,利用模型查找并修复代码漏洞;但高风险网络安全任务会自动降级回Sonnet 5处理。

Sonnet 5.5沿用与Sonnet 5相同的生物相关安全防护机制。该防护体系针对有害请求;绝大多数科研、教育以及临床工作不受影响,但部分微生物学与病毒学相关请求可能出现误拦截。

在模型蒸馏防护方面,Sonnet 5.5是首款内置安全分类器以抵御推理提取攻击的Sonnet系列模型,并扩展了保留思考链路(preserved thinking)机制:Claude的推理思考过程无法脱离生成该内容的账号单独剥离。

此外,Claude Sonnet 5.5版本也提供了不保存任何数据功能的版本。

结语:Claude中端主力模型性能暴涨,但成本是个坎

Sonnet 5.5的升级,标志着Anthropic的主力中端大模型正在快速收窄与旗舰模型之间的能力差距。这或许会改变企业落地大模型的选型思路,不必一味追求最高规格旗舰,可采用主力模型承担绝大多数常规任务、旗舰模型仅处理高难度复杂任务的分层调用架构,在能力与成本之间找到更优平衡点。

不过综合开发者的实测结果来看,Sonnet 5.5在成本端并未实现大幅缩减。一旦面对复杂Agent任务,用户往往需要拉高投入等级来换取足够性能,此时单任务开销会明显抬升。

来源:Anthropic、X

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
傅园慧当老师两年直呼有寒暑假太香!被问假期还游泳吗,她脱口而出:绝对不会

傅园慧当老师两年直呼有寒暑假太香!被问假期还游泳吗,她脱口而出:绝对不会

阿废冷眼观察所
2026-09-29 04:37:35
真不愧是“化痰冠军”!才喝两回,痰根拔掉,润喉又顺畅

真不愧是“化痰冠军”!才喝两回,痰根拔掉,润喉又顺畅

健身狂人
2026-09-29 11:56:58
一大叔买了100多克黄金,价值12万,称“给儿子结婚用”,儿子一脸懵:我怎么不知道要结婚?随后,民警的一个电话揭开了惊天秘密

一大叔买了100多克黄金,价值12万,称“给儿子结婚用”,儿子一脸懵:我怎么不知道要结婚?随后,民警的一个电话揭开了惊天秘密

背包旅行
2026-09-27 11:14:51
亚运收官女篮开启留洋潮,5人奔赴海外,张子宇留守山东打磨

亚运收官女篮开启留洋潮,5人奔赴海外,张子宇留守山东打磨

涵有话说
2026-09-29 09:29:59
这10个草书我盯了半晌,愣是没认全!您能一眼读出的,算我服!另外问一句:写大字时,行距是压紧显气势,还是拉开更见格局?

这10个草书我盯了半晌,愣是没认全!您能一眼读出的,算我服!另外问一句:写大字时,行距是压紧显气势,还是拉开更见格局?

书画相约
2026-09-29 16:32:47
申长雨卸任国家知识产权局局长

申长雨卸任国家知识产权局局长

知产库
2026-09-29 16:43:02
王曼昱为何掀翻孙颖莎?日媒赛后说出内情,估计和你想的不一样!

王曼昱为何掀翻孙颖莎?日媒赛后说出内情,估计和你想的不一样!

阿伧说事
2026-09-29 06:41:41
市场监管总局发布13项食品快检方法,可查18种风险物质

市场监管总局发布13项食品快检方法,可查18种风险物质

澎湃新闻
2026-09-28 17:46:26
已售超70万份,鲍师傅60厘米超长蛋挞被吐槽“全是皮没蛋液”,客服:将优化产品

已售超70万份,鲍师傅60厘米超长蛋挞被吐槽“全是皮没蛋液”,客服:将优化产品

齐鲁壹点
2026-09-29 07:05:12
8000万切尔西天才彻底陨落,赛季0球0助跌下神坛状态断崖式下滑!

8000万切尔西天才彻底陨落,赛季0球0助跌下神坛状态断崖式下滑!

看我说体育
2026-09-29 08:17:50
官宣开赛阶段报销!隐瞒伤情?伦纳德的交易裂开了!

官宣开赛阶段报销!隐瞒伤情?伦纳德的交易裂开了!

贵圈真乱
2026-09-29 10:33:03
白宫前秘书莱维特躺在床上开启直播,观众人数竟瞬间碾压特朗普!

白宫前秘书莱维特躺在床上开启直播,观众人数竟瞬间碾压特朗普!

最美的巧合
2026-09-29 13:35:33
笑麻了!原来医生才是最懂“双标”的,网友:脱了白大褂也是老百姓

笑麻了!原来医生才是最懂“双标”的,网友:脱了白大褂也是老百姓

周哥一影视
2026-09-28 02:17:07
日本想洗白侵略历史?中美一记耳光教其做人

日本想洗白侵略历史?中美一记耳光教其做人

燕梳楼频道
2026-09-28 21:24:26
汶颂第四棒超级位移热血生吃小池祐贵 韩国被判犯规!泰国递补摘铜

汶颂第四棒超级位移热血生吃小池祐贵 韩国被判犯规!泰国递补摘铜

劲爆体坛
2026-09-28 23:27:22
大婶怒骂拒让座女子,10天后孙女保研资格公布,导师到访她哭求挽回

大婶怒骂拒让座女子,10天后孙女保研资格公布,导师到访她哭求挽回

罪案洞察者
2025-08-26 11:40:36
热议!女孩从浙江返乡,相亲12次全被拒,只因一句工作经历太心酸

热议!女孩从浙江返乡,相亲12次全被拒,只因一句工作经历太心酸

四海神君
2026-09-27 07:00:08
威少澳门度假,吃路边摊,逛服装店,退役享受生活,十分接地气

威少澳门度假,吃路边摊,逛服装店,退役享受生活,十分接地气

大西体育
2026-09-29 15:31:59
“神药壮阳”都是骗,真正能壮阳治阳痿的只有一种药

“神药壮阳”都是骗,真正能壮阳治阳痿的只有一种药

乔志峰
2026-09-29 13:15:43
性专家说:当一个异性开口跟你要钱,要礼物,不管对方是不是想试探你的真心,你都应该明白,你已被对方列入供养者行列

性专家说:当一个异性开口跟你要钱,要礼物,不管对方是不是想试探你的真心,你都应该明白,你已被对方列入供养者行列

心理观察局
2026-08-05 06:46:04
2026-09-29 19:07:00
智东西 incentive-icons
智东西
智东西,AI产业新媒体,专注报道人工智能的前沿技术发展,和技术应用带来的千行百业产业变革。
12679文章数 117174关注度
往期回顾 全部

科技要闻

82亿美元收购!李飞飞将与苏姿丰并肩做AI

头条要闻

坚决反对删除"敌国条款" 中国代表两问日方

头条要闻

坚决反对删除"敌国条款" 中国代表两问日方

体育要闻

王楚钦回应:找不回以前打球的感觉

娱乐要闻

赌王四房婚礼,何超琼带三房成员现身

财经要闻

央行调整完善若干货币政策工具

汽车要闻

京北"小兰博"/限时售9.99万起 北京现代艾尼氪V上市

态度原创

教育
时尚
数码
艺术
军事航空

教育要闻

学生欺凌不只是打人 索要财物 起侮辱性绰号 都是欺凌

再冷的天也拆不散我和九分裤组CP

数码要闻

雷克沙推出SLIVER GO microSD UHS-I存储卡,读取可达250MB/s

艺术要闻

320米!杭州第一高楼“金手指”,幕墙即将封顶!

军事要闻

伊朗最高领袖最新发声:伊朗现已变得独立、强大

无障碍浏览 进入关怀版