网易首页 > 网易号 > 正文 申请入驻

价格暴降90%,多项测试超GPT-6 Luna!Anthropic最便宜模型来了

0
分享至

编辑|勺嘴鹬

Anthropic 争夺 Agent 成本。


同志们,Anthropic 又来卷价格了。这次轮到 Claude 家族里最便宜的 Haiku。

10月7日,Anthropic 正式发布 Claude Haiku 5.5 ,号称自家迄今速度最快、能力最强、价格最低的小模型。

最夸张的是价格,每百万输入Token 最低只要 0.1美元,相比上代直接降价90%。



性能也没落下。按照 Anthropic 公布的测试结果,Haiku 5.5 在计算机操作、知识工作、Agent 编程等多个基准上超过 OpenAI 的 GPT-6 Luna,部分成绩甚至拉开了不小的差距。

而且,Haiku 5.5 还引入了可调节的推理强度,支持 100万Token 上下文窗口和最高 12.8万Token 输出。

至此,Anthropic 在短短 15 天里完成了 Claude 5.5 全家桶的更新:9 月 22 日 Opus 5.5 登场,9 月 28 日 Sonnet 5.5 发布,如今 Haiku 5.5 也正式加入。

这次,Anthropic 把重点放在了那些调用量巨大、对价格极其敏感的 AI 任务上。

多项成绩超过 GPT-6 Luna,计算机操作成功率 72.4%

按照 Anthropic 公布的 Benchmark 成绩,Haiku 5.5 相比上一代实现了大幅提升,在部分测试中还取得了比 GPT-6 Luna 更好的成绩。



其中最显眼的成绩来自 OSWorld。这是一项衡量 AI Agent 操作真实计算机能力的测试,要求模型完成跨应用、多步骤的操作任务。

在 OSWorld 2.1 离线任务子集上,Haiku 5.5 取得 72.4% 的成功率,上一代 Haiku 4.5 只有 15.7%,GPT-6 Luna 则为 48.9%。



知识工作方面,Haiku 5.5 在 GDPval-AA v2.1 中取得 1620 分,超过 GPT-6 Luna的1437分。Agent 编程测试 Terminal-Bench 4.0 中,两者成绩分别为 39.2% 和 16.4%。

不过,这些数据还有一个重要细节。Haiku 5.5 的最高 Benchmark 成绩,往往需要付出更多推理计算。

Haiku 5.5 首次在 Haiku 系列中引入可调节推理强度,开发者可以通过 effort 参数控制模型投入多少计算资源。

媒体VentureBeat注意到,在 Anthropic 公布的 Terminal-Bench 测试中, 39.2% 的成绩对应最大推理强度。切换至中等推理强度后,成绩降至约 20% ,而中等强度正是 Haiku 5.5 的默认设置。

第三方评测机构 Artificial Analysis 也观察到了类似现象。在其 Intelligence Index 评测中,Haiku 5.5 最大推理强度获得 43 分,中等推理强度为 34 分。同一评测下,平均每项任务成本分别约为 0.21 美元和 0.05 美元。

也就是说,模型可以通过增加推理预算换取更好的任务表现,但实际花费也可能明显增加。

Artificial Analysis 在自己的 Terminal-Bench 4.0 测试中,测得最大推理强度 33% 、中等强度 15% 的成绩。由于评测设置不同,这组数字与 Anthropic 官方结果存在差异。

这也是为什么看待小模型性能时,需要同时考虑推理强度、任务完成率和实际成本。

在更复杂的 Agent 编程任务上,Sonnet 5.5 依然具有明显优势:Terminal-Bench 4.0 成绩达到 70.6%。

Anthropic 也明确表示,Sonnet 和 Opus 仍然更适合复杂的 Agent 编程任务,Haiku 的优势集中在高频、范围明确的工作中。

价格直接砍到一折,和 GPT-6 Luna 正面竞争

如果说性能提升让 Haiku 5.5 有了竞争力,那么价格可能才是此次发布最重要的看点。Anthropic 为新模型设计了两档 API 价格。



对于提示长度不超过 10 万 Token 的请求,Haiku 5.5 的输入、输出单价都比上一代降低 90% 。超过这个门槛,价格仍比 Haiku 4.5 低 50%。

Anthropic 表示,上一代 Haiku 约 90% 的请求都处于 10 万 Token 以内。结合不同请求长度和 Token 消耗变化,公司预计 Haiku 5.5 完成同类任务的平均成本下降约 75%。

这里还有一个容易忽略的细节—— Haiku 5.5 换用了新的 Tokenizer 。根据官方开发者文档,同一段文本在新模型中产生的 Token 数量,可能比 Haiku 4.5 多约 30% ,具体增幅取决于内容。因此,API 单价下降 90% ,并不代表每项任务的账单都能减少 90% 。

另一个值得关注的对手是 GPT-6 Luna 。OpenAI 给出的 Luna 基础定价同样为每百万输入 Token 0.1 美元、输出 0.5 美元,缓存读取价格也与 Haiku 5.5 的低价档一致。

不过,两家公司的长上下文计费门槛存在明显差异。

Haiku 5.5 在提示超过 10 万 Token 后进入更高价格档;GPT-6 Luna 则在输入超过 27.2 万 Token 后才触发长上下文加价。这意味着,在 10 万至 27.2 万 Token 之间的请求中,Luna 的单位 Token 价格具有优势。

至于最终完成一项任务哪款模型更省钱,还需要结合实际 Token 用量、推理预算和任务成功率判断。

放到整个市场来看,Anthropic 也在向其他低价模型施加压力。

VentureBeat列出的同期 API 价格显示,Google Gemini 3.5 Flash-Lite 每百万输入 Token 价格为 0.3 美元、输出 2.5 美元;Gemini 3.8 Flash 分别为 0.75 美元和 3.75 美元。

当然,不同模型的能力定位、缓存策略和任务表现各不相同,这些数字首先反映的是 API 价格竞争。

小模型价格战,正在进一步升级。

一周 800 万次调用,企业开始让小模型给大模型打工

Haiku 5.5 到底适合干什么?

Anthropic 给出的场景包括文档摘要、信息分类、数据库查询、上下文压缩,以及在复杂 Agent 工作流中担任 Subagent。

这背后有一个很现实的问题:如今的 Agent 越来越复杂,一项任务往往需要多次调用模型。如果每个步骤都交给大模型处理,成本会快速累积。

金融 AI 公司 Rogo 提供了一个例子。在它的工作流中,一个能力更强的大模型负责制作财务演示文稿。处理其中某张幻灯片时,Haiku 5.5 Subagent 进入企业 10-K 年报,找到需要的业务收入数据,再把结果交给主模型。

对这种任务,模型需要快速、准确地完成信息查找和提取。Rogo 认为,Haiku 5.5 在准确率、速度和价格之间达到了适合大量重复调用的平衡。

企业内容管理平台 Box 也给出了早期测试结果。相比 Haiku 4.5,Haiku 5.5 的内部评测成绩提高 11 分,延迟下降约 50%。

Box 表示,这让新模型适合成本报告、财务摘要、周期性审查等需要规模化运行的分析工作。不过,Box 没有公开完整的评测标准。

Asana 的测试则覆盖 Bug 分类、项目建立、大型项目组合搜索等 Agent 任务。根据其披露的结果,相比当前使用的模型,Haiku 5.5 让任务完成延迟降低超过 30% ,单轮 Agent 推理速度最高提升 2.5 倍。

另一个更能体现成本价值的例子来自 AlphaSense。这家公司的Ask in Document 功能每周需要处理约 800 万次调用,主要回答针对一份或几份文档的具体问题。

在 400 个测试查询中,Haiku 5.5 的内部评测得分达到 0.84,而 Haiku 4.5 为 0.76。

如果一款模型每周要被调用数百万次,哪怕每次只节省很少的钱,长期累积下来的成本变化也可能相当可观。

这些数据来自 Anthropic 披露的早期客户反馈,具体工作负载、对照模型及评价标准并不完全一致,还需要更多独立测试。

Sonnet 跟着降价,Claude 5.5 全家桶开始拼成本

除了 Haiku 5.5,Anthropic 还同步调整了 Sonnet 5.5 的定价。从 10 月 7 日起,Sonnet 5.5 的缓存读取费用降低 50%,从每百万 Token 0.2 美元降至 0.1 美元。

Anthropic 预计,这项调整可以让多数 Agent 工作负载的成本再降低约 20%,实际降幅取决于应用重复使用缓存上下文的程度。

对于需要反复读取长对话历史、工具说明和任务上下文的 Agent 来说,缓存成本会直接影响系统的长期运行开销。

Anthropic 同时为 Claude Max 和 Team 订阅用户推出每月 API 额度:Max 5x 用户 100 美元,Max 20x 用户 200 美元,Team 用户共享最高 500 美元。

这些额度可用于 Claude 平台上的模型调用,鼓励更多订阅用户尝试构建自己的 Agent 和应用。

开发者方面,Haiku 5.5 已通过 Anthropic API、Amazon Bedrock、Google Cloud 和 Microsoft Azure 等平台提供服务,API 模型 ID 为。

claude-haiku-5-5

Anthropic 也更新了 Python 和 TypeScript SDK ,新增处于 Beta 阶段的浏览器操作与计算机操作支持。

至此,Claude 5.5 系列的产品分工已经相当清楚。

Opus 5.5 负责高难度、复杂推理任务,Sonnet 5.5 覆盖日常复杂工作与编程, Haiku 5.5 则主攻调用量大、成本敏感、要求快速响应的任务。

从 9 月 22 日到 10 月 7 日,Anthropic 用了 15 天完成这一轮产品更新,三个型号都在强调性能和成本效率。

Haiku 5.5 的发布,也让一个趋势更加明显。随着 Agent 逐渐从演示走向实际应用,开发者必须考虑整套系统的调用成本。一次任务里哪些步骤需要更强的模型、哪些可以交给小模型,以及不同模型之间如何分配工作,都会影响最终的商业可行性。

对 Anthropic 来说,Haiku 5.5 最有吸引力的地方,或许就在这里:它让更多原本因调用成本过高而难以规模化的任务,开始具备经济上的可行性。

小模型的竞争,已经开始深入 Agent 系统的每一个执行环节。

参考资料

https://www.anthropic.com/claude-haiku-5-5

https://venturebeat.com/technology/anthropic-launches-claude-haiku-5-5-with-90-api-price-reduction-matching-gpt-6-luna

https://x.com/claudeai/status/2107894042235166750

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
刚刚!江淮汽车股价跌停,或因尊界刹车测试,踏板支架断裂

刚刚!江淮汽车股价跌停,或因尊界刹车测试,踏板支架断裂

说财猫
2026-10-08 13:29:05
WTT大满贯女单四强出炉:国乒占4席!1/4决赛前瞻,国乒全是硬仗

WTT大满贯女单四强出炉:国乒占4席!1/4决赛前瞻,国乒全是硬仗

乒烧泳球
2026-10-08 21:33:19
突然反转?高盛大摩花旗瑞银野村罕见一致:2027 年,中国房价大涨

突然反转?高盛大摩花旗瑞银野村罕见一致:2027 年,中国房价大涨

专业聊房君
2026-10-08 17:04:45
霍尔木兹“周末封航”引爆油价!国际油价涨超3%,国内燃油期货大涨18%

霍尔木兹“周末封航”引爆油价!国际油价涨超3%,国内燃油期货大涨18%

华尔街见闻官方
2026-10-08 16:07:35
1998年11月从智利出发,2026年10月5日抵达英国,英国男子耗时28年完成5万公里徒步,穿越29个国家

1998年11月从智利出发,2026年10月5日抵达英国,英国男子耗时28年完成5万公里徒步,穿越29个国家

极目新闻
2026-10-08 12:20:16
周星驰退出内地影院生意,1港元卖掉业务

周星驰退出内地影院生意,1港元卖掉业务

极目新闻
2026-10-08 20:19:40
张小雷涉案1554亿:为4个情妇挥霍2亿元,他说最狠的话挨最毒的打

张小雷涉案1554亿:为4个情妇挥霍2亿元,他说最狠的话挨最毒的打

花寒弦絮
2026-10-08 00:24:33
A股第二高价股跌停,网友:20cm跌停,仓重的人今天连饭都吃不下

A股第二高价股跌停,网友:20cm跌停,仓重的人今天连饭都吃不下

东方豪侠
2026-10-08 11:56:24
47岁吴建豪暴瘦认不出!180只剩百斤,尖嘴猴腮像老头,健康引担忧

47岁吴建豪暴瘦认不出!180只剩百斤,尖嘴猴腮像老头,健康引担忧

八星人
2026-10-06 16:13:30
全网都在吹捧中国第一,只有我敢说出真实差距

全网都在吹捧中国第一,只有我敢说出真实差距

青苹果sht
2026-10-05 14:01:35
高芙:我被中国球迷网暴,我不是小偷!结果美国网友抨击更猛烈

高芙:我被中国球迷网暴,我不是小偷!结果美国网友抨击更猛烈

郭蛹包工头
2026-10-08 15:15:20
高芙:我被中国球迷网暴,我不是小偷!谁料美国网友抨击更猛烈

高芙:我被中国球迷网暴,我不是小偷!谁料美国网友抨击更猛烈

军情观察家
2026-10-08 16:22:34
涉嫌严重违纪违法,陈元虎被查

涉嫌严重违纪违法,陈元虎被查

中国基金报
2026-10-08 13:47:08
新进展!泰国失联男老师回上海,使馆透露原因,原来网友早有预料

新进展!泰国失联男老师回上海,使馆透露原因,原来网友早有预料

寻墨阁
2026-10-08 15:11:33
皇马炸锅!2.5 亿巨星铁心逃离伯纳乌!利物浦迎来史诗级捡漏

皇马炸锅!2.5 亿巨星铁心逃离伯纳乌!利物浦迎来史诗级捡漏

澜归序
2026-10-08 08:50:36
杭州一收费站被车撞击,车子四轮朝天,收费站多处损坏;当事车主:拍电影一样,人没事已到工位

杭州一收费站被车撞击,车子四轮朝天,收费站多处损坏;当事车主:拍电影一样,人没事已到工位

环球网资讯
2026-10-08 14:26:41
医生警告:每天吃一颗枸杞,就等于给肝脏添负担?真相来了!

医生警告:每天吃一颗枸杞,就等于给肝脏添负担?真相来了!

芹姐说生活
2026-10-07 20:12:59
中日对决不手软!陈幸同3-0横扫大藤沙月,下轮战日本最强削球手

中日对决不手软!陈幸同3-0横扫大藤沙月,下轮战日本最强削球手

钉钉陌上花开
2026-10-08 20:55:34
“哥哥又闹着进妹妹屋”,特殊家庭让网友不适:放弃他吧,有危险

“哥哥又闹着进妹妹屋”,特殊家庭让网友不适:放弃他吧,有危险

熙熙说教
2026-10-08 13:58:46
开拓者123-118击败勇士!杨瀚森创惊喜,这一战看到4个事实

开拓者123-118击败勇士!杨瀚森创惊喜,这一战看到4个事实

篮球大视野
2026-10-08 12:58:05
2026-10-08 22:19:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14155文章数 142745关注度
往期回顾 全部

科技要闻

江淮汽车回应"尊界V800刹车踏板支架断裂"

头条要闻

女局长被举报婚内出轨至少9人 大量亲密聊天记录公布

头条要闻

女局长被举报婚内出轨至少9人 大量亲密聊天记录公布

体育要闻

梅西社媒发文告别国家队 C罗点赞留言:致敬 拥抱

娱乐要闻

演员王晓慧刚担女主,就被曝已婚生子

财经要闻

央行:中国从不搞竞争性货币贬值

汽车要闻

特别版配色/碳纤尾翼 2027款深蓝L06将于10月9日上市

态度原创

亲子
本地
教育
时尚
公开课

亲子要闻

备孕男性要补硒吗?2026年研究给出了剂量和效果数据

本地新闻

转型再出发 奋勇打头阵

教育要闻

2026上海中考语文平均分116.83分

此时此地,重新理解“日常”

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版