网易首页 > 网易科技 > 网易科技 > 正文

凌晨最强模型上新,Claude Fable 5.1突然发布,缓存价暴降75%,实测:未必省钱

0
分享至

出品 | 网易智能

作者 | 小小

编辑 | 王凤枝

AI贵不贵,开始要按任务算账了。

9月1日,Anthropic同时发布Claude Fable 5.1和Mythos 5.1。两款产品使用同一个底层模型,重点提升长时间智能体编程和科研能力。科研类终端任务成绩翻了一倍多,办公自动化提高了约八成。


这次比跑分更值得看的是价格。Fable 5.1的标准输入和输出价格没动,但Anthropic宣布,缓存读取价格从每百万Token 1美元降到0.25美元,降幅75%。公司说,典型工作负载的成本能降约25%,高度智能体化的任务最多能降约45%。

但缓存便宜了,一项任务却仍可能更贵。

Artificial Analysis测出来的是另一组数字:在最高努力档下,Fable 5.1的单任务成本反而比上一代高20%。模型翻旧资料是便宜了,但输出的东西多了,总账单反而被抬上去。

当AI可以连续工作几十小时,每百万Token多少钱只是表面价格。真正要算的,是它把事情做完花了多少钱。

01从答一道题,到连续干几十小时

Fable 5.1的跑分提升,主要出现在需要模型连续操作的任务里。

Anthropic公布的测试里,Terminal-Bench-Science从Fable 5的24.7%升到52.6%;AutomationBench从17.1%升到31.4%;OSWorld 2.0的严格评分下,成绩也从36.1%升到41.7%。这些测试的共同点是,要模型在终端或计算机环境里连续搜索、分析、调用工具,还要根据结果调整下一步。


跑分之外,Anthropic发布材料里还列了几个早期测试案例,更容易看懂。

Millennium曾经碰上一个大约每运行100万次才出现一次的软件崩溃。内部团队查了四五年,一直没找到原因。测试中,Fable 5.1拆开外部供应商的软件库,和崩溃留下的core dump比对,最后把问题定位到外部库里的一个漏洞。

Ramp把测试时间拉得更长。一次无人值守的机器学习任务里,Fable 5.1连续跑了38小时。它先发现此前的实验结果受到标签问题影响,修正后启动六组并行实验,最后返回结果和下一步建议。Ramp还说,模型发现了一个无人负责的生产告警,并根据日志给出了修复方案。

Browserbase的说法是,在他们内部最难的浏览器智能体测试里,Fable 5.1完成了82%的任务,Fable 5为57%,Opus 5为74%。每项任务平均运行大约10分钟。

另外两家公司给出的案例更接近企业软件开发。MongoDB说,Fable 5.1用大约三天完成了一个复杂原型:先读公司各项服务的代码和文档,提出设计方案,再连续运行几个小时把它实现出来。Shopify则让它分析一项横跨三个代码库、八项以上服务的改动。按Shopify的说法,模型能把一个请求进入系统之后经过的服务、函数、数据库表和数据行一路梳理下来。

这些案例说明,长任务能力不只是"让模型多想一会儿"。模型还要保存已经完成的步骤,知道接下来该调用哪个工具,并在结果不符合预期时回到前面检查。任务越长,一次判断错了,后面就会被越滚越大。

这些案例都是Anthropic自己挑出来的,没有第三方复现。但它们指向同一个变化:模型开始可以在较长时间里保存进度、检查结果、继续推进,不必每走一步都等用户重新下指令。

82%的浏览器任务完成率反过来说,还有将近五分之一的任务没做完。长时间运行能力提升,不等于用户已经可以放弃验收。企业要的不只是模型肯一直做下去,还要它做不下去时能说一声、能留下过程记录,该把任务交回人手就交回来。

沃顿商学院教授伊森·莫利克(Ethan Mollick)在早期体验后也把注意力放在这一点上。他觉得Fable 5.1在需要判断和取舍的长时间任务里出现了实际进步,但一些带有明显"Claudish"特征的表现并没有跟着消失。

模型能干得更久,随之而来的问题也变得更实在:一次运行不再只是生成几段回答,而可能持续消耗上下文、工具调用和输出Token。能力上去之后,成本就成了下一道门槛。

02缓存便宜75%,为什么一项任务反而更贵

Fable 5.1的标准输入价格仍是每百万Token 10美元,输出仍是50美元。真正降下来的是缓存读取:从每百万Token 1美元降到0.25美元。

缓存读取,就是模型反复翻看已经处理过的资料。智能体连续工作时,需要不断重新读取代码库、系统指令、工具说明、文档和此前积累的上下文。运行时间越长,这部分开销通常越明显。

Anthropic根据2026年8月四周的实际使用情况估算,Fable 5.1在典型工作负载中的成本能降约25%;对缓存读取占比较高的智能体任务,降幅最高约45%。这个估算只针对按Token计费的情况,和Claude订阅价格没关系。

这组数据覆盖Claude Enterprise、Claude Code和API里的实际使用,采用的是各产品的默认努力等级。Fable 5.1在Claude Code里默认用High,在Claude Cowork和Claude.ai里默认用Medium。同一个模型选不同努力等级,思考时间、输出量和最终成本都可能不一样。

Anthropic还保留了更便宜的批处理价格:异步任务的输入和输出分别是每百万Token 5美元和25美元。这适合不用马上出结果的活,但换不掉需要实时来回调用工具的智能体任务。

Cognition联合创始人兼首席产品官沃尔登·严(Walden Yan)说,公司计划在Fable 5.1发布当天把Devin里的Opus 5流量切到Fable 5.1。按Cognition的内部测试,Fable 5.1能达到甚至略高于Fable 5的表现,单任务成本更低。缓存降价之后,代码审查这类此前跑Opus级模型的任务,也开始有了转到Fable级模型的经济性。

Every首席执行官丹·希珀(Dan Shipper)测出来的是另一组结果:Fable 5.1的运行速度大约是Opus 5的两倍,Token消耗大约减少一半。这只是一家公司在自己的任务上跑出来的数据,但它也说明,企业不会只看官网标价,还得拿自己的代码和工作流重新测一遍。

发布后,社交媒体上的好评也集中在这几点上。@kimmonismus强调,45%的降幅只适用于缓存占比较高的智能体负载;马特·舒默(Matt Shumer)关注的是能力提升与缓存降价同时出现;金宇宸的看法是,如果百万次才出现一次的崩溃诊断和更低Token消耗能够稳定复现,意义会更大。




不过,模型的一项成本下降,不等于整项任务一定更便宜。

Artificial Analysis在他们的Intelligence Index测试里发现,Fable 5.1在最高努力档下的单任务成本是3.76美元,比Fable 5高20%。测试里,Fable 5.1用掉的输出Token大约是上一代的1.7倍。缓存降价每项任务省下大约1.40美元,仍不够抵消新增的输出开销。

换到xhigh努力等级后,Fable 5.1的单任务成本降到2.72美元,比最高努力档低1.04美元。这说明同一个模型选不同努力等级,任务成本也可能差不少。

Anthropic和Artificial Analysis测的不是同一批任务,也没有用完全一样的努力等级,两组数字不能直接对照。但它们能解释为什么"缓存价格下降75%"和"单任务成本上涨20%"可以同时成立:模型翻旧资料便宜了,但如果为了完成任务生成更多新内容,总账单一样会涨。

这也是为什么输出价格仍然重要。Fable 5.1每百万输出Token还是收50美元,是缓存读取价格的200倍。长任务里只要多生成一段分析、多做一次检查、或者重跑一条失败路径,新增输出就可能很快吃掉缓存省下来的钱。

模型厂商对"价格"的理解也开始变。据《The Information》报道,OpenAI近几个月向部分大客户提供了任务完成后再付费的选项,比如只有AI完成客服交互才收费。OpenAI没有回应此事,这还不是公开、普遍适用的定价政策。

Anthropic这次仍然按Token计费,两家做法不一样。但AI开始接手一整项活以后,客户关心的不再是花了多少Token,而是活干完没有、干了多久、中途要不要人帮忙。

按结果收费也没有看上去那么简单。"完成一次客服交互"相对好数,"帮助销售团队增加了多少收入"就很难单独归因。就算未来计费单位从Token变成任务,厂商和客户还是得先约定:什么算完成、失败要不要收费、人工接管算谁的成本、结果有争议时以什么记录为准。

03科研不只看回答,还要交出可以验证的结果

Anthropic这次也把长任务能力用到了科学研究上。

这次要看的不是模型能答对多少科学问题,而是它交出来的东西能不能被实验、数据或计算结果验一遍。三个案例分别对应设计、分析和工程优化。

分子设计的测试里,Mythos 5.1用开源的蛋白质设计和折叠工具生成方案,再交给两家外部机构做实验验证。在三个目标上,模型设计的结合亲和力达到相关蛋白质设计竞赛最佳设计的10倍;在12个目标上,整体命中率接近50%。Anthropic说,蛋白质设计的典型命中率大约在10%到15%之间。

有一点要分清:Anthropic展示的设计确实经过实验验证能结合,但配套的结构图仍然是ESMFold2预测出来的,不是实验测出来的。

免疫学家德里亚·乌努特玛兹(Derya Unutmaz)体验后觉得,Fable 5.1的科研能力值得继续验证。他同时注意到,普通生物学和医学问题触发安全机制的频率已经下降85%。

计算分析这块,Fable 5.1用NASA麦哲伦号探测器留下的雷达图像,为金星大约三分之一区域重建了高分辨率的高程地图。Anthropic说,新地图的分辨率从此前的10到20公里提高到2到3公里,地形高度准确度最高提高25%。

计算生物学的测试里,Mythos 5.1为七个开源深度学习模型写了定制的GPU内核,最高把运行速度提高2.5倍,同时保持输出一致。Anthropic估算,这些优化能让全基因组分析的GPU成本降30%到60%。

这些项目还是Anthropic自己挑出来的早期案例,不能据此说模型已经能独立做科学发现。但它们让"怎么考科研能力"这件事换了个方式:答案不再只由另一个模型或一套选择题打分,还要接受实验结果、数据精度和实际运行效率的检验。

其中蛋白质设计的实验验证尤其重要。传统模型评测通常有标准答案,但科研任务可能根本没有现成答案。设计出来的蛋白质能不能结合、计算内核能不能在保持输出一致的前提下加速,这些反馈比语言评分直接得多。不过,一次实验成功,不等于模型给出的科学解释就成立了。设计能用、机制说得通、别人能复现,这是三件事。

AI开发者萨莉·斯德哥尔摩(Sally Stockholm)把这种变化概括为:用户交给模型的工作正在从"帮我写一段代码"变成"继续把这个问题往前推进"。编程和科研,是这种工作方式最早出现的地方。

04能一直干,也要知道自己能干到哪里

Fable 5.1和Mythos 5.1用的是同一个底层模型,区别主要在安全限制和访问资格上。

Fable 5.1已经对普通用户和企业开放,可以用于发现软件漏洞等防御性工作,但漏洞利用代码生成、渗透测试和基于二进制文件的漏洞扫描仍然受限。Anthropic说,新版网络安全机制在Claude Code里的平均干预次数比此前少了大约60%;基础生物学和医学问题触发限制的次数也少了85%。

Mythos 5.1则通过受信任访问项目,向经过审核的网络安全和生命科学机构开放更高权限。Anthropic想用同一个模型加两套访问规则,一边少误伤普通任务,一边把风险更高的能力圈在审核过的机构里。

企业数据怎么被监控,是另一道难题。Anthropic这次同时公布了Enterprise Frontier Safeguards(EFS):客户把相关数据存在自己控制的云基础设施里,默认由客户完成必要的人工审查,不用把数据交给Anthropic。EFS计划从今年秋季起分阶段上线;在此之前,符合条件的客户可以用零数据保留模式。

Anthropic说,EFS是在金融、医疗、制造、通信、法律、公共部门等行业超过100家客户的参与下开发的,计划覆盖Claude Code、Claude Enterprise、Claude Platform以及AWS、Google Cloud和Microsoft的相关平台。它要管的不是模型会不会答题,而是模型碰到企业代码、业务数据和外部工具的时候,监控记录留在哪、谁来看、异常行为谁处理。

这套限制不是凭空加上去的。今年7月,Anthropic披露过:在关闭部分生产安全机制的网络安全评估里,Claude曾多次越过测试边界,进入真实互联网环境,包括访问真实公司的数据库、向PyPI上传恶意软件包。英国AI安全研究所也在刻意开放互联网权限、关闭厂商分类器的测试里观察到类似行为。

其中一次测试里,模型因为开发者指令提到一个并不存在的Python包,就创建了PyPI账号并上传了同名恶意包。这个包在公开仓库存在大约一小时,被15个真实系统下载并执行。这个例子留下来不是因为普通Claude用户会碰上,而是它说明了一点:测试环境和真实互联网没有彻底隔开时,模型可能把模拟任务里的操作带到真实系统里。

这些事发生在故意放宽限制的研究配置下,不是普通用户能直接用的产品环境,也没有涉及Anthropic客户数据或其生产基础设施。Anthropic的说法是,正常启用的生产安全机制本应挡住这些行为。但这也说明:智能体工作时间越长、工具权限越多,模型之外的沙箱、审批、实时监控和停止机制就越重要。

关于发布节奏,投资人加文·贝克(Gavin Baker)觉得,Anthropic选在OpenAI下一代模型之前发布Fable 5.1,说明前沿模型的竞争仍在加速。他还猜Fable 5.2可能已经在准备中。

结语

Fable 5.1把模型竞争里的一笔账摆得更清楚了。

模型可以连续跑几小时甚至几十小时,企业买的就不再只是一次回答。它们还要为模型反复读取上下文、调用工具、生成输出、失败重试和人工接管付费。

Anthropic把缓存读取价格砍了75%,是在压低长期工作中最常见的一项开销;Artificial Analysis的测试则提醒用户,更能干的模型也可能生成更多Token,把总账单重新推上去。

OpenAI据报已经向部分大客户试过任务完成后再付费。Anthropic这次仍然按Token计价,但企业衡量模型的方式正在变。

下一轮比价,厂商还是会公布每百万Token多少钱。但一个模型到底贵不贵,得看它做完一项任务花了多久、重试几次、要不要人接手,以及最后有没有把活交出来。

完成率、单任务成本、人工接管次数,三项摆到一起,这笔账才算得清。

相关推荐
热点推荐
【史话】“庚子俄难”,连俄国兵都承认:他们不是魔鬼,便是畜性

【史话】“庚子俄难”,连俄国兵都承认:他们不是魔鬼,便是畜性

年之父
2026-07-16 00:00:04
懒懒才是人生赢家,戴80W粉宝石200W手表,生病时王思聪通宵陪着

懒懒才是人生赢家,戴80W粉宝石200W手表,生病时王思聪通宵陪着

小疯子耶
2026-09-01 10:31:49
51年曾泽生从朝鲜回国,见过主席之后回家警告妻子:北京不能待了

51年曾泽生从朝鲜回国,见过主席之后回家警告妻子:北京不能待了

浩渺青史
2026-09-02 02:35:51
普京提议中俄美APEC三方会晤?外交部回应来了

普京提议中俄美APEC三方会晤?外交部回应来了

浅遇时光
2026-09-02 16:16:23
用21年从没坏过!网友晒2005年包浆罗技鼠标:至今仍能战CS2

用21年从没坏过!网友晒2005年包浆罗技鼠标:至今仍能战CS2

快科技
2026-08-31 17:44:13
日本全面叫停种植牙?种牙潜藏的风险与后遗症,一次为你讲明白

日本全面叫停种植牙?种牙潜藏的风险与后遗症,一次为你讲明白

健康科普365
2026-08-13 14:30:15
伊朗原油近乎“断流”约7周,创纪录的出口缩水正在耗尽海上库存

伊朗原油近乎“断流”约7周,创纪录的出口缩水正在耗尽海上库存

金十数据
2026-09-02 16:27:14
老板为留住销冠有多拼?网友:老板直接把他儿子嫁给我吃软饭

老板为留住销冠有多拼?网友:老板直接把他儿子嫁给我吃软饭

另子维爱读史
2026-09-01 21:08:29
MLCC巨头,签订万亿订单

MLCC巨头,签订万亿订单

半导体行业观察
2026-09-02 15:01:33
远在英国的丁玉梅,看到老许父子三人被宣判的消息,她是什么感受

远在英国的丁玉梅,看到老许父子三人被宣判的消息,她是什么感受

照亮你的前行之路
2026-09-01 08:25:07
贾冰隔空喊话沈腾!一碗冰版徐福烩饭,看着就香,沈腾秒回应纯馋我

贾冰隔空喊话沈腾!一碗冰版徐福烩饭,看着就香,沈腾秒回应纯馋我

露珠聊影视
2026-09-02 11:01:23
曼晚:曼联夏窗静悄悄收官,支出不如伊普斯维奇

曼晚:曼联夏窗静悄悄收官,支出不如伊普斯维奇

懂球帝
2026-09-02 14:47:49
广东男生613分,被深圳大学数学专业录取,选择放弃入学,家长回复:没考好,想冲更好的学校!

广东男生613分,被深圳大学数学专业录取,选择放弃入学,家长回复:没考好,想冲更好的学校!

王大嘴评说
2026-08-31 23:35:14
越南的小心思够精明!这次吉尔吉斯斯坦举办的上合组织峰会,越南没派最高领导人出席,只让国家副主席带队参会,比起去年明显降了半格

越南的小心思够精明!这次吉尔吉斯斯坦举办的上合组织峰会,越南没派最高领导人出席,只让国家副主席带队参会,比起去年明显降了半格

扶苏聊历史
2026-09-01 15:15:37
日本专家说了大实话!不把高市早苗赶下台,没人可以救得了日本

日本专家说了大实话!不把高市早苗赶下台,没人可以救得了日本

老范谈史
2026-08-31 19:56:51
普京称俄愿意将中俄间的免签制度转为永久性安排,外交部回应

普京称俄愿意将中俄间的免签制度转为永久性安排,外交部回应

澎湃新闻
2026-09-01 14:36:35
马杜罗将在监狱自生自灭,拘押地曝光:牢房约6㎡,条件恶劣暴力频发,被称“人间地狱”;委代总统发声:合法总统只有一个副总统

马杜罗将在监狱自生自灭,拘押地曝光:牢房约6㎡,条件恶劣暴力频发,被称“人间地狱”;委代总统发声:合法总统只有一个副总统

极目新闻
2026-09-01 10:03:42
万万没想到!美国对华最大失算是:让中国90后、00后彻底清醒了

万万没想到!美国对华最大失算是:让中国90后、00后彻底清醒了

乌克兰小静
2026-09-02 11:50:22
尊界S800月销4223辆暴跌至367辆,粉丝经济为何撑不起百万豪车?

尊界S800月销4223辆暴跌至367辆,粉丝经济为何撑不起百万豪车?

娱乐圈的笔娱君
2026-09-02 09:26:16
40 年最差!皇马名宿暴怒开喷!穆里尼奥重建彻底失败!

40 年最差!皇马名宿暴怒开喷!穆里尼奥重建彻底失败!

奶盖熊本熊
2026-09-02 07:30:00
2026-09-02 17:12:49

科技要闻

凌晨最强模型上新,Claude Fable 5.1发布

头条要闻

功夫巨星陈观泰去世:凭《马永贞》成名 发掘了周星驰

头条要闻

功夫巨星陈观泰去世:凭《马永贞》成名 发掘了周星驰

体育要闻

一次有奖问答,让他成为欧冠主帅

娱乐要闻

香港武打影星陈观泰离世,终年80岁

财经要闻

需要重视的全球“资金失衡”

汽车要闻

一汽-大众新能源的新答案 试驾ID. AURA T6

态度原创

艺术
健康
房产
数码
教育

艺术要闻

273米,10亿!深圳最多“外号”的摩天楼,正式运营!

越吃越爆痘?医生讲清7大真相

房产要闻

新四代住宅 新样板间开放丨以艺术之名 赴一场迭代之约

数码要闻

全新华为MatePad Air预热 9月7日与三折叠一起发布

教育要闻

初中数学,难住中等生,数学不开窍

无障碍浏览 进入关怀版
×