网易首页 > 网易科技 > 网易科技 > 正文

凌晨最强模型上新,Claude Fable 5.1突然发布,缓存价暴降75%,实测:未必省钱

0
分享至

出品 | 网易智能

作者 | 小小

编辑 | 王凤枝

AI贵不贵,开始要按任务算账了。

9月1日,Anthropic同时发布Claude Fable 5.1和Mythos 5.1。两款产品使用同一个底层模型,重点提升长时间智能体编程和科研能力。科研类终端任务成绩翻了一倍多,办公自动化提高了约八成。


这次比跑分更值得看的是价格。Fable 5.1的标准输入和输出价格没动,但Anthropic宣布,缓存读取价格从每百万Token 1美元降到0.25美元,降幅75%。公司说,典型工作负载的成本能降约25%,高度智能体化的任务最多能降约45%。

但缓存便宜了,一项任务却仍可能更贵。

Artificial Analysis测出来的是另一组数字:在最高努力档下,Fable 5.1的单任务成本反而比上一代高20%。模型翻旧资料是便宜了,但输出的东西多了,总账单反而被抬上去。

当AI可以连续工作几十小时,每百万Token多少钱只是表面价格。真正要算的,是它把事情做完花了多少钱。

01从答一道题,到连续干几十小时

Fable 5.1的跑分提升,主要出现在需要模型连续操作的任务里。

Anthropic公布的测试里,Terminal-Bench-Science从Fable 5的24.7%升到52.6%;AutomationBench从17.1%升到31.4%;OSWorld 2.0的严格评分下,成绩也从36.1%升到41.7%。这些测试的共同点是,要模型在终端或计算机环境里连续搜索、分析、调用工具,还要根据结果调整下一步。


跑分之外,Anthropic发布材料里还列了几个早期测试案例,更容易看懂。

Millennium曾经碰上一个大约每运行100万次才出现一次的软件崩溃。内部团队查了四五年,一直没找到原因。测试中,Fable 5.1拆开外部供应商的软件库,和崩溃留下的core dump比对,最后把问题定位到外部库里的一个漏洞。

Ramp把测试时间拉得更长。一次无人值守的机器学习任务里,Fable 5.1连续跑了38小时。它先发现此前的实验结果受到标签问题影响,修正后启动六组并行实验,最后返回结果和下一步建议。Ramp还说,模型发现了一个无人负责的生产告警,并根据日志给出了修复方案。

Browserbase的说法是,在他们内部最难的浏览器智能体测试里,Fable 5.1完成了82%的任务,Fable 5为57%,Opus 5为74%。每项任务平均运行大约10分钟。

另外两家公司给出的案例更接近企业软件开发。MongoDB说,Fable 5.1用大约三天完成了一个复杂原型:先读公司各项服务的代码和文档,提出设计方案,再连续运行几个小时把它实现出来。Shopify则让它分析一项横跨三个代码库、八项以上服务的改动。按Shopify的说法,模型能把一个请求进入系统之后经过的服务、函数、数据库表和数据行一路梳理下来。

这些案例说明,长任务能力不只是"让模型多想一会儿"。模型还要保存已经完成的步骤,知道接下来该调用哪个工具,并在结果不符合预期时回到前面检查。任务越长,一次判断错了,后面就会被越滚越大。

这些案例都是Anthropic自己挑出来的,没有第三方复现。但它们指向同一个变化:模型开始可以在较长时间里保存进度、检查结果、继续推进,不必每走一步都等用户重新下指令。

82%的浏览器任务完成率反过来说,还有将近五分之一的任务没做完。长时间运行能力提升,不等于用户已经可以放弃验收。企业要的不只是模型肯一直做下去,还要它做不下去时能说一声、能留下过程记录,该把任务交回人手就交回来。

沃顿商学院教授伊森·莫利克(Ethan Mollick)在早期体验后也把注意力放在这一点上。他觉得Fable 5.1在需要判断和取舍的长时间任务里出现了实际进步,但一些带有明显"Claudish"特征的表现并没有跟着消失。

模型能干得更久,随之而来的问题也变得更实在:一次运行不再只是生成几段回答,而可能持续消耗上下文、工具调用和输出Token。能力上去之后,成本就成了下一道门槛。

02缓存便宜75%,为什么一项任务反而更贵

Fable 5.1的标准输入价格仍是每百万Token 10美元,输出仍是50美元。真正降下来的是缓存读取:从每百万Token 1美元降到0.25美元。

缓存读取,就是模型反复翻看已经处理过的资料。智能体连续工作时,需要不断重新读取代码库、系统指令、工具说明、文档和此前积累的上下文。运行时间越长,这部分开销通常越明显。

Anthropic根据2026年8月四周的实际使用情况估算,Fable 5.1在典型工作负载中的成本能降约25%;对缓存读取占比较高的智能体任务,降幅最高约45%。这个估算只针对按Token计费的情况,和Claude订阅价格没关系。

这组数据覆盖Claude Enterprise、Claude Code和API里的实际使用,采用的是各产品的默认努力等级。Fable 5.1在Claude Code里默认用High,在Claude Cowork和Claude.ai里默认用Medium。同一个模型选不同努力等级,思考时间、输出量和最终成本都可能不一样。

Anthropic还保留了更便宜的批处理价格:异步任务的输入和输出分别是每百万Token 5美元和25美元。这适合不用马上出结果的活,但换不掉需要实时来回调用工具的智能体任务。

Cognition联合创始人兼首席产品官沃尔登·严(Walden Yan)说,公司计划在Fable 5.1发布当天把Devin里的Opus 5流量切到Fable 5.1。按Cognition的内部测试,Fable 5.1能达到甚至略高于Fable 5的表现,单任务成本更低。缓存降价之后,代码审查这类此前跑Opus级模型的任务,也开始有了转到Fable级模型的经济性。

Every首席执行官丹·希珀(Dan Shipper)测出来的是另一组结果:Fable 5.1的运行速度大约是Opus 5的两倍,Token消耗大约减少一半。这只是一家公司在自己的任务上跑出来的数据,但它也说明,企业不会只看官网标价,还得拿自己的代码和工作流重新测一遍。

发布后,社交媒体上的好评也集中在这几点上。@kimmonismus强调,45%的降幅只适用于缓存占比较高的智能体负载;马特·舒默(Matt Shumer)关注的是能力提升与缓存降价同时出现;金宇宸的看法是,如果百万次才出现一次的崩溃诊断和更低Token消耗能够稳定复现,意义会更大。




不过,模型的一项成本下降,不等于整项任务一定更便宜。

Artificial Analysis在他们的Intelligence Index测试里发现,Fable 5.1在最高努力档下的单任务成本是3.76美元,比Fable 5高20%。测试里,Fable 5.1用掉的输出Token大约是上一代的1.7倍。缓存降价每项任务省下大约1.40美元,仍不够抵消新增的输出开销。

换到xhigh努力等级后,Fable 5.1的单任务成本降到2.72美元,比最高努力档低1.04美元。这说明同一个模型选不同努力等级,任务成本也可能差不少。

Anthropic和Artificial Analysis测的不是同一批任务,也没有用完全一样的努力等级,两组数字不能直接对照。但它们能解释为什么"缓存价格下降75%"和"单任务成本上涨20%"可以同时成立:模型翻旧资料便宜了,但如果为了完成任务生成更多新内容,总账单一样会涨。

这也是为什么输出价格仍然重要。Fable 5.1每百万输出Token还是收50美元,是缓存读取价格的200倍。长任务里只要多生成一段分析、多做一次检查、或者重跑一条失败路径,新增输出就可能很快吃掉缓存省下来的钱。

模型厂商对"价格"的理解也开始变。据《The Information》报道,OpenAI近几个月向部分大客户提供了任务完成后再付费的选项,比如只有AI完成客服交互才收费。OpenAI没有回应此事,这还不是公开、普遍适用的定价政策。

Anthropic这次仍然按Token计费,两家做法不一样。但AI开始接手一整项活以后,客户关心的不再是花了多少Token,而是活干完没有、干了多久、中途要不要人帮忙。

按结果收费也没有看上去那么简单。"完成一次客服交互"相对好数,"帮助销售团队增加了多少收入"就很难单独归因。就算未来计费单位从Token变成任务,厂商和客户还是得先约定:什么算完成、失败要不要收费、人工接管算谁的成本、结果有争议时以什么记录为准。

03科研不只看回答,还要交出可以验证的结果

Anthropic这次也把长任务能力用到了科学研究上。

这次要看的不是模型能答对多少科学问题,而是它交出来的东西能不能被实验、数据或计算结果验一遍。三个案例分别对应设计、分析和工程优化。

分子设计的测试里,Mythos 5.1用开源的蛋白质设计和折叠工具生成方案,再交给两家外部机构做实验验证。在三个目标上,模型设计的结合亲和力达到相关蛋白质设计竞赛最佳设计的10倍;在12个目标上,整体命中率接近50%。Anthropic说,蛋白质设计的典型命中率大约在10%到15%之间。

有一点要分清:Anthropic展示的设计确实经过实验验证能结合,但配套的结构图仍然是ESMFold2预测出来的,不是实验测出来的。

免疫学家德里亚·乌努特玛兹(Derya Unutmaz)体验后觉得,Fable 5.1的科研能力值得继续验证。他同时注意到,普通生物学和医学问题触发安全机制的频率已经下降85%。

计算分析这块,Fable 5.1用NASA麦哲伦号探测器留下的雷达图像,为金星大约三分之一区域重建了高分辨率的高程地图。Anthropic说,新地图的分辨率从此前的10到20公里提高到2到3公里,地形高度准确度最高提高25%。

计算生物学的测试里,Mythos 5.1为七个开源深度学习模型写了定制的GPU内核,最高把运行速度提高2.5倍,同时保持输出一致。Anthropic估算,这些优化能让全基因组分析的GPU成本降30%到60%。

这些项目还是Anthropic自己挑出来的早期案例,不能据此说模型已经能独立做科学发现。但它们让"怎么考科研能力"这件事换了个方式:答案不再只由另一个模型或一套选择题打分,还要接受实验结果、数据精度和实际运行效率的检验。

其中蛋白质设计的实验验证尤其重要。传统模型评测通常有标准答案,但科研任务可能根本没有现成答案。设计出来的蛋白质能不能结合、计算内核能不能在保持输出一致的前提下加速,这些反馈比语言评分直接得多。不过,一次实验成功,不等于模型给出的科学解释就成立了。设计能用、机制说得通、别人能复现,这是三件事。

AI开发者萨莉·斯德哥尔摩(Sally Stockholm)把这种变化概括为:用户交给模型的工作正在从"帮我写一段代码"变成"继续把这个问题往前推进"。编程和科研,是这种工作方式最早出现的地方。

04能一直干,也要知道自己能干到哪里

Fable 5.1和Mythos 5.1用的是同一个底层模型,区别主要在安全限制和访问资格上。

Fable 5.1已经对普通用户和企业开放,可以用于发现软件漏洞等防御性工作,但漏洞利用代码生成、渗透测试和基于二进制文件的漏洞扫描仍然受限。Anthropic说,新版网络安全机制在Claude Code里的平均干预次数比此前少了大约60%;基础生物学和医学问题触发限制的次数也少了85%。

Mythos 5.1则通过受信任访问项目,向经过审核的网络安全和生命科学机构开放更高权限。Anthropic想用同一个模型加两套访问规则,一边少误伤普通任务,一边把风险更高的能力圈在审核过的机构里。

企业数据怎么被监控,是另一道难题。Anthropic这次同时公布了Enterprise Frontier Safeguards(EFS):客户把相关数据存在自己控制的云基础设施里,默认由客户完成必要的人工审查,不用把数据交给Anthropic。EFS计划从今年秋季起分阶段上线;在此之前,符合条件的客户可以用零数据保留模式。

Anthropic说,EFS是在金融、医疗、制造、通信、法律、公共部门等行业超过100家客户的参与下开发的,计划覆盖Claude Code、Claude Enterprise、Claude Platform以及AWS、Google Cloud和Microsoft的相关平台。它要管的不是模型会不会答题,而是模型碰到企业代码、业务数据和外部工具的时候,监控记录留在哪、谁来看、异常行为谁处理。

这套限制不是凭空加上去的。今年7月,Anthropic披露过:在关闭部分生产安全机制的网络安全评估里,Claude曾多次越过测试边界,进入真实互联网环境,包括访问真实公司的数据库、向PyPI上传恶意软件包。英国AI安全研究所也在刻意开放互联网权限、关闭厂商分类器的测试里观察到类似行为。

其中一次测试里,模型因为开发者指令提到一个并不存在的Python包,就创建了PyPI账号并上传了同名恶意包。这个包在公开仓库存在大约一小时,被15个真实系统下载并执行。这个例子留下来不是因为普通Claude用户会碰上,而是它说明了一点:测试环境和真实互联网没有彻底隔开时,模型可能把模拟任务里的操作带到真实系统里。

这些事发生在故意放宽限制的研究配置下,不是普通用户能直接用的产品环境,也没有涉及Anthropic客户数据或其生产基础设施。Anthropic的说法是,正常启用的生产安全机制本应挡住这些行为。但这也说明:智能体工作时间越长、工具权限越多,模型之外的沙箱、审批、实时监控和停止机制就越重要。

关于发布节奏,投资人加文·贝克(Gavin Baker)觉得,Anthropic选在OpenAI下一代模型之前发布Fable 5.1,说明前沿模型的竞争仍在加速。他还猜Fable 5.2可能已经在准备中。

结语

Fable 5.1把模型竞争里的一笔账摆得更清楚了。

模型可以连续跑几小时甚至几十小时,企业买的就不再只是一次回答。它们还要为模型反复读取上下文、调用工具、生成输出、失败重试和人工接管付费。

Anthropic把缓存读取价格砍了75%,是在压低长期工作中最常见的一项开销;Artificial Analysis的测试则提醒用户,更能干的模型也可能生成更多Token,把总账单重新推上去。

OpenAI据报已经向部分大客户试过任务完成后再付费。Anthropic这次仍然按Token计价,但企业衡量模型的方式正在变。

下一轮比价,厂商还是会公布每百万Token多少钱。但一个模型到底贵不贵,得看它做完一项任务花了多久、重试几次、要不要人接手,以及最后有没有把活交出来。

完成率、单任务成本、人工接管次数,三项摆到一起,这笔账才算得清。

相关推荐
热点推荐
武汉街头正大量出现,20岁大学生一个月赚了7000元;有人半天花掉两三百元,“这钱花得值”

武汉街头正大量出现,20岁大学生一个月赚了7000元;有人半天花掉两三百元,“这钱花得值”

极目新闻
2026-09-01 13:04:24
各省养老金重算补发将陆续启动,养老金6000和2000元补发差多少?

各省养老金重算补发将陆续启动,养老金6000和2000元补发差多少?

虎哥闲聊
2026-09-02 08:44:34
讯飞丑闻最狠细节曝光:丈夫直接炸穿熟人圈,一点脸面不留

讯飞丑闻最狠细节曝光:丈夫直接炸穿熟人圈,一点脸面不留

辉哥说动漫
2026-09-02 06:09:36
孔绍逊履新代省长!多个省级政府领导班子有调整

孔绍逊履新代省长!多个省级政府领导班子有调整

上观新闻
2026-09-02 13:22:40
“老娘传位给儿子”,起底协会反腐第一案

“老娘传位给儿子”,起底协会反腐第一案

中国新闻周刊
2026-09-02 07:44:08
上合峰会期间中方领导人与伊朗总统曾短暂交谈?外交部回应

上合峰会期间中方领导人与伊朗总统曾短暂交谈?外交部回应

澎湃新闻
2026-09-02 15:38:26
紫牛头条|走遍全球233个国家!浙江诸暨男子花33年兑现年少全球旅行梦

紫牛头条|走遍全球233个国家!浙江诸暨男子花33年兑现年少全球旅行梦

扬子晚报
2026-09-01 09:48:09
A股“大肉签”来了,中一签或赚超28万

A股“大肉签”来了,中一签或赚超28万

第一财经资讯
2026-09-02 09:12:13
妻子情夫太多,丈夫设局杀人,2016年妻子:有一个没通知到,被杀了

妻子情夫太多,丈夫设局杀人,2016年妻子:有一个没通知到,被杀了

汉史趣闻
2026-09-02 11:29:34
CCTV5直播,中国男篮VS沙特阿拉伯,赛前3利好1噩耗,能否拿下?

CCTV5直播,中国男篮VS沙特阿拉伯,赛前3利好1噩耗,能否拿下?

体坛小快灵
2026-09-02 09:45:01
一句“没本事才来送外卖”,这位女老师把自己的饭碗砸了!

一句“没本事才来送外卖”,这位女老师把自己的饭碗砸了!

皮蛋儿电影
2026-09-02 10:11:24
孙宇晨当选利伯兰总理,可能在下一盘更大的棋

孙宇晨当选利伯兰总理,可能在下一盘更大的棋

上峰视点
2026-09-02 10:03:57
核战争打不得,这一点芬兰总统提不提醒都得注意

核战争打不得,这一点芬兰总统提不提醒都得注意

新民周刊
2026-09-02 09:11:51
河北高阳警方通报“女子被当街殴打撕扯”:2人被刑拘

河北高阳警方通报“女子被当街殴打撕扯”:2人被刑拘

界面新闻
2026-09-02 16:13:22
他曾是原政治局常委,68岁失意后选择吞药自尽,骨灰至今仍下落不明

他曾是原政治局常委,68岁失意后选择吞药自尽,骨灰至今仍下落不明

老崔生活故事
2026-09-02 06:45:05
胡锡进对孙宇晨《致胡锡进老师》的回复

胡锡进对孙宇晨《致胡锡进老师》的回复

DoNews
2026-09-01 23:16:59
“不听话”的成年人,被父母花钱送去暴力矫正

“不听话”的成年人,被父母花钱送去暴力矫正

每日人物
2026-09-02 09:10:20
清华美院丁荭风波后续:网传被约谈,作品被撤展,终身取消申报资格

清华美院丁荭风波后续:网传被约谈,作品被撤展,终身取消申报资格

小徐讲八卦
2026-09-02 09:30:37
上海卖房现场心酸一幕:女房东当场崩溃落泪不止,卖房亏得太多无力释怀,高位上车的购房者终究要付出代价

上海卖房现场心酸一幕:女房东当场崩溃落泪不止,卖房亏得太多无力释怀,高位上车的购房者终究要付出代价

捣蛋窝
2026-09-02 12:48:05
出轨女子第二波聊天记录曝光,虎狼之词惊呆吃瓜网友,她嫌丢人开始批量投诉了

出轨女子第二波聊天记录曝光,虎狼之词惊呆吃瓜网友,她嫌丢人开始批量投诉了

汉史趣闻
2026-09-01 17:55:01
2026-09-02 16:31:00

科技要闻

凌晨最强模型上新,Claude Fable 5.1发布

头条要闻

连续6天重击基辅 俄乌冲突新阶段:俄无人机能力大增

头条要闻

连续6天重击基辅 俄乌冲突新阶段:俄无人机能力大增

体育要闻

一次有奖问答,让他成为欧冠主帅

娱乐要闻

孙宇晨和景甜的瓜彻底反转了

财经要闻

需要重视的全球“资金失衡”

汽车要闻

一汽-大众新能源的新答案 试驾ID. AURA T6

态度原创

房产
健康
艺术
公开课
军事航空

房产要闻

新四代住宅 新样板间开放丨以艺术之名 赴一场迭代之约

越吃越爆痘?医生讲清7大真相

艺术要闻

273米,10亿!深圳最多“外号”的摩天楼,正式运营!

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

特朗普威胁伊朗终极打击蓄势待发

无障碍浏览 进入关怀版
×