网易首页 > 网易号 > 正文 申请入驻

凌晨最强模型上新,Claude Fable 5.1突然发布,缓存价暴降75%,实测:未必省钱

0
分享至


出品 | 网易智能

作者 | 小小

编辑 | 王凤枝

AI贵不贵,开始要按任务算账了。

9月1日,Anthropic同时发布Claude Fable 5.1和Mythos 5.1。两款产品使用同一个底层模型,重点提升长时间智能体、编程和科研能力。科研类终端任务成绩翻了一倍多,办公自动化提高了约八成。


这次比跑分更值得看的是价格。Fable 5.1的标准输入和输出价格没动,但Anthropic宣布,缓存读取价格从每百万Token 1美元降到0.25美元,降幅75%。公司说,典型工作负载的成本能降约25%,高度智能体化的任务最多能降约45%。

但缓存便宜了,一项任务却仍可能更贵。

Artificial Analysis测出来的是另一组数字:在最高努力档下,Fable 5.1的单任务成本反而比上一代高20%。模型翻旧资料是便宜了,但输出的东西多了,总账单反而被抬上去。

当AI可以连续工作几十小时,每百万Token多少钱只是表面价格。真正要算的,是它把事情做完花了多少钱。


从答一道题

到连续干几十小时

Fable 5.1的跑分提升,主要出现在需要模型连续操作的任务里。

Anthropic公布的测试里,Terminal-Bench-Science从Fable 5的24.7%升到52.6%;AutomationBench从17.1%升到31.4%;OSWorld 2.0的严格评分下,成绩也从36.1%升到41.7%。这些测试的共同点是,要模型在终端或计算机环境里连续搜索、分析、调用工具,还要根据结果调整下一步。



跑分之外,Anthropic发布材料里还列了几个早期测试案例,更容易看懂。

Millennium曾经碰上一个大约每运行100万次才出现一次的软件崩溃。内部团队查了四五年,一直没找到原因。测试中,Fable 5.1拆开外部供应商的软件库,和崩溃留下的core dump比对,最后把问题定位到外部库里的一个漏洞。


Ramp把测试时间拉得更长。一次无人值守的机器学习任务里,Fable 5.1连续跑了38小时。它先发现此前的实验结果受到标签问题影响,修正后启动六组并行实验,最后返回结果和下一步建议。Ramp还说,模型发现了一个无人负责的生产告警,并根据日志给出了修复方案。

Browserbase的说法是,在他们内部最难的浏览器智能体测试里,Fable 5.1完成了82%的任务,Fable 5为57%,Opus 5为74%。每项任务平均运行大约10分钟。

另外两家公司给出的案例更接近企业软件开发。MongoDB说,Fable 5.1用大约三天完成了一个复杂原型:先读公司各项服务的代码和文档,提出设计方案,再连续运行几个小时把它实现出来。Shopify则让它分析一项横跨三个代码库、八项以上服务的改动。按Shopify的说法,模型能把一个请求进入系统之后经过的服务、函数、数据库表和数据行一路梳理下来。

这些案例说明,长任务能力不只是"让模型多想一会儿"。模型还要保存已经完成的步骤,知道接下来该调用哪个工具,并在结果不符合预期时回到前面检查。任务越长,一次判断错了,后面就会被越滚越大。

这些案例都是Anthropic自己挑出来的,没有第三方复现。但它们指向同一个变化:模型开始可以在较长时间里保存进度、检查结果、继续推进,不必每走一步都等用户重新下指令。

82%的浏览器任务完成率反过来说,还有将近五分之一的任务没做完。长时间运行能力提升,不等于用户已经可以放弃验收。企业要的不只是模型肯一直做下去,还要它做不下去时能说一声、能留下过程记录,该把任务交回人手就交回来。

沃顿商学院教授伊森·莫利克(Ethan Mollick)在早期体验后也把注意力放在这一点上。他觉得Fable 5.1在需要判断和取舍的长时间任务里出现了实际进步,但一些带有明显"Claudish"特征的表现并没有跟着消失。


模型能干得更久,随之而来的问题也变得更实在:一次运行不再只是生成几段回答,而可能持续消耗上下文、工具调用和输出Token。能力上去之后,成本就成了下一道门槛。


缓存便宜75%

什么一项任务反而更贵

Fable 5.1的标准输入价格仍是每百万Token 10美元,输出仍是50美元。真正降下来的是缓存读取:从每百万Token 1美元降到0.25美元。


缓存读取,就是模型反复翻看已经处理过的资料。智能体连续工作时,需要不断重新读取代码库、系统指令、工具说明、文档和此前积累的上下文。运行时间越长,这部分开销通常越明显。

Anthropic根据2026年8月四周的实际使用情况估算,Fable 5.1在典型工作负载中的成本能降约25%;对缓存读取占比较高的智能体任务,降幅最高约45%。这个估算只针对按Token计费的情况,和Claude订阅价格没关系。

这组数据覆盖Claude Enterprise、Claude Code和API里的实际使用,采用的是各产品的默认努力等级。Fable 5.1在Claude Code里默认用High,在Claude Cowork和Claude.ai里默认用Medium。同一个模型选不同努力等级,思考时间、输出量和最终成本都可能不一样。

Anthropic还保留了更便宜的批处理价格:异步任务的输入和输出分别是每百万Token 5美元和25美元。这适合不用马上出结果的活,但换不掉需要实时来回调用工具的智能体任务。

Cognition联合创始人兼首席产品官沃尔登·严(Walden Yan)说,公司计划在Fable 5.1发布当天把Devin里的Opus 5流量切到Fable 5.1。按Cognition的内部测试,Fable 5.1能达到甚至略高于Fable 5的表现,单任务成本更低。缓存降价之后,代码审查这类此前跑Opus级模型的任务,也开始有了转到Fable级模型的经济性。

Every首席执行官丹·希珀(Dan Shipper)测出来的是另一组结果:Fable 5.1的运行速度大约是Opus 5的两倍,Token消耗大约减少一半。这只是一家公司在自己的任务上跑出来的数据,但它也说明,企业不会只看官网标价,还得拿自己的代码和工作流重新测一遍。


发布后,社交媒体上的好评也集中在这几点上。@kimmonismus强调,45%的降幅只适用于缓存占比较高的智能体负载;马特·舒默(Matt Shumer)关注的是能力提升与缓存降价同时出现;金宇宸的看法是,如果百万次才出现一次的崩溃诊断和更低Token消耗能够稳定复现,意义会更大。




不过,模型的一项成本下降,不等于整项任务一定更便宜。

Artificial Analysis在他们的Intelligence Index测试里发现,Fable 5.1在最高努力档下的单任务成本是3.76美元,比Fable 5高20%。测试里,Fable 5.1用掉的输出Token大约是上一代的1.7倍。缓存降价每项任务省下大约1.40美元,仍不够抵消新增的输出开销。

换到xhigh努力等级后,Fable 5.1的单任务成本降到2.72美元,比最高努力档低1.04美元。这说明同一个模型选不同努力等级,任务成本也可能差不少。

Anthropic和Artificial Analysis测的不是同一批任务,也没有用完全一样的努力等级,两组数字不能直接对照。但它们能解释为什么"缓存价格下降75%"和"单任务成本上涨20%"可以同时成立:模型翻旧资料便宜了,但如果为了完成任务生成更多新内容,总账单一样会涨。

这也是为什么输出价格仍然重要。Fable 5.1每百万输出Token还是收50美元,是缓存读取价格的200倍。长任务里只要多生成一段分析、多做一次检查、或者重跑一条失败路径,新增输出就可能很快吃掉缓存省下来的钱。

模型厂商对"价格"的理解也开始变。据《The Information》报道,OpenAI近几个月向部分大客户提供了任务完成后再付费的选项,比如只有AI完成客服交互才收费。OpenAI没有回应此事,这还不是公开、普遍适用的定价政策。

Anthropic这次仍然按Token计费,两家做法不一样。但AI开始接手一整项活以后,客户关心的不再是花了多少Token,而是活干完没有、干了多久、中途要不要人帮忙。

按结果收费也没有看上去那么简单。"完成一次客服交互"相对好数,"帮助销售团队增加了多少收入"就很难单独归因。就算未来计费单位从Token变成任务,厂商和客户还是得先约定:什么算完成、失败要不要收费、人工接管算谁的成本、结果有争议时以什么记录为准。


科研不只看回答

还要交出可以验证的结果

Anthropic这次也把长任务能力用到了科学研究上。

这次要看的不是模型能答对多少科学问题,而是它交出来的东西能不能被实验、数据或计算结果验一遍。三个案例分别对应设计、分析和工程优化。

分子设计的测试里,Mythos 5.1用开源的蛋白质设计和折叠工具生成方案,再交给两家外部机构做实验验证。在三个目标上,模型设计的结合亲和力达到相关蛋白质设计竞赛最佳设计的10倍;在12个目标上,整体命中率接近50%。Anthropic说,蛋白质设计的典型命中率大约在10%到15%之间。

有一点要分清:Anthropic展示的设计确实经过实验验证能结合,但配套的结构图仍然是ESMFold2预测出来的,不是实验测出来的。

免疫学家德里亚·乌努特玛兹(Derya Unutmaz)体验后觉得,Fable 5.1的科研能力值得继续验证。他同时注意到,普通生物学和医学问题触发安全机制的频率已经下降85%。


计算分析这块,Fable 5.1用NASA麦哲伦号探测器留下的雷达图像,为金星大约三分之一区域重建了高分辨率的高程地图。Anthropic说,新地图的分辨率从此前的10到20公里提高到2到3公里,地形高度准确度最高提高25%。


计算生物学的测试里,Mythos 5.1为七个开源深度学习模型写了定制的GPU内核,最高把运行速度提高2.5倍,同时保持输出一致。Anthropic估算,这些优化能让全基因组分析的GPU成本降30%到60%。

这些项目还是Anthropic自己挑出来的早期案例,不能据此说模型已经能独立做科学发现。但它们让"怎么考科研能力"这件事换了个方式:答案不再只由另一个模型或一套选择题打分,还要接受实验结果、数据精度和实际运行效率的检验。

其中蛋白质设计的实验验证尤其重要。传统模型评测通常有标准答案,但科研任务可能根本没有现成答案。设计出来的蛋白质能不能结合、计算内核能不能在保持输出一致的前提下加速,这些反馈比语言评分直接得多。不过,一次实验成功,不等于模型给出的科学解释就成立了。设计能用、机制说得通、别人能复现,这是三件事。

AI开发者萨莉·斯德哥尔摩(Sally Stockholm)把这种变化概括为:用户交给模型的工作正在从"帮我写一段代码"变成"继续把这个问题往前推进"。编程和科研,是这种工作方式最早出现的地方。



能一直干

也要知道自己能干到哪里

Fable 5.1和Mythos 5.1用的是同一个底层模型,区别主要在安全限制和访问资格上。

Fable 5.1已经对普通用户和企业开放,可以用于发现软件漏洞等防御性工作,但漏洞利用代码生成、渗透测试和基于二进制文件的漏洞扫描仍然受限。Anthropic说,新版网络安全机制在Claude Code里的平均干预次数比此前少了大约60%;基础生物学和医学问题触发限制的次数也少了85%。

Mythos 5.1则通过受信任访问项目,向经过审核的网络安全和生命科学机构开放更高权限。Anthropic想用同一个模型加两套访问规则,一边少误伤普通任务,一边把风险更高的能力圈在审核过的机构里。

企业数据怎么被监控,是另一道难题。Anthropic这次同时公布了Enterprise Frontier Safeguards(EFS):客户把相关数据存在自己控制的云基础设施里,默认由客户完成必要的人工审查,不用把数据交给Anthropic。EFS计划从今年秋季起分阶段上线;在此之前,符合条件的客户可以用零数据保留模式。

Anthropic说,EFS是在金融、医疗、制造、通信、法律、公共部门等行业超过100家客户的参与下开发的,计划覆盖Claude Code、Claude Enterprise、Claude Platform以及AWS、Google Cloud和Microsoft的相关平台。它要管的不是模型会不会答题,而是模型碰到企业代码、业务数据和外部工具的时候,监控记录留在哪、谁来看、异常行为谁处理。

这套限制不是凭空加上去的。今年7月,Anthropic披露过:在关闭部分生产安全机制的网络安全评估里,Claude曾多次越过测试边界,进入真实互联网环境,包括访问真实公司的数据库、向PyPI上传恶意软件包。英国AI安全研究所也在刻意开放互联网权限、关闭厂商分类器的测试里观察到类似行为。

其中一次测试里,模型因为开发者指令提到一个并不存在的Python包,就创建了PyPI账号并上传了同名恶意包。这个包在公开仓库存在大约一小时,被15个真实系统下载并执行。这个例子留下来不是因为普通Claude用户会碰上,而是它说明了一点:测试环境和真实互联网没有彻底隔开时,模型可能把模拟任务里的操作带到真实系统里。

这些事发生在故意放宽限制的研究配置下,不是普通用户能直接用的产品环境,也没有涉及Anthropic客户数据或其生产基础设施。Anthropic的说法是,正常启用的生产安全机制本应挡住这些行为。但这也说明:智能体工作时间越长、工具权限越多,模型之外的沙箱、审批、实时监控和停止机制就越重要。

关于发布节奏,投资人加文·贝克(Gavin Baker)觉得,Anthropic选在OpenAI下一代模型之前发布Fable 5.1,说明前沿模型的竞争仍在加速。他还猜Fable 5.2可能已经在准备中。



结语

Fable 5.1把模型竞争里的一笔账摆得更清楚了。

模型可以连续跑几小时甚至几十小时,企业买的就不再只是一次回答。它们还要为模型反复读取上下文、调用工具、生成输出、失败重试和人工接管付费。

Anthropic把缓存读取价格砍了75%,是在压低长期工作中最常见的一项开销;Artificial Analysis的测试则提醒用户,更能干的模型也可能生成更多Token,把总账单重新推上去。

OpenAI据报已经向部分大客户试过任务完成后再付费。Anthropic这次仍然按Token计价,但企业衡量模型的方式正在变。

下一轮比价,厂商还是会公布每百万Token多少钱。但一个模型到底贵不贵,得看它做完一项任务花了多久、重试几次、要不要人接手,以及最后有没有把活交出来。

完成率、单任务成本、人工接管次数,三项摆到一起,这笔账才算得清。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
CCTV5直播!中国女篮血战欧洲劲旅,热身赛曾输给对手24分,凶多吉少

CCTV5直播!中国女篮血战欧洲劲旅,热身赛曾输给对手24分,凶多吉少

中国篮坛快讯
2026-09-07 14:32:48
价值6分!补赛悄变保级生死战!天津津门虎发布迎战辽宁铁人票务

价值6分!补赛悄变保级生死战!天津津门虎发布迎战辽宁铁人票务

实事球是
2026-09-07 19:29:02
人妻街头私服,宽松衫下藏着饱满体态魅力

人妻街头私服,宽松衫下藏着饱满体态魅力

只要高兴就好
2026-09-06 11:34:53
快讯!欧盟向中国提条件了!

快讯!欧盟向中国提条件了!

故事终将光明磊落
2026-09-07 12:27:31
原来他是杜星霖前夫,富商身家不菲,为她与前妻离婚,今婚姻成迷

原来他是杜星霖前夫,富商身家不菲,为她与前妻离婚,今婚姻成迷

林雁飞
2026-09-07 15:10:48
如果日本真的敢一战,大概率亚洲有两个国家会消失!

如果日本真的敢一战,大概率亚洲有两个国家会消失!

壹知眠羊
2026-09-07 07:05:41
我国下一次8级大地震,最有可能发生在哪里?

我国下一次8级大地震,最有可能发生在哪里?

创造精彩剧情
2026-08-09 01:28:02
机会来了,亲华派彻底掌权,成功进入外国高层,对中国做过3好事

机会来了,亲华派彻底掌权,成功进入外国高层,对中国做过3好事

揽星戈
2026-09-08 00:29:48
出轨女子第二波聊天记录曝光,虎狼之词惊呆吃瓜网友,她嫌丢人开始批量投诉了

出轨女子第二波聊天记录曝光,虎狼之词惊呆吃瓜网友,她嫌丢人开始批量投诉了

汉史趣闻
2026-09-01 17:55:01
CCTV5直播!U23国足首秀即生死战,张玉宁搭档王钰栋,安东尼奥带队争首胜

CCTV5直播!U23国足首秀即生死战,张玉宁搭档王钰栋,安东尼奥带队争首胜

大卫的篮球故事
2026-09-07 17:33:59
70岁后不要做的6大体检,不仅没用还伤身,为您揭秘!

70岁后不要做的6大体检,不仅没用还伤身,为您揭秘!

鬼菜生活
2026-09-04 05:17:54
震惊!上海一男子13年把女友“改造”成芭比,坦言自己内心充满成就感,评论炸锅

震惊!上海一男子13年把女友“改造”成芭比,坦言自己内心充满成就感,评论炸锅

火山詩话
2026-09-07 11:04:58
最高9.3分,夯爆了

最高9.3分,夯爆了

来看美剧
2026-09-05 17:59:31
斯科尔斯:赖斯绊倒罗杰斯让人恼火,两人夏天或许发生了啥事

斯科尔斯:赖斯绊倒罗杰斯让人恼火,两人夏天或许发生了啥事

懂球帝
2026-09-08 02:11:15
德天空:克洛普即将公布首份德国队大名单,门将位置竞争激烈

德天空:克洛普即将公布首份德国队大名单,门将位置竞争激烈

懂球帝
2026-09-07 21:22:23
伊朗婚礼变葬礼:美军一枚炸弹疑“偏离目标”134米

伊朗婚礼变葬礼:美军一枚炸弹疑“偏离目标”134米

澎湃新闻
2026-09-07 20:14:36
重磅!男篮17岁新星赴美留洋 登顶全美第一名校 未来可期!

重磅!男篮17岁新星赴美留洋 登顶全美第一名校 未来可期!

你看球呢
2026-09-07 11:29:01
首款完整“韬定律”芯片落地,余承东现场称“史上最强”

首款完整“韬定律”芯片落地,余承东现场称“史上最强”

第一财经资讯
2026-09-07 16:13:11
是时候揭开真相了:当年对越作战的损失或许远超人们想象,仅从那些牺牲的将门之后就能看出端倪

是时候揭开真相了:当年对越作战的损失或许远超人们想象,仅从那些牺牲的将门之后就能看出端倪

人生录
2026-08-26 00:05:15
欠债不还,隐婚生子?56岁古天乐被告上法庭,王晶当年的话没说错

欠债不还,隐婚生子?56岁古天乐被告上法庭,王晶当年的话没说错

体育小柚
2026-09-05 09:58:20
2026-09-08 03:55:00
星海情报局 incentive-icons
星海情报局
关注“中国制造”的星辰大海
1431文章数 2031关注度
往期回顾 全部

科技要闻

小米澎程N90 Max定价26.99万元

头条要闻

伊朗试验特殊武器爆炸场面如同地狱 美军舰直接跑了

头条要闻

伊朗试验特殊武器爆炸场面如同地狱 美军舰直接跑了

体育要闻

压哨避开CBA选秀规则?NBL香港金牛队已为男篮国手王俊杰报备合同

娱乐要闻

热搜第一,演员李沐宸致歉

财经要闻

证监会原副主席王建军一审被判无期徒刑

汽车要闻

智能可变大空间SUV 小米澎程系列车型上市 20.99万起

态度原创

游戏
家居
艺术
时尚
军事航空

鸣潮费大劲捏出来的清冷师尊,咋就变成了哦齁剑仙?

家居要闻

2026建博会(广州) 公装联探展交流活动

艺术要闻

太罕见!苏轼这幅字流落民间900年,险些被当废纸卖掉……

内娱女星,纷纷“去父留子”

军事要闻

媒体:中美战区司令会晤释放的信号 台湾要听懂

无障碍浏览 进入关怀版