![]()
作者 | 山竹
出品 | 锌产业
9月2日,Anthropic发布Claude Fable 5.1和Claude Mythos 5.1。
两者采用相同的底层模型,但设置了不同级别的安全限制:Fable 5.1面向普通用户和企业开放,Mythos 5.1则仅向经过审核的网络安全及生命科学机构提供。
按照Anthropic的定位,Fable 5.1是目前能力最强的通用Claude模型,重点提升了编程、复杂知识工作、长周期任务和科学研究能力,它已经登陆Claude API,并通过AWS、Google Cloud和Microsoft Azure提供服务。
但与以往主要强调跑分和“最强能力”的发布相比,Fable 5.1更值得关注的地方,是Anthropic同时调整了使用成本、数据留存和安全护栏。
前沿模型之间的竞争,正在从“谁更聪明”,变成“谁能以更低成本、更少阻碍进入真实工作流”。
01 Fable 5.1补齐落地短板
从Anthropic公布的数据看,Fable 5.1在多项编程与Agent评测中超过了上一代:
在面向科学研究任务的Terminal-Bench-Science 0.1上,Fable 5.1取得52.6%的成绩,Fable 5为24.7%;
在衡量终端编程能力的Terminal-Bench 4.0上,Fable 5.1为55.8%,上一代为42.0%;
在企业自动化测试AutomationBench中,其成绩也由Fable 5的17.1%提高到31.4%。
![]()
这些数据仍需谨慎看待。
一方面,它们主要来自Anthropic自己的测试,尚不能代替更大规模的第三方评测;
另一方面,大模型在基准测试中的领先,并不必然转化为实际项目中的稳定优势。
不同模型调用工具、消耗Token和处理失败任务的方式不同,最终成本往往要在具体工作流中才能算清楚。
不过,Fable 5.1释放出的产品方向已经相当明确:模型不只是要回答更难的问题,还要在较少人工监督的情况下,把一个任务持续做完。
Anthropic列举的早期案例包括跨代码库排查故障、连续数小时完成复杂原型、分析金融文档,以及利用外部工具开展科学研究。Anthropic官方还表示,模型能够更主动地验证结果,并减少为了通过测试而关闭失败用例、绕过问题等“走捷径”行为。
如果这些能力能在生产环境中复现,Fable 5.1的真正竞争力就不只是单轮生成质量,而是承担完整工作链条的能力。对于代码审查、研究分析和企业自动化来说,用户购买的也不再是一次回答,而是一段可以持续运行的数字劳动。
Anthropic为此调整了成本结构。
Fable 5.1的基础价格仍为每百万输入Token 10美元、输出Token 50美元,但缓存读取价格下降75%,降至每百万Token 0.25美元。公司估算,典型工作负载的综合成本较Fable 5下降约25%,上下文和工具调用密集的Agent任务最多可下降约45%。
这种降价方式颇有针对性。长时间运行的Agent需要不断读取任务说明、代码库、历史记录和工具返回结果,缓存内容可能被反复调用。基础单价不变,并不妨碍实际任务成本下降。Anthropic显然希望把Fable从少数高难度任务使用的“昂贵专家”,推向更高频的企业工作流。
02 当竞争坐标从GPT-5.6指向GPT-6
Fable 5.1发布后,一个自然的问题是:它与OpenAI下一代模型相比处在什么位置?
截至2026年9月2日,OpenAI官方模型目录中尚未出现GPT-6,也没有公布其参数、价格、发布时间或正式评测结果。
但Fable 5.1显然有提前卡位的意味。在Anthropic公布的对照测试中,Fable 5.1直接选择GPT-5.6 Sol作为竞品:
Terminal-Bench-Science 0.1上,二者成绩分别为52.6%和22.4%;
Terminal-Bench 4.0上分别为55.8%和37.3%;
CursorBench 3.2.0上分别为73.4%和67.2%。
![]()
这些数字只能说明Fable 5.1在Anthropic选择的方法和配置下领先,不能推导出其在所有任务上都强于GPT-5.6。OpenAI在官方文档中强调,
GPT-5.6支持程序化工具调用、多Agent协作、持久化推理和最长约105万Token上下文,其产品思路同样指向复杂、长周期的生产工作流。
价格差异也很明显。
OpenAI官方数据显示,GPT-5.6 Sol的输入和输出价格分别为每百万Token 4美元和20美元,低于Fable 5.1的10美元和50美元。Fable的优势更多体现在缓存读取降价,以及Anthropic声称的任务完成质量和Token效率。究竟哪一个更便宜,不能只比较价目表,还取决于模型需要运行多少轮、调用多少工具,以及是否需要人工返工。
Anthropic正在提前定义下一轮竞争题目:下一代模型不仅要有更高智力上限,还要能够长时间工作、调用多种工具、控制上下文成本,并在安全限制下保持足够可用。
等GPT-6真正发布后,外界比较的重点恐怕也不会只是数学、编程或知识问答成绩,而是模型能否以可预测的成本承担完整项目。
这正是Fable 5.1试图抢先占据的位置。
03 同一模型,两套安全边界
Fable 5.1与Mythos 5.1的双版本设计,则体现了Anthropic对能力开放方式的另一层思考。
两者使用相同底层模型。Fable 5.1增加了针对网络安全和生命科学任务的限制,面向更广泛的用户开放;Mythos 5.1保留了更完整的相关能力,但目前主要提供给通过审核的美国网络安全机构和生命科学研究人员。
Anthropic官方表示,新版网络安全护栏对正常请求的误拦截减少约60%。
Fable 5.1现在可以协助发现软件漏洞,但漏洞利用生成、渗透测试以及基于二进制文件的漏洞扫描等双重用途任务,仍可能被限制或转交能力较低的模型处理。
这种变化回应了开发者长期以来对安全误判的抱怨。
护栏过松可能放大滥用风险,过严又会让模型在代码安全、医学和生物研究等专业场景中失去价值。
Anthropic的解决办法不是简单取消限制,而是把能力开放与用户身份绑定:普通用户获得风险受控的Fable,经过验证的专业机构则可以申请Mythos。
企业数据问题也被纳入这套发布方案。
Anthropic推出Enterprise Frontier Safeguards,允许符合条件的客户把数据保存在自己控制的云环境中,同时保留自动化滥用检测能力。该机制计划从今年秋季起分阶段开放,在正式上线前,部分合格客户可以使用零数据留存方案。
从Fable 5.1可以看出,前沿模型正在从一个单纯的软件产品,变成一套包含模型能力、身份验证、云基础设施、数据治理和安全审查的复杂系统。越强的模型,越难像普通应用一样无差别开放。
Fable 5.1未必已经确立长期领先,但它提出了一个越来越现实的问题:
当模型开始连续工作数小时,甚至参与网络安全和生命科学研究时,厂商需要交付的就不再只是一个更高的分数,而是一套能够承担后果的运行规则。
GPT-6尚未登场,Anthropic已经提前摆出了自己的答案。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.