![]()
作者 | 汤安迪
编辑 | 周欢
刚刚, Fable 5.1 发布!全球最强模型来了,针对蒸馏加入新限制
84 天。Anthropic 凌晨又扔了一颗炸弹。
Claude Fable 5.1 和 Mythos 5.1 同步发布。
![]()
这就是一个是目前公开可用的最强模型,两者共享同一个底层模型,区别只在安全限制的松紧。
Fable 5.1 全面开放给普通用户、开发者和企业,Mythos 5.1 只给经过审核的高风险领域合作伙伴。
这可能就是 AI 产品的未来形态:最强的能力,不会以同一种形式卖给所有人。
![]()
![]()
长任务增强
先看跑分。这次升级的味道很专一:全部押在长任务上。
科学研究型 Agent 基准 Terminal-Bench-Science 0.1,从 24.7% 飙到 52.6%,提升 113%,翻了一倍多。
商业流程评测 AutomationBench,从 17.1% 涨到 31.4%,提升 84%。
![]()
Agent 终端编程 Terminal-Bench 4.0,从 42.0% 提到 55.8%,提升 33%,能力更开放的 Mythos 5.1 在这个项目上达到 60.9%。
而普通知识问答、单项编程这些"一锤子买卖",进步幅度大多只有 1% 到 16%。
Anthropic 的意图毫不掩饰,我要的是你把一整个项目扔过来,几个小时甚至几天后来验收。
关键评测相对增幅:科学终端 +113% / 商业流程 +84% / Agent 编程 +33%。
![]()
![]()
降价了
有意思的价格。
输入输出单价没动,仍是每百万 Token 10 美元和 50 美元。但缓存读取价格直接砍掉 75%,降到每百万 0.25 美元。
![]()
按 Anthropic 对今年 8 月实际使用数据的测算:典型任务整体便宜约 25%,高度 Agent 化的任务最高便宜 45%。
第三方榜单 Artificial Analysis 的账算得更直白,Fable 5.1 High 档拿到 62 分,与上一代 Fable 5 Max 持平,但单项任务成本从 3.14 美元降到 1.43 美元,便宜了一半还多。
![]()
连"地表最强模型"都开始讲性价比了。能力军备竞赛的下半场,打法是同一分数、半价交货。
![]()
38 小时不睡觉的员工
跑分是体操比赛,案例才是实战。
这次的官方案例,全是冲着"长"字去的。
投资机构 Millennium 内部有一段代码,大约每运行一百万次崩溃一次,困扰了工程团队四五年,其他模型都没找到原因。Fable 5.1 的做法是:
反汇编外部供应商的程序库,比对核心转储文件,最后把问题定位到第三方库的一个 Bug。
金融公司 Ramp 更狠,直接让 Fable 5.1 连续跑了 38 小时。
模型中途发现原有机器学习结果受标签错误污染,自己修正了问题,并发启动六组实验,最后交回整理好的新结果和后续建议。
科研侧的案例更像科幻:
Mythos 5.1 设计的蛋白质结合剂,在三个目标蛋白上亲和力达到相关竞赛最佳方案的 10 倍;面对 12 个目标蛋白,有效命中率接近 50%,而行业常见水平是 10% 到 15%。
![]()
Fable 5.1 还拿 30 多年前 NASA 麦哲伦号探测器的雷达图像,给金星约三分之一的表面画了张新高程图,细节分辨率从 10 至 20 公里级提到 2 至 3 公里级,这张地图将以知识共享许可公开,供 NASA 后续任务使用。
![]()
"帮你写代码"变成"替你做研究”。
提出方案、调用工具、交付可供实验验证的结果,这条链已经走通了。
![]()
![]()
防蒸馏
焊进推理链里
能力放开的同时,锁也换了新的。
针对大规模模型蒸馏,Fable 5.1 加入了一项新限制:当天之后创建的 API 账户,将无法在保留 Claude 历史思考记录的同时,手动修改多轮对话中的先前上下文。
Anthropic 说得很直白,这是为了阻断一种已经公开的能力提取方法。
有人已经研究出了怎么通过"改历史、留思考"的组合拳,把 Claude 的能力批量蒸出来喂给自己的模型。
Anthropic除了打官司,还直接在 API 层面把这条路焊死。
这很 Anthropic。
6 月 Fable 5 发布时,它就在 319 页系统卡里埋了防蒸馏机制,怀疑你拿输出训练竞品,不警告、不提示,直接悄悄把回答质量调低。
当时还因为安全分类器误伤太狠被全网吐槽,分析代码被切模型、生物医学研究者直接没法用,官方宣称不到 5% 的触发率,体感完全不是 5%。
这次 5.1 显然吸取了教训,网络安全防护的误拦截次数较 Fable 5 减少约 60%,基础生物学和医疗问题的误拦截率降了 85%。
另外还有两个合规动作:为满足欧盟《人工智能法案》,Fable 5.1 的文本输出将带不可见水印,检测 API 首批向监管机构、媒体和事实核查组织开放。
Enterprise Frontier Safeguards 则让企业把数据留在自己的云里、自己负责人工审查,实现接近"零数据保留",今年秋季分阶段上线。
Anthropic 正处在 IPO 前夜,年化营收首次冲破 650 亿美元。这个时间点拿出一款"能力翻倍、价格不动、蒸馏焊死"的模型,是给用户的礼物,更是给投资人的路演。
![]()
小结
上半场比谁更聪明,下半场比三件事,谁能连续工作几十小时不跑偏,谁能把同一分数卖出半价,谁能在放开能力的同时守住模型不被抄走。
Anthropic 这场一口气全押了。
Fable 5.1还是目前最好的大模型,因为它能干别家干不到的事,作为生产力工具时,你别无选择。
•END•
欢迎点击奇偶工作室,看最新视频~
Question. Write.Narrate. Believe. Become a story.易简传媒的愿景是提问和传播商业故事,让读者更开阔,更聪明。有 2500 万微信粉丝关注我们的账号,欢迎大家关注:
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.