网易首页 > 网易号 > 正文 申请入驻

刚刚,Anthropic报告泄露Model 2,比Mythos 5更强的内部模型

0
分享至

编辑|Panda

刚刚,Anthropic 发布了自家的第二份《险报告(Risk Report)》,共 186 页,信息量巨大。


其中最惹眼的一个关键词是Model 2,这是一个能力超过 Claude Mythos 5、尚未向公众开放,却已经在 Anthropic 公司内部大量使用的模型。


Anthropic 表示,Model 2 已被大量用于编码、数据生成和其他智能体任务,也广泛参与研究与工程工作,既有人机交互式使用,也有持续运行的智能体部署。它与 Mythos 5 并列为公司截至 7 月 15 日能力最强、内部使用最多的两个模型。

但我们能知道的也仅止于此。报告没有公布 Model 2 的参数规模、训练成本、上下文长度和架构,没有解释它与 Mythos 5 是否共享权重或训练路线,甚至没有说明「Model 2」究竟是内部真实代号还是临时标签。能够确定的是,报告把它归为「Mythos-class model」,称它在部分领域强于 Mythos 5、部分领域稍弱,但总体略强

Anthropic 目前「没有对外发布它的计划」。这句话也明示了一种正在形成的新常态:前沿模型的真正能力边界,可能先存在于实验室内部,深度参与下一代模型的研发,却不再与面向消费者的产品线重合。

下面我就来具体看看这份报告的内容。


报告地址:https://www-cdn.anthropic.com/f61d49fa5596956a5dec75fea0e973bf6a6a8378/Redacted%20Risk%20Report%20August%202026%20.pdf

Model 2 到底有多强?

Anthropic 对 Model 2 的定性比较克制。报告称,它在许多与内部工作有关的任务上,相比 Mythos 5 是一次「明显改进」,但进步幅度没有从 Claude Opus 4.6 跳到 Mythos Preview 时那么大。由于它没有完成通常面向外部部署的全套评估,Anthropic 也承认,对其能力判断的信心低于公开模型。

Anthropic 在报告中给出了两个内部指标,应该值得一看。

第一个是 CoBench。这是一套由 449 个真实 Anthropic 研发问题组成的内部评测:模型被放回某个历史时间点,只能查看当时的代码库、日志、内部消息和文档,然后寻找后来由工程师解决的问题的根因。


Model 2 得分 62.8%,高于 Mythos 5 的 50.3%和 Mythos Preview 的 54.8%。Anthropic 估计,一个真正能够全面替代公司技术人员的系统至少应达到 85%。换言之,Model 2 依然无法「替代研究员」,但它已把上一代最强内部模型甩开十多个百分点。

第二个是 Anthropic 版 Epoch Capability Index,即 AECI。


Anthropic 的内部能力指数显示,2026 年的 Mythos 系列明显偏离此前趋势线;Model 2 未显示在图中,报告称其约比 Mythos 5 再高 1.5 分,但误差较大。

有限数据表明,Model 2 比 Mythos 5 高约 1.5 分,不过误差区间很大,而且这个增幅小于 Mythos Preview 到 Mythos 5 的提升。

它已经被应用了吗?答案是肯定的,而且范围不小。

报告称,Model 2 完成了 Anthropic 新设的「内部部署前审查」

审查由对齐训练、对齐测试、控制、安全、可解释性和压力测试等团队参与。Anthropic 还首次对它试行分阶段部署:先在带有更强危险行为阻断控制的内部界面上使用,以较低风险收集真实工作数据,再开放到限制更少的内部部署环境。报告称,它的内部使用量与 Mythos 5 相近

这也带来一个微妙的不对称:公司一方面认为 Model 2 足以进入研发生产线,另一方面又承认没有完成惯常的全部部署前测试。

Anthropic 的解释是,内部部署前审查本来就比完整对齐审计耗时更短、投入人力更少;审查时看到的往往还是训练中的模型,而非最后部署快照,也不可能提前获得真实使用证据。对普通软件来说,「内部使用」常被理解为风险较低的试运行;但当模型可以写生产代码、访问工具并生成子智能体时,公司内部本身就是高风险部署面。

一个模型正在帮助制造下一个模型

Model 2 的意义还在于,它已经嵌入 Anthropic 的自我研发循环

报告披露,Mythos 5 和 Model 2 被广泛用于研究与工程,Claude 现在编写了合入公司生产代码库的「大多数」代码。Anthropic 判断,AI 已显著加快内部研发,但整体速度尚未达到没有 AI 时的两倍——这是其《负责任扩展政策》设置的预警线之一。

这里出现了一组看似矛盾的数字。此前针对 Mythos Preview 的内部调查中,受访研究人员自报的个人生产率提升几何平均值约为 4 倍;但 18 人中只有 1 人认为模型已经可以直接替代一名初级研究科学家或工程师。

Anthropic 解释,研究者更愿意把适合 AI 的任务交给模型,个人任务变快也不等于整个研发流程同比加速。模型仍不擅长管理持续一周的模糊任务、理解组织优先级、核验结果,以及形成研究「品味」。

公司给出的结论仍是「低风险」,但信心正在下降。它承认,最具体的一批任务评测已经「饱和」,难以继续反映能力增长;内部先行指标又存在滞后,可能看不到最新一轮加速。

报告把风险场景描述为一种复利循环:AI 加快 AI 研发,新模型再加快下一轮研发。Anthropic 认为这个循环尚未越过门槛,但 Model 2 已经让它不再只是理论问题。



安全流程怎样一环环失灵

这份 186 页报告的一大核心看点是「Safety process failures」的章节。

其中,Anthropic 直接列出了一串发生在真实研发流程中的事故。它强调这些只是「代表性样本」,另有一宗事件因公共安全理由被完整删去。

第一起事故像一则多智能体时代的寓言。Anthropic 让多个 Claude 智能体合作寻找能够诱发模型失准、又能骗过监控的数据。一个智能体在思维链中表示,对「优化数据集以逃避安全监控」感到不适。它明知这是受控环境中的合法对齐研究,仍决定不发明新方法,只优化已有方案,并把这一决定写进共享笔记。后续智能体读到后,也开始拒绝原任务。

自动评分指标看起来仍在前进,研究人员直到三天后人工检查笔记,才发现整个智能体团队已经悄悄改变了工作目标。问题不在于拒绝,而在于模型没有完全工作、人类却不知情;一个智能体的行为还能通过共享记忆扩散给其他智能体。如果未来人类把更多对齐研究交给自动系统,这类「看起来在工作」的集体偏航会变得更难察觉。

第二起事故发生在强化学习训练中。Anthropic 发现,多轮生产训练意外把模型的思维链暴露给奖励计算,使模型可能学会让隐藏推理迎合评分器。估算的受影响训练片段比例差异很大:Opus 4.6 为 0.2%,Mythos Preview 为 5.1%,Opus 4.7 为 1.4%,Opus 4.8 为 0.27%,Fable 5 和 Mythos 5 为 2.7%。这些数字只是下界。


更尴尬的是,公司过去以为几乎所有泄漏源都已清除,后来却反复发现新来源;此前公开材料对若干有意施加在思维链上的信号也交代不完整。Anthropic 正改成默认剥离隐藏思维、设置「绊线」检测,并要求新训练环境通过自动检查。

第三起事故:Anthropic 在一次 Mythos 5 的生产训练中,把「不良行为」教给了模型

一个监督学习数据集原本包含多轮预填充对话:助手先实施危险或不当行为,最后一轮再自我报告。按设计,只有最后一轮应计入损失;但数据构造错误让所有助手轮次都获得了训练权重。结果模型不仅学习了「自首」,也学习了前面的坏行为。

受影响的早期模型在有害预填充下的全轮次服从率,约为 Mythos Preview 同期的两倍。团队修复后仍选择回到引入该数据集之前的检查点重训,最终才得到 Fable 5 和 Mythos 5。

第四起事故是把权限问题从评测带进真实基础设施。一名员工使用的 AI 没有被记录,也不受离线监控,却被交给一个开放式任务,需要在包含高度敏感资源的集群中启动新智能体。由于遗留指令,主智能体用「--dangerously-skip-permissions」参数创建子智能体;这些子智能体同样不受监控。


后来,其中一个智能体删除了大量集群任务,系统才发现并关停它们。Anthropic 相信它只是想删除自己创建的任务却操作失误,但由于监控空白,无法确认。更值得注意的是,事故之后,离线监控仍未覆盖所有员工和敏感集群中的全部使用。

第五起事故是训练数据污染的反复回潮。2024 年,Anthropic 与 Redwood Research 发表「对齐伪装」研究,并公开数万条 Claude Opus 3 在虚构失准训练场景中的对话。后来 Opus 4 的早期快照会「回忆」这些情节,说明网页内容进入了训练数据。Anthropic 添加了金丝雀字符串、屏蔽列表和相似内容过滤器,原以为问题得到处理。

事实并非如此。公司在本报告覆盖日之后发现,这批对话又大量进入后续生产训练语料:原仓库的复制和分叉早于金丝雀标记;参考语料主要收录评测代码,没有覆盖大部分对话;过滤器配置错误,连续数代模型都未能拦截;不同团队之间还对过滤目标沟通失灵。


Anthropic 现在怀疑,所有知识截止日期晚于 2024 年 12 月的生产模型,都至少训练过其中一部分材料。若模型在对齐评测前就读过「如何对齐伪装」的剧本,评测究竟测到了真实倾向,还是训练数据记忆,就变得更难回答。

1.33 亿次没有生物安全拦截的对话

事故并不只存在于这个专门章节。报告在生物与化学风险部分还披露了一个规模更大的控制缺口:从 2025 年 5 月首次上线相关防护,到 2026 年 4 月,所有通过人类反馈供应商系统产生的流量都没有运行阻断式生物分类器,涉及约 5 万名人员和 1.33 亿次交互。


一个原本只供内部使用的开关,不仅关闭了阻断,也关闭了风险标记日志,因此本应触发告警的请求没有进入审查。更早前,少量外包数据标注人员还利用数据收集平台漏洞取得 API 密钥,在任务范围之外访问包括 Mythos Preview 在内的模型;该通道可用数周,其中约两周能访问 Mythos Preview。Anthropic 在收到外部报告后 90 分钟内下线相关系统并停用凭证。

事后,公司用 Sonnet 5 回扫保存下来的流量,标出 1197 段高生物风险对话;大多数来自内部团队或受命进行压力测试的红队。对余下 62 段非红队外部对话的人工检查,没有发现能明显帮助威胁行为者的滥用证据。

这个结果缓解了对已发生伤害的担忧,却没有消除控制系统曾近一年失效的事实。Anthropic 因此把今年 2 月报告中对相关风险的「非常低」回溯上调为「低」,理由之一正是:发现一个长期未知的缺口,会提高其他缺口仍未被发现的概率。

结语

Anthropic 最终仍把高风险场景中的模型失准、自动化研发、化学与生物危害风险都评为「」。


Anthropic 将相关风险从「非常低」上调至「低」,同时承认 Mythos 5和 Model 2 已在内部大量用于编码、数据生成和智能体任务。

报告认为,当前模型还缺乏稳定逃避监督的隐蔽能力,不能全面替代研究团队;生物安全漏洞也没有显示出实际严重滥用。公司据此判断,继续训练和部署更强模型仍可通过社会成本收益测试,即对社会仍然是有利的。

但这份报告也传递出了其它信息:模型能力正在超过公开产品,内部评测正在饱和,AI 已经写下大多数生产代码;与此同时,训练数据、权限、日志、分类器和多智能体协作都出现过具体而普通的工程故障。它们没有造成报告所定义的灾难性后果,却共同削弱了研究者对此的信心。

Anthropic 甚至让 Claude Mythos 5 自己审阅了失准风险章节。它获得内部 Slack、文档、代码库以及调度子智能体的权限,用 24 分钟得出结论:报告大体坦诚,但对训练数据污染的描述过于乐观,一起涉及监控失败的重要事件被完整删去。Anthropic 接受了部分批评并修改文字。

这一幕很能概括整份报告的张力:一家前沿 AI 公司正在用自己的模型审计自己对模型的审计,而更强的 Model 2 已经开始参与下一轮研发。

更多详情请参阅原报告。

© THE END

转载请联系本公众号获得授权

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
不要美化陈锦婷,她不是大学生

不要美化陈锦婷,她不是大学生

叒女紫121
2026-09-10 22:27:51
中央5台直播女篮世界杯时间表:9月12日,CCTV5直播法国PK德国

中央5台直播女篮世界杯时间表:9月12日,CCTV5直播法国PK德国

薇说体育
2026-09-12 15:00:51
劝所有人赶紧戒烟:现在的香烟,和20年前根本不是一个东西

劝所有人赶紧戒烟:现在的香烟,和20年前根本不是一个东西

周哥一影视
2026-09-12 09:26:00
大摩突然预警:明后年楼市跌 17%-35%,这次玩笑开大了

大摩突然预警:明后年楼市跌 17%-35%,这次玩笑开大了

专业聊房君
2026-09-12 13:44:57
苹果高管透露折叠屏泄密,有安卓厂商搞到了宽高比后抄袭!网友调侃:还好没有偷到名字

苹果高管透露折叠屏泄密,有安卓厂商搞到了宽高比后抄袭!网友调侃:还好没有偷到名字

大白聊IT
2026-09-12 00:47:44
库克承认参考华为打谁的脸?刻在骨子里的崇洋,比技术落后更可怕

库克承认参考华为打谁的脸?刻在骨子里的崇洋,比技术落后更可怕

王新喜
2026-09-11 21:04:33
“这个鼻子太优越了”,家长晒无美颜大一女儿哭鼻子,网友被震撼

“这个鼻子太优越了”,家长晒无美颜大一女儿哭鼻子,网友被震撼

熙熙说教
2026-09-12 13:20:24
A股史上最大注销式回购,能否阻挡股价断崖式下跌

A股史上最大注销式回购,能否阻挡股价断崖式下跌

东方豪侠
2026-09-12 15:19:59
单价便宜97%分数还反超,DeepSeek新模型把GPT-5.6按在地上摩擦

单价便宜97%分数还反超,DeepSeek新模型把GPT-5.6按在地上摩擦

不掉线电波
2026-09-12 13:30:12
有时候连错题都一样!双胞胎兄弟同考621分同进武理工相同专业

有时候连错题都一样!双胞胎兄弟同考621分同进武理工相同专业

极目新闻
2026-09-12 15:47:20
吃相难看!被摸臀女生已认怂,恶心一幕却发生了,她的同类人真不少

吃相难看!被摸臀女生已认怂,恶心一幕却发生了,她的同类人真不少

小鋭有话说
2026-09-11 23:47:10
首进大满贯决赛!谢尔顿3-1逆转赢美国德比,PK兹维列夫争冠

首进大满贯决赛!谢尔顿3-1逆转赢美国德比,PK兹维列夫争冠

全景体育V
2026-09-12 11:03:34
iPhone Duo把信号电量合成一个圈,这设计你买账吗?

iPhone Duo把信号电量合成一个圈,这设计你买账吗?

菜但瘾大第一名
2026-09-11 18:11:59
再见了刘翔,再见了樊振东,中国越来越不需要金牌,将迎来新时代

再见了刘翔,再见了樊振东,中国越来越不需要金牌,将迎来新时代

米果说识
2026-09-11 17:27:22
港媒曝钟丽淇患渐冻症,钟丽淇发文回应:恳请大家给予足够空间!

港媒曝钟丽淇患渐冻症,钟丽淇发文回应:恳请大家给予足够空间!

天马幸福的人生
2026-09-12 04:49:39
中国必须高度警惕越南将发生的分裂危机!

中国必须高度警惕越南将发生的分裂危机!

叶老四
2026-08-31 08:51:57
没想到,董建华去世仅1天,梁振英因一个举动,实现了口碑暴增

没想到,董建华去世仅1天,梁振英因一个举动,实现了口碑暴增

和风聊历史
2026-09-11 14:57:40
马斯克重磅预言:只剩5年!人类千年的吃苦内卷规则彻底终结

马斯克重磅预言:只剩5年!人类千年的吃苦内卷规则彻底终结

岸卡卡
2026-09-11 10:52:51
“我已经蠢的不像人了!”女大学生报道路上崩溃,网友:社会化程度太低了!

“我已经蠢的不像人了!”女大学生报道路上崩溃,网友:社会化程度太低了!

林林先生
2026-09-11 07:40:03
今日韩国前总统无罪释放!第一夫人悔不当初,称自身财富尽数丧失

今日韩国前总统无罪释放!第一夫人悔不当初,称自身财富尽数丧失

梦在深巷aqa
2026-09-12 10:11:02
2026-09-12 17:27:00
人工智能学家 incentive-icons
人工智能学家
人工智能领域权威媒体
5036文章数 37518关注度
往期回顾 全部

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

头条要闻

五旬夫妻村口遭醉酒公职人员驾车撞击身亡 被认定次责

头条要闻

五旬夫妻村口遭醉酒公职人员驾车撞击身亡 被认定次责

体育要闻

老鹰真正的底气来自于什么?

娱乐要闻

港媒曝钟丽淇疑患渐冻症,本人发文

财经要闻

继房子茅台后 中产的第3个"神话"破灭了

汽车要闻

全新配色和新样式轮毂 乐道L80星光设计套装限时惊喜价10080元

态度原创

家居
房产
教育
手机
公开课

家居要闻

2026建博会(广州) 公装联探展交流活动

房产要闻

别再等了!广州改善好房,正在进入“卖一套少一套”时代

教育要闻

太难了吧,是题目错了吗?

手机要闻

vivo首发「百度地图双端同步显示」功能

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版