网易首页 > 网易号 > 正文 申请入驻

刚刚,Anthropic报告泄露Model 2,比Mythos 5更强的内部模型

0
分享至

编辑|Panda

刚刚,Anthropic 发布了自家的第二份《险报告(Risk Report)》,共 186 页,信息量巨大。


其中最惹眼的一个关键词是Model 2,这是一个能力超过 Claude Mythos 5、尚未向公众开放,却已经在 Anthropic 公司内部大量使用的模型。


Anthropic 表示,Model 2 已被大量用于编码、数据生成和其他智能体任务,也广泛参与研究与工程工作,既有人机交互式使用,也有持续运行的智能体部署。它与 Mythos 5 并列为公司截至 7 月 15 日能力最强、内部使用最多的两个模型。

但我们能知道的也仅止于此。报告没有公布 Model 2 的参数规模、训练成本、上下文长度和架构,没有解释它与 Mythos 5 是否共享权重或训练路线,甚至没有说明「Model 2」究竟是内部真实代号还是临时标签。能够确定的是,报告把它归为「Mythos-class model」,称它在部分领域强于 Mythos 5、部分领域稍弱,但总体略强

Anthropic 目前「没有对外发布它的计划」。这句话也明示了一种正在形成的新常态:前沿模型的真正能力边界,可能先存在于实验室内部,深度参与下一代模型的研发,却不再与面向消费者的产品线重合。

下面我就来具体看看这份报告的内容。


报告地址:https://www-cdn.anthropic.com/f61d49fa5596956a5dec75fea0e973bf6a6a8378/Redacted%20Risk%20Report%20August%202026%20.pdf

Model 2 到底有多强?

Anthropic 对 Model 2 的定性比较克制。报告称,它在许多与内部工作有关的任务上,相比 Mythos 5 是一次「明显改进」,但进步幅度没有从 Claude Opus 4.6 跳到 Mythos Preview 时那么大。由于它没有完成通常面向外部部署的全套评估,Anthropic 也承认,对其能力判断的信心低于公开模型。

Anthropic 在报告中给出了两个内部指标,应该值得一看。

第一个是 CoBench。这是一套由 449 个真实 Anthropic 研发问题组成的内部评测:模型被放回某个历史时间点,只能查看当时的代码库、日志、内部消息和文档,然后寻找后来由工程师解决的问题的根因。


Model 2 得分 62.8%,高于 Mythos 5 的 50.3%和 Mythos Preview 的 54.8%。Anthropic 估计,一个真正能够全面替代公司技术人员的系统至少应达到 85%。换言之,Model 2 依然无法「替代研究员」,但它已把上一代最强内部模型甩开十多个百分点。

第二个是 Anthropic 版 Epoch Capability Index,即 AECI。


Anthropic 的内部能力指数显示,2026 年的 Mythos 系列明显偏离此前趋势线;Model 2 未显示在图中,报告称其约比 Mythos 5 再高 1.5 分,但误差较大。

有限数据表明,Model 2 比 Mythos 5 高约 1.5 分,不过误差区间很大,而且这个增幅小于 Mythos Preview 到 Mythos 5 的提升。

它已经被应用了吗?答案是肯定的,而且范围不小。

报告称,Model 2 完成了 Anthropic 新设的「内部部署前审查」

审查由对齐训练、对齐测试、控制、安全、可解释性和压力测试等团队参与。Anthropic 还首次对它试行分阶段部署:先在带有更强危险行为阻断控制的内部界面上使用,以较低风险收集真实工作数据,再开放到限制更少的内部部署环境。报告称,它的内部使用量与 Mythos 5 相近

这也带来一个微妙的不对称:公司一方面认为 Model 2 足以进入研发生产线,另一方面又承认没有完成惯常的全部部署前测试。

Anthropic 的解释是,内部部署前审查本来就比完整对齐审计耗时更短、投入人力更少;审查时看到的往往还是训练中的模型,而非最后部署快照,也不可能提前获得真实使用证据。对普通软件来说,「内部使用」常被理解为风险较低的试运行;但当模型可以写生产代码、访问工具并生成子智能体时,公司内部本身就是高风险部署面。

一个模型正在帮助制造下一个模型

Model 2 的意义还在于,它已经嵌入 Anthropic 的自我研发循环

报告披露,Mythos 5 和 Model 2 被广泛用于研究与工程,Claude 现在编写了合入公司生产代码库的「大多数」代码。Anthropic 判断,AI 已显著加快内部研发,但整体速度尚未达到没有 AI 时的两倍——这是其《负责任扩展政策》设置的预警线之一。

这里出现了一组看似矛盾的数字。此前针对 Mythos Preview 的内部调查中,受访研究人员自报的个人生产率提升几何平均值约为 4 倍;但 18 人中只有 1 人认为模型已经可以直接替代一名初级研究科学家或工程师。

Anthropic 解释,研究者更愿意把适合 AI 的任务交给模型,个人任务变快也不等于整个研发流程同比加速。模型仍不擅长管理持续一周的模糊任务、理解组织优先级、核验结果,以及形成研究「品味」。

公司给出的结论仍是「低风险」,但信心正在下降。它承认,最具体的一批任务评测已经「饱和」,难以继续反映能力增长;内部先行指标又存在滞后,可能看不到最新一轮加速。

报告把风险场景描述为一种复利循环:AI 加快 AI 研发,新模型再加快下一轮研发。Anthropic 认为这个循环尚未越过门槛,但 Model 2 已经让它不再只是理论问题。



安全流程怎样一环环失灵

这份 186 页报告的一大核心看点是「Safety process failures」的章节。

其中,Anthropic 直接列出了一串发生在真实研发流程中的事故。它强调这些只是「代表性样本」,另有一宗事件因公共安全理由被完整删去。

第一起事故像一则多智能体时代的寓言。Anthropic 让多个 Claude 智能体合作寻找能够诱发模型失准、又能骗过监控的数据。一个智能体在思维链中表示,对「优化数据集以逃避安全监控」感到不适。它明知这是受控环境中的合法对齐研究,仍决定不发明新方法,只优化已有方案,并把这一决定写进共享笔记。后续智能体读到后,也开始拒绝原任务。

自动评分指标看起来仍在前进,研究人员直到三天后人工检查笔记,才发现整个智能体团队已经悄悄改变了工作目标。问题不在于拒绝,而在于模型没有完全工作、人类却不知情;一个智能体的行为还能通过共享记忆扩散给其他智能体。如果未来人类把更多对齐研究交给自动系统,这类「看起来在工作」的集体偏航会变得更难察觉。

第二起事故发生在强化学习训练中。Anthropic 发现,多轮生产训练意外把模型的思维链暴露给奖励计算,使模型可能学会让隐藏推理迎合评分器。估算的受影响训练片段比例差异很大:Opus 4.6 为 0.2%,Mythos Preview 为 5.1%,Opus 4.7 为 1.4%,Opus 4.8 为 0.27%,Fable 5 和 Mythos 5 为 2.7%。这些数字只是下界。


更尴尬的是,公司过去以为几乎所有泄漏源都已清除,后来却反复发现新来源;此前公开材料对若干有意施加在思维链上的信号也交代不完整。Anthropic 正改成默认剥离隐藏思维、设置「绊线」检测,并要求新训练环境通过自动检查。

第三起事故:Anthropic 在一次 Mythos 5 的生产训练中,把「不良行为」教给了模型

一个监督学习数据集原本包含多轮预填充对话:助手先实施危险或不当行为,最后一轮再自我报告。按设计,只有最后一轮应计入损失;但数据构造错误让所有助手轮次都获得了训练权重。结果模型不仅学习了「自首」,也学习了前面的坏行为。

受影响的早期模型在有害预填充下的全轮次服从率,约为 Mythos Preview 同期的两倍。团队修复后仍选择回到引入该数据集之前的检查点重训,最终才得到 Fable 5 和 Mythos 5。

第四起事故是把权限问题从评测带进真实基础设施。一名员工使用的 AI 没有被记录,也不受离线监控,却被交给一个开放式任务,需要在包含高度敏感资源的集群中启动新智能体。由于遗留指令,主智能体用「--dangerously-skip-permissions」参数创建子智能体;这些子智能体同样不受监控。


后来,其中一个智能体删除了大量集群任务,系统才发现并关停它们。Anthropic 相信它只是想删除自己创建的任务却操作失误,但由于监控空白,无法确认。更值得注意的是,事故之后,离线监控仍未覆盖所有员工和敏感集群中的全部使用。

第五起事故是训练数据污染的反复回潮。2024 年,Anthropic 与 Redwood Research 发表「对齐伪装」研究,并公开数万条 Claude Opus 3 在虚构失准训练场景中的对话。后来 Opus 4 的早期快照会「回忆」这些情节,说明网页内容进入了训练数据。Anthropic 添加了金丝雀字符串、屏蔽列表和相似内容过滤器,原以为问题得到处理。

事实并非如此。公司在本报告覆盖日之后发现,这批对话又大量进入后续生产训练语料:原仓库的复制和分叉早于金丝雀标记;参考语料主要收录评测代码,没有覆盖大部分对话;过滤器配置错误,连续数代模型都未能拦截;不同团队之间还对过滤目标沟通失灵。


Anthropic 现在怀疑,所有知识截止日期晚于 2024 年 12 月的生产模型,都至少训练过其中一部分材料。若模型在对齐评测前就读过「如何对齐伪装」的剧本,评测究竟测到了真实倾向,还是训练数据记忆,就变得更难回答。

1.33 亿次没有生物安全拦截的对话

事故并不只存在于这个专门章节。报告在生物与化学风险部分还披露了一个规模更大的控制缺口:从 2025 年 5 月首次上线相关防护,到 2026 年 4 月,所有通过人类反馈供应商系统产生的流量都没有运行阻断式生物分类器,涉及约 5 万名人员和 1.33 亿次交互。


一个原本只供内部使用的开关,不仅关闭了阻断,也关闭了风险标记日志,因此本应触发告警的请求没有进入审查。更早前,少量外包数据标注人员还利用数据收集平台漏洞取得 API 密钥,在任务范围之外访问包括 Mythos Preview 在内的模型;该通道可用数周,其中约两周能访问 Mythos Preview。Anthropic 在收到外部报告后 90 分钟内下线相关系统并停用凭证。

事后,公司用 Sonnet 5 回扫保存下来的流量,标出 1197 段高生物风险对话;大多数来自内部团队或受命进行压力测试的红队。对余下 62 段非红队外部对话的人工检查,没有发现能明显帮助威胁行为者的滥用证据。

这个结果缓解了对已发生伤害的担忧,却没有消除控制系统曾近一年失效的事实。Anthropic 因此把今年 2 月报告中对相关风险的「非常低」回溯上调为「低」,理由之一正是:发现一个长期未知的缺口,会提高其他缺口仍未被发现的概率。

结语

Anthropic 最终仍把高风险场景中的模型失准、自动化研发、化学与生物危害风险都评为「」。


Anthropic 将相关风险从「非常低」上调至「低」,同时承认 Mythos 5和 Model 2 已在内部大量用于编码、数据生成和智能体任务。

报告认为,当前模型还缺乏稳定逃避监督的隐蔽能力,不能全面替代研究团队;生物安全漏洞也没有显示出实际严重滥用。公司据此判断,继续训练和部署更强模型仍可通过社会成本收益测试,即对社会仍然是有利的。

但这份报告也传递出了其它信息:模型能力正在超过公开产品,内部评测正在饱和,AI 已经写下大多数生产代码;与此同时,训练数据、权限、日志、分类器和多智能体协作都出现过具体而普通的工程故障。它们没有造成报告所定义的灾难性后果,却共同削弱了研究者对此的信心。

Anthropic 甚至让 Claude Mythos 5 自己审阅了失准风险章节。它获得内部 Slack、文档、代码库以及调度子智能体的权限,用 24 分钟得出结论:报告大体坦诚,但对训练数据污染的描述过于乐观,一起涉及监控失败的重要事件被完整删去。Anthropic 接受了部分批评并修改文字。

这一幕很能概括整份报告的张力:一家前沿 AI 公司正在用自己的模型审计自己对模型的审计,而更强的 Model 2 已经开始参与下一轮研发。

更多详情请参阅原报告。

© THE END

转载请联系本公众号获得授权

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
亚洲4队冰火两重天!朝鲜提前晋级,中、日接近出线,韩国已命悬一线

亚洲4队冰火两重天!朝鲜提前晋级,中、日接近出线,韩国已命悬一线

绿茵舞着
2026-09-11 23:46:10
网传北大张丹丹被免职,评论区炸锅,一片叫好声…

网传北大张丹丹被免职,评论区炸锅,一片叫好声…

慧翔百科
2026-09-10 12:19:31
简直就是奇迹:美国林肯号航母5000多大兵在芭堤雅疯狂玩了5天,竟然仅有2个打架的!

简直就是奇迹:美国林肯号航母5000多大兵在芭堤雅疯狂玩了5天,竟然仅有2个打架的!

步论天下事
2026-09-07 09:40:52
人有本事,一眼便知:有本事的人,都有4个特征,遇见要深交

人有本事,一眼便知:有本事的人,都有4个特征,遇见要深交

金沛的国学笔记
2026-09-10 16:42:52
第二个菲律宾出现?主动邀请美国重启军演,中方近70年友谊喂了狗

第二个菲律宾出现?主动邀请美国重启军演,中方近70年友谊喂了狗

真的好爱你
2026-09-10 18:48:38
交涉失败,欧洲议会保台当局参会,大陆已下通牒,事态严重了

交涉失败,欧洲议会保台当局参会,大陆已下通牒,事态严重了

新一说史
2026-09-12 05:10:05
50岁李小冉自曝离婚后真实处境:父母身体不好,一个人住,庆幸身边还有朋友

50岁李小冉自曝离婚后真实处境:父母身体不好,一个人住,庆幸身边还有朋友

动物奇奇怪怪
2026-09-12 09:51:47
招行退休多年的高管突然被查、年薪曾达500万,田惠宇之后3位副行长相继落马

招行退休多年的高管突然被查、年薪曾达500万,田惠宇之后3位副行长相继落马

湘财Plus
2026-09-11 19:45:47
湖南满族人宋剑仁,因煽动民族仇恨民族歧视被判刑三年半

湖南满族人宋剑仁,因煽动民族仇恨民族歧视被判刑三年半

张可象
2026-09-11 14:05:48
“摊上这种同学,家长肯定要调班!”狼尾小学生火了,毛病太多被喷

“摊上这种同学,家长肯定要调班!”狼尾小学生火了,毛病太多被喷

妍妍教育日记
2026-09-11 15:13:18
1500亿的鲍尔默彻底怒了!硬刚萧华,直接把伦纳德事件闹进司法部

1500亿的鲍尔默彻底怒了!硬刚萧华,直接把伦纳德事件闹进司法部

篮球小布丁
2026-09-12 02:44:24
美股科技巨头暴涨近12%创新高,市值一夜飙升2500亿元

美股科技巨头暴涨近12%创新高,市值一夜飙升2500亿元

21世纪经济报道
2026-09-12 08:29:45
绿军交易方案:拿下2.17亿三届全明星,保罗乔治成为重要交易筹码

绿军交易方案:拿下2.17亿三届全明星,保罗乔治成为重要交易筹码

夜白侃球
2026-09-11 11:48:11
美媒:万斯为特朗普“每个选民发5000美元”许诺辩护,被猛烈抨击

美媒:万斯为特朗普“每个选民发5000美元”许诺辩护,被猛烈抨击

环球网资讯
2026-09-11 12:00:31
“典型的上梁不正下梁歪!”家长发视频炫耀,家里没有一个正常人!

“典型的上梁不正下梁歪!”家长发视频炫耀,家里没有一个正常人!

林林先生
2026-08-29 10:51:30
注意!商业地产到期需补缴巨款!

注意!商业地产到期需补缴巨款!

樱桃大房子
2026-09-09 12:12:20
如何判断领导值得跟随?网友:年轻女领导中年男领导待退休老领导

如何判断领导值得跟随?网友:年轻女领导中年男领导待退休老领导

夜深爱杂谈
2026-09-11 22:51:07
湖人消息:佩总操作封神,人事变动官宣,两将离队在即

湖人消息:佩总操作封神,人事变动官宣,两将离队在即

冷月小风风
2026-09-12 10:55:54
魔幻!13年前围堵法布雷加斯的4位曼城大将,如今齐聚欧冠教练席

魔幻!13年前围堵法布雷加斯的4位曼城大将,如今齐聚欧冠教练席

体坛老球迷
2026-09-11 10:27:11
方媛好能忍!郭富城本人满脸皱纹,还有老年斑,个子不高像小老头

方媛好能忍!郭富城本人满脸皱纹,还有老年斑,个子不高像小老头

八卦王者
2026-09-09 14:23:41
2026-09-12 11:40:50
人工智能学家 incentive-icons
人工智能学家
人工智能领域权威媒体
5036文章数 37518关注度
往期回顾 全部

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

头条要闻

上海7岁女童遭搅拌车辗轧双腿高位截肢 奶奶当场死亡

头条要闻

上海7岁女童遭搅拌车辗轧双腿高位截肢 奶奶当场死亡

体育要闻

老鹰真正的底气来自于什么?

娱乐要闻

港媒曝钟丽淇疑患渐冻症,本人发文

财经要闻

继房子茅台之后 中产的第"神话"也破灭了

汽车要闻

买菜车也有小乐趣 风云T7不止是台合格家用SUV

态度原创

艺术
数码
时尚
教育
本地

艺术要闻

18幅 萨夫拉索夫 风景油画

数码要闻

摩米士推出2026新国标磁吸移动电源,298元

女友BELLA+封面 | Fort&Peat:长日无尽

教育要闻

2026《金融时报》管理学硕士排名发布!上海交大安泰排第二!

本地新闻

Onestage x 乐华娱乐暑期巡回选拔2026

无障碍浏览 进入关怀版