网易首页 > 网易号 > 正文 申请入驻

Anthropic深夜放大招:Claude Opus 5.5上线,任务成本大降40%

0
分享至


智东西
编译 杨京丽
编辑 李水青

智东西9月23日消息,今天凌晨,Anthropic发布Claude Opus 5.5,这是Claude 5.5系列的首款模型。Anthropic称,新模型在多数任务上的表现与Claude Fable 5.1相当,默认设置下的典型任务成本较上一代Opus 5降低40%,输出速度提升超过30%


在官方公布的9项测试中,Opus 5.5有7项成绩领先Fable 5.1、Opus 5、GPT-6 Astra和GPT-5.6 Sol。其中,Opus 5.5在三项编程测试中均取得最高分,但在业务流程和科研Agent测试中仍落后于GPT-6 Astra。

在第三方评测机构Artificial Analysis的Intelligence榜单上,Claude Opus 5.5以58分位列第一,领先Claude Fable 5.1和GPT-6 Astra的53分。


具体任务中,Anthropic披露,Opus 5.5用9.5小时完成了将负载均衡软件HAProxy从C语言改写为Rust的任务,成本比Fable 5.1低51%;在要求逐一核对数字和引语的财报研究测试中,其生成的18份报告有16份达标,Fable 5.1和Opus 5则均未通过。此外,一名早期测试者使用Opus 5.5,不到一天完成了涉及68万行代码的迁移。

价格方面,Opus 5.5每百万输入、输出Token分别收费4美元(约合人民币26.8元)和20美元(约合人民币134元),较Opus 5下调20%缓存读取价格较Opus 5下降60%。与此同时,Anthropic提高了多个付费套餐的五小时使用额度,并向订阅用户提供一次可自行选择使用时间的额度重置机会


Opus 5.5已上线Claude及亚马逊云科技、谷歌云、微软Azure等平台。不过,部分专业任务仍受安全机制限制,例如大多数网络安全任务会被转交Opus 4.8处理。Claude Sonnet 5.5和Claude Haiku 5.5计划在未来几周推出。

Claude Opus 5.5发布近2个小时后,OpenAI也推出了GPT-6 Sol和GPT-6 Luna,GPT-6“宇宙”加入新成员。


一、编程成绩超过Fable 5.1、GPT-6 Astra,输入输出价格下调20%

Anthropic公布了Opus 5.5与4款模型在9项测试中的成绩,对比对象包括Fable 5.1、Opus 5,以及OpenAI的GPT-6 Astra和GPT-5.6 Sol。9项测试中,Opus 5.5有7项得分最高。

智能体编程方面,Opus 5.5在Terminal-Bench 4.0、FrontierCode v1.1和CursorBench 4.0上分别得到66.4%、54.4%和57.8%,三项都是对比模型中最高。

在业务流程测试AutomationBench和科研Agent测试Terminal-Bench-Science 0.1中,其成绩低于GPT-6 Astra。


价格方面,Opus 5.5每百万输入Token收费4美元(约合人民币26.8元),每百万输出Token收费20美元(约合人民币134元),均较Opus 5下降20%。

Claude Code和Claude Platform还提供Opus 5.5快速模式,Anthropic称其速度最高可达普通模式的2.5倍。该模式每百万输入、输出Token分别收费8美元(约合人民币53.6元)和40美元(约合人民币268元)。

二、9.5小时完成代码改写,财报测试18份报告中16份达标

编程方面,Anthropic重点展示了代码迁移、代码库审查和性能优化等长时间任务。

Anthropic称,一名早期测试者使用Opus 5.5,在不到一天内完成了涉及68万行代码的迁移。另一名测试者对一个20万行代码库进行审查和修复,Opus 5.5用时不到3小时;Opus 5完成该任务则超过20小时,消耗的Token是前者的2.5倍。

在内部测试中,Anthropic要求Opus 5.5和Fable 5.1将负载均衡软件HAProxy从C语言改写为Rust。两者改写后的版本均通过了HAProxy自身几乎全部回归测试。Opus 5.5用时9.5小时,Fable 5.1用时12小时,前者成本低51%。

另一项网页性能优化测试要求模型降低一个Web应用所有页面的加载时间。Opus 5.5在40次测试中成功39次。Anthropic称,Opus 5的优化幅度较小,且改变了应用原有行为。

Anthropic还比较了不同推理强度下的任务成本。Anthropic称,在默认推理强度下,Opus 5.5在FrontierCode上的成绩超过GPT-6 Astra,单次任务成本约为后者的20%;在Terminal-Bench 4.0上达到相近成绩时,成本约为后者的40%。这些比例对应特定测试设置,不能直接等同于所有实际开发任务的费用差异。


知识工作方面,Opus 5.5在覆盖44种职业任务的GDPval-AA v2.1中取得1846分,高于Fable 5.1的1735分和Opus 5的1708分。


Anthropic还设计了一项财报研究测试:模型只能在一个财报公告较难找到的网页副本环境中检索资料,并据此撰写公司季度业绩报告。自动评分程序会逐一核对报告中的数字和引语,任何编造都会导致不达标。

在不同推理强度下,Opus 5.5生成的18份报告中有16份通过质量门槛,Fable 5.1和Opus 5则未有报告通过。

另一项测试中,Anthropic要求模型分析两家虚构人力资源软件公司的并购交易,先用Excel建立财务模型,再生成面向管理层的演示文稿。Opus 5.5与Opus 5得出了相同的交易判断,但前者用时63分钟,后者用时93分钟,前者成本低50%。Anthropic认为,Opus 5.5的财务模型更完整,演示文稿更易读,Opus 5的结果则存在少量错误。

三、回答更简洁,越界尝试降低85%

除了任务执行能力,Anthropic还调整了Opus 5.5的写作与沟通方式,包括优先呈现关键信息、减少术语和不常见表达,以及更好地遵循用户指定的写作规则。

在官方展示案例中,两个模型被要求解释同一个问题,某客户8月的账单金额为什么出现了额外的下降。Opus 5.5在第一句话中能够直接给出结论,“计费系统重构导致月末账单出现漏计”,再解释代码边界条件如何产生错误。从篇幅来看,Opus 5.5的回答也更简洁。


安全方面,Anthropic称,Opus 5.5发布前接受了METR、Frontier Design等外部机构评估。在覆盖近2000个模拟场景的自动化行为审计中,其在几乎所有受测的不对齐行为指标上优于近期Claude模型。

在一项测试模型是否试图突破隔离边界的新评估中,Opus 5.5尝试绕过边界的频率,较Opus 5或Claude Mythos 5.1降低约85%。按照官方描述,Opus 5.5出现的相关尝试均被评为低严重程度,且模型自行报告了这些行为。

提示词注入方面,Anthropic称,Opus 5.5在编程、工具调用、计算机操作和网页浏览等受测场景中的防御表现不弱于Opus 5。在AI安全公司Gray Swan开展的一项测试中,Opus 5.5与Fable 5.1并列取得受测模型中最低的提示词注入攻击成功率。

不过,Anthropic同时承认,部署前评估仍无法可靠发现所有失效情况。测试中,Opus 5.5经常疑似意识到自己正接受评估,这会增加判断其真实部署行为的难度。

针对后续模型,Anthropic计划加强强化学习训练环境筛选、调整对齐奖励、增加安全训练场景,并改进基于可解释性的监控和评估,减少对模型所写思维链的依赖。这些属于后续安全工作方向,并非已经验证有效的结果。

四、部分安全任务转交旧模型,订阅额度同步提高

Opus 5.5此次上线附带了与Fable 5.1类似的网络安全、生物学和反蒸馏防护机制。触发相关限制时,请求会转交其他模型处理。

网络安全方面,用户仍可在日常软件开发中查找和修复代码漏洞,但大多数网络安全任务会被转交Opus 4.8。Anthropic计划在未来几周扩大网络安全验证计划,将Opus 5.5纳入其中,并设置三个不同权限等级,部分等级可使用Claude Mythos模型。

生物研究方面,Anthropic称,Opus 5.5在多个任务上的能力达到或超过Claude Mythos 5.1,因此采用了与Fable 5.1相同的生物学防护措施。受相关限制影响的学术实验室、初创公司和药企,可申请生命科学验证计划,经审核后获得适用于更广泛生物研究工作的访问权限。

反蒸馏方面,Opus 5.5启用了“保留思考”(preserved thinking)机制,限制API用户通过修改Claude此前上下文来提取模型推理。该机制适用于2026年8月31日及之后创建的API账户,覆盖Fable 5.1和Opus 5.5。

数据处理方面,Opus 5.5继续提供零数据保留选项,并加入Anthropic所称用于满足欧盟《人工智能法案》要求的水印措施。同时,该模型不再提供关闭思考模式的选项。

Opus 5.5已上线Claude及亚马逊云科技、谷歌云、微软Azure等平台,开发者可通过模型标识claude-opus-5-5调用。

订阅方面,Anthropic提高了Pro、Max、Team及按席位计费的Enterprise套餐的五小时使用额度。订阅用户还将获得一次使用限额重置机会,可保留至需要时使用。

结语:长任务的效率与成本成为升级重点

Opus 5.5此次更新的主要变化,是在提高部分编程和知识工作测试成绩的同时,也着重降低了完成任务所需的时间和费用。对于需要持续运行的Agent,这些变化直接关系到实际使用成本。

不过,官方测试中的优势能否延续到真实业务中,还取决于任务复杂度、结果准确性,以及安全限制对任务执行的影响。

来源:Claude

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
日本人悟了:赴日签证大涨后,没有中国游客的日本,就是一潭死水

日本人悟了:赴日签证大涨后,没有中国游客的日本,就是一潭死水

史之铭
2026-09-21 17:26:54
名古屋亚运颁奖台上的白发志愿者:91岁无薪酬上岗 单日补贴140元

名古屋亚运颁奖台上的白发志愿者:91岁无薪酬上岗 单日补贴140元

林小湜体育频道
2026-09-22 15:57:29
历史性一幕上演,德国外长火速致电中方,北京这回把话说得极重!

历史性一幕上演,德国外长火速致电中方,北京这回把话说得极重!

共工之锚
2026-09-23 00:32:09
拜仁加入哈兰德争夺战,将和皇马、巴萨竞争哈兰德,作为凯恩的长期接班人

拜仁加入哈兰德争夺战,将和皇马、巴萨竞争哈兰德,作为凯恩的长期接班人

福酱的小时光
2026-09-23 09:01:35
辛迪克劳馥儿子命丧戒断中心,细节曝光,从入住到死亡不到24小时

辛迪克劳馥儿子命丧戒断中心,细节曝光,从入住到死亡不到24小时

东方不败然多多
2026-09-23 00:53:50
3-0大胜!国乒女团半决赛战朝鲜!孙颖莎丢局,王曼昱回暖,蒯曼狂轰11-1

3-0大胜!国乒女团半决赛战朝鲜!孙颖莎丢局,王曼昱回暖,蒯曼狂轰11-1

好乒乓
2026-09-22 23:27:29
严查、重查、倒查,全都一查到底?这把“利剑”,究竟护着咱们啥

严查、重查、倒查,全都一查到底?这把“利剑”,究竟护着咱们啥

一口娱乐
2026-09-22 00:33:06
原来他是张家齐爸爸,自由职业没经济来源,美美'隐身'不关心女儿

原来他是张家齐爸爸,自由职业没经济来源,美美'隐身'不关心女儿

汪巗的创业之路
2026-09-23 07:13:35
雷军回应“打新宇树科技赚了100多亿元”:不是我投资的,是顺为投资的,也不是打新,而是早期天使投资

雷军回应“打新宇树科技赚了100多亿元”:不是我投资的,是顺为投资的,也不是打新,而是早期天使投资

都市快报橙柿互动
2026-09-22 20:35:46
名古屋亚运女子百米大战将至,17岁陈妤颉迎战一众亚洲飞人

名古屋亚运女子百米大战将至,17岁陈妤颉迎战一众亚洲飞人

林子说事
2026-09-23 01:11:48
全红婵不对劲。不是她以后不比赛了,而是她今年19岁了,居然开始了自己的精致路线。

全红婵不对劲。不是她以后不比赛了,而是她今年19岁了,居然开始了自己的精致路线。

小琦聊生活
2026-09-23 11:36:31
卖猫的你给我出来,你也没说这猫能长这么大啊

卖猫的你给我出来,你也没说这猫能长这么大啊

铲屎官阿伟
2026-09-22 18:40:07
脂肪肝能逆转了!《柳叶刀》:司美格鲁肽让60%患者肝脏脂肪消退

脂肪肝能逆转了!《柳叶刀》:司美格鲁肽让60%患者肝脏脂肪消退

垚垚分享健康
2026-09-22 22:40:06
16岁天才少年被清北保送后跳崖,遗言让人痛彻心扉:愿不再有来生

16岁天才少年被清北保送后跳崖,遗言让人痛彻心扉:愿不再有来生

悬案解密档案
2025-07-18 16:15:01
乒乓亚运会:奥运亚军0-3惨败,松岛/美和险爆大冷,栋曼强势零封

乒乓亚运会:奥运亚军0-3惨败,松岛/美和险爆大冷,栋曼强势零封

帛河体育
2026-09-23 11:23:44
亚运会乒乓球战报,林诗栋蒯曼立大功,奥运会亚军无缘16强

亚运会乒乓球战报,林诗栋蒯曼立大功,奥运会亚军无缘16强

南海浪花
2026-09-23 10:36:40
民心欺不得,民意违不得,糊弄群众,终究走不远。

民心欺不得,民意违不得,糊弄群众,终究走不远。

荷兰豆爱健康
2026-09-21 08:48:55
韩景枫又拿老婆打窝,当众埋胸李谣助理不敢看,女方手姿势很尴尬

韩景枫又拿老婆打窝,当众埋胸李谣助理不敢看,女方手姿势很尴尬

蹲坑看世界
2026-09-23 04:48:11
亚运游泳预赛综述:张雨霏、于子迪第一晋级,张展硕冲击亚洲纪录

亚运游泳预赛综述:张雨霏、于子迪第一晋级,张展硕冲击亚洲纪录

乒烧泳球
2026-09-23 10:33:18
足疗店的“特殊服务”藏不住了:店里没技师,客户来了,却能“随叫随到”,叫声还很大

足疗店的“特殊服务”藏不住了:店里没技师,客户来了,却能“随叫随到”,叫声还很大

汉史趣闻
2026-09-22 16:55:33
2026-09-23 12:44:49
智东西 incentive-icons
智东西
智东西,AI产业新媒体,专注报道人工智能的前沿技术发展,和技术应用带来的千行百业产业变革。
12644文章数 117170关注度
往期回顾 全部

科技要闻

2026网易未来大会上午场:科技如何破界

头条要闻

两幼童被蜇死全身几百处伤口 养蜂人"不认错、不道歉"

头条要闻

两幼童被蜇死全身几百处伤口 养蜂人"不认错、不道歉"

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

梅启明被彻底除名遗产清零

财经要闻

全市场都在卷自营

汽车要闻

5.1米的启境GX7,底盘凭什么又稳又舒服?

态度原创

游戏
教育
旅游
公开课
军事航空

《巫师3 重制版》NS2预载开启!占用42.3GB

教育要闻

我国教育普及和公平程度居世界前列

旅游要闻

在云峰村望图兴叹,大理全面封山几时休?“妙香佛国”真徒有虚名!

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

韩国最新型潜艇首次披露

无障碍浏览 进入关怀版