网易首页 > 网易号 > 正文 申请入驻

Claude Opus 5.5突袭!68万行代码一天迁完,API价格打8折

0
分享至

梦晨 听雨 发自 凹非寺
量子位 | 公众号QbitAI

Claude最新旗舰Opus 5.5跑分登顶!

在代码、知识工作、计算机操作等多项基准测试中拿下第一的同时,输出速度也比Opus 5快了30%以上



这暂停得好好的前沿,怎么不到两周又被推进了。



那CEO Dario Amodei发表的“放缓前沿”公开信算什么?

算他能发。



这届模型开始拿代码当画笔

目前看到比较新颖的测试是用纯代码生成图像,SVG鹈鹕骑自行车已经被刷爆了,这次是更复杂的Python渲染。



类似的能力可以扩展成用纯js代码生成渲染视频。

多项跑分登顶,API价格打8折

他们说任务成本降4成,但API价格并没有直接打6折

Opus 5.5的输入、输出价格分别是每百万Token 4美元20美元,相比Opus 5下降20%

再加上完成同一任务需要的步骤和Token更少,Anthropic测算,典型任务的总成本可以下降40%



真正下狠手的是缓存读取价。这一项从Opus 5的每百万Token 0.50美元,直接降到0.20美元,砍了60%

做Agent编程的都知道,长对话和大型代码任务需要反复读取上下文,缓存读取经常占据成本的大头。相比账面上的API单价,这一刀可能更有实际体感。

另外还有一个Fast mode,输出速度最高可达标准模式的2.5倍,价格也翻倍至每百万输入Token 8美元、输出Token 40美元,适合对延迟特别敏感的场景。

订阅用户也加量了,Pro、Max、Team和按席位收费的企业版,五小时使用限额都会提高;Anthropic还提供了一次可以暂存、由用户自行选择时间使用的rate limit reset。

具体看跑分,目前最新鲜的榜就是Terminal-Bench 4.0了,衡量模型处理复杂命令行任务的能力。

Opus 5.5拿下66.4%,上一代Opus 5是52.3%,OpenAI的GPT-6 Astra57.9%,Claude自家的Fable 5.155.8%

已经明显拉开差距。



在另一项编程基准FrontierCode v1.1上,Opus 5.5以54.4%超过GPT-6 Astra的53.3%,差距就没那么明显了。

而且推理effort开中档效果反而更好。

Opus 5.5在默认effort,也就是中档设置下,反而跑出了54.6%,超过表中其他模型的最高成绩,也略高于自己开到最高档时的54.4%



到了这个能力水平,0.2个百分点基本已经落在波动范围里。

Anthropic自己也承认,跑分差距越来越难准确反映真实使用体验,他们内部使用时,Opus 5.5和Fable 5.1的差距就没有榜单看起来这么大。

另一项CursorBench 4.0,测的是来自真实Cursor会话的多文件模糊任务。

最高effort下,Opus 5.5拿到57.8%,比Fable 5.1的51.8%6分,比GPT-5.6 Sol41.7%16.1分

如果看性价比,Opus 5.5在默认中档设置下得分52.5%,依然领先GPT-5.6 Sol的最高成绩约11分,单项任务成本只有后者的三分之一左右。

Opus 5.5特别强调在大规模代码库级别的任务上有明显提升。

早期测试者曾用它迁移68万行代码不到一天完成。换成人类工程团队,预计至少需要数周

还有一位测试者用它审计并修复一个20万行代码库,耗时不到3小时。同样的任务,Opus 5花了超过20小时,使用的Token数量还是它的2.5倍



在一项内部测试中,Anthropic让Opus 5.5和Fable 5.1分别将HAProxy从C语言重写成Rust。HAProxy是一款被广泛使用的Web流量负载均衡软件。

两个版本都通过了HAProxy自身几乎全部回归测试,但Opus 5.5只用了9.5小时,Fable 5.1用了12小时,前者的成本低了51%

Anthropic还让模型优化一个Web应用所有页面的加载速度。Opus 5.5在40次测试中成功了39次;Opus 5虽然也缩短了加载时间,但改进幅度更小,还改变了应用原本的行为。



知识工作方面同样值得关注。

在覆盖44个职业的真实工作能力评估GDPval-AA v2.1中,Opus 5.5得分1846 Elo,Fable 5.1是1735,Opus 5是1708

在默认effort设置下,Opus 5.5的得分就超过了GPT-6 Astra在最高effort下的表现,单项任务成本大约只有后者的五分之一

投资公司Walleye Capital反馈,Opus 5.5在最低设置下,就基本完成了他们的量化研究评测任务。

把effort调高后,它还发现评测指令里的分钟索引存在一个off-by-one错误,并主动修正。

模型甚至特意备注:这样处理是正确的,但可能会导致自己被评分器扣分。

Walleye称,此前测试过的所有模型,都没有发现并处理这个问题。

还有个明显变化在于:Opus 5.5说话的方式变了

以前Opus 5虽然也能找到答案,但很快就会钻进代码块、时间线和区间定义里,用户需要自己从大量技术细节中提炼结论。

Opus 5.5会先把最重要的信息摆出来,再解释原因。

官网展示了一个billing系统Bug的对比。Opus 5找到问题后,马上开始解释代码改动和时间区间;Opus 5.5开头就把账算清楚了:

额外减少的9.92美元来自一个Bug,免费层调整只占1.50美元



随后它才说明,究竟是哪次代码重构把每个月最后一天的大部分用量漏掉了。

一位早期测试者的评价是:

It writes the way I do(它写东西的方式跟我一样)。

Anthropic还特意强调,表达清楚不只是文风升级。模型把关键信息放在前面、减少术语和特异性表达,人类检查其结论和操作过程也会更加容易,这本身就是一项安全收益。

和Fable一个级别的笼子

能力往前冲,安全笼子也跟着加厚了。

Opus 5.5是首款同时搭载Fable 5.1同级网络安全、生物安全和反蒸馏护栏的Opus模型。触发相关限制后,系统会透明地回退到其他模型处理。

发布之前,它还接受了METR和Frontier Design两家外部机构的评估。

这也是Anthropic对“放缓前沿”的解释:模型照常研发和发布,但要给安全对齐和外部审查留出时间。

在Anthropic内部覆盖近2000个模拟场景的自动化行为审计中,Opus 5.5在几乎所有失调行为指标上,都拿到了近期Claude模型中的最好成绩。

在一项专门测试模型越过安全边界倾向的新评估中,Opus 5.5尝试规避边界的频率,比Opus 5和Claude Mythos 5.1低了约85%。

仅有的几次尝试也都属于低严重性事件,而且由模型自行上报。

不过Anthropic同时承认,他们观察到Opus 5.5经常怀疑自己正在接受评估

一旦模型知道“这是一场考试”,测试中的表现能否代表真实部署环境,就要打上一个问号。Anthropic称,目前仍然没有办法在发布前可靠地发现所有潜在问题。

在更实际的Agent防护上,Opus 5.5还配备了三层措施。

它会在执行前检查每一个操作;运行环境放在安全团队可以审计的开源沙箱中;代码审查功能则会在代码合并前检查漏洞。



面对提示注入攻击,Opus 5.5在Anthropic测试的编程、工具调用、计算机操作和网页浏览等场景中,都追平或超过了Opus 5。

这么厚的笼子,也和它在高风险领域的能力有关。

在生物学领域,Opus 5.5已经在多个方向追平甚至超过Claude Mythos 5.1,因此使用了与Fable 5.1相同的生物安全护栏。

在与Dyno Therapeutics合作开展的长期分子预测和设计评估中,Opus 5.5取得了进一步提升。参与红队测试的专家认为,其科学新颖性与他们测试过的最强模型相当。

经过审核的学术实验室、初创公司和制药企业,可以通过新推出的Life Sciences Verification Program,申请适用于生物研发工作的更宽松权限。

网络安全也是一样。

由于Opus 5.5的网络安全能力很强,普通用户提交的大多数网络安全任务会被自动转交给Opus 4.8。经过认证的网络安全从业者,则可以通过即将扩展的Cyber Verification Program申请使用Opus 5.5。

反蒸馏措施也直接上到了Fable 5.1的级别。

Opus 5.5搭载了preserved thinking机制,限制API用户编辑Claude此前生成的思考上下文,防止攻击者借此批量提取模型的推理能力。

这项限制适用于2026年8月31日及以后创建的API账户。

与此同时,Opus 5.5不再允许关闭thinking模式,输出文本中也加入了水印

这种水印不会直接显示在文本里,也没有添加隐藏字符。它通过调整模型在多个意思相近的词语之间如何选择,留下可供专用检测工具识别的统计模式,普通读者看不出区别。

OMT:Haiku终于更新了

在Sonnet、Opus和Fable都已经进入5系列之后,Claude家的“小杯”还停留在Haiku 4.5。

这次终于有准信了。



Anthropic宣布,Sonnet 5.5和Haiku 5.5都将在未来几周内推出,同样会获得性能、效率和安全方面的升级。

也就是说,Opus 5.5只是5.5系列的第一款。

OpenAI这边刚刚一口气端出GPT-6 Astra和GPT-5.6 Sol,Anthropic那边紧接着发布Opus 5.5,还预告后面有两款新模型排队。

前沿确实没有停,大家都在忙着踩油门啊~

参考链接:
[1]https://www.anthropic.com/claude-opus-5-5
[2]https://x.com/claudeai/status/2102435511222890900

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
日本推行65岁退休政策已久,然而实施之后,最终被证实是失败的

日本推行65岁退休政策已久,然而实施之后,最终被证实是失败的

你在偷看谁
2026-09-22 21:07:05
恩爱多年难敌现实,56岁工藤静香老态尽显,小2岁木村拓哉仍帅气

恩爱多年难敌现实,56岁工藤静香老态尽显,小2岁木村拓哉仍帅气

寒士之言本尊
2026-09-13 18:30:03
​​研究显示:地方卖地收入下滑,当地企业"招待费"反而上升

​​研究显示:地方卖地收入下滑,当地企业"招待费"反而上升

爆角追踪
2026-09-23 15:03:20
上课4天放假13天 四川一高校中秋国庆“拼”出超长假期

上课4天放假13天 四川一高校中秋国庆“拼”出超长假期

封面新闻
2026-09-16 11:25:04
令人羡慕的两种教师待遇:副高按照5档退休和退休后发放住房补贴

令人羡慕的两种教师待遇:副高按照5档退休和退休后发放住房补贴

郭爱华追问教育
2026-09-23 06:12:06
余依婷获亚运会女子100米蝶泳金牌

余依婷获亚运会女子100米蝶泳金牌

上观新闻
2026-09-23 16:24:42
你们家那个拖后腿的人是谁?网友:正常情况祖坟不能一直冒青烟!

你们家那个拖后腿的人是谁?网友:正常情况祖坟不能一直冒青烟!

带你感受人间冷暖
2026-09-18 00:05:21
中方专机还没到,“对华友好”先在美刷屏,鲁比奥:华盛顿没得选

中方专机还没到,“对华友好”先在美刷屏,鲁比奥:华盛顿没得选

浮黎礼
2026-09-23 07:27:14
周琦主动请战却被拒!郭士强的选人标准,为何对余嘉豪不适用?

周琦主动请战却被拒!郭士强的选人标准,为何对余嘉豪不适用?

林小湜体育频道
2026-09-23 17:00:33
听妈话从5楼往下扔快递给快递员 15岁女孩不幸坠亡 父母起诉快递公司索赔74万元

听妈话从5楼往下扔快递给快递员 15岁女孩不幸坠亡 父母起诉快递公司索赔74万元

闪电新闻
2026-09-22 22:11:07
再也瞒不下去了!德国专家曾指出,中美之所以尚未爆发冲突,不是因为美国没本事,而是美国可能已经察觉到了形势的严峻

再也瞒不下去了!德国专家曾指出,中美之所以尚未爆发冲突,不是因为美国没本事,而是美国可能已经察觉到了形势的严峻

z千年历史老号
2026-09-14 17:23:40
老了才懂:兄弟姐妹中,最自私、最会算计的人,往往有这2种结局

老了才懂:兄弟姐妹中,最自私、最会算计的人,往往有这2种结局

阿凯销售场
2026-09-23 06:09:21
运城13岁女孩遭强奸案,“闺蜜”被认定为共犯

运城13岁女孩遭强奸案,“闺蜜”被认定为共犯

中国新闻周刊
2026-09-22 23:54:02
损失40多万!中国样机在德国被一夜偷空,主办方回应让人非常无语

损失40多万!中国样机在德国被一夜偷空,主办方回应让人非常无语

璀璨幻行者
2026-09-22 10:58:41
闷声赚钱,绝不带熟人。

闷声赚钱,绝不带熟人。

老陆不老
2026-09-05 20:46:13
1978年最早公开反对“两个凡是”的三位省委书记到底是谁?

1978年最早公开反对“两个凡是”的三位省委书记到底是谁?

史不语
2026-09-22 13:45:04
499 元!OPPO 今晚发布这新品,感觉要卖爆啊...

499 元!OPPO 今晚发布这新品,感觉要卖爆啊...

科技狐
2026-09-23 00:59:24
韩景枫又拿老婆打窝,当众埋胸李谣助理不敢看,女方手姿势很尴尬

韩景枫又拿老婆打窝,当众埋胸李谣助理不敢看,女方手姿势很尴尬

蹲坑看世界
2026-09-23 04:48:11
新一代丰田RAV4,霸气十足,混动双擎极具竞争力,城市SUV标杆

新一代丰田RAV4,霸气十足,混动双擎极具竞争力,城市SUV标杆

沙雕小琳琳
2026-09-23 13:56:52
宣布竞选!陈芋汐流利英文发表宣言 网友:与全红婵走上不同道路

宣布竞选!陈芋汐流利英文发表宣言 网友:与全红婵走上不同道路

念洲
2026-09-23 09:22:24
2026-09-23 17:47:00
量子位 incentive-icons
量子位
追踪人工智能动态
13386文章数 176570关注度
往期回顾 全部

科技要闻

2026网易未来大会下午:AI走进现实

头条要闻

中国U23亚运会小组头名出线 八强战或避开日本

头条要闻

中国U23亚运会小组头名出线 八强战或避开日本

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

王玉雯杨玏被曝结婚又离 荒唐一幕出现

财经要闻

全市场都在卷自营

汽车要闻

5.1米的启境GX7,底盘凭什么又稳又舒服?

态度原创

亲子
房产
艺术
教育
军事航空

亲子要闻

媒体:举报“炒菜锅洗拖把”幼师的担心不能成真

房产要闻

楼市变天!三亚第一个"接住"新政的楼盘出现了

艺术要闻

穿浴衣的女子,日本写实画家新作

教育要闻

最新!全国化学奥赛北京队名单来了!26人进入决赛,来自这11所学校

军事要闻

韩国最新型潜艇首次披露

无障碍浏览 进入关怀版