网易首页 > 网易号 > 正文 申请入驻

Claude Code开始做Agent算力调度,配合Claude Haiku 5.5 极致低价,瞄准国产Flash大模型

0
分享至

大家好,我是 Ai 学习的老章

短短 24 小时之内,Anthropic 连续扔出了两记紧密咬合的重磅更新

先是在昨天凌晨发布的 Claude Code v2.1.292 中,官方悄然上线了两项底层能力:支持在创建 Subagent 时直接指定 effort 思考强度,同时允许 Mod 在 Workflow Agent 启动前直接拦截拒绝;紧接着在昨晚正式推出 Claude Haiku 5.5,今天凌晨发布的 v2.1.293 也闪电跟进,加入了模型与 agentType 的原生支持

很多朋友如果把它们当作零碎的小更新来看,可能觉得只是多了一个参数、降了一波价

站在架构演进的视角来看,Anthropic 这次打出的是一套教科书级的组合拳:他们正在给 Multi-Agent 系统搭建一套分布式“算力调度器+ 治理控制面”

痛点爆发:当 Agent 从 3 个变成上百个

常玩 AI 编程或搭智能体工作流的同学,一定深有感触:多 Agent 协同最让人心惊肉跳的就是账单

过去大家搭多 Agent 系统,分工往往非常粗放:

主 Agent
├── Research Agent
├── Coding Agent
├── Review Agent
└── Test Agent

每个角色各司其职,看起来挺美好,但实际跑起来往往面临两难困境:

要么全员拉满顶级模型与最高算力,随手跑几个深层 Bug 排查和跨目录依赖检索,几十万 Token 瞬间灰飞烟灭,钱包根本顶不住;要么退而求其次全用小模型,结果复杂规划频频翻车,甚至陷入死循环

尤其是 Anthropic 此前力推的 Dynamic Workflows,其设计愿景是在一个会话里并发跑起数十个甚至上百个 Subagent,如果所有子智能体都以最高推理强度运作,系统的成本和延迟会迅速彻底失控

这就逼出了一个核心命题:不同的工种,所需要的推理计算量天差地别

去跨目录 grep 搜个关键词、提取几行报错日志,凭什么要和系统架构决策、疑难算法重构消耗同样的 Token 预算?

调度革命:给每个打工人分配专属“思考档位”

Claude Code v2.1.292 最具突破性的动作,正是直接把算力分配做成了VIP能力

在官方的 Agent Tool 中,正式新增了 effort 参数:主 Agent 在调度创建 Subagent 时,可以直接指定该子任务的具体推理强度(low / medium / high / max)

这意味着 Orchestrator 可以根据任务难度,动态调整算力分配:

简单搜索 / grep 检索
↓
low effort

日志清洗 / 单测运行
↓
medium effort

核心逻辑编写 / 重构
↓
high effort

架构决策 / 复杂 Debug / 终审 Review
↓
max effort

无需再搞一刀切的粗暴消耗,简单任务走 low effort,毫秒级响应且极省 Token;关键决断走 max effort,算力拉满保证质量上限

这一改变让开发者可以真正像管理现代分布式系统那样,精细化管理多智能体的计算预算

治理防线:Mods 进化为 Multi-Agent 控制面

光能分配算力还不够,如果主 Agent 一口气派生了几十个甚至上百个子任务,谁来兜底?

v2.1.292 带来的另一个重磅改动,就是将 workflow agents 纳入了 Mods 的 agent.spawn Hook,并暴露了 run ID 和 index

这意味着 Mod 具备了在这些 Workflow Agent 真正启动前直接一票否决(拒绝运行)的权力


Multi-Agent 算力调度与治理控制架构

这非常接近现代 Kubernetes 集群中的准入控制器(Admission Controller):

  • 以前的 Orchestration 仅仅解决“谁负责什么任务”

  • 现在的 Claude Code 进一步解决了“谁消耗多少推理算力”以及“谁有资格被启动”

当上层调度器规划了大量并行任务时,控制面可以根据当前并发配额、预估成本预算或安全权限规则,直接拦截超额或高危的子任务,守住成本与安全底线

廉价算力就位:Haiku 5.5 直逼主流旗舰

调度机制与治理防线就绪后,最关键的一块拼图——能够大规模并发、干脏活累活的低成本劳动力,也正式登场了

这就是昨天刚刚发布的 Claude Haiku 5.5

咱们来看看官方公布的硬核定价,数字极具冲击力:

模型级别

输入价格(每 M Token)

输出价格(每 M Token)

缓存读取(每 M Token)

上下文窗口

Haiku 5.5(≤100K 提示) $0.10 $0.50 $0.01

1M

Haiku 5.5(>100K 提示)

$0.50

$2.50

$0.05

1M

Haiku 4.5

$1.00

$5.00

$0.10

200K

Sonnet 5.5

$2.00

$10.00

$0.10

(原$0.20)

1M

在常规短上下文(100K Token 以内)中,Haiku 5.5 的输入价格直接压到了 $0.10 / 百万 Token,输出只要 $0.50,综合运行成本较 Haiku 4.5 暴跌约 75%

这里包含一个极关键的设计细节:阶梯式定价策略

超过 100K 之后输入和输出价格分别变为 与 2.50,官方统计过去 Haiku 约 90% 的请求都在 100K 以内

这一计费规则清晰锁定了它的最佳定位:它天生就适合作为高并发、短平快、上下文轻量的 Subagent,去执行特定数据清洗与检索任务,避免将其作为单次滚长上下文的主会话容器

与此同时,Sonnet 5.5 的 Prompt Cache 读取价格直接减半(从 降 到 0.10),官方测算能让绝大多数 Agent 任务的总成本再降约 20%

而且千万别以为它只是廉价替代品,在 Artificial Analysis(AA)最新基准榜单上,Haiku 5.5(max with fallback)直接打出了 43 分:


Artificial Analysis 评测:Haiku 5.5 逼近主流旗舰

对比主要模型来看一组相当震撼的数据:

  • 反超 GLM-5.3 Flash :43 vs 42

  • 直逼 Kimi K3(max) :43 vs 44,仅仅只差 1 分

  • 明显高于 DeepSeek V4.1 Flash(max) :43 vs 39

  • 高于 Qwen3.6 27B(xhigh) :43 vs 34

  • 高于 MiniMax-M3 :43 vs 29

  • 仅略低于顶配大模型 GLM-5.3(max 45)与 MiMo-V2.6-Pro(46)

更惊艳的是代际飞跃:上一代 Claude 4.5 Haiku 只有 17 分,Haiku 5.5 实现了整整 +26 分的巨大跨度

从图表的 Token 消耗轴也能看出来,它并未依赖漫无边际的超长思维硬堆分数,它用极具克制的 Token 消耗摸到了主力模型的梯队,在高并发、低成本场景下展现出了惊人的战斗力

实测证据:落蛋模拟、火箭升空与 Devin Fusion

这套“大模型动脑 + 小模型干活”以及“小模型拉满推理”的实战表现到底有多强?咱们来看三组硬核实测

第一组是极具代表性的落蛋物理模拟试验,目标是设计出能让鸡蛋在 32 米高度安全落地的方案:


落蛋试验实测对比:Opus 5.5 单干 vs 带 10 个 Haiku 5.5 子代理

测试结果展现出了质的差距:

  • Opus 5.5 单独跑 :耗时 3 分 37 秒,尝试了 25 个方案,总账单花费 $0.47

  • Opus 5.5 + 10 个 Haiku 5.5 子代理 :仅用 58 秒,并发探索了 86 个方案,总账单只要 $0.14

同样顺利达成目标,时间缩短到原先的约 1/3.7,方案探索量提升了约 3.4 倍,整体账单反而砍掉了整整 70%

这正是多 Agent 协同的精髓所在:Opus 负责想,Haiku 负责干,编排层由大模型把控方向,执行层由 Haiku 规模化推进,效率与成本直接双赢

第二组来自社区开发者 @Bhavani_00007 的面对面对决实测:让 Haiku 5.5 与 GPT-6 Luna 在各自最高档位(max level)下,独立编写并渲染一个动态火箭升空发射模拟场景

实测跑下来的差距令人直呼不可思议:


Haiku 5.5 模拟火箭发射实测效果

  • Haiku 5.5 :花费 $1.30 ,耗时约 2 分钟,火箭升空的三维结构、发射塔脱离、尾焰与浓烟扩散逼真得令人吃惊,直接在视觉和物理动态上压制了 GPT-6 Luna

  • GPT-6 Luna :花费 $1.50 ,同样耗时约 2 分钟,渲染细节与动态质感明显逊色

测试者原话感慨:完全没预料到小模型在拉满 reasoning 之后能把场景写得如此真实,整体表现相比上一代 4.5 堪称跨越式巨变

第三组则是 Cognition 团队在 Devin Fusion 中的实测:使用 Opus 5.5 作为 Lead 主脑、Haiku 5.5 作为 Sidekick 副手,整套系统在 FrontierCode 拿下了 66.2 的顶尖分数,同样显著压低了延迟与开销

今天凌晨发布的 v2.1.293 更新还在 subagentStatusLine 中新增了 agentType 字段:


这让开发者在自动化管理与可视化看板中,能够精准追踪不同工种智能体的运行节奏

避坑指南:推理档位怎么选,别盲目拉满

虽然 Haiku 5.5 性能强悍,但老章在这里必须严肃提醒大家:千万别把 Haiku 5.5 的推理档位一股脑全拉到 max!

在这个级别的小模型上,盲目升档增加的主要是核对步骤与自查循环,基座模型的本质智商并没有发生质的改变

结合多位开发者的实战摸索,老章给大家整理了一套最接地气的档位使用法则:

  1. low 档 :分类、实体抽取、任务路由、简报摘要,只拼极致速度

  2. medium 档(默认基准) :客服对话、浏览器页面操作、范围明确的窄 Subagent 从这里起步

  3. high 档 :当 medium 偶尔漏判或翻车时再升档,适合多步协同或易漏字段的任务

  4. xhigh / max 档 :仅在自己的业务基准评测上验证有明显增益才开启,否则容易超时且徒增花费

  5. 长链工程编码坚决别硬扛 :看清官方 Terminal-Bench 4.0 的客观差距(Haiku 5.5 是 39.2%,Sonnet 5.5 高达 70.6%),复杂工程大任务依然老老实实交给主力模型

  6. 省钱窗口严控在 100K 内 :牢记阶梯价格,窄任务起步用 medium,失败再升档

总结

大模型狂飙到今天,智能体工程正在告别单体单打独斗的草莽时代

这套以 Claude Code 为调度底座、Haiku 5.5 为执行主力、Mod 为治理防线的组合拳,为多智能体走向工业级落地指明了清晰路径:

  • 任务精细分工 :大模型做架构决策与终审,小模型做高并发检索与信息提取

  • 算力按需分配 :按任务复杂度匹配 effort 档位,消除算力浪费

  • 策略准入把关 :通过治理控制面防范任务失控蔓延

建议大家尽快在本地工作流中尝试这种大小搭配的协作架构,亲身体验算力调度带来的效率跃升

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
俄罗斯发现乌克兰境内有日本工厂!毫不迟疑,当场炸成一片火海

俄罗斯发现乌克兰境内有日本工厂!毫不迟疑,当场炸成一片火海

谁将笑到最后
2026-10-10 14:39:44
长鑫科技,最新突破

长鑫科技,最新突破

第一财经资讯
2026-10-10 23:52:54
省委书记到浙江“最大的小县”调研

省委书记到浙江“最大的小县”调研

政知新媒体
2026-10-10 23:36:37
接班范乔丹!火箭新人已完全值得信任 攻防两端均能帮助球队

接班范乔丹!火箭新人已完全值得信任 攻防两端均能帮助球队

惊奇侃球
2026-10-10 21:03:31
15元9斤蜜薯遭“仅退款”,买家称“有本事就过来拿”,商家连夜跨省驱车800公里,仅取回3斤

15元9斤蜜薯遭“仅退款”,买家称“有本事就过来拿”,商家连夜跨省驱车800公里,仅取回3斤

界面新闻
2026-10-10 13:27:54
飞天奖红毯太真实,马伊琍穿成地摊货,倪萍像地主婆,唯她野心藏不住

飞天奖红毯太真实,马伊琍穿成地摊货,倪萍像地主婆,唯她野心藏不住

汪镛的创业之路
2026-10-10 10:02:17
爆大冷!第91分钟绝杀,中超领头羊轰然倒下,无缘提前夺冠

爆大冷!第91分钟绝杀,中超领头羊轰然倒下,无缘提前夺冠

足球狗说
2026-10-10 21:29:20
蒋万安不敢承认是中国人,唐湘龙直播直言:若不姓蒋,你什么都不是

蒋万安不敢承认是中国人,唐湘龙直播直言:若不姓蒋,你什么都不是

二大爷观世界
2026-10-10 03:32:03
大家管住手!管住手!千万要管住手!明天周一股市大概率要这样走了!

大家管住手!管住手!千万要管住手!明天周一股市大概率要这样走了!

趋势清风侠
2026-10-11 10:00:13
WTT中国大满贯:世界第1决赛输球!1:3无缘冠军,韩国2冠收官

WTT中国大满贯:世界第1决赛输球!1:3无缘冠军,韩国2冠收官

国乒二三事
2026-10-11 06:42:05
“家长等着坐牢吧”,顶楼放十几吨水给孩子玩,儿子动作暴露家教

“家长等着坐牢吧”,顶楼放十几吨水给孩子玩,儿子动作暴露家教

番外行
2026-10-10 10:03:14
梅艳芳63岁冥诞,骨灰被盗3月未寻回,亲哥梅启明不知情从未祭拜

梅艳芳63岁冥诞,骨灰被盗3月未寻回,亲哥梅启明不知情从未祭拜

小撇说事
2026-10-11 08:58:12
15战14负!张本美和:王曼昱是不可战胜的 而且我正落后她越来越多

15战14负!张本美和:王曼昱是不可战胜的 而且我正落后她越来越多

风过乡
2026-10-11 11:01:15
郑钦文首进中网决赛刷爆纪录:中国首人+外卡首人 重返世界前30

郑钦文首进中网决赛刷爆纪录:中国首人+外卡首人 重返世界前30

醉卧浮生
2026-10-10 20:48:18
放量下跌!宇树科技本周再创新低419元,上市不到2个月暴跌超过60%

放量下跌!宇树科技本周再创新低419元,上市不到2个月暴跌超过60%

慧眼看世界哈哈
2026-10-11 08:42:05
44岁姚笛独自在杭州豪宅家中煮泡面,眼神中难掩落寞

44岁姚笛独自在杭州豪宅家中煮泡面,眼神中难掩落寞

追影客栈
2026-10-03 16:08:17
特朗普称“乌克兰应该换个总统”后,乌外长力挺泽连斯基:他值得

特朗普称“乌克兰应该换个总统”后,乌外长力挺泽连斯基:他值得

环球网资讯
2026-10-11 08:47:12
懂车帝也太刚了!

懂车帝也太刚了!

胖胖说他不胖
2026-10-09 15:08:05
网红面筋哥离世一年后,账号突然更新,用AI“复活”拍网剧

网红面筋哥离世一年后,账号突然更新,用AI“复活”拍网剧

喜欢历史的阿繁
2026-10-11 08:59:27
2019年,印度建筑工人路过美军女兵寝室时,看到四下无人,内心躁动的他当即打开房门冲了进去,结果当时......

2019年,印度建筑工人路过美军女兵寝室时,看到四下无人,内心躁动的他当即打开房门冲了进去,结果当时......

回京历史梦
2026-10-11 03:35:06
2026-10-11 11:43:00
Ai学习的老章 incentive-icons
Ai学习的老章
Ai学习的老章
3536文章数 11199关注度
往期回顾 全部

科技要闻

卸任CEO后,苹果董事长库克再度到访中国

头条要闻

牛弹琴:特朗普发出最后通牒 泽连斯基的至暗时刻来了

头条要闻

牛弹琴:特朗普发出最后通牒 泽连斯基的至暗时刻来了

体育要闻

十年回首:湖人三榜眼的夏天,与NBA无关

娱乐要闻

梅艳芳63岁冥诞骨灰被盗,亲哥从不知情

财经要闻

黄仁勋长女完婚,万亿帝国如何传承?

汽车要闻

红旗天工07上市 限时16.79万起 硬核通关巴音布鲁克

态度原创

时尚
教育
亲子
家居
军事航空

伊姐周六热推:电视剧《魅影神捕》;电视剧《美人余》......

教育要闻

对偶法解这道题,真的是绝绝子

亲子要闻

孩子越来越胖,家长到底该怎么办?

家居要闻

2026建博会(广州) 公装联探展交流活动

军事要闻

沙特利雅得机场遭袭致12死309伤 中国大使馆紧急提醒

无障碍浏览 进入关怀版