网易首页 > 网易号 > 正文 申请入驻

对比 Codex,免费的 AgnesCode 也能在底层算子优化任务中打得有来有回

0
分享至


AgnesCode在部分芯片上跑出更高性能,免费模型完成专业级交付。

作者丨吴海明 曹PP

编辑丨李 娜

免费的 AI Coding Agent,能不能和付费 Codex 在真实工程任务里打得有来有回?

过去一年,我们已经习惯了让 Coding Agent 写网页、做应用、修 Bug。但这一次,我们想把它往更底层推一步:让 AI 去优化大模型自己运行时使用的算子

所谓“算子”,可以简单理解为大模型运行时反复执行的一小段底层计算程序模型每生成一个 Token,都要在 GPU 或其他 AI 芯片上执行大量矩阵计算、注意力计算和数据变换。单个算子看起来很小,但会被模型反复调用。因此,一段高频算子如果能快 10%、20%,最终就可能转化为推理速度、硬件利用率和服务成本上的实际差异。

这恰好提供了一种不同于常规 Coding Benchmark 的测试方式:如果 Agent 能够读懂任务、修改算子、适配不同芯片,并最终跑出真实的性能提升,那么它触及的已经不只是应用开发,而是 AI Infra 中一部分真正的工程工作。

为了回答这个问题,我们把 AgnesCode + Agnes 3.0 Flash 放进众智 FlagOS 开放计算全球大赛的一道算子优化题:为 DeepSeek-V3 解码阶段使用的底层算子写优化代码,并在 8 款芯片上接受赛事官方自动化评测,同时,选择 Codex + GPT-5.6 Sol 组合作为对照。两组候选者使用完全相同的环境为算子撰写优化代码,最终都提交到赛事官方的自动化评测系统进行评测。


结果很有趣:

两组选手都顺利完成了任务,Codex + GPT-5.6 Sol 用 8 分 57 秒给出结果,AgnesCode + Agnes 3.0 Flash 在中途被测试人员催促了一次后,耗时 20 分 36 秒完成任务。经过官方自动化评测后,对比 Codex 通过7款芯片的战绩,AgnesCode 略逊一筹,通过了 6 款芯片;但在双方共同通过的 5 款芯片上,AgnesCode 有 4 项加速比更高,其中在国际通用芯片 B 上达到 4.81×,高于 Codex 的 3.71×,加速比分数高出约 29.6%;昆仑芯上也只有 AgnesCode 通过测试。

这不只是一个“免费模型全面替代付费模型”的故事,还说明了另一件事:当任务边界、工具链和评测闭环足够清晰时,免费 Agent 已经可以进入底层工程任务,并交出可验收、有性能收益的产物。

Agent 时代,模型便宜只是入场券,能把任务交到终点才是分水岭。本文真正想回答的,是当 AI 开始拧紧自己的底层螺丝,免费的 AgnesCode 距离一个可用的工程助手还有多远。

01


一道题:

优化 DeepSeek-V3 底层算子

考虑到常见测试任务的数据很可能已经用于模型训练,导致模型本身已经很擅长,因此,在这次测试中,我们直接跳过常见的网页生成、数据看板、文案撰写等常见测试场景,选择让 AgnesCode 直接挑战更接近基础工程的题目:大模型推理算子优化。

具体来说,算子是模型算法能运行的基础环节,模型每生成一个 Token,背后都要反复调用矩阵乘法、注意力、归一化、激活函数等底层算子。在单个算子上几个百分点的加速比,往往直接变成推理延迟、显存占用和服务成本的差异。更重要的是,算子优化正在成为 AI 自进化的一部分,过去,优化这类底层代码高度依赖系统工程师手写经验;现在,Coding Agent 开始尝试读任务、写算子代码、跑测试、看报错、再改代码,这是 AI 开始反过来优化自身运行底座的一种工程样本


所选测试题来源截图1: 众 智 Fl agOS 开放计算全球大赛赛季二的赛道一

需要说明的是,这次的测试题目来自众智 FlagOS 开放计算全球大赛赛季二的赛道一:SGLang框架算子在多款芯片的性能优化。该比赛围绕 SGLang 推理框架开放了 200 余道算子任务,每周发布一批算子题目,参赛者只能在本周内看到赛题内容。因此,这可以极大保证测试任务的数据没有被测试模型提前学习,对评测对象来说,这完全是一次摸底考试”。


所选测试题来源截图2: 200+算子的多芯片优化任务

具体来说,我们选择了一道DeepSeek-V3 在解码阶段使用的融合 QKV-A 下投影算子题目(Task66: dsv3_fused_a_gemm)作为测试任务,该算子是将输入特征与合并后的投影权重相乘,一次完成 Q 分支和 KV 分支的前置投影,为后续注意力计算准备数据。题目本身的计算并不难,真正的挑战在于考察 AgnesCode 能否生成一套优化算子代码能快速通过 8 款芯片(2款国际芯片、天数智芯、沐曦、燧原、海光信息、昆仑芯和华为)。


所选测试题来源截图3: Task66-dsv3_fused_a_gemm 赛题

02


对打 Codex:

入口名翻车,但性能结果并不弱

为了更好知道 AgnesCode 的行业水平,我们选择 Codex+GPT-5.6 Sol 组合作为对照组,AgnesCode 则用官方提供的免费模型 Agnes 3.0 Flash 作为后台。我们为两个组合同时提供一个标准化的 Skill,该 skill 提供了赛制的全部信息,例如如何命名每个代码文件、如何在代码文件中命名函数名、写完代码以后要打包等。之后,我们在相同的环境下让两个组合为测试题撰写代码。

具体地,我们首先让两个组合在一台含有 NVIDIA 芯片的机器上撰写第一个版本代码,然后再基于这个版本代码撰写适配其他所有芯片的代码。

从运行过程来看,AgnesCode + Agnes 3.0 Flash 组合在第二阶段生成代码的时候,首先花费了7分10秒没有给出答案,经过测试人员催促以后,再次经过13分26秒后给出了 针对不同后端调整优化的代码。包括语法、禁用项和文件依赖检查,最终整理提交包,并更新开发记录。整体来看,从编写实现、跨芯片适配,到代码自检、打包和交付,这个组合已经能够围绕一个专业任务推进完整的工作流程。


AgnesCode + Agnes 3.0 Flash 组合运行截图

再来看看 Codex+GPT-5.6 Sol 组合的表现,相对AgnesCode + Agnes 3.0 Flash 组合 整体使用 20 分 36 秒的时间开销,Codex+GPT-5.6 Sol 组合仅用8分57秒就给出了结果。对比来看,Codex+GPT-5.6 Sol 组合的整体工作推进更快,也更加流畅。


Codex+GPT-5.6 Sol 组合运行截图

任务推进过程是一方面,两个模型经过系统评测的效果如何呢?


众智 FlagOS 开放计算全球大赛赛事官方自动化评测结果截图,第一行为 AgnesCode + Agnes 3.0 Flash 测评结果,第二行为 Codex+ GPT-5.6 Sol 测评结果。

整体来看,虽然在芯片的适配数量上,AgnesCode 落后Codex 一个,仅有六个芯片通过了测试。但在双方共同通过的五个芯片上,AgnesCode 有四项加速比更高,在天数智芯上,AgnesCode 为 2.16×,Codex为 1.72×;在国际通用芯片 B 上,AgnesCode 达到 4.81×,高于对照组的 3.71×,加速比分数高出约 29.6%;在昆仑芯上仅有 AgnesCode 通过了测试,并取得来2.56X的加速比。

该结果表明,AgnesCode + Agnes 3.0 Flash 交付了能够在多个平台获得实际加速的算子成果,体现了一定的竞争力,但在跨平台覆盖和最终验收,仍有继续改进的空间。

最后,对于一个绕不开的话题——成本,AgnesCode + Agnes 3.0 Flash 完全免费,这让它在真实的业务场景里更具吸引力。很多任务往往需要多轮问答才能获得较为不错的效果,而且模型还需要反复读取文件、根据用户反馈进行调整。若按闭源模型计费,账单很可能快速爆炸,而免费模型至少把“敢不敢让多试几轮”的门槛降了下来。

03


AA榜单揭示

Agnes 3.0 Flash 的能力边界

上述测试可以发现,免费的 AgnesCode+Agnes 3.0 Flash 完全可以和付费订阅的 Codex+ GPT-5.6 Sol 打的有来有回,这是个例还是普遍存在呢?

对此,我们调取了 Artificial Analysis (AA榜单)公布数据,其中的 Intelligence Index 指标综合考察模型在工作任务、工具执行、编程、复杂推理、知识可靠性与长上下文等方面的表现,为模型的整体水平提供参照,Agnes 3.0 Flash 的得分为 36 分,即为接近 GPT-5.6 Luna(max)的 38 分。这说明 Agnes 3.0 Flash 本身能力已经和主流模型能力不相上下了。


Artificial Analysis (AA榜单)公布数据截图

在 Artificial Analysis 的智能表现 × Token价格对比中,Agnes 3.0 Flash以约 0.03 美元/百万 Token 的价格进入最具吸引力区间,并位于帕累托前沿。

另外,把能力和价格放到同一张图里看,Agnes 3.0 Flash 的位置会更直观。AA 榜单的智能表现 × Token 价格对比显示,它以约 0.03 美元/百万 Token 的价格,进入了图中最具吸引力的低价高能区间:横向看,它的价格显著低于多数同等智能表现的模型;纵向看,在相近价格带里,拿到了更靠前的智能表现,这直接让模型坐稳帕累托前沿的位置。

从实际的 Agent 工作流来说,这个位置尤其重要,因为长任务会不断放大 Token 消耗,模型每便宜一点,都会直接影响用户是否愿意让它持续读文件、改代码、跑测试和反复迭代。


Artificial Analysis (AA 榜单)的智能表现 × Token 价格对比数据截图

04


免费又不失性能,

为 AI 进化带来更多探索空间

通过代码优化测试可以发现,AgnesCode + Agnes 3.0 Flash 已经能自动化生成能被系统验收、能被继续迭代、能在成本上算得过账的交付物。Agent 时代,模型便宜只是入场券,能把任务交到终点才是护城河。

换句话说,随着 AI 的发展,用户需要的不再只是生成应用,而是 AI 开始拧紧自己的底层螺丝。

从结果看,AgnesCode + Agnes 3.0 Flash 展示了两个信号:

1.在有明确工作流、任务文件和评测反馈的情况下,它已经能推进跨芯片算子适配,并在部分芯片上跑出更高加速比。

2.Agent 可能会在“最后一公里”犯错,例如入口命名、提交规范、覆盖范围等细节,这些问题不一定抹掉性能亮点,但会直接决定结果能不能被真实系统接收。

模型能力决定上限,工作台能力决定它能不能稳定抵达上限对开发者和企业用户而言,AgnesCode 的优势不只在模型本身,也在它把模型、项目文件、Skill、命令执行和评测反馈组织到同一个工作流里,帮助用户少打扰、少返工、少花钱地把事做完。

从算子优化来说,这也是国产 AI 芯片生态正在面对的现实问题,不同芯片之间的差异,不会因为上层框架统一就自动消失;推理框架、算子库、编译工具链和真实业务负载之间,仍然需要大量适配工作。如果 Agent 能进入这条链路,它就有机会把过去依赖少数系统工程师经验的优化工作,变成可以持续生成、持续验证、持续迭代的工程流程。

对比,Codex + GPT-5.6 Sol 在任务推进速度和整体流畅度上依然更占优,AgnesCode + Agnes 3.0 Flash 也暴露出交付细节上的不稳定。但同时证明了一件事:免费模型并非只能停留在简单任务层面,只要工具链、上下文和评测闭环足够明确,它同样可以进入专业工作流,并交出有竞争力的结果。

免费模型的真正价值,正在从让 AI 变得更便宜转向让更多真实任务有机会被 AI 反复尝试。当试错成本下降,Agent 才可能从“偶尔帮忙”变成“持续干活”;当持续干活成为可能,谁能把专业要求稳定写进执行过程,谁就更接近下一代 AI 工作台的入口。

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
张一鸣:遍地都是赚到百万的项目,但是99%的人选择埋头打工

张一鸣:遍地都是赚到百万的项目,但是99%的人选择埋头打工

一些小事
2026-09-22 06:17:58
亚运女团决赛中日对决!孙颖莎战张本美和!CCTV直播24日赛程出炉

亚运女团决赛中日对决!孙颖莎战张本美和!CCTV直播24日赛程出炉

江启
2026-09-24 03:40:04
中方专机还没到,对华友好先在美刷屏,鲁比奥:华盛顿没得选

中方专机还没到,对华友好先在美刷屏,鲁比奥:华盛顿没得选

观史搜寻着
2026-09-23 12:37:53
意媒:目前意甲仅有4家俱乐部财务稳定健康

意媒:目前意甲仅有4家俱乐部财务稳定健康

懂球帝
2026-09-23 19:15:08
金龟子女儿被曝家暴老公、殴打妈妈,本人发视频回应

金龟子女儿被曝家暴老公、殴打妈妈,本人发视频回应

韩小娱
2026-09-23 15:39:55
提问:从全民尊敬到万人嫌弃,工人阶级最终会变成“无用阶级”吗

提问:从全民尊敬到万人嫌弃,工人阶级最终会变成“无用阶级”吗

原广工业
2026-09-23 15:54:55
亚运会人气最高5位运动员,孙颖莎第2,张雨霏第4,第一无可争议

亚运会人气最高5位运动员,孙颖莎第2,张雨霏第4,第一无可争议

白面书誏
2026-09-22 18:42:56
17点24分!足协正式官宣周海滨率队,名宿汪强在列,4人值得期待

17点24分!足协正式官宣周海滨率队,名宿汪强在列,4人值得期待

王大发不懂球
2026-09-23 19:56:07
离谱!皇马放走超级天才!新罗德里 3 场封神打脸穆里尼奥

离谱!皇马放走超级天才!新罗德里 3 场封神打脸穆里尼奥

奶盖熊本熊
2026-09-23 07:21:50
审美大退步!新老LOGO你喜欢哪个?

审美大退步!新老LOGO你喜欢哪个?

柚子说球
2026-09-23 14:07:17
伤害性不大侮辱性极强!凯特戴旧项链艳压卡米拉,威廉连老婆的手都牵不到

伤害性不大侮辱性极强!凯特戴旧项链艳压卡米拉,威廉连老婆的手都牵不到

白露文娱志
2026-09-23 15:52:45
亚运战报!大冷门,13 连冠遗憾终结,中国狂揽 9 金,杀出 5 位三冠王

亚运战报!大冷门,13 连冠遗憾终结,中国狂揽 9 金,杀出 5 位三冠王

寒士之言本尊
2026-09-23 22:28:50
夺小组头名!中国男足0-0阿联酋 携朝鲜进亚运8强 王钰栋染黄将停赛

夺小组头名!中国男足0-0阿联酋 携朝鲜进亚运8强 王钰栋染黄将停赛

我爱英超
2026-09-23 15:29:19
美国:中国要做什么就让他去做吧

美国:中国要做什么就让他去做吧

小马姨
2026-09-20 09:15:43
提醒:长期吃降脂药他汀,遇到这4种情况要马上停药

提醒:长期吃降脂药他汀,遇到这4种情况要马上停药

药师方健
2026-09-23 22:18:55
180度大转弯!中方专机未到,鲁比奥放下强硬姿态:对华没得选

180度大转弯!中方专机未到,鲁比奥放下强硬姿态:对华没得选

老塕是个手艺人
2026-09-23 11:50:42
岛内震动!十二点共识曝出:解放军驻台、武器上交、台军整编?

岛内震动!十二点共识曝出:解放军驻台、武器上交、台军整编?

楠楠自语
2026-09-22 10:25:19
停用一个月后,他因两个数字重开Claude Code

停用一个月后,他因两个数字重开Claude Code

硅屿手记
2026-09-23 01:29:17
33岁绝世少帅!英超全员通杀BIG6,吊打各路豪门,难怪全英超抢着要

33岁绝世少帅!英超全员通杀BIG6,吊打各路豪门,难怪全英超抢着要

看我说体育
2026-09-22 17:16:52
一边是美国五大电视网暂停报道特朗普,一边是“特朗普电视”开播

一边是美国五大电视网暂停报道特朗普,一边是“特朗普电视”开播

新民周刊
2026-09-23 09:12:24
2026-09-24 05:19:00
AI科技评论 incentive-icons
AI科技评论
点评学术,服务AI
7669文章数 20785关注度
往期回顾 全部

科技要闻

网易未来大会圆满落幕 硅基智能跨越临界点

头条要闻

肺癌女性中98%从不吸烟 钟南山团队回应

头条要闻

肺癌女性中98%从不吸烟 钟南山团队回应

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

王玉雯杨玏被曝结婚又离 荒唐一幕出现

财经要闻

电池的权力游戏

汽车要闻

宾利首款纯电SUV 托卡尔正式发布 国内售价198.8万起

态度原创

时尚
游戏
本地
手机
教育

专场|| 最近最爱的一件羊绒薄针织,一周穿5天买得好值!

《三男一狗》富兰克林配音:《GTA7》3到4年就能出!

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

手机要闻

小米18Pro发布!全球首发第六代骁龙8至尊版

教育要闻

2027高考为什么被称作最难一届?4个核心压力,一个比一个狠

无障碍浏览 进入关怀版