网易首页 > 网易号 > 正文 申请入驻

对比 Codex,免费的 AgnesCode 也能在底层算子优化任务中打得有来有回

0
分享至


AgnesCode在部分芯片上跑出更高性能,免费模型完成专业级交付。

作者丨吴海明 曹PP

编辑丨李 娜

免费的 AI Coding Agent,能不能和付费 Codex 在真实工程任务里打得有来有回?

过去一年,我们已经习惯了让 Coding Agent 写网页、做应用、修 Bug。但这一次,我们想把它往更底层推一步:让 AI 去优化大模型自己运行时使用的算子

所谓“算子”,可以简单理解为大模型运行时反复执行的一小段底层计算程序模型每生成一个 Token,都要在 GPU 或其他 AI 芯片上执行大量矩阵计算、注意力计算和数据变换。单个算子看起来很小,但会被模型反复调用。因此,一段高频算子如果能快 10%、20%,最终就可能转化为推理速度、硬件利用率和服务成本上的实际差异。

这恰好提供了一种不同于常规 Coding Benchmark 的测试方式:如果 Agent 能够读懂任务、修改算子、适配不同芯片,并最终跑出真实的性能提升,那么它触及的已经不只是应用开发,而是 AI Infra 中一部分真正的工程工作。

为了回答这个问题,我们把 AgnesCode + Agnes 3.0 Flash 放进众智 FlagOS 开放计算全球大赛的一道算子优化题:为 DeepSeek-V3 解码阶段使用的底层算子写优化代码,并在 8 款芯片上接受赛事官方自动化评测,同时,选择 Codex + GPT-5.6 Sol 组合作为对照。两组候选者使用完全相同的环境为算子撰写优化代码,最终都提交到赛事官方的自动化评测系统进行评测。


结果很有趣:

两组选手都顺利完成了任务,Codex + GPT-5.6 Sol 用 8 分 57 秒给出结果,AgnesCode + Agnes 3.0 Flash 在中途被测试人员催促了一次后,耗时 20 分 36 秒完成任务。经过官方自动化评测后,对比 Codex 通过7款芯片的战绩,AgnesCode 略逊一筹,通过了 6 款芯片;但在双方共同通过的 5 款芯片上,AgnesCode 有 4 项加速比更高,其中在国际通用芯片 B 上达到 4.81×,高于 Codex 的 3.71×,加速比分数高出约 29.6%;昆仑芯上也只有 AgnesCode 通过测试。

这不只是一个“免费模型全面替代付费模型”的故事,还说明了另一件事:当任务边界、工具链和评测闭环足够清晰时,免费 Agent 已经可以进入底层工程任务,并交出可验收、有性能收益的产物。

Agent 时代,模型便宜只是入场券,能把任务交到终点才是分水岭。本文真正想回答的,是当 AI 开始拧紧自己的底层螺丝,免费的 AgnesCode 距离一个可用的工程助手还有多远。

01


一道题:

优化 DeepSeek-V3 底层算子

考虑到常见测试任务的数据很可能已经用于模型训练,导致模型本身已经很擅长,因此,在这次测试中,我们直接跳过常见的网页生成、数据看板、文案撰写等常见测试场景,选择让 AgnesCode 直接挑战更接近基础工程的题目:大模型推理算子优化。

具体来说,算子是模型算法能运行的基础环节,模型每生成一个 Token,背后都要反复调用矩阵乘法、注意力、归一化、激活函数等底层算子。在单个算子上几个百分点的加速比,往往直接变成推理延迟、显存占用和服务成本的差异。更重要的是,算子优化正在成为 AI 自进化的一部分,过去,优化这类底层代码高度依赖系统工程师手写经验;现在,Coding Agent 开始尝试读任务、写算子代码、跑测试、看报错、再改代码,这是 AI 开始反过来优化自身运行底座的一种工程样本


所选测试题来源截图1: 众 智 Fl agOS 开放计算全球大赛赛季二的赛道一

需要说明的是,这次的测试题目来自众智 FlagOS 开放计算全球大赛赛季二的赛道一:SGLang框架算子在多款芯片的性能优化。该比赛围绕 SGLang 推理框架开放了 200 余道算子任务,每周发布一批算子题目,参赛者只能在本周内看到赛题内容。因此,这可以极大保证测试任务的数据没有被测试模型提前学习,对评测对象来说,这完全是一次摸底考试”。


所选测试题来源截图2: 200+算子的多芯片优化任务

具体来说,我们选择了一道DeepSeek-V3 在解码阶段使用的融合 QKV-A 下投影算子题目(Task66: dsv3_fused_a_gemm)作为测试任务,该算子是将输入特征与合并后的投影权重相乘,一次完成 Q 分支和 KV 分支的前置投影,为后续注意力计算准备数据。题目本身的计算并不难,真正的挑战在于考察 AgnesCode 能否生成一套优化算子代码能快速通过 8 款芯片(2款国际芯片、天数智芯、沐曦、燧原、海光信息、昆仑芯和华为)。


所选测试题来源截图3: Task66-dsv3_fused_a_gemm 赛题

02


对打 Codex:

入口名翻车,但性能结果并不弱

为了更好知道 AgnesCode 的行业水平,我们选择 Codex+GPT-5.6 Sol 组合作为对照组,AgnesCode 则用官方提供的免费模型 Agnes 3.0 Flash 作为后台。我们为两个组合同时提供一个标准化的 Skill,该 skill 提供了赛制的全部信息,例如如何命名每个代码文件、如何在代码文件中命名函数名、写完代码以后要打包等。之后,我们在相同的环境下让两个组合为测试题撰写代码。

具体地,我们首先让两个组合在一台含有 NVIDIA 芯片的机器上撰写第一个版本代码,然后再基于这个版本代码撰写适配其他所有芯片的代码。

从运行过程来看,AgnesCode + Agnes 3.0 Flash 组合在第二阶段生成代码的时候,首先花费了7分10秒没有给出答案,经过测试人员催促以后,再次经过13分26秒后给出了 针对不同后端调整优化的代码。包括语法、禁用项和文件依赖检查,最终整理提交包,并更新开发记录。整体来看,从编写实现、跨芯片适配,到代码自检、打包和交付,这个组合已经能够围绕一个专业任务推进完整的工作流程。


AgnesCode + Agnes 3.0 Flash 组合运行截图

再来看看 Codex+GPT-5.6 Sol 组合的表现,相对AgnesCode + Agnes 3.0 Flash 组合 整体使用 20 分 36 秒的时间开销,Codex+GPT-5.6 Sol 组合仅用8分57秒就给出了结果。对比来看,Codex+GPT-5.6 Sol 组合的整体工作推进更快,也更加流畅。


Codex+GPT-5.6 Sol 组合运行截图

任务推进过程是一方面,两个模型经过系统评测的效果如何呢?


众智 FlagOS 开放计算全球大赛赛事官方自动化评测结果截图,第一行为 AgnesCode + Agnes 3.0 Flash 测评结果,第二行为 Codex+ GPT-5.6 Sol 测评结果。

整体来看,虽然在芯片的适配数量上,AgnesCode 落后Codex 一个,仅有六个芯片通过了测试。但在双方共同通过的五个芯片上,AgnesCode 有四项加速比更高,在天数智芯上,AgnesCode 为 2.16×,Codex为 1.72×;在国际通用芯片 B 上,AgnesCode 达到 4.81×,高于对照组的 3.71×,加速比分数高出约 29.6%;在昆仑芯上仅有 AgnesCode 通过了测试,并取得来2.56X的加速比。

该结果表明,AgnesCode + Agnes 3.0 Flash 交付了能够在多个平台获得实际加速的算子成果,体现了一定的竞争力,但在跨平台覆盖和最终验收,仍有继续改进的空间。

最后,对于一个绕不开的话题——成本,AgnesCode + Agnes 3.0 Flash 完全免费,这让它在真实的业务场景里更具吸引力。很多任务往往需要多轮问答才能获得较为不错的效果,而且模型还需要反复读取文件、根据用户反馈进行调整。若按闭源模型计费,账单很可能快速爆炸,而免费模型至少把“敢不敢让多试几轮”的门槛降了下来。

03


AA榜单揭示

Agnes 3.0 Flash 的能力边界

上述测试可以发现,免费的 AgnesCode+Agnes 3.0 Flash 完全可以和付费订阅的 Codex+ GPT-5.6 Sol 打的有来有回,这是个例还是普遍存在呢?

对此,我们调取了 Artificial Analysis (AA榜单)公布数据,其中的 Intelligence Index 指标综合考察模型在工作任务、工具执行、编程、复杂推理、知识可靠性与长上下文等方面的表现,为模型的整体水平提供参照,Agnes 3.0 Flash 的得分为 36 分,即为接近 GPT-5.6 Luna(max)的 38 分。这说明 Agnes 3.0 Flash 本身能力已经和主流模型能力不相上下了。


Artificial Analysis (AA榜单)公布数据截图

在 Artificial Analysis 的智能表现 × Token价格对比中,Agnes 3.0 Flash以约 0.03 美元/百万 Token 的价格进入最具吸引力区间,并位于帕累托前沿。

另外,把能力和价格放到同一张图里看,Agnes 3.0 Flash 的位置会更直观。AA 榜单的智能表现 × Token 价格对比显示,它以约 0.03 美元/百万 Token 的价格,进入了图中最具吸引力的低价高能区间:横向看,它的价格显著低于多数同等智能表现的模型;纵向看,在相近价格带里,拿到了更靠前的智能表现,这直接让模型坐稳帕累托前沿的位置。

从实际的 Agent 工作流来说,这个位置尤其重要,因为长任务会不断放大 Token 消耗,模型每便宜一点,都会直接影响用户是否愿意让它持续读文件、改代码、跑测试和反复迭代。


Artificial Analysis (AA 榜单)的智能表现 × Token 价格对比数据截图

04


免费又不失性能,

为 AI 进化带来更多探索空间

通过代码优化测试可以发现,AgnesCode + Agnes 3.0 Flash 已经能自动化生成能被系统验收、能被继续迭代、能在成本上算得过账的交付物。Agent 时代,模型便宜只是入场券,能把任务交到终点才是护城河。

换句话说,随着 AI 的发展,用户需要的不再只是生成应用,而是 AI 开始拧紧自己的底层螺丝。

从结果看,AgnesCode + Agnes 3.0 Flash 展示了两个信号:

1.在有明确工作流、任务文件和评测反馈的情况下,它已经能推进跨芯片算子适配,并在部分芯片上跑出更高加速比。

2.Agent 可能会在“最后一公里”犯错,例如入口命名、提交规范、覆盖范围等细节,这些问题不一定抹掉性能亮点,但会直接决定结果能不能被真实系统接收。

模型能力决定上限,工作台能力决定它能不能稳定抵达上限对开发者和企业用户而言,AgnesCode 的优势不只在模型本身,也在它把模型、项目文件、Skill、命令执行和评测反馈组织到同一个工作流里,帮助用户少打扰、少返工、少花钱地把事做完。

从算子优化来说,这也是国产 AI 芯片生态正在面对的现实问题,不同芯片之间的差异,不会因为上层框架统一就自动消失;推理框架、算子库、编译工具链和真实业务负载之间,仍然需要大量适配工作。如果 Agent 能进入这条链路,它就有机会把过去依赖少数系统工程师经验的优化工作,变成可以持续生成、持续验证、持续迭代的工程流程。

对比,Codex + GPT-5.6 Sol 在任务推进速度和整体流畅度上依然更占优,AgnesCode + Agnes 3.0 Flash 也暴露出交付细节上的不稳定。但同时证明了一件事:免费模型并非只能停留在简单任务层面,只要工具链、上下文和评测闭环足够明确,它同样可以进入专业工作流,并交出有竞争力的结果。

免费模型的真正价值,正在从让 AI 变得更便宜转向让更多真实任务有机会被 AI 反复尝试。当试错成本下降,Agent 才可能从“偶尔帮忙”变成“持续干活”;当持续干活成为可能,谁能把专业要求稳定写进执行过程,谁就更接近下一代 AI 工作台的入口。

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
雷军回应“打新宇树挣了100多亿”

雷军回应“打新宇树挣了100多亿”

澎湃新闻
2026-09-22 19:07:44
补时连续废人动作!央视名嘴怒斥阿联酋队:想格斗别报错亚运项目

补时连续废人动作!央视名嘴怒斥阿联酋队:想格斗别报错亚运项目

我爱英超
2026-09-23 16:16:17
亚运会乒乓球:张本智和收获奖牌!3:0大获全胜,松岛辉空3:2险胜

亚运会乒乓球:张本智和收获奖牌!3:0大获全胜,松岛辉空3:2险胜

国乒二三事
2026-09-23 06:51:57
广东省省长会见刘庆峰、王兴兴

广东省省长会见刘庆峰、王兴兴

极目新闻
2026-09-23 08:00:50
湖南邵阳“远洋捕捞”上海老板,“交一个亿,不然就判你!”

湖南邵阳“远洋捕捞”上海老板,“交一个亿,不然就判你!”

周军律师聊案子
2026-09-22 14:59:30
侵略者现身亚运会!韩国舆论彻底炸锅,中韩绕不开的那段历史

侵略者现身亚运会!韩国舆论彻底炸锅,中韩绕不开的那段历史

冷桂零落
2026-09-20 15:51:38
33岁女演员确诊癌症,已失去生活自理能力,家人苦撑2年公开求助:她想活下去,还想回去唱戏

33岁女演员确诊癌症,已失去生活自理能力,家人苦撑2年公开求助:她想活下去,还想回去唱戏

扬子晚报
2026-09-23 15:56:49
“黑老大”黄大发被判处死刑立即执行

“黑老大”黄大发被判处死刑立即执行

扬子晚报
2026-09-23 12:45:41
李乐成任安徽省委书记,周祖翼任河南省委书记,赵龙任福建省委书记

李乐成任安徽省委书记,周祖翼任河南省委书记,赵龙任福建省委书记

新京报政事儿
2026-09-23 11:06:09
亚运会!国乒爆大冷,世界冠军轰然倒下,孙颖莎丢局,蒯曼轰11-1

亚运会!国乒爆大冷,世界冠军轰然倒下,孙颖莎丢局,蒯曼轰11-1

林子说事
2026-09-23 04:09:43
赵探长:郭士强想放假但领导不同意;找个NBA训练师,15分钟就气走了

赵探长:郭士强想放假但领导不同意;找个NBA训练师,15分钟就气走了

懂球帝
2026-09-23 14:00:09
亚运会惊天逆转,日本组合挽救三赛点,松岛辉空拖张本美和后腿

亚运会惊天逆转,日本组合挽救三赛点,松岛辉空拖张本美和后腿

南海浪花
2026-09-23 11:33:41
野村报告:10万亿化债,效果几何?

野村报告:10万亿化债,效果几何?

罗sir财话
2026-09-22 14:35:32
奥运冠军张家齐上热搜!收入去向成谜,“我不是爸妈养大的,我是队里养大的”

奥运冠军张家齐上热搜!收入去向成谜,“我不是爸妈养大的,我是队里养大的”

上观新闻
2026-09-23 11:31:40
从卖产品到帮人做生意:xTool跑出中国出海新范式

从卖产品到帮人做生意:xTool跑出中国出海新范式

霞光社
2026-09-23 13:18:29
亚运男足太残酷了:随着伊朗1-4遭逆转,八强仅一支西亚球队

亚运男足太残酷了:随着伊朗1-4遭逆转,八强仅一支西亚球队

侧身凌空斩
2026-09-23 15:40:55
不愿回国!两名朝鲜亚运代表团成员,希望留在日本寻求庇护

不愿回国!两名朝鲜亚运代表团成员,希望留在日本寻求庇护

全景体育V
2026-09-22 19:39:04
豆包上车,熟悉的助手接下新的任务

豆包上车,熟悉的助手接下新的任务

晚点LatePost
2026-09-18 20:59:57
哈佛研究发现:3种颜色是“抑郁色”,若孩子喜欢,家长需谨慎

哈佛研究发现:3种颜色是“抑郁色”,若孩子喜欢,家长需谨慎

户外阿毽
2026-09-23 15:23:41
特朗普:从“泽连斯基没有牌”到请求乌克兰停火

特朗普:从“泽连斯基没有牌”到请求乌克兰停火

名人苟或
2026-09-23 15:29:18
2026-09-23 18:35:00
AI科技评论 incentive-icons
AI科技评论
点评学术,服务AI
7668文章数 20785关注度
往期回顾 全部

科技要闻

2026网易未来大会下午:AI走进现实

头条要闻

中国U23亚运会小组头名出线 八强战或避开日本

头条要闻

中国U23亚运会小组头名出线 八强战或避开日本

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

王玉雯杨玏被曝结婚又离 荒唐一幕出现

财经要闻

全市场都在卷自营

汽车要闻

5.1米的启境GX7,底盘凭什么又稳又舒服?

态度原创

房产
健康
时尚
家居
公开课

房产要闻

楼市变天!三亚第一个"接住"新政的楼盘出现了

痘痘没成熟,千万别硬挤!

消失的天后,带病复出,先赚10个亿

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版