让一个AI智能体独立经营网店一整年,它会亏钱还是赚钱?Qwen团队最新发布的E-Commerce Bench基准测试,把这个问题变成了一个可以量化的实验。这个测试让AI智能体在模拟环境中同时运营多家线上店铺,时间跨度长达365天,用来评估大模型在长期任务中的自主经营能力。
测试结果相当有信息量:18个前沿模型在七个维度上被评分,没有一个模型能全面领先。表现最好的GPT-5.6 Sol把100,000美元的启动资金做到了1,431,425美元,但在防欺诈维度上却排到了18个模型中的第16位,运营效率也不如Fable 5。赚钱能力强和风险控制能力弱,在同一个模型身上同时出现了。
![]()
开源模型阵营的排位
开源权重模型的表现同样值得关注。Qwen3.8-Max-Preview在开源阵营中领跑,最终资产达到416,252美元,比GLM 5.2(high)高出38%。更值得注意的是它的学习能力——在长达一年的模拟经营中,这个模型通过反复与供应商议价,逐步把采购成本压了下来。
这个细节很关键。大多数AI评测只关注单次对话或单轮任务的表现,但真实的商业经营是一个持续决策的过程:今天压价成功,明天可能影响供货关系;这个月冲销量,下个月可能面临库存积压。E-Commerce Bench的设计思路,就是把评测周期拉长到一年,看模型能不能在长期博弈中不断优化策略。
为什么长期评测这么难做
长期评测的难点在于,模型需要在一个动态环境中持续做出决策,而且每个决策的后果会累积。短期评测里,模型只需要针对当前问题给出正确答案;但在365天的经营模拟中,模型必须记住之前的交易记录、调整定价策略、管理库存周转、应对市场变化——这些能力很难用传统的单轮问答来检验。
从测试结果来看,不同模型在不同维度上各有长短。有的模型擅长快速积累资产,但在风险控制上表现不佳;有的模型运营效率很高,但总资产排名并不靠前。这种分化说明,“综合能力强”和“单项能力突出”是两回事,企业在选择模型时,需要根据具体业务场景来权衡。
对AI应用落地的启示
这个基准测试的价值在于,它把AI从“聊天工具”推向“经营助手”的评估场景。如果AI智能体真的要被用于电商运营、供应链管理这类长期任务,那么评测标准就不能只看单次回答的质量,还要看它在长时间跨度内的决策连贯性。
Qwen团队把论文和评测细节都公开了,论文地址在arxiv.org/abs/2608.30730,感兴趣的开发者可以直接查看完整的评测方法和数据。对于正在做AI智能体应用开发的团队来说,这份基准测试提供了一个参考框架:你的模型在一年期的任务里,能不能持续做出好决策?
目前来看,答案因模型而异。但至少,评测方法本身已经向前走了一步。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.