腾讯混元Hy4preview发布时,官方给它贴了四个标签:软件工程、办公分析、游戏开发、科学研究。参数规格也够唬人——770B总参数、49B激活参数、超过1M的上下文窗口。但参数好看不等于能干活,这是两码事。
网易科技团队用WorkBuddy对它做了五组实测,从做PPT到写订单后台,再到实现麦克斯韦方程的交互演示。结论是:它交出来的不是思路,而是可以继续使用的东西。
![]()
五组测试,覆盖四个生产力场景
测试设计得很实在,没有拿"你好世界"这种demo糊弄人。五组任务分别是:制作一份6页的活动简报PPT、开发一个带业务规则的前端页面、编写Python订单后台服务、创建一个可玩的网页游戏、实现麦克斯韦方程的交互演示。
每个任务都埋了业务逻辑的坑。前端测试包含跨时区、批量回滚这类真实场景;订单后台覆盖幂等键、库存不足整单回滚、重启状态恢复;截图理解环节还要求模型诚实标注看不清的内容,而不是靠猜。
这种验证方式比单纯跑benchmark更能反映生产环境里的可靠性。模型能不能在复杂约束下把事做完,比它能不能答对一道推理题重要得多。
PPT精修环节,烧掉562万Token
五组测试里有个反直觉的数据:耗时最长的麦克斯韦方程演示,Token消耗并不是最高的。真正的大头在PPT第二轮精修,烧了562万Token。
原因不难理解。模型要反复生成、渲染、检查六页内容,每一轮都在走完整的工具调用链路,链路长度远超单页演示。Token在这里不是成绩,它只说明这一轮走了多长的工具和上下文链路。
这个数据点值得注意:办公场景的Token消耗可能比写代码更凶猛,因为涉及多轮视觉反馈和迭代修改。
能交付成品,但别指望零修改
测试结果显示,Hy4preview生成的PPT可以直接编辑继续讨论,订单后台能跑通并通过隐藏测试验证事务一致性,游戏可以实际游玩,麦克斯韦方程演示可交互验证。
这意味着模型已经具备从理解材料、规划步骤、写代码、调试到完成交付的完整工作能力链。它不再是一个只会回答问题的模型,而是能把任务直接推进到成品阶段的生产力工具。
当然,成品不等于完美。测试中也强调了模型在截图理解环节被要求诚实标注看不清的内容,说明它仍有边界。但至少它知道自己的边界在哪,而不是硬编一个答案出来。
判断:生产力工具的分水岭到了
正方观点:模型能交付可用的成品,这已经跨越了"demo"和"工具"之间的鸿沟。对于PPT、后台服务这类结构化任务,它确实能省下大量重复劳动。
反方观点:562万Token的精修成本说明效率仍有问题。如果一次PPT修改要烧掉这么多Token,实际使用成本未必比人工低。
我的判断是:Token消耗会随着模型迭代快速下降,但"能交付成品"这个能力拐点已经出现。接下来的竞争焦点,会从"能不能生成"转向"生成得多快、多省、多准"。腾讯混元这次至少证明了一件事——它已经站在了工具这一侧。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.