![]()
作者 | 山竹
出品 | 锌产业
7月6日,腾讯正式发布混元Hy3。
据悉,Hy3是Hy3 preview的正式版本,重点提升智能体、代码生成、办公任务和复杂推理能力,并进一步下调API调用价格。
这一次,腾讯给出的关键词很明确:Agent、开源、低成本、真实业务链路。
Hy3采用MoE架构,总参数量2950亿,激活参数量210亿,支持256K上下文长度。
腾讯同时宣布,Hy3采用Apache 2.0协议开源,模型权重已上线GitHub、Hugging Face、ModelScope等平台。
API定价为输入1元/百万tokens、输出4元/百万tokens,缓存命中输入价格为0.25元/百万tokens。
在当下的大模型竞争里,这些信息并不只是配置表,更重要的是,腾讯正在把Hy3放进自己的产品系统里验证:
元宝、WorkBuddy、CodeBuddy、Marvis、ima,以及游戏业务,都成了Hy3的测试场。
01 智能体热潮下,腾讯先强调“能不能执行”
过去一年,大模型行业最热的词之一,是Agent。
但Agent这件事已经不新鲜了,真正难的是,模型能不能在长流程任务里少犯错、少乱试、少卡住,并且稳定调用工具,把结果交付出来。用户不关心模型是不是“很聪明”,用户只关心它能不能把PPT、Word、Excel、PDF、HTML这些文件做完,能不能在多轮对话里记住约束,能不能在证据不足时少编一点。
Hy3的发布,正踩在这个节点上。
![]()
腾讯元宝基于Hy3同步上线了Agent能力,用户在日常对话中输入需求,元宝即可执行复杂任务并交付PPT、Word、Excel、PDF、HTML等文件。
这个动作的意义在于,腾讯没有把Hy3仅仅包装成一个聊天模型,而是把它直接推向办公交付场景。
从腾讯在GitHub开源页披露的信息看,Hy3在后训练阶段提升了数据质量与多样性,并扩大了强化学习训练规模,重点改善推理、Agent工作流和长上下文任务。
腾讯还特别提到,公共榜单不能完全反映真实可用性,因此组织了270位专家基于真实工作任务进行盲测,Hy3平均得分2.67分,GLM-5.1为2.51分。
这些数字当然仍属于腾讯自家披露,需要放在“官方评测”语境里理解。但它们至少说明,Hy3这次主打的不是单点能力,而是更接近产品现场的稳定性。
![]()
这也是Agent赛道正在发生的变化:
早期讨论的是模型能不能拆任务,现在讨论的是它能不能少出错、会停手、能恢复、能持续执行。
按照腾讯GitHub页面显示,Hy3改进了输出格式和工具调用稳定性,减少无效调用和循环式错误;在真实场景内部评估中,幻觉率和常识错误率较此前版本下降,多轮意图跟踪也有提升。
换句话说,Hy3的Agent能力不是一个单独按钮,而是一组基础能力的合成:
长上下文、工具调用、规划执行、错误恢复、反幻觉和多轮约束保持。
它不一定最炫,但它指向的是大模型商业化最朴素的一关:能不能稳定进入工作流。
02 游戏制作,是腾讯绕不开的老本行
更有意思的是游戏。
作为腾讯最重要的老本行之一,Hy3也提到了游戏制作能力的提升,而且不是一个随手列出的应用场景。
据悉,WeGame近期上线的《流放之路:降临》AI游戏助手接入Hy3后,多轮推理与工具调度综合成功率提升至92%,幻觉率从4.5%降至2.8%。
这不是AI直接生成一款游戏的故事,至少从目前公开信息看,Hy3首先提升的是游戏相关任务里的推理、工具调用和问答助手能力,而不是已经替代游戏引擎、美术管线或关卡编辑器。
但这恰恰是它更现实的地方。
游戏生产链极其复杂,策划要写玩法规则、任务对白和数值说明,程序要处理工具链、脚本和接口,运营要维护玩家问答和活动说明,美术和关卡团队要反复沟通世界观、场景需求与资产规范……
大模型如果能在这些环节中稳定承担辅助工作,价值不会小。
![]()
对腾讯来说,游戏场景还有一个天然优势:它既有大量真实业务问题,也有成熟产品入口。
相比一家只做模型的公司,腾讯可以把模型放进WeGame、游戏助手、开发工具、内部工作流和玩家服务系统里反复打磨,Agent能力在这里不只是会调用工具,而是要理解玩家问题、检索游戏知识、执行多轮推理,并在不确定时避免胡说。
这也是Hy3对游戏生成能力的潜在提升方向。
短期看,它更可能先作用于游戏研发和运营流程,比如剧情草案、任务文本、脚本辅助、玩法原型说明、前端页面、工具自动化和玩家助手。
中长期看,如果它与腾讯已有的3D生成、多模态生成和游戏引擎工具链结合,才可能进一步触及关卡原型、NPC行为、UGC内容生成等更深层环节。
换句话说,Hy3不是一个游戏生成模型,但它可能成为腾讯游戏AI工作流里的基础推理与执行层。
03 开源和降价背后,是模型进入真实场景的抢位
Hy3发布的另一个信号,是腾讯明显加快了开源与分发节奏。
Hy3将采用Apache 2.0协议开源,开发者可下载模型并用于商业场景,API已在腾讯云TokenHub上线,后续还将接入OpenRouter、Hermes、Kilo、Cline、OpenClaw、OpenCode、CherryStudio等平台,并同步进入Hugging Face、ModelScope等开源模型社区。
这套动作的目标很清楚:让模型尽快被开发者和产品团队用起来。
国内大模型已经进入一个不太讲故事的阶段。
只说参数、榜单和“比肩旗舰”已经不够了,模型要证明自己能在代码、办公、数据、搜索、游戏、客服、知识库这些场景中带来效率提升。
腾讯在Hy3上强调Agent能力、工具调用稳定性、幻觉率下降、价格降低,本质上是在降低应用侧的试用门槛。
这也解释了为什么元宝同步上线Agent能力很关键。
对普通用户来说,Agent不是技术名词,而是“帮我把文件做出来”。对企业和开发者来说,Agent也不是演示视频,而是模型能否稳定调用工具、遵守格式、处理长上下文、少走死循环。
不过,Hy3仍要面对几个现实问题:
第一,官方披露的评测结果还需要更多第三方验证。内部盲测、产品遥测和业务案例能说明趋势,但开发者最终仍会用自己的任务、成本和延迟来投票。
第二,Agent场景的难点不只在模型。工具接口、权限管理、文件格式、数据安全、任务回滚、执行日志,都会决定最终体验。一个模型再强,如果周边系统不稳,Agent仍然会翻车。
第三,游戏生成更不能被简单理解成“模型一键做游戏”。游戏工业的复杂性,远高于文档生成。Hy3在游戏助手、游戏制作任务上的提升,是一个值得关注的入口,但距离真正改变游戏生产管线,还需要和引擎、资产库、关卡工具、测试系统继续结合。
因此,Hy3最值得看的地方,不是它能不能在某个榜单上赢过谁,而是腾讯能不能把它持续塞进自己的真实业务里,让模型在办公、代码、游戏和内容生产中不断被磨出来。
Agent热潮已经不缺概念,腾讯这次发布Hy3,更像是在把问题拉回地面:
智能体不只要会想,还要会做;
不只要能回答,还要能交付;
不只要有模型能力,还要站得住业务现场。
对腾讯来说,游戏是老本行,也是检验AI能力的硬场景。
Hy3如果真能在这里跑通,它的意义就不只是又一个开源大模型,而是腾讯把大模型能力转成产品生产力的一次关键试验。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.