网易首页 > 网易号 > 正文 申请入驻

微信搜一搜 AI 问答,为什么越来越好用了?

0
分享至

清华与微信的研究团队分享了微信 AI 问答线上模型的训练范式,聚焦后训练中如何让大模型持续进化。该模型已在生产环境全量上线,欢迎大家体验~

论文链接:

https://arxiv.org/abs/2607.20083


在微信顶部搜索框输入问题,AI 问答即刻给出答案

前言|大模型如何持续进化?

当大模型已经能给出不错的回答,怎样让它继续进步?在后训练中,每一次优化都需要评价体系判断哪些回答更好,并据此为模型提供下一步的训练指导。然而,随着模型能力不断提升,生成的回答普遍达到较高质量。此时,回答之间的优劣越来越难区分,原有评价体系逐渐失去区分能力,也就成为模型持续进化的阻碍。

已有方法往往“绕着走”,借助能力更强的闭源评价模型,或追加人工标注。这些方法能够补充训练指导,却也意味着持续投入:随着模型的更新,评价体系需要随之升级,成本会在一轮轮迭代中不断累积。如何让评价体系摆脱成本高昂的“外援”,与模型一起进步——这是强模型持续进化必须解决的问题。

面对这一难题,清华大学与腾讯微信的研究团队公开了论文 Co-Evolving LLM Evaluators and Policies via DynamicRubric,分享了当前微信 AI 问答线上模型采用的持续自进化训练范式。大模型在其中同时扮演两个角色:一边是努力变聪明的“学生”模型,一边是越来越严格的“老师”评价体系。“学生”不断给出更好的回答,“老师”也相应地不断提高评价要求,大模型由此在一轮轮自我较量中持续进化。


理论分析|为什么评价体系也需要进化


论文首先从理论层面分析了评价体系为什么必须跟着模型一起进化。

在后训练中,模型根据评价体系的反馈进行优化。论文证明,驱动这一优化的信号,正是评价体系对好坏回答给出的分差。评价体系一旦无法区分回答,模型也就失去继续进步的有效指导。


传统的评价体系不会随当前模型的能力水平动态变化,因此很难捕捉同一组回答之间最细微的差异。论文进一步指出,让评价体系同时读取问题和当前模型生成出的回答,可以围绕关键区分之处动态生成评价标准。理论下界表明,相比传统的逐一评分,这种方式更有利于维持排序能力。


让评价体系看到模型生成的回答,解决的是当前优化中如何分辨优劣。模型完成一轮优化后,生成的回答随之变化,上一轮有效的评价标准又可能失去区分能力。因此,评价体系还要跟着新回答更新,再用更新后的评价结果指导模型继续优化。


论文据此将二者写成联合优化的形式,让评价体系与模型交替更新。模型推动评价体系变强,评价体系再推动模型进步,形成共同进化。


方法实现|让大模型分饰不同角色

DynamicRubric 不引入其他模型,而是直接将同一大模型复制三份,分别初始化策略模型 DR-Policy(P)、评价标准生成器 DR-Generator(G)和评价标准验证器 DR-Verifier(V)。后两者组成评价体系,为 DR-Policy 提供训练反馈。


在训练中,DR-Policy 接收用户问题并生成多个回答。DR-Generator 同时读取问题和这些回答,生成一组评价标准(rubric)。每条评价标准都是可用“是/否”核验的明确检查项。DR-Verifier 逐项判断每个回答是否满足要求,再将结果汇总为回答得分。每个得分都能追溯到具体检查项,评价过程也因此可解释。

“学生”与“老师”共同进化

把 DR-Policy 看作“学生”,把 DR-Generator 看作“老师”。“学生”的目标很直观:提高生成回答的评价得分。

“老师”的目标是区分“学生”当前生成的回答。但如果只追求“分得开”,就可能只抓住表面差异,继而引发奖励投机(reward hacking)。因此在优化目标中引入带排序的用户偏好数据作为锚点。“老师”写的评价标准由此既要区分当前回答,又要在锚点数据上给出正确排序,也就是既“分得开”,也“分得对”。

标题中的 Dynamic 由此体现在两个层面:在单轮比较中,“老师”根据多份回答动态生成评价条目;而在多轮训练中,“老师”也根据“学生”能力的提高动态提升评价标准。

三个角色都由同一模型权重初始化,因此这里的共同进化同时也是自进化:模型通过分饰不同角色在交替更新中相互推动,持续提升生成与评价能力。

开源实验|公开基准上的模型表现

开源实验以 Qwen3-8B 为统一基座,分别验证策略模型与评价体系的性能收益。先看策略模型,DR-Policy 在四项开放域生成评测中,均优于使用最高达 70B 的奖励模型或 235B 静态评价标准生成器的监督方案。


再看评价体系,训练后的 DR-Generator 在六项准确率指标上全部超过参数量为其四倍的 Qwen3-32B 动态评价标准生成器,整体表现也可与更大规模的标量奖励模型竞争。



持续优化的实验显示,随着训练推进,DR-Generator 的评价能力和 DR-Policy的回答能力都继续提升,评价体系与策略模型都能在持续迭代中自进化”。

鲁棒性、计算开销等更多实验和分析请参考论文~

全量上线|服务微信搜一搜场景 AI 问答

微信 AI 问答场景的线上模型以微信自研大模型 WeLM-V4-80B-A3B为基座,并采用 DynamicRubric 框架进行后训练。与同基座的上一代线上模型相比,新模型在总搜索量、用户时长和正向用户行为等多项指标上均取得统计显著提升。验证效果后,新模型替代上一代生产模型,在微信 AI 问答生产环境全量上线。

上线之后,训练不停:锚点数据会根据新的优化目标和用户偏好持续更新。DR-Generator 据此调整评价方向,更新后的评价体系再为 DR-Policy 提供反馈,推动模型继续优化。微信 AI 问答由此能够随着用户真实需求持续进步,变得“越来越好用”。

结语

回到微信搜索框中的真实提问:当模型已经能给出不错的回答时,持续进化的关键,是让评价体系始终提供有效的训练指导。如今,这套训练范式已服务微信搜一搜 AI 问答线上模型的持续优化。

论文:Co-Evolving LLM Evaluators and Policies via DynamicRubric

作者:Beining Wang、Weihang Su、Hongtao Tian、Hao Kong、Tao Yang、Ting Yao、Qingyi Pan、Yueyue Wu、Qingyao Ai、Min Zhang、Yiqun Liu

单位:清华大学、腾讯微信

微信AI

不描摹技术的酷炫,不依赖拟人的形态,微信AI是什么?是悄无声息却无处不在,是用技术创造更高效率,是更懂你。

微信AI关注语音识别与合成、自然语言处理、计算机视觉、工业级推荐系统等领域,成果对内应用于微信翻译、微信视频号、微信看一看、微信读书、微信输入法、微信搜一搜等业务,对外服务王者荣耀、腾讯视频、QQ音乐等产品。

来源 | 微信AI (ID:WeChatAI)

作者 | 微信AI; 编辑 | 虾饺

内容仅代表作者独立观点,不代表早读课立场


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
出轨女子第二波聊天记录曝光,虎狼之词惊呆吃瓜网友,她嫌丢人开始批量投诉了

出轨女子第二波聊天记录曝光,虎狼之词惊呆吃瓜网友,她嫌丢人开始批量投诉了

汉史趣闻
2026-09-01 17:55:01
美媒:带雷达试飞!中国六代机迈入飞行测试新阶段

美媒:带雷达试飞!中国六代机迈入飞行测试新阶段

自在天高
2026-09-18 12:13:11
落后的篮球理念!中国男篮惨败日本,输球原因揭晓,特殊日子添堵

落后的篮球理念!中国男篮惨败日本,输球原因揭晓,特殊日子添堵

侃球熊弟
2026-09-18 18:41:57
店员被曝将头屑撒至比萨上,还多次对菜品吐口水,最新进展:因寻衅滋事,涉事店员被行拘7日!

店员被曝将头屑撒至比萨上,还多次对菜品吐口水,最新进展:因寻衅滋事,涉事店员被行拘7日!

每日经济新闻
2026-09-18 00:57:57
意媒:欧冠首批付款超13亿欧,意甲4队分超1.47亿欧

意媒:欧冠首批付款超13亿欧,意甲4队分超1.47亿欧

懂球帝
2026-09-18 22:25:09
宇宙早期的"小红点"到底是什么?新研究给出一个答案

宇宙早期的"小红点"到底是什么?新研究给出一个答案

硬核实验室哦
2026-09-17 23:19:03
为了顺利邀请中方秋季访美,美国将拿出顶级规格迎接中国代表团。

为了顺利邀请中方秋季访美,美国将拿出顶级规格迎接中国代表团。

荆楚寰宇文枢
2026-09-18 23:19:04
好惨!汽车龙头暴降256%,理想赛力斯小鹏全都亏损,汽车集体暴雷

好惨!汽车龙头暴降256%,理想赛力斯小鹏全都亏损,汽车集体暴雷

周哥一影视
2026-09-16 05:08:14
返聘被降薪1万,老医生日子也不好过?年轻医生:退了还返聘,难怪年轻人找不到工作?返聘主任:要有大局观念,我每年都给年轻医生发红包

返聘被降薪1万,老医生日子也不好过?年轻医生:退了还返聘,难怪年轻人找不到工作?返聘主任:要有大局观念,我每年都给年轻医生发红包

梅斯医学
2026-09-18 07:53:54
砸了700多亿,就是为了不看越南的脸色!

砸了700多亿,就是为了不看越南的脸色!

余奕阳
2026-09-18 16:27:14
9月18日,美国驻日本大使馆发帖,纪念美军B-29轰炸机成功执飞首个从日本到美国的直飞航班81周年;日本网民“心情复杂”,要求删帖

9月18日,美国驻日本大使馆发帖,纪念美军B-29轰炸机成功执飞首个从日本到美国的直飞航班81周年;日本网民“心情复杂”,要求删帖

台州交通广播
2026-09-18 23:49:31
巴萨沉重打击!诺坎普核心惨遭重创!弗里克陷入两难

巴萨沉重打击!诺坎普核心惨遭重创!弗里克陷入两难

澜归序
2026-09-18 08:33:27
风中自由人像主题拍摄

风中自由人像主题拍摄

坊图
2026-09-15 21:55:02
涨价+抢房!上海楼市,开始爆发了!

涨价+抢房!上海楼市,开始爆发了!

涛哥杂谈
2026-09-18 14:21:06
奥运冠军杜丽现状:44岁仍韵味十足,如今从满脸痘蜕变成颜值女神

奥运冠军杜丽现状:44岁仍韵味十足,如今从满脸痘蜕变成颜值女神

巧妹电影
2026-08-18 14:41:15
松岛辉空:无论王楚钦状态多好,我都能抗衡!日本5成实力可胜中国

松岛辉空:无论王楚钦状态多好,我都能抗衡!日本5成实力可胜中国

十点街球体育
2026-09-18 06:05:06
性专家说:当一个异性开口跟你要钱,要礼物,不管对方是不是想试探你的真心,你都应该明白,你已被对方列入供养者行列

性专家说:当一个异性开口跟你要钱,要礼物,不管对方是不是想试探你的真心,你都应该明白,你已被对方列入供养者行列

心理观察局
2026-08-05 06:46:04
纯电续航1100km!比亚迪新车官宣:9月23日正式上市

纯电续航1100km!比亚迪新车官宣:9月23日正式上市

科技阿维
2026-09-18 13:53:15
问界要从华为店里撤了:不是“分手”,是华为把最肥的课,教给赛力斯自己上

问界要从华为店里撤了:不是“分手”,是华为把最肥的课,教给赛力斯自己上

狠人搞钱
2026-09-18 08:06:06
青山控股,赚翻了!

青山控股,赚翻了!

大永强
2026-09-18 11:54:12
2026-09-19 00:43:00
互联网早读课 incentive-icons
互联网早读课
专注互联网产品、运营、交互
9879文章数 55228关注度
往期回顾 全部

科技要闻

直击iPhone 18新机发售:黄牛加价不如前代

头条要闻

俄杜马选举拉夫罗夫"意外"登顶名单 梅德韦杰夫被拿下

头条要闻

俄杜马选举拉夫罗夫"意外"登顶名单 梅德韦杰夫被拿下

体育要闻

好吧,中国男篮辛苦了

娱乐要闻

陈思诚 佟丽娅不想让儿子知道两人离婚

财经要闻

研发0.25亿理财26亿,敷尔佳豪赌三类器械

汽车要闻

纯电/插混双动力+五座/六座双布局 海狮08应该怎么选?

态度原创

数码
家居
手机
本地
公开课

数码要闻

Realforce静电容键盘GX1 Plus皮卡丘版亮相TGS2026

家居要闻

2026建博会(广州) 公装联探展交流活动

手机要闻

华为份额27%居首,苹果12.7%暂列第六:iPhone18开售前的中国市场周报!

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版