网易首页 > 网易号 > 正文 申请入驻

4B模型下棋比肩大师、还会讲棋,陈丹琦团队怎么做到的?

0
分享至

编辑|Panda


9 月 27 日,第 46 届国际象棋奥林匹克团体赛在撒马尔罕落幕。东道主乌兹别克斯坦在最后一轮以 2.5 比 1.5 击败乌克兰,第二次捧起公开组金牌,中国女队则第七次登上女子组最高领奖台。下一场焦点大战也近在眼前:11 月底,两位 20 岁的棋手古克什(Gukesh D)与辛达罗夫(Javokhir Sindarov)将在日内瓦争夺世界冠军头衔,这将是史上最年轻的一场世界冠军对决。

看过近几年顶级棋赛直播的人,大概都熟悉画面一侧那根上下浮动的评估条。引擎会告诉你此刻白方领先半个兵,或者某步棋让胜率一落千丈,但它从不解释原因——这仍要靠坐在解说席上的特级大师。



棋盘最左边那根黑白相间、上下浮动的竖条就是评估条

这其实是 AI 领域一个普遍困境的缩影。最强的专家模型往往是沉默的,而最会说话的语言模型,在专业领域里又常常不够强。国际象棋引擎早已把人类远远甩在身后,却说不出一句人话。前沿大模型能写出头头是道的分析,可它推荐的着法本身未必站得住,解释也就成了无本之木。

近日,普林斯顿大学陈丹琦团队在 arXiv 发布了一项成果,尝试把这两端接起来。



他们训练的模型名叫QUEEN,总参数量约 4B,棋力接近一位典型特级大师,同时能用自然语言讲清楚自己为什么这样走。





  • 论文标题:Language Models that Play Chess and Explain Their Moves
  • 论文地址:https://arxiv.org/abs/2610.03695v1
  • 模型地址:https://huggingface.co/collections/princeton-nlp/queen-chess-models
  • 开源代码:https://github.com/queen-project/queen

会下的不会说,会说的下不好

国际象棋与 AI 的缘分可以追溯到 1950 年。那一年,克劳德·香农(Claude Shannon)估算了国际象棋的计算复杂度,并设想了下棋机器的样子。

此后七十多年,从依靠手工评估函数的「深蓝」,到靠自我对弈成长起来的 AlphaZero,再到基于 Transformer 的 Leela Chess Zero(Lc0),引擎一代比一代强。但它们输出的始终只是一个着法和一串胜率数字。

语言模型这边的问题恰好相反。论文梳理发现,此前专门微调过的国际象棋语言模型大多只在孤立的战术题上训练和评测,连在这种受限场景里都难以选出好棋,解释的质量自然有限。今天的前沿模型进步明显,能给出像样的解释,但代价不菲:作者在附录里提到,用 GPT-5.6-Sol 的高推理档下一整盘棋,成本常常超过 15 美元。

这件事的意义不止于棋盘。论文表示,截至 10 月 2 日,全球共有 1899 位特级大师,不到活跃线上棋手的万分之一。绝大多数棋手一辈子都等不到一位特级大师坐下来给自己讲棋。 一个既下得好、又讲得清、还跑得便宜的模型,填补的正是这块空白。

一位沉默的大师,一位会说话的解说员

QUEEN 的思路可以用一个场景来理解:让一位只会用手指棋盘的沉默大师,和一位口才很好但棋力平平的解说员搭档。大师负责「看」,解说员负责「说」,关键在于让解说员真正读懂大师的手势。



具体来说,「沉默的大师」是 Lc0 家族的BT5 网络(论文称其为 Leela),约 240M 参数、15 层,输入固定为 64 个 token,正好对应棋盘上的 64 个格子,不做搜索就能下到接近超人的水平。

「解说员」是 HuggingFace 的SmolLM3-3B,一个几乎没受过国际象棋训练的通用指令模型。

两者之间的桥梁借鉴了视觉语言模型Flamingo 的门控交叉注意力:Leela 第 i 层的表征,接入语言模型第 2i 层之前,一共插入 16 个桥接模块,约 470M 参数。与原版 Flamingo 只取编码器最后一层不同,这种逐层对接让语言模型能同时看到 Leela 浅层和深层的「想法」。门控初始值设为零,桥接一开始相当于不存在,再随训练逐步打开,避免早期噪声干扰。

接下来是教解说员读懂手势。团队设计了一套四阶段问答课程,由浅入深:先问「某个格子上是什么子」这类静态问题,再问「这个马能走到哪」「谁能将军」这类动态问题,然后给出 1 到 8 步走法,让模型推演出未来局面再作答。所有答案都由程序生成并校验。这一阶段 Leela 和语言模型本体都被冻结,只训练桥接层和新增的词表。之所以要新增 64 个格子和 12 种棋子的专用 token,是因为原有分词器对格子名拆分得不一致,而「bishop」「knight」这些词在日常语料里带着与棋盘无关的含义。

训练后,模型在四类问题上的准确率分别达到 99.97%、99.97%、98.97% 和 96.07%。

用自然语言版的「贝尔曼更新」自我进化

学会读棋之后,模型还不会写分析。团队先用 GPT-5.6-Sol 的低推理档为 15000 个局面生成示范解释,花费 652.35 美元,过滤掉含非法着法或失误的样本后剩下 8602 条,用来做第一轮监督微调,得到的模型 Elo 为 1782。解释写得通顺,但推荐的棋常常不靠谱。

真正让 QUEEN 变强的,是新提出的迭代搜索蒸馏。它的灵感来自 AlphaZero:用搜索得到更好的判断,再把判断「压」回网络里,让网络下次不搜也能直接想到。QUEEN 的做法是把这个过程搬到自然语言上,作为理查德·贝尔曼(Richard Bellman)价值更新的语言版本。

这很像一位棋手的复盘习惯。面对一个局面,模型先写出三个候选着法;然后分别走一步,把三个新局面各自重新分析一遍;如果某个子局面的分析本身出了错,就顺着这个错误继续往下钻,直到找到模型「刚好力所不及」的位置。

随后,由 Qwen3.8-27B 把三份子分析合并成一份对原局面的完整解释,说明为什么选这一步、另外两步差在哪里,并被明确要求不得添加任何新内容。只有当合并后的结论比模型原先的判断更好时,这条数据才会被保留,用来训练下一轮模型。



论文给出了一些例子。白方面对三个候选:Rh2、Qh2+ 和 Qxf3。从对手视角看,三个子局面的评估分别是必被将死、-0.1 和 0.0,取对对手最不利的那个,结论是看似安静的 Rh2 才是杀着,而诱人的将军 Qh2+ 会放走对方的王。每一轮大约从 40 万个根局面出发,最终产出 15 万到 28 万条训练数据。七轮之后,第八代模型被正式命名为 QUEEN。

实验结果

棋力方面,每个模型与 8 个强度不同的引擎对弈 32 盘,按 Lichess 等级分体系换算。QUEEN 最终达到 2697 分,Gemini-3.1-Pro 为 2201,GPT-5.6-Sol 为 2071,同为 4B 规模的前作 C1-4B 则 32 盘全负。作为参照,Lichess 上特级大师快棋等级分的中位数是 2730。七轮迭代中,QUEEN 的分数从 1782 一路涨到 2697,累计提升 915 分,中间第五到第六轮曾短暂回落约 100 分。



论证能力方面,团队在 1000 道战术题和 1000 个实战局面上检验模型给出的主变是否出错。在战术题上,QUEEN 首步不失误率为 91.6%,比第二名 Gemini 高出 9 个百分点;在实战局面上这一数字为 97.1%。

不过,论文也坦率展示了短板。在 GPT-5.6-Sol 担任评委的打分里,QUEEN 的结构连贯性为 3.51,与 Sol 持平,但概念连贯性只有 2.76,明显低于 Sol 的 3.61,语言流畅度也略逊于前沿模型。

换句话说,它找到的变化是对的,但在用「牵制」「前哨」这类术语描述局面时更容易张冠李戴。作者分析,自我蒸馏能把搜索树逐渐压进权重,却教不会模型描述它没见过的棋型,错误的概念还可能在合并过程中层层传递。

消融实验给出了两个结论:

  • Leela 编码器和四阶段课程缺一不可,去掉任何一个,模型的棋力都会跌到 514 分。
  • QUEEN 并非简单复读 Leela:在有 5 个以上合理着法的局面中,它有 53.8% 的情况选了与 Leela 不同的棋。

团队还试验了完全不依赖前沿大模型的版本,用 Stockfish 手工评估特征加模板生成初始解释,结果前四轮的棋力反而更高,第一轮就达到 2115 分。

结语

QUEEN 的价值不只在国际象棋。它真正提供的是一套配方:在一个已有「沉默专家」的领域,用交叉注意力把专家模型接到语言模型上,先用课程教会语言模型读懂专家的表征,再用搜索加蒸馏的方式让解释越写越好。

作者认为,这套方法可以迁移到游戏、机器人和计算机操作等领域,这些地方恰好都不缺强大但不会说话的专用模型。

再过一个多月,日内瓦的世界冠军赛直播里,评估条依然只会给出数字,而能把数字讲成道理的 AI,或许已经不远了。



特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
凌晨在北京离世?同时和8个男友恩爱?75岁刘晓庆私生活谣言离谱

凌晨在北京离世?同时和8个男友恩爱?75岁刘晓庆私生活谣言离谱

秋姐居
2026-10-07 09:42:47
山东舰升级改造接近尾声,即将解锁歼35,国产四航母未来都将用上五代机

山东舰升级改造接近尾声,即将解锁歼35,国产四航母未来都将用上五代机

军武吐槽君
2026-10-07 16:18:37
除了喝酒,刘欢还有一个生活习惯,让他从 104 斤胖到快 200 斤!

除了喝酒,刘欢还有一个生活习惯,让他从 104 斤胖到快 200 斤!

荆楚寰宇文枢
2026-10-05 23:34:48
最亲华的欧洲领导人也要凉了,学默克尔每年访华,突然就翻车了

最亲华的欧洲领导人也要凉了,学默克尔每年访华,突然就翻车了

健身狂人
2026-10-07 06:27:29
专家发现:老人若从不喝牛奶,比起喝牛奶的人,身体会有 5 种区别

专家发现:老人若从不喝牛奶,比起喝牛奶的人,身体会有 5 种区别

路医生健康科普
2026-10-07 09:25:03
不查不知道 一查吓一跳,身价千万独居北京的王曼昱,私底下有多

不查不知道 一查吓一跳,身价千万独居北京的王曼昱,私底下有多

兵鉴史
2026-10-07 16:58:04
WTT中国大满贯捷报:男单爆冷!日乒主力遭4连杀!亚运冠军一轮游

WTT中国大满贯捷报:男单爆冷!日乒主力遭4连杀!亚运冠军一轮游

北纬的咖啡豆
2026-10-07 09:32:12
手握重兵也白搭!缅北“副总司令”昆明落网,中国法律不会惯着

手握重兵也白搭!缅北“副总司令”昆明落网,中国法律不会惯着

爱意随风起呀
2026-10-06 17:08:00
彼得森23+3+3无缘今日最佳!对不起,你碰到不讲理的勇士11号秀了

彼得森23+3+3无缘今日最佳!对不起,你碰到不讲理的勇士11号秀了

微评体育圈
2026-10-07 12:36:04
宏远晚报!大外即将到位,胡明轩喊话挑战上海,杜锋爱将闯下大祸!

宏远晚报!大外即将到位,胡明轩喊话挑战上海,杜锋爱将闯下大祸!

体坛卡卡说
2026-10-07 19:05:39
俄乌停火,中国买单?特朗普演都不演了,欧乌的请求要让中国应下

俄乌停火,中国买单?特朗普演都不演了,欧乌的请求要让中国应下

顾蔡卫
2026-10-06 10:50:31
水均益晒14岁龙凤胎,国外读书花销大,全靠他一人在北京赚钱养家

水均益晒14岁龙凤胎,国外读书花销大,全靠他一人在北京赚钱养家

梦想的旅途照进现实
2026-10-07 15:22:40
多名游客无视“不要踩踏”提示进入桂林阳朔一农田拍照,当地:已接到反馈,会协调处理

多名游客无视“不要踩踏”提示进入桂林阳朔一农田拍照,当地:已接到反馈,会协调处理

潇湘晨报
2026-10-07 13:07:11
好人没好报?蔡天凤案曝最无耻一幕!开水煮、轮流上、仅冰山一角

好人没好报?蔡天凤案曝最无耻一幕!开水煮、轮流上、仅冰山一角

青杉依旧啊啊
2026-10-05 10:25:32
特朗普:对伊朗的军事行动 “必须收尾了”,唯一要考虑的问题是以哪种方式收尾,是以柔和的方式或是强硬的方式

特朗普:对伊朗的军事行动 “必须收尾了”,唯一要考虑的问题是以哪种方式收尾,是以柔和的方式或是强硬的方式

极目新闻
2026-10-07 16:43:06
凌晨3点踹开房门!缅北四大家族以为来谈条件,10分钟后全部戴铐

凌晨3点踹开房门!缅北四大家族以为来谈条件,10分钟后全部戴铐

水泥土的搞笑
2026-10-07 16:25:17
号称世界第一的华西医院到底有多强?输了两天液,发现医生一直在骂同行

号称世界第一的华西医院到底有多强?输了两天液,发现医生一直在骂同行

华庭讲美食
2026-10-06 12:20:28
确认了!印度要申办奥运会!

确认了!印度要申办奥运会!

五星体育
2026-10-07 16:21:43
杀疯了!上市首日暴涨近十倍之后连跌6天蒸发70%,入场的全部被套?

杀疯了!上市首日暴涨近十倍之后连跌6天蒸发70%,入场的全部被套?

趋势清风侠
2026-10-07 17:17:02
珠海游客怒了!一盘皮皮虾480元,游客自费800元投流,曝光珠海一家海鲜大排档,网友:就在海洲路,出名了

珠海游客怒了!一盘皮皮虾480元,游客自费800元投流,曝光珠海一家海鲜大排档,网友:就在海洲路,出名了

火山詩话
2026-10-05 06:35:30
2026-10-07 20:12:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14143文章数 142744关注度
往期回顾 全部

体育要闻

从骑马舞到开口全中文 德约在北京不止七冠

头条要闻

男子带妻子和10岁娃爬山走野路 用手机照亮半夜没走出

头条要闻

男子带妻子和10岁娃爬山走野路 用手机照亮半夜没走出

娱乐要闻

蔡康永风波再升级!这次谁也救不了他

财经要闻

谷歌签下科技史上最大核能协议

科技要闻

诺贝尔化学奖揭晓,两位科学家摘得大奖

汽车要闻

智能化再提升 2027款东风标致、东风雪铁龙新车更人性化了

态度原创

艺术
教育
数码
手机
军事航空

艺术要闻

吴冠中 84岁画的风筝,358.4万港元!

教育要闻

这题做起来,错误率怎么这么高呢?

数码要闻

苹果Apple TV平台F1赛事转播将支持杜比全景声,本月底上线

手机要闻

还得是苹果!iPhone Duo 强制 APP 适配,不适配直接下架,安卓办不到

军事要闻

外舰跟监遵义舰 结果自己先"趴窝"了

无障碍浏览 进入关怀版