登录

4 B模型下棋比肩大师、还会讲棋,陈丹琦团队怎么做到的?


速读:模型地址:https:。 大师负责「看」,解说员负责「说」,关键在于让解说员真正读懂大师的手势。 SmolLM3-3B,一个几乎没受过国际象棋训练的通用指令模型。
2026年10月06日 18:36

编辑|Panda

9 月 27 日,第 46 届国际象棋奥林匹克团体赛在撒马尔罕落幕。东道主乌兹别克斯坦在最后一轮以 2.5 比 1.5 击败乌克兰,第二次捧起公开组金牌,中国女队则第七次登上女子组最高领奖台。下一场焦点大战也近在眼前:11 月底,两位 20 岁的棋手古克什(Gukesh D)与辛达罗夫(Javokhir Sindarov)将在日内瓦争夺世界冠军头衔,这将是史上最年轻的一场世界冠军对决。

看过近几年顶级棋赛直播的人,大概都熟悉画面一侧那根上下浮动的评估条。引擎会告诉你此刻白方领先半个兵,或者某步棋让胜率一落千丈,但它从不解释原因——这仍要靠坐在解说席上的特级大师。

棋盘最左边那根黑白相间、上下浮动的竖条就是评估条 棋盘最左边那根黑白相间、上下浮动的竖条就是评估条 这其实是 AI 领域一个普遍困境的缩影。最强的专家模型往往是沉默的,而最会说话的语言模型,在专业领域里又常常不够强。国际象棋引擎早已把人类远远甩在身后,却说不出一句人话。前沿大模型能写出头头是道的分析,可它推荐的着法本身未必站得住,解释也就成了无本之木。

近日,普林斯顿大学陈丹琦团队在 arXiv 发布了一项成果,尝试把这两端接起来。

他们训练的模型名叫  Q UEE N ,总参数量约 4B,棋力接近一位典型特级大师,同时能用自然语言讲清楚自己为什么这样走。

论文标题:Language Models that Play Chess and Explain Their Moves

论文地址:https://arxiv.org/abs/2610.03695v1

模型地址:https://huggingface.co/collections/princeton-nlp/queen-chess-models

开源代码:https://github.com/queen-project/queen

会下的不会说,会说的下不好

国际象棋与 AI 的缘分可以追溯到 1950 年。那一年,克劳德·香农(Claude Shannon)估算了国际象棋的计算复杂度,并设想了下棋机器的样子。

此后七十多年,从依靠手工评估函数的「深蓝」,到靠自我对弈成长起来的 AlphaZero,再到基于 Transformer 的 Leela Chess Zero(Lc0),引擎一代比一代强。但它们输出的始终只是一个着法和一串胜率数字。

语言模型这边的问题恰好相反。论文梳理发现,此前专门微调过的国际象棋语言模型大多只在孤立的战术题上训练和评测,连在这种受限场景里都难以选出好棋,解释的质量自然有限。今天的前沿模型进步明显,能给出像样的解释,但代价不菲:作者在附录里提到,用 GPT-5.6-Sol 的高推理档下一整盘棋,成本常常超过 15 美元。

这件事的意义不止于棋盘。论文表示,截至 10 月 2 日,全球共有 1899 位特级大师,不到活跃线上棋手的万分之一。绝大多数棋手一辈子都等不到一位特级大师坐下来给自己讲棋。 一个既下得好、又讲得清、还跑得便宜的模型,填补的正是这块空白。

一位沉默的大师,一位会说话的解说员

QUEEN 的思路可以用一个场景来理解:让一位只会用手指棋盘的沉默大师,和一位口才很好但棋力平平的解说员搭 档 。 大师负责「看」,解说员负责「说」,关键在于让解说员真正读懂大师的手势。

具体来说,「沉默的大师」是 Lc0 家族的  BT5 网络 (论文称其为 Leela),约 240M 参数、15 层,输入固定为 64 个 token,正好对应棋盘上的 64 个格子,不做搜索就能下到接近超人的水平。

「解说员」是 HuggingFace 的  SmolLM3-3B ,一个几乎没受过国际象棋训练的通用指令模型。

两者之间的桥梁借鉴了 视觉语言模型  Fla mingo 的门控交叉注意力 :Leela 第 i 层的表征,接入语言模型第 2i 层之前,一共插入 16 个桥接模块,约 470M 参数。与原版 Flamingo 只取编码器最后一层不同,这种逐层对接让语言模型能同时看到 Leela 浅层和深层的「想法」。门控初始值设为零,桥接一开始相当于不存在,再随训练逐步打开,避免早期噪声干扰。

接下来是教解说员读懂手势。团队设计了一套 四阶段问答课程 ,由浅入深:先问「某个格子上是什么子」这类静态问题,再问「这个马能走到哪」「谁能将军」这类动态问题,然后给出 1 到 8 步走法,让模型推演出未来局面再作答。所有答案都由程序生成并校验。这一阶段 Leela 和语言模型本体都被冻结,只训练桥接层和新增的词表。之所以要新增 64 个格子和 12 种棋子的专用 token,是因为原有分词器对格子名拆分得不一致,而「bishop」「knight」这些词在日常语料里带着与棋盘无关的含义。

训练后,模型在四类问题上的准确率分别达到 99.97%、99.97%、98.97% 和 96.07 % 。

用自然语言版的「贝尔曼更新」自我进化

学会读棋之后,模型还不会写分析。团队先用 GPT-5.6-Sol 的低推理档为 15000 个局面生成示范解释,花费 652.35 美元,过滤掉含非法着法或失误的样本后剩下 8602 条,用来做第一轮监督微调,得到的模型 Elo 为 1782。解释写得通顺,但推荐的棋常常不靠谱。

真正让 QUEEN 变强的,是新提出的 迭代搜索蒸馏 。它的灵感来自 AlphaZero:用搜索得到更好的判断,再把判断「压」回网络里,让网络下次不搜也能直接想到。QUEEN 的做法是把这个过程搬到自然语言上,作为理查德·贝尔曼(Richard Bellman)价值更新的语言版本。

这很像一位棋手的复盘习惯。面对一个局面,模型先写出三个候选着法;然后分别走一步,把三个新局面各自重新分析一遍;如果某个子局面的分析本身出了错,就顺着这个错误继续往下钻,直到找到模型「刚好力所不及」的位置。

随后,由 Qwen3.8-27B 把三份子分析合并成一份对原局面的完整解释,说明为什么选这一步、另外两步差在哪里,并被明确要求不得添加任何新内容。只有当合并后的结论比模型原先的判断更好时,这条数据才会被保留,用来训练下一轮模型。

主题:模型|国际象棋|解释|特级大师