游戏一直是被人低估的教育工具。它们门槛低,又很懂人性。
说这话的是 Good Start Labs 联合创始人兼 CEO Alex Duffy。这家公司正在做的事,是把游戏变成训练 AI 模型的教材。它去年十月从 AI 媒体与工具公司 Every 分拆出来,拿到了 360 万美元融资,投资方包括 General Catalyst、Inovia、Every 以及一批天使投资人。
![]()
这个想法的起点,是一场 2025 年的 Twitch 直播。
一场直播里,模型分出了性格
那场直播让前沿模型玩桌游《外交》(Diplomacy)。Duffy 说,这游戏正常玩一局要花上"几天甚至几周"。当时他还在 Every 担任 AI 训练负责人。
看着 AI 智能体在《外交》里互相厮杀,Duffy 发现每个前沿模型面对游戏场景时的行为都不一样。
最扎眼的是两个模型的对比:OpenAI 的 o3 靠策划一场未来的背叛赢下了所有对局;而 Claude 的 Opus 4 拒绝撒谎,结果"被打爆了"。
由此 Duffy 得出了一个判断:用《外交》这类游戏训练 AI 模型,可以教会它们战略思考这类能力。尤其是因为,这类游戏的结果是可以被验证的。
后来他在 Every 上发表的一篇文章里写道:"在策略游戏《外交》上微调一个模型,提升了它在客户支持和工业运营基准测试上的表现。"
背叛与诚实,在游戏里是胜负手,在基准测试里却变成了分数。
可验证,才是关键
Duffy 和联合创始人 Tyler Marques 创办 Good Start Labs,目标就是去找更多能教会 AI 模型有用技能的游戏。
他的原话是:"强化学习环境是教模型任何可验证内容的最可靠方式之一,这一点变得非常清楚。"
更大的设想在于:一个游戏以什么方式呈现给 AI,会决定它学到哪些技能,以及这些技能能不能带出游戏、用到工作里。
目前最有力的证据,来自一款十九世纪的铁路游戏。
1830:一款铁路游戏里的股市机制
Good Start Labs 最近让一个 30B 模型在游戏《1830:铁路与强盗大亨》里接受训练。维基百科对这款游戏的描述是:"一款策略游戏,其中唯一涉及运气的元素是决定初始行动顺序。"
随后,他们把同一个模型放到金融研究任务上测试。这个实验的设计目的,就是检验在游戏里学到的习惯能不能迁移到游戏之外。
Duffy 解释说:"那款游戏内部有股市机制。你在竞标这些铁路公司的股票……"
游戏里的竞价、持股、博弈,和金融研究任务之间,就这样被接上了线。
谁最可能背叛你
Good Start Labs 还发布了一份《外交》表现排名。按这份 2026 年 9 月的排名,Grok 4 Fast 是最不可能背叛你的那个模型。
反过来,在《外交》里别信 Gemini 2.5 Pro。
这份榜单本身也说明了一件事:同一个游戏,不同的模型会走出完全不同的路数。而 Duffy 想弄清楚的,正是这些路数背后,哪些能变成真实工作里的能力。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.