有人搭了一个叫 Brood War Bench 的测试场,把当下主流大模型拉进来打即时战略,让它们互相对战。结果是:所有模型的水平都没超过新手。
这个结果之所以扎眼,是因为《星际争霸:母巢之战》在 AI 研究里不是新面孔。这款 1998 年的经典即时战略游戏,一直是 AI 研究的老朋友。
![]()
AlphaStar 的旧账
2019 年,DeepMind 的 AlphaStar 曾在这款游戏里击败职业选手。那是即时战略游戏里少见的、AI 站上人类顶尖水平的时刻。
但那次胜利有个前提:AlphaStar 是专门训练的强化学习系统。它不是为了聊天、写代码或者回答问题的通用模型,它的全部本事都长在《星际争霸》这一件事上。
![]()
通用与专用的分界线
Brood War Bench 测的是另一类东西——当下主流的大模型。它们能对话、能写代码、能处理各种任务,但被放进即时战略的对战环境里,表现没能越过新手这条线。
一边是专门训练、击败职业选手的强化学习;一边是通用能力很强、却打不过新手的大模型。同一个游戏,两套系统,结果差得很远。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.