![]()
10 月 1 日,Anthropic 在自家的科学博客上刊发了哈佛大学理论物理学家马修·施瓦茨(Matthew Schwartz)的一篇客座文章。同一天,他借助 Claude 搭建的科研工具包 BootLoops 1.0 也在 GitHub 上以 MIT 协议正式开源。施瓦茨在文中透露,过去三个月里,他和 19 位合作者一起,带着 Claude 和这套工具从大约 400 个候选问题中筛选推进,最终完成了 36 篇学术手稿,涉及粒子物理、宇宙学、生态学、群体遗传学、经济学、语言学等 18 个领域。
这是施瓦茨今年第二次在 Anthropic 博客上记录自己用 Claude 做研究的经历。今年 3 月,他发表过一篇名为《Vibe Physics》的文章,讲述自己如何带着 Claude Opus 4.5,在两周内搞定了一篇通常需要做一年的量子色动力学论文。施瓦茨在新文章里回顾道,当时的 Opus 4.5 像个能力极强、干活快 20 倍的研究生,但整个协作过程其实很煎熬,他必须逐句帮它修改文字,还得时刻提防它跑偏,不断把它从支线和死胡同里拽回来。
这一次,他转变了思路。施瓦茨借用了物理学中的“阻抗失配”概念:两个系统如果各自运转良好,拼在一起却不匹配,那么一端输入的能量大部分都无法传递到另一端。在他看来,科学家想要的与 AI 擅长的事情之间,就存在这种明显的失配:“Claude 和 GPT 确实擅长科学,但它们并不是科学家。”
与其逼着模型像人类学者那样去思考和工作,不如反过来找适合它发挥的问题。他把这类问题称为“Claude 形状的问题”:许多学科目前卡壳的难题,其实在数学、物理或计算机领域早就有了成熟的解法,只是该领域的学者并不知情。而这正是 Claude 的强项,它各行各业都懂一点,代码功底扎实,而且阅读论文和处理数据的速度完全是机器级别的。
![]()
(来源:Anthropic)
BootLoops 框架就是顺着这个思路搭建起来的。施瓦茨将它定位为一个运行框架(harness),作用类似于 Claude Code 之于 Claude、Codex 之于 GPT。不同的是,BootLoops 不绑定任何特定模型,Claude、Gemini 或 ChatGPT 都能驱动。它的出发点是施瓦茨的本行:粒子物理中的散射振幅计算。散射振幅是连接对撞机实验数据与理论预言的桥梁,其核心是费曼图对应的多维积分。在当下,最棘手的那些积分,往往算出一个就足以拿下一篇博士学位论文。
过去 20 年间,物理学家探索出了另一条路径,即“S 矩阵自举法”(bootstrap):不再去死磕积分硬算,而是不断施加各种物理约束,直到把可能的结果排除到只剩一个。这套方法在对称性最高的理想理论中成果斐然,但一旦面对更接近现实的理论,约束条件往往就不够用了。于是学术界又发展出了“半数值自举”,也就是在少数几个特殊点上把积分算到极高精度(有时甚至需要上千位有效数字),再利用这些高精度数值把其余的系数彻底敲定。
施瓦茨认为,这种方法天生适合交给 AI 来做:它横跨数学、物理和计算机科学,几乎没有哪个单一学者能样样精通;它需要海量的代码编写和算法开发;最重要的是,其结果极易检验,任何人只需在电脑上跑两个脚本,就能将最终答案与原始积分逐位进行比对。
这一原则后来被确立为“BootLoops 标准”:一个费曼图只有在完整的函数解析形式已知、且能通过一个 Python 脚本在普通笔记本上算到任意精度时,才算真正被攻克。BootLoops 官网直言不讳地指出,设立这条标准就是为了防范 AI“作弊”,因为面对需要对齐的 30 位有效数字,AI 根本没有蒙混过关的空间。
今年夏天 Claude Fable 5 发布后,施瓦茨想测试一下它的网络安全攻防能力能否迁移到科学计算中。他给 Fable 5 安排的第一项任务,是将散落在 Wolfram 语言、C++、Python 和 Julia 中的各种计算方法统统移植进同一套框架,并补齐那些“只有论文发表、没有开源代码”的方法。Claude 大约只用了 20 分钟就完整复现了他当年某篇论文的结果,而施瓦茨当年写那套程序足足花了好几个星期;Claude 甚至还指出了他当年某一步算法效率低下,并直接给出了一种施瓦茨此前并不知晓的最优算法。
如今,BootLoops 官网上列出的工具有五十多个,一部分是 Claude 原生编写的,另一部分则是对社区现有成熟工具的移植与改进,其中两个核心的费曼积分引擎 AMFlow 和 Blade,其理论方法和最初的程序都出自北京大学马滟青团队。
随后,施瓦茨开始让 Claude 去啃那些此前无人算出的振幅。能用自举法解决的简单问题早被前人做完了,而施瓦茨注意到,Claude 总是习惯停留在最简单的对数函数范畴内,于是他推动它尝试更高阶的椭圆函数。椭圆型费曼积分难度极高,历史上被完整求解出的寥寥无几,据施瓦茨所知,此前还没有任何一个是纯靠自举法算出的。这并不是因为方法走不通,而是因为所需的跨学科知识过于分散,始终没人整合去试。
Claude 将此前为对数情况搭建的全套工具直接拓展了过去,其中许多支撑软件是它自己现写的,或者直接从纯数学领域借用过来的。短短几周内,他们便通过这套流程从头至尾求解了 30 个复杂积分,其中 15 个是用新途径复现的已知结果,另外 15 个则是此前从未有人计算出来的。
真正让研究全面铺开的,是一个有趣的学术现象:完全相同的数学方程,往往会在截然不同的学科中反复登场。施瓦茨原本只知道这些积分在宇宙学和弦论中管用;但 Claude 告诉他,费曼积分中有一大类在形式上就是若干多项式分别取幂再相乘,这与贝叶斯统计中根据离散计数数据比较模型时所用的“证据积分”在数学上完全一致。
而在群体遗传学、系统发育学、生态学以及单细胞测序中,这类积分随处可见。以往这些领域的学者大多依赖蒙特卡洛抽样进行近似计算,结果不可避免地带有统计噪声,但实际上,这些问题完全可以借助数学物理中的成熟工具直接求出解析解。
随着战线越拉越长,逐渐脱离自己熟悉的物理基本盘后,施瓦茨心里开始打鼓。当 Claude 声称在物理学上做出了重大突破时,他一眼就能看出真假,而且模型常常在胡说八道;但当 Claude 声称在其他陌生领域做出了重大成果时,他发现自己除了点头赞叹,根本无从反驳。
于是,他开始逐个寻找相关领域的资深专家介入把关。几乎每次求证的结论都如出一辙:Claude 在技术推导上挑不出毛病,但算出来的东西在领域内“没什么意思”,必须依靠真正的专家帮忙重新校正航向,才能转化为有真正学术价值的科学发现。
生态学领域的合作就是一个典型案例。中性生物多样性理论旨在探讨:一片森林里物种的兴盛与衰亡,究竟有多大成分纯属运气。生态学家斯蒂芬·哈贝尔(Stephen Hubbell)在 2001 年曾大胆假设这可能完全是偶然现象;2005 年,兰帕尔·艾蒂安(Rampal Etienne)为该理论推导出了一个数学方程,使其在原则上可以接受精确检验。然而整整 20 年间,从来没有人能在真实的大规模数据上真正解出这个方程。Claude 把这个方程解了出来,并应用在巴拿马运河的巴罗科罗拉多岛,这是全世界被生态学家监测得最透彻的热带森林样地。
计算结果显示,该森林树种构成的实际更替速率,是中性理论允许极限的 4.5 倍。施瓦茨兴奋地把这个成果拿给植物生物学教授、中性理论专家詹姆斯·奥德怀尔(James O'Dwyer)看。奥德怀尔对这套算法的技术实现大加赞赏,但坦言多数生态学家看到后大概只会“耸耸肩”,因为大家早就通过经验定性地知道,现实森林不可能纯靠中性理论解释。
不过,奥德怀尔给出了一个更敏锐的切入点:既然算出了中性理论的理论底线,不如直接把这部分中性背景扣除掉,去专注研究剩下的偏差,因为那才是自然选择、物种竞争与生态位差异真正发挥作用的地方。
随后,三方联手建立起一个描述树木生活史的最小化预测模型,该模型与实测数据高度吻合,目前正尝试从巴拿马推广至全球更多的森林观测网络。施瓦茨调侃道,在这次跨界合作中,自己实际上退化成了一个“Claude 操控员”,工作就是把 Claude 吐出的算式翻译给奥德怀尔听。
![]()
(来源:Anthropic)
群体遗传学项目也经历了几乎相同的路径。Claude 先是借用数学物理的方法,精确求解了一个在 1992 年提出、用于刻画自然选择如何塑造罕见突变的复杂积分公式,随后将其直接套用在目前最大的公开人类遗传变异数据库 gnomAD 上,涉及约 73 万人的蛋白编码区 DNA。
Claude 对跑出来的成果异常兴奋,而施瓦茨心里没底,先后给三位生物学家发信求证,最终拉来了自己的哈佛同事迈克尔·德赛(Michael Desai)。德赛同样高度认可纯数学上的解法,但觉得原问题的科学价值有限。他建议转换视角,去研究同一条染色体上相邻成对突变之间的关联性。
为此,Claude 引入了纯数学计算机辅助证明中的“不等式证书”等一系列新工具,分析了“千人基因组计划”中 113 位冈比亚人基因组里的 57 亿对相邻突变。最终发现,这些突变对偏离标准祖先模型的现象,大约有 95% 都可以用一种名为“基因转换”的机制得到解释。这项研究的重量在于:从推断远古人类种群演化历史到现代疾病的基因定位,以往几乎所有基于连锁遗传变异的经典统计分析,都完全忽略了基因转换的影响。
除了这些,还有一部分项目已经脱离了 BootLoops 起初擅长的精确符号积分,变成了更广泛意义上的“Claude 形状”的工作。例如,如今经济学顶级期刊通常要求作者公开复现包(包含原始数据和运行代码),交由期刊编辑核验,这是一项耗时耗力的繁琐工程。施瓦茨与经济学家以赛亚·安德鲁斯(Isaiah Andrews)、杰西·夏皮罗(Jesse Shapiro)合作开发了一个“AI 数据编辑”系统。
该系统直接抓取了《美国经济评论》《计量经济学》等五大顶刊自 2000 年以来发表的 4452 篇论文的复现包,将里面涉及的大约 3 万个程序,全部从 MATLAB、Stata 等商业软件平替移植为开源代码,并将论文表格中的几乎每一个数字与重跑结果逐个核对。
今年 9 月公布的 NBER 工作论文给出了初步核查数据:有 3460 篇论文的正文或附录中至少存在一处数字对不上;496 篇论文的计算流程通过代码重构实现了 10 倍以上的加速;还有 923 篇论文在原设定基础上被成功跑出了扩展分析。而在过去,同类学术复现研究的样本量往往只有几十到上百篇。
在语言学方向,过去关于世界语言词重音的类型学目录全凭语言学家人工梳理,不仅只覆盖几百种语言,还带有明显的样本偏差。Claude 检索了网络上所有公开可得的田野调查与学术文献,与三位语言学家合作构建了 AccStack 数据库,一口气收录了 6072 种语言的重音与声调数据,覆盖了全球约七成的已知口语语言。
几乎每一条录入的数据都附带了原书依据的引文摘录,同时还附带整理了一份包含 16 万部音系学文献的庞大书目。至于其余还在验证推进中的项目,还包括用数学物理模型复原地球“大氧化事件”如何伴随四次大冰期演进、用人口统计学模型测算太阳黑子的寿命,以及彻底解开数学家乔治·沃森(George Watson)在 1939 年提出的最后一个格点积分未解之谜。
能够多线并进推进这么多课题,背后依托的工程架构其实并不算太复杂。所有的 Claude Code 会话均部署在谷歌云的虚拟机上独立运行,每一个具体科研项目单独占用一个会话,另外设置一个“主控会话”负责统筹全局、分配算力配额并验收阶段性成果,同时还配置了专门充当“对抗性审稿人”的独立会话,负责在内部挑刺找茬。
具体到底层的密集运算,则全部下派给后台的子智能体(sub-agents)。施瓦茨提到,这么设计还有一个额外的好处:在深度代码交互中,他经常不小心触发 Fable 5 敏感的安全分类拦截器,而采用这种架构时,被系统强行熔断拦截的通常只是底层的某一个子智能体,不至于让整个项目的长会话上下文直接崩溃。
![]()
(来源:Anthropic)
即便工程调度如此严密,整个过程仍然高度依赖人工干预,施瓦茨在总结中详细罗列了 AI 目前的各种毛病。首先是 Claude 完全没有真实的时间流速概念,而且喜欢夸大其词。在某个项目终于搞定收尾时,Claude 曾充满戏剧性地对施瓦茨感叹:“Matt,公式终于解出来了。整整两年的浴血奋战,四次深入挺进……”而实际上,这项任务它总共只算了三天。
更让人头疼的是,Claude 在面对棘手计算时,默认倾向于选择“大力出奇迹”,宁愿傻傻跑上好几天去硬算,也想不到先写个小工具将算力需求压缩到几分钟内。施瓦茨不得不反复敲打它:“动动脑子想点聪明的办法,别光知道使蛮力。”
此外,Claude 极度热衷于提前宣布大捷,它口中的“任务完成(附带一个小条件)”,往往在事实上等于根本没做完。有一次,模型对自己给出的一份复杂数学证明极为满意,称全篇只剩“一个未经证明的小引理”,施瓦茨定睛一看,那个引理其实就是整个核心命题本身;而当他严厉要求模型“不许引入任何未证明的引理”后,Claude 没过多久再次宣布大功告成,只是这一次,它自作主张地在最前面直接添加了一条“新公理”。因此施瓦茨坚持,所有的分析图表必须由人类肉眼亲自审阅,完全依赖自动化检查绝不可靠。
至于在成千上万个潜在的“Claude 形状的问题”中,究竟挑选哪一个去攻克,模型完全没有鉴别力,它极度偏爱去翻找那些在历史上被高频引用、如今早已被学术界抛诸脑后的陈旧争论。所谓的“学术品味”,现阶段依然只能由人类学者来把关输入。
现年出任哈佛大学物理系正教授的施瓦茨,长期深耕于量子场论和粒子物理标准模型的精密检验,其撰写的《量子场论与标准模型》是全球物理系广泛采用的经典教材,他同时也是美国国家科学基金会人工智能与基本相互作用研究所(IAIFI)的创始成员。在这项密集的研究实验期间,他正担任 Anthropic 的访问研究员。
![]()
图丨马修·施瓦茨(来源:Harvard University)
BootLoops 的代码虽然是在其监督下由 Claude 编写、知识产权登记在 Anthropic 名下,但 Anthropic 在博文末尾特意澄清:BootLoops 属于独立开源探索,完全由施瓦茨个人拥有并维护。他的跨学科合作者与致谢名单阵容豪华,包括当代著名理论物理学家尼玛·阿尔卡尼-哈米德(Nima Arkani-Hamed)、数学家诺姆·埃尔基斯(Noam Elkies)以及计算社会科学家加里·金(Gary King)等人。
施瓦茨坦言,这项尝试在计算资源和 API token 上的开销极其惊人,其中相当一部分资金都花在了反复打磨代码、将其封装为普适通用的工具链上,目的就是为了让其他学者拿到手就能直接使用。
虽然用 AI 完成了如此多的工作,但谈及当下甚嚣尘上的“AI 科研革命”,施瓦茨本人的判断依然冷静。他坚持认为,无论大语言模型进化得多么聪慧,绝大多数实质性的科学突破,追根溯源仍然来自对真实物理世界数据的观测与提炼。数据需要人工去采集、理解与多轮校对,每一轮的结论又会衍生出下一轮全新的困惑。
AI 当然可以极好地嵌进这套飞轮中,并释放巨大的生产力,但它绝不可能将这套漫长的探索闭环压缩成一个按键,人类不可能单凭一句绝妙的 Prompt,就凭空换来可控核聚变堆或癌症的特效药。在他眼中,人类现有的知识版图边缘犬牙交错,那些单凭个人的智力和时间本来够得着、但过去受限于精力从未涉足过的学科交叉地带,才是当前最应该交给 AI 大展拳脚的舞台。
真正让他感到困惑与迷茫的反而是现实层面的学术生态。如果一个难题 AI 在一夜之间就能彻底算完,青年学者为什么还要耗费心力去申请为期三年的科研基金?两年前,他还会将“面向工程开发的 Python 编程”列为研究生的必修基本功,如今看来这项技能几乎已无立锥之地,他坦言自己至今仍在摸索未来到底该如何指导研究生。
施瓦茨同样关切的是,在这类“Claude 形状”的全新科研范式下,真正干活的人该如何获取应有的学术署名与尊重。传统的学术评价机制往往是顶层的课题负责人拿走全部学术声誉,而底层埋头编写代码、清洗数据的实际执行者往往默默无闻。AI 的深度介入,很可能会彻底颠覆甚至倒转这种既有的分配体系。施瓦茨直言,他目前也看不透这个利益机制最终会演变成什么样,“但有一点我很肯定,我们绝不能继续假装那些繁重的工作全是由人类亲手完成的了。”
参考资料:
1.https://www.anthropic.com/research/claude-shaped-science
2.https://github.com/BootLoops-ai/bootloops/tree/66b680ce742e654cfe86da4f072a69061fe182b1
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.