![]()
近日,一家名为 C5R 的美国旧金山初创公司用 12 周建成了一座 AI 驱动的研究设施 Facility-0,覆盖了生物学、化学和材料科学。接着它发布了一个名为 SciUniverse 的基准,能够测试模型是否可以在真实实验室里工作,结果发现模型虽然很懂科学理论,却在实际操作中频繁遗漏一些关键细节。
比如,当一个前沿 AI 模型在实验室里试图移液一批样本的时候,但它根本没有注意到样本还冻着。另一个 AI 模型在含 DNA 的孔之间重复使用了同一个枪头,以至于污染了整组样本。还有 AI 模型对着敞开的孔板做涡旋震荡,甚至完全没有考虑溶剂正在蒸发。
这些便是 C5R 在 SciUniverse 基准测试里记录下来的真实失败,C5R 的创始人 Michael Akilian 在 2026 年 9 月 24 日的一则 X 帖子中介绍了这家公司。
他说自己在 18 个月之前开始学生物学,先是在公寓里搭了一个小实验室做线虫实验,后来加入了加州大学旧金山分校的实验室。在这之前,他在 Apple 公司和 Misfit Wearables 公司做过硬件,还联合创办并出售了一家初创 AI 公司 Clara Labs。这个职业混合背景构成了 C5R 的核心判断,他认为要想让 AI 做有用的科学工作,需要给它一个能够连接仪器和实验的物理工作空间。
![]()
图 | Michael Akilian(来源:领英)
他和团队研发的 Facility-0 软件可以控制并监控从液压机到单个移液器的各类仪器。模型能够设计实验、执行协议、读取测量结果,然后再决定下一步做什么。
C5R 称其已经集成了 40 种以上科学仪器,方式是逆向工程驱动程序以及搭建定制的硬件适配器。当模型执行任务的时候,可以先探索库存和阅读规格说明,把实验设计成为代码。代码则会被转化为设备控制和给人类的指令。
接着模型会去分析测量结果、重新规划、决定下一步做什么。按照 C5R 自己的说法来看,软件能够控制设备,也可以给人下指令。也就是说,它并没有声称模型能够独自搞定所有动手的活,这个区别等于划出了实际测试的边界,要测的是模型是否能够可靠地把一个研究目标,进而变成人和机器都能照着做的实验步骤,最后再用实验结果指导下一步决策。
6 个前沿模型进场参加了测试。Claude Fable 5.1 以 45.3% 的 Pass@1 排在第一名,平均每个任务的推理成本为 49.61 美元。
GPT-6 Astra 的通过率是 32.5%,单任务成本为 52.37 美元。Claude Opus 5 通过率是 30.5%,成本 46.31 为美元。
Grok 4.6 通过率是 26.2%,成本为 13.41 美元。Gemini 3.8 Flash 通过率是 14.6%,成本为 4.55 美元。GPT-5.6 Sol 通过率是 9.4%,成本为 16.53 美元。
但是,这个成绩单需要结合任务难度的定义来评价。C5R 对于 Level 1 任务的描述是,这些任务对科学家来说很简单,最多只需花几个小时。换言之,一个熟练科学家一个下午能做完的事,最强的 AI 也只有不到一半的把握能够一次做对。
目前,成本高低和做对之间也画不出一条漂亮的权衡曲线。成本最便宜的 Gemini 3.8 Flash 每个任务只花 4.55 美元,通过率掉到了 14.6%。成本最高昂的 GPT-6 Astra 花了 52.37 美元,通过率也并没有排到第一。
C5R 在公布结果时也承认,真实世界任务的 rollout 次数是有限的,结果噪声往往偏大,而提高设施吞吐量、压低方差本身就是该公司下一版产品的迭代重点。
SciUniverse 基准测试的早期发现指向了这样一个具体落差:模型确实展现出了很强的科学理论知识,但是却在物理实验室操作中频繁出错。
比如,它们竟然试图吸取还冻着的样本,对敞开的孔板开展涡旋震荡,在含 DNA 的孔之间重复地使用了同一个枪头,也没有考虑过溶剂的蒸发。这些错误指向了同一个问题,那就是模型能够理解化学,但是在实际执行化学操作时却缺乏对物理现实的把握。
这个落差存在的原因在于:软件和数学存在即时的验证循环,运行代码之后马上得到结果。科学实验的约束条件是不同的,物理现实给出的反馈慢且模糊,有时候还具有一定的破坏性。一个被污染的样本的确不会弹出错误信息,它只会让后面所有数据都失去意义。
![]()
(来源:C5R)
SciUniverse 的任务设计覆盖了科学研究过程的更多环节,它把选择材料、操作仪器、运行实验、调试失败以及适应真实约束都纳进来。
其中,Level 1 包含了 92 个任务,分布在 17 个任务家族之中,涵盖了基础样品制备、仪器控制、协议适配、跨实验学习、设施管理和真实测量数据解读。任务会被映射到工作周期和物质尺度的坐标之上,让化学、生物学和材料科学能够在同一个框架下比较。
样品制备被单独地列为了一个任务类别,原因是早期测试结果显示模型在这方面表现不佳。仪器控制任务则比较了模型使用的厂商软件、Python API 以及直接固件命令的效果。
协议适配任务负责测试模型在试剂、设备和时间受限时如何调整标准流程。
跨实验学习任务负责测试模型能否从实验中学习,比如是否能在材料和预算有限的情况下选择下一步。
设施管理任务负责查看模型能否在短缺、设备故障和截止日期的压力下让实验保持推进。
真实测量数据解读任务通过使用核磁共振、X 射线衍射和色谱数据,来测试模型能否识别产物、定量混合物以及辨认不可靠的信号。
![]()
(来源:C5R)
把 C5R 的产品思路放进行业背景里看,AI 自主实验室的概念已经有一段时间了。传统科研实验室自动化通常处理一些预定义协议内的重复任务,自动化主要被广泛用于提高已有检测或制造流程的吞吐量。自驱动系统则能走得更远,因为它会解释结果、预测下一个实验和执行那个实验,而C5R 的定位则是提供物理基础设施和衡量进展的基准。
一些行业内其他动向也值得留意,比如 Insilico Medicine 公司宣布在其 AI 驱动的全机器人药物发现实验室里部署了第一台双足人形机器人,能够用于数据采集和生成,训练具身 AI 系统地学习人类实验室科学家的技能。
日本东京科学大学团队启动了一个由人形机器人、自主系统和 AI 运行的医学实验室,目前拥有 10 台机器人,工作时没有现场人类研究人员,该实验室的核心是一台叫 Maholo LabDroid 的人形机器人,它的双臂可以处理精细科学操作,能够精确转移试剂、管理温度敏感材料以及执行自动化细胞培养任务。
而 C5R 的设施依然把人类操作员放在 AI 循环里,它的软件能够控制设备并向人发出指令,设施本身也是产品的一部分,这个定位让 C5R 的 Facility-0 拥有了两个用途,一方面能做研究,另一方面也能用来评估模型在物理科学里到底能干什么。
但是,当前也存在一定限制。目前的自主系统擅长执行预定义的实验协议,在初始假设失败的时候缺乏创造性问题的解决能力。因此,人类科学家在战略决策和处理意外结果方面仍旧不可替代。一言以蔽之,C5R 的 SciUniverse 测试的是模型能否驾驭实验室里不可预测、混乱的物理现实。
C5R 方面称 Facility-0 覆盖蛋白质设计、药物化学和固态材料,不管是在设施内还是在数字孪生中,SciUniverse 都能评估前沿模型能否在这些领域把科学目标转化为可验证的结果。这意味着科学实验室本身变成了产品的一部分,模型的实验规划能力也被接到了这套实际操作的环节上。
大家都知道,AI 已经能够加速早期药物设计,机器人技术则在向接近人类水平的灵巧度推进,这两个领域的发展瓶颈正在从计算转向物理执行。像 C5R 的 Facility-0 这样的产品,代表了移除这个结束瓶颈的一种尝试。C5R 认为系统必须连接规划软件、物理仪器、测量结果以及人类指令,难点则在于把这些环节变成一个可重复的科学工作。
C5R 的创始人 Michael Akilian 在 X 帖子中说,公司目前已经成立了五个月,是一群朋友一起做的,公司官网没有给出融资数字。
对于 Michael Akilian 来说,这个公司无疑是一个赌注。科学 AI 的进展将取决于能否让模型接触到科学研究真正发生的条件。他在 X 帖子中表示,自己的路径和背景横跨生物学研究、硬件工作和 AI 创业,这些经历让他相信让 AI 做有用的科学研究工作,就必须给它一个物理工作空间,而不仅仅只是一个只处理数字数据的系统。
参考资料:
https://c5r.net/sciuniverse/#overview-results
https://glitchwire.com/news/c5r-built-a-research-lab-run-by-ai-in-12-weeks-the-sciuniverse-benchmark-shows-w/
https://runtimewire.com/article/c5r-physical-lab-ai-models-michael-akilian
https://www.dailyairoundup.com/news/c5r-built-a-research-lab-run-entirely-by-ai-in-12-weeks
https://c5r.net/sciuniverse/
https://www.linkedin.com/in/akilian
注:封面/首图由 AI 辅助生成
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.