网易首页 > 网易号 > 正文 申请入驻

本周AI项目推荐|智能知识、Copula Lab、UniPat…谁在给中国模型造后训练数据与考场?

0
分享至


作者黄小艺
微信 H997Hbiu

随着Agent走向真实工作,后训练和数据正在成为提升智能的关键。

据数据供应商 Handshake 方估算,多家头部 AI 公司每年在“人类数据”上的支出已接近 10 亿美元量级。

从专家完成的 SFT、RLHF 数据,到可以运行数万次 rollout 的 RL 环境,再到 评分器(grader)、验证器(verifier)、训练 recipe、算力和整套 RL 服务,“数据公司”正在变成模型后训练的外部研发部门,长出了Surge AI、Mercor、Scale AI 这样的头部选手。

将视线转回中国数据市场,其体量也在快速增长。以字节为例,据报道,2026 年为世界模型训练数据安排的预算达到数千万元人民币, Coding 数据投入仅次于世界模型。

在这个背景下,一个值得关心的问题是,国产模型的后训练需要哪些数据,正在把哪些环节留在内部,哪些工作交给外部团队?如果模型公司需要专家任务、Agent 轨迹、Benchmark、可执行环境和自动验证信号,国内有哪些团队正在提供这些能力?

本期项目推荐,我们整理了一批新兴公司,包括智能知识、Copula Lab、原壤智能、UniPat AI、维纳智能等。这些公司都位于“后训练—评测—数据反馈”这条宽泛链条上,但商业形态不同:有的是专家数据供应商,有的是数据生产软件或 RL 环境创业公司,有的是研究型 Benchmark 团队,还有的把合成数据能力封装进企业 Agent。

以下是具体信息。

1

智能知识(Human Intelligence )


一句话定位:智能知识是一家“专家网络 + 数据生产软件 + RL-ready 任务数据”的组合型供应商。

产品概述

其业务可以分成三层:专家从哪里来、数据如何生产,以及最终生产什么数据。

第一层是“一面千识”,负责专家供给。和简单开放任务、让普通标注员抢单的方式不同,它是根据模型公司的训练目标确定人才画像,再通过身份和学历验证、AI 面试等流程筛选专家,最后完成任务分配、质量追踪和报酬结算。


从目前公开的招募岗位看,一面千识以程序员为主,其它岗位覆盖金融证券、内容运营、法律实务、创新药研发、K12教育、记者编辑、医生、保险、税务和高校科研人员等。

以金融岗位为例,专家需要设计真实投研任务,准备公告、财报、行情和监管规则等材料,确定估值方法、核心假设和验收标准,再审核模型结论中的数据误读、风险遗漏与证据问题,偏向于“专业工作任务生产工作流”。

官方披露,一面千识已实现每日数百场AI面试、每月数千名专家成功接单,已连接50,000+领域专家。

第二层是 Xpert Studio,负责把专家组织成一条可规模化的数据生产线。平台覆盖标注界面配置、任务分发、权限管理、抽样审核、多轮质检、标注一致性计算和质量看板,也支持通过 API、SDK、云端或私有化方式接入模型团队现有的数据流程。

第三层是它最终交付的数据。Xpert Studio 除了支持常规问答、分类和偏好排序,还面向 CoT、规划、多轮对话、API调用、Browser Use、Computer Use等复杂Agent任务,目前已发布了Terminal RL Data、MCP Data。

团队背景

智能知识核心团队来自字节跳动 Seed 部门,已经获得头部大模型公司订单,完成初步 PMF,2026年6月宣布完成由锦秋基金、耀途资本联合投资的天使轮融资,此前种子轮获得五源资本和奇绩创坛投资。本轮资金主要用于扩张Coding、Enterprise Office、Agentic Tool Use等数据品类,以及升级专家画像、技能评估和人岗匹配系统。

为什么值得关注

智能知识的业务形式,直接对标Scale AI。

一面千识对应Scale旗下的Outlier,负责招募、筛选和管理领域专家;Xpert Studio对应Scale Data Engine,由AI辅助,把任务配置、专家协作、标注审核和质量控制沉淀成软件;Terminal RL等数据资产,则开始向Scale AI 的RL Environments靠近,不仅包含题目和答案,还包含Docker环境、测试脚本、Oracle参考解法、运行轨迹和元数据;MCP任务则进一步加入受控网页、浏览器工具和程序化Verifier,可以让模型进入环境反复尝试,记录完整rollout,并通过测试结果获得明确的奖励信号。

值得注意的是,Xpert Studio还试图降低专业数据生产工具的门槛。平台目前提供三档定价:社区版面向独立开发者限量免费,会员价格为3000元/年,VIP为5万元/年,相比只服务头部实验室的大额数据合同,这套定价意味着小型Agent团队、研究机构和独立开发者也可以自己组织专家、设计评测集和迭代数据。

1

Copula Lab


一句话定位:Copula Lab 提供专家工作流数据、Benchmark、评测和 RL 环境,主要面向前沿模型团队。

产品概述

继编程之后,下一个前沿是模型能否真正深入高经济价值、高门槛的专业工作流。前沿后训练正在从静态问答、偏好标注和单轮任务,转向可交互、可验证、可扩展的专家工作流环境。

Copula Lab想解决的问题是:如何让模型在一个接近真实工作的环境中连续使用工具、处理多步依赖、修正错误,最终完成一份可以被专业人士验收的交付物。


目前官网公开的数据产品主要集中在 Coding、设计和专业办公任务。例如,WebDev 将自然语言需求、可运行的前端产品、开发轨迹、页面截图和专家审美评分组合成数据,可用于 SFT、偏好训练、RL 和评测。

团队背景

创始人梁丽曾负责 MiniMax 的 Agent 业务,并从零建立内部 Agent Benchmark。

技术联合创始人蔡佳人曾担任 MiniMax 开源负责人和后训练工程师,参与 MiniMax M2 系列在 Coding 方向的后训练,并负责与 LMArena、Vals AI、Terminal-Bench 等 Benchmark 和数据项目的合作。目前公司尚未公开披露融资情况。

为什么值得关注

如果说智能知识更像“专家众包网络+数据生产平台”,GOMAX 更偏向中文科学与产业数据及垂类评测,那么 Copula Lab 的特点,是从模型公司内部的后训练需求出发,反向设计数据和环境。

创始团队既做过 Agent 产品,也参与过模型后训练和 Benchmark 建设,因此它的出发点不是召集专家网络,而是模型在真实任务中为什么失败,从不同的 failure mode,形成不同的任务、轨迹、Rubric、环境和奖励信号,这使 Copula 的数据更接近模型训练团队实际采购的形态。

在本期几家公司中,Copula 是将 RL Environment 明确放在核心产品位置的一家。但目前公开案例主要证明它能够生产“任务+运行资产+轨迹+评分标准”,还不能证明这些环境已经具备大规模 RL 训练所要求的完整工程能力。

真正值得继续验证的是:环境能否被稳定重置和复现,能否直接连接模型公司的 Agent 与训练框架,能否支持大量并行 rollout;评分函数是否足够自动化、稳定且不容易被模型钻空子;以及这些任务经过训练后,能否在独立 Benchmark 上带来可复现的能力提升。

1

UniPat AI


一句话定位:UniPat AI 是一家围绕真实世界能力构建 Benchmark、训练数据和实验模型的 research-first 团队。

产品概述

它不是传统意义上的数据公司,也暂时不像 Copula Lab 那样明确向模型公司销售专家工作流数据和 RL 环境。UniPat 更像一座数据与后训练实验室:先构造足够真实、足够困难的任务,找到模型的能力缺口;再围绕这些缺口生产数据、设计 Rubric,并通过实际后训练验证这些训练信号是否有效。

在 Agent 评测方面,UniPat 已发布 SaaS-Bench、RoadmapBench、EvoCode-Bench、Monthly-SWEBench、BabyVision 等多个 Benchmark,覆盖 Computer Use、长期软件开发、多轮 Coding 和视觉推理。

除了 Benchmark,UniPat 也在生产后训练数据并亲自训练模型。

其 UniScientist 项目通过人类专家与 LLM 协作,生产了超过 4,700 个研究级科学任务,覆盖 50 多个学科,并为每个任务配套可验证的 Rubric。团队随后用这些数据对 Qwen3-30B-A3B-Thinking 进行 Agentic SFT,显著提升了效果。

团队背景

UniPat 公开研究的主要贡献者包括 Liang Chen、Kuan Li 等人,公开资料未披露其融资情况,也没有明确说明 Benchmark、数据和 RL 环境的商业化收入。

为什么值得关注

UniPat 值得关注的地方,是它没有把 Benchmark、数据和后训练当成三件分离的事。

很多数据公司完成交付后,很难回答一个问题:这批数据到底有没有让模型变强?UniPat 的做法是先用真实任务找到模型的 failure mode,再围绕这些失败生产训练数据和评分标准,最后实际训练模型,并在留出集和外部 Benchmark 上验证能力有没有提升。

从 UniScientist、ExpertEval 到 BabyVision,其公开项目已经覆盖了三种不同的数据路线:LLM 大规模合成、专家直接生产,以及面向 RLVR 的可验证数据。它也分别用 Agentic SFT、Rubric rejection sampling 和 GRPO 做过后训练实验。相比单纯发布排行榜,这更接近一套“发现能力缺口—生产训练信号—训练模型—验证泛化”的数据研究闭环。

下一步需要观察的是,它会继续作为研究团队发布模型和 Benchmark,还是把这些能力封装成面向模型公司的环境、数据或后训练服务。

1

原壤智能

一句话定位:原壤智能目前通过两个品牌开展业务:负责专家招募和任务交付的 TalentsAI,以及负责高质量数据、Benchmark 和企业数据合作的 Humanlaya。

产品概述

TalentsAI 是原壤智能的专家数据生产平台。它负责寻找不同学科的专业人员,验证学历、执业资格和工作经历,再将专家匹配给模型训练与评测项目。

据平台披露,TalentsAI 目前已有超过5万名专家入驻,覆盖300多个细分学科,其中包括5000多名博士级人才,并与10多家头部 AI Lab 合作。平台公开的任务类型包括复杂指令遵循、Rubric 设计与评测、HLE 高难度推理、RLHF、VLM、长文本与专业文档处理,以及金融、法律、医疗、自然科学、软件工程等领域的多轮对话和学科验证。


Humanlaya 则更像原壤智能的数据与评测实验室。它围绕真实专业工作推出 Benchmark 和高保真数据集,目前已经发布 BiomniBench、ExcelBench、$OneMillion-Bench 和 WorldTravel,覆盖生物医学分析、表格操作、专业知识工作和多模态旅行规划等任务。

两个品牌组合起来,形成了一条从“找专家”到“定义任务”的链条。

团队背景

原壤智能的公开招聘资料披露,公司已获得红杉中国与 BAI 资本的天使轮投资,融资近千万美元。

为什么值得关注

它同时踩在专家供给、数据生产和模型评测三个位置上。TalentsAI 解决“谁有资格定义专业工作”,Humanlaya 解决“如何把这种判断变成模型可理解、可比较的标准”。如果两边能够持续互相反馈,Benchmark 不只是一个对外传播产品,也会成为寻找训练数据需求和检验数据效果的入口。

接下来需要验证的,是5万名注册专家中有多少能够稳定参与高难度任务,公开 Benchmark 能否转化为持续的数据采购和评测收入,以及公司是否已经为模型客户生产了与公开测试集隔离、并能带来可量化训练提升的数据集。

1

维纳智能(Wiener Intelligence)


一句话定位:维纳智能做的是大模型推理数据生成,以及基于这些数据构建闭环 Agent 系统。

产品概述

前面的公司主要依靠专家生产任务、轨迹和评价标准。

但专家数据有一个天然限制:贵,而且慢。任务越专业,真正能够完成和审核的人就越少。所以还有公司选择了另一条路:让模型自己出题、自己生成推理过程和答案,再利用测试与反馈不断筛选和优化这些数据。

它提出的核心数据结构是 cQrA 四元组,即 Context、Question、reasoning 和 Answer。模型读取行业文档或结构化信息后,不只生成答案,还要主动提出问题,并生成相应的推理过程。

维纳把传统模型训练概括为“数据→Token”,自己的重点则是补上“Token→数据”:用模型输出重新生成专业推理数据,再让这些数据进入测试、优化和后续训练,形成“数据→Token→数据”的循环。

从目前公开的商业化产品看,维纳并不是把数据集单独摆上货架,而是将数据生成能力封装进企业 Agent。

团队背景

创始人兼 CEO 柳崎峰毕业于中国科学院自动化研究所,曾任香港生成式人工智能研发中心总经理、平安集团加马 AI 研究院院长,并参与香港大模型训练和超算基础设施建设。

据公司官网披露,维纳智能总部位于香港,在深圳和北京设有分部,已完成由联想创投领投的千万美元级种子轮融资。

为什么值得关注

维纳智能押注的是,专家无法无限生产数据,但模型可以。

如果 AI 能够从企业文档、数据库和实际交互中持续生成高质量问题、推理过程和答案,企业就有可能建立自己的合成数据飞轮,不再完全依赖人工标注。

它更准确的定位是:合成推理数据公司,以及以数据反馈为底座的闭环 Agent 公司。

这条路径最大的难点,是如何验证 AI 生成的数据。模型自己出题、自己回答,也可能把原有错误和偏见循环放大。维纳能否建立独立的 verifier、专家抽检和真实业务结果反馈,将决定“AI 造数据”究竟是有效的训练信号,还是规模更大的合成噪声。

1

小结

以上几个项目都在处理大模型后训练阶段的“数据”问题,但它们并不属于同一种公司。

Human Intelligence、原壤智能等接近专家供给与专业数据生产:它们试图找到真正理解任务的人,再把专家的知识转化为任务、答案、Rubric 和评价信号。Copula Lab 和 UniPat 更关注如何把真实工作变成 Benchmark、可执行任务或可验证环境,让模型不只回答问题,而是在接近实际的软件和工作流程中完成任务。维纳智能走的则是另一条相邻路线:利用模型生成问题、推理过程和答案,再通过企业应用中的反馈筛选和更新这些数据。

这些路径之间并非泾渭分明。一家公司既可能招募专家,也可能制作 Benchmark;既可能交付训练数据,也可能搭建环境、评分器和企业 Agent。

某种意义上,这也说明了国内后训练数据市场仍处在品类形成期。专家数据、Benchmark、RL 环境、自动验证和企业反馈尚未形成稳定、清晰的专业分工,模型公司更偏向将核心后训练环节留在内部,外部团队能够承接的主要是专家组织、任务生产和部分环境构造。

但无论从专家出发、从环境出发,还是让模型参与数据生成,这些项目的目标是一致的:构建更多来自真实工作、承载专业判断且能够被验证的高质量数据,让模型学会处理更复杂的任务,推动其向下一代智能演进。

我们也会继续关注这个赛道,动态记录其中的公司、产品以及后训练供应链的变化。


点个爱心,再走 吧

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
“没有手艺都是科技”,青岛一烤羊店招牌被六旬师傅装反,店主:主打纯手艺无科技,视频太火了,正在犹豫要不要改过来

“没有手艺都是科技”,青岛一烤羊店招牌被六旬师傅装反,店主:主打纯手艺无科技,视频太火了,正在犹豫要不要改过来

扬子晚报
2026-09-01 12:22:59
不查不知道一查吓一跳!执掌恒大27年的许家印,私下到底有多壕?

不查不知道一查吓一跳!执掌恒大27年的许家印,私下到底有多壕?

花颜蕴韵
2026-09-02 17:32:24
紧急预警!新型入室盗窃席卷全国,无数家庭已经中招

紧急预警!新型入室盗窃席卷全国,无数家庭已经中招

小虎新车推荐员
2026-09-01 09:17:01
体坛大乱!国羽高层被一锅端,刘国梁被带走?唯独蔡振华全身而退

体坛大乱!国羽高层被一锅端,刘国梁被带走?唯独蔡振华全身而退

林子说事
2026-09-02 12:21:47
外卖下半场,为何最先恢复的是美团?

外卖下半场,为何最先恢复的是美团?

道总有理
2026-09-01 20:53:59
日媒得出大胆结论:特朗普仅用6个月,就把美国霸权逼至终结拐点

日媒得出大胆结论:特朗普仅用6个月,就把美国霸权逼至终结拐点

福建睿平
2026-09-02 07:21:31
423万拆迁款女儿一分没有,父亲大寿她不去,一月后哥哥送来文件

423万拆迁款女儿一分没有,父亲大寿她不去,一月后哥哥送来文件

林林故事揭秘
2025-05-06 15:43:19
赛力斯8月销量骤降44%:问界品牌近乎腰斩

赛力斯8月销量骤降44%:问界品牌近乎腰斩

阿芒娱乐说
2026-09-02 05:09:21
品牌打印机为什么不愿适配鸿蒙系统?

品牌打印机为什么不愿适配鸿蒙系统?

小柱解说游戏
2026-08-31 13:21:35
麦克托米奈:若皇马来电,我会考虑

麦克托米奈:若皇马来电,我会考虑

懂球帝
2026-09-02 16:00:41
韩国光州双年展恢复“台湾馆”名称,大陆艺术家集体撤展,国台办:台湾参与国际活动,必须按照一个中国原则来处理

韩国光州双年展恢复“台湾馆”名称,大陆艺术家集体撤展,国台办:台湾参与国际活动,必须按照一个中国原则来处理

政知新媒体
2026-09-02 13:03:33
吴柳芳谈退役安置不公:我没刘翔那命,只有16万买断

吴柳芳谈退役安置不公:我没刘翔那命,只有16万买断

东方不败然多多
2026-09-01 11:00:29
卡塔尔半岛电视台确认了:美国偷袭伊朗拉腊克岛,美军轰炸了岛上两处伊朗革命卫队火箭发射装置,这是美军一个月来首次对伊朗采取军事行动

卡塔尔半岛电视台确认了:美国偷袭伊朗拉腊克岛,美军轰炸了岛上两处伊朗革命卫队火箭发射装置,这是美军一个月来首次对伊朗采取军事行动

吉刻新闻
2026-08-31 07:20:45
“一个月陪睡一两次”:网红魏莹的榜一大哥照片曝光,他身价过亿,是个大企业家

“一个月陪睡一两次”:网红魏莹的榜一大哥照片曝光,他身价过亿,是个大企业家

江山挥笔
2026-08-25 16:40:36
孙宇晨前女友曾颖回应景甜“三千万彩礼”:他给的大概率是千万要开心,千万要幸福,千万要平安

孙宇晨前女友曾颖回应景甜“三千万彩礼”:他给的大概率是千万要开心,千万要幸福,千万要平安

背包旅行
2026-08-31 17:43:35
金正恩女儿持枪开坦克,韩情报院称已进入接班人内定阶段

金正恩女儿持枪开坦克,韩情报院称已进入接班人内定阶段

桂系007
2026-09-02 10:15:38
常州400多人HR群事件发酵!成都网友爆料,当地同样存在这类HR同盟群,直言“钱可以让人不要脸,更不要心”

常州400多人HR群事件发酵!成都网友爆料,当地同样存在这类HR同盟群,直言“钱可以让人不要脸,更不要心”

火山詩话
2026-08-31 08:17:34
消化科主任忠告:立即停止食用这5类素食,吃的越多,息肉越大

消化科主任忠告:立即停止食用这5类素食,吃的越多,息肉越大

医学科普汇
2026-09-02 15:50:59
高铁女孩熟睡男生盯死手机不敢转头,两百万外网围观无声的人机对峙,藏着成年人不敢破冰的社交尴尬防线

高铁女孩熟睡男生盯死手机不敢转头,两百万外网围观无声的人机对峙,藏着成年人不敢破冰的社交尴尬防线

明话直说
2026-08-25 18:07:55
离婚的妇人都是咋和前夫相处的?网友:我就好奇,有没有睡在一起

离婚的妇人都是咋和前夫相处的?网友:我就好奇,有没有睡在一起

带你感受人间冷暖
2026-08-31 00:05:16
2026-09-02 18:15:00
硅星人 incentive-icons
硅星人
硅(Si)是创造未来的基础,欢迎来到这个星球。
3372文章数 10529关注度
往期回顾 全部

科技要闻

凌晨最强模型上新,Claude Fable 5.1发布

头条要闻

尼泊尔用无人机找幸存者 隧道被泥浆"像牙膏一样"塞满

头条要闻

尼泊尔用无人机找幸存者 隧道被泥浆"像牙膏一样"塞满

体育要闻

一次有奖问答,让他成为欧冠主帅

娱乐要闻

香港武打影星陈观泰离世,终年80岁

财经要闻

需要重视的全球“资金失衡”

汽车要闻

23万级给到激光雷达和900km续航 比亚迪海狮08售22.99万起

态度原创

教育
时尚
艺术
房产
手机

教育要闻

成都南华实验学校2026年秋季开学典礼:养正立身 勤学启新

夏天别总穿黑色裤子,试试这几款高腰裙,显瘦优雅又提气质

艺术要闻

273米,10亿!深圳最多“外号”的摩天楼,正式运营!

房产要闻

新四代住宅 新样板间开放丨以艺术之名 赴一场迭代之约

手机要闻

华为详解nova 16 Pro内部空间设计,7.1mm机身塞7000mAh电池

无障碍浏览 进入关怀版