网易首页 > 网易号 > 正文 申请入驻

MIT牵头破题:AI能模拟社会,但谁来验证它?

0
分享至


新智元报道


下一周,人们对iPhone、特斯拉等品牌的搜索关注会如何变化?

AI能在数据公布之前,预测这些关键词之间的相对热度吗?


官网:https://socialsim.org/

GitHub:https://github.com/Social-Atoms/social-sim-arena

评测与接入文档:https://socialsim.org/docs.html

常见问题(FAQ):https://socialsim.org/faq.html

这是Social Simulation Arena(SSA)的一类真实评测任务,参赛系统需要提前预测五个指定关键词之间的搜索热度分布,封存答案,再由随后公布的数据检验。

这个具体问题背后,是一个更广泛的研究目标:社会模拟系统对人群行为的判断,能否经得起真实未来的检验?

模拟越来越逼真

验证跟上了吗?

社会模拟正在从学术研究走向商业应用。基于大语言模型的模拟系统,已被用于探索政策分析、公共卫生和计算社会科学等问题;Aaru、Simile等创业公司也在尝试构建虚拟人群,预演消费者、员工等群体在不同情境下的反应。

这类技术的吸引力在于:它有望帮助人们在采取现实行动之前,以更低的成本探索不同方案。而这一前景能否实现,取决于模拟对真实人群的刻画是否可靠。

目前,社会模拟的验证能力尚未跟上系统的发展速度。看似自然的对话、符合直觉的行为,以及接近真实数据的总体均值,都不足以证明系统准确刻画了人群差异与行为规律。

与此同时,不同研究采用各自的数据、任务和指标,使结果难以比较,能力上的进展也难以积累为可复核的共同认识。当这些系统开始参与商业或公共决策时,验证的缺位可能使看似可信的结果被赋予超出证据范围的信任。

因此,社会模拟需要在扩大规模、丰富交互之外,建立共享基准、开放数据和可复现的评测流程,明确系统在什么任务、什么人群和什么条件下有效。

随着模拟结果逐步成为现实决策的依据,一个基础问题也变得更加迫切:模拟结果在多大程度上能够反映真实人群,又应当通过怎样的共同标准接受检验?


SSA公开评测看板。左侧展示所选系统与基线的成绩随评测推进的变化,右侧列出得分及参评题目数量。Arena Score以沿用上一期结果的persistence基线为0分,以完全准确预测的理想Oracle为100分,负分表示低于基线。图中数据截至2026年9月24日。

SSA

让真实未来检验社会模拟

Social Simulation Arena(SSA)由MIT研究团队牵头发起,联合来自多所高校的研究者共同建设,旨在通过面向真实未来的公开评测,检验社会模拟系统的预测能力。

一轮评测如何连接社会模拟与真实世界

SSA的一轮评测分为三个阶段:开放提交(Open)、预测封存(Locked)和完成评分(Resolved)。题目提前公开,参与者在截止前提交预测;截止后,答案被固定,预测的哈希摘要汇入清单并提交OpenTimestamps,相关承诺通常在数小时后锚定至比特币区块链,形成可核验的时间证明;待第三方公布观测结果,平台按既定规则评分并公开记录。


SSA单轮评测流程。Open阶段接收并加密保存预测;Locked阶段固定有效提交并建立时间证明;观测结果公布、核验与评分完成后进入Resolved。具体时间安排与存证状态以各轮记录为准。

开放提交:提前出题,加密交卷。

题目通常在截止前一周公开,明确预测对象、目标人群、结果来源与评分规则。参与者按要求提交答案,并在概率预测任务中表达不确定性。提交后的预测通过Sealbox加密封存机制保存,其他参与者在提交窗口内无法查看预测明文。多数轮次在预定结果公布前48小时停止接收预测。

预测封存:固定答案,建立时间证明。

截止后,平台按规则解封并核验有效提交,将预测及冻结历史数据的哈希摘要写入清单,再提交OpenTimestamps。相关承诺通常在数小时后锚定至比特币区块链。

哈希相当于文件的数字指纹,能够帮助外部研究者检查公开内容是否与封存记录一致;时间证明则支持核验相应内容在所锚定区块形成之前已经存在。两者共同为预测的内容与存在时间提供可核验依据,具体证明范围以各轮记录为准。

完成评分:与现实对照,与基线比较。

观测结果公布并完成核验与评分后,题目进入Resolved状态,成绩更新至榜单。按照平台公布的安排,评分应在结果发布后六小时内完成。

Arena Score以两个参照点帮助读者理解成绩:0分对应persistence,即沿用上一期观测值的基线;100分对应预测损失为零的理想Oracle。正分表示优于persistence,负分表示低于这一基线。在数值预测任务中,SSA还提供线性趋势外推、指数加权移动平均(EWMA)和历史均值等统计对照,帮助研究者判断模型及其工作流提供了多少额外预测价值。

每轮结束后,预测、时间证明、观测结果与成绩共同形成可追溯记录。同一数据来源的下一次发布将对应一道新题,重新从Open开始,使评测随真实世界的变化持续进行。


Sealbox。 提交窗口内,参与者用私钥签名,平台核验后以age公钥加密,经GitHub App写入sealed分支;窗口内无人可读明文。封存时刻,持有age私钥的工作流解密并复核签名,将明文预测与哈希清单写入main分支,清单经OpenTimestamps锚定至比特币区块。此后任何人可用ots verify与哈希比对独立核验:预测在区块之前已存在,且此后未改动。

从总体趋势到群体差异

SSA测什么?

SSA关注的是现实中的人群及其持续变化的态度与行为。不同数据源按照各自的周期,重复测量特定人群的状态,为模拟结果提供可持续对照的观测依据。

当前任务从三个方面检验预测能力:总体指标如何变化、不同群体之间有何差异,以及人们的关注流向何处。各类任务采用相应的答题格式与评分规则。

整体数值:总体状态是否同步。

题目要求预测即将公布的总体读数,如密歇根大学消费者信心指数、纽约联储家庭通胀预期和AAII散户情绪差。

参与者提交带不确定性的分布,以CRPS评分,同时考察预测位置与不确定性表达。题目会写明目标人群(成年人、登记选民或家庭户主),因为同一机构对不同人群的读数可能相差数个百分点。

不同群体:差异结构是否正确。

群体画像题要求同时预测按年龄、族裔、性别、学历等划分的16个群体,以能量分数(CRPS的多维形式)整体评分,并拆分为整体水平与群体间结构两部分。模拟器无法依靠猜中总体数字、同时系统性地误判某些群体来取得好成绩;把所有人模拟成「平均选民」的系统,会在这类题上暴露出来。

集体关注:注意力流向何处。

这类题关注行为痕迹而非态度表达:下一周英文维基百科阅读量前十的条目及顺序,以及若干品牌在Google搜索中的关注份额。前者按排名重合度评分,后者按份额分布评分。


SSA已完成评测的题目示例。每张卡片对应同一统计序列的一次数据发布,展示模型预测、上一期观测值与本期公布结果(绿线),便于比较不同轮次的预测偏差,并追溯具体题目与数据来源。

与已有的预测评测有何不同?

FutureX、Prophet Arena与SSA都通过尚未揭晓的真实结果检验预测能力,但各自的评测重点有所不同。

FutureX面向广泛领域的未来预测,考察智能体的信息搜集、推理与预测能力;Prophet Arena以真实预测市场事件为主要任务来源,评估系统的概率预测,并与同期市场共识比较。

SSA更聚焦于持续存在、被反复观测的现实人群,通过预测其态度、行为及群体差异,检验社会模拟系统对目标人群的刻画是否可靠。当前评测从预测下一次观测结果入手,后续计划拓展至新问题外推、干预情境和跨问题一致性等任务,进一步检验人群建模在不同情境下的有效性。

面对真实未来,模型表现如何?

评测范围。

截至2026年9月24日,SSA已完成59轮真实评测,对应的数据发布日期覆盖8月14日至9月23日。

评测涵盖GPT、Claude、Gemini、Grok、Qwen、DeepSeek、Kimi和GLM等系列的16个底层模型,并比较它们与不同预测工作流(harness)的组合。

工作流主要在两个方面有所区别:一是信息输入,包括是否提供近期历史数据、固定新闻摘要或网络搜索结果;二是预测引导方式,包括直接作答,或按基准分析、因素拆解与预测失败反思等步骤形成预测。

简单基线仍是数值预测的重要参照。

在当前数值题榜单上,模型配置的平均相对得分仍低于沿用上一期结果的persistence基线。例如,Gemini3.1 Pro与Claude Sonnet 5的网络搜索配置均完成了43道数值题,Arena Score分别为−22.0和−23.6分。

这表明,在这些已完成的题目上,模型及其工作流尚未取得正的平均预测增益。这一结果不应直接推广至其他任务类型。

平均水平上的改善,比群体差异上的改善更一致。

在9月11日的Civiqs人群画像题中,24个模型配置里有23个在各群体数值的平均水平上优于基线,但只有5个在群体间差异结构上优于基线。后续两道人群画像题中,结构上的改善有所增加,但并非所有配置都能受益。

这说明,跟随人群的整体变化与准确刻画不同群体之间的差异,仍是两项需要分别检验的能力。目前人群画像题仅有3道,结论仍需更多轮次支持。

具体任务中,也出现了明显优于基线的预测。

在9月12日的品牌搜索份额题中,Kimi的网络搜索配置预测,iPhone将占五个指定关键词相对搜索热度的55.0%;随后公布的观测值为54.49%,而该轮persistence基线为39.84%。

在完整的五关键词分布评分中,这一配置的预测损失较基线降低约89.9%。这一案例展示了模型在特定任务中的预测价值,但能否持续取得类似优势,仍需后续评测检验。

历史信息有帮助,增加预测流程则未必带来一致改善。

在保持模型、题目与直接预测方式相同的262组配对中,加入近期历史数据后,约96.2%的配对获得了更低的预测损失。

相比之下,在同样使用网络搜索的条件下,额外加入基准分析、因素拆解和预测失败反思等步骤,结果有改善也有退步。对系统设计而言,增加信息或流程的价值,需要通过具体对照来确认。

评测的价值与边界

社会模拟的快速发展,使一个问题愈发重要:如何判断模拟结果真实反映了目标人群?

生动的交互、复杂的系统设计,以及少量符合直觉的案例,都需要进一步的实证支持。

当不同研究采用各自的任务、数据与评价标准时,结果也难以比较,领域中的进展便难以累积为共同认识。

SSA希望为这一验证缺口提供可操作的回应。

通过明确预测对象、提前封存答案、依据独立观测评分,并与统计基线比较,平台让不同方法接受共同检验,帮助研究者判断新增的模型能力与系统复杂度是否带来了实际预测增益。

持续公开的评测记录,也使成功与失败都能成为后续研究可复核、可积累的证据。

这类检验仍有明确边界:总体指标上的准确,未必意味着系统充分刻画了群体差异;预测上的优势,也不能直接证明其还原了社会机制。

SSA提供的是特定任务与条件下的预测效度证据。更广泛的行为解释、因果推断与干预应用,仍需相应的验证。

参考资料:

[1] Position: Time to Close The Validation Gap in LLM Social Simulations (ICML 2026 Position)

[2] CoBRA: Programming Cognitive Bias in Social Agents Using Classic Social Science Experiments (CHI 2026 best paper)

[3] Simulating Society Requires Simulating Thought (NeurIPS 2025 Position)

[4] YuLan-OneSim: Towards the Next Generation of Social Simulator with Large Language Models (2025)

[5] Generative Agents: Interactive Simulacra of Human Behavior (UIST 2024 best paper)

编辑:LRST

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
高水平外资,在打骨折卖商业大楼

高水平外资,在打骨折卖商业大楼

老凤说财经
2026-08-03 11:17:22
中秋晚会主持翻车!全程不看镜头:观众一眼出戏 是提词器装错了?

中秋晚会主持翻车!全程不看镜头:观众一眼出戏 是提词器装错了?

阿废冷眼观察所
2026-09-28 03:53:04
历史杂记|毛主席八次接见红卫兵的组织工作

历史杂记|毛主席八次接见红卫兵的组织工作

老正时空
2026-09-28 12:55:01
军事 | 太紧急了,沙特向多国求援!后果会怎样?

军事 | 太紧急了,沙特向多国求援!后果会怎样?

新民周刊
2026-09-28 09:08:32
亚运女足半决赛中国VS朝鲜,传来3好1坏消息,中国队有望晋级

亚运女足半决赛中国VS朝鲜,传来3好1坏消息,中国队有望晋级

林子说事
2026-09-28 10:04:24
刘欢妻子发布朋友圈:我永远的爱,永远的痛;姚贝娜父亲哽咽回应:他就是个天才;孙楠、韩红、蔡健雅、萧敬腾、孙茜等众歌手悼念刘欢

刘欢妻子发布朋友圈:我永远的爱,永远的痛;姚贝娜父亲哽咽回应:他就是个天才;孙楠、韩红、蔡健雅、萧敬腾、孙茜等众歌手悼念刘欢

极目新闻
2026-09-26 16:30:10
难以置信!4000多万粉丝主播跪地拜师再引热议,网友:一个带货网红都开始收徒了,还是这种高调跪拜式收徒,这个世界还是颠了

难以置信!4000多万粉丝主播跪地拜师再引热议,网友:一个带货网红都开始收徒了,还是这种高调跪拜式收徒,这个世界还是颠了

火山詩话
2026-09-26 06:28:12
情商太低了!张家大桥46岁负责人命令式私信,索要航拍视频,博主当场示范礼貌话术,引发网友热议

情商太低了!张家大桥46岁负责人命令式私信,索要航拍视频,博主当场示范礼貌话术,引发网友热议

火山詩话
2026-09-28 06:02:23
欧足联主席警告意大利足协:政治干预或动摇2032欧洲杯信任

欧足联主席警告意大利足协:政治干预或动摇2032欧洲杯信任

赛场速报局
2026-09-27 17:14:01
最惨外逃女贪官顾震芳:嫁当地残疾男子,给他生孩子还要打工养家

最惨外逃女贪官顾震芳:嫁当地残疾男子,给他生孩子还要打工养家

磊子讲史
2026-07-06 14:06:19
阿玛尼大秀,袁泉脸垮又方,莫文蔚一脸褶,“大嫂”高叶西装抢镜

阿玛尼大秀,袁泉脸垮又方,莫文蔚一脸褶,“大嫂”高叶西装抢镜

娱圈办事处
2026-09-27 22:27:58
顶住压力!射落金牌!

顶住压力!射落金牌!

五星体育
2026-09-28 11:52:56
当年一针疫苗没打的500万人,如今结局出人意料,太真实了!

当年一针疫苗没打的500万人,如今结局出人意料,太真实了!

坠入二次元的海洋
2026-09-11 00:35:48
彻底摊牌了?一个欠9亿一个骗13.9亿,董卿被爆猛料,原来她和王丽坤同样困境

彻底摊牌了?一个欠9亿一个骗13.9亿,董卿被爆猛料,原来她和王丽坤同样困境

她时尚丫
2026-08-07 18:55:34
苦等12年!王曼昱/蒯曼4-0进女双决赛:再战张本美和 中日第4次交锋

苦等12年!王曼昱/蒯曼4-0进女双决赛:再战张本美和 中日第4次交锋

风过乡
2026-09-28 12:47:53
刚刚,大众纯电车开售,8.08万起!

刚刚,大众纯电车开售,8.08万起!

手机评测室
2026-09-28 11:58:10
官方:新加坡归化英冠卡迪夫城后卫黄添喜,球员为血缘归化

官方:新加坡归化英冠卡迪夫城后卫黄添喜,球员为血缘归化

懂球帝
2026-09-28 10:15:13
日媒称孙颖莎狂热粉丝“攻陷”亚运会,日本球迷:饭圈正在削弱国乒

日媒称孙颖莎狂热粉丝“攻陷”亚运会,日本球迷:饭圈正在削弱国乒

新杀猪的秀才
2026-09-27 23:07:25
谢霆锋没想到,刘欢去世后,一言不发的王菲,因一段羁绊口碑暴增

谢霆锋没想到,刘欢去世后,一言不发的王菲,因一段羁绊口碑暴增

社会日日鲜
2026-09-28 10:28:09
日媒狠批仅开胃菜!张本智和迎3 大噩耗,终是为父母的荒唐买了单

日媒狠批仅开胃菜!张本智和迎3 大噩耗,终是为父母的荒唐买了单

寒士之言本尊
2026-09-28 16:21:41
2026-09-28 18:56:49
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
16298文章数 67094关注度
往期回顾 全部

科技要闻

赛力斯华为合作模式生变后 余承东再次回应

头条要闻

男子醉驾碾压拖行女教师5.9公里 事后烧毁存储卡冲走

头条要闻

男子醉驾碾压拖行女教师5.9公里 事后烧毁存储卡冲走

体育要闻

114项指控成立,曼城已经完蛋了吗?

娱乐要闻

去世刚2天,人民日报对刘欢的称呼改了

财经要闻

一天近2亿人次在路上:钱会在哪里停留?

汽车要闻

智界R7上市售价23.98万起 8大升级/搭载华为乾崑ADS 5

态度原创

数码
家居
旅游
亲子
公开课

数码要闻

4????元:极摩客EVO-X5 Pro桌面AI超算开启预约,10月9日发售

家居要闻

2026建博会(广州) 公装联探展交流活动

旅游要闻

118座祠堂、600年银杏、一条惠山浜:无锡惠山古镇,免费逛

亲子要闻

龙宝打算去姥家长住,上大棚接姥爷回家,一人一辆三轮车太带价了

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版