网易首页 > 网易号 > 正文 申请入驻

给天气预报装上一个"我有多确定"的按钮

0
分享至


2022年之后,AI天气预报模型突然变得很能打。谷歌的GraphCast、华为的盘古气象,一个接一个地在预测精度上超越了传统的数值天气预报模式,而且算得更快、更省钱。这些模型有一个共同的软肋:它们全都是确定性的,也就是说,你问它明天下不下雨,它只会甩给你一个答案,不会告诉你"我有六成把握"还是"我瞎猜的"。

这事儿听起来好像不算大问题,天气预报不就是该给个准话吗?但真正做决策的人知道这远远不够。

一个航空公司要不要因为可能的雷暴取消航班,一个保险公司要不要为可能的洪水调整定价,一个电网公司要不要为可能的寒潮提前调度电力,这些决策背后都有一本自己的成本账。取消航班的成本和延误的成本不一样,不同的人对"多大概率该采取行动"这件事有完全不同的答案。

如果天气预报只给一个确定的数字,等于要求所有人都按同一个标准做决策,这在经济学上被证明是不划算的。这也是为什么传统数值天气预报几十年来一直在搞集合预报,同时跑几十次模拟,用结果的分散程度来表示不确定性。

而这批跑得很快的AI模型,恰恰在这件事上集体交了白卷。

更麻烦的是,最近出现了一类新的AI天气模型,叫端到端模型

端到端模型:不依赖传统数值天气预报的资料同化流程,直接从卫星、地面站、气球、船舶等原始观测数据出发,一步到位生成预报结果的AI系统。传统流程里,原始观测数据需要先经过资料同化,也就是把七零八落的观测数据和一个背景预报融合成一张完整的大气状态图,这个过程本身就很烧计算资源。

端到端模型跳过了这一步,直接吃观测数据吐预报结果,省下了一大块计算成本。英国的Aardvark Weather和欧洲中期天气预报中心的GraphDOP都是这条路线上的代表。问题是,这类模型的不确定性来源更复杂了。它不再是从一个现成的、别人已经算好的大气分析场出发,而是自己一边消化观测数据一边构建对大气状态的理解,同时还要往前推演天气演变。这就好比一个既要当侦探又要当预言家的人,你很难说他最后给出的答案里,有多少不确定性来自线索本身不够清楚,有多少来自他推理能力的局限。

这篇论文要解决的,就是这个问题:能不能让端到端模型不仅给出预报,还能说清楚自己的不确定性从哪儿来。

把一个"哑巴"模型改造成会说"我不确定"的模型

论文的团队选择在Aardvark Weather这个模型上动手术。之所以选它,是因为Aardvark的架构是模块化的,分成编码器、处理器、解码器三段,权重和训练数据也是公开的,方便动刀子。

编码器:负责把卫星、船舶、气球、地面站这些五花八门的观测数据,揉合成一张完整的初始大气状态图,相当于传统流程里的资料同化步骤。

处理器:拿着这张初始状态图,一步一步往前推演,模拟大气随时间的演变,生成未来若干天的预报。

解码器:把处理器算出来的全球格点预报,翻译成具体某个气象站位置的天气数字。

研究团队的思路很直接:给这三段流水线里的前两段,各装一个随机扰动的机关,让原本确定的输出变成一个概率分布。

编码器这边装的是可学习的、和输入相关的高斯噪声。简单说,就是让模型自己学会在哪些地方该"抖动"得厉害一点,哪些地方该稳一点。观测数据稀疏或者质量差的区域,模型会自动给自己留更大的不确定性空间。这个设计对应的是气象学里的一个概念

资料同化不确定性:观测数据本身存在误差、覆盖不全,再加上把观测数据和背景预报融合时引入的误差,导致最终生成的大气初始状态本身就带着不确定性,这是传统气象学里的老问题,如今被搬到了AI模型的编码器环节。

处理器这边装的是一种叫蒙特卡洛丢弃的技巧。

蒙特卡洛丢弃:训练神经网络时常用的一种正则化手段是随机"丢弃"一部分神经元不参与计算,本来这只在训练阶段用来防止过拟合,推理阶段就关掉了。这篇论文的做法是把丢弃机制在推理阶段也保持开启,而且每往前推演一步就重新随机丢弃一次。这样同一个初始状态,用不同的随机丢弃方式走一遍推演流程,会得到略微不同的结果,这些结果之间的差异就代表了模型自身对大气演变规律理解上的不确定性。

这两个机关分别对应着不确定性研究里两个经典概念

偶然不确定性:由被观测系统本身的随机性带来的、原则上无法通过收集更多数据消除的不确定性,比如观测仪器的固有误差、大气本身的混沌特性。

认知不确定性:源自模型本身的局限,比如训练数据不够、架构设计不完美,这类不确定性原则上可以通过更多训练、更好的架构来降低。

论文把编码器的噪声对应偶然不确定性,把处理器的丢弃对应认知不确定性,但作者很谨慎地强调,这个对应关系是一种设计选择,需要用实验去验证,而不是拍脑袋认定的真理。

这里有一个类比能说清楚为什么要用两套不同的机关,而不是随便找一个统一的噪声源糊弄过去。

想象你要预测一场足球比赛的比分。第一层不确定性来自你对场上球员实力和状态的了解程度,比如你根本不知道主力前锋今天是不是感冒了,这是信息缺失带来的模糊。第二层不确定性来自你对足球这项运动本身规律的理解,比如你到底懂不懂什么样的战术组合更容易进球,这是理解能力带来的模糊。如果你只用一个笼统的"这场比赛不好预测"来表达不确定性,教练根本不知道该去打听球员伤病情况,还是该去请更懂战术的分析师。只有把这两层拆开,才能知道该往哪个方向努力。论文如果只在某一处加一个统一的随机扰动,就相当于把这两种完全不同性质的模糊搅在一起,没法回答"到底该加观测站还是该换模型"这个实际问题。

至于解码器,论文选择保持它完全确定,不加任何随机性。这个设计其实是为了保证整个不确定性的拆分是干净利落的两分法,如果三个环节都掺了随机性,最后就很难说清楚每一份不确定性到底是从哪儿冒出来的。

不确定性怎么拆分:一个嵌套集合的设计

光装两个随机机关还不够,还得想办法把最终预报里的总体不确定性,拆解成分别归功于编码器和处理器的两部分。

论文用的方法叫嵌套集合

嵌套集合:先固定住一次编码器的随机噪声抽样,得到一个初始状态,然后在这个初始状态基础上,用处理器的丢弃机制重新推演很多次,得到一组"内层"预报结果。接着换一次编码器的噪声抽样,重复上面的步骤,得到另一组内层预报结果。这样反复做上好几轮外层抽样,就形成了一个"外层套内层"的两层集合结构。

论文里用的具体配置是外层抽样7次,每次内层再推演7次,一共产生49个预报成员,这个规模和欧洲中期预报中心业务系统里50个成员的集合预报差不多。

这样一套嵌套结构做出来之后,就可以用统计学里的方差分析方法,把总方差干净地拆成两块:同一组内层结果的散布程度,代表处理器丢弃机制带来的不确定性;不同组之间均值的散布程度,代表编码器噪声带来的不确定性。这套公式叫全方差定律,本质上就是说总的不确定性等于组内变化加组间变化。

这个设计可以类比成一个连锁餐厅想搞清楚顾客口味满意度差异到底来自哪里。总部先派出7位不同风格的主厨,每位主厨按自己的理解定一套菜谱,这是外层的抽样。然后每套菜谱又交给7位不同手法的厨师去实际炒菜,每位厨师手法略有差异,这是内层的抽样。如果不这样拆开做实验,直接把49份菜端上桌收集顾客评分,你得到的只是一个笼统的满意度方差,根本分不清是菜谱设计得不好,还是厨师手艺参差不齐。只有严格控制外层菜谱不变、只变内层厨师,才能算出厨艺本身贡献了多少差异,反过来也才能算出菜谱设计贡献了多少差异。这正是论文里嵌套结构存在的意义,不嵌套就没法拆分。

改造之后,预报到底变准了还是变差了

这是最实际的问题:加了这么多随机扰动进去,会不会把原本还不错的确定性预报给搞砸了?

结果是不但没砸,反而变好了。

论文里报告的数据显示,经过概率化改造之后的集合预报均值,在六个关键气象变量(地表两米温度、850百帕高空温度、10米高度的南北和东西风速、500百帕位势高度、海平面气压)上,相比原来的确定性Aardvark模型,均方根误差平均降低了4.2%。第一天的预报改善了6.1%,第十天的预报改善了8.1%,中间三到五天的改善幅度最小但也没有变差。

这个反直觉的结果背后有个机制解释:编码器学会的输入相关噪声,客观上起到了损失衰减的作用,训练过程中会自动给那些天生就很难预测准的目标降低权重,不逼着模型在这些注定算不准的地方死磕,反而腾出精力把容易预测准的地方做得更好。

如果换成概率评分的角度看,进步幅度就更大了。论文用了一种叫CRPS的评分标准

CRPS(连续分级概率评分):一种衡量概率预报质量的标准评分方法,对于只给一个确定答案的预报,CRPS就退化成普通的绝对误差。这个指标既能奖励预报准,又能奖励预报的不确定性表达得恰当。

用CRPS衡量,改造后的集合预报比原来的确定性预报提升了24%到38%,而且在所有变量、所有预报时长上都有统计学意义上的显著改善。

不过和欧洲中期预报中心的业务集合预报系统比,端到端模型还是有明显差距,第一天的CRPS差距高达80%,到第十天差距缩小到18%到36%。差距最大的是气压场相关的变量,论文分析原因是这些变量在传统业务系统里高度依赖探空气球、飞机报告和无线电掩星观测,而端到端模型的编码器压根没吃到飞机和掩星数据,探空气球数据的权重也很低。这说明差距的根源可能不在概率化机制本身,而在于原始观测数据喂得不够丰富。

预报到底准不准,这套系统有没有说实话

一个概率预报光是数字好看还不够,还得看它说的"不确定性"到底靠不靠谱。这里有个专门的检验指标

离散度技巧比:集合预报里各个成员之间的分散程度,除以集合均值预报的实际误差,如果这个比值等于1,说明模型说的不确定性和它实际犯错的程度是匹配的,如果远大于1说明模型过于谨慎,喊得比实际情况可怕,如果远小于1则说明模型盲目自信,实际比它说的更容易出错。

论文测出来的结果是,从第一天到第十天,平均下来这个比值是0.98,非常接近完美的1,走势也和欧洲中期预报中心的业务集合预报很像,第一天略微保守,中间几天最接近完美,第十天又略微回升。

但这个平均数字掩盖了一个细节:在预报的最初那一刻,也就是编码器刚生成初始状态还没开始推演的时候,它的离散度技巧比只有0.78,明显偏自信了,说明编码器学到的噪声只覆盖了观测数据本身遗留下来的那部分不确定性,没能完全代表整个资料同化过程应有的误差。等处理器的丢弃机制一介入,只推演一步之后,整体校准立刻变好,说明丢弃机制在校准这件事上扛了大头。

拿到气象站层面去验证,结果基本一致:站点预报的均方根误差和原来的确定性模型相比,差距控制在2.4%以内,同时CRPS在每个预报时长、每个地区(包括观测站点稀疏的西非和太平洋地区)都显著更好。不过站点层面的校准就没有格点层面那么理想,模型在所有预报时长上都显得有点自信过头,论文推测这和解码器完全没有加随机性有关,观测误差和代表性误差这类"最后一公里"的不确定性根本没被建模进去。

不确定性到底是谁的锅:一次因果验证实验

前面说编码器管观测不确定性、处理器管模型不确定性,这只是设计初衷,得拿实验去验真假。

论文设计了一个很巧妙的验证方法,思路借鉴自传统气象学里的观测系统实验

观测系统实验:通过人为拿掉某一种观测数据源,重新跑一遍整个预报流程,看看结果会受到多大影响,从而判断这种观测数据到底有多重要。传统方式做这种实验代价很高,得跑完整的资料同化和预报循环,耗时数月。而在这个端到端集合系统里,做一次这样的实验只需要重新编码加重新跑一遍集合预报,一块GPU几个小时就搞定。

论文选了两个观测数据源做测试:一个是IASI卫星红外探测仪,这是对模型影响最大的观测数据源;另一个是IGRA探空气球网络,是影响最小的数据源。

结果非常干脆。拿掉IASI之后,编码器分支贡献的不确定性在前三天内直接翻倍(增幅96%到111%),随着预报天数增加,这种影响逐渐被处理器的推演过程"遗忘",到第十天只剩5%的增幅。而在整个过程中,处理器分支贡献的不确定性几乎没有反应,最大波动也不超过8%。反过来,拿掉影响力最弱的探空气球数据,两个分支的变化都在1%以内,几乎可以忽略。

这个结果就像一次精确制导的实验:动了哪根线,只有对应的那个仪表盘会跳。这说明编码器分支和处理器分支确实各自守着自己的领地,拿掉一个关键观测源,只会让"我们对当前大气状态了解多少"这个指标变差,而不会莫名其妙地影响"我们对大气演变规律理解多少"这个指标。

这个验证之所以重要,是因为如果没有这层因果检验,前面所有关于"编码器代表观测不确定性、处理器代表模型不确定性"的说法都只是一厢情愿的命名游戏。就像给两个抽屉贴了标签"文件"和"杂物",但从没真正打开检查过里面装的是不是对得上标签。这次拿掉观测源的实验,相当于真的打开抽屉验证了一次,结果发现标签贴对了。

从这个结果往前想一步,其实这套机制天然适合用来规划未来的观测网络。想知道某个新增的卫星传感器对提升预报信心有多大帮助,或者某个老旧地面站网络退役会造成多大损失,理论上都可以用这种"拿掉再看反应"的方式快速估算,而不需要真的花几个月去跑传统的观测系统实验。

不确定性的真相:一个反直觉的发现

论文里有一个结果,我觉得值得单独拎出来说。

传统气象学里有个根深蒂固的直觉:预报的头一两天,误差主要来自初始条件没定准(也就是观测和资料同化环节的问题),越往后推演,模型自身动力学理解上的偏差才会越来越占主导。这个直觉支撑了几十年的集合预报设计思路。

论文的结果部分符合这个直觉,部分完全推翻了它。

方向是对的:从第一天到第十天,处理器分支(对应模型/动力学不确定性)占总不确定性的比例,确实从86%一路涨到96%,越往后模型不确定性确实越占主导。

但程度完全出乎意料:即便是在第一天,理论上应该是初始条件误差唱主角的时刻,编码器分支贡献的不确定性占比也只有14%,剩下86%全都来自处理器的动力学推演。换句话说,从一开始,这套系统里的大部分不确定性都被归因到模型本身,而不是观测数据的问题。

论文对这个结果保持了相当审慎的态度,没有直接下结论说"模型不确定性远比观测不确定性重要",而是把它解读成一对边界:编码器分支给出的是观测不确定性的下限,处理器分支给出的是纯模型不确定性的上限。真实情况可能介于两者之间,因为至少有三种因素可能扭曲这个比例。第一种可能是编码器学到的噪声本身就低估了观测和资料同化环节的真实误差,这一点从编码器单独拿出来看时明显偏自信(离散度技巧比只有0.46到0.19)就能看出端倪。第二种可能是这套方差分解方法在数学处理顺序上,把编码器和处理器之间的交互效应全部算进了处理器那一份账里。第三种可能是每一步都重新抽取的丢弃掩码,其实更像是一种沿途累积的随机扰动机制,而不是对模型参数不确定性的一次性快照。

这种坦诚地把自己方法的局限性和可能的解释偏差摆在台面上讨论,比一上来就宣称"我们发现了真理"要靠谱得多。

写在后面

读完这篇论文,最让我意外的不是技术设计本身,而是那个"14% vs 86%"的数字。

我原本以为,端到端模型既然是直接从原始观测数据出发构建大气状态,它的不确定性理应大部分来自观测这一端,毕竟省掉了传统资料同化那套精密的误差处理流程。结果论文告诉我,哪怕在预报刚开始的那一刻,绝大部分不确定性依然算在了模型动力学头上。这提醒我一件事:一个系统"从哪里获取信息"和"它对这些信息有多大把握",其实是两回事,前者决定输入渠道,后者取决于处理这些信息的机制本身设计得多严谨。观测数据再丰富,如果编码器学到的置信度评估本身偏乐观,这份不确定性就会被系统性低估,而不是自动反映在最终结果里。

另一个值得琢磨的地方是,论文反复强调"编码器分支约等于观测不确定性,处理器分支约等于模型不确定性"这个说法只是一种近似,而不是精确对应。这种谨慎其实挺难得的,在一个动辄用"可解释AI"当卖点的领域里,愿意承认自己的解释框架有边界、有局限,反而更让人信服。

论文最后提到一个还没做的实验:把编码器学到的观测噪声,拿去和欧洲中期预报中心那套专门用来评估资料同化不确定性的集合系统做对比。这个对比如果做出来,可能会告诉我们编码器的置信度评估到底低估了多少,低估在哪些具体的气象要素上。这事儿现在还是空白,但答案应该不难猜,大概率还是偏乐观的那一边。

Q&A

Q1:端到端天气预报模型和传统AI天气预报模型有什么区别?

A:端到端模型跳过了传统的资料同化环节,直接从卫星、地面站、气球等原始观测数据生成预报,而传统AI天气预报模型(如GraphCast)依然依赖ERA5这类经过资料同化处理的再分析数据集作为输入和训练目标。

Q2:这套不确定性拆分方法会不会让原本的预报准确率变差?

A:不会,反而变好了。论文数据显示,改造后的集合预报均值相比原始确定性模型,均方根误差平均降低4.2%,用CRPS概率评分衡量则提升了24%到38%,且没有任何变量在任何预报时长上出现显著变差。

Q3:为什么说编码器分支和处理器分支的不确定性来源是真实分开的,而不是凑出来的说法?

A:论文做了观测系统拿掉实验验证,拿掉最重要的IASI卫星数据后,编码器分支的不确定性在前三天翻倍,而处理器分支几乎不受影响;拿掉影响最小的探空气球数据后,两个分支变化都在1%以内,证明两者确实各自对应不同的不确定性来源。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
烟草系统拉响警报:再这样下去,中国烟草真要出大问题

烟草系统拉响警报:再这样下去,中国烟草真要出大问题

阿振观点
2026-08-25 05:56:32
西方为何痛批中国治沙?真相曝光:动了的不是沙子,是老外奶酪!

西方为何痛批中国治沙?真相曝光:动了的不是沙子,是老外奶酪!

史之铭
2026-08-25 17:15:36
即将迎来激动人心的时刻!菲公诉代表:杜特尔特夫妇的机会渺茫

即将迎来激动人心的时刻!菲公诉代表:杜特尔特夫妇的机会渺茫

萌城少年强
2026-09-10 13:05:38
意外!上港队在本赛季引援最大失误,就是没有引进强力中锋外援

意外!上港队在本赛季引援最大失误,就是没有引进强力中锋外援

振刚说足球
2026-09-11 14:04:31
中方新一轮反制,日本“一天都没撑过”,要求立即撤回还找G7协调

中方新一轮反制,日本“一天都没撑过”,要求立即撤回还找G7协调

老踝是个手艺人
2026-09-10 23:53:05
没订奶的孩子站教室后排喝水,背后是一桩84亿的生意

没订奶的孩子站教室后排喝水,背后是一桩84亿的生意

可达鸭面面观
2026-09-11 12:07:36
降价9万仍无人问津,库存超260万辆,经销商应该怎么跳出死循环?

降价9万仍无人问津,库存超260万辆,经销商应该怎么跳出死循环?

曹莽看世界
2026-09-10 15:44:41
万梓良的儿子,18岁生日那天收到的不是跑车,不是豪宅,而是一块光滑的、没有刻字的金属牌

万梓良的儿子,18岁生日那天收到的不是跑车,不是豪宅,而是一块光滑的、没有刻字的金属牌

一盅情怀
2026-08-22 16:34:50
打完五场世界杯!中国女篮这四名球员可以“退货了”,宫鲁鸣尽力了

打完五场世界杯!中国女篮这四名球员可以“退货了”,宫鲁鸣尽力了

男足的小球童
2026-09-11 18:06:47
姚明当年选择那叫一个干脆,2011年退役之后,上海体育局给了两条路,他直接选了自主择业,放弃编制,人事关系切断

姚明当年选择那叫一个干脆,2011年退役之后,上海体育局给了两条路,他直接选了自主择业,放弃编制,人事关系切断

背包旅行
2026-09-10 15:21:03
网友发帖称母亲心梗,父亲打120误入荣耀魔法画报耽误呼救;大风新闻走访荣耀体验店——锁屏后滑动魔法画报难退出,要从底部上划才能使用手机

网友发帖称母亲心梗,父亲打120误入荣耀魔法画报耽误呼救;大风新闻走访荣耀体验店——锁屏后滑动魔法画报难退出,要从底部上划才能使用手机

大风新闻
2026-09-11 16:58:05
高中生因救摔倒老人错过了重要大考,无奈报了大专,40多天后老人的儿子登门:小兄弟,我给你发录取单

高中生因救摔倒老人错过了重要大考,无奈报了大专,40多天后老人的儿子登门:小兄弟,我给你发录取单

晓艾故事汇
2026-09-10 11:29:32
提醒:煮熟也有毒,一口都别吃,很多家庭天天吃,看完赶紧扔掉

提醒:煮熟也有毒,一口都别吃,很多家庭天天吃,看完赶紧扔掉

观星赏月
2026-09-11 06:31:51
某大厂P7:失业一年后,房子面临断供。找银行说明情况,房贷从18000多元降到6000元,至少维持两年

某大厂P7:失业一年后,房子面临断供。找银行说明情况,房贷从18000多元降到6000元,至少维持两年

蚂蚁大喇叭
2026-09-10 11:24:45
俄乌冲突最新进展:9月11日上午最新消息

俄乌冲突最新进展:9月11日上午最新消息

第一校尉
2026-09-11 09:55:41
中国千亿芯片订单撤销,欧美光刻机生产线接连停工。

中国千亿芯片订单撤销,欧美光刻机生产线接连停工。

荆楚寰宇文枢
2026-09-10 21:31:24
诸旖已任上海黄浦区委副书记

诸旖已任上海黄浦区委副书记

澎湃新闻
2026-09-11 10:16:29
周星驰导演票房超80亿

周星驰导演票房超80亿

界面新闻
2026-09-11 15:31:24
这么多“刚好”、“巧合”凑在一起,你觉得公众会信吗?

这么多“刚好”、“巧合”凑在一起,你觉得公众会信吗?

走读新生
2026-09-10 17:24:39
被央视点名24小时彻底破防!装了半辈子体面的郭德纲,这次彻底凉透

被央视点名24小时彻底破防!装了半辈子体面的郭德纲,这次彻底凉透

天天热点见闻
2026-09-11 07:14:15
2026-09-11 18:55:00
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9842文章数 568关注度
往期回顾 全部

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

头条要闻

时隔6天"葫芦娃爷爷"重新挂出葫芦:感觉对不起游客

头条要闻

时隔6天"葫芦娃爷爷"重新挂出葫芦:感觉对不起游客

体育要闻

37岁还能场场进球,还能翻跟头!

娱乐要闻

黄晓明直言帮太多白眼狼,杨颖遭殃

财经要闻

千叶珠宝创始人夫妇失联 股价应声"腰斩"

汽车要闻

买菜车也有小乐趣 风云T7不止是台合格家用SUV

态度原创

游戏
数码
旅游
公开课
军事航空

金刚狼陷新争议!线性还引导 而且看着像有人放屁

数码要闻

三星Galaxy SmartTag 3外观设计与黑白配色渲染图曝光

旅游要闻

文旅部门回应将核查措嘉冰川违规探险情况!南都曾推出调查

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

涉伊朗核问题 中国和俄罗斯投下反对票

无障碍浏览 进入关怀版