![]()
系列简介
这是我们一系列原创技术贴,从易到难,每天学习一点。所有内容均为疾控数据分析、科研论文相关,或者说很多和现在的热门监测预警相关,所以我们这个系列就叫“监测预警基础”。
之前很多老师反馈这种小专题的形式特别好,可以一口气彻底学透一种方法,好的,我们又来了!
这次是分布滞后非线性模型,我们初步计划用8小节左右的内容讲通它的前世今生,以及如何使用。所以我们这个小专题的名字就叫做《八小篇搞懂DLNM》
今天是第2小篇——了解DLNM的前世
再次说一点,其实这个方法没那么复杂,尤其是只是使用的话难度不大,但是,我主要想借这一篇经清楚相关的很多东西,所以前面内容会比较多稍显啰嗦复杂,
上一篇我们聊到,气象与健康效应的两大核心特征是非线性与滞后效应,传统模型总是顾此失彼。很多同行看到 DLNM 的公式就望而却步,但其实它并非凭空出现,而是在 GLM、GAM 这些基础模型上一步步扩展而来的。
今天我们就把这两个疾控时间序列研究的 “基石模型” 拆透,给出最常用的实战公式,并逐符号解释清楚每一项的含义、在研究里起什么作用。把基础打扎实,后面理解 DLNM 就像搭积木一样顺理成章。
![]()
1. 为什么不用普通线性回归?
我们疾控日常分析的日发病数、死亡数、门诊就诊数,都属于计数数据取值只能是非负整数,且普遍服从泊松分布或负二项分布,不符合普通线性回归要求的 “正态分布、方差齐性” 假设,强行使用会导致结果严重偏倚。
广义线性模型(Generalized Linear Models, GLM)正是为解决这个问题而生,它把线性回归的适用范围从正态分布拓展到了整个指数分布族,是疾控领域计数数据分析的标准工具。
2. GLM 的三大核心构成
理解 GLM,只要抓住三个部分即可:
第1是随机部分:规定因变量的分布类型(如发病数服从泊松分布)
第2是系统部分:所有自变量组合成的线性预测项
第3是联系函数:连接因变量均值与线性预测项的 “桥梁”,保证拟合结果符合数据特征
3. 疾控实战标准公式:泊松 GLM
在传染病监测、环境健康研究中,我们最常用的是泊松回归,它属于 GLM 的一个分支。一个标准的时间序列泊松 GLM 公式如下:
![]()
4. 更贴近真实研究的完整 GLM 公式
在实际的疾控时间序列分析中,我们通常会加入时间趋势、星期效应这两类核心混杂因素,公式会写成这样:
![]()
5. GLM 的优势与核心局限
优势主要是模型结构清晰,结果解读直观,系数直接对应风险大小,计算稳定,是所有时间序列健康效应研究的入门基础。
核心局限在于线性假设太强。上面的公式中,温度的系数都是固定值,意味着 “温度每升高 1℃,风险变化比例始终不变”。但真实世界中,低温区间升温会降低风险,高温区间升温会升高风险,两者幅度完全不同。强行用直线拟合 U 型、J 型的真实关系,必然会大幅低估极端温度的健康损害。
![]()
既然线性假设不符合真实规律,我们就让模型自己去拟合数据的真实曲线形状,广义相加模型(Generalized Additive Models, GAM)就是这个思路的产物。
1. 从 GLM 到 GAM:把直线换成平滑曲线
GAM 是 GLM 的扩展,核心变化只有一个:把原来的线性自变量项,替换成了非参数平滑函数不需要我们提前规定关系是直线、二次曲线还是三次曲线,模型会自动根据数据拟合出最贴合的平滑曲线,这就是它能处理非线性关系的核心原因。
2. GAM 的标准公式
疾控场景下,GAM 依然常用泊松分布 + 对数联系函数,一般形式为:
![]()
3. 疾控实战完整版 GAM 公式
在温度与健康、气象与传染病的研究中,标准的 GAM 模型通常写成这样:
![]()
4. GAM 的优势与能力边界
优势在于完美解决了非线性问题,可以直接绘制暴露 - 反应曲线,精准找到风险最低的 “最适温度”,分别评估低温、高温的健康风险,这是 GLM 完全做不到的。
核心短板:系统分析滞后效应的能力很弱。如果想研究 “今天的温度对未来 14 天发病的影响”,GAM 只有两种笨拙的做法:
第一是分别单独拟合滞后 1 天、滞后 3 天、滞后 7 天的效应,只能看到几个孤立的时间点,无法呈现完整的滞后变化过程,也不能计算累积总效应。
第二是把滞后 0 天到滞后 14 天的温度全部放进模型,但相邻日期温度高度相关,会引发严重的多重共线性,结果波动极大,完全无法稳定解读。
一句话总结:GAM 能看清 “不同温度的风险不一样”,却看不清 “同一天温度,在不同天的效应不一样”。
我们对比一下广义线性和广义先加模型,
GAM 擅长处理非线性,却搞不定滞后效应;而我们下一篇要讲的分布滞后线性模型(DLM),刚好反过来 —— 它专门为分析滞后效应而生,却又默认暴露与结局是线性关系。
既然两者各有所长,那能不能把 “非线性能力” 和 “滞后分析能力” 结合起来?这正是 DLNM 诞生的核心思路。下一篇我们就拆解 DLM 模型与样条函数这两块 “核心积木”,看看它们最终是如何组合成分布滞后非线性模型的。
![]()
![]()
![]()
编辑:普通疾控人 | 审核:诗酒趁年华
文章来源 | 原创
说明 | 转载只为分享,如有侵权联系删除
©版权声明 | 部分信息和图片来自公开网络
转载请注明
再次转载请注明出处
![]()
科普健康 | 宣传疾控
本号为多位疾控机构从业者运营
重点关注国内外健康事件
致力于疾控科普
在做好科普服务大众的同时
做好疾控机构的宣传
让更多的人了解疾控,拥抱健康
欢迎加「小编」微信(cdcjkr126com)
本文具体说明
本文为原创内容,文章为个人理解所学,不涉及疫情信息及内部保密数据,发表的目的为自我总结及给有需求的人士学习使用。如有不妥之处,欢迎联系小编修改、删除。
更多精彩视频,尽在“CDC疾控人”视频号
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.