![]()
9 月 22 日《新英格兰医学杂志》发表了 NHS-Galleri 的主要结果。这是一项 14 万多人的多癌种早期检测随机对照试验:英格兰 50 到 77 岁的普通人,一半人的血送去做检测,一半人的血只是封存起来,最多抽三次,每年一次。主要终点很直白:看看筛查能不能让 III 期和 IV 期的癌少一些。
结果是没有。干预组和对照组的晚期癌发病率比是 1.03,95% 置信区间 0.92 到 1.14,P=0.63。换成人话:两组一样多。
这个结果之所以值得写,在于它戳破了一个很常见的默认假设:以为「查得出来」就等于「查得早」。一管血能不能查出癌,和它能不能在还来得及的时候查出癌,是两个问题。
这项试验测的是什么
参与者是英格兰八个癌症联盟区域的普通居民,50 到 77 岁。142,250 人按 1:1 随机分成两组:干预组 71,122 人的血样当场送检,拿到「检出癌信号」结果的人被叫回医院做进一步检查;对照组 71,128 人的血样抽了就冻起来,谁也不测。分组一开始对参与者和试验人员都保密。
检测方法是读血里游离 DNA 的甲基化模式。肿瘤细胞的 DNA 甲基化和正常细胞不一样,机器学习模型从这些差异里判断「有没有癌信号」,并且顺手猜一下信号来自哪个器官。
主要终点选得很讲究:12 种预设癌种里 III 期或 IV 期癌的发病率。为什么不直接看死亡率?因为死亡率要等十几年。晚期诊断率被普遍当作死亡率的先行指标:一种癌如果能在 I 期抓住,后面变成晚期、变成死亡的概率就低。所以晚期诊断变少,是这条逻辑链上最早能观察到的那一环。
三轮筛查做完,再等至少 12 个月,然后数两组各自出现了多少例 III/IV 期癌。
两个数字,读法不一样
主要终点:发病率比 1.03(0.92–1.14),P=0.63。置信区间横跨 1,意思是数据既不支持筛查组晚期癌更少,也不支持更多。这是一个干净的阴性结果。
关键次要终点:IV 期癌的发病率比 0.86(0.74–1.00)。这个数看着像有点效果,低了 14%,但区间的上界正好压在 1.00 上。按统计学的规矩,这叫边缘结果,不能拿来宣布结论。它值得继续追踪,作者自己在文末写了需要更长随访。
安全性方面:不到 1% 的参与者出现与试验相关的不良事件,没有严重事件。也就是说,抽血这个动作本身不伤人,代价不在针眼上。
![]()
第一条链:这类检测最灵的时候,恰好是最没用的时候
血里的游离 DNA 大部分来自正常细胞更新,主要是白细胞。肿瘤只要在长,就会有细胞死掉、裂解,把自己的 DNA 碎片释放进血里,这部分叫循环肿瘤 DNA。关键在于量:释放多少,大体上跟着肿瘤负荷走。一个直径几毫米的早期病灶,一天里死掉的细胞数量有限,它的 DNA 在血里的占比可能只有万分之几甚至更低,被正常细胞的 DNA 彻底淹没;而一个已经转移、总重量上百克的肿瘤,释放量能高出好几个数量级。
这不是猜测。2014 年《科学·转化医学》那项 640 例的研究就把这条关系量了出来:晚期胰腺癌、卵巢癌、结直肠癌、膀胱癌、胃食管癌、乳腺癌、黑色素瘤、肝癌、头颈癌里,能测到 ctDNA 的超过 75%;而局限期的结直肠癌是 73%、胃食管癌 57%、胰腺癌 48%、乳腺癌 50%。同一种癌,晚期和早期的检出率差一大截。
Galleri 这个检测本身的验证数据更直接。2021 年《肿瘤学年鉴》上发表的独立验证集里,4077 个样本,特异度 99.5%,总敏感度 51.5%。按分期拆开看:
I 期 16.8%,II 期 40.4%,III 期 77.0%,IV 期 90.1%。首尾差了五倍多。
这个梯度和筛查的目标正好拧着:筛查想在 I 期把癌抓住,而这类检测在 I 期十次里漏掉八次;它最擅长的是 IV 期,可 IV 期的癌通常已经有症状、已经被查出来了,不需要靠筛查发现。
主要终点要动,必须有一批本来会长到 III/IV 期才被发现的癌,在 I 期或 II 期就被拦下来。而拦下来的能力恰恰最弱。
![]()
第二条链:晚期病例要减少,得满足一个更苛刻的条件
就算检测能抓到一些早期癌,晚期发病率也不会自动下降。
筛查让晚期诊断变少,靠的是「期别前移」:某个人的癌本来会在两年后以 IV 期的样子被发现,现在提前在 I 期被查出并治掉,两年后那个 IV 期病例就不存在了。晚期发病率是这么降下来的。
这笔账有三个地方会漏。
第一,查出来的癌可能本来就不会变晚期。有些病灶长得极慢,或者根本不会突破局部。把它们提前查出来,晚期病例数不变,只是多了一批人要接受检查和治疗,这就是过度诊断的来源。
第二,间期癌。三轮筛查之间各隔一年。一个在第一次抽血时太小、测不出来的病灶,完全可能在接下来 12 个月里长成 III 期,在下一次抽血之前就以症状的形式暴露出来。这类癌既没被筛查抓住,也照样计入晚期病例。
第三,重叠。乳腺癌、结直肠癌、宫颈癌本来就有成熟的筛查手段在跑,这部分癌的早期病例常规筛查已经在抓,血检再抓一遍,增量有限。
三个漏点叠起来,就能解释为什么「检测确实找到了一些癌」和「晚期癌没有变少」可以同时成立。
![]()
那么这条路是走不通吗
不能这么说。
随访时间还短。三轮年度筛查加至少 12 个月观察,对一个以期别分布为终点的筛查试验来说是偏早的。乳腺癌和结直肠癌筛查试验当年都要等更久,效应才稳定下来。IV 期那个 0.86(0.74–1.00)究竟会向下走实还是回到 1,得靠继续随访回答。
终点不是死亡率。主要终点是晚期诊断率,这是替代指标。它没达成,说明这条逻辑链的第一环没走通;但反过来,即使它达成了,也不直接等于有人因此活得更久。把替代指标和硬终点混在一起谈,是评价筛查时最常见的错误。
技术在动。敏感度的短板来自「早期肿瘤释放的 DNA 太少」这个物理事实,而这个事实决定的是当前方法的天花板,不是永远的天花板。更深的测序深度、更多的标记类型、更长的采血间隔设计,都还有空间。这项试验测的是当前这一代检测在一个具体人群里的表现。
现在,普通人该怎么用这条消息
它不能替代已有的常规筛查。低剂量胸部 CT 查肺癌、结肠镜或便隐血查结直肠癌、HPV 联合细胞学查宫颈癌、钼靶查乳腺癌,这些手段都有大型随机对照试验或长期人群研究支持。一管血查十几种癌听着更省事,但目前的证据等级还不在一个层面上。拿血检的阴性结果当安心的理由、把该做的肠镜或 CT 往后推,风险是实在的。
阴性不等于身上没有癌。按分期敏感度看,一次「未检出癌信号」并不能说明没有早期癌,它只是说明血里没读到足够强的信号。有症状的时候尤其如此:体重下降、便血、咳血、无痛性血尿,一般都建议按症状本身去做相应检查,不因为血检是阴性就改变原有的检查计划。具体查什么、什么时候查,还是要由接诊医生判断。
阳性结果的代价不是零。试验设计时预计阳性率大约 1%。收到「检出癌信号」的人接下来要做影像、可能要内镜、可能要穿刺,其中相当一部分最后没找到癌。这段时间的焦虑是真实的成本,NHS-Galleri 专门嵌了一项心理学子研究来测它。所以这类检测通常不建议抱着顺便查一下的心态自费去做。
国内同类自费套餐怎么看。各种「多癌种甲基化早筛」的价格在几千元一档。判断依据一般不看宣传里的敏感度数字,而看两个条件:一是有没有随机对照试验证明它能改变期别分布或死亡率,二是拿到阳性结果之后,有没有一条明确的后续检查路径在等着。要不要做、做完怎么办,建议先和自己的主诊医生谈。NHS-Galleri 是这个领域里证据等级最高的随机对照试验之一,而它的主要终点没有达成。
泌尿科的一点补充
前面那项 2014 年的研究里有个细节,跟我的专业有关:原发的肾癌、前列腺癌、脑肿瘤和甲状腺癌,ctDNA 检出率不到 50%,明显低于结直肠癌、胃食管癌、胰腺癌这些消化道肿瘤。
前列腺癌大多长得慢、细胞更新不快,释放进血里的 DNA 本来就少,这一点比较好理解;肾癌为什么也偏低,目前没有公认的解释。不管原因是什么,在泌尿系肿瘤上别指望血里的甲基化检测能代替 PSA 加多参数磁共振,或者代替肾脏的影像随访。反过来说,前列腺癌本身有 PSA 这个相对便宜、也有争议但机制清楚的指标,讨论要不要查、几年查一次,仍然是回到 PSA 的那套逻辑里去谈。
检测问题,和筛查问题
一管血同时查十几种癌,技术上已经做到能读出信号;14 万人的随机对照试验说明,它目前还没做到在来得及的时候读出信号。前者是检测的本事,后者才是筛查的价值。
参考来源
Sasieni P, et al. N Engl J Med 2026 (NHS-Galleri)
Klein EA, et al. Ann Oncol 2021;32:1167-1177 (CCGA validation)
Bettegowda C, et al. Sci Transl Med 2014;6:224ra24
Marlow LAV, et al. BMJ Open 2023;13:e072657
AI 辅助整理,作者审核;内容仅供参考,具体诊疗请遵医嘱。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.