![]()
一位 68 岁的先生拿着前列腺磁共振报告来门诊,上面写着「外周带可疑信号,PI-RADS 3 类」。他问我:3 类是不是一半一半?要不要穿刺?
我通常不直接回答穿或不穿,先问他两个数:PSA 的具体数值和前列腺体积。原因后面会讲。这个问号在泌尿外科门诊里出现的频率,比 4 类和 5 类加起来还高。4 类和 5 类的处理没什么争议,该穿;1 类和 2 类基本可以先放着。难的是中间这一档。
2026 年 9 月 26 日,《European Radiology》在线发表了一项多中心研究,把一套已经在市面上卖的人工智能风险分级系统和放射科医生读出来的 PI-RADS 直接对比。结果有一处看着自相矛盾:同一套软件,按病人算比医生更敏感,按病灶算却不如医生。按病人算,AI 的敏感度是 97.6%,医生 92.6%;按病灶算,AI 78.8%,医生 88.8%。
PI-RADS 3 这个分数在说什么
PI-RADS 不是概率,是一套读片的描述规则。它按病灶在 T2 加权像和弥散加权像上的表现,把可疑程度从 1 排到 5。3 类的字面含义是「可疑程度居中,证据不足以判定」。
居中不等于一半。EAU 2026 年版前列腺癌指南引用的 PI-RADS v2.1 荟萃分析里,按病人算的 ISUP 分级组 ≥ 2 的癌(临床有意义的癌)检出率是:1 类 6%、2 类 6%、3 类 20%、4 类 55%、5 类 83%。
所以 3 类的意思是:十个人里大约两个穿出有意义的癌,八个穿了白穿。穿刺不是抽血,经直肠或经会阴打十几针,发热、感染、血尿、尿潴留都是实际存在的风险,还有一笔费用和一次麻醉。八个人承担这些代价换两个人及早发现,这笔账怎么算,一直是争论的焦点。
这项研究比的是什么
研究收了 2014 到 2025 年间做过前列腺磁共振、并且有病理结果可以对照的男性,排除之后剩 787 人,年龄中位数 70 岁。其中 380 人(48.3%)病理证实有 ISUP 分级组 ≥ 2 的癌。
对比的两套判断是:商用 AI 系统给出的三档风险类别,和放射科医生给出的 PI-RADS 分类。金标准是穿刺或手术的病理。多中心、多厂家机型,意味着图像质量和参数本来就不统一,这对一套软件是偏难的考场。
两个层面分别算了敏感度。按病人算,AI 97.6%,医生 92.6%,AI 不劣于医生(P < 0.001);按病灶算,AI 78.8%,医生 88.8%,非劣性没有达到(P = 0.98)。病人层面的曲线下面积 AI 0.80、医生 0.77,差 0.032(95% 可信区间 0.001 到 0.064,P = 0.043)。
![]()
同一套软件,为什么一边赢一边输
两个层面问的不是同一个问题。
按病人算,问的是「这个人身上有没有有意义的癌」。只要 AI 在这个人的前列腺里任何一处报了高风险,病理又确实在某处找到癌,就算它答对了。位置对不对,这个算法不追究。
按病灶算,问的是「报高风险的区域,是不是病理证实有癌的同一块组织」。这里要求空间对得上:热区的位置、范围得和病理取到癌的位置重合,才算命中。
两个问题的差别在这里,矛盾也就落在这里。打个比方:一张卷子有两种判法,一种只问这个学生会不会做题,任意一道答对就算会;另一种要求第 3 题答对,答对了第 5 题也不给分。同一份答卷,两种判法给出的分数可以差很远。AI 的热区是按体素算概率再连成片画出来的,它倾向于把信号可疑的区域都标上。标得多,在病人层面是加分项,因为命中的机会变大;在病灶层面是扣分项,因为多标出来的区域和病理对不上,既不算命中,还会把注意力分散到几个位置上。医生读片时反过来,会尽量只落一两个靶点,所以病灶层面的命中率更高。
这一条归因是我按两种统计口径的定义做的推断,原文报的是数字和结论,没有专门做这项拆解。但原文作者的结论指向同一个方向:病灶定位的责任仍然留给放射科医生。
这个区别直接决定了 AI 能干什么。靶向穿刺要坐标,针往哪里扎,靠的是病灶层面的判断。所以这套软件适合回答这个人要不要穿,不适合回答穿哪一针。定性还是靠病理,这一条没有变。
![]()
不打造影剂的磁共振,少了哪一路信息
还有一处容易被跳过的细节:研究用的是双参数磁共振,英文缩写 bpMRI。
常规的前列腺磁共振是多参数,包含 T2 加权像、弥散加权像和动态增强序列三部分,最后那一部分要往静脉里打钆造影剂。双参数把增强序列去掉了,只留 T2 和弥散。
去掉它的理由很实在。造影剂要经肾脏排出,肾功能差的人用起来有顾虑;钆剂会在体内有少量沉积;做完增强还要多躺十几分钟,一台机器一天能排的人数就少了。不打造影剂,检查时间短、费用低、禁忌少。
代价是少了一路信息。增强序列看的是血流灌注的时间曲线,癌灶通常进得快、退得也快,这个动态过程在 T2 和弥散上看不到。所以双参数读片对剩下两个序列的图像质量要求更高,弥散序列一旦有变形或者伪影,判断的余地就小了。
AI 在这里的位置就清楚了。这类计算机辅助检测软件的通常做法,是把图像上的信号特征算成一个风险数值,再把数值高的区域连成片、归进几档风险;具体用了哪些特征、怎么训练,摘要里没有写。它的长处是稳定,不受疲劳影响,一天读一百份和读第一份用的是同一套参数。医生比它强在能把前列腺炎留下的弥散受限、钙化灶、既往穿刺造成的瘢痕和真正的病灶区分开,这些判断要靠对解剖和病史的理解,不只是信号强弱。两种能力不重叠,这也是作者把它定位成决策辅助而不是替代的依据。
用在 3 类上,能少穿多少
研究还模拟了几种分流策略。针对 PI-RADS 3 类做分流,可以免掉 18.9% 的穿刺,同时保住 98.4% 的敏感度。
落到 3 类病灶内部:AI 把其中 93.1% 病理证实有癌的病灶升了档,同时把 24.1% 良性病灶判为低风险。
前一个数字说的是漏诊控制,后一个说的是省下的针。两个数字放在一起,就是 3 类分流的全部内容:把一部分人往上推、让他去穿,把另一部分人往下放、先随访。注意这只是基于已有数据的模拟,不是真的让一批人按 AI 的建议不穿刺再追踪结局。
这些数字不能直接搬进门诊
第一,队列里 48.3% 的人确实有有意义的癌。能走到穿刺和病理这一步的人,已经被 PSA、指诊和磁共振筛过几轮,患病率远高于门诊初筛的人群。阳性预测值随患病率升降,把这里的数字搬给一个 PSA 刚刚轻度升高的人,会高估风险。
第二,研究是回顾性的,图像跨了十一年、跨了多家厂家机型。软件在老机型的图上表现如何、在新机型上又如何,摘要没有分开报。
第三,被评测软件的生产厂家有两位员工是本文作者,另有一位作者披露了来自该公司的咨询费。文中说明用于本研究的影像和病理数据没有参与该系统的开发或训练,这一点降低了数据泄漏的可能,但利益关系本身仍然存在。软件最终是卖给医院和影像中心的,分流能省多少针,直接关系到它值不值这笔钱,读结论时要把这层关系放进去。
报告上写着 3 类,可以问哪两件
目前能用的办法,不依赖 AI 也成立。
第一件是 PSA 密度,也就是 PSA 值除以前列腺体积,两个数在报告里一般都有。EAU 2026 年指南的风险矩阵里,3 类病灶按 PSA 密度分开之后差别很明显:密度低于 0.10 的,有意义癌的比例是 4%(3/74);0.10 到 0.15 是 13%(11/88);0.15 到 0.20 是 29%(12/41);高于 0.20 是 29%(15/51)。同样是 3 类,一头 4%、一头 29%,不能一概而论。指南对应的建议是:密度最低那一档可以不穿,中间档考虑穿,高档建议穿。
第二件是读片的质量和经验。PI-RADS 3 的比例在不同中心差得很远,指南里提到有研究的 3 类占到 46%,并把图像质量缺少统一把控列为可能原因之一。同一个人的片子换一家有前列腺专项经验的中心再读一次,分类改变并不少见。
所以拿到 3 类报告,不用急着在穿和不穿之间二选一。先把 PSA 密度算出来,问清楚读片中心有没有前列腺专项经验,再和医生商量下一步。
我个人现在的用法是:AI 的风险分档当成读片之外的第二只眼睛,它和医生意见一致时让我多一分底气,不一致时提醒我把片子再调出来看一遍,至于针扎在哪里,仍然按医生标出的靶点。
![]()
还没定论的地方
AI 辅助分流最缺的一环,是前瞻性验证:真的让一批 3 类的人按 AI 的建议不穿刺,随访几年看漏掉了多少有意义的癌。现在所有「能省 18.9% 穿刺」的说法,都来自在已完成的队列上回头做的模拟。
另外,病灶层面的差距能不能靠调阈值补上,也还没有答案。原文说的是在预设阈值下非劣性未达成,阈值调低理论上能提高病灶敏感度,代价是误报变多,这个平衡点在哪里,需要新的研究。
参考来源
① Guenzel K, et al. Eur Radiol 2026, online ahead of print
② EAU-EANM-ESTRO-ESUR-ISUP-SIOG Guidelines on Prostate Cancer 2026
前列腺磁共振分类和穿刺决策,需要结合完整影像资料、PSA 变化和个人情况由医生判断。
AI 辅助整理,作者审核;内容仅供参考,具体诊疗请遵医嘱。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.