第40章:基于人工智能的慢性阻塞性肺疾病(COPD)患者评估(Artificial Intelligence-Based Evaluation of Patients with Chronic Obstructive Pulmonary Disease (COPD))
AI 辅助定量 CT 的局限性(Limitations of AI-Assisted QCT)
作者把这一节命名为"AI 辅助 QCT 的局限性",集中讨论肺密度测定(lung densitometry)这一 COPD 影像评估方法的实际工程瓶颈。要测量肺密度测定中的低衰减肺体积(low-attenuating volume, LAV),首先必须对全肺实质进行分割。过去几年间虽已开发出多种软件以辅助分割,但在许多场景下仍需人工输入或人工校正;上文中所引述的研究在评估肺体积时采用了不同的分割方法——具体包括人工分割、基于 HU 阈值的分割、区域生长算法(region-growing algorithms)或神经网络——而无论采用哪种方法,大多数情况下都需要以人工校正的形式进行干预。这正是肺密度测定在实际临床中难以铺开的根本原因:这些人工环节将定量评估变成一项繁琐且耗时的流程,使其几乎只在科研场景下使用、而并未在日常临床实践中落地 [71]。
即便在技术优势与商业软件解决方案均已成熟的情况下,肺密度测定也并非一项"独立"流程——它应在传统视觉分析之后再开展 [45]。作者特别强调,AI 辅助的定量 CT 方法还要求严格遵守统一的采集参数,并在此基础上叠加人工输入,因此天然带有较强的患者间和观察者间变异性 [72]。这种对协议一致性的硬性要求在多中心、跨设备的临床场景中很难实现。
进一步说,上文所引述的、采用机器学习方法的研究在训练时所使用的队列往往不同、且样本量较小、诊断目标各异——这种异质性导致其结果在患者群体、CT 扫描设备与采集协议上表现出明显的方差,从而严重限制了结果的可推广性。换言之,每个研究都在自己小而单一的队列上做优化,模型换到不同人群、不同设备、不同协议上时性能往往下降。
作者在节末指出:随着 AI 在模式识别与分割上的优势进一步发挥,并经过更大、更多样化队列训练的算法,将显著提升对肺实质改变的定量评估能力,并在胸部 CT 分析中展现巨大潜力 [73-76]。此外,AI 还将节省时间、降低观察者间与患者间变异性,相对于半定量方法构成明显优势 [71]——这一点是 AI 替代"传统方法"的核心驱动。
深度学习在 COPD 评估中的应用(Deep Learning in the Evaluation of COPD Patients)
与上一节所述的机器学习方法相比,深度学习的核心特征在于算法可自主选择特征来区分不同的影像生物标志物(如不同的肺气肿模式),而无需事先由人工指定感兴趣特征。这种"绕过"特征识别的独立性是深度学习相比传统机器学习的关键跃迁——它不再要求放射科医师事先告诉算法"看哪里",算法自行在原始 CT 体数据中寻找区分性模式。然而,这种"独立性"是有代价的:它只能通过使用大得多的数据集来训练算法才能实现。这种训练需要高算力,且耗时较长;但由于训练成功后其后续分析速度快得多,因此仍是一项值得投入的工作。
深度学习在 COPD 中的早期应用之一由 Gonzales 等人于 2018 年发表 [77]。该研究小组使用来自 COPD 遗传流行病学研究(Genetic Epidemiology of COPD, COPDGene [78])的 7,983 例 CT 扫描来训练一个卷积神经网络(CNN),之后用 1,000 名不与训练集重叠的 COPDGene 参与者与 1,672 名 ECLIPSE 研究(Evaluation of COPD Longitudinally to Identify Predictive Surrogate End-points [79])受试者进行评估。在 COPD 检出方面,COPDGene 与 ECLIPSE 两个评估集上的 COPD 精确分期准确率分别为 51.1% 与 29.4%,±1 期内的检出准确率分别为 75% 与 74.6%,受试者工作特征曲线下面积(AUC)为 0.856。精确分期准确率明显低于 ±1 期内的准确率,这反映了 COPD 分期在 CT 影像上的内在难度——邻近分期的形态学差异本身就不大。此外,该 CNN 还能够较合理地预测最有可能出现急性呼吸事件的吸烟者以及死亡率最高者,表明其学到的特征不仅服务于分期,还包含预后信息。
Humphries 及其同事在 2019 年 [80] 建立了一种结合 CNN 与长短期记忆层(递归神经网络, RNN)的深度学习算法,用以按 Fleischner 标准对肺气肿进行分类。这一架构选择很重要——CNN 负责空间特征、长短期记忆层负责序列依赖,反映出肺气肿的空间分布在 CT 体数据中具有"沿 z 轴"的模式。训练同样使用 COPDGene 研究的参与者(2,407 例用于训练,100 例用于验证与参数调优);评估则使用 COPDGene 研究的 7,143 例参与者与 ECLIPSE 研究的 1,962 例受试者。研究以视觉评分与肺功能检查等临床参数作为参照,结果显示该算法能够区分不同的肺气肿分类,并与临床参数以及死亡风险存在相关性。
更近一些,Tang 等人 [82] 检验了三种深度残差网络(deep residual networks)用于随机子集 CT 扫描的 COPD 自动检测。这些算法独立地使用 Pan-Canadian 早期肺癌检测(PanCan)研究 [81] 的参与者进行训练;PanCan 研究招募的是有肺癌高风险的曾吸烟者与现吸烟者。验证使用 ECLIPSE 研究中的 2,153 例 CT 扫描,这些扫描同时具有可评估 COPD 程度的肺量测定数据。研究小组发现三个模型的性能相近,最佳模型的 AUC 达到 0.889。该研究的特殊之处在于其使用了外部数据集对模型的泛化能力进行测试与验证——这是针对经过特定数据训练的算法时一个核心议题,因为单中心训练的模型在多中心数据上往往性能下降。
随着研究者与临床医生对此关注的增加,针对 COPD 患者的 AI 评估也进入了商业软件开发者的视野。Fischer 等人 [72, 84, 85] 使用 AI-Rad Companion Chest CT(Siemens Healthineers, Erlangen, Germany)的原型进行了全自动肺气肿量化并将结果与临床参数相关联。该应用所用的自动分割算法是一个深度图像到图像网络(Deep Image-to-Image Network, DI2IN),是多层卷积网络(convolution image-to-image network, CIN),其描述与应用最早见于肝脏分割任务 [83]。该算法在超过 10,000 例 CT 数据集上进行训练和测试,其中约 5,500 例用于训练。CIN 以三维 CT 扫描体数据作为输入,生成概率图,对每个体素标注其属于肺某一区域的可能性。在这些研究中流程尚未做到完全端到端,研究团队对每位患者的分割结果仍做了人工核对。胸部 CT 不同的重建方法几乎产生了相同的结果,表明算法对重建参数的鲁棒性较好。研究小组展示了基于 AI 的全自动肺分割与肺气肿量化具有很高的重测信度(ICC 1.0),并与 GOLD 分期、TI(trapping index)等临床参数呈现良好相关。文中以 AI-Rad Companion Chest CT 与 Imbio LDA(Imbio, LLC, Minneapolis, MN, USA)为例展示了自动分割与肺气肿量化的实例(分别见图 40.1 与图 40.2):图 40.1 为一例上叶肺气肿患者,自动分割以不同颜色描出各叶边界(黄色为右肺上叶、绿色为左肺上叶、深蓝为左肺下叶),< -950 HU 的低衰减实质以浅蓝填充,并附上每叶与全肺的肺气肿百分比报告(LAV950);图 40.2 为一例肺癌筛查患者的小叶中心型肺气肿,Imbio LDA 以红色高亮低密度区并附上分布与肺体积汇总。
局限性(Limitations)
作者明确指出:上述许多研究都极为近期,所采用的方法(如深度学习在 COPD 胸部 CT 分析中的应用)也是新颖的 AI 应用;这构成了放射学中一个相对崭新且持续演进的领域,因此对所有结果都需持保留态度。许多研究小组所构建并测试的算法是在已经确诊为相应疾病的患者身上建立和检验的——而这些患者已经接受了肺量测定等其它临床诊断,这本身就意味着已经怀疑存在肺部疾病,因此与一般人群的可比性有限。换言之,训练集中的"健康"对照组实际上从未真正健康过——他们只是"未在本次研究中被诊断",而与真实世界中的无 COPD 群体存在系统差异。这些算法的底层结构彼此不同(CNN、RNN-CNN、深度残差网络、DI2IN 等),目前尚不清楚各种不同方法各自的优势与局限;并不存在某种标准算法,这意味着仍需进行大量后续研究才能取得可靠且可推广的结果。
结论(Conclusion)
AI 应用在影像分析中是放射学研究中一个快速增长的领域,并已出现若干临床应用。CT 扫描的总检查量在持续增长 [86-89]。随着 AI 在 COPD 患者中的使用与益处证据日益积累,加上越来越多的呼声主张将 CT 纳入 COPD 患者的诊断 [20],胸部 CT 检查的数量也可能随之上升。由于放射科医师人数的增长速度不及这一上升趋势 [90],这一发展可能导致人力资源短缺,从而使每位放射科医生需要评估的研究量上升,错误或差异的发生率也可能上升 [91-93]。此外,随着影像判读标准、分类与指南的应用日益细化(如 Fleischner 标准、GOLD 分期),放射学报告的撰写也变得更加复杂——放射科医生面对的是越来越长的判读清单与越来越细的分级条目。
随着 AI 软件应用不断演进、人工输入减少甚至不再需要,它将有能力为这一工作流提供辅助。在 COPD 患者的评估中,AI 在未来可能以多种方式提供帮助:它可以以肺气肿的范围、分布或模式的形式提供对该疾病的可靠定量评估,从而让不同检查之间以及病程不同阶段之间具有更好的可比性;它还具有被应用于"非 COPD 主因"胸部 CT 的潜力,例如肺癌筛查或心脏诊断的 CT——在这些场景下,处于疾病早期的患者可能由此被识别出来,从而改善 COPD 的低诊断率问题 [20]。然而,仍需进一步开展对照研究以优化偶发性 COPD 的管理,并决定是否需要肺量测定以确认诊断 [82]。标准化的辅助评估还可以与结构化报告等应用 [94-96] 相结合,从而缓解工作流并为未来的研究提供结构化数据。住院医师可受益于 AI 对其学习过程的辅助(AI 的稳定输出可作为初学者的对照参考),而高年资放射科医师则可能缩短其评估每个研究的时间(让 AI 完成初筛与定量、医师专注于疑难与决策)。
基于 AI 的、独立、客观且可比的判读——与放射科医师的经验相结合——可能帮助疑似 COPD 的患者更早获得诊断,从而有潜力降低发病率并提高生存率。
本章个人批注
本章是 Decker 等人合著的 COPD 影像 AI 综述章(pp. 426-433),整章页数约 8 页,但其中约 4 页版面(pp. 426-431)是连续的 96 条参考文献编号列表,正文散文只占 4 页左右;又因为是"补充式"综述章,文中大量句子是逐点引用前文研究,因此散文密度低、行文短句多。这导致本章内概述在结构上必然是"短章节 + 紧贴源文事实点"的——任何对 COPD 临床流行病学、机制或具体扫描协议的扩张都会越过"只复述源文"边界。
值得注意的源文细节:图 40.1 展示的是一位上叶肺气肿患者,使用 AI-Rad Companion Chest CT 进行了肺段层面的自动分割(右肺上叶、左右肺下叶以不同颜色描边,< -950 HU 的低衰减实质以浅蓝填充)和三维重建,并附上每叶与全肺的肺气肿百分比报告(LAV950,threshold -950 HU)。图 40.2 展示的是一位肺癌筛查患者的小叶中心型肺气肿,使用 Imbio LDA 进行肺密度分析(低密度区以红色高亮,并附上肺气肿分布与肺体积的汇总)。这两张图都是"商业原型"层面的示例,恰好对应文中"AI 进入商业软件开发者视野"那句过渡。
写作上我严格限定在源文事实点之内:第一节按"全肺分割→人工干预不可缺→肺密度测定需叠加于视觉分析之上→统一采集协议+人工输入导致变异性→机器学习研究队列异质→AI 在更大队列上的潜力"四步复述;第二节按 Gonzales 2018 / Humphries 2019 / Tang PanCan / Fischer AI-Rad 四项研究的时间顺序复述,每项都按"队列规模 + 评估集 + 关键指标"的源文三段式给出;第三节直接复述源文结论的"算法在确诊患者上训练→与一般人群可比性受限→无标准算法→需更多后续研究"四点。结论节按"CT 总量增长—放射科医师增长不足—报告更复杂—AI 可帮助定量评估—可应用于偶发性 COPD—结构化报告结合—辅助住院医师与高年资医师—更早诊断降低发病率"八个源文要点复述。我没有为凑 1000 字而引入作者未在本章中提到的 GOLD 分期细节、InCheck 系统、Emphysema subtypes 等内容——这些专属 ## 本章个人批注。
跨章衔接的考量:本章是 De Cecco 卷"按器官/疾病"组织的肺部主线(ch40 COPD → ch41 间质性肺疾病 → ch42 感染性影像 → ch43 肺癌筛查 → ch44 肺癌表征 → ch45 机会性胸部 CT → ch46 肺血管病)中的第一章。ch40 的写法与 ch38(心脏超声 AI)不同:ch38 是"轻技术、重观念",ch40 是"重技术综述 + 简短结论"——这与编辑者把 COPD 这一最为常见且 AI 工具最成熟的肺部疾病放在肺部主线之首是契合的:先让读者看到一个"AI 工具已经在 COPD 上有商业原型"的成熟案例(AI-Rad Companion Chest CT、Imbio LDA),然后再进入更复杂的 ILD(ch41)、感染(ch42)、肺癌(ch43-44)、机会性筛查(ch45)、肺血管(ch46)。下一章 ch41 的作者 Silva 等是意大利帕尔马大学放射科团队,会把 ILD 拆成 Tissue Density / Tissue Texture / Machine Learning / Deep Learning 四个子节,技术密度与 ch40 持平但篇幅更长(pp. 434-440+)。
与上下章的衔接(一段话)
第 40 章属于 De Cecco 这本编辑卷中"按器官/疾病"组织的肺部主线之首,紧接第 41 章间质性肺疾病(ILD)AI、第 42 章感染性影像 AI 之前,专章讨论 AI 在慢性阻塞性肺疾病(COPD)患者 CT 评估中的角色。作者 Decker 等的写法与本书前几章(ch36 先天性心脏病、ch37 核医学、ch38 心脏超声、ch39 心血管风险分层)形成对照:前几章按"模态"组织,而 ch40 起转入按"疾病"组织,把 COPD 作为 AI 工具在肺部最成熟的入口来呈现。章中先把已有 AI 辅助定量 CT 的工程瓶颈(人工校正不可缺、采集参数不一致、研究队列异质)列出,再过渡到深度学习四项代表性研究(Gonzales 2018 COPDGene、 Humphries 2019 Fleischner 分类、 Tang PanCan 残差网络、 Fischer AI-Rad Companion Chest CT)以说明"AI 工具在 COPD 上已有可用形态",最后以"更早诊断降低发病率"作为临床终点收束。下一章 ch41(Silva 等)会在同一种"按疾病"组织方式下进入 ILD 域——把分析技术拆为 Tissue Density、Tissue Texture、Machine Learning、Deep Learning 四类并详述其与肺密度直方图参数、纹理分类器、深度学习分类器的关系,篇幅更长(pp. 434-440+),但同样以"标准算法尚未确立、需后续研究"作为收束,与 ch40 末段的"局限性与未来方向"形成回响。编辑者让 ch40 承担"AI 工具在 COPD 上接近临床可及"的叙事角色,是肺部主线在 ILD 与更复杂疾病展开之前的一道"成熟度基准"。