跳转至

第24章:基于人工智能的冠脉钙化评估(Artificial Intelligence-Based Evaluation of Coronary Calcium)

非增强胸部 CT 上的钙化评分

本章承接前文对冠脉钙化(CAC)评分在专用心脏 CT(CSCT)上的介绍,转而把视角放到临床上数量更为庞大的非增强胸部 CT 上。作者开门见山地指出,仅美国每年就采集超过 700 万次非增强胸部 CT,大约是专用 CSCT 扫描量的十倍;若再考虑未来可能推行低剂量 CT 肺癌筛查,又会额外增加 7–10 百万次扫描。此外还有放射治疗计划 CT 这类非诊断目的的扫描。它们的共同点是视野都覆盖心脏,从而具备对冠脉和主动脉进行钙化评分的潜力。因此美国心血管 CT 学会与胸科放射学会的指南已明确建议:在所有此类 CT 上对 CAC 进行定量并出具报告。

然而,把原本为 CSCT 设计的方法搬到非增强胸部 CT 上面临若干额外挑战:一是视野不聚焦于心脏,平面内分辨率较低;二是扫描通常不带 ECG 触发,心脏运动伪影更明显,钙化灶的形态也因此被进一步扰乱。尽管如此,CAC 评分在非心脏 CT 上仍然最常被应用于冠状动脉;由于缺乏对比增强和运动伪影,定位冠脉本身不可行,机器学习方法通常退而求其次,通过定义一个感兴趣区域(ROI)或者引入空间先验来缩小搜索范围。

González 等用机器学习分类器在三个正交方向上逐片判断心脏的存在,从而在心脏周围画出一个 bounding box,再在 box 内用规则方法识别 CAC 病灶。Išgum 等则不限制 ROI,而是利用冠脉钙化在冠脉树上有典型解剖位置这一先验:通过将扫描与一组带参考标注的扫描做图像配准,构建一张空间 CAC 概率图,并据此为候选钙化计算空间特征,结合形状、大小、表现和位置四类特征,再用多分类器组合来检测 CAC 病灶。这一方法虽在低剂量胸部 CT 上开发,但同样被迁移到心脏灌注 PET 的衰减校正 CT 和乳腺癌患者的放疗计划 CT 上,所得结果与参考评分之间的一致性良好。

视野大同样带来一个独特优势:可以同时量化心外动脉的钙化,例如胸主动脉、无名动脉、颈动脉等。Išgum 等提出用多图谱分割方法勾勒主动脉,再用两层串行 kNN 分类器对候选病灶做真假阳性筛选。Chellamuthu 等则用两层串行 CNN:第一层检测胸颈大血管中是否存在钙化并回归 bounding box 位置,第二层在 box 内对病灶做精确分割。两个团队都报告串行结构显著降低了假阳性。最近,Lessmann 等针对低剂量胸部 CT 提出了基于深度学习的钙化评分方法,使用两层串行 CNN:第一个 CNN 利用空洞卷积识别候选钙化体素并标注其空间归属,第二个 CNN 在这些候选中筛出真阳性。由于低剂量 CT 噪声较高,无法像传统 130 HU 阈值那样做区域生长,所以该方法直接在体素级别做出判定。

上述方法大多在图像采集参数较为统一的数据上开发和评估,作为监督学习方法,它们对采集参数和人群变化非常敏感,性能在跨协议、跨中心的扫描上常常出现明显下降,限制了临床可用性。为克服这一局限,van Velzen 等在大型多中心研究中系统评估了 Lessmann 团队所提深度学习方法的训练策略,纳入 CSCT、诊断胸部 CT、放疗计划 CT 以及心脏 PET 的衰减校正 CT;用所有类型 CT 联合训练后,在风险分层上与人工评分之间的线性加权 Cohen's κ 超过 0.9。这种"通用型"方法免去了为每种 CT 协议单独训练网络的麻烦,更适合临床铺开使用。

对比增强扫描中的钙化评分

在 CCTA 采集过程中,血管内会注入含碘对比剂,使冠脉树显影。CCTA 的核心诊断价值在于识别非钙化斑块以及评估冠脉狭窄的解剖学意义,但标准的钙化评分流程不能直接套用——冠脉腔内对比剂浓度通常超过临床常用的 130 HU 阈值。一种做法是采用更高阈值,比如 320 HU 或 600 HU。然而由于采集协议、扫描设备和对比剂种类不同,对所有被试沿用同一阈值往往不能得到最优结果。因此后续工作转向在标准化的解剖位置(如升主动脉或冠脉近段)自适应地确定阈值。

CCTA 上的自动 CAC 评分通常包含两个环节:先确定 CAC 提取阈值,再通过追踪冠脉(和主动脉)中心线定位这些血管,从而在中心线附近检测 CAC 病灶。Teßman 等从已定位血管的直方图中推导出阈值,再对血管树内所有体素统一应用。更复杂一些的方法则把 CAC 定义为相对于局部管腔强化值的偏离。Dey 等、Wesarg 等、Ahmed 等陆续在 CCTA 上提出了基于局部管腔参考值的 CAC 检测方法。Mittal 等则把机器学习方法引入这一任务:先提取冠脉中心线,再沿中心线用一组基于手工特征训练的随机森林分类器识别 CAC 病灶。

深度学习方法也被引入 CCTA 上的 CAC 评分。冠脉中心线在严重狭窄等病理条件下提取困难,因此 Wolterink 等绕开中心线,用深度学习方法在心脏周围画 bounding box,再用 4 对 2.5D/3D 串行 CNN 集成对 box 内所有体素做二分类;该方法与 CSCT 参考评分高度相关,风险分层一致性好。Zreik 等则先提取冠脉中心线,再用 CNN 与循环神经网络(RNN)组合沿中心线判断 CAC 是否存在;其方法只检测钙化存在与否,不做分割。Fischer 等沿用了 CNN+RNN 思路做 CAC 检测,准确率高,但同样未做分割,因此未能评估钙化定量。

推进标准的钙化评分流程

前面介绍的方法虽然路径不同,但都严格沿用临床工作流:先用强度阈值定义钙化、再做病灶分割、最后按 Agatston 公式出分。作者认为,通过改造这一工作流,可以把钙化评分带到一个新层次。其一,绕开显式病灶分割、直接回归 Agatston 分数,可让评分速度提升数个量级;其二,重新审视 CAC 的定义本身,可以提高量测的再现性。

直接预测冠脉钙化分数

针对 CSCT 和其他非增强胸部 CT 上的钙化评分,前述方法都遵循"先识别钙化、再量化"的人工流程。这一流程即使表现良好,也伴随着显著的计算开销。因此,de Vos 等和 Cano-Espinoza 等提出了绕开病灶分割、直接由 CT 图像回归 Agatston 分数的方法。与分类任务输出离散标签不同,这类方法的输出是一个连续的钙化分数。Cano-Espinoza 等先用目标检测方法在心脏周围画 bounding box,再用一个 3D CNN 对整个心脏体素块做分数回归;该方法在 14% 的图像上因心脏检测失败而无法完成后续分析。de Vos 等则用基于 CSCT 扫描构建的图谱做配准来定义 ROI,但传统配准在计算上十分昂贵,与"直接评分"追求速度的初衷相悖。因此他们转而使用一个可在 1 秒内完成 3D 体数据配准的深度学习配准框架,配准完成后用 2D CNN 逐片回归 ROI 内的 Agatston 分数。这种逐片计算的方式在形式上模拟了临床 Agatston 分数沿 2D 轴位片计算的传统。de Vos 等的方法在风险分层精度上与既有的心脏和胸部 CT 钙化评分方法相当或更优,但速度要快数百倍。

改善再现性

冠脉钙化评分是 CVD 风险分层的成熟、有效方法,但其跨扫描的再现性并不理想:即便在专为 CAC 评分优化的 CSCT 上,Agatston 分数的扫描间差异也被报告为 15%–41%;在非心脏 CT(无 ECG 触发、平面内分辨率更低)上,差异可达 71%,并导致 24% 的被试在风险分层上出现不一致。

在非心脏 CT 上,分辨率不足使部分容积效应在 CAC 定量中扮演关键角色:它把小的钙化"模糊"到阈值以下,造成漏分割和钙化量被低估。另一个原因是心脏运动——在非心脏 CT 上,扫描通常不带 ECG 触发,剧烈的心动周期伪影可能使病灶模糊甚至完全不可见。

为提高扫描间一致性,研究者尝试了多种思路。最早的一类做法是放弃固定的 130 HU 阈值,改为病灶特异的自适应阈值。Groen 等在非 ECG 触发的 CT 上根据每个 CAC 病灶的最大强度确定阈值。Song 等则反其道而行之,在专用 CSCT 上基于病灶周围背景的强度做阈值调整。Saur 等在 CSCT 上用基于网格的算法,根据强度曲线精修 CAC 病灶边界。然而当病灶较小或受心脏运动影响较大时,强度往往达不到平台值,边界模型难以建立,限制了在非 ECG 触发协议下的表现。Šprem 等与 Dehmeshki 等的工作针对非 ECG 触发协议,考虑到由于空间分辨率有限和心脏运动,病灶体素往往是 CAC 与其他组织的混合,于是用期望最大化算法估计每个体素内的部分钙含量,再据此校正病灶体积。

部分容积校正方法的开发与评估一直面临一个根本困难:患者身上真正的钙含量无法无创测得,因此也不存在 ground truth。现有方法大多使用体模或尸检数据进行开发,这对需要大规模训练集的 AI 方法而言是一道障碍。截至文献撰写时,只有少数方法被证实在患者数据上迁移良好。

重新审视动脉钙化的临床定义

如上一节所述,强度阈值法是导致钙化定量扫描间再现性差的重要原因,在非 ECG 触发的 CT 上尤其受到部分容积效应和心脏运动伪影的双重影响。van Velzen 等提出了一种抛弃传统 CAC 定义的方法:不再以强度阈值界定病灶,而是把"含有 CAC 的图像"与"对应的不含 CAC 的图像"之差作为病灶。然而,同一患者同一时点"一张含 CAC、一张不含 CAC"的成对扫描并不存在,因此他们使用 CycleGAN 做图像合成,从含 CAC 的图像生成对应的不含 CAC 图像。训练时只需要"该层是否含 CAC"的切片级标签,CycleGAN 学习在含/不含两个域之间互译。通过这种设定,模型得以避开阈值化的检测与分割,转而在更高层次的抽象上自行决定哪些体素属于 CAC。这让那些部分或全部落在阈值以下、又被部分容积效应和运动伪影模糊的病灶得以被定量。该方法得到的扫描间相对差异显著低于标准人工评分,有望带来更稳健的 CVD 风险预测。

未来方向与结论

人工智能研究的近期进展一度引发"未来放射科医生将被高级计算机算法取代"的预测。作者认为这一未来或许仍然遥远,但 AI 驱动的自动图像分析会更快地以辅助工具的形式进入临床,扮演"第二双眼睛"或从繁重任务中解放阅片人的角色。

由于人工钙化评分耗时费力,过去已开发了大量 AI 方法以实现自动化。然而这些方法大多基于单中心、存在选择偏倚、且常常排除低质量扫描的数据集上进行训练和评估。要走向常规临床,软件工具必须对采集参数和人群差异具备鲁棒性,因此最理想的情况是有大型、多样化、结构良好且带标注的数据集供新方法开发和既有方法验证。医疗数据共享在法律层面往往受限,收集用于多中心评估的大规模数据因而困难。这凸显了图像分析挑战赛在方法性能基准评测上的价值——orCaScore 挑战赛正是在这一背景下为 CSCT 上多种自动钙化评分方法提供了多中心、多厂商数据下的统一评测。此外,也有若干方法被证实在与其训练数据不同人群或协议的 CT 上依然适用,展示了宽广的临床应用潜力。

在 CSCT 上,CAC 评分对专家而言是相对容易的任务,阅片者间一致性很高;在非 ECG 同步的 CT 上,由于噪声、低分辨率和运动伪影等因素,阅片者间差异通常较大。自动方法在两类扫描上呈现出同样的性能梯度:orCaScore 挑战赛证明 CSCT 上的自动方法能紧密跟随专家表现,而面向其他显示心脏的 CT 协议时,方法常因图像伪影和低分辨率而表现下降;不过即使在这些情况下,方法性能也已接近阅片者间一致性的水平。

在训练策略上,AI 钙化评分方法呈现明显代际差异。早期的机器学习方法通常在病灶级别标签上训练分类器;后续方法转向在体素级别标签上做分类。两种方式都需要大量人工准备参考标准,但都提供了较强的监督信号,在性能上往往优于其他训练策略。直接回归 Agatston 分数的方法使用切片级 Agatston 分数作为标签,监督粒度比体素/病灶级更粗,但生成参考标签前仍需手工分割 CAC,速度优势才是其主要卖点。还有一种使用切片级"是否含 CAC"标签的方法,跳开了临床 CAC 定义,标注成本显著低于病灶分割,模型被训练成从"是否含 CAC"这一信息中自行推出"哪些体素是 CAC"。

在临床可接受性方面,方法的可解释性是关键。大多数钙化评分方法都会输出一张逐体素的分割图,再据此做进一步量化;算法或网络的内部机制虽然不透明,但分割图本身的形态可直接用于评估结果的合理性。直接评分方法只输出 Agatston 分数,黑箱程度更高。de Vos 等为这一问题设计了一个可选的决策反馈机制,可视化图像中对最终分数贡献最大的区域;此外,多种 CNN 可视化技术(如 Zeiler & Fergus 的反卷积、Grad-CAM 等)也被提出用于增进 CNN 决策的可解释性。

既然钙化评分的终极目标是得出 CVD 风险,未来研究的一个方向是直接从 CT 扫描预测 CVD 风险。硬终点(如 CVD 事件、CVD 死亡率)由严格的临床方案和定义给出,参考标准本身受到的阅片者间差异较小,具备很强的可靠性。尽管潜力明显,这一方向目前仍处于早期,困难既来自问题本身,也来自数据规模。已有方法大多采用两步法:先用一组特征描述图像,再训练分类器按临床结局分类,但第一步并未与最终预测目标直接耦合。结合临床患者数据做多任务学习,或引入更高级的增强技术,可能让小数据集下的端到端训练成为可能。

在精准医疗时代,量化疾病相关参数以提供患者整体生理状态的完整画像变得越来越重要。要从 CT 扫描蕴含的海量信息中量化所有相关参数,人工成本高昂,AI 方法有望加速这一过程。覆盖钙化分数在内的一组 CVD 参数,有望把个性化医疗实践提升到一个新水平。在拥抱 AI 进入 CVD 风险预测的同时,临床医生不应忽视细致评估本身的价值。

本章个人批注

这一章的定位很清晰:ch23 在 NLP 上做了一篇较窄但深的方法学综述,ch24 则把笔锋拉回到 CV 影像中量化任务的一个具体子方向——冠脉钙化评分。整章的主线是"AI 改造工作流",从"在多种非增强 CT 上自动评分"到"在 CCTA 上避开对比剂干扰的自动评分",再到"绕开病灶分割直接回归 Agatston 分数"以及"用 CycleGAN 重新定义 CAC"。这四步的逻辑是逐步把临床工作流中"先检测、再分割、再量化"这一标准链路替换或重组,本质上是把"AI 自动化"从"模仿人"推进到"用更合适的任务定义超越人"。

我特别留意到作者对再现性问题着墨很多。冠脉钙化评分的核心痛点其实是 Agatston 分数在扫描间的高变异性,而不是病灶有没有检出。所以这一章里我能看到三种截然不同的修补思路:调整阈值(Groen/Song)、用 EM 做部分容积校正(Šprem/Dehmeshki)、以及用 CycleGAN 把整个阈值化的"病灶定义"废掉(van Velzen 本团队)。第三种思路最有意思——它实际是在说"既然部分容积效应和运动伪影让阈值法在物理上就站不住脚,那我们干脆不基于强度定义 CAC,而基于'有/无'的语义差定义"。这是一次对临床定义本身的反思,而不只是在算法层修修补补。

章末几节的语气明显从"技术综述"过渡到"学科展望"。作者反复强调"软件工具需要对采集参数和人群变化具备鲁棒性"、"需要大规模多样化数据集"、"多中心挑战赛对基准评测至关重要"——这三句话其实是同一个问题的三个侧面:AI 钙化评分要真正走出 demo 走进放射科,缺的是泛化性,而泛化性的根源是数据。这与 ch22 里"指南制定流程需要 AI 方法学"在动机上是同构的。

另一个值得记一笔的点是关于"可解释性"的论述。作者坦言"分割图本身就是一种可解释性"——这一点是 CV 影像 AI 与 NLP AI 一个有趣的差别:分割任务天然有像素级输出来佐证结果,而 NLP 任务里对"为什么"的可解释性需求要更复杂、更难满足。也正因为如此,作者认为直接回归 Agatston 分数的方法在临床落地时需要补一个反馈可视化层。

最后想提一处不算问题但值得注意的细节:本章在 orCaScore 挑战赛一节引用的"orCaScore"框架与 ch21("Currently Available AI Softwares")中描述的几个商用 CAC 评分软件的研究背景可能有重叠,但本章并未对商用产品做介绍,所以前后读起来是技术原理与商业落地两条平行线。

与上下章的衔接(一段话)

ch23 把视线从影像本身移开,进入 NLP 在心血管应用中的方法学与任务谱系,ch24 立刻又把视线拉回到最经典的 CV 影像任务——冠脉钙化评分。这种"从语言到像素"的切换其实是这本书编辑结构上的一个特色:方法学章节(ch22/ch23)与具体应用章节(ch24 起的钙化、斑块、狭窄等)形成"原理 → 任务"的两层结构。ch24 在钙化这一任务上做了一次系统梳理:先讲非增强 CT 上的多种协议扩展,再讲 CCTA 上避开对比剂干扰的适配,然后从"沿用临床流程"过渡到"改造临床流程"(直接预测分数、重新定义 CAC),最后回到学科层面的展望。下一章 ch25(Artificial Intelligence-Based Evaluation of Coronary Atherosclerotic Plaques)会把焦点从"钙化评分"扩展到"斑块整体"——从钙化灶的检测与定量,扩展到非钙化斑块、混合斑块以及斑块对管腔狭窄的影响。这样就自然从"有没有钙、有多少钙"过渡到"斑块是什么、堵了没有、风险多高"——ch24 是 ch25 的前置地基。