跳转至

第37章:心脏核医学:人工智能的角色(Cardiac Nuclear Medicine: The Role of Artificial Intelligence)

图像重定向与重切片(Image Reorientation and Reslicing)

心脏核医学图像的处理与可视化以标准心脏方位为主——短轴(SA)以及水平、垂直长轴(图 37.2a)。把横断面图像重定向到标准切面曾是 1990 年代众多研究的主题,目前所有临床软件都内置了自动重定向算法。Germano 等 [35] 的方法先用阈值操作结合基于规则的位置/形状/尺寸准则识别左心室(LV),再提取心肌中层轮廓并拟合成二次曲面作细化;最终 LV 长轴对应所得三维椭球的长轴并用于重切片。该方法在 400 例中正确重定向 394 例(98.5% 成功率)。Mullick 等 [36] 同样从基于图像强度直方图的阈值出发,再用一系列启发式规则细化选取,建立 LV 二值掩模并提取三维表面模型;以表面三维法向量的内向延伸拟合出 LV 长轴直线,该方法在 124 例正常与异常受试者中成功 116 例(93.5%)。Slomka 等 [37] 采用另一思路:先建立已知 LV 朝向的男女模板图像,把每个新数据集配准并缩放到模板,以最小化两幅图像绝对差之和;48 例经视觉评估从未失败。

图像分割(Image Segmentation)

完成重切片后,准确的 LV 分割对心肌灌注的可靠评估至关重要。核素心脏影像学对这一图像处理任务的自动化研究可追溯到 1990 年代 [7-9, 34]。在识别出 LV 腔中心与基底、顶端切片后,自动三维采样程序从每个 SA 切片提取最大计数轮廓——采样方案依方法而异,可为椭球形 [10, 13] 或混合设计 [11]。这些三维灌注分布最终被映射到标准模板,即把计数轮廓映射成同心环的二维极坐标图(polar map)[7]。已有大量论文测试并验证了这些方法。

近年技术进步进一步提升了 LV 分割的稳健性。已开发出一种质控算法来评估自动得到的轮廓并检出分割失败 [38]——通过两个错误标志检查 LV 形状与二尖瓣位置,并在与专家读片者对比中显著减少了对人监督的需要。机器学习(ML)技术最近被用于一项从 SPECT 图像自动识别瓣膜平面(VP)的算法 [39]:研究人员构建了 22 个与 VP 位置、形状、强度及门控采集相关的高级图像特征,输入到一个基于支持向量机(SVM)的算法中,能高效整合专家知识与 VP 解剖变异;用冠脉 CT 造影验证 VP 位置,以总灌注缺损(TPD)评估模型的诊断准确性,该全自动方法的诊断性能等同于经验读片者修正后的结果。另一团队利用深度学习(DL)的潜力,开发了一个从门控 SPECT 图像勾勒 LV 心外膜与心内膜轮廓的模型 [40],端到端的全卷积神经网络(CNN)以临床医师勾勒的 LV 轮廓为训练数据;56 例初步结果显示 LV 心肌体积评估精度优异,误差为 1.09 ± 3.66%。图 37.3 展示了一个正常与一个异常病例应用该方法的结果。

图像解读与结局预测(Image Interpretation and Outcome Prediction)

基于影像的诊断与结局预测领域,可能是自 ML 与 DL 技术带来最新技术与方法学进展以来核素心脏学进步最大的板块。在用 AI 方法早期进行冠脉疾病(CAD)研究时 [41-47],人工神经网络(ANN)就被用来判断是否存在缺血、缺血程度以及哪支冠脉可能存在狭窄——以心肌灌注数据样本作为输入,对应侵入性冠脉造影(ICA)结果作为输出。本节展示的工作则提供了更复杂方法能整合来自大量受试者的众多异质变量并产出强大诊断工具与预测模型的证据。Arsanjani 等 [48] 提出了一种全自动算法计算 TPD,与目前临床推荐标准的专家读片视觉评估做比较,并在 665 例接受 SPECT 心肌灌注成像(MPI)的患者上以血管造影结果做验证:自动分析的整体准确性在按患者层面与专家读片相当,而在按血管分析识别 ≥70% 病变时则优于视觉评估。作者随后使用 SVM 技术采用完全 ML 方法 [49] 把若干定量变量组合起来,从 957 例 SPECT 研究中检测 CAD,算法整合了灌注与功能指标——TPD、静息与负荷之间的缺血变化和射血分数(EF)变化以及局部 LV 壁运动与增厚评分,诊断准确性与两位专家读片者对比,并以 ICA 结果验证。各项定量指标曾被广泛用于评估 CAD,但将它们整合一直困难。该研究显示 SVM 技术诊断准确性 ROC AUC 为 0.92,而两位读片者分别为 0.88 和 0.87。在后续研究 [50] 中纳入 1181 例静息/负荷 SPECT 研究,作者展示了当定量灌注指标与临床变量结合时 ML 带来的额外改善:ML 结果再次与专家读片者对比,AUC 为 0.94 对 0.89(p < 0.001)。鉴于众多异质变量的整合具有挑战性,且 MPI 解读很大程度依赖读片者经验,这种自动评估的纳入有望在未来为放射科医师——尤其在经验较少的中心——提供基本支持。提高诊断准确性的最终目标是结局预测,对 CAD 而言是识别出哪些受试者将受益于早期干预。Arsanjani 等 [51] 旨在研究能否通过将临床数据与 SPECT MPI 衍生的定量特征相结合有效预测早期血运重建:从 33 项指标与变量集合中以自动特征选择算法提取相关参数,分析了 713 例静息/负荷研究共 372 例血运重建事件,ML 模型性能与两位读片者比较;预测血运重建时 ML 算法的灵敏度与一位有经验读片者相当、高于第二位但与单一灌注测量相当,特异性优于两位读片者但与 TPD 类似。在一项多中心研究中,Hu 等 [52] 也使用 ML 算法从 SPECT MPI 预测 90 天内按血管的早期血运重建,模型使用 18 个临床变量、9 个负荷试验变量以及额外 28 个影像特征,从 1980 例患者共 5590 支血管观察中得出;ML 方法 AUC 在按患者和按血管层面均优于当前定量方法与专家解读。预测血运重建是 CAD 评估中的一个重要临床需求,因为不少已安排做侵入性造影的患者最终并无阻塞性病变。

DL 技术同样被广泛用于 CAD 诊断与预后研究,算法可独立识别模式。Betancur 等 [53] 首次描述了其使用——一个深度 CNN 被建模来直接解读灌注极坐标图并识别阻塞性疾病,图 37.4 展示了算法原理。该模型用 1638 例患者的数据库实现,并与 TPD 定量评估做对比:仅使用影像数据作为输入时,按血管的灵敏度从 64.4%(TPD)提升到 69.8%(CNN)。该技术进一步开发以纳入立位与仰卧位数据 [54]——这是一种常规用于在某些固态相机上减轻衰减伪影的采集方式。DL 算法在极坐标图、低灌注缺损与低灌注严重度上训练,并以类似方式评估检测阻塞性 CAD;与联合定量评估相比,DL 模型在按患者与按血管预测疾病时均显示 AUC 提升,灵敏度与特异性均改善。同一团队还开发了 ML 模型用于风险分层与主要不良心血管事件(MACE)预测 [55],结合了 2619 例 SPECT 的临床数据与影像特征;ML 与专家视觉解读、自动负荷 TPD、自动缺血 TPD 相比,AUC 分别为 0.81 对 0.65 对 0.73 对 0.71(p < 0.01)。这些模型与研究在输入数据与特征选择方面可能显得复杂;在 Juarez-Orozco 等 [56] 的近期工作中,一个 ML 算法由易于获取的临床与功能变量开发而来,用于通过定量 PET 灌注——即 PET 衍生的心肌血流储备(MFR)< 2.0——检测心肌缺血。模型在 1234 例患者数据库上实现并测试,性能与同变量的简单 logistic 回归模型比较:ML 的 AUC 为 0.72,而传统回归方法为 0.67。在另一项提供更简易方法的努力中,Alonso 等 [57] 通过从 122 个潜在特征中选取子集,基于 SPECT MPI 与临床数据用多个 ML 模型估计患者的心源性死亡风险,模型在 8321 例患者上训练与测试并与标准回归技术比较;作者识别出一个使用 6 个特征、AUC 为 0.77 的模型,优于使用多达 14 个特征的更复杂回归模型。

图像精度与采集效率(Image Accuracy and Efficiency)

随着 AI 技术进入心脏医学影像,它主要被用于图像处理、诊断与风险分层。但核素影像中其他同样重要的领域——如剂量降低与图像重建技术——预期也将经历新的、有临床价值的发展 [58]。Shiri 等 [59] 最近提出了一种 CNN 方法,旨在通过把每个投影的采集时间减半或把角向投影数减半来降低 SPECT MPI 的采集时间,从而降低辐射剂量。从 363 例患者的列表模式采集数据中为每位患者生成 4 组投影:全时间(FT)20 秒/投影、半时间(HT)10 秒/投影、全投影(FP)32 个投影、半投影(HP)16 个;卷积网络执行图像到图像转换以从 HT 预测 FT、从 HP 预测 FP。其结果虽然初步,但显示 HT 投影预测得到的图像质量优于 HP 预测。其他可行性研究 [60, 61] 通过开发优于传统图像处理技术的基于 DL 的图像去噪方法,探讨了低剂量成像的适用性。Ramon 等 [60] 使用有监督 DL 方法,通过全剂量与低剂量图像配对去除低剂量采集典型的高图像噪声,研究纳入 1052 例 SPECT MPI 数据集并测试了两种常用重建技术(FBP 与 OSEM):结果显示 DL 方法在显著改善降噪的同时提升了诊断准确性。图 37.5 展示了在灌注缺损存在时该技术随注射剂量逐步降低的结果。

几十年来作为降低有效辐射暴露高达 60% 并取消不必要检查的方案,单纯负荷(stress-only)方案一直被提出,但严重未被充分利用。最近一项基于 ML 的算法 [62] 被提出用于基于单纯负荷 MPI 与临床数据进行风险预测,以筛选可受益于取消静息检查的低风险患者。研究纳入 20414 例受试者共 98 个特征,训练与测试以提供作为未来事件连续概率的 MACE 风险——表示为 ML 评分;通过匹配医师解读与两项临床指南所达到的取消率,得出 ML 评分三个不同阈值,比较不同方法下被选中取消静息检查患者的年度 MACE 率。ML 引导的取消推荐所选出的患者 MACE 率低于基于医师解读或临床指南选出的患者。图 37.6 显示了 ML 引导推荐的两例以及各特征对 ML 评分贡献的排序。

核素心脏影像中另一个根据初步研究预期将从 AI 技术中获益匪浅的重要领域,是基于低剂量 CT 的衰减校正(AC)。SPECT MPI 数十年的研究已显示 AC 可减少歧义并提升诊断准确性。但由于 SPECT/CT 设备昂贵且并非随处可用,非 AC SPECT 图像常被用于诊断。DL 方法最近以生成对抗网络(GAN)的形式向临床医师提供了一种可能的方案,具体应用是从一种模态的图像生成另一种模态。最近发表了一项从核素 SPECT 图像生成 AC 图的可行性研究。Shi 等 [63] 开发了一个基于 GAN 的三维模型,专门训练仅从 SPECT 图像估计衰减图,研究纳入 65 例正常与异常患者,均有 SPECT 与 AC CT;合成衰减图与真实衰减图在定性与定量上一致,平均绝对误差为 3.6%。相应地,两组 AC 校正后的 SPECT 图像(真实与合成 AC)高度相似,平均绝对误差为 0.26%。值得注意的是,训练完成后模型可在 1 秒内从 SPECT 图像生成合成 AC 图。图 37.7 展示了两个患者的真实与合成 AC 图,以及真实 AC、合成 AC 与无 AC 下得到的最终灌注极坐标图。

用于 AI 的核素影像数据库(Nuclear Imaging Databases for AI)

AI 技术与方法被严谨训练、验证与测试的一个重要前提是大量数据的可用性——通常称为"大数据"。原则上,可用数据越多模型性能越好,无论是要考虑高解剖变异性的分割任务,还是需要整合并探索若干变量间所有可能相互作用的结局预测模型。在医学与医学影像的语境下,另一个重大挑战与数据标准化相关,尤其是当数据从不同中心采集时。不同机构汇集的影像数据集很可能用不同的影像设备与方案获取,定量变量可能用不同软件计算,并且可能使用不同的术语。数据的质量与一致性将影响算法的准确性与适用性,无论采用何种 AI 方法。对这些数据采集各方面的控制对于推广新模型与算法至关重要。Cedars-Sinai 医学中心的团队最近建立了一个大型多中心注册研究 [64]——下一代 SPECT 快速心肌灌注成像注册(REFINE)——汇集来自九个国际中心的影像与临床数据并带有诊断与预后终点。截至本文撰写时已收集 24025 套完整 SPECT MPI 数据集 [26],每项研究自动量化 290 多个灌注与功能变量,并与临床数据整合。在诊断方面,获得成像后 6 个月内进行 ICA 的结果;在预后方面,随访记录 MACE。图 37.8 展示了 REFINE 注册研究的概览。作为这一重要努力的成果已发展出若干协作项目 [52, 62, 65]。

可解释人工智能(Explainable Artificial Intelligence)

AI 的"黑箱"性质一直是这些方法论的阿喀琉斯之踵,也是临床界采纳或支持的障碍。为克服这一障碍,计算机科学中近来出现了"可解释 AI"技术——它们明确呈现算法对某一特定判定或推荐的"理由"。例如 CNN 方法可识别影像中触发某一事件的特定区域,并以热图的形式作为对用户的解释工具 [66, 67]。这些视觉解释最初为自然图像开发,可应用于核素心脏学以在灌注极坐标图上生成热图(见 [26] 中图 37.6)。基于 ML 的预测或风险分层模型——如前几节所介绍——也能通过提供所用临床与影像特征对最终风险评分或结局预测个体贡献的排序,使其内部工作更加透明(图 37.6)。这些解释工具的实际示例可在 Hu 等 [52, 62]、Betancur 等 [55] 与 Alonso 等 [57] 中找到,并构成消除医学界对这类方法普遍怀疑的重要一步。

结论(Conclusions)

基于 AI 的方法论有潜力革新我们处理患者医疗与医学影像的方式,包括核素心脏学影像。前几节详述的研究已经展示这些技术至少在心肌灌注成像中的广泛应用。通过基于 ML 的方法对临床与影像变量进行复杂整合的可行性,已促成影像解读、结局预测与风险分层方面的广泛研究。但核素影像中旨在改善图像质量与采集效率的其他领域已开始探索这些技术在改进其他困难任务(如生成 AC 图、图像去噪与低剂量方案)方面的能力——这些任务除了在影像解读与患者管理方面争议较少之外,还能极大地惠及核素心脏学影像整体并因此惠及患者医疗。

医学界对这些技术抱有可理解的怀疑,将其视为内里运作不透明、甚至可能威胁其工作与完整性的黑箱。然而这些方法的某些价值难以否认,尤其是在 AI 进入临床环境与实践的语境下,不是要取代医师决策而是作为近乎第二意见的支持。当可解释 AI 的方法也被部署为使模型与预测对临床医师更透明的手段时,这一点尤其成立。另一方面,在某些应用的语境下——如基因组学或影像组学,即在原始影像数据中搜索纹理模式——人眼或传统统计方法将不足以胜任,而 AI 独立学习的能力可能显示出优势。

尽管如此,仍存在重大挑战与障碍,阻碍 AI 在近期内被采用到临床设置中。最重要的一点当然是这些技术需要通常需人工标注的大型训练数据集以提供准确结果。此外,模型验证需要用不同队列进行以确保实现恰当的泛化。创建可在医师与科学家间共享的大型国际多中心注册研究的努力已经在进行,但围绕共享此类医疗数据的法律壁垒存在于我们的医疗系统中。这项数据采集努力的一个根本方面也是质量控制与数据标准化,因为算法的可靠性将很大程度上取决于输入数据的质量,以及与图像的无缝 HER 集成。

总之,心脏核素影像已经从可靠影像采集、图像处理、诊断与预后的众多技术中获益。AI 最近作为可被接受或拒绝的新工具集合登上了舞台。持续进步取决于我们作为科学家的承诺——以患者医疗为念,审慎而批判地投入新技术。

本章个人批注

本章是 De Cecco 这本编辑卷中"核医学影像 AI"专题的综述,作者是 Piccinelli 与 Garcia(Emory/Cedars-Sinai 一系),所以内容高度集中在 Cedars-Sinai QPS/QGS 软件家族与 REFINE SPECT 注册研究两条主线上,是非常典型的"中心视角"。开篇便用图像重定向与重切片、分割、解读与预测、采集效率、数据库、可解释性、结论这七节把核医学 AI 的全部主要任务过了一遍,结构相当标准。

数据点的密度上,这章其实介于"普通综述"与"研究汇总"之间——七节里有五节有具体的样本量、AUC 与作者/年份引用,这对写"内概述"非常友好,但也正因为这样我必须严格控制"只复述源文",不去补"为什么 TPD 是临床标准"或"REFINE 在真实世界落地如何"这类背景,否则就会越过复述边界。

图像处理这块(重定向、分割)写得较老派——Germano/Mullick/Slomka 三套 1990 年代方法各有数字(98.5%、93.5%、48 例 0 失败),还有 SVM 找瓣膜平面、CNN 找心内膜外膜(56 例,误差 1.09 ± 3.66%)。这一节是"经典延续",并非新发展。诊断与预后那一节是全文密度最高的部分,从 Arsanjani 2013 一路到 Alonso 2019,作者用 AUC 数字(0.92、0.94、0.81、0.72、0.77)串起 ML 在 CAD 检测与血运重建预测上的进展。

采集效率那一节明显是新意所在:Shiri(半时间/半投影 CNN)、Ramon(1052 例低剂量去噪 CNN)、Hu REFINE 单纯负荷(20414 例、98 特征、3 阈值)、Shi GAN 从 SPECT 生成 AC 图(65 例、3.6% MAE、1 秒)。这些是 2019-2021 的工作,时间线清晰。REFINE 数据库(24025 套数据集、290+ 变量、九中心)是支撑多个衍生研究 [52, 62, 65] 的基础设施,作者把整张数据流图作为图 37.8 展示,是这章的"看家宝"。

可解释 AI 一节虽然短,但它点出了这章隐含的伦理叙事:黑箱是 AI 进入临床的最大障碍,而热图与特征贡献排序是当前的过渡方案。结论节中"基因组学与影像组学里人眼不足"那句,把 AI 必要性从影像扩展到所有模式识别问题。结尾"决心作为科学家审慎而批判地投资新技术,以患者医疗为念"是典型编辑卷的政治正确收尾。

跨章衔接方面——上一章 ch36 是先天性心脏病 AI(侧重儿科、心超、MR/CT 的重建/后处理/诊断/预后),ch38 是心脏超声 AI(Seetharam & Sengupta),主题从"特殊人群的 AI"切到"核医学的 AI"再切到"超声的 AI",三章连续覆盖了心脏影像三大主要模态(先天性→核医学→超声)的 AI 综述,编辑者显然按"模态"而非"任务"组织这一段。本章在 ch36 与 ch38 之间起到了"模态过渡"作用——从先天性这类"特殊场景"过渡到"通用影像任务(核医学)"再到"另一种主力模态(超声)"。

与上下章的衔接(一段话)

第 37 章在书的整体结构中属于"Part V:基于 AI 的心血管影像诊断学"(与冠心病、心衰、心肌病等并列的"按器官/任务"模块),专门覆盖心脏核医学模态中 AI 的角色。作者从最经典的图像处理(重定向、重切片、分割)出发,经由诊断与结局预测(CAD 检测与血运重建预测),过渡到近年兴起的采集效率优化(剂量降低、衰减校正合成)与数据库基础设施(REFINE),最后以可解释 AI 与临床落地的伦理-方法学反思收束。这种"基础设施 → 算法 → 应用 → 反思"的结构使本章既可作为核素 AI 的入门综述,也反映了整本编辑卷反复出现的"ML/DL 不再是黑箱、需可解释与多中心验证"的基调。上一章 ch36 谈先天性心脏病 AI 涉及的模态分散(超声、MR、CT),下一章 ch38 则把焦点收窄到超声这一单一模态,本章处在"多模态综述"与"单模态综述"之间,正好以核医学这个最具"硬件-算法-数据库"一体化特征的模态作为桥梁。