第29章:基于超声图像的症状性 vs 无症状性斑块分类(Symptomatic Versus Asymptomatic Plaque Classification in Carotid Ultrasound)
1 Introduction
WHO 估计到 2030 年将约有 2360 万人主要死于心脏病和卒中[1]。动脉内的斑块沉积引起动脉增厚,导致动脉粥样硬化,而这正是心脏病和卒中的首要病因[2]。研究表明颈动脉狭窄(颈动脉壁增厚)是死亡的一个强预测因子[3]。解除狭窄的常见治疗手段包括颈动脉支架置入术(CAS)和颈动脉内膜剥脱术(CEA),且已证实手术切除斑块可降低同侧卒中的风险[4, 5]。然而在颈动脉血管重建内膜剥脱术 vs 支架置入术试验(CREST)[6] 中发现 CAS 带来更高的卒中风险,而 CEA 带来更高的心肌梗死风险。已观察到有症状的患者(曾发生过视网膜或半球症状,如卒中、短暂性脑缺血发作 TIA 和一过性黑矇 AF)其斑块破裂更频繁,从而引起致命性栓塞。在症状性斑块中破裂发生率达 74%,而无症状患者斑块中仅为 32%[7]。由于无论 CEA 还是 CAS 都对患者有相当风险,因此需要技术来有效地从中筛选出那些卒中风险更高的症状性患者来进行手术。因此,有效的诊断系统不仅有助于动脉粥样硬化性心血管疾病的成功治疗,也能降低医疗成本和患者焦虑。成功的颈动脉粥样硬化检测还可用于辅助手术之外的治疗——人类基因组计划中的基因组鉴定工作推动了载脂蛋白 A1 Milano 的研发,该蛋白在一定程度上可保护携带该疾病者免于血管事件,基于此蛋白的治疗在数周内即可使冠状动脉粥样硬化发生消退[8]。
由于动脉粥样硬化是一种常见病,诊断支持系统必须具有经济性以减轻社会财务负担。颈总动脉(CCA)通常被用于检测斑块是否存在。超声成像成本低、可负担性强,因此是颈动脉成像的良好选择。尽管诊断超声具有显著优势,但仍有局限:超声影像学特征与颈动脉斑块的组织学评估之间的相关性常常较差[9],造成这种缺陷的限制因素包括空间分辨率低和超声伪影。因此,有必要使用恰当的图像预处理技术和优良的特征提取来改善图像质量。本章提出了一种低成本、无创的计算机辅助诊断(CAD)系统,它使用图像处理和数据挖掘技术对 B 型超声图像中的症状性与无症状性斑块进行分类,作者将其称为 Atheromatic™ 系统族(Global Biomedical Technologies, Inc., California, USA)。在该系统中,基于离散小波变换(DWT)的灰度特征被提取并送入支持向量机(SVM)分类器进行自动分类。本章的流程为:第 2 节简要描述(2.1)所提系统的总体方法学;(2.2)数据获取和预处理步骤;(2.3)使用 DWT 提取特征的方法;(2.4)用于选择重要特征的统计 t 检验技术;以及(2.5)SVM 分类器及其各种核函数。分类结果在第 3 节中呈现。第 4 节讨论结果,第 5 节给出结论。
2.1 Methodology
所提出的 CAD 系统如图 29.1 所示。它由一个在线系统(图 29.1 右侧)组成,用于处理新到患者的测试图像。该系统基于离线学习系统(图 29.1 左侧)所确定的训练参数,通过对在线灰度特征向量的变换来预测类别标签。离线分类系统由一个分类阶段组成,利用离线灰度训练特征与对应的离线真实类别标签(无症状/症状性为 0/1)的组合产生训练参数。在两个系统中,灰度特征都是若干基于 DWT 的特征,提取自 DWT 分解后的图像。研究中由临床医生从每个待研究的图像中选定感兴趣区域(ROI),并采用人工分割的斑块区域。提取出的特征中使用 t 检验来筛选具有显著差异的特征,并将 SVM 分类器作为离线学习分类器进行评估。上述 CAD 系统使用一个被划分为训练集和测试集的图像数据库进行开发。训练集图像被用于开发学习分类器;所构建的分类器使用测试集进行评估,评估采用 k 折交叉验证协议。测试图像的预测类别标签与对应的真实标签(0/1)相比较,得到敏感性、特异性、准确率和阳性预测值(PPV)等性能指标。
2.2 Data Acquisition and Preprocessing
本工作共使用 150 张无症状和 196 张症状性(合计 346 张)颈动脉斑块超声图像。这些图像从被转诊至塞浦路斯尼科西亚血管筛查诊断中心(Vascular Screening Diagnostic Center, Nicosia, Cyprus)进行诊断性颈动脉超声检查以检测颈内动脉狭窄的存在和严重程度的患者中收集。研究开展前获得了机构审查委员会的批准和患者的知情同意。研究排除了具有心源性栓塞症状或远期症状(>6 个月)的受试者[5],且狭窄程度小于 50% 的斑块未被纳入数据库。同时也排除了在正常工作时间之后由未经斑块图像采集培训的人员进行扫描的急诊病例。进行检查和采集斑块图像的超声医师知晓转诊原因,因为他们执行的是常规的狭窄存在和分级诊断。然而,对诸如本研究这样的目的而言,数据库图像经过匿名化处理,随后进行图像归一化和分析的医生并不知道斑块是症状性还是无症状性的[10]。
为成功实现图像归一化,进行了以下前提准备:(1)动态范围调整。(2)帧平均(persistence)。(3)时间增益补偿(TGC)曲线斜穿组织,并垂直定位于血管腔内,因为超声束在穿过血液时不被衰减,这保证前壁和后壁的外膜具有相近的亮度。(4)增益调整。(5)使用线性传递曲线的后处理。(6)超声束与动脉壁成 90°。(7)使用最小深度使斑块占据图像的大部分。(8)调整探头使斑块邻近的外膜作为高回声带清晰可见,可用于归一化。灰度图像以血液和外膜作为参考点进行人工归一化,方法是将图像进行线性调整,使血液的灰度中值落在 0–5 范围内,外膜(动脉壁)的灰度中值落在 180–190 范围内。
来自有视网膜或半球症状(不稳定斑块)患者(如卒中、短暂性脑缺血发作 TIA 和一过性黑矇 AF)的斑块被归为症状性斑块(88 例卒中、70 例 TIA、38 例 AF,合计 196 例)。无症状斑块来自既往无相关症状的患者。在预处理阶段,由临床医生从每张待研究图像中选定 ROI。血管外科医生和超声医师经过训练,能够识别代表硬斑块或狭窄的低回声区。因此,本工作中采用了人工分割的斑块区域。疾病的本质集中于血管壁——其使管腔-内膜界面的形态从缓慢渐进性的脂质形成改变为成熟为硬斑块或松散的出血岛[11]。因此,年轻与陈旧斑块都聚焦于这种血管病变,并以其在超声图像中的回声信息反映出来[10]。所聚焦的 ROI 占图像帧的 <25%,因此血管外科医生对这一局部信息中的斑块特征分析尤为关注,本工作也因而聚焦于分析由血管外科医师所勾画的这一小块 ROI。典型的症状性与无症状性颈动脉图像分别如图 29.2a、b 所示,图 29.3a、b 展示了对应的 ROI。
2.3 Feature Extraction
本工作中使用二维(2D)DWT 和均值算法进行特征提取。信号的 DWT 变换通过将信号通过一系列下采样的高通和低通滤波器来确定。低通滤波器由传递函数 g[n] 定义,高通滤波器由 h[n] 定义。高通滤波器输出 D[n] 即细节系数,定义为
低通滤波器输出 A[n] 即近似系数,定义为
频率分辨率通过级联这两个基本滤波操作而进一步提高。具体而言,第一级低通滤波器的输出被馈入相同的低通和高通滤波器组合。每一级都输出细节系数,它们构成各级系数。一般地,每一级都将样本数减半、频率分辨率加倍。因此在最终级,细节系数和近似系数都作为该级系数而被获得。对于 2D 信号可使用 2D DWT。对图像使用了小波包分解(WPD)。这些图像被表示为 m × n 的灰度矩阵 I[i, j],其中每个元素代表一个像素的强度。在 I[i, j] 中所有非边缘像素(i ∈ {0, m},j ∈ {0, n})都有八个相邻像素。这八个邻居可用于遍历矩阵。然而,改变矩阵遍历方向只会反转像素的顺序,2D DWT 系数保持不变。例如,当矩阵从左到右遍历时 WPD 结果与从右到左遍历时相同。因此只剩下四种可能的方向,被称为对应于 0°(水平,Dh)、90°(垂直,Dv)和 45° 或 135°(对角,Dd)方向的分解。该算法的实现遵循图 29.4 所示的框图。图中展示了 N × M 维输入图像 I[i, j] 及第 1 级的结果。本工作发现第 1 级的结果已足以获得显著特征。
本工作评估了若干小波函数。每一小波函数都有其独有的低通滤波器传递函数 g[n] 和高通滤波器传递函数 h[n]。图 29.5 显示了本工作所使用 Biorthogonal 3.1(bior3.1)小波族的传递函数。第 1 级 2D DWT 产生四个结果矩阵,分别记为 Dh1、Dv1、Dd1 和 A1,其元素为强度值。图 29.6 示意性地表示了这些结果矩阵。不幸的是,这些矩阵不能直接用于分类,因为元素数量过多。因此定义了两种平均方法,每种用单数字表征结果矩阵。第一种用于从 2D DWT 结果向量中提取均值度量:
最终的平均方法不使用强度值本身,而是使用强度值的能量:
这三个元素构成特征向量。
2.4 Feature Selection
本工作使用 t 检验[13]来验证特征是否足够显著以准确地区分症状性和无症状性两类。该检验中,首先假设原假设为来自两类的特征均值相等;然后计算 t 统计量(两类特征均值之差与类均值间标准误的比值)及相应的 p 值。p 值是在原假设为真的情况下拒绝原假设的概率。在本案例中假设特征服从正态分布,但检验统计量中的尺度项未知,因此用基于数据的估计来代替。较低的 p 值(<0.01 或 0.05)表明两类的均值显著不同,因而该特征是显著的。
2.5 Classification
SVM 是一种基于超平面的非参数分类器。当使用输入特征-输出真实类别标签对进行训练时,它输出一个决策函数,可用于测试新的输入特征。设类标签 c = -1 表示无症状类、c = +1 表示症状性类,SVM 算法将训练集映射到一个特征空间,并试图在该空间中定位一个将正例与负例分开的超平面。在测试新未标记图像时,算法将该图像的特征向量映射到同一特征空间,并基于其落在分隔超平面的哪一侧来确定类别。因此,SVM 的主要目标就是确定一个分隔超平面以最大化特征空间中所绘制输入数据类之间的间隔[14–16]。为确定间隔,借助训练数据在分隔超平面两侧各构造一个平行超平面。考虑如下形式的二分类线性模型:
其中 φ(·) 表示特征变换核,b 为偏置参数,w 为超平面的法向量。训练数据由输入特征向量 x 和对应类 c 组成。在测试阶段,新特征向量基于 y 的符号进行分类。到训练数据集最近点的垂直距离即为间隔,训练 SVM 分类器的目标就是确定最大间隔超平面,并对位于错误一侧的样本施加软惩罚。支持向量就是那些被间隔"顶到"的点。该问题变成如下优化问题:
其中 ζ_i 是被错分样本的惩罚项,C 是控制错分样本与间隔之间权衡的正则化参数。第一项等价于最大化间隔。该二次规划问题可以通过为每个约束引入拉格朗日乘子 α_i 并求解对偶形式来求解。拉格朗日量为
其中 α_i 和 γ_i 是拉格朗日乘子。在消去 w、b 和 ζ_i 后,得到需要对之最大化的对偶拉格朗日量:
预测模型现在由下式给出:
其中 b 通过下式估计:
M 是满足 0 < α_i < C 的下标集合。该二次规划问题的求解见 [17]。在线性不可分的情况下,特征首先使用核函数映射到更高维空间[17, 18],然后再确定超平面,即 (29.9) 中的每个内积都被非线性核函数替代。本工作使用了线性核、阶数为 1、2、3 的多项式核以及径向基函数(RBF)核。p 阶多项式核定义为
RBF 核定义为
在分类阶段,训练数据用于确定训练参数 C(即拉格朗日乘子 α_i 和 γ_i)以及 b,使新数据 x 可代入 (29.10) 得到对应的 y 值。类 c 由 y 值的符号决定。
3.1 Selected Features
所选特征为:能量、第 1 级水平与垂直 DWT 系数的均值。这些特征被送入 SVM 分类器用于未知类别的自动检测。表 29.1 展示了使用 bior3.1 小波经 DWT 获得的特征。其中 p 值 <0.0001 表明这些特征具有显著性。
| 特征 | AF(mean ± SD) | AS(mean ± SD) | p-value |
|---|---|---|---|
| Average Dh1 (Ah) | 0.10 ± 0.04 | 0.14 ± 0.03 | <0.0001 |
| Average Dv1 (Av) | 3.82E-02 ± 1.55E-02 | 5.49E-02 ± 1.47E-02 | <0.0001 |
| Energy (E) | 5.47E-08 ± 2.22E-08 | 7.17E-08 ± 1.99E-08 | <0.0001 |
3.2 Classification Results
本工作比较了 54 种不同小波函数和 15 种分类器的性能。所分析的小波母族包括 Reverse Biorthogonal(rbio)、Daubechies(db)、Biorthogonal 3.1(bior)、Coiflets、Symlets、Discrete Meyer(FIR 近似)(dmey)以及 Haar 族。其中 Biorthogonal(bior3.1)小波函数表现优于其他函数。分类器使用三层分层交叉验证方法评估。该方法将 346 张图像的数据集分为三部分,每部分包含两类中相同比例的图像。在第一折中,两部分用于训练,第三部分用于测试。具体而言,242 张图像用于训练分类器,104 张图像用于测试:训练包含 137 张症状性图像(26 AF、49 TIA、62 卒中)和 105 张无症状图像;测试组包括 59 张症状性(12 AF、21 TIA、26 卒中)和 45 张无症状图像。该协议重复执行,使每一部分都有机会成为测试集。结果共执行三轮迭代。每折测试阶段所得性能指标的均值作为该分类器的最终性能指标。
由于 SVM 在 15 个分类器中表现更好,表 29.2 中呈现了 SVM 在各种核配置下所得的性能指标(敏感性、特异性、准确率和 PPV)。TN(真阴性)是被识别为无症状的无症状斑块数;TP(真阳性)是被识别为症状性的症状性样本数;FN(假阴性)则是被识别为无症状的症状性样本数;FP(假阳性)是被识别为症状性的无症状样本数。敏感性即技术识别症状性病例的概率,由 TP/(TP+FN) 计算;特异性即技术识别无症状病例的概率,由 TN/(TN+FP) 计算。PPV 即被技术标记为症状性的样本中真正症状性受试者的比例,由 TP/(TP+FP) 计算;准确率即被正确分类样本数与总样本数之比,由 (TP+FP)/(TP+FP+TN+FN) 计算。
| SVM | TN | FN | TP | FP | A (%) | PPV (%) | Sn (%) | Sp (%) |
|---|---|---|---|---|---|---|---|---|
| Linear | 48 | 8 | 37 | 11 | 81.7 | 77 | 82.2 | 81.3 |
| Polynomial order 1 | 48 | 8 | 37 | 11 | 81.7 | 77 | 82.2 | 81.3 |
| Polynomial order 2 | 51 | 9 | 36 | 8 | 83.7 | 81.8 | 80 | 86.4 |
| Polynomial order 3 | 53 | 12 | 33 | 6 | 82.6 | 84.6 | 73.3 | 89.8 |
| RBF | 50 | 11 | 34 | 9 | 80.8 | 79 | 75.5 | 84.7 |
结果表明,阶数为 2 的多项式核 SVM 分类器达到平均准确率 83.7%、敏感性 80%、特异性 86.4% 和 PPV 81.8%。为选择最优分类器,必须选择一个对敏感性和特异性同时给出高值的分类器——同等的高值表明分类器对两类都具有良好的判别能力而不会偏向某一类。此外分类器的总体准确率也应较高。基于这些标准,阶数为 2 的多项式核 SVM 分类器被认为适合该颈动脉斑块分类问题。
4 Discussion
颈动脉斑块的分类是一个困难且多面的问题。本研究采用基于小波变换的尺度/频率方法来表征 B 型超声中的颈动脉粥样硬化斑块[19]。研究比较了两种小波分解方案(DWT 与小波包 WPD)和三种基函数(Haar、symlet3、biorthogonal3.1)在区分症状性与无症状性病例方面的能力。使用 DWT 提取了 12 幅细节子图像,使用 WP 分解提取了 255 幅。结果表明使用 Haar 滤波器及 1-1 范数作为纹理描述符的 WP 分析不仅能揭示高频也能揭示低频中的差异,因此能高效地表征粥样组织。该研究结论是需开展进一步应用和扩展上述方法的研究,以确保小波纹理分析在颈动脉粥样硬化中的有用性。因此,本研究探索了小波特征在斑块分类中的效用。
Kyriacou 等[20]在神经和统计分类器中使用 10 个纹理和形态特征,获得约 71.2% 的准确率。针对结构与多级二值形态模型计算的归一化模式谱被用作两种分类器(概率神经网络和 SVM)的分类特征,用于症状性与无症状性类别的自动诊断[21]。在每类 137 个样本上使用 SVM 分类器,多级二值形态图像分析的分类效率为 73.7%,灰度形态分析为 66.8%。颈动脉粥样硬化的纹理和运动模式被提取并送入模糊 C 均值分类器,将斑块分为症状性与无症状性[22]。在 10 张症状性和 9 张无症状性斑块图像的特征上评估分类器,结果显示基于纹理特征该技术可正确分类 74% 的斑块,基于运动特征可分类 79%;当结合运动和纹理特征时,分类性能达 84%。在另一项研究[23]中,对 230 个斑块的人工分割 ROI 提取了 61 个纹理和形状特征,用于模块化神经网络,报告了 73.1% 的分类准确率。
从以上讨论的研究可见,需要更准确且使用更少特征的技术。大多数这些研究采用纹理特征进行斑块分类。在作者早期的工作[24]中,从同一数据集(使用人工 ROI 选择)提取了四个纹理特征(标准差、熵、对称性和游程百分比)并用于 Adaboost 和 SVM 分类器,SVM(RBF 核)取得了 82.4% 的准确率。为进一步提升准确率,本工作研究了基于 DWT 的特征在斑块分类问题中的能力。所提方法的准确率、敏感性和特异性分别达到 83.7%、80% 和 86.4%。本工作的准确率相对高于先前研究,且仅使用了非常少的特征(三个)。
就斑块 ROI 分类而言,SVM 分类器达到了 83.7% 的准确率。准确率难以更高出于以下原因:所有斑块最初都是无症状的;在这项横断面研究中,数据集收集时已有 196 个斑块变为症状性。随着时间推移,可能有更多斑块破裂并变为症状性。然而根据其纹理,这些斑块会被本技术归为高风险和症状性,但在成像时临床上却被标记为无症状。这种差异导致准确率降低。该问题只能通过前瞻性纵向研究加以解决。
所提技术的关键特征如下:(a) 使用小特征集:特征集很小(仅三个),但足以有效分类症状性与无症状性斑块,准确率达 83.7%。显著特征是第 1 级水平系数的均值、第 1 级垂直系数的均值和第 1 级垂直系数的能量。由于这些特征具有低 p 值(表 29.1),将它们用于 SVM 分类器时获得了良好的准确率。作者观察到,当数据使用阶数为 2 的多项式核被变换到更高维空间时取得了最佳准确率。(b) 稳健性:为获得稳健的系统,使用了一个由两类中几乎相等样本数构成的大型数据库(150 张无症状和 196 张症状性斑块)进行评估。此外,使用分层三折交叉验证数据重采样技术训练和构建 SVM 分类器,以获得可处理任何新患者图像的通用训练参数。(c) 实时性:除 ROI 选取外无需人工交互,系统是实时的。ROI 可由专家超声医师轻松勾画,无需数学建模。系统允许借助多普勒超声作为辅助工具选择 ROI 区域。(d) 通用性:所提 CAD 框架可扩展到其他医学图像。这是一个通用系统,作者已经将此经典框架扩展到甲状腺和肝脏超声,只是这里的特征集经过调谐以捕获由动脉粥样硬化形成(如硬斑块和软斑块)所致的纹理信息。(e) 低成本和安全:技术成本低,因为使用的是从广泛可获得且可负担的超声模态所采集图像中提取的特征。此外该技术可轻松写成软件应用程序,免费安装到任何计算机上。不同于 CT,技术不使用辐射;也不同于 MRI,技术更经济。
虽然使用三个小波特征的新颖组合在大数据集上达到了 83.7% 的良好准确率,但仍存在以下未来工作方向:1. 通过添加能够表征壁区动脉粥样硬化沉积物的更高级特征来提升准确率的余地存在,作者团队致力于为下一代改进该系统。2. 所提协议要求超声医师人工勾画 ROI,希望未来 ROI 分割可自动完成。3. 在本工作中,斑块是否症状性的真实信息是基于症状的有无获得的。这种真实信息判定的缺点在于某些无症状斑块可能被错误标记为症状性——症状可能由心脏而非颈动脉中的斑块引起;也可能因患者不记得其症状史而被归为无症状。为缓解该问题,未来研究计划从病理学研究而非临床报告中确定真实信息。
5 Conclusions
只有经验丰富的医生或血管超声医师能够高效地检测超声图像中的症状性与无症状性斑块。本工作所提 CAD 系统可帮助医生就所检测斑块的性质获得有价值的第二意见,从而使其自信地决定治疗方案。本系统使用 DWT 进行特征提取,并以超过 83% 的准确率、敏感性和特异性自动诊断两类。具体而言,达到 83.7% 的分类准确率、80% 的敏感性以及 86.4% 的特异性。该准确率相对高于文献中类似研究的记录。因此作者相信,所提技术可被视为一种有效的图像挖掘技术,可作为血管外科医生在选择患者进行高风险狭窄治疗时的有效辅助工具。然而这些准确率可能尚不足以将该系统纳入常规临床工作流,需要更多研究以提升分类结果。由于本研究已测试了广泛的分类器,未来工作将研究更多特征提取技术以提升准确率,特别是研究更多基于纹理的方法以及各种特征提取方法的组合。
本章个人批注
本章是典型的"小特征集 + 经典分类器"型 CAD 工作,三个 DWT 统计量(Ah、Av、E)经 t 检验筛选后送入 SVM 多项式核,结论是多项式阶 2 核达到 83.7% 准确率。从工程角度看,这种把 ROI 严格限制在 <25% 图像帧、特征数压到 3 个的做法,是教科书级别的"low-dimensionality bias-variance tradeoff"演示,但作者也坦诚这类横断面研究中"未来才破裂的斑块会被错标为无症状"的问题——本质上是数据收集的时间窗口与斑块演变时间尺度不匹配。
值得注意的几点:第一,Atheromatic™ 这一命名表明作者团队已经把这一管线产品化(Global Biomedical Technologies 公司化运作),说明本章的应用价值不在学术新颖性,而在临床工程落地。第二,与文献综述对比,10 个特征+神经网络的 71.2%、61 个特征的 73.1%、纹理+运动的 84%——可见"特征多 ≠ 性能高",三个精心选择的小波能量统计量反而胜过数十个通用纹理描述符,这呼应了第 28 章关于"特征设计优先于分类器选择"的原则。第三,作者明确把 ground truth 来源作为方法学局限列出,提议未来从病理学而非临床报告获取,这是难能可贵的诚实——大多数 CAD 论文回避这一根本性问题。
与上一章(第 28 章 影像融合)相比,本章是更纯粹的"信号处理 + 机器学习"管线,没有多模态配准/融合环节,可作为单模态 B 超 CAD 的代表样本;与第 26 章(IVUS 算法)、第 27 章(OCT 可视化)也形成对照——后者偏物理建模与高分辨率成像,本章则偏纹理分类与决策边界。
与上下章的衔接(一段话)
本章处于全书的"计算机辅助诊断"主题区块中,紧接第 28 章(影像融合技术)之后。在第 28 章讨论了多模态融合如何提供互补信息之后,本章回到最简单、最经济的单模态(B 超)+ 经典分类器(SVM)框架,展示在工程约束下(无 CT、无 MRI、只用便宜超声)如何仅靠三个 DWT 统计量就达到 83.7% 准确率。这一收束自然地为下一章(第 30 章,按全书结构应是总结性或比较性的章节)做了铺垫——读者在见识了物理建模(OCT)、算法增强(IVUS LRE)、多模态融合(Ch28)和机器学习分类(本章)后,应该已具备评判"哪种 CAD 范式更适合哪类临床场景"的能力。