第 11 章:细胞迁移分析的软件应用(Software Applications for the Analysis of Cell Migration)
引言(Introduction)
本章由 Arndt Rohwedder 撰写,作者在 Johannes Kepler University Linz 工作。本章的目标是为读者提供一个"软件工具地图":概述目前用于细胞迁移原始数据分析的软件;讨论评估迁移事件时的关键参数;并以采集技术为线索,引导读者根据实验所用的记录方法选择最合适的软件——尤其偏重开源方案;最后附上可帮助研究者找到合适分析软件的互联网链接。作者开篇即承认,任何"可用软件清单"在写作过程中就已经过时,因此只列出几个有代表性的成熟例子;这种"时效性免责"是此类工具综述章节的常见起手式,提示读者应将其视为"代表性路线图"而非"完整目录"。本章的核心思想是:任何细胞迁移的定量分析,本质上都依赖于"两个时间点之间被记录的差异",而差异的形态(连续时间序列、起止端点对照、单时刻形态快照)以及采集方式(光学成像、阻抗测量等)会决定后续所需的软件栈,因此分析的"纯量化"与"数据解读"必须分开处理并各自匹配采集方法。
1. 引言(Introduction,详)
任何细胞迁移事件的定量分析都依赖于"两个时间点之间的差异",差异可以是连续时间序列(在 2D 或 3D 成像系统上记录),也可以是阻抗测量;另一种方式是只比较起始状态与终点状态,可被视为"压缩后的时间序列"。测量可反映位置变化、形态变化,或两者随时间的共同变化;在某些条件下,仅靠单时间点也能携带迁移信息——前提是有足够的实验背景。鉴于方法的多样性,分析任务必须被拆成两部分:一是要根据记录方式调整的纯量化,二是数据解读。市面上存在大量软件,可独立或联合完成这两项任务。考虑到生物系统的天然异质性,研究者需要大量实验数据与重复;而高通量记录系统的普及进一步要求强大的计算分析系统来应对日益增加的数据量(尽管存储本身已不再是瓶颈);分析软件因此越来越需要在结果解读中扮演更主动的角色,而如何整合不同采集方法的数据以便相互比较不同实验体系,仍然是一个公开的挑战。
2. 一般性考虑(General Considerations)
作者把分析细胞迁移的软件分为三层:采集(Acquisition)——控制采集仪器并管理数据存储的软件,通常由仪器厂商提供,需要较专业的知识,但也有部分开源软件可按需调整;量化(Quantification)——从采集数据中提取与迁移相关参数的软件,开发者众多、专用性强,商业与开源皆有;数据分析(Data analysis)——处理量化数据以提取生物学意义,可选用多种统计软件(商业与免费均有);高通量测量越来越依赖统计软件以及日益增加的机器学习应用。在方法学层面,分析细胞迁移有两条主要路径:最常见的是基于时间序列(time-resolved)的记录与分析;另一类是非成像技术,例如阻抗测量 [1, 2]。绝大多数数据仍来自成像应用;非成像技术的量化与硬件高度耦合,因此用户在后续解读/分析环节的选择空间有限。即便把范围限定在成像技术之内,仍然存在大量选项——这使得结果在不同系统间的可比性与翻译成为一个公开问题。成像本质上是获取并分析以多维数组形式存储的数据集;一张图像至少是一个 2D 数值阵列,含有的信息量等同于像素采样数。除了整套图像序列,单帧扫描也可用于分析细胞或细胞聚合体的形状与朝向,但需要事先假设"细胞运动时主要采用的形状"。在所有步骤中,"如何从图像中剥离与细胞迁移真正相关的信息"是软件要解决的核心问题。识别相关参数时,有若干常见考量:速度、方向性、迁移事件频率、总迁移距离、链式迁移、迁移模式(如核运动、变形虫样)等;当引入第三维度或复杂环境时,参数数量还会显著增加。研究者必须决定哪些参数与当前实验条件相关——这是分析中最容易引入偏差的环节之一:好的分析软件应能提取尽可能多的特征,同时帮助用户筛选最相关的参数;但几乎没有任何单一软件能同时满足这两个需求,因此用户往往需要组合多类软件。多种成像技术(相差、共聚焦、磁共振等)携带的迁移信息彼此差异巨大,数据在不同维度、不同时间/空间分辨率上呈现,因此业界迫切需要一个"统一的方案"以改善跨系统的结果翻译。流程从采集技术开始:大多数成像系统随附厂商专用软件,但开放系统正越来越多。厂商层面,蔡司使用 Zen 软件提供基础图像分析(增强、分割等)并可通过购买模块扩展;徕卡的 LAS-X 提供等价选项,并可购买专用版本;奥林巴斯的 cellSens 偏重采集但提供独立分析工具;尼康提供 NIS-Elements。在开源方面,最知名的是 μManager,专注于采集且分析能力不强,但作为开源系统可由用户修改代码以适应专门需求 [5]。Table 1 列举了潜在迁移参数及其可被测量的技术,提示测量参数越多,就越难挑选最具代表性的参数;软件/工作流开发时,必须把可用性与可实践性放在首位——任何编程环境的优雅性都不应取代"为成像数据提供可靠量化与分析软件"这一根本目标。近年来,Python 已经成为此领域的强大工具:它易学易读、提供大量专用成像工具且易于集成;其优势还在于通用、低成本、维护良好,并能以较少额外工作把脚本打包成可在无 Python 环境的计算机上分发的独立软件。最后,由于用户对参数的偏好可能掩盖相关信息,分析流程的最后一步必须用统计方法评估参数显著性,例如主成分分析(PCA)。
3. 时间分辨迁移实验(Time-Resolved Migration Assays)
由于数据量巨大,时间分辨测量通常被限制在 2D 维度。最基础的形式是相差光镜下的迁移实验:细胞在时间序列中被相机记录为灰度图像(Fig. 1)。最著名的是伤口愈合实验——在细胞单层上制造一个缺口(gap),然后观察细胞向该缺口的迁移(Fig. 2)。在缺口并非必需的场合(如化学趋化/趋化排斥),缺口本身反而无益;但若仅需要在 2D 维度高通量地获取速度与方向性,缺口仍是"最易实现"的设计。市场上既有商业、也有开源/freeware 的迁移细胞分析软件(Table 1 列出了可被测量的参数范围,Fig. 2 与 Fig. 1 提供了典型样品)。也存在一些将硬件与分析软件打包销售的商业方案。
4. 阻抗测量(Impedance Measurements)
虽然不如成像方法普及,但阻抗测量可提供可靠的细胞形状与位置信息。它利用细胞膜的导电性,通过改变频率与电导率,推断单个细胞或细胞簇的形状与位置。优势之一是"无标记"——适合活细胞测量,并能避免光毒性;Chiu 等 2019 年的综述对此技术作了良好概括 [3]。微加工与分布式制造的兴起使该技术能够适应更专业的应用场景。然而,由于所需设备的专门性,阻抗测量的"采集开源软件"基本不存在。可用阻抗技术获取的参数包括细胞形态、凋亡、增殖与迁移 [1, 4];获取这些参数需要谨慎选择实验设置,因此阻抗采集比基于成像的方法更复杂——除了成像所关注的项目外,还需考虑电流频率、电极位置与电流强度。基础的阻抗测量必须被翻译为目标参数;目前缺乏广泛可用且易用的参数提取软件。设备昂贵(主要由少数厂商或实验室自研搭建)相对于更便宜的成像方法是明显短板;尽管阻抗测量在精度上具有优势,但在它变得更普及之前,很可能仍会停留在小众技术的范畴。一旦获得上述参数,阻抗测量面对的解读挑战与光学/显微方法完全相同——这一部分的数据分析将在本章后文集中讨论。
5. 成像技术(Imaging Technology)
使用成像技术时,一般需要执行若干通用步骤来为后续量化做准备;这些步骤可能隐藏在所用软件的内部,也可能需要用户手动调整。第一步通常是设定强度阈值以分离背景与细胞,随后常伴随去噪;阈值算法种类繁多,正确选择并不容易;阈值往往可由用户调节,但也有软件自动估计阈值。在这一阶段,图像分辨率差异就已经会引发"结果可迁移性"问题:低分辨率图像的噪声可能被误判为去除对象,导致单个细胞被抹去而遮蔽围绕中心对象的潜在迁移事件;高分辨率图像的自动降噪算法则可能让软件把背景假阳判为细胞。接下来的步骤是用边缘检测或分水岭等算法识别细胞边界——不同软件使用不同算法,对用户知识储备的要求各异;开源与商业分析软件都以不同程度的专业化形态存在。对于以时间序列为主的迁移实验,用户调整的轻微差异影响有限,因为细胞轨迹才是核心信息;但形态测量则对参数极其敏感,用户偏差很容易损害数据的可比性。
6. 采集软件(Acquisition Software)
成像方法的采集软件来源广泛,通常由硬件厂商提供;开源软件同样存在并可按专门用途调整。最典型的例子是 μManager [5],支持多种成像硬件并能与免费分析软件 Fiji/ImageJ [6] 集成。其他框架则要求编程语言集成,从而获得高模块化能力,例如 Python 库 Python Microscope [7];更通用、但要求更高专家背景的是 ImSwitch [8]。基于时间序列的迁移实验本就对存储空间要求很高,且常与高通量测量叠加——在这种情况下,采集软件的适配会变得复杂;商用显微镜厂商提供的软件并不必然支持高通量采集,具体取决于设备类型;常见做法是通过购买附加模块扩展。时间序列迁移实验通常依赖额外的存储与数据管理框架;部分平台(开源与商业皆有)提供对第三方软件或自定义分析脚本的集成能力,例如开放显微镜环境(Open Microscopy Environment, OME),它支持多种语言接入、标准化文件存储,并连接数据库与权限控制 [9]。组织成像数据进行形态分析有不同路径:已有系统试图把不同来源(含形态信息)的成像数据整合 [10],但其定位是"提供参考材料"而非"提供实验室内组织结构";在线成像数据库(如 Image Data Resource, IDR)则提供参考材料并允许发布已发表成像数据,用于评估实验结果 [11]。
7. 成像时间序列迁移实验(Imaging Time-Series Migration Assays)
评估细胞或细胞聚合体迁移特性最常用的技术是伤口愈合实验(wound healing assay),它已成为 2D 细胞迁移测量中最频繁使用的技术之一。该方法相对简单:在 2D 细胞培养上长至汇合,再施加一个切口("伤口"),然后记录细胞向该空白区域的迁移(Fig. 2 给出了一个示例)。尽管存在实时测量的方案,但大多数数据提取发生在已记录的时间序列上;由此可推断,图像数据的存储与管理本身就需要框架支撑——部分平台(免费与商业皆有)允许集成第三方软件或自定义分析脚本。除了伤口愈合,另一类典型是基于单细胞迁移的分析。
7.1 单细胞迁移实验(Single-Cell Migration Assays)
要从成像时间序列中提取迁移数据,已有多种工具;Barry 等 [12] 与 Masuzzo 等 [13] 的综述提供了优秀概览。最简单的形式下,用户需在每一帧逐个标记单细胞,并把该细胞的数据独立存储;典型工具是基于 ImageJ 的 MTrackJ 插件,设计用于少量细胞的时间序列追踪 [14]——但当细胞数量增加时便不再实用。因此自动化细胞检测与追踪方法更适合高通量数据分析;MATLAB 平台上的 CellTracker 是一个文档完备的专用程序,能提供可靠的追踪分析 [15]。同样在 ImageJ 平台上的 TrackMate [16] 则是另一代表。自动化追踪软件对输入时间序列有一定要求:软件用分割技术隔离单细胞,因此必须能把细胞与背景区分开——在最优成像条件下效果好,但实际图像通常需要预处理(如对比度调节、背景扣除)。机器学习的应用有潜力克服时间序列中的质量问题,最近已被纳入 ImageJ 的 TrackMate 插件 [17]。用户对自动化分析软件可靠性的掌控义务仍然存在——不仅对开源软件如此,对商业软件也一样。开源的优势在于用户能追踪所用算法,而商业软件通常不具备这种透明度;商业软件产生的错误结果往往无法由用户调整,只能依赖软件厂商的售后服务。
8. 2D 伤口愈合实验(2D Wound Healing Assay)
当使用经典伤口愈合实验评估 2D 细胞培养的迁移能力时,分析方法必须相应调整——它不再依赖单细胞追踪,而是依赖"汇合细胞层"与"无细胞空白区"的检测。伤口愈合实验中的分析通常衡量"封闭初始缺口所需要的时间"。基于 ImageJ 的开源工具至少可以部分实现此类实验的高通量参数分析:例如 TScratch [18] 提供基本分析(无高通量选项),而插件 Wound_healing_size_tool [19] 提供高通量能力。现代商业高通量成像系统通常自带一系列自动细胞迁移分析工具,例如 Molecular Devices® 的 ImageXpress 系列或 Sartorius® 的 Incucyte——其分析软件给出的结果与开源软件相似,但通常会"预消化"为用户能直接使用的报告。尽管原则上有能力生成 3D 时间序列,但采集往往较为棘手,尤其是当目标对象可能移出焦平面时。
9. 基于形态学的软件工具(Morphology-Based Software Tools)
用细胞形态解读迁移事件需要两类前提之一:关于所考察细胞类型的先验信息,或参考数据的采集。参考数据指在特定时间点、对特定处理的细胞状态;这比时间序列所需的数据量少,但无法确定完整迁移路径。如果要考察三维细胞反应,两个时间点(而非连续时间序列)更可能成为工具选择。
10. 2D 形态学分析(2D Morphology Analysis)
可用于从 2D 图像提取信息的工具众多,其中相当多已作为 ImageJ/Fiji 的插件实现,可以提取前文列举的多项参数(Fig. 3;例如 [12, 20, 21])。这类工具通常非常专门化:例如有专门用于量化超分辨率可见特征(如神经元上的树突棘)的形态学插件 [22];但这种专用软件很少能直接用于提取单细胞或细胞群体的迁移信息,只能提供补充信息。2D 细胞显微图像的形态学量化是一个长期被深入研究的课题,因此解决方案众多。除商用多用途图像分析软件(如 Imaris、VoloCity)外,开源软件也很多元。最常见的方案是要求在机器上安装某种编程语言,但都有潜在局限:MATLAB® 平台的开源软件虽然自身"免费",但仍要求昂贵的 MATLAB® 背景;MATLAB® 平台的开源形态学分析优秀方案之一是 ShapeMetrics [23],但要把相关脚本移植到免费的 MATLAB® 替代品 GNU Octave,需要较强的编程背景。Python 是更容易获取、且常常已预装在许多电脑上的解释语言,但因依赖关系问题,运行 Python 脚本未必直接;Python 的开发已快速向 3D 分析倾斜,留下不少需要基础编程能力的库,例如某种神经元形态量化库 [24]。这一例子的意义在于揭示了"识别合适软件"的难题:虽然神经元形态量化软件很受欢迎 [25],但其结果很少直接服务于细胞迁移信息。随着机器学习算法被方便地集成到流程中,Python 在 2D 图像分析中变得更吸引人 [26]:在细胞形态学分析中,机器学习有潜力区分不同细胞类型,但对特定参数要特别小心——在监督学习场景下,参数本身往往并未被记录。随着高内涵成像采集系统的增多,高通量与机器学习能力变得越来越重要;部分多用途软件已能一次性分析多张图像,但常需要调整;一些工作流专门针对形态学量化与后续分析中的这些问题 [27]。
11. 3D 形态学分析(3D Morphology Analysis)
随着 3D 细胞培养(如球体基质包埋)数量的增加,3D 分析日益受到关注。在三维空间内分析细胞或细胞聚合体的优势显而易见:细胞与其他生物体一样,不仅占据三维空间,也在三维空间中运动。当分析被限制在 2D 维度时(尤其当数据来自记录的图像堆栈),伸出的突起信息很容易丢失或被误读——一个切片的突起可能在另一片与胞体失去联系,从而被解读为独立实体;此外,胞体形状可能遮蔽位于其他切片中的较小突起。因此,对 3D 记录的细胞/聚合体进行形态学分析时,必须同时尊重其维度属性。3D 形态学分析导出的参数通常是 2D 形态学分析参数的扩展(参看 Table 1)。从计算角度看,3D 图像分析需要显著更多投入,软件方案必须正视这一点;近年来的各种新技术被用于处理这一问题,理论上标准 PC 即可完成 3D 图像量化。前文提到的多用途软件中有不少已包含 3D 分析;ImageJ/Fiji 也有 3D 分析实现,但必须注意 ImageJ/Fiji 最初为 2D 图像分析而生,要"说服"它"在三维思考"并不容易——一些更专门的软件同样存在这一问题。专门的高内涵 3D 分析软件确实存在(Fig. 4;[28]),但仍属少数。Python 因其易安装模块,被证明是处理 3D 数据的得力工具——部分模块非常适合数据提取并集成到统计软件包进行大规模数据分析(参看下文的链接列表)。
12. 数据分析(Data Analysis)
后续的数据分析虽然取决于每个实验室的习惯方法,但值得注意的是:它也可以被整合进图像分析流程。基于 MATLAB(GNU Octave)、R 或 Python 的工作流允许高度的模块化,在应用高内涵方法时尤为有价值。市面上有大量、且质量优秀的库/模块可用,使用门槛通常不要求具备计算机学位;不过要详尽覆盖这些内容至少需要一整本书的篇幅。作者还鼓励"跳出本领域"思考——许多量化问题已在工程、考古乃至安防领域被解决;毕竟对计算机而言,人也只是一个带突起的中心体。
13. 选择(Choices)
潜在可用软件数量庞大。选择时,应先评估"需要什么"以及"有哪些资源(人力与财力)"。例如,若计划分析 3D 采集数据,软件必须支持 3D 图像分析;接下来还要考虑:用该软件获得有用的数据分析需要多少时间?是否必须翻阅大量手册甚至参加培训?多用途分析软件通常配备数量庞大的量化功能,但对新手可能令人困惑。在例如 Python 中使用库还会额外要求基础的编程能力,但脚本化方法可以更具针对性。商业软件通常被设计为可应对多种图像量化问题,因而具有多用途性;其优势通常包括良好的支持、定期更新以及允许直接提问或参加培训的服务;但其缺点除了成本外,还可能包括有限的工作流控制——尽管论文可能使用某款特定软件,但隐藏算法的可靠性往往难以判断;商业软件没有"控制正确性"的选项。若研究由公共资金资助,应考虑使用公共资金开发的软件。Fig. 5 的决策图可帮助选择软件;图中提到的例子代表文中讨论过的一组软件选项。
关键要点(Take-Home Message)
作者在本章末尾归纳了若干关键要点:分析软件的选择取决于可用专业度——软件的通用性越强,把它用于具体任务所需的时间越多;专用软件有助于快速产出结果;多用途软件通常要求更高的用户专业度,但在大多数情况下可以通过插件/模块的整合转变为专用软件;开源软件提供算法透明度,但通常缺乏快速的支持渠道;闭源软件支持好但缺乏透明度,且存在软件产品停产后数据可能完全丢失的风险;现代解释型编程语言易学,并提供大量模块来构建专门化工作流,特别适合手头的分析任务;所付出的学习努力会很快被最终生成的实用软件所补偿。
免费软件链接(Links for Free Software)
本章末尾按类别列出了一系列免费软件/库的官方链接,方便读者按"编程语言 / 采集 / 数据库 / 图像分析 / Python 模块"快速定位。编程语言包括 Python(python.org)、Octave、CRAN 上的 R、Oracle 的 Java;采集类包括 micro-manager.org、python-microscopy.org、ImSwitch;数据库类包括 Open Microscopy Environment 的 OMERO 与 IDR;图像分析类包括 ImageJ、Fiji、Icy、QuPath、CellTracker、TScratch(ETH CSE-Lab 下载页)、Wound-healing-size-tool(GitHub)、Shapemetrics(GitHub)、Adapt(Barry GitHub)、SMorph(GitHub)、Surface_and_Direction_Detector(ARRohwedder GitHub)、Cloudbuster(ARRohwedder GitHub)、VAMPIRE_open(kukionfr GitHub)、TrackMate、Meijering 软件页的 MTrackJ;Python 模块包括 Open3D、PythonAwesome 的 3D 点云库、scikit-image、scikit-learn、avifilelib 等。这些链接与正文各节中所引用的工具一一对应(如 [5]–[28] 等参考文献所示),方便读者按方法学需求对照选择。
本章个人批注
本章的写作视角很特殊——它不是"工具综述 + 操作指南",而是"选择决策框架"。Rohwedder 把可用软件分为三层(采集 / 量化 / 数据分析),并强调"采集与硬件耦合、量化与硬件部分耦合、解读与硬件解耦"——这种分层与他随后区分"纯量化 vs. 数据解读"的论述是同构的。对于做细胞迁移实验的生物学家来说,本章最有用的不是"哪个工具最好"的结论,而是"为什么几乎没有一个工具能同时满足提取所有特征 + 帮助筛选相关参数"的判断——这一点直接对应到"用户必须组合多类软件"的现实操作。Table 1 的价值也在于此:它把"参数—描述—可用技术"做成一张映射表,让研究者能在实验设计阶段就知道"用 2D 还是 3D、是阻抗还是成像"会解锁哪些参数。我注意到 Table 1 把"凋亡(Apoptosis)"列为只能由阻抗测量的参数——这与第 13 章把凋亡归为细胞死亡/病毒诱导的细胞学事件略不一致;但本章的"凋亡"很可能特指"早期凋亡导致的细胞形态/贴壁变化能被阻抗信号检测",而不是把所有凋亡形式都纳入,与"成像难捕捉早期形态变化"的现实一致。另外,Fig. 5 的决策图把"专门软件 vs. 多用途软件 vs. 自定义工作流"分到不同分支,并让"用户专业度"作为横向维度——这其实是在回应他多次强调的"几乎没有任何软件兼具所有特征"。我读完后留下两个具体疑问:(1) TrackMate 与 MTrackJ 都被归为"基于 ImageJ 的单细胞追踪工具",但 TrackMate 已支持机器学习而 MTrackJ 没有——作者选择 MTrackJ 作为"低细胞数场景"代表、TrackMate 作为"自动化/机器学习代表"是有意为之的对比,还是说 MTrackJ 仍有一些 TrackMate 缺乏的能力?(2) "Python Microscope 与 μManager/ImSwitch 都被归为开源采集软件"的并列中,前者要求 Python 集成(模块化高但门槛高),后者是通用 GUI 工具(门槛低但分析能力有限)——这两者的目标用户显然是不同的,作者却没有在文字里把这种"门槛—模块化"的取舍显式化,可能让读者误以为"两个开源选项随便挑一个"。最后,本章的参考文献(1–28)覆盖了从 2014 到 2022 的关键工具论文,对需要快速溯源的研究者很有价值——很多引用都是 Tools/Methods 类的,定位就是"软件条目"。
与上下章的衔接(一段话)
本章在全书结构中扮演"实验—分析"链条的最后一环:前面章节(特别是第 7 章 Methods to Investigate Cell Migration、第 9 章 Using High-Resolution Imaging to Investigate Cell Migration In Vitro、第 10 章 Computational Modelling of Cell Migration)都在讲"如何采集、如何建模",而本章回答的是"采集到数据之后用什么工具把它转成可发表的参数"。作者特别把"成像"作为主线(覆盖第 9 章的高分辨活细胞成像、第 7 章中的伤口愈合等时间序列方法),把"阻抗"作为侧线——这与全书"成像为主、其他技术为辅"的取向一致;同时他在第 5、6 章讲过的"细胞形态"被进一步发展成"形态学量化"这一独立工具族,并通过 Table 1 把"参数—测量技术"的映射明确化。从下游看,本章的"数据分析层"为第 10 章的计算建模提供了"输入侧的接口说明"——计算模型往往假定已经提取了例如平均速度、方向性比、总迁移距离等参数,而本章正是告诉读者"这些参数是哪些软件、用什么方法提取出来的"。与下一章(第 12 章 Pharmacological Strategies for Targeting Cancer Cell Migration and Invasion)的衔接则更间接:本章给出"如何测量迁移"的工具,下一章则开始讨论"如何用药物干预迁移",因此本章也是第 12 章所有干预实验数据的"测量学背书"。综合来看,本章是全书第一部分(基础—采集—分析)向第二部分(干预—建模)过渡的"分析学收尾",它的"软件选择决策树(Fig. 5)"也是全书第一次把"工具选择"作为一个独立的研究设计维度系统地呈现出来。