第 1 章:概率、图与因果模型导论(Introduction to Probabilities, Graphs, and Causal Models)
1.1.1 Why Probabilities?
因果意味着律则性的必然,而概率则意味着例外性、怀疑与缺乏规律。尽管两者在语义上对张,但作者主张以概率语言切入因果分析,原因有二。第一层原因较为直接:日常因果陈述("鲁莽驾驶导致事故""你因懒惰会不及格")本身就内含不确定性——前件只是让后件更可能,而非必然。概率语言正是刻画这种"程度差异"的标准工具;而且经济学、流行病学、社会学、心理学等使用因果建模的学科,已将概率论奉为正式数学语言,研究者关心的不只是因果连接是否存在,还关心其强度以及如何从噪声观测中推断。第二层原因更为微妙:即便最笃定的自然语言因果表达也都潜藏例外,而确定性逻辑无法容忍这些例外。例如下面两条前提:(1) "我邻居的屋顶每逢我家屋顶湿了也跟着湿";(2) "如果我用水管冲我家屋顶,它会湿",字面合并会推出"我用水管冲屋顶时邻居屋顶也湿"这一悖论。悖论源自语言粒度的有限性——前提 (1) 中隐含的"除非被塑料布盖住"等例外未被显化。一旦把这些例外补全,悖论消失;概率论因其"容忍未显化例外"的特性,恰好绕开了这类伪悖论。然而作者也提醒:容忍例外只解决了部分与因果相关的问题,剩下的推断、干预、识别、分支、混杂、反事实与解释等核心议题仍是本书主线。第 7 章会回到确定性逻辑,用概率仅作为刻画未观测事实之不确定性的工具。
1.1.2 Basic Concepts in Probability Theory
本节是对后续章节所需概率基础概念的速览,并特意强化了贝叶斯推断及其与人类不确定性推理心理学的联系——这一视角在标准教科书中通常缺席。全书聚焦有限离散变量系统,所需的记号与概念并不复杂,连续变量情形会扼要提及。作者采用贝叶斯解释:概率编码的是对世界事件的信念程度,观测数据用于强化、更新或削弱这些信念。信念度赋给语言中的命题,遵循概率演算规则。形式上,信念度量须满足三条公理:\(0 \le P(A) \le 1\);必然命题概率为 1;互斥事件的概率可加。由可加性立即推出:任一事件 \(A\) 可写为 \((A \land B) \cup (A \land \neg B)\),从而 \(P(A) = P(A, B) + P(A, \neg B)\);更一般地,\(P(A) = \sum_i P(A, B_i)\),其中 \(\{B_i\}\) 是穷尽且互斥的命题集(一个划分或变量),此即"全概率公式",对 \(B\) 求和的操作叫"边际化",所得 \(P(A)\) 称为边际概率。
在贝叶斯形式体系中,核心表达式是条件概率 \(P(A \mid B)\):在 \(B\) 已知为真的前提下,对 \(A\) 的信念。\(P(A \mid B) = P(A)\) 时称 \(A\) 与 \(B\) 独立;\(P(A \mid B, C) = P(A \mid C)\) 时称给定 \(C\) 下 \(A\) 与 \(B\) 条件独立。与传统"用联合事件定义条件概率"的做法不同,贝叶斯学派把条件关系视为比联合事件更基本——\(B\) 充当知识背景的指针,\(A \mid B\) 是 \(B\) 所指定语境下的事件 \(A\)(如疾病 \(B\) 语境下的症状 \(A\))。由此,经验知识总是以条件概率陈述编码,联合事件概率(若需要)通过乘积 \(P(A, B) = P(A \mid B) P(B)\) 算出。链式法则进一步把 \(n\) 个事件的联合概率分解为 \(n\) 个条件概率之积。
贝叶斯推断的核心是著名的反转公式:\(P(H \mid e) = P(e \mid H) P(H) / P(e)\),即在获得证据 \(e\) 之后对假设 \(H\) 的信念度,等于先验信念 \(P(H)\) 乘以证据在 \(H\) 下的似然 \(P(e \mid H)\)。\(P(H \mid e)\) 称为后验,\(P(H)\) 称为先验,分母 \(P(e)\) 仅是归一化常数。从形式上看 (1.13) 是 (1.14) 的同义反复,但贝叶斯主观主义者把它视为响应证据而更新信念的规范规则——条件概率不是纯数学构造,而是忠实翻译"已知 \(A\)"这一英文表达的原初概念。其推论之一是:发现 \(A\) 之后对 \(B\) 的信念,从不低于发现前对 \(A \land B\) 的信念,且二者之比随对 \(A\) 的惊讶度 \(P(A)^{-1}\) 线性增长。
为完成这一节铺垫,作者介绍"概率模型(概率空间)":它是对信息的编码,使我们能按公理 (1.1)–(1.3) 计算每个良构句子 \(S\) 的概率。传统指定方法采用联合分布函数——对样本空间(初等事件,即每个原子命题或其否定各出现一次的合取式)赋非负权重且总权重为 1;任一布尔公式 \(S\) 的概率由可加性公理按初等事件权重求和得出。联合分布函数是判断"信息是否足以唯一确定完整概率模型""信息是否一致""还差什么"的核心工具(看能否唯一确定每个初等事件概率、看概率之和是否为 1)。然而实际中很少显式指定联合分布:连续随机变量用正态、指数等代数式;离散变量则发展出"由局部关系推断整体"的间接表示法,其中"图模型"是本书通篇讨论的对象,其使用与形式刻画将在随后几节展开。
1.1.3 Combining Predictive and Diagnostic Supports
本节用"先验几率"与"似然比"两个量重写贝叶斯公式,更清晰地分解为"预测支持"与"诊断支持"两个因子。令 \(O(H) = P(H)/P(\neg H)\) 为先验几率,\(L(e \mid H) = P(e \mid H)/P(e \mid \neg H)\) 为似然比,则后验几率 \(O(H \mid e) = P(H \mid e)/P(\neg H \mid e)\) 满足 \(O(H \mid e) = L(e \mid H) \cdot O(H)\)。先验几率 \(O(H)\) 度量的是背景知识单独赋予 \(H\) 的预测(前瞻)支持,似然比 \(L\) 度量的是实际观测证据 \(e\) 赋予 \(H\) 的诊断(回顾)支持——二者的乘积即证据 \(e\) 与背景 \(K\) 共同作用下的整体信念强度。作者强调,\(L(e \mid H)\) 在概念上可能依赖于背景知识库 \(K\) 的内容,但贝叶斯技术的威力源于:在因果推理中,\(P(e \mid H)\) 是一种相当局部的依赖——一旦 \(H\) 为真,\(e\) 的概率估计可以自然进行且不依赖知识库中太多其他命题。例如,医疗知识的组织范式把"症状"视为疾病的稳定特征:一旦患者确诊为某病 \(H\),估计其出现症状 \(e\) 的概率就相对独立于流行病学背景、既往病史或仪器故障等因素。正因如此,\(P(e \mid H)\) 而非 \(P(H \mid e)\) 才是贝叶斯分析的原子关系——前者拥有类似逻辑规则的模块性,传递"若 \(H\) 则 \(e\) 这类规则的置信度,且该置信度不依赖知识库中的其他规则或事实。
Example 1.1.1(夜半警铃)以三家假设为依据:(a) 真正有入室企图时警铃触发概率 95% 即 \(P(\text{alarm} \mid \text{burglary}) = 0.95\);(b) 假警率 1% 即 \(P(\text{alarm} \mid \text{no burglary}) = 0.01\);(c) 一夜发生入室的先验 \(P(\text{burglary}) = 10^{-4}\)。由 (1.19) 得 \(O(\text{burglary} \mid \text{alarm}) = (0.95/0.01) \times 10^{-4} = 0.0095\),再由 \(P(A) = O(A)/(1+O(A))\) 得 \(P(\text{burglary} \mid \text{alarm}) \approx 0.00941\)。警铃证据把"入室"信念从万分之一推到千分之九点四,约百倍增幅;但因系统约每三月一假警,最终信念仍在 1% 以下并不奇怪。值得注意的是,计算只需 \(P(\text{alarm} \mid \text{burglary})\) 与 \(P(\text{alarm} \mid \text{no burglary})\) 之比,绝对值无需估计。
1.1.4 Random Variables and Expectations
"变量"指可能取某一指定域中若干可能值(outcome)的属性、测量或询问;当我们对变量可能取值附以信念(即概率)时,称之为"随机变量"。本书主要分析有限随机变量集 \(V\)(也称划分),其中每个变量 \(X \in V\) 取值域 \(D_X\)。记号约定:大写字母(\(X, Y, Z\))表变量名,小写字母(\(x, y, z\))表具体取值。命题 \(X = \text{yellow}\) 描述一个事件,即满足该命题的全部可能世界状态之集合;任一变量 \(X\) 也可视为对世界状态的一种划分。变量与变量集之间通常不做记号区分:变量集 \(Z = \{X, Y\}\) 本质上定义一个复合变量,其取值域为 \(D_X \times D_Y\),\(z\) 代表满足 \(X = x, Y = y\) 的 \((x, y)\) 对。
对实值随机变量可定义均值或期望 \(E(X) = \sum_x x P(x)\),以及条件均值 \(E(X \mid y) = \sum_x x P(x \mid y)\);\(X\) 任意函数 \(g\) 的期望为 \(E[g(X)] = \sum_x g(x) P(x)\)。特别地,\(g(X) = (X - E(X))^2\) 的期望称为方差 \(\sigma_X^2\);条件均值 \(E(X \mid Y = y)\) 是给定观察 \(Y = y\) 后对 \(X\) 的"最优估计"(以最小化期望平方误差 \(\sum_x (x - x')^2 P(x \mid y)\) 为准)。两个变量函数的期望需要联合概率 \(P(x, y)\);最重要的是乘积 \(g(X, Y) = (X - E(X))(Y - E(Y))\) 的期望,即协方差 \(\sigma_{XY}\),归一化后得相关系数 \(r_{XY} = \sigma_{XY}/(\sigma_X \sigma_Y)\),以及回归系数 \(r_{XY} = r_{XY} \cdot \sigma_X/\sigma_Y = \sigma_{XY}/\sigma_Y^2\)。给定 \(Z = z\) 下的条件方差、条件协方差与条件相关系数类似定义,其中条件相关系数为 \(r_{XY \mid z} = \sigma_{XY \mid z}/(\sigma_{X \mid z} \sigma_{Y \mid z})\)。正态分布特有的性质留待第 5.2.1 节再述。
以上定义针对离散(取值有限或可数)随机变量。实际更常用的是连续随机变量,其特征由密度函数 \(f(x)\) 给出:\(P(a \le X \le b) = \int_a^b f(x) dx\)(\(a \le b\))。若 \(X\) 离散,\(f(x)\) 与概率函数 \(P(x)\) 相同,只要把积分按 \(\int \leftrightarrow \sum\) 翻译即可——例如连续期望 \(E(X) = \int x f(x) dx\)。读者熟悉的连续分析可按此翻译规则在本书中无缝对接。本节末尾顺势引出下一节主题:变量间条件独立关系的定义——它是因果建模中的核心概念。
1.1.5 Conditional Independence and Graphoids
Definition 1.1.2(条件独立) 设 \(V = \{V_1, V_2, \ldots\}\) 是有限变量集,\(P(\cdot)\) 是 \(V\) 上的联合概率函数,\(X, Y, Z\) 是 \(V\) 的任意三个子集。若 \(P(x \mid y, z) = P(x \mid z)\) 在 \(P(y, z) > 0\) 时恒成立,则称 \(X\) 与 \(Y\) 在给定 \(Z\) 条件下独立——即一旦知道 \(Z\),再学习 \(Y\) 不会改变对 \(X\) 的信念(\(Z\) 在 \(X\) 与 \(Y\) 之间"屏蔽"了相关信息)。
作者采用 Dawid (1979) 记号 \((X \perp\!\!\!\perp Y \mid Z)_P\)(简记 \((X \perp\!\!\!\perp Y \mid Z)\))表示 \(X\) 与 \(Y\) 在 \(P\) 中给定 \(Z\) 条件独立:\((X \perp\!\!\!\perp Y \mid Z) \iff P(x \mid y, z) = P(x \mid z)\)。无条件的边际独立记为 \((X \perp\!\!\!\perp Y \mid \emptyset)\),即 \(P(x \mid y) = P(x)\)(当 \(P(y) > 0\))。注意 \((X \perp\!\!\!\perp Y \mid Z)\) 蕴含 \(X\) 中每个变量与 \(Y\) 中每个变量都条件独立于 \(Z\),但反之不一定成立。
条件独立关系满足以下五类(部分)性质(统称"图公理 graphoid axioms",由 Pearl & Paz 1987 与 Geiger et al. 1990 提出,并被证明在多种"信息相关性"解释下都成立):
- 对称性 \((X \perp\!\!\!\perp Y \mid Z) \Rightarrow (Y \perp\!\!\!\perp X \mid Z)\);
- 分解 \((X \perp\!\!\!\perp YW \mid Z) \Rightarrow (X \perp\!\!\!\perp Y \mid Z)\);
- 弱并 \((X \perp\!\!\!\perp YW \mid Z) \Rightarrow (X \perp\!\!\!\perp Y \mid ZW)\);
- 收缩 \((X \perp\!\!\!\perp Y \mid Z) \land (X \perp\!\!\!\perp W \mid ZY) \Rightarrow (X \perp\!\!\!\perp YW \mid Z)\);
- 交(严格正分布下成立) \((X \perp\!\!\!\perp W \mid ZY) \land (X \perp\!\!\!\perp Y \mid ZW) \Rightarrow (X \perp\!\!\!\perp YW \mid Z)\)。
这五条性质可由 (1.28) 与概率论基本公理直接证得。直觉上:对称性说明"若 \(Y\) 关于 \(X\) 无新信息,则 \(X\) 关于 \(Y\) 也无新信息";分解性说明"两项信息合并后对 \(X\) 不相关,则各项分别也不相关";弱并说明"已无关的信息 \(W\) 不会让无关信息 \(Y\) 变得相关";收缩与弱并一起说明"无关信息不会改变其他命题的相关性状态——原相关的仍相关,原无关的仍无关";交说明"若 \(Y\) 在知道 \(W\) 时对 \(X\) 无关,且 \(W\) 在知道 \(Y\) 时对 \(X\) 无关,则 \(Y\) 与 \(W\)(及其合并)都对 \(X\) 无关"。在图中,这些性质可解释为:"\((X \perp\!\!\!\perp Y \mid Z)\) 意味着 \(X\) 子集节点到 \(Y\) 子集节点的全部路径都被 \(Z\) 子集节点截断"。
1.2.1 Graphical Notation and Terminology
一个图由顶点集 \(V\)(节点)与边集 \(E\)(链接)组成,连接若干对顶点。本书中的图节点对应变量,边表示变量对的某种关系(其解释随应用而变);被边直接相连的两变量称为相邻。每条边可有向(单箭头)或无向(无标记);在某些应用中还会用到"双向边"(虚线弧上两箭头)表示未观测的共同原因(混杂因子)。若所有边均有向,称该图为有向图;把所有箭头抹去得到的无向图称为该图的骨架。图中的"路径"是边的序列(如 \(\{(W, Z), (Z, Y), (Y, X), (X, Z)\}\)),每条边起点为前一条边终点,路径可顺可逆箭头方向。若路径中每条边箭头都从第一点指向第二点,则称有向路径;例如 \(\{(W, Z), (Z, Y)\}\) 有向,但 \(\{(W, Z), (Z, Y), (Y, X)\}\) 与 \(\{(W, Z), (Z, X)\}\) 不是。若两节点间存在路径则称连通,否则称断开。
有向图可包含有向环(如 \(X \to Y \to X\),表示互为因果或反馈过程)但不能含自环(\(X \to X\))。无有向环的图(图 1.1)称为"非循环图"(acyclic);同时有向且非循环(图 1.1(b))称为"有向非循环图"(DAG),它将在本书因果讨论中占主导地位。书中沿用亲属关系术语(父母、子女、后代、祖先、配偶)描述图中的关系,沿完整箭头方向定义(含构成有向环的箭头,但忽略双向边与无向边)。图 1.1(a) 中,\(Y\) 有两父 \(X, Z\)、三祖先 \(X, Z, W\),无子女;\(X\) 无父(故无祖先)、一配偶 \(Z\)、一子女 \(Y\)。"家族"指含某节点及其全部父母的节点集合。有向图中无父的节点为根(root),无子女的为汇(sink);每个 DAG 至少有一根一汇。每个节点至多一父的连通 DAG 称为树(tree),每个节点至多一子女的树称为链(chain)。每对节点都有边相连的图称为完全图;图 1.1(a) 连通但非完全(因 \((W, X), (W, Y)\) 不相邻)。
1.2.2 Bayesian Networks
图在概率与统计建模中扮演三重角色:(1) 便于表达实质性假设;(2) 便于经济地表示联合概率函数;(3) 便于高效地由观测进行推断。本节从 (2) 切入:要显式存储 \(n\) 个二值变量的任意联合分布 \(P(x_1, \ldots, x_n)\) 需 \(2^n\) 条记录,规模不可想象。幸运的是,每个变量通常只依赖少数其他变量——这种"局部依赖"允许把大分布分解为若干小分布(每个涉及少量变量)再拼合以回答全局问题,图在这一分解中扮演核心角色,刻画了各知识状态下哪些变量彼此相关。
研究者既用无向图也用有向图实现这种分解。无向图(又称马尔可夫网)主要用于表示对称的空间关系(Isham 1981;Cox & Wermuth 1996;Lauritzen 1996);有向图(特别是 DAG)用于表示因果或时序关系(Lauritzen 1982;Wermuth & Lauritzen 1983;Kiiveri et al. 1984),并被冠以"贝叶斯网络"之名(Pearl 1985 首创),强调三点:(i) 输入信息的主观性;(ii) 以贝叶斯条件化为更新基础;(iii) 区分因果与证据两种推理模式,呼应 Thomas Bayes 1763 年的论文。混合图(有向与无向兼有)也曾被提出,但本书以有向非循环图为主,必要时用有向循环图表示反馈。
有向非循环图提供的基本分解如下:设 \(P\) 是 \(n\) 个离散变量上的分布,变量可任意排序为 \(X_1, \ldots, X_n\)。由链式法则,\(P\) 总能分解为 \(n\) 个条件分布之积 \(P(x_1, \ldots, x_n) = \prod_j P(x_j \mid x_1, \ldots, x_{j-1})\)。若某变量 \(X_j\) 的条件概率对所有前驱不敏感、只对其前驱的一个小子集 \(PA_j\) 敏感,即 \(P(x_j \mid x_1, \ldots, x_{j-1}) = P(x_j \mid pa_j)\),则只需关注 \(PA_j\) 各种取值,存储大幅简化。\(PA_j\) 称为 \(X_j\) 的"马尔可夫父节点"或简称父节点。
Definition 1.2.1(马尔可夫父节点) 设 \(V = \{X_1, \ldots, X_n\}\) 是有序变量集,\(P(v)\) 是这些变量上的联合分布。\(X_j\) 的一个父节点集 \(PA_j\) 是 \(X_j\) 的前驱 \(\subseteq \{X_1, \ldots, X_{j-1}\}\) 的子集,满足:(i) \(P(x_j \mid pa_j) = P(x_j \mid x_1, \ldots, x_{j-1})\);(ii) \(PA_j\) 的任何真子集都不满足 (i)。换言之,\(PA_j\) 是使 \(X_j\) 与其他前驱条件独立的最小前驱集。
构造算法(递归):从 \((X_1, X_2)\) 起,若 \(X_1\) 与 \(X_2\) 依赖则画箭头 \(X_1 \to X_2\);处理 \(X_3\) 时,若 \(X_3\) 与 \(\{X_1, X_2\}\) 独立则不画箭头,否则检查 \(X_2\) 是否屏蔽 \(X_3\) 与 \(X_1\)(画 \(X_2 \to X_3\))或 \(X_1\) 是否屏蔽 \(X_3\) 与 \(X_2\)(画 \(X_1 \to X_3\)),若都没有则从 \(X_1, X_2\) 都画箭头到 \(X_3\)。一般地,第 \(j\) 步选一组使 \(X_j\) 与其他前驱屏蔽的最小前驱集 \(PA_j\),并从 \(PA_j\) 每个成员画箭头到 \(X_j\)。所得到的 DAG 称为贝叶斯网络,其中 \(X_i \to X_j\) 把 \(X_i\) 标为 \(X_j\) 的马尔可夫父节点。可以证明(Pearl 1988b):若 \(P\) 严格正(即对每个构型 \(v\) 都有有限概率),则 \(PA_j\) 唯一,因此贝叶斯网络在给定变量序下唯一。
图 1.2 给出一个典型贝叶斯网络,描述季节 \(X_1\)、是否下雨 \(X_2\)、洒水器是否开 \(X_3\)、路面是否湿 \(X_4\)、路面是否滑 \(X_5\) 之间的关系。除根 \(X_1\)(春/夏/秋/冬四值)外都是二值变量。\(X_1\) 与 \(X_5\) 之间无直接连边,是因为"季节对人行道湿滑的影响"被其他条件(路面湿度)中介——这一定性直觉恰好对应 (1.32) 的独立性条件,因为一旦知道 \(X_4\)(路面湿),\(X_5\) 与 \(\{X_1, X_2, X_3\}\) 条件独立。Definition 1.2.1 构造的贝叶斯网络是一个沿着构造顺序承载条件独立关系的载体。任何满足 (1.32) 的分布必能由链式法则 (1.30) 分解为乘积 \(P(x_1, \ldots, x_n) = \prod_i P(x_i \mid pa_i)\)。例如图 1.2 诱导的分解为 \(P(x_1, x_2, x_3, x_4, x_5) = P(x_1) P(x_2 \mid x_1) P(x_3 \mid x_1) P(x_4 \mid x_2, x_3) P(x_5 \mid x_4)\)。
Definition 1.2.2(马尔可夫相容) 若概率函数 \(P\) 相对 DAG \(G\) 满足 (1.33) 的因式分解,则称 \(G\) 表示 \(P\),或 \(G\) 与 \(P\) 相容,或 \(P\) 相对 \(G\) 是马尔可夫的。相容性之所以重要,是因为它是"DAG \(G\) 能解释经验数据 \(P\)"(即描述可生成 \(P\) 的随机过程)的充要条件。若每个变量 \(X_i\) 依据某概率 \(P_i(x_i \mid pa_i)\)(仅基于已选定的 \(pa_i\))随机取值,则所生成实例 \(x_1, \ldots, x_n\) 的总体分布 \(P\) 必相对 \(G\) 是马尔可夫的;反之若 \(P\) 相对 \(G\) 马尔可夫,则存在 \(P_i(x_i \mid pa_i) = P(x_i \mid pa_i)\) 的选择使生成分布等于 \(P\)。刻画与 DAG \(G\) 相容的分布集有一个便利方法:列出每个这种分布必满足的(条件)独立关系——这些独立关系可借由图的"d-分隔"判据从 DAG 读出("d"表方向,Pearl 1988b),d-分隔将在本书许多讨论中扮演关键角色。
1.2.3 The d-Separation Criterion
设 \(X, Y, Z\) 是 DAG \(G\) 中三个互不相交的变量集。要判断在任一与 \(G\) 相容的分布中 \(X\) 与 \(Y\) 在给定 \(Z\) 下是否独立,需要看 \(Z\) 节点是否"阻断" \(X\) 节点到 \(Y\) 节点的全部路径。这里"路径"指图中边的连续序列(任意方向),"阻断"则按下列定义理解为停止依赖流。
Definition 1.2.3(d-分隔) 一条路径 \(p\) 被节点集 \(Z\) d-分隔(阻断)当且仅当:(1) \(p\) 包含链 \(i \to m \to j\) 或分叉 \(i \leftarrow m \to j\),且中点 \(m \in Z\);或 (2) \(p\) 包含倒分叉(碰撞)\(i \to m \leftarrow j\),且中点 \(m \notin Z\) 且 \(m\) 的所有后代均不在 \(Z\) 中。一组 \(Z\) 被称为 d-分隔 \(X\) 与 \(Y\) 当且仅当 \(Z\) 阻断 \(X\) 节点到 \(Y\) 节点的每一条路径。
d-分隔的直觉可由赋予箭头因果含义来理解。在因果链 \(i \to m \to j\) 与因果分叉 \(i \leftarrow m \to j\) 中,两个极端变量边际相关,但一旦条件化(中点 \(m\) 已知),它们彼此独立——条件化 \(m\) 阻断了信息沿路径的流动。但倒分叉 \(i \to m \leftarrow j\)(两个原因共享一个结果)方向相反:若两极端变量(边际)独立,条件化 \(m\)(共同结果)会使它们变得相关。图 1.2 可作示例:知道季节 \(X_1\) 后,\(X_3\)(洒水器)与 \(X_2\)(雨)独立(假设洒水器按季节预设);但发现路面湿 \(X_4\) 或滑 \(X_5\) 后 \(X_2, X_3\) 变得相关——否定其中一个解释会增加另一个解释的概率。
形式上:\(X = \{X_2\}, Y = \{X_3\}, Z = \{X_1\}\) 时,\(X_2\) 与 \(X_3\) 被 \(Z\) d-分隔,因两条路径都被 \(Z\) 阻断(路径 \(X_2 \leftarrow X_1 \to X_3\) 是分叉,中点 \(X_1 \in Z\);路径 \(X_2 \to X_4 \leftarrow X_3\) 是倒分叉,中点 \(X_4\) 及其后代都不在 \(Z\))。但 \(Z = \{X_1, X_5\}\) 不能 d-分隔 \(X, Y\)——路径 \(X_2 \to X_4 \leftarrow X_3\)(倒分叉)未被 \(Z\) 阻断,因为 \(X_4\) 的后代 \(X_5 \in Z\)。"条件化一个不在阻断路径上的节点反而打开该路径"看似奇怪,但它对应一般因果模式:对两个独立原因的共同结果的观察会使两原因条件相关——这在统计学中称为"选择偏倚"或 Berkson 悖论(Berkson 1946),在 AI 中称为"解释消除"效应(Kim & Pearl 1983)。例:某研究生院录取要么看本 GPA 要么看音乐特长,则在校生群体中这两项呈(负)相关,即便在总人口中不相关。
更复杂的 d-分隔示意见图 1.3:(a) 含双向弧 \(Z_1 \leftrightarrow Z_3\);(b) 含直接环 \(X \to Z_2 \to Z_1 \to X\)。图 (a) 中 \(X\) 与 \(Y\) 在不测 \(\{Z_1, Z_2, Z_3\}\) 时被 \(Z_2\) d-分隔;测 \(Z_1\) 则打开路径 \(X \to Z_1 \leftrightarrow Z_3 \leftarrow Y\)(因 \(Z_1\) 是 \(Z_1\) 处的碰撞点且 \(Z_1\) 是 \(Z_3\) 的后代——通过路径 \(Z_1 \to Z_2 \to Z_3\))。图 (b) 中 \(X\) 与 \(Y\) 不能被任何节点集 d-分隔(含空集):条件化 \(Z_2\) 阻断 \(X \to Z_1 \to Z_2 \to Y\) 但打开 \(X \leftarrow Z_2 \to Y\);条件化 \(Z_1\) 阻断 \(X \to Z_1 \to Z_2 \to Y\) 但因 \(Z_1\) 是碰撞点 \(Z_2\) 的后代而打开 \(X \leftarrow Z_2 \to Y\)。
Theorem 1.2.4(d-分隔的概率含义,Verma & Pearl 1988) 在 DAG \(G\) 中,若 \(X\) 与 \(Y\) 被 \(Z\) d-分隔,则在每个与 \(G\) 相容的分布中 \(X\) 与 \(Y\) 在 \(Z\) 条件下条件独立;反之若 \(X\) 与 \(Y\) 在 \(G\) 中不被 \(Z\) d-分隔,则在与 \(G\) 相容的至少一个分布中 \(X\) 与 \(Y\) 在 \(Z\) 条件下条件相关。逆命题实际更强——d-分隔不存在意味着在几乎所有与 \(G\) 相容的分布中都相关(因为要产生"未阻断路径上的独立"需对参数的精确调节,实际几乎不可能发生,详见 Spirtes et al. 1993 及 2.4、2.9.1 节)。
为区分概率的条件独立 \((X \perp\!\!\!\perp Y \mid Z)_P\) 与图的 d-分隔 \((X \perp\!\!\!\perp Y \mid Z)_G\),作者引入新记号把上述定理简记为:\((X \perp\!\!\!\perp Y \mid Z)_G \Rightarrow (X \perp\!\!\!\perp Y \mid Z)_P\)(当 \(G\) 与 \(P\) 相容),其逆在"对所有相容分布成立"时也成立。Lauritzen et al. (1990) 还基于"祖先图"给出 d-分隔的另一种检验:测试 \((X \perp\!\!\!\perp Y \mid Z)_G\) 时,从 \(G\) 中删除 \(\{X, Y, Z\}\) 及其祖先以外的所有节点,将有共同子节点的每对节点连边,并抹去所有箭头;所得无向图中 \(Z\) 截断 \(X\) 与 \(Y\) 之间全部路径当且仅当原图中 \((X \perp\!\!\!\perp Y \mid Z)_G\) 成立。值得注意:构造图所用的变量序不再影响 d-分隔判据,只有图拓扑决定 \(P\) 必满足的独立集。
Theorem 1.2.6(有序马尔可夫条件) 概率分布 \(P\) 相对 DAG \(G\) 马尔可夫的充要条件是:存在与 \(G\) 箭头方向一致的某种变量序,使每个变量在其前驱中条件独立于所有前驱。
Theorem 1.2.7(父节点马尔可夫条件) \(P\) 相对 \(G\) 马尔可夫的充要条件是:每个变量在 \(G\) 中条件独立于其所有非后代(给定其父节点;\(X_i\) 自身从"非后代"中排除)。这一定理由 Kiiveri et al. (1984) 与 Lauritzen (1996) 称为"局部"马尔可夫条件,在某些教材中(Howard & Matheson 1981)被直接作为贝叶斯网络的定义;但实际中有序马尔可夫条件更易使用。
d-分隔还引出判断两 DAG 是否"观测等价"(即任一与某 DAG 相容的分布必与另一相容)的判据。
Theorem 1.2.8(观测等价,Verma & Pearl 1990;Frydenberg 1990 独立得出) 两 DAG 观测等价当且仅当它们有相同骨架和相同的 v-结构集——所谓 v-结构是指两箭头汇聚而其尾不相连(即形如 \(X \to Z \leftarrow Y\) 且 \(X, Y\) 不相邻)。
观测等价限定了仅从概率推断方向的能力——两观测等价的网络无法在不借助操纵性实验或时间信息的情况下区分。例如把图 1.2 中 \(X_1 \to X_2\) 反向既不引入也不消除 v-结构,因此该反向得到一个观测等价的网络,\(X_1 \to X_2\) 方向性无法从概率信息中确定。而 \(X_2 \to X_4\) 与 \(X_4 \to X_5\) 的方向性则"非对称"——任何反向都会创造新的 v-结构,因此某些概率函数(如图 1.2 那个)在无时间信息辅助时可以约束图中某些箭头的方向。方向性约束的精确含义与从数据推断因果关系的可能性,将留待第 2 章形式化。
1.2.4 Inference with Bayesian Networks
贝叶斯网络是 1980 年代初为 AI 系统中预测与"溯因"任务开发的。在这些任务中,需要找到对当前观察的相容解释,使之与观察和先验信息均一致。数学上任务化为计算 \(P(y \mid x)\),其中 \(X\) 是观察集、\(Y\) 是被预测或诊断的重要变量。给定联合分布 \(P\),\(P(y \mid x) = \sum_s P(y, x, s) / \sum_{y, s} P(y, x, s)\),\(S\) 是 \(X, Y\) 之外的全部变量;因每个贝叶斯网络定义了联合 \(P\)(如 (1.33)),显然 \(P(y \mid x)\) 可由 DAG \(G\) 与定义在 \(G\) 家族上的条件概率 \(P(x_i \mid pa_i)\) 算出。挑战在于:在网络拓扑提供的表示层级下高效完成这些计算——后者对生成解释的推理系统尤为重要。
作者概述三种主要算法:消息传递架构(限制于树,Pearl 1982;Kim & Pearl 1983)让每个变量充当简单处理器,向邻居异步传递消息直至有限步内达到平衡;后来扩展到一般网络的方法中最著名的有 Lauritzen & Spiegelhalter (1988) 的"连接树传播"——把网络分解为团(clique)树状结构,每个团内变量作为复合变量与邻居传消息,例如图 1.2 可组织为三个团的马尔可夫相容链 \(\{X_1, X_2, X_3\} - \{X_2, X_3, X_4\} - \{X_4, X_5\}\);以及"割集条件化"方法(Pearl 1988b, pp. 204–10;Jensen 1996)——将一组变量实例化(取特定值)使剩余网络成树,在树上传播,再换一组实例化直至穷尽所有组合,结果求平均;图 1.2 中若实例化 \(X_1\)(如 \(X_1 = \text{summer}\))则 \(X_2, X_3\) 间路径被打断,剩余网络呈树结构。割集条件化的优势是存储需求最小(与网络规模线性),而连接树方法可能为指数级。Shachter et al. (1994) 与 Dechter (1996) 等还提出混合方法以灵活权衡存储与时间(Darwiche 2009)。一般网络上的精确推断属"NP 难"(Cooper 1990),但可预先估计复杂度;若超出合理范围,可用诸如随机模拟(Pearl 1988b, pp. 210–23)之类的近似方法——它利用网络拓扑对局部变量子集执行 Gibbs 采样。DAG 在专家系统证据推理中的更多性质与应用参见 Pearl (1988b)、Lauritzen & Spiegelhalter (1988)、Pearl (1993a)、Spiegelhalter et al. (1993)、Heckerman et al. (1995) 与 Darwiche (2009)。
1.3 Causal Bayesian Networks
把 DAG 解读为"独立假设载体"并不必然蕴含因果;任何沿某种变量序(不必是因果或时序)的递归独立集都适用。然而 DAG 模型在统计与 AI 应用中的普遍存在(往往未被自觉地)主要源于其因果解读——即将其视为"按家族划分的过程系统",能够解释观测数据的产生。正是因果解读解释了为何 DAG 模型几乎从不按非时序、非因果的变量序构造。
按因果而非按关联信息构造 DAG 模型有若干优势。第一,建模所需的判断更有意义、更易获取因而更可靠:让读者尝试按 \((X_5, X_1, X_3, X_2, X_4)\) 的次序为图 1.2 的关联建一个 DAG 即可体会——某些独立关系对心智而言比其他更鲜明,而条件独立判断只有锚定在因果关系等更根本的构件上才易获取(因而可靠)。在图 1.2 的例中,我们之所以愿意断言"一旦知道 \(X_4\)(路面湿)则 \(X_5\) 与 \(X_2, X_3\) 独立",是因为这可以翻译为"雨与洒水器对滑度的影响被路面湿度中介"。没有因果支撑的依赖被视为奇怪乃至"悖论"(参见第 1.2.3 节 Berkson 悖论讨论)。本书多个场合将展示因果优先于关联:在极端情形下,人们甚至完全忽略概率信息而只关注因果(见 6.1.4 节)。这动摇了统计中图模型的统治范式(Wermuth & Lauritzen 1990;Cox & Wermuth 1996)——后者把条件独立假设作为表达实质知识的主要载体;若条件独立判断不过是存储因果关系的副产物,那么直接表示因果关系才是更自然、更可靠的知识表达——这正是"因果贝叶斯网络"背后的哲学。
第二,按因果构造贝叶斯网络的另一项优势(也是理解因果组织的基础)是可以表示并响应外部或自发性变化。环境中任何局部的机制重构只需对网络拓扑作小修改即可同构反映。例如:要表示图 1.2 故事中"洒水器坏了",只需删除与 Sprinkler 节点关联的全部链接;表示"若下雨则关掉洒水器"这一策略,只需加一条 Rain → Sprinkler 链接并修正 \(P(x_3 \mid x_1, x_2)\)。若网络不是按因果方向而是按 \((X_5, X_1, X_3, X_2, X_4)\) 这样的次序构造,这些变化将需要大得多的重构工作量。这种"重构灵活性"可视为区分慎思型与反应型主体的关键——使前者能即时应对新颖情境而无需训练或适应。
1.3.1 Causal Networks as Oracles for Interventions
上述灵活性的根源在于假设网络中每个父-子关系代表稳定且自治的物理机制——即可以单独改变其中一个而不影响其他。把知识组织成这种模块化结构使我们能以最少的额外信息预测外部干预的效果。确实,因果模型(假设有效)所承载的信息远多于纯概率模型。联合分布告诉我们事件有多可能、概率如何随后续观察变化;因果模型还告诉我们这些概率在外部干预(如政策分析、治疗管理、日常规划)下会如何变化——这种变化即便从完全指定的联合分布中也无法推出。
模块性与干预的关联如下:我们无须为每种可能的干预各指定一个新概率函数,只需指定该干预所蕴含的局部变化;由自治性假设,这种变化是局部的,不会扩散到未指明的其他机制。一旦知道干预改变了哪个机制、改变的形态如何,干预的整体效果就可通过修改 (1.33) 中对应因子、用修改后的乘积计算新概率函数来预测。例如要表示图 1.2 中"打开洒水器"这一动作,删去 \(X_1 \to X_3\) 链接并把 \(X_3\) 赋值为 On(参见图 1.4);所得剩余变量的联合分布为 \(P_{X_3 = \text{On}}(x_1, x_2, x_4, x_5) = P(x_1) P(x_2 \mid x_1) P(x_4 \mid x_2, X_3 = \text{On}) P(x_5 \mid x_4)\),其中右侧各因子由自治性知与 (1.34) 中相同。删除 \(P(x_3 \mid x_1)\) 因子意味着"无论动作前季节与洒水器之间存在何种关系,在执行动作期间该关系不再生效——一旦我们物理地把洒水器打开并保持开,则新机制(与季节无关)决定洒水器状态"。
注意动作 \(do(X_3 = \text{On})\) 与观察 \(X_3 = \text{On}\) 的区别:后者效果由普通贝叶斯条件化 \(P(x_1, x_2, x_4, x_5 \mid X_3 = \text{On})\) 给出,前者由"截断图"(删除 \(X_1 \to X_3\) 链接后)上的条件化给出。这正映射"看"与"做"的区别——观察到洒水器开之后我们想推断季节干燥、不太可能下雨等;在评估"打开洒水器"这一设想的动作时不应做此推断。
因果网络预测动作效果的能力当然需要在构造时使用更强假设——基于因果(而非仅关联)的知识,确保系统按"自治性原则"对干预做出反应。
Definition 1.3.1(因果贝叶斯网络) 设 \(P(v)\) 是变量集 \(V\) 上的概率分布,\(P_x(v)\) 表示把变量子集 \(X\) 强制置为常数 \(x\) 的干预 \(do(X = x)\) 所得分布。令 \(P^*\) 是所有干预分布 \(P_x(v)\)(\(X \subseteq V\))之集,包括 \(P(v)\)(表示无干预即 \(X = \emptyset\))。DAG \(G\) 称为与 \(P^*\) 相容的因果贝叶斯网络当且仅当以下三条对每个 \(P_x \in P^*\) 成立:
- \(P_x(v)\) 相对 \(G\) 是马尔可夫的;
- 对所有 \(V_i \in X\),当 \(y_i\) 与 \(X = x\) 一致时 \(P_x(y_i) = 1\);
- 对所有 \(V_i \notin X\),当 \(pa_i\) 与 \(X = x\) 一致时 \(P_x(y_i \mid pa_i) = P(y_i \mid pa_i)\),即每条 \(P(y_i \mid pa_i)\) 对不涉及 \(V_i\) 的干预保持不变。
Definition 1.3.1 对干预空间 \(P^*\) 加约束,使我们能用单个贝叶斯网络 \(G\) 经济地编码这一庞大空间。由这些约束,任一干预 \(do(X = x)\) 后的分布 \(P_x(v)\) 可由截断分解 \(P_x(v) = \prod_{i : V_i \notin X} P(y_i \mid pa_i)\)(对所有与 \(x\) 一致的 \(v\))算出,这从条件 (i)–(iii) 推出并与之等价,从而为 \(G\) 上的"家族删除"程序(如 (1.36))提供了理论依据。可以证明:若 \(G\) 相对 \(P^*\) 是因果贝叶斯网络,则以下两条性质必成立。
Property 1 对所有 \(i\):\(P(y_i \mid pa_i) = P_{pa_i}(y_i)\),即父节点集 \(PA_i\) 相对其子女 \(V_i\) 是外生的,确保条件概率 \(P(y_i \mid pa_i)\) 等于把 \(PA_i\) 外部控制为 \(pa_i\) 时对 \(V_i\) 的效应。
Property 2 对所有 \(i\) 及与 \(\{V_i, PA_i\}\) 不交的任意变量子集 \(S\):\(P_{pa_i, s}(y_i) = P_{pa_i}(y_i)\),即一旦控制直接原因 \(PA_i\),其他任何干预都不影响 \(V_i\) 的概率。这表达了"不变性"概念。
1.3.2 Causal Relationships and Their Stability
上述基于机制的干预概念为"因果效应""因果影响"等概念(将在第 3、4 章形式化)提供了语义基础。例如要测试 \(X_i\) 是否对 \(X_j\) 有因果影响,可用 (1.37) 截断分解公式计算 \(X_j\) 在 \(do(X_i = x_i)\) 下的(边际)分布 \(P_{x_i}(x_j)\),看该分布是否对 \(x_i\) 敏感。易见网络中只有 \(X_i\) 的后代才会被 \(X_i\) 影响——从联合分布中删除 \(P(x_i \mid pa_i)\) 因子使 \(X_i\) 在截断图中成为根节点,而根节点(由 d-分隔判据)独立于除其后代之外的所有变量。
这种"因果影响"的认识让我们看清为何因果关系比概率关系更"稳定"——以及在哪方面更稳定。我们预期这种稳定性差异,是因为因果关系是本体论的,描述世界中客观物理约束;而概率关系是认知的,反映我们所知或所信。因此因果关系在环境中无变化时保持不变,即便我们对环境的认知发生变化也保持不变。以因果陈述 \(S_1\)("打开洒水器不影响下雨")和其概率对应 \(S_2\)("洒水器状态独立于(或不关联于)雨状态")对比(图 1.2):\(S_2\) 在两种情形下发生改变而 \(S_1\) 不变。第一,\(S_2\) 在我们得知季节(\(X_1\))时由假变真;第二,已知季节后,一旦观察到路面湿(\(X_4 = \text{true}\))则 \(S_2\) 由真变假。而 \(S_1\) 无论得知或了解季节、路面情况都保持为真。该例揭示了因果关系比对应概率关系更稳定的更强意义——超出本体-认知基本差异。\(S_1\) 将在"调节季节如何影响洒水器"这一机制变化下保持不变,事实上它对图 1.2 中所有机制的变化都保持不变。因此因果关系在本体变化下也表现出更强鲁棒性——它们只对更小的机制集敏感。更具体且与概率关系形成鲜明对比的是:因果关系在管理因果变量的机制(如例中 \(X_3\))发生变化时仍保持不变。
鉴于这种稳定性,难怪人们偏好按因果而非按概率结构编码知识。概率关系(边际与条件独立)在由未受控观察假设初始因果结构时可能有帮助;然而一旦知识被铸成因果结构,那些概率关系往往被遗忘——人们对条件独立的判断是从所获因果结构派生的。这解释了为何人们自信地断言某些条件独立(如"中国豆价与洛杉矶交通独立")而对所涉数值概率一无所知(不知豆价是否超过 $10/蒲式耳)。
稳定性(机制的不变性)也是所谓"解释性"因果论的核心——它认为因果模型无须编码"干预下行为",而应主要提供"数据如何产生"的"解释"或"理解"。无论"理解"最终作何用,我们必然偏好以可在情境间迁移的稳定关系来理解,而不是以短暂关系为根据。充分解释所伴随的"可理解性",其本质是因果关系的可迁移性(从而也是我们对其的熟悉程度)的副产物。正因稳定性之故,我们把气压下降视为"预测"而非"解释"下雨;这种预测不能迁移到气压被人为控制的情境。真正的理解能在那些机制变化、新机制被加入的新颖情境中仍能作预测。因此可以合理地认为,因果的"解释性"论述只是"操纵性"论述的一个变体——只是其中干预处于潜伏状态。相应地,我们对"数据如何产生"或"事物如何运作"的渴求,可以被理解为"获取在更广泛情境下(包含情境被拆解、被重构或自发变化)作预测的能力"的追求。
1.4 FUNCTIONAL CAUSAL MODELS
本书对贝叶斯网络的因果解读方式与因果模型(及因果图)最初引入遗传学(Wright 1921)、计量经济学(Haavelmo 1943)和社会学(Duncan 1975),以及物理与工程中日常使用的方式有着根本差异。在那些模型中,因果关系以确定性函数方程表达,概率通过"某些变量未观测"假设引入——这反映了 Laplace (1814) 的自然现象观:自然律是确定性的,随机性仅因我们对边界条件无知而产生。与之对比,因果贝叶斯网络定义中假设所有关系"内在随机",更符合现代(量子力学)物理观——自然律本质上是概率的,确定性仅为方便近似。
本书倾向 Laplace 的准决定论因果观,并常用它(与随机观对照)来定义与分析本书研究的多数因果实体。这一倾向基于三点考虑。第一,Laplacian 观更一般:每个随机模型都可由多个函数关系(带随机输入)模拟,反之不然——函数关系只能以极限方式由随机模型逼近。第二,Laplacian 观更契合人类直觉:少数与 Laplacian 观冲突的量子力学实验让人惊讶与不信,并迫使物理学家放弃对局域性与因果性的既有直觉(Maudlin 1994);本书目标是保留、阐明并满足这些直觉,而不是摧毁它们。第三,Laplacian 框架内才能定义人类话语中无处不在的某些概念。例如"事件 \(B\) 因 \(A\) 而发生的概率"与"若无 \(A\),\(B\) 本会不同的概率"这类反事实概念,不能在纯随机模型中定义——这些所谓的反事实概念需要 Laplacian 模型中确定性与概率成分的综合。
1.4.1 Structural Equations
函数式因果模型的一般形式由形如 \(x_i = f_i(pa_i, u_i), i = 1, \ldots, n\) 的方程组构成,其中 \(pa_i\)(表示 parents)是直接决定 \(X_i\) 取值的变量集,\(U_i\) 是因遗漏因子产生的误差(或"扰动")。(1.40) 是对线性结构方程模型(SEM)\(x_i = \sum_k a_{ik} x_k + u_i\) 的非线性、非参数推广,后者在经济学与社会科学中已成标准工具(见第 5 章详述);在线性模型中 \(pa_i\) 对应 (1.41) 右端系数非零的那些变量。(1.40) 中函数关系的解释是物理与自然科学中函数的常见解释——它是一份"配方""策略"或"律",规定自然对 \((PA_i, U_i)\) 每种可能取值组合会给 \(X_i\) 分配什么值。形如 (1.40) 且每条方程代表自治机制的方程组称为结构模型;若每个变量在以之为左端(因变量)的方程中只出现一次,则称结构因果模型或简称因果模型。结构方程与代数方程的数学区别是:结构方程的任何子集本身就是一个有效的结构模型——它代表某组干预下的条件。
为说明,图 1.5 描绘一个把价格与需求联系起来的经济计量学典范模型,由方程 \(q = b_1 p + d_1 i + u_1\) 与 \(p = b_2 q + d_2 w + u_2\) 构成:\(Q\) 是某产品 \(A\) 的家庭需求量,\(P\) 是单价,\(I\) 是家庭收入,\(W\) 是产品 \(A\) 的工资率,\(U_1, U_2\) 是误差项(影响数量与价格的未建模因素,Goldberger 1992)。该模型对应的图是有环的,与 \(U_1, U_2, I, W\) 关联的顶点是根节点,传递"相互独立"假设。"自治性"(Aldrich 1989)在此意味着两方程代表经济中松耦合的两段——消费者与生产者。方程 (1.42) 描述消费者如何决定购买数量 \(Q\),(1.43) 描述厂商如何决定价格 \(P\)。与所有反馈系统一样,这也代表隐含动态——今日价格基于昨日需求而定,这些价格将决定下一交易期的需求;方程的解代表在 \(U_1, U_2\) 等背景量保持不变假设下的长期均衡。
两方程在"动态变化"意义上被认为是"自治的"——影响一方的外部变化不蕴含另一方的变化。例如政府决定价格管制、把价格 \(P\) 定为 \(p_0\) 时,(1.43) 将被改写为 \(p = p_0\) 但 (1.42) 中关系保持完整,给出 \(q = b_1 p_0 + d_1 i + u_1\)。于是 \(b_1\)("需求弹性")应解释为 \(Q\) 对 \(P\) 的每单位"受控变化"的响应率;这与 \(Q\) 对 \(P\) 的每单位"观察变化"的响应率不同(后者除 \(b_1\) 还受 (1.43) 参数影响,见 7.2.1 节 (7.14))。"受控"与"观察"变化的区别对正确解读社会科学与经济学中的结构方程模型至关重要,将于第 5 章详述。如有理由相信消费者行为也会在价格管制政策下改变,则需在辅助方程中把 \(b_1, d_1\) 显式建模为依赖 \(P\) 的因变量;7.2.1 节将用该模型分析政策相关问题。
非线性函数模型的运作可用图 1.2 因果关系再作说明:与之对应的因果模型含五个函数,每个代表支配一个变量的自治机制:\(x_1 = u_1, x_2 = f_2(x_1, u_2), x_3 = f_3(x_1, u_3), x_4 = f_4(x_3, x_2, u_4), x_5 = f_5(x_4, u_5)\)。误差变量 \(U_1, \ldots, U_5\) 在图中未显式绘出,按惯例意味着假定它们相互独立;当某些扰动被判定为依赖时,惯例上以双头箭头(图 1.1(a))增补到图中。函数集 \(\{f_1, \ldots, f_5\}\) 与扰动项的典型规范由以下布尔模型给出:\(x_2 = [(X_1 = \text{winter}) \lor (X_1 = \text{fall}) \lor u_2] \land \neg \bar{u}_2\),\(x_3 = [(X_1 = \text{summer}) \lor (X_1 = \text{spring}) \lor u_3] \land \neg \bar{u}_3\),\(x_4 = (x_2 \lor x_3 \lor u_4) \land \neg \bar{u}_4\),\(x_5 = (x_4 \lor u_5) \land \neg \bar{u}_5\),其中 \(x_i\) 表示 \(X_i = \text{true}\),\(u_i, \bar{u}_i\) 分别表示触发与抑制异常事件。例如 \(u_4\) 表示"洒水器关且无雨时仍使路面湿"的未明事件(如水管爆裂),\(\bar{u}_4\) 表示"即便下雨、洒水器开且 \(u_4\) 发生仍使路面干"的事件(如路面被塑料布覆盖)。
值得强调的是,上述两模型中放在等号左端(因变量或输出变量)的变量在每条方程中的角色与其他变量截然不同。这种区分在讨论干预时至关重要——只有借助它才能识别"把价格定为 \(p_0\)"(\(do(P = p_0)\))或"打开洒水器"(\(do(X_3 = \text{true})\))这类局部干预应当修改哪条方程。
接着比较 (1.40) 函数模型与 1.3 节因果贝叶斯网络的特征。为此考察三类查询的处理:
- 预测(如:发现洒水器关,路面会滑吗?)
- 干预(如:若我们使洒水器关,路面会滑吗?)
- 反事实(如:路面其实不滑且洒水器开,若洒水器原本关着,路面会滑吗?)
可见这三类查询代表三种根本不同的任务层级,对知识细节的需求逐级递增。
1.4.2 Probabilistic Predictions in Causal Models
给定因果模型 (1.40),若从 \(PA_i\) 每个成员向 \(X_i\) 画箭头,所得图 \(G\) 称为因果图。若因果图无环,则相应模型称为半马尔可夫的,且 \(X\) 变量值由 \(U\) 变量值唯一决定;此条件下联合分布 \(P(x_1, \ldots, x_n)\) 由误差变量分布 \(P(u)\) 唯一确定。若除无环外误差项还联合独立,则该模型称为马尔可夫因果模型(Markovian)。
关于马尔可夫因果模型的一个基本定理通过 Theorem 1.2.7 的父节点马尔可夫条件建立了因果与概率的连接。
Theorem 1.4.1(因果马尔可夫条件,Pearl & Verma 1991) 每个马尔可夫因果模型 \(M\) 诱导的分布 \(P(x_1, \ldots, x_n)\) 满足相对其因果图 \(G\) 的父节点马尔可夫条件——即每个变量 \(X_i\) 在给定其父节点 \(PA_i\) 下独立于其所有非后代。
证明直接:集合 \(\{PA_i, U_i\}\) 决定 \(X_i\) 的唯一取值,故分布 \(P(x_1, \ldots, x_n, u_1, \ldots, u_n)\) 必相对增广 DAG \(G(X, U)\)(显式表示 \(U\) 变量)是马尔可夫的;\(P(x_1, \ldots, x_n)\) 的所需马尔可夫条件由 \(G(X, U)\) 上的 d-分隔推出。Theorem 1.4.1 说明 Theorem 1.2.7 的父节点马尔可夫条件源于两条因果假设:(1) 我们承诺把"作为两个或多个其他变量之原因"的每个变量纳入模型(而非归入背景);(2) Reichenbach (1956) 的"共同原因"假设(即"无因果不相关"——若两变量相关,则一为另一之因或存在第三变量为两者之因)。这两条蕴含背景 \(U\) 中因子相互独立,从而模型是马尔可夫的。Theorem 1.4.1 既解释了为何马尔可夫模型在因果分析中被如此频繁地假设,也解释了为何父节点马尔可夫条件(Theorem 1.2.7)常被视为因果模型的内禀特征(见 Kiiveri et al. 1984;Spirtes et al. 1993)。
因果马尔可夫条件意味着:把每个"子女-父节点"关系刻画为确定性函数(而非通常的条件概率 \(P(x_i \mid pa_i)\)),对所得分布施加等价的独立约束,并导出刻画贝叶斯网络同样的递归分解(见 (1.33))。更重要的是,这并不依赖函数 \(\{f_i\}\) 的具体选取或误差分布 \(P(u_i)\)——一旦测得(或估计)\(P(x_i \mid pa_i)\),马尔可夫因果模型的所有概率性质就确定了,无关心生成这些条件概率的实际机制为何。Druzdzel & Simon (1993) 已证明:对于由分布 \(P\) 刻画(如 (1.33))的每个贝叶斯网络 \(G\),都存在一个生成与 \(P\) 相同分布的函数模型(如 (1.40))。因此在贝叶斯网络的所有概率应用中(包括统计估计、预测与诊断),都可使用等价的函数模型 (1.40),并把函数模型视作联合分布函数的另一种编码。
但因果-函数式规范即使在纯预测(非操纵性)任务中也比概率规范有若干优势。首先,因果图 \(G\) 显示的全部条件独立都被保证是稳定的——即对机制 \(f_i\) 与分布 \(P(u_i)\) 的参数变化保持不变。这意味着选择用马尔可夫因果模型组织知识的智能体可以在不评估数值概率的情况下作出关于条件独立关系的可靠断言——这在人类中常见且对推断有用。其次,函数式规范往往更有意义且自然、参数更少。典型例子是社会科学与经济学中的线性结构方程(见第 5 章),以及在建模多二值原因效应时流行的"噪声 OR 门"(Pearl 1988b, p. 184)。第三(也许对经验主义者最难接受的是),可观测量的条件独立判断在函数模型中变得简化且更可靠——因为它们被直接表示为"是否存在未观测共同原因"的判断(例如"为何中国豆价被判断与洛杉矶交通独立?")。构造贝叶斯网络时,我们不必判断每个变量是否在其父节点下独立于其所有非后代,而只需判断父节点集是否包含所有相关直接原因——特别是判断被父节点集遗漏的因子是否同时是其他可观测变量的原因。这类判断更自然,因为它们可由定性因果结构直接识别——而定性因果结构正是心智为存储经验中稳定方面所选用的结构。
最后,基于因果机制的预测模型还有一项源自稳定性(第 1.3.2 节)的优势。环境中某些条件变化时,通常只有少数因果机制受影响;其余保持不变。知道对应的符号变化也是局部的(仅涉及少数参数),重新评估(判断)或重新估计(统计)模型参数比从头重新估计整个模型更简单。
1.4.3 Interventions and Causal Effects in Functional Models
函数特征化 \(x_i = f_i(pa_i, u_i)\) 与其随机对应物一样,为"指定结果分布如何随外部干预而变化"提供了便利语言。办法是把每种干预编码为对一组选定函数(而非一组条件概率)的变更;干预的整体效果可通过修改模型中的相应方程并用修改后的模型计算新概率函数预测。因果贝叶斯网络(第 1.3 节)的所有特征在马尔可夫函数模型中都能复现。
例如要在 (1.44) 模型中表示"打开洒水器",删去方程 \(x_3 = f_3(x_1, u_3)\),代之以 \(x_3 = \text{On}\)。修改后的模型包含计算动作对其他变量影响所需的全部信息:例如修改模型诱导的概率函数等于 (1.36),修改图与图 1.4 一致。更一般地,当干预强制变量子集 \(X\) 取固定值 \(x\) 时,(1.40) 中一组方程要被剪除(每个 \(X\) 成员一条),由此定义剩余变量上的新分布,刻画干预效果,并与从因果贝叶斯网络中剪除家族所得的截断分解 (1.37) 一致。
函数模型对干预的表示比随机模型更灵活、更一般。首先,干预分析可扩展到有环模型(图 1.5),以回答政策相关问题(如:"若我们把价格控制为 \(p_0\),需求量为多少?")。其次,涉及修改方程参数(如 (1.42) 中 \(b_1, d_1\))的干预比"条件概率修改"更易理解——也许是因为稳定物理机制通常与方程关联而非与条件概率关联:条件概率被视为由联合分布派生的,而非联合分布的生成元。第三,非马尔可夫模型中因果效应分析将因函数模型大幅简化。原因是:对离散变量 \(X_i\) 与 \(PA_i\) 而言,条件概率 \(P(x_i \mid pa_i)\) 有无穷多个,而函数 \(x_i = f_i(pa_i, u_i)\) 只有有限个。这一事实使第 8 章 8.2.2 节能用线性规划技术在涉及不依从(noncompliance)的研究中得出因果效应的锐界。
最后,函数模型允许分析"情境特定"的动作与策略。迄今定义的因果效应在实用政策制定中价值有限——它只给出动作引发响应的整体倾向(如药物对总体人群的康复倾向),但不针对由一组特定观察刻画的情境中的动作(这些观察本身可能受动作影响)。医生通常关心"对已经检查且有某症状的病人施加治疗的效应"——某些症状本身将受治疗影响。同样,经济学家关心"在由若干经济指标刻画的经济情境中施加税收的效应"——这些指标(再次)将受税收影响。这类情境特定因果效应无法通过在静态贝叶斯网络中模拟干预来计算,因为情境本身随干预变化,条件概率 \(P(x_i \mid pa_i)\) 也随之变化。但函数关系 \(x_i = f_i(pa_i, u_i)\) 保持不变,这使我们可以按下一节所述计算情境特定因果效应(详见 7.2.1、8.3、9.3.4 节)。
1.4.4 Counterfactuals in Functional Models
现在转向函数模型最显著的特征——反事实分析。某些反事实句子(如前所述)无法在随机因果网络框架内定义。为说明其困难,考虑最简单的因果贝叶斯网络——一对独立(因而不相连)的二值变量 \(X, Y\)。这种网络出现在对照(即随机化)临床试验中:发现治疗 \(X\) 对受试者反应 \(Y\) 的分布无影响(\(Y\) 可为康复 \(Y = 0\) 或死亡 \(Y = 1\))。假设某受试者 Joe 接受治疗且已死亡;我们问:Joe 之死是否因治疗而起?反之还是无关治疗?换言之,我们求 Joe 若未受治疗是否会死的概率 \(Q\)。
为突出回答此类反事实问题的困难,取极端情形:治疗组与对照组中 50% 病人康复、50% 死亡;进一步设样本量趋于无穷,得到 \(P(y \mid x) = 1/2\)(对所有 \(x, y\))。熟悉统计检验的读者会立即认识到从已有数据回答反事实问题的不可能性——Joe 接受了治疗且死亡,从未在"未治疗"条件下被测试过。此外困难不在于把问题针对特定个体 Joe(他只有一个数据点)。把问题改用总体频率重述——问"治疗组已故受试者中有多大比例 \(Q\) 若未受治疗会康复"——会遇到相同困难,因为这些受试者都没有在"未治疗"条件下被测过。这种困难使部分统计学家把反事实问题斥为形而上学,主张把统计分析限制在只回答那些可直接检验的问题(Dawid 2000)。
然而,科学、法律与日常语言中反事实表达俯拾皆是,这清楚说明反事实远非形而上学;它们必有明确的可检验含义并承载宝贵的实质信息。反事实分析因此对共享本书目标的任何人都是一个机遇——把实质知识与统计数据相整合以提炼前者并解释后者。在这一框架下,反事实议题要求回答一些棘手但可处理的技术问题:反事实查询的经验内容是什么?回答这些查询需要什么知识?这种知识如何用数学表示?给定这样的表示,导出答案需要什么样的数学机制?
第 7.2.2 节将给出反事实的经验解释——把反事实视为关于"某些机制时序持续性"的断言。在前述例子中,每个(仍存活)病人对治疗的反应被假定为持续的。若 \(Y\) 是可逆条件而非死亡,反事实主张将直接转化为对未来治疗反应的预测。但即便在死亡情形下,反事实量 \(Q\) 也不仅是对已故受试者假设行为的猜测——它还蕴含对"未治疗组存活者如接受治疗将如何"的可检验断言。我们留作读者练习证明:基于 (1.46)、除抽样变异外,治疗组已故受试者中"若未治疗本会康复"的比例 \(Q\) 恰好等于未治疗组存活者中"如接受治疗将死"的比例 \(Q\)——尽管 \(Q\) 是假设性的,\(Q\) 是无可争议地可检验的。
在勾勒反事实的经验解释后,本导论章的下一步是表示问题:回答反事实问题需要什么知识?应如何公式化这些知识,使反事实查询能被快速可靠地回答?这种表示的存在性可由"人区分似真与不似真反事实陈述"的速度与一致性来证实——多数人会同意 Clinton 总统的历史地位若未遇见 Monica Lewinsky 将会不同,但只有少数人会断言 Clinton 若昨天未吃早餐其历史地位会改变。在认知科学中,这种意见一致性已近于"某种有效机制存在于人脑中以表示并操作反事实"的证明——那种机制的构件是什么?
一种直截了当的表示方案会:(i) 以反事实前提的形式存储反事实知识,(ii) 用某种从前提到结论的逻辑推理规则导出反事实查询的答案。哲学家 Robert Stalnaker (1968) 与 David Lewis (1973a,b) 已采用此路径,以"最近世界"语义构造反事实逻辑("若 \(A\) 则 \(B\)"当且仅当在与我们世界最相近且 \(A\) 真的可能世界中 \(B\) 成立)。然而最近世界语义仍留下两个未解之问:(1) 选什么距离度量才能让反事实推理与日常因果概念相容?(2) 什么跨世界距离的心智表示能让反事实计算对人或机器都易处理、实用?这两个问题将由第 7 章展开的结构模型方法回答。
统计学家在"潜在结果"框架(Rubin 1974;Robins 1986;Holland 1988)中也追求了一条与 Lewis 相似(但较不形式化)的路径。实质知识以反事实变量间的概率关系(如独立性)表示,再用于估计因果效应。表示问题从"最近世界"转向"潜在结果":反事实变量间的概率关系如何在研究者心智中存储或推断?第 7 章(另见 3.6.3 节)将分析最近世界与潜在结果方法,并与下文展开的"结构模型"方法对比——后者把反事实由函数因果模型 (1.40) 导出(事实上由其定义)。
为看清反事实与结构方程的连接,先考察为什么贝叶斯网络中的信息(即便采用因果解读)不足以回答反事实查询。再考虑对照随机实验例子 (1.46)——对应于无边贝叶斯网络(图 1.6(a)),含两个独立二值变量及联合概率 \(P(y, x) = 0.25\)(对所有 \(x, y\))。现给出两个函数模型,各自生成 (1.47) 的联合概率但给出"所求量 \(Q\)——已故受试者(\(x = 1, y = 1\))若未受治疗(\(x = 0\))本会康复(\(y = 0\))的概率"——不同值。
Model 1(图 1.6(b)) 令 \(x = u_1, y = u_2\),其中 \(U_1, U_2\) 是两个独立二值变量,\(P(u_1 = 1) = P(u_2 = 1) = 1/2\)(如随机硬币)。
Model 2(图 1.6(c)) 令 \(x = u_1, y = x u_2 + (1 - x)(1 - u_2)\),\(U_1, U_2\) 仍为独立二值变量。
Model 1 对应"对所有受试者无作用"的治疗;Model 2 中每个受试者都受治疗影响。两模型给出相同分布的原因是 Model 2 描述两个子总体的混合——一子总体(\(u_2 = 1\))中受试者当且仅当接受治疗时死亡(\(y = 1\)),另一子总体(\(u_2 = 0\))中受试者当且仅当接受治疗时康复(\(y = 0\))。两模型对应的 \(P(x, y, u_2)\) 与 \(P(x, y)\) 分布见 Figure 1.7。\(Q\) 在两模型中不同——Model 1 中 \(Q = 0\)(已故者对应 \(u_2 = 1\),因治疗对 \(y\) 无效,\(X\) 由 1 改为 0 仍给出 \(y = 1\));Model 2 中 \(Q = 1\)(已故受治者必对应 \(u_2 = 1\)——那些接受治疗即死的人——意味着当且仅当未治疗时康复)。
该例的第一课是:随机因果模型不足以计算反事实概率;需要 \(P(y \mid x)\) 背后实际过程的知识。第二课是:函数因果模型构成足以计算(并定义)这些概率的数学对象。例如 Model 2 (1.48) 中我们得出"已故受治者(\(y = 1, x = 1\))若未治疗本会康复"的结论用了三步心理推演。第一步,将手头证据 \(e : \{y = 1, x = 1\}\) 用于模型,得出 \(e\) 仅与 \(U_1, U_2\) 的一种实现相容——\(u_1 = 1, u_2 = 1\)。第二步,为模拟"若他/她未受治疗"的假设条件,把 \(x = 0\) 代入 (1.48) 而忽略第一方程 \(x = u_1\)。第三步,在 \(x = 0, u_2 = 1\) 下解 (1.48) 求 \(y\),得 \(y = 0\),从而在所考虑假设条件下"康复(\(y = 0\))概率"为 1。
这三步可推广为任何因果模型 \(M\) 上的一般程序。给定证据 \(e\),要计算"在假设条件 \(X = x\)(\(X\) 是变量子集)下 \(Y = y\) 的概率",对 \(M\) 实施以下三步:
- 溯因(abduction):更新 \(P(u)\) 为 \(P(u \mid e)\);
- 行动(action):把对应于 \(X\) 中变量的方程替换为 \(X = x\);
- 预测(prediction):用修改后的模型计算 \(Y = y\) 的概率。
用时序隐喻:第 1 步解释过去(\(U\))以呼应当前证据 \(e\);第 2 步(最小地)弯曲历史进程以符合假设条件 \(X = x\);第 3 步基于我们对过去的最新理解和新确立的条件 \(X = x\) 预测未来(\(Y\))。鉴于对每个 \(u\) 值都有 \(Y\) 的唯一解,第 3 步总能给所需概率的唯一解——只需把所有使 \(Y = y\) 成立的 \(u\) 上的 \(P(u \mid e)\) 累加。第 7 章将基于"双网络"上的概率传播(Balke & Pearl 1995a)发展计算反事实概率的有效程序:一个网络代表真实世界,另一个代表反事实世界。
注意假设条件 \(X = x\) 总是与所考虑模型中 \(U\) 的当前值 \(u\) 矛盾(否则 \(X = x\) 实际就会实现而不会被视为假设)。正因如此我们(在第 2 步)调用外部干预(也可称为"理论变化"或"奇迹";Lewis 1973b),它修改模型从而消解矛盾。第 7 章把这种结构-干预模型扩展为对反事实与反事实概率给出完整语义与公理化叙述。与 Lewis 理论对比,这一叙述不基于"假设世界间抽象相似性"概念,而是基于"产生所考虑假设世界"的实际机制。与潜在结果框架对比,结构叙述中的反事实不是未定义的原初概念,而是由更基本的"因果机制及其结构"概念派生的量。
反事实推理的三步模型也揭示了随机因果模型不足以计算反事实概率的真正原因——因为 \(U\) 变量在随机模型中不显式出现,我们无法执行第 1 步以用证据 \(e\) 更新 \(P(u)\)。这意味着基于反事实的几个无处不在的概念——包括原因概率(给定结果)、解释概率、情境依赖因果效应——无法在这样的模型中定义。为此我们必须对函数 \(f_i\) 的形式与误差项概率作某些假设。例如线性、正态与误差独立的假设对计算图 1.5 模型中的所有反事实查询已足够(见 7.2.1 节)。第 9 章将给出:当 \(f_i\) 与 \(P(u)\) 未知,只对这些实体的总体特征(如单调性)作假设时,关于"原因概率"的反事实查询何时可由数据推断。第 8.3 节将给出当只有随机模型可用时如何界定反事实概率。
前述讨论进一步蕴含:本节开头列出的三类任务——预测、干预与反事实——构成因果推理任务的一个自然层级,细节逐级精细、所需知识逐级增长。预测最简单,只需联合分布的规范;干预分析除联合分布外还需因果结构;反事实处理最难,需要关于函数关系与/或遗漏因子分布的某些信息。该层级也定义了本书各章的自然划分——第 2 章主要处理因果贝叶斯网络的概率方面(因果结构将作为概念指南);第 3–6 章专门处理因果模型的干预方面,包括因果效应识别、结构方程模型澄清、混杂与可压缩性的关系;第 7–10 章处理反事实分析,包括公理基础、政策分析应用、反事实查询界定、原因概率识别与单事件因果的阐明。
1.5 CAUSAL VERSUS STATISTICAL TERMINOLOGY
本节定义全书将用的基本术语与概念。这些定义未必与标准来源一致,存疑时请参考本节。
概率参数 是指任何按联合概率函数定义之量(参 1.1 与 1.2 节定义之量)。
统计参数 是指任何按可观测变量的联合概率分布定义之量,对未观测变量的存在与否不作任何假设。例:条件期望 \(E(Y \mid x)\)、回归系数 \(r_{YX}\)、密度函数在 \(y = 0, x = 1\) 处的值。把"未测量变量"从统计参数定义中排除是为了防止把因果假设藏在"潜在变量"幌子下——若允许这种构造,任何量都可称为统计的,从而模糊了"可仅由统计数据估计的量"与"需要数据之外假设的量"之间重要区分。
因果参数 是指任何按因果模型(如 (1.40))定义、且不是统计参数的量。例:(1.41) 中系数 \(a_{ik}\);\(X_9\) 是否对 \(X_3\) 在某 \(u\) 下有影响;干预 \(do(X = 0)\) 下 \(Y\) 的期望值;变量 \(X_7\) 的父节点数。
统计假设 是对可观测变量联合分布的任何约束——如 \(f\) 是多元正态、或 \(P\) 相对给定 DAG \(D\) 是马尔可夫的。
因果假设 是对因果模型的、不能由施加统计假设实现的约束——如 \(f_i\) 是线性的、\(U_i\) 与 \(U_j\)(未观测)不相关、或 \(x_3\) 不出现在 \(f_4(pa_4, u_4)\) 中。因果假设可有可无统计含义——有统计含义的假设称"可检验"或"可证伪"。因果假设常(但不总是)可由实验研究证伪,此时称"实验可检验"。例如 Model 2(图 1.6)中"\(X\) 对 \(E(Y)\) 无效"的假设是可经验检验的,而"\(X\) 可能治愈总体中某受试者"的假设则不可检验。
因果参数与统计参数的区别是鲜明而根本的——两者不混。除非调用因果假设,否则因果参数不能由统计参数识别。这些假设的表述与化简将占本书很大篇幅。
时间先后关系可提供一些关于因果关系(不)存在的信息——后发生事件不能是早发生事件之因。经济分析中常用的时序索引分布 \(P(y_t \mid y_{t-1}, x_t), t = 1, \ldots\) 因此可视为统计与因果模型的边缘情形。但本书仍将之归为统计——因为绝大多数政策相关问题都不能在"对未测量变量存在与否不作假设"的承诺下从这类分布中识别。因此"Granger 因果性"(Granger 1969)与"强外生性"(Engle et al. 1983)等计量经济学概念将归为统计而非因果。
"理论"与"结构"两词常与"因果"互换使用;本书使用后两者,并注意某些结构模型可能不是因果的(见 7.2.5 节)。
Causal versus Statistical Concepts
因果与统计参数的分界线同样延伸到一般概念,并将由术语区分支持。统计概念例:相关、回归、条件独立、关联、似然、可压缩性、风险比、优势比、倾向得分、Granger 因果性等。因果概念例:随机化、影响、效应、混杂、外生性、可忽略性、扰动(如 (1.40))、虚假相关、路径系数、工具变量、干预、解释等。这条分界线的目的不是把因果概念排除出统计分析领域,而是鼓励研究者以合适的工具集处理非统计概念。
有些读者会对"随机化、混杂、虚假相关、效应"等教科书中概念竟属非统计而感到惊讶;另一些读者会对"外生性、混杂、反事实等有争议的概念竟可用因果模型定义"感到震惊。本书为这些读者而写,后面将展示上述因果与统计概念的区分对澄清两者都是必要的。
Two Mental Barriers to Causal Analysis
统计与因果概念的鲜明区分可翻译为一条有用原则:每条因果主张背后必存在某种"不能从联合分布识别、因而无法在观察研究中检验"的因果假设。这种假设通常由人给出、依赖于专家判断。因此人组织与交流经验知识的方式成为研究的一个不可分割部分——它决定专家被请作出的判断的真实性。
该因果-统计区分的另一推论是:任何因果分析的数学方法必须获得新记号。概率演算的词汇(期望、条件化、边际化算子)严格按分布函数定义,因而不足以表达因果假设或因果主张。例如概率演算语法不允许我们表达"症状不引起疾病"这样简单事实,更谈不上从中得出数学结论。我们能说的只是两事件相关——意味着若发现一者,我们可以预期遭遇另一者;但我们无法在标准概率演算中区分"统计依赖"(由条件概率 \(P(\text{disease} \mid \text{symptom})\) 量化)与"因果依赖"(对后者在标准概率演算中没有表达)。
前述两项要求:(1) 以未经检验的判断性假设开启因果分析;(2) 扩展概率演算语法,构成因果分析在传统统计训练专业人士中遭遇接受障碍的两大主因(Pearl 2003c,亦见 11.1.1 与 11.6.4 节)。本书借助基于图形与代数方法共生的高效友好符号系统来帮助克服这两道障碍。
本章个人批注
本章把因果建模的全部后续讨论所需的"语言"系统搭了一遍:先从概率基础(贝叶斯解释、条件独立、贝叶斯公式的几种等价写法)出发,再把"图"作为独立关系载体引入,最后把"自治机制"与"干预"两个关键直觉落到结构方程上。三层结构互相支撑:1.1 节给出概率演算工具,1.2 节把图与概率正式绑定(贝叶斯网络与 d-分隔),1.3 节在贝叶斯网络上引入"父-子关系即机制"的因果解读,1.4 节则把机制具体化为结构方程,1.5 节为全书划清"统计量 vs 因果量"的方法论边界。
我个人最被打动的几个具体点:(i) 1.1.1 的"鲁悖论"——"邻居屋顶湿"+"我冲屋顶"推出"我冲屋顶时邻居屋顶湿",确定性逻辑无法容忍的例外;概率论能容忍,但只是"把问题藏起来",并不解决因果建模的真正困难。(ii) 1.2.3 中 d-分隔的"倒分叉悖论"——条件化共同结果反让独立的原因变相关,对应 Berkson 悖论与"解释消除"效应。这是把"看与做"区分落到图上的关键机制。(iii) 1.4.4 反事实的三步法(溯因-行动-预测),把"\(P(B\) 因 \(A\) 而发生\()\)"这种在随机模型里无法定义的问题,落到结构方程后变得可计算——而且清晰显示出"我们需要的不是更复杂的概率论,而是更基本的机制表达"。
与上下章衔接一章将铺就后续所有讨论的共同词汇;下一章(第 2 章)将在此基础上形式化"从数据推断因果结构"的问题。值得注意的是,1.4.1 末尾明确点出:本章与第 2 章主要走概率路径(即使底层的因果结构是概念指南),第 3–6 章转干预与识别,第 7–10 章转反事实。读者进入第 2 章前应确认:自己已能在 (i) 联合分布、(ii) DAG 上的 d-分隔、(iii) 截断分解 \(P_x(v) = \prod_{V_i \notin X} P(v_i \mid pa_i)\)、(iv) 结构方程 \(x_i = f_i(pa_i, u_i)\) 四种"语言"间自如切换。第 2 章起,处理"因果发现"——给定观测数据,如何在等价 DAG 类中识别哪些箭头是真实机制、哪些只是统计关联。
与上下章的衔接(一段话)
本章是全书的"语言铺垫"——后续所有讨论都在概率、图、因果模型这三种工具的组合中展开。把本章放在最前,是因为即便后续章节涉及高深识别算法或反事实概率的精细计算,其底层语汇仍由本章定义:1.1 节的概率演算与条件独立给出"量"的载体,1.2 节的贝叶斯网络与 d-分隔给出"图上独立关系读取"的工具,1.3 节给出"父-子关系即自治机制"的因果解读,1.4 节用结构方程把"机制"具体化并由此得到反事实推理的三步法,1.5 节把"统计量 vs 因果量"的边界划清以便全书方法论自洽。第 2 章将在本章搭好的"图-概率-机制"三脚架上处理"因果发现"问题——给定观测数据 P,如何在 d-分隔约束下识别哪些有向箭头代表真实机制、哪些只是统计关联(不变量信息下哪些结构是不可区分的)。第 3 章起将处理因果效应识别(在干预分布 P_x 上),第 7 章起处理反事实分析(基于 1.4.4 的三步法)。可以说,后续每一章都在调用本章定义的概念工具;任何对术语的犹豫都可回溯到 1.5 节。