跳转至

第 7 章:基于结构的反事实逻辑(The Logic of Structure-Based Counterfactuals)

7.1 结构模型语义(STRUCTURAL MODEL SEMANTICS)

本节开篇指出,科学家在不同实验条件下从一组实验预测另一组实验的结果,这种能力本质上需要"反事实推断"——即设想世界在各种假设性变动下会变成什么样子。这种推断是科学思维的基础,但难以在标准逻辑、代数方程或概率的语言中形式化。形式化要求一种语言,能把世界中"不变的关系"(机制)与"暂时性的关系"(关于世界的信念)区分开来。结构模型提供了这种区分,源于 Balke and Pearl (1994a,b)、Galles and Pearl (1997, 1998) 和 Halpern (1998) 的工作,与 Rubin (1974) 的实验主义视角形成鲜明对比;相关思路在 Simon and Rescher (1966) 和 Ortiz (1999) 中也有提出。本节从因果模型的确定性定义入手(每个变量有函数关系,函数代表自主机制),因果与反事实关系定义为对机制局部修改的响应。概率关系通过对背景条件赋概率自然涌现。7.1.2 节用例子展示如何在该框架下计算确定性、概率性反事实;7.1.3 节给出用因果图计算反事实概率的一般方法。

7.1.1 因果模型、行动与反事实的定义(Definitions: Causal Models, Actions, and Counterfactuals)

"模型"在日常用法中是现实的理想化呈现;在逻辑系统中则是给语言中的句子赋真值的数学对象——真值表给命题逻辑中的布尔表达式赋真值,概率函数给形如 P(A) ≤ p 的句子赋真值。因果模型需要编码涉及因果关系的句子的真值:行动句("如果我们做 B,则 A 将为真")、反事实("要不是 B,A 本会不同")和朴素因果陈述("A 可能导致 B"或"B 因 A 而发生")。这些句子无法在标准命题逻辑或概率演算中解释,因为它们处理的是"外部世界发生的变化"而非"我们对静态世界信念的变化"。因果模型通过对机制(这种变化中真正被改动的部分)的显式表示来编码并区分关于外部变化的信息。

定义 7.1.1(因果模型):因果模型是三元组 M = ⟨U, V, F⟩,其中 (i) U 是由模型外因素决定的背景变量集(也称外生),(ii) V = {V₁, V₂, …, Vₙ} 是由 U ∪ V 中变量决定的内生变量集,(iii) F = {f₁, f₂, …, fₙ},其中 fᵢ 把 Uᵢ ∪ PAᵢ 映射到 Vᵢ(Uᵢ ⊆ U,PAᵢ ⊆ V \ Vᵢ),整个 F 形成从 U 到 V 的映射,且具有唯一解 V(u)。每个因果模型 M 可与一个有向图 G(M) 关联,节点对应变量,弧从 PAᵢ 和 Uᵢ 指向 Vᵢ——这图仅识别对 Vᵢ 有直接影响的变量,不规定函数形式。父集 PAᵢ 限于 V 是因为背景变量通常不可观测。

定义 7.1.2(子模型):设 M 是因果模型,X 是 V 中变量集,x 是 X 的具体实现。子模型 Mₓ 是 Mₓ = ⟨U, V, Fₓ⟩,其中 Fₓ = {fᵢ : Vᵢ ∉ X} ∪ {X = x},即从 F 中删除 X 中成员对应的所有函数,用常数函数 X = x 替换。子模型用于表示局部行动和假设性变化的效果。把每个 fᵢ 视作独立的物理机制,把行动 do(X = x) 定义为使 X = x 在任何 u 下成立的最小变化,则 Mₓ 代表该最小变化后的模型。Fₓ 改变了 F 的代数内容,这也是 Galles and Pearl (1998) 中"可修改结构方程"这一名称的由来。

定义 7.1.3(行动的效果):行动 do(X = x) 对 M 的效果由子模型 Mₓ 给出。

定义 7.1.4(潜在响应):设 X 和 Y 是 V 的两个子集。Y 对行动 do(X = x) 的潜在响应,记作 Yₓ(u),是方程组 Fₓ 关于 Y 的解,即 Yₓ(u) = Y_{Mₓ}(u)。条件行动 do(X = x) if Z = z 可以通过把方程替换为 Z 的函数(而非常数)来形式化(见 4.2 节)。文中不考虑析取式行动 do(X = x 或 Z = z),因其会复杂化反事实的概率处理。

定义 7.1.5(反事实):句子"Y 在 u 情境下,若 X 为 x 则为 y"被解释为等式 Yₓ(u) = y。定义 7.1.5 把反事实短语"若 X 为 x"解释为对模型方程的假设性修改——它模拟一个外部行动(或自发变化),修改历史的实际进程,并以机制上的最小改动实施条件"X = x"。这是反事实语义的关键一步(Balke and Pearl 1994b),它允许 x 与 X(u) 的当前值不同而不致逻辑矛盾;同时抑制了由前件 X = x 触发的回溯(溯因)推断。第 3 章(3.6.3 节)用 Y(x, u) 表示 Neyman-Rubin 潜在结果模型中的单位条件"单位 u 在 X 为 x 时 Y 取得值";本章起改用 Yₓ(u) 表示专门与结构模型定义 7.1.5 绑定的反事实,Y(x, u) 保留给不承诺任何具体语义的一般虚拟条件句。定义 7.1.5 还使原子机制 {fᵢ} 本身获得干预-反事实解释:yᵢ = fᵢ(paᵢ, uᵢ) 是 Vᵢ 在子模型 M_{V\yᵢ} 中的值,即当我们对 V 中所有其他变量干预时 Vᵢ 的潜在响应。

定义 7.1.6(概率因果模型):概率因果模型是一对 ⟨M, P(u)⟩,其中 M 是因果模型,P(u) 是定义在 U 域上的概率函数。P(u) 加上每个内生变量是 U 的函数这一事实,定义了内生变量上的概率分布:对 V 中任何变量集 Y,有 P(y) = P(Y = y) = Σ_{u : Y(u) = y} P(u)。反事实句的概率以同样方式定义:通过子模型 Mₓ 诱导的函数 Yₓ(u),P(Yₓ = y) = Σ_{u : Yₓ(u) = y} P(u)。同样地,因果模型定义了反事实句的联合分布。P(Yₓ = y, Zᵥ = z) 对任何变量集 Y, X, Z, W(不必互不相交)有定义。P(Yₓ = y, X = x') 和 P(Yₓ = y, Yₓ' = y') 对 x ≠ x' 有定义。

如果 x 与 x' 不相容,Yₓ 和 Yₓ' 不能被同时测量,因此给联合句"Y 在 X = x 时为 y 且 Y 在 X = x' 时为 y'"赋概率似乎无意义。这种担忧成为近期把反事实视为联合分布随机变量的反对意见的源头(Dawid 2000)。把 Yₓ 和 Yₓ' 定义为由标准 U 空间概率测度支配的两个不同子模型中 Y 的解,通过把矛盾的联合句解释为 U 空间中的普通事件来消解这些反对意见。

特别感兴趣的是以实际观测为条件的反事实概率。例如事件 X = x"是"事件 Y = y 的"原因"的概率可解释为:在已知 X = x、Y = y 实际发生的前提下,Y 在 X 不为 x 时不会等于 y 的概率(详见第 9 章)。这些概率在该模型中良定义,需要评估形如 P(Yₓ' = y' | X = x, Y = y) 的表达式,x' 和 y' 分别与 x 和 y 不相容。式 (7.4) 允许按以下方式评估该量:先用证据更新 P(u) 得到 P(u | x, y),再用更新后的分布 P(u | x, y) 计算等式 Yₓ'(u) = y' 的期望。这证实了 1.4 节引入的三步程序。

定理 7.1.7:给定模型 ⟨M, P(u)⟩,反事实句"若 A 则 B"在证据 e 给定下的条件概率 P(B | A, e) 可用三步评估:(1) 溯因(abduction)——用证据 e 更新 P(u) 得到 P(u | e);(2) 行动(action)——用 do(A) 修改 M 得到子模型 M_A;(3) 预测(prediction)——用修改后的模型 ⟨M_A, P(u | e)⟩ 计算 B 的概率。

为完成本节,引入两个在后续讨论中有用的对象:世界和理论。

定义 7.1.8(世界与理论):因果世界 w 是对 ⟨M, u⟩,其中 M 是因果模型,u 是 U 的特定实现。因果理论是因果世界的集合。世界 w 可视为退化的概率模型(P(u) = 1)。因果理论用于表征因果模型的部分规约,例如共享同一因果图的模型或其中 fᵢ 是带未定系数线性函数的模型。

7.1.2 反事实的确定性评估(Evaluating Counterfactuals: Deterministic Analysis)

本节用 1.4.1 节引入的"行刑队"例子,演示如何在结构模型语义下形式评估反事实查询。设两枪手行刑队的故事:A、B、C、D、U 分别代表:U = 法院下令;C = 队长发令;A = 枪手 A 射击;B = 枪手 B 射击;D = 囚犯死亡。假设法院决定未知,两枪手都准确、警觉、守法,囚犯不会因惊吓或其他外部原因死亡。要用形式表示使下列句子可机械评估:

  • S1 预测——若枪手 A 不射,囚犯活着:¬A → ¬D
  • S2 溯因——若囚犯活着,则队长没发令:¬D → ¬C
  • S3 转导——若 A 射了,则 B 也射了:A → B
  • S4 行动——若队长没发令且枪手 A 决定射,则囚犯死且 B 不射:¬C → (D_A ∧ ¬B_A)
  • S5 反事实——若囚犯死,则即使 A 不射,囚犯仍会死:D → D_{¬A}

评估标准句:证明 S1–S3 无需因果模型;这些句子用标准逻辑连接词,可由任何方便的理论(如 T₁: U ⇔ C, C ⇔ A, C ⇔ B, A ∨ B → D;或 T₂: U ⇔ C ⇔ A ⇔ B ⇔ D)处理,每个理论有两个逻辑模型 m₁ = {U, C, A, B, D} 和 m₂ = {¬U, ¬C, ¬A, ¬B, ¬D}。S1–S3 的有效性可通过从 T 推导或观察其前件后件属于同一模型来验证。两个备注:(1) T₁ 和 T₂ 中的双向蕴含对支持溯因必要;若用单向蕴含则不能从 A 推出 C。使用双向蕴含时,预测、溯因、转导三种推理仅在前件后件的解释上不同,推理方法无异。(2) S1–S3 易于在标准逻辑中处理,是因为它们都处理认知推断——从对静态世界的信念到关于该世界的信念。

评估行动句:S4 涉及"枪手 A 决定射"这种有意行动。任何此类行动必须违反初始理论的某些前提或机制。要正式识别行动下保持不变的部分,必须把因果关系纳入理论;纯逻辑关系不足。对应故事的结构模型 M 为:C = U, A = C, B = C, D = A ∨ B。评估 S4 时按定义 7.1.3 形成子模型 M_A(方程 A = C 被 A 替换),事实 ¬C,由此可演绎 D 和 ¬B。注意 S4 这种"问题性"句子(前件违反故事中的基本前提——两枪手都守法)在同一确定性框架下得到自然处理。传统逻辑学家和概率论者倾向把 S4 这类句子视为矛盾并坚持重铸为概率论以容忍 A → C 的例外;这种重塑是不必要的。结构方法让我们在自然的确定性环境下处理日常因果陈述,不必先沉浸到非确定性装饰中。所有规律都被理解为"可废除的"默认表达——可被有意干预打破。基本物理规律当然不可变,但它们对任何情景的适用性可受主体行动或外部干预修改。

评估反事实句:评估 S5。按定义 7.1.5,D_{¬A} 代表 D 在子模型 M_{¬A} 中的值。该值有歧义,因其依赖于 U 的值,M_{¬A} 中未指定 U。观察到 D 消除该歧义;发现囚犯死可推断法院已下令(U),因此若 A 忍住不射则 B 会射杀囚犯,从而确认 D_{¬A}。形式上,用定理 7.1.7 的步骤(无概率)。先把事实 D 加入原模型 M 并评估 U,然后形成子模型 M_{¬A} 并用第一步求得的 U 值重新评估 D。注意只有 U 这个背景变量的值从第一步带到第二步;其他命题必须在新修改的模型下重估。这反映"背景因素 U 不受模型中变量或机制影响"的理解;因此反事实后件(D)必须在与实际世界相同的背景条件下评估。背景变量是从实际世界到假设世界信息的主要载体,是动态过程中从前者转化为后者的"不变性的守护者"。这两步程序可合并:把 M 和 Mₓ 合并为一个逻辑理论,纯逻辑地证明 S5。S4 与 S5 表面句法相同(都涉及"事实蕴含反事实"),但实际差异在于给定事实与反事实前件的关系:S4 中给定事实 ¬C 不被前件 A 影响;S5 中给定事实 D 可能被前件 ¬A 影响。S4 评估时已知 C 不受模型修改 do(A) 影响,故可直接把 C 加入 M_A。S5 评估时需考虑从 D 到 ¬D 的可能反转,因此先把事实 D 加入原模型 M,经 U 总结其影响,再在 do(¬A) 生效后重估 D。这种把已知事实影响经 U 路由的必要性使反事实不同于行动句。大多数自然语言反事实陈述暗含对受前件影响的事实的知识。

7.1.3 反事实的概率评估(Evaluating Counterfactuals: Probabilistic Analysis)

为演示反事实的概率评估(式 (7.3)–(7.5)),把行刑队故事稍作修改:(1) 法院下令概率 P(U) = p;(2) 枪手 A 因紧张拉扳机的概率为 q;(3) A 的紧张独立于 U。要计算 P(¬D_{¬A} | D)——囚犯在 A 不射时仍活着的概率,条件是囚犯实际已死。直觉上:¬D_{¬A} 为真当且仅当法院没下令(因为若法院下令且 B 是守法者,¬A 时 B 必射),故问题化为 P(¬U | D)。但本节意在演示一般形式化方法,而非用直觉。概率因果模型 (定义 7.1.6) 包含两个背景变量 U 和 W(A 的紧张)。模型为:C = U, A = C ∨ W, B = C, D = A ∨ B。背景变量按 (7.7) 分布:P(u, w) = pq 若 u=1, w=1;p(1−q) 若 u=1, w=0;(1−p)q 若 u=0, w=1;(1−p)(1−q) 若 u=0, w=0。按定理 7.1.7,第一步(溯因)计算后验 P(u, w | D)。囚犯死 (D=1) 蕴含 (U=1) 或 (W=1),即排除 (U=0, W=0) 的情形。对其余三个 (u, w) 组合,按贝叶斯规则 P(u, w | D) = P(u, w) / P(D)。P(D) = 1 − P(U=0, W=0) = 1 − (1−p)(1−q)。对 (7.8):若 u=1 或 w=1 则 P(u, w | D) = p(u,w) / [1 − (1−p)(1−q)],若 u=0 且 w=0 则为 0。第二步(行动)形成子模型 M_{¬A},保留 (7.8) 的后验概率,新模型中 A 被常数函数 ¬A 替代。第三步(预测)在该概率模型中计算 P(¬D)。注意到 ¬D ⇔ ¬U(因为 D = A ∨ B,¬A 后 B = C = U,因此 D = U;¬D 即 ¬U),结果为 P(¬U | D)。由 (7.8) 求和得 q(1−p) / [1 − (1−q)(1−p)],与直觉一致。值得注意的是,本节建立的一般形式机制——先验更新、机制修改、修改后网络推理——正是 7.1.4 节双网络方法的代数前身;双网络是同一程序在更方便计算形式下的重新表达。

7.1.4 双网络方法(The Twin Network Method)

前述程序的主要实践难点是需要计算、存储并使用后验分布 P(u | e),u 是所有背景变量集合。即使起始是 Markovian 模型(背景变量互相独立),对 e 条件化通常破坏这种独立性,需要承载 U 联合分布(条件于 e)的完整描述。表格形式可能过大。Balke and Pearl (1994b) 描述了一种克服该困难的图方法:用两个网络,一个表示实际世界,一个表示假设世界。图 7.2 给出行刑队故事的这种构造。两个网络结构相同,但指向 A 的弧被删除以反映从 M_{¬A} 删除的方程。两网络像连体双胞胎共享背景变量(U 和 W),因为这些在修改下不变。内生变量被复制并加不同标号,因为它们在假设世界和实际世界可能取不同值。计算 P(¬D) 在模型 ⟨M_{¬A}, P(u, y | z)⟩ 中化为在所示双网络中条件化 A = false 计算 P(¬D | D)。一般地,要计算反事实概率 P(Yₓ = y | z)(X, Y, Z 任意不必互不相交),定理 7.1.7 指示我们计算 P(y) 在子模型 ⟨Mₓ, P(u | z)⟩ 中,这化为在增强贝叶斯网络中计算普通条件概率 P(y | z)。该计算可用标准证据传播技术完成。委派给贝叶斯网络推理的好处:P(u | z) 不必明示,条件独立性可被利用,局部计算方法可使用。

双网络表示也提供一种测试反事实量间独立性的方法。例如对链式因果图 X → Z → Y,要测试 Yₓ 是否条件独立于 X 给定 Z(即 Yₓ ⊥⊥ X | Z)。双网络见图 7.3。检验原模型中 Yₓ ⊥⊥ X | Z 是否成立,等价于检验双网络中 Z 是否 d-分离 X 与 Y。容易看出(通过定义 1.2.3),条件化 Z 通过 Z 处的对撞节点使 X 与 Y 间的路径 d-连接——X → Z 弧进入 Z,Z → Y 弧离开 Z,Z 处的对撞被条件化打开,故 X 与 Y 之间的路径经 Z d-连接。该独立性在原模型中不成立。条件化 Y 或 (Y, Z) 时形成 Y 与 X 的连接:Y 在双网络中与 Y 通过共享 U_Y 形成路径,故条件化 Y 也使 Y 与 X 经 U_Y 路径连接;若不条件化 Y 或 Z,连接被断开,Yₓ ⊥⊥ X。双网络揭示了形如 Z_{paZ} 的反事实的解释——Z 任意变量,PA_Z 为其父集。Zₓ 是否独立于模型中某给定变量集,取决于 Z 是否与该变量集 d-分离。但任何 d-分离于 Z 的变量也 d-分离于 U_Z,所以 U_Z 节点可作为反事实变量 Zₓ 的单向代理。这并非巧合,因 Z 由方程 z = f_Z(x, u_Z) 控制。Zₓ 的概率等于条件 X = x 时 Z 的概率;该条件下 Z 仅当 U_Z 变化时变化。故若 U_Z 服从某独立性关系,则 Zₓ(更一般地 Z_{paZ})也服从该关系。因此我们得到对任何形如 Z_{paZ} 反事实变量的简单图表示,用所谓"误差项" U_Z。从图 7.3 可验证 (U_Y ⊥⊥ X | {Y, Z*})_G 和 (U_Y ⊥⊥ U_Z | {Y, Z})_G 在双网络中成立,因此 Y_z ⊥⊥ X | {Yₓ, Zₓ} 和 Y_z ⊥⊥ Zₓ | {Y, Z} 在模型中成立——这些独立性从原链模型本身或原方程组都不易直接读出。更多有关双网络的考虑,包括到多网络(表示不同前件下的反事实)的推广,见 Shpitser and Pearl (2007),亦见 11.3.2 和 11.7.3 节。

7.2 结构模型的应用与解释(Applications and Interpretation of Structural Models)

7.2.1 线性计量经济模型中的政策分析:例子(Policy Analysis in Linear Econometric Models: An Example)

本节用 1.4 节讨论的供需均衡经典经济问题(图 7.4)回答政策相关问题。两个方程:q = b₁p + d₁i + u₁(7.9),p = b₂q + d₂w + u₂(7.10),其中 q 是产品 A 的家庭需求量,p 是单位价格,i 是家庭收入,w 是生产 A 的工资率,u₁ 和 u₂ 是误差项(影响数量和价格的省略因素,Goldberger 1992)。该方程组构成因果模型(定义 7.1.1),令 V = {Q, P},U = {U₁, U₂, I, W},每方程代表一自主过程。I 和 W 可观测,U₁ 和 U₂ 不可观测且独立于 I 和 W。误差项 U₁ 和 U₂ 的分布通常取高斯,协方差矩阵 σᵢⱼ = cov(uᵢ, uⱼ)。经济学中已知(追溯到 Wright 1928)线性、正态性和 {I, W} 与 {U₁, U₂} 独立的假设允许一致估计所有模型参数包括协方差矩阵。但本书焦点不是参数估计而是其用于政策预测。要评估三个查询:

  1. 若价格被控制为 P = p₀,需求 Q 的期望值是多少?
  2. 若价格被报告为 P = p₀,需求 Q 的期望值是多少?
  3. 已知当前价格 P = p₀,若把价格控制为 P = p₁,需求 Q 的期望值是多少?

读者应能识别这三个查询分别代表行动、预测、反事实——我们的三级层次。查询 2 是标准文献的预测,无需因果、结构、不变性即可直接从协方差矩阵回答。查询 1 和 3 依赖方程的结构性质,标准结构方程文献未处理。

回答查询 1:把 (7.10) 替换为 p = p₀,留下 (7.11) 和 (7.12),U₁ 和 I 的统计量不变(注意只删除机制 P = b₂Q + d₂W + U₂,I 和 U₁ 不受 P 方程修改影响)。控制后需求为 q = b₁p₀ + d₁i + u₁,条件于 I = i 的期望为 E[Q | do(P = p₀), i] = b₁p₀ + d₁i + E(U₁ | i)。因 U₁ 独立于 I,最后一项为 E(U₁) = E(Q) − b₁E(P) − d₁E(I)。代入得 E[Q | do(P = p₀), i] = E(Q) − b₁(p₀ − E(P)) − d₁(i − E(I))。

回答查询 2:在当前观察 {P = p₀, I = i, W = w} 上对 (7.9) 条件化取期望:E(Q | p₀, i, w) = b₁p₀ + d₁i + E(U₁ | p₀, i, w)。E[U₁ | p₀, i, w] 的计算是 σᵢⱼ 给定后的标准程序(Whittaker 1990, p. 163)。注意 U₁ 假设独立于 I 和 W,但观察到 P = p₀ 后该独立性不再成立——P 通过 (7.10) 依赖 W 和 U₂,对 p₀ 的条件化把 U₂ 的信息泄露给 U₁。还注意 (7.9) 和 (7.10) 都参与求解,观察值 p₀ 会通过 E(U₁ | p₀, i, w) 影响期望需求 Q,即使 b₁ = 0 时也是如此(因为 p₀ 携带 U₂ 信息),但查询 1 中当 b₁ = 0 时价格控制对 E[Q | do(P = p₀), i] 无影响——因为 (7.11) 截断了 P 的信息路径。

回答查询 3:需计算反事实量 Q_{P=p₁} 的期望,条件于当前观察 {P = p₀, I = i, W = w}(见 11.7.1 节)。按定义 7.1.5,Q_{P=p₁} 由子模型 (7.15) 和 (7.16) 控制,u₁ 密度应条件于 {P = p₀, I = i, W = w}。得 E(Q_{P=p₁} | p₀, i, w) = b₁p₁ + d₁i + E(U₁ | p₀, i, w)。E(U₁ | p₀, i, w) 与查询 2 的解相同;查询 2 与查询 3 只在 b₁p₁ 项上不同(p₀ vs p₁),但共享同一从证据 E = (p₀, i, w) 来的溯因结果。线性高斯模型中评估反事实查询的一般矩阵方法见 Balke and Pearl (1995a)。

本节强调:计算反事实期望不是学术练习,而是几乎每个决策情境的典型案例。预测政策效果时,两个考虑适用。第一,政策变量(如经济学中的价格和利率、过程控制中的压力和温度)很少是外生的。政策变量在观察运行中的系统时是内生的;在规划阶段——我们考虑行动和变化时——是外生的。第二,政策很少抽象评估;它们由需要补救的事件带入焦点。在故障排除中,我们观察受其他条件 X = x 影响的不良效果 e,希望预测带来 X 变化的行动是否能补救情况。e 提供的信息极有价值,必须用溯因处理(先更新对背景的认识)才能预测任何行动效果。溯因这一步赋予关于行动的实际查询以反事实特性,正如查询 3 (7.17) 评估所示。当前价格 p₀ 反映决策时存在的经济条件(Q),这些条件被认为可被所考虑的政策改变。因此价格 P 是内生决策变量(图 7.4),在 deliberation 时变为外生,由子模型 M_{P=p₁} 决定。查询 3 的虚拟语气转化为实际政策分析问题:"已知当前价格 P = p₀,求若今天把价格改为 P = p₁ 时需求 (Q) 的期望值。" 在实际决策情境中使用虚拟短语的原因将在下节和 11.7.2 节讨论。Pearl 在 10 节脚注中提到一个经验事实:他向一百多位计量经济学学生和教员提出这三个查询时,所有人都能答查询 2,只一人能答查询 1,无人能答查询 3。这与第 5 章(5.1 节)将讨论的"反事实未被工具化"现象相吻合。

7.2.2 反事实的经验内容(The Empirical Content of Counterfactuals)

"反事实"一词用词不当,因为它暗示与事实相反或至少无法经验验证的句子。反事实不属于这两类;它们是科学思维的基础,承载与任何科学定律一样清晰的经验信息。考虑欧姆定律 V = IR。该定律的经验内容可用两种形式编码:

  1. 预测形式:若在 t₀ 测得电流 I₀ 和电压 V₀,则在其他条件相同时,未来任意 t ≥ t₀,若电流为 I(t),则电压为 V(t) = (V₀/I₀) I(t)。
  2. 反事实形式:若在 t₀ 测得电流 I₀ 和电压 V₀,则若 t₀ 时电流为 I' 而非 I₀,电压将为 V' = (V₀I')/I₀。

表面上预测形式做出有意义可检验的经验主张,反事实形式则仅推测未发生(且不能发生)的事件,因为不可能对同一电阻同时施加两种电流。然而若把反事实形式解释为不过是预测形式的会话简写,则前者的经验内容清晰显现。两者都让我们从单次测量 (I₀, V₀) 做出无限多预测,两者都源于赋予任何导电对象不随时间变化性质(比值 V/I)的科学定律。

若反事实陈述只是绕弯说预测集合,我们为何不直接用预测方式而用这种迂回表达方式?一个明显答案是我们常用反事实传达的不仅是预测本身,还包括那些预测的逻辑推论。例如说"如果 A 没射,囚犯仍会活着"可能仅是传达 B 没射的事实信息。这里反事实语气用基于一般定律的逻辑论证来补充所传达事实。不那么明显的答案在于伴随预测主张的"其他条件相同"限制并非完全无歧义。改变电阻中电流时应保持什么——温度?实验设备?时间?肯定不是电压表读数!这些事项在我们宣读预测主张并认真对待时必须仔细指定。当我们用反事实表达时,许多这些指定是隐含的(因而多余),尤其当我们认同底层因果模型时。例如我们无需指定预测应在何温度压力下成立;这些由"若 t₀ 时电流为 I' 而非 I₀"暗示。我们指代的是 t₀ 时实验室里盛行的条件。该陈述也意味我们并不真要任何人保持电压表读数不变;变量应顺其自然,唯一应设想的变化是当前(按我们的因果模型)决定电流的机制。

总结:反事实陈述可被解释为传达在明确定义的条件下——事实部分陈述的条件下——的预测集合。为使这些预测有效,两个成分必须保持不变:规律(或机制)和边界条件。用结构模型语言,规律对应方程 {fᵢ},边界条件对应背景变量 U 的状态。因此反事实陈述的预测解释有效的前提是:当我们应用或检验预测主张时 U 不改变。这最好用打赌例子说明。我们必须对公平抛硬币结果押正或反;押对赢 1 美元,押错输 1 美元。假设我们押正赢了 1 美元,没有瞥见硬币结果。考虑反事实"若我押法不同,我会输 1 美元"。该句的预测解释转化为不可信主张"若下次押反,我会输 1 美元"。为使该主张有效,两个不变量必须被假设:赔付政策和硬币结果。前者在打赌情境下可成立,后者只在罕见情况下实现。这正是"若我押法不同会输 1 美元"陈述的预测效用相当低的原因,有人甚至视之为事后胡言。是 U 和 f(x, u) 跨时间的持续性赋予反事实表达预测能力;缺乏这种持续性,反事实失去明显的预测效用。

但反事实中有一种无法立即转化为预测收益的效用,因此可解释反事实在人类话语中普遍存在的缘由。我想到的是解释价值。假设打赌故事中每押一次都新抛一次硬币。"若我押法不同,我会输 1 美元"这种陈述是否完全无价值?我认为有;它告诉我们这里不是任性的庄家,而是一个至少瞥一眼赌注、与某标准比较、用一致政策决定输赢的庄家。该信息对我们玩家可能不很有用,但对州检查员有用——他们时不时来校准赌博机以确保州从利润中分成。更重要的是,若我们想小作弊——比如操纵硬币轨迹或装微型发射器知道硬币怎么落——该陈述揭示了赔付政策 y = f(x, u) 的重要方面,对我们玩家也很有用。为使作弊成功,我们应知道赔付政策 y = f(x, u),而"若我押法不同会输 1 美元"揭示了该政策的重要方面。

用不太可能的情形(玩家作弊、规则被打破)来论证反事实的价值是否牵强?我认为这种不太可能的操作正是衡量句子解释价值的常态。任何因果解释的效用本质上不在标准情境上证明,而在需要创新性操纵标准的全新设定上证明。理解电视如何工作的效用不来自正确转动旋钮,而来自电视坏了时能修好它。记住每个因果模型宣称的不是一个而是一族子模型,每个由违反某些规律创建。模型中机制的自主性因此是移除或替换这些机制的公开邀请,而句子解释价值的判断自然应基于它们多能预测这种替换的后果。

含内在非决定性的反事实。回顾讨论,反事实可在两个条件下获得预测价值:(1) 未观察的不确定性产生变量 (U) 保持不变(直到下次预测或行动);(2) 不确定性产生变量提供未来某时被观察的潜能(在下次预测或行动前)。两种情形下都需要确保结果产生机制 f(x, u) 保持不变。这些结论引发关于反事实在微观现象中使用的有趣问题,因上述条件都不成立。Heisenberg 的骰子每秒被重新掷数十亿次,U 的测量永远不够精细以消除响应方程 y = f(x, u) 的所有不确定性。因此把量子级过程纳入分析时我们面临两难:要么摈弃反事实的所有讨论(一些研究者如 Dawid 2000 推荐的策略),要么继续使用反事实但把使用限于它们获得经验意义的情形。这等同于分析中只保留满足上段条件 (1) 和 (2) 的 U。我们不假设 U 完全消除所有不确定性,而只接受要么 (1) 持续要么 (2) 潜在可观察的 U。粗化背景变量的粒度有其代价:机制方程 vᵢ = fᵢ(paᵢ, uᵢ) 失去确定性,应改为随机。我们不应构造由确定性方程 {fᵢ} 组成的因果模型,而应考虑由随机函数 {fᵢ} 组成的模型,每个 fᵢ 是从 V\U 到 Vᵢ 状态上某内在概率分布 P(yᵢ) 的映射。这导出一个因果贝叶斯网络(1.3 节),其中条件概率 P(yᵢ | paᵢ, uᵢ) 表示内在非决定性(有时称"客观机会",Skyrms 1980),根节点表示持续或潜在可观察的背景变量 U。该表示中反事实概率 P(Yₓ = y | e) 仍可用定理 7.1.7 的三步(溯因、行动、预测)评估。溯因阶段我们对根节点先验 P(u) 条件化证据 e 得到 P(u | e)。行动阶段删除进入 X 中变量集的弧并把它们实例化为 X = x。预测阶段在更新后的操控网络中计算 Y = y 的概率。该评估当然可在普通因果贝叶斯网络(即不仅表示内在非决定性的)中实现,但此时计算结果不表示反事实 Yₓ = y 的概率。这种评估相当于假设单位同质,每个具有总体的随机性质,即 P(yᵢ | paᵢ, u) = P(yᵢ | paᵢ)。在量子级现象中这种假设可能足够(单位代表特定实验条件),但在宏观现象中单位可能彼此显著不同,则不够。在 1.4.4 节图 1.6 的例子中,随机归属相当于假设无人受药物影响(按模型 1)而忽略某些个体可能对药物更敏感的可能性(模型 2)。

7.2.3 因果解释、陈述及其解释(Causal Explanations, Utterances, and Their Interpretation)

常识认为解释增进理解,理解更多者能更有效地推理和学习。也公认解释概念不能与因果概念分离:症状可解释我们对疾病的信念,但不解释疾病本身。然而原因和解释的精确关系仍是讨论很多的话题(Cartwright 1989; Woodward 1997)。在确定性和概率性两种设置中具有因果和反事实的形式理论,赋予"什么构成充分解释"问题以新视角,并为机器自动生成解释开辟了新可能(Halpern and Pearl 2005a,b)。

生成解释的自然起点是使用因果贝叶斯网络(1.3 节),其中待解释事件(解释项)e 是网络中实例化节点的某种组合,任务是找到 e 祖先子集(即原因)c 的实例化,最大化"解释力"度量——c 解释 e 的程度。然而该度量的适当选择未定。许多哲学家和统计学家主张用似然比 L = P(e | c) / P(e | c') 作为 c 比 c' 更好解释 e 的适当度量。在 Pearl (1988b, 第 5 章) 和 Peng and Reggia (1986) 中,最佳解释通过最大化后验概率 P(c | e) 找到。两种度量都有缺陷,被多位研究者批评,包括 Pearl (1988b)、Shimony (1991, 1993)、Suermondt and Cooper (1993)、Chajewska and Halpern (1997)。为补救这些缺陷,已提出更复杂的概率参数组合 [P(e | c), P(e | c'), P(c), P(c')],但似乎都无法很好地捕捉人们赋予"解释"一词的意义。

概率度量的问题在于它们无法捕捉 c 和 e 之间因果连接的强度;任何命题 h 都可被想象为对 e 有某种影响,无论多微弱。这使 h 有资格成为 e 在因果网络中的祖先,并允许 h 凭与 e 的强伪关联竞争并胜过真正解释。为摆脱此困难,我们必须超越概率度量,集中于因果参数,如因果效应 P(y | do(x)) 和反事实概率 P(Y_{x'} = y' | x, y) 作为解释力的基础。这里 x 和 x' 遍历替代解释集,Y 是被观察取值 y 的响应变量集。P(Y_{x'} = y' | x, y) 读作:在 X 实际取值 x 时,Y 在 X = x' 时取值 y' 的概率。注意 P(y | do(x)) = P(Yₓ = y)。因果效应和反事实概率计算模型的发展使我们能把这些参数与标准概率参数结合,合成更忠实的解释力度量,指导充分解释的选取和生成。

这些可能性触发一个重要基本问题:"解释"是基于一般原因(如"喝毒芹导致死亡")还是单例原因(如"苏格拉底喝毒芹导致他死亡")?因果效应表达式 P(y | do(x)) 属第一类,反事实表达式 P(Y_{x'} = y' | x, y) 属第二类,因条件化 x 和 y 把世界情景缩窄到与最特定信息相容者:X = x 且 Y = y。因果陈述分为一般和单例两类的做法在哲学中得到深入研究(见 Good 1961; Kvart 1986; Cartwright 1989; Eells 1991;亦见 7.5.4 和 10.1.1 节)。该研究在认知科学和人工智能中关注甚少,部分因它未引出实用推理程序,部分因它基于有问题的概率语义(见 7.5 节关于概率因果的讨论)。在机器生成解释情境下,这一分类既具认知意义又具计算意义。第 1 章(1.4 节)讨论了两种因果查询的鲜明分界:可由 ⟨P(M), G(M)⟩(模型 M 的概率和图)回答者与需要函数规约附加信息者。一般因果陈述(如 P(y | do(x)))常属第一类(如第 3 章),反事实表达式(如 P(Y_{x'} = y' | x, y))属第二类,因此需要更详细规约和更高计算资源。

把解释正确归入一般或单例类取决于原因 c 是否通过其产生 e 的一般倾向(与 c 替代项较弱倾向比较)相对于 c 是触发特定情境下导致 e 的特定事件链的必要性(由 e 及可能其他事实观察刻画)来获得解释力。形式上,差异取决于评估各假设解释力时是否应条件化于实际发生的事件 c 和 e。这些替代项的形式分析见第 9、10 章,那里讨论因果的充要方面及单事件因果概念。本节其余部分关注解释性陈述的解释和生成,把必要性方面作为规范。

以下清单主要取自 Galles and Pearl (1997),给出解释性话语中使用的陈述例子及其在 7.1.1 节可修改结构模型方法中的语义:

  • "X 是 Y 的原因",若存在 X 的两个值 x、x' 和 U 的某值 u 使 Yₓ(u) ≠ Y_{x'}(u)。
  • "X 在上下文 Z = z 中是 Y 的原因",若存在 x、x' 和 u 使 Y_{xz}(u) ≠ Y_{x'z}(u)。
  • "X 是 Y 的直接原因",若存在 x、x' 和 u 使 Y_{xr}(u) ≠ Y_{x'r}(u),r 是 V \ {X, Y} 的某实现。
  • "X 是 Y 的间接原因",若 X 是 Y 的原因且 X 不是 Y 的直接原因。
  • "事件 X = x 总是导致 Y = y",若 (i) 对所有 u,Yₓ(u) = y;(ii) 存在 U 的某值 u' 使 Y_{x'}(u') ≠ y 对某 x' ≠ x。
  • "事件 X = x 可能导致了 Y = y",若 (i) X = x 和 Y = y 为真;(ii) 存在 U 的某值 u 使 X(u) = x, Y(u) = y 且 Y_{x'}(u) ≠ y 对某 x' ≠ x。
  • "未观察事件 X = x 是 Y = y 的可能原因",若 (i) Y = y 为真;(ii) P(Yₓ = y, Y_{x'} ≠ y | Y = y) 对所有 x' ≠ x 都很高。
  • "事件 Y = y 尽管 X = x 仍发生",若 (i) X = x 和 Y = y 为真;(ii) P(Yₓ = y) 很低。

上述清单展示可修改结构模型在形式化因果表达细微差别方面的灵活性。更多细微差别(涉及"使能、阻止、维持、产生"等概念)将在第 9、10 章分析。相关表达包括:"事件 A 解释事件 B 的发生";"A 会在 C 为真时解释 B";"B 虽 A 仍发生乃因 C 为真"。能解释和生成这类解释句子,或选择最适合语境的表达,是人机对话研究中最引人入胜的挑战之一。

7.2.4 从机制到行动到因果(From Mechanisms to Actions to Causation)

7.1.1 节描述的结构模型语义为认知科学和人工智能中两个问题提供解答:行动的表示和因果排序的作用。我们依次讨论,因第二个建立在第一个之上。

行动、机制与手术。无论采取概率范式(行动是从概率分布到概率分布的变换)还是确定性范式(行动是从状态到状态的变换),这种变换原则上可以无限复杂。然而实践中人们相当快地相互教会世界中行动的一般结果,并能无困难地预测大多数行动的后果。如何做到?结构模型通过假设我们正常在常识推理中调用的行动可表示为局部手术来回答。世界由大量自主不变的联动或机制组成,每一机制对应一物理过程,约束相对小的一组变量的行为。若理解这些联动如何相互作用(通常它们仅共享变量),则应能理解任何给定行动的效果:仅重新规约被该行动扰动的少数机制;然后让修改后装配中的机制相互交互,看平衡时何状态会演化。若规约完整(即 M 和 U 已给),则单一状态会演化;若规约概率(即 P(u) 已给),则新概率分布会出现;若规约部分(即某些 fᵢ 未给),则新的部分理论会被创建。三种情况下我们应能回答关于行动后状态事务的查询,尽管精度递减。使该方案可操作的成分是行动的局部性。孤立地看,局部性是模糊概念,因一空间中的局部在另一空间中可能不局部。结构语义强调行动在机制空间局部,而非变量空间、句子空间或时间槽。例如推倒一排多米诺骨牌中最左一块,在物理空间看似不"局部",但在机制域很局部:仅一个机制被扰动——正常保持该骨牌稳定直立的引力恢复力;其他机制保持不变,遵守通常物理方程。局部性使指定此行动无需枚举其所有后果。听话者假设她与我们共享多米诺物理理解,可自行推演此行动或"把第 i 块骨牌向右推"类行动的后果。通过把域表示为稳定机制装配,我们事实上创建了一个能回答关于大量行动及行动组合效果的查询的 oracle,无需我们明示这些效果。

规律与事实。该手术程序在结构方程模型语境下表达似微不足道。但当尝试在经典逻辑中实现此方案时遇到很大困难。为在机制空间实现手术程序,我们需要一种语言,使某些句子有别于其他。描述机制的句子应区别于描述生活其他事实(如观察、假设、结论)的句子,因前者被假定为稳定而后者是短暂的。的确,描述多米诺骨牌如何相互作用的方程保持不变,即使骨牌本身的状态随环境自由变化。承认需要此区分一直是行动和因果逻辑方法中的困难转变,也许因为经典逻辑的许多力量来自其表征统一性和句法不变性——任何句子都不享有特殊地位。概率论者更不抗拒拥抱规律和事实的区分,因该区分已由 Bayes 1763 编程入概率语言:事实表达为普通命题因而可获概率值并可条件化;规律则表达为条件概率句(如 P(accident | careless driving) = high),因而不应被赋概率也不能被条件化。正是这一传统使概率论者一直把非命题特征赋予条件句(如鸟会飞),拒绝允许嵌套条件(Levi 1988),坚持把对条件句的信心解释为条件概率判断(Adams 1975; Lewis 1976)。值得注意,这些被一些哲学家视为限制的约束,正是保护概率论者不混淆规律和事实的护栏,保护他们免于陷入某些已困住逻辑方法的陷阱。

机制与因果关系。从我们目前讨论看,似乎可以构造计算行动后果的有效表示而无需诉诸任何因果概念。这在物理和工程许多领域确实可行。例如若我们有一个由电阻和电压源组成的大电路,且要计算改变电路中一个电阻的效果,那么因果概念在计算中几乎不出现。我们只需把修改后的电阻值代入 Ohm 和 Kirchhoff 方程,并解(对称)方程组得到所需变量。该计算可有效执行,无需承诺电流电压间任何方向性因果关系。

要理解因果的作用,我们应注意到(与电路例子不同)大多数机制在日常语言中没有名字。我们说:"加税"、"让他笑"、"按按钮"——一般地,do(q),其中 q 是命题而非机制。在电路例子中说"增大该电流"或"若该电流更高……"将无意义,因有多种(最小)增大该电流的方式,每种有不同后果。显然常识知识不像电阻网络那样纠缠。在 STRIPS 语言(Fikes and Nilsson 1971)中,行动不按其修改的机制名字刻画,而按其直接效果(ADD 和 DELETE 列表)刻画,这些效果表达为普通命题。的确,若知识按因果组织,则该规约足够,因每个变量由一个且仅一个机制治理(见定义 7.1.1)。因此我们应能自行弄清在实现指定效果时必须扰动哪个机制,这使我们能预测场景其余部分。

这种语言缩写定义了事件间一种新关系,我们通常称为"因果":事件 A 导致 B 若实现 A 所需的扰动蕴含 B 的实现。这类因果缩写被非常有效地用于规约领域知识。什么关系稳定、机制如何相互作用的复杂描述很少以机制形式被显式传达;它们以事件或变量间的因果关系传达。例如我们说"若第 i 块骨牌向右倒,它导致第 i+1 块骨牌也向右倒";我们不传达这种知识于各骨牌维持物理形状、对引力响应的倾向及服从牛顿力学的细节。

7.2.5 西蒙的因果排序(Simon’s Causal Ordering)

我们能直接以一个事件导致另一个事件(而非行动改变机制而改变又产生效果)的方式说话,在计算上非常有用,但同时要求域中机制装配满足容纳因果方向性的某些条件。的确,7.1.1 节给出的因果模型形式定义假设每方程被指定一不同特权变量(位于左端),视为"因变量"或"输出"。然而一般而言,机制可被规约为函数约束 Gₖ(x₁, …, xₗ; u₁, …, uₘ) = 0 而不识别任何"因变量"。

Simon (1953) 设计了一种程序用于判定这种对称 G 函数集合是否规定唯一选择方式为各机制选取内生因变量(排除背景变量,因它们在系统外决定)。Simon 问:我们能否以某种方式排序变量 (V₁, V₂, …, Vₙ),使我们对每个 Vᵢ 求解时不必解 Vᵢ 任何后继?若存在这种排序,则它规定我们赋予因果的方向。该判据初看人工,因为解方程顺序是计算便利问题,而因果方向性是物理现实客观属性。详见 De Kleer and Brown 1986; Iwasaki and Simon 1986; Druzdzel and Simon 1993。重新表述 Simon 问法以行动和机制术语:假设每机制(即方程)可独立于其他被修改,令 Aₖ 为能修改方程 Gₖ 而保持其他不变的行动集。设想我们从 Aₖ 中选择行动 aₖ 并修改 Gₖ 使整个方程组的解集 (V₁(u), V₂(u), …, Vₙ(u)) 与行动前不同。若 X 为 Gₖ 直接约束的变量集,我们问是否存在 X 的一个成员,记 Xₖ,能解释所有其他解的变化。若该预测成员身份对所有 aₖ 和 u 的选择都保持不变,则指定 Xₖ 为 Gₖ 中的因变量。

形式上,该性质意味着 aₖ 的变化诱导从 Xₖ 域到 (V \ Xₖ) 域的函数映射;系统内所有变化(由 aₖ 生成)可归因于 Xₖ 变化。这种情况下,指定 Xₖ 为机制 Gₖ 的"代表"是有意义的,我们有理由用"事件 Xₖ = xₖ 导致 Y = y"(Y 为系统中任何变量)替代"行动 aₖ 导致事件 Y = y"。Xₖ 对 aₖ 选择的不变性是把行动视为模态 do(Xₖ = xₖ)(定义 7.1.3)的基础。它提供把行动由其直接后果(独立于实际产生这些后果的工具)刻画的许可,事实上定义了"局部行动"或"局部手术"概念。

Nayak (1994) 表明 Xₖ 唯一性可由涉及方程集纯拓扑性质(即变量如何分组到方程)的简单判据决定。判据是:应能形成方程和变量间的一一对应且对应唯一。这可由解方程与变量间的"匹配问题"(Serrano and Gossard 1987)决定。若匹配唯一,则每方程中因变量选择唯一,由该选择诱导的方向性定义一有向无环图 (DAG)。在图 7.1 中例如,箭头方向不必外部指定;可从对称约束集 S = {G₁(C, U), G₂(A, C), G₃(B, C), G₄(A, B, D)} 机械确定。读者易验证从每方程中选取一特权变量是唯一的,因此图 7.1 所示箭头的因果方向性不可避免。

因此可见,Simon 的因果方向性从两个假设涌现:(1) 变量分为背景 (U) 和内生 (V) 集;(2) 模型中机制的整体配置。据此,一变量在给定机制中被指定为"因变量",在嵌入不同模型时可能标为"自变量"。的确,上山时引擎使车轮转动,下山时引擎与车轮角色互换。

当然,若我们无法确定背景变量,则多种因果排序可能出现。在 (7.18) 中例如若我们未获知 U 是背景变量的信息,则 (U, A, B, C) 中任一都可被选为背景,每种选择对其余变量诱导不同排序(有些与常识冲突,如队长信号影响法院决定)。然而 A → D ← B 的方向性在所有这些排序中保持。在对称约束系统中是否存在产生因果排序的 (U, V) 划分,也可用拓扑方法(多项式时间)解决(Dechter and Pearl 1991)。

Simon 排序判据在我们无法一次解一个方程、必须同时解 k 个方程块时失效。这种情况下由该块决定的 k 个变量将互相无序,尽管它们与其他块的关系仍可排序。这出现在图 7.4 的经济模型中:(7.9) 和 (7.10) 必须同时对 P 和 Q 求解,因此方程与变量间对应不唯一;Q 或 P 都可被指定为任一方程中的"自变量"。事实上把 (7.9) 归类为"需求"方程((7.10) 归类为"价格"方程)所需信息不来自变量如何分配到方程,而来自主题考虑。我们对家庭收入直接影响家庭需求(而非价格)的理解在此分类中起主要作用。

在我们倾向于明确断言反馈环中因果流为顺时针的情形,这种断言通常基于力的相对大小。例如转水龙头会降低水箱水位,但实际上我们对水箱里的水几乎无能为力以转动水龙头。当此类信息可用时,因果方向性通过再次诉诸假设干预概念并问机制中一变量的外部控制是否必然影响其他变量来决定。这一考虑因此构成在非递归因果模型(定义 7.1.1)中识别因变量 Vᵢ 的操作语义。

因果关系的不对称性绝不与物理方程的对称性冲突。我们说"X 导致 Y 而 Y 不导致 X",意指改变其中 X 通常为因变量的机制对世界的影响不同于改变其中 Y 通常为因变量的机制。因为涉及两个独立机制,该陈述与物理方程中的对称性完全和谐。

Simon 因果排序理论对 Hume 的因果归纳问题(即因果知识如何从经验获得,见第 2 章)有深远影响。从一组对称机制(连同内生变量集选择)演绎因果方向性的能力意味着因果关系获取与(如通过实验)获取普通物理定律(Hooke 弹簧定律或 Newton 加速度定律)无异。这不意味着获取物理定律是平凡任务,方法论和哲学微妙性全无;它意味着因果归纳问题——哲学史上最棘手之一——可被归约为更熟悉的科学归纳问题。

7.3 公理化表征(AXIOMATIC CHARACTERIZATION)

公理在形式系统表征中起重要作用。它们提供系统本质性质的简洁描述,从而允许替代形式间比较并易于测试等价性或蕴含关系。此外,公理常可用作从给定前提演绎(或验证)新关系的推理规则。下一小节将建立一组公理,刻画形如 Yₓ(u) = y 的反事实句间关系(递归和非递归系统均有)。用这些公理可演示(在 7.3.2 节)因果效应识别如何通过符号方法验证,平行于第 3 章(3.4 节)的演绎。7.3.3 节建立因果相关性概念的公理,对比捕捉信息相关性的公理。

7.3.1 结构反事实的公理(The Axioms of Structural Counterfactuals)

我们提出反事实的三个性质——组合(composition)、有效性(effectiveness)和可逆性(reversibility),它们在所有因果模型中成立。

性质 1(组合):对因果模型中任何三组内生变量 X、Y 和 W,有 Wₓ(u) = w ⟹ Y_{xw}(u) = Yₓ(u)。组合指出若我们强制变量 W 取其不被干预时本会取的值 w,则干预对系统其他变量无影响。该不变性在所有固定条件 do(X = x) 下成立。

因组合允许去除下标(即 Y_{xw}(u) 化简为 Yₓ(u)),我们需要对带空下标变量的解释——自然地,我们把它等同于无干预下的变量。

定义 7.3.1(空行动):Y_∅(u) = Y(u)。

推论 7.3.2(一致性):对因果模型中任何变量集 Y 和 X,有 X(u) = x ⟹ Y(u) = Yₓ(u)。证明:在 (7.19) 中以 X 替 W、以 ∅ 替 X,得 Y_∅(u) = x ⟹ Y_∅(u) = Y_∅(u)。空行动(定义 7.3.1)允许去掉 ∅,留 X(u) = x ⟹ Y(u) = Yₓ(u)。(7.20) 中的蕴含 Robins (1987) 称为"一致性"。

性质 2(有效性):对所有变量集 X 和 W,X_{xw}(u) = x。有效性规定对被操控变量本身的干预效果——若我们强制 X 取值 x,则 X 确实取值 x。

性质 3(可逆性):对任何两变量 Y 和 W 及任何变量集 X,(Y_{xw}(u) = y) ∧ (W_{xy}(u) = w) ⟹ Yₓ(u) = y。可逆性排除反馈环导致的多解。若设 W 为 w 导致 Y 为 y,且设 Y 为 y 导致 W 达 w,则 W 和 Y 将自然取 w 和 y(分别),无需外部设置。在递归系统中可逆性直接从组合得出。在递归系统中,Y_{xw}(u) = Yₓ(u) 或 W_{xy}(u) = Wₓ(u)。因此可逆性化为 (Y_{xw}(u) = y) ∧ (Wₓ(u) = w) ⟹ Yₓ(u) = y(组合的另一种形式)或化为 (Yₓ(u) = y) ∧ (W_{xy}(u) = w) ⟹ Yₓ(u) = y(平凡真)。

可逆性反映"无记忆"行为:系统状态 V 跟踪 U 状态而无论 U 历史如何。不可逆的典型例子是"以牙还牙"策略(如囚徒困境)的两主体系统。此系统在相同外部条件 U 下有两个稳定解——合作和背叛——因此不满足可逆性。强制任一主体合作导致另一主体合作(Y_w(u) = y, W_y(u) = w),但不保证从一开始就合作(Y(u) = y, W(u) = w)。在如此系统中,不可逆性源于使用了过粗的状态描述——决定系统最终状态的因素未全被纳入 U。在以牙还牙系统中,完整状态描述应包括玩家先前行动等因素,可逆性在缺失因素被补足后恢复。

一般地,组合、有效性和可逆性三个性质独立——任一都不是其他两个的推论。Galles and Pearl (1997) 通过构造具体模型(其中两个性质成立而第三个不成立)展示了这一点。在递归系统中,组合和有效性独立而可逆性平凡成立。

定理 7.3.3(可靠性):组合、有效性和可逆性在结构模型语义中可靠;即它们在所有因果模型中成立。证明见 Galles and Pearl (1997)。

下一定理建立把三性质作为公理或推理规则时的完备性。完备性等价于充分性:反事实陈述的所有其他性质都从这三者推出。完备性的另一解释:给定与性质 1-3 一致的任何反事实陈述集 S,存在因果模型 M 使 S 在其中为真。完备性的形式证明需要显化两个技术性质——存在性和唯一性——它们隐含在因果模型定义(定义 7.1.1)中。

性质 4(存在性):对任何变量 X 和变量集 Y,∃x, x s.t. X_y(u) = x。

性质 5(唯一性):对每变量 X 和变量集 Y,X_y(u) = x ∧ X_y(u) = x' ⟹ x = x'。

定义 7.3.4(递归性):设 X 和 Y 是模型中单例变量,令 X ⇝ Y 代表不等式 Y_{xw}(u) ≠ Y_w(u) 对某 x、w、u 成立。模型 M 是递归的,若对任何序列 X₁, X₂, …, Xₖ,有 X₁ ⇝ X₂, X₂ ⇝ X₃, …, X_{k-1} ⇝ Xₖ ⟹ Xₖ ⇝ X₁。显见,因果图 G(M) 无环的任何模型 M 都是递归的。

定理 7.3.5(递归完备性):组合、有效性和递归性是完备的(Galles and Pearl 1998; Halpern 1998)。

定理 7.3.6(完备性):组合、有效性和可逆性对所有因果模型完备(Halpern 1998)。

可靠性和完备性的实际重要性在我们试图测试某条件集是否足以识别某反事实量 Q 时显现。在该语境下可靠性保证:若我们用三公理对 Q 进行符号操作并成功化简为涉及普通概率(无反事实项)的表达式,则 Q 可识别(按定义 3.2.3 的意义)。完备性保证逆:若我们未能化简 Q 为概率表达式,则 Q 不可识别——我们三公理已尽可能强。下一节演示一个使用有效性和分解作为推理规则的可识别性证明。

7.3.2 反事实逻辑中的因果效应:例子(Causal Effects from Counterfactual Logic: An Example)

我们重访 3.4.3 节分析的吸烟-癌症例子。模型具有以下结构(图 7.5):V = {X(吸烟), Y(肺癌), Z(肺中焦油)}, U = {U₁, U₂}, U₁ ⊥⊥ U₂。方程:x = f₁(u₁), z = f₂(x, u₂), y = f₃(z, u₁)。该模型体现多个假设,所有假设都在图 7.5 中表示。X 与 Y 缺连接代表吸烟 (X) 对肺癌 (Y) 的效应完全由肺中焦油沉积中介。U₁ 与 U₂ 间缺连接代表即使基因型 (U₁) 加剧肺癌发生,它对肺中焦油量也无影响(除非通过吸烟中介)。我们想用模型中假设推导因果效应 P(Y = y | do(x)) = P(Yₓ = y) 的可估计表达式,基于联合分布 P(x, y, z)。

该问题在 3.4.3 节由图方法用 do-calculus 公理(定理 3.4.1)解决。这里展示反事实表达式 P(Yₓ = y) 如何被化简为普通概率表达式(不含反事实),用纯粹符号操作,只用概率演算和两条推理规则:有效性和组合。为此,首先需把图中模型假设翻译为反事实语言。3.6.3 节表明翻译可系统完成,用两条简单规则(Pearl 1995a, p. 704):

规则 1(排除限制):对每有父 PA_Y 的变量 Y 及任何与 PA_Y 不相交的变量集 Z ⊆ V,有 Y_{paY}(u) = Y_{paY, z}(u)。

规则 2(独立限制):若 Z₁, …, Zₖ 是 V 中任何不通过只含 U 变量路径与 Y 连接的节点集,有 Y_{paY} ⊥⊥ {Z₁_{paZ₁}, …, Zₖ_{paZk}}。等价地,(7.26) 在对应 U 项 (U_Z₁, …, U_Zₖ) 与 U_Y 联合独立时成立。

规则 1 反映 Y 在直接原因 PA_Y 被固定后对 V 中任何操控的不敏感性;它由定义 7.1.1 中恒等 yᵢ = fᵢ(paᵢ, uᵢ) 得出——若 PA_Y 已固定为 pa_Y,则不论 V 中其他变量(如 Z)是否被操控,Y 都由 u_Y 决定。规则 2 把 U 变量间独立性解释为对应 V 变量反事实(其父固定)间独立性。Y_{paY} 的统计由方程 Y = f_Y(pa_Y, u_Y) 控制;因此一旦 PA_Y 固定,Y 的残差变化仅由 U_Y 变化决定,所以 U_Y 与其他 U 项的独立性立刻翻译为 Y_{paY} 与其他反事实的独立性。这两条规则提供了从图到反事实记法的系统翻译路径,是 3.6.3 节引入的翻译规则的更紧凑形式。

应用这两条规则于本例,图 7.5 中因果图编码以下假设:(7.27) Zₓ(u) = Z_{yx}(u),(7.28) X_y(u) = X_{zy}(u) = X_z(u) = X(u),(7.29) Y_z(u) = Y_{zx}(u),(7.30) Z_x ⊥⊥ {Y_z, X}。(7.27)–(7.29) 由 (7.25) 排除限制得,用 PA_X = ∅, PA_Y = {Z}, PA_Z = {X}。例如 (7.27) 表示 Y 到 Z 无因果链(即 Z 不在 PA_Y 中,所以 Y 中没有 Z 依赖项),(7.28) 表示 Z 或 Y 到 X 无因果链(X 无父)。相反,(7.30) 由 (7.26) 独立限制得,因 U₁ 和 U₂ 间无连接(即独立)排除任何只含 U 变量的 Z 与 (X, Y) 间路径——这里只有潜在路径 Z ← U₂ → X 中含 U 变量,因 U₂ 独立于 U₁,故路径不成立;以及 U₁ 不可达 Z 因 U₁ 不在 Z 方程中。

现在用这些假设(编码递归性),连同组合和有效性性质,计算 3.4.3 节分析的任务。

任务 1:计算 P(Zₓ = z)(即吸烟对焦油的因果效应)。由 (7.30) 得 P(Zₓ = z) = P(Zₓ = z | x)。再由组合 P(Zₓ = z | x) = P(Z = z | x)。故 P(Zₓ = z) = P(z | x)。(7.31)

任务 2:计算 P(Y_z = y)(即焦油对癌症的因果效应)。先对 x 求和去掉条件边际:P(Y_z = y) = Σₓ P(Y_z = y | x) P(x)。(7.32) 因 (7.30) 蕴含 Y_z ⊥⊥ Zₓ | X,可把条件 P(Y_z = y | x) 写成 P(Y_z = y | x, Zₓ = z) 再用组合去 z 下标。具体地:P(Y_z = y | x) = P(Y_z = y | x, Zₓ = z) 由 (7.30) = P(Y_z = y | x, z) 由组合 = P(y | x, z) 由组合。(7.33) 代入 (7.32) 得 P(Y_z = y) = Σₓ P(y | x, z) P(x)。(7.34)

任务 3:计算 P(Yₓ = y)(即吸烟对癌症的因果效应)。对任何变量 Z,由组合有 Yₓ(u) = Y_{xz}(u) 若 Zₓ(u) = z。因 Y_{xz}(u) = Y_z(u)(由 (7.29),表示 Z → Y 链上 X 不影响 Y),Yₓ(u) = Y_{xzx}(u) = Y_z(u),其中 zₓ = Zₓ(u)。(7.35) 因此 P(Yₓ = y) = P(Y_{zx} = y) 由 (7.35) = Σ_z P(Y_{zx} = y | Zₓ = z) P(Zₓ = z) = Σ_z P(Y_z = y | Zₓ = z) P(Zₓ = z) 由组合 = Σ_z P(Y_z = y) P(Zₓ = z) 由 (7.30)。(7.36)

P(Y_z = y) 和 P(Zₓ = z) 已在 (7.34) 和 (7.31) 中计算。代入得 P(Yₓ = y) = Σ_z P(z | x) Σ_{x'} P(y | z, x') P(x')。(7.37) 右端可从 P(x, y, z) 计算,与 3.4.3 节导出的前门公式 (3.42) 一致。故 P(Yₓ = y) 可被化简为涉及观察变量概率的表达式,因此可识别。注意 (7.37) 与 do-calculus 给出的同一公式完全相符,但推导过程是纯代数和反事实记法操作,不涉及图分离判据——这说明反事实代数(用组合和有效性)独立具备完整识别能力。更一般地,我们完备性结果(定理 7.3.5)蕴含任何可识别的反事实量都可通过反复应用组合和有效性(假设递归)化简为正确表达式。

7.3.3 因果相关性的公理(Axioms of Causal Relevance)

1.2 节中我们给出了图公理类(Pearl and Paz 1987; Geiger et al. 1990)的一组公理,刻画信息相关性。这里我们为因果相关性发展一组平行公理,即某些事件影响物理世界中其他事件发生的倾向,独立于观察者-推理者。信息相关性关心形式问题:"已知 Z,获得 X 信息是否会给我们关于 Y 的新信息?" 因果相关性关心形式问题:"已知 Z 被固定,改变 X 是否会改变 Y?" 我们显示因果相关性满足有向图中路径拦截的所有公理,除传递性外。

因果相关性概念植根于 Suppes (1970) 和 Salmon (1984) 的哲学工作,他们试图给概率解释因果-效果关系并认识到需要区分因果与统计相关性(见 7.5 节)。虽然这些尝试未产生因果相关性的概率定义,但它们引出了在给定概率分布和变量时间排序下检验相关性陈述一致性的方法(见 7.5.2 节)。这里我们目标是把相关性陈述本身公理化——不参考底层概率或时间排序。

因果相关性的公理化对精确因果模型不存在的领域中的实验研究者有用。若我们通过实验已知某系统中某变量对其他变量无因果影响,则我们可能希望确定其他变量是否会施加因果影响(也许在不同实验条件下),或问哪些额外实验能提供这种信息。例如假设我们发现老鼠饮食对肿瘤生长无影响(活动量固定),反之活动量对肿瘤生长无影响(饮食固定)。我们希望推断仅控制饮食(不关注活动量)仍对肿瘤生长无影响。更微妙的推理问题是:决定在已知温度对活动量无影响(饮食固定)且温度对(老鼠对)饮食的选择无影响(活动量固定)的情况下,改变笼中环境温度是否对老鼠体力活动有影响。

Galles and Pearl (1997) 分析了因果不相关性的概率和确定性解释。概率解释把因果不相关性等同于不能改变效果变量概率,直观有吸引力但推理能力很弱;除非对底层因果模型作进一步假设,它不支撑很有表达力的公理集。若加上稳定性假设(没有不相关性可被系统中个体过程性质变化所破坏),则获得对概率因果不相关性与有向图路径拦截公理集相同的一组公理。

本节分析一种确定性解释,把因果不相关性等同于在世界任何状态 u 中不能改变效果变量。该解释由丰富公理集支配,无需对因果模型作任何假设:有向图许多路径拦截性质对确定性因果不相关性成立。

定义 7.3.7(因果不相关性):变量 X 因果不相关于 Y,给定 Z(记作 X ⫫ Y | Z)若对任何与 {X, Y, Z} 不交的变量集 W,对所有 u, z, x, x', w,有 Y_{xzw}(u) = Y_{x'zw}(u),x 和 x' 是 X 的两个不同值。

该定义捕捉直觉"若 X 因果不相关于 Y,则 X 在任何环境 u 或包含 do(Z = z) 的模型任何修改下不能影响 Y"。要理解为何要求等式 Y_{xzw}(u) = Y_{x'zw}(u) 在每上下文 W = w 下成立,考虑图 7.6 模型。在该例中 Z = 0, W 跟随 X,因此 Y 跟随 X;即 Y_{x'=0}(u) = Y_{x'=1}(u) = u₂。然而因 y(x, w, u₂) 是 x 的非平凡函数,X 似乎与 Y 因果相关。只有保持 W 不变才能揭示 X 对 Y 的因果影响。为捕捉此直觉,定义 7.3.7 中必须考虑所有上下文 W = w。

按此因果不相关性定义,有以下定理。

定理 7.3.8:对任何因果模型,以下句子必须成立。

弱右分解:(X ⫫ YW | Z) ∧ (X ⫫ Y | ZW) ⟹ (X ⫫ Y | Z)。 左分解:(XW ⫫ Y | Z) ⟹ (X ⫫ Y | Z) ∧ (W ⫫ Y | Z)。 强联合:(X ⫫ Y | Z) ⟹ (X ⫫ Y | ZW) ∨ W。 右交叉:(X ⫫ Y | ZW) ∧ (X ⫫ W | ZY) ⟹ (X ⫫ YW | Z)。 左交叉:(X ⫫ Y | ZW) ∧ (W ⫫ Y | ZX) ⟹ (XW ⫫ Y | Z)。

这组公理与有向图中路径拦截性质惊人相似。Paz and Pearl (1994) 表明定理 7.3.8 的公理,连同传递性和右分解,构成关系 (X ⫫ Y | Z)_G 的完备刻画,当解释为"有向图 G 中 X 到 Y 的每条有向路径至少含 Z 中一个节点"时(亦见 Paz et al. 1996)。

Galles and Pearl (1997) 表明,尽管缺少传递性,定理 7.3.8 允许我们从有向图性质推断因果不相关性某些性质。例如假设我们希望验证一般陈述:"若 X 对 Y 有影响,但当我们固定 Z 时失去影响,则 Z 必对 Y 有影响。"该陈述可由以下事实证明:在任何有向图中,若 X 到 Y 所有路径被 Z 拦截且 Z 到 Y 无路径,则 X 到 Y 无路径。

关于因果依赖的传递性备注。因果依赖不具传递性,从图 7.6 显然。在任何 (U₁, U₂) 状态下,X 能改变 W 状态,W 能改变 Y,但 X 不能改变 Y。Galles and Pearl (1997) 给出例子,其中定义 7.3.7 弱意义下的因果相关性对二元变量也非传递。问题自然涌现:为何传递性常被视为因果依赖的内在性质,或更形式地,我们何时把因果依赖归类为传递时隐含假设了什么?一个合理答案是我们通常把传递性解释为:"若 (1) X 导致 Y 且 (2) Y 导致 Z 与 X 无关,则 (3) X 导致 Z。"建议是关于传递性的问题让人想起链式过程,其中 X 影响 Y,Y 影响 Z,但 X 对 Z 无直接影响。有了这限定,二元变量的传递性可立即由组合(式 (7.19))证明。

让句子"X = x 导致 Y = y",记作 x ⇝ y,解释为联合条件 (X(u) = x, Y(u) = y, Y_{x'}(u) = y' ≠ y)(文字上,x 和 y 成立,但改 x 为 x' 会使 y 变为 y')。我们可证明若 X 对 Z 无直接影响,即 Z_{y'x'}(u) = Z_{y'}(u),(7.39) 则 x ⇝ y ∧ y ⇝ z ⟹ x ⇝ z。(7.40)

证明:(7.40) 左端读作 X(u) = x, Y(u) = y, Z(u) = z, Y_{x'}(u) = y', Z_{y'}(u) = z'。由 (7.39) 我们可把最后一项改写为 Z_{y'x'}(u) = z'。组合进一步允许我们写 Y_{x'}(u) = y' ∧ Z_{y'x'}(u) = z' ⟹ Z_{x'}(u) = z',与 X(u) = x, Z(u) = z 一起蕴含 x ⇝ z。因果传递性的较弱形式在第 9 章讨论(引理 9.2.7 和 9.2.8)。

7.4 结构与基于相似性的反事实(STRUCTURAL AND SIMILARITY-BASED COUNTERFACTUALS)

7.4.1 与 Lewis 反事实的关系(Relations to Lewis’s Counterfactuals)

因果来自反事实。在引用最广的句子之一中,David Hume 把因果关系的两面——相继规律性和反事实依赖——绑在一起:"我们可以把原因定义为后随另一对象的对象,且所有与第一相似的对象都后随与第二相似的对象,换言之,若第一对象不曾存在,第二对象也从未存在"(Hume 1748/1958, sec. VII)。这双面定义在多方面令人困惑。首先,相继规律性或现代术语"相关性"不足以成为因果,连非统计学家现在也知道。其次,"换言之"过强,鉴于规律性基于观察,而反事实基于心理活动。第三,Hume 九年前已引入规律性判据,令人惊讶何事促使他用反事实伴随物补充它。显然 Hume 对规律性说明并不完全满意,必定觉得反事实判据较不问题较多且更具启发性。但"若第一对象不曾存在,第二对象也从未存在"这种迂回表达如何能启发"A 导致 B"这种简单日常表达?

基于反事实建立因果的观念进一步被 John Stuart Mill (1843) 回响,并在 David Lewis (1973b, 1986) 的工作中达到顶峰。Lewis 呼吁彻底放弃规律性说明,把"A 导致 B"解释为"要不是 A,B 不会发生"。Lewis (1986, p. 161) 问:"为何不直接接受反事实:作为关于实际情境可能替代的陈述……?"

此提议中隐含一主张:反事实表达比我们心智更少模糊。否则"B 若非 A 则为假"的表达怎会被视为"A 导致 B"的解释,而非反之,除非我们能辨别前者真值比后者更确定?字面上看,辨别反事实真值需要生成和检查实际情境的可能替代,并测试某命题是否在那些替代中成立——这心理任务规模不容小觑。尽管如此,Hume、Mill 和 Lewis 显然相信完成这心理练习比直接直觉 A 是否导致 B 更简单。如何做到?什么心理表征使人类如此迅捷可靠地处理反事实,什么逻辑支配该过程以维持一致性和合理性的统一标准?

结构 vs 相似性。按 Lewis 1973b,反事实评估涉及相似性概念:我们用某种相似性度量排序可能世界,反事实 A ⊃ B(在所有最接近的 A-世界中 B 成立)在世界 w 中为真当且仅当 B 在 w 的所有最接近 A-世界中为真(图 7.7)。该语义仍未解决表征问题。什么相似性度量的选择能使反事实推理与日常因果概念相容?什么可能世界排序的心理表征使反事实计算(在人和机器中)易管理且实用?Lewis 初始提议中他小心保持形式主义尽可能一般;除每世界最接近自身的要求外,他未对相似性度量施加任何结构。然而简单观察告诉我们相似性度量不能任意。人们能用反事实交流这一事实本身表明他们共享一相似性度量,该度量在心智中被简洁编码,因此必须高度结构化。Kit Fine (1975) 进一步表明外观相似性不充分。Fine 考虑反事实"若 Nixon 按了按钮,核战争本会发生",这被普遍接受为真。明显地,按钮恰好被断开的那个世界比我们已知世界更相似,而非引发核爆的世界。因此我们看到不仅相似性度量不能任意,而且必须尊重我们的因果规律概念。Lewis (1979) 随后在相似性各方面建立精致的权重和优先级系统——"奇迹"(违反规律)的大小、事实匹配、时间优先等——试图使相似性更接近因果直觉。但这些优先级相当事后,仍产生反直觉推断(J. Woodward,个人交流)。

这些困难不进入结构说明。与 Lewis 理论对照,反事实不基于可能世界间抽象相似性概念;它们直接基于产生那些世界的机制(或"规律")和这些机制的不变性质。Lewis 难以捉摸的"奇迹"被原则性的微小手术 do(X = x) 替代,代表建立前件 X = x(对所有 u)的(对模型的)最小改变。因此,相似性和优先级——若需要——可作为事后想法读入 do(.) 算子(见 (3.11) 后的讨论和 Goldszmidt and Pearl 1992),但对分析不是基本的。

结构说明通过提供一简洁的知识编码来回答心理表征问题,从中原因、反事实和反事实概率可由有效算法导出。然而这种有效性部分通过把反事实前件限于基本命题合取获得。析取式虚拟,如"若 Bizet 和 Verdi 是同胞",通常导致多解从而概率赋值不唯一。

7.4.2 公理比较(Axiomatic Comparison)

若我们对世界间距离的评估来自因果知识,问题在于该知识是否对距离施加其自身结构——一种未在 Lewis 逻辑中捕捉的结构。换种说法:通过同意基于因果关系测量世界接近度,我们是否限制我们视为有效的反事实陈述集?问题不仅是理论的。例如 Gibbard and Harper (1976) 用 Lewis 一般框架刻画决策条件句(即"若我们做 A 则 B"形式的句子),而我们的 do(.) 算子基于代表因果机制的函数;两形式主义是否相同不确定。

我们现展示两形式主义在递归系统上相同;换言之,组合和有效性在递归性成立时对 Lewis 最接近世界框架成立。我们从提供 Lewis 反事实句子逻辑版本(取自 Lewis 1973c)开始。

规则:(1) 若 A 和 A ⟹ B 是定理,则 B 也是。(2) 若 (B₁ ∧ …) ⟹ C 是定理,则 ((A ⊃ B₁) ∧ …) ⟹ (A ⊃ C)。

公理:(1) 所有真值函项重言式。(2) A ⊃ A。(3) (A ⊃ B) ∧ (B ⊃ A) ⟹ (A ⊃ C) ⊃ (B ⊃ C)。(4) ((A ∨ B) ⊃ A) ∨ ((A ∨ B) ⊃ B) ∨ (((A ∨ B) ⊃ C) ⊃ (A ⊃ C) ∧ (B ⊃ C))。(5) (A ⊃ B) ⟹ A ⟹ B。(6) (A ∧ B) ⟹ A ⊃ B。

句子 A ⊃ B 代表"在所有 A 成立的最接近世界中 B 也成立"。要把 Lewis 公理与因果模型公理关联,必须翻译其语法。我们把 Lewis 世界等同于因果模型中所有变量(含 U)的实例化。因果模型中变量子集的赋值代表 Lewis 命题(如规则和公理中的 A 和 B)。因此令 A 代表合取 X₁ = x₁ ∧ … ∧ Xₙ = xₙ,令 B 代表合取 Y₁ = y₁ ∧ … ∧ Yₘ = yₘ。则 A ⊃ B 等价于 Y_{1 x₁, …, xₙ}(u) = y₁ ∧ … ∧ Y_{m x₁, …, xₙ}(u) = yₘ。(7.41) 反过来,需把 Yₓ(u) = y 等因果陈述翻译为 Lewis 记法。令 A 代表命题 X = x,B 代表 Y = y。则 Yₓ(u) = y 等价于 A ⊃ B。(7.42)

公理 (1)–(6) 从最接近世界解释得出,未对距离测度施加任何限制,除要求每世界 w 距自身不超其他世界 w' ≠ w。因结构语义在世界间定义明显距离测度 d(w, w'),由把 w 转化为 w' 所需的最小局部干预数给出,Lewis 所有公理应在因果模型中成立并逻辑上从有效性、组合和(非递归系统)可逆性推出。这将首先被显式展示。然而要保证结构语义不引入新约束,需展示逆:结构语义三公理由 Lewis 公理推出。这将随后展示。

为展示公理 (1)–(6) 在结构语义中成立,逐个检查:(1) 平凡真——任何真值函项重言在结构模型中也是真值函项重言。(2) 与有效性相同:若强制 X 取值 x,则 X 结果值为 x,即 Xₓ(u) = x。(3) 是可逆性的较弱形式,仅对非递归因果模型相关——递归系统中可逆性平凡成立(见 7.3.1),故 Lewis 公理 (3) 的弱形式随之成立。(4) 因结构模型中行动限于文字合取,A 和 B 是字面量,该公理退化。(5) 该公理由组合推出:把 (A ⊃ B) 解读为在所有最近 A-世界 B 也成立,配合规则 (1) 即得组合含义。(6) 该公理由组合推出:A ∧ B 都真则 B 平凡真。

为展示组合和有效性从 Lewis 公理推出,组合是 Lewis 形式中公理 (5) 和规则 (1) 的推论,有效性与 Lewis 公理 (2) 相同。简言之,Lewis 框架在递归系统上不添加新约束:结构模型语义是 Lewis 一般最近世界框架的一个特例,且在递归假设下两者完全重合。

总之,对递归模型,因果模型框架未对反事实陈述施加 Lewis 框架之外的任何限制;最近世界的一般概念足够。递归性假设如此强以至它已蕴含结构语义施加的所有其他限制。当考虑非递归系统时,我们看到可逆性不被 Lewis 框架强制。Lewis 公理 (3) 类似但不如可逆性强;即使 Y = y 在所有最接近 w-世界中成立且 W = w 在所有最接近 y-世界中成立,Y = y 在实际世界中仍可能不成立。尽管如此,我们可以安全结论:采用反事实的因果解释(连同可修改结构方程模型的表征和算法机制),我们未对相对递归系统有效的反事实陈述集引入任何限制。

7.4.3 成像与条件化(Imaging versus Conditioning)

若行动是从一个概率函数到另一个概率函数的变换,可问是否每个此类变换对应一行动,或是否有些约束是源于行动的变换所特有。Lewis (1976) 反事实形式确实识别这种约束:变换必须是成像算子(imaging operator)。Bayes 条件化 P(s | e) 把被 e 排除状态的整个概率质量按当前 P(s) 比例转移到剩余状态;成像工作方式不同;每个被排除状态 s 把其质量单独转移到被认为"最接近"s 的某状态集 S(s)。的确,(3.11) 中我们看到行动 do(Xᵢ = x'ᵢ) 定义的变换可用这种质量转移过程解释;每个被排除状态(即 Xᵢ ≠ x'ᵢ 者)把其质量转移到共享同 paᵢ 值的一组特定未排除状态。这种对最接近状态集 S(s) 的简单刻画对 Markovian 模型有效,但成像一般允许选择任何此类集合。

成像是行动相关变换更恰当表示的原因可由 Gärdenfors (1988, 定理 5.2, p. 113;奇怪的是,行动的联系从未出现于 Gärdenfors 分析)表示定理看出。Gärdenfors 定理陈述概率更新算子 P(s) → P_A(s) 是成像算子当且仅当它保持混合;即 [λP(s) + (1−λ)P'(s)]A = λP_A(s) + (1−λ)P'_A(s) 对所有常数 λ ∈ [0, 1]、所有命题 A 和所有概率函数 P 和 P'。换言之,任何混合的更新是更新的混合。该性质(称为同态)允许我们以转移概率规约行动,正如随机控制和 Markov 决策过程通常所做。记 P_A(s | s') 为已知状态 s' 上执行行动 A 所得概率,同态 (7.43) 规定 P_A(s) = Σ P_A(s | s') P(s');这意味着 s' 不确定时 P_A(s) 由 P(s') 加权对 s' 的 P_A(s | s') 加权和给出,权重为当前概率函数 P(s')。

该刻画过于宽松;虽然它要求任何基于行动的变换可用转移概率描述,它也接受任何转移概率规约(无论多么异想天开)作为某行动描述符。行动被定义为局部手术这一宝贵信息在该刻画中被忽略。例如与原子行动 Aᵢ = do(Xᵢ = xᵢ) 关联的转移概率源自装配中仅一个机制的删除。因此与原子行动集关联的转移概率通常互相约束——例如因它们共享相同的 U 分布。这种约束在概率赋给 U 状态时由有效性、组合和可逆性公理涌现(Galles and Pearl 1997)。因此成像加 Gärdenfors 定理虽然捕捉了行动变换的"线性"性质(保持混合),但没有充分约束转移概率的具体形式;把成像升级为"局部手术"才能完全刻画结构因果意义上的行动。

7.4.4 与 Neyman-Rubin 框架的关系(Relations to the Neyman–Rubin Framework)

寻找模型的语言。我们用于反事实量的记法 Yₓ(u) 借自 Neyman (1923) 和 Rubin (1974) 的潜在结果框架(3.6.3 节简要介绍),该框架为处理效应的统计分析而设计。在该框架中,Yₓ(u)(常写作 Y(x, u))代表实验单位 u(如个人或农业地块)在假设实验条件 X = x 下的结果。然而与结构建模不同,该变量不源自因果模型或任何科学知识的形式表示,而被视为原始的——即未观察变量,仅在 x 与实际接受处理一致时揭示其值,由一致性规则 X = x ⟹ Yₓ = Y(式 (7.20))规定。因此潜在结果框架不提供可从中导出此类规则的数学模型,或在其上尝试公理刻画以决定(例如)是否应部署附加规则或给定潜在结果表达式集合是否冗余或矛盾的模型。7.1 节形式化的结构方程模型事实上提供了潜在结果框架缺乏的形式语义,因每个这样的模型为潜在结果研究中使用的反事实量赋相容真值。从结构视角看,量 Yₓ(u) 不是原始的,而是从方程组 F(透明地代表关于主题的知识)数学导出。该知识通过参与方程的变量定性地表达,不承诺其精确函数形式。变量 U 代表与分析相关的任何背景因素集,不必是总体中特定个人的身份。

用此语义,7.3 节我们建立了潜在响应函数 Yₓ(u) 的公理刻画及其与观察变量 X(u) 和 Y(u) 的关系。这些基本公理包含或蕴含潜在结果研究者视为给定的限制,如一致性规则(式 (7.20))。完备性结果进一步保证递归模型中涉及反事实关系的演绎可安全地只用两公理管理:有效性和组合。结构方程语义蕴含的所有真理也可由这两公理推出。类似地——在构建递归模型假设性列联表时(见 6.5.3 节)——我们保证,一旦表满足有效性和组合,就至少存在一个因果模型生成该表。本质上,这建立了结构方程建模(流行于经济学和社会科学,Goldberger 1991)与潜在结果框架(如统计中所用,Rubin 1974; Holland 1986; Robins 1986)的形式等价。在非递归模型中情况并非如此。仅用组合和有效性评估反事实陈述的尝试可能无法确认某些有效结论(即在所有因果模型中真)——其有效性只能通过可逆性识别。

图与反事实分析。结构与潜在结果框架间的形式等价涵盖语义和表达力问题,但不含概念化或实际有用性的等价。结构方程及其关联图特别用作表达关于因果关系假设的工具。这些假设以先验经验知识为基础——如众多证据所示——在人脑中以相互连接的自主机制装配编码。这些机制因此是判断反事实所导出的构件。结构方程 {fᵢ} 及其图抽象 G(M) 为这些机制提供直接映射,因此构成阐述或验证因果知识或假设的自然语言。潜在结果框架的主要弱点在于要求假设以涉及反事实变量的条件独立性关系表达。例如 (7.30) 中表达的假设连熟练研究者也不易理解,但其结构形象 U₁ ⊥⊥ U₂ 唤起直接基于过程的解释。

图和反事实记法间的和谐共生在 7.3.2 节演示。该例中假设以图形式表达,然后翻译为反事实记法(用 (7.25) 和 (7.26) 规则),最后提交代数演绎。这种共生提供比坚持直接以反事实表达假设的方法更有效的分析方法。更多例子将在第 9 章演示,那里分析因果概率。注意在 7.3.2 节演绎中,图继续通过显示难由代数方法导出的独立性关系协助过程。例如几乎不直接显示 (7.27)–(7.30) 假设蕴含条件独立性 (Y_z ⊥⊥ Zₓ | {Z, X}) 但不蕴含条件独立性 (Y_z ⊥⊥ Zₓ | Z)。这些蕴含可容易在图 7.5 图或 7.1.3 节双网络构造(图 7.3)中测试。

塑造因果假设为图语言最具说服力的理由是这些假设在数据收集前就需要,此时模型参数仍"自由"(即仍由数据决定)。通常诱惑是把那些假设塑造为统计独立性的语言,这带有可检验性光环因而具科学合法性(第 6 章示例化这种诱惑的无用)。然而统计独立性条件——无论涉及 V 变量、U 变量还是反事实——通常对模型参数值敏感,在模型构建阶段不可用。建模阶段可用的实质知识不能支持这种假设,除非它们是稳定的,即对所涉参数值不敏感。图模型蕴含(仅基于机制间相互连接)满足该稳定性要求,因此可在数据收集前由一般实质知识确定。例如图 7.5 蕴含的断言 (X ⊥⊥ Y | Z, U₁) 对 {fᵢ} 中任何函数替代和对 U₁, U₂ 的任何先验概率赋值仍有效。

这些考虑不仅适用于因果假设的构建,也适用于因果概念定义和交流的语言。社会科学和医学科学中许多概念以未观察 U 变量间关系定义,也称"误差"或"扰动项"。5.4.3 节我们看到因果外生性和工具变量等关键计量概念传统上以某观察变量与某误差项间相关性缺失定义。自然地,这些定义引来严格经验主义者批评,他们视不可观察者为形而上学或定义性(Richard 1980; Engle et al. 1983; Holland 1988),也(更近期)引来潜在结果分析者批评,他们错误地把结构模型的使用视为对特定函数形式的无端承诺(Angrist et al. 1996)。这些批评将在下节考虑。

7.4.5 外生性与工具变量:反事实与图定义(Exogeneity and Instruments: Counterfactual and Graphical Definitions)

本章分析提供结构方程模型中误差项的反事实解释,补充 (5.25) 的操作定义。我们已看到方程 Y = f_Y(pa_Y, u_Y) 中误差项 u_Y 的意义被反事实变量 Y_{paY} 捕捉。换言之,变量 U_Y 可解释为从 PA_Y 到 Y 函数映射的修正量。这种修正的统计量在 pa_Y 固定时可观察。翻译为反事实记法可能便利 U_Y 的代数操作,无需承诺 f_Y 的函数形式。然而从模型规约视角,误差项仍应被视为(被省略因素的)摘要。

凭此解释,我们可获得因果概念(图或反事实)的原本基于误差的定义。这些概念的例有因果影响、外生性和工具变量(5.4.3 节)。在澄清这些概念的基于误差、反事实和图定义间关系时,我们首先应注这三种描述方式可组织为简单层次。因图分离蕴含独立性,但独立性不蕴含图分离(定理 1.2.4),基于图分离的定义应蕴含基于误差项独立的定义。同样,因对任何两变量 X 和 Y 独立性 U_X ⊥⊥ U_Y 蕴含反事实独立性 X_{paX} ⊥⊥ Y_{paY}(反之不然),基于误差独立的定义应蕴含基于反事实独立的定义。整体上,我们有如下层次:图判据 ⟹ 基于误差的判据 ⟹ 反事实判据。

外生性概念可作为示例说明该层次。外生性的实用定义最好以反事实或干预术语形式化如下。

外生性(反事实判据):变量 X 相对于 Y 是外生的当且仅当 X 对 Y 的效果等同于 Y 给定 X 的条件概率——即若 P(Yₓ = y) = P(y | x) (7.45),或等价地 P(Y = y | do(x)) = P(y | x) (7.46);这又等价于独立性条件 Yₓ ⊥⊥ X,Rosenbaum and Rubin (1983) 称为"弱可忽略性"。该定义是实用的,因它通过明确经济学家应关注外生性的原因(揭示发现变量外生性的政策分析益处)凸显了与外生性的关联。然而该定义未能指导研究者如何从对域的实质知识验证该独立性条件是否在任何给定系统中成立,尤其当涉及许多方程时(见 11.3.2 节)。为便利这种判断,经济学家(如 Koopmans 1950; Orcutt 1952)采用定义 5.4.6 的基于误差的判据。

外生性(基于误差的判据):变量 X 在 M 中相对于 Y 是外生的,若 X 独立于对 Y 有不经 X 中介影响的所有误差项。该定义对人判断更透明,因参考误差项倾向于聚焦对 Y 有潜在影响的特定因素,科学家熟悉这些因素。然而,除非所考虑独立性由拓扑考虑决定以保证其稳定性,否则判断这些因素是否统计独立是困难心理任务。的确,外生性最流行概念被封装于"共同原因"观念中;这可形式陈述如下。

外生性(图判据):变量 X 相对于 Y 是外生的,若 X 和 Y 在 G(M) 中无共同祖先,或等价地,若 X 和 Y 间所有后门路径被(对撞箭头)阻断。

易证图条件蕴含基于误差的条件,后者又蕴含 (7.46) 反事实(或实用)条件。逆向蕴含不成立。例如图 6.4 展示图判据失败而基于误差和反事实判据都把 X 分类为外生性的情形。6.4 节我们论证这种外生性(该处称"无混淆")是不稳定或偶发的,我们已提出是否这些情形本意包含于该定义的问题。若我们从考虑中排除不稳定情形,则三层层次崩塌,三定义一致。

工具变量:三个定义。类似三层层次刻画工具变量概念(Bowden and Turkington 1984; Pearl 1995c; Angrist et al. 1996),见图 5.9。传统定义赋予变量 Z 工具性(相对于对 (X, Y))若 (i) Z 独立于对 Y 有不经 X 中介影响的所有变量(含误差项)且 (ii) Z 不独立于 X。

反事实定义用 (i') 替代条件 (i):Z 独立于 Yₓ。图定义用 (i'') 替代条件 (i):连接 Z 和 Y 的每条未阻断路径必含一指向 X 的箭头(替代地,(Z ⊥⊥ Y)_{GX})。图 7.8 通过例子说明该定义。

当测量了一组协变量 S 时,这些定义如下推广。

定义 7.4.1(工具):变量 Z 相对于 X 对 Y 的总效应是工具,若存在一测量集 S = s,不受 X 影响,使以下任一判据成立:

  1. 反事实判据:(i) Z ⊥⊥ Yₓ | S = s;(ii) Z ⊥⊥ X | S = s。
  2. 图判据:(i) (Z ⊥⊥ Y | S)_{GX};(ii) (Z ⊥⊥ X | S)_G。

本节结论处,我应重申,正是因为图定义对模型参数值不敏感,图词汇如此好地引导和表达我们对因果效应、外生性、工具、混淆甚至(我推测)随机性和统计独立性等更技术性概念的直觉。

7.5 结构与概率因果(Structural Versus Probabilistic Causality)

概率因果是哲学的一个分支,试图以概率关系解释因果关系。这一尝试由几个想法和期望驱动。首先最重要的是,概率因果承诺解决古老因果发现之谜——即人类如何从无任何因果先入观念的纯经验观察中发现真正因果关系。给定 Hume 教条(所有知识源自人类经验)和(当时流行但不那么有说服力的)假设(人类经验以概率函数形式编码),自然期望因果知识可被归约为所关注变量上某概率分布中一组关系。其次,与因果的确定性说明对照,概率因果提供显著认知经济。物理状态和物理规律无需以微小细节规约,因它们可代之以宏观状态间概率关系形式概括以匹配自然话语粒度。第三,概率因果能处理现代(即量子理论)不确定性概念,其中决定论仅为认知虚构,非决定性是物理现实基本特征。概率因果形式化方案归功于 Reichenbach (1956) 和 Good (1961),随后被 Suppes (1970)、Skyrms (1980)、Spohn (1980)、Otte (1981)、Salmon (1984)、Cartwright (1989) 和 Eells (1991) 推进。考虑其原始雄心,该方案现状相当令人失望,但不令人惊讶,考虑 1.5 节讨论。Salmon 已彻底放弃该努力,结论"因果关系不应以统计相关性关系分析"(1984, p. 185);他代之以"因果过程"为基本构件的分析。Cartwright 和 Eells 的更近期说明解决了 Salmon 遇到的某些困难,但代价是或者把理论复杂到难以辨认,或者妥协其原始目标。以下简要叙述 Cartwright (1989) 和 Eells (1991) 描绘的概率因果主要成就、困难和妥协。

7.5.1 对时间排序的依赖(The Reliance on Temporal Ordering)

概率因果标准说明假设,除概率函数 P 外,我们还被给定分析中变量的时间顺序。这可理解,因果是非对称关系,而统计相关性是对称的。缺乏时间信息,决定两个依赖变量哪个是因哪个是果不可能,因每联合分布 P(x, y) 由 X 为 Y 因的模型诱导也可由 Y 为 X 因的模型诱导。因此任何推断 X 为 Y 因的方法必也对称地推断 Y 为 X 因。第 2 章我们展示了确实至少需要三个变量才能决定 DAG 中箭头方向性,且更严重地,无箭头能从纯概率信息定向——无附加的(因果)稳定性或最小性假设。施加效果永不超过其因的约束,对称被打破,因果推断可开始。

对时间信息的依赖有其代价,因为它先验地排除了时间顺序未明确定义情形的分析——无论因过程在时间上重叠还是它们(看似)瞬时发生。例如我们必须放弃(非受控方法)确定持续体育锻炼是否有助于低胆固醇水平,或反之低胆固醇水平增强体育锻炼欲望的可能性。类似地,概率因果哲学理论不会试图区分"高旗杆导致长影子"与"长影子导致高旗杆"——为所有实际目的,假定因和果同时发生。第 2 章我们已看到一些因果方向性可从非时间统计信息决定,若加上最小性或稳定性假设。这些假设隐含反映物理过程一般性质——不变性和自主性(见 2.9.1 节)——它们构成因果结构方法基础。

7.5.2 循环性的危险(The Perils of Circularity)

尽管依赖时间优先,哲学家为识别因果关系设计的判据却受显著循环性困扰:为了确定事件 C 是否为事件 E 的因,必须预先知道其他因素如何与 C 和 E 因果相关。这种循环性源于需要定义评估因果关系的"背景语境",因"原因应增加其效果概率"的直觉思想必须以"其他事物假定相等"为条件限定。例如"学算术"增加通过科学测试的概率,但仅当我们保持学生年龄不变;否则学算术可能实际上降低通过测试概率,因它指示年幼。因此似乎自然提供以下。

定义 7.5.1:事件 C 与 E 因果相关若在某背景语境 K 中至少有一个条件 F 使 P(E | C, F) ≠ P(E | ¬C, F)。但背景语境应包含何种条件?一方面,坚持对物理环境完整描述将概率因果归约为决定论物理(除量子级考虑外)。另一方面,完全忽略背景因素——或对它们描述过粗——将引入伪相关和其他混淆效果。一种自然妥协是要求背景语境本身"因果相关于"所问变量,但这一举措正是概率因果定义中循环性的源头。

选择适当背景因素集的问题类似于几章中关于混淆调整讨论的适当调整问题(如第 3.3、5.1.3 和 6.1 节)。我们已看到(如 6.1 节)选择适当协变量集用于调整的判据不能仅基于概率关系,必须依赖因果信息。特别地,我们必须确保列为背景的因素满足后门条件,因定义 7.5.1 中的不等式总能通过条件化某想象因素 F(如 6.2(c) 图)来满足,该因素在 C 和 E 间产生伪关联。这里我们看到循环性涌现:为了确定 C 相对于 E 的因果角色(如药物对恢复的效果),我们必须先确定每因素 F(如性别)相对于 C 和 E 的因果角色。

可尝试通过条件化 C 前所有因素来逃出该循环,但不幸的是,其他不能仅通过时间排序识别的因素也必须被权衡。考虑 7.2.2 节用的打赌例子。我必须对公平抛硬币结果押正或反;押对赢押错输。自然地,一旦硬币抛出(结果仍未知),赌注被认为与赢因果相关,尽管我押正或反赢的概率相同。为揭示赌注 (C) 的因果相关性,我们必须把硬币结果 (F) 包含在背景语境中,即使 F 不满足共同原因判据——它不影响我的赌注 (C),也不因果相关于赢 (E)(除非我们先宣告赌注与赢相关)。更糟的是,我们无法通过 F 早于 C 发生来正当化把 F 包含在背景语境中,因硬币是否先于我的赌注抛出与问题本身完全无关。我们结论,仅时间优先不足以识别适当背景语境,即使我们诉诸 Eells (1991) 所谓的"交互因"——即满足 (i) 不被 C 因果影响且 (ii) 与 C(或 ¬C)联合增加 E 概率的(简化)因素 F。

因所有因果相关性定义固有的循环性,概率因果不能被视为从时间-概率信息提取因果关系的方案;它应被视为验证所提因果关系集是否与可得时间-概率信息一致的方案。更形式地,假设某人给我们概率分布 P 和(完整)变量集 V 上时间顺序 O。此外,V 中任何对变量集(如 X 和 Y)被符号 R 或 I 注释,R 代表"因果相关",I 代表"因果不相关"。概率因果处理测试所提 R 和 I 标签是否与对 ⟨P, O⟩ 一致,并与"因应优先且增加其效果概率"的教条一致。

目前最先进一致性测试基于 Eells (1991) 相关性判据,可翻译如下。

一致性测试:对每对标记为 R(X, Y) 的变量,测试 (i) X 在 O 中优先于 Y;(ii) 存在 x, x', y 使 P(y | x, z) ≠ P(y | x', z) 对背景语境 K 中某变量集 Z 的某 z 成立,其中 I(X, Z) 和 R(Z, Y)。这引发进一步问题:(a) 是否每对 ⟨P, O⟩ 都有一致标签?(b) 标签何时唯一?(c) 当一致标签存在时是否有寻找它的程序?尽管图方法提供对这些问题的某些洞见(Pearl 1996),要点是因循环性,概率因果的使命已改变:从发现到一致性测试。

还应指出,定义因果于条件化(即使成功)的基本方案与作为干预神谕的因果自然概念冲突。该方案首先把因果关系 P(E | do(C)) 与认识条件化 P(E | C) 混淆,然后通过补救性条件化步骤去除伪相关,得到 P(E | C, F)。相比之下,结构说明直接以自然不变量(即定义 7.1.2 子模型 Mₓ)定义因果;见定理 3.2.2 后的讨论。

7.5.3 挑战封闭世界假设,与儿童(Challenging the Closed-World Assumption, with Children)

概率因果最关键最不站得住脚的范式基础在于假设人们拥有某域所有相关变量的概率函数。该假设免除分析者担心可能(物理上)影响分析中几个变量而对分析者仍隐晦的未测量伪因。众所周知这种"混淆因素"的存在可反转或否定任何可能从概率导出的因果结论。例如观察者若不知蚊虫角色可能结论"坏空气"是疟疾因,或下降气压是雨因,或上班加速是迟到因。因它们未测量(甚至未被怀疑),这种例中混淆因素不能通过条件化或"保持固定"中和。因此认真对待 Hume 从原始数据提取因果信息的方案意味着处理下述问题:任何此类信息有效性都以"所有相关因素已被考虑"这一不可检验假设为前提。

这引发问题:人们如何从环境获得因果信息,更具体地,儿童如何从经验提取因果信息。试图通过统计学习理论解释该现象的概率因果支持者不能忽略儿童永不在封闭孤立环境中操作的事实。未注意的外部条件支配每个学习环境的操作,这些条件常以意外和隐蔽方式具有混淆因果的潜能。

幸运的是,儿童不生长于封闭无菌环境确有其利。除被动观察外,儿童拥有两个普通统计学家无法获得的宝贵因果信息来源:操纵实验和语言建议。操纵使假定因果事件服从已知机制的唯一影响,因此压倒可能也产生假定效果的未控制因素的影响。"独立操纵之美当然是其他因素可在不被识别下保持不变"(Cheng 1992)。独立通过使关注对象服从一己意志任性来达成,确保该操纵不受任何可能产生假定效果的环境因素影响。例如儿童可推断摇动玩具能产生格格声,因是儿童的手(仅由儿童意志支配)带来玩具摇动和随后格格声。自由操纵的任意性质替代了统计随机化实验观念,并起从儿童行动产生的声音中过滤由未控制环境因素产生声音的作用。

但操纵实验不能解释人类获得和拥有的大部分因果知识,仅因我们环境中大多数变量不能被直接操纵。第二个宝贵因果知识来源是语言建议:关于事物运作的显式因果句,我们从父母、朋友、老师和书本获得并编码了过去世代的操纵经验。尽管该因果信息来源表面明显不有趣,它可能占我们因果知识的大部分,理解这种知识传递如何运作远非平凡。为理解和吸收如"玻璃因你推它而破碎"这种因果句,儿童必须已具备使这种输入有意义的因果图式。为进一步推断推玻璃将使某人对你生气而非你兄弟(即使他打碎了上个玻璃),需要真正复杂推理机制。在多数儿童中,该机制可能是先天的(Gopnik et al. 2004)。

注意然而语言输入大体上是定性的;我们很少听到父母向孩子解释把玻璃置于桌边使破碎概率增加 2.85 倍。概率因果方法把这种定性输入嵌入人为数值框架,而因果结构方法(第 7.1 节)直接建立于我们获得和语言传递的定性知识。本节最后回到对概率因果程序整体评价:本节提出质疑,保持与决定论物理教导相容的理想是否真的证明其代价合理。基本议程需要严肃重审——若方案是认识论练习则"概率"是矛盾修饰(人类因果感知仍为准决定论),若方案是现代物理练习则"因果"一词不必要(量子级因果遵循其自身规则)。在 AI 和认知科学中,按 Laplace 和 Einstein 准决定论宏观近似编程的机器人会远胜于按正确但反直觉的 Born-Heisenberg-Bohr 量子理论构建的机器人。

7.5.4 单例与一般因(Singular versus General Causes)

7.2.3 节我们看到一般因(如"喝毒芹导致死亡")和单例因(如"苏格拉底喝毒芹导致他死亡")的区分在理解解释本质上起重要作用。我们也已指出单例因果(也称"标记"或"单事件"因果)概念在概率因果说明中未达到适当概念化或形式化状态。本节我们详述这些困难性质并结论它们源于概率说明的基本缺陷。第 1 章(图 1.6)我们证明单例因果主张的评估需要反事实或函数关系形式的知识,且这种知识不能从纯统计数据(即使受控实验下获得)提取。该限制在 7.2.2 节被归因于支持反事实陈述所需信息的时间持续性(或不变性)——该持续性在统计陈述中(即使用时间和因果相关信息丰富时)通过平均被洗掉。该基本限制在概率因果文献中呈现有趣偏向并引发关于单例和一般陈述关系(见 Good 1961; Cartwright 1989; Eells 1991; Hausman 1998)的密集争论。

按概率因果基本信条之一,因应提升其效果概率。然而我们常在条件概率 P(y | x) 低于 P(y | x') 时判断事件 x 为 y 的因。例如疫苗 (x) 通常降低疾病 (y) 概率,我们常在说(且能医学上验证)疫苗本身在给定人 u 身上导致该疾病。此反转对结构模型学习者不问题,他们能把单例陈述解释为"若人 u 未接种疫苗 (x'),则 u 仍健康 (y')"。该反事实陈述概率 P(Y_{x'} = y' | x, y) 可高,而条件概率 P(y | x) 以及 P(y | do(x)) 低,所有概率由同一结构模型评估(9.2 节给出三量间的精确关系)。然而此反转对概率因果学习者是创伤,他们因各种原因不信任反事实——部分因反事实带有决定论光环(Kvart 1986, pp. 256–63),部分因反事实被视为基于"我们仅有语义开端(通过可能世界上的测度装置)"的不稳形式基础(Cartwright 1983, p. 34)。

为调和概率增加概念与单例因果,概率论者主张若我们足够仔细地看任何给定情景(其中 x 被判为 y 的因),将总能找到子总体 Z = z,其中 x 提升 y 的概率——即 P(y | x, z) ≠ P(y | x', z)。(7.47) 在疫苗例中,我们可能把所求子总体识别为对疫苗不良易感个体;按定义,疫苗无疑在该子总体提升疾病概率。奇怪的是,仅少数哲学家注意到"不良易感"等因素被反事实定义,且在允许条件化于这种因素时,我们开了把决定论和反事实信息秘密溜回分析的后门。

也许更隐晦的反事实出现于 Hesslow (1976) 的避孕药例(4.5.1 节讨论)。假设我们发现 Jones 夫人未孕并问服用避孕药是否是她血栓症的因。未孕女性总群体结果过粗不能明确回答此问题。若 Jones 夫人属于若无药则会孕的妇女类,则药可能实际上通过防孕降低她血栓概率。若另一方面她属于无论有药否都不会孕的妇女类,则她服药肯定增加血栓机会。该例启发因为两类测试人群在英语中没有既定名字(与疫苗例中"易感性"不同)必须以反事实词汇显式定义。妇女属前类或后类取决于许多社会和偶发环境(通常未知且不太可能定义给定人的不变属性)。我们仍认识到评估药是否 Jones 夫人血栓因时需分别考虑两类。

因此我们看到处理标记级因果时无法逃避反事实。概率论者坚持无反事实句法以定义标记因果主张导致用反事实表达式划分子总体:"疫苗例中"不良易感""和 Jones 夫人例中"本不会孕"。概率论者当然可争辩无需把子类 Z = z 精细到决定论极端,因为一旦找到按 (7.47) 要求提升 y 概率的子类就可停止精细化。该论证近乎重言,除非附以从某合理人类知识模型(无论多假设)识别测试子总体 Z = z 并计算 (7.47) 量的形式程序。不幸地,概率因果文献对程序和表征问题保持沉默。

具体地,概率论者在解释人们如何如此迅捷一致地搜寻解救子总体 z 及多数人在问是否 x 导致 y 时如何得到相同答案上面临困难两难。例如(Debra Rosen 所给,引于 Suppes 1970)偶然偏转高尔夫球的树枝 (x) 立即一致地被感知为球最终入洞的"因",尽管这种碰撞通常降低入洞 (y) 概率。显然若存在满足 (7.47) 的子总体 z(在这种例中,且我怀疑它从未进入任何人脑海),它必须至少有两特征。

(1) 它必含 x 前后发生的事件。例如球撞枝的角度及球撞枝后落在草上的纹理都应为 z 的一部分。 (2) 它必依赖于 x 和 y。因为若我们测试枝是否导致替代结果 y'(如球停在离洞两码短处),显然需不同条件集 z'。

这把我们带到概率因果方法中主要方法论不一致:若对 x 和 y 的无知导致错误的 z 且对 x 和 y 的意识导致正确 z 选择,则必存在某过程使人们把 x 和 y 的发生纳入意识。该过程是什么?按概率认识论规范,证据通过条件化纳入知识体系。那么我们如何正当化从 z 排除导致其选择的证据——即 x 和 y 的发生?检查 (7.47) 显示 x 和 y 从 z 排除在句法上被迫,因它将使 P(y | x', z) 未定义并使 P(y | x, z) = 1。的确,在概率演算句法中我们不能问事件 y 的概率(给定 y 实际已发生)——答案(平凡)为 1。我们能做的最好是暂时脱离实际世界,假装对 y 发生无知,问该无知状态下 y 的概率。这恰好对应支配 P(Y_{x'} = y' | x, y) 评估的三步(溯因、行动、预测)(见定理 7.1.7),它在我们例中获高值并正确把树枝 (x) 定为入洞 (y) 因。我们看到,所求量可用关于 x 和 y 的普通条件化表达和评估,无需显式诉诸任何子总体 z。

具有讽刺意味的是,通过拒绝反事实条件句,概率论者剥夺了自己使用标准条件句——他们正试图保留的条件句——的权利,被迫以迂回方式容纳简单证据信息。概率论者围绕因果竖立的句法屏障造成了单例与一般因之间人为紧张,但该紧张在结构说明中消失。10.1.1 节我们展示通过容纳标准和反事实条件句(即 Yₓ),单例和一般因不再需要分开分析。两种因类型仅在加于问题的场景特定信息水平上不同——即进入量 P(Yₓ = y | e) 的证据 e 的具体性。

7.5.5 总结(Summary)

Cartwright (1983, p. 34) 列出追求概率路径而非反事实路径的若干理由:"[反事实路径]要求我们评估反事实的概率,对此我们仅有语义的开始(通过可能世界上的测度装置)且无方法论,更无论说明该方法论为何适合语义。我们如何测试关于反事实概率的主张?我们无答案,更无符合我们新兴语义的答案。最好有效果度量,其仅要求可在实际世界以标准方式测试的事件上的概率。" 考察概率方法过去三十年进展,似乎清楚 Cartwright 的愿望已实现——但不是在她倡导的框架中,而是在反事实的竞争框架中,即结构模型中体现者。"效果"(我们词汇中的"因果效应")以"可测试事件"的完全刻画源自 Simon (1953) 和 Strotz and Wold (1960) 的可修改结构模型概念,并最终化为后门判据(定理 3.3.2)和更一般的定理 3.6.1 和 4.4.1,其中概率判据(如 (3.13))仅为粗略特例。单例因果以反事实概率 P(Y_{x'} = y' | x, y) 的解释已获有意义形式语义(第 7.1 节)和有效评估方法(定理 7.1.7 和 7.1.3–7.2.1 节)的支持,而 (7.47) 的概率判据停留在含糊无程序的争论。原始使因果主张可测试的梦想在概率框架中被放弃——一旦未测量实体(世界状态、背景语境、因果相关性、易感性)被允许渗入分析,关于可测试性问题的解答方法已转向结构-反事实框架(见第 9 章和 11.9 节)。

与决定论物理学教导相容的理想似乎仍是概率因果方案唯一可行方面,本节质疑维持该理想是否证明牺牲合理。它进一步建议概率因果方案基本议程需要严肃重审。若该方案是认识论练习,则"概率"一词是矛盾修饰——人类因果感知仍为准决定论,这些易错人类仍是因果谈论主要消费者。若该方案是现代物理练习,则"因果"一词不必要——量子级因果遵循其自身规则和直觉,另一名字(也许"准因果性")或更贴切。然而就人工智能和认知科学而言,我愿预测被编程以模拟 Laplace 和 Einstein 准决定论宏观近似的机器人将远胜于基于正确但反直觉的 Born、Heisenberg 和 Bohr 理论构建的机器人。

本章个人批注

第 7 章是全书的真正技术核心,某种意义上可视为之前六章的"形而上学清算"。前面章节给出 do-calculus、图判据、各种识别策略,本章把它们统一在一个公理化、可计算、与 Neyman-Rubin 框架相容的语义之下。读完本章我最大的感受是:Pearl 的反事实定义 (7.1.5) 的"最小修改"思想是整个结构因果理论的关键设计选择——它绕开了回溯推理的歧义,并让 Yₓ(u) 在 U 空间上变成普通事件,从而 P(Yₓ = y | e) 成为良定义的概率。

定理 7.1.7 的三步(abduction-action-prediction)虽只占半页,但它是 9 章 PN、10 章实际原因分析的基础。我注意到双网络方法 (7.1.4) 的"连体双胞胎"隐喻背后是 fact:U 共享而内生变量复制——这把"反事实"重新表达为"对扩展网络上普通事件的信念传播",让所有贝叶斯网络算法可被复用。这是非常优雅的"工作马"。

7.2.2 节的"反事实不是经验上不可验证的"反驳(用 Ohm 定律 V = aI 例子)是教科书级别的科普写作。Pearl 把"ceteris paribus"的歧义推到前台,说明反事实句法正是用"在 t₀ 时刻实验室盛行条件"这一具体语境替换了含糊的"其他条件相同"。我读到这里才明白为何 4 章那些 do(.) 算子的形式化在哲学上是必要的:仅仅说 P(y | x, z) 不够,必须能说"在固定 z 之外还指定 x 的干预"。

7.3.1 节组合/有效性/可逆性三公理是我个人最看重的部分。原因:它们独立但合在一起完备刻画了结构模型语义下所有反事实性质。这意味着"识别性"问题(3.2.3)可被机械化——任何可识别的反事实量都可通过反复应用这两/三公理化为普通概率。定理 7.3.5 (recursive completeness) 把 Pearl 的工作与 Halpern 的可能世界公理化对接,奠定了因果推理的"编译目标"。

7.3.2 节吸烟-癌症例子用纯符号操作(不用图)重新导出 3.4.3 节的前门公式——这演示了"图 + 反事实"组合的算法效率:图给出独立性假设的清晰语言,反事实记法便于代数操作,两者各司其职。Pearl 在注 25 对 Angrist et al. 1996 的批评("研究者通常不真知道这些扰动代表什么")值得一读——他论证说,不懂机制的统计学家也不可能对反事实依赖做出可靠判断。

7.4 节比较 Lewis 和结构方法的部分,对我而言哲学价值高过技术内容。Pearl 用"Nixon 按按钮"例子击穿 Lewis 的"奇迹"机制——按钮断连的世界比核爆世界更相似于我们的世界,但显然我们不愿接受反事实"按按钮 → 核爆"为假。Pearl 的解释是把"奇迹"换为"原则性的微小手术",把抽象相似性换为机制性局部修改。这与第 8 章 8.2 节将要讨论的"minimality assumption"有直接联系。

7.4.4 节明确陈述了"结构 = 潜在结果"在递归模型上的形式等价。这对跨学科交流极重要:做计量的、做统计的、做 AI 的,可以承认自己用的是同一种数学对象。我注意到 Pearl 紧接着在 7.4.4 末尾转过来强调"等价不等于实用等价"——结构图是更自然的假设语言,潜在结果框架假设表述需要复杂的反事实条件独立性如 (7.30)。这是用得最多的反驳"图无信息论价值"的反例。

7.4.5 节外生性的三层判据(graphic ≻ error-based ≻ counterfactual)解决了一个长期困扰我的问题:为什么经济学的"外生"和统计学的"无混淆"看似是同一概念却用不同方式定义?答案:它们是同一概念在不同强度假设下的体现。Pearl 进一步指出,6.4 节那种图判据失败但反事实判据成立的情况是"不稳定"的外生性,应被排除。

7.5 节"结构 vs 概率因果"是哲学分量最重的部分。7.5.2 节的"循环性"诊断是我读过的对概率因果最锐利的批评:定义 C 对 E 的因果相关性需要条件化某 F,但 F 的选择又需知道 F 对 C、E 的因果角色——这种循环让"从数据发现因果"沦为"检验与数据一致性的因果标签"。Pearl 因此把概率因果的真正使命从"发现"降级为"一致性测试"。

7.5.3 节"用儿童挑战封闭世界假设"对我特别有共鸣:Pearl 把儿童拥有两个"统计学家没有的武器"(操纵实验 + 语言建议)展开——这解释了为何科学因果发现可行。Hume 那个"从纯观察数据提取因果"的计划从根本上低估了人脑可用的工具。

7.5.4 节"单例 vs 一般因"是 9-10 章的预演。疫苗例(概率降低但仍是因)和 Hesslow 避孕药例(取决于"她会否怀孕"这一反事实定义的子总体)共同说明:单例因果本质上是反事实的,任何想消除反事实的尝试都偷偷在条件化变量中重新引入它们。Pearl 在 7.5.4 末尾回到 7.1.7 的三步程序作为唯一能正确处理"在已知 x 和 y 已发生时"这种场景的框架。

7.5.5 节总结的语气稍带悲观——他承认 Cartwright 的初衷(用概率语言让因果可测)在结构框架中得到了实现,而非在她的概率框架中。末段的"准因果性(qua-sality)"戏谑提议和"Laplace 机器人会胜过 Born 机器人"预测,是 Pearl 收尾的招牌式风格。

与上下章的衔接(一段话)

第 7 章是 Pearl 因果理论三大支柱(图的因果读、do-calculus 识别、结构反事实语义)中最抽象、技术性最强的一章,向上承接第 1 章(介绍反事实)、第 3 章(基于图的因果效应识别)和第 4 章(行动、计划、直接效果)所建立的所有概念——本章把它们统一在 Yₓ(u) = y 这一形式定义下,并补齐了 Neyman-Rubin 框架缺失的形式语义。向下,本章为接下来三章搭建舞台:第 8 章用 7.1.3 节的反事实概率处理不完美实验,引入"效果"的新概念并给出界;第 9 章承接 7.5.4 节的单例因果讨论,用 P(Y_{x'} = y' | x, y) 形式化"原因概率",给出必要充分条件;第 10 章进一步把"实际原因"(actual cause)置于 7.2.3 节的解释语义下进行精细分析。本章在全书中的位置相当于"语法书"——前六章是词汇和短句,本章确立形式语言的公理和规则,接下来的章节则用这套语言写出"完整段落"。