第 31 章 因果推論與研究設計
第七部 因果推論與研究整合
31Chapter

因果推論與研究設計

=1.5em

前面各章所發展的模型,無論是迴歸、結構方程、多層次或成長曲線,其估計的核心多為變項間的關聯與條件期望。然而,行為科學的許多根本問題本質上是因果的:某介入是否改善了學習、某風險因子是否導致了症狀、某政策是否產生了效果。這些問題無法僅靠「關聯有多強」來回答,因為關聯可源於因果,也可源於混淆、選擇或反向因果。「相關不蘊含因果」是一句人人會說的箴言,但它只是起點而非終點:現代因果推論的貢獻,正在於提供一套嚴謹的形式語言,讓「在什麼條件下,關聯可被詮釋為因果」這一問題得到精確的回答。

本章對因果推論作一系統的處理。首先建立兩個奠基性的框架:Rubin 的潛在結果框架與 Pearl 的因果圖,二者互補地界定了因果效果、識別的假設與混淆的結構。其次,闡明「控制變項」這一看似無害的操作何以可能製造而非消除偏誤,並呈現隨機化實驗、傾向分數、工具變項、差異中差異與迴歸不連續等識別策略。再者,處理因果中介、未測混淆的敏感度分析與結構方程模型的因果詮釋。最後,論及縱貫因果推論的難處與可操弄性這一測量的哲學爭議。貫穿全章的核心訊息是:因果結論從不單由資料所給定,而總是資料與一組不可由資料本身檢驗的因果假設共同推得,方法的價值在於使這些假設明確、可辯護、且其後果可分析。

從相關到因果:問題的根本困難

因果推論的困難有其邏輯根源。欲知某介入對某個體的因果效果,理想上須比較「該個體接受介入」與「同一個體未接受介入」兩種情形下的結果之差。但任一個體在同一時點只能處於其一,另一情形的結果永遠無法觀測。Holland (1986) 將此稱為因果推論的根本問題(fundamental problem of causal inference):個體層次的因果效果本質上不可觀測,因為它涉及一個反事實(counterfactual)的、未曾發生的結果。

這一困難意味著,因果推論不可能是純粹的資料描述,而必然涉及對未觀測之反事實的推斷。統計方法之所以能夠回應,是因為雖然個體效果不可識別,群體平均的因果效果在適當假設下卻可以識別。理解因果推論,因此就是理解「哪些假設,能讓可觀測的關聯支撐起對不可觀測之反事實的推斷」。

潛在結果框架

上一節指出個體層次的因果效果不可觀測,卻還沒有說明「效果」二字究竟該如何精確地表述。潛在結果框架(potential outcomes framework)正是為此而設。它的直覺相當單純:談某個介入對某人的效果,其實是在比較兩個世界,一個是此人接受了介入的世界,另一個是此人未接受介入的世界,效果就是兩個世界中結果的差。這個框架源自 Rubin (1974) 並延續 Neyman 的傳統,其形式化的作法,是為每一個體同時設想在各種處理下的多個「潛在結果」,而因果效果即為這些潛在結果之差。如此界定的好處是,因果效果在個體層次上就有了明確意義,不必等到有樣本或有模型才談得上,而「哪些量估得到、要靠什麼假設才估得到」也隨之成為可逐條檢視的問題。

推導方塊潛在結果與根本問題

設個體 i 面對二元處理 W_i\in\{0,1\},並有兩個潛在結果:接受處理下的 Y_i(1) 與未接受下的 Y_i(0)。個體層次的因果效果定義為

\tau_i = Y_i(1) - Y_i(0).

然而觀測到的僅為對應於實際處理的那一個結果:

Y_i = W_i\,Y_i(1) + (1-W_i)\,Y_i(0),

另一潛在結果則為反事實、不可觀測,此即根本問題。群體層次的平均處理效果(average treatment effect, ATE)\tau = E[Y_i(1)-Y_i(0)] 仍可能識別。關鍵在於,天真的組間差異並不等於因果效果:

\begin{aligned} &E[Y\mid W=1] - E[Y\mid W=0] \\ &\qquad = \underbrace{E[Y(1)-Y(0)\mid W=1]}_{\text{處理組因果效果 (ATT)}} \\ &\qquad\quad {}+ \underbrace{E[Y(0)\mid W=1] - E[Y(0)\mid W=0]}_{\text{選擇偏誤}}. \end{aligned}

末項為選擇(或混淆)偏誤:它是處理組與對照組在「皆未受處理時」的基線差異。唯有當此項為零,觀測到的組間差才等於因果效果。

這套符號可以用熟悉的情境讀出來。設想高三學生甲在暑假報名了數學補習班,隔年學測數學考了 12 級分,此即觀測到的 Y_i。要問補習對甲的效果,就得知道另一個未曾發生的事實:若甲當初沒補習會考幾級分。假定那個未實現的成績是 10 級分,則 \tau_i = 12 - 10 = 2 級分,這才是補習對甲一人的因果效果。困難在於,10 永遠不會出現在任何成績單上,研究者手上只有 12;任何宣稱「補習有效」的分析,實質上都是在用別人的資料替補甲身上那個看不見的 10。

這個分解是理解一切因果推論策略的關鍵。所有的識別策略,無論是隨機化、調整、工具或設計,本質上都是使選擇偏誤項為零(或可估計並扣除)的不同手段。因果推論的方法論,因而可統一地理解為「消除或量化選擇偏誤」的技藝。

識別的三個假設

要從觀測資料識別平均因果效果,潛在結果框架依賴三個核心假設。第一是穩定單位處理值假設(stable unit treatment value assumption, SUTVA):一個體的潛在結果不受他人所受處理的影響(無干擾,no interference),且處理僅有單一、明確界定的版本。此假設在傳染、社會互動或溢出效果存在時可能受威脅。第二是可忽略性(ignorability),又稱無混淆性(unconfoundedness):在給定一組可觀測共變項 X 後,處理指派與潛在結果獨立,即 \{Y(0),Y(1)\}\perp W\mid X。其實質意涵是「在 X 相同的個體中,誰受處理如同隨機」,這要求所有同時影響處理與結果的混淆因子皆已被 X 涵蓋。

第三是重疊(overlap),又稱正值性(positivity):在 X 的每一水準上,接受與不接受處理的機率皆嚴格介於 0 與 1 之間,即 0<P(W=1\mid X)<1,否則某些個體無可資比較的對象。

這三個假設的地位截然不同。重疊性可由資料檢驗(檢視各共變項水準上的處理分布);SUTVA 部分可由設計保障;但可忽略性在觀測研究中原則上不可由資料檢驗,因為它斷言「不存在未被 X 涵蓋的混淆因子」,而未觀測者依定義無法從資料中察見。這是觀測性因果推論的阿基里斯之踵,也是後文敏感度分析所欲應對的核心。

因果圖與 do 運算

可忽略性要求「所有混淆因子都已納入 X」,卻沒有告訴研究者該如何判斷某個變項算不算混淆因子。潛在結果框架長於界定效果與推導估計,但面對「哪些變項構成混淆、應納入 X」這個實作上最常出錯的問題,圖模型的語言更為直觀有力。Pearl (2009) 發展的因果有向無環圖(directed acyclic graph, DAG),以節點表變項、有向邊表直接因果,將因果假設編碼為可視覺化、可推演的結構。

讀一張 DAG 的方式並不困難:每個節點是一個變項,每支箭頭讀作「箭尾直接造成箭頭」,兩個變項之間沒有箭頭相連,即代表研究者假定二者沒有直接的因果作用;「無環」則指順著箭頭走永遠回不到出發點,不容許一個變項成為自己的原因。畫出一張圖,等於把研究者的因果信念一次攤在紙上,其後關於「該控制什麼」的爭論,都可以在圖上依規則推演,而不再各憑直覺。

推導方塊可忽略性、do 運算與後門準則

以可觀測共變項 X 為條件,若可忽略性 \{Y(0),Y(1)\}\perp W\mid X 與重疊性成立,則各處理下的平均潛在結果可由觀測條件期望識別:

E[Y(w)] = E_X\bigl\{\,E[Y\mid W=w,\ X]\,\bigr\},

從而 ATE 可估。隨機化實驗使處理 W 無條件地獨立於潛在結果,故可忽略性由設計自動成立,無須依賴 X。

在圖模型中,Pearl 以 do 運算 do(W=w) 表徵「外生地設定處理」的介入,並以後門準則(back-door criterion)判定調整集:若 X 阻斷了 W 與 Y 之間所有指向 W 的路徑(後門路徑),且 X 不含 W 的任何後代,則

P\bigl(Y\mid do(W=w)\bigr) = \sum_{X} P(Y\mid W=w,\ X)\,P(X).

此式與潛在結果框架的識別公式完全一致,後門準則即可忽略性的圖形對應:二框架在此殊途同歸。

後門準則的名稱來自一個空間上的比喻。W 對 Y 的因果影響走的是「前門」,即順著箭頭由 W 流向 Y 的路徑;若還有路徑繞過因果方向,經由某個同時指向 W 的變項把 W 與 Y 連起來,那便是「後門」,關聯會從這裡洩漏進來冒充因果。以補習為例,家庭社經地位同時影響是否補習與學測成績,「補習 \leftarrow 家庭社經地位 \rightarrow 學測成績」就是一條後門路徑,把它納入調整集等於將這扇門關上。準則的第二個條件同樣要緊:調整集不得含有 W 的後代,否則關後門的同時也堵住了前門。

DAG 的實用價值,在於它把「該控制什麼」從直覺判斷轉為可依規則推演的圖形操作。特別是,它清楚地區分了三種結構迥異的第三變項:混淆因子、中介變項與對撞因子,而三者對「是否應控制」給出截然不同的指示。Rohrer (2018) 為心理學讀者提供了以 DAG 澄清此類問題的優良導引。

混淆、對撞與「控制」的陷阱

「控制」(統計調整)常被誤認為越多越好,彷彿把手邊每一個變項都塞進迴歸式右側,就能離因果更近一步。這是一個危險的誤解。後門準則已經透露了原因:調整的作用是關閉特定路徑,而路徑有的該關、有的不該關,甚至有的原本關著,一調整反倒被打開。一個共變項在因果結構中扮演什麼角色,因而決定了控制它是消除偏誤還是製造偏誤;同一個變項放在不同的因果圖裡,可以得到完全相反的處置建議。三種最常見的角色摘要於表 31.1。

表 31.1 第三變項的三種角色與是否應控制
角色 圖結構 控制的後果
混淆因子 W \leftarrow C \rightarrow Y 應控制;不控制則有混淆偏誤
中介變項 W \rightarrow M \rightarrow Y 控制會阻斷部分效果、偏誤總效果
對撞因子 W \rightarrow K \leftarrow Y 控制會誘發假關聯(對撞偏誤)

註. C 為混淆因子、M 為中介變項、K 為對撞因子。箭頭表因果方向。是否控制中介,取決於所欲估計者為總效果或直接效果。

混淆因子(W\leftarrow C\rightarrow Y)同時影響處理與結果,不控制它會使關聯混入非因果成分,故應納入調整集。中介變項(W\rightarrow M\rightarrow Y)則位於因果路徑之上,若目標為總效果,控制它會錯誤地扣除經由 M 傳遞的那部分因果效果,造成過度控制偏誤。假定補習之所以有用,主要是因為它逼著學生每週多花時間演練,而演練時數才直接推升成績;一旦把演練時數放進模型,補習的係數就只剩下「不經由演練」的那一小部分,可能由 2 級分縮到 0.5 級分,看起來像是補習沒什麼用,實際上只是把它真正發揮作用的管道扣掉了。

最違反直覺的是對撞因子(W\rightarrow K\leftarrow Y):K 是 W 與 Y 的共同結果,二者原本無關,但一旦以 K 為條件(控制它、或以它篩選樣本),便會在 W 與 Y 之間誘發一個純屬人為的關聯,此即對撞偏誤(collider bias)。許多著名的悖論,包括伯克森悖論與若干選擇效應,皆可歸因於無意間對對撞因子設限。

這個機制值得用一個甄選的情境講清楚。設想某系個人申請採計兩項獨立的資訊:學測成績與備審資料評分,在所有報名者中兩者的相關為零,會考試的人不見得書面表現突出。假定該系規定兩項標準化分數之和達 1.0 以上才錄取,錄取名單這個群體便是以「兩項之和」這個共同結果設限而成的。名單之內,學測特別漂亮的錄取生多半是靠學測被拉上來的,備審評分反而偏低;備審極出色的人,學測往往只是勉強達標。於是在錄取生中重算相關,可能得到 -0.35 的明顯負值。這個負相關全由篩選製造,母體中並不存在,研究者若只拿得到錄取生的資料,便可能據此宣稱「會考試的人書面表現較差」。

同樣的道理指出了論文中極普遍卻少被察覺的一種錯誤,即表二謬誤(Table 2 fallacy):研究者把主要處理與一長串共變項一起放進迴歸模型,然後在表二逐列報告所有係數,並對每一列都給予因果詮釋。問題在於,一組調整集只為某一個特定的處理而挑選。以補習為處理時,家庭社經地位是必須關閉的後門,理當納入;但若轉而把家庭社經地位讀成處理、詮釋它自己的係數,補習就成了它的中介變項,該係數既非社經地位的總效果,也不是任何容易命名的量。同一張表中的每個係數各自需要一套不同的識別假設,能被因果詮釋的通常只有一個。

由此可見,「控制變項」絕非中性的保險措施,而須以明確的因果結構為依據。

共變數調整與 Lord 悖論

在準實驗與觀測研究中,一個極常見的做法是以共變數分析(analysis of covariance, ANCOVA)調整前測或基線差異,藉此淨化出處理的效果。然而,共變數調整並非中性的技術,其結果的因果詮釋取決於一組不可由資料檢驗的假設。這一點最鮮明地體現於 Lord (1967) 所提出的悖論:兩位統計學家分析同一筆學生自入學到學年末體重變化的資料,一位比較兩性別組的變化分數,發現兩組平均變化並無差異,因而斷言性別對體重變化無效果;另一位以入學體重為共變數對學年末體重做 ANCOVA,卻發現顯著的組間差異,因而得出相反結論。兩種分析在代數上皆正確,卻導向矛盾的實質結論。

Lord 悖論的潛在結果解析揭示,這並非統計技術的錯誤,而是兩種分析回答了不同的因果問題,並各自預設了不同且不可檢驗的假設。變化分數取向假定若無處理、兩組本會有相同的平均變化;ANCOVA 取向則假定在相同基線下、兩組本會有相同的學年末結果。當處理(此處為性別)並非隨機分派、且與基線相關時,這兩個假設一般不能同時成立,資料本身也無力在其間仲裁,因為它們所涉及的皆是未曾觀測的反事實。此一悖論因而是本章核心訊息的縮影,即因果結論從不單由資料給定,而總是資料與所選因果估計量及其識別假設的共同產物。共變數調整與變化分數的代數性質屬第十章的範疇,本章則負責其潛在結果的識別解析。

隨機化實驗:為何是黃金標準

隨機化實驗之所以被奉為因果推論的黃金標準,其理由可由前述框架精確地說明。將處理隨機分派,使處理指派在期望上與所有前處理特徵(無論可觀測與否)獨立,因而潛在結果與處理無條件獨立,可忽略性由設計成立,選擇偏誤項在期望上為零。這裡要辨明隨機化究竟解決了什麼:它保證的不是「兩組人一模一樣」,而是「兩組人的差異只來自運氣」。任一次分派仍可能讓某組的基線略高,但這種差異沒有系統性的方向,其大小可由抽樣分布刻畫,落在統計推論本就處理得了的範圍內。至關重要的是,隨機化同時中和了已知與未知的混淆因子,這是任何觀測性調整都無法保證的:調整只能處理被測到的混淆,未測者則束手無策。

以一項憂鬱介入的試驗為例。設想 120 位受試者以電腦亂數分為兩組,一組接受八週的認知行為團體方案,一組維持常規照護,前測以 BDI-II 施測,兩組平均分別為 26.4 與 25.8 分。這 0.6 分的落差是抽籤的結果而非選人的結果,若把分派程序重複許多次,這類落差的平均會趨近於零,因此後測若出現 5.2 分的組間差距,才有理由把它歸給方案。反過來說,若改由受試者自行決定要不要參加,基線差就可能放大為好幾分且方向可以預期,因為病情較重或求助動機較強的人本來就更會報名。

隨機化並非萬能,它仍可能受不完全遵從、流失、或違反 SUTVA 的干擾所威脅,但它為因果識別所提供的無條件可忽略性,是其不可取代的優勢所在。此一邏輯與第十章所述 Fisher 的實驗設計三原則(隨機化、區集、重複)一脈相承:隨機化保障可忽略性,區集吸收已知的異質以提升精確度,重複則使誤差變異得以估計。由此觀之,實驗設計與因果識別實為一體兩面,即設計本身就是一種識別策略,好的設計把識別所需的假設,由不可檢驗的信念轉化為由研究者主動施加、因而可辯護的程序。

傾向分數

在無法隨機化的觀測研究中,若可忽略性在一組共變項 X 下成立,仍可藉調整逼近因果效果。真正的困難出在實作:可忽略性通常要納入相當多的共變項才勉強可信,而共變項一多,直接分層或匹配就會失效:十個二分變項交叉分格便有 1024 格,多數格子裡不是只有處理組、就是只有對照組,找不到條件相同的比較對象。Rosenbaum & Rubin (1983) 的傾向分數(propensity score)提供了優雅的降維之道:把整組共變項壓成一個純量,再依這個純量去比較條件相近的人。

推導方塊傾向分數與逆機率加權

傾向分數定義為給定共變項下接受處理的條件機率:

e(X) = P(W=1\mid X).

Rosenbaum & Rubin (1983) 證明其兩個關鍵性質。其一為平衡性:以傾向分數為條件,處理與共變項獨立,W\perp X\mid e(X)。其二為降維:若可忽略性在 X 下成立,則在純量 e(X) 下亦成立,\{Y(0),Y(1)\}\perp W\mid e(X)。故調整一個純量的傾向分數,即足以移除所有可觀測共變項所致的偏誤。

傾向分數可用於匹配、分層或加權。逆機率加權(inverse probability weighting, IPW)估計式為

\hat\tau_{\mathrm{IPW}} = \frac{1}{n}\sum_{i=1}^{n}\left[\frac{W_i\,Y_i}{e(X_i)} - \frac{(1-W_i)\,Y_i}{1-e(X_i)}\right],

其在可忽略性與重疊性下為 ATE 的無偏估計,因 E\!\left[\dfrac{W\,Y}{e(X)}\right] = E[Y(1)]。進一步地,雙重穩健(doubly robust)估計式結合傾向模型與結果模型,只要二者之一設定正確即為一致,提供了對模型誤設的部分保險。

傾向分數的效力有其邊界:它僅能平衡可觀測的共變項,對未測混淆無能為力。因此傾向分數方法縮小、但不消除觀測研究與隨機化實驗之間的鴻溝,其可信度最終仍取決於可忽略性這一不可檢驗的假設。

這道邊界還有一層心理計量特有的細節:即使混淆因子「有測到」,只要測得不準,控制就不會徹底。調整所能移除的是共變項真分數所承載的那部分混淆,測量誤差的部分則留在殘差裡繼續作用,形成殘餘混淆(residual confounding)。設想以一份家庭社經地位量表作為混淆因子的代理,其信度為 0.80,意即觀測分數的變異只有八成來自真分數。在單一混淆因子的線性情形下,控制這個不完美的測量大約只能消去八成的混淆偏誤:若未調整前的偏誤相當於 1.0 級分,調整之後仍有約 0.2 級分留著,而報表上不會有任何跡象提示它的存在。信度越低殘留越多,信度 0.50 時有一半的混淆根本沒被碰到。測量品質於是直接決定了因果結論的可信度,這也是心理計量對因果推論最具體的貢獻之一。

工具變項

當存在未測混淆、可忽略性不成立時,調整策略全盤失效。工具變項(instrumental variable, IV)提供了一條不同的識別路徑:借助一個外生的變異來源,繞過未測混淆。一個有效的工具 Z 須滿足三個條件:與處理相關(相關性)、僅透過處理影響結果而無其他路徑(排除限制,exclusion restriction)、且本身不受混淆(外生性)。在這三個條件下,Z 的變異形同一次外生的擾動:它推著處理走,卻不循其他管道影響結果。識別的直覺即由此而來,把「Z 所造成的結果差異」除以「Z 所造成的處理差異」,商數便是處理對結果的效果。假定某方案以抽籤決定資格,中籤者有六成參加、未中籤者僅一成,兩組平均成績相差 0.6 級分,則估得的效果為 0.6/(0.6-0.1)=1.2 級分。

Angrist et al. (1996) 將 IV 嵌入潛在結果框架,闡明在額外的單調性假設下,IV 所識別的並非全體的 ATE,而是局部平均處理效果(local average treatment effect, LATE):即那些「因工具而改變處理狀態」的順從者(compliers)次群體的平均效果。這一釐清具深遠意義,它指出 IV 的估計標的是一個特定且未必具普遍代表性的子群,其外推須審慎。工具變項在計量經濟學中以兩階段最小平方實作,而其邏輯與結構方程模型中的識別問題緊密相通。

工具變項的效力完全繫於假設的可信度,尤其是排除限制,它同樣不可由資料檢驗。一個看似合理卻暗中透過其他管道影響結果的「工具」,會產生嚴重且難以察覺的偏誤;而過弱的工具(與處理相關甚微)則導致不穩定的估計。工具變項因而是強力卻脆弱的方法。

自然實驗與準實驗設計

當隨機化不可行、又缺乏有效工具時,研究者可訴諸利用自然發生之外生變異的準實驗設計。差異中差異(difference-in-differences, DiD)比較處理組與對照組在介入前後的結果變化之差,藉「取差分」消去不隨時間變動的組間混淆,其核心識別假設是平行趨勢(parallel trends):若無介入,兩組結果本會呈平行的時間變化。這個假設之所以關鍵,在於它讓對照組的前後變化得以充當處理組「若未受介入本會有的變化」,兩者相減即扣去共同的時間趨勢。假定某縣市推行課後輔導後,會考待加強比例由 32% 降為 25%,鄰近未推行的縣市同期由 30% 降為 29%,差異中的差異便是 6 個百分點。此假設援引縱貫資料(第二十八、二十九章),但本身不可直接檢驗,僅能以介入前的趨勢佐證,若處理組同期還換了教科書或增聘師資,它就破了。

迴歸不連續(regression discontinuity, RD)則利用某連續指派變項越過一門檻即決定處理的情形,比較門檻兩側鄰近個體的結果:在門檻附近,個體落於哪一側可視為如同隨機,其識別假設是結果對指派變項的期望在門檻處連續,因而門檻處若出現跳躍,就只能歸給處理;反之,一旦個體有辦法精確操控自己落在門檻的哪一側,或門檻同時觸發了其他資源,這個假設便不再成立。各設計的核心識別假設對照於表 31.2。

表 31.2 因果識別策略與其核心假設
策略 核心識別假設
隨機化實驗 隨機分派(無條件可忽略性)
傾向分數/迴歸調整 可忽略性+重疊性
工具變項 相關性+排除限制+單調性
差異中差異 平行趨勢
迴歸不連續 結果於門檻處連續

註. 各策略以不同的可辯護假設換取因果識別;除重疊性與部分設計的輔助檢驗外,多數核心假設不可由資料直接檢驗。

這些設計的共同精神,是尋找一個「如同隨機」的外生變異來源,以近似隨機化所提供的可忽略性。它們擴展了因果推論的適用範圍,但每一種都以一組特定且多不可檢驗的假設為代價。Shadish et al. (2002) 在 Campbell 的效度威脅傳統中,對此類設計及其對內在效度威脅的防禦,作了經典而系統的整理,與第八、九章的效度架構一脈相承。

四類效度:實驗傳統的整合視角

前述的各種識別策略,可置於 Campbell 傳統的效度類型學中獲得整合的理解。Shadish et al. (2002) 將實驗與準實驗研究的效度區分為四類,各對應一種不同的推論威脅。內在效度(internal validity)關乎處理與結果之間的關聯是否確為因果,正是本章各識別策略所直接處理的核心,混淆、選擇與對撞等偏誤皆屬對內在效度的威脅。統計結論效度(statistical conclusion validity)關乎所宣稱的關聯是否在統計上站得住腳,涉及檢定力、多重比較與效果量的估計,與第八章的推論議題相接。

另外兩類效度則把視野推向因果宣稱的邊界。外在效度(external validity)關乎所得的因果結論能否推廣到其他人群、情境與時間,這正是第九章抽樣與外在推論所處理的問題;一個內在效度無懈可擊的隨機化實驗,其結論仍可能因樣本的特殊性而難以外推,工具變項所識別的局部平均處理效果尤其凸顯了這一限制。構念效度(construct validity)則關乎所操弄的處理與所測量的結果是否確為研究者宣稱的那些構念,這使因果推論直接倚賴第七章的效度論證:若處理或結果的構念界定含糊,則無論因果識別多麼嚴謹,其結論所指涉的因果關係本身即是模糊的。四類效度的區分提醒研究者,一項因果研究的可信度,並非僅由內在效度單獨決定,而須在四個面向上分別辯護。

因果中介分析

中介分析欲拆解一個因果效果經由某中介變項傳遞的部分(間接效果)與其餘部分(直接效果),是心理學檢驗歷程理論的核心工具。第十六章已介紹其在結構方程中的傳統做法,然而 Baron & Kenny (1986) 式的迴歸取向,其係數乘積雖在估計上便利,卻預設了強而常未言明的因果假設。因果中介分析以潛在結果重新界定中介效果,將間接與直接效果形式化為自然間接效果(natural indirect effect)與自然直接效果(natural direct effect),二者涉及對「若處理改變、但中介固定於其在某處理下之值」這類巢狀反事實的推斷。

Imai et al. (2010) 提出的一般化因果中介框架,闡明了此類效果得以識別所需的序列可忽略性(sequential ignorability):不僅處理相對於結果須無混淆,中介相對於結果亦須在給定處理與前處理共變項後無混淆。後者尤其嚴苛,因為即便處理經隨機化,中介卻幾乎從不隨機,處理後才發生、且可能與結果共享未測原因的中介變項,使中介的可忽略性極難成立。此框架的貢獻,在於把中介分析的因果詮釋所需的假設攤在明處,從而揭示了許多常規中介宣稱的脆弱:一個統計上顯著的間接效果,遠不足以支撐「M 因果地中介了 W 對 Y 的效果」這一實質結論。

未測混淆的敏感度分析

既然可忽略性這一觀測研究的核心假設不可檢驗,一個務實且負責任的做法,是評估「結論對違反此假設的穩健程度」,即敏感度分析。其問題意識為:一個未測混淆因子須強到何種程度,才足以推翻既有的結論?VanderWeele & Ding (2017) 提出的 E 值(E-value)將此形式化為一個直觀的指標:它是未測混淆因子須同時與處理及結果具備的最小關聯強度(以風險比為尺度),方能將觀測到的效果完全解釋為虛假。E 值越大,表示要推翻結論所需的未測混淆越強、結論越穩健;E 值接近 1,則些微的未測混淆即可能顛覆結論。敏感度分析不能證明因果,但它將「可能存在未測混淆」這一空泛的質疑,轉化為可量化、可討論的具體命題,是觀測性因果研究不可或缺的一環。

結構方程模型與因果

結構方程模型(第十五、十六章)常被期待用以「檢驗因果模型」,但其與因果的關係充滿誤解。最根本的一點是:SEM 本身並不能由關聯建立因果。一個 SEM 的路徑係數要具有因果詮釋,須先假定該模型的因果結構為真,包括變項間的方向、以及不存在未納入的共同原因(外生誤差不相關的假設)。模型與資料適配良好,並不驗證這些因果假設,因為如第十六章所述,往往存在多個適配等量卻因果結構迥異的等價模型 (MacCallum et al., 1993),資料無力在其間仲裁。

Bollen & Pearl (2013) 系統澄清了關於 SEM 與因果的八個迷思,論證 SEM 的結構係數在其假設成立時確有因果意義,但此意義來自模型所編碼的因果假設,而非來自適配本身。將 SEM 與因果圖對接,有助於明確一個路徑模型究竟預設了哪些因果假設、哪些可檢驗、哪些純屬設定。此外,測量誤差會使結構係數產生系統性偏誤,這也是何以潛在變項的 SEM 在處理測量誤差上,較以觀測分數迴歸更有利於因果推論,但前提仍是測量模型與結構假設皆正確。

縱貫與因果:交叉延宕模型及其批判

時間先後常被視為因果的線索,縱貫資料因而被寄望能支持較強的因果推論。交叉延宕模型(cross-lagged panel model, CLPM)是心理學長期倚重的工具:以各變項在前一時點的值預測另一變項在後一時點的值,並將該交叉延宕係數詮釋為前瞻性的「效果」。然而 Hamaker et al. (2015) 提出了具影響力的批判:傳統 CLPM 混淆了個體間的穩定差異與個體內的動態歷程,其交叉延宕係數同時承載了這兩種性質不同的變異,因而未必反映所欲的個體內因果過程。其提出的隨機截距交叉延宕模型(random-intercept CLPM, RI-CLPM)藉納入隨機截距,將穩定的個體間差異自個體內動態中分離,此一組間組內分離的邏輯,正與第二十八章多層次模型的中心化與 Mundlak 取向相通,其較完整的處理見第二十九章。

更進一步,當處理本身隨時間變動、且存在同樣隨時間變動的混淆因子時,因果推論面臨一個標準調整無法處理的難題:一個時變的混淆因子,可能同時是先前處理的結果、又是後續處理與結果的共同原因,形成處理與混淆的回饋。此時逕自控制該時變混淆,反而會阻斷部分處理效果並誘發對撞偏誤,須改用邊際結構模型等專為時變處理設計的方法。此類問題在密集縱貫資料中尤為突出,其與動態建模的交織屬第三十章的範疇,本章僅作概觀性的提示。

更根本地,時間先後既非因果的充分條件、亦非其保證。所謂 Granger 因果本質上是預測性的,回答「前者是否有助預測後者」,而非干涉論意義下的因果。縱貫設計雖排除了最粗糙的反向因果、並提供時序上的前提,卻無法自動排除未測混淆,也無法保證個體內的關聯即為因果。縱貫資料使因果推論更有依據,但不使其自動成立。

因果與可操弄性:測量的哲學問題

因果推論觸及一個對心理學尤為切身的哲學爭議:因果是否以可操弄性為前提。在潛在結果的嚴格觀點下,Y_i(1) 與 Y_i(0) 的定義預設了一個明確界定的介入,Holland (1986) 因而有「無操弄即無因果」(no causation without manipulation)之說。依此,種族、性別、年齡等屬性因缺乏明確的「操弄」,其「因果效果」在此框架下難以良好定義。與此相對,Bollen & Pearl (2013) 及圖模型傳統認為此要求過於嚴苛,主張因果圖可表徵不可操弄之屬性的因果角色。

此爭議對心理學有直接而深刻的意涵,因為心理學所欲研究因果的,多為憂鬱、智力、動機等潛在構念,而「操弄一個構念」意味著什麼,往往並不明確。這使因果推論與本書前半的核心主題緊密相接:構念效度(第七章)是因果宣稱的前提。一個界定含糊的構念,其「因果效果」也必然含糊;追問「對這個變項施予介入,究竟意味著什麼」,是對因果宣稱的一種必要的紀律,它迫使研究者釐清所欲估計的因果量是否具有良好定義。因果推論於是回頭質問測量本身:唯有先能清楚地界定並測量一個構念,才談得上嚴謹地推論它的因果作用。

小結

本章自框架、方法到哲學前提,對因果推論作了系統的鋪陳。開頭所提的那句箴言「相關不蘊含因果」,至此應已從一句警語,變成一組可以逐條檢查的技術條件。核心上,因果推論奠基於潛在結果與因果圖兩個互補框架,其共同的識別問題可統一理解為消除或量化選擇偏誤;而識別所依賴的假設,尤其是可忽略性與排除限制,多不可由資料檢驗,這使因果結論總是資料與假設的共同產物。

方法上,本章涵蓋隨機化實驗、傾向分數、工具變項、差異中差異與迴歸不連續等識別策略,釐清了「控制變項」在混淆、中介與對撞三種角色下的截然後果,並處理了因果中介的嚴苛假設、未測混淆的敏感度分析、結構方程與因果的關係、縱貫因果的難處,以及可操弄性這一觸及測量根基的爭議。對各主題的完整處理,可參潛在結果傳統的 Imbens & Rubin (2015)、現代因果推論的 Hernán & Robins (2020)、以及中介與交互作用的 VanderWeele (2015)。

全章的核心訊息是:因果推論的嚴謹,不在於某種神奇的統計技術,而在於使因果假設明確、可辯護、且其後果可分析;而對心理學而言,這份嚴謹最終回指向測量本身的清晰。下一章將把推論的單位從單一研究提升到整個文獻,探討如何以後設分析系統性地彙整眾多研究的證據,並正視發表偏誤與異質性等研究整合所特有的挑戰。

參考文獻

Angrist, J. D., Imbens, G. W., & Rubin, D. B. (1996). Identification of causal effects using instrumental variables. Journal of the American Statistical Association, 91(434), 444–455. https://doi.org/10.2307/2291631
Baron, R. M., & Kenny, D. A. (1986). The moderator-mediator variable distinction in social psychological research: Conceptual, strategic, and statistical considerations. Journal of Personality and Social Psychology, 51(6), 1173–1182. https://doi.org/10.1037/0022-3514.51.6.1173
Bollen, K. A., & Pearl, J. (2013). Eight myths about causality and structural equation models. In S. L. Morgan (Ed.), Handbook of causal analysis for social research (pp. 301–328). Springer. https://doi.org/10.1007/978-94-007-6094-3_15
Hamaker, E. L., Kuiper, R. M., & Grasman, R. P. P. P. (2015). A critique of the cross-lagged panel model. Psychological Methods, 20(1), 102–116. https://doi.org/10.1037/a0038889
Hernán, M. A., & Robins, J. M. (2020). Causal inference: What if. Chapman & Hall/CRC.
Holland, P. W. (1986). Statistics and causal inference. Journal of the American Statistical Association, 81(396), 945–960. https://doi.org/10.1080/01621459.1986.10478354
Imai, K., Keele, L., & Tingley, D. (2010). A general approach to causal mediation analysis. Psychological Methods, 15(4), 309–334. https://doi.org/10.1037/a0020761
Imbens, G. W., & Rubin, D. B. (2015). Causal inference for statistics, social, and biomedical sciences: An introduction. Cambridge University Press.
Lord, F. M. (1967). A paradox in the interpretation of group comparisons. Psychological Bulletin, 68(5), 304–305. https://doi.org/10.1037/h0025105
MacCallum, R. C., Wegener, D. T., Uchino, B. N., & Fabrigar, L. R. (1993). The problem of equivalent models in applications of covariance structure analysis. Psychological Bulletin, 114(1), 185–199. https://doi.org/10.1037/0033-2909.114.1.185
Pearl, J. (2009). Causality: Models, reasoning, and inference (2nd ed.). Cambridge University Press.
Rohrer, J. M. (2018). Thinking clearly about correlations and causation: Graphical causal models for observational data. Advances in Methods and Practices in Psychological Science, 1(1), 27–42. https://doi.org/10.1177/2515245917745629
Rosenbaum, P. R., & Rubin, D. B. (1983). The central role of the propensity score in observational studies for causal effects. Biometrika, 70(1), 41–55. https://doi.org/10.1093/biomet/70.1.41
Rubin, D. B. (1974). Estimating causal effects of treatments in randomized and nonrandomized studies. Journal of Educational Psychology, 66(5), 688–701. https://doi.org/10.1037/h0037350
Shadish, W. R., Cook, T. D., & Campbell, D. T. (2002). Experimental and quasi-experimental designs for generalized causal inference. Houghton Mifflin.
VanderWeele, T. J. (2015). Explanation in causal inference: Methods for mediation and interaction. Oxford University Press.
VanderWeele, T. J., & Ding, P. (2017). Sensitivity analysis in observational research: Introducing the e-value. Annals of Internal Medicine, 167(4), 268–274. https://doi.org/10.7326/M16-2607
本章引用格式游琇婷(2026)。因果推論與研究設計。《計量心理學:測量、模型與推論》(第 31 章)。