結構方程模型
第十五章的 CFA 回答了「這些構念怎麼測」,但研究者真正關心的問題,多半是構念「之間」的關係:工作滿意度會不會導致離職意圖?焦慮會不會中介壓力對表現的影響?結構方程模型(structural equation modeling, SEM)正是能把「一整套理論」,也就是一張由潛在構念織成、彼此以箭頭相連、每個構念又各自由指標測量的網,放進「同一個模型」裡估計與檢驗的框架。它是心理計量工具箱裡最有野心的一個,也是最容易被過度宣稱的一個,尤其是在因果之上。
從測量模型到完整的 SEM
SEM 的結構,可以一分為二。一半是測量模型(measurement model),也就是第十五章的 CFA,講的是「每個潛在構念如何由它的指標測量」。另一半是結構模型(structural model),講的是「潛在構念彼此之間如何相互影響」。把這兩半接在一起,就是一個「完整的 SEM」:先以指標把看不見的構念測出來,再讓這些構念之間拉起有方向的箭頭。
SEM 常以路徑圖(path diagram)來表示:圓圈是潛在變項、方框是觀測變項、單箭頭是有方向的效果、雙箭頭(曲線)是共變。這種圖的好處,是能把一個複雜的理論一目了然地攤在一張圖上。就歷史而言,路徑分析最早由遺傳學家 Wright (1934) 發明,用以釐清變項間的因果路徑;社會科學家 Duncan (1975) 把它引入社會學;而 Jöreskog 則把「因素分析」「路徑分析」「聯立方程」三條線熔於一爐,成就了今天的 SEM 與 LISREL(第十五章)。這一融合的意義在於,它讓研究者第一次能在單一模型中,同時處理「測量的不完美」與「構念間的結構」,而不必先犧牲其一。
須補充的是,SEM 有一個簡化的特例,即路徑分析。當所有變項都是單一觀測變項、沒有潛在構念與測量模型時,SEM 便退化為古典的路徑分析,也就是 Wright 最初的形式。此時模型只剩下結構部分,箭頭直接連在觀測變項之間。這雖然簡便,卻放棄了 SEM 最寶貴的優點,也就是扣除測量誤差;因此除非變項本身幾無測量誤差,否則以潛在變項的完整 SEM 取代純觀測變項的路徑分析,通常更為妥當。
路徑分析與結構模型
結構模型的核心,是描述潛在構念之間的有方向關係。把它寫成矩陣形式,便得到 SEM 的引擎,如下面的方塊所示。
把潛在構念分成兩類:內生變項 \boldsymbol{\eta}(會被模型裡其他變項影響的)與外生變項 \boldsymbol{\xi}(只當原因、不被解釋的)。結構模型為
其中 \mathbf{B} 是「內生變項之間」的路徑係數矩陣(對角為 0,因變項不影響自己)、\boldsymbol{\Gamma} 是「外生到內生」的路徑係數矩陣、\boldsymbol{\zeta} 是干擾項(內生變項未被解釋的部分)。這條式子的右邊也有 \boldsymbol{\eta},看似循環;把它解開、移項,得縮減式(reduced form):
它把每個內生變項,表達成「純外生變項與干擾」的函數。縮減式是理解 SEM 一切效果分解的鑰匙:因為 (\mathbf{I} - \mathbf{B})^{-1} 這一項,把「一步步沿著箭頭傳遞」的所有間接路徑,全都加總了進去。模型隱含的共變數矩陣,即由這組結構參數(\mathbf{B}、\boldsymbol{\Gamma}、以及因素與干擾的共變數)與測量模型的負荷,共同決定。
值得強調的是,SEM 之所以強大,正在於它把「測量」與「結構」放在同一個模型裡一起估計。這意味著,構念之間的關係,是在「已經扣除測量誤差」之後估出來的,這正是第五章衰減校正的邏輯,被內建進了整個模型。相對於「先算因素分數、再拿去跑迴歸」的兩段式做法(那會受因素分數不定性所累,見第十四章),SEM 一步到位,也更嚴謹。
結構模型還可依「是否含回饋」而分為兩類。若箭頭只單向流動、沒有任何變項透過一連串箭頭回到自己,稱為遞迴模型(recursive),其估計相對單純;若模型允許雙向因果或回饋迴路,例如 \eta_1 \to \eta_2 且 \eta_2 \to \eta_1,則為非遞迴模型(non-recursive)。非遞迴模型雖能表達互為因果的理論,卻常面臨辨識的困難,往往須藉助工具變項(第三十一章)之類的額外設定才能估計。(\mathbf{I}-\mathbf{B}) 是否可逆,正是這類模型能否求得縮減式的數學關鍵。
直接、間接與總效果
SEM 最迷人的能力之一,是把一個變項對另一個變項的影響,拆解為「直接」與「間接」兩塊。這正是「中介」概念的數學基礎,如下面的方塊所示。
考慮最簡單的中介鏈 X \to M \to Y,且 X 也可能直接影響 Y。設路徑係數為:X 對 M 的效果 a、M 對 Y 的效果 b、X 對 Y 的直接效果 c'。則:
直接效果(direct effect):X 不透過 M、直接作用於 Y 的部分,等於 c'。
間接效果(indirect effect):X 透過 M 傳給 Y 的部分,等於兩段路徑的乘積 a\cdot b。
總效果(total effect):兩者之和,c' + a\cdot b。
一般化到多變項的 SEM,這個分解由前一節的縮減式 (\mathbf{I}-\mathbf{B})^{-1} 自動給出:矩陣中每一條「多步路徑」的乘積之和,就是對應的間接效果。效果分解讓研究者能精確回答「X 影響 Y,有多少是直接的、多少是繞道 M 的」。
中介分析與拔靴法
上面的間接效果 a\cdot b,正是中介分析(mediation analysis)的核心量,它回答「X 是不是透過 M 來影響 Y」。經典的做法,是 Baron & Kenny (1986) 提出的一套逐步檢定:先看 X 對 Y 顯不顯著、再看 X 對 M、M 對 Y,最後看放入 M 後 X 對 Y 的效果是否縮小。這套流程直觀、影響深遠,但如今已知有不少侷限:它其實沒有直接檢定「間接效果 a\cdot b」本身,而且步驟繁瑣、檢定力偏低。更關鍵的是一個統計上的細節:間接效果 a\cdot b 的抽樣分配,並不是常態的。
a 與 b 各自的估計,在大樣本下近似常態。但它們的「乘積」a\cdot b,抽樣分配卻是偏態的,因為兩個常態變數的乘積並不常態。這帶來一個實際後果:傳統上用來檢定間接效果的 Sobel 檢定,因為假設 a\cdot b 近似常態、並以常態近似算標準誤,在中小樣本下往往不準、檢定力偏低。
較好的做法是拔靴法(bootstrap):反覆從樣本中「有放回地」重抽出許多個新樣本,在每個重抽樣本上重新估計 a\cdot b,得到一整個 a\cdot b 的經驗分配,再由這個分配的百分位數(或偏誤校正加速版本)取出信賴區間;拔靴法的一般原理、各種區間類型與其適用及失效情境,已於第十二章的重抽樣整併節統一交代。這個區間不假設常態,因此更貼合 a\cdot b 真實的偏態分配。MacKinnon et al. (2002) 的大型模擬正式確立了「拔靴法優於 Sobel 檢定」這一共識。
拔靴法中介的普及,很大程度上要歸功於 Preacher & Hayes (2008) 把它推廣到多重中介模型,並提供了廣為使用的工具,使研究者能同時估計多條中介路徑、並比較其相對大小。然而工具的便利也帶來了新的風險,也就是把「顯著的間接效果」不假思索地讀成「因果機制」。最後須提醒一句,而且怎麼強調都不為過:中介,本質上是一個「因果」主張(X 透過 M 造成 Y)。即使 a\cdot b 的信賴區間漂亮地排除了 0,那也只是統計上的關聯;要把它讀成真正的因果中介,需要一整套關於「沒有干擾 M 與 Y 關係的第三變項」的強假設,即序列可忽略性,這是第三十一章因果推論的主題。以橫斷資料跑出的「顯著中介」,遠不等於證明了因果機制。
中介模型的家族遠不止於單一中介。當多個中介依序相連,如 X \to M_1 \to M_2 \to Y,稱為序列中介;當中介效果本身又隨第三變項而變,例如某條中介路徑只在高壓力者身上成立,則為調節式中介或條件間接效果,這把中介與調節結合為一。這些延伸都能在 SEM 或迴歸框架內以拔靴法估計其條件間接效果的信賴區間。不過須提醒,衡量「中介了多少」的效果量指標,例如所謂的中介比例,在直接與間接效果方向相反時可能給出怪異、甚至大於一的數值,因而其詮釋須格外謹慎。
調節、潛在交互作用與多群組 SEM
除了中介,SEM 也能處理調節(moderation),也就是第十一章談過的交互作用,只是現在牽涉的是潛在變項。潛在交互作用的估計,比觀測變項的乘積項困難得多,因為研究者不能直接把兩個「看不見的因素」相乘。文獻為此發展出兩條主要路徑:一是乘積指標法,以兩個因素各自指標的乘積作為交互作用因素的指標;二是 Klein & Moosbrugger (2000) 的潛在調節結構方程(latent moderated structural equations, LMS),它把交互作用所導致的非常態聯合分布,表示為若干常態分布的混合,再以最大概似直接估計。LMS 通常更有效率,但計算較重,且不提供傳統的整體適配指標,須改以巢狀模型的概似比檢定來評估交互作用。
更常用、也更根本的,是多群組 SEM(multigroup SEM):把「同一個模型」同時配到好幾個群體上(例如男性與女性、實驗組與控制組),再檢驗「參數在群體間是否相等」。研究者可以問:某條結構路徑(如壓力對表現的效果)在不同群體是否一樣強?也可以問:測量的部分(如負荷、截距)在群體間是否等同,而這正是第十九章「測量不變性」的引擎。多群組 SEM 讓「群體差異」本身,成為一個可以精確設定與檢定的問題,而它與潛在交互作用其實是一體兩面:以類別調節變項分群,即多群組;以連續調節變項相乘,即潛在交互作用。
多群組比較還有一個常被跳過、卻不可或缺的前提:在比較各群體的結構路徑或潛在平均之前,必須先確認測量在群體間是不變的。若一份量表在不同群體測到的其實不是同一個構念,那麼比較它們的路徑係數就如同比較公斤與磅,數字再精確也沒有意義。因此,嚴謹的多群組 SEM,總是先以測量不變性(第十九章)打好地基,再談結構層次的群體差異。
SEM 的因果詮釋:能與不能
現在來到 SEM 最危險、也最常被誤用的地方,也就是因果。SEM 的路徑圖「看起來」就是因果圖,一個個箭頭,彷彿在宣告「這個造成那個」。於是無數研究,把估出來的路徑係數,直接當成因果效果來報告。這是一個嚴重的誤解。
必須把話說清楚:SEM 估計的,是「研究者所指定的那個模型」的參數;它「不會」證明那個因果結構是對的。路徑圖上的箭頭,是研究者「輸入」的假設,不是模型「輸出」的發現。要讓路徑係數具有因果意義,所需的假設與第十一章的迴歸如出一轍、甚至更嚴苛:沒有被遺漏的干擾變項、模型設定正確、箭頭方向正確,只不過現在要對「一整個系統」都成立。
近年,Pearl (2009) 的因果推論架構,為這件事提供了更清晰的語言。在他看來,SEM 其實是一種「結構因果模型」(structural causal model):路徑圖確實可以承載因果意義,但那個因果意義,完全來自研究者在圖上「編碼進去」的因果假設。這一觀點也糾正了兩種相反的偏差。Bollen & Pearl (2013) 在一篇釐清「八個迷思」的論述中指出,一方面,把 SEM 的係數不加假設地讀成因果效果固然是錯的;另一方面,因此就宣稱「SEM 與因果無關、純屬描述」也同樣是錯的。正確的立場是:SEM 是一個把因果假設寫清楚、再看它與資料合不合的工具。而且它並非全無檢驗力,因為一組因果假設會隱含若干可檢驗的條件獨立關係,透過檢視這些「模型所隱含、卻可用資料檢驗」的獨立性,研究者能對整個因果結構做局部的否證。SEM 與因果推論的整合,是第三十一章的核心議題。
值得把「SEM 並非全無檢驗力」講得更具體。一組因果假設會隱含某些條件獨立關係,例如若模型設定 X 僅透過 M 影響 Y、且無其他共因,則在控制 M 之後,X 與 Y 應條件獨立;一旦資料顯示兩者在控制 M 後仍顯著相關,這個中介結構便被否證。因此,即使無法證明模型為真,研究者仍可透過檢驗這些「模型所隱含、卻可被資料反駁」的獨立性,對因果結構做局部而有意義的檢驗,這也是第三十一章因果圖取向的一大優點。
等價模型:適配良好的致命弱點
即使抵擋住了「把箭頭當因果」的誘惑,SEM 還有一個更深、更難纏的問題,也就是等價模型(equivalent models)。
問題是這樣的:對幾乎任何一個 SEM,都存在一些「等價模型」,它們的結構不同(例如把某個箭頭的方向反過來),卻隱含出「一模一樣」的共變數矩陣,因此適配統計量完全相同、分毫不差。最簡單的例子是:用橫斷資料時,「X 造成 Y」與「Y 造成 X」這兩個模型,往往適配得一樣好,資料根本無力區分它們。事實上,Lee & Hershberger (1990) 整理出一套所謂的替換規則,能機械地由一個模型生成大量與之等價的模型。舉一個具體的例子:在模型的某個區塊中,若兩個變項之間原本設為一條有向路徑 X \to Y,只要該區塊滿足特定的對稱條件,把它替換為反向的 Y \to X、或替換為一條雙向的殘差相關 X \leftrightarrow Y,往往都給出分毫不差的隱含共變數,因而適配完全相同。這說明等價模型並非罕見的例外,而是普遍的常態。
這件事的含意相當顛覆:模型適配良好,「不能」證明研究者的模型(尤其是箭頭方向)是對的,因為總有一批等價的對手,配得跟它一樣好。換言之,「我的 SEM 適配指標很漂亮」這句話,遠不如許多人以為的那麼有力,它只說明「你的模型與資料相容」,卻沒排除「一堆別的模型也同樣相容」。要在這些等價的對手中做選擇,靠的不是資料,而是理論與研究設計,例如縱貫資料能為「時間先後」提供方向的線索。MacCallum et al. (1993) 系統地揭示了這個問題在應用研究中的普遍與嚴重。這也是第十二、十五章「適配是工具、不是判決」那句話,在 SEM 裡最尖銳的體現。
分析實務與陷阱
把整章收攏成一套做 SEM 的實務準則。工作流程大致是:先從理論同時設定「測量模型」與「結構模型」,檢查辨識,選估計器並處理缺失(ML/MLR/WLSMV+FIML,第十二、十三章),評鑑適配(多個指標,第十五章),帶著因果的謙遜去詮釋,主動考慮等價模型與替代設定。這裡有一個廣受推薦的策略,也就是兩步法 (Anderson & Gerbing, 1988):先單獨把測量模型(CFA)確立好,再放進結構關係。這樣做的好處是,萬一整體模型適配不良,研究者能分辨問題是出在「測量」還是「結構」;否則兩者糾纏在一起,很難診斷。
至於最常見的陷阱,這裡一次列清:因果過度宣稱(把路徑當因果效果);忽略等價模型(以為適配好就證明了結構);為了通過門檻而順著修正指標修模型(第十五章,把驗證變探索);樣本數不足(SEM 通常需要相當大的樣本,見第九章的樣本數規劃,且宜以蒙地卡羅事前估算);以及,只報告一堆適配指標,卻不報告真正該關心的實質參數估計與其信賴區間。一份好的 SEM 分析,讓人看見的應該是「這個理論在資料上站得多穩、又有哪些同樣站得住的對手」,而不只是「我的 CFI 有沒有超過 0.95」。
在報告的規範上,本章與第十五章有一道自然的分工。測量層次的交代,包括各題的標準化負荷、測量模型的適配、以及以 omega 估計的信度,屬於第十五章 CFA 的報告範疇;本章則聚焦於結構層次應報告的內容。一份完整的結構層報告,至少應包含:每一條結構路徑的未標準化與標準化係數及其信賴區間;直接、間接與總效果的分解,且間接效果須附拔靴信賴區間;各內生變項被解釋的變異比例;以及,同樣不可或缺的,研究者曾認真考慮過哪些等價或替代模型、又憑什麼理論理由偏好目前這一個。把測量層與結構層的報告分開陳述,不僅使讀者能分辨適配問題的來源,也讓「這個理論站得多穩」與「這份工具測得多準」兩個問題各得其所。
前沿:貝氏 SEM、正則化 SEM 與網絡
SEM 仍在快速演化,幾個方向特別值得一提。其一是貝氏 SEM(Bayesian SEM;(Muthén & Asparouhov, 2012))。如第十五章所述,它以先驗把 SEM 變得更有彈性,例如以「小變異先驗」容許次要的交叉負荷或殘差相關「近似為零」而非「嚴格為零」,這往往比傳統的「全零」設定更貼近現實;貝氏取向也能自然地處理複雜模型與小樣本,並提供完整的後驗不確定性。其細節見第三十三章。
其二是正則化 SEM(regularized SEM)。Jacobucci et al. (2016) 把第十一章的 lasso 之類懲罰搬進 SEM,對眾多路徑或交叉負荷施加懲罰,讓資料自己把「不重要的」壓成零,藉此在參數眾多、或需要探索性地找出關鍵路徑時,做「資料驅動的模型化簡」。這條路等於把 SEM 與機器學習(第三十四章)接了起來,也呼應了本書一再出現的偏誤-變異權衡。其三是網絡取向與潛在變項模型的整合:晚近有研究把「潛在因素」與「變項間的直接網絡連結」納入同一個廣義框架,使研究者不必在「共同原因」與「直接互動」兩種本體論之間預先選邊(第三十五章)。更長遠地看,SEM 與現代因果推論(Pearl,第三十一章)的整合,仍是進行中的重要議題:如何在 SEM 的框架裡,更嚴謹地釐清「哪些效果在什麼假設下才有因果意義」,是這個領域持續在耕耘的方向。
小結
結構方程模型,是把「測量模型」與「結構模型」熔於一爐的完整框架,它讓研究者能把一整套理論,寫成一張潛在構念相連的網,一次估計、一次檢驗。本章的幾個核心工具值得記牢:縮減式 (\mathbf{I}-\mathbf{B})^{-1} 是理解一切效果傳遞的鑰匙;效果可分解為直接、間接與總效果,而間接效果(中介)因其偏態的抽樣分配,該用拔靴法而非 Sobel 檢定;至於因果詮釋,SEM 讓假設變明確,卻不能替研究者證明它們;而等價模型的存在,更提醒我們,適配良好從來不等於「這個結構就是對的」。
歸結成一句話:SEM 有「表達一套理論」的強大能力,但那不等於「證明一套理論」的能力。用它來清楚地陳述、並嚴謹地檢驗理論結構,同時對它的因果與結構宣稱保持謙遜,這才是 SEM 正確的用法。
接下來,第四部分將轉向另一大類測量模型。第十七章的項目反應理論,處理的是「類別型」的題目反應(如對錯、等級),它將揭示,那個看似專屬於測驗的理論,骨子裡其實就是一個「跑在潛在能力上的 logistic 迴歸」(第十一章)。而第十九章,則會用本章的多群組架構,正式建立測量不變性,回答「跨群體、跨時間的比較,到底何時才站得住腳」這個貫穿全書的問題。