第 16 章 結構方程模型
第四部 潛在變項測量模型
16Chapter

結構方程模型

第十五章的 CFA 回答了「這些構念怎麼測」,但研究者真正關心的問題,多半是構念「之間」的關係:工作滿意度會不會導致離職意圖?焦慮會不會中介壓力對表現的影響?教學品質是不是要先提高學生的學習投入,才可能反映在學業成就上?這些問題有一個共同的形狀,也就是它們同時牽涉兩件事:每個構念各自要被妥善測量,而構念與構念之間又要拉起有方向的關係。CFA 只做前一件事,它把潛在構念與指標的對應寫得很清楚,卻把構念之間一律當成無方向的共變;迴歸(第十一章)只做後一件事,它容許有方向的預測,卻假定放進方程式的變項本身沒有測量誤差。結構方程模型(structural equation modeling, SEM)正是能把「一整套理論」,也就是一張由潛在構念織成、彼此以箭頭相連、每個構念又各自由指標測量的網,放進「同一個模型」裡估計與檢驗的框架。

本章以一個貫穿全章的情境來說明:教學品質經由學習投入影響學業成就。這三個構念都是潛在的,各自由若干題目或指標測量,而它們之間的關係則以箭頭表達。沿著這個例子,讀者將看到 SEM 如何把一個總效果拆成直接與間接兩塊、間接效果的信賴區間為何要用拔靴法而非常態近似、以及在模型適配漂亮的同時,還有哪些結構完全不同卻配得一樣好的對手在旁邊等著。SEM 是心理計量工具箱裡最有野心的一個框架,也是最容易被過度宣稱的一個,尤其是在因果之上;因此本章的後半,會用相當的篇幅談它「不能」做到的事。

從測量模型到完整的 SEM

SEM 的結構,可以一分為二。一半是測量模型(measurement model),也就是第十五章的 CFA,講的是「每個潛在構念如何由它的指標測量」。另一半是結構模型(structural model),講的是「潛在構念彼此之間如何相互影響」。把這兩半接在一起,就是一個「完整的 SEM」:先以指標把看不見的構念測出來,再讓這些構念之間拉起有方向的箭頭。這一節要回答的是:為什麼非得把兩半放進同一個模型裡一起估計不可?直覺上,分兩步做似乎也行,先用 CFA 確認每份量表測得準,再把因素分數拿去跑迴歸。但這樣做會在第二步悄悄地把「測量並不完美」這件事忘掉,於是構念之間的關係被系統性地低估。讀完本節,讀者應能說清楚 SEM 相對於路徑分析究竟多了什麼,以及這個多出來的東西在什麼情況下值得付出額外的模型複雜度。

SEM 常以路徑圖(path diagram)來表示:圓圈是潛在變項、方框是觀測變項、單箭頭是有方向的效果、雙箭頭(曲線)是共變。這種圖的好處,是能把一個複雜的理論一目了然地攤在一張圖上。就歷史而言,路徑分析最早由遺傳學家 Wright (1934) 發明,用以釐清變項間的因果路徑;社會科學家 Duncan (1975) 把它引入社會學;而 Jöreskog 則把「因素分析」「路徑分析」「聯立方程」三條線熔於一爐,成就了今天的 SEM 與 LISREL(第十五章)。這一融合的意義在於,它讓研究者第一次能在單一模型中,同時處理「測量的不完美」與「構念間的結構」,而不必先犧牲其一。

須補充的是,SEM 有一個簡化的特例,即路徑分析。當所有變項都是單一觀測變項、沒有潛在構念與測量模型時,SEM 便退化為古典的路徑分析,也就是 Wright 最初的形式。此時模型只剩下結構部分,箭頭直接連在觀測變項之間。這雖然簡便,卻放棄了 SEM 最寶貴的優點,也就是扣除測量誤差;因此除非變項本身幾無測量誤差,否則以潛在變項的完整 SEM 取代純觀測變項的路徑分析,通常更為妥當。

這個差別有多大,用數字看最清楚。設想一份研究以四題自陳量表測量學習投入、以校內段考成績測量學業成就,而兩者在潛在層次的真實相關為 0.50。假定投入量表的信度為 0.80、成績的信度為 0.90,則依第五章的衰減公式,觀測層次的相關只會是 0.50 \times \sqrt{0.80 \times 0.90} \approx 0.42。讀出來就是:光是測量誤差,就讓這個關係憑空縮水了約一成六;若直接以觀測分數跑路徑分析,路徑係數也會依同樣的比例被低估。SEM 的潛在變項把這一成六還給研究者,代價則是每個構念都需要多個指標,而且必須承擔測量模型設定錯誤的風險。

路徑分析與結構模型

結構模型的核心,是描述潛在構念之間的有方向關係。上一節說明了為什麼要把測量與結構放進同一個模型,這一節則要把「結構」那一半寫成可以計算的形式。直覺上,結構模型做的事很像一組聯立迴歸:每一個會被解釋的構念都有自己的一條方程式,等號右邊擺的是所有指向它的構念。把這一組方程式疊成矩陣形式,便得到 SEM 的引擎,也就是下面方塊中的兩條式子。其中第二條式子,即所謂的縮減式,特別值得留意,因為本章後面關於直接效果、間接效果與中介的一切討論,都是從它推出來的。

推導方塊結構模型與縮減式

把潛在構念分成兩類:內生變項 \boldsymbol{\eta}(會被模型裡其他變項影響的)與外生變項 \boldsymbol{\xi}(只當原因、不被解釋的)。結構模型為

\boldsymbol{\eta} = \mathbf{B}\boldsymbol{\eta} + \boldsymbol{\Gamma}\boldsymbol{\xi} + \boldsymbol{\zeta},

其中 \mathbf{B} 是「內生變項之間」的路徑係數矩陣(對角為 0,因變項不影響自己)、\boldsymbol{\Gamma} 是「外生到內生」的路徑係數矩陣、\boldsymbol{\zeta} 是干擾項(內生變項未被解釋的部分)。這條式子的右邊也有 \boldsymbol{\eta},看似循環;把它解開、移項,得縮減式(reduced form):

\boldsymbol{\eta} = (\mathbf{I} - \mathbf{B})^{-1}(\boldsymbol{\Gamma}\boldsymbol{\xi} + \boldsymbol{\zeta}).

它把每個內生變項,表達成「純外生變項與干擾」的函數。縮減式是理解 SEM 一切效果分解的鑰匙:因為 (\mathbf{I} - \mathbf{B})^{-1} 這一項,把「一步步沿著箭頭傳遞」的所有間接路徑,全都加總了進去。模型隱含的共變數矩陣,即由這組結構參數(\mathbf{B}、\boldsymbol{\Gamma}、以及因素與干擾的共變數)與測量模型的負荷,共同決定。

值得強調的是,SEM 之所以強大,正在於它把「測量」與「結構」放在同一個模型裡一起估計。這意味著,構念之間的關係,是在「已經扣除測量誤差」之後估出來的,這正是第五章衰減校正的邏輯,被內建進了整個模型。相對於「先算因素分數、再拿去跑迴歸」的兩段式做法(那會受因素分數不定性所累,見第十四章),SEM 一步到位,也更嚴謹。

結構模型還可依「是否含回饋」而分為兩類。若箭頭只單向流動、沒有任何變項透過一連串箭頭回到自己,稱為遞迴模型(recursive),其估計相對單純;若模型允許雙向因果或回饋迴路,例如 \eta_1 \to \eta_2 且 \eta_2 \to \eta_1,則為非遞迴模型(non-recursive)。非遞迴模型雖能表達互為因果的理論,卻常面臨辨識的困難,往往須藉助工具變項(第三十一章)之類的額外設定才能估計。(\mathbf{I}-\mathbf{B}) 是否可逆,正是這類模型能否求得縮減式的數學關鍵。

以貫穿本章的情境為例。若三個構念只以「教學品質 \to 學習投入 \to 學業成就」的單向箭頭相連,這就是遞迴模型,箭頭一路向前,沒有任何構念繞回自己。但研究者也可以主張,成績進步會提高學生的效能感,使他更願意投入,而投入又進一步推高成績,於是學習投入與學業成就之間形成回饋迴路,模型隨即成為非遞迴的。這時單靠一次施測的橫斷資料,通常無法把兩個方向的係數分開估計,必須另外找到一個只影響其中一方的變項當作工具變項,例如只會影響投入、卻不直接影響成績的通勤時間,模型才可能辨識。可見遞迴與非遞迴的分別不只是畫圖的習慣,而是關乎「這個模型到底估不估得出來」。

直接、間接與總效果

SEM 最迷人的能力之一,是把一個變項對另一個變項的影響,拆解為「直接」與「間接」兩塊。前一節得到的縮減式其實已經預告了這件事:(\mathbf{I}-\mathbf{B})^{-1} 把沿著箭頭一步一步傳遞的所有路徑全部加了起來,而效果分解要做的,就是把這個總和再拆回一條一條的路徑。直覺上,這就像問一位教師:把教學品質提上來以後,學生成績的改善,有多少是「因為學生變得更投入」而發生的,又有多少是繞過投入、經由別的途徑直接發生的。前一節只告訴研究者這些路徑會被自動加總,這一節則要把加總的結果重新拆開、逐條命名。這正是「中介」概念的數學基礎,如下面的方塊所示。

推導方塊直接、間接與總效果的分解

考慮最簡單的中介鏈 X \to M \to Y,且 X 也可能直接影響 Y。設路徑係數為:X 對 M 的效果 a、M 對 Y 的效果 b、X 對 Y 的直接效果 c'。則:

直接效果(direct effect):X 不透過 M、直接作用於 Y 的部分,等於 c'。

間接效果(indirect effect):X 透過 M 傳給 Y 的部分,等於兩段路徑的乘積 a\cdot b。

總效果(total effect):兩者之和,c' + a\cdot b。

一般化到多變項的 SEM,這個分解由前一節的縮減式 (\mathbf{I}-\mathbf{B})^{-1} 自動給出:矩陣中每一條「多步路徑」的乘積之和,就是對應的間接效果。效果分解讓研究者能精確回答「X 影響 Y,有多少是直接的、多少是繞道 M 的」。

把數字放進來,這個分解的意義會更清楚。假定在一份以標準化解呈現的分析中,教學品質對學習投入的路徑為 a = 0.45、學習投入對學業成就的路徑為 b = 0.52、教學品質對學業成就的直接路徑為 c' = 0.10。那麼間接效果是 a \cdot b = 0.45 \times 0.52 \approx 0.23,總效果是 0.10 + 0.23 = 0.33。讀出來就是:教學品質每提高一個標準差,學業成就平均提高約三分之一個標準差,而其中約 0.23 個標準差是經由「學生變得更投入」傳過來的,只有 0.10 個標準差走的是其他直接途徑。這個分解之所以有價值,在於它把「要不要投資教學品質」這個籠統的問題,轉成了「該從哪一個環節介入」這個可以行動的問題。有了效果分解,下一節就能問:a \cdot b 這個乘積該怎麼檢定、怎麼給信賴區間。

中介分析與拔靴法

上面的間接效果 a\cdot b,正是中介分析(mediation analysis)的核心量,它回答「X 是不是透過 M 來影響 Y」。經典的做法,是 Baron & Kenny (1986) 提出的一套逐步檢定:先看 X 對 Y 顯不顯著、再看 X 對 M、M 對 Y,最後看放入 M 後 X 對 Y 的效果是否縮小。這套流程直觀、影響深遠,但如今已知有不少侷限:它其實沒有直接檢定「間接效果 a\cdot b」本身,而且步驟繁瑣、檢定力偏低。更關鍵的是一個統計上的細節:間接效果 a\cdot b 的抽樣分配,並不是常態的。

推導方塊間接效果的抽樣分配與拔靴法

a 與 b 各自的估計,在大樣本下近似常態。但它們的「乘積」a\cdot b,抽樣分配卻是偏態的,因為兩個常態變數的乘積並不常態。這帶來一個實際後果:傳統上用來檢定間接效果的 Sobel 檢定,因為假設 a\cdot b 近似常態、並以常態近似算標準誤,在中小樣本下往往不準、檢定力偏低。

較好的做法是拔靴法(bootstrap):反覆從樣本中「有放回地」重抽出許多個新樣本,在每個重抽樣本上重新估計 a\cdot b,得到一整個 a\cdot b 的經驗分配,再由這個分配的百分位數(或偏誤校正加速版本)取出信賴區間;拔靴法的一般原理、各種區間類型與其適用及失效情境,已於第十二章的重抽樣整併節統一交代。這個區間不假設常態,因此更貼合 a\cdot b 真實的偏態分配。MacKinnon et al. (2002) 的大型模擬正式確立了「拔靴法優於 Sobel 檢定」這一共識。

承續前一節的數字,可以看出這個差別在實務上長什麼樣子。設想樣本數為 300,估得 a \cdot b = 0.23。以五千次重抽得到的偏誤校正拔靴區間為 [0.14,\ 0.34],它並不對稱,右尾比左尾長,這正反映了乘積項偏態的抽樣分配;而以常態近似計算的 Sobel 區間則必然對稱,約為 [0.15,\ 0.31]。在這個例子裡,兩者都排除了 0,結論一致。但當間接效果較小、樣本較少時,硬把一個偏態的分配壓成對稱的常態,會使區間整體往錯的方向偏移,於是真正存在的中介被判為不顯著。這就是為什麼拔靴區間如今已取代 Sobel 檢定,成為中介分析的預設做法。

拔靴法中介的普及,很大程度上要歸功於 Preacher & Hayes (2008) 把它推廣到多重中介模型,並提供了廣為使用的工具,使研究者能同時估計多條中介路徑、並比較其相對大小。然而工具的便利也帶來了新的風險,也就是把「顯著的間接效果」不假思索地讀成「因果機制」。最後須提醒一句,而且怎麼強調都不為過:中介,本質上是一個「因果」主張(X 透過 M 造成 Y)。即使 a\cdot b 的信賴區間漂亮地排除了 0,那也只是統計上的關聯;要把它讀成真正的因果中介,需要一整套關於「沒有干擾 M 與 Y 關係的第三變項」的強假設,即序列可忽略性,這是第三十一章因果推論的主題。以橫斷資料跑出的「顯著中介」,遠不等於證明了因果機制。

中介模型的家族遠不止於單一中介。當多個中介依序相連,如 X \to M_1 \to M_2 \to Y,稱為序列中介;當中介效果本身又隨第三變項而變,例如某條中介路徑只在高壓力者身上成立,則為調節式中介或條件間接效果,這把中介與調節結合為一。這些延伸都能在 SEM 或迴歸框架內以拔靴法估計其條件間接效果的信賴區間。

讀這兩類結果時,關鍵在於分清楚報告的到底是哪一個量。序列中介報告的是連續數段路徑的乘積,例如教學品質 \to 學習投入 \to 學習策略 \to 學業成就,其數值通常遠小於單一中介的兩段乘積,因為每多乘一段,效果就再縮小一次;若三段路徑各為 0.45、0.40、0.50,串起來的間接效果只有 0.09,這個「看起來很小」是結構使然,不宜逕自解讀為機制不重要。調節式中介報告的則不是單一個間接效果,而是「在調節變項的不同取值上,各有一個間接效果」,因此必須把調節變項固定在幾個具代表性的水準上分別呈現,例如平均數以及上下各一個標準差處,並且說明這些間接效果彼此之差本身是否顯著。只寫一句「中介效果受到調節」而不列出各水準的數值,讀者無從判斷差異的實質大小。

還有一個常見的陷阱,出在衡量「中介了多少」的效果量指標上。所謂的中介比例,是把間接效果除以總效果,直覺上像是在說「總效果裡有幾成是繞道而來的」;但這個直覺只在兩個效果同號時才成立。假定間接效果為 0.30、直接效果為 -0.10,總效果便是 0.20,中介比例算出來是 0.30 / 0.20 = 1.50,字面上讀成「中介了百分之一百五十」顯然沒有意義。這種情形稱為不一致中介,它其實傳達了一個實質訊息:X 有兩條方向相反的作用途徑,經由 M 的那條是正向的,另一條直接途徑是負向的,兩者互相抵銷,才讓總效果看起來平淡。因此與其報告一個比例,不如把 a \cdot b 與 c' 各自的估計值與信賴區間並列,這樣既誠實,資訊也更完整。

調節、潛在交互作用與多群組 SEM

除了中介,SEM 也能處理調節(moderation),也就是第十一章談過的交互作用,只是現在牽涉的是潛在變項。潛在交互作用的估計,比觀測變項的乘積項困難得多,因為研究者不能直接把兩個「看不見的因素」相乘。文獻為此發展出兩條主要路徑:一是乘積指標法,以兩個因素各自指標的乘積作為交互作用因素的指標;二是 Klein & Moosbrugger (2000) 的潛在調節結構方程(latent moderated structural equations, LMS),它把交互作用所導致的非常態聯合分布,表示為若干常態分布的混合,再以最大概似直接估計。LMS 通常更有效率,但計算較重,且不提供傳統的整體適配指標,須改以巢狀模型的概似比檢定來評估交互作用。

更常用、也更根本的,是多群組 SEM(multigroup SEM):把「同一個模型」同時配到好幾個群體上(例如男性與女性、實驗組與控制組),再檢驗「參數在群體間是否相等」。研究者可以問:某條結構路徑(如壓力對表現的效果)在不同群體是否一樣強?也可以問:測量的部分(如負荷、截距)在群體間是否等同,而這正是第十九章「測量不變性」的引擎。多群組 SEM 讓「群體差異」本身,成為一個可以精確設定與檢定的問題,而它與潛在交互作用其實是一體兩面:以類別調節變項分群,即多群組;以連續調節變項相乘,即潛在交互作用。

多群組比較還有一個常被跳過、卻不可或缺的前提:在比較各群體的結構路徑或潛在平均之前,必須先確認測量在群體間是不變的。若一份量表在不同群體測到的其實不是同一個構念,那麼比較它們的路徑係數就如同比較公斤與磅,數字再精確也沒有意義。因此,嚴謹的多群組 SEM,總是先以測量不變性(第十九章)打好地基,再談結構層次的群體差異。

SEM 的因果詮釋:能與不能

現在來到 SEM 最危險、也最常被誤用的地方,也就是因果。SEM 的路徑圖「看起來」就是因果圖,一個個箭頭,彷彿在宣告「這個造成那個」。於是無數研究把估出來的路徑係數直接當成因果效果報告,寫出「提高教學品質可使學業成就提升 0.33 個標準差」這樣的句子。這是一個嚴重的誤解,而它的嚴重之處不在於數字算錯了,而在於數字被賦予了它承擔不起的意義。這一節要處理兩個問題:路徑係數要在什麼條件下才能讀成因果效果,以及當這些條件不成立時,SEM 是否就完全失去了檢驗能力。

必須把話說清楚:SEM 估計的,是「研究者所指定的那個模型」的參數;它「不會」證明那個因果結構是對的。路徑圖上的箭頭,是研究者「輸入」的假設,不是模型「輸出」的發現。要讓路徑係數具有因果意義,所需的假設與第十一章的迴歸如出一轍、甚至更嚴苛:沒有被遺漏的干擾變項、模型設定正確、箭頭方向正確,只不過現在要對「一整個系統」都成立。

近年,Pearl (2009) 的因果推論架構,為這件事提供了更清晰的語言。在他看來,SEM 其實是一種「結構因果模型」(structural causal model):路徑圖確實可以承載因果意義,但那個因果意義,完全來自研究者在圖上「編碼進去」的因果假設。這一觀點也糾正了兩種相反的偏差。Bollen & Pearl (2013) 在一篇釐清 SEM 常見迷思的論述中指出,這些迷思多半落在兩個相反的極端。一端是把 SEM 的係數不加假設地讀成因果效果,或以為模型適配漂亮就等於因果結構得到了證實;另一端則是因為 SEM 用的是非實驗的相關性資料,便宣稱它與因果毫不相干、圖上的箭頭只是一種比喻。這兩種說法看似對立,其實來自同一個誤會,也就是把「模型」與「資料」的分工弄反了。因果結構是研究者帶進來的假設,資料能做的是檢驗這些假設所隱含的後果,而不是替研究者挑選假設;因此,沒有實驗操弄並不表示不能談因果,只表示所有因果宣稱都必須連同它所倚賴的假設一起攤開來受檢視。正確的立場是:SEM 是一個把因果假設寫清楚、再看它與資料合不合的工具。而且它並非全無檢驗力,因為一組因果假設會隱含若干可檢驗的條件獨立關係,透過檢視這些「模型所隱含、卻可用資料檢驗」的獨立性,研究者能對整個因果結構做局部的否證。SEM 與因果推論的整合,是第三十一章的核心議題。

值得把「SEM 並非全無檢驗力」講得更具體。一組因果假設會隱含某些條件獨立關係,例如若模型設定 X 僅透過 M 影響 Y、且無其他共因,則在控制 M 之後,X 與 Y 應條件獨立;一旦資料顯示兩者在控制 M 後仍顯著相關,這個中介結構便被否證。以本章的情境來說,若研究者主張教學品質「只」透過學習投入影響學業成就,這個主張等於設定 c' = 0,而它隱含一項可以檢驗的預測:在統計上控制了學習投入之後,教學品質與學業成就之間應該不再有關聯。假定實際估計得到 c' = 0.10 且其信賴區間排除 0,這個純中介的設定便被資料反駁了,研究者必須承認還有其他途徑存在,例如教學品質也可能直接改善了學生對教材的理解,而不必經過投入程度。因此,即使無法證明模型為真,研究者仍可透過檢驗這些「模型所隱含、卻可被資料反駁」的獨立性,對因果結構做局部而有意義的檢驗,這也是第三十一章因果圖取向的一大優點。

等價模型:適配良好的致命弱點

即使抵擋住了「把箭頭當因果」的誘惑,SEM 還有一個更深、更難纏的問題,也就是等價模型(equivalent models)。前一節談的是「係數能不能讀成因果效果」,這一節要談的更根本:同一組資料,往往連「箭頭該往哪個方向畫」都無力分辨。直覺上可以這樣想:SEM 的估計與適配,全部建立在一個共變數矩陣之上;只要兩個結構不同的模型隱含出同一個共變數矩陣,資料就沒有任何辦法在兩者之間做出區別,因為它們在資料看得見的那一層完全一樣。這不是估計技術不夠好,也不是指標選得不對,而是資訊本身不足;換再大的樣本、換再精緻的估計器,都無濟於事。

問題是這樣的:對幾乎任何一個 SEM,都存在一些「等價模型」,它們的結構不同(例如把某個箭頭的方向反過來),卻隱含出「一模一樣」的共變數矩陣,因此適配統計量完全相同、分毫不差。最簡單的例子是:用橫斷資料時,「X 造成 Y」與「Y 造成 X」這兩個模型,往往適配得一樣好,資料根本無力區分它們。事實上,Lee & Hershberger (1990) 整理出一套所謂的替換規則,能機械地由一個模型生成大量與之等價的模型。舉一個具體的例子:在模型的某個區塊中,若兩個變項之間原本設為一條有向路徑 X \to Y,只要該區塊滿足特定的對稱條件,把它替換為反向的 Y \to X、或替換為一條雙向的殘差相關 X \leftrightarrow Y,往往都給出分毫不差的隱含共變數,因而適配完全相同。這說明等價模型並非罕見的例外,而是普遍的常態。

回到本章的情境更能感受它的分量。「學習投入 \to 學業成就」與「學業成就 \to 學習投入」這兩個模型,在只做一次施測的橫斷資料上,適配結果會分毫不差地相同,卡方值、CFI、RMSEA 全部一樣。從理論上看,前者說的是投入帶來成績,後者說的是成績帶來效能感與投入,兩者都說得通,而資料完全不站在任何一邊;若再把這條箭頭改成一條雙向的共變,適配依然不變。要在這三個版本之間做選擇,研究者能倚靠的只有兩件事:研究設計對時序的安排,例如學期初測投入、學期末測成績;以及理論本身的說服力。

這件事的含意相當顛覆:模型適配良好,「不能」證明研究者的模型(尤其是箭頭方向)是對的,因為總有一批等價的對手,配得跟它一樣好。換言之,「我的 SEM 適配指標很漂亮」這句話,遠不如許多人以為的那麼有力,它只說明「這個模型與資料相容」,卻沒排除「一堆別的模型也同樣相容」。要在這些等價的對手中做選擇,靠的不是資料,而是理論與研究設計,例如縱貫資料能為「時間先後」提供方向的線索。MacCallum et al. (1993) 系統地揭示了這個問題在應用研究中的普遍與嚴重。這也是第十二、十五章「適配是工具、不是判決」那句話,在 SEM 裡最尖銳的體現。

分析實務與陷阱

把整章收攏成一套做 SEM 的實務準則。工作流程大致是:先從理論同時設定「測量模型」與「結構模型」,檢查辨識,選估計器並處理缺失(ML/MLR/WLSMV+FIML,第十二、十三章),評鑑適配(多個指標,第十五章),帶著因果的謙遜去詮釋,主動考慮等價模型與替代設定。這裡有一個廣受推薦的策略,也就是兩步法 (Anderson & Gerbing, 1988):先單獨把測量模型(CFA)確立好,再放進結構關係。這樣做的好處是,萬一整體模型適配不良,研究者能分辨問題是出在「測量」還是「結構」;否則兩者糾纏在一起,很難診斷。

至於最常見的陷阱,這裡一次列清:因果過度宣稱(把路徑當因果效果);忽略等價模型(以為適配好就證明了結構);為了通過門檻而順著修正指標修模型(第十五章,把驗證變探索);樣本數不足(SEM 通常需要相當大的樣本,見第九章的樣本數規劃,且宜以蒙地卡羅事前估算);以及,只報告一堆適配指標,卻不報告真正該關心的實質參數估計與其信賴區間。一份好的 SEM 分析,讓人看見的應該是「這個理論在資料上站得多穩、又有哪些同樣站得住的對手」,而不只是「我的 CFI 有沒有超過 0.95」。

在報告的規範上,本章與第十五章有一道自然的分工。測量層次的交代,包括各題的標準化負荷、測量模型的適配、以及以 omega 估計的信度,屬於第十五章 CFA 的報告範疇;本章則聚焦於結構層次應報告的內容。一份完整的結構層報告,至少應包含:每一條結構路徑的未標準化與標準化係數及其信賴區間;直接、間接與總效果的分解,且間接效果須附拔靴信賴區間;各內生變項被解釋的變異比例;以及,同樣不可或缺的,研究者曾認真考慮過哪些等價或替代模型、又憑什麼理論理由偏好目前這一個。把測量層與結構層的報告分開陳述,不僅使讀者能分辨適配問題的來源,也讓「這個理論站得多穩」與「這份工具測得多準」兩個問題各得其所。

前沿:貝氏 SEM、正則化 SEM 與網絡

SEM 仍在快速演化,以下幾個方向特別值得一提。它們的共同動機是相近的:放鬆傳統 SEM 中某些過於僵硬的設定,讓模型更貼近資料真實的樣子,同時把不確定性交代得更完整。其一是貝氏 SEM(Bayesian SEM;(Muthén & Asparouhov, 2012))。如第十五章所述,它以先驗把 SEM 變得更有彈性,例如以「小變異先驗」容許次要的交叉負荷或殘差相關「近似為零」而非「嚴格為零」,這往往比傳統的「全零」設定更貼近現實;貝氏取向也能自然地處理複雜模型與小樣本,並提供完整的後驗不確定性。其細節見第三十三章。

其二是正則化 SEM(regularized SEM)。Jacobucci et al. (2016) 把第十一章的 lasso 之類懲罰搬進 SEM,對眾多路徑或交叉負荷施加懲罰,讓資料自己把「不重要的」壓成零,藉此在參數眾多、或需要探索性地找出關鍵路徑時,做「資料驅動的模型化簡」。這條路等於把 SEM 與機器學習(第三十四章)接了起來,也呼應了本書一再出現的偏誤-變異權衡。其三是網絡取向與潛在變項模型的整合:晚近有研究把「潛在因素」與「變項間的直接網絡連結」納入同一個廣義框架,使研究者不必在「共同原因」與「直接互動」兩種本體論之間預先選邊(第三十五章)。更長遠地看,SEM 與現代因果推論(Pearl,第三十一章)的整合,仍是進行中的重要議題:如何在 SEM 的框架裡,更嚴謹地釐清「哪些效果在什麼假設下才有因果意義」,是這個領域持續在耕耘的方向。

小結

結構方程模型,是把「測量模型」與「結構模型」熔於一爐的完整框架,它讓研究者能把一整套理論,寫成一張潛在構念相連的網,一次估計、一次檢驗。本章的幾個核心工具值得記牢:縮減式 (\mathbf{I}-\mathbf{B})^{-1} 是理解一切效果傳遞的鑰匙;效果可分解為直接、間接與總效果,而間接效果(中介)因其偏態的抽樣分配,該用拔靴法而非 Sobel 檢定;至於因果詮釋,SEM 讓假設變明確,卻不能替研究者證明它們;而等價模型的存在,更提醒我們,適配良好從來不等於「這個結構就是對的」。

歸結成一句話:SEM 有「表達一套理論」的強大能力,但那不等於「證明一套理論」的能力。用它來清楚地陳述、並嚴謹地檢驗理論結構,同時對它的因果與結構宣稱保持謙遜,這才是 SEM 正確的用法。

接下來,第四部分將轉向另一大類測量模型。第十七章的項目反應理論,處理的是「類別型」的題目反應(如對錯、等級),它將揭示,那個看似專屬於測驗的理論,骨子裡其實就是一個「跑在潛在能力上的 logistic 迴歸」(第十一章)。而第十九章,則會用本章的多群組架構,正式建立測量不變性,回答「跨群體、跨時間的比較,到底何時才站得住腳」這個貫穿全書的問題。

參考文獻

Anderson, J. C., & Gerbing, D. W. (1988). Structural equation modeling in practice: A review and recommended two-step approach. Psychological Bulletin, 103(3), 411–423. https://doi.org/10.1037/0033-2909.103.3.411
Baron, R. M., & Kenny, D. A. (1986). The moderator-mediator variable distinction in social psychological research: Conceptual, strategic, and statistical considerations. Journal of Personality and Social Psychology, 51(6), 1173–1182. https://doi.org/10.1037/0022-3514.51.6.1173
Bollen, K. A., & Pearl, J. (2013). Eight myths about causality and structural equation models. In S. L. Morgan (Ed.), Handbook of causal analysis for social research (pp. 301–328). Springer. https://doi.org/10.1007/978-94-007-6094-3_15
Duncan, O. D. (1975). Introduction to structural equation models. Academic Press.
Jacobucci, R., Grimm, K. J., & McArdle, J. J. (2016). Regularized structural equation modeling. Structural Equation Modeling, 23(4), 555–566. https://doi.org/10.1080/10705511.2016.1154793
Klein, A., & Moosbrugger, H. (2000). Maximum likelihood estimation of latent interaction effects with the LMS method. Psychometrika, 65(4), 457–474. https://doi.org/10.1007/BF02296338
Lee, S.-Y., & Hershberger, S. (1990). A simple rule for generating equivalent models in covariance structure modeling. Multivariate Behavioral Research, 25(3), 313–334. https://doi.org/10.1207/s15327906mbr2503_4
MacCallum, R. C., Wegener, D. T., Uchino, B. N., & Fabrigar, L. R. (1993). The problem of equivalent models in applications of covariance structure analysis. Psychological Bulletin, 114(1), 185–199. https://doi.org/10.1037/0033-2909.114.1.185
MacKinnon, D. P., Lockwood, C. M., Hoffman, J. M., West, S. G., & Sheets, V. (2002). A comparison of methods to test mediation and other intervening variable effects. Psychological Methods, 7(1), 83–104. https://doi.org/10.1037/1082-989X.7.1.83
Muthén, B., & Asparouhov, T. (2012). Bayesian structural equation modeling: A more flexible representation of substantive theory. Psychological Methods, 17(3), 313–335. https://doi.org/10.1037/a0026802
Pearl, J. (2009). Causality: Models, reasoning, and inference (2nd ed.). Cambridge University Press.
Preacher, K. J., & Hayes, A. F. (2008). Asymptotic and resampling strategies for assessing and comparing indirect effects in multiple mediator models. Behavior Research Methods, 40(3), 879–891. https://doi.org/10.3758/BRM.40.3.879
Wright, S. (1934). The method of path coefficients. The Annals of Mathematical Statistics, 5(3), 161–215. https://doi.org/10.1214/aoms/1177732676
本章引用格式游琇婷(2026)。結構方程模型。《計量心理學:測量、模型與推論》(第 16 章)。