第 28 章 多層次模型
第六部 相依資料與變化的建模
28Chapter

多層次模型

社會與行為科學所處理的資料,多半具有巢狀(nested)結構:學生巢狀於班級、班級巢狀於學校;病人巢狀於醫院;員工巢狀於團隊;重複測量巢狀於個人。此種結構並非資料蒐集的偶然瑕疵,而是研究對象本身的組織方式。忽略它,不僅損失了層次之間的實質訊息,更會違反標準統計方法賴以成立的獨立性假定,導致推論失真。多層次模型(multilevel model),又稱階層線性模型(hierarchical linear model, HLM)或混合效果模型(mixed-effects model),即為明確地把此巢狀依賴納入模型而發展的統計框架。此框架的奠立與普及,見 Raudenbush & Bryk (1986) 的學校效果研究,以及 Raudenbush & Bryk (2002) 與 Hox et al. (2018) 等經典專著。

本章對多層次模型作一完整而深入的處理。前半部建立其核心邏輯:自巢狀依賴的後果與組內相關談起,逐步展開隨機截距、隨機斜率、脈絡效果與中心化,並詳論估計(ML 與 REML)、變異數成分的邊界推論、以及變異解釋。後半部則系統呈現其延伸:三層與交叉分類結構、廣義線性混合模型、縱貫資料的多層次取向、多層次結構方程模型、貝氏多層次模型,以及固定效果與隨機效果在因果推論上的分野。全章的主軸是一個貫穿始終的洞見:層次結構所生的依賴,既是必須處理的統計障礙,也是承載實質理論的訊息來源。

巢狀資料與依賴:為何忽略分層會出錯

標準迴歸(第十一章)的核心假定之一,是觀測值彼此獨立、殘差不相關。然而在巢狀資料中,同一群集內的個體因共享環境、經歷與相互影響,其反應必然相關:同一班級的學生受同一位教師、同一套教材、同一種班級氛圍的影響,他們的成就分數不可能彼此獨立。此種群集內相關,使得每一觀測所攜帶的獨立訊息量,少於獨立抽樣時的一筆觀測。

忽略此依賴的後果具體而嚴重。若對巢狀資料逕行 OLS 迴歸,其標準誤估計將系統性地偏低,t 值與顯著性因而虛假地膨脹,第一類型錯誤率遠超名目水準。問題的另一面向是跨層次的推論謬誤:以總體層次的相關去推論個體層次的關係,是生態謬誤(ecological fallacy),Robinson (1950) 的經典分析即揭示總體相關可能與個體相關方向相反、大小懸殊;反向地,以個體層次關係推論總體,則為原子謬誤(atomistic fallacy)。多層次模型的價值,正在於同時而分別地估計各層次的關係,使兩類謬誤皆可避免。

組內相關與設計效應

量化群集內依賴的核心指標,是組內相關(intraclass correlation, ICC)。其形式定義最清楚地體現於最簡單的多層次模型,即不含任何預測變項的空模型(unconditional model)。

推導方塊組內相關與設計效應

空模型將每一觀測分解為總平均、群集效果與個體殘差:

Y_{ij} = \gamma_{00} + u_{0j} + e_{ij}, \qquad u_{0j}\sim N(0,\tau_{00}),\quad e_{ij}\sim N(0,\sigma^2),

其中 i 標記群集 j 內的個體,u_{0j} 與 e_{ij} 相互獨立。由此,單一觀測的總變異被拆為群集間與群集內兩部分:

\mathrm{Var}(Y_{ij}) = \tau_{00} + \sigma^2.

同一群集內兩個體的共變,來自其共享的群集效果 u_{0j}:

\mathrm{Cov}(Y_{ij}, Y_{i'j}) = \tau_{00}\quad(i\neq i').

組內相關即群集間變異佔總變異的比例,亦等於同群兩觀測的相關:

\rho = \frac{\tau_{00}}{\tau_{00} + \sigma^2}.

其對推論的衝擊由設計效應(design effect)刻畫。當群集大小為 m 時,

\mathrm{Deff} = 1 + (m-1)\rho,

有效樣本數為 N_{\text{eff}} = N/\mathrm{Deff}。即使 \rho 不大,只要群集夠大,\mathrm{Deff} 仍可觀,正確標準誤因而遠大於 OLS 所給者。此式亦連結第九章的抽樣與檢定力:巢狀設計的實質樣本資訊,被 \mathrm{Deff} 所折減。

ICC 有雙重意義。就統計而言,它衡量忽略分層所將造成的偏誤幅度;就實質而言,它回答「結果變異有多少歸因於群集層次」這一具實質重要性的問題,例如「學生成就的變異,有多少來自學校之間的差異」。一個接近零的 ICC 意味群集無關緊要,多層次模型退化為單層迴歸;一個可觀的 ICC 則意味群集層次承載了實質的變異,值得建模。

隨機截距模型

在空模型中加入預測變項,即得到最基本的實質多層次模型。多層次模型的標準寫法,是先分層設定各層次的方程,再合併為一式。

推導方塊隨機截距模型的分層與合併

設 X_{ij} 為個體層次(第一層)預測變項。第一層方程將結果對 X 迴歸,容許各群集有各自的截距 \beta_{0j}:

Y_{ij} = \beta_{0j} + \beta_{1j} X_{ij} + e_{ij},\qquad e_{ij}\sim N(0,\sigma^2).

第二層方程刻畫群集層次的截距如何變動。在隨機截距模型中,截距在總平均 \gamma_{00} 上下隨機浮動,斜率則暫設為跨群集固定:

\beta_{0j} = \gamma_{00} + u_{0j},\qquad \beta_{1j} = \gamma_{10},\qquad u_{0j}\sim N(0,\tau_{00}).

代入合併,得單一混合模型:

Y_{ij} = \underbrace{\gamma_{00} + \gamma_{10}X_{ij}}_{\text{固定部分}} + \underbrace{u_{0j} + e_{ij}}_{\text{隨機部分}}.

固定部分(fixed part)\gamma_{00}+\gamma_{10}X_{ij} 描述母體平均的迴歸線;隨機部分(random part)u_{0j}+e_{ij} 則含兩個變異來源:群集間的 \tau_{00} 與群集內的 \sigma^2。\gamma 稱固定效果(fixed effects),u_{0j} 與 \tau_{00} 稱隨機效果(random effects)與變異數成分(variance component)。

隨機截距模型的幾何意象,是一族平行的迴歸線:各群集的迴歸線斜率相同(\gamma_{10}),但截距高低不一(因 u_{0j} 而上下平移)。此設定隱含一個實質假設,即 X 對 Y 的效果在所有群集中一致。當此假設不合理時,即須引入隨機斜率。

隨機斜率與隨機效果的共變結構

若 X 對 Y 的效果本身因群集而異,例如某教學法在某些班級特別有效、在另一些班級效果平平,則斜率也應容許隨機變動。此時第二層方程對截距與斜率同時設定隨機效果:

\beta_{0j} = \gamma_{00} + u_{0j},\qquad \beta_{1j} = \gamma_{10} + u_{1j},

其中兩個隨機效果服從聯合常態,並具有一個完整的共變結構:

\begin{pmatrix} u_{0j}\\ u_{1j}\end{pmatrix} \sim N\!\left(\mathbf{0},\ \mathbf{T}\right), \qquad \mathbf{T} = \begin{pmatrix} \tau_{00} & \tau_{01}\\ \tau_{01} & \tau_{11}\end{pmatrix}.

其中 \tau_{11} 為斜率的群集間變異(效果的異質程度),\tau_{01} 為截距與斜率的共變(例如起點高的群集是否效果也較大)。合併模型為

Y_{ij} = \gamma_{00} + \gamma_{10}X_{ij} + u_{0j} + u_{1j}X_{ij} + e_{ij}.

隨機斜率模型有一個常被忽略卻極重要的性質:其邊際變異不再固定,而是預測變項的函數。由合併式可導出

\mathrm{Var}(Y_{ij}\mid X_{ij}) = \tau_{00} + 2\tau_{01}X_{ij} + \tau_{11}X_{ij}^2 + \sigma^2,

即結果變異隨 X 呈二次變化。這意味隨機斜率模型內生地蘊含異質變異(heteroscedasticity),是它與固定斜率模型在統計行為上的根本差異,亦提醒研究者:所謂「隨機斜率」不只是多估幾個參數,而是改變了模型對變異結構的整體設定。

脈絡效果、跨層次交互作用與中心化

多層次模型的一項獨特能力,是同時納入不同層次的預測變項並刻畫其交互作用。群集層次的預測變項 W_j(如學校規模、班級社經組成)可進入第二層方程,用以解釋截距或斜率的群集間變異。當 W_j 預測斜率時,

\beta_{1j} = \gamma_{10} + \gamma_{11} W_j + u_{1j},

代入合併式即產生一個跨層次交互作用(cross-level interaction)項 \gamma_{11} W_j X_{ij},其意義為:個體層次預測變項 X 對結果的效果,本身受群集層次脈絡 W 的調節。這使多層次模型得以形式化「情境如何形塑個體歷程」這類本質上跨層次的理論命題。

一個與此密切相關且極易誤用的議題是脈絡效果(contextual effect):群集層次的聚合變項(如班級平均成就)在控制個體層次同一變項後,是否仍對結果有額外效果。要正確估計脈絡效果,中心化(centering)的選擇至關重要,且其後果遠非計算細節,而直接改變參數的實質意義。Enders & Tofighi (2007) 對此有權威的釐清,主要的中心化策略及其意涵見表 28.1。

表 28.1 第一層預測變項的中心化策略
策略 迴歸係數的意義 適用情境
不中心化 截距為 X=0 之期望;常無實質意義 少用
總平減(CGM) 混合了組間與組內效果 控制變項、脈絡效果分析
組平減(CWC) 純粹的組內(個體層次)效果 分離組內與組間效果
組平減+組平均 組內效果與脈絡效果分別估計 檢驗脈絡效果

註. CGM 為 centering at grand mean(總平均中心化);CWC 為 centering within cluster(組內中心化)。組平減將 X_{ij} 減去其所屬群集之平均 \bar{X}_{\cdot j},總平減則減去全樣本總平均 \bar{X}_{\cdot\cdot}。

中心化之所以關鍵,在於未加分離的第一層斜率,往往是組內效果與組間效果的一個模糊加權平均,兩者在實質上可能截然不同,甚至方向相反(此即前述生態謬誤在迴歸中的體現)。將 X_{ij} 作組平減、並同時把群集平均 \bar{X}_{\cdot j} 納入第二層,即可將組內效果與組間(脈絡)效果乾淨地分離,此即計量經濟學中 Mundlak 取向的多層次對應。

然而,以觀測到的群集平均 \bar{X}_{\cdot j} 作為群集真值的估計,本身帶有抽樣誤差,尤其在群集偏小時。Lüdtke et al. (2008) 證明,此種外顯聚合(manifest aggregation)會使脈絡效果的估計產生系統性偏誤、並低估其標準誤;其提出的多層次潛在共變模型(multilevel latent covariate model)改以潛在的群集真均值取代觀測群均,是更可靠的取向,亦預示了本章稍後的多層次結構方程模型。

估計:最大概似、受限最大概似與計算

多層次模型的估計,建立在對隨機效果邊際化後的邊際概似之上。將群集 j 的所有觀測堆疊為向量,模型可寫為緊緻的矩陣形式,這也是理解其估計與各種延伸的統一起點。

推導方塊邊際模型、ML 與 REML

以 \mathbf{Y}_j 為群集 j 的結果向量,\mathbf{X}_j、\mathbf{Z}_j 分別為固定與隨機效果的設計矩陣,則

\mathbf{Y}_j = \mathbf{X}_j\boldsymbol{\gamma} + \mathbf{Z}_j\mathbf{u}_j + \mathbf{e}_j, \qquad \mathbf{u}_j\sim N(\mathbf{0},\mathbf{T}),\quad \mathbf{e}_j\sim N(\mathbf{0},\sigma^2\mathbf{I}).

將隨機效果 \mathbf{u}_j 積分消去,得邊際分布

\mathbf{Y}_j \sim N\!\left(\mathbf{X}_j\boldsymbol{\gamma},\ \mathbf{V}_j\right), \qquad \mathbf{V}_j = \mathbf{Z}_j\mathbf{T}\mathbf{Z}_j' + \sigma^2\mathbf{I}.

固定效果的廣義最小平方(GLS)估計為

\hat{\boldsymbol{\gamma}} = \Bigl(\textstyle\sum_j \mathbf{X}_j'\mathbf{V}_j^{-1}\mathbf{X}_j\Bigr)^{-1} \sum_j \mathbf{X}_j'\mathbf{V}_j^{-1}\mathbf{Y}_j,

但 \mathbf{V}_j 含未知的變異數成分,故須以迭代(如 EM、Fisher 得分法,或 Goldstein (2011) 的疊代廣義最小平方法 IGLS)交替估計 \boldsymbol{\gamma} 與 (\mathbf{T},\sigma^2)。

最大概似(ML)同時估計固定效果與變異數成分,但其變異數成分估計向下偏誤,因為它未計入估計 \boldsymbol{\gamma} 所耗損的自由度。受限最大概似(restricted ML, REML)改為最大化與固定效果正交之誤差對比(error contrasts)的概似,從而校正此偏誤,其道理與樣本變異數採 n-1 而非 n 為分母完全平行。實務準則:比較僅在隨機部分不同的模型,宜用 REML;比較固定效果不同的巢狀模型(以概似比檢定),則須改用 ML,因 REML 的概似不可跨不同固定效果結構比較。

上述框架同時說明了多層次模型如何自然地處理缺失資料。當結果變項在部分時點或個體上缺失,只要缺失機制為隨機缺失(MAR,見第十三章),以完整資訊最大概似(FIML)估計邊際概似即可得到無偏估計,無須刪除整個群集,這是多層次模型相對於傳統重複量數變異數分析的一大優勢。

推論:變異數成分的邊界問題與自由度

多層次模型的推論,在固定效果與變異數成分上有不同的難處。固定效果的檢定可用 Wald 檢定或概似比檢定,其主要困難在於分母自由度的界定:在不平衡的巢狀資料中,適當的自由度並無單一顯然的定義,小樣本時尤須採用近似,如 Satterthwaite 法或偏誤更小的 Kenward & Roger (1997) 法,後者同時校正自由度與標準誤的小樣本偏誤。

變異數成分的檢定則涉及一個更根本的理論問題,且與第二十章的類別數決定遙相呼應。

推導方塊變異數成分檢定的邊界問題

考慮檢定是否需要隨機斜率,即 H_0:\tau_{11}=0。由於變異數必然非負(\tau_{11}\ge 0),此虛無假設恰落在參數空間的邊界上。Wilks 定理要求真參數位於參數空間內部,此條件在此不成立,故概似比統計量並不漸近服從 \chi^2_1。Stram & Lee (1994) 證明,其正確的漸近分配為兩個卡方分配的等權混合:

-2(\ell_{H_0} - \ell_{H_1}) \ \dot\sim\ \tfrac{1}{2}\chi^2_0 + \tfrac{1}{2}\chi^2_1,

其中 \chi^2_0 為集中於零的點質量。若逕自對照 \chi^2_1,所得 p 值偏大、檢定過度保守,將傾向錯誤地捨棄本應保留的隨機效果。此與第二十章「K 對 K+1 類別的概似比因邊界值而失效」屬同一類非正則問題。

此邊界問題的實務意涵是:關於隨機效果是否需要的決策,不應僅依賴天真的概似比 p 值,而宜輔以資訊準則、對混合分配的正確校正、以及理論考量。過度精簡地刪除隨機斜率,會低估效果的群集間異質性並使固定效果的標準誤偏低;過度飽和地保留,則可能導致模型不收斂或變異數成分的邊界估計(如 \hat\tau_{11}=0 或相關達 \pm 1,即所謂的奇異適配 singular fit)。

在推論策略的層次上,尚須辨明一項常被忽略的取捨:完整的隨機效果建模並非唯一的合法選項。當研究旨趣僅在於固定效果的無偏推論,而非變異數分解或群集層次效果本身時,設計取向(design-based)的做法提供了另一條路徑,即以群集穩健標準誤(cluster-robust standard error)或廣義估計方程(generalized estimating equation, GEE)校正群集內依賴。此類做法對隨機部分的設定保持中立,因而對隨機效果結構的設定錯誤較具穩健性,代價則是放棄了對變異數成分與隨機效果的估計。McNeish et al. (2017) 系統比較了模型取向(HLM)與設計取向的適用時機,並指出當群集僅為須加以校正的干擾(nuisance)、而非實質研究對象時,設計取向往往較為簡潔而穩健;反之,當變異數成分、隨機斜率或跨層次效果本身即為理論關切時,多層次模型才是無可替代的選擇。取向的抉擇因而應由研究問題決定,而非預設地一律訴諸 HLM。

變異解釋與模型比較

多層次模型中「解釋了多少變異」的問題,較單層迴歸複雜,因變異分屬不同層次。常見做法是計算各層次的擬 R^2(pseudo-R^2):以加入預測變項後、各層次變異數成分(\sigma^2 與 \tau_{00})相對於空模型的縮減比例為指標。惟須注意,因層次間變異的重新分配,擬 R^2 偶可出現負值,其詮釋須審慎。

較新且應用漸廣的取向,是 Nakagawa & Schielzeth (2013) 提出的邊際與條件 R^2。邊際 R^2(marginal R^2)以固定效果所解釋的變異佔總變異(固定效果變異、隨機效果變異與殘差變異之和)的比例定義,回答「僅固定效果解釋了多少」;條件 R^2(conditional R^2)則把隨機效果變異一併計入分子,回答「固定與隨機效果合計解釋了多少」。此一分解不僅為擬 R^2 提供了統一而不會出現負值的定義,更可推廣至廣義線性混合模型:在非線性連結下,殘差變異改以連結尺度上的分布特定變異(如邏輯斯模型的 \pi^2/3)替代,從而在無自然殘差變異的計次或二元結果中亦可計算效果量。模型整體的比較,則回到第十二章的架構:巢狀模型以概似比檢定(留意上述邊界問題),非巢狀模型以 AIC、BIC 等資訊準則。Snijders & Bosker (2012) 對多層次變異解釋與模型建構策略有詳盡的處理。

三層與交叉分類結構

真實資料的巢狀結構常超過兩層,或不呈嚴格的樹狀巢狀。多層次框架可自然地推廣以容納這些結構,摘要於表 28.2。三層模型(three-level model)處理如「學生於班級於學校」的嚴格巢狀,各層皆可設隨機效果,變異因而拆分至三個層次。當單位並非嚴格巢狀,而是交叉歸屬於兩個以上的分類因子時(如學生同時巢狀於「就讀學校」與「居住社區」,而社區與學校不互相巢狀),則須用交叉分類隨機效果模型(cross-classified random effects model, CCREM)。更進一步,當一個低層單位同時隸屬多個高層單位(如學生在學期間轉學、隸屬多所學校),則為多重隸屬模型(multiple membership model),以權重刻畫各高層單位的貢獻。

表 28.2 多層次資料結構的類型
結構 特徵 範例
兩層巢狀 低層單位嚴格巢狀於單一高層單位 學生於學校
三層巢狀 三層嚴格巢狀 學生於班級於學校
交叉分類 單位交叉歸屬於多個非巢狀因子 學生 \times 學校 \times 社區
多重隸屬 低層單位同時隸屬多個高層單位 轉學生隸屬多校

註. 交叉分類與多重隸屬結構的估計較巢狀結構複雜,貝氏 MCMC(見本章後段與第三十三章)在此類模型上常較最大概似更具彈性。

廣義線性混合模型

前述模型皆假定結果為連續且條件常態。當結果為二元、次數或其他非常態型態時,須將多層次結構與第十一章的廣義線性模型結合,成為廣義線性混合模型(generalized linear mixed model, GLMM)。其做法是在線性預測子中納入隨機效果,再經連結函數對應至結果的期望。例如二元結果的隨機截距邏輯斯模型為

\mathrm{logit}\bigl[P(Y_{ij}=1\mid u_{0j})\bigr] = \gamma_{00} + \gamma_{10}X_{ij} + u_{0j},\qquad u_{0j}\sim N(0,\tau_{00}).

GLMM 帶來兩個特有的複雜性。其一是詮釋:因連結函數為非線性,固定效果具有單位特定(unit-specific,即條件於隨機效果)的意義,不等同於總體平均(population-average)的邊際效果,兩者在邏輯斯模型中會因隨機效果變異而系統地相差一個縮放。混淆此二者是應用 GLMM 常見的錯誤,亦正是前節設計取向 GEE(估計的是邊際效果)與模型取向 GLMM(估計的是條件效果)在詮釋上分歧的根源。其二是估計:隨機效果的積分在非線性連結下沒有封閉解,須以數值方法近似,如適應性高斯求積(adaptive Gaussian quadrature,精確但隨隨機效果維度指數增長)、Laplace 近似,或懲罰擬概似(penalized quasi-likelihood, PQL)。Breslow & Clayton (1993) 提出的 PQL 計算便利,但在二元結果且群集小時,變異數成分會有明顯向下偏誤,是須警覺的限制。一個具統整意義的觀察是:第十七章的兩參數 IRT 模型,可視為以受測者為隨機效果、試題為固定效果的 GLMM,這揭示了測量模型與多層次模型在數理上的深層一致。

縱貫資料的多層次取向

多層次框架最富成效的應用之一,是縱貫(longitudinal)資料。若將同一個人的重複測量視為巢狀於個人之內,則「時點於個人」構成一個兩層結構:第一層描述個人的時間軌跡,第二層描述軌跡參數(如起始水準與變化率)的個體間差異。Laird & Ware (1982) 的隨機效果模型正是此取向的奠基之作。以線性成長為例,第一層設 Y_{ti} = \pi_{0i} + \pi_{1i}\,\text{Time}_{ti} + e_{ti},第二層則令截距 \pi_{0i} 與斜率 \pi_{1i} 隨個人隨機變動,其變異即刻畫個體軌跡的異質性。

此取向較傳統重複量數變異數分析(第十章)有數項實質優勢:容許不等間隔與個體特定的測量時點、容納隨時間變動的共變項(time-varying covariate)、在 MAR 下藉 FIML 處理流失(attrition)、並可對第一層殘差設定各種共變結構(如自迴歸)以刻畫時間相依。成長曲線建模作為多層次模型的重要特例,將於第二十九章專章深入,本節在此僅確立其與多層次框架的一體關係。

多層次結構方程模型

多層次模型與結構方程模型(第十五、十六章)各自處理一種複雜性:前者處理層次依賴,後者處理潛在變項與變項間的結構關係。多層次結構方程模型(multilevel SEM, MSEM)將兩者整合,容許在多個層次上同時設定測量模型與結構模型。其核心邏輯,是把觀測變項的總共變數矩陣分解為組內(within)與組間(between)兩個成分,並在各層分別設定因素或路徑結構 (Muthén, 1994)。

MSEM 解決了若干單靠多層次迴歸難以處理的問題。前述 Lüdtke et al. (2008) 的聚合偏誤,在 MSEM 中獲得自然的解法:群集層次的構念可設為潛在的組間因素,從而以模型內生地校正群均的測量與抽樣誤差,此即所謂的潛在聚合。隨機斜率亦可在 MSEM 中被視為潛在變項,與其他潛在構念建立結構關係。多層次中介分析即為一例:Preacher et al. (2010) 提出的一般化 MSEM 框架,將各種多層次中介設定統攝為特例,並釐清了中介效果在不同層次上分解的正確方式。MSEM 因而代表了本書兩條主線,即潛在變項建模與層次依賴建模的匯流。

貝氏多層次模型與部分聯營

多層次模型與貝氏推論(第三十三章)有著特別自然的親和性。事實上,多層次模型的隨機效果設定,本身即具貝氏的結構:第二層方程 \beta_{0j}=\gamma_{00}+u_{0j} 恰可視為對群集參數 \beta_{0j} 施加一個以 \gamma_{00} 為中心、以 \tau_{00} 為變異的先驗。由此觀之,多層次估計對群集效果所做的收縮(shrinkage),正是一種部分聯營(partial pooling):各群集的估計被朝總體平均拉近,拉近的幅度取決於該群集的資訊量,樣本小、雜訊大的群集被拉得多,樣本大的群集被拉得少。此機制在「完全不聯營」(各群集獨立估計、過度擬合)與「完全聯營」(忽略群集、抹平差異)之間取得最適折衷,是多層次模型借力(borrowing strength)的統計精髓 (Gelman & Hill, 2007)。

明確的貝氏取向在若干情境下尤具價值。當群集數偏少時,變異數成分的最大概似估計不穩、且易落在邊界(\hat\tau=0),對變異數成分施加弱資訊先驗可穩定估計並避免退化解。當模型結構複雜(如交叉分類、多重隸屬、非線性 GLMM)時,MCMC(第三十三章)常較最大概似更具彈性。代價則是先驗選擇的敏感性與計算成本,關於變異數成分先驗的設定尤須審慎,此於第三十三章詳論。

樣本數、檢定力與模型診斷

多層次設計的樣本數規劃,其關鍵不在總樣本數,而在層次的分配:究竟需要多少群集、每群多少個體。一個穩健的經驗是,群集數(第二層單位數)對變異數成分與跨層次效果的估計品質,較每群人數更為關鍵;群集數偏少時,標準誤估計偏低、第一類型錯誤膨脹。Maas & Hox (2005) 的模擬顯示,固定效果在群集數不多時即可估得尚可,但變異數成分及其標準誤則需相當數量的群集方能無偏,若干情境下約需五十個以上群集。實際規劃宜以蒙地卡羅檢定力分析(連結第九章)針對具體模型與效果量進行,而非套用單一經驗法則。

模型診斷方面,多層次模型的假設包括各層隨機效果的常態性、變異數的同質性、以及隨機效果與預測變項的獨立性(違反此點正是下節固定與隨機效果之爭的核心)。實務上應檢查各層殘差、辨識具影響力的群集(單一異常群集可能主導變異數成分估計)、並評估模型設定錯誤(如遺漏隨機斜率)對固定效果標準誤的後果。缺失資料的處理則連結第十三章,須留意缺失可能同時發生於不同層次。

固定效果與隨機效果:因果推論的視角

多層次模型(在計量經濟學傳統中稱隨機效果模型)有一個常被忽略的強假設:隨機效果與模型中的預測變項不相關。若群集層次存在未測量的干擾因子,同時影響預測變項與結果(即群集層次的內生性),此假設即被違反,隨機效果估計將產生偏誤。計量經濟學傳統因而常偏好固定效果(fixed effects)取向:藉由對群集去平均(等價於納入群集虛擬變項),將一切不隨時間變動的群集層次干擾徹底吸收,代價是無法估計任何群集層次(不隨時間變動)預測變項的效果,且捨棄了組間訊息。

固定效果與隨機效果之爭,本質上是「無偏但低效」與「有效但需較強假設」之間的權衡。傳統上以 Hausman 檢定判別兩者是否分歧,但更具建設性的取向,是採用組內組間分離(within-between)或 Mundlak 設定:在隨機效果模型中同時納入去群均的預測變項與其群集平均,如此既能得到與固定效果一致的無偏組內估計,又能保留對組間效果的估計與隨機效果框架的彈性 (Bell & Jones, 2015)。McNeish & Kelley (2019) 對心理學脈絡下兩取向的異同與選擇提供了清晰的比較與建議。此一議題直接關聯第三十一章的因果推論:多層次模型能否支持因果詮釋,取決於群集層次干擾是否已被適當處理,而非模型形式本身。

小結

本章對多層次模型作了自基礎至前沿的完整鋪陳。核心邏輯上,多層次模型以隨機效果明確地建模巢狀依賴,將變異分解至各層次,並藉隨機截距、隨機斜率、脈絡效果與跨層次交互作用,把「情境如何形塑個體」這一跨層次命題形式化。方法細節上,本章詳論了 ML 與 REML 的分野、變異數成分檢定的邊界問題、中心化對參數意義的決定性影響、聚合偏誤的來源與矯正、以及模型取向與設計取向在推論策略上的取捨。延伸上,本章涵蓋三層與交叉分類結構、廣義線性混合模型、縱貫的多層次取向、多層次結構方程模型、貝氏部分聯營,以及固定與隨機效果在因果推論上的分野。貫穿全章的,是層次依賴的雙重性:它既是必須以隨機效果處理的統計障礙,也是承載脈絡理論的實質訊息。下一章將聚焦於此框架最重要的縱貫特例,即成長曲線模型,深入探討如何對「隨時間的變化」本身進行建模。

參考文獻

Bell, A., & Jones, K. (2015). Explaining fixed effects: Random effects modeling of time-series cross-sectional and panel data. Political Science Research and Methods, 3(1), 133–153. https://doi.org/10.1017/psrm.2014.7
Breslow, N. E., & Clayton, D. G. (1993). Approximate inference in generalized linear mixed models. Journal of the American Statistical Association, 88(421), 9–25. https://doi.org/10.2307/2290687
Enders, C. K., & Tofighi, D. (2007). Centering predictor variables in cross-sectional multilevel models: A new look at an old issue. Psychological Methods, 12(2), 121–138. https://doi.org/10.1037/1082-989X.12.2.121
Gelman, A., & Hill, J. (2007). Data analysis using regression and multilevel/hierarchical models. Cambridge University Press.
Goldstein, H. (2011). Multilevel statistical models (4th ed.). John Wiley & Sons.
Hox, J. J., Moerbeek, M., & Schoot, R. van de. (2018). Multilevel analysis: Techniques and applications (3rd ed.). Routledge.
Kenward, M. G., & Roger, J. H. (1997). Small sample inference for fixed effects from restricted maximum likelihood. Biometrics, 53(3), 983–997. https://doi.org/10.2307/2533558
Laird, N. M., & Ware, J. H. (1982). Random-effects models for longitudinal data. Biometrics, 38(4), 963–974. https://doi.org/10.2307/2529876
Lüdtke, O., Marsh, H. W., Robitzsch, A., Trautwein, U., Asparouhov, T., & Muthén, B. (2008). The multilevel latent covariate model: A new, more reliable approach to group-level effects in contextual studies. Psychological Methods, 13(3), 203–229. https://doi.org/10.1037/a0012869
Maas, C. J. M., & Hox, J. J. (2005). Sufficient sample sizes for multilevel modeling. Methodology, 1(3), 86–92. https://doi.org/10.1027/1614-2241.1.3.85
McNeish, D., & Kelley, K. (2019). Fixed effects models versus mixed effects models for clustered data: Reviewing the approaches, disentangling the differences, and making recommendations. Psychological Methods, 24(1), 20–35. https://doi.org/10.1037/met0000182
McNeish, D., Stapleton, L. M., & Silverman, R. D. (2017). On the unnecessary ubiquity of hierarchical linear modeling. Psychological Methods, 22(1), 114–140. https://doi.org/10.1037/met0000078
Muthén, B. O. (1994). Multilevel covariance structure analysis. Sociological Methods & Research, 22(3), 376–398. https://doi.org/10.1177/0049124194022003006
Nakagawa, S., & Schielzeth, H. (2013). A general and simple method for obtaining {R}^2 from generalized linear mixed-effects models. Methods in Ecology and Evolution, 4(2), 133–142. https://doi.org/10.1111/j.2041-210x.2012.00261.x
Preacher, K. J., Zyphur, M. J., & Zhang, Z. (2010). A general multilevel SEM framework for assessing multilevel mediation. Psychological Methods, 15(3), 209–233. https://doi.org/10.1037/a0020141
Raudenbush, S. W., & Bryk, A. S. (1986). A hierarchical model for studying school effects. Sociology of Education, 59(1), 1–17. https://doi.org/10.2307/2112482
Raudenbush, S. W., & Bryk, A. S. (2002). Hierarchical linear models: Applications and data analysis methods (2nd ed.). Sage.
Robinson, W. S. (1950). Ecological correlations and the behavior of individuals. American Sociological Review, 15(3), 351–357. https://doi.org/10.2307/2087176
Snijders, T. A. B., & Bosker, R. J. (2012). Multilevel analysis: An introduction to basic and advanced multilevel modeling (2nd ed.). Sage.
Stram, D. O., & Lee, J. W. (1994). Variance components testing in the longitudinal mixed effects model. Biometrics, 50(4), 1171–1177. https://doi.org/10.2307/2533455
本章引用格式游琇婷(2026)。多層次模型。《計量心理學:測量、模型與推論》(第 28 章)。