潛在類別與混合模型
=1.5em
前面數章所建立的潛在變項模型,包括因素分析、結構方程與項目反應理論,其共同前提是潛在變項為連續量:受測者在某條潛在向度上佔有一個位置,模型的任務是估計該位置並刻畫其與觀測指標的關係。然而,並非所有的潛在結構都適合以連續量刻畫。當母體由若干性質相異的次群體(subpopulation)混合而成,而群體成員身分無法直接觀測時,較自然的表徵是一個類別型潛在變項(categorical latent variable):它不指涉程度的高低,而指涉類型的歸屬。本章處理的模型家族,即以此類別型潛在變項為核心,統稱為有限混合模型(finite mixture model),其在類別觀測指標下的特例即潛在類別分析(latent class analysis, LCA)。
這一取向常被稱為以人為中心(person-centered)的分析,以別於因素分析等以變項為中心(variable-centered)的取向。前者追問「母體中存在哪幾種人」,後者追問「變項之間如何共變」。兩者並非互斥,而是對異質性(heterogeneity)的兩種互補刻畫。此外,本章亦與第二十一章的認知診斷模型相銜接:後者以類別潛在屬性描述受測者「掌握了什麼」,正是類別型潛在變項在測驗情境中的應用。
潛在變項的四重分類
要定位混合模型在測量理論中的位置,最清晰的方式是依觀測變項與潛在變項各自的測量層次(連續或類別)交叉分類。此一分類架構源自潛在結構分析的傳統 (Lazarsfeld & Henry, 1968),其現代的應用形貌則見 Hagenaars & McCutcheon (2002),如表 20.1。
| 潛在變項連續 | 潛在變項類別 | |
|---|---|---|
| 觀測變項連續 | 因素分析、SEM | 潛在剖面分析(LPA) |
| 觀測變項類別 | 項目反應理論、潛在特質模型 | 潛在類別分析(LCA) |
註 SEM 為結構方程模型;LPA 為 latent profile analysis;LCA 為 latent class analysis。四類模型共享潛在變項的形式邏輯,差異僅在測量層次的設定。 此表揭示一個重要的統一:因素分析、IRT 與 LCA 並非彼此無關的技術,而是同一潛在變項框架在不同測量層次設定下的展開。四者皆藉由「潛在變項解釋觀測指標之關聯」這一核心機制運作,而其估計、辨識與適配評估的邏輯亦相互呼應。理解這一點,有助於將本章置於前述各章的延續脈絡之中,而非視為孤立的方法;此一四重分類,也正是第三章全書定位圖在測量層次上的一個切面。
潛在類別模型的形式界定
設有 J 個類別型觀測指標,為簡明計以二元指標 Y_j \in \{0,1\} 為例。引入一個具 K 個類別的潛在類別變項 C \in \{1, \dots, K\}。模型由兩組參數界定:類別比例(mixing proportion)\pi_k = P(C = k),滿足 \sum_{k=1}^{K}\pi_k = 1;以及類別條件下的試題反應機率 \rho_{jk} = P(Y_j = 1 \mid C = k)。前者刻畫各潛在類別在母體中的相對大小,後者刻畫各類別成員在每一指標上的作答傾向,即類別的反應輪廓(response profile)。
模型的關鍵假設是類別內的局部獨立性(local independence):在給定潛在類別成員身分後,各觀測指標彼此獨立。此假設與 IRT 中局部獨立性的角色完全平行,其實質意涵是「觀測指標之間的一切關聯,皆由潛在類別所解釋」。
在局部獨立假設下,給定類別 k,一個反應組型 \mathbf{y} = (y_1, \dots, y_J) 的條件機率為各指標機率之積:
潛在類別無法觀測,故須對其邊際化。依全機率公式,觀測到組型 \mathbf{y} 的邊際機率為各類別條件機率以類別比例加權之和:
此式即有限混合模型的一般形式:觀測資料的分布,被表徵為 K 個「局部獨立成分分布」的加權混合。混合權重 \pi_k 即類別比例,成分分布則由 \rho_{jk} 界定。整體對數概似為 \ell = \sum_{i=1}^{N}\log P(\mathbf{Y} = \mathbf{y}_i),其中 \mathbf{y}_i 為第 i 位受測者的反應組型。
值得強調的是,局部獨立性並非可有可無的技術便利,而是模型的實質內容。若在某類別內指標仍殘留關聯(局部相依),通常意味著類別數不足,或存在未納入的結構;此時盲目增加類別數以吸收殘留關聯,將導致類別的過度抽取,此一風險將於本章後段詳論。
潛在剖面分析與有限混合模型的一般框架
當觀測指標為連續量時,類別型潛在變項的對應模型即潛在剖面分析(LPA)。其設定與 LCA 平行,唯成分分布由 Bernoulli 改為(多元)常態:各潛在類別 k 以其平均向量 \boldsymbol{\mu}_k 與共變異數矩陣 \boldsymbol{\Sigma}_k 界定,觀測向量 \mathbf{y} 的邊際密度為常態成分之混合:
其中 \phi(\cdot) 為多元常態密度。此即高斯混合模型(Gaussian mixture model)。更一般地,任何有限混合模型皆可寫為 f(\mathbf{y}) = \sum_k \pi_k f_k(\mathbf{y}; \boldsymbol{\theta}_k),其中 f_k 為第 k 個成分的密度、\boldsymbol{\theta}_k 為其參數 (McLachlan & Peel, 2000)。LCA 與 LPA 僅為此框架下成分分布的兩種特例。Muthén & Shedden (1999) 進一步將此混合結構嵌入含連續潛在變項的模型,奠定了混合模型與 SEM 整合的估計基礎。
LPA 的一個關鍵設定選擇,是共變異數矩陣 \boldsymbol{\Sigma}_k 應設為跨類別相等(class-invariant)抑或各類別自由(class-specific)。前者較節省且穩定,後者較有彈性但參數量大增,且可能引發概似函數的退化:當某一成分的變異數趨近於零(例如成分僅涵蓋單一觀測點),概似可無界地增大,導致偽解。此一奇異性(singularity)問題在允許自由變異數的混合模型中普遍存在,實務上須藉由變異數下界、貝氏先驗或設定約束加以處理。
估計:EM 演算法
混合模型的最大概似估計面臨一個結構性困難:其對數概似
在對數之內含有加總,無法如指數族般得到封閉解。期望最大化(expectation-maximization, EM)演算法 (Dempster et al., 1977) 為此提供了優雅的迭代解法。其核心洞見是:若「類別成員身分」可觀測,估計將變得平凡;故將未觀測的成員身分視為缺失資料,在其期望與參數更新之間交替迭代。
引入類別成員指示 z_{ik},當受測者 i 屬類別 k 時為 1,否則為 0。完全資料(若 z_{ik} 可觀測)的對數概似為
E 步:以當前參數估計,計算每位受測者屬各類別的後驗機率(posterior probability),即以觀測資料對成員身分的期望,此量常稱為責任值(responsibility):
M 步:以 \tau_{ik} 取代 z_{ik},最大化期望完全資料對數概似。類別比例更新為責任值之平均,成分參數則以責任值為權重作加權最大概似估計:
反覆交替 E 步與 M 步。可證每次迭代觀測資料對數概似單調不減,故必收斂,但僅保證收斂至局部極大或鞍點,不保證全域極大。
EM 的單調性雖使其穩健,卻也帶來兩個必須正視的實務問題。第一是局部極大:混合模型的概似曲面常有多個峰,EM 的終點依賴起始值,故標準做法是採用大量隨機起始值,取其中對數概似最高者為解,並檢查最高解是否重複出現,以判斷是否已達全域極大。第二是標籤轉換(label switching):類別的編號本身並無實質意義,將「類別 1」與「類別 2」對調得到的是同一模型,此一非辨識性在最大概似估計中屬良性,但在貝氏 MCMC 估計中會使事後樣本的類別標籤失去一致性,須另行處理。
模型辨識
混合模型的辨識(identification)較連續潛在變項模型更為微妙。一個必要條件是參數量不得超過資料所提供的獨立資訊。以 J 個二元指標的 LCA 為例,觀測資料提供 2^J - 1 個獨立的組型比例,而 K 類別模型須估計 K-1 個類別比例與 KJ 個反應機率,共 K(J+1)-1 個參數。當參數量超過 2^J-1,模型即不可辨識。Goodman (1974) 系統分析了潛在結構模型的可辨識與不可辨識情形,指出參數計數僅為必要而非充分條件:即使參數量足夠,特定的參數配置仍可能導致局部不可辨識,須檢查資訊矩陣是否非奇異。
除此之外,混合模型尚有兩類特殊的辨識議題。其一為前述的標籤轉換,屬良性的非辨識,通常藉由對參數施加次序約束(如令 \pi_1 \ge \pi_2 \ge \cdots)加以解決。其二為空類別或近乎空類別:當某 \hat\pi_k 趨近於零,該類別的成分參數幾乎不受資料約束,其估計將高度不穩,此往往是類別數設定過多的徵兆。辨識問題與類別數決定因而密切交纏,構成混合模型分析中最需審慎之處。
類別數的決定:混合模型的核心難題
在混合模型的應用中,最關鍵且最具爭議的決策,是潛在類別的數目 K。此問題之所以困難,根源於一個深刻的統計事實:用於比較「K 類別」與「K+1 類別」模型的概似比檢定(likelihood ratio test, LRT),其檢定統計量並不服從一般的卡方分配。
考慮虛無假設 H_0:母體為 K 類別混合,對立假設 H_1:母體為 K+1 類別混合。K 類別模型可視為 K+1 類別模型的特例,其達成方式有二:令多出的第 K+1 類別之比例 \pi_{K+1} = 0;或令其中兩類別的成分參數完全相同。前者使真參數落在參數空間的邊界上(\pi_{K+1} = 0 為邊界值),後者則使部分參數在 H_0 下不可辨識。
Wilks 定理保證 -2(\ell_K - \ell_{K+1}) 漸近服從自由度等於參數差的卡方分配,其成立以「真參數位於參數空間內部」及「參數在虛無下可辨識」為前提。上述兩種退化恰好各自違反其一,正則條件(regularity conditions)不成立。因此,逕自將該統計量對照卡方分配所得的 p 值並無理論依據,會系統性地誤導類別數的判定。
既然標準 LRT 失效,實務上須改採其他工具,主要分三類,摘要於表 20.2。第一類為資訊準則(其一般原理見第十二章),以貝氏資訊準則(BIC)= -2\ell + p\log N 最為常用,其對複雜度的懲罰隨樣本數增長,傾向選擇較節省的模型;樣本數調整 BIC(sample-size adjusted BIC, ssBIC)在中小樣本表現尤佳。第二類為以重抽樣或漸近近似修正的概似比檢定:拔靴概似比檢定(bootstrap LRT, BLRT)以蒙地卡羅模擬建構檢定統計量在虛無下的經驗分配,繞過卡方近似的失效;Lo-Mendell-Rubin 檢定 (Lo et al., 2001) 則提供一個解析近似。第三類為分類品質指標,如熵(entropy),衡量類別區辨的清晰程度,但須強調其並非模型適配指標。
| 工具 | 判準 | 性質與限制 |
|---|---|---|
| AIC / BIC / ssBIC | 取最小值 | BIC 偏節省;ssBIC 適中小樣本 |
| BLRT | p<.05 支持 K+1 | 模擬密集但表現最穩健 |
| LMR / VLMR | p<.05 支持 K+1 | 解析近似,較 BLRT 寬鬆 |
| 熵(entropy) | 越接近 1 越好 | 分類清晰度,非適配指標 |
註 AIC、BIC、ssBIC 分別為 Akaike、貝氏、樣本數調整貝氏資訊準則;BLRT 為 bootstrap 概似比檢定;LMR/VLMR 為 (Vuong-)Lo-Mendell-Rubin 檢定。 在系統性的模擬比較中,Nylund et al. (2007) 發現 BIC 與 BLRT 在正確判定類別數上整體表現最佳,AIC 傾向高估類別數,而 LMR 的表現介於其間。然而,沒有任何單一指標可作為機械式的判準。類別數的決定,最終須綜合統計指標、模型的可解釋性、類別的實質意義、以及理論的先驗預期,而非僅憑一個 p 值或資訊準則的最小值。作為另一條思路,貝氏取向(第三十三章)可把「類別數」本身視為待估的對象而非事先固定的常數:透過可變維度的抽樣(如可逆跳躍 MCMC),或藉由過度擬合混合(overfitted mixture)與稀疏化先驗讓多餘成分的比例自動收縮至零,乃至以無限混合(如狄利克雷過程混合)容許成分數隨資料成長,皆可在單一估計程序中對類別數進行推論。這些取向在概念上優雅,惟其結果對先驗設定相當敏感,且計算負擔沉重,實務上仍多與資訊準則等工具並用,而非取而代之。無論採何種取向,類別數決定的審慎立場在下一節與本章結尾的批判性討論中將再度浮現。
分類與後續分析:三步法及其偏誤修正
估計完成後,常見的需求是將受測者分派至類別,並進一步探討類別成員身分與外部變項(共變量或遠端結果)的關係。分派依據為 E 步所得的後驗機率 \tau_{ik},通常採眾數分派(modal assignment),即將受測者歸入後驗機率最高的類別。然而,此分派並非確定無誤:當各類別的後驗機率相近,分類即帶有不確定性。整體分類品質常以熵值指標量化,
其值介於 0 與 1 之間,越接近 1 表示後驗機率越集中、類別區辨越清晰。須再次強調,高熵值僅代表分類明確,不代表類別數正確或模型適配良好。
將類別與外部變項連結時,存在一個常被忽略的偏誤來源。天真的三步法(three-step approach)先估計測量模型(步驟一)、依眾數分派類別(步驟二)、再以分派所得的類別作自變項進行迴歸(步驟三)。此程序的問題在於,步驟三將類別分派視為無誤,忽略了步驟二的分類不確定性,導致類別與外部變項的關聯被系統性地衰減(attenuation)。Vermunt (2010) 提出偏誤校正的三步法,透過將分類誤差機率納入步驟三的加權或概似,還原無偏的關聯估計。此一校正又細分為若干具體做法:其一為以錯分機率矩陣調整的方法(常稱 ML 取向),其二為以個體層次權重校正的 BCH 取向。Bakk & Vermunt (2016) 以模擬系統比較二者,指出在遠端結果的變異數跨類別不等或分布偏離常態時,BCH 取向較 ML 取向更為穩健,而在測量品質高(熵值高)時兩者差異縮小;此結果使 BCH 成為連續遠端結果情形下的常見預設。另一替代為一步法,將共變量直接納入混合模型同時估計,但其風險是共變量可能反過來改變測量模型所界定的類別本身。校正三步法因兼顧無偏與測量穩定,已成為當前的推薦做法。
延伸的模型家族
以類別型潛在變項為核心,可衍生出一個龐大的模型家族,處理縱貫、連續與診斷等多樣結構。潛在轉移分析(latent transition analysis, LTA)為 LCA 的縱貫延伸,容許受測者在不同時點隸屬不同潛在狀態,並以轉移機率矩陣刻畫狀態間的變動 (Collins & Lanza, 2010);其估計須假定測量參數的跨時不變性,與第十九章的不變性檢驗直接相連,亦為第二十九章縱貫建模的離散對應。成長混合模型(growth mixture model, GMM)將第二十九章的成長曲線與潛在類別結合,容許不同潛在類別具有質性相異的發展軌跡,用以刻畫發展路徑的未觀測異質性 (Muthén & Shedden, 1999)。因素混合模型(factor mixture model, FMM)則同時納入連續潛在因素與類別潛在變項,成為連續與類別兩種潛在結構的混合體 (Lubke & Muthén, 2005),適用於構念本身兼具維度性與類型性的情形。
診斷分類模型(diagnostic classification model, DCM),又稱認知診斷模型,將類別潛在變項擴展為多個二元潛在屬性(attribute)的組合,用以判定受測者是否掌握各項細部技能,直接承接第二十一章的認知診斷測驗。其中最基本的 DINA 模型(deterministic input, noisy-and gate)以 Q 矩陣界定各試題所需的屬性,並容許猜測與失誤兩類作答雜訊 (Torre, 2009)。DCM 家族的系統整理見 Rupp et al. (2010)。這些延伸共享同一估計核心,即以 EM 或 MCMC 處理類別潛在變項的邊際化,展現了本章框架的廣泛適用性。
類別是真實的嗎?過度抽取的風險
混合模型最深刻的爭議,不在技術而在詮釋:估計所得的潛在類別,究竟對應母體中真實存在的類型(taxa),抑或僅為對連續異質性的便利近似?此一實在論與工具論之爭,在心理病理學中尤為尖銳。Meehl (1995) 發展的類型計量學(taxometrics),即專為判別某構念在本體上究竟是類別性(categorical)抑或維度性(dimensional)而設計,其方法邏輯與混合模型互補:混合模型假定類別存在並估計之,類型計量學則檢驗類別是否存在。
此處潛藏一個極易犯的推論謬誤:類別型潛在變項的統計適配,並不等同於類別型的心理實在。Bauer & Curran (2003) 以嚴謹的分析證明,當觀測資料的分布為非常態的連續分布時,即使母體並不存在任何真實的次群體,混合模型仍會抽取出多個看似最適的潛在類別。換言之,混合模型可能將單一母體的非常態性,誤判為多類別的異質性。這意味著,僅憑資訊準則或概似比檢定支持多類別解,不足以斷言類別在實質上存在;所謂的「類別」,可能只是模型為逼近非常態分配所動用的數學裝置。
此一警示對實務有直接的方法學意涵。研究者不應將估計所得的類別逕自實在化(reify),而須輔以穩健性與敏感度檢查:檢驗結果對分布假定的敏感程度、在獨立樣本中的可複製性、以及類別是否具有外部效度(即能否為外部變項所預測、能否預測理論上相關的結果)。當類別僅具統計上的可分離性而缺乏外部佐證與理論意義時,較審慎的立場是將其視為描述異質性的啟發式工具,而非本體上的真實類型。這一保留與第三章關於潛在變項本體地位的討論、以及第三十五章網絡取向對潛在變項本體論的相關議題一脈相承。
往診斷走一步:受限 LCA 與診斷模型
本章一再強調,潛在類別分析是一個相對「無結構」的模型:它讓 K 個類別的反應機率 \rho_{jk} 各自自由估計,資料落在哪幾類、每一類長什麼樣,全由資料自己決定。但若研究者對「類別應該長什麼樣」握有明確的理論,便可以把這個理論寫成對 \rho_{jk} 的約束,使 LCA 由探索性轉為驗證性。把約束推到極致,就得到下一章的主角,即診斷分類模型。
以一個最小的例子說明這個轉折。設想一份測驗要診斷兩項技能,即屬性 A 與屬性 B,每位受測者對每一項要嘛掌握、要嘛未掌握。兩個二元屬性的組合,恰好界定了 2^2=4 個潛在類別:兩者皆未掌握、僅掌握 A、僅掌握 B、兩者皆掌握。就形式而言,這正是一個四類別的 LCA。差別在於:一般的 LCA 讓這四類的反應機率完全自由,而診斷模型則以一張 Q 矩陣,事先規定每一道題需要哪些屬性,再據此對各類別的答對機率施加約束;例如一道同時需要 A 與 B 的題目,只有「兩者皆掌握」的那一類才應有高答對機率,其餘三類都應偏低。於是,診斷模型不過是一個以 Q 矩陣約束了反應機率的受限 LCA。
這個受限 LCA 的視角,把本章與下一章接了起來,也揭示了診斷模型的雙重血緣:從 LCA 看,它是加了理論約束的潛在類別分析;從項目反應理論看,它是把連續的潛在能力換成了一組離散的屬性剖面。第二十一章便以此為起點,發展出 DINA、G-DINA 等一整套診斷分類模型,並處理 Q 矩陣的效度、屬性分類的信度等專屬議題。本章所建立的混合模型骨架,即以類別潛在變項邊際化、以 EM 或 MCMC 估計,也將原封不動地在那裡繼續發揮作用。
小結
本章將潛在變項的框架自連續延伸至類別,建立了以有限混合模型為核心的分析取向。自 LCA 的形式界定與局部獨立性,到 LPA 與高斯混合的一般框架、EM 演算法的估計邏輯、辨識條件,以至類別數決定這一核心難題,本章逐步鋪陳了混合模型的技術骨幹;並延伸至 LTA、GMM、FMM 與 DCM 等模型家族,展現其廣泛的適用性。同時,本章亦強調混合模型在詮釋上的審慎:類別的統計可分離性不等於心理實在,過度抽取的風險要求研究者以穩健性檢查與外部效度加以節制。就方法論而言,混合模型與第二十八章的多層次模型可視為處理異質性的兩種互補策略:混合模型以離散的潛在類別刻畫未觀測的異質性,多層次模型則以連續的隨機效果刻畫巢狀結構所生的依賴。兩者的對照,構成理解母體異質性的完整圖像。