潛在類別與混合模型
=1.5em
前面數章所建立的潛在變項模型,包括因素分析、結構方程與項目反應理論,其共同前提是潛在變項為連續量:受測者在某條潛在向度上佔有一個位置,模型的任務是估計該位置並刻畫其與觀測指標的關係。然而,並非所有的潛在結構都適合以連續量刻畫。當母體由若干性質相異的次群體(subpopulation)混合而成,而群體成員身分無法直接觀測時,較自然的表徵是一個類別型潛在變項(categorical latent variable):它不指涉程度的高低,而指涉類型的歸屬。本章處理的模型家族,即以此類別型潛在變項為核心,統稱為有限混合模型(finite mixture model),其在類別觀測指標下的特例即潛在類別分析(latent class analysis, LCA)。
這一取向常被稱為以人為中心(person-centered)的分析,以別於因素分析等以變項為中心(variable-centered)的取向。前者追問「母體中存在哪幾種人」,後者追問「變項之間如何共變」。兩者並非互斥,而是對異質性(heterogeneity)的兩種互補刻畫。此外,本章亦與第二十一章的認知診斷模型相銜接:後者以類別潛在屬性描述受測者「掌握了什麼」,正是類別型潛在變項在測驗情境中的應用。
為使後續的討論有一個具體的落點,本章將反覆回到同一個情境。設想一份針對高中生的網路使用行為量表,包含六道二元計分的題目:是否每日使用超過四小時、是否曾為上網熬夜、是否主要用於線上遊戲、是否主要用於社群互動、是否曾因網路使用與家人衝突、是否曾影響隔天到校。研究者關心的不是誰在「網路成癮程度」上分數較高,而是高中生的網路使用可分成哪幾種型態;這樣的提問,正是本章要處理的問題形式。
潛在變項的四重分類
要定位混合模型在測量理論中的位置,最清晰的方式是依觀測變項與潛在變項各自的測量層次(連續或類別)交叉分類。此一分類架構源自潛在結構分析的傳統 (Lazarsfeld & Henry, 1968),其現代的應用形貌則見 Hagenaars & McCutcheon (2002),如表 20.1。
| 潛在變項連續 | 潛在變項類別 | |
|---|---|---|
| 觀測變項連續 | 因素分析、SEM | 潛在剖面分析(LPA) |
| 觀測變項類別 | 項目反應理論、潛在特質模型 | 潛在類別分析(LCA) |
註 SEM 為結構方程模型;LPA 為 latent profile analysis;LCA 為 latent class analysis。四類模型共享潛在變項的形式邏輯,差異僅在測量層次的設定。 此表揭示一個重要的統一:因素分析、IRT 與 LCA 並非彼此無關的技術,而是同一潛在變項框架在不同測量層次設定下的展開。四者皆藉由「潛在變項解釋觀測指標之關聯」這一核心機制運作,而其估計、辨識與適配評估的邏輯亦相互呼應。理解這一點,有助於將本章置於前述各章的延續脈絡之中,而非視為孤立的方法;此一四重分類,也正是第三章全書定位圖在測量層次上的一個切面。
這個分類容易讓人以為,潛在變項設為連續或類別只是換一格的技術選項。實際上,這個選擇對應著一個實質主張:次群體之間究竟是「質」的不同,還是同一條向度上「量」的分界。兩種主張會導出不同的預測。若真相是一條連續向度被切成幾段,各類別的反應輪廓應形狀相同而只有高低之別;若真相是質的不同,輪廓則會交叉。延續前述的網路使用量表,設想社群取向的一群在「主要用於社群互動」上答是的機率為 0.85,在「主要用於線上遊戲」上僅 0.10;遊戲沉浸的一群恰好相反,分別為 0.12 與 0.90。兩群在「每日超過四小時」上可能同樣偏高,卻不是在同一條線上一前一後,而是朝不同方向展開。輪廓是否交叉,因而是判斷類別究竟為質性類型或連續分界的第一道實質線索。
潛在類別模型的形式界定
上一節確立了混合模型在潛在變項家族中的座標,但座標本身無法拿來估計。這一節要做的,是把「母體由幾種人混合而成」這句話,翻譯成一個可以估計的機率模型。翻譯只需要兩組數字:每一種人在母體中佔多大比例,以及屬於某一種人的受測者在每一道題上答是的機率是多少。前者是類別的大小,後者是類別的長相。把這兩組數字相乘並對所有類別加總,就得到任一反應組型出現的機率,模型的全部內容也就到此為止。讀完這一節,應能回答兩個問題:潛在類別模型究竟在估什麼參數,以及局部獨立這個看似技術性的假設,在此處承擔了什麼實質工作。
設有 J 個類別型觀測指標,為簡明計以二元指標 Y_j \in \{0,1\} 為例。引入一個具 K 個類別的潛在類別變項 C \in \{1, \dots, K\}。模型由兩組參數界定:類別比例(mixing proportion)\pi_k = P(C = k),滿足 \sum_{k=1}^{K}\pi_k = 1;以及類別條件下的試題反應機率 \rho_{jk} = P(Y_j = 1 \mid C = k)。前者刻畫各潛在類別在母體中的相對大小,後者刻畫各類別成員在每一指標上的作答傾向,即類別的反應輪廓(response profile)。
模型的關鍵假設是類別內的局部獨立性(local independence):在給定潛在類別成員身分後,各觀測指標彼此獨立。此假設與 IRT 中局部獨立性的角色完全平行,其實質意涵是「觀測指標之間的一切關聯,皆由潛在類別所解釋」。直覺上可以這樣理解:在全體樣本中,「曾為上網熬夜」與「曾影響隔天到校」兩題必然高度相關,因為兩者都受同一個未觀測的使用型態所驅動;但若只看遊戲沉浸這一類的成員,他們在使用型態上已經同質,這兩題之間便不該再剩下什麼關聯。局部獨立要求的正是這一點:把類別的效果抽掉之後,題目之間的相關應歸於零。若抽掉之後仍有殘留,代表模型尚未把資料中的結構說完。
在局部獨立假設下,給定類別 k,一個反應組型 \mathbf{y} = (y_1, \dots, y_J) 的條件機率為各指標機率之積:
潛在類別無法觀測,故須對其邊際化。依全機率公式,觀測到組型 \mathbf{y} 的邊際機率為各類別條件機率以類別比例加權之和:
此式即有限混合模型的一般形式:觀測資料的分布,被表徵為 K 個「局部獨立成分分布」的加權混合。混合權重 \pi_k 即類別比例,成分分布則由 \rho_{jk} 界定。整體對數概似為 \ell = \sum_{i=1}^{N}\log P(\mathbf{Y} = \mathbf{y}_i),其中 \mathbf{y}_i 為第 i 位受測者的反應組型。
把這個式子用數字讀一次會更清楚。只取其中兩道題,假定遊戲沉浸類佔三成(\pi_1 = 0.30),其成員在「主要用於線上遊戲」與「曾為上網熬夜」上答是的機率分別為 0.90 與 0.70;低度使用類佔七成(\pi_2 = 0.70),對應的機率分別為 0.10 與 0.15。一位兩題皆答是的受測者,其反應在遊戲沉浸類之下出現的機率為 0.90 \times 0.70 = 0.63,在低度使用類之下僅 0.10 \times 0.15 = 0.015;以類別比例加權後,這個組型的邊際機率為 0.30 \times 0.63 + 0.70 \times 0.015 = 0.199。樣本中「兩題皆答是」的比例之所以遠高於兩題各自比例的乘積,原因不在題目本身相依,而在於樣本混合了兩種輪廓截然不同的人。
值得強調的是,局部獨立性並非可有可無的技術便利,而是模型的實質內容。若在某類別內指標仍殘留關聯(局部相依),通常意味著類別數不足,或存在未納入的結構;此時盲目增加類別數以吸收殘留關聯,將導致類別的過度抽取,此一風險將於本章後段詳論。
潛在剖面分析與有限混合模型的一般框架
當觀測指標為連續量時,類別型潛在變項的對應模型即潛在剖面分析(LPA)。其設定與 LCA 平行,唯成分分布由 Bernoulli 改為(多元)常態:各潛在類別 k 以其平均向量 \boldsymbol{\mu}_k 與共變異數矩陣 \boldsymbol{\Sigma}_k 界定,觀測向量 \mathbf{y} 的邊際密度為常態成分之混合:
其中 \phi(\cdot) 為多元常態密度。此即高斯混合模型(Gaussian mixture model)。更一般地,任何有限混合模型皆可寫為 f(\mathbf{y}) = \sum_k \pi_k f_k(\mathbf{y}; \boldsymbol{\theta}_k),其中 f_k 為第 k 個成分的密度、\boldsymbol{\theta}_k 為其參數 (McLachlan & Peel, 2000)。LCA 與 LPA 僅為此框架下成分分布的兩種特例。Muthén & Shedden (1999) 進一步將此混合結構嵌入含連續潛在變項的模型,奠定了混合模型與 SEM 整合的估計基礎。
LPA 的一個關鍵設定選擇,是共變異數矩陣 \boldsymbol{\Sigma}_k 應設為跨類別相等(class-invariant)抑或各類別自由(class-specific)。前者較節省且穩定,後者較有彈性但參數量大增,且可能引發概似函數的退化:當某一成分的變異數趨近於零(例如成分僅涵蓋單一觀測點),概似可無界地增大,導致偽解。此一奇異性(singularity)問題在允許自由變異數的混合模型中普遍存在,實務上須藉由變異數下界、貝氏先驗或設定約束加以處理。
估計:EM 演算法
混合模型的最大概似估計面臨一個結構性困難:其對數概似
在對數之內含有加總,無法如指數族般得到封閉解。期望最大化(expectation-maximization, EM)演算法 (Dempster et al., 1977) 為此提供了優雅的迭代解法。其核心洞見是:若「類別成員身分」可觀測,估計將變得平凡;故將未觀測的成員身分視為缺失資料,在其期望與參數更新之間交替迭代。
引入類別成員指示 z_{ik},當受測者 i 屬類別 k 時為 1,否則為 0。完全資料(若 z_{ik} 可觀測)的對數概似為
E 步:以當前參數估計,計算每位受測者屬各類別的後驗機率(posterior probability),即以觀測資料對成員身分的期望,此量常稱為責任值(responsibility):
M 步:以 \tau_{ik} 取代 z_{ik},最大化期望完全資料對數概似。類別比例更新為責任值之平均,成分參數則以責任值為權重作加權最大概似估計:
反覆交替 E 步與 M 步。可證每次迭代觀測資料對數概似單調不減,故必收斂,但僅保證收斂至局部極大或鞍點,不保證全域極大。
責任值是後續一切分類工作的基礎,值得用數字讀一次。沿用前述兩道題的設定,一位兩題皆答是的受測者,其屬於遊戲沉浸類的責任值為 0.30 \times 0.63 除以 0.199,約等於 0.95,屬於低度使用類者則約為 0.05。M 步的做法,是讓每位受測者以責任值為權重同時參與所有類別的估計:這位受測者在遊戲沉浸類幾乎算作完整的一個人,在低度使用類只算 0.05 個人。這種部分歸屬的加權,正是 EM 與硬性分群的關鍵差異。
EM 的單調性雖使其穩健,卻也帶來兩個必須正視的實務問題。第一是局部極大:混合模型的概似曲面常有多個峰,EM 的終點依賴起始值,故標準做法是採用大量隨機起始值,取其中對數概似最高者為解,並檢查最高解是否重複出現,以判斷是否已達全域極大。第二是標籤轉換(label switching):類別的編號本身並無實質意義,將「類別 1」與「類別 2」對調得到的是同一模型,此一非辨識性在最大概似估計中屬良性,但在貝氏 MCMC 估計中會使事後樣本的類別標籤失去一致性,須另行處理。
模型辨識
混合模型的辨識(identification)較連續潛在變項模型更為微妙。一個必要條件是參數量不得超過資料所提供的獨立資訊。以 J 個二元指標的 LCA 為例,觀測資料提供 2^J - 1 個獨立的組型比例,而 K 類別模型須估計 K-1 個類別比例與 KJ 個反應機率,共 K(J+1)-1 個參數。當參數量超過 2^J-1,模型即不可辨識。Goodman (1974) 系統分析了潛在結構模型的可辨識與不可辨識情形,指出參數計數僅為必要而非充分條件:即使參數量足夠,特定的參數配置仍可能導致局部不可辨識,須檢查資訊矩陣是否非奇異。
除此之外,混合模型尚有兩類特殊的辨識議題。其一為前述的標籤轉換,屬良性的非辨識,通常藉由對參數施加次序約束(如令 \pi_1 \ge \pi_2 \ge \cdots)加以解決。其二為空類別或近乎空類別:當某 \hat\pi_k 趨近於零,該類別的成分參數幾乎不受資料約束,其估計將高度不穩,此往往是類別數設定過多的徵兆。辨識問題與類別數決定因而密切交纏,構成混合模型分析中最需審慎之處。
類別數的決定:混合模型的核心難題
在混合模型的應用中,最關鍵且最具爭議的決策,是潛在類別的數目 K。此問題之所以困難,根源於一個深刻的統計事實:用於比較「K 類別」與「K+1 類別」模型的概似比檢定(likelihood ratio test, LRT),其檢定統計量並不服從一般的卡方分配。
考慮虛無假設 H_0:母體為 K 類別混合,對立假設 H_1:母體為 K+1 類別混合。K 類別模型可視為 K+1 類別模型的特例,其達成方式有二:令多出的第 K+1 類別之比例 \pi_{K+1} = 0;或令其中兩類別的成分參數完全相同。前者使真參數落在參數空間的邊界上(\pi_{K+1} = 0 為邊界值),後者則使部分參數在 H_0 下不可辨識。
Wilks 定理保證 -2(\ell_K - \ell_{K+1}) 漸近服從自由度等於參數差的卡方分配,其成立以「真參數位於參數空間內部」及「參數在虛無下可辨識」為前提。上述兩種退化恰好各自違反其一,正則條件(regularity conditions)不成立。因此,逕自將該統計量對照卡方分配所得的 p 值並無理論依據,會系統性地誤導類別數的判定。
既然標準 LRT 失效,實務上須改採其他工具,主要分三類,摘要於表 20.2。第一類為資訊準則(其一般原理見第十二章),以貝氏資訊準則(BIC)= -2\ell + p\log N 最為常用,其對複雜度的懲罰隨樣本數增長,傾向選擇較節省的模型;樣本數調整 BIC(sample-size adjusted BIC, ssBIC)在中小樣本表現尤佳。第二類為以重抽樣或漸近近似修正的概似比檢定:拔靴概似比檢定(bootstrap LRT, BLRT)以蒙地卡羅模擬建構檢定統計量在虛無下的經驗分配,繞過卡方近似的失效;Lo-Mendell-Rubin 檢定 (Lo et al., 2001) 則提供一個解析近似。第三類為分類品質指標,如熵(entropy),衡量類別區辨的清晰程度,但須強調其並非模型適配指標。
| 工具 | 判準 | 性質與限制 |
|---|---|---|
| AIC / BIC / ssBIC | 取最小值 | BIC 偏節省;ssBIC 適中小樣本 |
| BLRT | p<.05 支持 K+1 | 模擬密集但表現最穩健 |
| LMR / VLMR | p<.05 支持 K+1 | 解析近似,較 BLRT 寬鬆 |
| 熵(entropy) | 越接近 1 越好 | 分類清晰度,非適配指標 |
註 AIC、BIC、ssBIC 分別為 Akaike、貝氏、樣本數調整貝氏資訊準則;BLRT 為 bootstrap 概似比檢定;LMR/VLMR 為 (Vuong-)Lo-Mendell-Rubin 檢定。 在系統性的模擬比較中,Nylund et al. (2007) 發現 BIC 與 BLRT 在正確判定類別數上整體表現最佳,AIC 傾向高估類別數,而 LMR 的表現介於其間。然而,沒有任何單一指標可作為機械式的判準。類別數的決定,最終須綜合統計指標、模型的可解釋性、類別的實質意義、以及理論的先驗預期,而非僅憑一個 p 值或資訊準則的最小值。作為另一條思路,貝氏取向(第三十三章)可把「類別數」本身視為待估的對象而非事先固定的常數:透過可變維度的抽樣(如可逆跳躍 MCMC),或藉由過度擬合混合(overfitted mixture)與稀疏化先驗讓多餘成分的比例自動收縮至零,乃至以無限混合(如狄利克雷過程混合)容許成分數隨資料成長,皆可在單一估計程序中對類別數進行推論。這些取向在概念上優雅,惟其結果對先驗設定相當敏感,且計算負擔沉重,實務上仍多與資訊準則等工具並用,而非取而代之。
撇開估計取向的差異不談,前述三類工具之所以常給出不同的答案,是因為它們回答的本來就是三個不同的問題,混淆它們是誤讀結果最常見的原因。資訊準則問的是「在懲罰複雜度之後,哪一個模型與資料最契合」;BIC 的懲罰項 p\log N 隨樣本數增大而變重,故在大樣本中傾向選出較少的類別,它衡量整體適配,與類別分得清不清楚無關。BLRT 問的是「多加一個類別帶來的概似提升,是否大到不像抽樣誤差所能造成」,其做法是以模擬在虛無模型下重複產生資料,得到統計量的經驗分配,再看實際觀察值落在何處。熵值問的則是「模型替每一個人歸類時有多少把握」,它只看後驗機率是否集中,完全不看模型是否適配資料。
把三者放在一起,就能看出它們為何常不一致。設想以前述的網路使用量表依序估計一至五個類別,BIC 隨 K 遞增依序為 12,480、12,140、12,032、12,038 與 12,061,最小值落在三類別;ssBIC 因懲罰較輕,最小值落在四類別;BLRT 在三對四的比較中 p = .008,在四對五的比較中 p = .21,因而支持四類;熵值則由三類別的 0.82 略降為四類別的 0.79。這樣的分歧並不罕見,也不代表分析出錯,因為這幾個數字本來就在回答不同的問題。此時該做的不是挑一個支持既有偏好的指標,而是檢視兩個候選解的實質差別:多出來的第四類是否只涵蓋 3% 的樣本、其輪廓是否只是第三類的稍高版本、在另一半樣本中能否重現。若第四類具有前面所說的交叉特徵,並能被外部變項所預測,多抽一類才有實質意義。無論採取哪一種取向,類別數決定的審慎立場,都將在下一節與本章結尾的批判性討論中再度浮現。
分類與後續分析:三步法及其偏誤修正
估計完成後,常見的需求是將受測者分派至類別,並進一步探討類別成員身分與外部變項(共變量或遠端結果)的關係。分派依據為 E 步所得的後驗機率 \tau_{ik},通常採眾數分派(modal assignment),即將受測者歸入後驗機率最高的類別。然而,此分派並非確定無誤:當各類別的後驗機率相近,分類即帶有不確定性。整體分類品質常以熵值指標量化,
其值介於 0 與 1 之間,越接近 1 表示後驗機率越集中、類別區辨越清晰。須再次強調,高熵值僅代表分類明確,不代表類別數正確或模型適配良好。
以數字說明分類為何帶有不確定性。設想三類別解之下,某位受測者的後驗機率為 0.62、0.33 與 0.05,眾數分派會把他歸入第一類,並在後續分析中當作百分之百的第一類成員;但模型其實只有六成二的把握,另有三成三的可能他屬於第二類。另一位受測者的後驗機率為 0.97、0.02 與 0.01,同樣歸入第一類,兩人在資料檔中卻長得一模一樣。熵值所測量的正是這種把握程度在全體樣本上的平均:後驗機率人人集中於單一類別時 E_K 趨近於 1,人人如擲骰子般均分於 K 類時則趨近於 0。實務上多以 0.80 作為可接受的參考線,但這條線只說明模型自認分得清楚;一個抽了過多類別的模型,只要各類輪廓被推得夠極端,熵值照樣可以很高。
將類別與外部變項連結時,存在一個常被忽略的偏誤來源。天真的三步法(three-step approach)先估計測量模型(步驟一)、依眾數分派類別(步驟二)、再以分派所得的類別作自變項進行迴歸(步驟三)。此程序的問題在於,步驟三將類別分派視為無誤,忽略了步驟二的分類不確定性,導致類別與外部變項的關聯被系統性地衰減(attenuation)。Vermunt (2010) 提出偏誤校正的三步法,透過將分類誤差機率納入步驟三的加權或概似,還原無偏的關聯估計。此一校正又細分為若干具體做法:其一為以錯分機率矩陣調整的方法(常稱 ML 取向),其二為以個體層次權重校正的 BCH 取向。Bakk & Vermunt (2016) 以模擬系統比較二者,指出在遠端結果的變異數跨類別不等或分布偏離常態時,BCH 取向較 ML 取向更為穩健,而在測量品質高(熵值高)時兩者差異縮小;此結果使 BCH 成為連續遠端結果情形下的常見預設。另一替代為一步法,將共變量直接納入混合模型同時估計,但其風險是共變量可能反過來改變測量模型所界定的類別本身。校正三步法因兼顧無偏與測量穩定,已成為當前的推薦做法。
衰減的幅度值得具體感受。設想第一類與第二類在某份憂鬱量表上的真實平均差為 0.50 個標準差,而分類的正確率約為八成五:被誤歸入第一類的第二類成員會把第一類的平均往上拉,反之亦然,兩類的觀察差距因而縮到 0.35 個標準差左右。研究者若照單全收,等於把帶有誤差的分類當成無誤的自變項,低估了關聯。校正的三步法所還原的正是這一段被錯分吃掉的差距:它不重新分類,而是承認分類會錯,並把錯分機率當作已知的測量誤差寫進第三步的估計。至於為何不乾脆採一步法,理由在於測量的穩定:一步法讓共變量參與類別的形成,換一組共變量就可能得到一組不同的類別,測量模型因而失去獨立於後續假設的地位。
延伸的模型家族
以類別型潛在變項為核心,可衍生出一個龐大的模型家族,處理縱貫、連續與診斷等多樣結構。潛在轉移分析(latent transition analysis, LTA)為 LCA 的縱貫延伸,容許受測者在不同時點隸屬不同潛在狀態,並以轉移機率矩陣刻畫狀態間的變動 (Collins & Lanza, 2010);其估計須假定測量參數的跨時不變性,與第十九章的不變性檢驗直接相連,亦為第二十九章縱貫建模的離散對應。成長混合模型(growth mixture model, GMM)將第二十九章的成長曲線與潛在類別結合,容許不同潛在類別具有質性相異的發展軌跡,用以刻畫發展路徑的未觀測異質性 (Muthén & Shedden, 1999)。因素混合模型(factor mixture model, FMM)則同時納入連續潛在因素與類別潛在變項,成為連續與類別兩種潛在結構的混合體 (Lubke & Muthén, 2005),適用於構念本身兼具維度性與類型性的情形。
診斷分類模型(diagnostic classification model, DCM),又稱認知診斷模型,將類別潛在變項擴展為多個二元潛在屬性(attribute)的組合,用以判定受測者是否掌握各項細部技能,直接承接第二十一章的認知診斷測驗。其中最基本的 DINA 模型(deterministic input, noisy-and gate)以 Q 矩陣界定各試題所需的屬性,並容許猜測與失誤兩類作答雜訊 (Torre, 2009)。DCM 家族的系統整理見 Rupp et al. (2010)。這些延伸共享同一估計核心,即以 EM 或 MCMC 處理類別潛在變項的邊際化,展現了本章框架的廣泛適用性。
類別是真實的嗎?過度抽取的風險
混合模型最深刻的爭議,不在技術而在詮釋:估計所得的潛在類別,究竟對應母體中真實存在的類型(taxa),抑或僅為對連續異質性的便利近似?此一實在論與工具論之爭,在心理病理學中尤為尖銳。Meehl (1995) 發展的類型計量學(taxometrics),即專為判別某構念在本體上究竟是類別性(categorical)抑或維度性(dimensional)而設計,其方法邏輯與混合模型互補:混合模型假定類別存在並估計之,類型計量學則檢驗類別是否存在。
此處潛藏一個極易犯的推論謬誤:類別型潛在變項的統計適配,並不等同於類別型的心理實在。Bauer & Curran (2003) 以嚴謹的分析證明,當觀測資料的分布為非常態的連續分布時,即使母體並不存在任何真實的次群體,混合模型仍會抽取出多個看似最適的潛在類別。換言之,混合模型可能將單一母體的非常態性,誤判為多類別的異質性。這意味著,僅憑資訊準則或概似比檢定支持多類別解,不足以斷言類別在實質上存在;所謂的「類別」,可能只是模型為逼近非常態分配所動用的數學裝置。
這個結果的直覺並不難掌握。設想一個母體在「每週上網時數」上只有單一而右偏的分布:多數人集中在每週十小時上下,少數人拖出一條長尾到六十小時以上。這條偏態曲線並非常態,單一常態成分怎麼配都配不好;但兩個常態疊起來就配得相當好,一個窄而高負責主體,一個寬而扁負責長尾。模型於是報告兩類別解顯著優於單類別解,BIC 也支持兩類,然而母體裡其實只有一條連續的偏態分布。這也說明了為什麼在指標明顯偏態或具天花板效應時,混合模型特別容易抽出「一大群正常、一小群極端」的兩類解:那個小類別可能只是分布的尾巴。
此一警示對實務有直接的方法學意涵。研究者不應將估計所得的類別逕自實在化(reify),而須輔以穩健性與敏感度檢查:檢驗結果對分布假定的敏感程度、在獨立樣本中的可複製性、以及類別是否具有外部效度(即能否為外部變項所預測、能否預測理論上相關的結果)。當類別僅具統計上的可分離性而缺乏外部佐證與理論意義時,較審慎的立場是將其視為描述異質性的啟發式工具,而非本體上的真實類型。這一保留與第三章關於潛在變項本體地位的討論、以及第三十五章網絡取向對潛在變項本體論的相關議題一脈相承。
往診斷走一步:受限 LCA 與診斷模型
本章一再強調,潛在類別分析是一個相對「無結構」的模型:它讓 K 個類別的反應機率 \rho_{jk} 各自自由估計,資料落在哪幾類、每一類長什麼樣,全由資料自己決定。但若研究者對「類別應該長什麼樣」握有明確的理論,便可以把這個理論寫成對 \rho_{jk} 的約束,使 LCA 由探索性轉為驗證性。把約束推到極致,就得到下一章的主角,即診斷分類模型。這個對比與探索性因素分析和驗證性因素分析之間的關係完全平行:探索性的版本問「資料呈現出什麼結構」,驗證性的版本問「資料是否符合預先設定的結構」。前面幾節之所以要花那麼大的力氣處理類別數的決定,有一部分原因正在於這種無結構;一旦理論能夠提供約束,類別的數目與意義往往是被規定的,而非被搜尋的。
以一個最小的例子說明這個轉折。設想一份測驗要診斷兩項技能,即屬性 A 與屬性 B,每位受測者對每一項要嘛掌握、要嘛未掌握。兩個二元屬性的組合,恰好界定了 2^2=4 個潛在類別:兩者皆未掌握、僅掌握 A、僅掌握 B、兩者皆掌握。就形式而言,這正是一個四類別的 LCA。差別在於:一般的 LCA 讓這四類的反應機率完全自由,而診斷模型則以一張 Q 矩陣,事先規定每一道題需要哪些屬性,再據此對各類別的答對機率施加約束;例如一道同時需要 A 與 B 的題目,只有「兩者皆掌握」的那一類才應有高答對機率,其餘三類都應偏低。於是,診斷模型不過是一個以 Q 矩陣約束了反應機率的受限 LCA。
這個受限 LCA 的視角,把本章與下一章接了起來,也揭示了診斷模型的雙重血緣:從 LCA 看,它是加了理論約束的潛在類別分析;從項目反應理論看,它是把連續的潛在能力換成了一組離散的屬性剖面。第二十一章便以此為起點,發展出 DINA、G-DINA 等一整套診斷分類模型,並處理 Q 矩陣的效度、屬性分類的信度等專屬議題。本章所建立的混合模型骨架,即以類別潛在變項邊際化、以 EM 或 MCMC 估計,也將原封不動地在那裡繼續發揮作用。
小結
本章將潛在變項的框架自連續延伸至類別,建立了以有限混合模型為核心的分析取向。自 LCA 的形式界定與局部獨立性,到 LPA 與高斯混合的一般框架、EM 演算法的估計邏輯、辨識條件,以至類別數決定這一核心難題,本章逐步鋪陳了混合模型的技術骨幹;並延伸至 LTA、GMM、FMM 與 DCM 等模型家族,展現其廣泛的適用性。同時,本章亦強調混合模型在詮釋上的審慎:類別的統計可分離性不等於心理實在,過度抽取的風險要求研究者以穩健性檢查與外部效度加以節制。就方法論而言,混合模型與第二十八章的多層次模型可視為處理異質性的兩種互補策略:混合模型以離散的潛在類別刻畫未觀測的異質性,多層次模型則以連續的隨機效果刻畫巢狀結構所生的依賴。兩者的對照,構成理解母體異質性的完整圖像。