估計、模型適配與模型選擇
在第十一章配好了一個迴歸模型,麻煩其實才剛開始。每一個建模者心裡都盤旋著三個問題:模型的參數該如何估計?估出之後,如何知道它配得好不好?當手上有好幾個候選模型時,又該選哪一個?這三個問題,也就是估計、適配、選擇,會在本書其後每一個建模章節裡反覆出現:因素分析要問、結構方程模型要問、項目反應理論要問、多層次模型也要問。與其在每一章重新推導一遍,本章索性把這套共通的工具箱一次建好;此後的章節只須說一句「以最大概似估計、用 BIC 比較」,便能直接往下走,因為背後的原理都在這一章。為求具體,討論多以第十一章的迴歸為例,但須強調的是,這些原理是通用的。
本章一以貫之的立場,將在末節明白揭示:適配統計與資訊準則都是工具,而非判決。它們告訴研究者「資料怎麼說」,卻無法代替研究者回答「該相信哪個模型」,因為後者終究是一個需要實質知識的科學判斷。
估計法系譜:最大概似作為通用引擎
第九章的普通最小平方,其實只是一個更普遍原理的特例。這個更普遍的引擎,是第八章介紹過的最大概似(maximum likelihood, ML)。它的邏輯很單純:在所有可能的參數值裡,挑出那個「讓已觀察到的資料發生機率最大」的。饒富意味的是,在「誤差常態」的假設下,迴歸的最大概似估計恰好等於最小平方,兩條看似不同的路通到了同一個答案。但 ML 的適用範圍遠比最小平方廣:logistic 迴歸、因素分析、IRT、多層次模型,它們的參數幾乎都是靠最大化某個概似函數估出來的。
設資料 \mathbf{x} 來自參數為 \boldsymbol{\theta} 的模型,對數概似函數為 \ell(\boldsymbol{\theta}) = \ln L(\boldsymbol{\theta})。最大概似估計 \hat{\boldsymbol{\theta}} 由「分數方程」(score equation)決定:
在正則條件下,MLE 具有三個漸近性質:一致性(consistency,樣本愈大,\hat{\boldsymbol{\theta}} 愈接近真值)、漸近常態性,以及漸近有效性(在不偏估計中變異最小)。其抽樣分配近似為
其中 \mathbf{I}(\boldsymbol{\theta}) 為 Fisher 訊息量。這個結果極為實用:它指出,參數的標準誤可以直接由「對數概似在最大值附近彎得多陡」(即 Hessian 或訊息量的逆)算出。彎得愈陡,訊息愈多,估計愈精確。第八章訊息量與精度的關係,在這裡得到了一般化。
由最大概似,可自然導出三種彼此相關的檢定,構成整個推論的骨幹。概似比檢定比較受限與未受限模型的概似高度;Wald 檢定以估計值偏離虛無值的距離、除以標準誤來判定;分數檢定則檢視在虛無值處概似的斜率是否為零。三者在大樣本下漸近等價,卻各有便利之處:Wald 只須配一次模型,概似比須配兩次卻通常較穩健,分數檢定則只須配受限模型。至於估計如何在電腦中求得,由於分數方程多半無封閉解,實務上以牛頓-拉福森(Newton-Raphson)或 Fisher 計分等迭代法逐步逼近,每一步都用到概似的一階與二階導數,這也說明了何以 Fisher 訊息量既是精度的度量、又是估計演算法的核心。此外,標準誤可由觀察訊息(在估計值處的 Hessian)或期望訊息(其期望值)計算,兩者在模型設定正確時漸近相等,設定有誤時則可能分歧。
歷史上,最大概似是 Fisher 於一九二○年代奠定的統計基石 (Fisher, 1925)。它之所以成為現代統計建模的通用語言,正因上述的漸近性質:只要模型設定正確、樣本夠大,ML 幾乎總是給出「最好」的估計,並附帶一套現成的標準誤與檢定。
當分布假設不成立:穩健與加權估計
ML 的美好,建立在「所假設的分布是對的」這個前提之上。可是真實資料常常不聽話:連續變項嚴重偏態、峰態過高,或根本是次序類別,如李克特量表的五點評定。此時直接套用假設常態的 ML,點估計或許還堪用,但標準誤與適配統計量會失真,使推論不可信。統計學為此發展出一整排替代的估計器,形成一份「看資料型態點菜」的選單。
穩健最大概似(robust ML,在部分軟體中記為 MLR)是最常用的一種。它的點估計與一般 ML 相同,但以「三明治」式的公式,對標準誤與適配統計量做非常態校正 (Satorra & Bentler, 1994)。也就是說,它不改變所估到的值,只把「這個估計有多不確定」算得更誠實。當結果變項是次序類別時,連 MLR 都不夠,因為把「非常不同意」到「非常同意」硬當成等距的連續分數,本身就是錯的;此時的主流做法,是對次序指標改用加權最小平方的穩健變體(常記為 WLSMV):它先估出各題背後的「閾值」與變項間的多分相關(polychoric correlation),再據此估計模型。這是第十五章處理次序型驗證性因素分析的標準估計器。此外尚有無加權最小平方與廣義最小平方等成員,各自對「殘差矩陣如何加權」做了不同的取捨;而當任何解析標準誤都難以信任時,還可訴諸拔靴法(bootstrap),以重抽樣直接逼近抽樣分配。
把這些整理成一句實用的口訣:連續又大致常態,用 ML;連續但不常態,用 MLR;次序類別,用 WLSMV。其後的建模章節,會反覆指回這份選單。至於「資料有缺失時該如何估」這個同樣關鍵的問題,完全訊息最大概似(full information maximum likelihood, FIML)在資料為隨機缺失時,能用上每一筆可得的資訊、給出不偏估計,則留待下一章專門處理,這裡先記住它也是這份估計選單的一員。
適配:模型和資料合不合
估好了參數,下一個問題是:這個模型究竟配得好不好?適配(goodness-of-fit)的一般精神很簡單:比較「模型所隱含的樣子」與「資料實際呈現的樣子」,兩者差距愈小,適配愈好。在迴歸裡,這個差距體現於殘差;在結構方程模型裡,則體現於「模型隱含的共變數矩陣」與「樣本共變數矩陣」之間的差距(第十五、十六章)。
對共變數結構模型(如 SEM),有一個古典的整體適配檢定,即卡方檢定(chi-square test)。它的虛無假設是「模型完美適配母體」;若卡方值夠大、p 值夠小,便拒絕這個假設,宣告模型不合。聽來合理,卻有一個惡名昭彰的問題,即對樣本數過度敏感。樣本一大,即使模型只有微不足道的偏差,卡方檢定也幾乎必然顯著、必然拒絕。換言之,在大樣本下幾乎沒有模型能通過卡方檢定,而這恰與「所有模型都是簡化、都是錯的,只有有用沒用之別」的統計現實相牴觸。
正是這個困境,催生了一整套「近似適配指標」(approximate fit indices)。這些指標大致可分為三類:絕對適配指標直接衡量模型偏離資料的程度,如 SRMR 與 RMSEA;增值適配指標則以模型相對於一個「最差的基線模型」改善了多少來衡量,如 CFI 與 TLI;簡約適配指標則在適配之外,額外獎勵較簡約的模型。它們不再問「模型是不是完美」,而問「模型偏離完美的程度,是否小到可以接受」。這些指標的具體定義、慣用門檻與各自的侷限,是第十五章的主題;此處要把握的是背後的一般邏輯:整體適配檢定回答「合不合」,近似適配指標回答「差多少」,而後者之所以被發明,正因前者在大樣本下幾乎失去了鑑別力。
巢狀模型比較:概似比檢定
許多時候,問題不是「這個模型好不好」,而是「加了這幾個參數,值不值得」。例如:在迴歸裡多放一個交互作用項,有沒有顯著改善?在因素模型裡多設一條路徑,有沒有幫助?當兩個模型是「巢狀」的,也就是其中一個(受限模型)是另一個(完整模型)的特例、可透過「固定某些參數」得到,便能以概似比檢定來比較,如下面的方塊所示。
設有兩個巢狀模型:完整模型 M_1(參數較多),與受限模型 M_0(將 M_1 的某些參數固定,故為其特例)。令兩者最大化後的對數概似分別為 \ell_1 與 \ell_0。概似比檢定統計量為
此量常稱為兩者「離差」(deviance)之差。在虛無假設「受限模型為真(被固定的參數確實為 0)」之下,\mathrm{LR} 漸近服從自由度為 \Delta df(兩模型參數個數之差)的卡方分配:
若 \mathrm{LR} 夠大、超過臨界值,便拒絕受限模型,判定那些額外參數確實帶來了顯著改善。
概似比檢定是巢狀模型比較的黃金標準,也是第十五、十九章比較不同設定(例如測量不變性的各個層級)的核心工具。但它有兩個限制。其一,它只適用於巢狀模型:兩個彼此不能靠「固定參數」互相化約的模型,例如兩個不同的三因素結構,它便無能為力,此時須改用如 Vuong 檢定等非巢狀比較法,或轉而依賴下一節的資訊準則。其二,它與卡方適配檢定一樣,在大樣本下容易「顯著」:再瑣碎的改善,只要樣本夠大都會被判定為顯著。還須補充一個實務要點:當估計採用 MLR 等穩健方法時,兩個模型的卡方不能直接相減,而須使用如 Satorra-Bentler 的尺度校正卡方差 (Satorra & Bentler, 1994),否則所得的差值檢定並不服從卡方分配。
資訊準則:在適配與簡約之間權衡
概似比檢定的限制,指向同一個更深的問題:模型愈複雜,配樣本一定愈好。多加一個參數,殘差平方和一定下降、概似一定上升,哪怕那個參數只是在配雜訊。這就是過度配適(overfitting):一個把訓練樣本裡每個小起伏都學起來的模型,換到新資料上往往慘敗。因此「配得好」不能只看樣本內的適配,還必須替複雜度付出代價。資訊準則(information criteria)正是這個「適配減去複雜度懲罰」的分數。最著名的兩個是 AIC 與 BIC,它們的形式很像,卻源自兩套完全不同的哲學,如下面的方塊與表 12.1 所示。
兩個準則都寫成「負二倍對數概似,加上一個複雜度懲罰」的形式。令 \ell 為最大化對數概似、k 為參數個數、n 為樣本數:
兩者的數值都是愈小愈好。它們的差別全在懲罰項,而這個差別來自兩套不同的目標。Akaike (1974) 的 AIC,源自最小化模型與真實分布之間的 Kullback-Leibler 散度;它估計的是「這個模型在新資料上的預測表現」,目標是預測,其 2k 懲罰不隨樣本數改變。Schwarz (1978) 的 BIC,則源自對「模型的邊際概似」做 Laplace 近似;它近似的是「在候選集合裡,這個模型為真的後驗機率」,目標是辨識真模型。BIC 的懲罰 k\ln(n) 隨樣本數成長:只要 n \ge 8,就有 \ln(n) > 2,此時 BIC 的懲罰比 AIC 重,因而 BIC 總是偏好比 AIC 更簡約的模型。
| AIC | BIC | |
|---|---|---|
| 複雜度懲罰 | 2k | k\ln(n) |
| 理論來源 | KL 散度(預測導向) | 邊際概似(貝氏導向) |
| 主要目標 | 最佳化預測 | 辨識真模型 |
| 大樣本性質 | 漸近有效 | 一致 |
| 模型偏好 | 傾向較複雜模型 | 傾向較簡約模型 |
資訊準則有兩個概似比檢定所沒有的優點。第一,它們能比較「非巢狀」模型:只要用同一批資料、同一個概似框架,兩個八竿子打不著的模型也能比 AIC、比 BIC。第二,它們天生就把「簡約」納入考量,不會因為樣本大就一味偏好複雜模型。Burnham & Anderson (2002) 更把這個想法推廣為「多模型推論」(multimodel inference):與其硬選一個「贏家」,不如根據各模型的 AIC,算出它們的「Akaike 權重」,再對多個模型做加權平均,坦然承認我們對「哪個模型才對」本就有不確定性。此外,這兩個經典準則也各有校正版本值得一提:在小樣本或參數相對眾多時,宜改用對 AIC 的修正 AICc;而 BIC 亦有一個把有效樣本數納入考量的調整版本,在多層次與混合模型中尤為常用。
那到底該用 AIC 還是 BIC?沒有標準答案,取決於研究目標。Vrieze (2012) 對此有清楚的整理:BIC 具有一致性,也就是當真模型確實在候選集合中時,樣本夠大便會選中它;AIC 則不具一致性,但當真模型不在候選集合中時,AIC 具有效率,能漸近地選出預測誤差最小的模型。由於「真模型是否在候選集合中」在心理學裡幾乎永遠無法確知,兩者孰優其實取決於研究者對這一前提的信念。實務上兩個一起報、看它們是否指向同一個模型,往往是最穩健的做法。
交叉驗證:直接檢驗「換到新資料還準不準」
資訊準則是以「懲罰複雜度」的方式,間接估計模型的外部表現。還有一條更直接的路,就是交叉驗證(cross-validation, CV)。它的想法直白到近乎粗暴:既然我們真正在乎的是「模型在沒看過的資料上表現如何」,那就乾脆把資料切成兩塊,一塊拿來配模型(訓練集),另一塊藏起來、模型從沒見過(測試集),再看模型在測試集上預測得準不準。
最常用的是 k 折交叉驗證(k-fold CV):把資料隨機切成 k 份,每次留一份當測試集、用其餘 k-1 份訓練,輪流 k 次,再把 k 次的預測誤差平均。當 k 等於樣本數時,就是留一交叉驗證(leave-one-out)。CV 的好處是,它幾乎不依賴分布假設,直接以「實際的外部預測誤差」說話。在心理計量學中,這一想法早在 Cudeck & Browne (1983) 便被引入共變數結構模型:把樣本一分為二,以一半估出的模型去預測另一半的共變數矩陣,據以評估模型是否過度配適於單一樣本的特異之處。
交叉驗證與資訊準則其實是親戚。Stone (1974) 證明,在一定條件下,留一交叉驗證與 AIC 漸近等價,兩者都在估計同一件事,即模型的樣本外預測表現。這也解釋了何以它們常給出相近的結論。使用 CV 時還有兩個實務要點:其一,當同時要「調參數」又要「評估表現」時,須採用巢狀交叉驗證,把調參與評估分置於不同的資料切割,否則會低估誤差;其二,在挑選模型複雜度時,常採用「一個標準誤法則」,也就是在誤差最小的模型的一個標準誤範圍內,選最簡約者,以避免過度配適於驗證集的雜訊。CV 之所以在近年特別重要,是因為它是機器學習(第三十四章)評估模型的預設工具:當模型複雜到算不出乾淨的參數個數 k、或分布假設根本不成立時,資訊準則失靈,而 CV 只要能「訓練、再預測」就能用。代價是計算量大,須反覆配模型許多次。實務上,資訊準則與交叉驗證常互補使用:前者快、有理論支撐但依賴假設,後者慢、假設少但直接。
交叉驗證的精神,還有一個尺度更大的近親值得一提。交叉驗證在單一資料集之內,以「在一部分資料上估計、在另一部分上檢驗」來評估泛化能力;而後設分析(第三十二章)則把同樣的邏輯提升到研究的層次,檢驗一項發現能否跨越不同樣本、不同實驗室、不同情境而重現。就此而言,兩者都是在問同一個問題,即「這個結果能不能推廣到手上這批資料之外」,差別僅在於交叉驗證的「樣本外」是被藏起來的那幾折資料,後設分析的「樣本外」則是其他獨立研究。把交叉驗證與後設分析並置,有助於看清一件事:對抗過度配適與追求可重複,本質上是同一種科學紀律在微觀與宏觀兩個尺度上的展現。
重抽樣推論的整併
前面數節多次提到,當解析的標準誤難以取得、或其所依賴的分布假設不可信時,可以訴諸重抽樣。這類方法在全書各處零星出現,值得在此集中整理,確立其共通的邏輯與適用界限。
最核心的是拔靴法(bootstrap),由 Efron (1979) 提出。它的構想大膽而簡潔:既然母體的真實分布未知,就把手上的樣本本身當成母體的最佳代理,從中以放回方式反覆抽取許多個「拔靴樣本」,每個大小與原樣本相同,再對每個拔靴樣本重算一次所關心的統計量。這些重算值的分布,便直接逼近了該統計量的抽樣分配,其標準差即標準誤的估計,其分位數則可用以構造信賴區間。拔靴法的威力,在於它幾乎不依賴分布假設,也不要求統計量具有封閉的變異公式,因此對中介效果、間接效果、信度係數這類抽樣分配複雜或偏態的量特別有用。
由拔靴分布構造信賴區間,有幾種漸次精緻的做法。最簡單的百分位法,直接取拔靴分布的第 2.5 與 97.5 百分位為區間端點;它直觀,卻在統計量帶有偏誤或分布偏態時覆蓋率不佳。偏誤校正加速法(bias-corrected and accelerated, BCa)則對偏誤與偏態各引入一個校正因子,在較一般的條件下達到較準確的覆蓋,是目前較受推薦的做法之一 (Efron & Tibshirani, 1993)。此外尚有基本法與學生化法等變體,各自在計算成本與精確度之間取捨。
然而拔靴法並非萬能,其失效情境同樣須銘記。當統計量取決於分布的極端,例如樣本的最大值或最小值時,拔靴法會系統性地失準,因為重抽樣無法產生比原樣本更極端的值。當樣本極小時,可供重抽的資訊本就貧乏,拔靴分布會過度離散。當資料具有相依結構,例如時間序列或巢狀資料時,簡單的逐一放回抽樣會破壞相依,須改用區塊拔靴或其他保留結構的變體。而當參數落在容許範圍的邊界上,例如變異成分為零時,拔靴法的漸近理據亦不再成立。這些界限提醒,重抽樣雖然免去了分布假設,卻並未免去「樣本必須能代表母體、且重抽樣須尊重資料結構」這一前提。
與拔靴法並列的另一支重抽樣方法,是置換檢定(permutation test)。它的邏輯與拔靴法不同:不去估計標準誤,而是直接建構虛無假設下的分布。其做法是,在「兩組並無差異」這類虛無假設所蘊含的可交換性之下,把觀測的組別標籤反覆隨機重排,每次重算檢定統計量,由這些重排值構成虛無分布,再看實際觀測的統計量落在其中多極端。這正是第十章品茶夫人所體現的隨機化推論在一般情境下的推廣:當隨機化或可交換性成立時,置換檢定給出的是幾乎不依賴任何分布假設的精確 p 值。
把這些方法集中於此,還有一個貫穿全書的用意。重抽樣的身影其後將反覆出現:第八章以重抽樣建構對等檢定的區間,第十六章以拔靴法為中介與間接效果構造不對稱的信賴區間,第二十章以拔靴法概似比檢定(bootstrap likelihood ratio test)判定混合模型的類別數,第三十二章則以重抽樣為後設分析的異質性評估與穩健推論提供依據。這些看似分散的應用,共享的都是本節所確立的同一套邏輯,即以電腦的反覆重抽,替換掉解析推論所仰賴、卻未必成立的分布假設。日後各章再度用到時,皆可回指本節。
模型診斷:找出模型哪裡出了問題
至此的工具,也就是適配指標、資訊準則、交叉驗證,回答的都是「整體」問題:這個模型整體配得多好、比別的模型整體好多少。但它們有一個共同的盲點:一個整體看來不錯的模型,可能是被少數幾個極端觀測「撐」出來的假象;整體適配良好,也可能在某個局部嚴重失準。要抓出這些問題,需要的是診斷(diagnostics):它問的不是「配得多好」,而是「哪裡出了問題」。
第一種診斷是殘差分析。把殘差畫出來,若呈現系統性的型態,例如隨預測值變大而扇形展開,或呈現曲線趨勢,便暗示了模型設定的問題,如異質變異或遺漏的非線性關係。為使不同觀測的殘差可以比較,實務上常改用標準化或學生化殘差,因為原始殘差的變異本身會隨槓桿而不同。第二種,是找出「影響力過大」的觀測,如下面的方塊所示。
在線性迴歸中,帽子矩陣(hat matrix)為
它把觀察值 \mathbf{y} 映射到配適值 \hat{\mathbf{y}} = \mathbf{H}\mathbf{y}。其對角元素 h_{ii} 稱為第 i 個觀測的槓桿值(leverage),衡量該觀測的預測變項有多「極端」;槓桿高的點,光憑其 x 的位置,便對迴歸線有很大的拉力。但「槓桿高」不等於「影響大」,還要看它的殘差。Cook (1977) 的 Cook 距離把兩者結合起來:
其中 e_i 為殘差、p 為參數個數、s^2 為誤差變異估計。D_i 衡量的是「把第 i 個觀測拿掉,整組配適值會變動多少」。D_i 特別大的觀測,就是主宰了模型的影響點(influential point),值得回頭檢查:它可能是輸入錯誤、真正的離群個案,或暗示模型不適用於某個次群體。若想進一步知道某觀測影響的是「哪一個」係數,則可檢視 DFBETAS 之類的量。
第三種常見診斷是多元共線性,可用第十一章提過的變異數膨脹因子(VIF)偵測;而在多變項情境中,還可用馬氏距離(Mahalanobis distance)辨識預測空間中的多變項離群點。這一整套迴歸診斷的方法,主要由 Belsley et al. (1980) 以及 Cook 等人於一九七○、八○年代發展成熟。它們共同的精神是:別只盯著「模型整體配得好不好」這一個數字,而要拆開來看,模型在哪些觀測、哪些局部可能站不住腳。
收斂與不當解:當估計本身出了問題
前面都假設「估計總是能算出來」。但對迭代型的估計器,如 logistic 迴歸、SEM、IRT、混合模型,它們的參數多半沒有封閉解,得靠電腦一步步逼近,於是估計本身就可能出狀況。這類問題常被初學者忽略,卻是實務中最常見的絆腳石。
最基本的是不收斂(non-convergence):迭代跑了半天,參數就是定不下來,或撞到邊界。原因五花八門,可能是樣本太小、模型太複雜、起始值太差,或模型根本設定錯了。遇到不收斂,第一反應不該是「換個軟體再跑一次」,而該是「這個模型是不是有問題」;有時改善起始值、或暫時簡化模型以定位問題所在,比盲目重跑更有幫助。在因素分析與 SEM 裡,還有一種惡名昭彰的「不當解」(improper solution),稱為 Heywood case:估出了負的變異數,或大於 1 的標準化負荷,這在數學上根本不可能。Heywood case 通常是警訊,指向幾種可能:模型設定錯誤、樣本太小、某個因素只有兩個指標(經驗上辨識不足),或資料本身不支持這個模型。把負變異數硬「固定成 0」讓模型跑得動,往往治標不治本,真正該做的是回頭質疑模型;與此相關的「非正定矩陣」(non-positive-definite matrix)警告,多半也源自類似的病灶。
這些問題背後,常是一個更根本的概念,即辨識(identification)。一個模型若「結構上」就無法從資料唯一決定其參數(結構性辨識不足),或雖然理論上可辨識、但這批資料剛好提供不了足夠資訊(經驗性辨識不足),估計便會出亂子。特別是後者,經驗性辨識不足,往往在小樣本或變項近乎共線時悄然發生,其症狀正是不收斂或標準誤大到荒謬。辨識的細節會在第十五至十七章隨模型展開;這裡要記住的教訓是:當估計不收斂、或跑出不可能的數值,不要急著「湊」出一個能跑的結果,那些警訊,往往正是模型在對你說實話。
前沿與整合:適配統計是工具,不是判決
最後,把這一章的工具放回一個更清醒的視角。有一個誘惑必須抵抗:把適配指標、資訊準則當成「模型對不對」的最終判決。這是危險的,也是 MacCallum (2003) 反覆申論的主題,即研究者始終是在與不完美的模型工作,而非在尋找那個唯一為真的模型。
一方面,一個模型可以「配得很好,卻是錯的」。第十六章會談到等價模型(equivalent models):好幾個因果結構南轅北轍的模型,可以隱含出一模一樣的共變數矩陣,因此適配統計量完全相同;適配再好,也無法在它們之間做選擇,那要靠理論。另一方面,一個模型也可以「配得不夠好,卻很有用」:一個刻意簡化的模型,適配指標未必漂亮,卻可能抓住了現象最重要的骨架。這正是 MacCallum 所謂「與不完美模型工作」的真義:目標不是通過某條門檻,而是判斷這個近似對當前的研究目的是否夠好。
資訊準則本身也不是萬靈丹。在混合模型的「類別枚舉」問題上(第二十章),用 BIC 決定「資料裡有幾個潛在類別」是常見做法,但它並不可靠:BIC 有時會建議出過多、或缺乏實質意義的類別,因此需要搭配其他判準,如可解釋性、拔靴法概似比檢定,一起判斷。同樣值得警惕的是,過度追逐適配門檻本身也會導致另一種過度配適,也就是不斷依修正指標加設參數,直到指標「達標」,換來的卻可能是一個追著樣本雜訊跑、難以複製的模型。這一切再次說明:沒有任何單一統計量,能替研究者完成「這個模型好不好」的判斷。好的建模,從來不是「跑出一個適配指標、對照一張門檻表」這麼機械,而是一個把適配統計、模型診斷、理論知識與研究判斷全部端上桌、反覆對話的過程。統計量告訴我們「資料怎麼說」,但「該相信哪個模型」,最終是一個需要實質知識的科學判斷,這也呼應了第八章「別把 p 值當判準」的提醒。
小結
本章把橫貫全書所有建模章節的共通工具,一次備齊。估計上,最大概似是通用引擎,並依資料型態延伸出 MLR、WLSMV、FIML 這份選單,其推論則由概似比、Wald 與分數三種檢定支撐。適配上,整體卡方檢定回答「合不合」、近似指標回答「差多少」,並可分為絕對、增值、簡約三類。比較上,巢狀模型用概似比檢定,非巢狀或講究簡約時用 AIC、BIC,講究外部預測時用交叉驗證。診斷上,用槓桿值、Cook 距離、標準化殘差與 VIF 找出局部問題,並警惕不收斂與 Heywood case 這些「模型在說實話」的警訊。而貫穿全章的一句話是:這些都是工具,不是判決,真正的模型評鑑,是統計、診斷、理論與判斷的合奏。
至此,第十一、第十二兩章已把「模型怎麼估、怎麼評、怎麼選」講透。第三部分只剩最後一塊拼圖:當資料有缺失時,前面這一切又該如何調整。這正是下一章的主題。補完缺失資料,我們便備妥了全部的統計工具,可以正式進入第四部分,把這些工具用到因素分析、SEM、IRT 這些真正的潛在變項模型上。