第 15 章 驗證性因素分析與分析實務
第四部 潛在變項測量模型
15Chapter

驗證性因素分析與分析實務

第十四章的探索性因素分析,讓資料自己「建議」了一個結構。但建議不等於證明。驗證性因素分析(confirmatory factor analysis, CFA)把局面反轉過來:研究者事先明確指定「哪幾題屬於哪個因素」,這是一個精確、可否證的假設,再把它拿到資料面前受檢。這是研究鏈上「驗證」的那一半。然而 CFA 也是整個領域最有爭議的實務所在:該看哪些適配指標?門檻該訂在哪裡?模型不合時,能不能「動手修」?本章要嚴謹地把 CFA 建立起來,並以完整的篇幅,講清楚「如何好好做一次 CFA」。

從探索到驗證

EFA 與 CFA 的根本差別,在於「事先知道多少」。EFA 讓每一題都可以負荷在每一個因素上,再靠旋轉整理,是資料驅動的;CFA 則要求事先把絕大多數負荷固定為零,只留下理論上認為該有的那幾條,是理論驅動的。

舉一個例子。假設研究者主張一份 10 題的量表測「焦慮」與「憂鬱」兩個構念,第 1 至 5 題測焦慮、第 6 至 10 題測憂鬱,而且沒有任何一題同時測兩者。在 CFA 裡,會把「焦慮因素對第 6 至 10 題的負荷」與「憂鬱因素對第 1 至 5 題的負荷」全部固定為零,只估計「該有的」那 10 條負荷。這整組「哪裡是零、哪裡不是零」的設定,就是一個明確而可否證的測量假設:若資料與這個結構嚴重不合,模型便會被拒絕。也正因如此,一個嚴謹的研究鏈往往是:先以一半樣本做 EFA 生成結構假設,再以另一半樣本、或獨立樣本做 CFA 加以驗證;若在探索所用的同一批資料上做 CFA,其「驗證」意義便大打折扣。CFA 由 Jöreskog (1969) 所開創,並透過他的 LISREL 系統普及,成為潛在變項建模的基石。

CFA 測量模型

CFA 的測量模型,形式上與第十四章的共同因素模型一模一樣,差別只在:負荷矩陣 \boldsymbol{\Lambda} 現在有一個「固定的、大量為零」的型態,如下面的方塊所示。

推導方塊CFA 的隱含共變數結構

CFA 設觀測向量 \mathbf{x} = \boldsymbol{\Lambda}\boldsymbol{\eta} + \boldsymbol{\varepsilon},其中負荷矩陣 \boldsymbol{\Lambda} 的型態事先指定(多數元素固定為 0)。在共同因素與誤差不相關、誤差彼此不相關的假設下,模型隱含的共變數矩陣為

\boldsymbol{\Sigma}(\boldsymbol{\theta}) = \boldsymbol{\Lambda}\,\boldsymbol{\Phi}\,\boldsymbol{\Lambda}' + \boldsymbol{\Theta},

其中 \boldsymbol{\Phi} = \mathrm{Cov}(\boldsymbol{\eta}) 為因素的變異–共變數矩陣、\boldsymbol{\Theta} = \mathrm{Cov}(\boldsymbol{\varepsilon}) 為殘差共變數矩陣(通常設為對角)。自由參數 \boldsymbol{\theta} 包含:那些「非零」的負荷、因素的變異與共變數、以及殘差變異。

潛在變項沒有天生的尺度,因此必須「定尺」。常見兩法:一是把每個因素的某一題負荷固定為 1(標記變項法),二是把因素變異固定為 1(標準化法)。少了這一步,模型無法辨識。

CFA 與 EFA 在數學上共用 \boldsymbol{\Sigma} = \boldsymbol{\Lambda}\boldsymbol{\Phi}\boldsymbol{\Lambda}' + \boldsymbol{\Theta} 這個骨架,差別全在對 \boldsymbol{\Lambda} 施加的約束。也正因為 CFA 施加了這些「零負荷」的約束,模型才有了可能「配不上資料」的空間,也才因此能被否證,這正是它作為「驗證」工具的力量來源。此外,當分析涉及平均數的比較,例如第十九章的測量不變性時,還須把題目的截距納入模型,成為所謂的「平均數結構」;本章暫且聚焦於共變數結構,截距留待該章展開。

CFA 的測量模型還常須放寬一個過嚴的假設,即殘差彼此不相關。當某些題目共享了與目標構念無關的成分時,例如採用相同的作答方式、或若干題目在文字上高度雷同,它們的殘差便會相關;此時若強行維持對角的 \boldsymbol{\Theta},模型會系統性地失配。因應之道有二:一是在有理論依據下,允許特定幾對殘差相關;二是明確設立一個「方法因素」,把共同的方法變異吸收進去,這正是第七章多特質多方法矩陣在 CFA 中的落實。一個典型的例子,是量表中正向題與反向題所形成的用詞效應(wording effect):像 Rosenberg 自尊量表這類正反向題交錯的工具,其反向題之間往往共享一個與自尊無關的作答成分,若不加處理,這個純由題目措辭方向造成的共變,便常被誤判為「正向自尊」與「負向自尊」兩個實質構念,而它其實只是方法造成的假象。將這類用詞效應以相關殘差或方法因素明確納入模型,能還原量表本應有的單維結構。更廣泛地說,反向題效應只是反應風格(response styles)的一個特例,默許反應、極端反應等系統性的作答傾向,同樣會在測量模型中留下方法變異的印記,其專門的建模留待第二十五章討論。這類設定必須出於事前的理論,而非事後為了改善適配而添加,否則便落入下文將談的修正陷阱。

模型辨識

在估計之前,須先確認一件事:這個模型「估得出來嗎」?也就是辨識(identification)問題,模型的參數,能否從資料(樣本共變數矩陣)唯一決定。設定得不好,模型會有無限多組同樣好的參數,估計器便無所適從。

推導方塊辨識的必要與充分條件

辨識的資訊上限,來自樣本共變數矩陣 \mathbf{S} 中「不重複」的元素個數。對 p 個觀測變項,這個數是 p(p+1)/2(對角的變異加上下三角的共變數)。

必要條件(t 準則):自由參數的個數 t,不能超過這個上限,即模型自由度 df = p(p+1)/2 - t \ge 0。df < 0 者必然不可辨識;df = 0 者「恰好辨識」(saturated),能完美重現 \mathbf{S},卻因此無從檢驗;df > 0 者「過度辨識」,這才是我們要的:模型施加了可被否證的約束,因此可以檢定。

充分條件(經驗法則):t 準則只是必要、非充分。三指標法則:一個因素若有三個以上、只負荷於它的指標,加上標準假設,通常即可辨識;兩指標法則:只有兩個指標的因素,唯有在它與別的因素相關時才辨識。此外還有「經驗性辨識不足」(第十二章):理論上可辨識,但這批資料剛好提供不了足夠資訊,症狀常是不收斂或標準誤爆炸。

估計與適配函數

辨識沒問題後,便進入估計。CFA 沿用第十二章的最大概似:找出一組參數 \boldsymbol{\theta},使「模型隱含的共變數 \boldsymbol{\Sigma}(\boldsymbol{\theta})」盡量貼近「樣本共變數 \mathbf{S}」。衡量兩者差距的,是適配函數,如下面的方塊所示。

推導方塊ML 適配函數

在多元常態假設下,CFA 的最大概似估計,等價於最小化下列適配函數:

F_{ML}(\boldsymbol{\theta}) = \log|\boldsymbol{\Sigma}(\boldsymbol{\theta})| + \mathrm{tr}\!\big(\mathbf{S}\,\boldsymbol{\Sigma}(\boldsymbol{\theta})^{-1}\big) - \log|\mathbf{S}| - p,

其中 |\cdot| 為行列式、\mathrm{tr} 為跡、p 為觀測變項數。這個函數有一個關鍵性質:當且僅當 \boldsymbol{\Sigma}(\boldsymbol{\theta}) = \mathbf{S} 時 F_{ML}=0(完美適配),否則為正。估計就是找 \hat{\boldsymbol{\theta}} 使 F_{ML} 最小。更進一步,在虛無假設「模型正確」下,

(N-1)\, F_{ML}(\hat{\boldsymbol{\theta}}) \;\overset{\cdot}{\sim}\; \chi^2,

自由度為前述的 df。這正是第十二章談過的「卡方適配檢定」在 CFA 裡的具體形式,也是所有近似適配指標的計算基礎。

至於「該用哪一種估計器」,直接沿用第十二章的選單。連續且大致常態的指標,用 ML;連續但明顯偏離常態,用穩健最大概似 MLR(以 Satorra-Bentler 校正卡方與標準誤,見 (Satorra & Bentler, 1994));而心理計量最常見的次序類別指標(如李克特量表),正確做法是用加權最小平方的穩健變體 WLSMV,它以多分相關與閾值為基礎,避免了「把次序當等距」的錯誤。至於一份量表究竟該設幾個反應選項,以及在多少個類別以上、分布多接近對稱時,把次序資料逕當連續處理才不致造成明顯偏誤,則是一個關乎反應格式的實證問題,其系統性的證據將於第二十五章整理。若資料還有缺失,則搭配第十三章的 FIML。須補充的是,次序型 CFA 常另行報告 WRMR 這個為類別資料設計的殘差指標,而各適配指標的慣用門檻,在 WLSMV 之下未必與連續情形相同,這也提醒了門檻的情境依賴。這一整套「看資料型態選估計器」的決策,是做 CFA 的第一道實質關卡。

適配指標與它們的門檻

第十二章說過,卡方檢定在大樣本下幾乎必然拒絕,因此實務上,我們靠一整套「近似適配指標」來判斷「模型偏離完美的程度可不可接受」。它們大致分三類,如表 15.1 所示。增量式指標(incremental)拿研究者的模型與一個「最差的基準模型」(通常是假設變項全不相關的虛無模型)比,看進步了多少,代表是 CFI 與 TLI (Bentler, 1990)。精簡調整式指標針對「每個自由度的偏差」懲罰複雜度,代表是 RMSEA (Browne & Cudeck, 1993)。殘差式指標則直接看「模型隱含相關與實際相關的平均差距」,代表是 SRMR。

表 15.1 常用適配指標與慣用門檻
指標 類型 良好 可接受
CFI / TLI 增量式 \ge .95 \ge .90
RMSEA 精簡調整 \le .06 \le .08
SRMR 殘差式 \le .08 —

這幾個指標其實有一個共同的理論根源,即第九章談過的非中心性。當模型有些微設定誤時,卡方統計量不再服從中央卡方,而服從一個非中央卡方,其非中心性參數衡量了模型偏離正確的程度。RMSEA 直接由此構造,大致定義為

\mathrm{RMSEA} = \sqrt{\frac{\max(\chi^2 - df,\, 0)}{df\,(N-1)}},

分子的 \chi^2 - df 正是非中心性參數的估計,再除以自由度(懲罰複雜度)與樣本數;而 CFI 則以「你的模型」相對於「基準模型」在非中心性上的改善比例來刻畫。Browne 與 Cudeck 還提出以 RMSEA 的信賴區間,以及「接近適配檢定」(檢定 RMSEA 是否小於某個門檻如 .05),把單一個點估計,變成一個帶不確定性的判斷。理解這一共同根源,有助於看清何以這些指標會隨樣本數、自由度而系統性地變動,這正是下一節的主題。

這一非中心性的視角,也釐清了兩種常被混淆的檢定。傳統卡方檢的是「精確適配」,也就是「模型完全正確」這個幾乎注定被大樣本拒絕的虛無假設;而以 RMSEA 信賴區間為基礎的「接近適配檢定」,檢的則是「模型的偏誤小到可接受」這個較實際的假設。兩者的虛無假設不同,結論也常不同,報告時務必分清。此外,當指標為次序類別、以 WLSMV 估計時,這些指標的分布性質會改變,慣用的連續型門檻未必適用,晚近的研究因此建議改用為類別資料另行校準的門檻,這再次呼應了門檻的情境依賴。

「黃金門檻」的迷思

上面那張表的門檻,很多人奉為圭臬。它們的來源,主要是 Hu & Bentler (1999) 那篇極具影響力的模擬研究,CFI \ge .95、RMSEA \le .06、SRMR \le .08 這組數字,即由此而來,並迅速成為期刊審查的「潛規則」。

但把這些數字當成放諸四海皆準的「及格線」,是一個嚴重的誤解。Marsh et al. (2004) 在一篇著名的評論中直言,把 Hu 與 Bentler 的建議當成「黃金律」來套用,是一種危險的過度概化;Hu 與 Bentler 自己也強調,這些門檻是在「特定的模型、特定的樣本數、特定的分布」條件下得出的,並不通用。事實上,適配指標的數值,會隨模型類型、樣本數、指標數目、負荷大小、以及「錯在哪裡」而變動,同一個門檻,在不同情境下的意義天差地別。結果是:一個模型可能「通過了門檻,卻其實設定錯誤」;另一個可能「沒達到門檻,卻完全堪用」。把一條固定的線,套到千變萬化的模型上,本身就不合理。這場爭論的一個極端立場甚至主張,既然近似適配指標如此難以標準化,不如回歸卡方檢定;儘管多數學者不採此見,它仍凸顯了問題的嚴重。

針對這個困境,近年出現了動態適配指標(dynamic fit index)的取徑。McNeish & Wolf (2023) 主張,與其套用一組固定門檻,不如針對研究者手上「這一個」模型與資料條件,以模擬去算出「專屬的」門檻。其運作機制大致如此:先依研究者的模型設定,即因素數、指標數、負荷大小與樣本數等,模擬出大量「正確設定」之下的資料,再模擬出一批帶有某種目標程度設定誤,例如一條被忽略的交叉負荷,之下的資料,各自算出適配指標的分布,最後取一個能最佳區分兩者的數值,作為這一研究專屬的門檻。這把 Hu-Bentler 的「一套數字打天下」,換成了「因模型與資料制宜」,也把門檻的選擇由憑藉一篇舊模擬的權威,轉為一個可在當前情境重新計算、透明可複製的程序。

然而動態門檻也非萬靈丹,其限制須一併認識。它繼承了所有模擬取徑的共同弱點,即結論取決於模擬時所假設的設定誤型態與大小,而「該以何種、多大的設定誤為對照」本身又是一個需要判斷的問題;換言之,它把「門檻該訂多少」的主觀性,部分地轉移到了「該模擬何種錯誤」之上,而非徹底消除。此外,它的計算成本較高,也尚未在所有模型類型上得到充分檢驗。儘管如此,動態適配指標的價值,不在於再給出一條神聖的線,而在於它逼使研究者明白地說出「我把什麼程度的設定誤視為不可接受」,從而把適配評鑑由套用慣例,推回為一個必須言明前提的實質判斷。更根本地,這一切都呼應了第十二章的那句提醒:適配指標是工具,不是判決,它們幫助研究者思考模型合不合,卻不該替他做出「接受或拒絕」的自動裁決。

局部適配與模型修正的陷阱

整體適配指標,看的是「模型與資料整體有多合」。但整體看來還行的模型,局部可能藏著問題,例如某兩題之間有模型沒捕捉到的關聯。要看穿這種局部失配,須檢查殘差(模型隱含相關與實際相關的差),以及修正指標(modification indices, MI)。標準化的殘差矩陣尤其有用,一個特別大的殘差,直接指出「哪兩個變項之間的關係,被模型低估或高估了」。

修正指標的功能是:對每一個「被固定為零」的參數,估計「若把它放開,卡方會下降多少」。它等於在說:「這裡加一條路徑(例如讓某兩題的誤差相關、或讓某題交叉負荷到另一個因素),適配會改善最多。」這個提示很誘人,順著它一路放開參數,適配指標很快就會漂亮起來。

但這正是 CFA 最大的陷阱。順著修正指標「修模型」,等於把「驗證性」偷偷變回了「探索性」,研究者不再是在檢驗一個事前的假設,而是在用同一批資料,反覆挑出「剛好能改善這批資料」的參數,這就是在配雜訊(capitalizing on chance)。MacCallum et al. (1992) 早已以模擬證明,這種資料驅動的修正在不同樣本間往往並不一致,一批資料修出的「改善」,換一批資料便可能消失。因此紀律很清楚:任何修正,都必須有事前的理論理由,不能純為了「讓數字好看」;做了修正,就該誠實報告,並最好用獨立樣本交叉驗證。一個為了通過門檻而被反覆微調的模型,它的「良好適配」其實一文不值。

更複雜的結構:高階與雙因子模型

基本的 CFA 之外,還有兩種常見的擴充,用以處理「構念本身有層次」的情形。

高階因素模型(higher-order model)處理的是:幾個一階因素彼此相關,而這些相關,又可以用一個更上位的「二階因素」來解釋。經典例子是智力,語文、數值、空間等特定能力(一階因素)彼此相關,背後是一個一般智力 g(二階因素)。

雙因子模型(bifactor model)則採取不同的切法:讓每一題「同時」負荷在一個貫穿全部題目的「一般因素」,與一個只涵蓋部分題目的「特殊群組因素」上,而且一般因素與特殊因素彼此正交。它近年非常流行,特別適合回答一個關鍵問題:「這份量表的總分,究竟主要反映單一個一般構念,還是好幾個成分的混合?」,這與第六章的階層 omega 直接相通 (Reise, 2012)。為了回答這個問題,Rodriguez et al. (2016) 整理了一組專屬的雙因子指標,例如解釋共同變異(ECV)、階層 omega,以及未受汙染相關的百分比(PUC),使研究者能量化「總分究竟有多接近單維」。不過須提醒:雙因子模型的彈性很大,容易「過度配適」,它幾乎總是比競爭模型配得更好,卻未必更有意義;因此它的良好適配,不能單獨作為「構念就是這個結構」的證據,仍要回到理論與可解釋性。

至於高階模型與雙因子模型孰優,並無定論。數學上,高階模型其實是雙因子模型的一個受限特例,因此雙因子通常配得較好,但這部分只是彈性使然,未必反映更真實的結構。選擇的依歸,應是理論:若相信各特殊能力是「一般能力的下位分化」,高階模型較貼切;若相信「一般」與「特殊」是兩組並行、可各自解釋題目的來源,雙因子較貼切。以適配優劣單方面裁決兩者,正是本書反覆告誡的、把統計量當判決的錯誤。

分析實務:如何好好做一次 CFA

把整章的原理,收攏成一套可操作的工作流程。這也是本章標題「分析實務」的核心。

第一步,從理論設定模型:清楚寫下有幾個因素、哪題屬於哪個因素、哪些負荷固定為零,這是要檢驗的假設,必須在看資料之前就定好。第二步,檢查資料以選定估計器:變項是連續還是次序?常態還是偏態?有無缺失?據此決定用 ML、MLR 還是 WLSMV,並在有缺失時搭配 FIML(第十二、十三章)。第三步,檢查辨識:自由度是否 \ge 0、每個因素是否有足夠指標。第四步,估計,並留意收斂。第五步,檢查有無不當解:負的殘差變異、標準化負荷大於 1 這類 Heywood case(第十二章),是模型或資料出問題的警訊,不能視而不見。第六步,評鑑整體適配:同時看卡方、CFI、RMSEA、SRMR 等多個指標,並牢記門檻只是啟發、不是鐵律。第七步,檢視局部適配:看殘差與修正指標,但克制「無理論就修模型」的衝動。第八步,詮釋與報告:報告標準化負荷、因素間相關、以及以 omega(第六章)估計的信度。

樣本數方面,與其記憶「每參數幾人」的粗略規則,不如記住一個原則:因素的指標愈多、負荷愈高、模型愈簡單,所需樣本便愈小,反之則需要相當大的樣本,這也呼應了第九章以蒙地卡羅規劃 SEM 樣本數的做法。報告的規範同樣重要:一份負責任的 CFA 報告,應交代完整的模型設定、所用的估計器、多個適配指標(並註明門檻只是參考)、標準化負荷與因素相關、以及任何做過的修正及其理由。就軟體而言,R 的 lavaan 與 Mplus 是最主流的工具,而 Kline (2016) 對整套 SEM 實務提供了權威而完整的參考;一如前面各章反覆強調,工具再強,也取代不了這一連串的判斷。

值得補充的是,CFA 與第六章的信度直接相連。一旦估出各題的標準化負荷與殘差變異,便可據以計算 omega 係數,這正是第六章所談、優於 alpha 的因素分析取向信度;換言之,一次設定良好的 CFA,同時交付了測量結構的檢驗與信度的估計。就雙因子模型而言,前述的階層 omega 更能回答「總分主要反映一般因素到什麼程度」。因此在報告 CFA 時,一併報告以模型為基礎的信度,遠比另外計算一個與模型脫節的 alpha 來得一致而誠實。

小結與前沿

驗證性因素分析,是一個可否證的測量模型:它把「哪題測哪個構念」寫成一組明確的約束,再以第十二章的估計與適配工具,把這個假設放到資料面前嚴格受檢。它是 EFA 的「驗證」對偶:EFA 生成結構假設,CFA 檢驗它。本章的幾個核心訊息值得記牢:辨識是估計的前提;估計器要看資料型態選(ML/MLR/WLSMV+FIML);適配評鑑要靠多個指標加上判斷,而非死守 Hu-Bentler 的黃金門檻;而修正指標是甜美的毒藥,無理論的修模型,會把驗證偷換成探索。

前沿方面,貝氏 CFA 提供了一條迷人的中間道路。傳統 CFA 要求交叉負荷「嚴格等於零」,這往往過於死板;Muthén & Asparouhov (2012) 提出以「小變異的先驗」,讓那些交叉負荷「近似、但不完全等於零」,既保留了理論結構的骨架,又容許現實資料裡難免的微小交叉負荷。與之精神相近的還有正則化 SEM,以懲罰項自動決定哪些交叉負荷該保留、哪些該壓為零;而網絡取向(第三十五章)則更根本地追問,指標間的關聯是否真的須以共同因素來解釋。這些取徑的細節,將於第十六、三十三、三十五章分別展開。

CFA 也是通往後面兩章的橋樑。下一章的結構方程模型,會在 CFA 的測量模型之上,再加入「潛在因素之間的結構關係」,把「怎麼測」與「構念間怎麼相互影響」結合成一個完整的模型。而第十九章的測量不變性,則會用多群組 CFA,去檢驗「同一份量表,在不同群體、不同時點,是不是在測同一件事」,這是任何跨群體比較能否成立的前提。

參考文獻

Bentler, P. M. (1990). Comparative fit indexes in structural models. Psychological Bulletin, 107(2), 238–246. https://doi.org/10.1037/0033-2909.107.2.238
Browne, M. W., & Cudeck, R. (1993). Alternative ways of assessing model fit. In K. A. Bollen & J. S. Long (Eds.), Testing structural equation models (pp. 136–162). Sage.
Hu, L., & Bentler, P. M. (1999). Cutoff criteria for fit indexes in covariance structure analysis: Conventional criteria versus new alternatives. Structural Equation Modeling, 6(1), 1–55. https://doi.org/10.1080/10705519909540118
Jöreskog, K. G. (1969). A general approach to confirmatory maximum likelihood factor analysis. Psychometrika, 34(2), 183–202. https://doi.org/10.1007/bf02289343
Kline, R. B. (2016). Principles and practice of structural equation modeling (4th ed.). Guilford Press.
MacCallum, R. C., Roznowski, M., & Necowitz, L. B. (1992). Model modifications in covariance structure analysis: The problem of capitalization on chance. Psychological Bulletin, 111(3), 490–504. https://doi.org/10.1037/0033-2909.111.3.490
Marsh, H. W., Hau, K.-T., & Wen, Z. (2004). In search of golden rules: Comment on hypothesis-testing approaches to setting cutoff values for fit indexes and dangers in overgeneralizing Hu and Bentler’s (1999) findings. Structural Equation Modeling, 11(3), 320–341. https://doi.org/10.1207/s15328007sem1103_2
McNeish, D., & Wolf, M. G. (2023). Dynamic fit index cutoffs for confirmatory factor analysis models. Psychological Methods, 28(1), 61–88. https://doi.org/10.1037/met0000425
Muthén, B., & Asparouhov, T. (2012). Bayesian structural equation modeling: A more flexible representation of substantive theory. Psychological Methods, 17(3), 313–335. https://doi.org/10.1037/a0026802
Reise, S. P. (2012). The rediscovery of bifactor measurement models. Multivariate Behavioral Research, 47(5), 667–696. https://doi.org/10.1080/00273171.2012.715555
Rodriguez, A., Reise, S. P., & Haviland, M. G. (2016). Evaluating bifactor models: Calculating and interpreting statistical indices. Psychological Methods, 21(2), 137–150. https://doi.org/10.1037/met0000045
Satorra, A., & Bentler, P. M. (1994). Corrections to test statistics and standard errors in covariance structure analysis. In A. von Eye & C. C. Clogg (Eds.), Latent variables analysis: Applications for developmental research (pp. 399–419). Sage.
本章引用格式游琇婷(2026)。驗證性因素分析與分析實務。《計量心理學:測量、模型與推論》(第 15 章)。