測量不變性與差異試題功能
假設一項研究發現,男性在某份領導力量表上的平均分數高於女性;或者,某項追蹤研究發現憂鬱程度在疫情期間顯著上升。在把這兩種比較當成實質結論之前,都必須先回答一個更前置的問題:這份量表在兩個群體之間,或在兩個時點之間,測量的是否為「同一件事」。倘若某道題目在不同群體的運作方式不同,例如「我會在會議上主動發言」對男性主要反映領導傾向,對女性卻同時反映果斷特質與文化期待的交互作用,那麼直接比較兩群的總分,等於在混淆兩種來源的差異。測量不變性(measurement invariance),正是用來檢驗「跨群體、跨時間的比較是否合法」的形式機制。而它恰恰是絕大多數已發表比較從未明確檢查的那個前提。
本章將以一個具體情境貫穿全部討論。假定研究團隊編製了一份十題、四點量尺的中文版憂鬱量表,打算比較都會與偏鄉兩地成人的憂鬱程度,也打算比較男性與女性。這個情境的好處是問題夠尖銳:若偏鄉樣本的平均分數比都會高出 0.30 分,這 0.30 分究竟代表「偏鄉居民確實比較憂鬱」,還是代表「憂鬱程度相同的人在偏鄉會對某幾道題給出比較高的分數」?測量不變性提供的,正是把這兩種解釋分開的工具。循著這個情境,本章要回答三個問題:不變性有哪些層級,各層級被違反時實質上代表什麼;判定是否違反的統計程序與門檻從何而來,又有什麼限制;以及當完全不變性無法達成時,還剩下哪些負責任的選擇。Putnick & Bornstein (2016) 檢視了 126 篇實徵文章、269 次不變性檢驗,發現即使在明確處理此議題的文獻中,報告的完整性與判準的一致性仍相當參差,這說明測量不變性在方法學上雖已成熟,其實務落實仍有明顯落差。
為什麼比較需要前提
比較潛在構念的平均數或分數,表面上天經地義,實則預設了一個強假設:被比較的群體之間,測量模型完全相同。若此假設不成立,例如同一道題在不同群體的因素負荷不同,或截距不同,則觀察分數的差異便同時承載了「構念本身確有差異」與「量表運作方式不同」兩種來源,兩者無從分辨。這正是效度議題(第七章)在群體比較脈絡下的直接延伸:分數的意義若不跨群穩定,任何以分數為基礎的推論都失去共同的參照。
以憂鬱測量為例。設想一題問「我對未來不抱希望」,若在某個文化中人們傾向以身體症狀而非情緒詞彙表達憂鬱,那麼即使兩個文化的受測者「憂鬱程度相同」,他們在這一題上的作答仍可能系統性地不同。此時跨文化比較憂鬱分數,便會被這種題目層次的不對等所汙染。測量不變性把這個直覺轉化為一套可以精確設定、逐級檢驗的統計程序。它既是有效比較的前提,也直接呼應第二章對「什麼才使測量得以比較」這個古老問題的追問。這套架構的公理基礎由 Meredith (1993) 奠定,其核心命題為:唯有當觀察變項在給定潛在變項下的條件分布跨群相同時,潛在構念的比較才具有意義。此一形式化定義,把「量表是否公平」這類長期停留在直覺層次的關切,安置在可檢驗的統計架構之上,也與測驗公平性運動、以及對「試題是否對特定群體不利」的政策關切密切相連。
測量不變性的層級
測量不變性的主要檢驗場域,是第十五、十六章的多群組驗證性因素分析(multigroup CFA, MG-CFA):將同一個 CFA 模型同時配適於數個群體,再逐步把參數設定為跨群相等,觀察每增加一層約束、模型適配是否顯著變差。這個作法之所以可行,關鍵在於多群組設定把「群體」從一個事後才拿來分組的標籤,變成模型內部的一個層次:每個群體都擁有自己的一套負荷、截距與殘差變異,研究者可以逐項指定哪些跨群相等、哪些自由估計。約束加得愈多,模型愈省儉,能夠吸收跨群差異的自由度也愈少;一旦約束加過了頭,適配便會惡化,而惡化的位置恰好指出量表在哪一個層次上不對等。這構成一個由寬鬆到嚴格的層級序列,如表 19.1 所示。
| 層級 | 跨群相等的參數 | 允許的比較 |
|---|---|---|
| 形貌(configural) | 因素結構相同、無等同約束 | 基準模型 |
| 量尺/弱(metric) | 因素負荷 \boldsymbol{\Lambda} 相等 | 因素變異數與相關 |
| 截距/強(scalar) | 負荷 \boldsymbol{\Lambda} 與截距 \boldsymbol{\tau} 相等 | 潛在平均數 |
| 嚴格(strict) | 再加殘差變異 \boldsymbol{\Theta} 相等 | 觀察分數差異全歸於潛在差異 |
形貌不變性只要求各群體具有相同的因素個數與相同的負荷型態(哪些題目落在哪個因素上),但容許所有數值參數自由估計;它確立了「同一套構念結構在各群體都站得住腳」,是後續一切檢驗的基準。量尺不變性進一步要求因素負荷跨群相等,其實質意涵是「潛在構念每變動一個單位,在各群體所引起的指標反應幅度相同」,唯有如此,因素之間的變異數、共變數與迴歸關係才可跨群比較。截距不變性再要求指標截距跨群相等,其意涵是「在潛在構念取值相同時,各群體在該指標上的期望反應相同」,這正是比較潛在平均數的前提。嚴格不變性額外要求殘差變異跨群相等,意味著指標的信度與測量誤差結構也跨群一致,此時觀察分數的所有跨群差異都可歸因於潛在構念的差異。
這四個層級用數字說明會更清楚。設想憂鬱量表中「我提不起勁做任何事」這一題,在都會樣本的負荷估計為 0.78、截距為 1.85,在偏鄉樣本則為 0.52、截距為 1.90。負荷 0.78 對 0.52 的意思是:憂鬱潛在分數每上升一個單位,都會受測者在這題上約多給 0.78 分,偏鄉受測者只多給 0.52 分,換言之這道題對偏鄉受測者的憂鬱變化較不敏感,量尺不變性因此不成立。反之,若兩地的負荷同為 0.78,截距卻是 1.85 對 2.20,則代表憂鬱程度完全相同的兩個人,偏鄉的那一位仍會在這題上多給 0.35 分,此時不成立的是截距不變性。前者是刻度的間距不同,後者是刻度的起點不同,兩者都會讓總分的跨群比較失去共同基準。
此一層級序列有一項關鍵的實務含意:所欲進行的比較種類,決定了所需達到的不變性層級。若僅欲比較因素之間的相關或迴歸關係是否跨群相同,量尺不變性即已足夠;但只要涉及群體平均數的比較,而這是社會科學中最常見的比較,就必須達到截距不變性。此點極為重要卻常遭忽略:許多研究直接比較群體平均數,卻從未確認截距不變性是否成立,等於在一個未經檢驗的前提上構築整套結論。
值得補充的是,上述以負荷與截距為核心的層級,是為連續指標(以最大概似估計)設計的。當指標為次序類別(第十七章的多元計分情形,常以 WLSMV 估計)時,「截距」須改以「閾值」(thresholds)表述,不變性的建立也須同時處理閾值與負荷的辨識,其細節較連續情形更為複雜(見 (Millsap, 2011) 的處理)。這並非枝節:發展與臨床研究中大量使用李克特式次序題,若沿用連續情形的直覺而忽略閾值層次,容易得到誤導性的不變性結論。
巢狀模型檢驗與 \DeltaCFI 之爭
不變性的各層級彼此巢狀,每往嚴格方向推進一級,即多加一組等同約束。所謂巢狀,意思是較嚴格的模型所能表達的設定,較寬鬆的模型全都能夠表達,反之則不然:把量尺不變模型中的負荷等同約束逐一解除,得到的正是形貌不變模型。正因為兩個模型之間只差了一組約束,適配上的落差才能被歸因於「這組約束是否成立」,而被約束掉的參數個數,就是檢定自由度的來源。於是問題轉為一個量化的判斷:適配要變差到什麼程度,才算這一層不變性遭到違反?本節先給出古典的統計檢定,再說明實務上為何普遍改看適配指標的變化量,以及這個轉向本身帶來的新麻煩。既然各層模型彼此巢狀,便可援用第十二章的概似比檢定逐級比較,如下方方塊所示。
設較寬鬆的模型(如形貌不變性)配適的卡方為 \chi^2_A、自由度 df_A;較嚴格的模型(如量尺不變性,多了負荷等同的約束)為 \chi^2_B、df_B(df_B > df_A)。兩者的卡方差
在虛無假設「這一層約束成立」下,漸近服從自由度為 \Delta df = df_B - df_A 的卡方分配。若 \Delta\chi^2 顯著,即代表加上這層等同約束後適配明顯變差,亦即這一層不變性遭違反。然而此一卡方差檢定,與第十、十三章的老問題如出一轍:對樣本數過度敏感,樣本一大,再瑣碎的不等也會顯著。有鑑於此,Cheung & Rensvold (2002) 提出改看 CFI 的變化:若加上約束後 CFI 下降超過約 0.01(即 \Delta\mathrm{CFI} > .01),即判定不變性遭違反。
\Delta\mathrm{CFI} 的 .01 門檻雖然實用且廣被採用,卻帶有與 Hu-Bentler 黃金門檻(第十五章)完全相同的弱點:它是在特定條件下模擬得出的經驗值,並不普適,在不同的模型結構、樣本數與群體大小下,其適當性會改變。Chen (2007) 以兩項蒙地卡羅研究進一步細緻化此議題,指出判準應隨樣本大小與群體樣本是否均衡而調整,並建議把 \Delta\mathrm{CFI} 與其他指標的變化聯合使用:在樣本充足(總數大於約 300)且群組大小相近時,可採 \Delta\mathrm{CFI} \leq .010 搭配 \Delta\mathrm{RMSEA} \leq .015 或 \Delta\mathrm{SRMR} \leq .030(負荷不變性)/\leq .010(截距不變性)作為近似不變性的證據;而在樣本較小或群組嚴重不均衡時,這些界值的敏感度會下降,須格外審慎。把這些數字放回憂鬱量表的情境會更有感覺。假定都會與偏鄉各 400 人,形貌不變模型的 CFI 為 .962、RMSEA 為 .048;加上負荷等同約束後,CFI 降為 .958、RMSEA 升為 .050,\Delta\mathrm{CFI} 僅 .004、\Delta\mathrm{RMSEA} 僅 .002,兩者都遠低於界值,量尺不變性可以接受。再加上截距等同約束後,CFI 掉到 .941、RMSEA 升到 .061,\Delta\mathrm{CFI} 達 .017、\Delta\mathrm{RMSEA} 達 .013,前者已超過 .010 的界值,訊號指向截距層次確有題目不對等。要留意的是,同一份資料在負荷這一層的 \Delta\chi^2 很可能就已達顯著,因為八百人的樣本足以把 .004 的 CFI 落差推成統計顯著,這正是兩套判準時常彼此打架之處。此一結果的方法學意涵在於:把 \Delta\mathrm{CFI} < .01 當成「不變性成立」的自動判準同樣危險。負責任的做法,是聯合檢視卡方差、\Delta\mathrm{CFI}、\Delta\mathrm{RMSEA} 與 \Delta\mathrm{SRMR} 等多個指標,並結合對「哪些參數不等、不等的幅度多大」的實質評估,而非以任一單一門檻裁決。
部分不變性及其偏誤
在真實資料中,「完全不變性」往往難以達成,尤以截距不變性為甚,鮮少所有題目皆能通過。這其實不難理解:一份量表少說十餘題,只要有一題的措辭在某個群體引起不同的聯想,截距等同約束便告失守,而題目愈多、群體愈多,全數通過的機會愈低。前一節的檢驗程序到此為止只能告訴研究者「這一層不成立」,卻沒有告訴研究者接下來該怎麼辦:完全放棄比較未免可惜,硬著頭皮比較又欠缺正當性。本節要處理的正是這個兩難。退而求其次的策略是部分不變性(partial invariance;(Byrne et al., 1989)):容許少數不服從等同約束的參數(某些負荷或截距)跨群自由估計,而其餘維持相等,藉此保住「多數題目仍站在共同量尺上」的比較基礎。讀完本節應能回答兩個問題:這樣的權宜安排在什麼條件下可以接受,以及它會讓潛在平均數的估計付出什麼代價。
此一策略帶來一項尖銳的爭議:究竟可以放行多少個不變的參數,比較才仍具意義。放行過多,等於承認量表在群體之間差異巨大,比較本身即失去根基。更棘手的是「如何決定放行哪幾個」:若依修正指標挑選「放開後改善最多」的參數,便再次落入第十五章的陷阱,以同一批資料反覆搜尋「恰好能改善這批資料」的設定,實為對雜訊的配適,很可能換一批資料即不再成立。還有一項常遭輕忽卻後果嚴重的事實:在僅有部分不變性(尤其部分截距不變性)的情況下直接比較潛在平均數,會產生系統性偏誤,那些被忽略而實際不等的截距,會扭曲潛在平均數的估計,其方向與幅度取決於不等截距的分布。這個偏誤有多大,用數字最容易感受。假定十題憂鬱量表中有兩題的截距在偏鄉樣本各高出 0.30 分,而研究者未曾察覺,逕自把十題的截距全部設為相等,那麼這多出來的 0.60 分無處可去,只能被模型分攤到潛在平均數上,使偏鄉的潛在憂鬱平均數遭到高估。若真實的潛在平均數差異其實只有 0.10 個標準差,估計值卻可能來到 0.25 個標準差,結論便從「兩地差異微小」變成「兩地差異中等」。反過來說,若不等的截距一半偏高、一半偏低,偏誤會彼此抵銷,忽略部分不變性的後果反而輕微。可見偏誤的大小不取決於有幾個參數不等,而取決於不等的方向是否一致。因此部分不變性並非免除檢驗責任的通行證,而是一項需要謹慎交代、並如實評估其對結論影響的權宜安排。
此處另有一項近年受到重視的補充視角:不變性的違反不僅是「有或無」的顯著性問題,更是「幅度多大、是否具實務重要性」的效果量問題。Nye & Drasgow (2011) 針對 CFA 架構的測量等值分析提出效果量指標 d_{\mathrm{MACS}},其構想是把某道題目因負荷與截距不等所導致的期望反應差異,在潛在分數的分布上加以整合,換算為以指標標準差為單位的標準化差異。這使研究者得以區分「統計上顯著但實務上可忽略」與「確實足以扭曲比較」的不變性違反,恰與第八、九章反覆強調的「統計顯著不等於實質重要」一脈相承。把顯著性檢驗與效果量並陳,是評估部分不變性後果時較為完整的作法。
差異試題功能:IRT 取向
「不變性」是因素分析傳統的用語;在項目反應理論(第十七章)的傳統中,同一件事另有名稱,即差異試題功能(differential item functioning, DIF)。兩個傳統長期各自發展,用語不同、慣用的偵測程序不同,連發表的期刊社群也大致分屬兩邊,以致初學者常誤以為那是兩套彼此獨立的技術。實際上它所問的是同一個問題,一道題目是否對不同群體運作不同,只是改以 IRT 的語言表述:不談負荷與截距,改談鑑別度與難度;不看模型適配的變化,改看兩群的項目反應函數是否重合。本節先把 DIF 的定義與型態交代清楚,再回頭指出它與前幾節的層級架構如何一一對應,如下方方塊。
一道題目呈現 DIF,意指:對兩個「能力 \theta 相同、但來自不同群體」的受測者,答對該題的機率並不相同。以 IRT 的語言表述:若兩群的項目反應函數 P(\theta) 不重合,即存在 DIF。關鍵在「\theta 相同」這個條件,它把兩種截然不同的現象區分開來:
衝擊(impact):兩群在能力 \theta 的分布上確有差異(例如一群平均能力較高)。這是真實的群體差異,並非題目的問題。
DIF:在控制 \theta(即在相同能力)之後,題目仍運作不同。這才是題目層次的偏誤。
DIF 又分兩型:均勻 DIF(uniform DIF)指兩群僅在難度 b 上有差(反應函數平行位移);非均勻 DIF(non-uniform DIF)指兩群連鑑別度 a 亦不同(反應函數交叉)。偵測方法包括 Lord 的卡方檢定、概似比檢定(比較「題目參數是否可跨群相等」的巢狀模型),不依賴 IRT 參數化的 Mantel-Haenszel 法,以及可同時偵測均勻與非均勻 DIF 的次序性邏輯迴歸法(在總分或估計能力上迴歸,檢驗群體主效果與群體\times能力交互作用)(Holland & Wainer, 1993)。
此處再次可見第十七章所揭示的統一:MG-CFA 的不變性與 IRT 的 DIF,實為同一問題的兩種語言。負荷不變性遭違反,約略對應非均勻 DIF(鑑別度不同);截距或閾值不變性遭違反,約略對應均勻 DIF(難度不同)。無論由因素分析或 IRT 的路徑進入,處理的都是同一問題:題目在群體之間是否對等。衝擊與 DIF 的分別,也以數字說明最為清楚。設想憂鬱量表中「我最近常常掉眼淚」這一題,男性樣本勾選「經常如此」的比例為 0.28,女性為 0.45,相差 0.17。若把兩群中憂鬱潛在分數同樣落在 \theta = 0 的人挑出來單獨比較,男性的比例為 0.30、女性為 0.44,仍相差 0.14,那麼原先那 0.17 之中真正來自憂鬱程度差異的部分極小,絕大部分是題目層次的不對等,屬於 DIF。反之,若在 \theta = 0 的條件下兩群的比例分別是 0.31 與 0.33,幾乎重合,則原先的 0.17 就純屬衝擊,反映的是女性樣本的憂鬱分布整體偏高,題目本身並無問題。與前一節相呼應,DIF 分析同樣發展出效果量取向的判準(例如以期望分數差異為基礎的整合指標),用以評估某題的 DIF 是否大到足以影響量表層次的測驗分數,因為個別題目的 DIF 有時會在加總時彼此抵銷,量表整體未必受實質影響。
除了因素分析與 IRT 這兩條傳統路徑,第十八章所述的解釋型 IRT 還提供了第三種、也更為統一的視角:把 DIF 直接寫成廣義線性混合模型中「群體 \times 試題」的交互作用項。在這個框架下,偵測 DIF 不過是檢驗某個交互作用係數是否為零,於是它與多層次模型、與以受試者或試題特徵解釋參數的整套機制,共用同一副骨架。這一視角的好處,是讓 DIF 不再是一個孤立的檢定程序,而能與試題特徵、受試者共變項一併納入單一模型,例如直接詢問「具有某種語言特徵的題目,是否系統性地對某語言群體較難」,把 DIF 由「哪幾題有問題」推進到「為什麼這些題有問題」。
錨定問題
DIF 偵測潛藏一個深刻且至今缺乏完美解答的難題,即錨定(anchoring)。前幾節談的都是發現不對等之後該如何處置,本節要退一步問一個更根本的問題:憑什麼判定某一題不對等?任何 DIF 指標都是在比較兩群受測者於某題上的表現,而這樣的比較,只有在兩群的能力量尺已經對齊之後才有意義。量尺的對齊並非憑空得來,它必須倚賴一組被假定為「乾淨」的題目來建立。於是整套程序的可信度,最後全落在一個看似技術性、實則相當棘手的選擇上:哪些題目有資格充當共同的參照。
要判斷某題是否具有 DIF,必先把兩群的能力量尺對齊;而對齊需要一組「假設不具 DIF」的錨定題(anchor items)作為共同參照。問題在於:若選作錨的題目本身即帶有 DIF,整個量尺的對齊便遭汙染,連帶使所有題目的 DIF 判斷失準;而研究者偏偏是在「尚不知道哪些題有 DIF」的情況下選錨的。這形成一個近乎循環的困境:欲偵測 DIF,需要乾淨的錨;欲確認錨乾淨,又須先偵測 DIF。
實務上發展出多種純化(purification)迭代程序以緩解此困境:先以全部題目暫定一個量尺、執行一輪 DIF 偵測、剔除疑似具 DIF 的題目、再以其餘題目重新對齊、再執行一輪,反覆至結果穩定。此外,錨定策略本身也有不同取捨:以「單一題」為錨簡潔但高風險(該題若有 DIF 則全盤皆錯),以「所有其他題」為錨較穩健但在 DIF 普遍時同樣受汙染,晚近則有各種以資料驅動挑選穩定錨題的程序(例如比較各候選錨題所導致的估計位移、擇其最一致者)。這些程序能改善問題卻無法根除,錨定至今仍是 DIF 分析在方法學上最棘手的環節之一。
前沿:對齊法、MNLFA 與近似不變性
傳統的不變性檢驗有一項現實痛點:當群體數目眾多時(例如跨數十國的比較),完全不變性幾乎必然無法達成,只要群體夠多,總會有若干題目在某些群體上不對等。這不只是耐心的問題。兩個群體時只需比對一組參數,三十個群體時要比對的參數組合數量暴增,逐級檢驗再依修正指標手動尋找部分不變性,既繁瑣又易流於武斷,而且每多看一次修正指標,就多累積一分以同一批資料窺探設定的風險。更根本的困難在於,前幾節所用的判準本質上是二分的:一個參數要嘛跨群相等,要嘛不等,中間沒有灰階。然而真實資料裡的不對等多半輕微而普遍,若一律判為違反,等於宣告大型跨國比較無法進行。近年數項發展正是為此而生,其共同思路是把「精確等於」鬆綁為「近似等於」。
對齊法(alignment method;(Asparouhov & Muthén, 2014))不再追求精確不變性,而改採近似不變性的思路:它以形貌不變模型為起點,自動搜尋一組參數配置,使「跨群不變性違反的總量」最小化,容忍少數較大的不等,換取多數參數的近似對齊。此法讓數十個群體的潛在平均數比較在實務上變得可行,而不必受困於「無一題完全不變」的僵局,並已成為大型跨國調查(如 PISA、ESS 類資料)分析的重要工具。調節非線性因素分析(moderated nonlinear factor analysis, MNLFA;(Bauer, 2017) 提出的一般化框架)則把不變性推廣至連續的調節變項。傳統作法僅能處理離散群體(男/女、甲國/乙國),MNLFA 則容許測量參數為「年齡」這類連續變項的函數,研究者得以直接詢問「這道題的難度是否隨年齡連續變化」,而不必勉強把年齡切割為若干組,這在發展與縱貫研究中尤具價值。與此並行的是貝氏取向的近似不變性:以小變異數先驗(承第十五章)取代精確的等同約束,允許跨群參數存在細微差異而不視為違反,藉此在「完全自由」與「完全等同」之間取得折衷。近年亦有以正則化(regularization,承第十一、十六章)自動偵測非不變參數的取向,透過對跨群差異施加懲罰,讓資料自行判定哪些參數應被放行,藉以緩解「依修正指標逐一放行」的資料窺探風險。這些取向雖各有假設與限制,但共同標誌著測量不變性研究由二分的「不變/不不變」判準,走向更細緻的幅度評估與自動化辨識。
測量不變性與預測不變性:一個弔詭
本章至此所談的測量不變性,關切的是「量表在不同群體是否以相同方式運作」,這是一個純粹關於測量的性質。但在甄選與預測的脈絡中,還有另一種同名而異義的不變性,即預測不變性(predictive invariance):以測驗分數去預測某個外部效標,如工作表現、學業成就時,其迴歸方程式是否跨群相同。一份直覺上「公平」的甄選工具,似乎應同時具備這兩種不變性,即量表對各群體測得一樣準,且分數對各群體預測得一樣準。
然而 Millsap (1997) 證明了一個令人不安的弔詭:在一般條件下,測量不變性與預測不變性其實無法同時成立。更精確地說,若一份量表具有嚴格的測量不變性,而各群體在潛在構念上的分布又確有差異,那麼它對效標的預測通常就不會是不變的;反之亦然。兩者只有在極為特殊、現實中鮮少滿足的條件下才能相容。這個結果的深刻之處在於,它揭示了「公平」本身並非單一而融貫的概念:測量意義上的公平,即同樣的構念、同樣的測量,與預測意義上的公平,即同樣的迴歸、同樣的錄取後果,是兩個在數學上彼此拉扯的目標,追求其一往往意味著犧牲其二。
這個弔詭把本章的技術議題,與測驗使用的公平性正式接軌,也是全書由「技術層次的 DIF 與不變性」通往「使用層次的公平與正義」這條敘事線的樞紐。測量不變性檢驗的是量表本身是否對等;預測不變性,連同其背後的甄選效用、差別預測、以及不同公平定義之間的不可能結果,則牽涉制度如何運用分數、又對誰造成何種後果,這一層的完整討論,包含 Cleary 差異預測模型、演算法公平的不可能定理及其在心理計量文獻中的先聲,留待第二十七章。本章在此只確立一件事:一個量表縱使通過了最嚴格的測量不變性檢驗,也不因此自動保證它在使用上是公平的。
實務準則與縱貫不變性
綜合本章可歸納為一份實務準則。第一,在進行任何跨群體或跨時間的比較之前,先檢驗不變性,勿將其視為可有可無的附加步驟。第二,明確說明所達到的層級:欲比較平均數,即須報告已達截距不變性;未達到者應據實陳述,並限縮結論的範圍。第三,若僅達部分不變性,務必謹慎詮釋,並如實評估「被忽略的不等」對結論可能造成的偏誤,同時報告效果量以判斷其實務重要性,而非僅呈現顯著與否。第四,勿過度依賴 \Delta\mathrm{CFI} < .01 這類單一門檻,應多指標並看並輔以實質判斷,且按 Chen (2007) 的提醒,依樣本大小與群組均衡程度調整判準。第五,DIF 分析須正視錨定問題,採用純化程序並清楚交代選錨方式。Putnick & Bornstein (2016) 對報告規範的整理,可作為撰寫不變性分析結果時的實用檢核依據。
另有一個常遭遺忘的場域,即縱貫不變性。當研究欲探討「同一群人隨時間的變化」時,無論是成長模型(第二十九章)或密集縱貫的動態模型(第三十章),同樣需要跨時點的測量不變性;否則,研究者以為的「構念改變了」,可能只是「量表在不同時點的運作改變了」。此道理與跨群體比較完全相同,只是把「群組」換成「時點」。縱貫情形另有其特有的複雜性,例如同一受測者在相鄰時點的殘差往往相關,須在模型中納入相關殘差,否則會扭曲不變性檢驗。Vandenberg & Lance (2000) 對整套實務程序作了經典的整理,Millsap (2011) 則提供了最嚴謹的統計處理,兩者皆為值得深入的參考。
小結
測量不變性,是一切比較的隱形前提。本章的核心可濃縮為數點:多群組 CFA 的不變性層級(形貌、量尺、截距、嚴格)與 IRT 的 DIF,是同一問題的兩種語言;所欲進行的比較種類,決定了所需的不變性層級(比較平均數須達截距不變性);部分不變性是常態,但須誠實面對其所帶來的偏誤,並以效果量評估其實務重要性;而 \Delta\mathrm{CFI} 門檻、錨定問題、對齊法與近似不變性,則分別是這個領域的常用工具、未解難題與前沿解方。
本章其實把全書數條線索收攏在一處:它是第七章效度的延伸(分數在群體之間是否具有相同意義)、第二章「可比較性」古老問題的當代形式、第十五與十七章 CFA-IRT 統一的又一次體現,也是第二十九章縱貫研究能否談論「變化」的前提。至此,以連續潛在變項為核心的測量模型已大致完備。接下來的第二十章,將轉向另一類潛在變項模型,即以「類別」而非「連續」的潛在變項來刻畫受測者的潛在類別與混合模型;而把這些測量理論落實到測驗編製與電腦化適性測驗等最實際的層面,則是第五部(第二十二、二十四章)的主題。