第 18 章

縱貫因素分析與跨時間的測量恆等性

多層次那一部的模型把結果變項當成給定的,一個在每一個時點都指同一件事的數字。從這裡開始的結構方程 (structural equation) 那一部要質疑這個假設,而它以測量 (measurement) 開場是有理由的:這個架構對「變化的研究」最獨特的貢獻,正是它能問一個工具 (instrument) 是不是在每一個波次都以同樣的方式測量同一個構念 (construct),並且在答案是「是」之前拒絕比較分數。這就是第 3 章寫下、而由本章來兌現的那張支票。如果一份憂鬱量表的題目在收案時與在追蹤時的運作方式不同,可能是因為某個症狀被重新解讀了、反應量尺位移了,或某一題的意義漂移了,那麼總分的改變就把憂鬱的真實變化與測量的變化混在一起,而前面幾章那些優雅的成長模型估計的,就是一個假象的軌跡。縱貫測量恆等性 (longitudinal measurement invariance) 是使那項比較取得許可的性質,而檢定它既不是一道預備關卡,也不是一項官僚儀式:恆等性的失敗本身就是一項關於「一個構念如何被測量、如何被理解」的發現。本章設定縱貫因素模型,以讀者必須掌握的那套精確簿記執行恆等性檢定序列,處理「恆等性部分失敗」這個常見情形,把這套做法延伸到類別題目,並以模擬示範忽略整個問題要付出多少代價。

學習目標

讀完本章之後,你應該能夠:(1) 設定一個帶相關獨特性 (correlated uniquenesses) 的縱貫驗證性因素模型 (confirmatory factor model),並為那個設定辯護;(2) 執行形貌 (configural)、量尺 (metric)、截距 (scalar) 與嚴格 (strict) 恆等性序列,並在每一步都做對識別 (identification);(3) 以配適差異 (fit-difference) 準則裁決恆等性,同時知道那些準則的限制;(4) 定位非恆等的參數,並實施一個站得住腳的部分恆等性 (partial invariance);(5) 在指標為類別 (categorical) 時執行恆等性檢定;(6) 以模擬說明忽略非恆等性如何使變化的估計產生偏誤;(7) 把一項恆等性分析報告到完備的程度。

18.1 縱貫測量模型

一個在數個時點以數個題目測量的構念,由一個縱貫驗證性因素模型 (longitudinal confirmatory factor model) 來表示:每個時點一個潛在因素 (latent factor),各由同一組指標 (indicator) 測量,而各因素之間可以自由共變。圖 18.1 為兩個時點畫出這個結構,它可以推廣到任意多個時點。使縱貫模型有別於「一疊各自獨立的橫斷因素模型」的關鍵特徵,在於它如何處理獨特性 (uniquenesses),也就是指標的殘差。同一道題目在兩個時點上共享的東西不只是共同因素:它還帶著一個屬於題目本身的成分,也就是那一道題目特有的、會跨時間持續下去、而且與構念無關的怪癖。一道詞彙題可能因為與語文能力無關的理由而穩定地偏簡單;一道問卷題可能一直被以某種特定方式解讀。這份共享的、屬於題目本身的變異數,會在同一題跨波次的殘差之間引出相關,而縱貫因素模型必須納入這些相關獨特性 (correlated uniquenesses)。省略它們並不只是少了一個干擾參數;它是把「屬於題目本身的穩定性」逼進唯一還留給它的那條路徑,也就是各因素之間的相關,因而灌大了構念本身被估計出來的穩定性。

一個帶相關獨特性的縱貫驗證性因素模型。
圖 18.1 一個帶相關獨特性的縱貫驗證性因素模型。

註:每個時點一個因素,各由同一組指標測量,而各因素之間可以自由共變。虛線箭頭就是相關獨特性,它把每個指標的殘差跨時間連到自己身上,捕捉屬於題目本身的穩定變異數。省略它們會把那份穩定性逼進因素共變數,灌大構念表面上的穩定性。此圖可推廣到任意多個波次。

這份偏誤不是假設性的,而圖 18.2 在本章跑的資料集上把它量了出來,那是一份模擬的四波、三指標投入感 (engagement) 量表,測量模型已知。納入相關獨特性時,估計出來的因素相關貼著它們的真值;省略它們時,每一個因素相關都被灌大,於是研究者會高估一個人在某一波的構念高低能多好地預測他在下一波的高低。因此相關獨特性是縱貫因素模型的預設骨架,不是一項可有可無的精緻化。

省略相關獨特性會灌大因素的穩定性。
圖 18.2 省略相關獨特性會灌大因素的穩定性。

註:投入感資料在納入與省略相關獨特性兩種情形下估計出來的波次間因素相關,對照它們的真值。省略相關殘差(紅)把每一個因素相關都往上推,高估了構念的穩定性。屬於題目本身的穩定變異數無處可去。

在各因素能夠跨時間比較之前,模型必須先被識別 (identified),而在一個帶平均數與共變數結構的模型中,識別是一套會把許多使用者絆倒的簿記。潛在變項本身沒有固有的尺度或原點,所以每一個因素都需要以慣例固定一個尺度與一個零點,而通行的尺度設定慣例 (scaling convention) 有三種:標記變項 (marker-variable) 法把一個負荷量固定為一、它的截距固定為零;固定因素 (fixed-factor) 法把因素變異數固定為一、因素平均數固定為零;效果編碼 (effects-coding) 法則約束各負荷量平均為一、各截距總和為零。這些慣例與恆等性約束互相牽動,因為一個給定的約束識別出什麼,取決於已經固定了什麼,而表 18.1 把這張對照表排了出來。實務上的守則是:挑一個慣例、一致地施用它,並在每一步都把每一個自由度 (degree of freedom) 交代清楚,而這正是本章從頭到尾示範的紀律。配適以第 8 章的那些指標評估,也就是比較配適指標 (comparative fit index, CFI)、近似均方根誤差 (root mean square error of approximation, RMSEA) 與標準化均方根殘差 (standardized root mean square residual, SRMR),對照它們慣用的基準來讀,並帶著一個標準的告誡:那些基準是從特定模擬條件得出的經驗法則,不是律法,在這裡當診斷用而不是當判決用。

表 18.1 尺度設定慣例,以及每一個恆等性步驟各約束了什麼。

慣例尺度由什麼設定對恆等性檢定的後果
標記變項一個負荷量 \(=1\),它的截距 \(=0\)標記那一題被假定為恆等;其餘負荷量與截距才受檢定
固定因素因素變異數 \(=1\),平均數 \(=0\)所有負荷量都放開受檢定;量尺恆等性成立之後,後面各波的變異數必須放開
效果編碼各負荷量平均 \(1\),各截距總和 \(0\)讓因素留在指標的計量上;把識別的重擔分散到各題

註:三種慣例給出相同的配適與相同的實質結論,但它們把識別用的約束放在不同的地方,因此每一個恆等性步驟所放開與所約束的自由度也不同。挑一個並一致地施用;本章的實作範例用的是標記變項法。

18.2 恆等性階梯

測量恆等性是以一系列巢套 (nested) 模型來檢定的,每一個都跨時間加上一組等式約束,也各自許可一種進一步的比較。圖 18.3 顯示這個序列在投入感量表上跑出來的結果,而那個型態正是研究的對象。形貌恆等性 (configural invariance) 只要求同樣的因素結構、也就是同樣的題目落在同樣的因素上,在每一個時點都成立;它確立構念跨時間具有相同的形式,但不許可任何量化的比較。量尺恆等性 (metric,或稱弱恆等性) 再加上各因素負荷量跨時間相等,而它許可的是「比較涉及該因素的共變數與迴歸斜率」,因為負荷量相等意味著該因素的一個單位在每一波都是同一個意思。截距恆等性 (scalar,或稱強恆等性) 再加上各指標截距跨時間相等,而它是研究變化最關鍵的一級,因為只有在負荷量與截距都恆等時,各潛在平均數才能跨時間比較,也就是說,只有那時潛在平均數的改變才反映構念的變化、而不是測量的漂移。嚴格恆等性 (strict invariance) 再加上各指標殘差變異數相等,而它許可的是「比較觀察到的複合分數 (composite score)」,因為只有那時,因素高低相同才隱含觀察分數的期望值相同。表 18.2 陳述每一級約束了什麼、是什麼意思、又許可了什麼。

恆等性階梯:配適一路撐住,直到加上截距恆等性。
圖 18.3 恆等性階梯:配適一路撐住,直到加上截距恆等性。

註:投入感量表上四個巢套恆等性模型的比較配適指標。形貌與量尺恆等性配適良好,所以各負荷量是恆等的;但一加上截距恆等性、也就是各截距相等,配適就垮掉了,因為有一個指標的截距漂移了。嚴格恆等性是在已經失敗的截距層之上再加等殘差。在這一步帶著訊息的是配適的「改變量」,不是它的絕對值。

在投入感資料上,這個序列說出一個清楚的故事。形貌模型配適良好,比較配適指標為 \(1.00\)、近似均方根誤差為 \(.006\)。量尺恆等性成立:把四個波次的負荷量約束為相等,卡方只變動 \(1.9\)、自由度為 \(6\),遠遠不到顯著,而各配適指標也沒有變。截距恆等性則決定性地失敗:把各截距約束為相等,卡方惡化 \(374\)、自由度為 \(6\),而比較配適指標掉了 \(.079\),由 \(1.00\) 降到 \(.92\)。故事是:各題目跨時間以完全相同的方式落在該構念上,所以構念的意義相同;但至少有一題的截距漂移了,所以觀察到的分數並不在共同的基準上,各潛在平均數還不能拿來比較。要裁決這件事需要決策準則,而本章的政策,依循報告方面的文獻,是把好幾個都報出來。卡方差異檢定是精確的,但對樣本數敏感,在大樣本中會把無關緊要的非恆等性也標出來;比較配適指標的改變量,其經驗門檻在 \(.01\) 附近,以及近似均方根誤差的改變量,比較不受樣本數左右,但它們當初是為跨組 (multi-group) 而非跨時間的比較校準的,這項轉用應該註明;而一個關於非恆等性大小的效果量 (effect size) 度量則補完整張圖。表 18.3 收齊了這些準則與它們的告誡。這裡每一個準則都給出一致的結論,因為植入的違反很大;但誠實的分析者會把整組報出來,不會只靠單一個切點。

表 18.2 恆等性階梯:約束、意義,以及所許可的比較。

層級跨時間約束什麼許可什麼
形貌同樣的因素型態構念具有相同的形式;不許可量化比較
量尺負荷量比較共變數與迴歸斜率
截距負荷量與截距比較潛在平均數(也就是變化)
嚴格負荷量、截距、殘差比較觀察到的複合分數

註:每一級加上約束,也許可一種進一步的比較。研究潛在變化需要截距恆等性,因為只有負荷量與截距都相等,因素平均數的改變才是一項關於構念、而不是關於測量的陳述。複合分數則是默默地假定了嚴格那一級。

基礎概念 • Meredith 的形式化與選擇定理

恆等性階梯不是一串便宜行事的順序,而是從一個形式定義推出來的。Meredith (1993) 透過「給定真實構念之下觀察指標的條件分配 (conditional distribution)」來定義測量恆等性:當那個條件分配跨時點或跨組別都相同時,測量就是恆等的,於是兩個構念值相同的人,不論在何時何地被測量,都有相同的題目反應期望值。弱恆等性約束負荷量,強恆等性再加上截距,嚴格恆等性再加上殘差變異數,與上面的量尺、截距、嚴格三級一一對應。這個定義與一條選擇定理 (selection theorem) 綁在一起:若一個母體是依與該構念有關的變項選出來的,那麼因素恆等性在該選擇之下得以保留,恰恰就在測量參數為恆等的時候,而這正是為什麼恆等性是那個「使跨越被選擇過或不斷演變的母體之比較(包括同一批人在不同年齡)合法」的性質。這項形式化之所以要緊,是因為它顯示這些約束檢定的是一個關於測量歷程的融貫假設,而不只是一連串模型的配適。

表 18.3 裁決一個恆等性步驟的準則。

準則經驗法則告誡
卡方差異該步驟達顯著對樣本數敏感;\(N\) 大時會標出無關緊要的非恆等性
比較配適指標的改變量惡化超過約 \(.01\)當初是為跨組、不是為跨時間的比較校準的
RMSEA 的改變量惡化超過約 \(.015\)同樣有轉用的但書;比較不受樣本數左右
非恆等性的效果量差異的大小區辨「偵測得到」與「有實質後果」

註:沒有任何單一個準則能定案。本書的政策是把整組準則連同一個關於非恆等性大小的效果量度量一起報告,好讓「統計上偵測得到但實務上微不足道」的差異不會被誤認為有實質後果,反之亦然。

18.3 當恆等性失敗時

截距恆等性的失敗是分析的開始,不是結束。第一項工作是定位 (locate) 那個非恆等的參數。因為一個帶等式約束的模型會把肇事的參數藏起來,讓一般的修正指標 (modification index) 看不到它,那個指標是針對單一個模型計算的,所以鑑識用的工具是「評估放開每一個約束」的分數檢定 (score test),或者等價地,那個透明的做法:一次放開一個指標的截距、重新配適,看哪一個把配適救回來。圖 18.4 顯示結果:放開第二個指標的截距使比較配適指標回到 \(1.00\),而放開另外任一個都做不到,這就指認出第二題是元兇。定位出來的結果應該以理論加以盤問,而不是貪婪地追著跑,因為單純為了改善配適而放開約束會利用到機遇 (chance),也可能放開那些只是因為抽樣雜訊才看起來非恆等的參數。圖 18.5 直接顯示這個違反的解剖:第二個指標的負荷量最小,在第三與第四波卻顯示出相對於第一波最大的變化,這是恆等性之下不可能出現的型態;在恆等性之下,一道題目的變化應該正比於它的負荷量乘上該因素的變化。這一題的基線往上漂移了,在後面幾波對觀察分數的貢獻超過了構念所能保證的份量。

一次放開一個指標,把元兇定位出來。
圖 18.4 一次放開一個指標,把元兇定位出來。

註:把每一個指標的截距跨波次放開時,截距恆等模型的比較配適指標。放開第二個指標使配適回到 \(1.00\);放開另外任一個都仍然配適不良。這就指認出第二題是非恆等的那一題,也就是分數檢定的鑑識用法,而不是一次貪婪的搜尋。

非恆等性的解剖:有一題漂移得比它的負荷量所能預測的還多。
圖 18.5 非恆等性的解剖:有一題漂移得比它的負荷量所能預測的還多。

註:各指標相對於第一波的平均數變化。在恆等性之下,一道題目的變化等於它的負荷量乘上該因素的變化,所以負荷量最高的那一題應該變化最多。實際上卻是負荷量最小的第二題在第三、四波(陰影處)變化最多,這是截距向上漂移、而不是真正成長的特徵。

定位出違反之後,分析者採取部分恆等性 (partial invariance),把肇事的那個截距放開、其餘維持相等,這個做法由 Byrne et al. (1989) 引入。把第二個指標在第三、四波的截距放開,使配適回到比較配適指標 \(1.00\),各潛在平均數現在可以比較了,所依靠的是量表中仍然恆等的其餘部分、也就是那些定錨題目 (anchor items)。誠實的問題是:部分到什麼程度就太多了?哪些題目可以充當錨定?這兩個問題沒有現成的公式可套:一份大多數題目都漂移了的量表撐不起一個可信的比較,而站得住腳的做法是讓相當多數的題目維持恆等、以實質理由為定錨題目那一組辯護,並報告一項敏感度分析 (sensitivity analysis),顯示在其他放開方式之下結論依然成立。關鍵在於,非恆等性本身就是一項實質發現。一道漂移的題目已經改變了它與構念的關係,這可能反映受訪者的重新校準 (recalibration)、題目所測量的東西發生了位移,或構念呈現方式的真實改變,也就是第 3 章的異型連續性 (heterotypic continuity);而在臨床脈絡中,它與「反應轉移 (response shift)」那一支文獻相接,該文獻探討病人如何隨著病況演變而重新解讀一份量表。當完全恆等性站不住腳時,還有更有彈性的替代方案,包括透過貝氏小變異數先驗 (small-variance priors) 達成的近似恆等性 (approximate invariance),容許測量參數略有差異而不必完全相等,以及在許多組別或時點之間求取折衷最佳化的對齊法 (alignment method) (Asparouhov & Muthén, 2014),不過它們用於縱貫情境的指引仍在發展中。

18.4 類別指標

心理學的題目常常是次序 (ordinal) 的,只有少數幾個有序的反應類別而不是一條連續的量尺,這時恆等性檢定必須在類別背後的潛在反應分配 (latent response distribution) 上進行。每一道次序題被建模成一個潛在連續反應被一組閾值 (thresholds) 粗化 (coarsening) 的結果,而圖 18.6 把這個想法畫了出來:一道五類別的題目來自四個閾值把一條潛在常態反應切成有序的幾段。因此類別題目的恆等性關乎閾值也關乎負荷量,而兩者以一種需要特定檢定序列與特定識別約束的方式耦合在一起,這一點由 Wu and Estabrook (2016) 釐清,並由 Liu et al. (2017) 推廣到縱貫情境。估計通常採用加權最小平方 (weighted least squares) 法,對次序資料的非常態具穩健性,而不是用最大概似。表 18.4 對照連續與類別兩套程序。有一項實務上的考量接回第 6 章:加權最小平方估計式處理遺漏資料的方式,不如連續模型的完全訊息最大概似 (full-information maximum likelihood) 優雅,它使用一種近似成對 (pairwise) 的處理,假定了一個較嚴格的遺漏機制,所以遺漏量大的時候,配上穩健修正的最大概似做法,或者一個完全貝氏的處理,可能更好。在把投入感題目重新編碼成五個類別之後,形貌模型與「閾值與負荷量皆恆等」的模型都配適良好,示範了這套做法;完整的類別序列連同它那套細緻的識別,詳見所列文獻。

次序題目的那套做法:閾值把潛在反應切成幾個類別。
圖 18.6 次序題目的那套做法:閾值把潛在反應切成幾個類別。

註:一道五類別的次序題目,被建模成一個潛在連續反應變項被四個閾值粗化的結果。類別題目的恆等性檢定在潛在反應的尺度上把負荷量與閾值一起加以約束,並以穩健加權最小平方而不是最大概似估計。

表 18.4 連續與類別兩套恆等性程序的比較。

面向連續指標類別指標
受檢定的參數負荷量、截距、殘差負荷量、閾值、殘差
估計式最大概似穩健加權最小平方
尺度設定標記、固定因素或效果編碼再加上 delta 或 theta 參數化
遺漏資料完全訊息最大概似近似成對;假定較嚴格

註:類別恆等性以潛在反應上的閾值取代截距,並把它們與負荷量耦合,因而需要特定的序列與識別 (Liu et al., 2017; Wu & Estabrook, 2016)。這個估計式在遺漏資料上的處理較弱,是遺漏量大時偏好「最大概似配上穩健修正」的一個理由。

18.5 這番工夫為什麼要緊

整套做法的動機在於:忽略非恆等性會使變化的研究產生偏誤,而一項模擬把代價變得具體。圖 18.7 顯示在三種分析選擇之下,投入感構念被還原出來的潛在平均數軌跡,對照已知的真值。真值是每一波穩定成長 \(0.4\)。複合分數,也就是各題目的平均,默默地假定了嚴格恆等性,它高估了後期的成長,因為漂移的那一題在第三、四波把複合分數灌大了。一個錯誤地施加完全截距恆等性的因素模型也一樣,它把那一題的漂移歸給了因素平均數。只有部分恆等模型,也就是把漂移的那個截距放開的模型,還原出真正的軌跡。這份偏誤不是捨入誤差:在最後一波,複合分數估出的變化是 \(1.44\),真值是 \(1.20\),也就是把構念的成長高估了 \(20\)%;而圖 18.8 顯示,這份高估會隨漂移增大而無上限地擴大,部分恆等的估計值則不論如何都留在真值附近。這項模擬就是結構方程那一部「測量優先」序列的論據:一個成長模型不論多精巧,都會繼承它所配適的那些分數的偏誤,而第 20 章的二階成長模型 (second-order growth model),也就是把軌跡配適到恆等的潛在因素而不是配適到複合分數的那個模型,才是恰當的補救。從一項恆等性分析取出因素分數 (factor scores)、再把它們餵進一個成長模型,是一條誘人的捷徑,但它帶著自己的風險,因為那些分數是帶著誤差估計出來的,而第二階段忽略了那份誤差,這是一個代入 (plug-in) 問題,最好靠「把測量模型與成長模型聯合配適」來避開。

忽略非恆等性會扭曲成長軌跡。
圖 18.7 忽略非恆等性會扭曲成長軌跡。

註:在三種分析選擇之下還原出來的投入感構念潛在平均數變化,對照已知的真值。複合分數與那個錯誤地施加完全截距恆等性的因素模型都高估了後期的成長,因為漂移的那一題把它們灌大了;只有部分恆等模型還原出真正的軌跡。這就是「測量優先」地分析變化的論據。

偏誤隨漂移增大。
圖 18.8 偏誤隨漂移增大。

註:以截距漂移的大小為橫軸,複合分數與部分恆等模型所估計的第一波到第四波潛在變化。複合分數的估計值隨漂移增大而灌水;部分恆等模型的估計值則留在真值附近。非恆等性不會自我修正,漂移越大,偏誤也越大。

18.6 報告一項恆等性分析

一項恆等性分析要報告到讓讀者能跟上每一個約束、重現每一個決定的程度,而這個領域也記錄了這種報告向來有多不齊整 (Putnick & Bornstein, 2016)。報告要陳述縱貫因素模型,包括相關獨特性與尺度設定慣例;把模型序列以一張表呈現,附上每一個模型的配適與每一步的配適差異;指名任何非恆等的參數以及定位它們的證據;陳述部分恆等的決定與定錨的邏輯;並報告一項敏感度分析,顯示實質結論在其他部分恆等設定之下仍然成立。表 18.5 就是那份檢核表,也是每一篇這類論文都需要的那張序列表的範本。書面報告要在非恆等性出現的地方以實質意義去解讀它,而不是把它當成技術性的但書埋掉,因為一道漂移的題目就是一項關於該構念的發現。

表 18.5 恆等性的報告檢核表與序列表範本。

要素要報告什麼
測量模型各因素、指標、相關獨特性,以及尺度設定慣例
序列表每一個模型連同它的配適指標,以及每一步的配適差異
決策準則卡方差異、各配適指標的改變量,以及一個效果量
非恆等的參數哪些參數被放開,以及定位它們的證據
部分恆等的邏輯定錨題目,以及放開那一組的理由
敏感度在其他部分恆等設定之下的結論

註:那張序列表,一個模型一列、欄位放各配適指標與它們的差異,是每一篇恆等性論文都需要的展品。非恆等性要被報告出來並以實質意義解讀,不要藏起來,因為題目漂移就是一項發現。

18.7 在 R 中執行恆等性序列

縱貫因素模型與恆等性約束在 lavaan 中的設定方式,是為那些要跨波次維持相等的參數加上標籤。相關獨特性則以「每一個指標與跨時間的自己」之間的殘差共變數加進去。

library(lavaan)
config <- '
  f1 =~ 1*y1w1 + L2_1*y2w1 + L3_1*y3w1     # 各波負荷量自由(形貌)
  f2 =~ 1*y1w2 + L2_2*y2w2 + L3_2*y3w2
  f3 =~ 1*y1w3 + L2_3*y2w3 + L3_3*y3w3
  f4 =~ 1*y1w4 + L2_4*y2w4 + L3_4*y3w4
  y1w1 ~~ y1w2 + y1w3 + y1w4                # 相關獨特性 ...
  y2w1 ~~ y2w2 + y2w3 + y2w4                # ... 同一題跨波次
  y3w1 ~~ y3w2 + y3w3 + y3w4  '
m_config <- sem(config, data = engage_long, meanstructure = TRUE)

量尺恆等性讓各負荷量跨波共用一個標籤(L2、L3);截距恆等性再讓截距共用標籤並放開各潛在平均數;嚴格恆等性再讓殘差共用標籤。相鄰的模型以 anova 比較,它們的配適以 fitMeasures 取得。

anova(m_config, m_metric, m_scalar, m_strict)          # 巢套的卡方檢定
fitMeasures(m_scalar, c("cfi","rmsea","srmr"))          # 各層級的配適
# 定位違反:放開一個指標的截距再配適一次,
# 或用 lavTestScore(m_scalar) 對那些等式約束做分數檢定。
# 次序題目:sem(..., ordered = c("oy1w1", ...), estimator = "WLSMV")

隨附的腳本 ch18_analysis_V01.R 收錄了完整的分析,包括相關獨特性的偏誤示範、附自由度交代的完整階梯、定位與部分恆等性的修補、潛在平均數的還原、後果模擬,以及次序模型的配適;圖形則由中文版的 ch18_figures_zh_V01.R 繪出,資料集由 gen_engage_long_V01.R 產生。該分析把等式約束明白寫出來以求透明;實務上 semTools 套件會把整個序列自動化。

軟體提示 • 恆等性檢定的工具

semTools 套件透過它的 measEq.syntax 函式自動建出縱貫恆等性模型,它會在任何一種尺度設定慣例之下產生各層級帶標籤的 lavaan 語法,並以正確的閾值與參數化處理類別的情形,所以實務上並不需要手寫那些約束;本章寫出明白的語法,是為了理解那個函式產生的是什麼。在 Mplus 中,這個序列透過 MODEL = CONFIGURAL METRIC SCALAR 這個便利選項要求,類別模型的穩健卡方差異則透過 DIFFTEST。blavaan 套件以第 17 章的貝氏估計配適同樣的模型,那也是透過「在測量參數的差異上放小變異數先驗」達成近似恆等性的路徑,是對這裡所檢定的那種嚴格等式約束的一種貝氏鬆綁。

18.8 常見的迷思

關於恆等性,有幾個信念會誤導讀者。第一個是恆等性是一道預備關卡,不是科學;恆等性的失敗是一項關於「一個構念如何被測量、如何被理解」的實質發現,而題目漂移可能是一項研究中最有意思的結果。第二個是卡方差異檢定太敏感,應該整個忽略;它對樣本數敏感,這是把它連同效果量與配適差異指標一起報告的理由,不是把它丟掉的理由。第三個是一對相反的錯誤:放開單一個負荷量就會使整個分析失效,以及應該把修正指標建議的東西都放開;真相是,帶著充分理由、只放開少數參數的部分恆等性,仍然支持有效的比較,而貪婪地放開則會利用到機遇。第四個是複合分數可以繞過恆等性這個問題;它們不能,它們默默地假定了嚴格那一級,而後果模擬顯示了那個假定為假時的代價。第五個是只要模型配適得好,各潛在平均數就可以比較;只有在截距恆等性、至少是部分截距恆等性成立之後,它們才可以比較。

常見陷阱 • 恆等性實作上的四個錯誤

第一,省略相關獨特性:少了它們,屬於題目本身的穩定性就會灌大各因素相關與構念表面上的穩定性(圖 18.2)。第二,沒有截距恆等性就比較潛在平均數:那時的平均數差異把構念的變化與截距的漂移混在一起。第三,貪婪地追著修正指標跑:要以實質理由、配上敏感度分析放開參數,不是為了把配適推到最大。第四,把配適指標的切點當成律法:那些配適改變量的門檻是為特定條件校準的,是診斷而不是判決;請報告好幾個準則。

本章摘要

縱貫測量恆等性是那個許可跨時間比較一個構念的性質,而檢定它是結構方程取向之變化研究的測量基礎。縱貫因素模型每個時點放一個因素、各由同一組指標測量,並帶著捕捉題目本身穩定性的相關獨特性,而省略它們會灌大構念被估計出來的穩定性(圖 18.1 與圖 18.2)。識別依循三種尺度設定慣例之一,一致地施用並把自由度完全交代清楚(表 18.1)。恆等性階梯,形貌、量尺、截距、嚴格,逐步加上約束,依序許可共變數的比較、平均數的比較與複合分數的比較(圖 18.3、表 18.2),並由 Meredith 的形式化推得;各步驟以好幾個準則裁決,沒有一個單獨足以定案(表 18.3)。恆等性失敗時,違反以鑑識的方式定位,並以帶著充分理由的定錨題目實施部分恆等性來修補(圖 18.4 與圖 18.5),而那份漂移要被解讀成一項發現。類別題目在它們的閾值上以穩健加權最小平方檢定(圖 18.6、表 18.4)。這番工夫之所以要緊,是因為忽略非恆等性會使變化的軌跡產生偏誤:複合分數與那個錯誤地施加恆等性的模型都高估了成長,而部分恆等模型還原出真值(圖 18.7 與圖 18.8),這就是後面幾章「測量優先、二階取向」的論據。這項分析要報告到一份完整序列表的標準(表 18.5)。

接下來要去哪裡

本章是結構方程那一部其餘內容所依託的測量基礎。第 19 章配適潛在成長曲線模型,揭示它就是第 14 章那個成長模型的結構方程形式;第 20 章發展二階成長模型,把軌跡配適到本章那些恆等的潛在因素、而不是配適到複合分數,正是這裡所示範的那份偏誤的恰當補救。第 21 章把交叉延宕追蹤模型內部的恆等性假設攤開來說;第 22 章把這個問題延伸到跨潛在類別的恆等性。在密集縱貫那一部,第 25 章面對動態模型所假定的個體內因素結構。第 34 章大規模評量的垂直量尺化 (vertical scaling) 問題,則是換了一副面貌的恆等性問題。本章示範的紀律,也就是把每一個約束與每一個自由度都交代清楚,並把恆等性的失敗解讀成一項發現而不是一項麻煩,正是有測量意識的縱貫研究的工作習慣。

習題

  1. 18.1 設定並清點。在兩種尺度設定慣例之下,寫出一個三指標、四波次的縱貫因素模型語法,並為形貌到嚴格各模型做出自由度的交代。
  2. 18.2 跑一次階梯。在一份植入了非恆等截距的資料集上執行完整序列,定位違反、附理由把它放開,並報告序列表。
  3. 18.3 次序恆等性。以穩健加權最小平方估計式對次序題目配適形貌模型與閾值恆等模型,並解讀這項比較。
  4. 18.4 延伸後果。改變截距漂移的大小,畫出由此造成的潛在變化估計偏誤,重現斜率偏誤曲線。
  5. 18.5 把那一節寫出來。由所提供的輸出,寫出一項恆等性分析的測量與結果段落,並以實質意義解讀其中的非恆等性。

本章重要名詞中英對照

中文English說明/首次出現處
尺度設定慣例scaling convention為潛在變項固定尺度與原點的三種做法;第 18.1 節
縱貫驗證性因素模型longitudinal confirmatory factor model每個時點一個因素、各由同一組指標測量;第 18.1 節
獨特性uniqueness指標的殘差;第 18.1 節
相關獨特性correlated uniqueness同一題跨波次的殘差相關,捕捉題目本身的穩定變異數;第 18.1 節
標記變項法marker-variable method把一個負荷量固定為一、其截距為零;第 18.1 節
固定因素法fixed-factor method把因素變異數固定為一、平均數為零;第 18.1 節
效果編碼法effects-coding method各負荷量平均為一、各截距總和為零;第 18.1 節
形貌恆等性configural invariance各時點的因素型態相同;不許可量化比較;第 18.2 節
量尺恆等性(弱)metric / weak invariance再加上負荷量相等;許可比較共變數與斜率;第 18.2 節
截距恆等性(強)scalar / strong invariance再加上截距相等;許可比較潛在平均數;第 18.2 節
嚴格恆等性strict invariance再加上殘差相等;許可比較複合分數;第 18.2 節
部分恆等性partial invariance放開少數非恆等參數、其餘維持相等;第 18.3 節
定錨題目anchor item部分恆等性所倚靠的那些仍然恆等的題目;第 18.3 節
反應轉移response shift受訪者隨病況演變而重新解讀一份量表;第 18.3 節
對齊法alignment method在許多組別或時點之間求取折衷的最佳化做法;第 18.3 節
閾值threshold把潛在連續反應粗化成次序類別的切點(承第 15 章);第 18.4 節
複合分數composite score各題目的平均;默默假定嚴格恆等性;第 18.5 節

參考文獻

Asparouhov, T., & Muthén, B. (2014). Multiple-group factor analysis alignment. Structural Equation Modeling: A Multidisciplinary Journal, 21(4), 495–508. https://doi.org/10.1080/10705511.2014.919210

Byrne, B. M., Shavelson, R. J., & Muthén, B. (1989). Testing for the equivalence of factor covariance and mean structures: The issue of partial measurement invariance. Psychological Bulletin, 105(3), 456–466. https://doi.org/10.1037/0033-2909.105.3.456

Chen, F. F. (2007). Sensitivity of goodness of fit indexes to lack of measurement invariance. Structural Equation Modeling: A Multidisciplinary Journal, 14(3), 464–504. https://doi.org/10.1080/10705510701301834

Cheung, G. W., & Rensvold, R. B. (2002). Evaluating goodness-of-fit indexes for testing measurement invariance. Structural Equation Modeling: A Multidisciplinary Journal, 9(2), 233–255. https://doi.org/10.1207/S15328007SEM0902_5

Little, T. D. (2013). Longitudinal structural equation modeling. Guilford Press.

Liu, Y., Millsap, R. E., West, S. G., Tein, J.-Y., Tanaka, R., & Grimm, K. J. (2017). Testing measurement invariance in longitudinal data with ordered-categorical measures. Psychological Methods, 22(3), 486–506. https://doi.org/10.1037/met0000075

Meredith, W. (1993). Measurement invariance, factor analysis and factorial invariance. Psychometrika, 58(4), 525–543. https://doi.org/10.1007/BF02294825

Millsap, R. E. (2011). Statistical approaches to measurement invariance. Routledge. https://doi.org/10.4324/9780203821961

Nye, C. D., & Drasgow, F. (2011). Effect size indices for analyses of measurement equivalence: Understanding the practical importance of differences between groups. Journal of Applied Psychology, 96(5), 966–980. https://doi.org/10.1037/a0022955

Putnick, D. L., & Bornstein, M. H. (2016). Measurement invariance conventions and reporting: The state of the art and future directions for psychological research. Developmental Review, 41, 71–90. https://doi.org/10.1016/j.dr.2016.06.004

Rosseel, Y. (2012). lavaan: An R package for structural equation modeling. Journal of Statistical Software, 48(2), 1–36. https://doi.org/10.18637/jss.v048.i02

van de Schoot, R., Lugtig, P., & Hox, J. (2012). A checklist for testing measurement invariance. European Journal of Developmental Psychology, 9(4), 486–492. https://doi.org/10.1080/17405629.2012.686740

Vandenberg, R. J., & Lance, C. E. (2000). A review and synthesis of the measurement invariance literature: Suggestions, practices, and recommendations for organizational research. Organizational Research Methods, 3(1), 4–70. https://doi.org/10.1177/109442810031002

Widaman, K. F., Ferrer, E., & Conger, R. D. (2010). Factorial invariance within longitudinal structural equation models: Measuring the same construct across time. Child Development Perspectives, 4(1), 10–18. https://doi.org/10.1111/j.1750-8606.2009.00110.x

Widaman, K. F., & Reise, S. P. (1997). Exploring the measurement invariance of psychological instruments: Applications in the substance use domain. In K. J. Bryant, M. Windle, & S. G. West (Eds.), The science of prevention: Methodological advances from alcohol and substance abuse research (pp. 281–324). American Psychological Association.

Wu, H., & Estabrook, R. (2016). Identification of confirmatory factor analysis models of different levels of invariance for ordered categorical outcomes. Psychometrika, 81(4), 1014–1045. https://doi.org/10.1007/s11336-016-9506-0