變化的分析游琇婷(Hsiu-Ting Yu)社會科學的縱貫、密集縱貫與動態資料分析

第 18 章

縱貫因素分析與跨時間的測量恆等性

多層次那一部把結果變項當成給定的:一個在每一個時點都指同一件事的數字。從這裡開始的結構方程(structural equation)那一部要質疑這個假設,而它以測量(measurement)開場自有道理。這個架構對變化研究最獨特的貢獻,就是能追問一個工具(instrument)是不是在每一個波次都以同樣的方式測量同一個構念(construct),並且在答案確定是「是」之前,拒絕比較分數。第 3 章寫下的那張支票,由本章來兌現。一份憂鬱量表的題目若在收案時與在追蹤時運作方式不同,可能是某個症狀被重新解讀、反應量尺位移,或某一題的意義漂移了,那麼總分的改變就把憂鬱的真實變化與測量的變化混在一起,前面幾章那些優雅的成長模型估到的,也就成了一條假象的軌跡。縱貫測量恆等性(longitudinal measurement invariance)正是讓那項比較取得許可的性質。檢定它既不是預備關卡,也不是官僚儀式:恆等性失敗本身就是一項發現,它告訴你一個構念是怎麼被測量、又是怎麼被理解的。本章設定縱貫因素模型,以你必須掌握的那套精確簿記跑完恆等性檢定序列,處理「恆等性部分失敗」這個常見情形,把這套做法延伸到類別題目,並以模擬示範忽略整個問題要付出多少代價。

學習目標

讀完本章之後,你應該能夠:(1) 設定一個帶相關獨特性(correlated uniquenesses)的縱貫驗證性因素模型(confirmatory factor model),並為這個設定辯護;(2) 跑完形貌(configural)、量尺(metric)、截距(scalar)與嚴格(strict)四級恆等性序列,每一步都把識別(identification)處理正確;(3) 以配適差異(fit-difference)準則裁決恆等性,同時知道這些準則的限制;(4) 定位非恆等的參數,並實施一個站得住腳的部分恆等性(partial invariance);(5) 在指標為類別(categorical)時檢定恆等性;(6) 以模擬說明忽略非恆等性如何使變化的估計產生偏誤;(7) 把一項恆等性分析報告到完備的程度。

18.1 縱貫測量模型

一個構念在數個時點以數個題目測量,就用一個縱貫驗證性因素模型(longitudinal confirmatory factor model)來表示:每個時點一個潛在因素(latent factor),各由同一組指標(indicator)測量,各因素之間可以自由共變。圖 18.1 為兩個時點畫出這個結構,時點再多也照樣推廣。縱貫模型與「一疊各自獨立的橫斷因素模型」的關鍵差別,在於它怎麼處理獨特性(uniquenesses),也就是指標的殘差。同一道題目在兩個時點上共享的不只是共同因素,還有一個屬於題目本身的成分:這一題特有、會跨時間持續、又與構念無關的怪癖。一道詞彙題可能因為與語文能力無關的理由而穩定地偏簡單;一道問卷題可能一直被讀成同一個意思。這份屬於題目本身的共享變異數,會在同一題跨波次的殘差之間引出相關,縱貫因素模型必須納入這些相關獨特性(correlated uniquenesses)。省略它們不只是少了一個干擾參數,而是把「屬於題目本身的穩定性」逼進唯一還留給它的那條路徑,也就是各因素之間的相關,於是構念本身估出來的穩定性就被膨脹了。

一個帶相關獨特性的縱貫驗證性因素模型。
圖 18.1 一個帶相關獨特性的縱貫驗證性因素模型。

註:每個時點一個因素,各由同一組指標測量,各因素之間可以自由共變。虛線箭頭就是相關獨特性,把每個指標的殘差跨時間連回自己身上,捕捉屬於題目本身的穩定變異數。省略它們,那份穩定性就被逼進因素共變數,膨脹構念表面上的穩定性。波次再多,此圖照樣推廣。

這份偏誤不是假設性的。圖 18.2 就在本章要跑的資料集上把它量了出來:一份模擬的四波、三指標投入感(engagement)量表,測量模型已知。納入相關獨特性時,估出來的因素相關貼著真值;省略它們時,每一個因素相關都被膨脹,研究者於是高估了一個人某一波的構念高低能多準確地預測這個人下一波的高低。相關獨特性因此是縱貫因素模型的預設骨架,不是可有可無的精緻化。

省略相關獨特性會膨脹因素的穩定性。
圖 18.2 省略相關獨特性會膨脹因素的穩定性。

註:投入感資料在納入與省略相關獨特性兩種做法下估出來的波次間因素相關,對照真值。省略相關殘差(紅)把每一個因素相關都往上推,高估構念的穩定性:屬於題目本身的穩定變異數無處可去。

各因素要能跨時間比較,模型得先識別(identified);而在帶平均數與共變數結構的模型裡,識別是一套會把許多使用者絆倒的簿記。潛在變項本身沒有固有的尺度或原點,每一個因素都得靠慣例固定一個尺度與一個零點。通行的尺度設定慣例(scaling convention)有三種:標記變項(marker-variable)法把一個負荷量固定為一、它的截距固定為零;固定因素(fixed-factor)法把因素變異數固定為一、因素平均數固定為零;效果編碼(effects-coding)法則約束各負荷量平均為一、各截距總和為零。慣例與恆等性約束互相牽動:一個約束識別出什麼,取決於已經固定了什麼。表 18.1 把這張對照排了出來。實務守則只有一條:挑一個慣例、一致地施用,每一步都把每一個自由度(degree of freedom)交代清楚,這也是本章從頭到尾示範的紀律。配適以三個常用的整體指標評估:比較配適指標(comparative fit index, CFI)、近似均方根誤差(root mean square error of approximation, RMSEA)與標準化均方根殘差(standardized root mean square residual, SRMR),對照慣用的基準來讀,同時記住一句標準的告誡:那些基準是從特定模擬條件得出的經驗法則,不是律法,在這裡是診斷用的,不是判決用的。

表 18.1 尺度設定慣例,以及每一個恆等性步驟各約束了什麼。

慣例尺度由什麼設定對恆等性檢定的後果
標記變項一個負荷量 \(=1\),它的截距 \(=0\)標記的那一題假定為恆等;受檢定的是其餘負荷量與截距
固定因素因素變異數 \(=1\),平均數 \(=0\)所有負荷量都放開受檢定;量尺恆等性成立後,後面各波的變異數必須放開
效果編碼各負荷量平均 \(1\),各截距總和 \(0\)讓因素留在指標的計量上;把識別的重擔分散到各題

註:三種慣例給出相同的配適、相同的實質結論,只是把識別用的約束放在不同地方,因此每一個恆等性步驟所放開與所約束的自由度也不同。挑一個,一致地施用;本章的實作範例用的是標記變項法。

18.2 恆等性階梯

測量恆等性以一系列巢套(nested)模型來檢定,每一個模型跨時間多加一組等式約束,也各自許可一種進一步的比較。圖 18.3 是這個序列在投入感量表上跑出來的結果,而那個型態本身正是研究的對象。形貌恆等性(configural invariance)只要求因素結構在每個時點都一樣,也就是同樣的題目落在同樣的因素上。它確立構念跨時間具有相同的形式,但不許可任何量化比較。量尺恆等性(metric)(又稱弱恆等性)再加上各因素負荷量跨時間相等,於是可以比較涉及該因素的共變數與迴歸斜率:負荷量相等,該因素的一個單位在每一波就是同一個意思。截距恆等性(scalar)(又稱強恆等性)再加上各指標截距跨時間相等,這是研究變化最關鍵的一級。負荷量與截距都恆等,各潛在平均數才能跨時間比較,潛在平均數的改變才反映構念的變化,而不是測量的漂移。嚴格恆等性(strict invariance)再加上各指標殘差變異數相等,許可的是比較觀察到的複合分數(composite score):到這一級,因素高低相同才隱含觀察分數的期望值相同。表 18.2 列出每一級約束了什麼、是什麼意思、又許可了什麼。

恆等性階梯:配適一路撐住,直到加上截距恆等性。
圖 18.3 恆等性階梯:配適一路撐住,直到加上截距恆等性。

註:投入感量表上四個巢套恆等性模型的比較配適指標。形貌與量尺恆等性都配適良好,可見各負荷量是恆等的;一加上截距恆等性,也就是各截距相等,配適就垮了,因為有一個指標的截距漂移了。嚴格恆等性是在已經失敗的截距層上再加等殘差。這一步帶著訊息的是配適的改變量,不是它的絕對值。

在投入感資料上,這個序列說出一個清楚的故事。形貌模型配適良好,比較配適指標為 \(1.00\)、近似均方根誤差為 \(.006\)。量尺恆等性成立:把四個波次的負荷量約束為相等,卡方只變動 \(1.9\)、自由度為 \(6\),遠遠不到顯著,各配適指標也沒有變。截距恆等性則決定性地失敗:把各截距約束為相等,卡方惡化 \(374\)、自由度為 \(6\),比較配適指標掉了 \(.079\),由 \(1.00\) 降到 \(.92\)。故事很清楚:各題目跨時間以完全相同的方式落在該構念上,構念的意義因此相同;但至少有一題的截距漂移了,觀察到的分數並不在共同的基準上,各潛在平均數還不能拿來比較。裁決這件事要靠決策準則,而本章依循報告方面的文獻,把好幾個準則一起報出來。卡方差異檢定精確,但對樣本數敏感,大樣本中連無關緊要的非恆等性也會標出來。比較配適指標的改變量(經驗門檻在 \(.01\) 附近)與近似均方根誤差的改變量則較不受樣本數左右,但它們當初是為跨組(multi-group)、不是為跨時間的比較校準的,這項轉用應該註明。再加上一個非恆等性大小的效果量(effect size)度量,整張圖才算補完。表 18.3 收齊了這些準則與各自的告誡。這裡每一個準則都給出一致的結論,因為植入的違反很大;但誠實的分析者會把整組報出來,不會只靠單一個切點。

表 18.2 恆等性階梯:約束、意義,以及所許可的比較。

層級跨時間約束什麼許可什麼
形貌同樣的因素型態構念具有相同的形式;不許可量化比較
量尺負荷量比較共變數與迴歸斜率
截距負荷量與截距比較潛在平均數(也就是變化)
嚴格負荷量、截距、殘差比較觀察到的複合分數

註:每一級多加一組約束,也多許可一種比較。研究潛在變化需要截距恆等性:只有負荷量與截距都相等,因素平均數的改變才是一項關於構念的陳述,而不是關於測量的陳述。複合分數則是默默假定了嚴格那一級。

基礎概念 • Meredith 的形式化與選擇定理

恆等性階梯不是便宜行事排出來的順序,而是從一個形式定義推出來的。Meredith (1993) 以「給定真實構念之下觀察指標的條件分配(conditional distribution)」定義測量恆等性:那個條件分配跨時點或跨組別都相同,測量就是恆等的;構念值相同的兩個人,不論何時何地受測,題目反應的期望值都一樣。弱恆等性約束負荷量,強恆等性再加上截距,嚴格恆等性再加上殘差變異數,與上面的量尺、截距、嚴格三級一一對應。這個定義還與一條選擇定理(selection theorem)綁在一起:母體若是依與該構念有關的變項選出來的,因素恆等性能在這道選擇之下保留下來,恰恰就在測量參數恆等的時候。恆等性因此是那個讓「跨越被選擇過或不斷演變的母體去比較」合法的性質,同一批人在不同年齡也包括在內。這項形式化要緊,是因為它顯示這些約束檢定的是一個關於測量歷程的融貫假設,不只是一連串模型的配適。

表 18.3 裁決一個恆等性步驟的準則。

準則經驗法則告誡
卡方差異該步驟達顯著對樣本數敏感;\(N\) 大時會標出無關緊要的非恆等性
比較配適指標的改變量惡化超過約 \(.01\)當初是為跨組、不是為跨時間的比較校準的
RMSEA 的改變量惡化超過約 \(.015\)同樣有轉用的但書;較不受樣本數左右
非恆等性的效果量差異的大小區辨「偵測得到」與「有實質後果」

註:沒有單一個準則能定案。本書的做法是把整組準則連同一個非恆等性大小的效果量度量一起報告,免得「統計上偵測得到、實務上微不足道」的差異被誤認為有實質後果,反過來也一樣。

18.3 當恆等性失敗時

截距恆等性失敗是分析的開始,不是結束。第一項工作是定位(locate)那個非恆等的參數。帶等式約束的模型會把肇事的參數藏起來,一般的修正指標(modification index)看不到它,因為那個指標是針對單一個模型算的。鑑識用的工具是分數檢定(score test),它評估放開每一個約束的後果;等價而且更透明的做法,是一次放開一個指標的截距、重新配適,看哪一個把配適救回來。圖 18.4 給出結果:放開第二個指標的截距,比較配適指標回到 \(1.00\),放開另外任一個都做不到,第二題就是元兇。定位出來的結果要拿理論盤問,不要貪婪地追著跑。單純為了改善配適而放開約束會利用到機遇(chance),也可能放開那些只因抽樣雜訊才看起來非恆等的參數。圖 18.5 直接畫出這個違反的解剖。第二個指標的負荷量最小,在第三與第四波卻出現相對於第一波最大的變化,這在恆等性之下不可能發生:恆等時,一道題目的變化應該正比於它的負荷量乘上該因素的變化。這一題的基線往上漂移了,後面幾波對觀察分數的貢獻超過構念所能保證的份量。

一次放開一個指標,把元兇定位出來。
圖 18.4 一次放開一個指標,把元兇定位出來。

註:逐一把每個指標的截距跨波次放開時,截距恆等模型的比較配適指標。放開第二個指標,配適回到 \(1.00\);放開另外任一個都仍然配適不良。第二題就是非恆等的那一題。這是分數檢定的鑑識用法,不是一次貪婪的搜尋。

非恆等性的解剖:有一題漂移得比它的負荷量所能預測的還多。
圖 18.5 非恆等性的解剖:有一題漂移得比它的負荷量所能預測的還多。

註:各指標相對於第一波的平均數變化。恆等時,一道題目的變化等於它的負荷量乘上該因素的變化,負荷量最高的那一題應該變化最多。實際上變化最多的卻是負荷量最小的第二題,而且落在第三、四波(陰影處)。這是截距向上漂移的特徵,不是真正成長的特徵。

定位出違反之後,分析者改採部分恆等性(partial invariance):把肇事的那個截距放開,其餘維持相等。這個做法由 Byrne et al. (1989) 引入。把第二個指標在第三、四波的截距放開,配適回到比較配適指標 \(1.00\),各潛在平均數就可以比較了,靠的是量表中仍然恆等的其餘部分,也就是那些定錨題目(anchor items)。接著是兩個誠實的問題:部分到什麼程度算太多?哪些題目可以充當定錨?這兩個問題沒有現成公式可套。一份大多數題目都漂移了的量表撐不起可信的比較;站得住腳的做法,是讓相當多數的題目維持恆等,以實質理由為那一組定錨題目辯護,並報告一項敏感度分析(sensitivity analysis),顯示換一種放開方式結論依然成立。關鍵在於,非恆等性本身就是一項實質發現。一道漂移的題目已經改變了它與構念的關係,這可能反映受訪者的重新校準(recalibration)、題目所測量的東西位移了,或構念呈現方式的真實改變,也就是第 3 章的異型連續性(heterotypic continuity)。在臨床脈絡中,它接上反應轉移(response shift)這一支文獻,那支文獻探討病人如何隨病況演變而重新解讀一份量表。完全恆等性站不住腳時,還有更有彈性的替代方案:透過貝氏小變異數先驗(small-variance priors)達成的近似恆等性(approximate invariance),容許測量參數略有差異而不必完全相等;以及在許多組別或時點之間求取折衷最佳化的對齊法(alignment method) (Asparouhov & Muthén, 2014)。這些方法用於縱貫情境的指引仍在發展中。

18.4 類別指標

心理學的題目常常是次序(ordinal)的,只有少數幾個有序的反應類別,不是一條連續的量尺。這時恆等性檢定必須在類別背後的潛在反應分配(latent response distribution)上進行。每一道次序題都建模成一個潛在連續反應被一組閾值(thresholds)粗化(coarsening)的結果,圖 18.6 把這個想法畫了出來:一道五類別的題目,來自四個閾值把一條潛在常態反應切成有序的幾段。類別題目的恆等性因此既關乎閾值、也關乎負荷量,而兩者耦合的方式需要特定的檢定序列與特定的識別約束。這一點由 Wu and Estabrook (2016) 釐清,並由 Liu et al. (2017) 推廣到縱貫情境。估計改用加權最小平方(weighted least squares)法,對次序資料的非常態具穩健性,不用最大概似。表 18.4 對照連續與類別兩套程序。有一項實務考量接回第 6 章:加權最小平方估計式處理遺漏資料的方式,不如連續模型的完全訊息最大概似(full-information maximum likelihood)優雅,它用的是近似成對(pairwise)的處理,假定了較嚴格的遺漏機制。遺漏量大的時候,改用配上穩健修正的最大概似,或一個完全貝氏的處理,可能更好。把投入感題目重新編碼成五個類別之後,形貌模型與「閾值與負荷量皆恆等」的模型都配適良好,這套做法就示範完了;完整的類別序列連同它那套細緻的識別,詳見所列文獻。

次序題目的那套做法:閾值把潛在反應切成幾個類別。
圖 18.6 次序題目的那套做法:閾值把潛在反應切成幾個類別。

註:一道五類別的次序題目,建模成一個潛在連續反應變項被四個閾值粗化的結果。類別題目的恆等性檢定在潛在反應的尺度上一起約束負荷量與閾值,並以穩健加權最小平方估計,不用最大概似。

表 18.4 連續與類別兩套恆等性程序的比較。

面向連續指標類別指標
受檢定的參數負荷量、截距、殘差負荷量、閾值、殘差
估計式最大概似穩健加權最小平方
尺度設定標記、固定因素或效果編碼再加上 delta 或 theta 參數化
遺漏資料完全訊息最大概似近似成對;假定較嚴格

註:類別恆等性以潛在反應上的閾值取代截距,並把閾值與負荷量耦合,因而需要特定的序列與識別 (Liu et al., 2017; Wu & Estabrook, 2016)。這個估計式處理遺漏資料的能力較弱,這也是遺漏量大時偏好「最大概似配上穩健修正」的理由之一。

18.5 這番工夫為什麼要緊

整套做法的動機很單純:忽略非恆等性會使變化的研究產生偏誤,而一項模擬把代價變得具體。圖 18.7 是三種分析選擇之下還原出來的投入感構念潛在平均數軌跡,對照已知的真值。真值是每一波穩定成長 \(0.4\)。複合分數,也就是各題目的平均數,默默假定了嚴格恆等性。它高估了後期的成長,因為漂移的那一題在第三、四波把複合分數膨脹了。錯誤施加完全截距恆等性的因素模型也一樣,它把那一題的漂移歸給了因素平均數。只有部分恆等模型,也就是把漂移的那個截距放開的模型,還原出真正的軌跡。這份偏誤不是捨入誤差:最後一波複合分數估出的變化是 \(1.44\),真值是 \(1.20\),構念的成長被高估了 \(20\)%。圖 18.8 進一步顯示,這份高估會隨漂移增大而無上限地擴大,部分恆等的估計值則始終留在真值附近。這項模擬就是結構方程那一部「測量優先」序列的論據:成長模型再精巧,都會繼承它所配適的那些分數的偏誤。恰當的補救是第 20 章的二階成長模型(second-order growth model),把軌跡配適到恆等的潛在因素,而不是配適到複合分數。從一項恆等性分析取出因素分數(factor scores)再餵進成長模型,是一條誘人的捷徑,卻帶著自己的風險:那些分數是帶著誤差估計出來的,第二階段卻忽略了那份誤差。這是一個代入(plug-in)問題,最好靠「把測量模型與成長模型聯合配適」來避開。

忽略非恆等性會扭曲成長軌跡。
圖 18.7 忽略非恆等性會扭曲成長軌跡。

註:三種分析選擇之下還原出來的投入感構念潛在平均數變化,對照已知的真值。複合分數與那個錯誤施加完全截距恆等性的因素模型都高估了後期的成長,因為漂移的那一題把它們膨脹了;只有部分恆等模型還原出真正的軌跡。這就是「測量優先」分析變化的論據。

偏誤隨漂移增大。
圖 18.8 偏誤隨漂移增大。

註:以截距漂移的大小為橫軸,複合分數與部分恆等模型所估計的第一波到第四波潛在變化。複合分數的估計值隨漂移增大而膨脹,部分恆等模型的估計值則留在真值附近。非恆等性不會自我修正:漂移越大,偏誤也越大。

18.6 報告一項恆等性分析

一項恆等性分析要報告到讓讀者跟得上每一個約束、重現得了每一個決定的程度;這個領域也記錄過這類報告向來有多不齊整 (Putnick & Bornstein, 2016)。報告要陳述縱貫因素模型,包括相關獨特性與尺度設定慣例;以一張表呈現模型序列,附上每一個模型的配適與每一步的配適差異;指名非恆等的參數,並交代定位它們的證據;陳述部分恆等的決定與定錨的邏輯;報告一項敏感度分析,顯示實質結論在其他部分恆等設定之下仍然成立。表 18.5 就是那份檢核表,也是每一篇這類論文都需要的那張序列表的範本。非恆等性出現在哪裡,書面報告就要在哪裡以實質意義解讀它,不要當成技術性的但書埋掉:一道漂移的題目就是一項關於該構念的發現。

表 18.5 恆等性的報告檢核表與序列表範本。

要素要報告什麼
測量模型各因素、指標、相關獨特性,以及尺度設定慣例
序列表每一個模型連同它的配適指標,以及每一步的配適差異
決策準則卡方差異、各配適指標的改變量,以及一個效果量
非恆等的參數哪些參數被放開,以及定位它們的證據
部分恆等的邏輯定錨題目,以及放開那一組的理由
敏感度在其他部分恆等設定之下的結論

註:那張序列表一個模型一列、各欄放配適指標與它們的差異,是每一篇恆等性論文都需要的展品。非恆等性要報告出來並以實質意義解讀,不要藏起來:題目漂移就是一項發現。

18.7 在 R 中執行恆等性序列

在 lavaan 裡設定縱貫因素模型與恆等性約束,做法是為那些要跨波次維持相等的參數加上標籤。相關獨特性則以「每個指標與跨時間的自己」之間的殘差共變數加進去。

library(lavaan)
config <- '
  f1 =~ 1*y1w1 + L2_1*y2w1 + L3_1*y3w1     # 各波負荷量自由(形貌)
  f2 =~ 1*y1w2 + L2_2*y2w2 + L3_2*y3w2
  f3 =~ 1*y1w3 + L2_3*y2w3 + L3_3*y3w3
  f4 =~ 1*y1w4 + L2_4*y2w4 + L3_4*y3w4
  y1w1 ~~ y1w2 + y1w3 + y1w4                # 相關獨特性 ...
  y2w1 ~~ y2w2 + y2w3 + y2w4                # ... 同一題跨波次
  y3w1 ~~ y3w2 + y3w3 + y3w4  '
m_config <- sem(config, data = engage_long, meanstructure = TRUE)

量尺恆等性讓各負荷量跨波共用一個標籤(L2、L3);截距恆等性再讓截距共用標籤,並放開各潛在平均數;嚴格恆等性再讓殘差共用標籤。相鄰的模型以 anova 比較,配適以 fitMeasures 取得。

anova(m_config, m_metric, m_scalar, m_strict)          # 巢套的卡方檢定
fitMeasures(m_scalar, c("cfi","rmsea","srmr"))          # 各層級的配適
# 定位違反:放開一個指標的截距再配適一次,
# 或用 lavTestScore(m_scalar) 對那些等式約束做分數檢定。
# 次序題目:sem(..., ordered = c("oy1w1", ...), estimator = "WLSMV")

完整的分析收在隨附的腳本 ch18_analysis_V01.R 裡,包括相關獨特性的偏誤示範、附自由度交代的完整階梯、定位與部分恆等性的修補、潛在平均數的還原、後果模擬,以及次序模型的配適;圖形由中文版的 ch18_figures_zh_V01.R 繪出,資料集由 gen_engage_long_V01.R 產生。那份分析把等式約束明白寫出來以求透明,實務上 semTools 套件會把整個序列自動化。

軟體提示 • 恆等性檢定的工具

semTools 套件的 measEq.syntax 函式會自動建出縱貫恆等性模型:它在任何一種尺度設定慣例之下都能產生各層級帶標籤的 lavaan 語法,也以正確的閾值與參數化處理類別的情形。實務上不必手寫那些約束,本章把語法明白寫出來,是為了讓你看懂那個函式產生的是什麼。Mplus 用 MODEL = CONFIGURAL METRIC SCALAR 這個便利選項要求整個序列,類別模型的穩健卡方差異則用 DIFFTEST。blavaan 套件以第 17 章的貝氏估計配適同樣的模型,也是「在測量參數的差異上放小變異數先驗」以達成近似恆等性的那條路徑,等於對這裡所檢定的嚴格等式約束做一次貝氏鬆綁。

18.8 常見的迷思

關於恆等性,有幾個說法會誤導讀者。第一個是恆等性是一道預備關卡,不是科學。恆等性失敗是一項實質發現,它說的是一個構念如何被測量、如何被理解,而題目漂移可能是整項研究中最有意思的結果。第二個是卡方差異檢定太敏感,應該整個忽略。它對樣本數敏感,這是把它連同效果量與配適差異指標一起報告的理由,不是把它丟掉的理由。第三個是一對相反的錯誤:放開單一個負荷量就會使整個分析失效,以及修正指標建議放開什麼就放開什麼。真相是,帶著充分理由、只放開少數參數的部分恆等性仍然支持有效的比較,貪婪地放開才會利用到機遇。第四個是複合分數可以繞過恆等性這個問題。繞不過去。複合分數默默假定了嚴格那一級,而後果模擬已經顯示那個假定為假時的代價。第五個是只要模型配適得好,各潛在平均數就可以比較。要等截距恆等性、至少是部分截距恆等性成立之後,它們才可以比較。

常見陷阱 • 恆等性實作上的四個錯誤

第一,省略相關獨特性:少了它們,屬於題目本身的穩定性會膨脹各因素相關,也膨脹構念表面上的穩定性(圖 18.2)。第二,沒有截距恆等性就比較潛在平均數:這時的平均數差異把構念的變化與截距的漂移混在一起。第三,貪婪地追著修正指標跑:放開參數要有實質理由,還要配上敏感度分析,不是為了把配適推到最大。第四,把配適指標的切點當成律法:那些配適改變量的門檻是為特定條件校準的,是診斷,不是判決;請一次報告好幾個準則。

本章摘要

縱貫測量恆等性就是那個許可跨時間比較一個構念的性質,檢定它則是結構方程取向研究變化的測量基礎。縱貫因素模型每個時點放一個因素,各由同一組指標測量,並帶著捕捉題目本身穩定性的相關獨特性;省略它們會膨脹構念估出來的穩定性(圖 18.1 與圖 18.2)。識別依循三種尺度設定慣例之一,一致地施用,並把自由度完全交代清楚(表 18.1)。恆等性階梯由形貌、量尺、截距到嚴格,逐步加上約束,依序許可共變數的比較、平均數的比較與複合分數的比較(圖 18.3、表 18.2),而這座階梯由 Meredith 的形式化推得。各步驟以好幾個準則一起裁決,沒有哪一個單獨足以定案(表 18.3)。恆等性失敗時,違反要以鑑識的方式定位,再以有充分理由的定錨題目實施部分恆等性來修補(圖 18.4 與圖 18.5),而那份漂移本身要解讀成一項發現。類別題目則在閾值上以穩健加權最小平方檢定(圖 18.6、表 18.4)。這番工夫要緊,是因為忽略非恆等性會使變化的軌跡產生偏誤:複合分數與那個錯誤施加恆等性的模型都高估了成長,只有部分恆等模型還原出真值(圖 18.7 與圖 18.8),這就是後面幾章「測量優先、二階取向」的論據。整項分析要報告到一份完整序列表的標準(表 18.5)。

接下來要去哪裡

本章是結構方程那一部其餘內容所依託的測量基礎。第 19 章配適潛在成長曲線模型,揭示它就是第 14 章那個成長模型的結構方程形式。第 20 章發展二階成長模型,把軌跡配適到本章那些恆等的潛在因素,而不是配適到複合分數,正是這裡所示範那份偏誤的恰當補救。第 21 章把交叉延宕追蹤模型內部的恆等性假設攤開來講;第 22 章把這個問題延伸到跨潛在類別的恆等性。密集縱貫那一部裡,第 25 章要面對動態模型所假定的個體內因素結構。第 34 章大規模評量的垂直量尺化(vertical scaling)問題,則是換了一副面貌的恆等性問題。本章示範的紀律,也就是把每一個約束與每一個自由度都交代清楚,並把恆等性的失敗解讀成一項發現而不是一項麻煩,正是有測量意識的縱貫研究該有的工作習慣。

習題

  1. 18.1 設定並清點。在兩種尺度設定慣例之下,寫出一個三指標、四波次的縱貫因素模型語法,並為形貌到嚴格各個模型交代自由度。
  2. 18.2 跑一次階梯。在一份植入了非恆等截距的資料集上跑完整個序列,定位違反,附理由把它放開,並報告序列表。
  3. 18.3 次序恆等性。以穩健加權最小平方估計式對次序題目配適形貌模型與閾值恆等模型,並解讀這項比較。
  4. 18.4 延伸後果。改變截距漂移的大小,畫出由此造成的潛在變化估計偏誤,重現斜率偏誤曲線。
  5. 18.5 把那一節寫出來。根據所提供的輸出,寫出一項恆等性分析的測量與結果段落,並以實質意義解讀其中的非恆等性。

本章重要名詞中英對照

中文English說明/首次出現處
尺度設定慣例scaling convention為潛在變項固定尺度與原點的三種做法;第 18.1 節
縱貫驗證性因素模型longitudinal confirmatory factor model每個時點一個因素、各由同一組指標測量;第 18.1 節
獨特性uniqueness指標的殘差;第 18.1 節
相關獨特性correlated uniqueness同一題跨波次的殘差相關,捕捉題目本身的穩定變異數;第 18.1 節
標記變項法marker-variable method把一個負荷量固定為一、其截距為零;第 18.1 節
固定因素法fixed-factor method把因素變異數固定為一、平均數為零;第 18.1 節
效果編碼法effects-coding method各負荷量平均為一、各截距總和為零;第 18.1 節
形貌恆等性configural invariance各時點的因素型態相同;不許可量化比較;第 18.2 節
量尺恆等性(弱)metric / weak invariance再加上負荷量相等;許可比較共變數與斜率;第 18.2 節
截距恆等性(強)scalar / strong invariance再加上截距相等;許可比較潛在平均數;第 18.2 節
嚴格恆等性strict invariance再加上殘差相等;許可比較複合分數;第 18.2 節
部分恆等性partial invariance放開少數非恆等參數、其餘維持相等;第 18.3 節
定錨題目anchor item部分恆等性所倚靠的那些仍然恆等的題目;第 18.3 節
反應轉移response shift受訪者隨病況演變而重新解讀一份量表;第 18.3 節
對齊法alignment method在許多組別或時點之間求取折衷的最佳化做法;第 18.3 節
閾值threshold把潛在連續反應粗化成次序類別的切點(承第 15 章);第 18.4 節
複合分數composite score各題目的平均數;默默假定嚴格恆等性;第 18.5 節

參考文獻

Asparouhov, T., & Muthén, B. (2014). Multiple-group factor analysis alignment. Structural Equation Modeling: A Multidisciplinary Journal, 21(4), 495–508. https://doi.org/10.1080/10705511.2014.919210

Byrne, B. M., Shavelson, R. J., & Muthén, B. (1989). Testing for the equivalence of factor covariance and mean structures: The issue of partial measurement invariance. Psychological Bulletin, 105(3), 456–466. https://doi.org/10.1037/0033-2909.105.3.456

Chen, F. F. (2007). Sensitivity of goodness of fit indexes to lack of measurement invariance. Structural Equation Modeling: A Multidisciplinary Journal, 14(3), 464–504. https://doi.org/10.1080/10705510701301834

Cheung, G. W., & Rensvold, R. B. (2002). Evaluating goodness-of-fit indexes for testing measurement invariance. Structural Equation Modeling: A Multidisciplinary Journal, 9(2), 233–255. https://doi.org/10.1207/S15328007SEM0902_5

Little, T. D. (2013). Longitudinal structural equation modeling. Guilford Press.

Liu, Y., Millsap, R. E., West, S. G., Tein, J.-Y., Tanaka, R., & Grimm, K. J. (2017). Testing measurement invariance in longitudinal data with ordered-categorical measures. Psychological Methods, 22(3), 486–506. https://doi.org/10.1037/met0000075

Meredith, W. (1993). Measurement invariance, factor analysis and factorial invariance. Psychometrika, 58(4), 525–543. https://doi.org/10.1007/BF02294825

Millsap, R. E. (2011). Statistical approaches to measurement invariance. Routledge. https://doi.org/10.4324/9780203821961

Nye, C. D., & Drasgow, F. (2011). Effect size indices for analyses of measurement equivalence: Understanding the practical importance of differences between groups. Journal of Applied Psychology, 96(5), 966–980. https://doi.org/10.1037/a0022955

Putnick, D. L., & Bornstein, M. H. (2016). Measurement invariance conventions and reporting: The state of the art and future directions for psychological research. Developmental Review, 41, 71–90. https://doi.org/10.1016/j.dr.2016.06.004

Rosseel, Y. (2012). lavaan: An R package for structural equation modeling. Journal of Statistical Software, 48(2), 1–36. https://doi.org/10.18637/jss.v048.i02

van de Schoot, R., Lugtig, P., & Hox, J. (2012). A checklist for testing measurement invariance. European Journal of Developmental Psychology, 9(4), 486–492. https://doi.org/10.1080/17405629.2012.686740

Vandenberg, R. J., & Lance, C. E. (2000). A review and synthesis of the measurement invariance literature: Suggestions, practices, and recommendations for organizational research. Organizational Research Methods, 3(1), 4–70. https://doi.org/10.1177/109442810031002

Widaman, K. F., Ferrer, E., & Conger, R. D. (2010). Factorial invariance within longitudinal structural equation models: Measuring the same construct across time. Child Development Perspectives, 4(1), 10–18. https://doi.org/10.1111/j.1750-8606.2009.00110.x

Widaman, K. F., & Reise, S. P. (1997). Exploring the measurement invariance of psychological instruments: Applications in the substance use domain. In K. J. Bryant, M. Windle, & S. G. West (Eds.), The science of prevention: Methodological advances from alcohol and substance abuse research (pp. 281–324). American Psychological Association.

Wu, H., & Estabrook, R. (2016). Identification of confirmatory factor analysis models of different levels of invariance for ordered categorical outcomes. Psychometrika, 81(4), 1014–1045. https://doi.org/10.1007/s11336-016-9506-0

引用本章

APA 第 7 版沒有「單一作者專書之章」這個文獻類型:正式的參考文獻指向整本書,章次寫在內文引用裡。若您要讓引用直接連到本章這一頁,再採用下方第二組(依 APA 的網站文件格式)。

引用全書、於內文指明章次(建議)

內文(游琇婷,2026,第 18 章) 或 游琇婷(2026,第 18 章)
參考文獻游琇婷(2026)。《變化的分析:社會科學的縱貫、密集縱貫與動態資料分析》(繁體中文網頁版)。https://hsiutingyu.github.io/LDA-book-zh-V2/

只引用本章這一頁

參考文獻游琇婷(2026)。第 18 章 縱貫因素分析與跨時間的測量恆等性。載於《變化的分析:社會科學的縱貫、密集縱貫與動態資料分析》(繁體中文網頁版)。https://hsiutingyu.github.io/LDA-book-zh-V2/LDA_C_Chapter18.html

英文稿件中引用

APA 第 7 版第 9.38 節:非英文著作保留原文題名,並於方括號內附英文翻譯。

ReferenceYu, H.-T. (2026). 變化的分析:社會科學的縱貫、密集縱貫與動態資料分析 [Analyzing change: Longitudinal, intensive longitudinal, and dynamic data analysis for the social sciences] (Traditional Chinese web edition). https://hsiutingyu.github.io/LDA-book-zh-V2/
In text(Yu, 2026, Chapter 18)