第 3 章
跨時間與跨時間尺度的測量
變化分數會承接它所依據的每一項測量缺陷,並且再添上幾項自己的。在問一個人有沒有改變之前,必須先能夠為一個容易被假定、卻難以真正取得的前提辯護:這份工具在兩個時點上意謂著同一件事。本章談的就是這個前提,以及當測量開始重複之後,信度究竟是什麼意思。
學習目標
讀完本章之後,你應該能夠:(1) 說明為什麼關於水準 (level)、變化 (change) 與變異性 (variability) 的問題,對測量品質的要求並不相同;(2) 為一份密集縱貫量表分別計算並解讀個體間信度 (between-person reliability) 與個體內信度 (within-person reliability);(3) 說明為什麼把重複測量資料堆疊起來所算出的 alpha 係數無法解讀;(4) 撰寫能夠尊重既定參照期間 (reference period) 與時間尺度的當下題目;(5) 從概念上定義形貌恆等性 (configural invariance)、量尺恆等性 (metric invariance) 與截距恆等性 (scalar invariance),並預測違反各層次時會有什麼後果;(6) 區分構念連續性 (construct continuity) 與分數可比較性 (score comparability),包含異型連續性 (heterotypic continuity) 這種情形;(7) 評估變化分數,以及由個體內時間序列衍生出來的變異性指標,各自的信度。
3.1 變化要能被解讀,什麼必須保持不變
想像每天早晨站上家裡的體重計,把數字記下來。如果這台體重計值得信任,這一串數字就能告訴你體重的變化。但假設它在你不知情的情況下慢慢失準,到了月底時每次都多讀兩公斤。此時那條上升的數列反映的是儀器而不是身體,你所推論出來的變化只是一個假象。或者假設它變得不穩定,即使體重沒有改變,讀數也一天比一天跳動得更厲害。此時數字仍然圍繞著真值,但每一個讀數都比前一個更不可靠,而其中任兩個之間的差異可能大半只是雜訊。心理學的構念是用會漂移、也會退化的工具測量的,漂移的方式恰恰就是這兩種,只是它很少像一台沒校準的體重計那樣顯眼。
一次重複測量要能產出可解讀的變化,有三件不同的事必須成立。圖 3.1分別示範這三件事,圖中那個人在某項特質上的真實水準從頭到尾都沒有改變。第一項要求是,工具在每個時點測到的是同一個構念 (same construct),如此那些數字才指向同一件事。第二項是,它使用同一套量尺 (same metric),如此一個給定的分數在每個時點都代表構念的同樣份量;圖 3.1的子圖 B 顯示量尺逐步往上漂移,於是一個完全沒有改變的人,看起來卻像是在成長。第三項是,它維持同樣的精確度 (same precision),如此各時點的分數才同樣值得信任;子圖 C 顯示精確度逐步退化,於是後期的分數在真值周圍散得更開。這三項要求非正式地對應到測量恆等性 (measurement invariance) 的各個形式層次,本章第 3.5 節先引入、第 18 章再完整發展:同一個構念對應形貌恆等性,同一套量尺對應量尺恆等性與截距恆等性,同樣的精確度對應測量誤差在各時點相等。
註:模擬資料。圖中這個人的真實特質值(虛線)在六個時點上固定不變。子圖 A 的工具穩定,觀察分數彼此可比較。子圖 B 的量尺往上漂移,在沒有變化的地方製造出變化的外觀。子圖 C 的精確度流失,後期的分數比早期的分數更不可靠。
還有一層更細緻的複雜性:要讓構念保持不變,有時必須改變題目。以攻擊行為跨越發展階段為例。在一個五歲兒童身上,它表現為打人、咬人與發脾氣;在一個十五歲青少年身上,同一個底層的傾向表現為言語敵意、打架與違規犯紀。一份在兩個年齡都詢問「咬人」的工具,在五歲時測得很好,在十五歲時測得很糟。這就是異型連續性 (heterotypic continuity):構念本身是連續的,但它的行為指標會隨發展而改變,因此要測到同一個構念,反而必須使用不同的、符合各年齡的題目(圖 3.2)。異型連續性逼出兩項設計決定。第一,它支持納入定錨題目 (anchor item),也就是在整個年齡範圍內都保持有效的指標,用來把各年齡專屬的測量連結到同一條量尺上。第二,它意味著原始分數的可比較性不能被假定,而必須靠分析建立起來,也就是第 18 章的縱貫連結 (linking) 與部分恆等性 (partial invariance) 方法。一個構念表面上的穩定或變化,可能只是「題目該換卻沒換」的假象,也可能是「換了題目卻沒有連結」的假象 (Widaman et al., 2010)。
註:潛在構念跨年齡持續存在,但它的行為指標會改變。一道在兩個年齡都有效的定錨題目(橘色)提供共同的參照點,兩個年齡專屬的測量才能被放到同一條量尺上。
3.2 測量重複之後的信度
古典測驗理論 (classical test theory) 把信度 (reliability) 定義為觀察分數變異數中屬於真分數 (true score) 而非誤差 (error) 的比例;對單一次橫斷測量而言,這個定義就夠用了。一旦測量開始重複,單一個信度係數就不再夠用,因為信度是相對於某個母體、也相對於某個分析層次而言的。同一份量表可以在「把人依平均水準排序」這件事上信度極高,卻在「偵測某個人此刻的起伏」這件事上信度很差;第 3.3 節的實作範例會具體展示這一點。從某一個樣本、某一個時點報告出來的「\(\alpha = .85\)」這種數字,若沒有進一步的證據,並不授權任何一種重複測量的用法。
在變化的測量上,流傳最頑強的一則坊間說法與差異分數 (difference score) 的信度有關;由於第 10 章需要這件事先有定論,這裡值得正面處理。這個古典結果與 Cronbach and Furby (1970) 相連:差異分數往往不可靠。這句話本身沒錯,只是說得不夠完整。
基礎概念 • 差異分數的信度
令 \(Y_1\) 與 \(Y_2\) 為前測與後測分數,兩者變異數相等為 \(\sigma^2\)、信度相等為 \(\rho\),並令 \(\rho_{12}\) 為兩者的觀察相關。差異為 \(D = Y_2 - Y_1\),其觀察變異數為
而 \(D\) 之中的誤差變異數是兩個誤差變異數之和,即 \(2(1-\rho)\sigma^2\)。差異分數的信度就是一減去「誤差對觀察」的比值:
一般人從式 (3.2) 讀到的結論令人不安:當前後測相關 \(\rho_{12}\) 逼近信度 \(\rho\) 時,差異的信度就趨近於零。如果兩個時點的相關是 \(.80\),每個時點的信度也是 \(.80\),那麼差異的信度就是 \(0\)。但請把這個公式連同它的意義再讀一次。\(\rho_{12}\) 很高意味著人們從前測到後測維持原本的排序,也就是每個人改變的量大致相同,於是根本沒有多少變化上的個體間變異可供信度係數去偵測。差異分數信度低所發出的訊號是「變化很同質」,不是「測量無效」。差異分數依然是每個人個體內變化的不偏估計值;它信度低所陳述的是「變化上的個體差異能被偵測到的精確度」,而不是「變化究竟有沒有發生」(Rogosa et al., 1982)。這項區分,也就是「偵測個體差異的精確度」與「個體內量本身的效度」之分,會在全書反覆出現。
比任何單一係數都更誠實的框架來自概化理論 (generalizability theory),它把觀察分數視為從一個「可容許觀察的全域」(universe of admissible observations) 中抽出的一個樣本,並追問這個分數的變異數有多少可以歸給測量的每一個側面 (facet) (Cronbach et al., 1972)。對重複測量資料而言,相關的側面是個體、時點與題目,三者交叉如圖 3.3所示。概化理論把題目反應的總變異數分解為:穩定的個體差異成分、個體之內的時點成分(真正的當下狀態)、題目成分,以及這些成分的交互作用與殘差。這個框架的價值在於,它拒絕抽象地回答「這份量表的信度是多少?」,而是逼出另一個問題:「對什麼而言可靠、要概化到什麼範圍?」把人排序的信度,概化的對象是時點與題目,它落在個體成分上;偵測當下狀態的信度,概化的對象只有題目,它落在「個體乘時點」成分上。兩者取用的是同一份變異數分解中的不同片段,這正是它們可以差距如此懸殊的原因。
註:每一個格子是一位個體在一個時點對一道題目的作答。概化理論把總變異數分解為個體、個體之內的時點、題目,以及這些來源之間交互作用的成分。不同的信度問題取用不同的成分:個體間成分主導一個人平均水準的信度,「個體乘時點」成分主導當下狀態的信度。
3.3 密集資料的多層次信度
密集縱貫資料使信度的「層次專屬性」無法迴避,因為每個人都貢獻許多時點,而題目結構在個體層次與時點層次上可能不同。Cranford et al. (2006) 以及 Geldhof et al. (2014) 所發展的框架,把每一份密集縱貫量表同時擁有的兩種信度形式化。個體間信度 (between-person reliability) 問的是:這份量表把人依其平均水準排序時有多可靠,也就是把每個人的許多時點聚合起來之後的排序品質;當穩定的個體差異相對於誤差很大時,它就高。個體內信度 (within-person reliability) 問的是:在單一個時點上,這份量表偵測某個人「相對於自己平均數的當下偏離」時有多可靠;若當下的狀態變異數相對於題目層次的誤差很大,它就高。這是兩個不同的量,而一份量表完全可能在其中一項表現出色、在另一項不堪使用。
實作範例使用本書 affect_ema_items 這份配套資料集中的四道負向情緒題目,也就是 affect_ema 當下負向情緒複合分數背後的題目層次作答。以交叉隨機效果模型 (crossed random-effects model) 分解這些題目的變異數,得到個體間(穩定)變異數約 \(0.17\)、個體乘時點(當下狀態)變異數約 \(0.15\)、題目層次殘差約 \(0.53\)。由這些成分算出來,在平均六十一個時點、四道題目的條件下,一個人平均水準的個體間信度約為 \(.97\):有六十一次當下回報,一個人的平均負向情緒被估計得相當精確。相對地,單一次四題複合分數的個體內信度只有約 \(.53\):一次四題的回報,是「此人此刻相對於自己常態位在何處」的一個雜訊很大的指標。多層次因素分析用 omega 的語言講出同一個故事:這份負向情緒量表的個體間 omega 約為 \(.88\),而個體內 omega 約為 \(.61\)。當我們比較不同人的平均數時,這些題目凝聚成一份良好的量表;當我們追蹤同一個人的起伏時,它們凝聚得差得多。這個落差並不是這份特定量表的缺陷,而是常態;而且對任何只報告單一個信度係數的人來說,它是完全隱形的。
常見陷阱 • 在堆疊的長格式資料上算 alpha 係數
當密集縱貫資料以長格式存放、每一列是一個「人乘時點」時,一個很誘人的捷徑是:忽略個體結構,直接在堆疊起來的題目欄位上跑 alpha 係數。對上面那些負向情緒題目而言,這個合併後的 alpha 約為 \(.71\),一個看起來體面、卻幾乎沒有意義的數字。它是個體間信度(約 \(.88\))與個體內信度(約 \(.61\))的混合,權重取決於樣本中個體間與個體內變異數的比例,因此它不對應研究者真正想要的任何一個量。報告它,會誘使讀者以為這份量表在水準與變化上一樣好用,而事實並非如此。正確的做法是把信度依層次拆開、兩者都報告,用多層次驗證性因素分析 (multilevel confirmatory factor analysis, CFA) 或概化理論的係數;合併後的 alpha 根本不該出現。另一個相關的錯誤是只報告個體內 omega,卻把它描述成「這份量表的信度」,好像那是一個全域屬性;它其實專指當下偏離的信度,對於個體平均數的信度一句話也沒說。
接著會有兩個實務問題。第一個是:一份當下量表需要幾道題目?由於每一次提示所能動用的題量十分有限(第 2 章),當下量表都很短,而個體內信度的公式正說明了這件事為何有害:把題目數量減半,會提高題目層次誤差在每一個當下分數中所佔的份量。這裡沒有普世的下限,但主導這個決定的應該是個體內信度,而不是個體間信度,因為聚合值的個體間信度會被時點數量本身撐高,幾乎在任何情況下都看起來足夠。第二個問題是:單一題目能不能勝任?當構念狹窄而具體、負擔確實是約束條件,而且有個體內層次的效度證據時,單題的當下測量是站得住腳的;但單一題目的個體內信度完全無法從內部一致性 (internal consistency) 推得,必須以其他方式建立,例如安排偶爾一次的多題探測,或在很短的間隔內做重測 (test–retest) (Schuurman & Hamaker, 2019)。表 3.1整理本節引入的各個係數。
表 3.1 重複測量資料的信度係數。
| 係數 | 它回答的問題 | 如何取得 |
|---|---|---|
| 個體間信度(個體間 omega;\(R_{kF}\)) | 這份量表把人依平均水準排序時有多可靠? | 兩層次 CFA(個體間 omega);變異數成分 |
| 個體內信度(個體內 omega;\(R_{kR}\)) | 單一次回報偵測當下偏離時有多可靠? | 兩層次 CFA(個體內 omega);變異數成分 |
| 個人平均數的信度 | 在 \(T\) 個時點下,一個人的估計平均數有多穩定? | \(\sigma^2_p / (\sigma^2_p + \sigma^2_{w}/T)\) |
| 差異分數的信度 | 變化上的個體差異被偵測得多精確? | 由重測資料計算 \((\rho - \rho_{12})/(1 - \rho_{12})\) |
| iSD 或慣性的信度 | 個體內變異性或動態被估計得多可靠? | 以模擬或折半法 (split-half);隨 \(T\) 緩慢提升 |
註:個體間與個體內係數依循 Cranford et al. (2006) 與 Geldhof et al. (2014) 的多層次框架;\(\sigma^2_w\) 表示複合分數在時點層次的變異數。R 的實作見第 3.8 節。
3.4 當下評估的題目與量表設計
測量品質是在估計之前就被設計進去的,而當下評估 (momentary assessment) 施加了一些特質測量所沒有的設計限制。其中最重要的一項是參照期間 (reference period)。一道當下題目必須詢問現在,或詢問一段最近而有明確邊界的區間,也就是「現在這一刻」或「自上一次提示以來」,因為密集取樣的全部理由就是要在記憶重建之前捕捉經驗(第 2 章)。一道問「過去一週以來,你有多緊繃?」的題目被嵌進當下評估方案裡,其實是一份偽裝過的回溯摘要;它把設計原本要擊敗的回憶偏誤又請了回來,而且混淆了時間尺度,因為一份以週為單位的摘要不可能在一天之內隨著提示而變動。圖 3.4把一道良好的當下題目,與一道把回溯窗口偷渡進當下研究的題目並列對照。
註:示意稿。參照期間是決定性的設計選擇:一道當下題目必須詢問現在,或詢問自上一次提示以來的區間,如此作答才能在一天之內變動,而不是由記憶重建而來。
除了參照期間之外,還有幾項選擇會塑造當下資料的品質。反應量尺應該在各次提示之間保持一致,無論採用視覺類比量尺 (visual analog scale),也就是能捕捉細緻層次但對受訪者要求較高的形式,或採用少數幾個李克特 (Likert) 選項,也就是在高頻施測下較快且較穩健的形式;在各次提示之間混用不同格式會破壞可比較性。題目可以在各次提示之間輪替,也就是保留一組每次都測的固定核心、再搭配偶爾才測的輪替周邊,這是一種計畫性遺漏 (planned missingness),以分析複雜度為代價換取負擔的降低(第 6 章)。標準工具的當下版本被廣泛使用,表 3.2列出常見的改編方式;此處最重要的紀律是,從一份已驗證的特質工具出發去改寫參照期間與措辭,並且明確引用所使用的那一個當下版本,而不是假定特質量表的心理計量性質可以直接移轉過來。表 3.3把這些設計規則收攏成一份檢核表。
表 3.2 常見自陳構念的當下版本改編(示例)。
| 特質構念 | 當下版本的改編 | 參照期間 |
|---|---|---|
| 正向/負向情緒(PANAS 傳統) | 當下情緒形容詞(例如:緊繃、心煩、滿足、愉快) | 「現在這一刻」 |
| 知覺壓力 | 一道或數道當下壓力評估題 | 「現在這一刻」或「自上一次提示以來」 |
| 自尊 | 狀態自尊(例如「現在這一刻,我對自己感覺良好」) | 「現在這一刻」 |
| 反芻思考 (rumination) | 當下的重複性思考 (momentary repetitive thought) | 「自上一次提示以來」 |
註:表中的措辭僅為示例,不是經認可的工具。請從一份已驗證的特質量表改編,並引用所使用的那一個當下版本;不要假定特質量表的信度與效度會移轉到當下層次。
表 3.3 撰寫當下題目的檢核表。
| 要這樣做 | 要避免 |
|---|---|
| 明確寫出當下的參照期間(「現在這一刻」) | 在當下評估方案中使用回溯窗口(「過去一週以來」) |
| 一道題目只測一個構念 | 一題兩問 (double-barreled),例如「緊繃而且擔憂」 |
| 各次提示的反應量尺完全相同 | 在各次提示之間混用視覺類比與李克特格式 |
| 固定一組簡短的核心題,其餘輪替 | 冗長不變的題組,使受訪者疲乏 |
| 在順序效果可能存在時隨機化題目順序 | 固定順序,讓前面的題目促發後面的題目 |
| 引用所使用的當下版本及其證據 | 假定特質量表的心理計量性質可以移轉 |
註:這份檢核表把第 2 章的設計原則落實到單一題目的層次。
3.5 測量恆等性:概念
測量恆等性是第 3.1 節「同一套量尺」那項要求的形式化機制;雖然它的完整裝置要留到第 18 章,它的邏輯可以用一座梯子來掌握,如圖 3.5所示。每往上一階,就多把測量模型的一項特徵限制為跨時點相等,也因此多授權一種比較。最底層的形貌恆等性 (configural invariance) 只要求在每個時點上,相同的題目以相同的型態負荷到相同的因素上;它確立的是「測到的是同一個構念」,但不授權任何量化比較。往上一階是量尺恆等性 (metric invariance),也稱弱恆等性,它加上因素負荷量 (factor loading) 跨時點相等(此處的「量尺」指潛在變項的計量單位,不是第 3.4 節所說的題目反應量尺);由於潛在變項的量尺此時已跨時點一致,它授權比較這個構念與其他變項的關聯如何隨時間變化,也授權比較變化的斜率。第三階是截距恆等性 (scalar invariance),也稱強恆等性,它加上題目截距 (item intercept) 相等;只有到了這一階,潛在平均數在各時點之間才可以比較,也就是說,只有到了這一階,關於「構念水準有所成長」的主張才站得住腳。最上面一階是嚴格恆等性 (strict invariance),也稱殘差恆等性,它加上殘差變異數相等,於是連觀察分數的信度都跨時點相等;實質結論通常並不需要走到這一階。表 3.4陳述每一階授權什麼、又還不授權什麼。
註:概念圖;對應的方程式與檢定出現在第 18 章。較高的階層涵蓋較低的階層。一項研究達到哪一階,決定了哪些跨時點的比較站得住腳。
表 3.4 恆等性層次以及各層次所授權的比較。
| 層次 | 跨時點限制相等 | 授權 | 仍不安全 |
|---|---|---|---|
| 形貌恆等性 | 題目與因素的型態 | 「測到的是同一個構念」 | 任何量化比較 |
| 量尺恆等性(弱) | +因素負荷量 | 比較關聯與變化的斜率 | 比較潛在平均數 |
| 截距恆等性(強) | +題目截距 | 比較潛在平均數(水準的成長) | – |
| 嚴格恆等性 | +殘差變異數 | 直接比較觀察分數信度 | – |
註:每一層次都涵蓋表中位於它上方的層次。截距恆等性是解讀「構念平均水準的變化」時的實務門檻。表中短橫線表示該處未列出項目。
縱貫非恆等性 (noninvariance) 的成因有一些是重複測量所特有的。受訪者可能隨著自身發展而重新解讀 (reinterpret) 題目,於是同樣一段文字在兒童與青少年眼中並不相同。追蹤制約 (panel conditioning)(第 2 章)可能改變資深受訪者使用量尺的方式。測量模式的改變,例如從紙本改為智慧型手機應用程式,可能改變題目的功能 (item functioning)。而評量的情境,例如基線在實驗室、追蹤在日常生活中,也可能改變一道題目所捕捉到的東西。忽略非恆等性的後果不只是不夠優雅:當負荷量或截距實際上發生漂移卻被假定為相等時,成長的估計值就會有偏誤,而一項研究可能報告出「構念的變化」,其實那是「工具的變化」。關鍵在於,這種偏誤並不限於結構方程模型。一位研究者若以「改用多層次成長模型去配適總分」來迴避恆等性檢定,其實並沒有逃離這個問題;總分只是在未經檢定的情況下假定了嚴格恆等性,並默默地繼承了同樣的偏誤。換一個分析框架,這頓午餐並不會因此變成白吃的,這一點第 18 章會用模擬展示。
3.6 衍生個體內指標的信度與效度
密集縱貫研究越來越常把一個人時間序列的某些特徵本身當成分數來使用:以個體內標準差 (within-person standard deviation, iSD) 作為情緒變異性的測量,以連續差異均方根 (root mean square of successive differences, RMSSD) 作為不穩定性的測量,以延宕一期自我相關 (lag-1 autocorrelation)(也就是慣性 (inertia))作為情緒持續性的測量(這些指標在第 7 章發展)。由於它們是從一個人的序列估計出來的,它們的信度極度依賴時點的數量,而且比一個簡單平均數的信度依賴得多得多。圖 3.6以模擬顯示三個量的信度如何隨每人時點數而成長。一個人的平均數在只有四個時點時就已經達到約 \(.70\),到六十個時點時超過 \(.95\)。個體內標準差達到可接受的信度慢得多,大約要到十四個時點才越過 \(.70\)。慣性,也就是自我相關,要求最高:在十四個時點時它的信度只有約 \(.34\),要接近 \(.80\) 得等到將近六十個時點。一份為期兩週、每天一次提示的日誌研究,能給出一個人平均數的可靠估計,卻只能給出這個人情緒慣性的一個勉強可用的估計。從短序列報告慣性而不承認它的不可靠,是一個常見而且後果嚴重的錯誤。
註:模擬。個人平均數(藍色)只要少數時點就變得可靠;個體內標準差(金黃色)需要更多;延宕一期自我相關,也就是慣性(橘紅色),需要很多。點線標示 \(.70\) 的信度。橫軸講的是每人時點數,不是樣本大小。
變異性指標還有第二個特有的危險,就是它與平均數的糾纏。對任何有上下界的反應量尺而言,可能的變動範圍會受到水準的限制:一個人的當下負向情緒若貼近量尺的地板,他就不可能表現出和一個位在量尺中段的人一樣大的標準差,因此觀察到的「平均數與變異性有關聯」可能只是界限造成的數學假象,而不是實質發現 (Mestdagh et al., 2018)。這件事很重要,因為情緒變異性經常被當成心理病理的相關因子來研究;如果症狀水準較高的人平均數也較高,那麼變異性與症狀之間表面上的連結,可能是平均數假扮成變異性。補救方式有三:使用經平均數校正的變異性指標,例如相對變異性指數 (relative variability index);明確控制平均數;或者更好的做法,改採第 16 章那種以模型為基礎的取徑,直接把個體內變異數當成參數來估計,同時對平均數加以調整。Dejonckheere et al. (2019) 提出的更廣泛的警告是:複雜的動態指標往往在平均數與變異數之外只增添很少的預測訊息,而它們在現實序列長度下的不可靠,正是原因的一部分。圖 3.7從另一個角度讓「結構具有層次專屬性」變得鮮明,它比較當下情緒題目在個體間與個體內的相關結構。
註:affect_ema_items 中八道當下情緒題目之間的相關,分別以個體間(左,由個人平均數計算)與個體內(右,由個人平均數中心化後的偏離值計算)方式求得。在個體間,負向與正向情緒題目形成清楚且相關強烈的區塊;在個體內,同樣的區塊弱得多,而這正是個體間與個體內信度會分歧的原因。
3.7 超越自陳
並非所有跨時間的測量都是自陳。活動記錄儀記錄動作並推估睡眠;隨身生理測量記錄心率與心率變異性;智慧型手機與穿戴式感測器記錄位置、活動與通訊(第 2 章)。這些管道避開了自陳的某些問題,特別是反應性與回憶,但它們並沒有避開測量理論,只是把它搬到別的地方。對被動測量與生理測量而言,關鍵的測量決定往前移到同步化與前處理:把以不同頻率取樣的資料流對齊到同一個時鐘上、決定聚合所依據的時段長度 (epoch)、界定什麼算是假訊號 (artifact) 以及如何處理它,還有從原始訊號中選擇要抽取哪些特徵。這些每一項都是測量選擇,其對信度與效度的後果和題目措辭一樣真實,因此每一項都應該被報告,而且最好接受穩健性檢驗。被動測量的效度證據也有它特定的形式:由於像「在家時間」這樣的感測器衍生指標,是「退縮」這類心理構念的替代指標 (proxy),它的效度取決於這個替代關係有多強,而這件事必須被建立,不能被假定 (Fried et al., 2022)。本章的測量原則,也就是同一個構念、同一套量尺、同樣的精確度,以及層次專屬的信度,套用在一串加速度計計數上,與套用在一道心情題目上完全一樣,儘管建立它們的技術並不相同。
3.8 以 R 估計信度
上面討論的各種信度都可以用幾行 R 算出來,而看到計算過程能讓它們的意義變得具體。實作範例使用 affect_ema_items 中的四道負向情緒題目。第一項任務是概化理論信度背後的變異數分解:把題目堆疊成長格式,再配適一個對個體、對個體之內的時點、以及對題目都設定隨機效果的交叉隨機效果模型。
library(lme4)
d <- readRDS("Examples/data/affect_ema_items.rds")
na_items <- c("na_tense", "na_nervous", "na_upset", "na_distressed")
# 堆疊成長格式:一列 = 一人 × 一時點 × 一題
long <- reshape(d[, c("person","day","beep", na_items)], varying = na_items,
v.names = "resp", timevar = "item", times = na_items,
direction = "long")
long <- long[!is.na(long$resp), ]
long$occ <- interaction(long$person, long$day, long$beep, drop = TRUE)
vc <- as.data.frame(VarCorr(lmer(resp ~ 1 + (1|person) + (1|occ) + (1|item),
data = long)))
s2_p <- vc$vcov[vc$grp == "person"] # 個體間,約 0.17
s2_pt <- vc$vcov[vc$grp == "occ"] # 個體內(狀態),約 0.15
s2_e <- vc$vcov[vc$grp == "Residual"] # 題目層次誤差,約 0.53
k <- 4; Tbar <- mean(tapply(!is.na(d$na_tense), d$person, sum)) # 約 61
RkR <- s2_pt / (s2_pt + s2_e / k) # 個體內,約 0.53
RkF <- s2_p / (s2_p + s2_pt/Tbar + s2_e/(Tbar*k)) # 個體間,約 0.97
第二項任務直接由兩層次驗證性因素分析計算個體間與個體內的 omega,許多讀者會覺得這個做法更熟悉。lavaan 的語法在個體內層次指定一個因素、在個體間層次指定一個因素,omega 則由各層次所得的負荷量與殘差變異數算出。
library(lavaan)
model <- "
level: 1
fw =~ na_tense + na_nervous + na_upset + na_distressed
level: 2
fb =~ na_tense + na_nervous + na_upset + na_distressed
"
fit <- sem(model, data = d, cluster = "person", missing = "listwise")
# 某一層的 omega = (負荷量總和)^2 × 因素變異數 ÷
# [ (負荷量總和)^2 × 因素變異數 + 殘差變異數總和 ]
# 以 parameterEstimates(fit) 取出;omega_within 約 .61、omega_between 約 .88
跑完這些程式會確認第 3.3 節報告的數值:個人平均數的個體間信度接近 \(.97\),單一當下分數的個體內信度接近 \(.53\);換成 omega 的語言,則是個體間 \(.88\)、個體內 \(.61\)。作為對照,那個誘人但錯誤的合併 alpha,也就是 psych::alpha(d[na_items]),會回報約 \(.71\),正是上面警告過的那個無法解讀的混合值。這段程式所強制的紀律是:在計算任何信度之前,必須先選定一個層次,因為沒有任何單一個數字能描述這份量表。
3.9 重複測量的信度報告
如今審查密集縱貫研究的審稿人,會期待信度被報告在與每一項主張相匹配的層次上,而一份只報告單一個 alpha 的方法段會招來詢問。前面各章所引入的報告紀律,在信度上有四個對應要素。第一,報告與估計標的相匹配的信度:如果分析關心的是平均水準上的個體間差異,就報告個體間信度;如果關心的是個體內的起伏或耦合,就報告個體內信度;如果兩者都關心,就兩者都報告。第二,指明方法與模型:說明這些係數來自多層次驗證性因素分析還是概化理論的變異數成分,並給出軟體與版本。第三,對於 iSD 或慣性這類衍生指標,要在已達成的時點數之下報告或至少承認它們的信度,而不是把它們當成和平均數一樣可靠來呈現。第四,當使用單題的當下測量時,要說明信任它的依據何在,因為單一題目的內部一致性信度是沒有定義的。
把這些要素合在一起,針對實作範例中那份負向情緒量表的一段示範文字可以這樣寫:「四題當下負向情緒量表的信度以兩層次驗證性因素分析估計(lavaan 0.6-x)。個體間信度(個體間 omega)為 \(.88\),表示各參與者的平均水準能被可靠地區分;個體內信度(個體內 omega)為 \(.61\),表示單一次當下回報區分同一個人不同時點的程度僅屬中等。由於主要分析關心的是個體內的耦合,相關的係數是個體內那一個,而它中等的數值也反映在第 25 章所採用的衰減校正 (attenuation correction) 之中。」每一個子句都指明了一個層次;凡是提出信度係數的地方,都交代了那是「什麼的信度」。
軟體提示 • 計算多層次信度
有好幾種工具可以計算本章的各個係數,而在指定方式等價時它們的結果一致。在 R 中,lavaan 配適兩層次 CFA,個體間與個體內 omega 由此計算;semTools 計算組合信度的函式直接支援多層次模型;psych 的 multilevel.reliability(mlr)實作 Cranford 與 Shrout-Lane 的概化係數(\(R_{kF}\)、\(R_{kR}\) 及其相關量),不過在時點數很多時它內部的模型可能無法收斂,此時退回用 lme4 的變異數成分自行計算(如第 3.8 節所示)是穩健的備案。misty 套件提供便利的包裝函式。在 Mplus 中,同樣的兩層次 CFA 以 TYPE = TWOLEVEL 指定,並由模型限制功能計算各層次的 omega。無論用哪一種工具,都要報告是哪一個係數、在哪一個層次、來自哪一個模型。
3.10 常見的迷思
有四種看法反覆出現。第一,認為只要有一次 alpha 超過 \(.70\),這份量表就永遠、在每一個層次上都被證成了:信度是相對於某個母體、某個時點、某個分析層次而言的,而一個個體間的 alpha 對個體內信度什麼也沒說(第 3.3 節)。第二,認為差異分數本質上不可靠,所以變化分數永遠不該使用:差異分數信度低所發出的訊號是變化很同質,不是測量無效,而變化分數依然是一個不偏的個體內量(見基礎概念方塊;Rogosa et al., 1982)。第三,認為恆等性檢定是結構方程模型的講究,做多層次模型的人可以略過:以成長模型去配適總分,是在未經檢定的情況下假定了嚴格恆等性,並繼承同樣的偏誤,因此換框架換不到豁免。第四,針對那個經常被問到的問題「密集評估裡每個構念可以只用一道題目嗎?」:有時可以,條件是構念狹窄、負擔確實是約束,而且有個體內層次的效度證據;但單一題目的個體內信度無法從內部一致性讀出來,必須以其他方式建立。
本章摘要
一個變化分數要能被解讀,前提是工具跨時點維持了同一個構念、同一套量尺與同樣的精確度(圖 3.1);而有時候,要維持同一個構念反而必須改變題目,異型連續性就是這種情形。測量一旦重複,信度就不是一個數字:同一份量表有一個用來把各人的平均數排序的個體間信度,也有一個用來偵測當下狀態的個體內信度,而兩者經常分歧,實作範例中的 \(.88\) 對 \(.61\) 就是例子。在堆疊的長格式資料上算 alpha 係數,混合了兩者,因此哪一個都不是。長期被詬病的差異分數信度,反映的是變化的同質程度,而不是測量的無效。測量恆等性把「同一套量尺」這項要求形式化為一座階梯,每往上一階就授權更強的比較;違反它會使成長估計值產生偏誤,而且在多層次與結構方程兩種框架下都一樣。像變異性與慣性這類衍生的個體內指標,本身也是分數,其信度陡峭地依賴時點數,而且可能與平均數混淆。請把信度報告在與主張相匹配的那個層次上。
接下來讀哪裡
本章的線索貫串全書。這裡預告的各種衍生指標在第 7 章發展;差異分數的平反為第 10 章的兩時點方法鋪路;個體內變異數的模型化取徑是第 16 章;測量恆等性的形式機制,連同方程式與一個偏誤模擬,是第 18 章;測量誤差對動態估計值的後果是第 25 章;而在異型連續性之下連結各年齡專屬測量這件事,則在第 34 章的發展研究應用中再度出現。本章唯一的命令是:對每一個信度、每一個比較,都要說出它成立於哪一個層次、哪一個時間尺度。
習題
- 3.1 兩種信度。使用
affect_ema_items,依第 3.8 節的做法計算四道正向情緒題目的個體間信度與個體內信度。解讀兩者的落差,並說明如果要研究當下正向情緒的動態,你會報告哪一個係數。 - 3.2 改寫題目。從任何一份已發表的特質量表中取三道回溯式問卷題目,把每一道改寫成帶有明確參照期間的當下題目。請依表 3.3為每一個參照期間的選擇提出理由。
- 3.3 差異分數的代數。由定義推導式 (3.2)。接著計算 \(\rho = .85\)、\(\rho_{12} = .80\) 時的差異分數信度,並寫兩句話向一位持懷疑態度的審稿人說明,為什麼使用這個變化分數的研究仍然具有訊息價值。
- 3.4 恆等性的威脅。你拿到一份為期二十年的自尊追蹤研究,從青少年期到中年期都使用同一份問卷測量。請指出三個可能造成縱貫非恆等性的來源,並針對每一個說明它會危及哪一項比較。
- 3.5 信度與 \(T\)(模擬)。改寫
ch03_figures_zh_V01.R中的模擬,估計延宕一期自我相關的信度如何隨時點數變化。序列要多長它才達到 \(.70\)?你的答案對一份為期兩週的每日日誌研究意味著什麼?
本章重要名詞中英對照
| 中文 | English | 說明/首次出現處 |
|---|---|---|
| 信度 | reliability | 觀察分數變異數中屬於真分數而非誤差的比例;第 3.2 節 |
| 古典測驗理論 | classical test theory | 觀察分數=真分數+誤差的測量理論;第 3.2 節 |
| 真分數 | true score | 無誤差時應得的分數;第 3.2 節 |
| 同一個構念 | same construct | 各時點測到的是同一件事;第 3.1 節 |
| 同一套量尺 | same metric | 相同分數在各時點代表相同份量;第 3.1 節 |
| 同樣的精確度 | same precision | 各時點分數同樣值得信任;第 3.1 節 |
| 異型連續性 | heterotypic continuity | 構念連續但行為指標隨發展改變;第 3.1 節 |
| 構念連續性 | construct continuity | 潛在構念跨時間持續為同一者;第 3.1 節 |
| 分數可比較性 | score comparability | 原始分數能否跨時點直接相比;第 3.1 節 |
| 定錨題目 | anchor item | 跨年齡皆有效、用於連結量尺的指標;第 3.1 節 |
| 連結 | linking | 把不同題組放到同一條量尺上;第 3.1 節 |
| 差異分數 | difference score | 後測減前測;第 3.2 節 |
| 變化分數 | change score | 差異分數的一般說法;全書 |
| 概化理論 | generalizability theory | 依測量側面分解變異數的理論;第 3.2 節 |
| 可容許觀察的全域 | universe of admissible observations | 觀察分數被視為由此抽出的樣本;第 3.2 節 |
| 側面 | facet | 測量的一個來源維度(個體、時點、題目);第 3.2 節 |
| 變異數成分 | variance component | 歸屬於某一側面的變異數;第 3.2 節 |
| 個體間信度 | between-person reliability | 把人依平均水準排序的可靠程度;第 3.3 節 |
| 個體內信度 | within-person reliability | 偵測當下偏離的可靠程度;第 3.3 節 |
| 交叉隨機效果模型 | crossed random-effects model | 同時對個體、時點與題目設隨機效果;第 3.3 節 |
| 多層次驗證性因素分析 | multilevel CFA | 分層估計因素結構的模型;第 3.3 節 |
| omega 係數 | omega | 由負荷量與殘差算出的組合信度;第 3.3 節 |
| alpha 係數 | coefficient alpha | 內部一致性信度;堆疊資料上不可解讀;第 3.3 節 |
| 內部一致性 | internal consistency | 同一份量表各題目之間的一致程度;第 3.3 節 |
| 當下評估 | momentary assessment | 詢問「此刻」狀態的測量;第 3.4 節 |
| 參照期間 | reference period | 題目所詢問的時間範圍;第 3.4 節 |
| 視覺類比量尺 | visual analog scale | 連續滑桿式反應量尺;第 3.4 節 |
| 一題兩問 | double-barreled item | 一道題目同時問兩件事;第 3.4 節 |
| 計畫性遺漏 | planned missingness | 刻意讓部分題目在部分時點不施測;第 3.4 節 |
| 測量恆等性 | measurement invariance | 測量模型的參數跨時點是否相等;第 3.5 節 |
| 形貌恆等性 | configural invariance | 題目與因素的型態相同;第 3.5 節 |
| 量尺恆等性(弱) | metric / weak invariance | 加上因素負荷量相等;第 3.5 節 |
| 截距恆等性(強) | scalar / strong invariance | 加上題目截距相等;第 3.5 節 |
| 嚴格恆等性 | strict / residual invariance | 加上殘差變異數相等;第 3.5 節 |
| 部分恆等性 | partial invariance | 只有部分參數跨時點相等;第 3.1 節 |
| 非恆等性 | noninvariance | 恆等性不成立的狀態;第 3.5 節 |
| 因素負荷量 | factor loading | 題目與潛在因素的關聯強度;第 3.5 節 |
| 題目截距 | item intercept | 潛在分數為零時的題目期望值;第 3.5 節 |
| 殘差變異數 | residual variance | 未被因素解釋的題目變異數;第 3.5 節 |
| 潛在平均數 | latent mean | 潛在變項的平均數;第 3.5 節 |
| 重新解讀 | reinterpret / reinterpretation | 受訪者對同一題目的理解隨時間改變;第 3.5 節 |
| 個體內標準差 | within-person standard deviation (iSD) | 個人序列的標準差;第 3.6 節 |
| 連續差異均方根 | root mean square of successive differences (RMSSD) | 相鄰時點變動幅度的指標;第 3.6 節 |
| 慣性 | inertia | 延宕一期自我相關;情緒的持續性;第 3.6 節 |
| 相對變異性指數 | relative variability index | 經平均數校正的變異性指標;第 3.6 節 |
| 時段長度 | epoch | 被動訊號聚合所依據的時間單位;第 3.7 節 |
| 假訊號 | artifact | 非目標來源造成的訊號;第 3.7 節 |
| 替代指標 | proxy | 以可測量的量代表目標構念;第 3.7 節 |
| 衰減校正 | attenuation correction | 針對測量誤差造成的低估加以校正;第 3.9 節 |
參考文獻
Cranford, J. A., Shrout, P. E., Iida, M., Rafaeli, E., Yip, T., & Bolger, N. (2006). A procedure for evaluating sensitivity to within-person change: Can mood measures in diary studies detect change reliably?. Personality and Social Psychology Bulletin, 32(7), 917–929. https://doi.org/10.1177/0146167206287721
Cronbach, L. J., & Furby, L. (1970). How we should measure “change”: Or should we?. Psychological Bulletin, 74(1), 68–80. https://doi.org/10.1037/h0029382
Cronbach, L. J., Gleser, G. C., Nanda, H., & Rajaratnam, N. (1972). The dependability of behavioral measurements: Theory of generalizability for scores and profiles. Wiley.
Dejonckheere, E., Mestdagh, M., Houben, M., Rutten, I., Sels, L., Kuppens, P., & Tuerlinckx, F. (2019). Complex affect dynamics add limited information to the prediction of psychological well-being. Nature Human Behaviour, 3(5), 478–491. https://doi.org/10.1038/s41562-019-0555-0
Fried, E. I., Flake, J. K., & Robinaugh, D. J. (2022). Revisiting the theoretical and methodological foundations of depression measurement. Nature Reviews Psychology, 1(6), 358–368. https://doi.org/10.1038/s44159-022-00050-2
Geldhof, G. J., Preacher, K. J., & Zyphur, M. J. (2014). Reliability estimation in a multilevel confirmatory factor analysis framework. Psychological Methods, 19(1), 72–91. https://doi.org/10.1037/a0032138
Horn, J. L., & McArdle, J. J. (1992). A practical and theoretical guide to measurement invariance in aging research. Experimental Aging Research, 18(3), 117–144. https://doi.org/10.1080/03610739208253916
Meredith, W. (1993). Measurement invariance, factor analysis and factorial invariance. Psychometrika, 58(4), 525–543. https://doi.org/10.1007/BF02294825
Mestdagh, M., Pe, M. L., Pestman, W., Verdonck, S., Kuppens, P., & Tuerlinckx, F. (2018). Sidelining the mean: The relative variability index as a generic mean-corrected variability measure for bounded variables. Psychological Methods, 23(4), 690–707. https://doi.org/10.1037/met0000153
Nezlek, J. B. (2017). A practical guide to understanding reliability in studies of within-person variability. Journal of Research in Personality, 69, 149–155. https://doi.org/10.1016/j.jrp.2016.06.020
Rogosa, D. R., Brandt, D., & Zimowski, M. (1982). A growth curve approach to the measurement of change. Psychological Bulletin, 92(3), 726–748. https://doi.org/10.1037/0033-2909.92.3.726
Schuurman, N. K., & Hamaker, E. L. (2019). Measurement error and person-specific reliability in multilevel autoregressive modeling. Psychological Methods, 24(1), 70–91. https://doi.org/10.1037/met0000188
Widaman, K. F., Ferrer, E., & Conger, R. D. (2010). Factorial invariance within longitudinal structural equation models: Measuring the same construct across time. Child Development Perspectives, 4(1), 10–18. https://doi.org/10.1111/j.1750-8606.2009.00110.x
Willett, J. B. (1988). Questions and answers in the measurement of change. Review of Research in Education, 15, 345–422. https://doi.org/10.3102/0091732X015001345