第 10 章
分析兩個時點:配對比較、變化分數與可靠改變
前測一次、後測一次,兩個時點的資料是最常見的縱貫設計,也是最常被做錯的一種。本章不把它當成退化的特例打發掉,因為它逼出來的選擇,正是本書其餘部分的核心論點第一次現身:模型把問題編碼了進去,同一批資料的兩種分析都站得住腳,卻可以得到相反的結論,因為它們回答的是不同的問題。本章由第一原理建立配對比較,走過「變化分數對共變數分析」這個核心爭議與那個把爭議推到極致的悖論,再轉向兩個組層次檢定答不出來的問題:某一個人是否可靠地改變了,以及一個組別是不是真的穩定、而不只是「沒有顯著差異」。後續每一個方法章節的樣板也在此定下:模型、假設、估計、效果量、實作範例與報告。
學習目標
讀完本章之後,你應該能夠:(1) 依結果變項的量尺與研究問題,選出配對 \(t\) 檢定、Wilcoxon 符號等級檢定(Wilcoxon signed-rank test)或 McNemar 檢定,並說得出選擇的理由;(2) 把配對 \(t\) 推導成對差異分數所作的單樣本檢定,並說明前後測相關(pre-post correlation)如何驅動它的檢定力;(3) 講清楚變化分數(change score)分析與共變數分析(analysis of covariance, ANCOVA)的區別,重現 Lord 悖論(Lord’s paradox),並依設計選定分析;(4) 計算並解讀配對的效果量,區分差異計量的 \(d_z\) 與原始計量的 \(d_{av}\);(5) 用可靠改變指標(reliable change index, RCI)為個體的改變分類;(6) 當主張是「沒有發生有意義的改變」時,改用等值檢定(equivalence testing);(7) 把一項兩時點分析報告到可供發表的水準。
10.1 一組,兩個時點
配對比較的起點,是認清同一個人前後兩次測量給的並不是兩個獨立的數字,而是一個差異分數(difference score)。把每個人化約成各自的改變量,就等於把原本會遮蔽這個改變的個體間變異移除掉。配對 \(t\) 檢定(paired \(t\) test)因此不過是一個單樣本 \(t\) 檢定,問的是平均差異是否偏離零;它相對於獨立組比較的檢定力優勢,全部來自那一次移除,推導見基礎概念方塊。它的假設很溫和:不是結果變項服從常態分配,而是那些差異近似常態,中等樣本下連這一點都很寬容。圖 10.1給出配對資料的兩種誠實圖示,資料取自治療試驗的實驗組:一張把每位病人的基線與終點連起來的斜率圖(slope chart),讓摘要所遮蔽的改變異質性顯露出來;以及差異分數的分配,它的平均數正是配對檢定所評估的那個量。這些病人平均改善了 \(12.67\) 個 HDRS 分(\(95\%\) CI \([11.20, 14.14]\)),兩個子圖都看得見這個下降。
註:左:一張斜率圖,每一位有完整前後測資料的接受治療病人(\(n = 66\))各有一條線,由基線連到第 12 週 HDRS,粗線是平均數;個別斜率有多分散,一看便知。右:變化分數(change score)的分配,它的平均數(紅線)就是配對 \(t\) 檢定拿來與零(虛線)比較的量。配對檢定就是對這些差異所作的單樣本檢定。
基礎概念 • 配對為什麼划算:差異的變異數
取一組配對測量 \((X_1, X_2)\),變異數分別為 \(\sigma_1^2, \sigma_2^2\),相關為 \(\rho\)。差異 \(D = X_2 - X_1\) 的變異數是 \(\mathrm{Var}(D) = \sigma_1^2 + \sigma_2^2 - 2\rho\,\sigma_1\sigma_2\)。兩個時點正相關時,被減掉的那一項會把差異的變異數縮小;兩個變異數相等(皆為 \(\sigma^2\))時它化為 \(\mathrm{Var}(D) = 2\sigma^2(1 - \rho)\),隨著 \(\rho \to 1\) 趨向零。配對 \(t\) 統計量是 \(\bar{D}/(s_D/\sqrt{n})\),\(\mathrm{Var}(D)\) 越小、統計量越大,在相同的平均改變之下檢定力也就越高。配對設計的優勢到此為止,全部就是這一件事:同一批人測兩次,把獨立組比較必須當成雜訊扛著的那份穩定的個體間變異數(between-person variance) \(\sigma^2\) 移除掉了。同一個改變若改以獨立組檢定,面對的差異變異數是 \(2\sigma^2\),也就是 \(\rho = 0\) 的情形。
檢定力這樣依賴前後測相關,不是技術細節,而是偏好個體內設計的理由,圖 10.2把它量化。固定原始改變量與樣本數,配對設計的檢定力隨前後測相關增大而陡升;同一批資料改作獨立組分析,用不上配對,就平平地停在相關為零的水準。兩個時點相關達 \(0.7\) 的研究,幾十筆配對觀察就偵測得到的效果,換成獨立觀察要多出許多筆才辦得到。結果變項若是次序量尺、或差異嚴重偏離常態,常見的替代是Wilcoxon 符號等級檢定(Wilcoxon signed-rank test),但別誤解它:它不是無母數版的 \(t\) 檢定,而是檢定差異的分配是否對稱於零;更粗略的符號檢定(sign test)只問上升的次數是不是多於下降的次數。配對的二元結果,也就是由一個類別換到另一個類別,交給McNemar 檢定(McNemar’s test),它評估的是兩種不一致的改變是否一樣頻繁,絕不可與 kappa 這類一致性指標混為一談:兩個時點可以高度一致,卻仍呈現系統性的改變。表 10.1把結果變項的量尺與研究問題對應到適當的檢定。
註:偵測一個固定原始改變量的統計檢定力(statistical power),以前後測相關為橫軸,分別畫出配對(個體內)分析與同一批資料的獨立組分析。配對設計隨相關增大而取得檢定力,因為相關的那份個體間變異數被差分掉了;獨立分析用不上配對,因此停在相關為零的水準。
表 10.1 兩時點檢定的選擇指南。
| 結果變項的量尺 | 設計與問題 | 檢定 |
|---|---|---|
| 連續 | 一組,平均改變 | 配對 \(t\)(對差異作) |
| 連續,但差異非常態 | 一組,分配的位移 | Wilcoxon 符號等級(對稱性) |
| 次序,或只有方向 | 一組,上升是否多於下降? | 符號檢定(sign test) |
| 二元 | 一組,類別的轉換 | McNemar(精確或 mid-\(p\)) |
| 連續 | 兩組,差異性的改變 | 見第 10.3 節(變化分數對 ANCOVA) |
註:配對 \(t\) 假設的是差異分數近似常態,不是結果變項近似常態。符號等級檢定評估的是差異的對稱性(symmetry),不是平均數相等;差異的分配呈偏態(skewed)時,兩者可能得到不同的結論。
10.2 配對資料的效果量
報告一項配對分析要有效果量(effect size),而這裡藏著一個已經污染過許多後設分析(meta-analysis)的陷阱:配對設計有兩個標準化效果量在流通,回答的卻是不同的問題。差異計量(difference-metric)的標準化效果 \(d_z = \bar{D}/s_D\),把平均改變除以差異的標準差;分母會被前後測相關縮小(見基礎概念方塊),相關越高 \(d_z\) 就越大,因此它與組間的 \(d\) 不可比,併進組間 \(d\) 會膨脹。原始計量(raw-metric)的效果 \(d_{av} = \bar{D}/s_{av}\) 除以的是前測與後測標準差的平均,與組間效果落在同一個計量上,適合用於後設分析 (Dunlap et al., 1996; Morris & DeShon, 2002)。兩者可以差很多:在試驗的實驗組中,\(d_z = 2.12\)、\(d_{av} = 2.38\)。此處前後測相關只有 \(0.37\),低於 \(0.5\) 這個分界,所以 \(d_z\) 反而是兩者中較小的;相關超過 \(0.5\) 之後大小順序才反轉、\(d_z\) 才開始膨脹。規則很簡單:兩個都報告、寫明哪個是哪個,絕不要把 \(d_z\) 放進組間效果的後設分析。表 10.2定義各個配對效果量與它們的用途;它們的信賴區間都可以由非中心 \(t\) 分配(noncentral \(t\) distribution)或拔靴法(bootstrap)求得。
表 10.2 配對設計的效果量。
| 效果量 | 分母 | 什麼時候報告它 |
|---|---|---|
| \(d_z\) | 差異的標準差 \(s_D\) | 研究內的檢定力與樣本數規劃;不可與組間 \(d\) 相比 |
| \(d_{av}\) | 前測與後測標準差的平均 | 通用的配對效果量;跨設計可比,用於後設分析是安全的 |
| \(d_{rm}\) | 已對相關作校正 | 相關已知時的後設分析併計 (Morris & DeShon, 2002) |
| 等級二系列相關(rank-biserial correlation) | 以等級為基礎 | Wilcoxon 符號等級檢定的搭檔 |
註:分母不同,數字就不同,這個選擇不是裝飾。把 \(d_z\) 當成組間 \(d\) 來報告,是後設分析(meta-analysis)中常見而且後果嚴重的錯誤。
10.3 兩組,兩個時點:核心爭議
兩個組各自前後測一次時,眼前有三種分析,而理解它們為什麼會彼此不合,正是本章智識上的核心。可以分析變化分數(change scores),檢定兩組「改變了多少」是否不同;可以作共變數分析(analysis of covariance, ANCOVA),檢定調整前測之後兩組在後測上是否不同;也可以只比後測分數,完全不理前測。隨機化設計下兩組基線期望值相等,前兩者在期望值上一致,ANCOVA 只是效率較高;兩組在基線就非等組(nonequivalent)時,變化分數分析與 ANCOVA 估計的是不同的量,可以得到相反的結論。這就是Lord 悖論(Lord’s paradox) (Lord, 1967),圖 10.3用構造出來的資料在數值上重現它。那兩個非等組的組別平均而言都是穩定的(平均改變 \(-0.19\) 與 \(+0.30\),皆未達顯著),於是變化分數分析找不到任何組間的改變差異,效果只有 \(0.5\) 分而未達顯著。可是兩組在基線本來就不同,組內「後測對前測」的迴歸斜率又小於一,ANCOVA 卻找到一個調整前測之後、在後測上高達 \(6.9\) 分且高度顯著的組間差異。資料一模一樣,判決完全相反。
註:兩個非等組組別的構造資料。各組的平均數(菱形)都落在等同線(identity line)(虛線)上,所以兩組都是穩定的,變化分數分析找不到組間差異。兩條共變數分析的迴歸線(實線,共同斜率)在垂直方向上錯開,調整前測之後便在後測上得到一個很大的組間差異。悖論在於:兩種分析各自對不同的估計標的都是正確的。
解決之道不是宣告哪一種分析才對,而是看清每一種回答的是不同的反事實(counterfactual)問題,再由設計決定哪一個問題才合理。變化分數分析假設平行趨勢(parallel trends):沒有任何組效果時兩組會改變同樣多,這正是計量經濟學差異中的差異(difference-in-differences)的邏輯,兩組走在只有水準不同的平行軌跡上時,它站得住腳。ANCOVA 假設的則是給定前測之下、若無效果則組別與後測無關,這在前測捕捉到了相關的混淆時站得住腳。隨機化之下兩個假設都成立,兩種分析一致,ANCOVA 因檢定力較高而較受偏好 (Senn, 2006; van Breukelen, 2006)。非等組之下兩個假設都不是免費的,分析者必須拿實質知識為其中一個辯護,不能讓軟體代為決定。另有兩項難題讓情況更複雜。第一是迴歸趨中(regression to the mean),見圖 10.4:極端分數者重測時會較不極端,純粹因為兩個時點的相關並不完美。完全沒有介入時,前測最低的十分之一會朝平均數上升,最高的十分之一會朝平均數下降 (Barnett et al., 2005),任何以基線極端程度為條件的分析,都有把這個假象誤認為改變的風險。第二是共變項本身的測量誤差:前測帶著誤差時,ANCOVA 會調整不足(under-adjust),因為被衰減的迴歸係數消不掉基線差異。圖 10.5顯示這在非等組中會留下一個虛假的組效果,並隨前測信度下降而增大,由完美信度時的接近零,一路到信度 \(0.5\) 時的將近五分,而此時真實效果是零。這種衰減正是「改以一個已去除測量誤差的潛在前測來調整」的理由,也就是第 19 到 21 章的結構方程取向。表 10.3給出一個決策框架。
註:沒有任何介入的模擬資料,總平均數為五十,前後測相關並不完美。前測最低與最高的十分之一(平均數以箭頭標出)在後測時都朝總平均數移動,靠的只是相關不完美這一件事。以基線的極端程度為條件,就會把這個假象(artifact)誤認為真實的效果。
註:模擬的非等組資料,後測上沒有真實的組效果。前測共變項的信度一下降,共變數分析對基線差異就調整不足,因而報告出一個虛假的組效果,信度為二分之一時達到將近五分。這個偏誤只在前測完全可靠時才消失,採用潛在變項調整(latent-variable adjustment)的理由正在於此。
表 10.3 變化分數對共變數分析:一個決策框架。
| 情境 | 較宜採用的分析 | 理由 |
|---|---|---|
| 隨機化,基線相等 | ANCOVA | 兩者都不偏;ANCOVA 檢定力較高 |
| 非等組,平行趨勢說得通 | 變化分數 | 差異中的差異估計標的與設計相符 |
| 非等組,前測捕捉到混淆 | ANCOVA(前測不可靠時改用潛在的) | 條件可交換性(conditional exchangeability)的估計標的;須校正測量誤差 |
| 前測不可靠 | 以潛在共變項調整 | 觀察值的 ANCOVA 調整不足(圖 10.5) |
| 基線依極端程度挑選 | 兩者都不宜逕行採用 | 迴歸趨中同時污染兩者 |
註:這兩種分析在不同的假設之下估計不同的量。選出估計標的(estimand)的是設計,不是軟體的預設值;在非等組中,這個選擇必須被論證,不能被自動化。
10.4 個體的改變:可靠改變指標
組層次的檢定回答的是「平均而言的那個人」有沒有改變,臨床與應用上的問題卻往往落在這一個人身上:這個人改變了嗎?改變的幅度有沒有超出測量誤差單獨就能製造的範圍?Jacobson and Truax (1991) 的可靠改變指標(reliable change index, RCI)正是為此而設,做法是把一個人觀察到的改變除以差異的標準誤(standard error of the difference),\(\mathrm{RCI} = (X_2 - X_1)/S_{\mathrm{diff}}\),其中 \(S_{\mathrm{diff}} = \sqrt{2}\,\mathrm{SE}_{\mathrm{meas}}\),而 \(\mathrm{SE}_{\mathrm{meas}} = s_1\sqrt{1 - r_{xx}}\) 取決於量表的信度。指標的絕對值超過 \(1.96\),這個改變就超出了測量誤差所能輕易解釋的範圍。再配上一個區隔功能範圍與失功能範圍的臨床切點(clinical cutoff),就得到 Jacobson–Truax 分類(Jacobson–Truax classification):可靠地改變了、而且跨進功能範圍的是痊癒(recovered);可靠地改變了但仍在功能範圍之外的是改善(improved);改變落在測量誤差之內的是未改變(unchanged);可靠地變差了的是惡化(deteriorated)。圖 10.6把試驗中每一位病人依基線與終點畫出來,再畫上可靠改變的帶與緩解切點,分類就看得見了:可靠的改變要求那個點落在一條 \(\pm 5.4\) 個 HDRS 分的帶之外(整條走廊寬 \(10.7\) 分),痊癒還要求它落在緩解線之下。兩個判準各自獨立,計算方式見表 10.4。最要緊的警告是信度係數必須與量表和母體相符,一個不適當的信度會讓每一個分類都被膨脹或壓縮。
註:每一位兩次評估都有的病人(240 人中的 134 人)依基線與第 12 週 HDRS 畫出。實線是無改變;落在下方虛線之下的點是可靠地改變了,超出由量表信度決定的 \(\pm 5.4\) 分的帶;點線是緩解(remission)切點。同時落在兩條線之下的是痊癒,落在可靠改變帶之下但仍在緩解線之上的是改善。可靠改變與臨床顯著性(clinical significance)是兩個各自獨立的判準。
表 10.4 可靠改變指標的各個成分。
| 量 | 定義與角色 |
|---|---|
| \(\mathrm{SE}_{\mathrm{meas}} = s_1\sqrt{1 - r_{xx}}\) | 測量標準誤(standard error of measurement);量表越可靠它就越小 |
| \(S_{\mathrm{diff}} = \sqrt{2}\,\mathrm{SE}_{\mathrm{meas}}\) | 兩次測量之差的標準誤 |
| \(\mathrm{RCI} = (X_2 - X_1)/S_{\mathrm{diff}}\) | 標準化的改變;\(|\mathrm{RCI}| > 1.96\) 即為可靠 |
| 臨床切點 | 一個把功能與失功能分數區隔開來的判準 |
| 分類 | 由 RCI 與切點共同決定:痊癒、改善、未改變或惡化 |
註:可靠改變問的是這個改變有沒有超出測量誤差,臨床顯著性(clinical significance)問的是這個人有沒有跨過一個有意義的門檻。兩者可以只符合其中一項,所以兩項都要報告。
10.5 確立「沒有改變」
一個不顯著的配對檢定確立不了「什麼都沒改變」:未能拒絕虛無假設不是支持它的證據,而一項小到偵測不出有意義改變的研究,不論真相如何都會例行地回報不顯著。要主張穩定,就得直接檢定穩定,工具是等值檢定(equivalence testing),具體而言是兩個單尾檢定(two one-sided tests, TOST)的程序 (Lakens, 2017; Lakens et al., 2018)。先指定一個等值區間(equivalence region),也就是一個小到可以視為微不足道的改變範圍,由第 4 章的最小關切效果量(smallest effect size of interest)決定,再檢定觀察到的改變是不是顯著地比兩端的界限都更靠近零。圖 10.7把這個邏輯用在控制組的短期穩定性上:改變的 \(90\%\) 信賴區間完全落在 \(\pm 2\) 分的等值區間之內,所以這個改變顯著地小於最小關切效果,可以作出「等值」的結論,而不只是「沒能找到差異」。關鍵在等值界限,它必須在分析之前就由實質理由辯護過:區間寬就容易宣告等值,區間窄則幾乎不可能。這個界限編碼的是「什麼才算沒有有意義的改變」,那是科學判斷,不是統計判斷。
註:控制組短期改變的 \(90\%\) 信賴區間完全落在 \(\pm 2\) 分的等值區間(底色區塊)之內。這個區間排除了兩端的等值界限,因此改變顯著地小於最小關切效果,可以作出等值的結論。等值界限(equivalence bounds)必須在分析之前就辯護過。
10.6 兩波之外:學不到的東西
不管分析得多麼小心,兩個時點都帶著一個硬性的限制:識別得出改變的量,識別不出改變的形狀,對後續各章所建模的個體內動態更是無話可說。圖 10.8用三條基線相同、終點也相同、中間卻完全不同的軌跡把這個限制攤開:一條穩定下降,一條晚期驟降,一條早期驟降之後持平。兩波研究只測到兩個端點,區分不了這三種歷程,而它們在臨床與理論上都不相同:穩定反應、晚期反應、早期反應之後持平,講的是關於機制與預後的三個不同故事。這不是分析的失敗,是設計的失敗,也是本書要走出兩波的理由。它同時讓第 3 章那個差異分數信度的問題復活:兩個不完美可靠的測量之差,可能比其中任何一個都更不可靠 (Cronbach & Furby, 1970; Rogosa, 1988)。那個問題在該章已經平反過,在此仍然成立,並為下一章的變異數分析方法與第四部的成長模型鋪路;要識別出一條軌跡,那些方法都需要三個以上的時點。
註:三條軌跡(trajectory)的基線值與終點值完全相同(黑點),形狀卻截然不同:穩定下降、晚期驟降,以及早期驟降之後進入高原。兩時點的設計只觀察到兩個端點,區分不了這些歷程;要區分它們,需要三個以上的波次(wave)。
10.7 在 R 中執行這些分析
實作的分析用 base R 就夠:t.test、wilcox.test 與 mcnemar.test 涵蓋各種配對檢定,效果量直接算。配對檢定是對差異所作的單樣本檢定,兩個效果量都報告也只是兩行計算。
library(dplyr); library(tidyr)
rct <- readRDS("Examples/data/therapy_rct.rds")
pp <- rct |> filter(week
pivot_wider(names_from = week, values_from = hdrs, names_prefix = "w",
id_cols = c(patient_id, arm)) |>
filter(!is.na(w0), !is.na(w11)) |> mutate(change = w11 - w0)
trt <- filter(pp, arm == "Treatment")
t.test(trt$w11, trt$w0, paired = TRUE) # 對差異作的配對 t
dz <- mean(trt$change) / sd(trt$change) # 差異計量的 d
dav <- mean(trt$change) / mean(c(sd(trt$w0), sd(trt$w11))) # 原始計量的 d
那三種兩組分析就是三個線性模型。重現 Lord 悖論的做法,是把三個模型都配適到非等組資料上,再比較組別係數。
ld <- readRDS("Examples/data/lord_demo.rds")
lm(change ~ group, data = ld) # 變化分數分析
lm(post ~ pre + group, data = ld) # ANCOVA(調整前測)
lm(post ~ group, data = ld) # 只看後測
可靠改變指標由量表信度直接算出,分類則由指標與一個臨床切點決定。等值檢定就是兩個單尾檢定的程序,拿一個 \(90\%\) 信賴區間與等值界限比較。
rel <- 0.86 # 已發表的量表信度
se_meas <- sd(pp$w0) * sqrt(1 - rel); s_diff <- sqrt(2) * se_meas
pp <- pp |> mutate(RCI = change / s_diff,
class = case_when(RCI <= -1.96 & w11 <= 7 ~ "Recovered",
RCI <= -1.96 ~ "Improved",
RCI >= 1.96 ~ "Deteriorated",
TRUE ~ "Unchanged"))
# --- 等值檢定 (TOST):改變是否落在 +/- 2 分的區間內? ---
stab <- rct |> filter(week
pivot_wider(names_from = week, values_from = hdrs, names_prefix = "w",
id_cols = c(patient_id, arm)) |>
filter(arm == "Control", !is.na(w0), !is.na(w1)) |>
mutate(d = w1 - w0)
n <- nrow(stab); m <- mean(stab$d); se <- sd(stab$d) / sqrt(n)
m + c(-1, 1) * qt(0.95, n - 1) * se # 90
max(1 - pt((m + 2) / se, n - 1), pt((m - 2) / se, n - 1)) # p_TOST = .015
完整的分析都在隨附的 ch10_analysis_V01.R 裡,包括檢定力對相關的曲線、迴歸趨中與測量誤差的模擬,以及完整的可靠改變分類。繪圖的腳本是 ch10_figures_zh_V01.R,悖論的資料存檔為 lord_demo。偏好使用套件的讀者,effectsize 與 TOSTER 分別可算出配對的效果量與等值檢定,並重現此處所示的數值。
軟體提示 • 效果量與等值檢定的工具
base R 涵蓋本章的每一個檢定,但有兩個套件可以讓報告更順手。effectsize 能由一個已配適的配對檢定算出 \(d_z\)、\(d_{av}\) 與它們的信賴區間,省去把錯的分母配上錯的標籤的風險,也為無母數檢定(nonparametric test)報告以等級為基礎的效果量。TOSTER 實作兩個單尾檢定的程序與它的檢定力分析,等值界限可用原始單位或標準化單位給定。由點選式軟體(point-and-click software)轉過來的讀者,會在「成對樣本」選單下找到配對 \(t\),在一般線性模型或迴歸選單下找到 ANCOVA。對應是精確的,但「依設計而不是依預設值選擇變化分數或 ANCOVA」這個責任,仍然在分析者身上。
10.8 報告一項兩時點分析
兩時點的結果報告出來要有檢定、平均改變與它的區間、標示正確的效果量;若是試驗,還要有 CONSORT 的參與者流程。這項試驗的示範段落可以這樣寫:「在 \(66\) 位有完整前後測資料的實驗組病人中,HDRS 分數由基線到第 12 週平均下降 \(12.67\) 分,\(t(65) = 17.21\),\(p < .001\),效果很大(\(d_{av} = 2.38\);\(d_z = 2.12\)),差異計量與原始計量的標準化效果分開報告。控制組下降 \(6.80\) 分(\(95\%\) CI \([5.40, 8.20]\))。本試驗經過隨機化,組間比較因此採用以基線為共變項的共變數分析,那是兩種不偏分析中檢定力較高的一種。個體的改變以可靠改變指標分類,採用已發表的信度 \(.86\)(\(S_{\mathrm{diff}} = 2.74\));\(66\) 位實驗組病人中有 \(30\) 位痊癒、另有 \(31\) 位可靠地改善,控制組則分別為 \(8\) 位與 \(32\) 位。」每一個元素都在,效果量沒有混淆,選擇 ANCOVA 的理由來自設計、不是斷言。下面的陷阱方塊收的是這樣一段報告所避開的錯誤。
常見陷阱 • 兩時點分析的三個錯誤
第一,拿 \(d_z\) 去做後設分析:\(d_z\) 會被前後測相關膨脹,放進組間效果的後設分析會高估效果,有時嚴重高估;請報告並併計 \(d_{av}\),或一個已對相關校正的效果量。第二,把「控制基線」當成理所當然的美德:非等組設計中,對一個組間本來就不同的基線作調整,估計的是一個可能並不存在的反事實(counterfactual),前測不可靠時還會調整不足(圖 10.5)。這項調整必須由設計來論證;審查者反射性地要求它時,站得住腳的回應是援引 Lord 悖論與爭議中的那個估計標的。第三,用錯信度的可靠改變指標:採用來自不同量表、不同樣本或不同間隔的信度,會讓每一個分類都失準,那個係數必須與手上的工具與母體相符。
10.9 常見的迷思
關於兩時點分析,有幾個信念會誤導。第一個是配對 \(t\) 檢定要求結果變項服從常態分配:它只要求差異分數近似常態,中等樣本下對輕微的偏離也相當穩健。第二個是ANCOVA 永遠優於變化分數:兩者估計的是不同的量,非等組之下這個「優越」的主張是空的,因為根本沒有一個不帶假設的答案,Lord 悖論已經說明了這一點。第三個是一個不顯著的前後測檢定就表示沒有發生改變:證據的缺席不是缺席的證據,關於穩定的主張需要一個帶有已辯護界限的等值檢定。第四個是一個顯著的可靠改變指標就代表臨床上有意義的痊癒:可靠改變與臨床顯著性是兩個各自獨立的判準,一個人可以可靠地改變,卻沒有跨過任何有意義的門檻。還有一個反覆出現的實務問題:觀察性的前後測設計中,審查者要求作基線調整時該怎麼回應?答案不是拒絕,而是把估計標的講明白:說出那項調整假設的是哪一個反事實、顯示設計支不支持它,並在平行趨勢之下提出變化分數分析作為互補的估計標的 (Allison, 1990; Holland & Rubin, 1983)。
本章摘要
兩時點設計無所不在,也很有教育意義,而它的核心啟示是:分析把問題編碼了進去。配對 \(t\) 檢定是對差異分數(difference score)所作的單樣本檢定,檢定力優勢來自把個體間變異數差分掉,並隨前後測相關增大(圖 10.1、10.2);Wilcoxon 檢定與 McNemar 檢定處理非常態與二元的結果,各自帶著自己的假設。配對的效果量有差異計量的 \(d_z\) 與原始計量的 \(d_{av}\) 兩種,絕不可混淆,因為 \(d_z\) 會隨相關而膨脹並污染後設分析。變化分數對共變數分析的爭議由 Lord 悖論推到極致:同一批非等組資料在改變上沒有組間差異,用 ANCOVA 卻有很大的差異(圖 10.3),因為兩種分析假設的是不同的反事實;迴歸趨中與前測的測量誤差讓這項調整更加複雜(圖 10.4、10.5),估計標的必須由設計來選。個體的改變以可靠改變指標對照測量誤差與一個臨床切點(clinical cutoff)來分類(圖 10.6),穩定性由等值檢定而不是由一個不顯著的結果來確立(圖 10.7),而兩個波次不管怎麼分析,都只識別得出改變的量、識別不出它的形狀(圖 10.8)。
接下來讀哪裡
兩時點的情形是後續一切的種子。配對 \(t\) 檢定是最簡單的個體內模型,一個對差異分數只含截距的模型;下一章用重複量數變異數分析把它推廣到三個以上的時點,第四部再把兩者都重新表述為混合模型的特例,其中變化分數與共變項調整重新現身為建模的選擇,而不是彼此分立的程序。變化分數分析的差異中的差異邏輯,會在第 20 與 21 章交叉延宕追蹤模型的爭論中回來,同樣的估計標的爭議在那裡是在潛在層次上開打;「以一個無誤差的潛在前測來調整」的理據,則由第 19 到 21 章的結構方程方法接手。可靠改變與臨床顯著性的想法會在第 33 章的臨床應用中再度出現。往前帶著的唯一啟示是:兩種站得住腳的分析可以回答不同的問題,而分析者的第一項責任,是在選模型之前先把問題講清楚。
習題
- 10.1 它們何時一致。以代數證明:兩組基線平均數相等、且組內「後測對前測」的迴歸斜率為一時,變化分數估計式與共變數分析估計式所得的組間差異相等,並指出隨機化保證的是哪一個假設。
- 10.2 重現這個悖論。就所提供的
lord_demo資料執行三種兩組分析,說出每一方會提出的主張,再把反事實假設講明白,據以裁決。 - 10.3 一次完整的配對分析。就
therapy_rct的其中一組執行配對檢定,報告兩個標準化效果量與它們的區間,並產出斜率圖與差異的分配圖。 - 10.4 可靠改變。取兩個不同的信度係數,把所有病人依可靠改變指標分類,報告有多少人的分類改變了、往哪個方向改變。
- 10.5 設計一項等值檢定。針對「停止治療之後沒有惡化」這個主張,由一個最小關切效果辯護出等值界限,並說明兩個單尾檢定的程序需要多大的樣本,才能以足夠的檢定力偵測到等值。
本章重要名詞中英對照
| 中文 | English | 說明/首次出現處 |
|---|---|---|
| 差異分數 | difference score | 同一個人前後兩次測量之差;第 10.1 節 |
| 配對 \(t\) 檢定 | paired \(t\) test | 對差異分數所作的單樣本 \(t\) 檢定;第 10.1 節 |
| 符號等級檢定 | Wilcoxon signed-rank test | 檢定差異的分配是否對稱於零;第 10.1 節 |
| 符號檢定 | sign test | 只問上升是否多於下降;第 10.1 節 |
| McNemar 檢定 | McNemar’s test | 配對二元結果的兩種轉換是否等頻;第 10.1 節 |
| 差異計量效果量 | difference-metric effect size (\(d_z\)) | 平均改變除以差異的 SD;隨相關膨脹;第 10.2 節 |
| 原始計量效果量 | raw-metric effect size (\(d_{av}\)) | 平均改變除以前後測 SD 的平均;第 10.2 節 |
| 變化分數 | change score | 兩組設計中作為結果變項的改變量;第 10.3 節 |
| 共變數分析 | analysis of covariance (ANCOVA) | 調整前測之後比較後測;第 10.3 節 |
| 非等組 | nonequivalent groups | 兩組在基線就有系統性差異;第 10.3 節 |
| Lord 悖論 | Lord’s paradox | 同一批資料兩種分析得到相反判決;第 10.3 節 |
| 平行趨勢 | parallel trends | 無效果時兩組會改變同樣多的假設;第 10.3 節 |
| 差異中的差異 | difference-in-differences | 平行趨勢之下的組間改變對比;第 10.3 節 |
| 迴歸趨中 | regression to the mean | 極端分數重測時趨向平均數;第 10.3 節 |
| 調整不足 | under-adjustment | 共變項有誤差時 ANCOVA 消不掉基線差異;第 10.3 節 |
| 可靠改變指標 | reliable change index (RCI) | 個體改變除以差異的標準誤;第 10.4 節 |
| 測量標準誤 | standard error of measurement | \(s_1\sqrt{1 - r_{xx}}\);第 10.4 節 |
| 臨床切點 | clinical cutoff | 區隔功能與失功能範圍的判準;第 10.4 節 |
| 臨床顯著性 | clinical significance | 是否跨過有意義的門檻;第 10.4 節 |
| Jacobson–Truax 分類 | Jacobson–Truax classification | 痊癒/改善/未改變/惡化四類,由 RCI 與臨床切點共同決定;第 10.4 節 |
| 等值檢定 | equivalence testing (TOST) | 直接檢定改變小於最小關切效果;第 10.5 節 |
| 等值區間 | equivalence region | 小到可視為微不足道的改變範圍;第 10.5 節 |
參考文獻
Allison, P. D. (1990). Change scores as dependent variables in regression analysis. Sociological Methodology, 20, 93–114. https://doi.org/10.2307/271083
Barnett, A. G., van der Pols, J. C., & Dobson, A. J. (2005). Regression to the mean: What it is and how to deal with it. International Journal of Epidemiology, 34(1), 215–220. https://doi.org/10.1093/ije/dyh299
Cronbach, L. J., & Furby, L. (1970). How we should measure “change”: Or should we?. Psychological Bulletin, 74(1), 68–80. https://doi.org/10.1037/h0029382
Dunlap, W. P., Cortina, J. M., Vaslow, J. B., & Burke, M. J. (1996). Meta-analysis of experiments with matched groups or repeated measures designs. Psychological Methods, 1(2), 170–177. https://doi.org/10.1037/1082-989X.1.2.170
Holland, P. W., & Rubin, D. B. (1983). On Lord’s paradox. In H. Wainer & S. Messick (Eds.), Principals of modern psychological measurement: A festschrift for Frederic M. Lord (pp. 3–25). Lawrence Erlbaum Associates.
Jacobson, N. S., & Truax, P. (1991). Clinical significance: A statistical approach to defining meaningful change in psychotherapy research. Journal of Consulting and Clinical Psychology, 59(1), 12–19. https://doi.org/10.1037/0022-006X.59.1.12
Lakens, D. (2017). Equivalence tests: A practical primer for t tests, correlations, and meta-analyses. Social Psychological and Personality Science, 8(4), 355–362. https://doi.org/10.1177/1948550617697177
Lakens, D., Scheel, A. M., & Isager, P. M. (2018). Equivalence testing for psychological research: A tutorial. Advances in Methods and Practices in Psychological Science, 1(2), 259–269. https://doi.org/10.1177/2515245918770963
Lord, F. M. (1967). A paradox in the interpretation of group comparisons. Psychological Bulletin, 68(5), 304–305. https://doi.org/10.1037/h0025105
Morris, S. B., & DeShon, R. P. (2002). Combining effect size estimates in meta-analysis with repeated measures and independent-groups designs. Psychological Methods, 7(1), 105–125. https://doi.org/10.1037/1082-989X.7.1.105
Rogosa, D. R. (1988). Myths about longitudinal research. In K. W. Schaie, R. T. Campbell, W. Meredith, & S. C. Rawlings (Eds.), Methodological issues in aging research (pp. 171–209). Springer.
Senn, S. (2006). Change from baseline and analysis of covariance revisited. Statistics in Medicine, 25(24), 4334–4344. https://doi.org/10.1002/sim.2682
van Breukelen, G. J. P. (2006). ANCOVA versus change from baseline had more power in randomized studies and more bias in nonrandomized studies. Journal of Clinical Epidemiology, 59(9), 920–925. https://doi.org/10.1016/j.jclinepi.2006.02.007
引用本章
APA 第 7 版沒有「單一作者專書之章」這個文獻類型:正式的參考文獻指向整本書,章次寫在內文引用裡。若您要讓引用直接連到本章這一頁,再採用下方第二組(依 APA 的網站文件格式)。
引用全書、於內文指明章次(建議)
只引用本章這一頁
英文稿件中引用
APA 第 7 版第 9.38 節:非英文著作保留原文題名,並於方括號內附英文翻譯。