變化的分析游琇婷(Hsiu-Ting Yu)社會科學的縱貫、密集縱貫與動態資料分析

第 4 章

規劃縱貫研究:檢定力、精確度與設計上的取捨

第 2 章挑選了設計,第 3 章顧好了設計的測量品質。本章要處理計畫審查委員接下來一定會問的那個問題:這項研究要做多大?對縱貫模型而言,誠實的答案從來不是單一個數字。一項研究在估計平均軌跡上檢定力充裕,卻可能完全偵測不到那條軌跡的個體差異。規劃的意思是先決定哪一個估計標的(estimand)才重要,再繞著它把研究建起來;而面對現實的模型,讓這件事做得到的工具是模擬。

學習目標

讀完本章之後,你應該能夠:(1) 指出重複量數變異數分析、多層次成長模型、潛在成長模型與密集縱貫設計各自由哪些設計因素主導檢定力(power);(2) 對簡單的重複測量設計套用封閉解(closed-form)的檢定力公式,並說明公式在哪裡失效;(3) 依一套可重複使用的六步驟流程,從零做出一個縱貫模型的模擬式檢定力分析;(4) 在標準情形下改用 simr 這類既有工具與蒙地卡羅(Monte Carlo)功能;(5) 在預算固定時,量化地權衡「人數」與「時點數」;(6) 為現實的流失與配合度預作規劃;(7) 用「估計標的先行、關注精確度」的語言,向計畫審查委員說明樣本數的理由。

4.1 當模型有許多參數時,檢定力是什麼意思

在兩組比較裡,檢定力是一個數字,附著在一個效果上。縱貫模型同時估計許多個量,而每一個量都有自己的檢定力。圖 4.1用一項每日日誌設計把這件事攤開來看:三十個人,連續測量十四天。在同一項研究裡,隨機截距(random intercept)變異數的檢定力幾乎等於一;某個每日預測變項的個體內效果,檢定力約為 \(.82\);而個體間效果、跨層次交互作用(cross-level interaction)與隨機斜率(random slope)變異數這三個量,檢定力都在 \(.50\) 附近,遠低於慣用的 \(.80\)。同一批資料,會因為你問的問題不同,而同時是檢定力過剩的與檢定力不足的。世上沒有「這項研究的檢定力」這種東西,只有「某一個指名的估計標的的檢定力」。

同一項研究、五個估計標的、五個檢定力值。
圖 4.1 同一項研究、五個估計標的、五個檢定力值。

註:同一項每日日誌設計(30 人、14 天)中,由同一個多層次模型估計的五個量各自的模擬檢定力。檢定力從隨機截距變異數的接近 \(1.0\),一路降到隨機斜率變異數的約 \(.49\)。虛線標示慣用的 \(.80\)。

這種多重性帶來一個很有建設性的推論:規劃要從指名「這項研究是為了估計哪一個估計標的而存在」開始,再為那一個量準備檢定力。它也讓整件事值得換一個框架來看。虛無假設檢定的檢定力問的是「一個效果能不能與零區辨開來」,但一項研究可以跨過那道門檻,仍然把效果估得太不精確而派不上用場。與它互補的框架是參數估計準確度(accuracy in parameter estimation, AIPE),改為針對一個目標精確度(precision)來規劃,問的是「要多少樣本,才能讓信賴區間(confidence interval)的寬度不超過某個由實質判斷選定的值」(Maxwell et al., 2008)。精確度規劃留到第 4.6 節與圖 4.8再展開。當審稿人對一個「任何可行樣本都偵測不到」的量堅持要求 \(.80\) 檢定力,精確度往往是更站得住腳的框架,因為它把對話從二元判決,換成「這個效果會被釘得多緊」。

4.2 封閉解的結果及其適用範圍

最簡單的重複測量設計,檢定力可以直接由公式算出來。成對樣本 \(t\) 檢定(paired \(t\) test)與重複量數變異數分析都有以非中心分配(noncentral distribution)為基礎的古典檢定力公式,而公式裡編碼的關鍵縱貫事實是:檢定力取決於重複測量之間的相關。時點之間相關得越強,受試者內的對比(contrast)就估得越精確,這正是重複測量設計有效率的原因,也正是球形(sphericity)假設一旦被違反就會扭曲整個計算的原因。從 G*Power 這類軟體轉過來的讀者會發現,這些情形那些軟體都有現成的處理。基礎概念方塊陳述非中心性的邏輯,以及多層次成長斜率的解析結果。

基礎概念 • 非中心性,以及多層次的解析結果從何而來

雙尾的 \(H_0\!:\gamma = 0\) 檢定,在 \(|z| = |\hat\gamma / \mathrm{SE}(\hat\gamma)|\) 超過 \(z_{1-\alpha/2}\) 時拒絕。對立假設 \(\gamma = \gamma^\ast\) 之下,統計量 \(z\) 的中心不在零,而在非中心性參數(noncentrality parameter)

\[\lambda = \frac{\gamma^\ast}{\mathrm{SE}(\hat\gamma)}, \qquad \text{檢定力} = \Phi(\lambda - z_{1-\alpha/2}) + \Phi(-\lambda - z_{1-\alpha/2}).\]
(4.1)

檢定力因此完全由「效果對其標準誤的比值」決定。

兩層次成長模型中的平均線性斜率,若有 \(N\) 個人,每個人都在編碼為 \(t_1,\dots,t_T\) 的各時點受測,則其抽樣變異數有一個頗具啟發性的封閉解:

\[\mathrm{Var}(\hat\gamma_{\text{斜率}}) \;\approx\; \frac{\tau_{11}}{N} \;+\; \frac{\sigma^2}{N \sum_{j}(t_j - \bar t)^2},\]
(4.2)

其中 \(\tau_{11}\) 是斜率的個體間變異數,\(\sigma^2\) 是個體內的殘差變異數 (Raudenbush & Liu, 2001; Snijders & Bosker, 2012)。式 (4.2) 是縱貫設計的解析核心。增加時點或把時點拉得更開,\(\sum_j (t_j - \bar t)^2\) 就變大,第二項隨之縮小:期程與間距買得到精確度。第一項 \(\tau_{11}/N\) 則是一道壓不下去的下限(floor),由斜率上真實存在的個體差異所設定;個體內測量做得再密都動不了它,只有增加人數才行。一項研究可以在平均斜率上檢定力極為充裕,在斜率的變異數上卻很弱,原因就在這裡。

式 (4.2) 值得畫成一張圖。圖 4.2把斜率估計值的抽樣變異數對人數作圖,比較三種時點設計:四個時點集中在較窄的跨距、四個時點散在較寬的跨距,以及八個時點。把時點拉寬或增加時點,都能明顯把曲線壓低;「何時測量、測量幾次」因此可以和「招募多少人」一樣重要。但三條曲線都朝同一道下限逼近,也就是 \(\tau_{11}/N\) 那一項,而它只有靠招募更多人才推得下去。一項設計若要估計的是「變化上的個體差異」而不只是「平均變化」,測量密度再高也補不上來,它本質上是一件大 \(N\) 的事。

斜率估計量變異數的解剖:人數、時點數與間距各自的貢獻。
圖 4.2 斜率估計量變異數的解剖:人數、時點數與間距各自的貢獻。

註:平均斜率的解析抽樣變異數(式 4.2)對人數作圖,比較三種時點設計。增加時點或把時點拉寬都會把曲線壓低;虛線是 \(\tau_{11}/N\) 這道下限,只能靠增加人數來降低。圖中參數為示意值(\(\tau_{11}=0.05\)、\(\sigma^2=0.6\))。

再往外走,公式就變得脆弱。廣義線性混合模型(generalized linear mixed model)、參數眾多的潛在成長模型,以及帶有自我迴歸結構的密集縱貫模型,都很少能得到值得信賴的封閉解檢定力:目標參數的標準誤取決於整個模型,而這種依賴沒有任何簡單公式捕捉得住。碰到這些情形,誠實而通用的工具是模擬。模擬一旦學會,封閉解就從必需品退成可有可無的方便。

4.3 以模擬為基礎的檢定力分析流程

模擬式的檢定力分析是一項可以反覆使用的技能:指定產生資料的歷程,用它產生大量資料集,把分析模型配適到每一個資料集上,再數一數目標效果被偵測到的比例。那個比例就是檢定力。整個流程有六個步驟,見圖 4.3;只要換掉資料生成函式與分析方法,同一具骨架就能服務任何模型。

以模擬為基礎的六步驟檢定力分析流程。
圖 4.3 以模擬為基礎的六步驟檢定力分析流程。

註:同一具骨架適用於任何模型:只有資料生成歷程(data-generating process, DGP)(步驟 1)與分析方法(步驟 4)會換。步驟 6 回饋到步驟 2,因為檢定力分析是針對不確定假設所做的敏感度分析,不是一次計算。

下面這段程式碼就是完整的引擎,套用在一個每日日誌模型上:模型裡有一個個體內預測變項與一個個人層次的調節變項(moderator),兩者一起影響結果變項。程式刻意寫得精簡;配套的 power_sim_template_zh_V01.R 是同一套邏輯加上註解,後續各章會反覆用到。

library(lme4)

# 步驟 1:資料生成歷程,每一個參數都明白寫出
sim_diary <- function(N, D, g10 = 0.15, g01 = 0.20, g11 = 0.10,
                      tau00 = 0.25, tau11 = 0.03, sigma = sqrt(0.5)) {
  person <- rep(seq_len(N), each = D)
  w <- rep(rnorm(N), each = D); x <- rnorm(N * D)          # 調節變項、預測變項
  u0 <- rep(rnorm(N, 0, sqrt(tau00)), each = D)            # 隨機截距
  u1 <- rep(rnorm(N, 0, sqrt(tau11)), each = D)            # 隨機斜率
  y  <- u0 + (g10 + u1)*x + g01*w + g11*x*w + rnorm(N*D, 0, sigma)
  data.frame(person, x, w, y)
}

# 步驟 3 與 4:產生資料、配適模型、收割一次重複的結果
one_rep <- function(N, D) {
  d <- sim_diary(N, D)
  f <- lmer(y ~ x + w + x:w + (1 + x | person), data = d)
  b <- fixef(f); s <- sqrt(diag(vcov(f)))
  data.frame(p_within = 2*pnorm(-abs(b["x"]/s["x"])),      # 個體內效果
             converged = length(f@optinfo$conv$lme4$messages) == 0)
}

# 步驟 5:彙整多次重複的檢定力(步驟 2 就是上面選定的數值)
set.seed(2026)
reps <- do.call(rbind, replicate(500, one_rep(N = 40, D = 14),
                                 simplify = FALSE))
reps <- reps[reps$converged, ]                             # 收斂紀錄
mean(reps$p_within < 0.05)                                 # 估計檢定力約 0.95

這套流程有三個特徵,把值得信賴的檢定力分析與誤導的分析分開。第一是收斂紀錄(convergence bookkeeping)。混合模型在某些模擬資料集上會不收斂,小樣本時尤其如此;默默把那些資料集丟掉,會把回報的檢定力抬高,因為這些失敗相對於效果並不是隨機發生的。誠實的做法是記下每一次配適的收斂狀態、報告收斂率,並事先講好未收斂的配適怎麼計入;把它們算成「未偵測到」,保守而站得住腳。第二是種子管理(seed management):在最上面設一個種子,整份分析就可重現;要平行執行,則必須改用平行安全的隨機數產生器(例如 L’Ecuyer 串流),各個工作程序才不會共用或重複同一批隨機數。第三,步驟 2 的那些參數值,正是檢定力分析的生死關口。

常見陷阱 • 檢定力分析出錯的三種方式

第一,觀察到的檢定力(observed power),也就是事後檢定力(post hoc power):拿一項已完成研究實際觀察到的效果量(effect size)回頭去算檢定力,沒有任何訊息量,因為觀察到的檢定力是 \(p\) 值的單調函數,除了 \(p\) 值以外什麼也沒多說;結果不顯著時,就構造而言觀察到的檢定力必然偏低。檢定力分析是設計活動,要在蒐集資料之前做完。第二,只為固定的主效果準備檢定力:宣稱一項研究對平均斜率有 \(.90\) 的檢定力,真正的科學主張卻是斜率的個體差異或某個跨層次交互作用,等於替容易的估計標的宣傳檢定力,同時把困難的那一個藏起來(圖 4.1)。請為承載主張的那個估計標的準備檢定力。第三,忽略收斂失敗:只在收斂的那些資料集上彙整檢定力,又不報告有多少沒收斂,會讓估計值往上偏,也掩蓋掉一項「以其樣本而言野心過大」的設計。

那些參數值從哪裡來?這是檢定力分析的「垃圾進、垃圾出」問題,沒有完全令人滿意的解答,只有幾個有紀律的選項,摘要於表 4.1。前導資料(pilot data)給得出現實的變異數成分,但樣本一小,效果的估計就既有雜訊又偏高。已發表的文獻提供得了效果量,卻被發表偏誤(publication bias)扭曲;照著已發表的效果去規劃,就是照著一個被膨脹的目標規劃,做出來的研究檢定力不足。最站得住腳的錨點往往是最小關切效果量(smallest effect size of interest, SESOI),也就是「低於此值,這項發現在實質上就不重要」的那個效果;為它準備檢定力,等於保證這項研究偵測得到任何值得偵測的東西 (Lakens, 2022)。不管來源是哪一種,輸入值不確定的補救辦法都一樣:在一段合理的參數範圍上報告檢定力,給一條敏感度曲線(sensitivity curve)而不是單一個數字,讓讀者看見結論怎麼隨假設改變。

表 4.1 檢定力分析的參數從何而來。

來源它提供什麼要注意什麼
前導資料現實的變異數成分與相關小型前導研究給出的效果量既有雜訊又偏高
已發表文獻貌似合理的效果量發表偏誤會把效果膨脹:贏家的詛咒(winner’s curse)
最小關切效果量(SESOI)有原則的下界,用來作為準備檢定力的對象需要一個明確的實質判斷
敏感度分析一段合理數值範圍上的檢定力要報告整條曲線,不是某個方便的單一數字

註:把來源合併使用相當常見:變異數成分取自前導研究、效果取在 SESOI,再對最不確定的輸入做一次敏感度掃描。

4.4 標準情形的工具捷徑

從零寫出模擬是通用技能,但面對標準模型,既有工具可以省掉那些樣板程式。表 4.2把常見的模型家族對應到工具。lme4 模型用 simr,它把整套流程包了起來:從一個已配適或已指定的模型模擬資料,回報檢定力,也畫得出隨樣本數變化的檢定力曲線 (Green & MacLeod, 2016)。兩層次與三層次的試驗設計,powerlmm 曾提供便利的封閉解與模擬檢定力,不過撰稿時要先確認該套件的維護狀態,若已無法取得,就以等效的自寫程式替代。潛在成長模型與結構方程模型可用 lavaan 的資料模擬功能搭配一個配適迴圈,實作的正是同一套蒙地卡羅邏輯;Mplus 的 MONTECARLO 程序則是這個領域在潛在變項檢定力上長年的主力 (Muthén & Curran, 1997; Muthén & Muthén, 2002)。帶有自我迴歸結構的密集縱貫設計可用 Lafit et al. (2021) 的 Shiny 應用程式,它為多層次模型做檢定力分析時會尊重時間依賴性,而現成工具通常忽略這一點。用哪一種工具都一樣,三項紀律不變:指名估計標的、誠實交代參數來源、報告敏感度。

表 4.2 縱貫檢定力分析的工具。

工具模型家族長處限制
simrlme4 的 LMM/GLMM包好了「模擬、配適、計數」;可畫檢定力曲線格點大時很慢;只支援 lme4
powerlmm兩至三層次的試驗對標準試驗設計很快需確認 CRAN 狀態;模型類別有限
lavaan 蒙地卡羅潛在成長模型/SEM彈性高;迴圈由你掌控需要自寫程式
Mplus MONTECARLO潛在成長/成長混合/DSEM潛在變項檢定力的領域標準授權軟體
Lafit 等人的 Shiny 程式多層次自我迴歸(密集縱貫)尊重時間依賴性模型選單固定
自寫模擬任何模型完全掌控;這是通用技能必須自己寫、自己驗證

註:套件的可取得性會變動,撰稿時請再確認。自寫模擬永遠是備案,也正是其他工具所自動化的那項技能。

4.5 三個實作的檢定力分析

第 2 章那三個設計小案例在這裡以檢定力分析的形式回來,每一個都產出一張圖與一段可以直接寫進計畫書的文字。

4.5.1 每日日誌研究:主效果便宜,交互作用昂貴

那項壓力與睡眠的日誌研究問兩個問題:每日壓力會不會在個體內預測當晚的睡眠,以及這個個體內的耦合會不會被某個個人層次的特質調節。前者是個體內主效果,後者是跨層次交互作用。圖 4.4畫出個體內效果在「人數 \(\times\) 天數」格點上的檢定力。這個效果很便宜:每人只測一週,八十人就已超過 \(.80\);測滿兩週,三十人上下即可達到,此後很快飽和,因為個體內效果吃的是每個人貢獻的許多時點。圖 4.5把主效果與跨層次交互作用放在同一條軸上對照。交互作用則很昂貴:十四天的條件下,要到七十人附近才有 \(.80\) 檢定力,大約是主效果所需樣本的兩倍。原因在於跨層次交互作用本質上是在個體間層次估計的,而在那個層次上訊息的單位是人,不是時點。這是日誌與經驗取樣研究最重要、也最常被忽略的一項規劃教訓:增加天數對跨層次交互作用幫助很小,增加人數才有決定性。

個體內效果在人數與天數上的檢定力(每日日誌小案例)。
圖 4.4 個體內效果在人數與天數上的檢定力(每日日誌小案例)。

註:每日預測變項的個體內效果之模擬檢定力(每格 \(300\) 次重複),作為人數與天數的函數。個體內效果在不大的樣本下就達到高檢定力,而且很快飽和。

個體內主效果與跨層次交互作用:同一項研究,檢定力天差地遠。
圖 4.5 個體內主效果與跨層次交互作用:同一項研究,檢定力天差地遠。

註:每人十四天下的模擬檢定力。個體內主效果(藍色)在三十人附近達到 \(.80\);跨層次交互作用(橘紅色)需要大約兩倍的人數,而且增加天數並不會把這個差距補起來。

這項研究可以直接寫進計畫書的一段文字是:「本研究的主要假設關乎每日壓力與特質反芻思考在預測睡眠上的跨層次交互作用。假定個體內壓力對睡眠的斜率為 \(0.15\)、調節效果為 \(0.10\)、隨機斜率變異數為 \(0.03\)、殘差變異數為 \(0.50\)(取自前導資料與最小關切效果量),每個條件 \(300\) 次重複的蒙地卡羅檢定力分析顯示:\(120\) 位參與者完成十四天的日誌,在 \(\alpha = .05\) 之下偵測該交互作用的檢定力至少為 \(.90\)。調節效果由 \(0.07\) 變動到 \(0.13\) 的敏感度分析,檢定力介於 \(.72\) 與 \(.98\);上述各條件的收斂率都超過 \(99\%\)。」

4.5.2 加速成長研究:偵測變化上的個體差異

那項加速世代的學業成就研究(school_growth 設計)問的不只是兒童會不會成長,而是他們成長的速度有沒有差異,也就是隨機斜率的變異數是不是不為零。式 (4.2) 早就預告過,這是一個大 \(N\) 的問題。圖 4.6畫出斜率變異數的檢定力:五十位兒童時約 \(.45\),到四百位時幾乎等於一,並在一百三十位附近跨過 \(.80\)。一項只按「估計平均成長軌跡」來定樣本數的研究,需要的兒童遠少於此,卻會在「個體差異」這個經常真正驅動發展研究的問題上嚴重檢定力不足 (Hertzog et al., 2006)。指名這兩個問題中哪一個才是主要問題,是規劃這類研究的第一個動作。

在加速設計中偵測成長的個體差異(斜率變異數)的檢定力。
圖 4.6 在加速設計中偵測成長的個體差異(斜率變異數)的檢定力。

註:四波成長模型中隨機斜率變異數的概似比檢定(likelihood-ratio test)模擬檢定力(每點 \(200\) 次重複),作為兒童人數的函數。偵測變化上的變異數需要很多人,與式 (4.2) 一致。

4.5.3 臨床試驗:在現實的退出率下規劃檢定力

那項兩組的憂鬱症試驗(therapy_rct 設計)檢定的是處理與時間的交互作用:實驗組的症狀軌跡有沒有比控制組下降得更快。試驗一定會流失參與者,規劃者因此必須問:退出對檢定力做了什麼?圖 4.7畫出該交互作用的檢定力如何隨樣本數變化,並比較零、百分之十五與百分之三十的隨機遺漏(missing at random, MAR)退出。損失相當溫和:八十位病人時,檢定力從無退出下的約 \(.68\) 降到百分之三十退出下的約 \(.55\),是真實但不大的減損。理由很重要,也預告了第 6 章。混合模型以概似估計軌跡,會用上每一位病人確實提供過的每一筆觀察;隨機遺漏的退出耗掉的是訊息,因而耗掉檢定力,卻不會讓估計值產生偏誤。天真的替代做法是只分析完成者(completer),那既損失更多檢定力,又會因為完成者與退出者有系統性的不同而引入偏誤。為退出預作規劃的意思因此是:適度加大樣本以抵銷精確度的損失,而不是把退出當成災難。前提有兩個:遺漏可合理假定為隨機遺漏,而分析以概似為基礎。

在 \(0\%\)、\(15\%\) 與 \(30\%\) 的隨機遺漏退出之下,處理 \(\times\) 時間交互作用的檢定力。
圖 4.7 在 \(0\%\)、\(15\%\) 與 \(30\%\) 的隨機遺漏退出之下,處理 \(\times\) 時間交互作用的檢定力。

註:十二週試驗中處理 \(\times\) 時間交互作用的模擬檢定力(每點 \(400\) 次重複),比較三種單調的隨機遺漏退出水準。退出把曲線適度往下移,代價是精確度而不是偏誤,因為概似會用上所有可得的資料(第 6 章)。

4.6 在限制條件下設計

檢定力分析與現實相遇的形式是一份預算。人數、時點數與每個時點的密度都要花錢,也都要花掉參與者的善意,而它們替不同的估計標的買檢定力,如表 4.3所摘要。核心的取捨在人數與時點數之間。觀察總數固定時,怎麼分配並不中性:個體間的估計標的與跨層次交互作用是用人數買來的,個體內效果、成長形狀與動態則是用時點數買來的。一百個人各測十次,與十個人各測一百次,含有同樣的一千筆觀察,回答的問題卻幾乎不相交;「重要的是 \(N \times T\) 的總數」這種坊間說法因此是錯的。設計必須與估計標的相配,預算要花在估計標的的訊息所在之處。

表 4.3 哪一個設計因素替哪一個估計標的買檢定力。

增加……主要買到的是幫助很小的是
人數(\(N\))個體間效果、跨層次交互作用、所有變異數成分(對所有量都提高精確度)
時點數(\(T\))個體內效果、成長形狀、動態個體間的平均數差異
期程/間距成長斜率的精確度、斜率變異數快速的動態(有疊頻風險)
每個時點的題目數透過提高信度(減少衰減)而利於所有效果直接的設計層次檢定力

註:本表把式 (4.2) 及其類比落實為操作原則:把預算對準估計標的的訊息所在之處。

精確度規劃為同一份預算提供第二種看法。圖 4.8畫出個體內效果的信賴區間預期寬度如何隨人數變化:要把這個效果釘到 \(0.10\) 的寬度,大約需要一百一十人,而且不管那個樣本數跨不跨得過某個檢定力門檻,答案都是這個數。審稿人對一個「任何可行樣本都達不到」的變異數成分堅持要求 \(.80\) 檢定力時,精確度這個框架給得出誠實的回應:報告這項研究將達到的區間寬度,並主張一個估計良好的界限比一個檢定力不足的檢定更有訊息量。另有兩項工具能把固定的預算拉長。計畫性遺漏(planned missingness)設計刻意讓每位參與者只分到題目或時點的一個子集,在降低負擔的同時保住主要估計標的的檢定力(第 6 章)。循序設計(sequential design)(指依期中結果調整規模,與第 2 章的世代序列設計無關)與內部前導設計(internal-pilot design)則允許在研究進行到一半時重新估計變異數成分,以累積中的資料精修樣本數的決定。表 4.4把報告要點提煉成一份範本。

為精確度規劃:個體內效果的信賴區間預期寬度。
圖 4.8 為精確度規劃:個體內效果的信賴區間預期寬度。

註:每人十四天下,個體內效果 \(95\%\) 信賴區間的模擬預期寬度。參數估計準確度問的是「要多少樣本才能達到目標寬度」(此處為 \(0.10\),約在一百一十人附近),與圖 4.4的檢定力問題互補。

表 4.4 一份站得住腳的樣本數說明所包含的要素。

要素要陳述什麼
估計標的目標的量,用文字寫出來,以及它為何承載這項主張
分析模型將要配適的模型,讓讀者能判斷該估計標的的標準誤
參數與其來源所假定的數值,以及每一個是從哪裡來的(前導資料、文獻、SESOI)
檢定力或精確度在計畫的 \(N\) 之下的檢定力,或信賴區間寬度,並附方法與重複次數
敏感度在最不確定的輸入的合理範圍上,檢定力或精確度各為多少
應變規劃所假定的退出率與配合度,以及樣本如何被放大以抵銷它們

註:這些要素讓一次檢定力分析可以被稽核;預先註冊(preregistration)與計畫申請書也越來越期待看到它們(第 36 章)。

實務要點 • 大型檢定力格點的執行時間與檢查點存檔

在一整片條件格點上做檢定力分析,可能需要數萬次模型配適,而執行時間很容易被低估。啟動之前,先量一次配適要多久,乘上重複次數與格點數,再除以核心數。跑一整晚的格點很正常,跑一整週的就得重新想過。平行化要在重複次數上做,並使用平行安全的隨機數產生器,結果才保得住可重現性。長時間的執行請逐個條件把結果存到磁碟,也就是檢查點存檔(checkpointing),被中斷時才是續跑而不是重跑,部分結果也可以先拿來檢視。開發階段先用很少的重複次數把流程除錯,流程確定正確之後再把次數拉高:二十五次重複的檢定力估計值當最終答案毫無用處,用來確認程式跑得動卻剛剛好。

軟體提示 • 潛在成長模型的 Mplus 蒙地卡羅

潛在成長模型與混合模型,Mplus 的 MONTECARLO 功能仍是領域標準。它的邏輯與第 4.3 節的 R 流程一一對應:MODEL POPULATION 區塊指定資料生成的參數,MODEL 區塊指定分析模型,Mplus 反覆產生資料並配適,回傳每一個參數顯著的重複次數比例(也就是檢定力),連同參數偏誤、標準誤的準確度與涵蓋率(coverage)。這個做法由 Muthén and Muthén (2002) 定型。分析模型本身就是一個結構方程模型、而在 R 裡手寫生成與配適又相當費工時,它是自然的選擇。報告的紀律則完全一樣:指名估計標的、為母體值提出理由、呈現敏感度。

4.7 常見的迷思

有四種看法會誤導規劃者。第一,認為重要的是觀察總數 \(N \times T\):訊息是層次專屬的,十個人各測一百次回答不了一百個人各測十次所能回答的個體間問題,儘管兩者的總數相同。第二,認為流失只會降低檢定力:隨機遺漏的退出加上以概似為基礎的分析,代價確實主要是檢定力(圖 4.7),但非隨機遺漏的退出還會讓估計值產生偏誤,那是任何樣本數都補不回來的(第 6 章)。第三,認為一次檢定力分析就是一個數字:它是一條曲線或一個曲面,橫跨各個設計因素,外加產生它的那些假設;只報告一個孤零零的數字,兩者都被藏了起來。第四,是實務上的那個兩難:「審稿人對每一件事都要求 \(.80\) 檢定力,但我的斜率變異數檢定力只有 \(.40\)」。答案不是把假設膨脹到數字看起來可接受為止,而是誠實陳述哪些估計標的檢定力充裕、哪些是為精確度而估計,並用這樣的語言為設計提出理由 (Lakens, 2022)。

本章摘要

縱貫模型的檢定力是估計標的專屬的:同一項研究對某些量檢定力充裕,對另一些量卻無能為力(圖 4.1),規劃因此要從指名「承載科學主張的那個估計標的」開始。封閉解只在簡單設計裡存活,卻留下一個耐久的洞見:斜率估計量的變異數(式 4.2)分成兩項,一項靠時點數與間距降低,另一項是 \(\tau_{11}/N\) 這道下限,只能靠人數降低。面對現實的模型,通用工具是六步驟的模擬流程,而它站得住腳的條件是收斂紀錄、可重現的種子,以及以最小關切效果量為錨的誠實參數來源。三個實作分析帶出幾個反覆出現的教訓:個體內效果便宜,跨層次交互作用昂貴;偵測變化上的個體差異是一件大 \(N\) 的事;隨機遺漏的退出耗掉的是精確度,不是製造偏誤。規劃到頭來是一個預算問題,解法是把人數、時點數與密度對準估計標的的訊息所在之處,再用「估計標的先行、關注精確度」的語言報告出來。

接下來讀哪裡

本章各項模擬所用的壓力測試,倚賴第 6 章形式化的遺漏機制;本章當成黑盒子處理的那些模型,則在第 13、14 章(多層次成長)、第 19 章(潛在成長)與第 23 章(密集縱貫)發展。貝氏規劃把單一個檢定力數字換成「在先驗不確定性上平均後的保證度(assurance)」,見第 17 章。檢定力分析本身也是可以預先註冊的對象,這一點由第 36 章處理。本章引入的 power_sim_template_zh_V01.R 會在後續各章的習題中反覆出現,屆時只要替換各個新模型的資料生成歷程。

習題

  1. 4.1 加入未作答。延伸第 4.3 節的日誌檢定力模擬,在配適之前完全隨機刪掉 \(20\%\) 的「人 \(\times\) 時點」。報告個體內效果的檢定力變化,並用「訊息的損失」解釋它。
  2. 4.2 使用 simr。取一份小型前導資料(例如 sleepstudy),配適一個隨機斜率模型,再用 simr 算出固定斜率隨樣本數變化的檢定力曲線,並與從零寫出的模擬相比較。
  3. 4.3 精確度(AIPE)。用日誌的資料生成歷程,以模擬找出「要多少人,才能讓標準化個體內效果的 \(95\%\) 信賴區間寬度不超過 \(0.10\)」。把這個 \(N\) 與產生 \(.80\) 檢定力的 \(N\) 對照。
  4. 4.4 評論一段檢定力陳述。給定一段已發表的樣本數說明,指出它為哪一個估計標的準備了檢定力、陳述了哪些假設,以及一位持懷疑態度的審稿人還會想知道什麼。
  5. 4.5 寫出說明。依表 4.4,為第 4.5 節的加速成長研究撰寫樣本數段落,為斜率變異數這個估計標的準備檢定力,並納入一項敏感度分析。

本章重要名詞中英對照

中文English說明/首次出現處
檢定力power效果為真時能偵測到它的機率;全書
估計標的estimand研究真正要估計的那個量;全書
精確度precision估計值的區間寬度;第 4.1 節
參數估計準確度accuracy in parameter estimation (AIPE)以達到目標區間寬度為目標的規劃;第 4.1 節
信賴區間confidence interval反覆抽樣下涵蓋參數的區間;第 4.1 節
封閉解closed form可用公式直接算出的解;第 4.2 節
非中心性參數noncentrality parameter對立假設下檢定統計量的中心位置;第 4.2 節
非中心分配noncentral distribution非中心性不為零的抽樣分配;第 4.2 節
球形sphericity重複量數變異數分析對共變數結構的假設;第 4.2 節
成對樣本 \(t\) 檢定paired \(t\) test兩個相依測量之差的檢定;第 4.2 節
對比contrast各時點平均數的線性組合;第 4.2 節
隨機截距random intercept個體特定的起始水準;第 4.1 節
隨機斜率random slope個體特定的變化率;第 4.1 節
跨層次交互作用cross-level interaction個體間變項調節個體內效果;第 4.1 節
廣義線性混合模型generalized linear mixed model非常態結果變項的混合模型;第 4.2 節
資料生成歷程data-generating process (DGP)模擬中產生資料的機制;第 4.3 節
蒙地卡羅Monte Carlo以反覆隨機抽樣求近似的方法;第 4.3 節
收斂紀錄convergence bookkeeping記錄並報告每次配適是否收斂;第 4.3 節
種子管理seed management設定隨機種子以確保可重現;第 4.3 節
觀察到的檢定力observed (post hoc) power由已觀察效果量回推的檢定力;無訊息量;第 4.3 節
前導資料pilot data小規模先行蒐集的資料;第 4.3 節
發表偏誤publication bias顯著結果較易被發表所造成的膨脹;第 4.3 節
贏家的詛咒winner’s curse被選中發表的效果量系統性偏大;第 4.3 節
最小關切效果量smallest effect size of interest (SESOI)低於此值即不具實質意義的效果;第 4.3 節
敏感度分析sensitivity analysis在一段假設範圍上重算結論;第 4.3 節
敏感度曲線sensitivity curve檢定力隨假設值變化的曲線;第 4.3 節
檢定力曲線/曲面power curve / surface檢定力隨設計因素變化的圖形;第 4.4 節
概似比檢定likelihood-ratio test比較巢套模型的檢定;第 4.5 節
涵蓋率coverage區間實際包含真值的比例;第 4.3 節
退出dropout參與者中途離開研究;第 4.5 節
完成者completer完成全部評量的參與者;第 4.5 節
計畫性遺漏planned missingness刻意只施測部分題目或時點;第 4.6 節
循序設計sequential design允許依期中結果調整規模的設計;第 4.6 節
內部前導設計internal-pilot design以研究前段資料重估變異數成分;第 4.6 節
檢查點存檔checkpointing逐條件存檔,使中斷後可續跑;第 4.6 節
保證度assurance在先驗不確定性上平均後的檢定力;「接下來讀哪裡」
預先註冊preregistration資料蒐集前公開登錄分析計畫;第 4.6 節

參考文獻

Arend, M. G., & Schäfer, T. (2019). Statistical power in two-level models: A tutorial based on Monte Carlo simulation. Psychological Methods, 24(1), 1–19. https://doi.org/10.1037/met0000195

Bolger, N., Stadler, G., & Laurenceau, J.-P. (2012). Power analysis for intensive longitudinal studies. In M. R. Mehl & T. S. Conner (Eds.), Handbook of research methods for studying daily life (pp. 285–301). Guilford Press.

Cohen, J. (1988). Statistical power analysis for the behavioral sciences (2nd ed.). Lawrence Erlbaum Associates.

Green, P., & MacLeod, C. J. (2016). SIMR: An R package for power analysis of generalized linear mixed models by simulation. Methods in Ecology and Evolution, 7(4), 493–498. https://doi.org/10.1111/2041-210X.12504

Hertzog, C., Lindenberger, U., Ghisletta, P., & von Oertzen, T. (2006). On the power of multivariate latent growth curve models to detect correlated change. Psychological Methods, 11(3), 244–252. https://doi.org/10.1037/1082-989X.11.3.244

Lafit, G., Adolf, J. K., Dejonckheere, E., Myin-Germeys, I., Viechtbauer, W., & Ceulemans, E. (2021). Selection of the number of participants in intensive longitudinal studies: A user-friendly Shiny app and tutorial for performing power analysis in multilevel regression models that account for temporal dependencies. Advances in Methods and Practices in Psychological Science, 4(1). https://doi.org/10.1177/2515245920978738

Lakens, D. (2022). Sample size justification. Collabra: Psychology, 8(1), 33267. https://doi.org/10.1525/collabra.33267

Maxwell, S. E., Kelley, K., & Rausch, J. R. (2008). Sample size planning for statistical power and accuracy in parameter estimation. Annual Review of Psychology, 59, 537–563. https://doi.org/10.1146/annurev.psych.59.103006.093735

Muthén, B. O., & Curran, P. J. (1997). General longitudinal modeling of individual differences in experimental designs: A latent variable framework for analysis and power estimation. Psychological Methods, 2(4), 371–402. https://doi.org/10.1037/1082-989X.2.4.371

Muthén, L. K., & Muthén, B. O. (2002). How to use a Monte Carlo study to decide on sample size and determine power. Structural Equation Modeling, 9(4), 599–620. https://doi.org/10.1207/S15328007SEM0904_8

Raudenbush, S. W., & Liu, X. (2000). Statistical power and optimal design for multisite randomized trials. Psychological Methods, 5(2), 199–213. https://doi.org/10.1037/1082-989X.5.2.199

Raudenbush, S. W., & Liu, X.-F. (2001). Effects of study duration, frequency of observation, and sample size on power in studies of group differences in polynomial change. Psychological Methods, 6(4), 387–401. https://doi.org/10.1037/1082-989X.6.4.387

Snijders, T. A. B., & Bosker, R. J. (2012). Multilevel analysis: An introduction to basic and advanced multilevel modeling (2nd ed.). Sage.

引用本章

APA 第 7 版沒有「單一作者專書之章」這個文獻類型:正式的參考文獻指向整本書,章次寫在內文引用裡。若您要讓引用直接連到本章這一頁,再採用下方第二組(依 APA 的網站文件格式)。

引用全書、於內文指明章次(建議)

內文(游琇婷,2026,第 4 章) 或 游琇婷(2026,第 4 章)
參考文獻游琇婷(2026)。《變化的分析:社會科學的縱貫、密集縱貫與動態資料分析》(繁體中文網頁版)。https://hsiutingyu.github.io/LDA-book-zh-V2/

只引用本章這一頁

參考文獻游琇婷(2026)。第 4 章 規劃縱貫研究:檢定力、精確度與設計上的取捨。載於《變化的分析:社會科學的縱貫、密集縱貫與動態資料分析》(繁體中文網頁版)。https://hsiutingyu.github.io/LDA-book-zh-V2/LDA_C_Chapter04.html

英文稿件中引用

APA 第 7 版第 9.38 節:非英文著作保留原文題名,並於方括號內附英文翻譯。

ReferenceYu, H.-T. (2026). 變化的分析:社會科學的縱貫、密集縱貫與動態資料分析 [Analyzing change: Longitudinal, intensive longitudinal, and dynamic data analysis for the social sciences] (Traditional Chinese web edition). https://hsiutingyu.github.io/LDA-book-zh-V2/
In text(Yu, 2026, Chapter 4)