第 7 章

變異數分解與重複測量的描述統計

在配適任何變化模型之前,一份重複測量的資料,應該先用能配合它結構的描述工具徹底盤問一遍。其中後果最重大的一個問題是變異數落在哪裡,因為一個變異幾乎全在個體之間的構念,所提出的問題與所支持的分析,都和一個在同一個人身上一刻一刻擺盪的構念不同。本章為第 1 章「個體間與個體內」這組概念性區分提供量化的對應物:測量各層次各佔多少變異數的組內相關、把預測變項分解成個體間與個體內兩部分的做法,以及摘要每一個人動態的那一族個體層次指標,包括變異性、不穩定與慣性。本章同時也刻意是一堂關於「保持懷疑」的課,因為這些指標每一個都帶著自己的失效模式,而負責任的分析者在介紹每一個測量的同時,就把它的限制一併說清楚。

學習目標

讀完本章之後,你應該能夠:(1) 由無條件多層次模型估計並解讀組內相關 (intraclass correlation, ICC),包括個體層次與「個體之內的日」層次,並說出高值或低值對設計與分析各意味著什麼;(2) 把一個隨時間變動的預測變項分解成個體間與個體內兩個成分,並說明各自代表什麼;(3) 計算標準的個體內變異性與動態指標,包括個體內平均數 (iMean)、個體內標準差 (iSD)、相對標準差 (relative standard deviation)、連續差異均方根 (RMSSD)、急遽變化機率 (PAC) 與延宕一期慣性 (lag-1 inertia),並說出每一個各針對歷程的哪一個特徵;(4) 認出並校正有界量尺上「平均數與變異數的混淆」(mean-variance confound);(5) 評估個體層次指標的信度如何隨時點數而變;(6) 認出這些指標在實徵上的冗餘 (redundancy),並抗拒過度解讀;(7) 產出一份可供發表的縱貫資料描述表。

7.1 變異數落在哪裡:組內相關

重複測量資料最基礎的描述量是組內相關 (intraclass correlation, ICC),它回答的是:對某個變項而言,它的總變異數有多少比例落在個體之間,而不是落在個體之內。它由一個無條件模型 (unconditional model) 或虛無模型 (null model) 估計而來,也就是只含截距的兩層模型,\(y_{it} = \gamma_{00} + u_{0i} + e_{it}\),其中 \(u_{0i} \sim N(0, \tau_{00})\) 是這個人相對於總平均數的穩定偏離,\(e_{it} \sim N(0, \sigma^2)\) 則是當下的起伏。虛無模型是一台變異數分解機器:它把總變異數切成個體間的部分 \(\tau_{00}\) 與個體內的部分 \(\sigma^2\),而 ICC 就是兩者的比值,\(\mathrm{ICC} = \tau_{00} / (\tau_{00} + \sigma^2)\)。這個量有兩種等價的讀法,兩種都值得記住。它是「變異數落在個體之間的比例」,同時也是「從同一個人身上抽出兩筆觀察,兩者之間的期望相關」,這也就是為什麼它同時可以當成一個指標,衡量後續模型必須設法容納的那種非獨立性。圖 7.1 是一次視覺校準:在 ICC 為 \(0.1\) 時,各個體的軌跡徹底交纏在一起,因為幾乎所有變異數都是當下的;到 \(0.5\) 時它們開始分離;而到 \(0.9\) 時每個人各佔一條穩定、幾乎不重疊的帶狀區域,因為此時是個體間的差異在主導。

組內相關長什麼樣子。
圖 7.1 組內相關長什麼樣子。

註:十位模擬的個體,各測十二個時點,每一個子圖的總變異數都相同。當 ICC 由 \(0.1\) 升到 \(0.9\),穩定且屬於個體之間的那份變異數比例隨之增加,軌跡就從一團糾結的帶狀分離成各自持續的、彼此有別的水準。因此 ICC 既是個體間變異數的比例,也是同一個人兩筆觀察之間的期望相關。

以本書的經驗取樣資料而言,虛無模型把當下負向情緒的 ICC 定在 \(0.36\)、正向情緒 \(0.43\)、當下壓力 \(0.47\),這些數值落在密集測量的情緒與行為構念通常報告的範圍內,大致是 \(0.3\) 到 \(0.6\) (Bolger & Laurenceau, 2013)。讀法直接而且後果重大:對這三個變項而言,都有略多於一半的變異數是當下的,而那正是經驗取樣設計存在的目的所要捕捉的個體內變異。與一個幾近特質式的變項對比很有啟發性:在這批資料中,「當下是否獨處」這個情境指標的 ICC 與零無異,意思是某個人在某次提示 (beep) 時是不是獨處,幾乎完全是個體內的、情境性的事,穩定的個體間成分很小,這個變項的變異數,就落在個體間問卷永遠觸及不到的地方。而一個 ICC 接近一的構念呈現的是相反的問題:個體內的問題缺乏變異數可用,而且再怎麼密集取樣,也造不出這個構念本來就不展現的起伏。

密集設計還邀請進一步的分解,因為它們的時點本身也是巢套的,一次次的提示 (beep) 巢套在日之內,日巢套在個體之內,於是一個三層的虛無模型 (three-level null model) 會把變異數切成個體、日與當下三份。對負向情緒而言,這三份是個體之間 \(0.35\)、個體之內的日之間 \(0.14\)、日之內 \(0.51\),也就是大約七分之一的總變異數屬於日層次,這個量不小,它描述的是這個構念有多「以日為結構」,也就是情緒是否在一刻一刻的雜訊之上,另外還有好日子與壞日子之分。相對地,壓力的日層次份額較小(\(0.06\)),意味著它的起伏比較純粹是當下的,而不是以日為單位組織起來的。最後、也最重要的一項警告是:ICC 並不是構念的固定性質。它取決於時間尺度 (timescale) 與取樣方案:對同一個構念以每小時、每天、每年取樣,會得到不同的分解,因為「個體內與個體間」的界線會隨著那個時間窗而移動。一個 ICC 是關於「某個變項在某個設計中」的陳述,不是關於某個變項本身、抽離設計之後的陳述。

7.2 分解預測變項:中心化是一種描述行為

用來描述結果變項的那同一個分解,也適用於預測變項,而執行它就是後續每一個個體內模型的描述性基礎。任何隨時間變動的變項都可以寫成「個體特定的平均數」加上「當下的偏離」,\(x_{it} = \bar{x}_{i\cdot} + (x_{it} - \bar{x}_{i\cdot})\),其中個人平均數 \(\bar{x}_{i\cdot}\) 是一個個體間的量,是這個人特質 (trait) 水準的替代指標,而偏離 \(x_{it} - \bar{x}_{i\cdot}\) 是一個個體內的量,是相對於這個人自己基準線的當下偏離。這不只是計算上的方便,而是一種實質的分離,因為兩個成分與同一個結果變項的關係可以不同、甚至相反,這正是第 1 章在概念上引入、並在第 13 與 23 章的多層次模型中形式化的那個現象。圖 7.2 以經驗取樣資料中壓力與負向情緒的關聯,把這個分離具體演示出來。個體間的子圖畫的是個人平均壓力對個人平均負向情緒,一個人一點,顯示平均而言壓力較大的人平均而言也較負向,個體間相關為 \(0.55\)。個體內的子圖畫的是每個人當下的壓力偏離對他自己當下的負向情緒偏離,其合併後的斜率,也就是個體內相關 \(0.33\),回答的是另一個問題:當某一個人比他自己平常更有壓力時,他是不是也比平常更負向?此處兩個關聯都是正的,但它們不是同一個數字,甚至不必然同號;而把兩者混為一談,正是個體內方法之所以存在、要防止的那個生態謬誤 (ecological fallacy)。

同樣兩個變項,兩種不同的關聯。
圖 7.2 同樣兩個變項,兩種不同的關聯。

註:左:個人平均壓力對個人平均負向情緒(一個人一點),也就是個體間的關聯(\(r = 0.55\))。右:個體內的壓力偏離對個體內的負向情緒偏離;細線是各個人,粗線是合併後的個體內斜率(\(r = 0.33\))。兩個關聯回答的是不同的問題,也是由不同的變異數估計出來的。

對這個「觀察值版」的分解要附上一項警告,而它在時點數少的時候會變得重要。個人平均數 \(\bar{x}_{i\cdot}\) 並不是這個人真正的特質水準,而是它的一個估計,帶有變異數為 \(\sigma^2/T_i\) 的抽樣誤差污染,於是在時點數少時,觀察到的個人平均數會比真正的特質平均數更分散,觀察到的個體間變異數也因此被膨脹。後果是:由原始個人平均數建立起來的分解,等於把每一個人的估計平均數當成已被精確知道的量,而它並不是。以模型為基礎的補救之道(第 13 章詳述)是用一個收縮 (shrinkage) 估計取代原始的個人平均數,依照各自的不確定性把不可靠的個別平均數往總平均數拉;而動態結構方程模型 (dynamic structural equation model, DSEM)(第 25 章)的完全潛在分解,則是在估計時就把真分數 (true score) 變異數與誤差變異數分開,從而徹底移除這份污染。就目前而言,描述層次的要點成立:中心化是一種分解,這個分解有訊息量,而它的原始形式帶有一個已知的偏誤,後續各章會加以校正。

基礎概念 • 個體內與個體間的分解,以及 \(T\) 小為什麼會咬人

把個人平均數寫成 \(\bar{x}_{i\cdot} = \frac{1}{T_i}\sum_t x_{it}\),並把 \(x_{it}\) 分解為 \(x_{it} = \bar{x}_{i\cdot} + \tilde{x}_{it}\),其中 \(\tilde{x}_{it} = x_{it} - \bar{x}_{i\cdot}\)。依建構,在每一個人之內都有 \(\sum_t \tilde{x}_{it} = 0\),因此個體內成分與個體間成分正交,總變異數也就可加地分解,\(\mathrm{Var}(x_{it}) \approx \mathrm{Var}(\bar{x}_{i\cdot}) + \mathrm{Var}(\tilde{x}_{it})\)。若每個人有一個真正的特質水準 \(\mu_i\),且 \(x_{it} = \mu_i + \varepsilon_{it}\)、\(\mathrm{Var}(\varepsilon_{it}) = \sigma^2\),則 \(E[\bar{x}_{i\cdot}] = \mu_i\),但 \(\mathrm{Var}(\bar{x}_{i\cdot} \mid \mu_i) = \sigma^2 / T_i\)。因此觀察到的個人平均數的分散程度,會比真正的特質變異數多出 \(\sigma^2 / T_i\),而它只在 \(T_i\) 增大時才會消失。這就是為什麼由短序列算出來的個人平均數是雜訊很大的特質估計,為什麼觀察到的個體間變異數在 \(T\) 小時向上偏誤,以及為什麼收縮(第 13 章)與潛在分解(第 25 章)比原始計算來得好。

7.3 個體內動態指標一覽

一旦從個體之內來看資料,每一個人的序列都可以用針對歷程不同特徵的指標來摘要,而這些指標有雙重角色:現在是描述性的摘要,在後續各章則自己成為結果變項或預測變項。指導的教學原則是「先算指標,後配模型」,因為每一個描述性指標都有一個以模型為基礎的對應物,用適當的不確定性去估計同一個量:個體內變異性對應第 16 章的混合效果位置尺度模型 (mixed-effects location-scale model),慣性對應第 25 章的多層次自我迴歸模型 (multilevel autoregressive model)。圖 7.3 是本章的招牌教學圖,它為整件事提出了最好的理由:四個人平均數完全相同,動態卻明顯有別。穩定的人變異很小;波動大的人擺盪得又寬又快;緩慢漂移的人也變異得很寬,但很慢,於是雖然漂移者的個體內標準差(\(0.78\))大於波動者的(\(0.67\)),他的連續差異卻小得多,因為改變是漸進而不是突然的;而陣發的人多半平靜,只是不時被幾次急遽的跳動打斷。單獨一個摘要,也就是平均數,對這一切完全盲目;而即使只用單獨一個變異性指標,也會把波動者與漂移者搞混。要捕捉這個差別需要好幾個指標,每一個都連同它所針對的特徵與它所要求的警告一起定義於下,並收在表 7.1 中。

位置由個體內平均數 (intraindividual mean, iMean) 摘要,也就是這個人的平均水準;就許多目的而言它是最具預測力的單一指標,而每一個變異性測量都必須拿它來對照檢查。變異性由個體內標準差 (intraindividual standard deviation, iSD) 摘要,也就是一個人自己那些觀察的標準差,它量化了狀態的擺盪範圍有多寬;但在有界量尺 (bounded scale) 上它會機械性地與平均數纏在一起,這一點下一節會處理,並由相對標準差 (relative standard deviation) 加以校正 (Mestdagh et al., 2018)。不穩定,也就是從一刻到下一刻突然改變的傾向,由連續差異均方根 (root mean square of successive differences, RMSSD) 摘要,\(\sqrt{\frac{1}{T-1}\sum_{t=2}^{T}(x_t - x_{t-1})^2}\);它與 iSD 不同,對觀察的時間順序敏感,因此能區分快速振盪與緩慢漂移 (Jahng et al., 2008);一個相關的不穩定指標是急遽變化機率 (probability of acute change, PAC),也就是連續轉換中超過某個選定門檻的比例,它單獨抓出大幅跳動的頻率。慣性,也就是狀態持續下去的傾向,由個體層次的延宕一期自我相關 (lag-1 autocorrelation) 摘要,也就是每一筆觀察與前一筆的相關;它曾被連結到情緒調節 (emotion regulation),而當它偏高時被連結到適應不良 (maladjustment) (Kuppens et al., 2010);它是第 24 章自我迴歸參數 (autoregressive parameter) 的描述性前身,而且帶有一項嚴重的小樣本警告,下文會詳細說明。跨構念的動態由兩個狀態之間的個體內相關 (within-person correlations) 摘要;而對一組情緒題目而言,則由情緒區辨 (emotion differentiation) 摘要,操作化為同效價 (valence) 題目之間平均的個體內相關,其中平均相關低表示這個人把自己的負向狀態分得很細,平均相關高則表示對這個人來說所有負向感受都一起變動 (Erbas et al., 2014);在題目層次的經驗取樣資料中,四個負向情緒題目之間平均的個體內相關是 \(0.27\),表示平均而言區辨程度中等。

表 7.1 個體內動態指標一覽。

指標所針對的特徵計算方式主要警告
iMean平均水準這個人所有觀察的平均數常是最強的預測變項;在把功勞給其他指標之前先控制它
iSD整體變異性這個人所有觀察的標準差在有界量尺上與平均數混淆
相對 SD已對平均數校正的變異性iSD 除以「在該平均數與該上下界之下的最大值」在量尺兩端附近沒有定義
RMSSD不穩定/突然性連續差異平方的平均數再開根號對順序敏感;會被趨勢與週期膨脹
PAC大幅跳動的頻率\(|\)連續差異\(|\) 超過某切點的比例切點的選擇是任意的,必須報告出來
慣性持續性/
延續效果
個體層次的延宕一期自我相關在 \(T\) 小時嚴重向下偏誤
個體內 \(r\)兩個狀態的耦合當下偏離之間的相關需要每個人有足夠的時點
區辨狀態的細緻程度同效價題目之間平均的個體內相關與變異性及平均數混淆

註:每一個指標都有一個以模型為基礎的對應物,能以收縮與適當的不確定性去估計同一個特徵:變異性對應第 16 章的混合效果位置尺度模型,慣性對應第 25 章的多層次自我迴歸模型。要描述就算指標,要推論就配模型。

還有一種互補的框架,源自 Fleeson (2001),它拒絕把個體內的序列化約成任何單一個指標,而是把整個個體內分配當成關注的對象,也就是密度分配 (density-distribution) 觀點:特質就是一個人隨時間所造訪過的那些狀態的密度。圖 7.4 為十二個人實現了這個觀點,並依他們當下負向情緒的平均水準排序;它用肉眼就還原了那些指標所量化的東西:平均負向情緒低的人,分配右偏並擠在量尺的地板上;水準較高的人則分配較寬、較對稱,於是平均數、離散程度與形狀是連動的,而這是單獨一個數字傳達不了的。密度觀點是對「指標氾濫」的一劑有用的解毒劑,提醒讀者這些指標只是一個更豐富對象的有損摘要。

把特質看成狀態的密度分配。
圖 7.4 把特質看成狀態的密度分配。

註:每一條山脊是一個人在兩週取樣期間,當下負向情緒的個體內分配,各個人依平均水準排序,並以顏色(藍至橘紅)標示其平均水準。平均數低的人,分配右偏並壓在量尺的地板上;平均數較高的人則較寬、較對稱。在 Fleeson 的框架裡,描述的對象是整個分配,而不只是它的平均數或標準差。

7.4 這些指標可信嗎?

上面那份一覽表如果沒有配上相對的節制,就會很危險,因為個體層次的指標是由有限長度的序列估計出來的,因此也承接了小樣本的一切脆弱之處,而其中有三個問題特別能把一個指標變成假象 (artifact)。第一個是平均數與變異數的混淆 (mean-variance confound)。在有界量尺上,一個人能展現多少變異數,受限於他的平均數離量尺的地板或天花板有多近:平均數靠近最低值的人幾乎沒有空間可以變動,而落在量尺中點附近的人則可以擺盪得很寬,於是即使底層歷程完全相同,iSD 仍然機械性地與 iMean 綁在一起。圖 7.5 在經驗取樣資料上演示了這個問題與它的校正。左子圖畫的是每個人的 iSD 對他的 iMean,拋物線的包絡線顯示在一到五的量尺上,每一個平均數之下可達到的最大標準差;觀察到的點緊貼在地板那一帶,而且與平均數的相關是 \(0.61\),於是一項天真地把變異性與某個結果變項連起來的分析,有一部分其實是在把平均數與那個結果變項連起來。Mestdagh et al. (2018) 的相對標準差移除了這個假象,做法是把每個人的 iSD 表達成「在他的平均數之下它本來可以取到的最大值」的一個比例,而右子圖顯示經過這道校正之後,與平均數的關聯已不再是正的。實務上的規則直接跟著出來:在有界量尺上,絕不要在沒有控制平均數,或沒有換成已對平均數校正的指標的情況下,解讀原始的 iSD,因為否則一項關於變異性的發現,可能只是一項關於水準的發現換了裝。

平均數與變異數的混淆及其校正。
圖 7.5 平均數與變異數的混淆及其校正。

註:左:原始的個體內標準差對個人平均數;虛線拋物線是在一到五的有界量尺上,每一個平均數之下可達到的最大標準差,觀察到的相關為 \(0.61\)。右:相對標準差把觀察到的標準差除以那個最大值,於是不再與平均數正向混淆(\(r = -0.41\))。任何由原始 iSD 得出的變異性結論,都必須拿這個混淆檢查一遍。

第二個問題是信度 (reliability),也就是一個指標需要多少時點,才會估計到一個穩定的個體特徵、而不是雜訊。由於指標是從一個人的序列算出來的,它的信度隨著那個序列的長度增長,而不同指標增長的速度差別很大。圖 7.6 報告一項折半信度 (split-half reliability) 模擬,做法是在一個人資料的兩個獨立半份 (independent halves) 上各算一次指標,再跨個體求相關,並看它如何隨時點數 (number of occasions) 變化。變異性指標的表現相對良好:iSD 與 RMSSD 在大約三十個時點時信度就接近 \(0.80\),到一百個時點時超過 \(0.94\)。慣性則要求高得多:延宕一期自我相關在十個時點時信度只有 \(0.11\)、三十個時點時 \(0.36\),而且要到序列很長時才接近可接受的水準,因為要估計一個跨時間的相關需要很多次轉換 (transitions)。這一課是:在每日日誌研究常見的短序列裡,慣性應該被當成一個不可靠的個體層次指標;而它以模型為基礎、帶收縮的估計(第 25 章),因為能在個體之間互相借力,並不是一項精緻化,而是一項必要。

個體層次指標的信度隨時點數而變。
圖 7.6 個體層次指標的信度隨時點數而變。

註:三個指標的折半信度對時點數 \(T\),來自一項在平均數、變異性與慣性上都有個體間變異的模擬。變異性指標(iSD、RMSSD)在 \(T = 30\) 附近跨過慣用的 \(0.80\) 門檻;慣性,也就是延宕一期自我相關,在那之後很久仍然不可靠,需要長得多的序列或以模型為基礎的估計。

慣性的困難除了信度低之外還有第二張臉,一項系統性的小樣本偏誤 (small-sample bias):樣本自我相關在短序列中向下偏誤,於是連它的平均數都低報了真正的持續性。在一項真實延宕一期自我相關為 \(0.40\) 的模擬中,樣本估計在十個時點時平均只有 \(0.17\)、三十個時點時 \(0.33\),而且要到一百個時點,才收斂到與真值只差一個四捨五入的範圍內。這個偏誤的階數是 \(1/T\),是自我迴歸模型 (autoregressive model) 的一個古典結果(最低階的校正項約為 \(-(1 + 3\varphi)/T\)),而它在實務上的含意很嚴重:跨個體或跨組別比較慣性時,若各自的序列長度不同,比較就會被差別性的偏誤所混淆,而記錄較短的那一組看起來會比實際上更不具慣性。下方的基礎概念方塊把兩種偏誤一起陳述。第三個問題是系統性趨勢的污染 (contamination by systematic trends),因為變異性與不穩定兩類指標都假定個體內的起伏就是訊號,而其中一部分可能是可預測的趨勢或週期。圖 7.7 用一個日內節律 (diurnal rhythm) 把這一點演示出來:一個隨一天中的時刻起落的序列,RMSSD 是 \(0.65\),但一旦把日週期模型化並移除,殘差的 RMSSD 就掉到 \(0.28\),於是表面上的不穩定有一半以上其實是一個被當成雜訊來計算的可預測節律。要不要移除這種結構是一項決定,不是預設的做法,而表 7.2 提供一份去趨勢 (detrending) 的決策指南;最關鍵的問題是:這個趨勢或週期是研究者想描述的那個歷程的一部分,還是一個在描述殘餘動態之前應該先被排除的干擾。

基礎概念 • 延宕一期自我相關的兩種偏誤

樣本延宕一期自我相關 \(r_1 = \sum_{t=2}^{T}(x_t - \bar{x})(x_{t-1} - \bar{x}) / \sum_{t=1}^{T}(x_t - \bar{x})^2\) 有兩個彼此不同的「\(T\) 小」問題。第一,它是負向偏誤的:對參數為 \(\varphi\) 的 AR(1) 歷程,其期望值約為 \(E[r_1] \approx \varphi - (1 + 3\varphi)/T\),因此短序列系統性地低報持續性,而且長度不同的序列偏誤幅度也不同。第二,它不可靠:它的抽樣變異數在 \(T\) 小時很大,於是同一個人資料的兩個半份會得到相關很弱的估計(圖 7.6)。兩個問題會相互加成,而這兩者正是為什麼由日誌長度的序列算出來的個體層次慣性要謹慎對待,也是為什麼第 25 章的多層次自我迴歸模型,因為能在個體之間合併訊息並把測量誤差與動態分開,才是恰當的估計工具。

表 7.2 變異性與不穩定指標的去趨勢決策指南。

若研究問題關心的是……那麼就這樣處理系統性結構……
含週期在內的整體個體內變異性直接在原始序列上計算指標;並報告趨勢已被保留
扣掉可預測節律之後的動態先移除線性趨勢 (linear trend) 與日內週期,再在殘差上計算指標
日內週期本身明確把週期模型化(第 23、30 章);此時週期就是訊號
比較趨勢不同的個體逐人去趨勢,或把趨勢與動態聯合模型化,以避免混淆

註:去趨勢是一項實質選擇,不是一個技術上的預設做法。移除一個週期所回答的問題,與保留它所回答的問題不同,而兩者可能對「誰最不穩定」給出相反的結論。請把這個選擇與它的理由寫出來。

被忽略的日內節律偽裝成不穩定。
圖 7.7 被忽略的日內節律偽裝成不穩定。

註:上:一段帶有日內週期的模擬當下序列,RMSSD 為 \(0.65\)。下:把日週期模型化並移除之後,殘差的 RMSSD 掉到 \(0.28\)。表面上一刻一刻的不穩定,有一半以上是一個可預測的節律。要不要移除它取決於研究問題(表 7.2)。

最後,即使個別而言可信的指標,合起來也可能是冗餘 (redundant) 的,也就是它們測到的東西太過接近,以致把好幾個一起放進模型除了多元共線性 (multicollinearity) 之外一無所獲,而且在預測結果變項時,相對於平均數所增加的也很少 (Dejonckheere et al., 2019)。圖 7.8 呈現經驗取樣資料中各個體層次指標之間的實徵相關,而這個型態令人清醒:RMSSD 與 PAC 相關 \(0.88\),是同一個不穩定的兩種看法;iMean 滲進 iSD 達 \(0.61\),就是上面記錄的那個混淆;而只有相對 SD 與慣性兩者,明顯和變異性那一群拉開距離。這並不意謂這些指標沒有用,而是說必須刻意挑選它們,一個特徵挑一個代表,而不是累積;而任何增量的主張,也就是「某個動態指標在平均數之上還能預測某個結果」,都必須拿平均數與其他指標檢定過,而不是逕行斷言。

多數動態指標彼此冗餘。
圖 7.8 多數動態指標彼此冗餘。

註:經驗取樣資料中各個體層次指標之間的實徵相關。RMSSD 與 PAC(\(0.88\))幾乎是重複的;平均數滲進 iSD(\(0.61\))。只有相對 SD 與慣性兩者,和變異性那一群有實質的區別。把好幾個冗餘的指標一起放進模型,產生的是多元共線性,不是洞見。

常見陷阱 • 指標誤導人的三種方式

第一,把功勞給了變異性卻沒有控制平均數:由於在有界量尺上 iSD 與 iMean 混淆(圖 7.5),iSD 與某個結果變項之間的相關可能只是平均數的相關換了裝;請一律控制平均數,或改用相對 SD。第二,在帶有趨勢的序列上計算不穩定或慣性:RMSSD 與自我相關會把任何日內週期或線性趨勢當成個體內的雜訊吸收進去(圖 7.7),因此要明確決定要不要去趨勢。第三,跨上下界不同的量尺比較 iSD:由於平均數與變異數的混淆取決於量尺的界限,一到五量尺上的 iSD \(= 0.7\) 與一到七量尺上的 \(0.7\) 並不可比;跨工具比較時要比相對變異性,不要比原始的標準差。

7.5 重複測量的描述表

本章這一整套描述工具,在縱貫版的「表 1」上達到頂點,也就是那張區分層次 (level-aware) 的描述表;每一項密集或追蹤研究都應該報告它,而讀者也需要它才能判斷後續的分析。它與橫斷版的「表 1」不同之處在於報告層次專屬的訊息:不是每個變項一個平均數與一個標準差,而是變異數跨層次的分解;也不是一個相關矩陣,而是兩個,因為個體間與個體內的關聯並不相同。表 7.3 是一份經驗取樣資料的示範描述表。每一個變項都帶著它的總平均數、總標準差,以及個體層次與日層次的組內相關;而相關矩陣在對角線上方報告個體間相關、下方報告個體內相關。兩個三角形講的是不同的故事,一如第 7.2 節的分解所預測:負向情緒與正向情緒在個體之間相關 \(-0.50\),在個體之內只有 \(-0.32\);而壓力與正向情緒在個體之間相關 \(-0.52\),在個體之內卻只有微不足道的 \(-0.11\),於是壓力與正向心情在特質層次上的對立,遠強於它們一刻一刻的耦合。單獨一個不加區分的相關,就會把這件事遮掉。軟體提示記錄了幾個能把這張表的一部分自動化的套件,並附上一項警告:它們的組內相關定義並不總是一致。

表 7.3 經驗取樣資料的示範描述表。

變項\(M\)\(SD\)\(\mathrm{ICC}_{p}\)\(\mathrm{ICC}_{d}\)123
1. 負向情緒2.010.71.35.14–\(-.50\)\(.55\)
2. 正向情緒3.220.82.43.10\(-.32\)–\(-.52\)
3. 壓力2.160.74.47.06\(.33\)\(-.11\)–

註:\(M\) 與 \(SD\) 是在所有「人乘時點」上計算的。\(\mathrm{ICC}_{p}\) 與 \(\mathrm{ICC}_{d}\) 是三層虛無模型所得的個體層次與日層次組內相關。對角線上方的相關是個體之間的(以個人平均數計算);對角線下方的相關是個體之內的(以個人平均數中心化後的偏離計算)。\(N = 120\) 人,每人最多 \(84\) 個時點。對角線上的短橫線表示該處不適用。

7.6 在 R 中執行描述統計

這個實作範例把本章的每一個量都在經驗取樣資料上算一遍。組內相關來自虛無多層次模型,直接讀出它們的變異數成分 (variance component) 再組合起來;兩層的版本給出個體 ICC,三層的版本再加上日層次的份額。

library(lme4); library(dplyr); library(tidyr)
ae <- readRDS("Examples/data/affect_ema.rds")

# 由兩層虛無模型得到 ICC
m2  <- lmer(na ~ 1 + (1 | person), data = ae)
vc  <- as.data.frame(VarCorr(m2))
tau <- vc$vcov[vc$grp == "person"]; sig <- vc$vcov[vc$grp == "Residual"]
icc_person <- tau / (tau + sig)                 # 負向情緒為 0.36

# 三層的變異數份額:提示在日之內、日在個體之內
m3  <- lmer(na ~ 1 + (1 | person/day), data = ae)   # person 與 day:person
vc3 <- as.data.frame(VarCorr(m3))
shares <- vc3$vcov / sum(vc3$vcov)              # 個體、日、當下三份

個體層次的指標以一個附有完整說明的函式計算,逐人套用在該人排好序的序列上。隨書附的腳本定義了 compute_dynamics_indices(),逐人套用,接著再算冗餘矩陣、信度模擬,以及上文報告的小樣本自我相關偏誤。

# compute_dynamics_indices(): iMean、iSD、相對 SD、RMSSD、PAC、慣性
compute_dynamics_indices <- function(x, lo = 1, hi = 5, pac_cut = 1) {
  xo <- x[!is.na(x)]; if (length(xo) < 3) return(rep(NA, 6))
  m <- mean(xo); s <- sd(xo)
  maxsd <- sqrt((hi - m) * (m - lo))            # 此平均數在 [lo,hi] 上的最大 SD
  rSD <- if (maxsd > 0) s / maxsd else NA       # Mestdagh et al. (2018)
  d <- diff(x); d <- d[!is.na(d)]
  RMSSD <- sqrt(mean(d^2)); PAC <- mean(abs(d) > pac_cut)
  x1 <- x[-length(x)]; x2 <- x[-1]; ok <- !is.na(x1) & !is.na(x2)
  inertia <- if (sum(ok) >= 3) cor(x1[ok], x2[ok]) else NA
  c(iMean = m, iSD = s, rSD = rSD, RMSSD = RMSSD, PAC = PAC, inertia = inertia)
}

person_idx <- ae 
  summarise(as.data.frame(t(compute_dynamics_indices(na))), .groups = "drop")

cor(person_idx[, -1], use = "pairwise.complete.obs")   # 冗餘矩陣

描述性的「表 1」把層次專屬的統計量與兩個相關矩陣組裝起來。個體間相關由個人平均數計算,個體內相關由個人平均數中心化後的偏離計算,正是把第 7.2 節的分解套用到每一對變項上。

pm  <- ae 
  summarise(across(c(na, pa, stress), ~mean(.x, na.rm = TRUE)))
between_cor <- cor(pm[, -1], use = "complete.obs")     # 對角線上方
aew <- ae 
  mutate(across(c(na, pa, stress), ~ .x - mean(.x, na.rm = TRUE), .names = "wd_{.col}"))
within_cor <- cor(aew[, c("wd_na","wd_pa","wd_stress")], use = "pairwise.complete.obs")

軟體提示 • 描述統計的輔助工具,以及一項關於 ICC 定義的警告

有幾個套件能把縱貫版「表 1」的一部分自動化:psych::statsBy 一次呼叫就傳回個體間與個體內的相關與信度;misty::multilevel.descript 報告層次專屬的描述統計與組內相關;performance::icc 則從一個已配適的模型中取出 ICC。最關鍵的一項警告是,「ICC」這個詞指的是一個家族,不是單一個量:各套件在「報告未調整或已調整的 ICC」、「單向或雙向的形式 (one-way or two-way)」,以及對三層資料而言「報告哪一層的份額」上都有差異,因此一個被報告出來的 ICC 應該一律附上產生它的模型與定義。像上面那樣由一個明確的虛無模型算出 ICC,可以讓定義毫無歧義。

7.7 描述結果的解讀與報告

一份密集研究的描述段落,應該報告變異數落在哪裡、指標的表現如何,以及層次專屬的關聯,而且措辭要讓各層次保持分明。針對經驗取樣資料的示範文字可以這樣寫:「當下負向情緒、正向情緒與壓力的個體層次組內相關分別為 \(.35\)、\(.43\) 與 \(.47\)(三層虛無模型),表示每一個變項都有大約一半的變異數是當下的,可供個體內分析使用;另有 \(6\) 至 \(14\%\) 組織在日層次上。各變項都計算了個人平均數與個人平均數中心化後的偏離。壓力與負向情緒的個體間關聯與個體內關聯在大小上有別(\(r = .55\) 與 \(r = .33\)),與特質層次與狀態層次為不同歷程的看法一致。個體內變異性以相對標準差而非原始的個體內標準差摘要,因為在有界的反應量尺上,後者與個人平均數的相關為 \(.61\)。延宕一期慣性亦已計算,但在報告時附上保留,因為在實際達成的時點數之下它的信度偏低。」每一個子句都報告一個層次專屬的量,並標記出唯一那個資料無法支持其可信度的指標,也就是慣性;而這正是本章所要培養的誠實。

7.8 常見的迷思

關於這些描述統計,有幾個信念會誤導人。第一個把組內相關等同於信度;兩者都由類似的變異數比值算出來,也確實相關,但一個結果變項的 ICC 描述的是它有多少變異數在個體之間,而一個測量的信度描述的是它有多少變異數是真分數 (true score),而一個變項完全可以 ICC 很低而測量得非常精確。第二個主張高慣性總是適應不良的;實徵文獻平均而言把偏高的慣性連結到較差的適應,但持續性是適應還是適應不良,取決於持續的是什麼,以及是在什麼脈絡裡,而把一個指標道德化是一種概念錯誤。第三個把個人平均數當成這個人的真實水準;它們是帶有抽樣誤差污染的估計,而在時點數少時那份誤差相當可觀,後續各章的收縮 (shrinkage) 與潛在分解方法之所以存在,正是因為原始平均數高估了個體間的分散程度。還有一個反覆被問到的問題,該用哪一個變異性指標,答案是表 7.1 的邏輯,也就是把指標對上研究者關心的那個歷程特徵,同時受冗餘警告的節制:每一個特徵挑一個代表,而不要報告一整批彼此相關的指標;而在有界量尺上,優先採用已對平均數校正的形式。

實務要點 • 每一個指標最少需要幾個時點

一個指標需要多少時點,不是單一個數字,而取決於是哪一個指標,以及研究者願意接受多高的信度。在圖 7.6 的模擬中,個體內平均數與標準差大約在三十個時點時折半信度接近 \(.80\),RMSSD 也差不多。延宕一期慣性要求高得多,在三十個時點時仍低於 \(.40\),需要長得多的序列,或是能在個體之間互相借力的模型式估計,個體層次的值才能被信任。這些數字是那個模擬歷程所特有的,應該被讀成數量級的指引,而不是門檻:誠實的做法是報告實際達成的時點數,並把由短序列算出來的個體層次指標,尤其是以自我相關為基礎的那些,一律當成暫定的。

本章摘要

重複測量的描述分析,從追問變異數落在哪裡開始。由虛無模型得到的組內相關把總變異數切成個體間與個體內兩份,同時兼任同一個人兩筆觀察的期望相關(圖 7.1);就本書的情緒資料而言,每一個當下構念都約有一半的變異數在個體之內,另有十分之一左右在日層次。任何隨時間變動的預測變項都可以分解成一個個體間的平均數與一個個體內的偏離,而兩者與結果變項的關聯可以不同(圖 7.2),且原始的個人平均數在 \(T\) 小時是一個雜訊很大的特質估計。一族個體層次指標摘要每一個人的動態,包括平均數、標準差及其對平均數校正後的相對形式、代表不穩定的 RMSSD 與急遽變化機率,以及代表慣性的延宕一期自我相關;而四個平均數完全相同的人,在這些指標上可以差得很多(圖 7.3)。每一個指標都帶著一種失效模式:原始的 iSD 在有界量尺上與平均數混淆,必須加以校正(圖 7.5);慣性在短序列中既不可靠又向下偏誤(圖 7.6);趨勢與日內週期若不先模型化移除就會膨脹不穩定(圖 7.7);而這些指標彼此冗餘,相對於平均數所增加的很少(圖 7.8)。本章以縱貫版的「表 1」收尾,它報告層次專屬的統計量,以及分開的個體間與個體內相關矩陣。貫穿全章的紀律是:要描述就算指標,要推論就配模型。

接下來讀哪裡

本章的描述統計是進入建模各部的入口。變異數分解就是每一個多層次成長與日誌模型(第 13、14、23 章)所要在其上擴充的那個虛無模型,而它所產生的 ICC 決定了那些模型有多少個體內訊號 (within-person signal) 可用。預測變項的個體間與個體內分解,會變成個體內建模核心的那個中心化 (centering) 決定。變異性指標會在第 16 章的混合效果位置尺度模型中變成模型參數,而慣性會變成第 24 與 25 章單一受試者 (single-subject) 與多層次時間序列模型中的自我迴歸參數,並在那裡以描述性指標所缺乏的收縮與誤差分離被估計出來。在第 33 與 35 章的應用中,這些指標會再度以臨床與人格結果變項的預測變項身分出現,而此處反覆提醒過的那些警告,也就是平均數的混淆、信度的下限、彼此的冗餘,就是一項穩健發現與一項假象之間的差別。

習題

  1. 7.1 分解變異數。就 affect_ema 中的五個變項,計算兩層與三層的組內相關,分別在個體層次與日層次上。解讀每一個值對於「這個構念比較適合在個體之內還是在個體之間研究」各意味著什麼。
  2. 7.2 兩種關聯。為壓力與負向情緒建立個體間與個體內兩張分解散布圖,估計兩個斜率,並寫一段約 \(225\) 字的解讀,讓兩個層次保持分明,並指名把兩者混為一談會犯下的那個謬誤。
  3. 7.3 把混淆暴露出來。重製「平均數對 iSD」的散布圖及其有界量尺包絡線,接著套用相對標準差,並報告一個假設性的「變異性與某結果變項之間的相關」在平均數的混淆被移除之後會如何改變。
  4. 7.4 慣性的偏誤。以模擬估計延宕一期自我相關在 \(T = 10\)、\(30\) 與 \(100\) 時的偏誤,真值由你自己選定,並說出這對「跨序列長度不同的研究比較慣性」有什麼後果。
  5. 7.5 建一張表 1。使用所提供的一份日誌資料與表 7.3 的範本,產出一份可供發表的描述表,含層次專屬的統計量以及分開的個體間與個體內相關矩陣,並寫出隨附的描述段落。

本章重要名詞中英對照

中文English說明/首次出現處
組內相關intraclass correlation (ICC)落在個體之間的變異數比例,同時是同一人兩筆觀察的期望相關;第 7.1 節
無條件模型unconditional model只含截距的模型,用來分解變異數;第 7.1 節
虛無模型null model同無條件模型;第 7.1 節
個體內平均數intraindividual mean (iMean)一個人自己觀察的平均數;第 7.3 節
個體內標準差intraindividual standard deviation (iSD)一個人自己觀察的標準差;第 7.3 節
相對標準差relative standard deviationiSD 除以該平均數所允許的最大 SD;第 7.3 節
連續差異均方根root mean square of successive differences (RMSSD)對時間順序敏感的不穩定指標;第 7.3 節
急遽變化機率probability of acute change (PAC)連續差異超過切點的比例;第 7.3 節
慣性inertia狀態持續的傾向,以延宕一期自我相關摘要;第 7.3 節
個體內相關within-person correlation兩個狀態當下偏離之間的相關;第 7.3 節
情緒區辨emotion differentiation同效價題目之間平均的個體內相關,低者區辨細;第 7.3 節
密度分配density distribution把特質看成一個人所造訪狀態的分配(Fleeson);第 7.3 節
平均數與變異數的混淆mean-variance confound有界量尺上 iSD 機械性地與 iMean 綁在一起;第 7.4 節
小樣本偏誤small-sample bias樣本自我相關在短序列中向下偏誤;第 7.4 節
去趨勢detrending計算指標前先移除趨勢或週期;第 7.4 節
冗餘redundancy多個指標測到幾乎相同的東西;第 7.4 節
收縮shrinkage依不確定性把不可靠的個別估計往總平均數拉;第 7.2 節
混合效果位置尺度模型mixed-effects location-scale model同時建模平均數與個體內離散度(第 16 章);第 7.3 節
縱貫版「表 1」longitudinal Table 1區分層次的描述表,含兩個相關矩陣;第 7.5 節

參考文獻

Baird, B. M., Le, K., & Lucas, R. E. (2006). On the nature of intraindividual personality variability: Reliability, validity, and associations with well-being. Journal of Personality and Social Psychology, 90(3), 512–527. https://doi.org/10.1037/0022-3514.90.3.512

Bliese, P. D. (2000). Within-group agreement, non-independence, and reliability: Implications for data aggregation and analysis. In K. J. Klein & S. W. J. Kozlowski (Eds.), Multilevel theory, research, and methods in organizations: Foundations, extensions, and new directions (pp. 349–381). Jossey-Bass.

Bolger, N., & Laurenceau, J.-P. (2013). Intensive longitudinal methods: An introduction to diary and experience sampling research. Guilford Press.

Dejonckheere, E., Mestdagh, M., Houben, M., Rutten, I., Sels, L., Kuppens, P., & Tuerlinckx, F. (2019). Complex affect dynamics add limited information to the prediction of psychological well-being. Nature Human Behaviour, 3(5), 478–491. https://doi.org/10.1038/s41562-019-0555-0

Enders, C. K., & Tofighi, D. (2007). Centering predictor variables in cross-sectional multilevel models: A new look at an old issue. Psychological Methods, 12(2), 121–138. https://doi.org/10.1037/1082-989X.12.2.121

Erbas, Y., Ceulemans, E., Pe, M. L., Koval, P., & Kuppens, P. (2014). Negative emotion differentiation: Its personality and well-being correlates and a comparison of different assessment methods. Cognition and Emotion, 28(7), 1196–1213. https://doi.org/10.1080/02699931.2013.875890

Fleeson, W. (2001). Toward a structure- and process-integrated view of personality: Traits as density distributions of states. Journal of Personality and Social Psychology, 80(6), 1011–1027. https://doi.org/10.1037/0022-3514.80.6.1011

Hamaker, E. L. (2012). Why researchers should think “within-person”: A paradigmatic rationale. In M. R. Mehl & T. S. Conner (Eds.), Handbook of research methods for studying daily life (pp. 43–61). Guilford Press.

Houben, M., Van Den Noortgate, W., & Kuppens, P. (2015). The relation between short-term emotion dynamics and psychological well-being: A meta-analysis. Psychological Bulletin, 141(4), 901–930. https://doi.org/10.1037/a0038822

Jahng, S., Wood, P. K., & Trull, T. J. (2008). Analysis of affective instability in ecological momentary assessment: Indices using successive difference and group comparison via multilevel modeling. Psychological Methods, 13(4), 354–375. https://doi.org/10.1037/a0014173

Kuppens, P., Allen, N. B., & Sheeber, L. B. (2010). Emotional inertia and psychological maladjustment. Psychological Science, 21(7), 984–991. https://doi.org/10.1177/0956797610372634

Mestdagh, M., Pe, M. L., Pestman, W., Verdonck, S., Kuppens, P., & Tuerlinckx, F. (2018). Sidelining the mean: The relative variability index as a generic mean-corrected variability measure for bounded variables. Psychological Methods, 23(4), 690–707. https://doi.org/10.1037/met0000153

Shrout, P. E., & Fleiss, J. L. (1979). Intraclass correlations: Uses in assessing rater reliability. Psychological Bulletin, 86(2), 420–428. https://doi.org/10.1037/0033-2909.86.2.420

Trull, T. J., Solhan, M. B., Tragesser, S. L., Jahng, S., Wood, P. K., Piasecki, T. M., & Watson, D. (2008). Affective instability: Measuring a core feature of borderline personality disorder with ecological momentary assessment. Journal of Abnormal Psychology, 117(3), 647–661. https://doi.org/10.1037/a0012532

Wang, L. P., Hamaker, E. L., & Bergeman, C. S. (2012). Investigating inter-individual differences in short-term intra-individual variability. Psychological Methods, 17(4), 567–581. https://doi.org/10.1037/a0029317