第 30 章 密集縱貫資料與動態模型
第六部 相依資料與變化的建模
30Chapter

密集縱貫資料與動態模型

前一章的成長曲線模型,處理的是以少數幾個測量波次描繪長期發展軌跡的資料。然而,經驗取樣法與穿戴式感測的普及,帶來了一種截然不同的縱貫資料:對同一批人在數週之內、每日多次地重複測量,累積出每人數十至數百個時點的序列。這類密集縱貫資料(intensive longitudinal data, ILD)的旨趣,已不在於「一個人在數年間長成什麼樣子」,而在於「一個人的心理狀態在日常生活中如何逐時刻地起伏、如何被前一刻的自己與當下的情境所牽動」。本章要處理的,正是這種以個體內歷程之動態為核心的測量與建模。

這個轉向不只是資料頻率的改變,更是分析目標的根本位移。當測量密集到足以捕捉一個人狀態的自我延續與相互溢出時,統計的對象便從「個體之間的差異」轉為「個體之內的歷程」。本章以此為主軸展開:先論證為何個體間的結構不能替代個體內的動態,即遍歷性問題;再處理密集取樣的設計取捨、動態建模的核心語彙、多層次向量自迴歸與動態結構方程的架構、中心化與滯後兩個技術關鍵、以及不等間距所需的連續時間取向。其後轉向密集資料特有的測量學問題,即組內信度與跨層不變性,並簡介動態網絡與個殊化建模,最後以一則關於情緒動態增量效度的前沿辯論收束。為使討論具體,全章以一項「兩週的心情取樣」研究為貫穿實例,即對一群大學生以手機每日隨機提示五次、連續十四天施測,記錄其當下的正負向情緒。

走進日常:ESM 與 EMA

密集縱貫資料的蒐集方法,統稱為經驗取樣法(experience sampling method, ESM)或生態瞬時評估(ecological momentary assessment, EMA),兩者旨趣相通,皆在於在受測者的日常情境中、於事件發生的當下捕捉其狀態,藉此避免回溯式自陳所固有的記憶偏誤與心境一致性偏誤。Bolger & Laurenceau (2013) 對這類方法的設計與分析提供了系統的參照。相較於實驗室的橫斷測量,此類設計的生態效度較高,因為它直接在真實生活的脈絡中取樣,所測到的情緒或行為未經事後重構的扭曲。

行動裝置的普及,使這類原本仰賴紙本日記、耗時費力的研究得以規模化,並進一步延伸為以感測器被動蒐集的數位表型(digital phenotyping),如以手機的活動、定位與使用型態推估心理狀態。本書對被動感測的測量效度持審慎立場,並明確標記其為進行中的議題,因為「感測訊號能否有效指涉心理構念」這一效度問題,遠比技術上能否蒐集到資料更為根本,其計算與訊號處理層面則屬第三十四章。無論主動或被動,密集取樣的共同承諾是把測量帶進日常,其代價與挑戰則構成本章其餘各節的主題。

遍歷性:為何個體間代替不了個體內

密集縱貫方法的認識論基礎,是一個看似抽象、實則影響深遠的區分,即個體內歷程與個體間差異未必一致。傳統心理學的絕大多數結論建立在個體間的變異之上,例如「焦慮與失眠正相關」這類陳述,其實描述的是「焦慮較高的人失眠也較多」的人際關係,而非「當一個人比平時更焦慮時,他當晚也更容易失眠」的個體內歷程。這兩者是否一致,並非邏輯上的必然,而是一個須以資料檢驗的實質問題。

概念方塊遍歷性與 Molenaar 宣言

一個歷程若滿足遍歷性(ergodicity),則個體間的結構與個體內的結構相同,因而以人際差異推論個體內動態才是合法的。遍歷性成立的條件相當嚴苛,主要有二:

同質性(homogeneity):所有個體須服從相同的動態歷程與參數。 定態性(stationarity):每一個體的歷程須在時間上維持相同的統計性質(如平均、變異、自我相關不隨時間漂移)。

Molenaar (2004) 的個殊科學宣言指出,心理歷程通常既不同質(人與人的動態不同)也不定態(歷程隨發展與情境變化),因而普遍不遍歷。其推論是激進的:建立在個體間變異上的心理學結論,原則上不能直接推論到任一個體之內的歷程。密集縱貫資料之所以不可或缺,正因為唯有它能直接觀測個體內的動態,而不必仰賴遍歷性這個多半不成立的假設。

遍歷性問題把第二十八與二十九章的組內組間分離推到了極致。在少時點的縱貫資料中,我們已看到隨機截距交叉延宕模型如何分離個體間的穩定差異與個體內的偏離;在密集資料中,這一分離不再只是統計上的講究,而成為整個研究得以成立的前提。以「兩週的心情取樣」為例,其目標正是估計「當某位學生此刻比其個人平均更沮喪時,下一次取樣他是否仍偏沮喪」這類純粹個體內的動態,而這是任何橫斷或少波次設計都無法回答的。

設計決策:取樣、頻率與負荷

密集研究的效度,在資料蒐集之前就已大半決定於設計。取樣策略主要有三類:訊號相依取樣(signal-contingent),即以隨機或半隨機的提示要求受測者當下作答,適合捕捉一般狀態的分布與動態;事件相依取樣(event-contingent),即在特定事件發生後作答,適合研究對特定情境的反應;時距相依取樣(interval-contingent),即固定時間間隔作答,便於分析但可能錯過事件。三者各有取捨,「兩週的心情取樣」採每日隨機五次的訊號相依設計,正是為了無偏地取樣日常情緒的自然起伏。

設計的核心張力在於頻率與負荷之間的權衡。取樣愈密,對動態的時間解析度愈高,但受測者的負擔也愈重,可能導致遵從率(compliance)下降與作答品質惡化。更微妙的是反應性(reactivity),即反覆自我觀察本身可能改變被觀察的歷程,例如持續記錄情緒可能使人更留意情緒。這些並非可忽略的枝節,而直接關係到所蒐集資料的效度:低遵從造成的缺失若與狀態相關(如心情低落時更不願作答),即為非隨機缺失,會系統性地扭曲對動態的估計。設計密集研究因而是一門在時間解析度、受測者負荷與資料品質之間求取平衡的藝術。

慣性與溢出:動態建模的語彙

分析密集資料,需要一套描述個體內歷程的語彙,其核心概念皆源自時間序列分析。最基本的是自迴歸(autoregression),即一個變項當前的值對其自身前一時點的迴歸,在心理學脈絡中常被詮釋為慣性(inertia)或稱情緒的自我延續:自迴歸係數愈高,表示一個人偏離其基準狀態後回復得愈慢,情緒愈黏著。慣性因而成為一個具實質心理意義的動態指標,而非單純的統計參數。

當歷程涉及多個變項時,語彙擴展為向量自迴歸(vector autoregression, VAR)。除了各變項自身的慣性,還有交叉延宕(cross-lagged)效果,即一個變項的前一時點對另一個變項當前值的效果,在心理學中常被詮釋為溢出(spillover)或情緒之間的相互牽動,例如「前一刻的焦慮是否預測下一刻的疲憊」。自迴歸捕捉單一歷程的自我延續,交叉延宕捕捉歷程之間的動態傳遞,兩者共同構成了刻畫個體內動態系統的基本工具。須強調的是,這些係數所描述的是個體內的時序關聯,其因果詮釋仍受制於第三十一章所論的識別條件,尤其是時變混淆的威脅。

多層次 VAR 與動態結構方程

密集資料的分析,須同時處理兩件事:每一個體的時間序列動態,以及這些動態參數本身在個體之間的差異。把時間序列的 VAR 與多層次的隨機效果結合,即得到多層次向量自迴歸(multilevel VAR),其單變量的一階特例最能清楚呈現此一結構。

推導方塊多層次 AR(1):把慣性設為隨機效果

對個體 i 在時點 t 的觀測 y_{it},組內(第一層)模型將其動態寫為以個人平均 \mu_i 為中心的一階自迴歸:

y_{it} = \mu_i + \phi_i\,(y_{i,t-1} - \mu_i) + \varepsilon_{it}, \qquad \varepsilon_{it}\sim N(0,\sigma^2_i).

其中 \mu_i 為個人的基準水準,\phi_i 為個人的慣性(自迴歸係數),\sigma^2_i 為個人的組內波動幅度。組間(第二層)模型則令這些個人參數隨機變動:

\mu_i = \gamma_\mu + u_{\mu i},\qquad \phi_i = \gamma_\phi + u_{\phi i},\qquad \begin{pmatrix} u_{\mu i}\\ u_{\phi i}\end{pmatrix}\sim N(\mathbf{0},\mathbf{T}).

\gamma_\phi 為母體的平均慣性,\mathbf{T} 中的 \tau_{\phi\phi} 則刻畫慣性的個體間差異,即「有些人情緒比別人更黏著」。更進一步,可令 \log\sigma^2_i 亦為隨機效果,使個體內的變異性本身成為可估計、可預測的個人特徵。動態結構方程模型((Asparouhov et al., 2018))將此架構推廣,容許潛在變項、測量模型與交叉延宕的隨機效果,並以貝氏方法(第三十三章)估計。

動態結構方程模型(dynamic structural equation model, DSEM)之所以成為當代密集縱貫分析的主流框架,在於它把四個傳統整合於一體:時間序列的動態、多層次的個體間異質、結構方程的潛在變項與測量模型、以及貝氏估計。它讓自迴歸係數、交叉延宕係數與組內變異等動態參數,皆可作為隨機效果在個體間變異,並可進一步以個人特質(如神經質)預測這些動態參數,從而形式化「哪種人的情緒較黏著」這類問題。DSEM 的作業化(如 Mplus 的實作)把原本高度專門的動態建模帶入了主流應用,但其複雜度也對先驗設定與收斂診斷提出了高度要求,此與第三十三章的議題一脈相承。

中心化與滯後:兩個技術關鍵

多層次動態模型有兩個看似技術性、實則關乎估計無偏與否的關鍵。第一是中心化。前述模型以「個人平均」為中心界定自迴歸,這一步不可省略,否則自迴歸係數會混淆個體內的動態與個體間的差異,正如第二十八章脈絡效果所論的組內組間混淆,在動態情境中同樣成立。然而,一個常被忽略的陷阱是,以觀測到的個人樣本平均作為 \mu_i 的估計並不理想:在時點數有限時,樣本平均本身帶有誤差,且此誤差與自迴歸的估計相關,導致慣性係數產生系統性的向下偏誤,這是動態面板模型中著名的一類偏誤。DSEM 的解法是採用潛在人均中心化(latent person-mean centering),即把個人平均 \mu_i 設為模型中的潛在變項一併估計,而非以觀測平均代入,從而校正此偏誤。

第二是滯後階數與定態性。自迴歸須指定滯後階數,一階模型假定當前狀態僅直接受前一時點影響;階數的選擇應兼顧理論與資料,過低會遺漏較長的時間依賴,過高則耗損自由度並使詮釋複雜。更根本的前提是定態性,即個體的動態參數在觀測期間維持穩定。若一個人的慣性或基準水準在兩週內本身發生系統性漂移(如處於情緒逐步惡化的歷程中),則定態性被違反,所估得的單一自迴歸係數便是對一個非定態歷程的誤描。定態性因而不是可預設的技術假定,而應在密集資料分析中被實質地檢視。

不等間距:連續時間取向

密集資料的一個現實特徵,是測量時點往往並非等間隔:訊號相依取樣的提示是隨機的,夜間通常不取樣,受測者也未必即時作答。標準的離散時間自迴歸模型隱含「相鄰觀測的時距相等」的假定,當此假定被違反時,自迴歸係數的意義便含混不清,因為間隔兩小時與間隔十小時的「前一時點效果」顯然不應相同。

推導方塊離散時間與連續時間自迴歸的對應

連續時間取向不直接建模「相鄰觀測」的關係,而假定歷程由一個定義在連續時間上的隨機微分方程所驅動,其核心是漂移參數 a(drift)。在此設定下,時距為 \Delta t 的兩觀測之間,離散時間的自迴歸係數並非常數,而是漂移參數與時距的函數:

\phi(\Delta t) = e^{\,a\,\Delta t}.

其中 a<0 對應一個回復穩態的歷程,|a| 愈大回復愈快。多變量情形下,a 推廣為漂移矩陣 \mathbf{A},離散時間的轉移矩陣為矩陣指數 \boldsymbol{\Phi}(\Delta t)=e^{\mathbf{A}\Delta t}。此一指數對應的關鍵優點是:不同時距的觀測可由同一組連續時間參數描述,從而原則性地處理不等間距,並使基於不同時距的研究結果得以互相比較。Voelkle et al. (2012) 對此取向與其結構方程實作有系統的闡述。

連續時間取向的代價,是估計較為複雜、對模型設定較為敏感。但它在概念上釐清了一件重要的事:所謂「自迴歸效果」並非一個絕對的量,而總是相對於某個時距而言的;忽略時距而逕自比較不同研究的自迴歸係數,可能得出誤導的結論。對於時距高度不規則的密集資料,連續時間取向提供了一個原則性而非權宜的處理方式。

密集資料的測量學:組內信度與跨層不變性

密集縱貫研究常把心理計量的基本問題擱在一旁,彷彿每次瞬時測量都是對狀態的完美讀取。這是危險的疏忽。瞬時量表同樣有測量誤差,且其信度問題比橫斷測量更為複雜,因為變異同時存在於個體內(時點之間)與個體間(人與人之間)兩個層次。Geldhof et al. (2014) 指出,信度必須在各層次分別估計:組內信度衡量瞬時測量對「個體內狀態波動」的可靠捕捉,組間信度則衡量對「個體間平均差異」的可靠區辨,兩者可以相差甚遠。一份在區辨人際差異上高度可靠的量表,未必能可靠地追蹤同一個人的逐時刻起伏。這一層次分離的信度概念,正是第六章概化理論邏輯在密集資料上的當代延伸,即把變異拆解到不同的變異來源再各自評估其信噪比。

與信度平行的問題是跨層與跨時的因素結構是否一致。密集資料的因素分析須區分組內與組間的因素結構,兩者未必相同,例如某些條目在描述「此刻的狀態」與「一個人的一般水準」時可能載荷於不同的維度。更進一步,若要比較某構念在不同時點或不同情境下的狀態,還須確認跨時點的測量不變性,其道理與第十九章跨群體不變性完全平行,只是此處的「群體」換成了「時點」或「情境」。忽略這些測量學問題,逕自把瞬時分數當作構念真值來建模動態,可能使所估得的「動態」部分反映的是測量性質的變動,而非心理歷程本身。測量爆發設計(measurement burst),即在長期追蹤中嵌入數段密集取樣,則為同時研究短期動態與長期發展、並檢驗其測量一致性提供了有力的架構。

動態網絡初探

把多層次向量自迴歸的估計結果以圖形呈現,即得到一個動態網絡:節點為變項(如各項情緒或症狀),有向連結為自迴歸與交叉延宕係數,箭頭方向表示時序上的領先預測。Bringmann et al. (2013) 示範了如何由經驗取樣資料估計此類時序網絡,使「哪些症狀在時間上驅動哪些症狀」成為可估計的問題。這一取向在近年的心理病理學研究中頗具影響,因為它把「疾病是症狀相互激發的網絡」這一構想,轉化為可由密集資料檢驗的動態結構。

本書對網絡取向採取明確的分工:本章示範的是動態網絡的時序估計,即如何從密集資料估得節點間的時滯關聯;而網絡取向更深層的估計方法(如正則化的偏相關網絡)與其本體論爭議(網絡究竟是實在的因果系統,還是潛在變項的另一種表徵)則留待第三十五章專章處理。此處要強調的是方法論上的審慎:由時序網絡的箭頭推論因果,仍受制於第三十一章所論的識別條件,時滯關聯是因果的必要線索而非充分證據。

個殊化建模:n=1 的科學

遍歷性的警示若被認真對待,其邏輯終點是個殊化(idiographic)建模,即為每一個體建立其專屬的動態模型,而非假定全體共享單一結構。這正是 Molenaar (2004) 宣言的積極主張:既然歷程普遍不遍歷,心理學就應當回到以個體為分析單位的科學。密集縱貫資料使這一主張首度變得可行,因為每人數十上百個時點,已足以估計一個個人層次的時間序列模型。

個殊化與匯總之間並非全然對立。以 Gates & Molenaar (2012) 的群體迭代多重模型估計(group iterative multiple model estimation, GIMME)為代表的取向,試圖在兩極之間取得平衡:它先辨識出多數個體共有的動態連結以形成群體結構,再為每一個體增補其特有的連結,從而同時得到可靠的群體推論與個殊的個人模型。這與多層次模型借力於部分聯營的精神相通,只是此處聯營的對象是動態的結構本身。個殊化建模標誌著一種分析取向的轉變,即從「估計一個適用於所有人的平均模型」轉向「估計一組容納個體異質的個人模型」,而密集資料正是使這一轉變成為可能的經驗基礎。

前沿專欄:情緒動態能否勝過平均數

密集縱貫方法的興盛,催生了大量以動態指標刻畫心理健康的研究,主張情緒的慣性、變異性、不穩定性等動態特徵,能捕捉單憑平均水準所遺漏的重要訊息。這一主張在直覺上頗具吸引力,也推動了情緒動態這一子領域的蓬勃發展。然而,一個嚴肅的實證挑戰隨之而來,即這些看似精緻的動態指標,是否真的提供了超越平均數的增量訊息。

Dejonckheere et al. (2019) 匯集多個密集縱貫資料集的分析給出了一個發人深省的結果:一旦控制了正負向情緒的平均水準,各種複雜的情緒動態指標對心理福祉的預測,僅剩相當有限的增量效度。這一發現對情緒動態領域構成了重要的方法論警示,其意涵有二。其一是統計上的:許多動態指標與情緒的平均水準高度相關(例如平均負向情緒高的人,其負向情緒的變異性往往也高),因而其表面的預測力有很大一部分只是平均水準的重新包裝。其二是研究策略上的:主張某個新穎的動態指標具有價值時,舉證責任在於證明它能勝過平均數這個簡樸而強勁的基準,而非僅僅顯示它與結果相關。這場辯論仍在進行,它並不否定動態研究的價值,而是提醒研究者以更嚴格的增量效度標準要求自己,避免把統計的複雜誤認為實質的洞見。

小結

本章處理了經驗取樣與穿戴感測時代的核心方法學,即密集縱貫資料的測量與動態建模。全章的認識論起點是遍歷性問題:個體間的結構通常不能替代個體內的動態,因而唯有直接觀測個體內歷程的密集資料,才能無偏地回答「一個人的狀態如何逐時刻起伏與相互牽動」這類問題。在建模上,本章以慣性與溢出為語彙,建立了多層次向量自迴歸與動態結構方程的架構,並剖析了潛在人均中心化與定態性這兩個關乎估計無偏的技術關鍵,以及以連續時間取向原則性地處理不等間距的方法。

在測量層次,本章強調密集資料絕非免於心理計量的檢驗:組內與組間信度須分別估計,跨時與跨層的測量不變性須加確認,否則所建模的「動態」可能只是測量性質的漂移。本章並簡介了動態網絡與個殊化建模這兩條把個體內取向推向極致的路線,且清楚劃定其與第三十五章網絡本體論、第三十一章因果識別的分工。最後,情緒動態的增量效度辯論提醒我們,密集資料與動態指標的精緻,並不自動等同於實質的解釋力,任何動態指標都須通過「勝過平均數」這一嚴格基準的檢驗。貫穿全章的訊息是:把測量帶進日常、把分析對準個體內的歷程,開啟了心理學前所未有的動態視野,但也要求更高的方法論自覺。至此,本書對相依資料與變化的建模已有完整交代,下一部將轉向一個貫穿全書的深層問題,即如何從資料推論因果,以及如何整合眾多研究的證據。

參考文獻

Asparouhov, T., Hamaker, E. L., & Muthén, B. (2018). Dynamic structural equation models. Structural Equation Modeling: A Multidisciplinary Journal, 25(3), 359–388. https://doi.org/10.1080/10705511.2017.1406803
Bolger, N., & Laurenceau, J.-P. (2013). Intensive longitudinal methods: An introduction to diary and experience sampling research. Guilford Press.
Bringmann, L. F., Vissers, N., Wichers, M., Geschwind, N., Kuppens, P., Peeters, F., Borsboom, D., & Tuerlinckx, F. (2013). A network approach to psychopathology: New insights into clinical longitudinal data. PLOS ONE, 8(4), e60188. https://doi.org/10.1371/journal.pone.0060188
Dejonckheere, E., Mestdagh, M., Houben, M., Rutten, I., Sels, L., Kuppens, P., & Tuerlinckx, F. (2019). Complex affect dynamics add limited information to the prediction of psychological well-being. Nature Human Behaviour, 3(5), 478–491. https://doi.org/10.1038/s41562-019-0555-0
Gates, K. M., & Molenaar, P. C. M. (2012). Group search algorithm recovers effective connectivity maps for individuals in homogeneous and heterogeneous samples. NeuroImage, 63(1), 310–319. https://doi.org/10.1016/j.neuroimage.2012.06.026
Geldhof, G. J., Preacher, K. J., & Zyphur, M. J. (2014). Reliability estimation in a multilevel confirmatory factor analysis framework. Psychological Methods, 19(1), 72–91. https://doi.org/10.1037/a0032138
Molenaar, P. C. M. (2004). A manifesto on psychology as idiographic science: Bringing the person back into scientific psychology, this time forever. Measurement: Interdisciplinary Research and Perspectives, 2(4), 201–218. https://doi.org/10.1207/s15366359mea0204_1
Voelkle, M. C., Oud, J. H. L., Davidov, E., & Schmidt, P. (2012). An SEM approach to continuous time modeling of panel data: Relating authoritarianism and anomia. Psychological Methods, 17(2), 176–192. https://doi.org/10.1037/a0027543
本章引用格式游琇婷(2026)。密集縱貫資料與動態模型。《計量心理學:測量、模型與推論》(第 30 章)。