縱貫與成長曲線模型
第二十八章末已指出,重複測量可視為巢狀於個人之內的兩層結構,因而落入多層次框架。本章則以此為起點,深入處理「對隨時間的變化本身進行建模」這一主題。發展與縱貫研究的核心,並非某一時點的靜態水準,而是兩個層層相扣的問題:個體如何隨時間變化(intraindividual change,個體內變化),以及個體之間在變化上有何差異(interindividual differences in change,變化的個體間差異)。成長曲線模型(growth curve model)即為同時回答這兩個問題而設計的統計框架。
本章對成長曲線模型作一完整處理。首先釐清其相對於傳統重複量數分析的優勢,並闡明其兩個看似不同、實則等價的建模傳統:多層次的隨機係數取向與結構方程的潛在成長曲線取向。其次系統展開線性模型的形式、時間編碼的深遠影響、以及非線性、條件、平行歷程等各式擴展。再者,處理成長混合模型、二階成長與縱貫測量不變性、以及自迴歸與變化分數等替代取向,並延伸至以密集縱貫資料為對象的動態結構方程前沿。最後,論及時間度量、估計、缺失資料與詮釋上的威脅。貫穿全章的主軸是:對「變化」的建模,遠比對「水準」的建模承載更多假設,而這些假設的成立與否,決定了所估得的「變化」是否確為實質的變化。
為何需要成長模型:從重複量數到個體軌跡
傳統的重複量數變異數分析(repeated-measures ANOVA)雖能處理時間因子,卻有數項根本限制。它將時間視為類別因子而非連續量,因而無法刻畫個體的軌跡形狀;它僅描述群體平均隨時間的變動,卻不估計個體在起始水準與變化率上的差異;它要求球形(sphericity)假設與平衡且完整的資料,難以容納不等間隔、個體特定的測量時點或流失。更根本地,它把個體間的軌跡差異全部歸入誤差,而成長模型的核心旨趣,恰恰在於將這些差異提升為模型的實質參數。
成長曲線模型的突破,在於將每一個體的時間軌跡以少數幾個參數(如起始水準與變化率)加以概括,再將這些個體參數本身視為具有母體分配的隨機量。如此,模型同時估計了平均軌跡(固定效果)與軌跡的個體間變異(隨機效果),使「變化的個體差異」得以被建模、被解釋、並與其他變項關聯。
兩個傳統:隨機係數與潛在成長曲線
成長曲線模型有兩個獨立發展、卻在數理上高度重疊的傳統。其一是多層次的隨機係數取向(第二十八章):將時點巢狀於個人,第一層以時間為預測變項刻畫個體軌跡,第二層令軌跡參數(截距與斜率)隨個人隨機變動。其二是結構方程的潛在成長曲線取向,源自 Meredith & Tisak (1990) 的潛在曲線分析與 McArdle & Epstein (1987) 的發展性結構方程模型:將截距與斜率設為潛在因素,各時點的觀測值對這兩個因素的負荷被固定為特定的時間分數,軌跡的個體差異即體現為因素的變異。Willett & Sayer (1994) 對後者作了具影響力的推廣,使其能納入變化的預測因子。
兩個傳統在一組寬鬆的條件下是分析上等價的:對同一線性成長設定,隨機係數模型與潛在成長曲線模型給出相同的參數估計與適配。Curran (2003) 對此等價性作了系統的闡明。理解此點有實質價值:它意味著研究者可依問題性質選擇較便利的框架,SEM 取向長於納入潛在測量模型、多重結果與複雜的結構關係,MLM 取向則長於處理個體特定的測量時點與三層以上的巢狀。本章的形式鋪陳將以 SEM 取向為主軸,因其最能凸顯成長模型作為潛在變項模型的本質,但所述概念在兩個框架中皆成立。
線性潛在成長曲線模型
線性成長是最基本的設定。以結構方程的語言,它是一個具有均值結構的受限因素模型,其形式清楚地揭示了成長模型如何同時再現資料的一階動差(平均軌跡)與二階動差(變異與共變)。
設個體 i 在 T 個時點的觀測為向量 \mathbf{y}_i = (y_{1i},\dots,y_{Ti})'。模型設兩個潛在因素,截距因素 \eta_{0i} 與斜率因素 \eta_{1i}:
截距因素的負荷全設為 1,斜率因素的負荷 \lambda_t 固定為時間分數(如 0,1,\dots,T-1),此即成長模型與一般驗證性因素分析的關鍵差異:負荷不估計,而由時間度量所界定。因素本身分解為平均與離差:
殘差 \boldsymbol{\varepsilon}_i \sim N(\mathbf{0},\boldsymbol{\Theta})。由此可導出模型隱含的動差結構:
均值結構 \boldsymbol{\Lambda}\boldsymbol{\alpha} 再現平均軌跡,故成長模型必須明確建模均值(不可如一般 CFA 般忽略)。各參數的實質意義為:\alpha_0 平均起始水準、\alpha_1 平均變化率、\psi_{00} 起始水準的個體間變異、\psi_{11} 變化率的個體間變異、\psi_{01} 起點與變化速率的關聯。
\psi_{11} 是成長模型的樞紐參數:唯有當它顯著大於零,才存在「變化的個體差異」可供解釋;若 \psi_{11}\approx 0,則所有個體以相近的速率變化,後續的條件模型便無異質性可言。需注意,對 \psi_{11}=0 的檢定同樣涉及第二十八章所述的變異數成分邊界問題,不宜僅憑天真的卡方檢定判定。
時間編碼與參數詮釋
成長模型中一個技術上簡單、後果卻深遠的選擇,是時間分數 \lambda_t 的編碼。它並非任意的計算慣例,而直接決定了截距因素的實質意義。
設將原時間分數平移一常數 c,即 \lambda_t^{*} = \lambda_t - c。由於同一軌跡可寫為
新截距因素為 \eta_{0i}^{*} = \eta_{0i} + c\,\eta_{1i},斜率因素則不變。對均值與共變結構取期望,得
而 \alpha_1 與 \psi_{11} 不隨編碼改變。可見,截距的平均、變異、以及它與斜率的共變,全都取決於時間原點的選擇;斜率相關的量則為尺度不變。
此代數有兩個重要的實務啟示。其一,截距代表「\lambda_t = 0 那個時點」的水準,故常見的編碼策略包括以基線為原點(\lambda_t = 0,1,\dots,截距即基線水準)、以終點為原點(截距即終點水準)、或以中段為原點。研究者應依所欲詮釋的時點選擇原點,而非任意設定。其二,起始水準與變化率的共變 \psi_{01},其符號甚至可能隨編碼而反轉:以基線為原點時「起點高者變化較慢」的負相關,換一個原點可能變為正相關。忽略此點而對 \psi_{01} 作實質詮釋,是縱貫研究中常見的錯誤。
非線性成長
線性軌跡在許多發展歷程中並不成立:學習有加速與高原、生理有飽和、症狀有起伏。成長模型可透過多種方式容納非線性,主要策略摘要於表 29.1。多項式成長在模型中加入二次(\lambda_t^2)或三次項因素,以刻畫曲率與轉折,但高次項的係數常難以實質詮釋,且外插行為不穩。潛在基底模型(latent basis,又稱自由負荷模型)僅固定兩個時間分數以確立尺度,其餘 \lambda_t 由資料自由估計,從而讓資料本身決定軌跡的形狀,是 Meredith & Tisak (1990) 傳統的一個優雅特例。分段(piecewise)成長以節點將時間切分為數段,各段設不同斜率,適合刻畫具明確階段轉換的歷程(如介入前後)。參數非線性模型則直接設定指數、logistic 或 Gompertz 等函數形式,其參數(如漸近水準、變化率、轉折點)具明確的實質意義,Grimm et al. (2011) 對發展研究中的非線性成長作了系統的整理。
| 形狀 | 設定方式 | 特徵與限制 |
|---|---|---|
| 線性 | \lambda_t 固定為 0,1,2,\dots | 固定變化率;最簡但常過簡 |
| 多項式 | 加入二次、三次項因素 | 可捕捉曲率;高次項難詮釋 |
| 潛在基底 | 部分 \lambda_t 自由估計 | 由資料估形狀;詮釋較彈性 |
| 分段 | 以節點分段設斜率 | 刻畫階段轉換;需先驗節點 |
| 參數非線性 | 指數/logistic/Gompertz | 參數具實質義;估計較難 |
註 潛在基底模型須固定至少兩個 \lambda_t(通常首末兩點)以辨識尺度。參數非線性模型在 SEM 框架下常需非線性約束或以多層次框架估計。
條件模型:預測軌跡的個體差異
無條件模型確立了軌跡的個體差異之後,自然的下一步是解釋這些差異。將時間不變的共變項(time-invariant covariate,如性別、介入組別、基線特質)納入模型預測截距與斜率因素,即得到條件成長模型:這些共變項對斜率因素的效果,回答了「哪些因素預測了變化的快慢」這一發展研究的核心問題。當共變項本身隨時間變動時(time-varying covariate),則於各時點直接預測該時點的觀測值,用以刻畫同時發生的波動如何伴隨結果變動。條件模型使成長曲線從單純的描述工具,提升為檢驗變化之預測因子的推論工具,這正是 Willett & Sayer (1994) 所強調的分析力量所在。
誤差結構
成長模型對第一層殘差 \boldsymbol{\Theta} 的設定,是一個常被忽略卻影響結論的選擇。最簡設定為同質且不相關的殘差(\boldsymbol{\Theta} = \sigma^2\mathbf{I}),但此假設在縱貫資料中常不成立:測量誤差的變異可能隨時間改變(異質變異),相鄰時點的殘差也可能相關(自我相關)。SEM 框架容許彈性地設定 \boldsymbol{\Theta},如容許時點特定的殘差變異、或設定一階自迴歸的殘差共變結構。誤差結構的設定與成長因素的設定會相互影響:一個被誤設為過度簡化的誤差結構,可能使模型錯誤地以增加成長因素(如虛假的曲率)來吸收殘留的時間相依,因而扭曲對軌跡形狀的推論。誤差結構因而不是可隨意預設的細節,而應與軌跡形狀一併審慎評估。
平行歷程與多變量成長
發展往往非單一歷程的孤立變化,而是多個歷程的協同演變:閱讀與數學能力共同成長、物質使用與憂鬱相互牽動。平行歷程成長模型(parallel process model)同時估計兩個(或多個)結果各自的成長因素,並容許它們的截距與斜率因素彼此相關,藉此刻畫跨領域的關聯:例如「一個領域的起始水準是否預測另一領域的變化速率」,或「兩個歷程的變化速率是否同步」。此設計是研究發展性共變(developmental coupling)與縱貫中介的基礎,Preacher et al. (2010) 的多層次中介框架即可用以正確地分解此類跨歷程效果在不同層次上的傳遞。多變量成長模型因而將成長分析自單一軌跡,擴展為對多個交織歷程之動態關係的刻畫。
成長混合模型與潛在類別成長分析
前述模型皆假定母體共享單一的平均軌跡形狀,個體差異僅為圍繞此形狀的連續變異。然而,母體有時由若干具質性相異軌跡的次群體混合而成,例如某介入對一部分人有效、對另一部分無效,或某症狀有慢性、緩解、惡化等不同的發展類型。成長混合模型(growth mixture model, GMM)將第二十章的類別型潛在變項引入成長框架:容許存在若干未觀測的潛在類別,各類別有其自身的平均軌跡與(可能的)類別內變異。其特例潛在類別成長分析(latent class growth analysis, LCGA),由 Nagin (1999) 發展,將類別內的軌跡變異固定為零,即假定同類別成員共享完全相同的軌跡,是一種更精簡但也更強的設定。Ram & Grimm (2009) 對 GMM 的建模流程與類別詮釋提供了清晰的方法指引。
此類模型的估計與類別數決定,全然承襲第二十章的邏輯:以 EM 或貝氏方法估計、以資訊準則與拔靴概似比檢定判定類別數,並須警覺標籤轉換與局部極大。更重要的是,第二十章關於過度抽取的核心警示在此同樣、甚至更尖銳地成立:Bauer & Curran (2003) 證明,當軌跡的分布為非常態的連續分布時,即使母體並不存在任何真實的軌跡次群體,GMM 仍會抽取出多個看似最適的潛在類別。因此,所謂的「發展軌跡類型」,可能只是模型對連續非常態異質性的一種離散近似,而非真實存在的類型。將 GMM 所得的軌跡類別逕自實在化,是縱貫研究中一個需要高度審慎的推論陷阱,應輔以穩健性檢查、外部效度與理論的節制。
二階成長模型與縱貫測量不變性
前述的成長模型多以單一觀測分數為結果。然而在心理學中,欲研究其變化的往往是需以多重指標測量的潛在構念(如憂鬱、能力)。二階成長模型(second-order growth model,又稱曲線因素模型)將測量模型與成長模型層疊:每一時點先由多個指標界定一個一階潛在構念,該構念的因素分數再進入成長結構。此設計的關鍵優勢,在於將測量誤差自成長歷程中分離,使所建模的變化是構念真值的變化,而非受測量誤差汙染的觀測分數的變化。
但此優勢有一個嚴格的前提,它直接連結第十九章的測量不變性。
在時點 t,測量模型為
其中 \eta_{ti} 為該時點的潛在構念,\boldsymbol{\Lambda}_t、\boldsymbol{\tau}_t 為負荷與截距;成長結構則作用於 \eta_{ti},如 \eta_{ti} = \eta_{0i} + \eta_{1i}\lambda_t + \zeta_{ti}。欲使「\eta_{ti} 隨時間的變化」可被詮釋為「同一構念的真實變化」,必須要求測量參數跨時點相等,即縱貫測量不變性:
(至少達到量尺與截距不變性)。若此不成立,則觀測到的 \eta_{ti} 變化,混淆了構念的真實變化與測量性質隨時間的漂移,二者無從分辨。
此點的重要性怎麼強調都不為過:離開了縱貫測量不變性,「變化」這個概念本身即失去明確意義,因為無法斷定所測到的差異是「同一把尺上刻度的移動」,還是「尺本身變了」。這與第十九章跨群體比較需要不變性的道理完全平行 (Meredith, 1993),只是此處的「群體」換成了「時點」。因此,嚴謹的潛在構念成長分析,理應先檢驗縱貫不變性,再詮釋成長參數。
自迴歸、變化分數與組內組間分離
成長曲線並非建模縱貫資料的唯一方式。自迴歸(autoregressive,又稱 simplex)取向以「後一時點迴歸於前一時點」刻畫時間歷程,其關注的是個體在群體中相對位置的穩定與變動,而非個體的絕對軌跡。成長取向與自迴歸取向長期分立,各自捕捉縱貫變化的不同面向。Bollen & Curran (2004) 提出的自迴歸潛在軌跡模型(autoregressive latent trajectory, ALT),將兩者綜合於單一框架,容許軌跡與時點間自迴歸結構並存,是兩傳統的重要匯流。
自迴歸取向在雙變量情形下的經典實作,是交叉延宕追蹤模型(cross-lagged panel model, CLPM),用以推斷「甲變項是否領先預測乙變項的後續變化」,長期為縱貫因果探索的主力工具。然而 Hamaker et al. (2015) 提出了具轉折意義的批判:傳統 CLPM 將個體間穩定的特質差異與個體內的時間波動混為一談,其交叉延宕係數因而混淆了兩種本質不同的關聯,可能導致關於領先與因果方向的錯誤結論。其提出的隨機截距交叉延宕追蹤模型(random-intercept CLPM, RI-CLPM)於模型中納入一組隨機截距,將穩定的個體間差異分離出來,使交叉延宕係數僅反映個體內的偏離歷程。此一組內與組間的分離,恰與第二十八章的組內組間分離取向同源,也已迅速成為心理學縱貫互鎖關係研究的主流設定。另一具影響力的取向是潛在變化分數模型(latent change score model),由 McArdle 等發展。它不直接建模軌跡的水準,而是將相鄰時點的變化量 \Delta_{ti} = \eta_{ti} - \eta_{(t-1)i} 定義為潛在變項,再對變化量本身建模,例如令變化量取決於前一時點的水準(表徵成比例的成長或趨中)與一個系統性的常數成長成分。此取向能自然地表達「當前水準如何驅動後續變化」這類動態假設,並可延伸為刻畫兩歷程相互驅動的雙變量動態系統。McArdle (2009) 對潛在變化分數與相關的縱貫潛在變項模型作了權威的綜述。這些取向提醒我們,「變化」有多種形式化方式,選擇何者應取決於研究問題所關切的變化究竟是絕對軌跡、相對位置,抑或動態驅動。
邁向密集縱貫資料
前述模型皆以少數幾個測量波次為對象,其旨趣在於長期的發展軌跡。近年隨經驗取樣法(experience sampling)、生態瞬時評估(ecological momentary assessment)與穿戴式感測的普及,出現了另一類資料型態,即密集縱貫資料(intensive longitudinal data):對多位個體在短期內密集地重複測量,每人可達數十至數百個時點。此類資料的旨趣,已從長期的發展軌跡轉向個體內歷程的動態,例如情緒的慣性、變異性以及變項間即時的相互調節。專為此而生的動態結構方程模型(dynamic structural equation model, DSEM),把時間序列的動態、多層次的個體間異質、結構方程的潛在測量與貝氏估計(第三十三章)整合於一體,已成為當代縱貫方法的主戰場。由於此一取向自成體系且發展迅速,本書將密集縱貫資料與動態建模留待第三十章專章深入,本章至此完成對稀疏波次成長軌跡的處理。
時間度量、估計與缺失資料
縱貫建模的一個前置抉擇,是時間度量的選擇:以研究波次、實足年齡、或距某事件的時間為時間軸,會導向不同的成長模型與詮釋,尤其當受測者的年齡與波次不一致(如加速縱貫設計,accelerated longitudinal design)時,度量的選擇直接關係到能否分離年齡效果與世代效果。當各個體的實際測量時點互異(時間非結構化資料)時,多層次框架可自然容納,SEM 框架則須藉由定義變項(definition variable)等技術處理。Singer & Willett (2003) 對時間度量與縱貫設計有詳盡的處理。
估計上,成長模型通常以最大概似進行。此處與第十三章的連結至關重要:只要缺失(含縱貫研究難以避免的流失,attrition)機制為隨機缺失(MAR),以完整資訊最大概似(FIML)估計即可得到無偏估計,無須列刪,這是成長模型相對於傳統方法的重大優勢。當常態假設可疑時,可採穩健最大概似(MLR)校正標準誤與檢定統計量。模型適配的評估,在 SEM 框架下沿用第十五章的適配指標與第十二章的資訊準則,用以比較不同的軌跡形狀與誤差結構設定。Grimm et al. (2017) 與 Duncan et al. (2006) 對成長模型在多層次與 SEM 兩框架下的估計實務提供了完整的參照。
假設、威脅與詮釋
成長曲線模型的效力,建立在若干必須審視的假設之上。首先是軌跡形狀的正確設定:若真實歷程為非線性而模型設為線性,則平均軌跡、變化率變異乃至條件效果皆將偏誤,因此形狀的選擇應有理論或資料的依據,而非預設線性。其次是前述的縱貫測量不變性:離開不變性,潛在構念的「變化」無從與測量漂移區辨。第三是對「真實變化」與「測量誤差」的區辨:二階模型藉多重指標分離測量誤差,是應對此威脅的有力設計,單一分數的成長模型則須留意觀測變化中混雜的誤差成分,以及趨中回歸(regression to the mean)造成的假性變化。
更深一層地,成長模型是描述性的:它刻畫變化的形狀與個體差異,但不當然地解釋變化的成因。將某共變項對斜率的預測效果詮釋為因果,須滿足第三十一章所論的因果推論條件;縱貫設計雖較橫斷設計更接近因果推論的時序前提,卻仍不足以自動保證因果結論。Bollen & Curran (2006) 對潛在曲線模型的假設、設定與詮釋界限有全面而審慎的處理,可為嚴謹應用的參照。
小結
本章對縱貫與成長曲線模型作了自基礎至前沿的鋪陳。核心上,成長模型以少數潛在參數概括個體軌跡,同時估計平均軌跡與變化的個體間差異,並統合了多層次隨機係數與結構方程潛在曲線兩個等價的傳統。形式上,本章詳論了線性模型的動差結構、時間編碼對截距詮釋的決定性影響、非線性與分段設定、條件模型、誤差結構、平行歷程、以及二階成長所要求的縱貫測量不變性。延伸上,本章涵蓋成長混合模型及其過度抽取的風險、自迴歸潛在軌跡、隨機截距交叉延宕與潛在變化分數等替代取向、並預告了密集縱貫資料與動態建模的前沿(留待第三十章),此外論及時間度量、估計與缺失的實務。貫穿全章的核心訊息是:對「變化」的建模承載了比對「水準」更多的假設,唯有形狀設定正確、測量跨時不變、真實變化與誤差得以區辨,所估得的「變化」方為實質而可詮釋的變化。至此,本書對「以稀疏波次描述長期變化」已有完整交代。下一章將轉向另一類迅速興起的縱貫資料,即以經驗取樣與生態瞬時評估所蒐集的密集縱貫資料,並發展動態結構方程等專門刻畫個體內歷程動態的建模工具。