變化的分析游琇婷(Hsiu-Ting Yu)社會科學的縱貫、密集縱貫與動態資料分析

第 28 章

密集縱貫資料的網絡取向

前面幾章把心理變項之間的共變當成一件有待解釋的事,而解釋多半訴諸一個潛在共同原因(latent common cause):這些變項都在測它。網絡(network)取向把這幅圖像整個翻過來。症狀、情緒、行為本身就是一組彼此直接影響的成分(component),於是一個症候群(syndrome)不是某個底層實體的倒影,而是互動所湧現(emergent)的型態,是一個回饋(feedback)結構:它會安頓在某個穩定狀態(stable state)上,也可以被推到另一個狀態去。這個重新框架讓臨床與人格心理學動了起來。它許諾了介入的標的,把共病(comorbidity)說成兩個群集之間的橋接(bridge),也讓逐人的病因學變得自然;而它的核心物件,那個估出來的網絡,是一張生動又好分享的圖像。危險也正在那些圖上。網絡裡的一條連結(edge)是一項條件關聯(conditional association),不是因果路徑;一個中心的節點(node)是一項拓樸(topology)摘要,不是一根被證實的槓桿;而中等樣本估出來的網絡可能複製不出來,一張說服力十足的佈局(layout)卻把這件事遮住了。本章把這套做法的力量與紀律一起教。它先建起高斯圖形模型(Gaussian graphical model)與它的正則化(regularization)估計,再把密集縱貫的網絡三聯圖一一對映到第 25 章的三個矩陣上,讓同一組物件穿上兩套詞彙;接著是本書在此處最具特色的展示:拿一個估出來的網絡對照已知的真相稽核(audit)一遍,看出還原是部分的,不是完美的。複製性(replicability)與中心性(centrality)這兩場爭論,本章當成內容來教;逐人(person-specific)結構則配上它自己的方法。最後以一道主張階梯(claims ladder)收尾,把一項網絡結果能用的語言,固定在支撐它的證據上。

學習目標

讀完本章之後,你應該能夠:(1) 陳述精神病理學的網絡理論,以及「潛在變項與網絡等價(equivalence)」這個問題,並指出哪些證據與它有關;(2) 估計一個正則化的偏相關(partial correlation)網絡,並精確說出一條連結是什麼(一項條件關聯)、不是什麼(一條因果路徑);(3) 估計密集縱貫三聯圖,也就是時間網絡、同時性網絡與個體間網絡,並把每一個對映到第 25 章的矩陣上;(4) 以拔靴法(bootstrap)的連結權重區間與中心性穩定度(centrality stability)係數評估網絡的準確度與穩定度,並誠實報告不穩定的結果;(5) 參照當前的批判文獻解讀中心性,知道強度(strength)是最站得住腳的指標,而一個中心的症狀是假設、不是治療標的;(6) 執行一次逐人的結構搜尋,並區分群體路徑與個人路徑;(7) 以排列檢定(permutation test)比較不同組的網絡,並把網絡結果寫在證據所支持的那一階上。

28.1 網絡這個想法

精神疾患(mental disorder)的網絡理論主張:一個症候群(syndrome)是一組彼此互相增強的成分,不是某個潛在疾病實體(latent disease entity)浮到表面的樣子 (Borsboom, 2017; Borsboom & Cramer, 2013)。潛在變項(latent variable)的說法是,失眠(insomnia)、疲倦與低落心情之所以相關,是因為每一項都由底層的憂鬱造成。網絡的說法是,它們之所以相關,是因為失眠造成疲倦、疲倦惡化心情、低落心情又擾亂睡眠,形成一個會鎖進自我維持(self-sustaining)狀態的回饋迴路(feedback loop)。這個重新框架對研究很有生產力:共病被重新說成連結兩個群集(cluster)的橋接症狀(bridge symptom) (Cramer et al., 2010);連結最多的症狀可能是最有效的介入點(intervention point);逐人的病因學也變得自然,因為症狀在不同的人身上可能接法不同。它還往前接上第 32 章動力系統(dynamical system)的想法:疾患是另一個穩定狀態,而通往它的過程會顯示早期預警訊號(early-warning signal)。圖 28.1 畫出這兩個生成故事。

同一組相關的兩個生成故事。
圖 28.1 同一組相關的兩個生成故事。

註:共同原因模型(左)用一個造成每個症狀的潛在實體解釋症狀之間的相關;網絡模型(右)用症狀之間的直接互動解釋。橫斷資料上兩者在統計上幾乎等價,這個選擇因此有一部分是詮釋性的;密集縱貫資料會約束動態,但沒有把問題定案。

等價問題必須在一開始就正面迎上。橫斷資料上,網絡模型與潛在變項模型可以在統計上幾乎等價,把同一個共變數矩陣(covariance matrix)配適得一樣好,單靠資料就無法在「一個隱藏的共同原因」與「一張直接互動的網」之間裁決 (Marsman et al., 2018; van der Maas et al., 2006)。這不是對網絡的致命反駁,卻是網絡主張的一道邊界:配適良好的網絡是共變結構的一種表徵(representation),不是一個被示範出來的機制(mechanism)。密集縱貫資料有幫助,動態網絡在時間上的先後順序能限制哪些故事還可行,這是單一個快照(snapshot)做不到的;但事情也沒有因此定案,第 25 與第 27 章關於間隔與混淆(confounding)的告誡,一字不改地適用於時間連結。本書的立場是:網絡是強而有力的表徵與假設生成(hypothesis-generating)框架,它的推論主張則必須掙來。本章其餘的部分講的就是怎麼掙。

28.2 估計網絡

主力模型是高斯圖形模型,它的定義性動作是「偏掉(partialling)」。相關網絡在每一對會共變的變項之間都畫一條連結;心理學裡幾乎每樣東西都彼此共變,這樣的網絡於是密實(dense)得不帶訊息。高斯圖形模型改成只在「以其他全部變項為條件之後兩個變項仍有關聯」時才畫連結,那就是一個偏相關:完全經由第三個變項傳導的關聯會消失,留下的是直接的、條件的關聯。圖 28.2 在 symptom_net 上呈現這個對比。相關網絡幾乎把每樣東西都接在一起;偏相關網絡留下的是一副由直接連結構成的稀疏骨架(backbone)。這些偏相關讀自共變數矩陣的反矩陣,也就是精確度矩陣(precision matrix):它非對角線上的零,恰恰就是不存在的那些連結,基礎概念方塊把這一點記了下來。網絡裡的一條連結就只是一項條件關聯,不是因果路徑,陷阱方塊會再回到這裡。

一條連結是什麼:把其他節點偏掉。
圖 28.2 一條連結是什麼:把其他節點偏掉。

註:左:symptom_net 上的相關網絡;間接關聯也被畫成連結,網絡因此密實。右:偏相關網絡(高斯圖形模型);只有條件的、直接的關聯存活下來,網絡因此稀疏。藍色連結為正、紅色為負,粗細編碼偏相關的大小。

樣本(sample)偏相關永遠不會恰好等於零,估計因此需要一個原則來決定哪些小連結是真的,而標準答案是正則化。圖形 lasso(graphical lasso),以及這裡採用的逐節點迴歸(nodewise regression)取向,把小的偏相關收縮(shrink)到恰好為零,產生一個稀疏(sparse)的網絡;收縮多少由一個調校懲罰(tuning penalty)決定,這個懲罰以最佳化擴充貝氏訊息準則(extended Bayesian information criterion)選出 (Epskamp & Fried, 2018)。圖 28.3 呈現正則化路徑:連結數隨懲罰上升而下降,而準則選出的懲罰在這裡還原到接近真實的連結數。正則化不是免費的。它在偽陽性(false positive)與偽陰性(false negative)之間權衡,而一個被正則化掉的零是「沒有支持這條連結的證據」,不是「有證據說它不存在」;晚近的文獻也一直在辯論什麼時候該改用不正則化、另以明確的模型選擇來做 (Isvoranu & Epskamp, 2023; Williams et al., 2019)。表 28.2 攤開這些估計選擇,軟體註記則提醒這個領域在 2020 年之後變動不小,實際分析時應該確認。

正則化在偽陽性與偽陰性之間權衡。
圖 28.3 正則化在偽陽性與偽陰性之間權衡。

註:留下來的連結數(左)隨懲罰變大而下降;擴充貝氏訊息準則(右)選出一個懲罰,這裡還原到接近真實的十條連結。被正則化掉的零,意思是這條連結沒有被選上,不是已知它不存在。

密集縱貫的情形產生的不是一個網絡,而是三個;把它們各自的矩陣出處分清楚,正是本章的規則。在 affect_ema 上估計一個多層次向量自我迴歸(multilevel VAR),也就是第 25 章一模一樣的模型,會得到三個網絡:時間網絡,它的有向(directed)連結是延宕的交叉效果(cross-effect),也就是轉移矩陣的非對角線;同時性網絡,它的無向(undirected)連結是個體內創新(innovation)的偏相關;個體間網絡,它的連結是個人平均數的偏相關。這正是第 25 章以矩陣估出來的同一批物件,現在換上網絡的衣服,而表 28.1 就是把兩套詞彙對映(mapping)起來的羅塞塔石碑。圖 28.4 呈現這三個網絡,而出處必須說準:圖上的時間網絡與同時性網絡不是多層次配適的產物,而是固定效果的併池 VAR 的產物,也就是對個人平均數置中後的資料所配的那三條迴歸;兩種做法的對應矩陣最大只差 \(0.0035\) 與 \(0.0036\),個體間網絡則完全相同。「每一張網絡圖都必須說出它的矩陣出處」這條規則不是迂腐。讀者若看到一個無向網絡,卻沒被告知它是同時性的還是個體間的,就無從知道它許可的是個體內的主張還是個體間的主張。

密集縱貫三聯圖,每一個網絡都以它的矩陣出處標示。
圖 28.4 密集縱貫三聯圖,每一個網絡都以它的矩陣出處標示。

註:affect_ema 上的一個向量自我迴歸:時間網絡(有向的延宕交叉效果,也就是轉移矩陣的非對角線)、同時性網絡(創新的偏相關),以及個體間網絡(個人平均數的偏相關)。前兩張取自固定效果的併池 VAR,也就是對個人平均數置中後的資料所配的迴歸,與多層次配適的對應矩陣最大差 \(0.0035\) 與 \(0.0036\);個體間網絡兩種做法相同。這三張就是第 25 章那三個矩陣的網絡形貌;每一張網絡圖都必須說出它的矩陣出處。

表 28.1 網絡物件與它們在第 25 章的矩陣(羅塞塔對照)。

網絡(本章)矩陣(第 25 章)連結的意義
時間網絡轉移矩陣 \(\boldsymbol{\Phi}\) 的非對角線有向的延宕交叉效果(已偏掉其他)
同時性網絡創新的精確度矩陣同一時點的條件關聯
個體間網絡個人平均數的精確度矩陣個體間的條件關聯
橫斷的 GGM資料本身的精確度矩陣單一時點上的條件關聯

註:同一組物件,兩套詞彙。網絡是精確度矩陣或轉移矩陣的一種呈現方式;它的連結原封不動地繼承生成它的那個矩陣的意義與告誡,包括時間連結的間隔依賴(第 27 章)。

基礎概念 • 偏相關、精確度矩陣與 EBIC

共變數為 \(\boldsymbol{\Sigma}\) 的多變量常態資料,精確度矩陣是 \(\mathbf{K} = \boldsymbol{\Sigma}^{-1}\);變項 \(i\) 與 \(j\) 控制其餘全部之後的偏相關是 \(\rho_{ij\cdot} = -k_{ij}/\sqrt{k_{ii}k_{jj}}\)。高斯圖形模型就是 \(\mathbf{K}\) 非對角線上非零元素的型態:某一格是零,代表給定其餘變項之後 \(i\) 與 \(j\) 條件獨立(conditionally independent),也就是沒有連結。以圖形 lasso 估計,是最大化被 \(\lambda \sum_{i\neq j}|k_{ij}|\) 懲罰過的高斯對數概似(log-likelihood),小的元素會被收縮到恰好為零;逐節點迴歸則以 lasso 把每個變項對其餘變項作迴歸,一條連結在兩個方向都存活才保留,得到同樣的稀疏。懲罰 \(\lambda\) 以最小化擴充貝氏訊息準則選出,\(\mathrm{EBIC} = -2\ell + E\log n + 4\gamma E \log p\),其中 \(\ell\) 是對數概似、\(E\) 是連結數、\(p\) 是節點數,\(\gamma\) 是超參數(hyperparameter)(常取 \(0.5\))。\(\gamma\) 對密度額外加罰,讓這個準則在心理學常見的「節點多、\(n\) 中等」情境下偏保守。

這套估計由本章最具特色的展示來背書:真值稽核。symptom_net 由一個已知的稀疏網絡生成,估計值因此可以對照真相計分(score),圖 28.5 正是這麼做。估出來的網絡還原了全部十條真實連結,敏感度(sensitivity)為 \(1.00\),特異度(specificity)為 \(0.94\),另有一條偽陽性的連結;估出來的連結權重與真實權重的相關是 \(0.95\)。這個訊息很精確,而且既不是凱旋也不是失敗:在現實的樣本數下,正則化估計式把真實結構還原得好但不完美,抓到了每一條真實連結,也納進一條假的。發表出來的網絡因此該讀成「一個結構的良好但不完美的估計值」,不是那個結構本身。這份誠實是那份生動的代價。下面的程式碼把整套估計與稽核都寫了出來。

真值稽核:還原一個已知的網絡。
圖 28.5 真值稽核:還原一個已知的網絡。

註:由已知稀疏結構生成的網絡(symptom_net,\(N=350\)),以正則化的高斯圖形模型估計。十條真實連結全數還原(敏感度 \(1.00\)),特異度 \(0.94\),權重相關 \(0.95\)。還原得好,但不完美:這是任何一個估出來的網絡該有的誠實讀法。

# 估計一個正則化的 GGM,並對照已知真相稽核它
sn <- readRDS("Examples/data/symptom_net.rds"); tr <- attr(sn, "truth")
X  <- as.matrix(sn[sn$group == 1, tr$nodes])
pcor <- function(X){ P <- -cov2cor(solve(cov(X))); diag(P) <- 0; P }   # 偏相關
reg  <- regularized_ggm(X)          # 逐節點 lasso(glmnet)+ EBIC 選取(ch28_analysis)
# 稽核:我們把哪些真實連結還原出來了?
ut <- upper.tri(tr$pcor)
sensitivity <- sum((reg$W != 0)[ut] &  (tr$pcor != 0)[ut]) / sum((tr$pcor != 0)[ut])  # 1.00
specificity <- sum((reg$W == 0)[ut] &  (tr$pcor == 0)[ut]) / sum((tr$pcor == 0)[ut])  # 0.94
cor(reg$W[ut], tr$pcor[ut])          # 0.95:估出來的連結權重對照真值

表 28.2 網絡估計的各項選擇。

選擇選項使用指引
連結的定義相關對偏相關用偏相關(GGM);相關會把間接的連接也接進來
稀疏性正則化(glasso/EBIC)對不正則化加模型搜尋正則化是預設;不正則化的替代方案仍在辯論(請確認當前建議)
密集縱貫的結構逐節點(mlVAR)對聯合(graphicalVAR、DSEM)逐節點快;聯合則尊重完整的概似
隨機效果正交對相關相關比較貼近現實但代價較高;第 25 章的告誡適用
節點集合全部題目對已修剪多餘者先修剪掉幾乎重複的節點(第 28.4 節)

註:估計方面的文獻在 2020 年之後變動很大,尤其是「正則化對不正則化」這場辯論,實際分析時請確認。無論選了哪一種,都要報告出來;賭注高的時候,還要以模擬對照稽核。

28.3 穩定度、準確度與複製性

只估過一次的網絡是一個點估計值(point estimate),它的連結與中心性摘要都帶著不確定性,而單獨一張佈局(layout)把那份不確定性藏了起來。準確度與穩定度工具組就是要讓它看得見 (Epskamp et al., 2018a)。圖 28.6 呈現兩項輸出。無母數(nonparametric)拔靴法重抽(resample)人再重估一次,為每一個連結權重產生一個信賴區間(confidence interval);區間跨過零的連結,就不能可靠地與「不存在」區分開來。逐次丟個案(case-dropping)的拔靴法在越來越小的子樣本上重估,追蹤中心性的排序保留得多好,並摘要成一個中心性穩定度係數:在大多數子樣本中,強度排序與全樣本排序的相關仍高於 \(0.7\) 的前提下,最多可以丟掉多少比例的個案。這裡的係數是 \(0.45\),中等,代表那個排序並不牢靠。門檻的慣例列在表 28.3。

穩定度與準確度必須報告,不能假定。
圖 28.6 穩定度與準確度必須報告,不能假定。

註:左:拔靴法的連結權重信賴區間;區間跨過零的連結並不穩定。右:逐次丟個案的中心性穩定度曲線,係數標示出「丟掉多少個案之後強度排序就開始瓦解」(這裡是 \(0.45\))。這些診斷是必要的,不是選配的。

心理學網絡的複製性成了一場公開的爭論,本章把它當成內容來教。批評方主張,同一個母體(population)的不同樣本估出來的症狀網絡可能差別很大,因而使人懷疑它們的可靠性 (Forbes et al., 2017);回應方則主張那些用來比較的指標本身有瑕疵,網絡複製得比批評所暗示的更好 (Borsboom et al., 2017)。這個領域後來的解決是:不同面向複製的程度不同。強連結(strong edge)存不存在,複製得好;確切的連結權重差一些;中心性的排序最差,尤其是「最中心的那一個節點是誰」。圖 28.7 在同一個樣本隨機切成的兩半上示範了這一點:連結權重的相關是 \(0.60\)、強度排序的相關是 \(0.78\),都還可以,最中心的那一個節點在兩半之間卻是不同的症狀。這兩個數字都是一次隨機切分的結果:把同樣的切分重複 \(500\) 次,強度排序相關的平均是 \(0.516\)、\(95\%\) 的範圍由 \(0.095\) 到 \(0.893\),一次切分等於在這個範圍裡抽一個點。實務上的教訓是報告複製得出來的東西,也就是強連結與粗結構,並抵抗「拿最中心的節點來說故事」的誘惑,因為那個節點恰恰是整份估計中最不穩定的特徵。陷阱方塊把網絡分析過度推銷的各種方式收在一起。

複製性:同一個樣本的兩半,兩個網絡。
圖 28.7 複製性:同一個樣本的兩半,兩個網絡。

註:在 symptom_net 隨機切成的兩半上估出來的網絡。連結權重的相關是 \(0.60\)、強度排序的相關是 \(0.78\),最中心的那一個節點在兩半之間卻不同;三者都是一次隨機切分的結果,重複切分的範圍見正文。強連結與粗結構複製得出來;最中心的那個節點往往複製不出來。

表 28.3 穩定度指標與它們的門檻。

指標它評估什麼經驗法則
拔靴法的連結信賴區間連結權重的不確定性區間跨過零:這條連結不可靠
連結權重差異檢定兩條連結是否不同大幅重疊:不要把連結排名次
中心性穩定度(CS)中心性排序被保留的程度偏好 \(>0.5\),最低 \(>0.25\)
中心性差異檢定兩個節點的中心性是否不同通常檢定力不足;解讀要謹慎

註:CS 係數是「在 \(95\%\) 的子樣本中,排序與全樣本排序的相關仍高於 \(0.7\)」的前提下,最多可丟掉的個案比例。低於 \(0.25\) 就代表中心性根本不該解讀。

常見陷阱 • 網絡分析過度推銷的四種方式

第一,把一條連結讀成因果效果。連結是條件關聯,要把它變成一支因果箭號,需要「沒有未測量的混淆變項」與「因果方向正確」這些假設,而估計式不提供這些假設,設計通常也撐不起來。第二,靠肉眼比對兩張佈局來比較兩個網絡。佈局演算法以力導向(force-directed)的捷思(heuristic)擺放節點,資料上極小的改變就可能讓節點大幅移動,於是權重幾乎相同的兩個網絡可以看起來不一樣、權重不同的兩個網絡可以看起來一樣;要比的是權重矩陣,不是圖。第三,由中心性推出臨床主張,斷言最中心的症狀就是治療標的。這項推論需要連結是因果的,需要那個中心節點具有可介入性(intervenability),也需要沒有混淆,而那個中心節點往往正是整份估計中最不穩定的特徵。第四,把一個被正則化掉的零讀成「不存在的證據」。它只代表證據不足以克服懲罰,所以一條缺席的連結並不是一項被示範出來的條件獨立。

28.4 中心性及其不滿

中心性指標依節點在網絡中的位置替它們排名,而心理學對它們的使用已經跑到正當性之前。最站得住腳的指標是強度(strength),也就是一個節點連結權重絕對值的總和,那是一項透明的摘要,說的是這個節點被連得多強。從社會網絡分析(social-network analysis)引進來、以流動(flow)為基礎的那些指標,中介中心性(betweenness)與接近中心性(closeness),都假設有某種東西沿著網絡中的最短路徑(shortest path)行進,而這個假設對偏相關網絡沒有清楚的意義,批判文獻也指出它在心理學應用上並不可靠 (Bringmann et al., 2019)。即使是強度,少了進一步的假設也不等於任何因果意義下的重要性 (Dablander & Hinne, 2019);它還容易受一項特定的假象影響,圖 28.8 就示範了那項假象。兩個節點幾乎重複,也就是兩個測到幾乎同一件事的多餘題目,會各自把對方的中心性膨脹起來,因為它們共有的變異數被算成了連接。加進一個症狀的近似複本,那個症狀的強度就由 \(0.93\) 提高到 \(1.45\),兩個雙胞胎都看起來很中心;那是多餘性(redundancy)造成的拓樸假象(artifact),不是實質發現。那個 \(1.45\) 是一次抽樣:複本的誤差項隨機抽取,膨脹後的強度因此本身就是一個隨機量,重複 \(500\) 次的平均是 \(1.389\)、\(95\%\) 的範圍由 \(1.213\) 到 \(1.581\),重現時落在這個範圍裡就是對的。補救的方法是在估計之前先修剪(prune)掉多餘的節點,實作方塊給出檢查步驟。表 28.4 把這些指標各自框回它們站得住腳的用途。

加一個多餘的節點就把中心性膨脹了。
圖 28.8 加一個多餘的節點就把中心性膨脹了。

註:把「無用」這個症狀的一個近似複本(與它的相關為 \(0.95\))加進 symptom_net。它的強度由 \(0.93\) 跳到 \(1.45\),兩個雙胞胎現在都顯得很中心;膨脹後的強度是一個隨機量,\(500\) 次重複的 \(95\%\) 範圍由 \(1.213\) 到 \(1.581\)。多餘的節點會製造中心性;解讀之前先把它們修掉。

表 28.4 中心性指標:定義、假設與地位。

指標定義在心理學網絡中的地位
強度連結權重絕對值的總和最站得住腳的一個;仍然不是因果上的重要性;會被多餘性膨脹
期望影響力帶正負號的連結權重總和當連結正負號混雜時,優於強度
中介中心性通過一個節點的最短路徑「沿最短路徑流動」這個假設站不住;不穩定
接近中心性到其他節點總距離的倒數同樣的流動假設;很少站得住腳
橋接強度跨越社群(community)的連接對共病問題有用,但帶著同樣的告誡

註:請報告強度或期望影響力,先修剪掉多餘的節點,並以懷疑的態度看待中介中心性與接近中心性。少了網絡本身提供不了的因果論證,沒有任何一個中心性指標能確立一個治療標的。

「最中心的症狀就是最好的介入點」,這項臨床上的期望值得把論證完整陳述一遍,因為它是好假設、壞結論。要從中心性走到治療標的,需要三件事:那些連結是因果的,不只是關聯的;那個中心節點是人真的介入得了的;沒有任何混淆變項同時膨脹它的中心性與它表面上的影響力。這三件事都不從估出來的網絡推得出來。所以一個中心症狀誠實的地位是可檢驗的假設,該用帶有介入的設計去檢驗,不是據以行動的結論。這樣框起來,中心性就是一具正當的假設引擎,是真實的貢獻,前提是那些假設被標明為假設。

28.5 逐人的結構:GIMME

到目前為止的網絡描述的是一個樣本,但第 25 章記錄過的異質性(heterogeneity)意味著,不同的人可能擁有性質上不同的結構,而不只是不同的參數值;結構本身就是問題時,就需要另一種方法。群體疊代多模型估計(group iterative multiple model estimation, GIMME)會在偵測跨樣本共有路徑的同時,找出逐人的有向網絡 (Beltz & Gates, 2017; Gates & Molenaar, 2012)。它的邏輯是一次搜尋(search):以「加進最能改善配適的延宕與同時有向連結」的方式蓋起每個人的網絡,而一條連結出現在絕大多數個體身上時,就把它指定為群體層次的。輸出因此把一副共有的骨架與各人的裝飾分了開來,中間還可以有一層次群體(subgroup)。圖 28.9 在一份植入了已知結構的模擬資料上呈現這個想法:所有人共有的那條群體路徑,這裡是壓力驅動負向情緒的類比(analogue),在幾乎每個人身上重現,並被正確標為群體層次;只植入在一個次群體裡的路徑,就只出現在那些個體身上,並被正確地留在逐人的層次。它與第 25 章多層次模型與動態結構方程模型的分別正在這裡:那些模型估計的是一個共同結構加上變動的參數,GIMME 則是逐人搜尋結構本身。研究對象是性質上的結構異質性、而不是參數異質性時,它才是那個工具。表 28.5 畫出選擇指引,實作方塊則指出 GIMME 以搜尋為基礎的性格與它對複製的需求。

GIMME 的邏輯:把群體層次的路徑與逐人的路徑分開。
圖 28.9 GIMME 的邏輯:把群體層次的路徑與逐人的路徑分開。

註:在模擬資料中,帶著每一條有向延宕連結的人所占的比例。被植入的群體路徑與 x 的自我迴歸在大多數人身上重現,並被標為群體層次(在虛線門檻之上);只植入在一個次群體裡的路徑,就只出現在那些個體身上。GIMME 搜尋的是結構,不只是它的參數。

表 28.5 在各種逐人動態方法之間作選擇。

方法什麼東西因人而異何時使用
多層次 VAR(第 25 章)參數,結構共有結構是共同的;你要的是平均動態與它們的散布
DSEM(第 25 章)參數,並帶潛在中心化同上,再加上測量與潛在分解
GIMME結構本身(哪些連結存在)性質上的異質性;不同的人有不同的地圖

註:人們共有一個結構、只在程度上不同時,多層次模型與動態結構方程模型才是對的;人們連「哪些連接存在」都不同時,GIMME 的結構搜尋才是那個工具。它給出的個人路徑是需要複製的搜尋結果,不是已確立的因果地圖。

實務要點 • 節點的挑選,以及 GIMME 以搜尋為基礎的性格

估計任何網絡之前,先為多餘性修剪節點集合:兩個幾乎互相改寫的題目會製造一條假的強連結,並互相膨脹中心性,所以請先檢查題目之間的相關與內容重疊,把幾乎重複的併掉或刪掉。也要注意遺漏資料,整列刪除(listwise deletion)可能扭曲一個由偏相關估出來的網絡,而第 6 章那種密集縱貫的遺漏需要有原則的處理。至於 GIMME 的輸出,請以它的方法所要求的謙遜來對待:它以資料驅動的方式在可能的連結上搜尋,一步步蓋出結構,個人層次的路徑因此是「在資料中被發現的假設」,與任何逐步(stepwise)搜尋一樣容易過度配適(overfit),要被讀成一個人的因果架構之前,得先在新資料上複製;群體層次的路徑建立在跨人的多數之上,是輸出中比較可信的那一部分。

28.6 比較網絡與主張階梯

研究問題常常問兩個網絡是否不同:治療前後、不同診斷組之間。誠實的檢定是排列檢定,不是用肉眼比對佈局。網絡比較檢定把組別標籤重新排列,為一個選定的差異統計量(difference statistic)建立虛無分配(null distribution),再把觀察到的差異拿去對照;那個統計量可以是整體連通度(global connectivity)的差、某一條特定連結的差,或整體結構的差 (van Borkulo et al., 2023)。圖 28.10 把它用在 symptom_net 的兩組上,那兩組被生成為恰好只在一條連結上不同。這個檢定正確地找不到整體連通度的差異,排列 \(p\) 為 \(0.33\),同時偵測到被植入的那條連結差異,\(p=0.005\)。這正是對的型態:一項整體統計量會錯過的局部差異。這個檢定在現實的樣本數下檢定力有限,所以一個虛無(null)結果是「等價的薄弱證據」,不是等價的證明。網絡隨時間的比較則往前接上第 32 章的時變(time-varying)網絡。

網絡比較檢定:一項特定的差異是真的嗎?
圖 28.10 網絡比較檢定:一項特定的差異是真的嗎?

註:在 symptom_net 的兩組上作的排列檢定,那兩組被生成為只在一條連結上不同。被植入的連結差異被偵測到了(\(p=0.005\),紅線對照排列虛無分配),整體連通度則沒有差異(\(p=0.33\))。排列檢定能定位出整體摘要會錯過的差異,而在心理學的樣本數下檢定力有限。

本章以「把網絡主張的語言固定在證據上」收尾,因為這片文獻反覆出現的失敗,正是把一個條件關聯結構描述得彷彿它是一個被發現的因果機制。圖 28.11 畫出一道四階的主張階梯。最低的一階是描述:這個網絡呈現的是這個樣本中條件關聯的型態,估計值直接支持(support)這項主張。第二階是條件關聯結構:這些變項在控制其餘之後仍然直接關聯;這項主張加進了偏掉的邏輯,也需要那些穩定度檢查。第三階是預測性動態:在時間網絡中,一個變項較早的狀態預報另一個變項較晚的狀態;這項主張需要縱貫資料,並繼承第 27 章的間隔告誡。最高的一階是因果系統:這些變項以那些連結所描繪的方式互相因果影響;這項主張需要網絡本身提供不了的假設或介入,多數網絡研究並沒有掙到它。表 28.6 把每一階配上一份報告檢核表與一段語言範本,讓一節結果可以寫在它的證據所及的那一階上,而不再更高。這道階梯與第 21 與第 25 章的估計標的(estimand)階梯是對齊的,也就是本章最後的紀律:這套做法很有力,而那些主張必須掙來。

網絡的主張階梯。
圖 28.11 網絡的主張階梯。

註:每一階都是一項比前一階更強、也需要更多東西的主張。估計值直接支持描述;條件關聯結構加上偏掉的邏輯與穩定度;預測性動態加上縱貫資料與第 27 章的間隔告誡;而一項因果系統的主張需要網絡本身提供不了的假設或介入。請寫在證據所及的那一階上。

寫一份網絡分析,就是報告估計、報告穩定度,並把主張寫在它們掙到的那一階上。報告要說明節點集合與任何多餘性的修剪、估計方法與它的調校,以及這個網絡是橫斷的,還是密集縱貫三聯圖中的哪一格、矩陣出處為何。它要呈現準確度與穩定度的診斷,也就是連結權重區間與中心性穩定度係數,並據此節制中心性的主張:報告強度而不是那些流動指標,把中心節點當成假設。若是組間比較,還要給出排列檢定與它的檢定力告誡。全篇都要把語言留在階梯上:連結是條件關聯,時間連結是帶著間隔告誡的預測,因果主張只有在具備當得起它的設計時才作。一段示範的寫法是:「在修剪掉兩個幾乎多餘的題目之後,本研究估計了一個正則化的偏相關網絡(擴充 BIC,\(\gamma=0.5\));最強的幾條連結(無用感與悲傷之間、以及與失樂之間)在拔靴區間下是穩定的,強度的中心性穩定度係數為 \(0.45\),因此中心性只作描述性報告,最中心的那個節點不解讀為治療標的。」

軟體提示 • 網絡的軟體生態

標準的工具鏈是一套 R 生態:qgraph 負責估計與呈現,bootnet 負責準確度與穩定度的工作流程,mlVAR 與 graphicalVAR 負責密集縱貫的三聯圖,psychonetrics 提供一個統一的驗證性框架,gimme 負責逐人的結構搜尋,NetworkComparisonTest 負責組間比較,mgm 負責混合型與時變的網絡。這套生態仍在積極維護,而它的建議,尤其是「正則化對不正則化」的估計建議,在 2020 年之後有所變動,所以當前的指引應該在實際分析時確認,不是從一本教科書上抄下來。本章的分析沒有用到這些套件,因為它們在目前的環境裡裝不起來;改以基礎 R 與 glmnet 作逐節點的正則化估計,另外自己寫偏相關與中心性工具,以及拔靴、排列與結構搜尋的常式,好讓每一個量,真值稽核的還原、穩定度係數、多餘性造成的膨脹,都能對照一個已知的真相檢查。應用工作上,那些套件才是正確的選擇。

表 28.6 網絡的報告檢核表與主張階梯的語言範本。

項目要報告什麼/語言範本
節點集合題目、多餘性的修剪,以及理由
估計方法、正則化與調校,以及矩陣出處(若為密集縱貫)
準確度與穩定度連結權重區間;中心性穩定度係數
中心性強度或期望影響力;當成描述,不當成標的
比較排列檢定,並附檢定力告誡
第一階(描述)「這個網絡呈現這個樣本中條件關聯的型態。」
第二階(結構)「控制其餘變項之後,X 與 Y 仍直接關聯。」
第三階(動態)「較早的 X 預測較晚的 Y」(時間網絡;附間隔告誡)。
第四階(因果)只有在具備當得起它的假設或介入時才作。

註:把結果一節寫在證據所及的那一階上。多數網絡研究有資格站在第一到第三階;因果的第四階需要一個網絡本身提供不了的設計。

本章摘要

網絡取向把心理變項表徵成一個直接互動的成分系統,不是某個潛在共同原因的倒影。這個重新框架對臨床與人格科學有生產力,但它的核心物件,那個估出來的網絡,很容易引來過度的主張。橫斷資料上,網絡與潛在變項兩種說法幾乎等價,所以網絡是共變結構的表徵,不是被示範出來的機制。高斯圖形模型只在「兩個變項以其餘為條件之後仍有關聯」時才畫連結,那就是從精確度矩陣讀出來的偏相關;正則化在一個訊息準則之下把小連結收縮到零,在偽陽性與偽陰性之間權衡。密集縱貫三聯圖,時間網絡、同時性網絡與個體間網絡,就是第 25 章那三個矩陣穿上網絡的衣服,而每一張網絡圖都必須說出它的矩陣出處。真值稽核是本章最具特色的展示:在生成歷程已知的資料上,正則化估計式把真實結構還原得好但不完美,抓到了每一條真實連結,也納進一條假的,所以一個發表出來的網絡是好的估計值,不是真相。準確度與穩定度必須報告:拔靴法的連結區間顯示哪些連結可靠,中心性穩定度係數顯示那個中心性排序有多牢,而在現實資料上它只是中等。複製性因面向而異,強連結與粗結構複製得出來、最中心的那一個節點往往複製不出來,所以中心性只作描述性報告,用強度而不用那些可疑的流動指標,並先修剪多餘節點以免製造出中心性;一個中心的症狀是假設,不是治療標的。性質上的異質性才是問題時,GIMME 搜尋逐人的結構,把共有的路徑與各人的路徑分開;網絡比較檢定則能定位出整體摘要會錯過的組間差異。本章最後的紀律是那道主張階梯:它把一項網絡結果的語言,描述、條件關聯結構、預測性動態、因果系統,固定在支撐它的證據上,好讓這套做法以全力被使用,而那些主張是掙來的。

習題

  1. 28.1 真值稽核。在 symptom_net 上重現圖 28.5 的稽核,確認十條真實連結全數還原、特異度 \(0.94\)、另有一條偽陽性;再沿圖 28.3 的路徑把懲罰調高與調低,說明敏感度與特異度如何互換,以及一個被正則化掉的零為什麼不是「它不存在」的證據。
  2. 28.2 三聯圖的出處。在 affect_ema 上配適一個多層次向量自我迴歸,畫出圖 28.4 的三個網絡,依表 28.1 標出各自的矩陣出處,並依表 28.2 交代逐節點與聯合估計的取捨;接著寫出一段結果,指名其中哪一句是個體內的主張、哪一句是個體間的主張。
  3. 28.3 穩定與複製。在 symptom_net 上算出拔靴法的連結權重區間與逐次丟個案的中心性穩定度係數,依表 28.3 的門檻判定圖 28.6 裡那個 \(0.45\) 該怎麼讀;再依圖 28.7 把樣本隨機切成兩半,說明強連結、連結權重與最中心的那個節點為什麼複製的程度並不相同。
  4. 28.4 中心性的假象。把一個與「無用」相關 \(0.95\) 的近似複本加進 symptom_net,重現圖 28.8 中強度由 \(0.93\) 跳到 \(1.45\) 的膨脹;再依表 28.4 寫一份給臨床同事的備忘錄,說明由中心性走到治療標的還需要哪三件事。
  5. 28.5 階梯稽核。取一篇比較兩組症狀網絡的已發表論文,依表 28.6 逐項稽核它的節點集合、估計、穩定度與比較;若它靠肉眼比對兩張佈局就下結論,就它的疏漏寫出應有的審查意見,說明為什麼要改用圖 28.10 那樣的排列檢定,並把它每一句主張改寫到圖 28.11 上證據撐得住的那一階。
  6. 28.6 逐人的結構。在 affect_ema 上執行一次逐人的結構搜尋,依圖 28.9 的作法把群體層次的路徑與個人層次的路徑分開;再依表 28.5 說明什麼時候該改回第 25 章的多層次向量自我迴歸,以及個人路徑為什麼要先複製,才讀得成一個人的因果地圖。

本章重要名詞中英對照

中文English說明/首次出現處
網絡network節點與連結構成的系統;本章的核心物件(承第 9 章);第 28.1 節
連結edge兩個節點之間的條件關聯;不是因果路徑(承第 9 章);第 28.2 節
高斯圖形模型Gaussian graphical model (GGM)只在偏相關不為零時畫連結的網絡模型;第 28.2 節
精確度矩陣precision matrix共變數矩陣的反矩陣;非對角線的零就是缺席的連結(承第 9 章);第 28.2 節
正則化regularization把小連結收縮到零以得到稀疏網絡(承第 13 章);第 28.2 節
擴充貝氏訊息準則extended Bayesian information criterion (EBIC)選取懲罰的準則;對密度額外加罰;第 28.2 節
三聯圖triptych時間、同時性與個體間三個網絡;即第 25 章的三個矩陣;第 28.2 節
真值稽核truth audit把估出來的網絡對照已知生成結構計分;第 28.2 節
中心性穩定度係數centrality-stability coefficient排序仍與全樣本相關高於 \(0.7\) 時可丟掉的個案比例;第 28.3 節
強度strength連結權重絕對值的總和;最站得住腳的中心性指標;第 28.4 節
橋接強度bridge strength跨越社群的連接;共病問題會用到;第 28.4 節
GIMMEgroup iterative multiple model estimation逐人的有向結構搜尋,並標出群體層次的路徑;第 28.5 節
主張階梯claims ladder把網絡結果的語言固定在證據上的四階;第 28.6 節

參考文獻

Beltz, A. M., & Gates, K. M. (2017). Network mapping with GIMME. Multivariate Behavioral Research, 52(6), 789–804. https://doi.org/10.1080/00273171.2017.1373014

Borsboom, D. (2017). A network theory of mental disorders. World Psychiatry, 16(1), 5–13. https://doi.org/10.1002/wps.20375

Borsboom, D., & Cramer, A. O. J. (2013). Network analysis: An integrative approach to the structure of psychopathology. Annual Review of Clinical Psychology, 9, 91–121. https://doi.org/10.1146/annurev-clinpsy-050212-185608

Borsboom, D., Fried, E. I., Epskamp, S., Waldorp, L. J., van Borkulo, C. D., van der Maas, H. L. J., & Cramer, A. O. J. (2017). False alarm? A comprehensive reanalysis of “Evidence that psychopathology symptom networks have limited replicability” by Forbes, Wright, Markon, and Krueger (2017). Journal of Abnormal Psychology, 126(7), 989–999. https://doi.org/10.1037/abn0000306

Bringmann, L. F., Elmer, T., Epskamp, S., Krause, R. W., Schoch, D., Wichers, M., Wigman, J. T. W., & Snippe, E. (2019). What do centrality measures measure in psychological networks?. Journal of Abnormal Psychology, 128(8), 892–903. https://doi.org/10.1037/abn0000446

Bringmann, L. F., & Eronen, M. I. (2018). Don’t blame the model: Reconsidering the network approach to psychopathology. Psychological Review, 125(4), 606–615. https://doi.org/10.1037/rev0000108

Cramer, A. O. J., Waldorp, L. J., van der Maas, H. L. J., & Borsboom, D. (2010). Comorbidity: A network perspective. Behavioral and Brain Sciences, 33(2–3), 137–150. https://doi.org/10.1017/S0140525X09991567

Dablander, F., & Hinne, M. (2019). Node centrality measures are a poor substitute for causal inference. Scientific Reports, 9, Article 6846. https://doi.org/10.1038/s41598-019-43033-9

Epskamp, S. (2020). Psychometric network models from time-series and panel data. Psychometrika, 85(1), 206–231. https://doi.org/10.1007/s11336-020-09697-3

Epskamp, S., Borsboom, D., & Fried, E. I. (2018a). Estimating psychological networks and their accuracy: A tutorial paper. Behavior Research Methods, 50(1), 195–212. https://doi.org/10.3758/s13428-017-0862-1

Epskamp, S., & Fried, E. I. (2018). A tutorial on regularized partial correlation networks. Psychological Methods, 23(4), 617–634. https://doi.org/10.1037/met0000167

Epskamp, S., Waldorp, L. J., Mõttus, R., & Borsboom, D. (2018b). The Gaussian graphical model in cross-sectional and time-series data. Multivariate Behavioral Research, 53(4), 453–480. https://doi.org/10.1080/00273171.2018.1454823

Forbes, M. K., Wright, A. G. C., Markon, K. E., & Krueger, R. F. (2017). Evidence that psychopathology symptom networks have limited replicability. Journal of Abnormal Psychology, 126(7), 969–988. https://doi.org/10.1037/abn0000276

Fried, E. I., & Cramer, A. O. J. (2017). Moving forward: Challenges and directions for psychopathological network theory and methodology. Perspectives on Psychological Science, 12(6), 999–1020. https://doi.org/10.1177/1745691617705892

Gates, K. M., & Molenaar, P. C. M. (2012). Group search algorithm recovers effective connectivity maps for individuals in homogeneous and heterogeneous samples. NeuroImage, 63(1), 310–319. https://doi.org/10.1016/j.neuroimage.2012.06.026

Haslbeck, J. M. B., & Waldorp, L. J. (2020). mgm: Estimating time-varying mixed graphical models in high-dimensional data. Journal of Statistical Software, 93(8), 1–46. https://doi.org/10.18637/jss.v093.i08

Isvoranu, A.-M., & Epskamp, S. (2023). Which estimation method to choose in network psychometrics? Deriving guidelines for applied researchers. Psychological Methods, 28(4), 925–946. https://doi.org/10.1037/met0000439

Marsman, M., Borsboom, D., Kruis, J., Epskamp, S., van Bork, R., Waldorp, L. J., van der Maas, H. L. J., & Maris, G. (2018). An introduction to network psychometrics: Relating Ising network models to item response theory models. Multivariate Behavioral Research, 53(1), 15–35. https://doi.org/10.1080/00273171.2017.1379379

Robinaugh, D. J., Hoekstra, R. H. A., Toner, E. R., & Borsboom, D. (2020). The network approach to psychopathology: A review of the literature 2008–2018 and an agenda for future research. Psychological Medicine, 50(3), 353–366. https://doi.org/10.1017/S0033291719003404

van Borkulo, C. D., van Bork, R., Boschloo, L., Kossakowski, J. J., Tio, P., Schoevers, R. A., Borsboom, D., & Waldorp, L. J. (2023). Comparing network structures on three aspects: A permutation test. Psychological Methods, 28(6), 1273–1285. https://doi.org/10.1037/met0000476

van der Maas, H. L. J., Dolan, C. V., Grasman, R. P. P. P., Wicherts, J. M., Huizenga, H. M., & Raijmakers, M. E. J. (2006). A dynamical model of general intelligence: The positive manifold of intelligence by mutualism. Psychological Review, 113(4), 842–861. https://doi.org/10.1037/0033-295X.113.4.842

Williams, D. R., Rhemtulla, M., Wysocki, A. C., & Rast, P. (2019). On nonregularized estimation of psychological networks. Multivariate Behavioral Research, 54(5), 719–750. https://doi.org/10.1080/00273171.2019.1575716

引用本章

APA 第 7 版沒有「單一作者專書之章」這個文獻類型:正式的參考文獻指向整本書,章次寫在內文引用裡。若您要讓引用直接連到本章這一頁,再採用下方第二組(依 APA 的網站文件格式)。

引用全書、於內文指明章次(建議)

內文(游琇婷,2026,第 28 章) 或 游琇婷(2026,第 28 章)
參考文獻游琇婷(2026)。《變化的分析:社會科學的縱貫、密集縱貫與動態資料分析》(繁體中文網頁版)。https://hsiutingyu.github.io/LDA-book-zh-V2/

只引用本章這一頁

參考文獻游琇婷(2026)。第 28 章 密集縱貫資料的網絡取向。載於《變化的分析:社會科學的縱貫、密集縱貫與動態資料分析》(繁體中文網頁版)。https://hsiutingyu.github.io/LDA-book-zh-V2/LDA_C_Chapter28.html

英文稿件中引用

APA 第 7 版第 9.38 節:非英文著作保留原文題名,並於方括號內附英文翻譯。

ReferenceYu, H.-T. (2026). 變化的分析:社會科學的縱貫、密集縱貫與動態資料分析 [Analyzing change: Longitudinal, intensive longitudinal, and dynamic data analysis for the social sciences] (Traditional Chinese web edition). https://hsiutingyu.github.io/LDA-book-zh-V2/
In text(Yu, 2026, Chapter 28)