第 33 章
臨床心理與心理健康的應用
前面各章一次一個方法地建起一套工具箱,但工具箱還不等於實作。本章是應用篇的第一章,讓這些方法在真實的臨床問題上一起運作,因為實際研究裡最要緊的決定都是整合(integration)的決定:哪一個分析回答得了這個問題、各分析該用什麼順序推進、它們彼此如何佐證或牴觸,以及整體要怎麼報告,才能讓審查者、主管機關人員與臨床工作者各自讀得懂。三個個案研究撐起整章的論證,每一個都寫成實徵論文的樣子,再附一段隨行的評註,把完成的論文藏起來的推理攤開。第一個個案認真對待一場憂鬱症試驗:先把處理對症狀軌跡(trajectory)的效果模型化,再把那個效果換成臨床工作者在意的緩解(remission)結果,正面處理威脅每一場試驗結論的大量退出(dropout),並讓那項發現接受遺漏資料(missing data)敏感度分析(sensitivity analysis)的檢驗,脆弱的主張因而變成穩健的主張;敏感度分析在這裡不是附錄,是與主要結果同等的正式結果。第二個個案研究密集縱貫資料(intensive longitudinal data)裡的症狀動態,並守住一項這類資料的熱情常常忘記的紀律:同一份資料可以表徵成多層次模型(multilevel model)、動態網絡(dynamic network)與個殊取向(idiographic)的肖像,三者是同一個真相的三面鏡頭,要調和(reconcile),不是三項可以選擇性報告、互相競爭的發現。第三個個案處理最新的臨床活動,也就是透過手機遞送介入(intervention),並把數位心理健康(digital mental health)例行混為一談的三件事分開:以微隨機化(micro-randomization)最佳化介入、以機器學習(machine learning)預測風險、以早期預警訊號(early-warning signal)監測轉變,三者各是不同的估計標的(estimand),證據標準也不同。貫串全章的承諾就是本書一貫的那幾條:先視覺化、先為估計標的命名,永遠作敏感度分析。
學習目標
讀完本章之後,你應該能夠:(1) 把臨床問題翻譯成估計標的,並對應到本書各章的分析;(2) 用有原則的邏輯替同一份資料上的多個分析排序,而不是把所有分析都端出來;(3) 處理臨床縱貫資料的現實,包括依症狀而定的退出、治療師的巢套(nesting)與施測反應性(reactivity);(4) 把遺漏資料的敏感度分析當成臨床證據義務來執行與報告;(5) 調和密集縱貫資料的多種表徵;(6) 把介入最佳化、風險預測與異常監測分成不同的數位心理健康活動;(7) 寫出審查者、主管機關人員與臨床工作者都讀得懂的臨床縱貫結果。
33.1 臨床縱貫研究的地形
關於變化的臨床問題分成少數幾個家族,每個家族都通往本書的某一部分。處理有沒有用、又有多快,問的是症狀軌跡,由第 13、14 與 19 章的成長模型(growth model)回答。對誰有用,問的是異質性(heterogeneity),由第 22 章那些謹慎的混合分配模型(mixture model)與第 31 章的樹(tree)方法處理。誰會復發、又在何時,問的是時機,由第 29 章的存活模型(survival model)回答。症狀在一位病人身上如何互動,問的是動態,由第 25 與 28 章的多層次向量自我迴歸(multilevel vector-autoregression)與網絡方法回答。即將到來的惡化看不看得出來,問的是監測,由第 26 與 32 章的狀態空間(state-space)與非線性方法處理,連同那兩章所有的警戒。至於如何在對的時刻遞送介入,問的是最佳化,由本章要介紹的微隨機化設計回答。圖 33.1 畫出這份對應,表 33.1 再連同估計標的與代表性文獻列成一表。
註:每一個臨床問題的家族都通往本書中回答它的那一部分。這份對應以估計標的為先:由問題決定方法,不是反過來。一項研究多半會問到其中好幾個問題,而把對應的分析整合起來,用有原則的順序推進、加上誠實的調和,正是本章各個案研究的主題。
表 33.1 臨床問題的分類、估計標的與章次。
| 問題 | 估計標的 | 章次(代表文獻) |
|---|---|---|
| 療效軌跡 | 兩組在變化上的差異 | 第 13–14、19 章 (Gueorguieva & Krystal, 2004) |
| 異質性 | 次群體(subgroup)或潛在類別(latent class)的效果 | 第 22、31 章 |
| 復發的時機 | 事件的危險(hazard) | 第 29 章 |
| 病人內的動態 | 延宕(lagged)與同時(contemporaneous)效果 | 第 25、28 章 (Bringmann et al., 2013) |
| 監測 | 穩定性(stability)隨時間的改變 | 第 26、32 章 |
| 遞送的最佳化 | 因果偏離效果 | 第 33 章 (Klasnja et al., 2015) |
註:估計標的這一欄就是紀律所在:臨床問題要先把推論標的命名出來,才回答得了。一項研究多半同時適用好幾列,分析者的工作是把它們排序,讓每一步為下一步提供依據,不是把所有方法都跑一遍再報告最好看的那一個。
臨床縱貫資料有三項現實形塑了接下來的每一個分析。第一,症狀量表(symptom scale)在治療推進的過程中,未必還以同樣的方式測量同一個構念(construct),這叫反應轉移(response shift),第 18 章的恆等性(invariance)方法檢定得了;忽略它,跨時間比較分數的天真做法就站不住。第二,頻繁施測有症狀的病人帶著負擔與反應性,測量排程因此是倫理與估計標的的問題,不只是後勤的問題。第三,病人巢套在治療師與收案場所之下,這個多層次結構不模型化就會膨脹偽陽性率(false-positive rate)。這三項之外,試驗傳統還加上一項心理學仍在吸收的紀律:ICH E9(R1) 增訂本的估計標的架構堅持退出與救援用藥(rescue medication)的處理方式要界定成估計標的本身的一部分,於是處理政策策略(treatment-policy strategy)(不論是否遵從的效果)、假想策略(hypothetical strategy)(若所有病人都遵從時的效果)與治療期間策略(while-on-treatment strategy)回答的是真正不同的問題,不可混為一談。表 33.2 把這些策略翻譯給心理學家看,個案研究 A 則把它們付諸實行。
表 33.2 退出與救援用藥的估計標的策略(ICH E9(R1),翻譯過的版本)。
| 策略 | 它回答的問題 | 退出的處理方式 |
|---|---|---|
| 處理政策 | 被指派的效果,不論是否遵從 | 全部追蹤,包含中止之後 |
| 假想 | 若所有人都遵從時的效果 | 把反事實(counterfactual)模型化(例如 MAR 之下的 FIML) |
| 治療期間 | 在治療期間的效果 | 分析到中止為止 |
| 複合 | 中止本身就是一個不好的結果 | 與結果合併 |
註:這些策略回答不同的臨床問題,也給出不同的估計值;選擇必須先於分析,並且要當成估計標的的一部分報告。隨機遺漏(missing at random)之下的混合模型瞄準的是假想策略;個案研究 A 的敏感度分析則探測一項非隨機遺漏(missing not at random)的偏離要多大,才會移動那個估計。
33.2 個案研究 A:認真對待一場試驗
therapy_rct 資料來自一場兩百四十位病人的隨機試驗(randomized trial),一半指派到主動治療、一半到控制,以 Hamilton 憂鬱量表(Hamilton depression rating scale, HDRS)每週測量,共十二週。分析依一個刻意安排的順序推進,每一步都由前一步推動;表 33.3 是記錄這份推理的決策日誌,也是一篇完成的論文會略去的、可重製推理的展示品。依本書一貫的規則,描述與視覺化排在最前。主要分析是帶隨機截距(random intercept)與隨機斜率(random slope)的症狀軌跡成長模型,估計標的是兩組在變化率上的差異。實驗組改善得比較快,每週比控制組多降半個 HDRS 分(處理乘時間交互作用(interaction)為每週 \(-0.51\) 分),到第十二週時模型隱含的嚴重度在實驗組是 \(8.5\)、在控制組是 \(14.6\),這個差距跨過了中度與輕度憂鬱的分界。次要的廣義線性混合模型(generalized linear mixed model)把連續的軌跡翻譯成臨床工作者會據以行動的結果,也就是緩解,定義為 HDRS 分數低於七;治療之下第十二週緩解的勝算(odds)高出許多倍。圖 33.2 畫出那些軌跡,以及軌跡底下威脅到整個結論的那件事。
註:子圖 (a):therapy_rct 試驗配適出來的成長模型(線)與觀察到的各週平均數(點)。實驗組改善得比較快(處理乘週斜率 \(-0.51\)),到第十二週時模型隱含的 HDRS 分數在實驗組是 \(8.5\)、控制組是 \(14.6\)。子圖 (b):留存率到第十二週降到約五成五,退出又與症狀有關,當下症狀較高的病人比較可能離開。這種量級、這種機制的流失可能讓主要估計產生偏誤,敏感度分析因此不是選配。資料的 week 由 \(0\) 起算,第十二週對應 week = 11;英文版的副標把兩組數字四捨五入成整數,順序又與正文相反,中文版明寫組名並保留一位小數。見 EN-33-03。
那件事就是流失。百分之四十四的病人沒有完成試驗,而退出的離散時間危險模型(discrete-time hazard model)顯示退出與症狀有關:當下症狀較高的病人比較可能離開(\(p < .001\))。以完全訊息最大概似法(full-information maximum likelihood)配適的主要成長模型,要在「給定已觀察軌跡之後退出是隨機遺漏」時才有效,而症狀相關性讓這個條件說得通、卻談不上確定,因為觸發退出的那個值正是沒被觀察到的那一個。這就是第 6 章那份非隨機遺漏的隱憂;臨床證據上的義務是去探測它,不是逕自宣稱它不存在。兩個敏感度分析做了這件事,圖 33.3 呈現它們。臨界點分析先由模型插補(impute)每一位退出者遺漏的分數,再對實驗組的退出者加上固定的若干 HDRS 分作為懲罰,假設離開的實驗組病人處境比模型預測的差;懲罰由零掃到八分,治療的好處逐漸減弱,卻全程維持顯著,要推翻這個結論,就需要一個大到不可信、而且只發生在某一組的隨機遺漏偏離。共享參數的聯合模型同時配適軌跡與退出歷程,讓兩者共用隨機斜率,得到與天真模型相差不到千分之二的估計(\(-0.512\) 對 \(-0.514\)),並發現退出與斜率只有微弱的關聯,直接佐證了隨機遺漏假設。這個量級的差距不宜作方向性的解讀:危險函數要不要含當下的症狀、共用的是隨機斜率還是隨機截距、數值積分怎麼做,任何一項換一個說得通的設定都移動得了第三位小數。撐得起結論的是兩個估計實質相同,不是那千分之一二落在哪一邊。兩個敏感度分析匯聚在一起,而那份匯聚、不是主要估計本身,才是那項穩健的發現。
註:子圖 (a):臨界點分析對實驗組的退出者加上固定的若干 HDRS 分(橫軸)再重新配適;處理乘週的好處逐漸減弱,但即使在八分的懲罰之下仍然顯著,要推翻它就需要一個不可信的非隨機遺漏偏離。子圖 (b):軌跡與退出的共享參數聯合模型得到與天真估計相差不到千分之二的值(\(-0.512\) 對 \(-0.514\)),退出的關聯接近零,佐證了隨機遺漏;兩點的先後不宜解讀,聯合模型設定上的選擇就移動得了第三位小數。兩個分析的匯聚才是那個穩健的結論。英文版子圖 (b) 未設橫軸範圍,ggplot 把軸縮到兩點之間 \(0.0016\) 寬的窗,反而把「兩者實質相同」畫成「兩者位在子圖兩端」;中文版把橫軸固定成涵蓋 \(0\)、與子圖 (a) 同尺度。見 EN-33-04。
最後一步誠實地標明自己是探索性的:平均效果是不是掩蓋了反應者的異質性?一個探索性的成長混合分配模型辨認出兩個潛在的軌跡類別,一群快速反應、一群緩慢反應,但這個分析帶著第 22 章的每一道護欄報告:類別只描述成探索性的假設,個數不當成已經發現的事實,也不因為單一樣本就實體化(reify)成臨床亞型。整個個案的教學重點就在那個排序:描述先於模型、主要先於次要、敏感度是義務,以及把軌跡上的差異翻譯成臨床讀者需要的緩解語言。
表 33.3 個案研究 A:分析排序的決策日誌。
| # | 步驟 | 理由 |
|---|---|---|
| 1 | 視覺化與描述 | 在建模之前先看軌跡與流失(本書的規則) |
| 2 | 主要成長模型 | 處理乘時間的估計標的;事前指定(pre-specified)的問題 |
| 3 | 緩解的 GLMM | 把軌跡翻譯成一個臨床結果 |
| 4 | 退出的危險模型 | 在信任步驟 2 之前先診斷遺漏機制 |
| 5 | 臨界點敏感度 | 量化非隨機遺漏要偏離多少才會推翻結果 |
| 6 | 聯合模型 | 同時模型化退出與軌跡以佐證隨機遺漏 |
| 7 | 探索性混合分配模型 | 探測異質性,帶著護欄且不實體化 |
註:這份日誌是一篇完成的論文會略去的教學產物:它記錄每一個分析為什麼接在前一個之後。步驟 4 到 6 之所以存在,是因為步驟 2 的效度取決於一個檢定不了的假設,而敏感度分析把這份依賴由未言明的風險,轉成有界而且報告得出來的不確定性。
33.3 個案研究 B:症狀動態與個人化的結構
affect_ema 資料追蹤一個樣本作了多天的生態瞬時評估(ecological momentary assessment),臨床興趣落在動態上:一位病人的壓力如何外溢到負向情緒、情緒如何往前帶,以及這些動態在病人之間如何不同。分析由測量與描述開始,因為瞬時題目比問卷量表更有雜訊:多層次信度(reliability)分析顯示瞬時負向情緒有百分之三十六的變異數落在個體間,而第 7 章的動態指標,也就是平均延宕一期自我相關 \(0.37\) 與平均連續差異均方根(RMSSD) \(0.60\),在任何模型加諸之前先描述了序列的節奏與不穩定性(instability)。主要的動態分析是多層次向量自我迴歸,它估計每個變項對自己與其他變項近期過去的依賴,並以隨機效果讓動態因人而異。結果是清楚的壓力到情緒外溢,也就是壓力對負向情緒的延宕效果 \(0.24\),以及情緒的慣性,也就是負向情緒的延續 \(0.31\),兩者都因病人而異。
這個個案研究存在的目的,是要教一項紀律:這些動態有三種表徵,三者是同一個真相透過不同鏡頭看到的樣子,要調和,不要選擇性地報告。多層次模型把效果陳述成帶隨機變異的迴歸係數。同樣那些延宕係數排成一個矩陣,就是時間網絡(temporal network),它的有向連結(directed edge)恰恰就是那些係數,也就是第 28 章的表徵。那些隨機效果則是個別病人個殊取向肖像的原料。圖 33.4 把前兩種鏡頭放在一起,也就是固定效果的時間網絡與逐人外溢的分配,表 33.4 再調和每一種鏡頭各主張了什麼。網絡那張圖必須帶著第 28 章的主張階梯紀律:它的連結是條件關聯(conditional association),不是已證明的機制,而一項中心性(centrality)主張需要那一章所要求的穩定度分析(stability analysis)。調和才是重點。一篇論文若把網絡當成新發現,擺在多層次模型旁邊,彷彿兩者是各自獨立的結果,就是把同一個分析算了兩次;一篇論文若只呈現網絡、只給那幅生動的圖像,就是藏起那些係數所帶的不確定性。
註:子圖 (a):把 affect_ema 的動態畫成多層次向量自我迴歸的延宕固定效果矩陣,也就是時間網絡;一條有向連結是一個延宕係數,是條件關聯,不是已證明的機制。子圖 (b):逐人的壓力對負向情緒外溢,在病人之間圍繞平均數 \(0.24\) 變異,那是單一個平均數會藏起來的隨機動態。網絡與多層次模型是同一個分析的兩種表徵,要調和,不要當成兩項各自的發現報告。英文版此處的直方圖不是估計值,而是以固定效果為平均數、隨機效果標準差為標準差當場抽出的一百二十個常態亂數,腳本又未設亂數種子;中文版改畫那一百二十個人真正的經驗貝氏(empirical Bayes)估計。見 EN-33-01。
個殊取向的分析接著問:關於一位個別病人能說什麼?第 25 章那堂關於合併(pooling)的課,在這裡帶著臨床的賭注回來。圖 33.5 對兩位病人比較兩件事:只用那位病人自己的資料算出來的逐人估計,以及多層次模型指派給那個人的收縮(shrunken)估計。資料充分而一致的病人,兩者相當接近;資料比較有雜訊的病人,兩者明顯分歧,多層次模型把不穩定的個別估計拉向團體。只報告逐人的那個數字,會過度信任一個有雜訊的估計;只報告收縮後的那個數字,會低估真實的個別性。臨床上的轉譯必須跟著小心:一項逐人的動態是關於那位病人的假設,要拿去對照病史與臨床工作者的了解來檢核,不是已經驗證的個體事實。報告它的倫理,也就是病人的隱私、把單一個醒目的係數過度解讀的誘惑,都是分析的一部分,不是事後才想到的。
註:對兩位病人,只用那位病人自己的資料估出來的壓力對負向情緒外溢(逐人),以及多層次模型跨病人借力之後指派的估計(收縮後)。資料一致的病人,兩者幾乎重合;資料比較有雜訊的病人,兩者分歧,多層次模型把不穩定的個別估計正則化(regularize)。逐人的那個數字過度信任一個不精確的估計,收縮後的那個數字則把它正則化了;兩者都不是全部的故事,一項關於個體的臨床主張必須同時承認兩者。英文版此圖的副標把收縮幅度歸因於「資料稀薄」,但被收縮較多的那位病人有 \(42\) 個可用時點、另一位有 \(40\) 個;真正的差別在個別估計的精確度(自身估計的標準誤 \(0.47\) 對 \(0.23\)),中文版的副標與軸標籤據此改寫。見 EN-33-02。
表 33.4 個案研究 B:調和那些表徵。
| 表徵 | 它主張什麼 | 與其他表徵的關係 |
|---|---|---|
| 多層次 VAR | 帶隨機變異的延宕與同時係數 | 估計的引擎 |
| 時間網絡 | 變項之間的有向連結 | 同一組係數,畫出來 |
| 個殊取向模型 | 一位病人自己的動態 | 那些隨機效果,逐人 |
註:這三者不是各自獨立的發現,而是同一個分析的三種呈現;把它們報告成彼此佐證,就是重複計算。網絡承接第 28 章的主張階梯紀律,個殊取向的呈現承接第 25 章的收縮紀律。一個真相、跨鏡頭調和,才是一篇臨床密集縱貫論文該達到的標準。
33.4 個案研究 C:監測、預測與適時介入
數位心理健康透過手機遞送評估與介入,也例行地把三件邏輯上不同的活動混為一談:最佳化介入、預測風險、監測轉變。這個個案研究把三者分開,因為每一件都是不同的估計標的,各有不同的設計與證據標準,如表 33.5 所列。及時調適性介入(just-in-time adaptive intervention)在 Nahum-Shani et al. (2018) 的架構下,於決策時點(decision point)遞送支持,依當事人當下的狀態量身調整,以影響一個近端結果(proximal outcome);圖 33.6 畫出它的架構。它所提的問題,也就是「現在把提示遞送出去會不會改善近端結果、又對誰有效」,是介入最佳化的估計標的,回答它的設計是微隨機化試驗(micro-randomized trial):介入在每一個決策時點都被隨機化,當下的因果效果因而得以識別 (Klasnja et al., 2015)。
註:在每一個決策時點,一個量身調整的變項(當下的狀態)決定要不要遞送介入,介入影響一個近端結果,再回饋到下一個決策時點。在一場微隨機化試驗裡,介入在每一個可用的決策時點都被隨機化,這識別出因果偏離效果(causal excursion effect),也就是遞送提示當下、在隨機化分配上平均之後的效果,以及那個變項對它的調節。
mrt_ema 資料是一個微隨機化的延伸:一則簡短的因應提示在每一個可用的決策時點被隨機化,近端結果是不久之後的負向情緒。因果偏離效果以加權且中心化的迴歸(weighted-and-centered regression)估計,這個做法對控制模型的設定錯誤(misspecification)穩健 (Boruvka et al., 2018),而它還原出植入的效果:提示在最早遞送時把近端負向情緒降低約半分,好處隨著當事人習慣化(habituation)而在研究期間逐漸消退,當事人有壓力時作用又比較強。圖 33.7 畫出偏離效果隨時間的變化。那份消退本身就是臨床上可據以行動的發現:效果會衰減的介入應該加以變化或拉開間隔,不是原樣重複。這是最佳化,不是預測,估計標的是一項行動的效果,證據是一次隨機化的對比。
註:在 mrt_ema 微隨機化試驗中,因應提示對近端負向情緒的估計因果偏離效果,依研究日呈現,虛線為植入的真值。提示的近端好處在最早遞送時最大(約 \(-0.46\)),隨著當事人習慣化而在研究期間逐漸消退。那份消退才是可據以行動的結果:當下效果會衰減的介入應該拉開間隔或加以變化,而這是只有微隨機化試驗才支持得了的設計結論。
預測是另一件活動,帶著另一個估計標的,也就是未來某個狀態的機率,由第 31 章的紀律管著。一個預報瞬時負向情緒的風險旗標(risk flag)模型,以依人分組交叉驗證(person-grouped cross-validation)評估,並對照持續性(persistence)基準來衡量,以一個真實但有界的幅度勝過那個基準(交叉驗證的決定係數 \(0.49\) 對基準的 \(0.26\));要檢查的不只是它的區辨(discrimination),還有它的校準(calibration),如圖 33.8 所示。監測是第三件活動,也就是偵測一次逼近中的轉變,而第 32 章的早期預警判斷原封不動地適用:一位病人資料流上的一個上升指標是監測假設,不是經過驗證的警報,而基本率(base rate)與分析者自由度(analyst degrees of freedom)的警戒在這裡一樣有拘束力。教學重點就是這份區分本身:一項數位心理健康研究若把預測模型報告得彷彿它最佳化了介入,或把早期預警訊號報告得彷彿它預測了風險,就是把需要三種設計的三個問題混為一談。
註:子圖 (a):一個預報瞬時負向情緒的模型在依人分組交叉驗證下的校準,橫軸是分箱後的預測值、縱軸是觀察值;點靠近對角線表示校準良好。子圖 (b):模型交叉驗證的決定係數(\(0.49\))對持續性基準(\(0.26\)),也就是那份誠實的幅度。預測要由「相對於基準的樣本外技巧」與校準來評判,不是由樣本內的配適;它與圖 33.7 的介入最佳化是不同的活動。
表 33.5 三種數位心理健康活動的區分。
| 活動 | 估計標的 | 設計 | 證據 |
|---|---|---|---|
| 最佳化 | 因果偏離效果 | 微隨機化試驗 | 隨機化的對比 |
| 預測 | 未來某個狀態的機率 | 觀察性世代(observational cohort) | 分組交叉驗證對基準 |
| 監測 | 穩定性的改變 | 密集時間序列 | 經替代序列(surrogate)檢定的趨勢 |
註:這三種活動在數位心理健康裡例行被混為一談,但它們以不同的設計與標準回答不同的問題:最佳化需要隨機化,預測需要誠實的樣本外評估,監測需要替代序列推論與對基本率的謙遜。一項研究應該說清楚自己在做哪一種,並且達到那一種的標準。
33.5 領域綜合
三個個案研究共用一根脊椎,把它命名出來就是本章的綜合。每一個都先視覺化才建模、先為估計標的命名才選方法,並且把敏感度分析當成理所當然,不是被要求時才做的事。每一個也各自執行一份與自己的方法相稱的主張紀律:試驗以遺漏資料的敏感度為結論設界,動態研究調和自己的表徵、不把它們乘起來,數位健康研究把最佳化、預測與監測分開。圖 33.9 畫出臨床主張階梯,把一項縱貫結果所賺得的語言釘在支持它的證據上;表 33.6 則是臨床期刊應該期待的報告檢核表(reporting checklist)。臨床縱貫工作最常見的審查者質疑,也就是拿平均效果去斷定一項處理對一個個體做了什麼、把更頻繁的測量假定為更多的臨床真相、把一張網絡圖讀成機制、把一項預報吹過頭,都各有一份個案研究示範過的紀律回答得了。各個領域文獻各自添上自己的紋理:憂鬱與焦慮的生態瞬時評估傳統 (aan het Rot et al., 2012; Hamaker & Wichers, 2017)、精神病的經驗取樣(experience sampling)研究 (Myin-Germeys et al., 2018; Myin-Germeys et al., 2009)、邊緣型人格疾患(borderline personality disorder)的不穩定性文獻 (Ebner-Priemer & Trull, 2009; Trull et al., 2008)、個殊取向網絡的範例 (Epskamp et al., 2018; Fisher et al., 2017);但那根分析的脊椎是共通的,而它正是本書一路建過來的那一根。
註:一項臨床縱貫結果所賺得的語言,釘在支持它的證據上。描述與關聯多數設計都給得起;穩健的、或設計上是因果的主張,需要隨機化,或一份為遺漏資料威脅設界的敏感度分析;個體層次或機制性的主張,需要個殊取向的驗證或一次實驗操弄。寫在證據所及的那一階、不再往上,就是三個個案研究共有的紀律。
表 33.6 臨床縱貫研究的報告檢核表。
| 項目 | 該報告什麼 |
|---|---|
| 估計標的 | 推論的標的,包含退出的處理策略 |
| 視覺化 | 在任何模型之前先呈現軌跡與流失 |
| 主要分析 | 事前指定的模型與它的組別/效果估計標的 |
| 遺漏 | 診斷出來的機制與敏感度分析 |
| 異質性 | 探索性次群體標明為探索性,且不實體化 |
| 表徵 | 對動態而言,模型、網絡與個殊取向三者的調和 |
| 主張 | 寫在證據所及的那一階 |
註:這份檢核表把本章的脊椎操作化。相對於本書一般的報告標準,它有三項臨床特有的增補:估計標的中退出的處理策略、把敏感度分析列為必要而非選配,以及在密集縱貫資料容易招來選擇性報告之處,要求多種表徵的調和。
常見陷阱 • 四種臨床上的越界
只分析完成者。 只分析完成試驗的病人,等於丟掉承載偏誤的那份流失;請在一個命名過的估計標的之下使用全部隨機化的病人,並探測遺漏。被實體化的反應者類別。 探索性混合分配模型的類別是假設,不是被發現的亞型;不要靠單一樣本就在它們之上建立臨床決策。把網絡當成機制。 症狀網絡的連結是條件關聯;把它們讀成因果槓桿的臨床論文,已經爬過了證據撐得住的那一階。預報的過度推銷。 預測模型要以撐得過分組交叉驗證的幅度勝過持續性基準,而且要有校準;樣本內的準確度不等於臨床上可用。
實務要點 • 與試驗統計師合作,以及安全監測
臨床工作裡有兩件實務事項反覆出現。第一,與試驗統計師的合作,靠一套共同的詞彙就順暢得多:估計標的架構、假想策略與處理政策策略的區分,以及敏感度分析的語言,就是那座橋;把本書的成長模型與聯合模型做法帶進那場對話的心理學家,是對等的合作者,不是請託者。第二,對有症狀的病人作高頻施測,要求一套安全監測方案(safety-monitoring protocol):可能浮現急性風險的瞬時題目,也就是自傷(self-harm)或自殺風險(suicidality),需要一條事前指定的回應路徑(response pathway),即時檢視或轉介升級;那條路徑要在資料蒐集之前就設計好,並寫進方法一節,因為偵測得到危機卻對它毫無作為的施測,在倫理上並不中立。
實務要點 • 倫理:當下的風險資料與逐人的結果
臨床密集縱貫資料帶來一些分析無法外包的倫理義務。瞬時的自殺風險或自傷題目產生的資料,它的處理、儲存、取用與回應路徑都必須事前界定,因為蒐集這種資料就創造出一份不會隨研究結束而終止的照護責任。逐人的結果自帶風險:一位病人的個殊取向模型,在團體估計所不會的意義上,是可以指認出當事人身分的;報告一個醒目的個別係數,不論是在論文裡還是回饋給病人,都同時冒著隱私外洩與過度解讀的風險,而估計值的不確定性撐不起那份過度解讀。紀律是把逐人的發現當成臨床假設,用與其他假設同樣的驗證標準要求它,並且像分析保護自己的推論那樣仔細地保護病人的資料與隱私。
本章摘要
應用篇的第一章讓本書的方法在臨床問題上一起運作,而在那裡最要緊的決定是整合、排序、調和與報告的決定。臨床問題依估計標的導向不同的方法:療效軌跡到成長模型、復發到存活分析、動態到多層次向量自我迴歸與網絡、遞送到微隨機化試驗。症狀測量、反應性、巢套與退出這些現實形塑了每一個分析,試驗傳統則再加上估計標的架構,其中退出的處理方式本身就是估計標的的一部分。個案研究 A 認真對待一場憂鬱症試驗:成長模型估計處理乘時間的好處,混合模型把它翻譯成緩解,危險模型診斷出依症狀而定的退出;兩個敏感度分析,也就是治療好處撐得過去的臨界點懲罰,與重現天真估計的聯合模型,匯聚起來使那項發現變得穩健。敏感度分析在這裡是與主要結果同等的正式結果,不是附錄,而反應者的異質性只標記成帶護欄的探索。個案研究 B 研究症狀動態,堅持多層次模型、時間網絡與個殊取向肖像是同一個真相的三面鏡頭,要調和,不要選擇性報告;網絡受主張階梯紀律約束,個殊取向的估計則與它們收縮後的對應值並列呈現,好讓有雜訊的個別數字與被正則化的數字,都不會被誤認成全部的故事。個案研究 C 把數位心理健康混為一談的三件活動分開:微隨機化試驗估計一則提示的因果偏離效果,並發現它隨習慣化而消退;預測模型以分組交叉驗證與校準,對照持續性基準受評判;早期預警的監測則承接第 32 章對單一個案的清醒。三者各是不同的估計標的,各需要不同的設計。三個個案研究共用一根脊椎:先視覺化、先為估計標的命名、永遠作敏感度分析,加上一道把每一項臨床結論寫在證據所賺得的那一階的主張階梯,以及臨床資料加諸分析者的那些倫理義務,也就是安全監測與逐人結果的隱私。
習題
- 33.1 敏感度即結果。先由
therapy_rct重現圖 33.2 的留存曲線與依症狀而定的退出,再重現圖 33.3 的臨界點掃描與共享參數聯合模型;說明為什麼是這兩者的匯聚、而不是主要估計本身,才構成那項穩健的發現。 - 33.2 由軌跡到緩解。依表 33.3 的步驟 2 與步驟 3,在
therapy_rct上配適帶隨機截距與隨機斜率的成長模型,再以緩解為結果配適次要的廣義線性混合模型,並寫出一段同時報告處理乘時間係數與第十二週緩解勝算的結果段落。 - 33.3 估計標的的分岔。依表 33.2 對照處理政策策略與假想策略,指出以完全訊息最大概似法配適的主要成長模型實際瞄準的是哪一個,並寫一份給試驗統計師的備忘錄,講清楚這個選擇為什麼必須先於分析。
- 33.4 表徵的調和。在
affect_ema上配適多層次向量自我迴歸,把延宕固定效果畫成圖 33.4 的時間網絡,依表 33.4 寫出三種表徵的調和;再照圖 33.5 對兩位病人比較逐人與收縮後的外溢估計,指名各自的標準誤。 - 33.5 檢核表稽核。取一篇已發表的臨床密集縱貫論文,依表 33.6 逐項稽核,特別看它有沒有命名退出的處理策略、有沒有把敏感度分析當成結果;再依圖 33.9 判定它的結論寫在第幾階,並寫出應有的審查意見。
- 33.6 三種活動分開。在
mrt_ema上以加權且中心化的迴歸估計因果偏離效果,重現圖 33.7 那份隨習慣化而來的消退;接著依表 33.5 說明第 33.4 節為什麼把它與第 31 章的風險預測、第 32 章的早期預警當成三個不同的估計標的。
本章重要名詞中英對照
| 中文 | English | 說明/首次出現處 |
|---|---|---|
| 估計標的架構 | estimand framework | ICH E9(R1) 的界定:退出的處理方式是估計標的的一部分;第 33.1 節 |
| 處理政策策略 | treatment-policy strategy | 被指派的效果,不論之後是否遵從;第 33.1 節 |
| 假想策略 | hypothetical strategy | 若所有人都遵從時的效果;混合模型在 MAR 下瞄準的目標;第 33.1 節 |
| 反應轉移 | response shift | 構念在治療過程中被同一份量表測到的方式改變了;第 33.1 節 |
| 緩解 | remission | 症狀降到臨床閾值以下(此處為 HDRS 低於七);第 33.2 節 |
| 臨界點分析 | tipping-point analysis | 量化非隨機遺漏要偏離多少才會推翻結論(承第 6 章);第 33.2 節 |
| 共享參數聯合模型 | shared-parameter joint model | 讓軌跡與退出歷程共用隨機效果(承第 29 章);第 33.2 節 |
| 時間網絡 | temporal network | 把延宕係數矩陣畫成有向圖(承第 28 章);第 33.3 節 |
| 個殊取向肖像 | idiographic portrait | 由隨機效果讀出的一位病人自己的動態(承第 25 章);第 33.3 節 |
| 及時調適性介入 | just-in-time adaptive intervention | 在決策時點依當下狀態量身調整的介入(承第 2 章);第 33.4 節 |
| 決策時點 | decision point | 可能遞送介入的時刻(承第 2 章);第 33.4 節 |
| 近端結果 | proximal outcome | 介入之後不久測到的結果(承第 2 章);第 33.4 節 |
| 因果偏離效果 | causal excursion effect | 微隨機化試驗所識別的當下因果效果;第 33.4 節 |
| 臨床主張階梯 | clinical claims ladder | 把結論的語言釘在證據上的四階;第 33.5 節 |
參考文獻
aan het Rot, M., Hogenelst, K., & Schoevers, R. A. (2012). Mood disorders in everyday life: A systematic review of experience sampling and ecological momentary assessment studies. Clinical Psychology Review, 32(6), 510–523. https://doi.org/10.1016/j.cpr.2012.05.007
Boruvka, A., Almirall, D., Witkiewitz, K., & Murphy, S. A. (2018). Assessing time-varying causal effect moderation in mobile health. Journal of the American Statistical Association, 113(523), 1112–1121. https://doi.org/10.1080/01621459.2017.1305274
Bringmann, L. F., Vissers, N., Wichers, M., Geschwind, N., Kuppens, P., Peeters, F., Borsboom, D., & Tuerlinckx, F. (2013). A network approach to psychopathology: New insights into clinical longitudinal data. PLOS ONE, 8(4), e60188. https://doi.org/10.1371/journal.pone.0060188
Ebner-Priemer, U. W., & Trull, T. J. (2009). Ecological momentary assessment of mood disorders and mood dysregulation. Psychological Assessment, 21(4), 463–475. https://doi.org/10.1037/a0017075
Epskamp, S., van Borkulo, C. D., van der Veen, D. C., Servaas, M. N., Isvoranu, A.-M., Riese, H., & Cramer, A. O. J. (2018). Personalized network modeling in psychopathology: The importance of contemporaneous and temporal connections. Clinical Psychological Science, 6(3), 416–427. https://doi.org/10.1177/2167702617744325
Fisher, A. J., Reeves, J. W., Lawyer, G., Medaglia, J. D., & Rubel, J. A. (2017). Exploring the idiographic dynamics of mood and anxiety via network analysis. Journal of Abnormal Psychology, 126(8), 1044–1056. https://doi.org/10.1037/abn0000311
Gueorguieva, R., & Krystal, J. H. (2004). Move over ANOVA: Progress in analyzing repeated-measures data and its reflection in papers published in the Archives of General Psychiatry. Archives of General Psychiatry, 61(3), 310–317. https://doi.org/10.1001/archpsyc.61.3.310
Hamaker, E. L., & Wichers, M. (2017). No time like the present: Discovering the hidden dynamics in intensive longitudinal data. Current Directions in Psychological Science, 26(1), 10–15. https://doi.org/10.1177/0963721416666518
Heron, K. E., & Smyth, J. M. (2010). Ecological momentary interventions: Incorporating mobile technology into psychosocial and health behaviour treatments. British Journal of Health Psychology, 15(1), 1–39. https://doi.org/10.1348/135910709X466063
International Council for Harmonisation of Technical Requirements for Pharmaceuticals for Human Use (2019). ICH harmonised guideline: Statistical principles for clinical trials: Addendum: Estimands and sensitivity analysis in clinical trials, E9(R1). ICH.
Kirtley, O. J., Lafit, G., Achterhof, R., Hiekkaranta, A. P., & Myin-Germeys, I. (2021). Making the black box transparent: A template and tutorial for registration of studies using experience-sampling methods (ESM). Advances in Methods and Practices in Psychological Science, 4(1), 2515245920924686. https://doi.org/10.1177/2515245920924686
Klasnja, P., Hekler, E. B., Shiffman, S., Boruvka, A., Almirall, D., Tewari, A., & Murphy, S. A. (2015). Microrandomized trials: An experimental design for developing just-in-time adaptive interventions. Health Psychology, 34(Suppl.), 1220–1228. https://doi.org/10.1037/hea0000305
Myin-Germeys, I., Kasanova, Z., Vaessen, T., Vachon, H., Kirtley, O., Viechtbauer, W., & Reininghaus, U. (2018). Experience sampling methodology in mental health research: New insights and technical developments. World Psychiatry, 17(2), 123–132. https://doi.org/10.1002/wps.20513
Myin-Germeys, I., Oorschot, M., Collip, D., Lataster, J., Delespaul, P., & van Os, J. (2009). Experience sampling research in psychopathology: Opening the black box of daily life. Psychological Medicine, 39(9), 1533–1547. https://doi.org/10.1017/S0033291708004947
Nahum-Shani, I., Smith, S. N., Spring, B. J., Collins, L. M., Witkiewitz, K., Tewari, A., & Murphy, S. A. (2018). Just-in-time adaptive interventions (JITAIs) in mobile health: Key components and design principles for ongoing health behavior support. Annals of Behavioral Medicine, 52(6), 446–462. https://doi.org/10.1007/s12160-016-9830-8
Shiffman, S., Stone, A. A., & Hufford, M. R. (2008). Ecological momentary assessment. Annual Review of Clinical Psychology, 4, 1–32. https://doi.org/10.1146/annurev.clinpsy.3.022806.091415
Trull, T. J., Solhan, M. B., Tragesser, S. L., Jahng, S., Wood, P. K., Piasecki, T. M., & Watson, D. (2008). Affective instability: Measuring a core feature of borderline personality disorder with ecological momentary assessment. Journal of Abnormal Psychology, 117(3), 647–661. https://doi.org/10.1037/a0012532
引用本章
APA 第 7 版沒有「單一作者專書之章」這個文獻類型:正式的參考文獻指向整本書,章次寫在內文引用裡。若您要讓引用直接連到本章這一頁,再採用下方第二組(依 APA 的網站文件格式)。
引用全書、於內文指明章次(建議)
只引用本章這一頁
英文稿件中引用
APA 第 7 版第 9.38 節:非英文著作保留原文題名,並於方括號內附英文翻譯。