第 33 章
臨床心理與心理健康的應用
前面各章一次一個方法地建起一套工具箱,而一套工具箱還不是一套實作。本章是應用篇的第一章,讓這些方法在真實的臨床問題上一起運作,因為在一項實際研究裡最要緊的決定都是關於整合 (integration) 的決定:哪一個分析回答得了這個問題、各分析應該以什麼順序進行、它們彼此如何佐證或牴觸,以及整體要怎麼報告,才能讓一位審查者、一位主管機關人員與一位臨床工作者各自讀得懂。三個個案研究承載整章的論證,每一個都寫成一篇實徵論文的樣子,並附上一段隨行的評註,把一篇完成的論文所隱藏的推理攤開來。第一個個案認真對待一場憂鬱症試驗:它把處理對症狀軌跡 (trajectory) 的效果模型化,把那個效果轉換成臨床工作者在意的緩解 (remission) 結果,正面處理威脅每一場試驗結論的大量退出 (dropout),並讓那項發現接受遺漏資料 (missing data) 的敏感度分析 (sensitivity analysis) 檢驗,把一項脆弱的主張變成一項穩健的主張,而敏感度分析在這裡不是附錄,是與主要結果同等的正式結果。第二個個案研究密集縱貫資料 (intensive longitudinal data) 裡的症狀動態,並且堅持一項這類資料的熱情常常忘記的紀律:同一份資料可以表徵成一個多層次模型 (multilevel model)、一個動態網絡 (dynamic network),以及一幅個殊取向 (idiographic) 的肖像,而這三者是同一個真相的三面鏡頭,必須被調和 (reconcile),不是三個可以選擇性報告的互相競爭的發現。第三個個案處理最新的臨床活動,也就是透過手機遞送介入 (intervention),並把數位心理健康 (digital mental health) 例行混為一談的三件事分開:以微隨機化 (micro-randomization) 最佳化一項介入、以機器學習 (machine learning) 預測風險,以及以早期預警訊號 (early-warning signal) 監測轉變,三者各是不同的估計標的 (estimand),各有不同的證據標準。貫串全章的承諾就是本書一貫的那幾條:先視覺化、先為估計標的命名,並且永遠作敏感度分析。
學習目標
讀完本章之後,你應該能夠:(1) 把臨床問題翻譯成估計標的,以及對應到本書各章的分析;(2) 以有原則的邏輯、而不是把所有分析都端出來,替同一份資料上的多個分析排序;(3) 處理臨床縱貫資料的現實,包括依症狀而定的退出、治療師的巢套 (nesting),以及施測反應性 (reactivity);(4) 把遺漏資料的敏感度分析當成一項臨床證據義務來執行與報告;(5) 調和密集縱貫資料的多種表徵;(6) 把介入最佳化、風險預測與異常監測區分成不同的數位心理健康活動;以及 (7) 寫出審查者、主管機關人員與臨床工作者都讀得懂的臨床縱貫結果。
33.1 臨床縱貫研究的地形
關於變化的臨床問題分成少數幾個家族,而每個家族都通往本書的某一部分。一項處理有沒有用、又有多快,是關於症狀軌跡的問題,由第 13、14 與 19 章的成長模型 (growth model) 回答。對誰有用,是關於異質性 (heterogeneity) 的問題,以第 22 章那些謹慎的混合分配模型 (mixture model) 與第 31 章的樹 (tree) 方法處理。誰會復發、又在何時,是一個時機的問題,由第 29 章的存活模型 (survival model) 回答。症狀在一位病人身上如何互動,是一個動態的問題,由第 25 與 28 章的多層次向量自我迴歸 (multilevel vector-autoregression) 與網絡方法回答。一次即將到來的惡化看不看得出來,是一個監測的問題,以第 26 與 32 章的狀態空間 (state-space) 與非線性方法處理,連同它們所有的警戒。而如何在對的時刻遞送一項介入,是一個最佳化的問題,由本章要介紹的微隨機化設計回答。圖 33.1 畫出這份對應,而表 33.1 連同估計標的與代表性文獻一起列出來。
註:每一個臨床問題的家族都通往本書中回答它的那一部分。這份對應是估計標的優先的:由問題決定方法,不是反過來。一項研究通常會問到其中好幾個問題,而把對應的分析整合起來,以一個有原則的順序、加上誠實的調和,正是本章各個案研究的主題。
表 33.1 臨床問題的分類、估計標的與章次。
| 問題 | 估計標的 | 章次(代表文獻) |
|---|---|---|
| 療效軌跡 | 兩組在變化上的差異 | 第 13–14、19 章 (Gueorguieva & Krystal, 2004) |
| 異質性 | 次群體 (subgroup) 或潛在類別 (latent class) 的效果 | 第 22、31 章 |
| 復發的時機 | 事件的危險 (hazard) | 第 29 章 |
| 病人內的動態 | 延宕 (lagged) 與同時 (contemporaneous) 效果 | 第 25、28 章 (Bringmann et al., 2013) |
| 監測 | 穩定性 (stability) 隨時間的改變 | 第 26、32 章 |
| 遞送的最佳化 | 因果偏離效果 | 第 33 章 (Klasnja et al., 2015) |
註:估計標的這一欄就是紀律所在:一個臨床問題唯有在它的推論標的被命名之後才回答得了。一項研究通常同時適用好幾列,而分析者的工作是把它們排序、讓每一步為下一步提供依據,不是把所有方法都跑一遍再報告最好看的那一個。
臨床縱貫資料有三項現實形塑了接下來的每一個分析。症狀量表 (symptom scale) 在治療推進的過程中,未必以同樣的方式測量同一個構念 (construct),那是一種反應轉移 (response shift),第 18 章的恆等性 (invariance) 方法檢定得了,而若忽略它,跨時間比較分數的天真做法就站不住。頻繁施測有症狀的病人帶著負擔與反應性,因此測量排程是一個倫理與估計標的的問題,不只是一個後勤的問題。而病人巢套在治療師與收案場所之下,那個多層次結構若不模型化就會灌大偽陽性率 (false-positive rate)。在這三項之外,試驗傳統還加上一項心理學仍在吸收的紀律:ICH E9(R1) 增訂本的估計標的架構,它堅持退出與救援用藥 (rescue medication) 的處理方式必須被界定成估計標的本身的一部分,使得處理政策策略 (treatment-policy strategy,不論是否遵從的效果)、假想策略 (hypothetical strategy,若所有病人都遵從時的效果) 與治療期間策略 (while-on-treatment strategy) 回答的是真正不同的問題,不可混為一談。表 33.2 把這些策略翻譯給心理學家看,而個案研究 A 把它們付諸實行。
表 33.2 退出與救援用藥的估計標的策略(ICH E9(R1),翻譯過的版本)。
| 策略 | 它回答的問題 | 退出的處理方式 |
|---|---|---|
| 處理政策 | 被指派的效果,不論是否遵從 | 全部追蹤,包含中止之後 |
| 假想 | 若所有人都遵從時的效果 | 把反事實 (counterfactual) 模型化(例如 MAR 之下的 FIML) |
| 治療期間 | 在治療期間的效果 | 分析到中止為止 |
| 複合 | 中止本身就是一個不好的結果 | 與結果合併 |
註:這些策略回答不同的臨床問題,也給出不同的估計值;選擇必須先於分析,並且要當成估計標的的一部分報告。隨機遺漏 (missing at random) 之下的混合模型瞄準的是假想策略;個案研究 A 的敏感度分析則探測一項非隨機遺漏 (missing not at random) 的偏離要多大才會移動那個估計。
33.2 個案研究 A:認真對待一場試驗
therapy_rct 資料是一場兩百四十位病人的隨機試驗 (randomized trial),一半指派到主動治療、一半到控制,並以Hamilton 憂鬱量表 (Hamilton depression rating scale, HDRS) 每週測量、共十二週。分析以一個刻意安排的順序推進,每一步都由前一步推動,而表 33.3 是記錄那份推理的決策日誌,也就是一篇完成的論文會略去的、可重製推理的展示品。依本書一貫的規則,描述與視覺化排在最前。主要分析是一個帶隨機截距 (random intercept) 與隨機斜率 (random slope) 的症狀軌跡成長模型,它的估計標的是兩組在變化率上的差異。實驗組改善得比較快,每週比控制組多降半個 HDRS 分(處理乘時間交互作用 (interaction) 為每週 \(-0.51\) 分),因此到第十二週時,模型隱含的嚴重度在實驗組是 \(8.5\)、在控制組是 \(14.6\),這個差距跨過了由中度到輕度憂鬱的分界。一個次要的廣義線性混合模型 (generalized linear mixed model) 把連續的軌跡翻譯成臨床工作者會據以行動的結果,也就是緩解,定義為 HDRS 分數低於七,並發現治療之下第十二週緩解的勝算 (odds) 高出許多倍。圖 33.2 畫出那些軌跡,以及在它們底下、威脅到整個結論的那件事。
註:子圖 (a):therapy_rct 試驗配適出來的成長模型(線)與觀察到的各週平均數(點)。實驗組改善得比較快(處理乘週斜率 \(-0.51\)),到第十二週時模型隱含的 HDRS 分數是 \(8.5\),控制組是 \(14.6\)。子圖 (b):留存率到第十二週降到約五成五,而且退出與症狀有關,當下症狀較高的病人比較可能離開。這種量級與這種機制的流失可能讓主要估計產生偏誤,這正是敏感度分析不是選配的原因。資料的 week 由 \(0\) 起算,故第十二週對應 week = 11;英文版的副標把兩組數字四捨五入成整數、順序又與正文相反,中文版明寫組名並保留一位小數。見 EN-33-03。
那件事就是流失。百分之四十四的病人沒有完成試驗,而一個退出的離散時間危險模型 (discrete-time hazard model) 顯示退出與症狀有關:當下症狀較高的病人比較可能離開(\(p < .001\))。以完全訊息最大概似法 (full-information maximum likelihood) 配適的主要成長模型,在「給定已觀察軌跡之後退出是隨機遺漏」時有效,而症狀相關性讓這個條件說得通、卻不確定,因為觸發退出的那個值正是沒被觀察到的那一個。這就是第 6 章那份非隨機遺漏的隱憂,而臨床證據上的義務是去探測它,不是逕自宣稱它不存在。兩個敏感度分析做了這件事,而圖 33.3 呈現它們。一個臨界點分析先由模型插補 (impute) 每一位退出者遺漏的分數,再對實驗組的退出者加上固定的若干 HDRS 分作為懲罰,假設離開的實驗組病人的處境比模型預測的差;把那個懲罰由零掃到八分,治療的好處逐漸減弱,但全程都維持顯著,因此要推翻這個結論,需要一個大到不可信、而且只發生在某一組的隨機遺漏偏離。一個共享參數的聯合模型,同時配適軌跡與退出歷程並讓兩者共用隨機斜率,得到與天真模型相同的估計(\(-0.512\) 對 \(-0.514\)),而且發現退出與斜率只有微弱的關聯,直接佐證了隨機遺漏假設。兩個敏感度分析匯聚在一起,而那份匯聚、不是主要估計本身,才是那項穩健的發現。
註:子圖 (a):一個臨界點分析對實驗組的退出者加上固定的若干 HDRS 分(橫軸)再重新配適;處理乘週的好處逐漸減弱,但即使在八分的懲罰之下仍然顯著,因此要推翻它需要一個不可信的非隨機遺漏偏離。子圖 (b):軌跡與退出的共享參數聯合模型得到與天真估計基本相同的值(\(-0.512\) 對 \(-0.514\)),而退出的關聯接近零,佐證了隨機遺漏。兩個分析的匯聚才是那個穩健的結論。英文版子圖 (b) 未設橫軸範圍,ggplot 把軸縮到兩點之間 \(0.0016\) 寬的窗,反而把「兩者實質相同」畫成「兩者位在面板兩端」;中文版把橫軸固定成涵蓋 \(0\)、與子圖 (a) 同尺度。見 EN-33-04。
最後一步誠實地標明自己是探索性的,它問平均效果是不是掩蓋了反應者的異質性。一個探索性的成長混合分配模型辨認出兩個潛在的軌跡類別,一個快速反應的群與一個緩慢反應的群,但這個分析帶著第 22 章的每一道護欄來報告:類別被描述成一項探索性的假設、它們的個數不被當成已經發現的事實,而且不因為單一樣本就被實體化 (reify) 成臨床亞型。整個個案的教學重點是那個排序,描述先於模型、主要先於次要、敏感度是義務,以及把一項軌跡上的差異翻譯成臨床讀者需要的緩解語言。
表 33.3 個案研究 A:分析排序的決策日誌。
| # | 步驟 | 理由 |
|---|---|---|
| 1 | 視覺化與描述 | 在建模之前先看軌跡與流失(本書的規則) |
| 2 | 主要成長模型 | 處理乘時間的估計標的;事前指定 (pre-specified) 的問題 |
| 3 | 緩解的 GLMM | 把軌跡翻譯成一個臨床結果 |
| 4 | 退出的危險模型 | 在信任步驟 2 之前先診斷遺漏機制 |
| 5 | 臨界點敏感度 | 量化非隨機遺漏要偏離多少才會推翻結果 |
| 6 | 聯合模型 | 同時模型化退出與軌跡以佐證隨機遺漏 |
| 7 | 探索性混合分配模型 | 探測異質性,帶著護欄且不實體化 |
註:這份日誌是一篇完成的論文會略去的教學產物:它記錄了每一個分析為什麼接在前一個之後。步驟 4 到 6 之所以存在,是因為步驟 2 的效度取決於一個檢定不了的假設,而敏感度分析把那份依賴由一項未言明的風險轉成一份有界而且被報告出來的不確定性。
33.3 個案研究 B:症狀動態與個人化的結構
affect_ema 資料追蹤一個樣本進行多天的生態瞬時評估 (ecological momentary assessment),而臨床興趣在動態上:一位病人的壓力如何外溢到負向情緒、情緒如何往前帶,以及這些動態在病人之間如何不同。分析由測量與描述開始,因為瞬時題目比問卷量表更有雜訊:一個多層次信度 (reliability) 分析顯示瞬時負向情緒有百分之三十六的變異數落在個體間,而第 7 章的動態指標,平均延宕一期自我相關 \(0.37\) 與平均連續差異均方根 (RMSSD) \(0.60\),在任何模型被加諸之前先描述了序列的節奏與不穩定性 (instability)。主要的動態分析是一個多層次向量自我迴歸,它估計每個變項對自己與其他變項近期過去的依賴,並以隨機效果讓動態因人而異。它找到清楚的壓力到情緒外溢,也就是壓力對負向情緒的延宕效果 \(0.24\),以及情緒的慣性,也就是負向情緒的延續 \(0.31\),兩者都因病人而異。
這個個案研究存在的目的,是要教一項紀律:這些動態可以有三種表徵,而三者是同一個真相透過不同鏡頭看到的樣子,要被調和、不要被選擇性地報告。多層次模型把效果陳述成帶隨機變異的迴歸係數。同樣那些延宕係數排成一個矩陣,就是一個時間網絡 (temporal network),它的有向連結 (directed edge) 恰恰就是那些係數,也就是第 28 章的表徵。而那些隨機效果就是個別病人個殊取向肖像的原料。圖 33.4 把前兩種鏡頭放在一起,也就是固定效果的時間網絡與逐人外溢的分配,而表 33.4 調和每一種鏡頭各主張了什麼。網絡那張圖必須帶著第 28 章的主張階梯紀律:它的連結是條件關聯 (conditional association),不是已證明的機制,而一項中心性 (centrality) 主張需要那一章所要求的穩定度分析 (stability analysis)。調和才是重點。一篇論文若把網絡當成一項新發現、擺在多層次模型旁邊,彷彿它們是各自獨立的結果,那是在把同一個分析算兩次;一篇論文若只呈現網絡、只給那幅生動的圖像,那是在藏起那些係數所帶的不確定性。
註:子圖 (a):把 affect_ema 的動態畫成一個多層次向量自我迴歸的延宕固定效果矩陣,也就是時間網絡;一條有向連結是一個延宕係數,是條件關聯而不是已證明的機制。子圖 (b):逐人的壓力對負向情緒外溢在病人之間圍繞著平均數 \(0.24\) 而變異,那是單一個平均數會藏起來的隨機動態。網絡與多層次模型是同一個分析的兩種表徵,要被調和,不要當成兩項各自的發現來報告。英文版此處的直方圖不是估計值,而是以固定效果為平均數、隨機效果標準差為標準差當場抽出的一百二十個常態亂數,且腳本未設亂數種子;中文版改畫那一百二十個人真正的經驗貝氏 (empirical Bayes) 估計。見 EN-33-01。
個殊取向的分析接著問,關於一位個別病人能說什麼,而第 25 章那堂關於合併 (pooling) 的課在這裡帶著臨床的賭注回來。圖 33.5 對兩位病人比較兩件事:只用那位病人自己的資料算出的逐人估計,與多層次模型指派給他的收縮 (shrunken) 估計。對一位資料充分而一致的病人,兩者相當接近;對一位資料比較有雜訊的病人,兩者明顯分歧,多層次模型把那個不穩定的個別估計拉向團體。只報告逐人的那個數字,會過度信任一個有雜訊的估計;只報告收縮後的那個數字,會低估真實的個別性。臨床上的轉譯必須相應地小心:一項逐人的動態是一項關於那位病人的假設,要拿去對照他的病史與他的臨床工作者的了解來檢核,不是一項已經驗證的個體事實,而報告它的倫理,病人的隱私、把單一個醒目的係數過度解讀的誘惑,都是分析的一部分,不是事後才想到的。
註:對兩位病人,只用那位病人自己的資料估出來的壓力對負向情緒外溢(逐人),與多層次模型跨病人借力之後指派的估計(收縮後)。對資料一致的病人,兩者幾乎重合;對資料比較有雜訊的病人,兩者分歧,多層次模型把不穩定的個別估計正則化 (regularize)。逐人的那個數字過度信任一個不精確的估計;收縮後的那個數字把它正則化了。兩者都不是全部的故事,而一項關於個體的臨床主張必須同時承認兩者。英文版此圖的副標把收縮幅度歸因於「資料稀薄」,但被收縮較多的那位病人其實有 \(42\) 個可用時點、另一位有 \(40\) 個;真正的差別在個別估計的精確度(自身估計的標準誤 \(0.47\) 對 \(0.23\)),中文版的副標與軸標籤據此改寫。見 EN-33-02。
表 33.4 個案研究 B:調和那些表徵。
| 表徵 | 它主張什麼 | 與其他表徵的關係 |
|---|---|---|
| 多層次 VAR | 帶隨機變異的延宕與同時係數 | 估計的引擎 |
| 時間網絡 | 變項之間的有向連結 | 同一組係數,畫出來 |
| 個殊取向模型 | 一位病人自己的動態 | 那些隨機效果,逐人 |
註:這三者不是各自獨立的發現,而是同一個分析的三種呈現,把它們報告成彼此佐證就是在重複計算。網絡承接第 28 章的主張階梯紀律;個殊取向的呈現承接第 25 章的收縮紀律。一個真相、跨鏡頭調和,是一篇臨床密集縱貫論文應該達到的標準。
33.4 個案研究 C:監測、預測與適時介入
數位心理健康透過手機遞送評估與介入,而它例行地把三件邏輯上不同的活動混為一談:最佳化一項介入、預測風險,以及監測轉變。這個個案研究把它們分開,因為每一件都是不同的估計標的,各有不同的設計與證據標準,如表 33.5 所列。及時調適性介入 (just-in-time adaptive intervention) 在 Nahum-Shani et al. (2018) 的架構下,在決策時點 (decision point) 遞送支持,依當事人當下的狀態量身調整,以影響一個近端結果 (proximal outcome),而圖 33.6 畫出它的架構。它所提的問題,也就是「現在把提示遞送出去會不會改善近端結果、又對誰有效」,是一個介入最佳化的估計標的,而回答它的設計是微隨機化試驗 (micro-randomized trial),其中介入在每一個決策時點被隨機化,使它當下的因果效果得以識別 (Klasnja et al., 2015)。
註:在每一個決策時點,一個量身調整的變項(當下的狀態)決定要不要遞送介入,而介入影響一個近端結果,再回饋到下一個決策時點。在一場微隨機化試驗裡,介入在每一個可用的決策時點被隨機化,這識別出因果偏離效果 (causal excursion effect),也就是遞送提示當下的效果、在隨機化分配上平均之後的值,以及它被那個變項調節的情形。
mrt_ema 資料是一個微隨機化的延伸,其中一則簡短的因應提示在每一個可用的決策時點被隨機化,而近端結果是不久之後的負向情緒。因果偏離效果以一個加權且置中的迴歸 (weighted-and-centered regression) 來估計,它對控制模型的設定錯誤 (misspecification) 具有穩健性 (Boruvka et al., 2018),而它還原出植入的效果:提示在最早遞送時把近端負向情緒降低約半分,它的好處隨著當事人習慣化 (habituation) 而在研究期間逐漸消退,而且在當事人有壓力時作用比較強。圖 33.7 畫出偏離效果隨時間的變化,而那份消退本身就是臨床上可據以行動的發現,因為一項效果會衰減的介入應該被變化或拉開間隔,而不是原樣重複。這是最佳化,不是預測:估計標的是一項行動的效果,而證據是一次隨機化的對比。
註:在 mrt_ema 微隨機化試驗中,因應提示對近端負向情緒的估計因果偏離效果,依研究日呈現,虛線為植入的真值。提示的近端好處在最早遞送時最大(約 \(-0.46\)),並隨著當事人習慣化而在研究期間逐漸消退。那份消退才是可據以行動的結果:一項當下效果會衰減的介入應該被拉開間隔或變化,而這是只有微隨機化試驗才支持得了的設計結論。
預測是一件不同的活動,帶著不同的估計標的,也就是未來某個狀態的機率,而第 31 章的紀律管著它。一個預報瞬時負向情緒的風險旗標 (risk flag) 模型,以依人分組交叉驗證 (person-grouped cross-validation) 評估、並對照持續性 (persistence) 基準來衡量,以一個真實但有界的幅度勝過那個基準(交叉驗證的決定係數 \(0.49\) 對基準的 \(0.26\)),而它的校準 (calibration)、不只是它的區辨 (discrimination),必須被檢查,如圖 33.8 所示。監測是第三件活動,也就是偵測一次逼近中的轉變,而第 32 章的早期預警判斷原封不動地適用:一位病人資料流上的一個上升指標是一項監測假設,不是一個經過驗證的警報,而基本率 (base rate) 與分析者自由度 (analyst degrees of freedom) 的警戒在這裡與在那裡一樣有拘束力。教學重點就是這份區分本身,因為一項數位心理健康研究若把一個預測模型報告得彷彿它最佳化了一項介入、或把一個早期預警訊號報告得彷彿它預測了風險,就是把需要三種設計的三個問題混為一談了。
註:子圖 (a):一個預報瞬時負向情緒的模型在依人分組交叉驗證下的校準,橫軸是分箱後的預測值、縱軸是觀察值;點靠近對角線表示校準良好。子圖 (b):模型交叉驗證的決定係數(\(0.49\))對持續性基準(\(0.26\)),也就是那份誠實的幅度。預測由「相對於一個基準的樣本外技巧」與校準來評判,不是由樣本內的配適,而它與圖 33.7 的介入最佳化是不同的活動。
表 33.5 三種數位心理健康活動的區分。
| 活動 | 估計標的 | 設計 | 證據 |
|---|---|---|---|
| 最佳化 | 因果偏離效果 | 微隨機化試驗 | 隨機化的對比 |
| 預測 | 未來某個狀態的機率 | 觀察性世代 (observational cohort) | 分組交叉驗證對基準 |
| 監測 | 穩定性的改變 | 密集時間序列 | 經替代序列 (surrogate) 檢定的趨勢 |
註:這三種活動在數位心理健康裡例行被混為一談,然而它們以不同的設計與標準回答不同的問題。最佳化需要隨機化;預測需要誠實的樣本外評估;監測需要替代序列推論與對基本率的謙遜。一項研究應該說清楚自己在做哪一種,並且達到那一種的標準。
33.5 領域綜合
三個個案研究共用一根脊椎,而把它命名出來就是本章的綜合。每一個都先視覺化才建模、先為估計標的命名才選方法,並且把敏感度分析當成理所當然、而不是被要求時才做的事。每一個也各自執行了一份與它的方法有關的主張紀律:試驗以遺漏資料的敏感度為它的結論設界,動態研究調和它的表徵、而不是把它們乘起來,而數位健康研究把最佳化、預測與監測分開。圖 33.9 畫出臨床主張階梯,它把一項縱貫結果所賺得的語言釘在支持它的證據上,而表 33.6 是一份臨床期刊應該期待的報告檢核表 (reporting checklist)。臨床縱貫工作最常見的審查者質疑,也就是把平均效果拿來決定一項處理對一個個體做了什麼、把更頻繁的測量假定為更多的臨床真相、把一張網絡圖讀成機制、把一項預報吹過頭,都各有一份個案研究示範過的紀律回答得了。各個領域文獻各自添上自己的紋理,憂鬱與焦慮的生態瞬時評估傳統 (aan het Rot et al., 2012; Hamaker & Wichers, 2017)、精神病的經驗取樣 (experience sampling) 研究 (Myin-Germeys et al., 2018; Myin-Germeys et al., 2009)、邊緣型人格疾患 (borderline personality disorder) 的不穩定性文獻 (Ebner-Priemer & Trull, 2009; Trull et al., 2008)、個殊取向網絡的範例 (Epskamp et al., 2018; Fisher et al., 2017),但那根分析的脊椎是共通的,而它正是本書一路建過來的那一根。
註:一項臨床縱貫結果所賺得的語言,釘在支持它的證據上。描述與關聯多數設計都給得起;一項穩健的、或設計上是因果的主張,需要隨機化或一份為遺漏資料威脅設界的敏感度分析;一項個體層次或機制性的主張,需要個殊取向的驗證或一次實驗操弄。寫在證據所及的那一階、不再往上,就是三個個案研究共有的紀律。
表 33.6 臨床縱貫研究的報告檢核表。
| 項目 | 該報告什麼 |
|---|---|
| 估計標的 | 推論的標的,包含退出的處理策略 |
| 視覺化 | 在任何模型之前先呈現軌跡與流失 |
| 主要分析 | 事前指定的模型與它的組別/效果估計標的 |
| 遺漏 | 診斷出來的機制與敏感度分析 |
| 異質性 | 探索性次群體標明為探索性,且不實體化 |
| 表徵 | 對動態而言,模型、網絡與個殊取向三者的調和 |
| 主張 | 寫在證據所及的那一階 |
註:這份檢核表把本章的脊椎操作化。它相對於本書一般報告標準的臨床特有增補有三項:估計標的中退出的處理策略、把敏感度分析列為必要而非選配的項目,以及在密集縱貫資料容易招來選擇性報告之處,要求多種表徵的調和。
常見陷阱 • 四種臨床上的越界
只分析完成者。 只分析完成試驗的病人,等於丟掉承載偏誤的那份流失;請在一個命名過的估計標的之下使用全部隨機化的病人,並探測遺漏。被實體化的反應者類別。 一個探索性混合分配模型的類別是一項假設,不是被發現的亞型;不要靠單一樣本就在它們之上建立臨床決策。把網絡當成機制。 一個症狀網絡的連結是條件關聯;一篇把它們讀成因果槓桿的臨床論文,已經爬過了證據所能支撐的那一階。預報的過度推銷。 一個預測模型必須以撐得過分組交叉驗證的幅度勝過持續性基準、而且要有校準;樣本內的準確度不等於臨床上可用。
實務要點 • 與試驗統計師合作,以及安全監測
臨床工作裡有兩件實務事項反覆出現。與試驗統計師的合作,靠一套共同的詞彙就順暢得多:估計標的架構、假想策略與處理政策策略的區分,以及敏感度分析的語言,就是那座橋,而一位把本書的成長模型與聯合模型做法帶進那場對話的心理學家,是一位對等的合作者、不是一位請託者。其次,對有症狀的病人作高頻施測要求一套安全監測方案 (safety-monitoring protocol):可能浮現急性風險的瞬時題目,也就是自傷 (self-harm) 或自殺風險 (suicidality),需要一條事前指定的回應路徑 (response pathway),即時檢視或轉介升級,那條路徑要在資料蒐集之前就設計好、並寫進方法一節,因為一項偵測得到危機卻對它毫無作為的施測,在倫理上並不中立。
實務要點 • 倫理:當下的風險資料與逐人的結果
臨床密集縱貫資料帶來一些分析無法外包的倫理義務。瞬時的自殺風險或自傷題目產生的資料,它的處理、儲存、取用與回應路徑都必須事前界定,因為蒐集這種資料創造出一份不會隨研究結束而終止的照護責任。逐人的結果自帶風險:一位病人的個殊取向模型,在一份團體估計所不會的意義上,是可以指認出當事人身分的,而報告一個醒目的個別係數,不論是在論文裡還是回饋給病人,都同時冒著隱私外洩與過度解讀的風險,而那份過度解讀是估計值的不確定性撐不起的。紀律是把一項逐人的發現當成一項臨床假設,以與任何其他假設同樣的驗證標準來要求它,並且像分析保護它的推論那樣仔細地保護病人的資料與隱私。
本章摘要
應用篇的第一章讓本書的方法在臨床問題上一起運作,而在那裡最要緊的決定是關於整合、排序、調和與報告的決定。臨床問題依它們的估計標的導向不同的方法,療效軌跡到成長模型、復發到存活分析、動態到多層次向量自我迴歸與網絡、遞送到微隨機化試驗,而症狀測量、反應性、巢套與退出這些現實形塑了每一個分析,試驗傳統則再加上估計標的架構,其中退出的處理方式本身就是估計標的的一部分。個案研究 A 認真對待一場憂鬱症試驗:一個成長模型估計處理乘時間的好處、一個混合模型把它翻譯成緩解、一個危險模型診斷出依症狀而定的退出,而兩個敏感度分析,一個治療好處撐得過去的臨界點懲罰與一個重現天真估計的聯合模型,匯聚起來使那項發現變得穩健,敏感度分析在這裡作為與主要結果同等的正式結果、而不是附錄,而反應者的異質性只被標記成帶護欄的探索。個案研究 B 研究症狀動態,並堅持多層次模型、時間網絡與個殊取向肖像是一個真相的三面鏡頭,要被調和而不是被選擇性報告,網絡受主張階梯紀律約束,而個殊取向的估計與它們收縮後的對應值並列呈現,好讓那個有雜訊的個別數字與那個被正則化的數字,都不會被誤認成全部的故事。個案研究 C 把數位心理健康混為一談的三件活動分開:一場微隨機化試驗估計一則提示的因果偏離效果,並發現它隨習慣化而消退;一個預測模型以分組交叉驗證與校準對照持續性基準受評判;而早期預警的監測承接第 32 章對單一個案的清醒,三者各是不同的估計標的、各需要不同的設計。三個個案研究共用一根脊椎,先視覺化、先為估計標的命名、永遠作敏感度分析,加上一道把每一項臨床結論寫在它的證據所賺得的那一階的主張階梯,以及臨床資料加諸分析者的那些倫理義務,也就是安全監測與逐人結果的隱私。
本章重要名詞中英對照
| 中文 | English | 說明/首次出現處 |
|---|---|---|
| 估計標的架構 | estimand framework | ICH E9(R1) 的界定:退出的處理方式是估計標的的一部分;第 33.1 節 |
| 處理政策策略 | treatment-policy strategy | 被指派的效果,不論之後是否遵從;第 33.1 節 |
| 假想策略 | hypothetical strategy | 若所有人都遵從時的效果;混合模型在 MAR 下瞄準的目標;第 33.1 節 |
| 反應轉移 | response shift | 構念在治療過程中被同一份量表測到的方式改變了;第 33.1 節 |
| 緩解 | remission | 症狀降到臨床閾值以下(此處為 HDRS 低於七);第 33.2 節 |
| 臨界點分析 | tipping-point analysis | 量化非隨機遺漏要偏離多少才會推翻結論(承第 6 章);第 33.2 節 |
| 共享參數聯合模型 | shared-parameter joint model | 讓軌跡與退出歷程共用隨機效果(承第 29 章);第 33.2 節 |
| 時間網絡 | temporal network | 把延宕係數矩陣畫成有向圖(承第 28 章);第 33.3 節 |
| 個殊取向肖像 | idiographic portrait | 由隨機效果讀出的一位病人自己的動態(承第 25 章);第 33.3 節 |
| 及時調適性介入 | just-in-time adaptive intervention | 在決策時點依當下狀態量身調整的介入(承第 2 章);第 33.4 節 |
| 決策時點 | decision point | 可能遞送介入的時刻(承第 2 章);第 33.4 節 |
| 近端結果 | proximal outcome | 介入之後不久測到的結果(承第 2 章);第 33.4 節 |
| 因果偏離效果 | causal excursion effect | 微隨機化試驗所識別的當下因果效果;第 33.4 節 |
| 臨床主張階梯 | clinical claims ladder | 把結論的語言釘在證據上的四階;第 33.5 節 |
參考文獻
aan het Rot, M., Hogenelst, K., & Schoevers, R. A. (2012). Mood disorders in everyday life: A systematic review of experience sampling and ecological momentary assessment studies. Clinical Psychology Review, 32(6), 510–523. https://doi.org/10.1016/j.cpr.2012.05.007
Boruvka, A., Almirall, D., Witkiewitz, K., & Murphy, S. A. (2018). Assessing time-varying causal effect moderation in mobile health. Journal of the American Statistical Association, 113(523), 1112–1121. https://doi.org/10.1080/01621459.2017.1305274
Bringmann, L. F., Vissers, N., Wichers, M., Geschwind, N., Kuppens, P., Peeters, F., Borsboom, D., & Tuerlinckx, F. (2013). A network approach to psychopathology: New insights into clinical longitudinal data. PLOS ONE, 8(4), e60188. https://doi.org/10.1371/journal.pone.0060188
Ebner-Priemer, U. W., & Trull, T. J. (2009). Ecological momentary assessment of mood disorders and mood dysregulation. Psychological Assessment, 21(4), 463–475. https://doi.org/10.1037/a0017075
Epskamp, S., van Borkulo, C. D., van der Veen, D. C., Servaas, M. N., Isvoranu, A.-M., Riese, H., & Cramer, A. O. J. (2018). Personalized network modeling in psychopathology: The importance of contemporaneous and temporal connections. Clinical Psychological Science, 6(3), 416–427. https://doi.org/10.1177/2167702617744325
Fisher, A. J., Reeves, J. W., Lawyer, G., Medaglia, J. D., & Rubel, J. A. (2017). Exploring the idiographic dynamics of mood and anxiety via network analysis. Journal of Abnormal Psychology, 126(8), 1044–1056. https://doi.org/10.1037/abn0000311
Gueorguieva, R., & Krystal, J. H. (2004). Move over ANOVA: Progress in analyzing repeated-measures data and its reflection in papers published in the Archives of General Psychiatry. Archives of General Psychiatry, 61(3), 310–317. https://doi.org/10.1001/archpsyc.61.3.310
Hamaker, E. L., & Wichers, M. (2017). No time like the present: Discovering the hidden dynamics in intensive longitudinal data. Current Directions in Psychological Science, 26(1), 10–15. https://doi.org/10.1177/0963721416666518
Heron, K. E., & Smyth, J. M. (2010). Ecological momentary interventions: Incorporating mobile technology into psychosocial and health behaviour treatments. British Journal of Health Psychology, 15(1), 1–39. https://doi.org/10.1348/135910709X466063
International Council for Harmonisation of Technical Requirements for Pharmaceuticals for Human Use (2019). ICH harmonised guideline: Statistical principles for clinical trials: Addendum: Estimands and sensitivity analysis in clinical trials, E9(R1). ICH.
Kirtley, O. J., Lafit, G., Achterhof, R., Hiekkaranta, A. P., & Myin-Germeys, I. (2021). Making the black box transparent: A template and tutorial for registration of studies using experience-sampling methods (ESM). Advances in Methods and Practices in Psychological Science, 4(1), 2515245920924686. https://doi.org/10.1177/2515245920924686
Klasnja, P., Hekler, E. B., Shiffman, S., Boruvka, A., Almirall, D., Tewari, A., & Murphy, S. A. (2015). Microrandomized trials: An experimental design for developing just-in-time adaptive interventions. Health Psychology, 34(Suppl.), 1220–1228. https://doi.org/10.1037/hea0000305
Myin-Germeys, I., Kasanova, Z., Vaessen, T., Vachon, H., Kirtley, O., Viechtbauer, W., & Reininghaus, U. (2018). Experience sampling methodology in mental health research: New insights and technical developments. World Psychiatry, 17(2), 123–132. https://doi.org/10.1002/wps.20513
Myin-Germeys, I., Oorschot, M., Collip, D., Lataster, J., Delespaul, P., & van Os, J. (2009). Experience sampling research in psychopathology: Opening the black box of daily life. Psychological Medicine, 39(9), 1533–1547. https://doi.org/10.1017/S0033291708004947
Nahum-Shani, I., Smith, S. N., Spring, B. J., Collins, L. M., Witkiewitz, K., Tewari, A., & Murphy, S. A. (2018). Just-in-time adaptive interventions (JITAIs) in mobile health: Key components and design principles for ongoing health behavior support. Annals of Behavioral Medicine, 52(6), 446–462. https://doi.org/10.1007/s12160-016-9830-8
Shiffman, S., Stone, A. A., & Hufford, M. R. (2008). Ecological momentary assessment. Annual Review of Clinical Psychology, 4, 1–32. https://doi.org/10.1146/annurev.clinpsy.3.022806.091415
Trull, T. J., Solhan, M. B., Tragesser, S. L., Jahng, S., Wood, P. K., Piasecki, T. M., & Watson, D. (2008). Affective instability: Measuring a core feature of borderline personality disorder with ecological momentary assessment. Journal of Abnormal Psychology, 117(3), 647–661. https://doi.org/10.1037/a0012532