後設分析與研究整合
單一研究幾乎從不是定論。任一項研究都受限於其特定的樣本、操作、情境與隨機誤差,其效果估計必然帶有可觀的不確定性。行為科學的知識,因而不是建立在任何一項決定性的實驗之上,而是在眾多研究的累積與整合之中逐步浮現。本章要處理的,正是如何把推論的單位從單一研究提升到整個研究群體,即以系統而量化的方法整合眾多研究的證據,估計效果的集中趨勢、刻畫其分布的異質、並診斷可能扭曲此一累積歷程的偏誤。這門技藝統稱後設分析(meta-analysis)與研究整合(research synthesis)。
本章與第八、九章共同構成一條「雙層推論」的敘事線:第八、九章處理的是「從一個樣本推論到一個母體」的第一層推論,本章則處理「從一群研究推論到一個效果的分布」的第二層推論。全章的展開如下:先以心理治療效果的歷史論戰帶出後設分析的緣起,論證敘事性回顧與計票法的不足;再建立效果量整合的核心機制,即逆變異數加權、固定與隨機效果模型的根本區別、以及異質性的量化與詮釋;接著處理調節變項分析、相依效果量、以及發表偏誤的診斷與校正這一充滿方法爭議的領域;最後轉向心理計量所特有的貢獻,即測量誤差的校正、信度與效度概化、以及後設分析結構方程模型,並以後設分析與開放科學的匯流收束。為使討論具體,全章以「成長型思維介入的效果」這一領域,從樂觀宣稱到大型後設分析、再到異質性與調節之爭的完整軌跡為貫穿實例。
一場關於「心理治療有沒有效」的戰爭
後設分析的誕生,與一場具體的學術論戰緊密相連。二十世紀中葉,關於心理治療是否真正有效的爭論僵持不下,各方各自援引支持己方的研究,而文獻的浩繁與結論的分歧,使任何以敘事方式進行的回顧都難以服人。Glass (1976) 的突破,在於他主張把每一項研究的結果化約為一個共同尺度上的效果量,再對這些效果量本身進行統計分析,並為這種「對分析結果的分析」創造了後設分析一詞。當他與同僚以此法整合了數百項心理治療研究、得出治療確有中等效果的結論時,後設分析作為一種研究方法的力量便昭然若揭。
這段歷史揭示了後設分析的根本精神,即它把文獻本身當作資料,把個別研究當作觀測。此一精神在不同學科中平行地發展:Hedges & Olkin (1985) 為後設分析奠定了嚴謹的統計基礎,Hunter 與 Schmidt 在工商心理學中發展出強調測量誤差校正的平行傳統((Schmidt & Hunter, 2015)),而 Cochrane 協作組織則把後設分析制度化為實證醫學的基石。晚近的再現性危機,更把發表偏誤的偵測方法推上了前台。後設分析因而不僅是一套統計技術,更是一種把科學知識的累積本身納入量化檢視的方法論立場。
為何不能用計票法
在後設分析的嚴謹方法確立之前,整合多項研究最直觀的做法是計票法(vote counting):數一數有多少研究得到顯著的正效果、多少得到不顯著或負效果,再以多數決定論。這個看似合理的做法,其實暗藏一個嚴重且違反直覺的統計缺陷。單一研究是否達到顯著,同時取決於效果的真實大小與該研究的檢定力,而檢定力又高度依賴樣本數。當多數研究的樣本偏小、檢定力偏低時,即使真實效果確實存在,多數研究仍可能得不到顯著結果,計票法因而會錯誤地得出「無效果」的結論。
更嚴重的是,計票法的這一偏誤不會隨研究數目的增加而消失,反而可能惡化。這是因為它拋棄了每項研究中最寶貴的量化資訊,即效果量的大小與精確度,而只保留了「是否顯著」這個被檢定力嚴重污染的二元訊號。後設分析的根本改進,正在於它不數票,而是估計效果量並依其精確度加權整合,從而把每項研究的完整資訊納入。理解計票法的謬誤,是理解後設分析何以必要的起點:整合證據不是統計顯著結果的多數表決,而是效果量的加權綜合。
效果量的萃取與轉換
後設分析的分析單位是效果量(effect size),即以一個標準化的尺度表徵研究結果的量,其定義系譜已在第九章鋪陳。整合的第一步,是把來自不同研究、以不同統計量報告的結果,轉換為一個共同的效果量尺度。常見的尺度包括標準化平均數差異(如 Cohen’s d 或偏誤校正的 Hedges’ g)、相關係數(常經 Fisher z 轉換以穩定變異)、以及勝算比或風險比等。這一萃取與轉換的工作看似機械,實則充滿判斷:原始研究的報告往往不完整,須由不完整的統計量反推效果量及其變異,而每一次反推都可能引入誤差。
一個常被忽略卻關鍵的問題是效果量的相依性。同一項研究常報告多個效果量,例如對多個結果變項、多個時點、或多個分組分別報告,這些效果量因共享同一批受試者而彼此相關,違反了標準後設分析對效果量獨立的假定。天真地把它們當作獨立觀測納入,會低估標準誤、虛增精確度。以「成長型思維介入」為例,一項研究可能同時報告對數學與語文成績的效果,此二者顯然相依,如何處理這類相依,是後文相依效果量一節的主題。
固定與隨機:兩種提問
後設分析的核心,是把眾多研究的效果量整合為一個總結。整合的方式取決於一個根本的抉擇,即固定效果模型與隨機效果模型,二者並非計算細節的差異,而是回答了兩個根本不同的問題。
設 k 項研究的效果量估計為 \hat\theta_1,\dots,\hat\theta_k,各自的抽樣變異為 v_1,\dots,v_k。整合估計為加權平均 \hat\theta = \sum_i w_i\hat\theta_i / \sum_i w_i。可證明,使整合估計變異最小的權重,正是各研究變異的倒數:
此即逆變異數加權(inverse-variance weighting)。其精神是讓精確(樣本大、變異小)的研究得到較大的發言權。
固定效果模型假定所有研究共享單一的真實效果 \theta,研究間的差異純由抽樣誤差造成,其權重為 w_i = 1/v_i,估計標的是「這個共同效果」。隨機效果模型則假定各研究的真實效果本身即為一分布 \theta_i\sim N(\mu,\tau^2),研究間差異來自抽樣誤差與真實效果的異質 \tau^2,其權重為
估計標的是「效果分布的平均 \mu」。二者的區別因而是實質的:固定效果問「這批研究的共同效果是多少」,隨機效果問「效果在研究母體中的平均是多少」,後者所推論的對象超出了手上的這批研究。
這一區別有直接的實務後果。當 \tau^2>0 時,隨機效果模型給小研究相對更大的權重(因為 \tau^2 稀釋了大研究的精確度優勢),其信賴區間也較寬,反映了對「效果本身有變異」這一事實的誠實承認。在行為科學中,研究幾乎總是在不同人群、操作與情境下進行,真實效果全然同質的假定往往不切實際,因此隨機效果模型通常是較合理的預設。然而,隨機效果模型的推論效力仰賴對 \tau^2 的良好估計,而當研究數目偏少時,\tau^2 本身即難以精確估計,這是後文須正視的限制。
異質性:把分歧變成資訊
隨機效果模型承認了效果的異質,下一步便是量化並理解這份異質。異質性不是需要被消除的麻煩,而是承載實質訊息的發現:若不同研究得到系統性不同的效果,這本身就提示了某些調節因素在起作用。量化異質性的工具,須小心地區分其統計顯著與實質大小。
Cochran 的 Q 統計量衡量觀測到的研究間變異相對於純抽樣誤差的期望:
在效果同質的虛無假設下,Q 漸近服從自由度 df = k-1 的卡方分布,故 E[Q]=df。Q 的顯著檢定告訴我們異質是否存在,但其檢定力隨研究數與樣本數變化,故不宜作為異質「大小」的指標。Higgins & Thompson (2002) 提出的 I^2 把異質表為比例:
即總變異中歸因於真實異質(而非抽樣誤差)的比例。須強調,I^2 是比例而非絕對量,I^2 高不代表效果的絕對散布大,它會隨研究內樣本數增大而升高。刻畫異質絕對大小的,是 \tau^2 本身,其常用的動差估計為 DerSimonian & Laird (1986) 法。真正對讀者最有用的報告,往往是預測區間(prediction interval),即約 \hat\mu \pm t\sqrt{\hat\tau^2 + \mathrm{SE}^2},它直接回答「下一項研究的真實效果大約落在哪個範圍」,把異質的實質後果攤在眼前。
I^2 的誤用在文獻中極為普遍,最常見的是把高 I^2 逕自解讀為「效果散布很大」。這是錯誤的:I^2 衡量的是異質佔總變異的比例,當各研究樣本極大、抽樣誤差極小時,即使真實效果的絕對散布很小,I^2 仍可趨近於一。因此,異質性的報告不應止於一個 I^2 數字,而應輔以 \tau^2 與預測區間,讓讀者能判斷異質的實質意義。以成長型思維為例,若整合後平均效果雖為正、但預測區間橫跨零,這意味著在某些情境下介入可能無效甚至有害,此一訊息遠比單一的平均效果更具實務價值。
調節變項與後設迴歸
異質性一旦被確認,隨之而來的問題是「什麼解釋了效果的差異」。調節變項分析(moderator analysis)與後設迴歸(meta-regression)即為此而設:以研究層次的特徵(如樣本的年齡、介入的劑量、實施的品質、發表年份)為預測變項,解釋效果量的研究間變異。就成長型思維而言,一個核心的爭論正是調節性的,即介入是否對特定次群體,如社經地位較低或學業風險較高的學生,效果較強。Sisk et al. (2018) 的大型後設分析,正是透過調節分析揭示了整體效果雖弱、但在若干高風險次群體中可能較為明顯的複雜圖像。
後設迴歸雖強大,卻有兩個必須警覺的陷阱。其一是研究層次的混淆與生態謬誤:調節變項是研究的屬性而非個體的屬性,故後設迴歸所揭示的是研究間的關聯,不能逕自推論到個體層次,否則即犯下第二十八章所論的生態謬誤。例如「平均年齡較大的研究效果較強」,不等於「年紀較大的個體效果較強」。其二是檢定力的現實:後設迴歸的樣本單位是研究而非個體,而研究數往往只有數十,故其偵測調節效果的檢定力通常偏低,且極易因少數具影響力的研究而不穩。調節分析因而應被視為探索性的線索,而非確證性的結論,其發現須以理論與後續研究審慎對待。
相依效果量與多層次後設分析
前述模型皆假定各效果量彼此獨立,但如前所述,同一研究常提供多個相依的效果量。忽略此相依會低估標準誤、誇大精確度與顯著性。處理相依有兩條主要路徑。其一是多層次後設分析(multilevel meta-analysis),它把效果量視為巢狀於研究之內的兩層(或更多層)結構,直接以第二十八章的多層次框架建模,在研究層與效果量層分別設定變異成分,從而正確地分離不同層次的異質。其二是穩健變異數估計(robust variance estimation, RVE),由 Hedges et al. (2010) 發展,它不對相依的具體結構作強假設,而以類似群集穩健標準誤的方式校正整合估計的變異,對相依結構的設定錯誤較具穩健性。
兩條路徑各有所長。多層次取向能明確估計各層次的異質、並支持對效果量層調節變項的分析,但須對相依結構作較多假定;穩健變異數估計則以最少的假定換取對相依的穩健處理,尤其適合相依結構複雜或未知的情形,近年已成為處理相依效果量的主流建議之一。二者並非互斥,晚近的實務常將穩健變異數估計與多層次模型結合,兼取兩者之長。這一發展再次體現了本書反覆出現的主題,即依賴結構既是統計的挑戰,也是承載訊息的來源。
發表偏誤:診斷與校正的工具箱
後設分析最深刻的威脅,是它所整合的文獻本身可能是有偏的樣本。若顯著或符合預期的結果較易被發表,而不顯著的結果被留在檔案抽屜裡,則可得的文獻會系統性地高估效果,此即發表偏誤(publication bias)。由於後設分析只能分析已發表(或可尋得)的研究,這一偏誤直接威脅其結論的效度。文獻已發展出一整套診斷與校正的工具,摘要於下面的概念方塊。
偵測與校正發表偏誤的方法眾多,各有假設與限制,彼此的結論未必一致:
漏斗圖(funnel plot):以效果量對精確度作圖,對稱則暗示無偏,不對稱則可疑;但不對稱也可能源於真實的異質。
Egger 檢定((Egger et al., 1997)):以迴歸形式化漏斗圖不對稱的檢定,但檢定力有限且易受異質干擾。
修剪填補(trim and fill,(Duval & Tweedie, 2000)):以對稱性假設補入「缺失」的研究再重估,直觀但在真異質下可能誤導。
選擇模型(selection model,(Vevea & Hedges, 1995)):明確建模「結果是否被發表取決於其 p 值」的選擇歷程,理論上較嚴謹但需較多假設與研究數。
p-曲線與 PET-PEESE:Simonsohn et al. (2014) 的 p-曲線由顯著結果的 p 值分布推斷證據價值,PET-PEESE 則以效果量對標準誤迴歸外推至精確度無限大處。
這些方法在不同情境下表現不一,且對同一資料常給出不一致的結論。誠實的做法是同時報告多種方法,並把它們的分歧本身視為對結論穩健性的一種訊息,而非挑選最合意的一種。
這套工具箱的一個核心教訓,是沒有任何單一方法能可靠地「修正」發表偏誤。每一種方法都以一組假設換取校正,而這些假設在真實的異質存在時往往難以與偏誤區辨,因為漏斗圖的不對稱既可能來自發表偏誤、也可能來自小研究本身的系統性差異。因此,發表偏誤的分析應被理解為敏感度分析,即評估「若存在偏誤,結論會如何改變」,而非給出一個確定的校正值。這一謹慎的立場,也把本章與第三十六章相接:發表偏誤的制度成因與其透過預先註冊、結果中性發表等開放科學實踐的根本改革,屬第三十六章的範疇,本章則負責其統計的偵測與校正。
心理計量後設分析:校正測量的傷
後設分析在心理學中有一項為其他學科所無的獨特貢獻,即對測量瑕疵的校正。在 Hunter 與 Schmidt 所發展的心理計量後設分析(psychometric meta-analysis)傳統中,觀測到的效果量被視為受到一系列人為誤差(artifacts)的系統性壓低,其中最重要的兩項是測量的不完全信度與樣本的全距限縮。
第五章已指出,測量誤差會使觀測相關系統性地低於真實構念間的相關,此即衰減。若預測變項與效標的信度分別為 r_{xx} 與 r_{yy},則構念層次的真實相關 \rho 與觀測相關 r 的關係為
Hunter-Schmidt 傳統把這一衰減校正系統地應用於後設分析:當各研究報告了其信度時,可對每一觀測效果量個別校正,再整合校正後的效果量;當個別信度不全時,則以人為誤差分布法(artifact distribution),以信度的分布資訊對整體進行校正。全距限縮的校正邏輯與此平行,即以限縮比例還原未受限縮母體中的相關。
心理計量後設分析的立場,是主張整合的目標應是構念層次的真實效果,而非受測量瑕疵污染的觀測效果,因此校正是必要而非可選的。這一立場有其力量,但也招致批評與晚近的重估,其中效度概化中全距限縮校正的合理性,尤其成為進行中的辯論焦點:校正所依賴的信度與限縮估計本身帶有不確定性,過度或不當的校正可能把觀測效果推高到難以驗證的程度。本書的立場是,衰減與限縮校正是揭示構念層次關係的有力工具,但每一次校正都引入了額外的假設與不確定性,因此校正的結果應與未校正的結果並陳,並清楚交代校正所依賴的信度與限縮資訊的來源與品質。
信度概化與效度概化
心理計量後設分析的邏輯,還可反過來施加於測量工具本身的性質。傳統上,信度常被誤認為測驗的固定屬性,彷彿某量表就是「信度 0.85 的量表」。這是一個概念錯誤:信度是特定樣本上分數的性質,會隨施測的人群與情境而變。信度概化(reliability generalization),由 Vacha-Haase (1998) 提出,即以後設分析的方法系統地檢視同一工具的信度係數如何在不同研究間變異、以及哪些研究特徵預測了這種變異。這把第六章「信度屬於分數而非測驗」的原則,提升為一個可跨研究量化檢視的實證問題。
與此平行的是效度概化(validity generalization)。工商心理學早期曾盛行一種悲觀的看法,認為測驗的效標關聯效度因情境而異、難以跨情境推廣,即所謂的情境特定性假說。Hunter 與 Schmidt 傳統的一項重要主張是,一旦校正了各研究間因抽樣誤差、信度差異與全距限縮所造成的人為變異,效度係數的跨情境變異往往大幅縮小,顯示效度其實比表面看來更能推廣,此即效度概化。這一主張對測驗的實務使用影響深遠,但如前節所述,其所依賴的校正近年正受到重新檢視。效度概化因而既是心理計量後設分析的一項重要成就,也是一個方法論辯論仍在進行的領域,其與第七章效度論證的關係在於,它把效度的跨情境穩定性從一個信念轉化為一個可經整合分析檢驗的命題。
MASEM:整合出一個結構模型
後設分析的旨趣,未必止於單一效果量的整合。當研究興趣在於多個變項之間的結構關係時,後設分析可與結構方程模型結合,成為後設分析結構方程模型(meta-analytic structural equation modeling, MASEM)。其基本構想是分兩階段進行:先以後設分析整合各研究所報告的相關係數,得到一個彙整的相關矩陣;再以此彙整矩陣為輸入,估計一個結構方程模型。Cheung (2015) 對 MASEM 的統一框架與其在結構方程環境下的實作有系統的處理。
MASEM 的價值,在於它使研究者能檢驗任何單一研究都未曾完整估計過的結構模型。個別研究常只報告部分變項的相關,透過跨研究的整合,MASEM 得以拼湊出一個完整的相關矩陣,從而估計一個涵蓋所有變項的路徑或因素模型。然而,MASEM 也繼承了後設分析與結構方程雙方的挑戰,即彙整的相關矩陣須妥善處理研究間的異質與缺失的變項組合,而第二階段的結構模型則須滿足第十六章所論的識別與適配要求。MASEM 因而代表了本書兩條主線的又一次匯流,即研究整合與潛在變項結構建模的結合,其技術細節倚賴第十六章的結構方程方法。
後設分析與開放科學
後設分析與開放科學運動有著深刻的親和性,因為前者的品質,根本地取決於後者所倡導的透明與可得。一個高品質的後設分析,本身就應遵循開放科學的規範:預先註冊其檢索策略、納入準則與分析計畫,以避免在整合過程中的研究者自由度;完整報告檢索與篩選的流程;並公開其資料與分析程式碼,使結果可被重製。後設分析的可重製性,如今已被視為其可信度的一部分,而 Viechtbauer (2010) 的 metafor 等開放工具的普及,正大幅降低了透明後設分析的門檻。
更深一層地,後設分析與開放科學的匯流,催生了一種嶄新的研究形態,即把後設分析的邏輯前置到研究設計之中。傳統後設分析是對既有文獻的事後整合,因而無可避免地受制於文獻的偏誤與異質;而大團隊科學(big team science),如多實驗室的協同複製計畫,則是預先協調眾多實驗室以共同的方案執行同一研究,其結果本質上就是一個「設計出來的後設分析」,從源頭上免除了發表偏誤、並以刻意的變異來估計效果的異質與其邊界條件。這一發展把研究整合從一種事後的補救,轉化為一種前瞻的設計哲學,也預示了下一章與第三十六章所將深入的計算與開放科學主題。
小結
本章把推論的單位從單一研究提升到整個研究群體,系統地處理了後設分析與研究整合。核心上,後設分析以逆變異數加權整合效果量,並在固定與隨機效果兩種模型間作出根本的區分,前者問「這批研究的共同效果」,後者問「效果分布的平均」。異質性的量化,須小心區辨 Q 的顯著、I^2 的比例性質與 \tau^2 及預測區間的絕對意義,並把異質理解為承載調節訊息的發現而非須消除的麻煩。方法上,本章處理了調節變項的後設迴歸及其生態謬誤與檢定力限制、相依效果量的多層次與穩健變異數取向、以及發表偏誤這一充滿方法分歧、只能以敏感度分析態度面對的領域。
在心理計量的維度上,本章闡明了後設分析所特有的貢獻,即以衰減與全距限縮校正逼近構念層次的真實效果,並把信度與效度提升為可跨研究檢視的概化問題,同時誠實面對這些校正近年所受的重估。MASEM 則把研究整合與結構方程結合,使跨研究的結構模型成為可能。最後,後設分析與開放科學的匯流,把研究整合從事後的補救推向前瞻的設計,預示了大團隊科學這一新形態。貫穿全章的核心訊息是,知識的累積不是研究的堆疊,而是一項需要嚴謹方法的推論工程,其誠實,既在於整合證據,也在於正視證據本身可能被扭曲的方式。下一部將轉入計算取向與學科的未來,首先是為不確定性提供統一表徵的貝氏方法。