後設分析與研究整合
=1.5em
單一研究幾乎從不是定論。任一項研究都受限於其特定的樣本、操作、情境與隨機誤差,其效果估計必然帶有可觀的不確定性。行為科學的知識,因而不是建立在任何一項決定性的實驗之上,而是在眾多研究的累積與整合之中逐步浮現。本章要處理的,正是如何把推論的單位從單一研究提升到整個研究群體,即以系統而量化的方法整合眾多研究的證據,估計效果的集中趨勢、刻畫其分布的異質、並診斷可能扭曲此一累積歷程的偏誤。這門技藝統稱後設分析(meta-analysis)與研究整合(research synthesis)。
本章與第八、九章共同構成一條「雙層推論」的敘事線:第八、九章處理的是「從一個樣本推論到一個母體」的第一層推論,本章則處理「從一群研究推論到一個效果的分布」的第二層推論。
全章的展開如下:先以心理治療效果的歷史論戰帶出後設分析的緣起,論證敘事性回顧與計票法的不足;再建立效果量整合的核心機制,即逆變異數加權、固定與隨機效果模型的根本區別、以及異質性的量化與詮釋;接著處理調節變項分析、相依效果量、以及發表偏誤的診斷與校正;最後轉向心理計量所特有的貢獻,即測量誤差的校正、信度與效度概化、以及後設分析結構方程模型,並以後設分析與開放科學的匯流收束。
為使討論具體,全章以兩條實例並行。一是「成長型思維介入的效果」這一領域,從樂觀宣稱到大型後設分析、再到異質性與調節之爭的完整軌跡,用以呈現一個研究文獻如何在整合的檢視下被改寫。二是一個假設性的數值範例,即整合三十項「正念介入對焦慮」的隨機分派研究,用以在每一個技術環節上給出具體數字,讓權重與異質性指標的意義能被讀出來,而不只是被定義。
一場關於「心理治療有沒有效」的戰爭
後設分析的誕生,與一場具體的學術論戰緊密相連。二十世紀中葉,關於心理治療是否真正有效的爭論僵持不下,各方各自援引支持己方的研究,而文獻的浩繁與結論的分歧,使任何以敘事方式進行的回顧都難以服人。Glass (1976) 的突破,在於他主張把每一項研究的結果化約為一個共同尺度上的效果量,再對這些效果量本身進行統計分析,並為這種「對分析結果的分析」創造了後設分析一詞。當他與同僚以此法整合了數百項心理治療研究、得出治療確有中等效果的結論時,後設分析作為一種研究方法的力量便昭然若揭。
這段歷史揭示了後設分析的根本精神,即它把文獻本身當作資料,把個別研究當作觀測。此一精神在不同學科中平行地發展:Hedges & Olkin (1985) 為後設分析奠定了嚴謹的統計基礎,Hunter 與 Schmidt 在工商心理學中發展出強調測量誤差校正的平行傳統((Schmidt & Hunter, 2015)),而 Cochrane 協作組織則把後設分析制度化為實證醫學的基石。晚近的再現性危機,更把發表偏誤的偵測方法推上了前台。後設分析因而不僅是一套統計技術,更是一種把科學知識的累積本身納入量化檢視的方法論立場。
為何不能用計票法
在後設分析的嚴謹方法確立之前,整合多項研究最直觀的做法是計票法(vote counting):數一數有多少研究得到顯著的正效果、多少得到不顯著或負效果,再以多數決定論。這個看似合理的做法,其實暗藏一個嚴重且違反直覺的統計缺陷。單一研究是否達到顯著,同時取決於效果的真實大小與該研究的檢定力,而檢定力又高度依賴樣本數。當多數研究的樣本偏小、檢定力偏低時,即使真實效果確實存在,多數研究仍可能得不到顯著結果,計票法因而會錯誤地得出「無效果」的結論。
更嚴重的是,計票法的這一偏誤不會隨研究數目的增加而消失,反而可能惡化。這是因為它拋棄了每項研究中最寶貴的量化資訊,即效果量的大小與精確度,而只保留了「是否顯著」這個被檢定力嚴重污染的二元訊號。後設分析的根本改進,正在於它不數票,而是估計效果量並依其精確度加權整合,從而納入每項研究的完整資訊。整合證據不是顯著結果的多數表決,而是效果量的加權綜合。
效果量的萃取與轉換
後設分析的分析單位是效果量(effect size),即以一個標準化的尺度表徵研究結果的量,其定義系譜已在第九章鋪陳。整合的第一步,是把來自不同研究、以不同統計量報告的結果,轉換為一個共同的效果量尺度。常見的尺度包括標準化平均數差異(如 Cohen’s d 或偏誤校正的 Hedges’ g)、相關係數(常經 Fisher z 轉換以穩定變異)、以及勝算比或風險比等。這一萃取與轉換的工作看似機械,實則充滿判斷:原始研究的報告往往不完整,須由不完整的統計量反推效果量及其變異,而每一次反推都可能引入誤差。
一個常被忽略卻關鍵的問題是效果量的相依性。同一項研究常報告多個效果量,例如對多個結果變項、多個時點、或多個分組分別報告,這些效果量因共享同一批受試者而彼此相關,違反了標準後設分析對效果量獨立的假定。天真地把它們當作獨立觀測納入,會低估標準誤、虛增精確度。以「成長型思維介入」為例,一項研究可能同時報告對數學與語文成績的效果,此二者顯然相依,如何處理這類相依,是後文相依效果量一節的主題。
固定與隨機:兩種提問
後設分析的核心,是把眾多研究的效果量整合為一個總結。既然要整合,第一個必須回答的問題就是每項研究該有多大的發言權。把各研究的效果量直接平均並不合理,因為一項只有二十人的前導研究與一項一千人的多校試驗,對真實效果所提供的資訊量相差懸殊,簡單平均卻對兩者一視同仁。合理的做法是加權,而權重應當反映精確度:估計愈精確的研究,權重愈大。至於精確度如何量化、加權後所指向的估計標的又是什麼,取決於一個根本的抉擇,即固定效果模型與隨機效果模型,二者並非計算細節的差異,而是回答了兩個根本不同的問題。讀完本節應能說出這兩個問題各是什麼,以及在什麼樣的研究情境下該問哪一個。
設 k 項研究的效果量估計為 \hat\theta_1,\dots,\hat\theta_k,各自的抽樣變異為 v_1,\dots,v_k。整合估計為加權平均 \hat\theta = \sum_i w_i\hat\theta_i / \sum_i w_i。可證明,使整合估計變異最小的權重,正是各研究變異的倒數:
此即逆變異數加權(inverse-variance weighting)。其精神是讓精確(樣本大、變異小)的研究得到較大的發言權。
固定效果模型假定所有研究共享單一的真實效果 \theta,研究間的差異純由抽樣誤差造成,其權重為 w_i = 1/v_i,估計標的是「這個共同效果」。隨機效果模型則假定各研究的真實效果本身即為一分布 \theta_i\sim N(\mu,\tau^2),研究間差異來自抽樣誤差與真實效果的異質 \tau^2,其權重為
估計標的是「效果分布的平均 \mu」。二者的區別因而是實質的:固定效果問「這批研究的共同效果是多少」,隨機效果問「效果在研究母體中的平均是多少」,後者所推論的對象超出了手上的這批研究。
權重的差別有多大,用數字最容易看清楚。設想要整合三十項關於正念介入對焦慮之效果的隨機分派研究,效果量以 Hedges’ g 表示,正值代表介入組焦慮下降的幅度大於對照組。其中一項小型研究每組二十五人,得到 g=0.62,抽樣變異約為 v=0.084;另一項大型研究每組一百五十人,得到 g=0.28,抽樣變異約為 v=0.014。在固定效果模型下,權重是變異的倒數,兩者分別約為 12 與 74,大研究的發言權是小研究的六倍。但若研究間確有異質,且估得 \tau^2=0.06,隨機效果的權重便成為 1/(0.084+0.06)\approx 7 與 1/(0.014+0.06)\approx 14,差距縮為兩倍。\tau^2 在此像是加在每一項研究上的一層共同的不確定性,它稀釋了大研究的精確度優勢,因為再大的樣本也無法消除「這個場域本來就和別的場域不同」這件事。
這一區別有直接的實務後果。如上例所示,隨機效果模型不但重新分配了權重,其信賴區間也較寬,反映了對「效果本身有變異」這一事實的誠實承認。在行為科學中,研究幾乎總是在不同人群、操作與情境下進行,真實效果全然同質的假定往往不切實際,因此隨機效果模型通常是較合理的預設。然而,隨機效果模型的推論效力仰賴對 \tau^2 的良好估計,而當研究數目偏少時,\tau^2 本身即難以精確估計,這是後文須正視的限制。
異質性:把分歧變成資訊
隨機效果模型承認了效果的異質,但承認之後還得回答一個更難的問題:這份異質究竟有多大。前一節的 \tau^2 只是模型裡的一個參數,若不把它翻譯成可以理解的語言,讀者仍然無從判斷「效果會因研究而異」這句話到底意味著什麼,也無從判斷手上這個整合估計能不能拿去指導下一個場域的決策。本節要建立的,正是量化並詮釋這份異質的一整套工具,以及使用這些工具時最常見的誤讀。
異質性不是需要被消除的麻煩,而是承載實質訊息的發現:若不同研究得到系統性不同的效果,這本身就提示了某些調節因素在起作用。量化異質性的工具彼此角色不同,須小心地區分三件事:異質是否存在(統計顯著)、異質佔了多少比例(相對指標)、以及異質的絕對大小有多少(絕對指標)。混淆這三者,是後設分析報告中最常見的錯誤之一。
Cochran 的 Q 統計量衡量觀測到的研究間變異相對於純抽樣誤差的期望:
在效果同質的虛無假設下,Q 漸近服從自由度 df = k-1 的卡方分布,故 E[Q]=df。Q 的顯著檢定告訴我們異質是否存在,但其檢定力隨研究數與樣本數變化,故不宜作為異質「大小」的指標。Higgins & Thompson (2002) 提出的 I^2 把異質表為比例:
即總變異中歸因於真實異質(而非抽樣誤差)的比例。須強調,I^2 是比例而非絕對量,I^2 高不代表效果的絕對散布大,它會隨研究內樣本數增大而升高。刻畫異質絕對大小的,是 \tau^2 本身,其常用的動差估計為 DerSimonian & Laird (1986) 法。真正對讀者最有用的報告,往往是預測區間(prediction interval),即約 \hat\mu \pm t\sqrt{\hat\tau^2 + \mathrm{SE}^2},它直接回答「下一項研究的真實效果大約落在哪個範圍」,把異質的實質後果攤在眼前。
I^2 的誤用在文獻中極為普遍,最常見的是把高 I^2 逕自解讀為「效果散布很大」,本節稍後將以具體數字說明這個解讀何以站不住腳。異質性的報告因而不應止於一個 I^2 數字。以成長型思維為例,若平均效果雖為正、預測區間卻橫跨零,便意味著介入在某些情境下可能無效甚至有害。
回到那三十項正念介入的研究,設想整合後得到隨機效果的平均 \hat\mu=0.42,其 95\% 信賴區間為 [0.31,\,0.53],異質性指標則為 Q=90(df=29)、I^2=68\%、\tau^2=0.06,亦即 \hat\tau=0.24。這組數字該怎麼讀?信賴區間 [0.31,\,0.53] 回答的是「效果分布的平均落在哪裡」,看起來相當穩固;但預測區間約為 [-0.09,\,0.94],回答的是「在一個新的場域再做一項研究,其真實效果大概落在哪裡」,卻橫跨了零。同一批資料,兩個區間給出的實務訊息截然不同:平均而言正念介入有中等偏小的正向效果,但要斷言它在下一所學校、下一間臨床機構必定有效,證據並不支持。對於「該不該在自己的機構推這個介入」這個真正被關心的問題,預測區間才是對應的答案。
I^2=68\% 又該如何理解?它說的是總變異中約有七成來自真實的異質、三成來自抽樣誤差,這是一個比例,並沒有說散布的絕對幅度有多大。若把這三十項研究的樣本數各放大十倍,真實效果的散布 \tau^2 完全不變,I^2 卻會攀升到九成以上,因為抽樣誤差被壓小了,比例的分母也隨之縮小。反過來說,一批全是小樣本的研究即使真實效果幾乎一致,I^2 也可能低到接近零。I^2 因此不是異質的大小,而是異質相對於雜訊的可見度。真正把異質的實質後果攤開來的,是 \hat\tau=0.24 這個與效果量同尺度的數字,以及由它算出的預測區間。
調節變項與後設迴歸
異質性一旦被確認,隨之而來的問題是「什麼解釋了效果的差異」。調節變項分析(moderator analysis)與後設迴歸(meta-regression)即為此而設:以研究層次的特徵(如樣本的年齡、介入的劑量、實施的品質、發表年份)為預測變項,解釋效果量的研究間變異。就成長型思維而言,一個核心的爭論正是調節性的,即介入是否對特定次群體,如社經地位較低或學業風險較高的學生,效果較強。Sisk et al. (2018) 的大型後設分析,正是透過調節分析揭示了整體效果雖弱、但在若干高風險次群體中可能較為明顯的複雜圖像。
後設迴歸雖強大,卻有兩個必須警覺的陷阱。其一是研究層次的混淆與生態謬誤:調節變項是研究的屬性而非個體的屬性,故後設迴歸所揭示的是研究間的關聯,不能逕自推論到個體層次,否則即犯下第二十八章所論的生態謬誤。例如「平均年齡較大的研究效果較強」,不等於「年紀較大的個體效果較強」。其二是檢定力的現實:後設迴歸的樣本單位是研究而非個體,而研究數往往只有數十,故其偵測調節效果的檢定力通常偏低,且極易因少數具影響力的研究而不穩。調節分析因而應被視為探索性的線索,而非確證性的結論,其發現須以理論與後續研究審慎對待。
相依效果量與多層次後設分析
前述模型皆假定各效果量彼此獨立,但如前所述,同一研究常提供多個相依的效果量。忽略此相依會低估標準誤、誇大精確度與顯著性。處理相依有兩條主要路徑。其一是多層次後設分析(multilevel meta-analysis),它把效果量視為巢狀於研究之內的兩層(或更多層)結構,直接以第二十八章的多層次框架建模,在研究層與效果量層分別設定變異成分,從而正確地分離不同層次的異質。其二是穩健變異數估計(robust variance estimation, RVE),由 Hedges et al. (2010) 發展,它不對相依的具體結構作強假設,而以類似群集穩健標準誤的方式校正整合估計的變異,對相依結構的設定錯誤較具穩健性。
兩條路徑各有所長。多層次取向能明確估計各層次的異質、並支持對效果量層調節變項的分析,但須對相依結構作較多假定;穩健變異數估計則以最少的假定換取對相依的穩健處理,尤其適合相依結構複雜或未知的情形,近年已成為處理相依效果量的主流建議之一。二者並非互斥,晚近的實務常將穩健變異數估計與多層次模型結合,兼取兩者之長。這一發展再次體現了本書反覆出現的主題,即依賴結構既是統計的挑戰,也是承載訊息的來源。
發表偏誤:診斷與校正的工具箱
後設分析最深刻的威脅,是它所整合的文獻本身可能是有偏的樣本。若顯著或符合預期的結果較易被發表,而不顯著的結果被留在檔案抽屜裡,則可得的文獻會系統性地高估效果,此即發表偏誤(publication bias)。由於後設分析只能分析已發表(或可尋得)的研究,這一偏誤直接威脅其結論的效度。文獻已發展出一整套診斷與校正的工具,摘要於下面的概念方塊。
偵測與校正發表偏誤的方法眾多,各有假設與限制,彼此的結論未必一致:
漏斗圖(funnel plot):以效果量對精確度作圖,對稱則暗示無偏,不對稱則可疑;但不對稱也可能源於真實的異質。
Egger 檢定((Egger et al., 1997)):以迴歸形式化漏斗圖不對稱的檢定,但檢定力有限且易受異質干擾。
修剪填補(trim and fill,(Duval & Tweedie, 2000)):以對稱性假設補入「缺失」的研究再重估,直觀但在真異質下可能誤導。
選擇模型(selection model,(Vevea & Hedges, 1995)):明確建模「結果是否被發表取決於其 p 值」的選擇歷程,理論上較嚴謹但需較多假設與研究數。
p-曲線與 PET-PEESE:Simonsohn et al. (2014) 的 p-曲線由顯著結果的 p 值分布推斷證據價值,PET-PEESE 則以效果量對標準誤迴歸外推至精確度無限大處。
這些方法在不同情境下表現不一,且對同一資料常給出不一致的結論。誠實的做法是同時報告多種方法,並把它們的分歧本身視為對結論穩健性的一種訊息,而非挑選最合意的一種。
工具之間的不一致有多大,看數字最清楚。仍以那三十項正念介入的研究為例,設想漏斗圖明顯不對稱:標準誤大於 0.25 的十二項小研究平均效果為 0.61,標準誤小於 0.12 的八項大研究平均卻只有 0.24,Egger 檢定得到 p=0.02。修剪填補法補入七項「缺失」研究,把整合估計由 0.42 拉低到 0.26;PET-PEESE 外推到標準誤為零之處,得到更低的 0.18;選擇模型則因研究數只有三十而不易穩定,給出居中的 0.31。三種校正給出的答案由 0.18 到 0.31 不等,最重者把效果砍掉超過一半,而這樣的分歧本身就是結論。
這套工具箱的一個核心教訓,是沒有任何單一方法能可靠地「修正」發表偏誤。每一種方法都以一組假設換取校正,而這些假設在真實的異質存在時往往難以與偏誤區辨,因為漏斗圖的不對稱既可能來自發表偏誤、也可能來自小研究本身的系統性差異。因此,發表偏誤的分析應被理解為敏感度分析,即評估「若存在偏誤,結論會如何改變」,而非給出一個確定的校正值。這一謹慎的立場也把本章與第三十六章相接:發表偏誤的制度成因,以及預先註冊、結果中性發表等根本改革,屬該章的範疇,本章則負責統計層面的偵測與校正。
心理計量後設分析:校正測量的傷
前面幾節所整合的,都是各研究「觀測到」的效果量。但本書自第五章起便反覆說明,觀測分數不等於構念:量表帶有誤差,而拿到手的樣本也未必是真正想推論的那個母體。這意味著即使把三十項研究整合得再精確,得到的仍然是三十次「被測量瑕疵打了折」的效果的平均,而不是構念與構念之間真正的關聯。後設分析在心理學中因而有一項為其他學科所無的獨特貢獻,即對測量瑕疵的校正。
在 Hunter 與 Schmidt 所發展的心理計量後設分析(psychometric meta-analysis)傳統中,觀測到的效果量被視為受到一系列人為誤差(artifacts)的系統性壓低,其中最重要的兩項是測量的不完全信度與樣本的全距限縮:前者使觀測相關低於構念相關,後者則因研究樣本的變異小於母體而進一步壓縮相關。本節要說明的,是這兩項校正各自在做什麼、買到了什麼,又付出了什麼代價。
第五章已指出,測量誤差會使觀測相關系統性地低於真實構念間的相關,此即衰減。若預測變項與效標的信度分別為 r_{xx} 與 r_{yy},則構念層次的真實相關 \rho 與觀測相關 r 的關係為
Hunter-Schmidt 傳統把這一衰減校正系統地應用於後設分析:當各研究報告了其信度時,可對每一觀測效果量個別校正,再整合校正後的效果量;當個別信度不全時,則以人為誤差分布法(artifact distribution),以信度的分布資訊對整體進行校正。全距限縮的校正邏輯與此平行,即以限縮比例還原未受限縮母體中的相關。
校正的幅度可以非常可觀。設想在企業甄選的脈絡下整合四十項研究,探討結構化面試分數與主管績效評等的關係,觀測相關的加權平均為 r=0.28。面試分數的信度約為 r_{xx}=0.80,而主管評等的評分者間信度通常偏低,假定為 r_{yy}=0.52。代入衰減校正,0.28/\sqrt{0.80\times 0.52}\approx 0.43。若再計入全距限縮,即這些研究的受試者都是已被錄取者、其面試分數的標準差僅約申請者母體的七成,校正後可再升到約 0.57。把數字讀出來:r=0.28 意味著面試分數只能解釋績效變異的百分之八,\rho=0.57 卻意味著三成二。同一批資料,對「結構化面試值不值得做」所給出的實務結論因而全然不同。校正的合理性之所以成為激烈辯論的焦點,正在於它牽動的不只是一個係數,而是一項人事決策工具的存廢。
心理計量後設分析的立場,是主張整合的目標應是構念層次的真實效果,而非受測量瑕疵污染的觀測效果,因此校正是必要而非可選的。這一立場有其力量,但也招致批評與晚近的重估,其中效度概化裡全距限縮校正的合理性尤其成為辯論焦點,因為校正所依賴的信度與限縮估計本身即帶有不確定性。本書的立場是,衰減與限縮校正是揭示構念層次關係的有力工具,但每一次校正都引入了額外的假設與不確定性,因此校正的結果應與未校正的結果並陳,並清楚交代校正所依賴的信度與限縮資訊的來源與品質。
信度概化與效度概化
心理計量後設分析的邏輯,還可反過來施加於測量工具本身的性質。傳統上,信度常被誤認為測驗的固定屬性,彷彿某量表就是「信度 0.85 的量表」。這是一個概念錯誤:信度是特定樣本上分數的性質,會隨施測的人群與情境而變。信度概化(reliability generalization),由 Vacha-Haase (1998) 提出,即以後設分析的方法系統地檢視同一工具的信度係數如何在不同研究間變異、以及哪些研究特徵預測了這種變異。這把第六章「信度屬於分數而非測驗」的原則,提升為一個可跨研究量化檢視的實證問題。
設想蒐集六十項使用同一份憂鬱量表的研究,所報告的 \alpha 由 0.79 到 0.94,臨床樣本平均為 0.91、大學生樣本則為 0.84。差距不難理解:臨床樣本的憂鬱分數散布較大,真分數變異的佔比較高,信度自然較高。這對後設分析有直接後果,因為衰減校正的分母正是信度,若一律沿用手冊上的單一數字,校正幅度便會系統性地偏誤。
與此平行的是效度概化(validity generalization)。工商心理學早期曾盛行一種悲觀的看法,認為測驗的效標關聯效度因情境而異、難以跨情境推廣,即所謂的情境特定性假說。Hunter 與 Schmidt 傳統的一項重要主張是,一旦校正了各研究間因抽樣誤差、信度差異與全距限縮所造成的人為變異,效度係數的跨情境變異往往大幅縮小,顯示效度其實比表面看來更能推廣,此即效度概化。
這一主張對測驗的實務使用影響深遠,但如前節所述,其所依賴的校正近年正受到重新檢視。效度概化因而既是心理計量後設分析的一項重要成就,也是一個方法論辯論仍在進行的領域。它與第七章效度論證的接點在於,把效度的跨情境穩定性從一個信念轉化為可經整合分析檢驗的命題。
MASEM:整合出一個結構模型
後設分析的旨趣,未必止於單一效果量的整合。當研究興趣在於多個變項之間的結構關係時,後設分析可與結構方程模型結合,成為後設分析結構方程模型(meta-analytic structural equation modeling, MASEM)。其基本構想是分兩階段進行:先以後設分析整合各研究所報告的相關係數,得到一個彙整的相關矩陣;再以此彙整矩陣為輸入,估計一個結構方程模型。Cheung (2015) 對 MASEM 的統一框架與其在結構方程環境下的實作有系統的處理。
MASEM 的價值,在於它使研究者能檢驗任何單一研究都未曾完整估計過的結構模型。設想要檢驗「正念介入透過降低反芻思考而減輕焦慮」這個中介模型,同時報告三個變項完整相關的研究只有十二項,樣本數合計不足以穩定估計中介效果;但逐對來看,介入與焦慮有二十八項研究可用、介入與反芻有二十五項、反芻與焦慮有三十項。MASEM 的第一階段便是分別整合這三個相關以拼出彙整矩陣,第二階段再據以估計中介模型。原本任何單一研究都無法回答的問題,於是在跨研究的層次上被回答了。
然而,MASEM 也繼承了後設分析與結構方程雙方的挑戰,即彙整的相關矩陣須妥善處理研究間的異質與缺失的變項組合,而第二階段的結構模型則須滿足第十六章所論的識別與適配要求。MASEM 因而代表了本書兩條主線的又一次匯流,即研究整合與潛在變項結構建模的結合,其技術細節倚賴第十六章的結構方程方法。
後設分析與開放科學
後設分析與開放科學運動有著深刻的親和性,因為前者的品質,根本地取決於後者所倡導的透明與可得。一個高品質的後設分析,本身就應遵循開放科學的規範:預先註冊其檢索策略、納入準則與分析計畫,以避免在整合過程中的研究者自由度;完整報告檢索與篩選的流程;並公開其資料與分析程式碼,使結果可被重製。後設分析的可重製性,如今已被視為其可信度的一部分,而 Viechtbauer (2010) 的 metafor 等開放工具的普及,正大幅降低了透明後設分析的門檻。
更深一層地,後設分析與開放科學的匯流,催生了一種嶄新的研究形態,即把後設分析的邏輯前置到研究設計之中。傳統後設分析是對既有文獻的事後整合,因而無可避免地受制於文獻的偏誤與異質;而大團隊科學(big team science),如多實驗室的協同複製計畫,則是預先協調眾多實驗室以共同的方案執行同一研究,其結果本質上就是一個「設計出來的後設分析」,從源頭上免除了發表偏誤、並以刻意的變異來估計效果的異質與其邊界條件。這一發展也預示了下一章與第三十六章所將深入的計算與開放科學主題。
小結
本章把推論的單位從單一研究提升到整個研究群體。核心上,後設分析以逆變異數加權整合效果量,並在固定與隨機效果兩種模型間作出根本的區分,前者問「這批研究的共同效果」,後者問「效果分布的平均」。異質性的量化須區辨 Q 的顯著、I^2 的比例性質與 \tau^2 及預測區間的絕對意義,並把異質理解為承載調節訊息的發現而非須消除的麻煩。方法上,本章處理了後設迴歸及其生態謬誤與檢定力限制、相依效果量的多層次與穩健變異數取向、以及發表偏誤這一只能以敏感度分析態度面對的領域。
在心理計量的維度上,本章闡明了後設分析所特有的貢獻,即以衰減與全距限縮校正逼近構念層次的真實效果,並把信度與效度提升為可跨研究檢視的概化問題,同時誠實面對這些校正近年所受的重估。MASEM 則把研究整合與結構方程結合,使跨研究的結構模型成為可能。最後,後設分析與開放科學的匯流,把研究整合從事後的補救推向前瞻的設計,預示了大團隊科學這一新形態。貫穿全章的核心訊息是,知識的累積不是研究的堆疊,而是一項需要嚴謹方法的推論工程。下一部將轉入計算取向與學科的未來,首先是為不確定性提供統一表徵的貝氏方法。