第 8 章 統計推論的基礎與爭議
第三部 統計推論與研究設計的方法基礎
08Chapter

統計推論的基礎與爭議

在所有科學論文之中,大概沒有哪個數字比 p<.05 更常出現、也更常被誤解。研究者以它作為「有沒有效」的判準,審稿人以它作為「能不能發表」的門檻;然而若隨機攔下十位使用它的人,問「p 值究竟是什麼意思」,十個答案裡很可能有九個是錯的。更麻煩的是,教科書裡那套顯著性檢定,其實是兩個哲學上互不相容的統計學派被硬湊在一起的產物,連當初創立它們的人都不會認帳。本章要做三件事:把這段學派恩怨講清楚、把 p 值與信賴區間這些工具「究竟宣稱了什麼」講精確,並說明何以近十年整個領域為它爭論不休。這是第三部分「方法工具箱」的第一章;其後所有的建模,都建立在對推論邏輯的正確理解之上。

本章的一條暗線是:統計推論的多數誤用,都源於同一個方向上的錯誤,也就是把「已知假設、談資料」的機率,偷偷倒轉為「已知資料、談假設」的機率。看清這一逆轉,便能一眼識破大半的統計迷思。

兩個學派的世紀恩怨

多數研究者是這樣學會統計的:算出一個 p 值,看它有沒有小於 .05,小於就寫「達顯著」,大於就寫「未達顯著」。這套程序順手到很少有人停下來問:它是誰訂的,又為什麼是這樣訂的。今日教科書裡的虛無假設顯著性檢定(null hypothesis significance testing, NHST),看似一套渾然天成的標準程序,實則是兩套哲學上互不相容的方法被後人硬縫在一起的結果。本節要交代的正是這段身世:Fisher 那一套在問什麼,Neyman 與 Pearson 那一套又在問什麼,兩者為何無法相容。讀完本節,應能分辨手上的每一次檢定,究竟是在衡量一份資料所提供的證據,還是在執行一套長期的決策規則。

一套來自 Fisher。他的顯著性檢定(significance testing)只有一個虛無假設 H_0,沒有對立假設。研究者算出一個 p 值,以它作為「資料有多不利於 H_0」的連續證據:p 愈小,愈有理由懷疑 H_0。在 Fisher 眼中,統計是一種歸納推論,由這一份資料推論這個世界;他甚至反對把 .05 當成一條死線,認為那只是一個方便的參考點,而非神聖不可侵犯的門檻 (Fisher, 1935)。另一套來自 Neyman & Pearson (1933)。他們的假設檢定(hypothesis testing)是一套決策程序:研究者手上有兩個假設(虛無與對立),事先訂好第一類錯誤率 \alpha 與第二類錯誤率 \beta,然後依資料落在哪個區域,機械地做出「拒絕」或「不拒絕」的決定。這套框架的重點,完全不在「這一份資料有多少證據」,而在「若長期反覆如此決定,犯錯的比率能被壓在多低」。Neyman 稱之為歸納行為(inductive behavior),刻意迴避「證據」這一字眼。

問題正出在這裡。Fisher 談的是「單次實驗的證據」,Neyman-Pearson 談的是「長期決策的錯誤率」,兩者在哲學上根本合不來,而 Fisher 與 Neyman 本人更是針鋒相對、爭執了大半輩子。然而後來的教科書,卻把 Fisher 的 p 值與 Neyman-Pearson 的 \alpha 門檻焊在一起,變成「算個 p 值、看它是否小於 .05」這套人人照做的儀式。Gigerenzer (2004) 辛辣地稱之為「虛無儀式」(null ritual):一套沒有人真正理解、卻人人照著奉行的統計程序。理解這段身世,是看懂其後一切爭議的關鍵。此外還須補充一點:在 Fisher 與 Neyman-Pearson 之外,其實還有第三個傳統,即貝氏取向(第三十三章),它直接計算「假設在資料之下為真的機率」;心理學之所以長期只見前兩者的混血,而少見貝氏,更多是歷史與計算條件使然,而非邏輯上的必然。

p 值到底是什麼(和不是什麼)

p 值大概是本書談到的所有數字裡,被誤讀得最徹底的一個。要把它讀對,得先從直覺講起。假想虛無假設為真,也就是所關切的效果其實並不存在,那麼純因抽樣的隨機起伏,資料仍可能看起來有點差異。p 值回答的正是:在「什麼都沒有」的世界裡,出現像眼前這筆資料一樣誇張、甚至更誇張的結果,機會有多大。機會很小,就表示這筆資料與「什麼都沒有」頗不相容。正式的定義由此而來。p 值是:假設虛無假設為真,得到「與實際觀察一樣極端、或更極端的資料」的機率。它是在 H_0 這個前提之下,關於「資料」的一個機率,而不是關於假設的機率。這一句話若擺對了位置,本節其餘的內容都只是它的推論。

推導方塊p 值的抽樣分配定義

設檢定統計量為 T,其在虛無假設 H_0 下的抽樣分配已知;觀察到的統計量值記為 t_{\text{obs}}。對右尾檢定,p 值定義為

p = P(T \ge t_{\text{obs}} \mid H_0),

即在 H_0 為真時,抽樣分配中「大於或等於觀察值」的那部分機率質量(雙尾檢定則取兩尾)。有兩點關鍵。其一,這個機率是在「H_0 為真」的條件下計算的,因此它不是 H_0 為真的機率。其二,它計入了「比觀察值更極端、但實際上並未發生」的資料。這也是為什麼 p 值會依賴於「原本打算如何蒐集資料、又打算在什麼條件下停止」,因為這些決定了抽樣分配的形狀。

接著把最常見的誤解一次講清楚 (Cohen, 1994; Greenland et al., 2016)。p 值不是「H_0 為真的機率」,它算的是 P(\text{資料} \mid H_0),而非 P(H_0 \mid \text{資料}),兩者截然不同,把它們混同,正是經典的逆機率謬誤。1-p 也不是「對立假設為真的機率」。p 值不是「結果純屬僥倖的機率」。小的 p 值也不代表效果大或重要,因為它同時受效果大小與樣本數影響,樣本一大,微不足道的效果也能擠出極小的 p。p 值更不是「重複實驗會再次顯著的機率」。Greenland et al. (2016) 整理出多達二十餘條環繞 p 值、信賴區間與檢定力的誤解,而這一長串「不是」,其實全都源於同一個根本錯誤,也就是本章開頭所點出的那個方向逆轉。

用一個具體的數字,把這四種誤解各讀一遍。設想某研究比較兩種國中數學補救教學法的成效,兩組各 60 人,最後算出 p=.03。第一,這不表示「兩法無差異」的機率只有 3%,因為 .03 正是在假定兩法確實無差異的前提下算出來的,前提不能同時又被當成結論。第二,這也不表示「兩法確有差異」的機率是 97%,1-p 從來就不是對立假設的機率。第三,它不是「這個結果純屬僥倖的機率為 3%」,因為 .03 描述的是整個「無差異世界」裡極端資料出現的相對頻率,而不是眼前這一次結果的性質。第四,它更不保證重做一次仍會顯著;若效果確實存在但該研究的檢定力只有五成,重做一次得到顯著的機率就是五成,與 .03 這個數字毫無關係。

p 值對抽樣與停止規則的依賴,還有一個影響深遠的實務後果,值得在此點出。同一批資料,若研究者原本打算固定樣本數蒐集,與打算「邊蒐集邊看、顯著就停」,兩者對應的抽樣分配並不相同,因而算出的 p 值也不同。這種未事先聲明的「選擇性停止」(optional stopping),會使名目上的 \alpha 被大幅膨脹,是後文將討論的研究者自由度的一個典型來源,也正是預先註冊(第三十六章)之所以必要的統計理由。

另有一個常被忽略、卻富啟發的性質值得一提:若虛無假設為真且模型正確,p 值本身的分配是均勻分配,也就是在 0 與 1 之間任何一段等長區間出現的機率都相等。這意味著,在虛無為真時,得到 p<.05 的機率恰為 .05,這正是第一類錯誤率的來源;也意味著,若某研究領域反覆出現大量剛好略小於門檻的 p 值,其分配便偏離了均勻,往往是選擇性報告或 p 值篩選留下的統計指紋。這件事可以用數字直接讀出來。設想虛無為真,某人把同一個研究重複做上一萬次:期望中約有五百次落在 p<.05,約有一千次落在 p<.10,而落在 .04 與 .05 之間的次數,會與落在 .90 與 .91 之間的次數大致相同,都是百分之一左右。正因如此,若掃過某一文獻群的 p 值分布,發現 .04 到 .05 這一段異常擁擠,.01 以下反而稀疏,那既不像虛無為真,也不像真效果穩定存在,倒比較像是有人反覆微調分析,直到剛好跨過門檻為止。至於單尾與雙尾之別,則反映對立假設是否指定了方向:單尾檢定把全部的 \alpha 押在一側,方向猜對時檢定力較高,猜錯時卻完全無法偵測,因此除非有堅實的事前理由,一般以雙尾作為較穩健的預設。

收攏成一句話:p 值衡量的是資料與虛無假設的不相容程度,且只在事先講好抽樣與停止規則之後才有意義。下一節要問的是,這套檢定長期運作會犯哪幾種錯。

兩類錯誤、檢定力與顯著結果的可信度

上一節把 p 值本身講清楚了,但只知道單一檢定會不會顯著,還不足以判斷一項研究可不可信。真正該問的是:這套程序長期運作會犯哪幾種錯、各以多高的頻率發生,而當一篇論文寫下「達顯著」三個字時,它為真的機會又有多大。Neyman-Pearson 這一套雖然被誤用得厲害,卻有一項實實在在的貢獻:它迫使研究者正視兩種會犯的錯。第一類錯誤(Type I error),是「H_0 其實為真,卻拒絕了它」,也就是無中生有的偽陽性,犯錯機率記為 \alpha。第二類錯誤(Type II error),是「H_0 其實為假,卻未能拒絕它」,也就是視而不見的偽陰性,機率記為 \beta。而 1-\beta,即檢定力(power):當效果真的存在時,能成功偵測到它的機率。

這裡有幾個要點。其一,\alpha 與 \beta 之間存在取捨:把顯著門檻訂得愈嚴(\alpha 愈小),愈不易偽陽性,卻也愈易偽陰性(\beta 變大)。其二,檢定力由三者共同決定,即效果大小、樣本數與 \alpha;效果愈大、樣本愈多,愈易偵測,這三者與檢定力的定量關係,是下一章樣本數規劃的主題。其三,也最易被忽略:\alpha、\beta 這些機率,唯有置於「長期反覆」的框架下才有意義,它們講的是「這套程序長期的犯錯比率」,而非「手上這一次結論為真的機率」。把「這個檢定的 \alpha 是 .05」理解成「這次結論有 95% 是對的」,又是一次偷換條件。

由此帶出一個對整個領域極為關鍵、卻長期被忽略的問題:一個顯著的結果,究竟有多大機率是真的?答案並不是 1-\alpha,而取決於三件事的交互作用,即 \alpha、檢定力,以及所檢驗之假設事前為真的比率。這一邏輯可用陽性預測值(positive predictive value)來刻畫。

推導方塊顯著結果為真的機率

設在某研究領域中,所檢驗的假設事前為真的比率(先驗勝算對應的比例)為 \pi。在為真的假設裡,被正確判為顯著的比率為檢定力 1-\beta;在為假的假設裡,被錯誤判為顯著的比率為 \alpha。於是,一個「顯著」結果實際為真的機率為

\mathrm{PPV} = \frac{(1-\beta)\,\pi}{(1-\beta)\,\pi + \alpha\,(1-\pi)}.

以一個並不極端的情境代入:\alpha=.05、檢定力 1-\beta=.5、而某領域真假設僅占 \pi=.2,則

\mathrm{PPV} = \frac{.5 \times .2}{.5 \times .2 + .05 \times .8} = \frac{.10}{.14} \approx .71,

亦即約有三成的「顯著發現」其實是偽陽性。若檢定力更低、或所探索的假設更為投機(\pi 更小),這個比率會急遽惡化。

這個公式最違反直覺之處,在於「顯著」的可信度竟取決於一件與手上資料無關的事,也就是所處領域裡假設事前為真的比率 \pi。同樣固定 \alpha=.05、檢定力 .5:若某團隊長年深耕一個理論成熟的題目,所提假設十之八九為真,\pi=.8,則顯著結果為真的機率為 .5\times.8/(.5\times.8+.05\times.2)\approx.98;若換成一個廣撒網的探索性研究,一百個假設裡只有五個為真,\pi=.05,在完全相同的 \alpha 與檢定力之下,顯著結果為真的機率只剩 .5\times.05/(.5\times.05+.05\times.95)\approx.34。兩份研究報出的 p 值可能一模一樣,可信度卻相差近三倍。換言之,假設從哪裡來、理論根據有多紮實,本身就是統計問題。

這正是 Ioannidis (2005) 那篇著名論文的核心論證:在檢定力偏低、探索性假設眾多、又充斥研究者自由度的領域,多數「顯著發現」很可能為偽。Cohen 數十年來反覆提醒的檢定力赤字,因此不只是效率問題,更直接侵蝕了顯著結果的可信度:檢定力不足的研究,即使得到顯著結果也相當可疑,容易是被誇大的僥倖,得到不顯著則更是什麼都不能說。這一結構性病根,正是再現性危機(第三十六章)的源頭之一。

檢定力不足還有一個較少被談及、卻同樣要命的後果,即效果量的膨脹,俗稱贏家詛咒(winner’s curse)。在低檢定力的研究中,唯有恰好落在抽樣分配極端的樣本,才能跨過顯著門檻;因此那些「成功顯著」的研究,其估計到的效果量會系統性地高於真實值。這解釋了一個看似弔詭的現象:初次發表的效果往往驚人,後續大樣本重複時卻大幅縮水。低檢定力於是同時帶來兩種傷害,一是漏掉真效果,二是把僥倖偵測到的效果誇大,兩者共同侵蝕了文獻的可信度。

概似原則與最大概似

至此的討論都圍繞「檢定」,也就是對一個假設做出拒絕或不拒絕的判斷。但檢定只能回答「是不是零」,回答不了「是多少、有多準」,而後者往往才是研究真正想知道的事。推論的另一半因此是「估計」,也就是由資料反推所關切的參數(例如母體平均、迴歸係數)究竟是多少。要把「由資料反推參數」這件事做得有紀律,需要一個共同的量尺,用來比較不同的參數值對同一筆資料的解釋能力孰優孰劣。這個量尺就是概似(likelihood),它既是本書其後所有估計方法的引擎,也是頻率取向與貝氏取向共用的地基。

推導方塊概似函數與最大概似估計

設資料為 x,模型有未知參數 \theta。把「在參數 \theta 之下觀察到這筆資料的機率(密度)」看成 \theta 的函數,即概似函數:

L(\theta) = P(x \mid \theta).

留意方向:機率是「固定 \theta、問資料」,概似則是「固定資料、問 \theta」。因此 L(\theta) 並不是「\theta 的機率」,它衡量的是「不同的 \theta 值,對已觀察到的這筆資料,解釋力有多好」。最大概似估計(maximum likelihood estimation, MLE),就是挑出讓 L(\theta)(或其對數 \ln L(\theta))最大的那個 \theta。 以拋硬幣為例:拋 n 次、出現 k 次正面,設每次正面機率為 \theta,則

L(\theta) = \binom{n}{k}\,\theta^{k}(1-\theta)^{\,n-k}.

取對數、對 \theta 微分並令其為零,解得 \hat{\theta} = k/n,即樣本比例。這個結果完全符合直覺:最能解釋「拋 10 次、出現 7 次正面」的正面機率,就是 0.7。

最大概似估計之所以成為統計建模的通用引擎,是因為它在相當一般的條件下具有若干良好的漸近性質,包括一致性(樣本愈大,估計愈逼近真值)、漸近有效性(在大樣本下達到最小可能的變異)與漸近常態性(估計的抽樣分配趨近常態,因而可據以建構標準誤與信賴區間)。這些性質也支撐了三種彼此相關的檢定,即概似比檢定、Wald 檢定與分數檢定,它們在大樣本下漸近等價,將於第十二章估計與適配中再作討論。

概似還帶來一條深刻的原則,即概似原則(likelihood principle):資料對參數的全部證據,都濃縮於概似函數之中。這條原則之所以重要,有兩個理由。其一,它是其後第十一、第十二章一切估計(迴歸、結構方程模型、項目反應理論的參數估計)的共同引擎。其二,它也是通往貝氏取向(第三十三章)的橋樑,因為貝氏推論正是把概似函數乘上先驗,得到後驗。可以說,概似是頻率取向與貝氏取向共同的地基;兩者真正的分歧,不在要不要用概似,而在要不要再搭配一個先驗。值得一提的是,嚴格的概似原則其實與 p 值有所扞格,因為 p 值計入了「未發生的更極端資料」,而這些資料並不影響概似函數,這一張力也是貝氏學者批評 p 值的理論依據之一。

概似的另一項直接應用,是以概似比作為兩個假設之間相對證據的度量:兩個參數值(或兩個模型)之下概似函數的比值,衡量了資料對其一相對於另一的支持程度。這一想法既是頻率取向中概似比檢定的基礎,也在去除先驗之後,構成了貝氏因子(第三十三章)的骨幹。就此而言,概似不僅是估計的引擎,更提供了一種與「拒絕或不拒絕」二分不同的、連續而對稱的證據語言。

信賴區間:比 p 值多說了什麼

相較於只丟出一個「顯著/不顯著」,信賴區間(confidence interval, CI)幾乎總是更有資訊。95% 信賴區間背後的意思常被講錯,須先講對:它是一套「程序」的性質。若把同樣的抽樣與計算程序重複無數次,這些區間之中會有大約 95% 罩得住真正的參數值。留意,機率是掛在「程序」上的,而非掛在「手上這一個區間」上。研究者算出的這一個具體區間,要嘛罩住了真值、要嘛沒有,只是不知道是哪一種;說「真值有 95% 的機率落在這個區間裡」,嚴格說來是頻率取向下的誤解,這句話反而較接近貝氏的可信區間。事實上,Cohen (1994) 之外的研究亦顯示,連研究者與學生也普遍對信賴區間做出這類誤解。信賴區間與檢定,其實是一體兩面,如下面的方塊所示。

推導方塊信賴區間與檢定的對偶

在同一個 \alpha 水準下,信賴區間與假設檢定是對偶的:某個特定值 \theta_0 落在 (1-\alpha) 信賴區間「之內」,若且唯若,以 \theta_0 為虛無假設的 \alpha 水準雙尾檢定「不會被拒絕」。反過來,\theta_0 落在區間之外,等價於該檢定被拒絕。 換言之,一個 95% 信賴區間,同時就是「所有在 .05 水準下不會被拒絕的虛無假設值」的集合。因此「看區間有沒有涵蓋 0」,與「t 檢定的 p 有沒有小於 .05」,得到的是同一個二分結論。但區間多告訴了兩件 p 值說不出口的事:效果大概有多大(區間的位置),以及估計有多精確(區間的寬窄)。

用一個例子把「95% 的信心」讀清楚。設想某大學評估一套線上英語課程,隨機分派兩組各 100 人,期末測驗平均差為 3.2 分,95% 信賴區間為 [0.4,\,6.0]。其一,區間不含 0,等價於在 .05 水準下拒絕「兩組無差異」,這是它與檢定重疊之處。其二,效果大約落在 0.4 分到 6.0 分之間,下限小到沒有實務意義,上限卻相當可觀,可見這份資料還分不出這套課程是聊勝於無,還是確有幫助。其三,「95%」講的是程序:若把同樣的實驗與計算重複執行一百次,約有九十五次算出的區間會罩住真正的平均差;至於眼前這一個有沒有罩住,答案非零即一,只是無人知曉罷了。

正因如此,近年的「新統計」(new statistics)運動主張:與其糾結於「有沒有效」的二分,不如把焦點移到「效果多大、多不確定」,多報效果量與信賴區間,少迷信 p 值。這一轉向,把研究的問題由「拒不拒絕虛無」,變回了更科學的「這個效果的大小與不確定性」。與此相關的一個實用工具是對等檢定(equivalence testing):傳統檢定無法證明「沒有效果」,但對等檢定藉由設定一個實務上可忽略的效果範圍,反過來檢驗「效果小到可視為等同於無」,從而讓研究者得以對「沒有實質差異」做出有依據的宣稱,而非僅以不顯著含糊帶過。

最後補充信賴區間的兩點實務延伸。其一,當估計量的抽樣分配難以解析求得時,可改以拔靴法(bootstrap)由資料自身重抽樣來逼近;重抽樣推論的系統整理,包括拔靴法的類型與其適用及失效情境,見第十二章,它在中介效果等非常態情境中的應用則見第十六章。其二,信賴區間與貝氏的可信區間(第三十三章)在數值上有時相近,詮釋卻根本不同:前者的機率掛在程序上,後者的機率則直接掛在參數上。許多人對信賴區間的所謂「誤解」,其實正是把它當成了可信區間來讀,而認清這一分野,本身就是統計素養的一部分。

顯著、不顯著、與「重要」:三件不同的事

有三個概念經常被混為一談,務必分開。統計顯著(statistically significant)講的是「這個結果不太可能純由抽樣波動造成」;實務顯著(practically significant)講的是「這個效果大到值得在乎」;而效果量(effect size)則是「效果究竟多大」的量化。這三者可以任意組合。樣本一大,一個小到毫無實務意義的差異,也能達到統計顯著;樣本一小,一個很大、很重要的效果,也可能統計不顯著。這裡最容易出事的其實是「顯著」這個中文詞:它在統計學裡是一個技術術語,在日常語言裡卻自帶「重要」的意味,兩者一旦混淆,誤讀便幾乎無可避免。

兩個對照的例子可以說明。假定某年度學測有二十萬名考生,使用某款線上題庫者的數學科平均比未使用者高 0.3 分,換算成相關係數約 r=.01,在這樣的樣本數下 p 值遠小於 .001。統計上確實「顯著」,實務上卻幾無意義,因為 0.3 分連一題的分值都不到,不會有任何招生或教學決策因此改變。反過來設想一項針對三十名重度憂鬱患者的小型治療研究,療程結束時量表分數平均下降 8 分,療效相當可觀,卻因樣本太小而得到 p=.11。此時「不顯著」絕不等於「無效」,它只是說這份資料的精確度不足以排除運氣。

由此帶出兩個常見的推論錯誤。其一,「不顯著」不等於「沒有效果」。得到 p>.05,多半只代表「證據不足以拒絕虛無」,而非「虛無為真」;證據的缺席,不是缺席的證據。把不顯著讀成「證明了沒差」,是嚴重的誤讀,也正是對等檢定所要矯正的對象。其二,一味追逐顯著,會使人忽略「效果究竟多大、對現實有沒有意義」這個真正該問的問題。矯正之道,就是報告效果量與其信賴區間,而這正是下一章的重點。

多重比較與研究者自由度

前述所有關於 \alpha 的討論,都預設研究者只做「一個」檢定。但真實研究往往同時檢驗許多假設,例如多個依變項、多個分組、多個時間點,此時偽陽性的問題會急遽放大。若每個檢定的 \alpha 都是 .05,做 20 個彼此獨立的檢定,至少出現一個偽陽性的機率便高達 1-(1-.05)^{20}\approx .64。這就是多重比較(multiple comparisons)問題。這個數字值得停下來想一想:在虛無假設全部為真、無人作假、每個檢定都合乎規範的情況下,光是「做得多」這件事,就足以讓一份研究幾乎必然冒出一個看來很漂亮的顯著結果。偽陽性因此往往不是品德問題,而是算術問題。本節先處理這個算術,再處理它更難防範的變形,也就是檢定次數根本沒被寫下來、連研究者自己也數不清的情況。

舉一個並不誇張的例子。設想某團隊評估一項正念課程對大學生的效果,測了五個依變項(焦慮、憂鬱、睡眠品質、學業投入、生活滿意度),分男女兩組看,又在課程結束時與三個月後各測一次,5\times2\times2=20 個檢定就這樣自然生成。就算這套課程完全無效,跑完之後至少看到一個 p<.05 的機率仍有約 .64。這份研究若只報告那個顯著的格子,讀者看到的會是「正念課程可改善女學生的睡眠品質」,而整個過程沒有任何一個人說謊。

處理之道分為兩種思路。較保守的一種控制族系錯誤率(family-wise error rate, FWER),也就是「一整族檢定中出現任何一個偽陽性」的機率,經典做法是 Bonferroni 校正,把 \alpha 除以檢定數。它嚴格,卻在檢定數眾多時過於保守,使檢定力大幅流失。較寬鬆而實用的一種控制偽發現率(false discovery rate, FDR),也就是「在所有被判為顯著的結果中,偽陽性所占的期望比例」;Benjamini & Hochberg (1995) 提出的程序,在基因體學等高維情境中已成為標準做法,因為它在容忍少量偽陽性的前提下,保住了遠高於 Bonferroni 的檢定力。兩者的選擇,取決於偽陽性與偽陰性孰者代價更高。此處還須標明一道分工:本章處理的是多重比較的錯誤率原理,也就是 FWER 與 FDR 這兩種「究竟要控制什麼」的邏輯;至於在變異數分析等特定設計中該選用哪一種事後比較程序,例如 Tukey 的 HSD、Scheffé 法或 Dunnett 法,屬於設計層次的實作問題,將在第十章隨實驗設計與變異數分析一併展開。原理在此,設計情境在彼。

多重比較還有一種更隱蔽、也更危險的形式,即研究者自由度(researcher degrees of freedom)。Simmons et al. (2011) 以模擬與實例犀利地證明:研究者在資料蒐集與分析中所擁有的種種未經聲明的彈性,例如自由決定何時停止蒐集資料、要納入哪些共變項、如何處理離群值、報告哪幾個依變項,即使每一步看來都合理,累積起來也足以把真實的偽陽性率由 .05 推高到遠超過 .05,從而「把任何東西都包裝成顯著」。這種在眾多分析路徑中事後挑出顯著者的做法,俗稱 p 值篩選(p-hacking);而即便研究者主觀上毫無作弊之意,只要分析決策是看了資料才做的,同樣會落入所謂「分叉路徑的花園」,暗中膨脹偽陽性。這也說明了何以第三十六章要把預先註冊與註冊報告,視為壓縮研究者自由度的制度性解方。

把這些自由度攤開來看會更具體。同一批經驗取樣資料,可以先看「當日壓力是否預測當晚睡眠」,不顯著就改看「前一日壓力是否預測隔日情緒」;離群值可以用三個標準差為界剔除,也可以用二點五個;反應時間可以取平均數,也可以取中位數;覺得樣本不夠,再多收二十人重跑一次。假定這四個決策點各有兩個看來都很合理的選項,整個分析空間便有 2^4=16 條路徑;只要最後只報告其中最好看的那一條,實際的偽陽性率就會遠高於名目上的 .05,而研究者主觀上可能全程都覺得自己在做正確的判斷。

這場爭論還在延燒:當代的統計改革

前面幾節把問題一層層攤開了:p 值的定義極易被讀反,檢定力不足會同時漏掉真效果並誇大僥倖偵測到的效果,多重比較與研究者自由度則在無人作假的情況下製造假發現。當心理學在二○一○年代前後發現大量經典結果無法被重複,這些原只存在於方法課本裡的技術細節,一夕之間成了整個學科的信任問題。再現性危機(第三十六章)因此重新點燃了關於 p 值的戰火。過去十年,統計改革的各種主張紛紛出籠,有的已成共識,有的仍在激烈交鋒,值得逐一分辨,以免把「某些人的提議」誤讀為「學界的定論」。

較有共識的一端,是美國統計學會(ASA)於二○一六年罕見地發表官方聲明 (Wasserstein & Lazar, 2016),以六條原則釐清 p 值「能做什麼、不能做什麼」,例如它不能衡量假設為真的機率、也不能單獨衡量效果的重要性。這份聲明代表主流統計界對「p 值長期被誤用」的正式表態,屬於已相當確立的共識。

爭議較大的,是各種更激進的改革方案,彼此仍在激烈交鋒。一派主張「調嚴門檻」,把宣稱新發現的顯著標準由 .05 下修至 .005 (Benjamin et al., 2018),理由是 .05 過於寬鬆、製造太多偽陽性。另一派則主張「乾脆廢除」:Amrhein et al. (2019) 在《自然》上發起連署,呼籲退休掉「統計顯著性」這整個二分概念,改為誠實地報告與詮釋估計值及其相容區間,而非以一條線把結果硬切為「有」與「沒有」。也有期刊直接禁用 p 值,另有人主張改以貝氏因子(Bayes factor)作為證據的度量(第三十三章)。這些方案各有利弊:調嚴門檻簡單易行,卻治標不治本,還可能使本就檢定力不足的研究雪上加霜;全面棄用更為徹底,卻也讓習慣了明確判準的研究者一時無所適從。這場爭論尚未塵埃落定,但其方向相當清楚:讓推論回到「連續的證據與不確定性」,而非「非黑即白的儀式」。

小結:一套誠實使用推論的守則

把本章收攏為幾條務實的守則。第一,弄清楚自己究竟在用哪一套框架,是 Fisher 的證據,還是 Neyman-Pearson 的決策,切莫稀里糊塗地奉行那套「虛無儀式」。第二,永遠報告效果量與信賴區間,而非只丟一個 p 值,把問題由「有沒有效」升級為「多大、多不確定」。第三,分清顯著、重要與不確定這三件事,別把統計顯著當成實務重要,也別把不顯著當成證明了沒差。第四,正視多重比較與研究者自由度,事前明確界定分析計畫;若研究涉及重大決定,事前的預先註冊(第三十六章)能大幅壓縮這些工具被濫用的空間。第五,把 p 值頂多當成「連續的證據強度」,而非一條神聖的分界線。第六,切記單一研究不是證據的終點。任何一次檢定,無論 p 值多小、區間多窄,都只是抽樣變異之下的一次實現;一個效果是否真實而穩健,終究要看它能否在多個獨立研究中反覆浮現。這一層由單一研究走向跨研究累積證據的思路,把統計推論從一次性的裁決,接上了第三十二章後設分析與研究整合的視野。

本章談的是推論的「邏輯」;下一章要談推論的「規劃」,也就是在真正蒐集資料之前,該用多大的樣本、期望偵測多大的效果、又能達到多高的檢定力。抽樣、樣本數、效果量與檢定力這四個環環相扣的概念,將把本章關於「檢定力」與「效果量」的伏筆,展開為一套可操作的研究設計工具。

參考文獻

Amrhein, V., Greenland, S., & McShane, B. (2019). Retire statistical significance. Nature, 567(7748), 305–307. https://doi.org/10.1038/d41586-019-00857-9
Benjamin, D. J., Berger, J. O., Johannesson, M., et al. (2018). Redefine statistical significance. Nature Human Behaviour, 2(1), 6–10. https://doi.org/10.1038/s41562-017-0189-z
Benjamini, Y., & Hochberg, Y. (1995). Controlling the false discovery rate: A practical and powerful approach to multiple testing. Journal of the Royal Statistical Society: Series B (Methodological), 57(1), 289–300. https://doi.org/10.1111/j.2517-6161.1995.tb02031.x
Cohen, J. (1994). The earth is round (p<.05). American Psychologist, 49(12), 997–1003. https://doi.org/10.1037/0003-066X.49.12.997
Fisher, R. A. (1935). The design of experiments. Oliver; Boyd.
Gigerenzer, G. (2004). Mindless statistics. The Journal of Socio-Economics, 33(5), 587–606. https://doi.org/10.1016/j.socec.2004.09.033
Greenland, S., Senn, S. J., Rothman, K. J., Carlin, J. B., Poole, C., Goodman, S. N., & Altman, D. G. (2016). Statistical tests, p values, confidence intervals, and power: A guide to misinterpretations. European Journal of Epidemiology, 31(4), 337–350. https://doi.org/10.1007/s10654-016-0149-3
Ioannidis, J. P. A. (2005). Why most published research findings are false. PLoS Medicine, 2(8), e124. https://doi.org/10.1371/journal.pmed.0020124
Neyman, J., & Pearson, E. S. (1933). On the problem of the most efficient tests of statistical hypotheses. Philosophical Transactions of the Royal Society A, 231, 289–337. https://doi.org/10.1098/rsta.1933.0009
Simmons, J. P., Nelson, L. D., & Simonsohn, U. (2011). False-positive psychology: Undisclosed flexibility in data collection and analysis allows presenting anything as significant. Psychological Science, 22(11), 1359–1366. https://doi.org/10.1177/0956797611417632
Wasserstein, R. L., & Lazar, N. A. (2016). The ASA statement on p-values: Context, process, and purpose. The American Statistician, 70(2), 129–133. https://doi.org/10.1080/00031305.2016.1154108
本章引用格式游琇婷(2026)。統計推論的基礎與爭議。《計量心理學:測量、模型與推論》(第 8 章)。