抽樣、樣本數、檢定力與效果量
第八章的結尾留下兩句叮嚀:報告效果量、正視檢定力。然而這兩件事真正的戰場,其實在「蒐集資料之前」。現實中,許多研究決定樣本數的方式是「別人都收這麼多」或「經費只夠收這麼多」,這無異於把研究的成敗交給運氣。本章要談的,正是把研究「規劃」這件事做對。它由四個環環相扣的概念組成:抽樣,決定資料代表誰;效果量,刻畫效果有多大;檢定力,衡量偵測到效果的機會有多高;樣本數,回答需要多少受試者。這四個量像四個彼此咬合的齒輪,固定其中任意三個,第四個便被決定。理解它們如何連動,研究者才能在動手之前,就判斷這項研究究竟有沒有機會成功。
本章一以貫之的立場是:研究品質在很大程度上,是在資料蒐集開始之前就已決定的;抽樣、效果量、檢定力與樣本數的規劃,不是統計課的形式作業,而是保障結論可信度的第一道防線。
抽樣:你的資料代表誰?
統計推論的整個重點,是由「手上的樣本」推論到「背後的母體」。但這個推論是否成立,取決於樣本是如何取得的。
機率抽樣(probability sampling)是黃金標準:母體中每個人被抽中的機率是已知且大於零的,這包括簡單隨機抽樣、分層抽樣(先把母體分成若干層,再從各層抽取)、叢集抽樣(先抽取若干群集,例如學校,再抽群集內的人)與系統抽樣等。它的優點在於,抽樣誤差可以量化,推論具有堅實的機率基礎。非機率抽樣(non-probability sampling)則相反,包括便利抽樣、配額抽樣與滾雪球抽樣,樣本如何進入,並沒有明確的機率結構,因而嚴格說來,古典推論統計所依據的抽樣分配,在非機率樣本上並不真正成立。
即使是機率抽樣,實作上也會遭遇兩道常被忽略的裂縫。其一是抽樣架構(sampling frame)的涵蓋誤差:抽樣所依據的名冊,未必涵蓋整個目標母體,例如以市內電話抽樣,便系統性地遺漏了只用手機的年輕族群。其二是無反應偏誤(nonresponse bias):被抽中卻拒絕參與的人,若在關鍵變項上系統性地不同於參與者,樣本便產生偏差,而這種偏差無法靠加大樣本來補救。這兩道裂縫提醒研究者,抽樣的品質不僅在於「抽的方式」,也在於「誰最終真的進了資料」。
心理學的現實則更為嚴峻:絕大多數研究採用的是非機率的便利樣本,最典型的即大學部學生與網路平台的受試者。這帶來一個著名的問題,Henrich et al. (2010) 將它總結為「WEIRD」:多數心理學樣本來自西方的(Western)、受過教育的(Educated)、工業化的(Industrialized)、富裕的(Rich)與民主的(Democratic)社會,而這群人在許多心理與行為特性上,其實是全人類之中相當不具代表性的一小撮。以 WEIRD 樣本得到的結論能否推廣至全人類,是一個嚴重且長期被輕忽的外在效度問題(第三十一章)。這並不是說便利樣本一無是處,而是提醒:樣本代表誰,決定了結論能說給誰聽。此處還須區辨兩種不同的推論:一是由樣本到其所出母體的統計推論,靠隨機抽樣保證;二是由研究母體到更廣人群的科學外推,靠的是理論論證與跨樣本重複,而非任何單一研究的統計程序。混淆二者,正是許多過度推廣之結論的根源。
為兼顧成本與代表性,大型調查常採多階段抽樣,先抽行政區、再抽學校、最後抽學生,並讓每個單位被抽中的機率與其規模成正比(probability proportional to size),使最終樣本自動趨近母體結構。這類設計雖然精巧,卻也把稍後將談的群集依賴、加權與無反應問題層層疊加,因而其分析遠比「一次簡單隨機抽樣」複雜。理解這一點,是正確使用各種公開調查次級資料的前提。
複雜抽樣與設計效應
真實世界的大型調查,很少採用簡單隨機抽樣,因為它既昂貴又不切實際,取而代之的是分層與叢集等複雜抽樣設計。分層抽樣通常能提升精確度,因為把同質的人分在同一層,減少了層內變異;當各層的抽樣比例依其變異與成本最佳配置時,精確度的增益尤為明顯。叢集抽樣則相反,它節省成本,只需前往少數幾所學校,而不必全國走遍,代價卻是精確度下降。原因在於,同一群集內的人,例如同一班的學生、同一診所的病人,往往彼此相似,因此每多收一人所帶來的「新資訊」,其實比隨機抽取一個陌生人要少。這種「資訊縮水」的程度,以設計效應(design effect)來量化,如下面的方塊所示。
設每個群集大小為 m,群集內的組內相關(intraclass correlation, ICC)為 \rho,也就是同一群集內兩人分數之間的相關。相對於簡單隨機抽樣,叢集抽樣使估計量變異放大的倍數,即設計效應為
解讀:當 \rho = 0(群集內的人其實並不相似),\mathrm{Deff}=1,叢集抽樣不吃虧;當 \rho 愈大、群集愈大,\mathrm{Deff} 愈大,資訊損失愈嚴重。例如 m=20、\rho=0.1,則 \mathrm{Deff} = 1 + 19 \times 0.1 = 2.9,意謂名目上的樣本,實際上只值 n/\mathrm{Deff} 個獨立觀測,此 n/\mathrm{Deff} 稱為有效樣本數(effective sample size)。ICC 這個量將於第二十八章多層次模型再度登場,在那裡它不僅是麻煩,更是研究的實質焦點。
這帶來兩個實務提醒。其一,以複雜抽樣蒐集的資料,尤其是各種公開的全國性調查次級資料,分析時若當成簡單隨機樣本處理,算出的標準誤會嚴重低估,p 值也會過度樂觀;正確做法是納入抽樣設計資訊,或改採能處理群集依賴的多層次模型。其二,若各單位被抽中的機率不等,還須以抽樣權重(sampling weight)加以校正,方能得到對母體的不偏估計。值得補充的是,加權本身也有代價:當權重差異很大時,它同樣會放大估計的變異。Kish (1965) 提出的加權有效樣本數公式,正是用以量化這一損失,提醒研究者加權雖能消除偏誤,卻須以部分精確度為代價。分層、叢集與加權因此各有得失,複雜抽樣的分析,本質上是在偏誤與精確度之間審慎權衡。
分層抽樣的效率還取決於各層樣本如何配置。比例配置讓各層樣本數與其在母體中的占比成正比;最佳配置(Neyman 配置)則進一步讓變異較大、抽樣成本較低的層分得較多樣本,可在相同總樣本下把精確度推到最高。當抽樣時無法事先分層、卻在事後得知母體各層的真實比例時,還可用事後分層(poststratification)或反覆加權(raking)來校正樣本組成,使其貼合已知的母體邊際分布。這些技術的共同精神,是把「關於母體結構的既有知識」納入估計,以少換多地提升效率或降低偏誤。
效果量:把「多大」講清楚
第八章已指出,統計顯著會把「效果大小」與「樣本數」混為一談,樣本夠大,再小的效果也能顯著。效果量(effect size)正是為了把「效果究竟多大」這件事,從樣本數的干擾中獨立出來。它主要有三大家族,如下面的方塊所示。
標準化平均差。 以兩組平均數之差,除以合併標準差,衡量「差距有幾個標準差」。最常見的是 Cohen’s d:
相關族。 以相關係數 r 衡量兩連續變項的關聯強度;其平方 r^2(或迴歸的 R^2)則是「被解釋的變異比例」。
變異解釋比。 在變異數分析與迴歸中,以 \eta^2、\omega^2、f^2 等衡量效果占總變異的比例。Cohen’s f^2 定義為
即「被解釋」相對於「未被解釋」變異之比。三大家族之間可以互相換算,例如兩組比較(等組)時,d 與 r 有 r = d/\sqrt{d^2 + 4} 的關係。
在這三大家族之外,還有幾種變體值得認識。Cohen’s d 在小樣本下會略微高估母體效果,Hedges’ g 以一個校正因子加以修正,因而在小樣本或後設分析中更受青睞;當兩組變異不等時,Glass’s \Delta 改以控制組的標準差為除數。對類別結果,例如有無復發、成功與否,則常以勝算比(odds ratio)或相對風險(relative risk)表達效果,它們與標準化平均差之間也有近似的換算關係。此外,效果量本身也是一個帶有抽樣不確定性的估計,因此當代規範要求為效果量附上信賴區間,而非僅報告一個點估計;一個「中等」但信賴區間橫跨「幾乎為零」到「很大」的效果,其實所知甚少。
Cohen 為這些效果量提供了「小、中、大」的參考基準,例如 d = .2, .5, .8、r = .1, .3, .5,以便快速溝通 (Cohen, 1988, 1992)。但此處必須嚴正提醒:這些基準是 Cohen 自己坦承的「任意」慣例,而非自然法則。一個 d=.2 的效果,在某些脈絡,例如一個便宜、可大規模施行的介入,可能極具價值;在另一些脈絡則可能微不足道。效果的大小,永遠須放回其實質脈絡去判斷,而非機械地對照 Cohen 的表格。此外,當測量的原始單位本身即具意義時,例如體重的公斤數、反應時間的毫秒數,未標準化的原始效果,往往比標準化的 d 更易解讀,也更不受樣本變異範圍的左右。
還有三點關於效果量的細節,值得在使用前釐清。其一,在多因子變異數分析中,偏 \eta^2 與 \eta^2 並不相同:前者把其他因子的變異排除於分母之外,因而通常較大,兩者混用是文獻中常見的錯誤。其二,對受試者內設計,效果量的標準化究竟該除以哪一個標準差(原始分數的、抑或差異分數的)並無定論,不同選擇會給出差異頗大的 d,報告時務必說明。其三,共同語言效果量(common language effect size)以「隨機各取一人、甲大於乙的機率」來表達效果,對非專業讀者往往比 d 更為直觀。這些細節提醒,效果量雖是溝通效果大小的利器,其定義與脈絡卻不容含糊。最後須就本章與後續各章的分工略作交代。變異數分析脈絡中 \eta^2、偏 \eta^2 與 \omega^2 的完整定義、偏 \eta^2 的高估問題及其選用,將於第十章隨變異數分析詳述;而效果量在多項研究之間的換算、合併與校正,例如將 d 與 r 轉換後納入後設分析、或對不可靠測量所致的衰減加以還原,則屬第三十二章的主題。本章的職責,是確立效果量的定義系譜,以及在單一研究之內該如何選擇、報告與詮釋效果量。
統計檢定力:四個量的連動
現在把第八章的檢定力接續回來。檢定力(1-\beta)不是一個孤立的數字,它由三件事共同決定:效果量、樣本數,以及顯著水準 \alpha,再加上檢定的具體設計。效果量、樣本數、\alpha 與檢定力這四個量,構成一組緊密的連動:固定其中任意三個,第四個便被決定。這正是一切樣本數規劃的數學核心,如下面的方塊所示。
以最簡單的兩組平均數比較(獨立樣本)為例。檢定力取決於非中心性參數(noncentrality parameter)\delta,它大致為
其中 d 是效果量、n 是每組樣本數。可以看出:效果量 d 愈大、樣本 n 愈多,\delta 愈大,檢定統計量的分配愈往「拒絕區」偏移,檢定力便愈高。反過來,若給定目標檢定力(慣例常取 .80)與雙尾 \alpha,每組所需樣本數近似為
其中 z 為標準常態分位數。這條式子把四個量的連動講得一清二楚:所需樣本數與效果量的平方成反比,效果小一半,樣本量便要多四倍。這也解釋了何以偵測「小效果」需要龐大的樣本,而心理學許多小樣本研究,注定檢定力不足。
上式背後其實牽涉一族「非中心分配」。在虛無假設下,檢定統計量服從中央的 t、\chi^2 或 F 分配;當對立假設為真時,它們改服從對應的非中央分配,而偏移的程度正由非中心性參數刻畫,檢定力即是這一非中央分配落在拒絕區的機率。除了效果量與樣本數,檢定力還受幾個常被忽略的因素影響:單尾檢定在方向正確時檢定力較高;受試者內設計因為去除了個體間變異,通常比受試者間設計更有檢定力;而測量的信度,也會透過效果量悄悄左右檢定力,這一點值得單獨一節細談。
值得補充的是,上述兩組比較只是最簡單的情形,不同的統計檢定各有其檢定力公式與對應的非中央分配:相關係數的檢定力取決於母體相關與 n,變異數分析取決於效果量 f 與各組人數,卡方檢定取決於效果量 w 與格數。把檢定力對樣本數作圖,會得到一條隨 n 上升而趨近 1 的檢定力曲線,其陡緩恰反映了效果的大小;閱讀這條曲線,往往比記憶單一個「所需樣本數」更能培養對研究規模的直覺。
由此,事前檢定力分析(a priori power analysis)的邏輯便清楚了:在蒐集資料之前,先根據理論或先前研究,設定一個想偵測的效果量,定好 \alpha 與目標檢定力,然後反解出所需的樣本數。這是研究規劃最該做、卻也最常被跳過的一步。
測量誤差與檢定力:被忽略的一環
前面幾章談信度與效度時反覆強調,測量誤差會稀釋變項之間的關係,這一稀釋在研究規劃的層次上,有一個常被忽略卻極為現實的後果,即不可靠的測量會降低檢定力。回到第五章的衰減公式:兩個構念之間的觀察相關,等於真分數相關乘上兩者信度平方根的乘積。因此,若所測量的變項信度偏低,研究者在資料上實際「看得到」的效果量,會系統性地小於真實的構念層次效果,而檢定力正是取決於這個被稀釋後的效果量。
這一關係的實務意涵相當直接。假設某構念層次的真實相關為 0.4,但自變項與依變項的信度都只有 0.7,則觀察相關會被壓低至約 0.4 \times 0.7 = 0.28;欲以 0.28 而非 0.4 為目標達到相同的檢定力,所需樣本數會大幅增加。換言之,粗糙的測量不只損害效度,也讓研究者被迫付出更大的樣本代價,或在不知不覺中做了一項檢定力不足的研究。這也揭示了一條常被忽視的權衡:與其一味加大樣本,改善測量的信度,有時是提升檢定力更划算的途徑。測量品質與研究規劃,因此不是兩件各自獨立的事,而是同一個推論鏈上緊密相扣的兩環。
檢定力分析的正確與錯誤用法
檢定力分析有一個正確的用法,也有一個極常見的錯誤用法,務必分清。正確的用法是事前的(a priori):在拿到資料之前,用它來決定樣本數。錯誤的用法,是所謂的事後檢定力或觀察檢定力(post hoc / observed power):研究做完、結果不顯著,於是有人以「觀察到的效果量」回頭去算這個研究的檢定力,想用「檢定力本來就不高」來替不顯著開脫。這在邏輯上是錯的。Hoenig & Heisey (2001) 指出,觀察檢定力其實只是 p 值的一個單調函數,p 值愈大,算出的觀察檢定力就愈低。因此「不顯著、而且觀察檢定力低」這句話,根本是同一件事講兩遍,並未提供任何新資訊,反而製造了「這個研究只是運氣不好」的錯覺。
正確處理不顯著結果的方式,不是回頭計算觀察檢定力,而是檢視效果量信賴區間有多寬。若區間很寬、把「有意義的效果」也涵蓋在內,結論便是「資料不足以下定論」;若區間很窄、且緊貼著 0,才較有底氣宣稱「即使有效果,也小到可以忽略」。另一個有用的變體是敏感度分析(sensitivity analysis):給定手上的樣本數與 \alpha,反問「這個研究有八成把握能偵測到的、最小的效果是多大」,藉此誠實地標示出研究的偵測極限。
更進一步,Gelman & Carlin (2014) 主張以「設計分析」取代狹隘的檢定力計算,並引入兩種在低檢定力情境下格外重要的錯誤。其一是 Type S 錯誤(sign error),即一個顯著結果的方向與真實效果相反的機率;其二是 Type M 錯誤(magnitude error),即顯著結果高估真實效果的倍數,又稱誇大比。在噪音大、樣本小的研究中,即便偶爾達到顯著,其估計也極可能方向錯誤或嚴重誇大。這正是第八章贏家詛咒的另一種表述,也再次說明:低檢定力不只讓人漏掉真效果,更會讓僥倖偵測到的效果既不可靠又被放大。
一個具體的數字能凸顯問題的嚴重。設某研究的真實效果為 d=0.2,卻只有每組 20 人的樣本,其檢定力僅約 0.1;在如此低的檢定力之下,一個僥倖達到顯著的估計,其平均大小可能高達真實效果的兩、三倍,且有不可忽略的機率連方向都相反。這說明了何以在噪音大的小樣本研究中,「顯著」二字幾乎不帶來任何保證,反而常是誤導的來源,也讓「唯有先確保足夠檢定力,顯著才有意義」這一原則顯得格外切要。
樣本數規劃的多重取徑
「該收多少人」並沒有單一答案,取決於研究的目標與模型。最傳統的是檢定力導向:如前所述,固定效果量、\alpha 與目標檢定力,解出 n。但檢定並非唯一的目的。精確度導向(accuracy in parameter estimation, AIPE)則主張,比起「有沒有顯著」,研究其實更該在乎「估計得夠不夠精確」,於是改為要求信賴區間窄到某個程度,再據此決定 n (Maxwell et al., 2008)。這個取徑與第八章「重估計、輕檢定」的精神一脈相承。
面對效果量本身充滿不確定的處境,還有幾種穩健的策略。其一是以「你在乎的最小效果」(smallest effect size of interest, SESOI)作為規劃依據,而非照抄文獻裡最搶眼的數字;其二是保護性檢定力(safeguard power),改以先前研究效果量信賴區間的保守端來規劃,以抵禦效果量膨脹。此外,若允許中途查看資料,則應採用有正式錯誤率控制的序貫分析(sequential analysis),例如 alpha 消耗函數,如此便能在事前規劃的前提下合法地提早停止,而不致膨脹第一類錯誤。
到了複雜模型,樣本數規劃更沒有現成公式可套。以結構方程模型為例,有兩條主流路線。一是 RMSEA 導向的檢定力分析:MacCallum et al. (1996) 提出,可針對「接近適配」或「不接近適配」的假設,計算在給定自由度與 n 之下,有多大檢定力能拒絕「模型適配不良」。二是蒙地卡羅(Monte Carlo)取徑:Muthén & Muthén (2002) 示範,直接依假設的模型模擬大量資料集,在不同的候選 n 之下,檢查參數估計有無偏誤、信賴區間的覆蓋率是否正確、以及對關鍵參數的檢定力是否足夠。蒙地卡羅法的優點是幾乎萬用,再複雜的模型,包括多層次、缺失與非常態,只要能模擬,就能規劃樣本數。近年也有學者主張,與其糾結於「該收多少」,不如把重點放在「把樣本數的決定講清楚」,也就是為樣本數提出一個明確而可辯護的正當理由,並將常見的六類正當化方式加以系統整理 (Lakens, 2022)。
值得把這些正當化方式攤開來看。Lakens (2022) 指出,樣本數的合理依據至少有六類,包括以檢定力偵測某個理論或實務上重要的效果、以精確度控制估計的區間寬度、依可行的資源上限、依欲偵測的最小效果、以序貫設計的停止規則,乃至坦承「這是在現實限制下所能達到的最大樣本」。關鍵不在於哪一種最好,而在於明確說出所依據的是哪一種,並誠實面對其限制。與此並行的還有貝氏取向的設計分析,例如以貝氏因子的設計分析,模擬在不同樣本數下獲得決定性證據的機率,這與蒙地卡羅樣本數規劃在精神上一脈相承(第三十三章)。
還有一種看待樣本數的視角來自後設分析式的思考,值得在此引入。當研究者體認到自己這項研究終將是未來某個證據綜合裡的一塊拼圖,而非孤懸的最終判決時,對「該收多少人」的盤算便隨之改變。從這個角度看,一個檢定力不足的小樣本研究,其代價並不只落在自己身上,更會外溢到整個文獻:大量小樣本研究即使個別看來無傷大雅,集體卻會加劇效果量的膨脹、放大研究間的異質性,並在選擇性發表的推波助瀾下,使後續的後設分析難以還原真相。反過來說,當單一研究確實無力獨力達到理想樣本數時,一個負責任的替代方案,是與其他實驗室協同進行多站點研究,或至少完整報告結果、開放資料與分析腳本,使自己的估計即便帶著不確定,仍能誠實地進入未來的累積證據。這種「單一研究的樣本數,終須放回跨研究的證據累積裡衡量」的觀點,把本章的規劃問題接上了第三十二章的後設分析與研究整合,也呼應第三十六章對小樣本研究文化及其集體成本的反省。
多層次與複雜設計的檢定力
當資料具有巢狀結構時,樣本數規劃還多了一層考量,即樣本要「加在哪一層」。在多層次設計中,總樣本數並非唯一決定檢定力的因素,群集數與群集大小的配置同樣關鍵。一般而言,對於跨層次效果與層次二的效果,增加群集數往往比增加每個群集的人數更有效,因為受設計效應所限,群集內多收一人所提供的獨立資訊相當有限。這使得「多找幾所學校,各校少收幾人」,在許多情況下優於「少找幾所學校,各校多收人」。這一直覺也有較具體的經驗法則可循,例如常被引用的建議是群集數至少三、四十個,方能穩定估計層次二的變異成分與其標準誤,群集數過少時,變異成分會偏誤、標準誤會低估。若進一步把每收一個群集與每收一名群集內個體的成本納入考量,還可推導出在固定預算下使檢定力最大的最佳群集大小,其結論通常是:當群集內相關較高、或增收群集的成本相對不高時,應優先增加群集數。
縱貫研究亦有類似的抉擇:檢定力同時受受試者數與每人測量次數(時點數)的影響,而成長軌跡之斜率的檢定力,對測量時點的數目與間距尤其敏感(第二十九章)。這些設計的檢定力多半沒有簡潔的封閉公式,誠實而通用的做法,通常仍是回到蒙地卡羅模擬。這也呼應了本章的一個核心訊息:愈是複雜的模型,愈不能套用兩組比較的簡單公式,而須以模擬如實地反映其設計。
前沿與陷阱
把研究規劃做對,還須繞開幾個常見的陷阱。
第一個陷阱是效果量膨脹與發表偏誤。已發表的效果普遍高於真實效果,因為顯著的、大的結果較容易被發表,在低檢定力的研究裡尤其嚴重。這造成一個惡性循環:研究者以「文獻裡報告的效果量」進行事前檢定力分析,而那個效果量本身是膨脹的,於是算出的樣本數偏小,做出的研究又是檢定力不足。矯正之道,是採用較保守的效果量或 SESOI 來規劃,而非照抄文獻裡最搶眼的數字。
第二個陷阱,是把檢定力當成別人家的問題。Sedlmeier & Gigerenzer (1989) 早在一九八九年便發現,儘管 Cohen 於一九六二年便警示心理學檢定力不足,二十餘年後該領域的檢定力非但未見提升,反而略有下降;Button et al. (2013) 進一步證明,神經科學研究的平均檢定力同樣偏低,並由此推導出偽陽性偏高、效果被誇大、可重複性低落等一連串後果。這段歷史提醒我們,檢定力不足不是個別研究的疏失,而是一種需要制度性矯正的結構性沉痾,其解方之一,正是第三十六章要談的預先註冊與更嚴格的樣本數規劃規範。
第三個陷阱,是別把兩組比較的簡單公式,硬套到多層次或 SEM 這類複雜模型上。這些模型的檢定力,受自由度、模型設定、缺失型態等多重因素影響,往往沒有簡單公式,誠實的做法通常就是回到蒙地卡羅模擬。
小結
把本章收攏為一句話:研究的成敗,在很大程度上,早在按下「開始蒐集資料」之前就已決定。動手之前,先講清楚三件事,即目標母體與抽樣計畫為何、在乎的最小效果有多大、想要多高的檢定力(或多精確的估計),然後據此算出、或模擬出所需的樣本數,並記得測量的信度本身也會左右檢定力。到了分析階段,則永遠報告效果量與其信賴區間(第八章),並把效果放回實質脈絡去解讀,而非套用 Cohen 的任意基準。
從第八章的推論邏輯,到本章的研究規劃,統計建模的前置作業已然備妥。第十章起正式進入研究設計與模型本身:先從實驗設計與變異數分析談起,把第八章的推論邏輯落實到具體的設計情境;緊接著的迴歸與廣義線性模型(第十一章)則會揭示,變異數分析其實只是迴歸的一個特例,二者同屬廣義線性模型的家族。迴歸既是最基本的統計模型,也是其後多層次模型、乃至項目反應理論之 logistic 結構的共同源頭;而第八章的最大概似,將在估計、模型適配與模型選擇(第十二章)化為真正估計參數的引擎。