第 10 章 實驗設計與變異數分析
第三部 統計推論與研究設計的方法基礎
10Chapter

實驗設計與變異數分析

第八章講的是推論的邏輯,第九章講的是研究的規劃,兩章合起來,回答了「拿到資料以後該怎麼想」與「動手之前該收多少」這兩個問題。然而在推論與其後的迴歸建模之間,還橫著一段方法史上的斷層,那就是變異數分析(analysis of variance, ANOVA)。這套技術由 Fisher 在一九二○年代的洛桑(Rothamsted)農業試驗站發展出來,原是為了在田間比較不同肥料與品種的產量;它與實驗設計(experimental design)如影隨形,共同構成了一整套「先設計、再分析」的思考方式 (Fisher, 1935)。這套方式後來被心理學全盤吸收,深深型塑了整個學科的實驗傳統,以至於 Rucci & Tweney (1980) 在追溯其制度化歷程時,把變異數分析稱為科學心理學的第二紀律。

本章的主線有二。其一,變異數分析表面上是一族看似各自為政的檢定,骨子裡卻共享同一套邏輯,也就是把總變異拆解為「可歸因於設計」與「無法歸因、只能算作誤差」兩部分,再看前者相對於後者是否夠大。其二,這一族檢定終究不是獨立的技術,而是迴歸與廣義線性模型(第十一章)的特例;本章會一路鋪陳到最後一節,以「變異數分析即迴歸」把它收束回統計建模的主幹。為使抽象的原理有所依附,全章以一個貫穿的實例來推進:設想一項比較三種統計教學法,即傳統講授、翻轉教室與專題導向,其成效的隨機化田野實驗,各節將逐步為它加入區集、第二個因子、重複量測與共變數,最後再以迴歸把整個模型重寫一遍。

Fisher 的三原則:隨機化、區集、重複

任何一項實驗,若要讓「處理造成了差異」這個結論站得住,都必須先解決一個根本難題:如何確保觀察到的組間差異,來自處理本身,而非來自各組在其他方面的既有不同。第八章的檢定只能告訴研究者,眼前的差異有多不像機遇所致,卻無力回答它究竟由什麼造成,因為那取決於資料是怎麼產生的。設計的工作,正是在蒐集資料之前先把干擾安排妥當,好讓事後的檢定有話可說。Fisher 為此提出三條互補的設計原則,即隨機化、區集與重複,至今仍是實驗方法的基石。

第一條是隨機化(randomization)。把受試者以隨機方式分派到各處理組,使得任何一個可能干擾結果的變項,無論研究者是否知情,都在機率意義上被均勻地打散到各組。隨機化不保證各組在每一個變項上都完全相等,但它保證了組間的殘餘差異純屬機遇,從而使誤差項有了明確的機率解釋,也為其後的顯著性檢定提供了正當性。就本章的教學法實驗而言,這意味著不能讓學生自選教法,也不能依成績分班,而必須以抽籤或亂數決定每個人接受哪一種教法。隨機化之所以是因果推論的關鍵一步,其深層理由留待第三十一章詳述,此處先確立它在設計層次的地位。

第二條是區集(blocking),又稱局部控制(local control)。若已知某個變項會帶來大量無關變異,例如不同班級的整體程度本就有別,與其放任它混入誤差,不如把它明確納入設計:先依這個變項把受試者分成若干同質的區集,再在每個區集之內施行隨機化。如此一來,區集所對應的變異便可從誤差中分離出來,使得對處理效果的檢定更為敏銳。區集的精神,是把「已知且可測量的干擾」由誤差項中扣除,這與稍後共變數分析的思路一脈相承,也預示了第二十八章多層次模型對巢狀結構的處理。

第三條是重複(replication),即每個處理都施加於多個實驗單位。重複有兩重作用:其一,唯有重複,才能估計出「同一處理之下、單位與單位之間」的自然變異,也就是誤差變異,而沒有誤差的估計,任何組間差異都無從判斷大小;其二,重複愈多,處理平均數的估計愈精確,檢定力愈高,這正呼應了第九章樣本數規劃的核心。須留意的是,這裡的重複指的是獨立實驗單位的重複;若只是對同一個單位反覆測量,那是假重複(pseudoreplication),並不能提供關於處理效果的獨立資訊,這一區辨在重複量數設計中格外重要。

品茶夫人:一場實驗的推論邏輯

上一節說明了隨機化能把干擾均勻打散,卻還沒有交代更關鍵的一步:隨機化本身如何生出推論所需的機率。少了這一步,「差異大到不像機遇」這句話便無所依憑。Fisher 以一個著名的例子,把這層邏輯講得淋漓盡致,那就是品茶夫人(the lady tasting tea)。一位女士宣稱,她能僅憑口感分辨一杯奶茶是先倒茶還是先倒奶。Fisher 的設計是:準備八杯奶茶,其中四杯先倒茶、四杯先倒奶,以隨機順序呈上,並事先告知她兩種各有四杯,請她挑出先倒奶的那四杯。

這個設計的巧妙之處,在於它讓「純靠運氣猜對」的機率變得可以精確計算。從八杯中選四杯,共有 \binom{8}{4}=70 種選法,其中唯有一種是全對。因此,若女士毫無辨別能力、純屬瞎猜,她全部猜對的機率恰為 1/70 \approx 0.014。這個數字並非來自任何常態分配的假設,而是直接由隨機化的排列組合算出,這正是所謂隨機化檢定(randomization test)或排列檢定(permutation test)的原型。若女士真的全部挑對,研究者面臨的選擇是:要嘛相信一件機率僅百分之一點四的巧合發生了,要嘛承認她確實有辨別力。

品茶夫人的意義,遠不止一則軼事。它揭示了 Fisher 式推論的核心:虛無假設,也就是她沒有辨別力這個假設,之所以能被檢驗,正是因為隨機化為「假設為真時會看到什麼」提供了一個明確的機率模型。變異數分析的 F 檢定,本質上是同一套邏輯在連續資料、常態假設下的近似展開;當常態假設可疑時,回到排列檢定這一原型,往往是更穩健的選擇。這條由隨機化直通推論的線索,會在第三十一章談因果時再度浮現。

單因子 ANOVA:變異的分解

回到教學法實驗最單純的版本:把學生隨機分派到三種教法,學期末測得統計素養分數,問三種教法的平均成效是否有別。最素樸的想法,是對三組兩兩做 t 檢定,但這立刻撞上第八章的多重比較問題,三組要做三次、組數再多則檢定次數暴增,偽陽性率迅速膨脹。變異數分析提供了一個更漂亮的解法:不去比較個別的平均數,而是一次性地問,組與組之間的變異,相對於組內的變異,是否大到不像是機遇所能造成。

推導方塊單因子變異數分析的平方和分解

設有 k 組,第 j 組有 n_j 人,該組第 i 人的分數為 Y_{ij},總平均為 \bar{Y}_{\cdot\cdot},第 j 組平均為 \bar{Y}_{\cdot j}。每一個觀察值對總平均的離差,可以拆成兩段:

Y_{ij} - \bar{Y}_{\cdot\cdot} = \underbrace{(\bar{Y}_{\cdot j} - \bar{Y}_{\cdot\cdot})}_{\text{組間}} + \underbrace{(Y_{ij} - \bar{Y}_{\cdot j})}_{\text{組內}}.

將兩邊平方後對所有觀察值加總,交叉項恰好為零,於是得到平方和的正交分解:

\underbrace{\sum_{j}\sum_{i}(Y_{ij}-\bar{Y}_{\cdot\cdot})^2}_{SS_T} = \underbrace{\sum_{j} n_j(\bar{Y}_{\cdot j}-\bar{Y}_{\cdot\cdot})^2}_{SS_B} + \underbrace{\sum_{j}\sum_{i}(Y_{ij}-\bar{Y}_{\cdot j})^2}_{SS_W}.

總變異 SS_T 因此被乾淨地分成組間 SS_B 與組內 SS_W 兩塊,對應的自由度亦同樣可加:N-1 = (k-1) + (N-k),其中 N=\sum_j n_j。

把平方和各自除以其自由度,得到均方(mean square):組間均方 MS_B = SS_B/(k-1),組內均方 MS_W = SS_W/(N-k)。組內均方是對誤差變異 \sigma^2 的估計,無論虛無假設是否為真都成立;組間均方則除了誤差之外,還額外含有處理效果所貢獻的變異。於是檢定統計量取兩者之比 F = MS_B/MS_W。在「各組母體平均皆相等」的虛無假設下,F 服從自由度為 (k-1,\, N-k) 的 F 分配;當處理確實有效時,MS_B 會系統性地大於 MS_W,F 值偏大,落入拒絕區。變異數分析的結果,習慣以一張摘要表呈現,如表 10.1。

表 10.1 單因子變異數分析摘要表
變異來源 平方和 自由度 均方 F
組間(處理) SS_B k-1 MS_B MS_B/MS_W
組內(誤差) SS_W N-k MS_W
總和 SS_T N-1

這個比值值得用數字讀一遍。設想三種教法各 20 人,學期末統計素養分數的組平均為 72、78 與 80 分,總平均約 76.7 分;若組內標準差約 10 分,組內均方即約為 100。組間平方和約為 693,除以自由度 2 得組間均方約 347,於是 F \approx 3.47。分母始終在估誤差,分子估的則是誤差再加上處理效果,兩者相除恰好把誤差這把共同的尺度約掉,剩下的就是處理效果相對於雜訊的倍數:組平均彼此的離散程度,約為純機遇下該有的三倍半。

這套推導背後有三個假設值得攤開:各組觀察值相互獨立、各組母體為常態分配、且各組變異相等,即變異數同質性(homoscedasticity)。獨立性由隨機化與適當的設計保障,一旦違反,例如資料具有巢狀結構,後果最為嚴重(第二十八章)。常態性在中央極限定理的作用下,於樣本稍大時多半無傷大雅。變異數同質性若違反,且各組人數不等,則 F 檢定的第一類錯誤率會受到扭曲,此時可改用不假設變異相等的 Welch 校正。

期望均方:固定與隨機因子

變異數分析真正深刻、也最常被教科書略過的一層,是期望均方(expected mean squares, EMS)。單因子設計裡,F 的分母該用哪一個並無懸念,因為摘要表上只有組內均方一個候選;設計一旦複雜起來,表上同時擺著三、四個均方,分母挑錯,整個檢定便失去意義。期望均方正是裁決這件事的依據。均方是隨機變數,它的期望值告訴我們,這個均方「平均而言在估計什麼」。而 F 比之所以能檢定某個效果,關鍵就在於分子與分母的期望均方,除了該效果之外其餘成分完全相同,如此相除才能把該效果單獨凸顯出來。

這裡必須區分兩種因子。固定因子(fixed factor)的各個水準,就是研究者所關心的全部水準,例如教學法實驗的三種教法,結論只針對這三種而發,不外推到「所有可能的教法」。隨機因子(random factor)的水準,則是從一個更大的水準母體中隨機抽取的樣本,例如若隨機選取二十位教師來施教,研究者關心的並非這二十位本身,而是「教師」這整個變異來源,結論要外推到教師母體。

這個區分在實務上意味著什麼,用數字最清楚。教法是固定因子時,研究者要的是「翻轉教室比傳統講授高 6 分」這類具體的水準差距,結論只涵蓋所比較的三種教法;教師是隨機因子時,研究者要的不是第七位教師比第十二位高幾分,而是教師這個來源貢獻了多少變異:若估得 \sigma_\alpha^2 = 16 而誤差變異 \sigma^2 = 84,便可說學生分數的變異約有一成六來自「碰到哪一位老師」,且這句話適用於整個教師母體,不限於受抽的那二十位。

概念方塊期望均方如何決定 F 比的構造

以單因子為例,固定與隨機因子的期望均方不同,因而 F 比的建構也不同。設組內誤差變異為 \sigma^2,每組 n 人。

固定因子:E(MS_B) = \sigma^2 + \dfrac{n\sum_j \alpha_j^2}{k-1},E(MS_W)=\sigma^2。虛無假設(所有 \alpha_j=0)為真時兩者皆等於 \sigma^2,故 F=MS_B/MS_W 恰當。

隨機因子:E(MS_B) = \sigma^2 + n\,\sigma_\alpha^2,E(MS_W)=\sigma^2,檢定的是變異成分 \sigma_\alpha^2=0。單因子時 F 比形式雖同,但所估計與所推論的對象,已由「特定水準的效果」變為「水準母體的變異」。

到了多因子設計,兩者的分歧更為關鍵:在含隨機因子的模型中,某些效果的正確誤差項不再是 MS_W,而是另一個含有相同變異成分的均方;誤用 MS_W 作分母,會得到錯誤的 F 檢定。

選錯分母的代價,值得用數字看清。設想教法(固定,三水準)與教師(隨機,六位)交叉的設計,摘要表上有三個均方:教法 MS_A、教法與教師的交互作用 MS_{A\times S},以及學生層次的 MS_W。期望均方顯示,E(MS_A) 含有教法效果、交互作用的變異成分與 \sigma^2,而 E(MS_{A\times S}) 恰好含有後兩者,故檢定教法的正確分母是 MS_{A\times S}。假定 MS_A = 480、MS_{A\times S} = 160、MS_W = 40,正確的 F 為 3.0;誤用 MS_W 作分母則得到 12.0,把一個平庸的結果膨脹成看似無可置疑的證據。

隨機因子的概念,其重要性遠超出變異數分析本身。當研究者把「題目」視為隨機因子,所得到的變異成分分解,正是第六章概化理論的內核;當把「學校」「教師」視為隨機因子,允許其效果隨機變動,便自然通往第二十八章的多層次模型。可以說,隨機因子是概化理論與多層次模型共同的祖先,而期望均方則是理解這條血脈的關鍵,並非可以帶過的計算細節。

對比與多重比較

一個顯著的 F 只告訴我們「這幾組平均並非全等」,卻沒說是哪幾組不同、以何種型態不同。對研究者而言,這樣的結論幾乎無法使用:教學法實驗若只得到「三種教法有別」,既不知道翻轉教室是否勝過傳統講授,也不知道兩種新教法彼此有無高下。整體檢定真正的功能,是替後續的細部比較把關,避免研究者一開始就在所有兩兩比較之間亂槍打鳥。真正的問題因此是:在守住整體錯誤率的前提下,如何問出有意義的個別比較。要回答它有兩條路,分別對應「事前就想好要問什麼」與「看了資料才決定要問什麼」這兩種處境。

第一條是事前對比(planned contrasts)。若研究者在蒐集資料之前,就依理論提出了明確的比較,便可將它寫成一個對比,也就是各組平均數的一個加權線性組合 \psi=\sum_j c_j \bar{Y}_{\cdot j},其中權重之和為零,\sum_j c_j = 0。就教學法實驗而言,一個有理論意涵的對比,是把兩種新式教法(翻轉、專題)的平均對上傳統講授,權重取 (-\tfrac{1}{2}, -\tfrac{1}{2}, 1)。對比的好處,是把 F 的整體變異切成若干各含一個自由度、方向明確的問題;若一組對比彼此正交,也就是權重乘積之和為零,它們還能把 SS_B 無重疊地完全分解,各自對應一個獨立的假設。

第二條是事後多重比較(post hoc comparisons)。當研究者事前並無特定假設,而是在看到資料後才想比較所有可能的配對時,偽陽性便會隨比較次數而累積,這正是第八章多重比較問題在實驗設計中的具體化身。控制錯誤率的原理,包括族系錯誤率與偽發現率,第八章已經交代;本章關心的,是這些原理落到變異數分析設計時所發展出的一族具體程序。

這族程序各有其保守程度與適用時機。Tukey 的誠實顯著差異法(honestly significant difference, HSD)專為「所有配對比較」而設,以學生化全距分配控制族系錯誤率,是等組配對比較的標準選擇。Scheffé 法最為保守,但它容許檢驗任意的對比,包括看了資料才想到的複雜對比,因而在探索性的、非配對的比較上獨具彈性。Bonferroni 及其改良的 Holm 法則最為通用,適用於任意一組事先指定、數目不多的比較。Dunnett 法則專為「多個處理組各自對照單一控制組」的情形設計;在教學法實驗中,若旨在比較兩種新教法各自與傳統講授之別,它會比全配對的 Tukey 更有檢定力。程序的選擇,取決於比較的結構與數目,而非隨意套用。

因子設計與交互作用

到此為止,教學法實驗只有一個因子。但真實問題往往牽涉多個因子的共同作用。假設研究者進一步懷疑,教法的成效可能因學生的先備程度而異,於是加入第二個因子,把學生分為高、低先備兩層,與三種教法交叉,構成一個 3\times 2 的因子設計(factorial design)。因子設計的效率,在於它以同一批受試者同時回答了多個問題,並揭示了單因子設計永遠看不到的東西,也就是交互作用。

因子設計可分離出三種效果。主要效果(main effect)指單一因子平均而言的作用,例如不分先備程度、平均來看,三種教法是否有別。交互作用(interaction)則指一個因子的效果,是否隨另一個因子的水準而改變,例如翻轉教室是否只對高先備學生特別有效、對低先備學生反而不利。交互作用是因子設計的靈魂:它所捕捉的「效果視情境而定」,恰恰是心理現象最常見的樣態,也是任何單因子設計都無從觸及的。

交互作用的存在,會改變主要效果的詮釋方式。當交互作用顯著時,籠統地談論某因子的主要效果往往具有誤導性,因為該因子的作用在不同情境下並不一致;此時應改看單純效果(simple effects),也就是固定另一因子於某一水準時,本因子的效果。就實例而言,若教法與先備程度有交互作用,則正確的說法不是「翻轉教室較優」,而是「翻轉教室對高先備學生較優、對低先備學生則否」。這種「效果取決於條件」的思維,與迴歸中的交互項完全相通,這一點會在本章末節的統一中再度呈現。

把數字擺出來,交互作用該怎麼讀便一目了然。假定這個 3\times 2 設計的六個細格平均如下:高先備學生在傳統講授、翻轉教室、專題導向分別得 78、88、84 分,低先備學生則分別得 70、66、72 分。翻轉教室對高先備學生比傳統講授高 10 分,對低先備學生卻低 4 分,一正一負,這就是交互作用。此時若只報告翻轉教室的主要效果,也就是把 88 與 66 平均得 77,再與傳統講授的 74 相比而說「高 3 分」,這個數字對兩群學生中的任何一群都不成立,等於把一個逆轉的型態壓成一句沒有內容的話。

效果量:ANOVA 語彙

第九章已鋪陳了效果量的定義系譜,並言明變異數分析脈絡的效果量留待本章。之所以非要效果量不可,是因為 F 值本身說不出效果有多大:同一個處理效果,樣本數愈大 F 就愈大,一個 F = 8.2 可能來自可觀的組間差距,也可能來自微小的差距配上龐大的樣本。研究者需要的,是不隨樣本數起伏、能夠跨研究比較的量。變異數分析的效果量,共通的精神是「某效果占了多少變異」,但細節上有幾個彼此易混的版本,混用會讓效果的重要性被系統性地誇大,務必分清。

最基本的是 \eta^2(eta squared),即某效果的平方和占總平方和的比例 \eta^2 = SS_{\text{effect}}/SS_T。它直觀,卻有一個缺點:在多因子設計中,加入或移除其他因子會改變 SS_T,從而改變同一效果的 \eta^2,使得跨研究比較失真。為此,偏 \eta^2(partial eta squared)改以「該效果的平方和」除以「該效果平方和加上誤差平方和」,即 \eta_p^2 = SS_{\text{effect}}/(SS_{\text{effect}}+SS_{\text{error}}),把其他因子的變異排除於分母之外。

偏 \eta^2 的這一性質,正是文獻中一個常見亂象的根源。由於分母排除了其他效果,偏 \eta^2 通常大於 \eta^2,在多因子設計中甚至可能大得多;當研究者誤把偏 \eta^2 當成 \eta^2 報告、或在不同設計間直接比較兩者時,效果的重要性便被系統性地誇大。更麻煩的是,一項設計中各效果的偏 \eta^2 之和可以超過一,這使它無法被詮釋為「變異的分割」。使用時務必明確標示所報告的究竟是哪一個。

此外,\eta^2 與偏 \eta^2 都是對母體效果量的偏高估計,因為樣本的平方和本身即含有誤差的膨脹。\omega^2(omega squared)以期望均方為基礎作了偏誤校正,是對母體效果量較不偏的估計,在樣本不大時尤其值得優先採用。三者的關係可收攏為一句話:\eta^2 最直觀但受設計影響,偏 \eta^2 便於排除其他因子但易被誤讀且不可加,\omega^2 最不偏但計算稍繁。至於這些效果量在跨研究之間的轉換與整合,則屬第三十二章後設分析的範疇。

重複量數與球形性

教學法實驗至此都是受試者間設計,每個學生只受一種教法、只測一次。但許多心理學研究是受試者內的:同一批人在多個時點或多個條件下反覆受測,例如追蹤每位學生在期中與期末的兩次統計素養分數。這類重複量數設計(repeated measures design)有一項顯著優勢,即每個人自己當自己的控制,個體間的穩定差異被消去,因而在相同樣本下往往具有更高的檢定力,這也呼應第九章「受試者內設計更省樣本」的論點。

然而重複量數也帶來一個代價:同一個人的多次測量彼此相關,違反了變異數分析的獨立性假設,必須改用能處理這種相依的模型。重複量數變異數分析透過把「受試者」視為一個區集,將個體間變異分離出去;但它的 F 檢定要成立,需要一個比變異數同質性更嚴苛的假設,即球形性(sphericity)。

球形性要求,所有成對時點之差的變異數皆相等。一個較強、較易理解的充分條件是複合對稱(compound symmetry),即各時點的變異數相等、且任兩時點之間的相關也相等;球形性正是複合對稱的推廣與必要條件。問題在於,真實的縱貫資料幾乎注定違反球形性:相鄰時點的測量,通常比相隔遙遠的時點更為相關,這種「越近越像」的型態直接牴觸了球形性。

違反球形性的後果,是誤差項的自由度被高估,使 F 檢定過於寬鬆、第一類錯誤率膨脹。矯正之道,是依資料估計一個介於零與一之間的球形性指標 \varepsilon,並以它去折減 F 檢定的自由度:\varepsilon 越偏離一、違反越嚴重,自由度折減越多,檢定越保守。實務上有兩個常用的估計,Greenhouse & Geisser (1959) 的版本較為保守,Huynh & Feldt (1976) 的版本則在 \varepsilon 較大時修正了前者的偏低。另一條路是改採不需球形性假設的多變量取徑,把多次測量當成一個向量來處理。不過,這些校正終究是補丁;當時點增多、相依結構複雜時,更根本的解法是改用第二十八章的多層次模型或第二十九章的成長模型,直接把相依結構納入模型。

混合設計

把受試者間與受試者內兩種因子放進同一項研究,便是混合設計(mixed design),這在心理學中極為普遍。教學法實驗的完整版即是一例:教法是受試者間因子(每人只受一種),測驗時點(期中、期末)是受試者內因子(每人都測兩次)。混合設計最引人入勝的,往往是「受試者間因子與受試者內因子的交互作用」,因為它捕捉的是「不同組別隨時間變化的型態是否不同」,例如三種教法的學生,其由期中到期末的進步幅度是否有別。

混合設計的分析,難點在於它含有多個不同的誤差項。受試者間因子的檢定,以「受試者巢套於組內」的變異為誤差;受試者內因子及其與組間因子的交互作用,則另以「受試者內殘差」為誤差。換言之,同一張變異數分析摘要表裡,不同的效果要用不同的分母來檢定,而選對誤差項的依據,正是第四節的期望均方。這種多重誤差項的結構,一方面顯示了古典變異數分析設計的精巧,另一方面也暴露了它的侷限:一旦設計再複雜一些,例如各人測量時點不齊、有缺失、或想納入隨時間變動的共變數,這套以平方和分解為骨架的架構便捉襟見肘,而這正是多層次與成長模型(第二十八、二十九章)登場的契機。

共變數分析與 Lord 悖論

還有一種在準實驗與田野研究中極為常用的設計,是共變數分析(analysis of covariance, ANCOVA)。它的構想,是把一個與依變項相關的連續變項,即共變數(covariate),納入變異數分析,藉由統計調整消去它所帶來的無關變異。就教學法實驗而言,最自然的共變數是前測分數:把學生入學時的統計基礎納入,等於在比較教法之前,先把各組起點的差異扣除,理論上能提高精確度與檢定力。

共變數分析要能正當運作,仰賴幾個假設,其中最關鍵的是各組之內「依變項對共變數的迴歸斜率」相等,即迴歸斜率同質(homogeneity of regression slopes)。若斜率不等,代表共變數的效果本身就隨組別而異,也就是共變數與處理有交互作用,此時「以單一斜率作調整」便失去意義,強行為之只會誤導。此外,共變數分析用於非隨機分組的觀察資料時,還藏著更深的陷阱。

這個陷阱,最戲劇性地體現在 Lord (1967) 提出的悖論。Lord 設想兩位統計學家,分析同一批「學生入學到學期末體重變化」的資料,欲比較兩間餐廳的伙食對男女生體重的影響。第一位只看「期末減期初」的變化量,發現男女生的平均體重各自都沒變,於是斷言伙食對兩性沒有差別效果。第二位改用共變數分析,以期初體重為共變數調整期末體重,卻發現在「起點相同」的男女生之間,期末體重有顯著差異,於是斷言伙食對兩性有不同效果。兩人用的是同一批資料,結論卻截然相反。

推導方塊Lord 悖論的代數與其根源

設個體期初、期末分數為 X 與 Y,組別為 G。變化量取向檢定的是兩組 E(Y-X\mid G) 之差,也就是以斜率 1 把 X 從 Y 中扣除;共變數分析檢定的是兩組 E(Y - \beta X\mid G) 之差,其中 \beta 是組內迴歸斜率,通常不等於 1。兩者所扣除的量相減:

(Y-X) - (Y-\beta X) = (\beta - 1)\,X.

只要 \beta \neq 1,且兩組的 X 平均不同,這兩種分析就會給出不同、甚至方向相反的組間比較。差異的根源不在算術,而在兩者其實在回答不同的問題。

悖論的化解,不在於統計,而在於因果。兩種分析各自估計的,其實是不同的因果量:變化量取向回答「若什麼都不做,兩組會如何自然變化」,共變數分析回答「在起點相同的假設下,組別的效果為何」。當分組是隨機的,共變數分析的調整合理且能提升效率;但當分組非隨機,例如性別本就不是隨機分派的,「調整起點」這個動作本身可能製造出並不存在的因果結論。究竟哪一個分析才對,取決於研究者所欲回答的因果問題,以及背後的因果結構,這已超出代數所能裁決的範圍,須以第三十一章的因果框架,即潛在結果與因果圖,方能釐清。本章在此只點明:共變數分析在設計層次是一把利器,在因果詮釋層次卻是一處險灘。

ANOVA 即迴歸:編碼與統一

行文至此,變異數分析已展開為一族琳瑯滿目的設計:單因子、因子、重複量數、混合與共變數分析,各有各的摘要表與誤差項,看起來像是一長串必須逐一背下的配方。然而本章開篇便預告過,這一切終究是迴歸的特例。看清這一點的好處不只是省去記憶:共同的骨架一旦浮現,讀者便能自行推導未曾學過的設計,也能明白為何遇上不整齊的資料時,迴歸的寫法遠比平方和分解有彈性。而這個統一,透過一個相當簡單的動作達成,就是把類別的組別身分編碼為數值的預測變項。

關鍵在於如何為「組別」這個類別變項編碼。最常見的是虛擬編碼(dummy coding):以其中一組為參照組,為其餘各組各設一個取值零或一的指示變項;此時迴歸截距即參照組的平均,各斜率即各組相對於參照組的平均差。另一種是效果編碼(effect coding),以 +1、-1、0 標定,使截距等於各組平均的總平均,斜率等於各組相對於總平均的效果,這恰好對應變異數分析中「效果」\alpha_j 的定義。第三種是對比編碼(contrast coding),直接把第五節所談的正交對比放進設計矩陣,使每個迴歸係數對應一個有理論意涵的比較。

推導方塊單因子變異數分析作為迴歸

設 k=3 組,以效果編碼設兩個預測變項 E_1, E_2:第一組取 (1,0)、第二組取 (0,1)、第三組取 (-1,-1)。迴歸模型

Y_{i} = \beta_0 + \beta_1 E_{1i} + \beta_2 E_{2i} + \varepsilon_i

的最小平方解為 \hat\beta_0 = \bar{Y}_{\cdot\cdot}(總平均)、\hat\beta_1 = \bar{Y}_{\cdot 1}-\bar{Y}_{\cdot\cdot}、\hat\beta_2 = \bar{Y}_{\cdot 2}-\bar{Y}_{\cdot\cdot},正是各組的處理效果。此模型檢驗 \beta_1=\beta_2=0 的整體 F 與其 R^2,數值上與單因子變異數分析的 F 與 \eta^2 完全相同。變異數分析並非另一種方法,而是「以類別變項為預測變項的迴歸」的另一種記法。

這個對應一旦看清,整幅圖景便豁然開朗。因子設計的交互作用,不過是迴歸中兩個編碼變項的乘積項;共變數分析,不過是同時納入類別編碼與連續共變數的迴歸;重複量數與混合設計,則對應把受試者效果也納入的模型,而那正是通往多層次模型的一步。變異數分析、迴歸、乃至第十一章的廣義線性模型,並非各自獨立的技術,而是同一個線性模型架構在不同資料型態下的面貌。把它們統一在迴歸之下,不僅是形式上的簡潔,更讓研究者得以用一致的語言,去思考設計、估計與檢定。歷史上這兩套傳統曾長期被分頭傳授,這道人為的鴻溝,直到晚近才在廣義線性模型的框架下被填平。

前沿:穩健、貝氏與設計的未來

變異數分析雖已年逾百歲,卻不是一門已經凍結的技術。它的古典形式建立在常態、變異同質與獨立這幾個相當強的假設之上,而這些假設在真實的心理學資料裡往往只是勉強成立;它的推論又完全繫於顯著性檢定,因而一併繼承了第八章所述的種種限制。方法學界針對這兩處的回應,加上設計本身的演進,構成了本節要勾勒的三條線索:把統計量穩健化、把推論貝氏化,以及把設計當成可以最佳化的對象。

其一是穩健化。古典 F 檢定對常態與變異同質的偏離,在不等組時尤其敏感。以截尾平均數(trimmed means)與相應的穩健變異估計取代傳統統計量,或採用不假設變異相等的 Welch 型校正,能在資料違反假設時維持較可靠的錯誤率。這類方法在方法學文獻中已相當成熟,卻遲遲未能撼動教科書與軟體預設,是一個「已確立卻未普及」的典型案例。

其二是貝氏取向。Rouder et al. (2012) 為變異數分析設計提出了一套預設先驗的貝氏因子,讓研究者得以直接評估「有效果」相對於「無效果」的證據強度,而非僅止於拒絕或不拒絕虛無。貝氏變異數分析的一個實質優勢,是它能對虛無假設本身提供支持證據,這正是第八章所述頻率取向難以做到的一點;其細節與更廣的貝氏框架,留待第三十三章。

其三是設計本身的演進,包括在多個候選設計中尋找最有效率者的最適設計(optimal design),以及允許依中途資料調整的序貫與適應性設計。最後值得重申一個貫穿全書的隱憂:心理學的實驗傳統長期偏好小樣本,而小樣本的變異數分析同樣受制於第九章所述的檢定力赤字,其顯著結果一樣可能是被誇大的僥倖。把 Fisher 的設計智慧,與當代對檢定力及再現性的關注(第三十六章)結合起來,才是這門古老技術在今日應有的用法。就變異數分析的整體學習,Maxwell et al. (2018) 以模型比較的視角貫串各種設計,是一部值得深入的參考。

小結

把本章收攏。變異數分析起於 Fisher 的實驗設計,其三條原則,即隨機化、區集與重複,至今仍界定著什麼叫做一個好的實驗。它的技術核心,是把總變異分解為可歸因於設計的部分與只能算作誤差的部分,再以 F 比檢驗前者是否夠大;而期望均方,則決定了在不同的固定與隨機因子設計下,這個 F 比該如何正確地建構。從單因子到因子設計、重複量數、混合設計與共變數分析,變異數分析發展出一整套應對各種設計的語彙,但也在設計漸趨複雜、資料漸不整齊時,逐步逼近自身的極限。

而貫穿本章的最深一條線索是:變異數分析從來不是一種孤立的技術,而是迴歸與廣義線性模型的一個特例。理解了這一點,第十一章便是順理成章的下一步:它會把本章末節的編碼統一正式展開,從最小平方的幾何,到廣義線性模型對非常態、非連續結果的擴充,把「線性模型」這個貫穿其後多層次、縱貫、乃至項目反應理論的共同引擎,完整地建立起來。變異數分析所體現的設計智慧,將在那個更大的框架裡,繼續發揮作用。

參考文獻

Fisher, R. A. (1935). The design of experiments. Oliver; Boyd.
Greenhouse, S. W., & Geisser, S. (1959). On methods in the analysis of profile data. Psychometrika, 24(2), 95–112. https://doi.org/10.1007/BF02289823
Huynh, H., & Feldt, L. S. (1976). Estimation of the Box correction for degrees of freedom from sample data in randomized block and split-plot designs. Journal of Educational Statistics, 1(1), 69–82. https://doi.org/10.3102/10769986001001069
Lord, F. M. (1967). A paradox in the interpretation of group comparisons. Psychological Bulletin, 68(5), 304–305. https://doi.org/10.1037/h0025105
Maxwell, S. E., Delaney, H. D., & Kelley, K. (2018). Designing experiments and analyzing data: A model comparison perspective (3rd ed.). Routledge.
Rouder, J. N., Morey, R. D., Speckman, P. L., & Province, J. M. (2012). Default Bayes factors for ANOVA designs. Journal of Mathematical Psychology, 56(5), 356–374. https://doi.org/10.1016/j.jmp.2012.08.001
Rucci, A. J., & Tweney, R. D. (1980). Analysis of variance and the “second discipline” of scientific psychology: A historical account. Psychological Bulletin, 87(1), 166–184. https://doi.org/10.1037/0033-2909.87.1.166
本章引用格式游琇婷(2026)。實驗設計與變異數分析。《計量心理學:測量、模型與推論》(第 10 章)。