貝氏取向在計量心理學
=1.5em
本書多處已預示了貝氏推論的身影:第八章論及統計推論的哲學爭議、第十二章的資訊準則、第十七章項目反應理論的估計、第十九章的近似不變性、以及第二十八章多層次模型的部分聯營與收縮。這些線索並非偶然,它們共同指向一個統一的推論典範。貝氏方法(Bayesian methods)將機率詮釋為信念的程度,把未知參數本身視為具有分布的隨機量,並以一條簡潔的規則描述如何依資料更新信念。此一觀點不僅提供了另一套估計與推論的工具,更為不確定性的表徵、複雜模型的估計、以及先驗知識的整合,給出了一個內在一致的框架。
本章對貝氏方法作一系統而深入的處理。首先辨明貝氏與頻率派兩個典範的根本差異,並鋪陳貝氏定理、先驗、後驗與可信區間等核心概念。其次,說明為何貝氏推論在實務上高度依賴計算,並詳述馬可夫鏈蒙地卡羅(MCMC)的原理、主要演算法與收斂診斷。再者,處理模型比較(貝氏因子與資訊準則)、後驗預測檢驗、以及貝氏方法在潛在變項模型中的應用。最後,闡明先驗作為正則化的觀點、貝氏工作流程、以及圍繞先驗主觀性的批判。貫穿全章的核心訊息是:貝氏方法的價值不在於某種意識形態的優越,而在於它為「在不確定下更新信念」這一推論的根本任務,提供了一個連貫、透明、且能自然量化不確定性的架構。
兩個典範:頻率派與貝氏
貝氏與頻率派的分歧,根源於對機率的不同詮釋。頻率派將機率理解為長期相對頻率,參數是固定但未知的常數,不確定性來自抽樣的隨機性,推論的對象是「在假設參數值下,資料出現的機率」。貝氏派則將機率理解為信念的程度,參數本身是隨機量、具有分布,不確定性直接以參數的機率分布表徵,推論的對象是「在觀測資料下,參數的機率」。這一差異看似抽象,卻導致了截然不同的推論語言:頻率派談的是 p 值與信賴區間,貝氏派談的是後驗機率與可信區間。
此分歧亦呼應第八章關於統計推論的爭議。頻率派推論的許多為人詬病之處,例如 p 值易被誤解為「虛無為真的機率」、信賴區間易被誤解為「參數落於其中的機率」,其根源正在於人們直覺上想要的是貝氏式的陳述,卻套用了頻率派的工具。貝氏方法的一個吸引力,正在於它所提供的,恰是人們直覺上所欲求的那種對參數的直接機率陳述。當然,這份直接性以引入先驗為代價,而先驗的地位,正是後續爭論的焦點。
兩種語言的差別,在一個具體情境中最容易看清。設想在 12 個班級、每班約 25 名學生的樣本上,估計班級層次的教學氛圍對學習投入的效果,點估計為 0.30。頻率派的問法是:假定真實效果恰為零,出現 0.30 這麼大或更大的估計值的機率有多少;若算出 0.04,便說在 0.05 的水準下拒絕虛無假設。貝氏的問法則是:在已經看到這批資料之後,這個效果大於零的機率是多少;若後驗給出 0.96,便可直接說「效果為正的機率是 0.96」。兩個數字有時相去不遠,指涉的對象卻全然不同:前者是資料的機率,後者是參數的機率。這個情境本章後續還會用到。
貝氏定理與後驗分布
上一節指出了兩個典範的分歧所在,卻還沒有說明貝氏派究竟如何從資料中學習。答案濃縮在貝氏定理這一條規則裡:它描述如何把見到資料之前的信念,與資料所提供的證據結合起來,得到更新之後的信念。就直覺而言,這條規則說的是一件相當樸素的事。原本認為某個參數值有多合理,看到資料之後,就依「這個參數值把觀測到的資料解釋得多好」按比例調整:解釋得好的參數值,信念上調;解釋得差的,信念下調;調完再整體歸一化,使全部參數值的機率合計仍為一。以下先給出正式的敘述。
設 \theta 為未知參數、y 為觀測資料。先驗分布 p(\theta) 表徵見到資料前對參數的信念,概似函數 p(y\mid\theta) 表徵資料所提供的證據。貝氏定理給出後驗分布:
分母 p(y) 稱邊際概似或證據,是對參數積分後的常數,不依賴 \theta。因此後驗與參數的關係可簡潔地寫為
即「後驗正比於概似乘以先驗」。此式亦蘊含貝氏推論的序列性:今日之後驗可作為明日之先驗,隨新資料持續更新,這使貝氏框架天然適合累積證據與序貫學習。
這條規則的優雅之處,在於它把「學習」形式化為一個機率的更新過程。先驗編碼了既有的知識或假設,概似傳入了資料的訊息,後驗則是二者的融合,並完整地保留了更新後的不確定性。與頻率派給出一個點估計加一個標準誤不同,貝氏推論的產出是一整個後驗分布,一切推論,無論點估計、區間或預測,皆由此後驗導出。
用一個小例子體會這個更新過程。設想要估計新編量表中某一道題目的通過率 \pi,先驗取 \mathrm{Beta}(2,2),其平均數為 0.50、標準差約 0.22,意思是在看到資料前傾向認為這題難度中等,但很不確定。今對 40 名學生施測,28 人答對。由於 Beta 先驗與二項概似共軛,後驗恰為 \mathrm{Beta}(30,14),平均數約 0.68、標準差約 0.07。把數字讀出來:先驗的中心 0.50 被資料拉向樣本比例 0.70,最後停在偏樣本一側的 0.68,而不確定性則從 0.22 收縮到 0.07。先驗與資料各自按其訊息量發言,這就是「後驗正比於概似乘以先驗」在數值上的樣貌。
先驗分布
貝氏定理要能運轉,必先有先驗。這是貝氏方法最具特色、也最受爭議的成分:它要求研究者把見到資料之前對參數的信念或知識,明確地編碼為一個機率分布。不少初學者在此止步,覺得這是憑空指定的東西。比較貼近實情的理解是,先驗所回答的,其實是一個研究者本來就得回答的問題:在這個領域裡,這個參數合理的範圍大概在哪裡。一個因素負荷不會是 8.5,一個相關係數不會是 1.7,一份臨床量表的組間差異也不太可能達到 20 個標準差。先驗只是把這類本已存在的常識,從研究者的腦中搬進模型裡,使它可以被看見、被檢視、被辯論。
先驗大致可分幾類。資訊性先驗(informative prior)納入了實質的既有知識,如前人研究的效果量範圍,在小樣本下能顯著穩定估計。弱資訊先驗(weakly informative prior)僅施加溫和的約束,排除不合理的參數值(如將標準差限為正、將效果量限於合理量級),而不強加具體結論,是當代實務的常見預設。無資訊或平坦先驗(noninformative/flat prior)試圖「讓資料說話」,但完全平坦的先驗在許多情形下並非真正客觀,且可能導致不當的後驗。共軛先驗(conjugate prior)則因與概似搭配可得到封閉形式的後驗,在計算受限的年代極為重要,如今則多讓位於數值方法。
這幾類之中,最需要澄清的是「無資訊」這個名稱,因為平坦並不等於沒有立場。首先,平坦是相對於某一種參數化而言的。若對相關係數 \rho 在 [-1,1] 上給均勻先驗,看似中立,經 Fisher z 轉換之後這個先驗就不再均勻;同理,對變異數 \sigma^{2} 給均勻先驗,等價於對標準差 \sigma 給一個偏向大值的先驗。其次,把先驗撐得極寬,等於宣稱極端值與合理值一樣可信。設想對一個以標準化分數表達的組間差異給 \mathrm{Normal}(0,100^{2}) 的先驗,這其實是在說「差異達 150 個標準差」和「差異為 0.3」同樣不無可能,而這不是任何研究者真正相信的事。當代實務偏好弱資訊先驗,用意不在注入結論,而在排除連提出假設的人自己都不相信的參數值。
先驗的選擇具有實質後果,尤其在資料訊息有限時,因此它要求透明與辯護。一個負責任的貝氏分析,應明確報告所用先驗、說明其依據,並進行先驗敏感度分析,檢視結論對先驗設定的穩健程度。將先驗視為分析的公開假設而非隱藏的操縱,是貝氏方法可信度的關鍵,這也與開放科學對預先註冊分析決策的要求相通。
後驗推論:點估計與可信區間
前一節得到了後驗分布,接下來的問題是如何讀它。後驗是一整條分布,而報告與溝通往往只需要幾個數字,因此貝氏推論的最後一步,是把這條分布摘要成點估計與區間。點估計可取後驗的平均數、中位數或眾數(後者即最大後驗估計,maximum a posteriori, MAP)。三者並非任選:後驗平均在平方損失下為最適,後驗中位數在絕對損失下為最適,取哪一個,取決於研究者在意的是何種誤差。不確定性則由後驗的離散程度刻畫,最常用的是後驗標準差;它的數值常與頻率派的標準誤相近,意義卻不同,前者說的是參數本身的變異,後者說的是估計值在重複抽樣下的變異。區間估計以可信區間(credible interval)表達,其詮釋與頻率派的信賴區間有本質差異,而這正是初學貝氏方法時最容易混淆的一點。
一個 95% 的可信區間 [a,b] 滿足
即「給定觀測資料,參數落於此區間的機率為 0.95」。這是一個關於參數的直接機率陳述。相對地,95% 的信賴區間(第八章)的正確詮釋是:在假想的重複抽樣中,如此構造的區間有 95% 會涵蓋真值;對任一已實現的區間,參數或在其中、或不在,並無「95% 機率」可言。
換言之,可信區間所具有的,正是人們常誤加於信賴區間的那種直觀詮釋。此外,最高後驗密度(highest posterior density, HPD)區間為在給定涵蓋機率下最短的區間,當後驗不對稱時,它較等尾區間更能反映後驗的集中所在。
這一詮釋上的直接性,是貝氏推論在溝通上的一大優勢:研究者可以直接說「該效果為正的後驗機率為 0.97」,而無須訴諸重複抽樣這一反事實的想像。然而須強調,此直接性建立在先驗與模型設定之上,可信區間的可信,終究不強於其所依賴的假設。
以具體數字體會這個差別。承前面 12 個班級的例子,設想教學氛圍效果的後驗平均為 0.30、後驗標準差為 0.12,95% 可信區間為 [0.06,\ 0.54]。這句話可以直接讀成:在這批資料與所設模型之下,該效果落在 0.06 與 0.54 之間的機率為 0.95,而效果大於零的後驗機率約為 0.99。若同樣一組數字來自頻率派的 95% 信賴區間,正確的說法只能是:若把這個研究重複無數次,每次以相同程序造一個區間,其中約有 95% 會涵蓋真值;至於眼前這一個區間,它要嘛涵蓋、要嘛不涵蓋,並無機率可言。兩種區間的端點可能幾乎重合,能說的話卻差得很遠。
計算的必要:正規化常數的難題
貝氏推論在概念上簡潔,在實務上卻長期受制於一個計算障礙。後驗的正規化常數 p(y)=\int p(y\mid\theta)p(\theta)\,d\theta,是一個對參數空間的積分;當參數為高維、或概似與先驗非共軛時,此積分沒有封閉解,且維度稍高即使數值積分亦不可行。這意味著,雖然後驗的形狀 p(y\mid\theta)p(\theta) 容易寫出,但要得到一個正規化的、可用以計算期望與分位數的後驗分布,卻極其困難。共軛先驗雖能繞過此難題,但其適用範圍狹窄,難以支撐心理學所需的複雜模型。
維度的問題比一般想像的嚴重得多。設想那份 20 題的量表以雙參數 IRT 模型分析,300 名受試者:待估的參數包含 20 個難度、20 個鑑別度,以及 300 個受試者的潛在特質,合計 340 個。正規化常數是對這 340 維空間作積分。即使每一維只切成 10 個格點,格點總數也是 10^{340} 這個天文數字,任何數值積分法都毫無指望。
貝氏方法的實用化,因而有賴於一類繞過正規化常數的計算策略:不去解析地求出後驗,而是設法從後驗中抽取大量樣本,再以這些樣本近似後驗的一切特徵。這一轉向,使貝氏方法自 1990 年代起隨計算能力的提升而全面復興。
馬可夫鏈蒙地卡羅
馬可夫鏈蒙地卡羅(Markov chain Monte Carlo, MCMC)正是那條繞路。其精妙構想是:既然無法把後驗寫出來,就設計一條在參數空間中游走的隨機路徑,讓這條路徑「偏好」後驗機率高的區域,偏好的程度恰好與後驗密度成正比。技術上的說法是,建構一條以後驗分布為平穩分布的馬可夫鏈。值得停下來說清楚它為何管用。馬可夫鏈的遍歷定理保證,只要鏈能到達參數空間的每個角落,鏈在任一區域停留的時間比例,長期下來會收斂到該區域的後驗機率;於是把鏈走過的位置逐一記錄下來,這串位置就是一份來自後驗的樣本。要計算後驗平均,取這些位置的平均即可;要計算 95% 區間,取它們的 2.5 與 97.5 百分位數即可。整個過程從頭到尾都不需要知道正規化常數。
目標是自 p(\theta\mid y)\propto p(y\mid\theta)p(\theta) 抽樣。Metropolis et al. (1953) 提出、Hastings (1970) 推廣的演算法如下。於當前狀態 \theta^{(t)},自提議分布 q(\cdot\mid\theta^{(t)}) 抽取候選 \theta^{*},並以下列機率接受之:
關鍵在於,未知的正規化常數 p(y) 在分子分母中相消,故計算接受機率無須知道它,這正是 MCMC 繞過正規化難題的訣竅。若接受則 \theta^{(t+1)}=\theta^{*},否則 \theta^{(t+1)}=\theta^{(t)}。當提議對稱(q(\theta^{*}\mid\theta^{(t)})=q(\theta^{(t)}\mid\theta^{*}))時,\alpha 化簡為後驗比值之最小值與 1。Gibbs 抽樣 (Gelfand & Smith, 1990) 為一特例,逐一自每個參數的完全條件分布抽樣,接受機率恆為 1。
Metropolis-Hastings 與 Gibbs 雖普適,但在高維或參數高度相關時效率低落、混合緩慢。現代貝氏計算多採哈密頓蒙地卡羅(Hamiltonian Monte Carlo, HMC)及其自動調校版本 NUTS:藉引入後驗對數梯度的資訊,使鏈能沿著後驗的幾何有效地大步移動,大幅提升高維問題的抽樣效率。機率程式語言 Stan (Carpenter et al., 2017) 即以 NUTS 為核心,使複雜貝氏模型的估計得以標準化與普及,是當代貝氏實務的重要基礎設施。
收斂診斷
MCMC 提供的是後驗的樣本近似,但此近似唯有在鏈已收斂至平穩分布、且樣本充分探索後驗時方屬可信。因此收斂診斷是任何 MCMC 分析不可或缺的一環,主要工具摘要於表 33.1。最重要的單一指標是 Gelman & Rubin (1992) 的潛在尺度縮減因子 \hat R:它比較多條起始值分散之鏈的鏈間變異與鏈內變異,若各鏈已收斂至同一分布,二者應趨於一致而 \hat R 接近 1;顯著大於 1 則表示鏈間尚未混合。有效樣本數(effective sample size, ESS)則量化因序列自相關而損失的資訊,它回答「這些相關的樣本相當於多少獨立樣本」,過小的 ESS 意味後驗摘要(尤其是尾端分位數)不可靠。
| 診斷 | 偵測對象 | 判準 |
|---|---|---|
| \hat R(Gelman-Rubin) | 鏈間是否已混合收斂 | 接近 1(如 <1.01) |
| 有效樣本數(ESS) | 自相關導致的資訊損失 | 越大越好,須足以估分位數 |
| 軌跡圖(trace plot) | 平穩性與混合 | 目視呈平穩交纏狀 |
| 發散轉移(divergence) | HMC 的幾何病態 | 應為零 |
註. \hat R 與 ESS 為當代通行的量化基準;發散轉移為 HMC/NUTS 特有的診斷,提示後驗幾何陡峭、估計可能偏誤。診斷須聯合研判,單一指標合格不保證收斂。
把數字讀出來會清楚得多。設想以 4 條鏈各抽 2,000 次、合計 8,000 個後驗樣本估計前述 12 個班級的模型。若某參數的 \hat R = 1.00、ESS 為 3,200,意思是鏈間變異與鏈內變異已幾乎相同,且這 8,000 個彼此相關的樣本,所帶訊息約當於 3,200 個獨立樣本,足以穩定地估出平均數與兩端的分位數。若換成 \hat R = 1.08、ESS 只有 60,則兩處同時亮紅燈:鏈間仍明顯不一致,有效訊息也少到連 95% 區間的端點都定不住,此時不應報告後驗摘要,而應延長暖機、改寫參數化或重新檢視模型。軌跡圖則是把各鏈的取值對疊代次數畫出來,看的是有沒有殘留趨勢、幾條鏈是否交纏成一片;若各鏈朝不同高度漂移,或某鏈長時間卡在一處,即使 \hat R 過關也應視為警訊。
須強調,收斂診斷只能提供未收斂的反證,而不能證明已收斂:診斷全數通過僅表示「未發現不收斂的跡象」,而非保證鏈已探索了整個後驗(例如多峰後驗中某些模態可能從未被造訪)。這要求研究者以多條分散起始的鏈、充分的暖機(warmup),並對診斷保持審慎。
模型比較:貝氏因子與資訊準則
貝氏框架下的模型比較有兩條主要路徑。第一條是貝氏因子(Bayes factor),即兩模型邊際概似之比,Kass & Raftery (1995) 對其定義、計算與詮釋作了經典的整理。貝氏因子直接量化資料對兩模型的相對支持,並自然地內含對複雜度的懲罰(經由邊際概似對先驗的積分)。把一個貝氏因子讀出來:\mathrm{BF}_{10}=12 表示這批資料在模型 1 之下出現的可能性是在模型 0 之下的 12 倍,屬中等偏強的支持;\mathrm{BF}_{10}=1.3 幾乎沒有分辨力;\mathrm{BF}_{10}=0.05 則是反過來支持模型 0,強度為 20 倍。與 p 值不同的是,貝氏因子可以量化「支持虛無」的證據,而不只是「未能拒絕虛無」。
然而它有一個嚴重的實務弱點:邊際概似對先驗的設定高度敏感,即使是對後驗影響甚微的漫射先驗,也可能劇烈改變貝氏因子,此即 Lindley 悖論所揭示的現象。因此貝氏因子的使用須格外審慎地對待先驗。作為虛無假設顯著性檢定的一種貝氏替代,貝氏因子與 p 值取向的根本對照,見第八章的推論爭議。
第二條路徑著眼於預測,並與第十二章的資訊準則一脈相承。相較於 AIC、BIC 等以點估計為基礎的準則,全貝氏的預測評估以整個後驗為基礎。早期通行的偏差資訊準則(deviance information criterion, DIC)已具此精神,卻把有效參數數目建立在後驗平均這一個點上,其值會隨參數化的寫法改變,遇到階層模型或明顯非常態的後驗時,甚至可能算出負的有效參數。
廣泛適用資訊準則(widely applicable information criterion, WAIC)與留一交叉驗證(leave-one-out cross-validation, LOO-CV)估計模型的樣本外預測準確度,Vehtari et al. (2017) 提出以帕列托平滑重要性抽樣(PSIS)高效且穩健地計算 LOO,並提供了診斷其可靠性的指標。此類方法不需重新擬合模型即可近似交叉驗證,已成為當代貝氏模型比較的主流,其精神與第十二章「以樣本外預測為模型選擇依據」的邏輯完全相通。二者取代 DIC 的關鍵,在於它們逐一觀察值地以整個後驗計算預測密度,不倚賴任何點估計,因而既不受參數化寫法左右,也能為模型間的比較差異附上標準誤。
後驗預測檢驗
模型比較回答「哪個模型較好」,但一個相對較好的模型仍可能絕對地不合適。後驗預測檢驗(posterior predictive check, PPC)用以評估模型對資料的絕對契合:自後驗預測分布模擬出「複製資料」,再將其與實際觀測資料在關切的特徵上比較。若模型良好,複製資料應與觀測資料相似;若在某些特徵(如偏態、極端值、特定次群體的分布)上系統性地偏離,則揭示了模型的設定不足。
PPC 的優點在於它可針對研究者實質關切的面向自訂檢驗量,是一種靈活且直觀的模型批判工具,體現了貝氏工作流程中「以模擬自我檢查」的精神。
貝氏潛在變項模型
貝氏方法對本書所論的潛在變項模型別具價值,因其能自然地處理這些模型在頻率派估計下常遭遇的困難。在結構方程與驗證性因素分析中,Muthén & Asparouhov (2012) 提出的貝氏結構方程模型以「近似零」先驗取代傳統的「恰為零」約束:容許交叉負荷與殘差共變偏離零一個微小的量,而非強制其為零。此舉緩解了過度嚴格的約束所造成的適配不良與模型修改的資料依賴,並與第十九章的近似測量不變性一脈相承。在項目反應理論(第十七章)中,MCMC 使高維、多向度與複雜計分模型的估計成為可能,繞過了邊際最大概似在高維積分上的困難。
貝氏方法與多層次模型(第二十八章)的親和尤深。如第二十八章所述,隨機效果的階層設定本質上即具貝氏結構,其收縮即部分聯營。明確的貝氏取向在群集數偏少、變異數成分的最大概似估計不穩或落於邊界時尤具價值:對變異數成分施加弱資訊先驗,可穩定估計並避免退化解,這是貝氏方法在小樣本階層模型上的一項實質優勢。
仍以 12 個班級為例:班級層次的變異數以最大概似估計時,常因群集數過少而被推到邊界,軟體回報「變異數成分為零」,連帶使固定效果的標準誤失真。改以半柯西(half-Cauchy)弱資訊先驗作貝氏估計,後驗自然避開零這個奇異點,例如給出中位數 0.06、95% 可信區間 [0.01,\ 0.18]。這個結果誠實得多:班級間確有差異,但憑 12 個班級的資訊,只能把它定位在一段相當寬的範圍內。整體而言,貝氏方法為潛在變項建模提供的,不只是另一種估計途徑,更是對複雜模型中不確定性與弱識別參數的一種更誠實的處理。
貝氏取向在本書中的應用遠不止於此。本章作為貝氏方法之家,其工具在多處應用章中各展其長,值得在此一併指路:貝氏變異數分析與其預設先驗的貝氏因子,見第十章;跨群體的近似測量不變性以近似零先驗實現,見第十九章;小樣本階層模型的變異數成分穩定化,見第二十八章;密集縱貫資料的動態結構方程模型以貝氏估計與 MCMC 為根基,見第三十章;把推論單位提升到研究群體的貝氏後設分析,見第三十二章;而心理計量網絡的貝氏估計,則見第三十五章。這些應用共享本章所奠立的同一套推論邏輯,即以先驗與資料融合為後驗、以 MCMC 繞過正規化難題、並以後驗直接量化不確定性;它們的多樣,正說明了貝氏取向作為一個統一框架的涵蓋力。
先驗作為正則化
先驗的一個深刻功能,是作為正則化(regularization)的機制,這也將本章與第三十四章相連。對迴歸或負荷係數施加集中於零的先驗,等同於對其施加一個收縮的懲罰:先驗越集中,係數被朝零拉近的力道越強。以標準化的迴歸係數為例,\mathrm{Normal}(0,1) 的先驗幾乎不構成任何約束,\mathrm{Normal}(0,0.1^{2}) 則等於事先宣告「係數的絕對值超過 0.2 的機率不到 5%」,估計時便會把微弱的係數壓向零。事實上,若干經典的正則化方法恰是特定先驗下的貝氏後驗眾數,如表 33.2 所示。
| 先驗分布 | 對應的頻率派正則化 | 收縮特性 |
|---|---|---|
| 常態(高斯) | 脊迴歸(ridge,L_2) | 均勻收縮,不產生稀疏 |
| 拉普拉斯(Laplace) | lasso(L_1) | 可將係數壓至恰為零 |
| 馬蹄(horseshoe) | 自適應收縮 | 強壓小訊號、幾乎不動大訊號 |
註. 常態先驗下的後驗眾數即脊估計;拉普拉斯先驗下的後驗眾數即 lasso 估計。馬蹄先驗無簡單的頻率派對應,屬全貝氏的自適應收縮。
其中,脊迴歸對應常態先驗、lasso 對應拉普拉斯先驗,二者將於第三十四章詳論。而 Carvalho et al. (2010) 的馬蹄先驗代表了貝氏收縮的一項精緻進展:它以重尾配合尖峰的先驗形狀,同時做到「強力壓縮接近零的雜訊係數」與「幾乎不收縮真正大的訊號係數」,在稀疏問題上優於均勻收縮的脊或一刀切的 lasso。這一觀點的統一意義在於揭示:正則化與貝氏先驗並非兩種相異的技術,而是同一收縮邏輯的兩種表述,先驗即是把「係數應偏小」這一信念,明確地寫成機率分布。
貝氏工作流程與批判
當代的貝氏實踐已遠非「套用一次貝氏定理」,而是一套迭代的貝氏工作流程(Bayesian workflow):從初步模型出發,經先驗預測檢驗評估先驗的合理性、以 MCMC 估計並嚴格檢查收斂、以後驗預測檢驗評估契合、以 WAIC/LOO 比較競爭模型、並以先驗敏感度分析檢視穩健性,如此循環修正。Gelman et al. (2013) 的《貝氏資料分析》系統呈現了此一取向,而 Schoot et al. (2014) 則為行為科學讀者提供了平易的入門。
貝氏方法最常受到的批判,是先驗的主觀性:既然結論部分取決於研究者所選的先驗,是否即失去了客觀性,甚至可被操縱以得到想要的結果?對此有幾層回應。其一,一切統計分析皆蘊含假設,頻率派的模型設定、概似選擇同樣是主觀決定,貝氏的先驗只是把其中一部分假設攤在明處、使之可檢視、可辯論。其二,弱資訊先驗配合先驗敏感度分析,可將先驗的影響控制在合理範圍並公開其後果。其三,隨著資料量增加,概似逐漸主導後驗,先驗的影響隨之淡出;先驗最具影響、也最須審慎之處,恰是資料訊息薄弱的小樣本或弱識別情境,而那也正是任何方法都最為艱難之處。
平衡地說,貝氏方法在若干情境下優勢最為明顯:小樣本、複雜的階層或潛在變項模型、需要整合既有知識、需要對參數作直接機率陳述、或存在弱識別參數之時。而在大樣本配簡單模型時,貝氏與頻率派的結論多趨於一致,方法的選擇則更多取決於詮釋的偏好與溝通的需要。貝氏方法不是萬靈丹:它同樣受制於模型設定的正確與否,需要可觀的計算與對診斷的細心,草率的貝氏分析一樣會誤導。其真正的價值,在於提供一個透明地表述假設、連貫地更新信念、並誠實地量化不確定性的框架。
小結
本章對貝氏方法作了自哲學基礎、核心概念、計算方法、到應用與批判的完整鋪陳。貝氏方法以信念程度詮釋機率、以分布表徵參數的不確定性,並以貝氏定理將先驗與資料融合為後驗;其推論的產出是一整個後驗分布,可信區間因而具有人們直覺所欲求的直接機率詮釋。先驗並非外加的累贅,而是把研究者本已持有的常識寫成一個分布,使原本隱而不宣的假設得以被檢視與辯論;而所謂的無資訊先驗,往往只是換一種參數化就不再中立的錯覺。
實務上,貝氏推論倚賴 MCMC 繞過正規化常數的難題,而收斂診斷(\hat R、有效樣本數)是其可信的前提。本章並涵蓋貝氏因子與 WAIC/LOO 的模型比較、後驗預測檢驗、貝氏潛在變項模型、以及先驗作為正則化的統一觀點。對進一步的學習,Kruschke (2015) 與 McElreath (2020) 提供了兼具嚴謹與可及性的優良教材。
貫穿全章的訊息是:貝氏方法的價值不在意識形態,而在其為「在不確定下更新信念」提供了一個連貫、透明、能整合先驗知識並自然量化不確定性的框架。先驗作為正則化的觀點,已預示了下一章的主題:當參數眾多、預測為重時,如何藉收縮與交叉驗證馴服複雜度,這正是機器學習與現代高維方法的核心關切。