第 33 章 貝氏取向在計量心理學
第八部 計算取向與學科的未來
33Chapter

貝氏取向在計量心理學

本書多處已預示了貝氏推論的身影:第八章論及統計推論的哲學爭議、第十二章的資訊準則、第十七章項目反應理論的估計、第十九章的近似不變性、以及第二十八章多層次模型的部分聯營與收縮。這些線索並非偶然,它們共同指向一個統一的推論典範。貝氏方法(Bayesian methods)將機率詮釋為信念的程度,把未知參數本身視為具有分布的隨機量,並以一條簡潔的規則描述如何依資料更新信念。此一觀點不僅提供了另一套估計與推論的工具,更為不確定性的表徵、複雜模型的估計、以及先驗知識的整合,給出了一個內在一致的框架。

本章對貝氏方法作一系統而深入的處理。首先辨明貝氏與頻率派兩個典範的根本差異,並鋪陳貝氏定理、先驗、後驗與可信區間等核心概念。其次,說明為何貝氏推論在實務上高度依賴計算,並詳述馬可夫鏈蒙地卡羅(MCMC)的原理、主要演算法與收斂診斷。再者,處理模型比較(貝氏因子與資訊準則)、後驗預測檢驗、以及貝氏方法在潛在變項模型中的應用。最後,闡明先驗作為正則化的觀點、貝氏工作流程、以及圍繞先驗主觀性的批判。貫穿全章的核心訊息是:貝氏方法的價值不在於某種意識形態的優越,而在於它為「在不確定下更新信念」這一推論的根本任務,提供了一個連貫、透明、且能自然量化不確定性的架構。

兩個典範:頻率派與貝氏

貝氏與頻率派的分歧,根源於對機率的不同詮釋。頻率派將機率理解為長期相對頻率,參數是固定但未知的常數,不確定性來自抽樣的隨機性,推論的對象是「在假設參數值下,資料出現的機率」。貝氏派則將機率理解為信念的程度,參數本身是隨機量、具有分布,不確定性直接以參數的機率分布表徵,推論的對象是「在觀測資料下,參數的機率」。這一差異看似抽象,卻導致了截然不同的推論語言:頻率派談的是 p 值與信賴區間,貝氏派談的是後驗機率與可信區間。

此分歧亦呼應第八章關於統計推論的爭議。頻率派推論的許多為人詬病之處,例如 p 值易被誤解為「虛無為真的機率」、信賴區間易被誤解為「參數落於其中的機率」,其根源正在於人們直覺上想要的是貝氏式的陳述,卻套用了頻率派的工具。貝氏方法的一個吸引力,正在於它所提供的,恰是人們直覺上所欲求的那種對參數的直接機率陳述。當然,這份直接性以引入先驗為代價,而先驗的地位,正是後續爭論的焦點。

貝氏定理與後驗分布

貝氏推論的全部機制,濃縮於貝氏定理這一條規則之中。它描述了如何將先驗信念與資料所提供的證據結合,得到更新後的後驗信念。

推導方塊貝氏定理與後驗

設 \theta 為未知參數、y 為觀測資料。先驗分布 p(\theta) 表徵見到資料前對參數的信念,概似函數 p(y\mid\theta) 表徵資料所提供的證據。貝氏定理給出後驗分布:

p(\theta\mid y) = \frac{p(y\mid\theta)\,p(\theta)}{p(y)}, \qquad p(y) = \int p(y\mid\theta)\,p(\theta)\,d\theta.

分母 p(y) 稱邊際概似或證據,是對參數積分後的常數,不依賴 \theta。因此後驗與參數的關係可簡潔地寫為

p(\theta\mid y) \ \propto\ p(y\mid\theta)\,p(\theta),

即「後驗正比於概似乘以先驗」。此式亦蘊含貝氏推論的序列性:今日之後驗可作為明日之先驗,隨新資料持續更新,這使貝氏框架天然適合累積證據與序貫學習。

這條規則的優雅之處,在於它把「學習」形式化為一個機率的更新過程。先驗編碼了既有的知識或假設,概似傳入了資料的訊息,後驗則是二者的融合,並完整地保留了更新後的不確定性。與頻率派給出一個點估計加一個標準誤不同,貝氏推論的產出是一整個後驗分布,一切推論,無論點估計、區間或預測,皆由此後驗導出。

先驗分布

先驗是貝氏方法最具特色、也最受爭議的成分。它把研究者在見到資料前對參數的信念或知識,編碼為一個機率分布。先驗大致可分幾類。資訊性先驗(informative prior)納入了實質的既有知識,如前人研究的效果量範圍,在小樣本下能顯著穩定估計。弱資訊先驗(weakly informative prior)僅施加溫和的約束,排除不合理的參數值(如將標準差限為正、將效果量限於合理量級),而不強加具體結論,是當代實務的常見預設。無資訊或平坦先驗(noninformative/flat prior)試圖「讓資料說話」,但完全平坦的先驗在許多情形下並非真正客觀,且可能導致不當的後驗。共軛先驗(conjugate prior)則因與概似搭配可得到封閉形式的後驗,在計算受限的年代極為重要,如今則多讓位於數值方法。

先驗的選擇具有實質後果,尤其在資料訊息有限時,因此它要求透明與辯護。一個負責任的貝氏分析,應明確報告所用先驗、說明其依據,並進行先驗敏感度分析,檢視結論對先驗設定的穩健程度。將先驗視為分析的公開假設而非隱藏的操縱,是貝氏方法可信度的關鍵,這也與開放科學對預先註冊分析決策的要求相通。

後驗推論:點估計與可信區間

一旦得到後驗分布,一切推論皆由其導出。點估計可取後驗的平均數、中位數或眾數(後者即最大後驗估計,maximum a posteriori, MAP),其中後驗平均在平方損失下為最適。不確定性則由後驗的離散程度刻畫,如後驗標準差。區間估計以可信區間(credible interval)表達,其詮釋與頻率派的信賴區間有本質差異。

概念方塊可信區間與信賴區間的詮釋差異

一個 95% 的可信區間 [a,b] 滿足

P(\theta\in[a,b]\mid y) = 0.95,

即「給定觀測資料,參數落於此區間的機率為 0.95」。這是一個關於參數的直接機率陳述。相對地,95% 的信賴區間(第八章)的正確詮釋是:在假想的重複抽樣中,如此構造的區間有 95% 會涵蓋真值;對任一已實現的區間,參數或在其中、或不在,並無「95% 機率」可言。

換言之,可信區間所具有的,正是人們常誤加於信賴區間的那種直觀詮釋。此外,最高後驗密度(highest posterior density, HPD)區間為在給定涵蓋機率下最短的區間,當後驗不對稱時,它較等尾區間更能反映後驗的集中所在。

這一詮釋上的直接性,是貝氏推論在溝通上的一大優勢:研究者可以直接說「該效果為正的後驗機率為 0.97」,而無須訴諸重複抽樣這一反事實的想像。然而須強調,此直接性建立在先驗與模型設定之上,可信區間的可信,終究不強於其所依賴的假設。

計算的必要:正規化常數的難題

貝氏推論在概念上簡潔,在實務上卻長期受制於一個計算障礙。後驗的正規化常數 p(y)=\int p(y\mid\theta)p(\theta)\,d\theta,是一個對參數空間的積分;當參數為高維、或概似與先驗非共軛時,此積分沒有封閉解,且維度稍高即使數值積分亦不可行。這意味著,雖然後驗的形狀 p(y\mid\theta)p(\theta) 容易寫出,但要得到一個正規化的、可用以計算期望與分位數的後驗分布,卻極其困難。共軛先驗雖能繞過此難題,但其適用範圍狹窄,難以支撐心理學所需的複雜模型。

貝氏方法的實用化,因而有賴於一類繞過正規化常數的計算策略:不去解析地求出後驗,而是設法從後驗中抽取大量樣本,再以這些樣本近似後驗的一切特徵。這一轉向,使貝氏方法自 1990 年代起隨計算能力的提升而全面復興。

馬可夫鏈蒙地卡羅

馬可夫鏈蒙地卡羅(Markov chain Monte Carlo, MCMC)是貝氏計算的核心。其精妙構想是:建構一條以後驗分布為平穩分布的馬可夫鏈,讓鏈在參數空間中游走,其長期停留的樣本即等同於自後驗抽出的樣本。如此,無須知道正規化常數,即可獲得後驗的樣本近似。

推導方塊Metropolis-Hastings 演算法

目標是自 p(\theta\mid y)\propto p(y\mid\theta)p(\theta) 抽樣。Metropolis et al. (1953) 提出、Hastings (1970) 推廣的演算法如下。於當前狀態 \theta^{(t)},自提議分布 q(\cdot\mid\theta^{(t)}) 抽取候選 \theta^{*},並以下列機率接受之:

\alpha = \min\!\left\{1,\ \frac{p(y\mid\theta^{*})\,p(\theta^{*})\,q(\theta^{(t)}\mid\theta^{*})}{p(y\mid\theta^{(t)})\,p(\theta^{(t)})\,q(\theta^{*}\mid\theta^{(t)})}\right\}.

關鍵在於,未知的正規化常數 p(y) 在分子分母中相消,故計算接受機率無須知道它,這正是 MCMC 繞過正規化難題的訣竅。若接受則 \theta^{(t+1)}=\theta^{*},否則 \theta^{(t+1)}=\theta^{(t)}。當提議對稱(q(\theta^{*}\mid\theta^{(t)})=q(\theta^{(t)}\mid\theta^{*}))時,\alpha 化簡為後驗比值之最小值與 1。Gibbs 抽樣 (Gelfand & Smith, 1990) 為一特例,逐一自每個參數的完全條件分布抽樣,接受機率恆為 1。

Metropolis-Hastings 與 Gibbs 雖普適,但在高維或參數高度相關時效率低落、混合緩慢。現代貝氏計算多採哈密頓蒙地卡羅(Hamiltonian Monte Carlo, HMC)及其自動調校版本 NUTS:藉引入後驗對數梯度的資訊,使鏈能沿著後驗的幾何有效地大步移動,大幅提升高維問題的抽樣效率。機率程式語言 Stan (Carpenter et al., 2017) 即以 NUTS 為核心,使複雜貝氏模型的估計得以標準化與普及,是當代貝氏實務的重要基礎設施。

收斂診斷

MCMC 提供的是後驗的樣本近似,但此近似唯有在鏈已收斂至平穩分布、且樣本充分探索後驗時方屬可信。因此收斂診斷是任何 MCMC 分析不可或缺的一環,主要工具摘要於表 33.1。最重要的單一指標是 Gelman & Rubin (1992) 的潛在尺度縮減因子 \hat R:它比較多條起始值分散之鏈的鏈間變異與鏈內變異,若各鏈已收斂至同一分布,二者應趨於一致而 \hat R 接近 1;顯著大於 1 則表示鏈間尚未混合。有效樣本數(effective sample size, ESS)則量化因序列自相關而損失的資訊,它回答「這些相關的樣本相當於多少獨立樣本」,過小的 ESS 意味後驗摘要(尤其是尾端分位數)不可靠。

表 33.1 主要的 MCMC 收斂與抽樣診斷
診斷 偵測對象 判準
\hat R(Gelman-Rubin) 鏈間是否已混合收斂 接近 1(如 <1.01)
有效樣本數(ESS) 自相關導致的資訊損失 越大越好,須足以估分位數
軌跡圖(trace plot) 平穩性與混合 目視呈平穩交纏狀
發散轉移(divergence) HMC 的幾何病態 應為零

註. \hat R 與 ESS 為當代通行的量化基準;發散轉移為 HMC/NUTS 特有的診斷,提示後驗幾何陡峭、估計可能偏誤。診斷須聯合研判,單一指標合格不保證收斂。

須強調,收斂診斷只能提供未收斂的反證,而不能證明已收斂:診斷全數通過僅表示「未發現不收斂的跡象」,而非保證鏈已探索了整個後驗(例如多峰後驗中某些模態可能從未被造訪)。這要求研究者以多條分散起始的鏈、充分的暖機(warmup),並對診斷保持審慎。

模型比較:貝氏因子與資訊準則

貝氏框架下的模型比較有兩條主要路徑。第一條是貝氏因子(Bayes factor),即兩模型邊際概似之比,Kass & Raftery (1995) 對其定義、計算與詮釋作了經典的整理。貝氏因子直接量化資料對兩模型的相對支持,並自然地內含對複雜度的懲罰(經由邊際概似對先驗的積分)。然而它有一個嚴重的實務弱點:邊際概似對先驗的設定高度敏感,即使是對後驗影響甚微的漫射先驗,也可能劇烈改變貝氏因子,此即 Lindley 悖論所揭示的現象。因此貝氏因子的使用須格外審慎地對待先驗。作為虛無假設顯著性檢定的一種貝氏替代,貝氏因子與 p 值取向的根本對照,見第八章的推論爭議。

第二條路徑著眼於預測,並與第十二章的資訊準則一脈相承。相較於 AIC、BIC 等以點估計為基礎的準則,全貝氏的預測評估以整個後驗為基礎。廣泛適用資訊準則(widely applicable information criterion, WAIC)與留一交叉驗證(leave-one-out cross-validation, LOO-CV)估計模型的樣本外預測準確度,Vehtari et al. (2017) 提出以帕列托平滑重要性抽樣(PSIS)高效且穩健地計算 LOO,並提供了診斷其可靠性的指標。此類方法不需重新擬合模型即可近似交叉驗證,已成為當代貝氏模型比較的主流,其精神與第十二章「以樣本外預測為模型選擇依據」的邏輯完全相通。

後驗預測檢驗

模型比較回答「哪個模型較好」,但一個相對較好的模型仍可能絕對地不合適。後驗預測檢驗(posterior predictive check, PPC)用以評估模型對資料的絕對契合:自後驗預測分布模擬出「複製資料」,再將其與實際觀測資料在關切的特徵上比較。若模型良好,複製資料應與觀測資料相似;若在某些特徵(如偏態、極端值、特定次群體的分布)上系統性地偏離,則揭示了模型的設定不足。PPC 的優點在於它可針對研究者實質關切的面向自訂檢驗量,是一種靈活且直觀的模型批判工具,體現了貝氏工作流程中「以模擬自我檢查」的精神。

貝氏潛在變項模型

貝氏方法對本書所論的潛在變項模型別具價值,因其能自然地處理這些模型在頻率派估計下常遭遇的困難。在結構方程與驗證性因素分析中,Muthén & Asparouhov (2012) 提出的貝氏結構方程模型以「近似零」先驗取代傳統的「恰為零」約束:容許交叉負荷與殘差共變偏離零一個微小的量,而非強制其為零。此舉緩解了過度嚴格的約束所造成的適配不良與模型修改的資料依賴,並與第十九章的近似測量不變性一脈相承。在項目反應理論(第十七章)中,MCMC 使高維、多向度與複雜計分模型的估計成為可能,繞過了邊際最大概似在高維積分上的困難。

貝氏方法與多層次模型(第二十八章)的親和尤深。如第二十八章所述,隨機效果的階層設定本質上即具貝氏結構,其收縮即部分聯營。明確的貝氏取向在群集數偏少、變異數成分的最大概似估計不穩或落於邊界時尤具價值:對變異數成分施加弱資訊先驗,可穩定估計並避免退化解,這是貝氏方法在小樣本階層模型上的一項實質優勢。整體而言,貝氏方法為潛在變項建模提供的,不只是另一種估計途徑,更是對複雜模型中不確定性與弱識別參數的一種更誠實的處理。

貝氏取向在本書中的應用遠不止於此。本章作為貝氏方法之家,其工具在多處應用章中各展其長,值得在此一併指路:貝氏變異數分析與其預設先驗的貝氏因子,見第十章;跨群體的近似測量不變性以近似零先驗實現,見第十九章;小樣本階層模型的變異數成分穩定化,見第二十八章;密集縱貫資料的動態結構方程模型以貝氏估計與 MCMC 為根基,見第三十章;把推論單位提升到研究群體的貝氏後設分析,見第三十二章;而心理計量網絡的貝氏估計,則見第三十五章。這些應用共享本章所奠立的同一套推論邏輯,即以先驗與資料融合為後驗、以 MCMC 繞過正規化難題、並以後驗直接量化不確定性;它們的多樣,正說明了貝氏取向作為一個統一框架的涵蓋力。

先驗作為正則化

先驗的一個深刻功能,是作為正則化(regularization)的機制,這也將本章與第三十四章相連。對迴歸或負荷係數施加集中於零的先驗,等同於對其施加一個收縮的懲罰:先驗越集中,係數被朝零拉近的力道越強。事實上,若干經典的正則化方法恰是特定先驗下的貝氏後驗眾數,如表 33.2 所示。

表 33.2 收縮先驗與其頻率派正則化對應
先驗分布 對應的頻率派正則化 收縮特性
常態(高斯) 脊迴歸(ridge,L_2) 均勻收縮,不產生稀疏
拉普拉斯(Laplace) lasso(L_1) 可將係數壓至恰為零
馬蹄(horseshoe) 自適應收縮 強壓小訊號、幾乎不動大訊號

註. 常態先驗下的後驗眾數即脊估計;拉普拉斯先驗下的後驗眾數即 lasso 估計。馬蹄先驗無簡單的頻率派對應,屬全貝氏的自適應收縮。

其中,脊迴歸對應常態先驗、lasso 對應拉普拉斯先驗,二者將於第三十四章詳論。而 Carvalho et al. (2010) 的馬蹄先驗代表了貝氏收縮的一項精緻進展:它以重尾配合尖峰的先驗形狀,同時做到「強力壓縮接近零的雜訊係數」與「幾乎不收縮真正大的訊號係數」,在稀疏問題上優於均勻收縮的脊或一刀切的 lasso。這一觀點的統一意義在於揭示:正則化與貝氏先驗並非兩種相異的技術,而是同一收縮邏輯的兩種表述,先驗即是把「係數應偏小」這一信念,明確地寫成機率分布。

貝氏工作流程與批判

當代的貝氏實踐已遠非「套用一次貝氏定理」,而是一套迭代的貝氏工作流程(Bayesian workflow):從初步模型出發,經先驗預測檢驗評估先驗的合理性、以 MCMC 估計並嚴格檢查收斂、以後驗預測檢驗評估契合、以 WAIC/LOO 比較競爭模型、並以先驗敏感度分析檢視穩健性,如此循環修正。Gelman et al. (2013) 的《貝氏資料分析》系統呈現了此一取向,而 Schoot et al. (2014) 則為行為科學讀者提供了平易的入門。

貝氏方法最常受到的批判,是先驗的主觀性:既然結論部分取決於研究者所選的先驗,是否即失去了客觀性,甚至可被操縱以得到想要的結果?對此有幾層回應。其一,一切統計分析皆蘊含假設,頻率派的模型設定、概似選擇同樣是主觀決定,貝氏的先驗只是把其中一部分假設攤在明處、使之可檢視、可辯論。其二,弱資訊先驗配合先驗敏感度分析,可將先驗的影響控制在合理範圍並公開其後果。其三,隨著資料量增加,概似逐漸主導後驗,先驗的影響隨之淡出;先驗最具影響、也最須審慎之處,恰是資料訊息薄弱的小樣本或弱識別情境,而那也正是任何方法都最為艱難之處。

平衡地說,貝氏方法在若干情境下優勢最為明顯:小樣本、複雜的階層或潛在變項模型、需要整合既有知識、需要對參數作直接機率陳述、或存在弱識別參數之時。而在大樣本配簡單模型時,貝氏與頻率派的結論多趨於一致,方法的選擇則更多取決於詮釋的偏好與溝通的需要。貝氏方法不是萬靈丹:它同樣受制於模型設定的正確與否,需要可觀的計算與對診斷的細心,草率的貝氏分析一樣會誤導。其真正的價值,在於提供一個透明地表述假設、連貫地更新信念、並誠實地量化不確定性的框架。

小結

本章對貝氏方法作了自哲學基礎、核心概念、計算方法、到應用與批判的完整鋪陳。貝氏方法以信念程度詮釋機率、以分布表徵參數的不確定性,並以貝氏定理將先驗與資料融合為後驗;其推論的產出是一整個後驗分布,可信區間因而具有人們直覺所欲求的直接機率詮釋。實務上,貝氏推論倚賴 MCMC 繞過正規化常數的難題,而收斂診斷(\hat R、有效樣本數)是其可信的前提。本章並涵蓋貝氏因子與 WAIC/LOO 的模型比較、後驗預測檢驗、貝氏潛在變項模型、以及先驗作為正則化的統一觀點。對進一步的學習,Kruschke (2015) 與 McElreath (2020) 提供了兼具嚴謹與可及性的優良教材。貫穿全章的訊息是:貝氏方法的價值不在意識形態,而在其為「在不確定下更新信念」提供了一個連貫、透明、能整合先驗知識並自然量化不確定性的框架。先驗作為正則化的觀點,已預示了下一章的主題:當參數眾多、預測為重時,如何藉收縮與交叉驗證馴服複雜度,這正是機器學習與現代高維方法的核心關切。

參考文獻

Carpenter, B., Gelman, A., Hoffman, M. D., Lee, D., Goodrich, B., Betancourt, M., Brubaker, M. A., Guo, J., Li, P., & Riddell, A. (2017). Stan: A probabilistic programming language. Journal of Statistical Software, 76(1), 1–32. https://doi.org/10.18637/jss.v076.i01
Carvalho, C. M., Polson, N. G., & Scott, J. G. (2010). The horseshoe estimator for sparse signals. Biometrika, 97(2), 465–480. https://doi.org/10.1093/biomet/asq017
Gelfand, A. E., & Smith, A. F. M. (1990). Sampling-based approaches to calculating marginal densities. Journal of the American Statistical Association, 85(410), 398–409. https://doi.org/10.1080/01621459.1990.10476213
Gelman, A., Carlin, J. B., Stern, H. S., Dunson, D. B., Vehtari, A., & Rubin, D. B. (2013). Bayesian data analysis (3rd ed.). CRC Press.
Gelman, A., & Rubin, D. B. (1992). Inference from iterative simulation using multiple sequences. Statistical Science, 7(4), 457–472. https://doi.org/10.1214/ss/1177011136
Hastings, W. K. (1970). Monte Carlo sampling methods using Markov chains and their applications. Biometrika, 57(1), 97–109. https://doi.org/10.1093/biomet/57.1.97
Kass, R. E., & Raftery, A. E. (1995). Bayes factors. Journal of the American Statistical Association, 90(430), 773–795. https://doi.org/10.1080/01621459.1995.10476572
Kruschke, J. K. (2015). Doing Bayesian data analysis: A tutorial with R, JAGS, and Stan (2nd ed.). Academic Press.
McElreath, R. (2020). Statistical rethinking: A Bayesian course with examples in R and Stan (2nd ed.). CRC Press.
Metropolis, N., Rosenbluth, A. W., Rosenbluth, M. N., Teller, A. H., & Teller, E. (1953). Equation of state calculations by fast computing machines. The Journal of Chemical Physics, 21(6), 1087–1092. https://doi.org/10.1063/1.1699114
Muthén, B., & Asparouhov, T. (2012). Bayesian structural equation modeling: A more flexible representation of substantive theory. Psychological Methods, 17(3), 313–335. https://doi.org/10.1037/a0026802
Schoot, R. van de, Kaplan, D., Denissen, J., Asendorpf, J. B., Neyer, F. J., & Aken, M. A. G. van. (2014). A gentle introduction to Bayesian analysis: Applications to developmental research. Child Development, 85(3), 842–860. https://doi.org/10.1111/cdev.12169
Vehtari, A., Gelman, A., & Gabry, J. (2017). Practical Bayesian model evaluation using leave-one-out cross-validation and WAIC. Statistics and Computing, 27(5), 1413–1432. https://doi.org/10.1007/s11222-016-9696-4
本章引用格式游琇婷(2026)。貝氏取向在計量心理學。《計量心理學:測量、模型與推論》(第 33 章)。