機器學習與計量心理學
第三十三章末以收縮先驗與交叉驗證作結,已指向一個更廣的方法傳統。當代資料的規模與維度日增,變項數常逼近甚至超過樣本數,而研究的旨趣有時亦自「解釋為何」轉向「預測為何」。機器學習(machine learning)與高維統計方法,正是為此類情境而發展:它們以樣本外預測為評準、以正則化馴服複雜度、並以演算法的彈性捕捉傳統線性模型難以觸及的結構。這套方法對心理學既是機遇,也是張力的來源,因為心理學作為一門以理解人類心智為職志的科學,其對「解釋」的追求,與機器學習對「預測」的偏重,並不總是一致。
本章對機器學習與高維方法作一系統的處理,並始終扣連其與心理計量傳統的關係。首先辨明解釋與預測兩種建模文化,並鋪陳偏誤-變異權衡與交叉驗證這兩個貫穿全局的概念。其次,詳述高維迴歸的正則化、樹集成、支持向量機與神經網路等監督式方法,以及分群與降維等非監督式方法。再者,處理效能評估、可解釋性、以及過度擬合與資料洩漏等誠實評估的議題。最後,深入網絡心理計量學這一將圖模型引入心理測量的新取向,並論及機器學習於測量的應用,以及預測、理解與公平之間的根本張力。貫穿全章的核心訊息是:機器學習為心理學帶來了強大的預測與探索工具,但其價值的發揮,取決於是否清醒地認識預測與解釋之別,以及演算法的彈性所伴隨的過度擬合與不透明之代價。
兩種文化:解釋與預測
Breiman (2001b) 著名地區分了統計建模的兩種文化。資料建模文化假設一個由參數界定的機率模型生成了資料,其目標是推斷這些參數以理解生成機制,這正是本書前二十餘章的主軸。演算法建模文化則將生成機制視為未知的黑箱,不求刻畫其內部結構,而以演算法直接學習由輸入到輸出的映射,其唯一評準是預測的準確。兩種文化對應著兩種提問:前者問「什麼機制生成了資料」,後者問「如何最準確地預測結果」。
Yarkoni & Westfall (2017) 將此區分引入心理學,主張心理學長期偏重解釋(以 p 值檢驗理論導出的效果)而相對忽視預測,並指出這種偏重使許多「顯著」的發現在樣本外毫無預測力,助長了再現危機。他們呼籲將預測納入心理科學的評準之列,因為一個真正掌握了現象的理論,理應能預測新資料。須強調,解釋與預測並非對立,而是互補:預測力是理論的一種嚴格試煉,而理解則賦予預測以意義。機器學習之於心理學的恰當定位,因而不是取代解釋,而是補上長期缺席的預測維度。
偏誤-變異權衡
理解機器學習,須自一個支配一切預測建模的根本張力入手:偏誤與變異的權衡。它精確地刻畫了模型複雜度與預測誤差之間的關係。
設真實關係為 y = f(x) + \varepsilon,其中 E[\varepsilon]=0、\mathrm{Var}(\varepsilon)=\sigma^2。對以訓練資料學得的預測 \hat f(x),其在某點 x 的期望平方預測誤差可分解為三項:
第一項為資料本身的雜訊,任何模型皆無法消除。第二項偏誤衡量模型的系統性偏離:過於簡單的模型(如低估非線性)偏誤大。第三項變異衡量估計對訓練樣本的敏感:過於複雜的模型隨樣本劇烈變動、變異大。
此分解揭示了過度擬合(overfitting)與擬合不足(underfitting)的本質。過簡的模型偏誤高、變異低,系統性地錯過訊號(擬合不足);過繁的模型偏誤低、變異高,把訓練樣本的雜訊也當成訊號學了進去(過度擬合),因而在新資料上表現崩壞。存在一個最適的複雜度,使偏誤與變異之和最小。機器學習的許多技術,無論正則化、集成或提早停止,本質上都是在調節此一權衡;而如何在不觸碰測試資料的前提下找到那個最適點,則須仰賴交叉驗證。
樣本外評估與交叉驗證
機器學習與傳統推論統計最深刻的方法論差異,在於評估的準則:不是模型對既有資料的契合,而是對未見資料的預測。因為任何足夠複雜的模型都能把訓練資料擬合得近乎完美,模型在訓練資料上的表現,對其真實預測力幾無參考價值。因此,資料通常被分為訓練集(擬合模型)、驗證集(選擇模型與調校超參數)與測試集(最終、僅一次的公正評估)三部分,測試集在建模全程須嚴格封存,方能給出無偏的樣本外估計。
當樣本有限時,k 折交叉驗證(k-fold cross-validation)更有效地運用資料:將資料切為 k 份,輪流以其中一份為驗證、其餘為訓練,重複 k 次並平均其表現,留一交叉驗證則為 k 等於樣本數的極端情形。交叉驗證直接估計樣本外誤差,是定位偏誤-變異最適點、選擇超參數的核心工具。此一「以樣本外預測為評準」的邏輯,與第十二章的資訊準則、第三十三章的 WAIC/LOO 完全相通,三者實為同一預測性思維在不同框架下的體現。
高維問題與正則化
當預測變項數 p 相對於樣本數 n 很大,甚至 p>n 時,傳統最小平方迴歸(第十一章)失效:估計高度不穩、變異暴增,在 p>n 時解甚至不唯一。正則化(regularization)藉在目標函數中加入懲罰項,以少許偏誤換取變異的大幅降低,是應對高維問題的核心手段。
最小平方估計最小化殘差平方和 \sum_i (y_i - \mathbf{x}_i^{\top}\boldsymbol{\beta})^2,在高維或共線時不穩。正則化對係數大小施加懲罰。脊迴歸(ridge,L_2 懲罰)為
它將係數朝零收縮但不使之恰為零。lasso(L_1 懲罰)為
其 L_1 幾何(約束區為帶尖角的菱形)使解常落於某些座標軸上,即部分 \hat\beta_j 恰為零,因而同時完成變數選擇 (Tibshirani, 1996)。彈性網(elastic net)結合兩者,\lambda[\alpha\sum_j|\beta_j| + (1-\alpha)\sum_j\beta_j^2],在存在高度相關的預測群時表現更佳 (Zou & Hastie, 2005)。調校參數 \lambda 由交叉驗證決定。
正則化與第三十三章的貝氏觀點在此交會:如第三十三章所述,脊估計恰為常態先驗下的後驗眾數、lasso 為拉普拉斯先驗下的後驗眾數,L_2 與 L_1 懲罰即是把「係數應偏小」或「係數應稀疏」的信念寫成先驗 (Hoerl & Kennard, 1970)。正則化在心理學高維情境中日益重要,如以大量題目或神經影像特徵預測結果,其中變數選擇與收縮既提升預測、也有助辨識少數關鍵預測子。相關方法的權威整理見 Hastie et al. (2009) 與較為入門的 James et al. (2013)。
樹方法與集成學習
決策樹以一連串對預測變項的二分切割,將特徵空間遞迴地劃分為若干區域,並在各區域給出預測。單棵樹直觀、可解釋、能自然地捕捉非線性與交互作用,但變異高、易過度擬合。集成學習(ensemble learning)藉組合多棵樹以降低變異、提升穩健。Breiman (2001a) 的隨機森林對自助抽樣的資料擬合大量樹,並在每次切割時隨機限制候選變項,再平均其預測;此雙重隨機化去除了樹間的相關,使平均能有效壓低變異。梯度提升(gradient boosting)則以序列方式逐棵擬合前一輪的殘差,往往能達到更高的預測準確度,但也更易過度擬合、對調參更敏感。樹集成尚提供變數重要性(variable importance)度量,用以評估各預測子的貢獻,是其在解釋性上的一項優點。
支持向量機與神經網路
支持向量機(support vector machine, SVM)尋找能以最大間隔分隔類別的決策邊界,並透過核(kernel)技巧將資料隱式映射至高維空間,以線性邊界處理原空間中的非線性可分問題,在高維而樣本不特別大時常表現優異。神經網路(neural network)則以多層的非線性轉換,將輸入層層映射為愈趨抽象的表徵,其深層版本即深度學習。LeCun et al. (2015) 綜述了深度學習如何藉表徵學習(representation learning)自原始資料自動習得有用的特徵,在影像、語音與文本等高維非結構資料上取得突破。神經網路的威力在於其近乎無限的彈性,但這也意味著它需要大量資料以馴服其變異、且高度不透明。本章所述主要監督式方法的特性,摘要於表 34.1。
| 方法 | 優勢 | 主要限制 |
|---|---|---|
| 正則化迴歸 | 可解釋、擅長高維、與統計傳統相通 | 預設線性關係 |
| 隨機森林 | 捕捉非線性與交互、穩健、免大量調參 | 相對黑箱 |
| 梯度提升 | 預測準確度常最高 | 易過度擬合、需細心調參 |
| 支持向量機 | 高維有效、理論基礎清晰 | 對核與參數選擇敏感 |
| 神經網路 | 表徵學習、大資料下極具彈性 | 需大量資料、高度不透明 |
註. 各方法在預測力、可解釋性與資料需求之間有不同的權衡;方法的選擇應依樣本規模、關係之非線性程度、以及對可解釋性的需求而定。
非監督學習:分群與降維
前述方法皆為監督式,即有明確的結果變項可供學習。非監督學習則在無標籤的情形下,探索資料的內在結構。分群(clustering)將觀測歸入若干群,如 k 平均法(k-means)以最小化群內離差為準則反覆分派,其邏輯與第二十章的混合模型相通,惟混合模型為機率式而 k 平均為硬性分派。降維(dimension reduction)將高維資料壓縮至少數維度:主成分分析(第十四章)以線性組合捕捉最大變異,而 t-SNE 與 UMAP 等非線性方法則專為高維資料的視覺化而設計,能保留局部鄰近結構。非監督方法在心理學中用於探索反應型態、辨識受測者次群、以及將高維測量壓縮為可詮釋的維度,是資料探索階段的有力工具,但其結果的實質意義須以理論與後續驗證加以檢核。
效能評估與指標
模型的價值取決於如何衡量其表現,而指標的選擇本身即是一個實質決策。分類任務中,整體準確率(accuracy)在類別不平衡時具高度誤導性:若九成個案屬同一類,一個把全體都判為多數類的無用模型也有九成準確率。因此須輔以針對關切類別的精確率(precision,判為正者中真正為正的比例)與召回率(recall,真正為正者中被判出的比例),二者間存在權衡。ROC 曲線下面積(ROC-AUC)刻畫跨所有判斷閾值的區辨能力,而校準(calibration)則評估預測機率是否與實際頻率相符,這在需要據機率做決策時尤為關鍵。迴歸任務則常以均方根誤差(RMSE)或 R^2 衡量。主要指標摘要於表 34.2。
| 任務 | 指標 | 說明與注意 |
|---|---|---|
| 分類 | 準確率 | 整體正確率;類別不平衡時嚴重誤導 |
| 分類 | 精確率/召回率 | 針對正類的正確性與涵蓋度,二者權衡 |
| 分類 | ROC-AUC | 跨閾值的整體區辨力 |
| 分類 | 校準 | 預測機率與實際頻率的一致程度 |
| 迴歸 | RMSE、R^2 | 誤差量級、解釋變異比例 |
註. 指標的選擇應反映實際的決策後果,如偽陽性與偽陰性代價不對稱時,準確率並非恰當的單一指標。
可解釋性
機器學習的預測力常以透明度為代價:隨機森林、梯度提升與神經網路皆為程度不一的黑箱,難以說明其如何由輸入得到輸出。可解釋機器學習(interpretable machine learning)因而發展出一系列事後解釋工具。變數重要性排序各預測子對模型的整體貢獻;部分相依圖(partial dependence plot)刻畫單一預測子在其他變項平均下與結果的關係;SHAP 值則以合作賽局理論為基礎,將個別預測歸因至各特徵。這些工具有助於窺探黑箱,但須審慎:它們是對模型行為的近似描述,而非對真實因果機制的揭示,將特徵重要性逕自詮釋為因果,重蹈第三十一章所戒之覆轍。可解釋性與預測準確度之間往往存在權衡,而在心理學這一以理解為職志的學科,可解釋性的分量,理應重於在純預測任務中。
過度擬合、資料洩漏與誠實評估
機器學習的彈性是雙面刃:同樣的彈性既能捕捉真實的複雜結構,也能擬合純粹的雜訊。除偏誤-變異權衡外,一個尤須警覺的實務陷阱是資料洩漏(data leakage):當測試資料的資訊以任何形式滲入訓練過程,樣本外評估即遭汙染而虛高。常見的洩漏包括在切分資料前即以全體資料進行特徵選擇或標準化、在時間序列中以未來預測過去、或反覆窺看測試集以調整模型。其後果是「樣本外」表現其實並非真正的樣本外,模型在真實新資料上將令人失望。這一問題與心理學的再現危機遙相呼應:正如可疑的推論實踐會產出無法再現的顯著結果,草率的機器學習評估也會產出無法再現的預測宣稱。誠實的評估,要求測試資料的嚴格封存、對整個建模流程(含特徵工程)的一致交叉驗證、以及對預測宣稱在獨立資料上的再現。
邁向網絡心理計量學
機器學習的圖模型思維,在心理計量學內部催生了一個獨立而重要的取向,即網絡心理計量學(network psychometrics)。它對「觀測變項之間的關聯從何而來」給出了與潛在變項傳統截然不同的答案:不將症狀之間的相關歸因於一個共同的潛在原因,而視症狀為彼此直接交互作用的自主實體,觀測到的關聯正來自這些直接的相互影響。其形式工具是以偏相關為邊的圖模型,並常以正則化(如圖形 lasso)在高維下估得稀疏而穩健的網絡。
這一取向與潛在變項傳統的對話,兼具估計方法與構念本體論兩個層面,其份量已足以獨立成章。由於它把本章的高維與正則化思維,與第三章關於構念本體地位的討論結合為一個完整的主題,本書將網絡心理計量學的估計方法、與潛在變項模型的異同、以及維度性探索等議題,留待第三十五章專章深入,本章至此完成對機器學習作為預測與高維工具的處理。
計算心理計量:文本、歷程與大型語言模型
機器學習不僅是預測的工具,更正在拓展測量本身的邊界,形成一個常被稱為計算心理計量(computational psychometrics)的新興領域。其一是以自然語言處理(natural language processing, NLP)量化文本。自傳、日記、社群貼文與晤談逐字稿等開放式語料,過去難以系統地測量,如今可經由從早期的詞袋與主題模型、到當代的詞嵌入(word embedding)與大型語言模型的一系列技術,轉為可分析的數值特徵,用以推估情緒、人格與心理狀態。然而,能把文字轉為數字,不等於所得的數字即有效地指涉了目標構念;文本測量同樣須通過本書前半所建立的效度檢驗,其效度框架不因技術的新穎而豁免。
其二是作答歷程與日誌資料。數位化施測記錄了遠超出最終作答對錯的訊息,如反應時間、鍵擊、修改軌跡與作答的先後順序,這些歷程資料承載了作答策略、投入程度與認知歷程的線索,其進階的建模與本書第十八章的作答歷程取向相接。機器學習可自這類高維而非結構的歷程資料中萃取特徵,但特徵工程的每一步選擇都可能引入與構念無關的變異,因而歷程資料的測量效度尤須審慎地論證。這類方法在實務上已用於偵測粗心或不投入的作答,與第二十五章的作答品質把關相呼應,也用於適性測驗的即時選題,與第二十四章相接。
其三,也是最新興而最須審慎的,是大型語言模型與測量的交會。當前的探索大致沿三條路線展開:把大型語言模型用作計分者,以評閱開放式反應,其效度與品管屬第二十六章的範疇;用作試題生成器,以大量產出候選試題供養題庫,其編製與品質把關屬第二十二章;以及一條更具推測性的路線,即把大型語言模型本身當作受測對象,以心理計量工具測量其「人格」或「能力」,即所謂人工智慧的心理計量學。本書對最後一條路線明確標記為高度推測性,因為一個語言模型是否具有可被穩定測量的心理屬性,本身就是一個尚未有定論的構念效度問題,把為人類設計的量表逕自施於模型,其分數的意義極不明朗。這些應用的共同教訓,與演算法公平的議題相通:機器學習能測到什麼,不等於它測到的就是所欲的構念,也不等於它的測量對不同群體同等有效。
批判:預測、理解與公平
機器學習為心理學帶來的力量,須與其限制一併衡量。第一重限制是預測與理解之別。一個模型可以預測精準卻毫無洞見,如以數千個特徵預測結果的黑箱,其高準確度並不等同於對現象的理解;反之,一個可理解的簡單機制也可能預測平平。心理學既以理解心智為職志,純粹的預測便是必要而不充分的:預測力是理論的試煉,卻非其替代。將機器學習的預測成就誤認為科學理解的達成,是一種需要警覺的混淆。
第二重限制是公平性。以資料訓練的模型會習得、甚至放大資料中既有的偏誤:若訓練資料反映了歷史性的不平等,模型的預測便可能對特定群體系統性地不利。這直接關聯第十九章的差異試題功能與第二十四章對適性演算法公平性的關切,並帶出演算法公平的深層難題,包括不同的公平準則在數學上往往無法同時滿足、以及公平與準確之間的權衡,這些難題的制度與法理一面則屬第二十七章。第三重限制是可推廣性:在某一母體或情境訓練的模型,未必能推廣至另一者,樣本的偏狹(如過度依賴特定文化的樣本)與資料分布的時間漂移,皆威脅其外部效度(第九、三十一章)。最後,高維方法強大的模式發現能力,在缺乏理論約束時也可能淪為對雜訊的過度擬合,將樣本的偶然特異當成規律,這使理論在機器學習時代非但未過時,反而更形重要:唯有理論能約束假設空間、並賦予所發現的模式以意義。
小結
本章對機器學習與高維方法作了系統的鋪陳,並始終扣連其與心理計量傳統的關係。核心概念上,本章闡明了解釋與預測兩種文化、支配預測建模的偏誤-變異權衡、以及以樣本外預測為評準的交叉驗證。方法上,本章涵蓋高維迴歸的正則化(脊、lasso、彈性網及其貝氏對應)、樹集成、支持向量機與神經網路等監督式方法、以及分群與降維等非監督式方法,並論及效能指標、可解釋性與資料洩漏等誠實評估的議題。在心理計量的接面上,本章預告了以圖模型重構測量的網絡心理計量學(留待第三十五章),並深入了機器學習於文本、作答歷程與大型語言模型的計算心理計量應用。貫穿全章的訊息是:機器學習為心理學補上了長期缺席的預測維度、並提供了探索高維結構的利器,但其恰當運用,取決於清醒地辨別預測與理解、警覺過度擬合與不透明之代價、並始終將演算法置於理論與測量的框架之中。接下來的第三十五章,將把本章預告的網絡心理計量學獨立展開,深入圖模型與潛在變項兩種取向對心理構念的不同構想;而全書的最後一章,則將回到貫穿始終的主線,對計量心理學的整合、開放科學實踐與未來走向,作一總結性的反思。