機器學習與計量心理學
=1.5em
第三十三章末以收縮先驗與交叉驗證作結,已指向一個更廣的方法傳統。當代資料的規模與維度日增,變項數常逼近甚至超過樣本數,而研究的旨趣有時亦自「解釋為何」轉向「預測為何」。機器學習(machine learning)與高維統計方法,正是為此類情境而發展:它們以樣本外預測為評準、以正則化馴服複雜度、並以演算法的彈性捕捉傳統線性模型難以觸及的結構。這套方法對心理學既是機遇,也是張力的來源,因為心理學作為一門以理解人類心智為職志的科學,其對「解釋」的追求,與機器學習對「預測」的偏重,並不總是一致。
本章對機器學習與高維方法作一系統的處理,並始終扣連其與心理計量傳統的關係。開頭先回顧臨床判斷與統計預測之爭這段前史,說明心理學早在半世紀前便已遭遇預測與解釋的對立。其次辨明解釋與預測兩種建模文化,並鋪陳偏誤-變異權衡與交叉驗證這兩個貫穿全局的概念。其次,詳述高維迴歸的正則化、樹集成、支持向量機與神經網路等監督式方法,以及分群與降維等非監督式方法。再者,處理效能評估、可解釋性、以及過度擬合與資料洩漏等誠實評估的議題。最後,深入網絡心理計量學這一將圖模型引入心理測量的新取向,並論及機器學習於測量的應用,以及預測、理解與公平之間的根本張力。貫穿全章的核心訊息是:機器學習為心理學帶來了強大的預測與探索工具,但其價值的發揮,取決於是否清醒地認識預測與解釋之別,以及演算法的彈性所伴隨的過度擬合與不透明之代價。
前史:臨床判斷與統計預測
Breiman 對兩種文化的區分雖出自統計學界,心理學其實更早就經歷過一次性質相同的對立,只是當時使用的語彙不同。Meehl (1954) 出版了一本篇幅不長的書,比較臨床心理師依專業經驗所作的判斷,與依簡單線性法則機械組合同一批資料所得的預測。他檢視當時可得的二十餘項研究,結論是機械式預測在絕大多數情況下不劣於臨床判斷,且往往更好。Meehl 本人後來稱之為「那本令人不安的小書」,並在三十年後的回顧中表示,社會科學裡少有爭議能累積出如此一面倒的證據 (Meehl, 1986)。
Sawyer (1966) 對這場爭論作了一個關鍵的釐清。他指出預測包含資料蒐集與資料組合兩個步驟,兩者可以分別由人或由公式執行,因而構成四種組合。其整理顯示,臨床工作者在蒐集資料上具有機器難以取代的價值,例如察覺一個未被事先編碼的線索;但在把這些線索組合為預測時,機械法則穩定地優於人的直覺。臨床判斷的弱點因此不在於資訊不足,而在於人對線索的加權在不同場合之間並不一致。
其後的證據持續累積。Dawes et al. (1989) 在《Science》上的綜述進一步指出,即使是所謂不當線性模型(improper linear models),亦即權重並非由資料最適化、而僅取相同單位權重的模型,其表現往往仍勝過專家判斷,因為人的真正優勢在於辨認出哪些變項有關,而非決定它們各佔多少比重。Grove et al. (2000) 以一百三十餘項研究進行後設分析,結論是機械式預測平均而言略優,約半數情況下兩者相當,臨床判斷明顯勝出者甚少。Ægisdóttir et al. (2006) 在諮商領域重作此一比較,結果一致。
這段前史值得置於本章開頭,有三個理由。其一,它說明預測導向的建模對心理學而言並非外來的新事物,Breiman 所描述的文化對立,心理學早已以自己的方式遭遇過一次。其二,它預告了本章反覆出現的主題:人與演算法之爭的核心是估計的穩定性,而不是誰比較聰明,這正是稍後偏誤與變異權衡的另一種說法。人的判斷之所以吃虧,是因為同一位專家在不同時點對同一批線索給出的權重會漂移,這在形式上就是高變異。其三,它預告了本章末的批判。機械法則的優勢建立在一個前提之上,即效標本身被妥善定義且未受污染;若效標本身即帶有歷史性的偏誤,機械法則只會把這個偏誤固定下來並加以規模化。這一點在當代演算法決策的脈絡中已成為核心關切,其制度與法理的一面屬第二十七章。
另須指出,這場爭論的結論常被過度延伸。批評者早已指出,比較研究中交給臨床工作者的任務,往往被窄化為與公式相同的形式,因而低估了臨床工作在問題界定、關係建立與個案理解上的功能 (Holt, 1958)。恰當的結論不是人不如公式,而是:當資訊已被編碼為固定的變項、且任務屬於重複性的預測時,機械組合較為可靠。這個限定條件與本章稍後討論的可解釋性及適用範圍,其實是同一件事的兩面。
兩種文化:解釋與預測
Breiman (2001b) 著名地區分了統計建模的兩種文化。資料建模文化假設一個由參數界定的機率模型生成了資料,其目標是推斷這些參數以理解生成機制,這正是本書前二十餘章的主軸。演算法建模文化則將生成機制視為未知的黑箱,不求刻畫其內部結構,而以演算法直接學習由輸入到輸出的映射,其唯一評準是預測的準確。兩種文化對應著兩種提問:前者問「什麼機制生成了資料」,後者問「如何最準確地預測結果」。
Yarkoni & Westfall (2017) 將此區分引入心理學,主張心理學長期偏重解釋(以 p 值檢驗理論導出的效果)而相對忽視預測,並指出這種偏重使許多「顯著」的發現在樣本外毫無預測力,助長了再現危機。他們呼籲將預測納入心理科學的評準之列,因為一個真正掌握了現象的理論,理應能預測新資料。
這個落差並不罕見。設想一份以三百名大學生為樣本的研究,以十五個量表分數預測學期成績,R^2 為 0.42 且數個係數顯著;把同一組係數套到另一屆的三百人,R^2 卻可能只剩 0.06。0.42 描述的是模型對手上這批資料的貼合,0.06 才是它面對新資料時真正的預測力。顯著並不保證可預測,這正是把預測納入評準的用意。解釋與預測並非對立,而是互補:預測力是理論的一種嚴格試煉,而理解則賦予預測以意義。機器學習之於心理學的恰當定位,因而不是取代解釋,而是補上長期缺席的預測維度。
偏誤-變異權衡
理解機器學習,須自一個支配一切預測建模的根本張力入手:偏誤與變異的權衡。前一節主張把預測納入心理學的評準,但只要真的動手做預測,立刻會撞見一個違反直覺的現象:把模型改得更複雜、在手上這批資料擬合得更貼合,換來的往往不是更準的預測,而是更差的預測。偏誤與變異的權衡正是解釋此一現象的框架:它把期望的預測誤差拆解為幾個可辨識的來源,並指出複雜度如何同時牽動其中兩項,一項隨之下降,另一項隨之上升。讀完本節應能回答,為何「擬合得好」與「預測得準」是兩回事。
設真實關係為 y = f(x) + \varepsilon,其中 E[\varepsilon]=0、\mathrm{Var}(\varepsilon)=\sigma^2。對以訓練資料學得的預測 \hat f(x),其在某點 x 的期望平方預測誤差可分解為三項:
第一項為資料本身的雜訊,任何模型皆無法消除。第二項偏誤衡量模型的系統性偏離:過於簡單的模型(如低估非線性)偏誤大。第三項變異衡量估計對訓練樣本的敏感:過於複雜的模型隨樣本劇烈變動、變異大。
此分解揭示了過度擬合(overfitting)與擬合不足(underfitting)的本質。過簡的模型偏誤高、變異低,系統性地錯過訊號(擬合不足);過繁的模型偏誤低、變異高,把訓練樣本的雜訊也當成訊號學了進去(過度擬合),因而在新資料上表現崩壞。存在一個最適的複雜度,使偏誤與變異之和最小。
以一個貫穿本章的情境來體會這個權衡。設想某大學一門選課八百人的大班必修課,課程平台記錄了學期前六週的線上學習行為,包括登入次數、教學影片的觀看完成率、作業繳交距截止時限的分鐘數、討論區發文則數等等,目標是預測期末是否不及格。假定以其中六百人訓練、另二百人封存作最終評估,並比較三種複雜度:只用登入次數的簡單線性模型、納入十餘個變項與少數交互項的中等模型、以及讓決策樹一路長到每個葉節點只剩一兩人的極繁模型。三者在訓練資料上的分類誤差為 0.19、0.13 與 0.00,看似一路改善;但在封存的二百人上卻是 0.20、0.14 與 0.26。第一個模型偏誤高,它假設風險只隨登入次數線性變化,系統性地錯過了訊號;第三個模型變異高,把六百人中偶然的個別特徵當成規律學了進去,以致在新樣本上還不如最簡單的模型。中等複雜度者樣本外誤差最低,即分解式所指的最適點。
機器學習的許多技術,無論正則化、集成或提早停止,本質上都在調節此一權衡。然而那二百人是最終的評判,一旦在挑選複雜度時反覆動用,便不再是未見的資料;如何另尋出路,是下一節的課題。
樣本外評估與交叉驗證
上一節指出最適複雜度確實存在,卻未說明如何事前把它找出來。答案是把「未見資料」制度化。機器學習與傳統推論統計最深刻的方法論差異即在於此:評估的準則不是模型對既有資料的契合,而是對未見資料的預測。因為任何足夠複雜的模型都能把訓練資料擬合得近乎完美,模型在訓練資料上的表現,對其真實預測力幾無參考價值。因此,資料通常被分為訓練集(擬合模型)、驗證集(選擇模型與調校超參數)與測試集(最終、僅一次的公正評估)三部分,測試集在建模全程須嚴格封存,方能給出無偏的樣本外估計。
當樣本有限時,k 折交叉驗證(k-fold cross-validation)更有效地運用資料:將資料切為 k 份,輪流以其中一份為驗證、其餘為訓練,重複 k 次並平均其表現,留一交叉驗證則為 k 等於樣本數的極端情形。交叉驗證直接估計樣本外誤差,是定位偏誤-變異最適點、選擇超參數的核心工具。
以那門必修課為例,五折交叉驗證的實際流程如下。先把六百名訓練學生隨機分為五份,每份一百二十人。對每一個候選的複雜度,例如決策樹的最大深度取 2、4、6、8,依序把其中一份留作驗證、以其餘四百八十人擬合並在該份上計分,輪替五次後取五個驗證誤差的平均。假定四個深度的平均驗證誤差依序為 0.21、0.14、0.15 與 0.19,則深度 4 勝出;深度 8 處誤差回升,即是變異開始壓過偏誤的訊號。選定之後,再以全部六百人依此深度重新擬合,最後才打開封存的二百人,取得那唯一一次的樣本外估計。此處有一個極易被忽略的細節:特徵的標準化、缺失值填補與變數篩選,都必須在每一折的訓練部分之內重做,否則驗證誤差在計算之前就已被汙染。
此一「以樣本外預測為評準」的邏輯,與第十二章的資訊準則、第三十三章的 WAIC/LOO 完全相通,三者實為同一預測性思維在不同框架下的體現。有了評估的準則,接下來要問的是:當預測變項多到與樣本數同一量級時,該用什麼手段主動壓低變異。
高維問題與正則化
當預測變項數 p 相對於樣本數 n 很大,甚至 p>n 時,傳統最小平方迴歸(第十一章)失效:估計高度不穩、變異暴增,在 p>n 時解甚至不唯一。心理學中這樣的情境已不罕見:數百題的題庫反應、上千個腦影像體素、或由數位歷程資料衍生的大量特徵,都能輕易讓變項數逼近甚至超過受試人數。正則化(regularization)藉在目標函數中加入懲罰項以限制係數整體的大小,用少許偏誤換取變異的大幅降低,是應對高維問題的核心手段。本節說明三種常見的懲罰各自在罰什麼,以及為何其中一種會順帶完成變數選擇。
最小平方估計最小化殘差平方和 \sum_i (y_i - \mathbf{x}_i^{\top}\boldsymbol{\beta})^2,在高維或共線時不穩。正則化對係數大小施加懲罰。脊迴歸(ridge,L_2 懲罰)為
它將係數朝零收縮但不使之恰為零。lasso(L_1 懲罰)為
其 L_1 幾何(約束區為帶尖角的菱形)使解常落於某些座標軸上,即部分 \hat\beta_j 恰為零,因而同時完成變數選擇 (Tibshirani, 1996)。彈性網(elastic net)結合兩者,\lambda[\alpha\sum_j|\beta_j| + (1-\alpha)\sum_j\beta_j^2],在存在高度相關的預測群時表現更佳 (Zou & Hastie, 2005)。調校參數 \lambda 由交叉驗證決定。
脊與 lasso 的差別表面上只是把平方換成絕對值,後果卻相當不同。懲罰項對每個係數施加一股推向零的力量,兩者的差別在於這股力量的大小是否隨係數而變。L_2 懲罰的斜率為 2\lambda\beta_j,係數越接近零、推力越弱,因此係數會不斷縮小卻永遠碰不到零。L_1 懲罰的斜率在零點以外恆為 \pm\lambda,是一股不隨係數大小衰減的固定推力;當某個變項對降低殘差的邊際貢獻小於這股推力,把它的係數設為恰好零反而使目標函數更小,稀疏解於是自然出現。方塊中所說的菱形尖角正是同一件事的幾何說法:尖角落在座標軸上,等高線由外向內碰到約束區時,碰在尖角的機會遠高於碰在光滑的圓周上。
回到那門大班必修課。假定從六週的平台日誌抽出一百二十個特徵,而可訓練的只有六百人,特徵數與樣本數之比已高到讓最小平方的係數極不穩定:換一批樣本,若干係數連正負號都會翻轉。改以 lasso 並由交叉驗證選定 \lambda,假定最後只留下九個非零係數,權重最大者為作業繳交距截止時限的中位數;脊迴歸則保留全部一百二十個係數,但每一個都被壓得很小。兩者的樣本外表現可能相去不遠,差別在於 lasso 交出一份能與授課教師討論的短名單,脊迴歸交出的則是難以逐項解讀、但在特徵高度相關時通常更穩定的加權合成。
正則化與第三十三章的貝氏觀點在此交會:如第三十三章所述,脊估計恰為常態先驗下的後驗眾數、lasso 為拉普拉斯先驗下的後驗眾數,L_2 與 L_1 懲罰即是把「係數應偏小」或「係數應稀疏」的信念寫成先驗 (Hoerl & Kennard, 1970)。正則化在心理學高維情境中日益重要,如以大量題目或神經影像特徵預測結果,其中變數選擇與收縮既提升預測、也有助辨識少數關鍵預測子。相關方法的權威整理見 Hastie et al. (2009) 與較為入門的 James et al. (2013)。
樹方法與集成學習
上一節的正則化仍在線性的框架內運作,係數所刻畫的是每個變項對結果的一份固定加權。但心理與教育資料中的關係常不是這個樣子:影片完成率偏低,對出席穩定的學生或許無妨,對缺席已多的學生卻是關鍵警訊,這是交互作用;登入次數超過某個門檻後便不再帶來額外助益,這是非線性。決策樹以一連串對預測變項的二分切割,將特徵空間遞迴地劃分為若干區域並在各區域給出預測,正是為捕捉這類結構而設計。單棵樹直觀、可解釋,能自然地表現非線性與交互作用,但變異高、易過度擬合:訓練樣本只要換掉少數幾人,切割點與整棵樹的形狀就可能大幅改變。
集成學習(ensemble learning)藉組合多棵樹以降低變異、提升穩健,其所以有效正是偏誤與變異分解的直接應用:若干個各自無系統性偏誤、彼此又不完全相同的預測取平均之後,偏誤不變而變異下降,下降的幅度取決於這些預測之間的相關有多低。Breiman (2001a) 的隨機森林對自助抽樣的資料擬合大量樹,並在每次切割時隨機限制候選變項,再平均其預測;此雙重隨機化正是為了壓低樹與樹之間的相關,好讓平均真正發揮降低變異的作用。
梯度提升(gradient boosting)則以序列方式逐棵擬合前一輪的殘差,其思路與隨機森林恰成對照:不是先讓每棵樹長深、再靠平均收回變異,而是讓每棵樹都很淺,只修正前一輪尚未解釋的部分,靠層層累加逼近訊號。它往往能達到更高的預測準確度,但也更易過度擬合、對調參更敏感。樹集成尚提供變數重要性(variable importance)度量,用以評估各預測子的貢獻,是其在解釋性上的一項優點,惟其解讀的限制須待可解釋性一節再作交代。
支持向量機與神經網路
樹並非捕捉非線性的唯一途徑。支持向量機(support vector machine, SVM)換了一條路:它不切割空間,而是尋找能以最大間隔分隔兩類的決策邊界,也就是在所有可行的邊界中挑出離最近樣本點最遠的那一條,因為留有餘裕的邊界對新樣本比較不敏感。原空間中線性不可分的情形,則透過核(kernel)技巧將資料隱式映射至高維空間,在那裡以線性邊界處理,在變項多而樣本不特別大時常表現優異。
神經網路(neural network)的基本構想其實並不神祕。最單純的一層所做的事,是把輸入變項按若干組不同的權重各作一次加權和,再讓每個加權和通過一個非線性函數,例如把負值一律壓為零;這些輸出成為新的一批變項,交給下一層重複同樣的動作。單看每一步都只是加權與壓縮,層層堆疊之後卻能表達極為彎曲的輸入與輸出關係,並把原始變項組合成愈趨抽象的表徵,其深層版本即深度學習。LeCun et al. (2015) 綜述了深度學習如何藉表徵學習(representation learning)自原始資料自動習得有用的特徵,在影像、語音與文本等高維非結構資料上取得突破。
神經網路的威力在於其近乎無限的彈性,但這也意味著它需要大量資料以馴服其變異,且高度不透明;以前述八百人的課程資料去訓練一個深層網路,幾乎注定落在變異過高的那一端。
本章所述主要監督式方法的特性,摘要於表 34.1。
| 方法 | 優勢 | 主要限制 |
|---|---|---|
| 正則化迴歸 | 可解釋、擅長高維、與統計傳統相通 | 預設線性關係 |
| 隨機森林 | 捕捉非線性與交互、穩健、免大量調參 | 相對黑箱 |
| 梯度提升 | 預測準確度常最高 | 易過度擬合、需細心調參 |
| 支持向量機 | 高維有效、理論基礎清晰 | 對核與參數選擇敏感 |
| 神經網路 | 表徵學習、大資料下極具彈性 | 需大量資料、高度不透明 |
註. 各方法在預測力、可解釋性與資料需求之間有不同的權衡;方法的選擇應依樣本規模、關係之非線性程度、以及對可解釋性的需求而定。
非監督學習:分群與降維
前述方法皆為監督式,即有明確的結果變項可供學習,模型的好壞有一個外在的標準可資對照。但心理學的許多問題並沒有這樣的標準答案:研究者手上只有一批反應型態,想知道其中是否存在自然的次群,或能否以少數維度加以概括。非監督學習正是在沒有標籤的情形下探索資料的內在結構,其成敗因而無法只靠預測誤差來判定。分群(clustering)將觀測歸入若干群,如 k 平均法(k-means)以最小化群內離差為準則反覆分派,其邏輯與第二十章的混合模型相通,惟混合模型為機率式而 k 平均為硬性分派。
降維(dimension reduction)將高維資料壓縮至少數維度:主成分分析(第十四章)以線性組合捕捉最大變異,而 t-SNE 與 UMAP 等非線性方法則專為高維資料的視覺化而設計,能保留局部鄰近結構。非監督方法在心理學中用於探索反應型態、辨識受測者次群、以及將高維測量壓縮為可詮釋的維度,是資料探索階段的有力工具,但其結果的實質意義須以理論與後續驗證加以檢核。
效能評估與指標
模型的價值取決於如何衡量其表現,而指標的選擇本身即是一個實質決策。分類任務中,整體準確率(accuracy)在類別不平衡時具高度誤導性。回到那門必修課:假定封存的二百名學生中只有十六人不及格,佔百分之八。一個把全體都判為及格、完全不看任何預測變項的模型,準確率就有百分之九十二,卻連一名需要協助的學生也找不出來。準確率高在此並不代表模型有用,只反映多數類本來就佔壓倒性的比例。
因此須輔以精確率(precision,判為正者中真正為正的比例)與召回率(recall,真正為正者中被判出的比例)。假定模型發出二十份預警而其中十人確實不及格,精確率即為 0.50,等於每兩份預警有一份是虛驚;十六名不及格者中被預警到十人,召回率為 0.63,等於仍有六人未受提醒便走到期末。二者存在權衡:門檻放寬則召回率上升而精確率下降,門檻收緊則反之,該往哪邊調,取決於漏掉一名需要協助的學生與多發一次虛驚,何者的代價較高。
ROC 曲線下面積(ROC-AUC)刻畫跨所有判斷閾值的區辨能力,其值可讀為任取一名不及格者與一名及格者,模型給前者較高風險分數的機率,故 0.5 等同擲銅板,0.78 表示約七成八的配對排序正確。校準(calibration)則評估預測機率是否與實際頻率相符:若模型判為風險 0.3 的那群學生最終確有約三成不及格,校準即屬良好,這在須依機率分配輔導資源時尤為關鍵。迴歸任務則常以均方根誤差(RMSE)或 R^2 衡量。
主要指標摘要於表 34.2。
| 任務 | 指標 | 說明與注意 |
|---|---|---|
| 分類 | 準確率 | 整體正確率;類別不平衡時嚴重誤導 |
| 分類 | 精確率/召回率 | 針對正類的正確性與涵蓋度,二者權衡 |
| 分類 | ROC-AUC | 跨閾值的整體區辨力 |
| 分類 | 校準 | 預測機率與實際頻率的一致程度 |
| 迴歸 | RMSE、R^2 | 誤差量級、解釋變異比例 |
註. 指標的選擇應反映實際的決策後果,如偽陽性與偽陰性代價不對稱時,準確率並非恰當的單一指標。
可解釋性
機器學習的預測力常以透明度為代價:隨機森林、梯度提升與神經網路皆為程度不一的黑箱,難以說明其如何由輸入得到輸出。可解釋機器學習(interpretable machine learning)因而發展出一系列事後解釋工具。變數重要性排序各預測子對模型的整體貢獻;部分相依圖(partial dependence plot)刻畫單一預測子在其他變項平均下與結果的關係;SHAP 值則以合作賽局理論為基礎,將個別預測歸因至各特徵,其各項貢獻的加總恰等於該筆預測與全體平均預測之差。
設想某位學生的風險分數為 0.62 而全體平均為 0.08,SHAP 可以指出這 0.54 的落差中有 0.21 來自作業遲交、0.18 來自影片完成率下滑,其餘分散於其他特徵。這句話的正確讀法是:在這個已訓練好的模型內部,各特徵把分數往上推了多少。它並不等於「若該生準時繳交作業,風險便會降低 0.21」:模型並非在能支撐此類反事實宣稱的設計下建立,遲交很可能只是投入不足的表徵,而非原因。
這些工具有助於窺探黑箱,但須審慎:它們是對模型行為的近似描述,而非對真實因果機制的揭示,將特徵重要性逕自詮釋為因果,重蹈第三十一章所戒之覆轍。可解釋性與預測準確度之間往往存在權衡,而在心理學這一以理解為職志的學科裡,可解釋性所應占的分量,理應高於在純粹預測任務中的分量。
過度擬合、資料洩漏與誠實評估
機器學習的彈性是雙面刃:同樣的彈性既能捕捉真實的複雜結構,也能擬合純粹的雜訊。除偏誤-變異權衡外,一個尤須警覺的實務陷阱是資料洩漏(data leakage):當測試資料的資訊以任何形式滲入訓練過程,樣本外評估即遭汙染而虛高。常見的洩漏包括在切分資料前即以全體資料進行特徵選擇或標準化、在時間序列中以未來預測過去、或反覆窺看測試集以調整模型。
其後果是「樣本外」表現其實並非真正的樣本外,模型在真實新資料上將令人失望。以那門必修課而言,若特徵中混入了期末考的缺考註記,或把整學期的登入總次數誤當成前六週的行為指標,交叉驗證的誤差都會漂亮得可疑,而預警真正需要的是學期初就能取得的資訊。
這一問題與心理學的再現危機遙相呼應:正如可疑的推論實踐會產出無法再現的顯著結果,草率的機器學習評估也會產出無法再現的預測宣稱。誠實的評估,要求測試資料的嚴格封存、對整個建模流程(含特徵工程)的一致交叉驗證、以及對預測宣稱在獨立資料上的再現。
邁向網絡心理計量學
機器學習的圖模型思維,在心理計量學內部催生了一個獨立而重要的取向,即網絡心理計量學(network psychometrics)。它對「觀測變項之間的關聯從何而來」給出了與潛在變項傳統截然不同的答案:不將症狀之間的相關歸因於一個共同的潛在原因,而視症狀為彼此直接交互作用的自主實體,觀測到的關聯正來自這些直接的相互影響。其形式工具是以偏相關為邊的圖模型,並常以正則化(如圖形 lasso)在高維下估得稀疏而穩健的網絡。
這一取向與潛在變項傳統的對話,兼具估計方法與構念本體論兩個層面,其份量已足以獨立成章。由於它把本章的高維與正則化思維,與第三章關於構念本體地位的討論結合為一個完整的主題,本書將網絡心理計量學的估計方法、與潛在變項模型的異同、以及維度性探索等議題,留待第三十五章專章深入,本章至此完成對機器學習作為預測與高維工具的處理。
計算心理計量:文本、歷程與大型語言模型
機器學習不僅是預測的工具,更正在拓展測量本身的邊界,形成一個常被稱為計算心理計量(computational psychometrics)的新興領域。其一是以自然語言處理(natural language processing, NLP)量化文本。自傳、日記、社群貼文與晤談逐字稿等開放式語料,過去難以系統地測量,如今可經由從早期的詞袋與主題模型、到當代的詞嵌入(word embedding)與大型語言模型的一系列技術,轉為可分析的數值特徵,用以推估情緒、人格與心理狀態。然而,能把文字轉為數字,不等於所得的數字即有效地指涉了目標構念;文本測量同樣須通過本書前半所建立的效度檢驗,其效度框架不因技術的新穎而豁免。
其二是作答歷程與日誌資料。數位化施測記錄了遠超出最終作答對錯的訊息,如反應時間、鍵擊、修改軌跡與作答的先後順序,這些歷程資料承載了作答策略、投入程度與認知歷程的線索,其進階的建模與本書第十八章的作答歷程取向相接。機器學習可自這類高維而非結構的歷程資料中萃取特徵,但特徵工程的每一步選擇都可能引入與構念無關的變異,因而歷程資料的測量效度尤須審慎地論證。這類方法在實務上已用於偵測粗心或不投入的作答,與第二十五章的作答品質把關相呼應,也用於適性測驗的即時選題,與第二十四章相接。
其三,也是最新興而最須審慎的,是大型語言模型與測量的交會。當前的探索大致沿三條路線展開:把大型語言模型用作計分者,以評閱開放式反應,其效度與品管屬第二十六章的範疇;用作試題生成器,以大量產出候選試題供養題庫,其編製與品質把關屬第二十二章;以及一條更具推測性的路線,即把大型語言模型本身當作受測對象,以心理計量工具測量其「人格」或「能力」,即所謂人工智慧的心理計量學。本書對最後一條路線明確標記為高度推測性,因為一個語言模型是否具有可被穩定測量的心理屬性,本身就是一個尚未有定論的構念效度問題,把為人類設計的量表逕自施於模型,其分數的意義極不明朗。這些應用的共同教訓,與演算法公平的議題相通:機器學習能測到什麼,不等於它測到的就是所欲的構念,也不等於它的測量對不同群體同等有效。
批判:預測、理解與公平
機器學習為心理學帶來的力量,須與其限制一併衡量。第一重限制是預測與理解之別。一個模型可以預測精準卻毫無洞見,如以數千個特徵預測結果的黑箱,其高準確度並不等同於對現象的理解;反之,一個可理解的簡單機制也可能預測平平。心理學既以理解心智為職志,純粹的預測便是必要而不充分的:預測力是理論的試煉,卻非其替代。將機器學習的預測成就誤認為科學理解的達成,是一種需要警覺的混淆。
第二重限制是公平性。以資料訓練的模型會習得、甚至放大資料中既有的偏誤:若訓練資料反映了歷史性的不平等,模型的預測便可能對特定群體系統性地不利。這直接關聯第十九章的差異試題功能與第二十四章對適性演算法公平性的關切,並帶出演算法公平的深層難題,包括不同的公平準則在數學上往往無法同時滿足、以及公平與準確之間的權衡,這些難題的制度與法理一面則屬第二十七章。
第三重限制是可推廣性:在某一母體或情境訓練的模型,未必能推廣至另一者,樣本的偏狹(如過度依賴特定文化的樣本)與資料分布的時間漂移,皆威脅其外部效度(第九、三十一章)。最後,高維方法強大的模式發現能力,在缺乏理論約束時也可能淪為對雜訊的過度擬合,將樣本的偶然特異當成規律,這使理論在機器學習時代非但未過時,反而更形重要:唯有理論能約束假設空間、並賦予所發現的模式以意義。
小結
本章對機器學習與高維方法作了系統的鋪陳,並始終扣連其與心理計量傳統的關係。核心概念上,本章自臨床判斷與統計預測之爭的前史入手,闡明了解釋與預測兩種文化、支配預測建模的偏誤-變異權衡、以及以樣本外預測為評準的交叉驗證。方法上,本章涵蓋高維迴歸的正則化(脊、lasso、彈性網及其貝氏對應)、樹集成、支持向量機與神經網路等監督式方法、以及分群與降維等非監督式方法,並論及效能指標、可解釋性與資料洩漏等誠實評估的議題。
在心理計量的接面上,本章預告了以圖模型重構測量的網絡心理計量學(留待第三十五章),並深入了機器學習於文本、作答歷程與大型語言模型的計算心理計量應用。貫穿全章的訊息是:機器學習為心理學補上了長期缺席的預測維度、並提供了探索高維結構的利器,但其恰當運用,取決於清醒地辨別預測與理解、警覺過度擬合與不透明之代價、並始終將演算法置於理論與測量的框架之中。接下來的第三十五章,將把本章預告的網絡心理計量學獨立展開,深入圖模型與潛在變項兩種取向對心理構念的不同構想;而全書的最後一章,則將回到貫穿始終的主線,對計量心理學的整合、開放科學實踐與未來走向,作一總結性的反思。