第 36 章 開放科學、再現性與計量心理學的未來
第八部 計算取向與學科的未來
36Chapter

開放科學、再現性與計量心理學的未來

本書自 Fechner 的心理物理學與 Spearman 的因素分析出發,歷經古典測驗理論、信度與效度、統計推論的基礎與爭議、實驗設計與變異數分析、迴歸與廣義線性模型、因素分析、結構方程、項目反應理論、認知診斷、測量不變性、測驗編製與等化、電腦化適性測驗、問卷與作答行為、評分者與實作評量、測驗公平、多層次與成長模型、密集縱貫、因果推論、後設分析、貝氏方法、機器學習,直至網絡心理計量學,走過了一段跨越百餘年、涵蓋整個計量心理學版圖的漫長旅程。這最後一章不再引入新的方法,而是後退一步,俯瞰全局:辨識貫穿全書的幾條主線,反思它們如何交織成一個整體,並前瞻計量心理學在開放科學與計算轉向下的未來走向。

一門成熟學科的價值,不僅在於其工具的精巧,更在於其對這些工具之限度的清醒認識。本章的核心關切,因而不是技術的堆疊,而是方法背後那些反覆出現的觀念與教訓:測量作為最深的問題、不確定性下推論的共同邏輯、潛在變項作為統一的建模架構、從關聯到因果與從解釋到預測的張力,以及貫穿一切的一個認識,即統計結果從不單由資料給定,而總是資料與假設的共同產物。這些主線的交會處,正是計量心理學作為一門學科的自我理解之所在。

一段旅程的回顧

回望全書的結構,其安排並非任意,而是循著一條由基礎至前沿、由測量至推論、由靜態至動態的內在邏輯。前半部奠立了測量的理論根基:何為構念、如何以量尺與模型加以刻畫、如何評估信度與效度。中段轉入統計推論與潛在變項建模:自 NHST 的爭議與估計的原理,到因素分析、結構方程與項目反應理論這一潛在變項模型的大家族。後半部則邁向更複雜的結構與更前沿的取向:縱貫與多層次的變化建模、因果推論的形式框架、貝氏的統一推論典範、以及機器學習的預測轉向。這條路徑本身即傳遞了一個訊息:計量心理學不是一堆彼此孤立的技術,而是一個層層相扣、概念相通的知識體系。

貫穿全書的主線

若將全書化約為幾條反覆出現的主線,可得到表 36.1 所列的七個主題。它們並非彼此獨立的章節群,而是交織於全書之中的觀念脈絡:同一章往往同時觸及數條主線,而同一主線亦貫穿於相隔甚遠的各章。

表 36.1 貫穿全書的七條主線
主線 核心問題 主要呼應章節
測量 如何測量看不見的構念 第 2–7、17、19、22、25–27 章
推論 如何在不確定下作判斷 第 8–13、33 章
潛在變項 觀測背後的結構為何 第 3、14–21 章
變化與時間 如何刻畫隨時間的變化 第 28–30 章
因果與整合 如何推論成因、如何彙整證據 第 31–32 章
預測 如何以模型預測新資料 第 11、34 章
計算 如何馴服複雜與高維 第 33–35 章

註. 七條主線相互交織而非彼此獨立;同一章常同時觸及數條主線,如第十七章項目反應理論同時屬於測量與潛在變項,第三十三章貝氏方法同時屬於推論與計算。

這七條主線的交織,正是計量心理學統一性的體現。以下數節將擇其要者,闡明它們如何在全書中反覆迴響,並在交會處揭示這門學科的核心關懷。

測量:最深的問題

若要指認計量心理學最根本、也最常被低估的問題,那便是測量本身。物理科學的許多構念有相對明確的操作與單位,而心理學所欲測量的憂鬱、智力、態度、人格,皆為無法直接觀測的潛在構念,其測量始終隔著一層由指標到構念的推論。本書自第二章的測量哲學、第三章的構念與量尺、到第五至七章的信度與效度,反覆回到這一核心:一個分數究竟測到了什麼,以及我們憑什麼相信它測到了所宣稱的構念。

效度作為一種持續的論證(第七章的 Messick (1989) 與 Kane (2013)),而非一次性的檢定,正凸顯了測量問題的開放性與艱難。令人憂心的是,這一最基礎的問題在實務中卻常被草率對待。Flake & Fried (2020) 所揭示的「可疑測量實踐」,指出大量研究對其測量工具的效度未加檢驗、對量表的修改未加報告,使建立於其上的一切統計推論根基動搖。這與再現危機互為表裡:若測量本身不可信,則再精巧的統計也只是在流沙上築樓。本書一再強調測量不變性(第十九章)、效度論證(第七章)與測量誤差對後續推論的汙染(第十六、三十一章),正是要凸顯一個立場:測量不是統計分析的前奏,而是計量心理學的核心。一切始於測量,也受限於測量。

不確定性下的推論

計量心理學的第二條主線,是如何在不確定下作出可辯護的判斷。本書對此的處理,橫跨了看似對立、實則相通的數個框架。第八、九章剖析了 NHST 的爭議:p 值的誤解、對顯著性的過度倚賴、以及效果量與檢定力的忽視,如何助長了不可靠的文獻。第十二章轉向估計與模型選擇,以資訊準則將推論的焦點自「拒絕虛無」移向「哪個模型較能預測」。第三十三章的貝氏方法則提供了一個統一的框架,以後驗分布直接表徵參數的不確定性,並給出人們直覺所欲求的機率陳述。

這些框架表面上分歧,深層卻共享一個邏輯:推論即是在資料的證據與其固有的不確定性之間,作出審慎而透明的權衡。無論是頻率派的信賴區間、資訊準則的模型比較、還是貝氏的後驗,其共同目標都是量化「我們對某結論有多少把握」,並誠實地標示這份把握的界限。本書對此的一貫立場是:沒有任何單一的推論工具是萬能的,方法論的成熟不在於信奉某一典範,而在於理解每一框架的假設、適用範圍與限度,並據問題的性質作出恰當的選擇。統計顯著、實務重要與推論不確定,三者必須分辨;而對不確定性的誠實,是一切可信推論的前提。

潛在變項作為統一架構

本書中段的大半篇幅,圍繞著一個統一的建模架構:潛在變項模型。乍看之下,探索性與驗證性因素分析、結構方程、項目反應理論、潛在類別、成長曲線與多層次模型,是一組各自為政的技術;但本書反覆揭示,它們實為同一觀念在不同設定下的展開。第二十章的四重分類清楚地顯示,因素分析、項目反應理論、潛在剖面與潛在類別,僅是「潛在變項與觀測變項各為連續或類別」四種組合的產物。第二十八、二十九章更進一步指出,多層次模型與結構方程的成長曲線在寬鬆條件下分析等價,隨機效果本身即可視為潛在變項。

這一統一性有深刻的意涵。它意味著,一旦掌握了潛在變項的核心邏輯,即觀測指標之間的關聯由不可觀測的潛在結構所解釋,便掌握了理解這一龐大模型家族的鑰匙。局部獨立、參數估計、識別、適配評估、以及測量不變性等概念,在各模型間彼此呼應、相互闡明。本書刻意凸顯這些橫向的連結,如將二參數項目反應模型視為廣義線性混合模型(第二十八章)、將認知診斷模型連結至潛在類別(第二十、二十一章),正是為了讓讀者看見表象之下的統一結構,而非困於各自孤立的技術細節。潛在變項,是計量心理學建模思維的中樞。

從關聯到因果,從解釋到預測

計量心理學的抱負,最終指向兩個超越描述的目標:解釋成因與預測未來。第三十一章闡明了自關聯邁向因果所需的嚴謹:因果結論從不單由資料給定,而依賴一組不可由資料檢驗的假設,如可忽略性與排除限制;潛在結果與因果圖兩個框架,使這些假設得以明確、可辯護。尤其發人深省的是,因果推論最終回指測量:可操弄性的爭議揭示,一個界定含糊的構念,其「因果效果」也必然含糊,因果的嚴謹於是與測量的清晰緊密相繫。

第三十四章則引入了另一個維度:預測。Breiman (2001) 的兩種文化與 Yarkoni & Westfall (2017) 對心理學的針砭提醒我們,解釋與預測是兩種不同的目標,而心理學長期偏重前者、忽視後者,以致許多「顯著」的發現毫無樣本外預測力。描述、解釋與預測,構成了計量研究的三種模式:描述回答「是什麼」,解釋回答「為什麼」,預測回答「接下來會如何」。三者互補而非互斥,一個成熟的計量心理學,理應在恰當的問題上運用恰當的模式,並清醒地辨明自己究竟在做哪一件事。將預測的成功誤認為解釋的達成、或將關聯的發現誇大為因果的證立,是本書反覆警戒的混淆。

一個反覆的教訓:模型即假設的載體

若要自全書提煉出單一最重要的方法論教訓,那便是:統計結果從不單由資料給定,而總是資料與一組假設的共同產物,而這些假設多半無法由資料本身完全檢驗。這一教訓在每一章反覆迴響。

概念方塊結果 = 資料 + 假設

本書所論的每一種方法,其結論的效力都繫於一組關鍵而常不可檢驗的假設:

  • 古典測驗理論的信度,繫於平行測驗或其弱化形式的假設(第五章)。

  • 因素分析與結構方程的估計,繫於正確的維度數、局部獨立、以及正確設定的模型結構(第十四至十六章)。

  • 缺失資料的無偏估計,繫於隨機缺失(MAR)這一不可檢驗的假設(第十三章)。

  • 多層次模型的效度,繫於隨機效果與預測變項不相關(第二十八章)。

  • 成長模型的「變化」,繫於正確的軌跡形狀與縱貫測量不變性(第二十九章)。

  • 因果推論的識別,繫於可忽略性、SUTVA 或排除限制(第三十一章)。

  • 貝氏推論的後驗,繫於先驗與概似的設定(第三十三章)。

一個良好方法的價值,不在於它消除了假設,而在於它使假設明確、精確、且可受檢視與辯論。

這一認識帶來的不是虛無主義,而是一種方法論的成熟。它意味著,任何統計結論都應伴隨對其所依賴假設的明示與辯護,並輔以敏感度分析與穩健性檢查,以評估結論對假設違反的脆弱程度。它也意味著,方法之間的高下,往往不在於孰能給出更確定的答案,而在於孰能更透明地承載其假設。計量心理學的專業素養,因而不在於追求虛假的確定性,而在於有紀律地管理不確定性與假設。這正是本書希望讀者帶走的核心心智習慣。

再現危機與開放科學

過去十餘年,心理學經歷了一場深刻的再現危機。Open Science Collaboration (2015) 的大規模重複研究顯示,相當比例的已發表發現無法再現,動搖了學界對文獻可信度的信心。這場危機的根源,與本書的核心關切緊密相連。Simmons et al. (2011) 揭示,資料收集與分析中未揭露的彈性,即所謂研究者自由度,足以將幾乎任何結果包裝為顯著,這正是第八、九章所論 NHST 誤用的極端後果。而如前所述,Flake & Fried (2020) 更指出危機亦有其測量的根源:草率的測量實踐使建立其上的推論根基不穩。

回應這場危機的,是開放科學運動。其核心實踐,包括預先註冊(preregistration)以區分驗證性與探索性分析、註冊報告(registered reports)以在資料收集前即審查研究設計、以及資料、材料與程式碼的公開共享以容許獨立檢驗。Nosek et al. (2015) 的透明與開放促進準則,以及 Munafò et al. (2017) 的可再現科學宣言,系統地闡述了這些實踐如何自方法、報告、再現與獎勵等環節重塑科學文化。這些實踐與本書一貫的立場深相契合:明示假設、公開先驗(第三十三章)、報告效果量與不確定性(第九章)、以及誠實的樣本外評估(第三十四章),本質上都是同一種透明性的要求。開放科學不是外加於計量方法的行政負擔,而是計量嚴謹在研究實踐層面的自然延伸。發表偏誤即是這一文化問題的縮影:其統計的偵測與校正工具屬第三十二章的範疇,而其制度成因,即期刊對顯著結果的偏好如何系統性地扭曲了可得的文獻,則須以出版文化的改革來回應。開放科學運動最富企圖的一步,是把累積科學的邏輯前置到研究設計之中,即大團隊科學與多實驗室的協同複製計畫,預先協調眾多實驗室以共同的方案執行同一研究,其成果本質上是一個設計出來的、從源頭免除發表偏誤的累積科學,而非對既有零散文獻的事後打撈。

測量的再現性:被忽視的一環

關於再現危機的討論,多聚焦於統計實踐,如 p 值操弄與研究者自由度,而相對忽略了一個同樣根本的源頭,即測量本身的再現性。一條推論鏈的可信度,不會強於其最脆弱的一環,而測量往往正是那最脆弱、卻最少受檢視的一環。若一份量表的效度證據不足,則無論其後的統計分析多麼嚴謹、樣本多麼龐大,所得的結論都繼承了測量的不確定,這一汙染會沿著整條推論鏈向下傳遞而難以事後補救。本書第七章所強調的效度論證、以及第二十五章所論的作答行為與測量實務,正是為了在源頭上鞏固這最脆弱的一環。

測量再現性的問題,還有其制度性的成因。學界對新量表的獎勵、對既有工具的忽視,助長了量表的氾濫:同一個構念名稱下,流通著數十份彼此低度相關的量表(jingle 謬誤),而名稱相異的量表卻可能測量著幾乎相同的東西(jangle 謬誤)。這一 jingle-jangle 的混亂,使跨研究的證據難以累積,因為表面上研究「同一構念」的文獻,其實測量的並非同一事物。此一問題延續自第三章對構念與量尺的討論,其解方不在於再多發明幾份量表,而在於測量的整合與標準化,以及一種把「我們究竟在測量什麼」置於研究核心的學術文化。測量的再現性因而不只是技術問題,更是學科如何獎勵與累積知識的制度問題。

理論的不可或缺

在方法日益強大、資料日益龐大的時代,一個容易滋生的錯覺是:只要有足夠的資料與夠彈性的演算法,理論便可有可無。本書的立場恰恰相反。第三十四章已指出,缺乏理論約束的高維探勘,極易將樣本的偶然特異當成規律;而第二章與 Meehl 對心理學理論的長期針砭則提醒,以 NHST 進行的鬆散理論檢驗,因缺乏風險性的預測,其實對理論的考驗甚微。理論在計量研究中扮演著不可替代的三重角色:它約束了假設空間,使模型不致在無窮的可能性中過度擬合;它賦予所發現的模式以意義,將統計的關聯轉譯為實質的理解;它提供了可被嚴格否證的預測,使資料得以真正地考驗觀念。

方法與理論的關係,因而不是主從,而是對話。統計方法若無理論的引導,易淪為漫無目的的資料探勘;理論若無嚴謹方法的檢驗,則流於無法否證的思辨。計量心理學最富成效的進展,往往發生於方法的創新與理論的深化彼此激盪之處,如潛在變項模型之於構念理論、因果框架之於機制假設、網絡取向之於心理病理的結構理論。本書所介紹的一切技術,其終極目的都不是技術本身,而是服務於對人類心智更清晰、更嚴謹、更可檢驗的理解。

未來走向

展望未來,計量心理學正經歷數個相互交織的轉向。其一是密集縱貫與個殊化的取向。隨著經驗取樣、穿戴裝置與數位表徵技術的普及,研究者得以高頻率地追蹤個體的動態,這使焦點自群體平均移向個體內的歷程。Molenaar (2004) 援引遍歷性(ergodicity)理論指出,群體間的變異結構未必等同於個體內的變異結構,因而以橫斷的組間資料推論個體內的動態,往往並不合法。這一洞見呼應了 Cronbach (1957) 對相關與實驗兩種科學傳統的經典區分,並推動著動態系統、個體網絡與人本位模型的興起,讓「把人帶回科學心理學」成為可能。

其二是機器學習與心理計量的深度整合:自然語言處理將開放式文本轉為可測量的訊號、作答歷程資料揭示了超越最終作答的認知過程、而預測與測量的結合正拓展著測量所能捕捉的行為邊界(第十八、三十四章)。其三是貝氏工作流程的日益標準化,使不確定性的表徵、複雜階層模型的估計與透明的模型檢查成為常規(第三十三章)。其四是穩健性與可推廣性的方法自覺,如多重宇宙分析與規格曲線,以系統地檢視結論對分析決策的敏感。與這些技術轉向並行的,是倫理與公平的關切日益迫切:演算法的偏誤、測量的文化偏差、以及自動化決策的問責,使公平性自邊緣議題移向方法論的核心(第十九、三十四章)。貫穿這些轉向的,是計量心理學與資料科學、統計學與計算科學日深的跨域對話。然而無論工具如何演進,測量的效度與推論的嚴謹這兩塊基石,始終是這門學科不可動搖的根本。

若把這些轉向收束為對整個學科的展望,有三個議題尤其值得計量心理學社群正視。其一是測量理論與人工智慧的相互滲透,即一方面機器學習與大型語言模型正被用於測量,另一方面心理計量的效度框架也正被用以評鑑演算法所測得之物,兩個傳統的對話才剛開始。其二是作業型心理計量的人才斷層,即等化、量尺維護、大型評量與題庫管理這些支撐真實測驗運作的專門技藝,其人才培養遠跟不上需求,形成學術訓練與實務需求之間的落差。其三是開放測量(open measurement)運動的興起,即把開放科學的透明精神延伸到測量本身,主張量表的題目、計分規則、效度證據與心理計量性質都應公開共享,使測量得以被獨立檢驗、被累積、被改進。這三個議題共同指向一個判斷,即計量心理學的未來,將不僅取決於統計模型的精巧,更取決於它能否守住並更新其對測量本身的關注。

結語

計量心理學,歸根結柢,是一門讓關於心智的主張變得可辯護的學問。它的全部技術,無論是一個信度係數、一組因素負荷、一條成長軌跡、一個因果效果、還是一個後驗分布,都服務於同一個目的:在無法直接觀測的心理世界與可觀測的資料之間,架起一座既嚴謹又誠實的橋梁。本書所走過的旅程,表面上是一連串方法的展開,深層卻是同一組核心關懷的反覆迴響:我們測到了什麼、我們有多少把握、我們的結論依賴哪些假設、以及我們能否清醒地分辨描述、解釋與預測。

這門學科教給我們的,或許最終不是某種確定性,而是一種面對不確定性的成熟姿態。它要求我們在每一個數字背後,看見其所依賴的假設;在每一個顯著結果面前,追問其實質的意義與再現的可能;在每一次以模型逼近現實時,記得模型終究只是地圖而非疆域。這份謙遜並不削弱計量方法的力量,反而是其力量的來源:唯有清楚地知道一個方法能做什麼、不能做什麼,我們才能負責任地運用它。

計量心理學的未來,將由更豐富的資料、更強大的計算與更精巧的模型所形塑,但它的靈魂始終在於那些方法所服務的、關於人的根本問題:人如何思考、感受、學習與改變,人與人之間又如何異同。方法會演進,工具會更替,而以嚴謹的量化去逼近這些問題、並對自己所知的界限保持誠實,這份志業將長存。願讀者帶著這份對測量的敬重、對不確定性的誠實、與對理解的執著,走向自己的研究之路。

參考文獻

Breiman, L. (2001). Statistical modeling: The two cultures. Statistical Science, 16(3), 199–231. https://doi.org/10.1214/ss/1009213726
Cronbach, L. J. (1957). The two disciplines of scientific psychology. American Psychologist, 12(11), 671–684. https://doi.org/10.1037/h0043943
Flake, J. K., & Fried, E. I. (2020). Measurement schmeasurement: Questionable measurement practices and how to avoid them. Advances in Methods and Practices in Psychological Science, 3(4), 456–465. https://doi.org/10.1177/2515245920952393
Kane, M. T. (2013). Validating the interpretations and uses of test scores. Journal of Educational Measurement, 50(1), 1–73. https://doi.org/10.1111/jedm.12000
Messick, S. (1989). Validity. In R. L. Linn (Ed.), Educational measurement (3rd ed., pp. 13–103). American Council on Education; Macmillan.
Molenaar, P. C. M. (2004). A manifesto on psychology as idiographic science: Bringing the person back into scientific psychology, this time forever. Measurement: Interdisciplinary Research and Perspectives, 2(4), 201–218. https://doi.org/10.1207/s15366359mea0204_1
Munafò, M. R., Nosek, B. A., Bishop, D. V. M., Button, K. S., Chambers, C. D., Percie du Sert, N., Simonsohn, U., Wagenmakers, E.-J., Ware, J. J., & Ioannidis, J. P. A. (2017). A manifesto for reproducible science. Nature Human Behaviour, 1(1), 0021. https://doi.org/10.1038/s41562-016-0021
Nosek, B. A., Alter, G., Banks, G. C., Borsboom, D., Bowman, S. D., Breckler, S. J., et al. (2015). Promoting an open research culture. Science, 348(6242), 1422–1425. https://doi.org/10.1126/science.aab2374
Open Science Collaboration. (2015). Estimating the reproducibility of psychological science. Science, 349(6251), aac4716. https://doi.org/10.1126/science.aac4716
Simmons, J. P., Nelson, L. D., & Simonsohn, U. (2011). False-positive psychology: Undisclosed flexibility in data collection and analysis allows presenting anything as significant. Psychological Science, 22(11), 1359–1366. https://doi.org/10.1177/0956797611417632
Yarkoni, T., & Westfall, J. (2017). Choosing prediction over explanation in psychology: Lessons from machine learning. Perspectives on Psychological Science, 12(6), 1100–1122. https://doi.org/10.1177/1745691617693393
本章引用格式游琇婷(2026)。開放科學、再現性與計量心理學的未來。《計量心理學:測量、模型與推論》(第 36 章)。