第 1 章 導論:本書地圖與計量心理學的知識架構
第一部 基礎與歷史
01Chapter

導論:本書地圖與計量心理學的知識架構

一個人的智力有多高?焦慮有多深?對工作的投入又有多強?這些問題,心理學每天都在問,也每天都嘗試以數字作答。然而,一道根本的難題正埋伏在這看似尋常的企圖之後。物理學家若想知道一根鋼樑有多長,取尺一量即得答案;心理學家若想知道一個人有多焦慮,卻遍尋不著任何一把「焦慮尺」。焦慮無法目視、不能觸及,也沒有任何儀器能夠直接讀出它的數值。

計量心理學(quantitative psychology)這門學問,正是為了回答一個表面簡單、實則極難的問題而存在:如何為看不見的心理特質,賦予有意義且可信賴的數字?這個問題的難度,並不亞於物理學家追問時間的本質,只是它的困難以不同的方式呈現。物理量至少留下可被儀器捕捉的物理痕跡;心理量卻連痕跡都必須先由研究者界定,才知道要到哪裡去尋。

本章是全書的導覽,也是一張地圖。它先釐清這門學問究竟在處理什麼問題,以及它與統計學、資料科學這幾個近鄰的關係;接著引入貫穿全書的兩種知識文化;最後把三十六章、八大部分的整體安排攤開,說明每一部分在全局中扮演的角色,以及可循的閱讀路徑。讀畢本章,讀者當能理解本書為何如此鋪陳,並依自身背景選擇最合適的切入方式。

心理學為什麼需要「測量」這門學問

物理世界的測量通常享有一項便利:被量度的對象與量度的工具,關係相當清楚。長度以尺、重量以秤;更關鍵的是,在動手量度之前,「長度」本身早已具有明確的意義。心理世界則全然不同。智力、焦慮、外向、幸福感,這些都不是能夠直接觀察的實體,而是心理學家為了整理與解釋人類行為所提出的理論概念,本書統稱為潛在構念(latent construct)。

研究者真正記錄到的,從來不是構念本身,而是它留下的痕跡:某一試題答對或答錯、某一量表勾選「非常同意」或「非常不同意」、某段時間內某個行為出現的次數。這些可被觀察、可被登錄的量,稱為指標(indicator)。心理測量的核心工作,正是由看得見的指標,回溯那看不見的構念。而由指標到構念的這一步跳躍,恰是整門學問最根本的難題所在。

不妨舉一個具體的例子。若要測量憂鬱,研究者無法直接觀察「憂鬱」本身,只能觀察一些被認為由憂鬱所驅動的表現:睡眠是否紊亂、對日常活動是否失去興趣、注意力能否集中、是否時常感到疲憊。這些可勾選、可計次的項目就是指標,而「憂鬱」則是被假設在背後統合這些表現的構念。測量的工作,是由這一組指標的組型,回推某人在憂鬱這一維度上的位置。困難也正落在這裡:同一組指標可能出自不同的成因,疲憊也許源於身體疾病而非憂鬱;而構念與指標之間對應的強度,本身即是需要以資料檢驗的假設,而非可以想當然耳的前提。這個看似樸實的例子,其實已經預告了後續各章反覆處理的所有難題:維度性、局部獨立、測量誤差,以及跨群體的可比較性。

這道難題帶來兩項深遠的後果。第一,測量並非「正式研究之前的暖身」,而是整套推論的地基。無論其後的統計如何精巧、所檢驗的理論如何重要,結論的可信程度終究受制於最前端的測量品質;地基若偏差一寸,其上的樓層便傾斜一尺。第二,由於構念無法被直接驗證,任何一次測量都必然承載一組假設,也就是關於「這些指標究竟如何反映該構念」的假設。這組假設可能為真,也可能為誤;一旦為誤,數字再精確也失去意義。這正是 Cronbach & Meehl (1955) 提出的建構效度(construct validity)之所以成為心理計量核心概念的緣由:當一個構念沒有現成的標準答案可供對照時,唯一的辦法是訴諸它與其他變項之間的理論關係網,逐步為測量的意義辯護。第七章將完整處理效度概念的演進,此處僅先埋下伏筆。

正因心理測量如此間接,這門學問自誕生之初便伴隨一種根本的質疑。Michell (1999) 尖銳地指出,心理計量學長期存在一個未經認真檢驗的假設:它預設心理特質如同長度與重量,是一種可以連續累加的「量」(quantity);然而這項假設是否成立,卻鮮少有人真正加以驗證。此一批評未必要求人們放棄測量,但它提醒了一件事:為心理特質賦予數字,從來不是理所當然的動作,而是一項需要理由與證據支撐的實質主張。本書自始至終將測量置於核心,正是奠基於這一認識。

這一質疑亦可換一個角度陳述:測量並不等同於「隨意指派數字」。當研究者說某人的外向程度為 5、另一人為 3 時,這組數字若要具有意義,它們之間的關係,例如 5 大於 3、或 5 與 3 之差等於 4 與 2 之差,就必須忠實對應到外向此一屬性在經驗世界中的某種結構。數字能否、以及在何種意義下能夠承載這樣的經驗關係,正是表徵測量理論(representational measurement theory)所追問的核心;第二章將循此線索,把「測量究竟是什麼」這個問題追究到底。此處須先確立的觀念是:一個數字之所以構成「測量」而非任意標記,取決於它與所測屬性之間是否存在可被辯護的對應。

由此還可引出第三項後果。既然由指標到構念的推論必然帶有誤差,計量心理學便不將誤差視為應當設法抹除的瑕疵,而視之為需要明確建模的量。這與日常直覺頗有出入:日常語彙裡的「誤差」往往意味著失誤,計量心理學裡的誤差卻是測量過程的內在成分,其大小、來源與結構本身即是研究對象。全書反覆現身的信度、標準誤、變異成分與後驗不確定性,說到底都是在正面處理誤差,而非假裝它並不存在。

在進入歷史與方法的細節之前,不妨先預覽兩個將反覆出現於全書的基本結構。它們的形式各異,內核卻一致:都是在區分「我們想知道的」與「我們實際觀察到的」。

概念方塊全書兩個反覆出現的核心結構

結構一:訊號與誤差的分解。任何一次觀察分數 X,都可被想成由兩部分構成,一部分是我們真正關心的訊號,一部分是無可避免的雜訊:

X = T + E,

其中 T 為真分數(true score),代表構念在此測量上的系統成分;E 為誤差(error)。這條看似樸素的分解式,是第五章古典測驗理論的起點,其變形也貫穿信度、因素分析與項目反應理論。

結構二:潛在變項與觀測指標的分離。當構念以連續潛在變項 \eta 表示、並同時影響多個指標 x_1,\dots,x_p 時,最簡單的反映性設定為

x_i = \lambda_i\,\eta + \varepsilon_i,\qquad i=1,\dots,p,

其中 \lambda_i 為負荷(loading),刻畫指標對構念的敏感度。此一設定是因素分析(第十四、十五章)與結構方程模型(第十六章)的共同骨架;當 \eta 或 x_i 改為類別變項時,便延伸為項目反應理論(第十七章)與潛在類別模型(第二十章)。

兩個結構回答的都是同一個問題:如何在承認觀察必然帶有誤差的前提下,仍然對背後的構念做出有紀律的推論。全書可視為對這個問題在不同抽象層次上的反覆作答。

這兩個結構值得先用具體的數字讀一遍。設想一份十題的焦慮量表,某位受測者的總分為 32 分。依結構一,這個 32 分並不等於他的焦慮程度,而是他的真分數 T 加上當天的誤差 E;若這份量表的信度為 0.80,意思是在一群受測者身上,觀測分數的變異有八成來自真分數的差異,兩成來自誤差。同一個人隔週再測一次,分數落在 29 或 35 都不足為奇,這個浮動並非量表壞掉,而是 E 在作用。依結構二,這十道題目之所以彼此相關,是因為它們共同受同一個 \eta 驅動;若第三題的負荷 \lambda_3 特別低,代表它對焦慮的變化不敏感,作答幾乎反映不出人與人的差別,這一題在後續的試題分析中便會被檢討。全書所談的技術,大體都是在把這兩句話說得更精確。

一門學問的誕生:從心理物理學到計算時代

計量心理學並非憑空出現,而是數條研究傳統匯流的結果,前後歷時一個多世紀。這幾條傳統各有各的問題意識:心理物理學想知道感覺如何隨刺激強度變化,個別差異研究想知道人與人為何不同,測驗運動想知道如何在有限的時間內判斷一個人的能力,而數理統計則提供了處理變異與共變的語言。它們在二十世紀前半交會,才長成今日所見的學科樣貌。

回顧這段歷史並非懷舊。今日許多方法之所以長成現在的模樣,原因往往藏在它誕生時所要解決的問題裡。因素分析以相關矩陣為出發點,是因為 Spearman 當年手上能取得的資料,就是各科成績兩兩之間的相關;項目反應理論把試題參數命名為難度與鑑別度,是因為它承接了測驗編製者判斷試題好壞的實務語言。不了解來歷,這些設計只能當成規定背下來;了解了來歷,它們就成為可以被質疑、也可以被改良的選擇。對這段歷程感興趣的讀者,可參考 Jones & Thissen (2007) 對心理計量學史的系統綜述;本節僅擇要勾勒其縱深,以為後續各章的歷史細節定位。

故事的源頭可上溯至十九世紀中葉的心理物理學(psychophysics)。在此之前,「心理現象能否被科學地測量」仍是一個懸而未決的問號。Fechner (1860) 提供了第一個系統性的肯定答案。他承接 Weber 的觀察:欲使人察覺兩個刺激有別,兩者的差距必須達到與原刺激強度成比例的最小量。Fechner 更進一步,假設每一個「剛可察覺的差異」都代表等量的感覺增量,經推導得到感覺強度與刺激強度之間的對數關係。這是歷史上第一次,有人以一條數學式將一個物理量與一個心理量連結起來。結論本身固然重要,其更深遠的意義卻在於它證明了一件事:心理量的數學化,原則上可行。

繼之登場的是 Galton (1889)。若說 Fechner 關切的是「人類共通的感覺法則」,Galton 在意的則是「人與人之間的差異」。他蒐集大量反應時間與感官敏銳度等資料,試圖以這些簡單指標估計智力。這條路徑後來證明成效有限,因為簡單感官指標與複雜智力之間的關聯其實相當微弱;但它遺留的方法遺產卻極為深遠:為了描述兩個變項如何共同變動,Galton 發展出相關與迴歸的雛形,稍後由 Pearson 打磨為今日熟知的積差相關係數。自此,「變異」與「共變」成為心理測量的核心語言。此處亦須誠實補上一筆:Galton 的個別差異研究與優生學(eugenics)的意識形態糾纏甚深,這段背景不應被美化。指出它,並非為了否定相關與迴歸的價值,而是提醒:測量工具的發展從來不是價值中立的,「要測什麼、如何解讀差異」,往往早已承載了測量者的立場。

真正使計量心理學成形的關鍵人物是 Spearman。他在一九○四年的研究裡,同時點燃了兩條研究火線。其一是因素分析:他發現各種認知測驗的分數彼此皆呈正相關,遂提出以一個「一般智力」因素(記作 g)搭配各測驗的特殊因素來解釋,這正是「潛在構念導致觀察分數」此一構想的原型 (Spearman, 1904a)。其二是測量誤差:他注意到測量本身的不準確會使觀察相關被系統性地低估,並提出了校正之法 (Spearman, 1904b)。信度(reliability)的概念即由此萌芽。自 Spearman 之後,測量不再僅是「給出分數」,而成為「一面由指標推論構念、一面估計此一推論有多可靠」的整套工程。

進入二十世紀,Thurstone 將心理量表化推向更嚴謹的層次。他的比較判斷律(law of comparative judgment;(Thurstone, 1927))示範了一件相當漂亮的事:僅憑「A 與 B 何者較強」這類純粹的排序判斷,即可反推出一把具有距離意義的等距尺度;他更主張,連態度這種看似主觀的對象也能被測量,從而將心理測量的版圖由感官一路擴張至社會態度。約略同時,Stevens (1946) 提出名義、次序、等距、等比四種測量尺度的分類。這套分類簡明好用,直到今日仍是方法學教科書的共同語言,儘管它也遺留下不少爭議,這一點留待第二章細論。

這些人物的努力,也使計量心理學逐步取得制度上的身分。一九三五年,計量心理學會(Psychometric Society)成立;翌年,《Psychometrika》創刊,為潛在變項模型與測量理論提供了專屬的發表園地。自此,計量心理學不再只是散見各處的零星技術,而成為一門擁有共同體、專門期刊與自我認同的學科。學科化的意義不僅在於學術建制,更在於它使方法的累積、批評與傳承得以在一個共享的問題脈絡中進行。

二十世紀後半,這門學問在理論與計算兩方面同步大步前進。Lord & Novick (1968) 以嚴謹的公理重新整理了古典測驗理論,同時為項目反應理論(item response theory)鋪好道路;Rasch (1960) 則自測量哲學的立場,提出一種性質格外優美的機率模型。Jöreskog (1969) 發展出驗證性因素分析,使潛在變項的分析由「探索」邁向「驗證」,結構方程模型(structural equation modeling)亦隨之成熟。再往後,馬可夫鏈蒙地卡羅(Markov chain Monte Carlo)等計算方法帶動了貝氏取向的復興,多層次與縱貫模型日益精緻,而近十餘年資料科學與機器學習的興起,又為這門老學問注入新的張力。本書的章節順序,大體便循著這條「由測量理論,至統計建模,再到現代計算」的歷史縱深展開。

這條歷史縱深還有一條與之交纏的暗線,即計算能力的演進。許多今日習以為常的模型,在提出之初根本無法估計,只能停留於紙上。期望最大化(EM)演算法使含潛在變項的最大概似估計成為可行,馬可夫鏈蒙地卡羅則讓複雜的貝氏模型得以實作,而個人電腦與專用軟體的普及,更把因素分析、結構方程與項目反應理論由少數專家的手藝,轉化為一般研究者的日常工具。方法的歷史,因此從來不只是觀念的歷史,也是「何者在當時算得動」的歷史。本書在第十二、十七、二十與三十三章談到估計時,會反覆觸及這條暗線。

計量心理學與它的鄰居:統計、研究方法與資料科學

計量心理學並非一座孤島,它恰好座落於統計學、研究方法學與資料科學的交會之處。這個位置帶來一種常見的困惑:修過多變量統計的學生會覺得因素分析看來不過是主成分分析的變形,熟悉機器學習的工程師會覺得潛在變項只是降維之後的特徵,而以實驗為主的研究者則可能認為測量無非就是「挑一份信效度看起來不錯的量表」。這三種印象都各自對了一部分,卻也都漏掉了同一件事,即構念的意義是需要被論證的。

釐清計量心理學與這幾位近鄰的關係,因此不只是學科定位的形式問題,而是一個實質問題:這門學問究竟提供了什麼,是其他領域不提供的。以下依序檢視三位近鄰,並說明本書為何在潛在變項模型之外,還要花相當篇幅處理統計推論與研究設計。

先論統計學。計量心理學既是統計方法的重度使用者,也是統計理論的重要貢獻者。因素分析、項目反應理論與結構方程模型,其實都是先在心理計量的問題脈絡中孕育,其後才被其他領域借用。那麼,統計學為何沒有將它整體吸納?關鍵在於,計量心理學始終聚焦於一件事:潛在構念的測量。這使它的模型帶著清楚的實質意義,而不只是壓縮或化簡資料的工具。同一個估計式,在統計學家眼中可能只是一種正定矩陣的分解,在心理計量學家眼中卻對應著「一個構念如何投射到若干指標」的實質主張。

再論研究方法學。測量與研究設計(research design),是「有效推論」的兩根支柱。設計決定了研究者能否談因果,測量則決定了手中的變項究竟是否具有意義。一項設計嚴謹卻採用了拙劣量表的研究,其結論同樣不足採信;反之亦然。正因如此,本書除潛在變項模型之外,亦專闢數章討論抽樣、檢定力、缺失資料與因果推論這些設計層面的議題,使測量與設計得以在同一部書中對話。

最後,也是最新、張力最強的近鄰,是資料科學與機器學習。這股力量帶來了海量的行為資料,以及一整套強調「預測」的演算法工具;然而它內在的知識觀,與計量心理學並不完全一致。當機器學習全力追求預測的準確時,構念的意義、模型的可解釋性、測量的效度,都可能被置於次要的位置。這種張力其實由來已久,早在 Cronbach (1957) 對心理學「兩種學術傳統」的著名剖析中便已見端倪。在預測掛帥的時代,如何守住測量的核心地位,是貫穿全書、並將於最後一章再度回收的根本問題。

綜觀這三位近鄰可以發現,計量心理學之所以未被任何一方吞併,關鍵始終在於它對「構念意義」的堅持。統計學可以不問一個因素究竟代表什麼,只要矩陣分解在數學上成立即可;資料科學可以不問特徵對應何種心理歷程,只要預測夠準即可。計量心理學卻拒絕擱置這個問題:它要問的不只是「模型合不合資料」,更是「這個潛在變項究竟是不是我們宣稱在測的那個東西」。這份堅持有時顯得緩慢而挑剔,卻正是它在方法快速更迭的年代裡仍不可被取代的理由。

兩種知識文化:解釋與預測

欲理解當代計量心理學內部的張力,Breiman (2001) 對統計建模「兩種文化」的區分是一把好用的鑰匙。第一種文化假設資料背後存在一個真實而有意義的生成機制,研究的目標是以模型逼近並解釋此一機制;第二種文化則將生成機制視為看不透的黑箱,只在意一件事:模型的預測是否準確。將這一區分移植到心理計量,前者對應以潛在變項為核心的解釋取向,後者對應以預測為核心的演算法取向。

這兩種取向在許多面向上形成對照。解釋取向在意建構效度、參數的可解釋性,以及理論能否被檢驗;其模型通常是生成式的,評鑑的重心落在模型與資料的結構是否契合。預測取向在意的則是模型面對「未曾見過的新資料」時的表現;它可以容忍、甚至擁抱複雜到無從解釋的模型,其裁判標準是交叉驗證下的預測誤差。舉例而言,一個以十個人格題項預測離職行為的問題,解釋取向會問「這些題項測到的是哪個構念、該構念是否真的驅動離職」,預測取向則直接問「這個模型在新員工樣本上的命中率有多高」;兩者未必給出相同的變項權重,因為它們最佳化的根本不是同一個目標。Yarkoni & Westfall (2017) 即指出,心理學長期偏重解釋而相對忽略預測,導致許多號稱「具解釋力」的模型一旦換至新樣本便原形畢露;他們主張引進機器學習講究樣本外驗證的紀律,以矯正此一積習。

這兩種文化的分歧,在模型評鑑的層次上表現得最為具體。解釋取向多以「模型與手中資料的契合程度」為評鑑依據,例如共變數結構模型的適配指標,衡量的是模型隱含的共變數矩陣與樣本共變數矩陣有多接近;此類指標算得的是樣本內(in-sample)的表現。預測取向則堅持以「模型在未參與估計的資料上的誤差」為準,也就是樣本外(out-of-sample)的表現,其標準工具是交叉驗證。兩者的差異絕非細枝末節:一個對手中資料契合得近乎完美的模型,完全可能在新資料上潰不成軍,這正是過度適配(overfitting)的核心教訓。本書第十二章將把樣本內適配與樣本外驗證並置討論,第三十四章則進一步說明,為何在高維度與強調預測的情境下,樣本外評估幾乎是唯一誠實的裁判。

尚須補充的是,解釋與預測並未窮盡科學的全部目標;描述(description)同樣是一項正當而常被低估的任務。當研究者對一個現象尚無成熟理論、也無明確的預測需求時,如實地刻畫它的分布、結構與變異,本身即是有價值的科學工作,探索性因素分析與許多潛在類別的應用正屬此類。耐人尋味的是,無論目標是描述、解釋或預測,測量都同樣是先決條件:去描述一個測不準的東西,得到的只是雜訊的形狀。這再度印證本書的核心信念,測量是這三者共同的地基。

本書的立場並非在兩種文化之間選邊,而是主張二者互補而非互斥。預測與解釋回答的是不同的科學問題,各有其適用場合與評鑑標準。更關鍵的是,無論偏向何者,測量都無可迴避:一個無法被妥善測量的構念,既不能被可靠地預測,也不能被清楚地解釋。正是基於這一認識,本書刻意採取「廣度平衡」的寫法,既深入潛在變項的測量模型,也認真對待統計推論、因果設計與資料科學的預測工具,並在全書結尾,將兩者的關係放進再現性與開放科學的脈絡中重新檢視。

本書的地圖:七個環節、八個部分

現在把整本書攤開檢視。全書三十六章,循著一條清楚的主線推進,這條主線可濃縮為七個環節,一環扣一環地層層堆疊:測量的基礎、統計方法的工具、潛在變項的建模、測驗發展與應用、相依與變化的建模、因果與研究整合,以及最後的計算取向與學科未來。這七個環節,對應於八個部分;每一部分,本書都將同時交代它的歷史來龍去脈,與當前最前沿的爭論。

第一部「基礎與歷史」先立起測量的問題意識與哲學根基,涵蓋讀者正在閱讀的本章,以及次章的測量史與哲學。第二部「測量基礎:量尺化與古典測驗理論」是本書刻意加厚的一塊:它先講清楚構念、尺度與反映性測量(第三章),接著補上一段長期被教科書略過的根基,也就是心理量尺化(第四章),從比較判斷、態度量尺一路談到多向度量尺法,隨後才進入古典測驗理論、信度與效度。將量尺化獨立成章,是為了恢復心理計量「量刺激」與「量人」兩個源頭的完整敘事,使測量不致被窄化為測驗。

第三部「統計推論與研究設計的方法基礎」是全書的工具箱,涵蓋統計推論的邏輯與爭議、抽樣與檢定力、實驗設計與變異數分析、迴歸與廣義線性模型、模型估計與適配,以及缺失資料。相較於過往的安排,本書在推論與迴歸之間補入了實驗設計與變異數分析一章(第十章),把心理學「第二紀律」的方法史與工具接回主線。將這些處處都會用到的工具置於前段,是為了讓讀者在進入後段高負荷的潛在變項模型之前,先備妥共通的語言與符號。

第四部「潛在變項測量模型」是全書篇幅最重的核心,依序展開探索性與驗證性因素分析、結構方程模型、項目反應理論及其進階模型、測量不變性與差異試題功能、潛在類別與混合模型,以及認知診斷模型。第五部「測驗發展、應用與社會脈絡」是本書著力最深的新增區塊,它把前面累積的測量理論,收束為一具完整的測驗生命週期:從測驗編製(第二十二章),到量尺化與等化(第二十三章)、電腦化適性測驗(第二十四章),再到問卷設計與作答行為(第二十五章)、評分者效果與實作評量(第二十六章),最終抵達測驗公平性與測驗使用的社會脈絡(第二十七章)。這一部是全書中,心理計量與真實世界貼得最近之處。

第六部「相依資料與變化的建模」處理巢狀資料(例如學生層層隸屬於不同班級)與隨時間變化的建模,涵蓋多層次模型、成長模型,以及當代方興未艾的密集縱貫與動態模型。第七部「因果推論與研究整合」把推論拉高到兩個層次:既問單一研究如何從關聯走向因果(第三十一章),也問眾多研究如何被後設分析整合為累積的證據(第三十二章)。第八部「計算取向與學科的未來」收束全書,涵蓋貝氏取向、機器學習與網絡心理計量,最終以開放科學與再現性作結,回應本章所提出的學科定位問題,並與全書最後一章首尾呼應。

相較於較早的架構,本書特別織入三條新線,皆為使「測量」這條主線更為完整而設。第一條是量尺化傳統(第四章),它把測量的根基由測驗回推到更早的判斷與偏好量尺化,提醒讀者測量的野心從一開始便不限於為人打分數。第二條是測驗生命週期(第五部),測量理論唯有走完編製、等化、施測、作答、評分、公平使用這一整套流程,才真正落地為社會所用,這一部因而是測量取向最貼近實務的展現。第三條是研究整合(第三十二章),它把推論的單位由單一研究擴展到整個文獻,正是測量與研究方法在累積科學這一層次上的交會。這三條線也各自映照著測量取向與預測取向的張力:量尺化與測驗生命週期,深化了以構念意義為核心的測量傳統;而後設分析則提醒人們,任何單一研究的預測或解釋,都必須放進更大的證據脈絡中,才能被公允地評價。

這一順序背後自有一套邏輯,其要旨在於各部分彼此相扣,而非各自為政。第三部建立的估計與適配原理,是第四、第五、第六部一切建模的共同地基;第四部確立的測量不變性,是能夠跨群體、跨時間比較的前提;而第二部所談的效度問題,將於第五部討論測驗使用、以及第八部討論測量再現性時再度浮現。因此,本書較近於一座螺旋向上的樓梯,而非一排彼此獨立的房間:同一組核心問題,諸如「如何將訊號與誤差分離」「模型與資料究竟是否契合」「在何種條件下兩個分數才能比較」,會在不同的抽象層次上反覆現身,一次比一次深入。

值得說明的是本書在取材上的一項刻意選擇:廣度平衡。計量心理學的當代面貌,至少橫跨五個面向,即測量理論、統計建模、研究設計、測驗發展與應用,以及資料科學;許多同類專書會擇一深耕,例如專論因素分析與結構方程,或專論項目反應理論。本書則選擇讓五個面向都獲得實質篇幅。這一選擇並非出於面面俱到的野心,而是基於一個判斷:這幾者在真實研究中本就彼此糾纏,一個只懂潛在變項模型卻不解抽樣與檢定力的研究者,或一個精於預測演算法卻對效度無感的分析者,都容易在自己看不見的地方犯錯。將它們置於同一部書中對話,正是為了讓這些盲點無所遁形。

每一部分的前沿專欄,都會落實「區分已確立、爭議中與推測性」的原則。舉其大者:第二部將處理 Cronbach’s alpha 是否早該被 omega 係數取代的爭論;第四部將檢視驗證性因素分析中適配指標「黃金門檻」的僵化;第六部將面對交叉延宕模型能否支撐因果宣稱的質疑;第八部則將追問網絡模型是否構成潛在變項模型的替代本體論,以及在大型語言模型興起之後,心理計量測量的邊界將如何被重新界定。這些議題有的已近共識,有的仍在激烈交鋒,有的不過是初步的推測;本書的責任,是把它們各自的成熟度標示清楚,而非一概當作定論陳述。

怎麼讀這本書

本書設定的讀者橫跨高年級大學生、研究生,以及對計量心理學感興趣的實務工作者,各人的數理背景與閱讀目的不盡相同。為兼顧不同讀者,本書在編排上採取分層設計。正文以概念、直覺與歷史脈絡為主,力求即使略過技術細節,讀者亦能掌握每個方法的重點與意義;完整的數學推導則收入獨立的「推導方塊」,留待有意深入者取用。此一安排呼應通用學習設計(Universal Design for Learning)所強調的多元表徵原則:同一主題可經由概念、公式、圖示等不同層次來理解,而不必為了易懂而犧牲嚴謹。此外,每章結尾均設一個前沿專欄,標示該主題近年最重要的爭論,並明確區分哪些已有定論、哪些仍在爭議、哪些僅屬初步的推測,以免讀者將尚未定案的看法誤認為領域的共識。

依此設計,不同背景的讀者可循不同路徑。第一條是測量與測驗發展路徑,適合以測驗與量表為主要工作對象的讀者:先讀第一至七章,打好測量與量尺化的地基,再直接銜接第十七至二十七章,把項目反應理論一路延伸到測驗編製、等化、適性測驗、作答行為、評分與公平使用,看測量理論如何落實為一整套測驗實務。第二條是統計建模路徑,適合以資料分析與建模為重心的讀者:以第八至十六章建立推論、設計、迴歸與潛在變項建模的骨幹,再進入第二十八至三十三章的多層次、縱貫、因果與貝氏方法。第三條是資料科學讀者路徑,適合自機器學習背景進入的讀者:可先自第一、三、八、十二章與第三十四至三十六章起步,掌握構念、推論、模型評鑑與計算取向的全景,再回頭補讀潛在變項與測量的各章,補足預測導向訓練中最容易缺席的測量素養。無論循哪一條路徑,每章均附獨立的參考文獻,可作為該主題的入門書單。

最後須說明本書的一項刻意取捨:本書不設傳統的習題、問答或作業。此舉的用意,是引導讀者對計量心理學的實質內容與研究發展脈絡建立一定深度的理解,而非熟練某套軟體的操作步驟。凡涉及分析實務之處,本書皆以敘述方式說明分析決策背後的邏輯與常見的陷阱,而不提供逐步的操作指南。這並不表示實作不重要,而是認為:一旦掌握了決策背後的道理,操作細節自可於各家軟體的說明文件中查得;反之,若只會按鍵而不明其理,再詳盡的步驟清單也無法防止誤用。

關於符號與術語,本書亦立下若干一貫的約定,以利跨章閱讀。全書採用統一的符號系統:以希臘字母(如 \eta、\lambda、\theta)表示潛在變項與模型參數,以拉丁字母(如 x、y)表示觀測變項,向量與矩陣則以粗體標示。專有名詞於首次出現時,在括號內保留英文原文,例如潛在構念(latent construct),以便讀者與國際文獻對照。書末另附符號表與中英術語索引,供隨時查考。這些約定看似瑣碎,卻是使全書得以作為一個整體、而非三十六篇各自獨立論文的黏著劑。

我們站在哪裡:再現性危機與資料科學時代

任何一本試圖反映當代面貌的計量心理學專書,都無法迴避近十餘年來重塑整個心理科學的兩股力量。這兩股力量的方向乍看相反:一股要求研究者更為謹慎,凡事講求可重複與可驗證;另一股則帶來規模空前的資料與運算能力,鼓勵研究者放手嘗試。然而兩者卻在同一個地方交會,那就是測量。前者暴露了心理學對測量品質的長期輕忽,後者則逼問測量在預測導向的方法中還剩下什麼位置。本節依序處理這兩股力量,並說明本書為何主張它們非但沒有削弱、反而抬高了測量的重要性。

第一股是再現性危機(replication crisis)。Open Science Collaboration (2015) 大規模重做了一百項心理學研究,結果發現能成功重現原始結論的比例,遠低於原先的普遍預期。這一發現逼出了一場深刻的反省。值得強調的是,這場危機並不僅是「顯著性檢定遭到濫用」的問題,它還揭開了一個長期被忽略的角落,也就是測量。Flake & Fried (2020) 直言,心理學中大量賴以立論的量表,其效度往往從未被認真建立,研究者選用測量工具時經常相當隨意。由這一角度觀之,再現性危機在很大程度上,其實也是一場測量的危機。

第二股力量是資料科學與機器學習的崛起。它為心理學帶來前所未有的行為大數據與強大的預測工具,卻也對「潛在變項測量」的核心地位提出根本質疑:既然演算法可以在完全不假設任何構念的情況下,把預測做得相當準確,那麼傳統的測量取向是否還有必要?Borsboom (2006) 早已感嘆,心理計量學這些年來的重要進展,並未真正滲透到日常研究的實作之中;在資料科學方法快速普及的今日,這道鴻溝所帶來的風險更被放大,因為缺乏測量素養的預測建模,極易在時髦方法的外表下,重蹈「效度不明」的覆轍。

本書的基本主張是:上述兩股力量非但未使計量心理學變得可有可無,反而令它比過去任何時候都更為關鍵。再現性危機的病根之一在於測量,而資料科學的預測轉向也擺脫不了對「有效測量」的依賴。理解構念如何被測量、模型如何被估計與評鑑、兩個分數在何種條件下才可比較,正是穿越這雙重挑戰時不可或缺的基本功。本書其後各章,即是對這些問題的系統回答。

結語:測量作為主角

若以一句話總括本章:測量不是研究的配角,而是主角之一。往下閱讀,讀者將看見這門學問如何一步步將「為看不見的對象賦予數字」這件事,做得既嚴謹又有意義。而在全書諸多章節之中,第五部尤其值得留意,那是心理計量與社會相遇之處:一份測驗一旦離開研究室、走進升學、甄選與臨床的現場,測量上每一個看似技術性的選擇,便都牽動著真實的人與真實的後果。期望讀者讀畢全書,不只學會一批方法,更能看懂這門學科的實質內容,以及它一路走來的思想脈絡。下一章,本書便從頭說起,回到這一切的歷史與哲學源頭。

參考文獻

Borsboom, D. (2006). The attack of the psychometricians. Psychometrika, 71(3), 425–440. https://doi.org/10.1007/s11336-006-1447-6
Breiman, L. (2001). Statistical modeling: The two cultures. Statistical Science, 16(3), 199–231. https://doi.org/10.1214/ss/1009213726
Cronbach, L. J. (1957). The two disciplines of scientific psychology. American Psychologist, 12(11), 671–684. https://doi.org/10.1037/h0043943
Cronbach, L. J., & Meehl, P. E. (1955). Construct validity in psychological tests. Psychological Bulletin, 52(4), 281–302. https://doi.org/10.1037/h0040957
Fechner, G. T. (1860). Elemente der Psychophysik. Breitkopf und Härtel.
Flake, J. K., & Fried, E. I. (2020). Measurement schmeasurement: Questionable measurement practices and how to avoid them. Advances in Methods and Practices in Psychological Science, 3(4), 456–465. https://doi.org/10.1177/2515245920952393
Galton, F. (1889). Natural inheritance. Macmillan.
Jones, L. V., & Thissen, D. (2007). A history and overview of psychometrics. In C. R. Rao & S. Sinharay (Eds.), Handbook of statistics, volume 26: psychometrics (pp. 1–27). Elsevier. https://doi.org/10.1016/S0169-7161(06)26001-2
Jöreskog, K. G. (1969). A general approach to confirmatory maximum likelihood factor analysis. Psychometrika, 34(2), 183–202. https://doi.org/10.1007/bf02289343
Lord, F. M., & Novick, M. R. (1968). Statistical theories of mental test scores. Addison-Wesley.
Michell, J. (1999). Measurement in psychology: Critical history of a methodological concept. Cambridge University Press.
Open Science Collaboration. (2015). Estimating the reproducibility of psychological science. Science, 349(6251), aac4716. https://doi.org/10.1126/science.aac4716
Rasch, G. (1960). Probabilistic models for some intelligence and attainment tests. Danish Institute for Educational Research.
Spearman, C. (1904a). “General intelligence,” objectively determined and measured. The American Journal of Psychology, 15(2), 201–292. https://doi.org/10.2307/1412107
Spearman, C. (1904b). The proof and measurement of association between two things. The American Journal of Psychology, 15(1), 72–101. https://doi.org/10.2307/1412159
Stevens, S. S. (1946). On the theory of scales of measurement. Science, 103(2684), 677–680. https://doi.org/10.1126/science.103.2684.677
Thurstone, L. L. (1927). A law of comparative judgment. Psychological Review, 34(4), 273–286. https://doi.org/10.1037/h0070288
Yarkoni, T., & Westfall, J. (2017). Choosing prediction over explanation in psychology: Lessons from machine learning. Perspectives on Psychological Science, 12(6), 1100–1122. https://doi.org/10.1177/1745691617693393
本章引用格式游琇婷(2026)。導論:本書地圖與計量心理學的知識架構。《計量心理學:測量、模型與推論》(第 1 章)。