第 2 章 心理測量的歷史與哲學基礎
第一部 基礎與歷史
02Chapter

心理測量的歷史與哲學基礎

「心理的東西,真的能夠被『測量』嗎?」這個問題乍聽像是哲學研討課上的思辨,實則糾纏了心理學一個多世紀,至今仍無真正的定論。更值得警惕的是,研究者每天使用的量表、每天計算的平均數,背後其實都已悄悄預設了某個答案,只是多數人從未回頭檢查那個預設是否成立。本章的任務,是回到問題發生的現場,考察心理測量這門學問如何一步步成形,又背負了哪些未被言明的哲學包袱。敘事的主軸並非年代,而是一個反覆現身的難題:當被量度的對象根本無法直接觀察時,「賦予它一個數字」的正當性,究竟從何而來?

這條難題會以三種面貌貫穿全章。其一是技術問題:用什麼程序,才能由外顯反應推得內在量值。其二是哲學問題:這樣得到的數字,在什麼意義下算是「測量」,而非任意的編碼。其三是歷史問題:為什麼某些便宜行事的答案能夠廣泛流通,而更嚴謹的替代方案卻長期被束之高閣。三者交織,構成心理計量學一段既輝煌又充滿未決張力的思想史。

心理物理學:第一次把感覺變成數字

十九世紀中葉以前,「心理現象能否被科學地測量」仍是一個懸而未決的大問號。第一個認真給出肯定答案的,是 Fechner 的心理物理學(psychophysics)。其起點是 Weber 的一項觀察:欲使人察覺兩個刺激之間的差別,兩者的差距必須達到一個與原刺激強度成比例的最小量。舉一個日常的例子:手持一百公克之物,大約須再增加兩公克才感覺得出變重;但若原本已持有兩百公克,則可能須增至四公克方能察覺。差異閾與原刺激的比值大致固定,此即 Weber 定律,可寫為 \Delta I / I = k。 Fechner (1860) 在這條經驗規律之上加入了關鍵的一步。下面的推導方塊呈現他如何由 Weber 定律,推得感覺與刺激之間的對數關係。

推導方塊由 Weber 定律到 Fechner 定律

Weber 定律指出,恰可察覺差異(just noticeable difference, JND)與刺激強度成正比:

\Delta I = k\,I .

Fechner 增添一項心理學假設:每一個 JND 對應等量的感覺增量 \Delta S,即 \Delta S = c(常數)。將感覺的微小增量與刺激的相對增量相聯繫,得

dS = c\,\frac{dI}{I}.

兩邊積分,即得感覺強度 S 與刺激強度 I 的對數關係:

S = c\,\ln I + \text{常數} = k\log I + \text{常數}.

此式的意義不在其具體形式,而在其存在本身:它是人類史上第一次,以一條數學式將一個物理量與一個心理量連結起來。它同時也埋下一個伏筆:由「等量 JND 對應等量感覺」這一步,Fechner 已然假設了感覺具有可累加的等距結構,而這正是本章後半要嚴格檢視的量化預設。

推導的結論固然重要,其更深遠的意義卻在於它證明了一件事:心理量的數學化,原則上可行。這一步跨得有多大,值得用具體數字讀一遍。設想手中先持一百公克的砝碼,若 Weber 常數為 0.02,則須加到約一百零二公克才剛好察覺變重;由此再往上,下一個察覺點約在一百零四公克,再下一個約在一百零六公克。物理上的增量一次比一次大,Fechner 卻假設這三步在感覺上一樣大。這個「等量 JND 對應等量感覺」的假定並不能由 Weber 定律導出,而是額外添上的心理學命題;整條對數定律的等距意涵,全繫於這個無法直接查驗的假定之上。

Fechner 同時遺留了一整套方法。既然感覺本身無法直接讀取,他便設計出各種心理物理程序,以受試者可觀察的判斷(例如「這兩者一樣重嗎」)去反推無法觀察的感覺,包括極限法(method of limits)、恆定刺激法(method of constant stimuli)與調整法(method of adjustment)。這套「以外顯反應回推內在狀態」的思路,成為心理測量此後無法擺脫的胎記,也就是它的間接性。與拿尺量長度不同,心理測量永遠隔著一層,必須仰賴一組「反應如何反映屬性」的假設方能成立,而這組假設隨時可能出錯。此一間接性,是貫穿全書的伏筆。

心理物理學的故事還有一段耐人尋味的後續,它預告了本章反覆出現的主題:測量的定律很少是最終定論。將近一個世紀之後,Stevens (1957) 以量值估計(magnitude estimation)的實驗主張,Fechner 的對數定律並不適用於多數感官連續體,取而代之的是一條冪次定律 S = kI^{n},其中指數 n 隨感官通道而異,由響度的約 0.3 到電擊的約 3.5 不等。冪次定律的核心主張是「等刺激比造成等主觀比」,這與對數定律的「等刺激比造成等主觀差」形成鮮明對照。此處的反諷在於:正是這位 Stevens,一面以冪次定律推翻了 Fechner 對心理物理定律的表述,另一面又以四種尺度的分類,替一種極為寬鬆的測量觀鋪好了路;本章稍後便將回到後者。無論對數定律與冪次定律孰是孰非,這場延續百年的爭論本身已充分說明,即便在心理物理學這個心理測量最「硬」的角落,測量所依附的假設也遠比表面看來脆弱。

心理物理學的間接性難題,在二十世紀中葉獲得了一個影響深遠的處理,即訊號偵測論(signal detection theory, SDT)。傳統的閾限概念假設存在一個固定的感覺門檻,低於門檻即偵測不到;然而 Green & Swets (1966) 指出,受試者是否回報「偵測到」,同時取決於其感官敏銳度與其決策標準,也就是寧可錯報還是寧可漏報的傾向。訊號偵測論以兩個彼此獨立的參數,即敏感度與判準,將這兩者分離開來,使「感官能力」與「反應偏好」不再糾纏於單一的閾限之中;至於這兩個參數(敏感度 d' 與以 ROC 曲線刻畫的判準)的形式化,因其已屬判斷量尺化的技術核心,本書留待第四章與其他量尺化模型一併處理,此處僅點出其哲學意涵。而這一意涵超越了心理物理學本身:它示範了一件將在全書反覆出現的事,即觀察到的反應往往同時承載了研究者真正關心的量與一層與之無關的歷程,而良好測量模型的職責,正是把二者拆開。項目反應理論對「能力」與「試題難度」的分離(第十七章),與訊號偵測論對敏感度與判準的分離,可謂同一測量理想的不同體現。

Galton 與相關的誕生:把焦點轉向「差異」

若說 Fechner 關切的是「人類共通的感覺法則」,那麼 Galton 感興趣的,則是「人與人之間的差異」。這一轉向本身即是一項深刻的選擇:它使「變異」而非「平均」,成為心理測量的主角。在感覺法則的框架下,個體之間的落差只是待消除的雜訊;一旦焦點移到差異本身,這些落差便升格為研究的對象,而描述落差需要一套全新的統計語言。Galton (1889) 設立了人體測量實驗室,大量蒐集反應時間、感官敏銳度、握力等資料,意圖以這些簡單指標估計一個人的智力。這一節要交代的,正是這套語言如何被造出來,以及它從一開始就夾帶了什麼。

就結論而言,這條路徑後來被證明成效有限:簡單的感官指標與複雜的智力之間,關聯其實相當微弱。這項失敗本身即是一堂早期的效度課,提醒人們「量得到」不等於「量對了」,此一區別將於第七章展開為構念效度的完整討論。然而 Galton 真正的遺產在於方法。為了描述兩個變項如何共同變動,他發展出相關與迴歸的雛形,並在遺傳資料中發現了「向平均迴歸」(regression toward the mean)的現象;其後 Pearson 將相關打磨為今日熟知的積差相關係數,而這一支由 Galton 經 Pearson 至 Fisher 的生物統計傳統,日後更長成整個推論統計的骨幹。自此,「變異」與「共變」成為心理測量的核心語言,第十一章的迴歸與第十四章的因素分析,皆是這一語言的直系後裔。

此處亦須誠實補上一筆:Galton 的個別差異研究,與優生學(eugenics)的意識形態糾纏甚深,這段背景不應被美化。事實上,「相關」這一工具的發展動機之一,正是為了量化親代與子代之間性狀的「遺傳」強度,以服務其優生主張。指出這一點,並非為了抹煞相關與迴歸的科學價值,而是提醒一件不容迴避的事:測量工具的發展從來不是價值中立的,「要測什麼、又如何解讀量到的差異」,往往早已夾帶了測量者的立場與時代的偏見。當代對測驗公平性與差異試題功能的關切(第十九章),可謂這一自省的制度化延續。至此,心理物理學的量化傳統與個別差異的統計傳統匯流,共同撐起了計量心理學的兩個源頭(關於這段實驗心理學的整體背景,參見 (Boring, 1929))。

由 Galton 開啟的個別差異傳統,很快分出兩條走向迥異的支流。一條由 Cattell 承接,他提出「心智測驗」(mental test)一詞,並沿用 Galton 的思路,以反應時間、感覺辨別等基本歷程作為智力指標 (Cattell, 1890);這條路徑與 Galton 同病相憐,終究因基本歷程與複雜認知的關聯薄弱而受挫。另一條則由 Binet 開創,帶來決定性的轉向。Binet & Simon (1905) 為鑑別學習困難的兒童,捨棄基本感官歷程,改以判斷、推理、記憶等較複雜的作業編製量表,並引入心理年齡(mental age)的概念,使不同年齡兒童的表現得以在同一把尺上比較。Binet 的成功不僅奠定了現代智力測驗的形式,更確立了一項至今仍具指導性的測量策略:與其糾結於構念的終極定義,不如以一組能有效區辨個體、並與實際結果相關的作業將它操作化。這條實用主義路線,是第二十二章測驗編製方法學的直接源頭,也與本章稍後討論的操作論在氣質上遙相呼應。

Spearman:潛在構念與測量誤差同時登場

真正使計量心理學成形的關鍵人物是 Spearman。他在一九○四年的研究中,一舉點燃了兩條研究火線,而這兩條火線至今仍在燃燒。第一條是因素分析。他注意到各種認知測驗的分數彼此皆呈正相關,遂提出:以一個「一般智力」因素(記作 g)搭配各測驗的特殊因素,即可解釋這一整片相關。在此構想中,可觀察的測驗分數被視為不可觀察的共同因素的表現,這正是「潛在構念導致觀察分數」此一反映性測量觀的原型 (Spearman, 1904a)。

Spearman 的雙因素理論並非僅止於直覺。他提出以四差分(tetrad difference)作為可檢驗的判準:若一組測驗確實由單一共同因素所支配,則對任意四個測驗,其相關係數應滿足

r_{ac}\,r_{bd} - r_{ad}\,r_{bc} = 0 .

式中的 a、b、c、d 指任意四個測驗,r_{ac} 即測驗 a 與測驗 c 的相關係數。這條等式的直覺並不難懂:若每個測驗的分數都只是 g 的一種帶有雜訊的展現,任兩個測驗之所以相關,便只因為兩者各自都與 g 有關,於是相關可拆成兩個負荷的乘積,交叉相乘之後恰好抵消。四差分為零,即為單一因素結構在資料上留下的可觀察印記。此一判準的重要性在於,它把「背後是否只有一個共同因素」由玄想化為可用資料檢驗的命題,堪稱後世驗證性因素分析(第十五章)與模型適配檢驗(第十二章)的遙遠先聲。

第二條火線是測量誤差。Spearman 發現測量本身的不準確會使觀察到的相關被系統性地低估,並提出了衰減校正(correction for attenuation)之法 (Spearman, 1904b);信度的概念即由此萌芽,並將於第五、六章展開為完整的形式理論。

Spearman 之後,「測量」的意義為之一變。它不再僅是「給出一個分數」,而是一整套工程:一面由可觀察的指標推論不可觀察的構念,一面估計「此一推論究竟有多可靠」。這一雙重任務,正是第五章古典測驗理論與第七章效度理論所要處理的核心。可以說,現代心理計量的骨架,早在一九○四年便已具備雛形。

g 因素的解釋自誕生之初便面對有力的競爭者。Thomson (1939) 提出取樣理論(sampling theory)或稱鍵結模型(bonds model)主張:測驗間的普遍正相關,未必源於單一的一般智力,也可能來自大量彼此重疊的微小心智「鍵結」被不同測驗隨機抽取所致。在此觀點下,g 是一種統計上的湧現,而非實體性的共同原因。取樣理論與雙因素理論在數理上可導出相近的相關結構,這使得「g 究竟是實體還是假象」難以僅憑相關資料裁決。這場自二十世紀初便懸而未決的本體論爭議,在當代以網絡心理計量的互利論(mutualism)重新登場(第三十五章),提醒人們:因素模型雖然主導了心理測量,卻從來不是唯一可能的世界觀。

Thurstone:連態度都能量

Fechner 為感覺立了尺,Thurstone 的抱負更大:他要為態度、偏好這些看似高度主觀的對象,同樣打造一把等距的尺。這件事初聽近乎不可能:態度背後沒有可供對照的物理刺激,也沒有任何現成的外在單位可以借用。其核心工具是比較判斷律(law of comparative judgment;(Thurstone, 1927))。這條定律的精妙之處在於,它只要求受試者做最簡單的排序判斷,例如「這兩項政策,何者較受支持」,然後由「多數人判定甲勝過乙」的比例,反推甲、乙在心理連續體上相距多遠。

其背後的設定饒富巧思:每一刺激在心理連續體上所引發的判斷值並非固定,而是一個服從常態分布的隨機變量,稱為判別歷程(discriminal process)。兩個刺激的尺度值相距越遠,其中一者在比較中被判為勝出的機率便越高;反過來,由觀察到的勝出比例,便能反推兩者在連續體上相距多遠。這一構想的漂亮之處在於,它由純粹「誰勝於誰」的次序資訊,變出了一把帶有距離意義的等距尺,彷彿無中生有。至於如何由勝出比例精確地算出尺度值,也就是比較判斷律及其最常用的 Case V 簡化的完整推導,因屬量尺化的技術核心,本書安排於下一章專門處理,本章著眼的是這套思路在測量史上的份量。就這層意義而言,比較判斷律是一種早期的機率化測量模型,與第十七章的項目反應理論在精神上一脈相承:兩者都由帶有機率的二元反應,回推一把潛在的連續尺。

Thurstone 由此喊出那句名言:「態度是可以被測量的」(Thurstone, 1928),象徵心理測量的版圖由感官正式擴張至社會態度。同一時期,他也將 Spearman 的單一因素推廣為多個共同因素,發展出多因素分析與作為因素詮釋準則的「簡單結構」(simple structure),這條線索留待第十四章詳述。就本章的主題而言,Thurstone 代表一種強測量綱領:他深信心理屬性原則上可被安放於一把數學性質良好的等距尺之上。這份信念大大推進了測量技術,卻也悄然預設了一個尚未被證明的前提,也就是心理屬性確實具有等距、乃至可加的內在結構,而這個前提,正是本章後半所要檢視的靶心。至於 Thurstone 那句宣言本身,則留下了一項未竟的任務:把「態度可以被測量」由一句歷史性的口號,兌現為一套可操作、可檢驗的形式程序。這正是下一章的起點。從比較判斷、態度量尺,到選擇模型與多向度量尺法,下一章所要接手的,恰是本章在此埋下的整條量尺化線索。

Stevens:四種尺度,和一場沒吵完的架

至二十世紀中葉,爭論升級了:學界開始追問「測量」二字本身究竟意指為何。這場爭論有一個具體的引爆點。英國科學促進會(British Association for the Advancement of Science)於一九三○年代組成一個委員會,歷時將近十年,只為回答一個問題:感覺強度究竟能否算是「測量」?委員會由物理學家與心理學家共同組成,其分歧本身即富象徵意義:物理學家傾向以「可加性」作為測量的必要條件,據此質疑感覺量的可測量性;心理學家則不願放棄以數字描述感覺的既有實作。委員會爭論至最後仍未達成共識,部分成員甚至逕行否認心理量可被測量 (Ferguson et al., 1940)。正是在回應這一僵局的氛圍下,Stevens (1946) 拋出一個影響深遠、也極具爭議的操作型定義:所謂測量,即是「依照某種規則,將數字指派給物件或事件」。

在這一相當寬鬆的定義之下,Stevens 提出四種測量尺度,即名義、次序、等距與等比,並主張每一種尺度所容許的統計運算,受其結構所限。這套分類因簡明易記,很快便成為方法學教科書的共同語言。然而其代價亦不容小覷。Stevens 的定義寬鬆到幾乎「只要依規則賦予數字即算測量」,這等於抹平了「隨意指定代號」與「真正的量化」之間的根本差異,使「該屬性究竟有無數量結構」這一要害問題,被定義本身輕巧繞過。

要理解這場委員會之爭的癥結,須回到物理學家 N. R. Campbell 對測量的嚴格界定。Campbell (1920) 區分了基本測量(fundamental measurement)與導出測量(derived measurement):前者如長度、質量,其可加性可由一種實徵的串接操作(例如將兩根桿子首尾相接)直接展示;後者如密度,則由基本量經由定律導出。Campbell 的關鍵主張是,唯有能展示此種可加串接的屬性,才配稱為可被測量的量。感覺強度顯然無法首尾相接地串接,因而在 Campbell 的標準下不具備基本測量的資格,這正是委員會中物理學家一方否認心理量可測的理論根據。這個「串接」的要求,用長度與響度對照最容易看清。兩根一公尺的桿子首尾相接,量得的長度就是兩公尺,物理世界替「一加一等於二」做了實徵的背書。聲音卻不然:把兩個各自六十分貝的音源同時播放,聲能雖然加倍,讀數卻只升到約六十三分貝,而要讓人聽起來像是「兩倍響」,一般還須再提高將近十分貝。既然找不到任何操作能把兩份感覺疊起來、再核對疊出來的和,感覺量的可加性便沒有實徵的立足點。Stevens 的操作型定義,某種意義上正是對這一嚴苛標準的正面回擊:既然可加串接的要求無法滿足,索性放寬「測量」的定義,使其不再以可加性為前提。連加測量理論(見本章後文)之所以在數十年後如此重要,正因為它提供了第三條路,證明可加的等距結構未必需要實體的串接操作,而可以由次序型態間接地確立,從而在不放棄嚴謹的前提下回應了 Campbell 的挑戰。

由 Stevens 那套「何種尺度配何種統計」的容許統計(permissible statistics)主張,更引發了綿延數十年的爭論。反對者認為,能否使用某一統計量,實取決於研究問題與資料分布,未必能單憑尺度類型機械地判定。這一爭論最生動的表述,出自 Lord 那則著名的寓言:即便是球衣號碼這種純粹名義性的數字,只要問題問得恰當(例如檢驗某廠商是否偷偷發放了號碼偏小的球衣),對其求平均並施行檢定也可能是完全正當的。反對「尺度決定統計」的一方由此主張,統計程序作用於數字,而數字不知道自己來自何種尺度;尺度類型真正約束的,是統計結果的實質詮釋而非其計算的合法性。Velleman & Wilkinson (1993) 更進一步主張,Stevens 的四類尺度分類本身即具誤導性,因為資料的意義往往取決於脈絡與研究目的,而非可由尺度標籤機械地讀出;他們呼籲以資料分析的實際考量,取代對尺度類型的教條式服從。

若把這場爭論拉高一層來看,其分歧其實源於對「測量是什麼」的不同信念。Michell (1986) 便指出,容許統計之爭的三方,即表徵論、操作論與古典論,各自對尺度與統計的關係抱持不同立場,因而註定各說各話:主張尺度嚴格決定統計的一方,骨子裡預設了測量的表徵論觀點,而主張數字一律可算的一方,則多半站在操作論的立場。換言之,這並非一場單純的技術爭論,而是一場典範的衝突。

反對「尺度決定統計」,並不等於主張尺度類型無關緊要。將本質上僅具次序意義的評定資料,逕自當作等距量去計算,在許多情況下確實可能扭曲結論,例如當不同題目的心理間距明顯不等、或分布嚴重偏斜時,忽視尺度性質的代價,便會實實在在地反映在推論的偏誤上。設想一份五點的大學課程評量,選項由「非常不同意」到「非常同意」依序編為 1 至 5 分。把某門課的平均報成 4.2 分,等於已經默認由 3 分到 4 分的態度差距,恰好等於由 4 分到 5 分的差距;然而願意由「同意」再往上跨到「非常同意」的門檻,通常遠高於由「普通」跨到「同意」,尾端的一分其實比中段的一分沉重。若甲課平均 4.2 分、乙課 3.9 分,這 0.3 分之差究竟對應多大的實質差異,並不是尺度標籤本身能夠回答的。折衷的立場因而是:尺度類型不宜被奉為決定統計合法性的鐵律,卻仍是解釋結果時必須誠實面對的限制。此一爭論至今未歇。下面的推導方塊以表徵測量理論的語言,將尺度類型的形式意義講述精確,而這一形式化本身,恰恰照見了 Stevens 的定義所迴避的問題。

推導方塊尺度類型與容許轉換

表徵測量理論以「容許轉換」(admissible transformation)刻畫尺度類型。設測量為由一實徵關係結構到數值關係結構的同態映射 \phi;尺度的唯一性(uniqueness),即由所有使該表徵仍然成立的轉換所構成的群來界定:

名義尺度:\phi 在任意一對一轉換下不變,數字僅表分類,無序、距、比之意義。 次序尺度:\phi 在任意嚴格遞增(單調)轉換 x \to f(x)(f 遞增)下不變,僅保序。 等距尺度:\phi 在正仿射轉換 x \to a x + b(a>0)下不變,零點與單位皆為約定。 等比尺度:\phi 在正相似轉換 x \to a x(a>0)下不變,零點固定,僅單位可變。

一個涉及測量值的陳述,若其真偽在該尺度的容許轉換下保持不變,即稱為有意義的(meaningful)。例如「甲的長度是乙的兩倍」在等比尺度下有意義;但「今日氣溫是昨日的兩倍」在等距的攝氏尺度下卻沒有意義,因為這句話的真假會隨攝氏與華氏之間的仿射轉換而改變:攝氏 10 度與 20 度看似恰為兩倍,換算成華氏卻是 50 度與 68 度,兩倍的關係當場消失。相對地,「今日的升溫幅度是昨日的兩倍」這類關於差距之比的陳述,在兩套尺度下同樣成立,因為仿射轉換中的平移項在相減時已被消去。這一意義性判準,為「何種統計量配得上何種尺度」提供了形式基礎,惟其在實際推論中的適用邊界,至今仍有爭論。

測量到底是什麼?三種哲學立場

前述這段歷史,實則沉澱出三種對「測量是什麼」的不同回答。這三種立場聽來抽象,對研究實作卻有非常實在的後果,因為研究者對「測量本質」的理解,會直接決定其如何看待效度、如何看待誤差。三者的分歧可以歸結為同一個問題:一個數字的意義究竟由什麼來保證。是由產生它的那套操作保證,是由它與經驗結構之間的對應保證,還是由被測屬性本身的真實構造保證。讀完本節,應能說出自己在解釋一個分數時,實際上站在哪一種立場上。

第一種是操作論(operationalism)。它源自物理學家 Bridgman (1927) 的主張:一個概念的意義,即等同於用以界定並量度它的那組操作。Stevens 將這一立場帶進心理學,其最極端的版本便是「智力即智力測驗所量到的東西」。操作論的吸引力在於乾脆而可操作,代價卻極高。它將構念與指標畫上等號,因而無力處理兩種常見的混淆:同一名稱之下實為不同構念(jingle),以及不同名稱之下實為同一構念(jangle),此即第三章將詳論的 jingle-jangle 謬誤。更根本地,若測量即等同於操作,則不存在獨立於操作的「真值」,「測量誤差」這一概念亦將無處安放,而這恰與心理計量自 Spearman 以來對信度的核心關切正面衝突。換言之,操作論若貫徹到底,將取消掉整個古典測驗理論賴以立足的真分數概念。

第二種是表徵測量理論(representational measurement theory, RMT),由 Scott、Suppes 等人開創,並在 Krantz et al. (1971) 手中集其大成。它將測量定義為:由一個「實徵關係結構」到一個「數值關係結構」的同態對應。所謂同態(homomorphism),白話說就是經驗世界裡物件之間的關係,在數字世界裡原封不動地重現:若甲比乙重,指派給甲的數就必須比乙大;若甲與乙合起來恰與丙一樣重,兩數之和就必須等於丙的數。測量的正當性因此不在數字本身,而在這層對應是否忠實。而這一對應是否成立、屬於何種尺度,須由兩個定理來擔保:表徵定理證明對應存在,唯一性定理界定其尺度型態。RMT 最重要的貢獻之一是連加測量(conjoint measurement)。Luce & Tukey (1964) 證明:即使一個屬性無法像長度那樣首尾相接地疊加,只要它在兩個因素上的共同排序滿足某些公理,仍可為其建立一把等距尺。這為心理屬性的測量指出了一條既嚴謹、又能以資料檢驗的路徑,其深意在於:它把「該屬性究竟是不是量」,由一個形上學的假設,轉化為一組可被資料推翻的條件,如下面的方塊所示。

推導方塊加性連加測量的公理

設有兩個因素集合 A 與 B,於其笛卡兒積 A \times B 上定義一次序關係 \succsim。所謂加性連加測量成立,意指存在實值函數 f 與 g,使得對所有 (a,b), (a',b') \in A \times B:

(a,b) \succsim (a',b') \iff f(a) + g(b) \ge f(a') + g(b').

此一表徵成立的核心公理包括:弱序(weak order,\succsim 為完備且遞移)、獨立性(單消去,single cancellation)、Thomsen 條件(雙消去,double cancellation)、可解性(solvability)與阿基米德公理(Archimedean axiom)。這些公理的關鍵特性在於,它們全都可以由 A \times B 上觀察到的次序型態直接檢驗。連加測量的方法論意義因而是決定性的:它讓「某心理屬性是否具備可加的、等距的量化結構」,成為一個有待實徵檢驗的經驗問題,而非測量施行之前即被默認的形上學假定。第十七章的項目反應理論,在若干設定下可視為這一測量理想在機率架構中的實現。

這組公理聽來抽象,換成具體的作業便清楚許多。設想一份企業甄選用的情境判斷測驗,題目的難度由兩個因素共同決定:須同時追蹤的資訊條數(兩條、三條、四條)與作答時限(六十秒、四十五秒、三十秒),九種組合各有一個平均答對率。獨立性所要求的是:在任何一種時限之下,資訊由兩條增為三條都會使表現變差,這個方向不因時限而翻轉。Thomsen 條件要求得更強:若「四條資訊、四十五秒」與「三條資訊、六十秒」難度相當,而「三條資訊、三十秒」又與「兩條資訊、四十五秒」難度相當,則「四條資訊、三十秒」與「兩條資訊、六十秒」也必須難度相當。這些全是關於排序的敘述,不必先假定難度是量,卻能直接在資料上查核;查核通過,那把等距的尺才算是掙來的。

第三種是實在論(realism)。它主張:心理屬性若確實存在,其結構便獨立於測量程序而存在;測量是去發現這一結構,而非去指派一個結構。在此立場下,「某個心理屬性究竟是不是量」,是一個必須以證據確立的經驗問題,而非可藉寬鬆定義迴避之物。這一「屬性是否為量」的問題,即所謂量化預設(quantity assumption),也是下一節的主角。實在論與表徵測量理論精神相通,皆要求測量主張須有結構性的證成;兩者合流,構成對操作論那種便宜行事最為有力的批判。當代對此立場最系統的辯護,見於 Borsboom (2005) 對潛在變項實在性的分析,其論證亦將在第七章效度與第三章潛在變項的本體論討論中再度出現。

在操作論、表徵測量理論與實在論這三種立場之外,晚近還浮現一種以潛在變項模型為核心的測量觀,可稱為模型本位(model-based)或因果取向的測量。其核心主張是:一個測量之所以有效,在於被測屬性以因果的方式影響了指標的取值,使指標的變異可回溯至屬性的變異 (Borsboom et al., 2004)。在此觀點下,效度不再是分數與外在效標相關的統計性質,而是「屬性是否確實因果地驅動了反應」這一實質問題(第七章將深入此一重構)。模型本位的測量觀與實在論精神相通,卻更進一步:它把測量的正當性錨定在一個可被形式化、乃至可被檢驗的因果模型之上,從而將本章的哲學爭論,接引到第三章的反映性測量模型與其後的潛在變項建模。這也說明了本書何以將測量的哲學置於全書之首:後續每一個因素模型、每一條反映性方程,骨子裡都是對「數字如何獲得意義」這一古老問題的一種具體作答。

一場沒發生的革命

表徵測量理論在數學上雖然優雅,卻與心理計量的日常實作長期脫節。這一脫節,正是當代測量哲學最尖銳的一記回馬槍。Michell (1997, 1999) 直指:心理計量學犯了一項系統性的疏忽,它一路預設心理屬性為連續量(亦即接受了量化預設),卻幾乎從未認真運用連加測量之類的工具,去檢驗這一預設是否成立。在 Michell 看來,Stevens 那套操作型定義之所以在心理學如此受歡迎,恰恰因為它讓學界得以名正言順地繞過這道麻煩的檢驗。

Cliff (1992) 則以「一場沒發生的革命」(the revolution that never happened),形容表徵測量理論對實務影響之微弱。RMT 在數理上明明已臻成熟,多數應用研究者卻對它視而不見,繼續在缺乏證成的情況下,將次序性的評定資料當作等距量去加總、平均、比較。這項批評自然引來回應。辯護的一方指出,項目反應理論(第十七章)之類的現代模型,其實已隱含地在檢驗量化結構,尤其 Rasch 模型可被視為連加測量的機率化版本。Perline et al. (1979) 早已明確論證,Rasch 模型正是加性連加測量的一個特例,只是把後者的確定性公理改寫為機率形式,從而繞開了確定性版本在雜訊資料中難以套用的困境;依此觀點,每一次成功配適 Rasch 模型,某種程度上便是對可加結構的一次間接檢驗。另一方則指出,嚴格的連加測量公理在充滿雜訊的真實資料中幾乎無法乾淨地驗證,公理的違反究竟意味著屬性不可加、還是僅僅反映了測量誤差,往往難以斷定,故其否證力在實務上相當有限。

然而比起這些技術性的往返,更值得深思的其實是另一個現象:連加測量的工具早在一九六○年代便已備妥,數十年來卻鮮少有心理計量研究真正拿它來檢驗自己的量表。這份集體的沉默,本身即是一則耐人尋味的學科診斷。Michell (2008) 便以「病態科學」(pathological science)這一沉重的判語直指:當一門學科把某個關鍵假設,也就是心理屬性為可量化的量,當作理所當然地成立,卻幾乎不曾認真嘗試檢驗它、甚至連這個假設的存在都少有人意識到時,這門學科便已陷入一種系統性的自我蒙蔽。這番指控引來激烈的辯護與反駁,其對錯難有定論;但即便不接受「病態」這般嚴厲的措辭,它所點出的那份不安仍值得每一位使用量表的研究者放在心上:一個被日用了一世紀的測量假設,竟從未被它所服務的學科認真地當作一個假設來對待。

無論這些回應是否足夠有力,量化預設的爭議都戳破了一件事:心理測量的哲學地基,遠比其精密的技術外表所暗示的更為脆弱。這份脆弱不會使測量變得無用,但它要求使用者對每一次「賦予數字」背後所承擔的假設,保持清醒。這也正是為什麼本書一再強調,任何測量都是一組假設的載體:假設可能成立,也可能不成立,而分辨兩者,是方法素養的核心。

這段歷史留給我們什麼

本章所追索的這條張力,並未隨時間消散,反而換上新裝,在當代方法學中持續回響。測量不變性(measurement invariance)的檢驗,可視為在追問「同一個分數,在不同群體、不同時間點,是否仍代表同一件事」,這與本章對尺度意義的追問一脈相承(第十九章)。網絡取向(network approach)則自更根本之處,質疑「單一共同潛在原因」的本體論,主張症狀或行為之間的關聯未必來自單一的潛在共因,這一挑戰間接鬆動了量化預設所依附的因素模型框架(第三十五章),並與本章 Spearman 一節所述的取樣理論遙相呼應。而在第三十六章將討論的再現性危機中,測量效度普遍不足的問題,更把本章的哲學關切推到了整個實證體系的核心。

對實務研究者而言,本章的教訓並非要求每做一項研究都去執行一遍連加測量的公理檢驗,那既不現實,多數時候亦無必要。真正的教訓在於養成一種測量的自覺:清楚區分「依規則賦予屬性一個數字」與「證成該屬性確實是量」這兩件截然不同的事,並在解釋分數、比較平均、推論效果量之際,對自己的尺度主張究竟有多強、有多少限制,心中有數。測量哲學的價值不在於提供一套照做即可的步驟,而在於使人看清自己每一次賦值的背後,究竟承諾了什麼。

本章所立起的概念座標,將一路支撐其後的章節。第三章接著把這些哲學議題,翻譯為可供操作的構念與模型語彙,區分反映性與形成性測量,並引入潛在變項模型的類型學;第四章則承接本章的量尺化線索,把 Fechner 的心理物理量尺、Thurstone 的比較判斷、乃至訊號偵測論的決策模型,統整為一整套心理量尺化的方法;第五章方自古典測驗理論出發,把本章反覆觸及的「測量誤差」與「真值」問題,展開為完整的形式處理。歷史與哲學的回顧至此告一段落;它的目的不是懷舊,而是為後續的技術章節,準備一個始終在場的批判性參照。

參考文獻

Binet, A., & Simon, T. (1905). Méthodes nouvelles pour le diagnostic du niveau intellectuel des anormaux. L’Année Psychologique, 11, 191–244. https://doi.org/10.3406/psy.1904.3675
Boring, E. G. (1929). A history of experimental psychology. Century.
Borsboom, D. (2005). Measuring the mind: Conceptual issues in contemporary psychometrics. Cambridge University Press.
Borsboom, D., Mellenbergh, G. J., & Heerden, J. van. (2004). The concept of validity. Psychological Review, 111(4), 1061–1071. https://doi.org/10.1037/0033-295X.111.4.1061
Bridgman, P. W. (1927). The logic of modern physics. Macmillan.
Campbell, N. R. (1920). Physics: The elements. Cambridge University Press.
Cattell, J. M. (1890). Mental tests and measurements. Mind, 15(59), 373–381. https://doi.org/10.1093/mind/os-xv.59.373
Cliff, N. (1992). Abstract measurement theory and the revolution that never happened. Psychological Science, 3(3), 186–190. https://doi.org/10.1111/j.1467-9280.1992.tb00024.x
Fechner, G. T. (1860). Elemente der Psychophysik. Breitkopf und Härtel.
Ferguson, A., Myers, C. S., Bartlett, R. J., et al. (1940). Final report of the committee appointed to consider and report upon the possibility of quantitative estimates of sensory events. Report of the British Association for the Advancement of Science, 2, 331–349.
Galton, F. (1889). Natural inheritance. Macmillan.
Green, D. M., & Swets, J. A. (1966). Signal detection theory and psychophysics. John Wiley & Sons.
Krantz, D. H., Luce, R. D., Suppes, P., & Tversky, A. (1971). Foundations of measurement, volume i: Additive and polynomial representations. Academic Press.
Luce, R. D., & Tukey, J. W. (1964). Simultaneous conjoint measurement: A new type of fundamental measurement. Journal of Mathematical Psychology, 1(1), 1–27. https://doi.org/10.1016/0022-2496(64)90015-x
Michell, J. (1986). Measurement scales and statistics: A clash of paradigms. Psychological Bulletin, 100(3), 398–407. https://doi.org/10.1037/0033-2909.100.3.398
Michell, J. (1997). Quantitative science and the definition of measurement in psychology. British Journal of Psychology, 88(3), 355–383. https://doi.org/10.1111/j.2044-8295.1997.tb02641.x
Michell, J. (1999). Measurement in psychology: Critical history of a methodological concept. Cambridge University Press.
Michell, J. (2008). Is psychometrics pathological science? Measurement: Interdisciplinary Research and Perspectives, 6(1-2), 7–24. https://doi.org/10.1080/15366360802035489
Perline, R., Wright, B. D., & Wainer, H. (1979). The Rasch model as additive conjoint measurement. Applied Psychological Measurement, 3(2), 237–255. https://doi.org/10.1177/014662167900300213
Spearman, C. (1904a). “General intelligence,” objectively determined and measured. The American Journal of Psychology, 15(2), 201–292. https://doi.org/10.2307/1412107
Spearman, C. (1904b). The proof and measurement of association between two things. The American Journal of Psychology, 15(1), 72–101. https://doi.org/10.2307/1412159
Stevens, S. S. (1946). On the theory of scales of measurement. Science, 103(2684), 677–680. https://doi.org/10.1126/science.103.2684.677
Stevens, S. S. (1957). On the psychophysical law. Psychological Review, 64(3), 153–181. https://doi.org/10.1037/h0046162
Thomson, G. H. (1939). The factorial analysis of human ability. University of London Press.
Thurstone, L. L. (1927). A law of comparative judgment. Psychological Review, 34(4), 273–286. https://doi.org/10.1037/h0070288
Thurstone, L. L. (1928). Attitudes can be measured. American Journal of Sociology, 33(4), 529–554. https://doi.org/10.1086/214483
Velleman, P. F., & Wilkinson, L. (1993). Nominal, ordinal, interval, and ratio typologies are misleading. The American Statistician, 47(1), 65–72. https://doi.org/10.1080/00031305.1993.10475938
本章引用格式游琇婷(2026)。心理測量的歷史與哲學基礎。《計量心理學:測量、模型與推論》(第 2 章)。