心理量尺化:比較判斷、態度量尺與多向度量尺法
第三章末留下一條分工線:測量資料有「刺激」與「受試者」兩側,量尺化取向沿著刺激的方向抽取結構,測驗理論則沿著受試者的方向抽取結構。本章要接手的,正是那被現代教科書逐漸淡忘、卻是整個心理計量半壁江山的刺激側傳統。《Psychometrika》創刊那一代人所念茲在茲的,多半不是「如何為人打分數」,而是一個更古老也更根本的問題:如何把人們的判斷與偏好,轉譯為刺激的量尺值。若把測量窄化為測驗,這半部歷史便無處安放,而許多今日習以為常的模型,例如 logistic 反應曲線,也就失去了它真正的出生地。本章的目標,是把這條量尺化的線索完整地攤開,並沿途指出它如何一次次預告了後續各章的核心工具。
為了讓抽象的量尺化邏輯有一個具體的落腳處,全章將以一個台灣讀者再熟悉不過的情境貫穿:手搖飲的甜度。一杯珍珠奶茶可以有無糖、微糖、半糖、少糖、全糖幾個等級,而「甜度」正是一個看不見、摸不著、卻人人都有意見的心理量。本章將示範,同一批關於甜度的判斷資料,如何能以三種截然不同的量尺化邏輯去解讀:由成對比較反推一把甜度的尺(比較判斷與選擇模型)、由每個人的「最適甜度」反推其理想點(展開模型)、以及由多個品牌之間的相似遠近繪出一張知覺地圖(多向度量尺法)。一杯飲料,三種量尺化,恰好勾勒出這門傳統的三個面向。
兩種測量:量刺激與量人
在正式進入技術之前,值得先把「量刺激」與「量人」這兩件事的分野再說得透澈一些,因為整章的邏輯都繫於此。設想一張「人乘以題」的資料表,每一格記錄某人對某題的反應。測驗理論的問題意識是:把這些題目當作固定的量尺,去估計每個人落在能力或態度連續體上的位置,換言之,題目是尺、人是被量的對象。量尺化的問題意識恰好相反:把人當作一群測量儀器,藉由他們一致或分歧的判斷,去估計那些刺激本身落在某條心理連續體上的位置,此時人是尺、刺激才是被量的對象。
這一視角的翻轉並非文字遊戲。它意味著,同一批判斷資料,可以朝兩個方向被榨取出不同的訊息。以手搖飲為例,若研究者關心的是「哪一種甜度最受歡迎」「各甜度等級在主觀甜感上相距多遠」,那是把甜度等級當作刺激來量尺化;若關心的是「哪些消費者偏甜、哪些偏淡」,那才是把消費者當作受試者來測量。歷史上,Fechner 的心理物理學率先示範了量刺激的可能(第二章),而 Spearman 與 Binet 的個別差異傳統則開啟了量人的道路。這兩條源流長期分流,直到本章末所預告、並在第十七章正式登場的項目反應理論,才在 logistic 這把共同的鑰匙之下悄然匯合。
量尺化傳統的奠基者是 Thurstone。他在第二章已以思想史的身分登場,喊出「態度是可以被測量的」那句宣言;本章的任務,則是把那句歷史性的口號,兌現為一套可操作、可檢驗的形式程序。Thurstone 留下的方法遺產大致可分三支:由成對比較反推刺激尺度值的比較判斷律、由整批評定建立態度量尺的等現間距法,以及把單一因素推廣為多因素的因素分析(後者留待第十四章)。本章先自比較判斷律說起,因為它最能凸顯量尺化那近乎魔術的核心成就:由純粹的次序判斷,變出一把帶有距離意義的尺。
比較判斷律:把「比較」變成量尺
假設研究者想為手搖飲的五個甜度等級建立一把「主觀甜感」的尺。最省事、也最可靠的作法,是不去要求消費者直接說「這杯有幾分甜」(那樣的絕對判斷極不穩定),而只請他們做最簡單的兩兩比較:任取兩杯,回答「哪一杯比較甜」。Thurstone 的比較判斷律(law of comparative judgment;(Thurstone, 1927))示範了一件漂亮的事:僅憑這種「誰勝於誰」的次序資料,加上一個關於判斷如何波動的機率假設,便足以反推出五個等級在主觀甜感連續體上各自的位置,而且這把尺具有距離意義,可以說「微糖與半糖之差,大於半糖與少糖之差」。
其巧思在於為「判斷的不確定性」建模。同一杯飲料,同一個人在不同時刻嚐來,甜感未必全然一致;不同人之間更是如此。Thurstone 遂假設,每一個刺激在心理連續體上所引發的判斷值並非一個固定的點,而是一個服從常態分布的隨機變量,他稱之為判別歷程(discriminal process),其平均即為該刺激真正的尺度值,其變異則稱辨別離散度(discriminal dispersion),刻畫判斷的浮動程度。有了這層機率假設,「甲被判為比乙甜」的比例,便不再只是一個孤立的數字,而承載了甲、乙尺度值之差的訊息:兩者相距越遠,甲勝出的比例便越懸殊。下面的推導方塊,將這一直覺化為精確的公式。
設刺激 j 與 k 所引發的判別歷程分別為 D_j \sim N(\mu_j,\sigma_j^2) 與 D_k \sim N(\mu_k,\sigma_k^2),兩者相關為 \rho。受試者判定「j 比 k 更強」,當且僅當該次的判別歷程滿足 D_j > D_k,亦即差值 D_j - D_k > 0。兩常態變量之差仍為常態:
故「j 勝於 k」的機率為
其中 \Phi 為標準常態累積分布函數。在最常用的 Case V 簡化下,各判別歷程的離散度相等且互相獨立(\sigma_j=\sigma_k=\sigma,\rho=0),分母退化為 \sqrt{2}\,\sigma:
反解之,將觀察到的勝出比例代入標準常態的反函數,即得尺度值之差:
由於尺度的原點與單位皆可自由約定,通常令 \sqrt{2}\,\sigma=1、並以某一刺激為零點。至此,一整套「誰勝於誰」的次序資訊,被轉譯成了一把帶有距離意義的等距尺。這正是量尺化最令人驚豔之處:無中生有地,由排序變出了間距。
這段推導值得用數字走一遍,因為「由排序反推間距」正是本章最容易卡住的一步。設想研究者取無糖、微糖、半糖三個等級,請一百位消費者就每一組配對回答「哪一杯比較甜」,得到三個勝出比例:微糖勝過無糖者佔 0.84,半糖勝過微糖者佔 0.69,半糖勝過無糖者佔 0.93。代入標準常態的反函數,三者的 z 值分別是 0.99、0.50 與 1.48;依 Case V,z 值即為尺度值之差。取無糖為零點,微糖便落在 0.99,半糖落在 1.49。模型還自帶一道檢核:半糖與無糖之差應為 0.99+0.50=1.49,而直接比較所得的 1.48 幾乎與之相同,這份前後一致正是資料支持 Case V 的證據。攤在數線上讀,無糖到微糖的心理距離約為微糖到半糖的兩倍,也就是第一匙糖的甜感增益遠大於其後的每一匙。這一整組結論全來自「哪一杯比較甜」的排序判斷,全程沒有人被要求說出一個絕對的甜度分數。
把等級數擴充到五個,作法完全相同,只是待估的 \mu 值多了兩個。上例那種「前段間距大、後段間距小」的組型若在五個等級上重現,便揭示了一件感官心理學早已熟知的事:甜感的增長並非隨含糖量線性上升,而是先快後慢地趨於飽和,這與第二章 Fechner 對數定律、Stevens 冪次定律所描繪的心理物理規律遙相呼應。Case V 的假設當然可能不成立,例如越極端的刺激判斷越一致、離散度越小,此時須改用容許離散度不等的更一般模型;但即便如此,比較判斷律所樹立的典範,也就是由機率化的次序反應回推潛在連續尺,已然預告了本章稍後的選擇模型,乃至第十七章項目反應理論的全部精神。
類別判斷與態度量尺化:Thurstone 的等現間距
成對比較雖然嚴謹,卻有一個現實的難處:當刺激數目一多,需要比較的配對便以平方的速度暴增,二十個題目就是近兩百組比較,受試者很快就會不耐。Thurstone 因而發展出一條更適合大量刺激的路徑,即等現間距法(method of equal-appearing intervals),用以建立態度量尺。其作法分兩階段。第一階段是題目的定尺:招募一批評判員,請他們把大量描述某一態度的陳述句,例如關於某項公共政策的種種說法,依其所表達的「贊成程度」分入若干個等距的類別,從最反對到最贊成。每一陳述句被賦予的量尺值,即取其被眾多評判員分入之類別的中位數,而評判員之間分歧的程度(四分位距),則用以篩掉那些語意含糊、人言言殊的句子。第二階段才是真正的施測:受測者只需就一份精選過的陳述句表達同意與否,其態度分數即為他所同意之陳述句量尺值的平均。
這條路徑背後,是類別判斷律(law of categorical judgment),可視為比較判斷律的延伸:它假設評判員心中存在若干個類別界線,每一界線本身也是連續體上一個帶有離散度的隨機位置,而一個刺激被歸入某類別的機率,取決於其判別歷程落在相鄰兩界線之間的機會。由這一模型,同樣能由「刺激落入各類別的比例」反推刺激的尺度值。Thurstone 態度量尺的理論企圖心不可謂不大:它要為每一道態度題目,都先在一把公共的等距尺上釘出一個精確的位置,使得受測者的分數具有清楚的區間意義。
然而,正是這份理論上的講究,埋下了它日後被超越的伏筆。定尺階段所耗費的評判員人力極為可觀,而且一個令人不安的問題始終揮之不去:評判員自己的態度,會不會汙染他們對題目的定尺判斷?一個激進的評判員與一個保守的評判員,對同一句話「有多贊成」的歸類,真的會一致嗎?後續研究顯示,評判員的態度確實可能系統性地影響定尺結果。當一套方法的前置成本如此高昂、而其宣稱的優勢又未必穩固時,一條更簡便的替代方案一旦出現,勝負便已注定。這條替代方案,來自 Thurstone 的一位學生。
Likert 的簡化革命:加總評定為何獲勝
Likert (1932) 提出的方法,簡單到近乎粗暴,卻徹底改變了此後一個世紀的問卷實作。他索性跳過了 Thurstone 那套繁複的題目定尺:不再費心為每道題釘出精確的量尺值,而是讓每一位受測者,直接就每一道陳述句在一個對稱的同意程度量尺上作答,典型者為「非常不同意、不同意、中立、同意、非常同意」五個等級,依序給予一到五分。受測者的態度總分,就是他在所有題目上得分的直接加總,這便是所謂的加總評定量尺(summated rating scale),也就是今日無人不曉的李克特量尺(Likert scale)。
從理論純度的角度看,Likert 的作法幾乎是一種倒退。它把 Thurstone 苦心經營的區間性質拋在腦後:同意程度的五個等級,其相鄰間距是否真的相等,「同意」與「非常同意」之差,是否恰等於「中立」與「同意」之差,Likert 完全不加追究,逕自以一到五的整數對待之。這正是第二章 Stevens 尺度之爭的活生生案例:把本質上僅具次序意義的等級,當作等距量去加總。
那麼,理論上遠為粗糙的 Likert 量尺,為何能夠全面勝出,把講究的 Thurstone 量尺擠到方法學史的角落?答案在於實用性對理論純度的壓倒性勝利。其一,Likert 量尺的編製成本極低,省去了整個評判員定尺的階段,研究者自己寫題、自己施測即可。其二,在效度與信度的實徵比較中,Likert 量尺的表現往往不遜於、甚至優於 Thurstone 量尺,這使得後者高昂的成本顯得更加不划算。其三,也是最深遠的一點,Likert 那把每題等權相加的邏輯,恰好與後來興起的因素分析、古典測驗理論若合符節:一份 Likert 量表,其實可以被自然地理解為一個反映性測量模型(第三章),各題是同一潛在態度構念的效果指標,而總分則是對構念的一個估計。換言之,Likert 之所以勝出,不僅因為它便宜,更因為它無意間站在了此後整個受試者側測量理論的正確一方。這段歷史留下一個耐人尋味的教訓:在方法的競爭中,理論上的優雅未必是決勝的關鍵,能否低成本地落地、又能否接上後續理論的主流,往往才是。
值得補上一筆的,是介於 Thurstone 與 Likert 之間的第三種嘗試,即 Osgood 的語意區分法(semantic differential)。它以一組兩極的形容詞對,例如「好與壞」「強與弱」「主動與被動」,請受測者在其間的七等分尺上標出一個位置,用以測量概念的內涵意義。語意區分法的資料,日後常以因素分析萃取出評價、力量、活動三大向度,因而也可視為由「量刺激」通往「多向度量尺化」的一座橋樑,後者正是本章稍後的主題。
Guttman 量尺圖:完美階梯的理想與現實
與 Thurstone、Likert 幾乎同時,Guttman 提出了另一種思路截然不同的量尺化理想。Guttman (1944) 關切的是一種特殊而優美的結構,即累積性(cumulativeness)。設想一組由易到難、由弱到強排列的題目:一個真正單維的量尺,理應具有這樣的性質,只要知道某人總共同意了幾題,便能一字不差地重建出他究竟同意了哪幾題。這就像爬樓梯,能踏上第四階的人,必然也踏得上第一到第三階;能舉起五十公斤的人,必然也舉得起四十公斤。這種「答對難題即蘊含答對所有易題」的完美階梯,即為 Guttman 量尺,其資料排開來會呈現一個漂亮的三角形,稱為量尺圖(scalogram)。
Guttman 量尺的迷人之處,在於它對單維性給出了一個極其嚴格、且可由資料直接檢驗的定義。若一組題目果真構成完美的 Guttman 量尺,那麼對 n 道題而言,理論上只可能出現 n+1 種反應組型,而非 2^n 種;任何偏離這 n+1 種完美組型的作答,都是量尺的一道裂縫。Guttman 遂以再生係數(coefficient of reproducibility)量化這道理想被滿足的程度。
對 N 位受測者、n 道題目,設每位受測者的反應皆與「其總分所對應的完美 Guttman 組型」逐題比對,凡不合之處計為一個誤差。令誤差總數為 e,則再生係數定義為
它是「可由總分正確重建的反應」佔全部反應的比例;\mathrm{Rep}=1 表示量尺圖毫無裂縫。Guttman 建議以 \mathrm{Rep} \ge 0.90 作為可接受的門檻。然而這個係數藏著一個系統性的樂觀偏誤:當題目的邊際比例極端時,例如某題幾乎人人皆同意,光靠「一律猜多數類別」就能達到很高的再生率,而與量尺是否真的單維毫無關係。為此須計算最小邊際再生係數(minimal marginal reproducibility, MMR),也就是純由各題邊際比例所能達到的再生率下限;唯有 \mathrm{Rep} 顯著高於 \mathrm{MMR},其差(可縮放為可量尺化係數)才真正反映了累積結構的存在。單看 \mathrm{Rep} 而不減去 \mathrm{MMR},是誤用 Guttman 量尺最常見的陷阱。
這個陷阱用數字看最清楚。設想一份五題量表施測於一百位受測者,合計五百個反應,逐題比對完美組型後找出三十五個誤差,於是 \mathrm{Rep}=1-35/500=0.93,看似安然越過 0.90 的門檻。但若五題的同意比例依序為 0.95、0.90、0.80、0.60、0.55,每一題光靠「一律猜多數類別」的正確率就等於這些比例本身,平均後 \mathrm{MMR}=0.76。真正由累積結構帶來的增益只有 0.17 這一段,換算為可量尺化係數 (0.93-0.76)/(1-0.76)=0.71,這才是該報告的數字。
Guttman 量尺的確定性理想,在現實的雜訊面前顯得過於剛硬,這正是它未能像 Likert 那樣普及的原因:真實資料裡總有那麼幾個「舉得起五十公斤卻舉不起四十公斤」的異常組型,而一個容不下任何裂縫的模型,面對這樣的資料便無所適從。然而 Guttman 的洞見並未白費,反而以一種更柔軟的形式獲得了新生。若把那道剛硬的完美階梯,換成一條平滑的、機率性的階梯,也就是允許「能力越高、答對某題的機率越大,但非絕對」,Guttman 的累積邏輯便化身為項目反應理論的單調項目反應函數(第十七章)。就此而言,Guttman 量尺可謂 IRT 的確定性極限,而 IRT 則是 Guttman 理想的機率化救贖。這也再次印證本章的主旋律:量尺化傳統中那些看似過時的模型,往往正是現代測量工具的史前形態。
選擇公理與 BTL 模型:logistic 的第一次登場
比較判斷律以常態分布為判別歷程的假設,數學上雖然自然,計算上卻不甚方便,因為常態的累積函數沒有簡潔的封閉形式。數理心理學的傳統,遂發展出一條以更便於運算的形式描述選擇行為的路徑,其核心是 Luce (1959) 的選擇公理(choice axiom)。選擇公理的精神,是一個關於選擇「內部一致性」的合理要求:從一組選項中選出某一項的機率,與其他無關選項的存在與否無關,這常被稱為「無關選項獨立性」。由這一條看似樸素的公理出發,可以嚴格地導出一個結論:每個選項都可以被賦予一個正的尺度值,而任一選項被選中的機率,恰等於其尺度值佔全部候選選項尺度值之和的比例。
當把這一結論套用到兩兩比較的特例時,便得到與 Bradley & Terry (1952) 各自獨立提出的模型完全相同的形式,後世合稱之為 Bradley-Terry-Luce(BTL)模型。而一旦把選項的尺度值改以對數尺度來參數化,BTL 模型便會露出它最深刻的面貌,如下面的方塊所示。
依選擇公理,每個選項 i 具有正的尺度值 v_i>0;在成對比較中,「i 勝於 j」的機率為
令 v_i = e^{s_i},即以對數尺度值 s_i 重新參數化,代入上式並同除以 e^{s_i}:
勝出機率因而是兩刺激尺度值之差的 logistic 函數。這是 logistic 反應曲線在心理計量中的第一次登場,其發生地正是量尺化,而非測驗理論。更深刻的是它與 Rasch 模型(第十七章)的代數親緣。Rasch 模型設受試者答對某題的機率為 P(\text{答對}) = \operatorname{logistic}(\theta - b),其中 \theta 為受試者能力、b 為試題難度。這與 BTL 的形式一字不差,只需把「i 對 j 的成對比較」換成「受試者對試題的一場對決」:能力 \theta 與難度 b,恰如兩位較量的選手。Andrich (1978) 正式證明,若在 Thurstone 的 Case V 中以 logistic 取代常態,所得的刺激定尺方程,與 Rasch 模型對受試者與試題的估計方程完全一致。量刺激的 BTL 與量人的 Rasch,原來只是同一個模型從刺激側與受試者側各看一眼的兩張面孔,這正是第三章所預告的深層統一。
BTL 模型的意義,遠不止於一個計算上的便利選項。它把量尺化與測驗理論這兩條長期分流的傳統,在 logistic 這座橋上接通了;理解了這一點,讀者便能明白為何本書要在項目反應理論之前,先花一整章鋪陳量尺化。回到手搖飲的例子:同一批消費者對五種甜度的成對比較資料,既可用第二節的 Thurstone-常態模型定尺,也可用此處的 BTL-logistic 模型定尺,兩者結果通常相去不遠,因為常態與 logistic 兩條 S 形曲線本就形貌相近。差別在於,BTL 的 logistic 形式使它能無縫接軌到第十七章的整套機率測量理論,也使它在半個多世紀後於一個全新的舞台上重獲新生,這一點留待本章末再敘。
展開與理想點:當「越多不一定越好」
至此所談的量尺化,其背後都藏著一個未言明的共同假設,即優勢(dominance)邏輯:某屬性越多,某種反應就越可能出現。能力越高,答對某題的機率越大;越贊成某政策,就越同意支持它的陳述。然而,有一整類心理判斷並不遵循這條邏輯,手搖飲的甜度恰是最好的例子。對甜度而言,「越多越好」根本不成立:一個偏好半糖的人,會嫌全糖太膩,也會嫌無糖太淡,他最滿意的是那個「剛剛好」的點,而偏離這個點,無論太甜或太淡,滿意度都會下降。這種「過猶不及」的判斷,遵循的是接近(proximity)邏輯,其反應函數不是單調上升的,而是單峰的。
Coombs (1964) 的展開模型(unfolding),正是為刻畫這類理想點(ideal point)判斷而生。它假設每個受測者在心理連續體上都有一個理想點,而他對某刺激的偏好,取決於該刺激與其理想點的距離,越近越愛。展開一詞的意象十分傳神:想像把每個人的偏好排序,看成一條以其理想點為摺點、向兩側對摺起來的紙帶;研究者拿到的是一疊各自摺法不同的紙帶(各人的偏好排序),而分析的任務,是把它們一一「展開」攤平,還原出刺激與各人理想點在同一條連續體上的共同位置。下面的方塊,把優勢與接近這兩種反應邏輯的分野講清楚,因為誤用其一於另一者的資料,會導致嚴重的錯誤結論。
優勢歷程(dominance)。反應機率為潛在屬性的單調函數:屬性越多,肯定反應越可能。項目反應函數呈 S 形上升。測驗理論、Likert 量尺、項目反應理論皆屬此類。一個對「稅應大幅調高」表示反對的人,其態度必然偏向低稅一端。
接近歷程(proximity/ideal point)。反應機率為「受測者理想點與刺激位置之距離」的單峰遞減函數:離理想點越近越肯定,太多與太少同樣導致否定。項目反應函數呈倒 U 形。偏好、態度中的溫和立場、感官的最適水準皆屬此類。
關鍵後果。在優勢模型下,「不同意」明確指向屬性偏低;在接近模型下,「不同意」卻是曖昧的,它可能因為刺激遠高於、也可能因為遠低於受測者的理想點。因此,一個同時不同意「稅應大幅調高」與「稅應大幅調低」的人,在優勢模型的邏輯裡像是自相矛盾,在接近模型裡卻是再自然不過的溫和派。若把本質上是理想點判斷的態度題,硬套入單調的優勢模型(例如逕以 Likert 加總),溫和者的分數會被系統性地扭曲,量表的效度也隨之受損。展開模型的 IRT 化,即第十八章將詳述的廣義分級展開模型(GGUM),正是為正確處理這類資料而生。
理想點模型長期不如優勢模型普及,一部分原因在於它的估計較為棘手:單峰的反應函數比單調的更難辨識,早期的展開技術也多屬確定性的、對雜訊敏感的。然而,隨著機率化的展開模型與現代估計方法的成熟,研究者逐漸意識到,許多長期被當作優勢題對待的題目,其實暗藏著理想點的結構,理想點取向近年因而明顯復甦。手搖飲甜度那個「剛剛好最好」的直覺,其實普遍存在於人類的偏好之中,只是長期被單調模型的方便所掩蓋。
多向度量尺法:從相似性到空間
前述各法,無論優勢或接近,多半假設刺激落在單一的連續體上。但許多心理對象的差異,本質上是多向度的:兩杯手搖飲之所以喝來不同,可能同時牽涉甜度、茶味、口感等好幾個面向。多向度量尺法(multidimensional scaling, MDS)處理的正是這類問題,它的輸入不是「誰比誰甜」的單向判斷,而是一整組刺激兩兩之間的相似或相異程度,其目標是在一個維度盡量低的空間中,為每個刺激找到一個座標,使得空間中的距離忠實反映出所輸入的相異度。直觀地說,MDS 是把一張「誰跟誰有多不像」的表格,還原成一張「知覺地圖」,讓相似的刺激彼此靠近、相異的彼此遠離。
MDS 的發展有一個關鍵的轉折點。早期的計量 MDS(如 Torgerson 的古典解法,見 (Torgerson, 1958))要求相異度資料本身即具備等距乃至等比的性質,這在心理資料中往往是奢求。突破來自 Shepard (1962) 與 Kruskal (1964) 的非計量 MDS:他們證明,其實不必假設相異度是精確的距離,只要相異度與空間距離維持單調關係,也就是「輸入越相異的一對,在圖上就該離得越遠」這一次序約束,便足以幾乎唯一地決定出刺激的空間構型。這與比較判斷律「由次序反推間距」的精神一脈相承,堪稱量尺化傳統中「以少求多」哲學的又一次勝利。下面的方塊,說明非計量 MDS 如何以壓力函數與單調迴歸達成這一點。
給定刺激兩兩之間的相異度 \delta_{ij},非計量 MDS 尋求一組低維座標 \mathbf{x}_i,使其歐氏距離 d_{ij}=\lVert \mathbf{x}_i-\mathbf{x}_j \rVert 與 \delta_{ij} 維持單調關係。其擬合的良窳由 Kruskal 的壓力(stress)度量:
其中 \hat{d}_{ij} 為離差(disparity),是把距離 d_{ij} 對相異度 \delta_{ij} 的次序做單調迴歸(isotonic regression)所得的擬合值,也就是在「與 \delta_{ij} 的排序一致」這一約束下,最貼近 d_{ij} 的一組數值。壓力可讀為距離與離差之間的落差佔距離總量的比例,介於 0 與 1 之間,越接近 0 表示構型越忠實地保住了原始相異度的次序;Kruskal 建議以 0.05 上下為良好、0.10 尚可、0.20 已屬勉強。演算法於是在兩步之間交替:固定座標、以單調迴歸更新離差;固定離差、以梯度下降移動座標以降低壓力,反覆至收斂。維度的選擇則參考壓力隨維度下降的轉折(陡坡準則)與構型的可詮釋性;壓力越低未必越好,過高的維度只是在擬合雜訊。個別差異 MDS(INDSCAL;(Carroll & Chang, 1970))進一步容許各受測者對共同空間的各維度賦予不同的權重,從而在一張共享的知覺地圖上,刻畫出人與人之間注意焦點的差異。
把 MDS 用回手搖飲:請消費者評判各品牌珍奶兩兩之間「喝起來有多不像」,MDS 便能把這些相似性判斷,攤成一張二維的品牌知覺地圖,其橫軸或許對應甜度、縱軸或許對應茶味的濃淡。維度的取捨也在此見真章:若二維解的壓力為 0.08、三維解只再降到 0.06,那多出來的向度往往既難命名又難詮釋,二維解便是較好的選擇。這張圖的價值在於,它不預設任何向度,而讓向度由資料自己浮現,再交由研究者詮釋。這種「先求空間、後釋向度」的探索精神,與因素分析(第十四章)殊途同歸,也與第三十四章將介紹的現代流形學習(如 t-SNE、UMAP)在概念上一脈相承,後者可謂 MDS 精神在高維資料與機器學習時代的延伸。權威而完整的 MDS 論述,見 Borg & Groenen (2005)。
訊號偵測理論:把感受性與反應傾向拆開
本章最後一件量尺化的利器,第二章已預告其哲學意涵,此處補上它的形式:訊號偵測理論(signal detection theory, SDT;(Green & Swets, 1966))。它要處理的問題,是判斷資料裡一個極易汙染測量的雜質,即反應傾向。設想請人品評一杯飲料「有沒有加糖」。一個回答,其實糅合了兩件截然不同的事:其一是這個人分辨甜與不甜的真實感官能力,其二是他回答「有」的意願高低,也就是他寧可錯認、還是寧可漏認的決策偏好。一個愛說「有」的人,命中率高,但誤報也多;單看命中率,會把「敢猜」誤當成「敏銳」。SDT 的貢獻,是以兩個彼此獨立的參數,把這兩者乾淨地拆開。
SDT 假設每一次刺激在觀察者內部激起一個連續的「證據」量。無訊號(雜訊)時,證據服從 N(0,1);有訊號時,證據服從 N(d',1),兩分布等變異而平移了 d'。觀察者設一判準 c,證據超過 c 便回報「有」。於是命中率與誤報率分別為
將兩式取標準常態反函數並相減、相加,即把兩個參數解出:
d' 為敏感度(sensitivity),衡量兩分布相隔多遠,也就是觀察者分辨訊號與雜訊的真實能力,與判準無關;c 為判準(response criterion),衡量觀察者回報「有」的門檻高低,即其反應傾向。若讓判準由寬到嚴地變動,(F,H) 便描出一條由左下到右上的弓形曲線,稱接收者操作特徵(receiver operating characteristic, ROC)曲線;其下的面積(AUC)是一個不受判準影響的敏感度總結。ROC 之所以重要,正因為它把「能不能分辨」與「願不願意說有」這兩件事,攤在同一張圖上各歸其位。
這兩個參數的分工,用一組對照最容易看清。設想兩位評審品評同一批飲料,逐杯判斷「有沒有加糖」。甲評審的命中率為 0.84、誤報率為 0.16;乙評審的命中率高達 0.98,誤報率卻也有 0.50。單看命中率,乙遙遙領先。但代入公式,\Phi^{-1}(0.84)=0.99、\Phi^{-1}(0.16)=-0.99,甲的 d'=1.98;\Phi^{-1}(0.98)=2.05、\Phi^{-1}(0.50)=0,乙的 d'=2.05。兩人分辨甜與不甜的真實能力其實相差無幾,差別全在判準:甲的 c=0.99 偏於謹慎,乙的 c=0 則寧可多說「有」。只報告命中率,得到的會是「誰比較敢猜」,而不是「誰比較敏銳」。
訊號偵測論的方法論意義,遠遠溢出了心理物理學的範圍。它所樹立的典範,即「觀察到的反應,往往同時承載了研究者真正關心的量與一層與之無關的歷程,而良好的測量模型必須把二者拆開」,會在全書反覆迴響。項目反應理論對「能力」與「試題難度」的分離、測量不變性對「真實差異」與「測量差異」的分離(第十九章),骨子裡都是同一個測量理想的不同化身。SDT 本身也早已超越了實驗室,成為醫學診斷、機器學習分類器評估、乃至一切「是與否」判斷之品質評鑑的共同語言;每當有人以 ROC 曲線下面積來衡量一個分類模型的優劣(第二十三、三十四章將再遇見它),其實都是在使用這件源自心理量尺化的百年工具。SDT 於分類決策與甄選情境的應用,將於第二十七章討論測驗使用時再度登場。
量尺化傳統的現代迴響
量尺化這門看似古老的傳統,在當代非但沒有褪色,反而在幾個意想不到的地方重獲新生。這一點初看頗違直覺:本章所談的方法多半成形於一九三○至一九六○年代,今日的方法教科書也往往只在歷史回顧處順帶提及,讀者因此容易以為它們早被更晚近的模型取代。實情並非如此。只要問題的形式是「由人的判斷反推對象本身的位置」,量尺化仍是最直接的工具,只是它今日多半改換了名字,散落在感官科學、消費研究、人格測量乃至機器學習等看似無關的領域。本節依循全書慣例,區分已確立的結果、進行中的議題與推測性的連結。
在已大致確立的一端,是理想點模型的復興。前文提及的展開邏輯,經廣義分級展開模型(GGUM;(Roberts et al., 2000))之類的機率化模型加以現代化後,已在人格與態度測量中站穩腳跟,其細節留待第十八章。與此並行的,是配對比較與其變體在應用領域的持久生命力:感官科學評鑑食品、消費研究衡量品牌偏好,至今仍大量倚賴成對比較與其效率化的變體,例如最優-最劣量尺化(best-worst scaling),後者請受測者僅指出一組選項中最好與最差者,便能高效地榨取出完整的偏好尺度。這些方法的數理內核,正是本章的 Thurstone 與 BTL 模型。
在進行中的議題一端,是量尺化與現代降維方法的概念交會。非計量 MDS「由相似性的次序反推低維空間」的思路,與機器學習近年廣泛使用的流形學習方法,例如 t-SNE((Maaten & Hinton, 2008))與 UMAP,共享著同一個古老的目標:把高維的相似性結構,忠實地壓縮到人眼可讀的低維地圖上。兩者的技術細節與最佳化策略雖大不相同,其精神卻一脈相承,這一連結將在第三十四章討論機器學習時再作展開。至於這些現代方法是否、以及在何種意義下改良了古典 MDS,仍是一個活躍的比較研究課題。
至於推測性的一端,一個近年浮現、格外耐人尋味的連結,出現在大型語言模型的對齊訓練之中。當前主流的「基於人類回饋的強化學習」,其關鍵一步是訓練一個報酬模型,去學習人類在成對輸出之間的偏好,也就是由「人類覺得 A 回答比 B 好」的大量成對判斷,反推每個回答的一個純量分數。這一步所採用的機率模型,本質上正是本章的 Bradley-Terry 型成對偏好模型((Christiano et al., 2017))。一件由 Thurstone 與 Luce 在為態度與選擇立尺時所打磨的百年工具,竟在他們遠不及預見的人工智慧對齊舞台上重新登場,用以為機器的行為立尺。這一呼應目前多屬概念層次的觀察,其深層意涵尚待釐清;但它至少生動地說明了一件事:量尺化所處理的「如何由偏好判斷反推潛在價值」這一問題,其普遍性遠遠超出了心理計量的邊界。
小結
本章把心理計量那條長期被測驗理論掩蓋的量尺化根基,完整地攤了開來。全章環繞一個核心成就展開:如何由人們的判斷與偏好,反推出刺激本身的量尺值,而其中最令人驚豔的手法,是一次又一次地由純粹的次序資訊,變出帶有距離意義的尺,無論那是比較判斷律由「誰勝於誰」反推的等距甜感尺,還是非計量 MDS 由「誰跟誰不像」反推的知覺空間。這條由 Thurstone、Likert、Guttman、Coombs、Luce、Shepard 一路接力的傳統,回答的都是「如何為刺激立一把尺」這一刺激側的問題,恰與其後各章「如何為人立一把尺」的受試者側問題兩相對照,共同撐起了測量的完整版圖。
沿途,本章也一再點出這些看似古老的模型如何預告了現代工具。Guttman 的完美階梯,是項目反應理論單調反應函數的確定性極限;BTL 模型的 logistic 形式,是 IRT 反應曲線的第一次登場,並經 Andrich 的證明,揭示了量刺激的 BTL 與量人的 Rasch 原是同一模型的兩張面孔;展開模型的理想點邏輯,通往第十八章的 GGUM;訊號偵測論「拆開感受性與反應傾向」的典範,則預示了 IRT 與測量不變性反覆現身的分離思想。理解了這條量尺化的線索,讀者再讀第十七章的項目反應理論時,便不會覺得 logistic 反應曲線是憑空冒出的技術,而會認出它其實是一段百年傳統水到渠成的結晶。
至此,本書已備妥「量刺激」這一側的完整圖像,接下來便要正式轉向「量人」的那一側。第五章將自古典測驗理論出發,把第三章寫下的反映性測量方程 x_i = \lambda_i \eta + \varepsilon_i,展開為真分數與測量誤差的完整理論;而本章反覆出現的 logistic 反應模型,則要等到第十七章,才在受試者側以項目反應理論的姿態,與這裡的量尺化傳統正式重逢。量刺激與量人這兩條源流的匯合,正是本書潛在變項測量模型一路鋪陳的伏筆所在。