古典測驗理論
設想某人參加一次英文檢定,得到 850 分;隔週在幾乎相同的狀態下再考一次,卻得到 870 分。究竟哪一個才是此人「真正的實力」?直覺會說:大概落在兩者之間,這 20 分的落差不過是運氣、當天狀態與猜對幾題之類的偶然因素所致。這個樸素的直覺,正是古典測驗理論(Classical Test Theory, CTT)的出發點。CTT 是心理測量史上第一個把「分數之中有多少是實力、有多少是雜訊」講清楚的理論框架。它的數學並不艱深,核心只有一條加法式,然而正是這條式子撐起了整個信度理論,也界定了研究者談論「測量誤差」時究竟在談什麼。
這套理論的雛形來自 Spearman 對測量誤差的處理,其後經 Gulliksen (1950) 集其大成,再由 Novick (1966) 與 Lord & Novick (1968) 賦予嚴謹的公理基礎。本章將它從定義一路推導至極限,沿途導出信度、測量標準誤與衰減校正等核心結果,並說明為何在 CTT 之後,測量學仍須發展出項目反應理論。全章的一條暗線是:CTT 的優雅與侷限,其實來自同一個源頭,也就是它把真分數定義在特定測驗之上。
從量刺激到量人
第四章走完了量尺化的傳統,其問題意識始終落在刺激側:如何為政策、態度、乃至飲料的甜度立一把尺。本章起,本書正式翻轉視角,轉向受試者側,回答一個看似對稱、實則另闢天地的問題:如何為人立一把尺。這一翻轉,恰是心理計量兩大源流的分水嶺。承自 Fechner 與 Thurstone 的量尺化傳統,把人當作一群大致可互換的判斷儀器,藉其一致的判斷去定位刺激;而承自 Spearman 與 Binet 的個別差異傳統關切的恰恰相反,是人與人之間的差異本身,它把測驗題目當作固定的尺,去估計每個人落在能力或態度連續體上的位置。古典測驗理論,正是這第二條傳統最早、也最簡潔的形式化。
這一視角的轉換,帶來一個容易被忽略卻影響深遠的後果,即「誤差」的意義變了。在量尺化傳統裡,判斷的浮動來自不同的人、不同的時刻;到了測驗理論,誤差指的是同一個人在同一份測驗上的分數,因偶然因素而在其「真正水準」上下的擺盪。前者問「這些人對這個刺激的判斷有多分歧」,後者問「這個人在這份測驗上的分數有多可靠」。古典測驗理論的全部工程,可以說就是把後面這個問題,也就是「分數裡有多少是實力、有多少是雜訊」,講到一清二楚。
兩條源流雖在此分流,卻並非從此老死不相往來。第四章末已預告,Andrich 證明了量刺激的 BTL 模型與量人的 Rasch 模型在代數上原是同一個東西;這意味著分流的兩條河,終將在項目反應理論(第十七章)的機率架構下重新匯合。看清這一點,有助於掌握本書的整體布局:本章與其後的信度、效度、因素分析,鋪陳的都是受試者側的測量理論,而它們與第四章量尺化的深層統一,要遲至第十七章才會被完整地揭示。在那之前,本章先自最基本的一條加法式說起。
一條核心的分解式:X = T + E
每一次測量所得到的觀察分數(observed score,記為 X),CTT 都把它拆解為兩部分:一部分是真分數(true score,T),另一部分是測量誤差(measurement error,E):
這條式子簡單到近乎同義反覆,真正的關鍵在於「真分數」如何定義。CTT 並不把真分數當成某種形上學的柏拉圖式真值,而是賦予它一個操作型定義 (Lord & Novick, 1968):設想同一個人,在狀態完全不受前次作答影響的條件下,重複接受同一份測驗無限多次,這些分數將形成一個分布,稱為命題分布(propensity distribution)。此分布的期望值,即定義為此人的真分數:
命題分布是一個思想實驗,值得用數字讀一遍。設想一位學生反覆接受同一份 40 題的英文單字測驗,而每次作答之間的記憶與疲勞效果都被清空:第一次答對 30 題,第二次 28 題,第三次 33 題,第四次 29 題。若這樣的重測能無限進行下去,這些分數會圍繞著某個中心散布;假定其平均為 30,那麼 30 就是這位學生在這份測驗上的真分數,而第三次的 33 題便含有 +3 的誤差。關鍵在於,30 並不是這位學生「真正的英文能力」,它只是一個期望分數,而且是對這 40 題而言的期望分數;換一份較難的 40 題,同一位學生的真分數可能落在 24。真分數之所以為真,真在誤差已被平均抹平,而不在它直接讀出了心裡的某個量。
這個定義有一個常被忽略、卻極為重要的性質:真分數是「對這一份特定測驗」而言的期望分數,而非某個抽象的、與測驗無關的實力。換言之,換一份測驗,真分數可能就隨之不同。此一特性看似細節,卻正是 CTT 樣本依賴與測驗依賴的根源,本章末將回到這裡。還須強調一點:X = T + E 本身並不是一個可否證的實證假設,而是一組定義,它不可能為假,因為 T 與 E 正是如此被界定出來的。真正帶有實證內容的,是稍後關於「多份測驗彼此關係」的假設,例如平行與 tau 等值。這個「定義」與「假設」的分野,在概念上至關重要,教科書卻往往一筆帶過。
CTT 之所以採取這條看似迂迴的定義路線,其實有其歷史與方法上的深意。在 Spearman 的年代,測量誤差是一個令人困擾的實務現象,卻缺乏清楚的理論位置;把真分數定義為命題分布的期望值,等於把「誤差」從一種模糊的失誤,轉化為一個具有明確統計意義的量。這與第二章的主題前後呼應:計量心理學不把誤差視為應當抹除的瑕疵,而視之為需要建模的對象,而 CTT 正是這一態度最早、也最簡潔的體現。
從定義能推出什麼
上一節把真分數與誤差都定義完畢,隨之而來的問題是:光靠這兩行定義,究竟能推出什麼?答案是相當多。一旦接受上述定義,若干重要性質便自動成立,無須任何額外假設,也無須向現實世界索取經驗前提。這正是 CTT 的優雅之處,它的核心結果幾乎都是定義的邏輯後果,而不是有待資料檢驗的主張。分清這一點很要緊:文獻中「CTT 假設誤差與真分數不相關」一類說法,指的並非可能被資料推翻的假設,而是定義所保證的恆等關係。以下的推導方塊,把三條基本性質完整導出。
給定 T \equiv \mathbb{E}(X)(對個體 i,期望值取自其命題分布)與 E \equiv X - T。
(1) 誤差的個體內期望為零。 對固定個體 i,
因對每個個體皆成立,母體層次亦有 \mathbb{E}(E)=0。 (2) 真分數與誤差不相關。 因 \mathbb{E}(E)=0,
其中內層期望取自個體 i 的命題分布,T_i 對該分布為常數。 (3) 變異的分解。 因 X = T+E 且 \mathrm{Cov}(T,E)=0,
這三條是 CTT 全部推論的地基,而它們都僅是定義的結果,並非附加的經驗假設。
三條性質之中,最後一條 \sigma_X^2 = \sigma_T^2 + \sigma_E^2 尤為關鍵。它揭示:觀察分數之所以出現變異,一部分來自人與人之間真正的差異(\sigma_T^2),一部分來自測量的雜訊(\sigma_E^2)。把這兩者的比例講清楚,就是信度。值得留意的是,真分數與誤差不相關這一性質,並非源於現實世界中誤差恰好與能力無關的經驗巧合,而是定義的必然;一旦誤解為經驗假設,便容易在後續推論中誤判它的適用範圍。
信度:訊號占了多少
上一節得到 \sigma_X^2 = \sigma_T^2 + \sigma_E^2,等於把一群人分數的散布切成了兩塊:一塊是人與人之間真正的差異,一塊是測量的雜訊。既然切成兩塊,就可以問一個很自然的問題:這些分數之所以有高有低,有多少是因為人真的不一樣,又有多少只是因為量得不準?這個比例,就是信度(reliability)。它衡量的不是分數的高低,也不是測驗的難易,而是分數之間的差距值不值得當真。定義因而相當直接:觀察分數的變異之中,來自真分數的那一份占了多少。
它是一個介於 0 與 1 之間的比例。信度為 1,表示分數毫無雜訊;信度為 0,表示分數全是雜訊、不含任何資訊。等價地,信度也可寫成 1 減去誤差變異占比,即 \rho_{XX'} = 1 - \sigma_E^2/\sigma_X^2。信度可以由三個等價的角度來理解,各自照亮它的一個面向:作為變異的比例,它回答「分數裡有多少是訊號」;作為兩份平行測驗的相關,它回答「重測的一致性有多高」;作為觀察分數與真分數相關的平方,它回答「分數與其所欲測之量有多接近」。三者在 CTT 的假設下彼此相等,直覺上卻互補。也正因如此,關於「信度要多高才算足夠」並沒有放諸四海皆準的門檻:探索階段的研究或許 0.70 已堪用,而攸關個人重大決定的高風險測驗,則往往要求 0.90 以上。門檻的高低取決於分數將被如何使用,而非某個約定俗成的魔術數字。
把數字讀出來,這個比例的意思會更清楚。設想某縣市以同一份數學科成就測驗施測於全體九年級學生,分數的標準差為 12 分,故觀察分數的變異為 144。若這份測驗的信度為 0.75,即表示這 144 之中有 0.75 \times 144 = 108 來自學生之間真正的數學程度差異,其餘 36 來自誤差;換算回標準差,真分數的標準差約為 10.4 分,誤差的標準差則為 6 分。反過來說,若信度只有 0.30,144 之中僅有約 43 來自真正的差異,其餘 101 都是雜訊,此時拿分數去排名次,排出來的順序有大半得歸功於運氣。
此處存在一個實務難題:\sigma_T^2 與 \sigma_E^2 皆無法直接觀察,因為 T 與 E 本身看不見,那麼信度究竟如何估計?CTT 的漂亮解答是:信度恰好等於兩份「平行測驗」分數之間的相關。這也是何以記號寫作 \rho_{XX'},也就是 X 與其平行版本 X' 之間的相關。
設 X 與 X' 為兩份平行測驗(parallel tests):兩者測到相同的真分數(T'=T)、誤差變異相等(\sigma_{E'}^2 = \sigma_E^2),且各誤差與真分數、兩誤差之間皆不相關。兩測驗分數的相關為
先看分子。因 X = T+E、X' = T+E',
因為後三項在 CTT 假設下皆為零。再看分母。因兩測驗平行,\sigma_X = \sigma_{X'} = \sqrt{\sigma_T^2+\sigma_E^2},故 \sigma_X\sigma_{X'} = \sigma_X^2 = \sigma_T^2+\sigma_E^2。於是
恰好等於信度的定義。這條結果的實務意義重大:它把一個看不見的量(真分數變異比),轉換成一個可觀察、可估計的量(兩份平行測驗的相關)。
信度還有一個常被略過、卻頗具啟發的孿生概念,即信度指標(index of reliability),指的是觀察分數與真分數之間的相關 \rho_{XT}。由定義可直接算得
也就是說,觀察分數與其自身真分數的相關,等於信度的平方根。這個看似樸素的等式,稍後將直接推出一條關於效度上限的重要結論:一份測驗與任何外在變項的相關,都不可能超過它與自身真分數的相關 \sqrt{\rho_{XX'}}。信度因而不只描述測驗品質,更為這份測驗所能建立的一切關聯設下了天花板。
信度並非測驗的固定屬性
一個對信度極為常見的誤解,是把它當成測驗本身的固定屬性,彷彿某份量表就有一個屬於「它的」信度。事實並非如此。由定義 \rho_{XX'} = \sigma_T^2/(\sigma_T^2+\sigma_E^2) 可知,信度取決於真分數變異 \sigma_T^2 與誤差變異 \sigma_E^2 之比,而前者是所測母體的性質,並非測驗本身所固有。同一份測驗,用在真分數差異很大的異質母體上,\sigma_T^2 較大,信度便高;用在真分數相近的同質母體上,\sigma_T^2 較小,信度便低。這正是全距限制(restriction of range)壓低信度的機制:把一份對一般人信度良好的測驗,施測於能力高度集中的樣本,例如以一般智力測驗施測於資優班學生,其信度往往顯著下降,並非測驗變差,而是可供區辨的真分數差異被壓縮了。
這一認識帶來兩個重要的實務後果。其一,報告信度時必須連同施測母體一併說明;一個抽離樣本脈絡的信度數字,其實所指未明。其二,文獻中同一量表的信度估計之所以彼此參差,很大一部分並非測量品質不穩,而是各研究樣本的異質程度不同所致。這也是何以晚近的方法學規範主張,信度應被理解為分數在特定情境下的屬性,而非測驗一勞永逸的標籤,此一主張將於第六章隨概化理論進一步深化。
從觀察分數回推真分數:Kelley 估計與向平均數迴歸
信度講的是整批分數裡訊號的占比,但實務上研究者常想問一個更個人化的問題:某人得到觀察分數 X,對他的真分數 T 最合理的估計是什麼?初學者的直覺往往是「就用 X 當作 T 的估計」,然而 CTT 給出的答案更為細緻,也更違反直覺。
以觀察分數 X 對真分數 T 作最佳線性預測。迴歸斜率為
其中用到 \mathrm{Cov}(T,X)=\mathrm{Cov}(T,T+E)=\sigma_T^2。由於 \mathbb{E}(T)=\mathbb{E}(X)=\mu,真分數的估計為
此即 Kelley (1923) 的估計式。
Kelley 估計式蘊含一個深刻的訊息,即向平均數迴歸(regression toward the mean)。真分數的最佳估計不是觀察分數本身,而是把觀察分數朝群體平均數 \mu 拉近,拉近的程度取決於 (1-\rho_{XX'})。信度愈高,觀察分數愈可信,拉近的幅度愈小;信度愈低,就愈該對極端分數存疑。這解釋了一個常令人困惑的現象:在低信度的測驗上,這次考特別高分的人,下次多半會退步,而這次特別低分的人,下次多半會進步。這並非什麼神秘的迴歸力量,而純粹是測量誤差的統計後果。以數字為例更能看出這層收縮的力道。設某測驗的群體平均數為 100、信度為 0.80,某人得到 130 分;依 Kelley 估計,其真分數的最佳估計並非 130,而是 0.80 \times 130 + 0.20 \times 100 = 124,朝平均數收縮了 6 分。信度若降至 0.50,收縮幅度更大,估計值僅為 0.50 \times 130 + 0.50 \times 100 = 115,測驗愈不可靠,就愈不該把亮眼的高分照單全收。忽略這一點,正是許多「介入方案看似有效」的假象根源,因為研究者常挑出極端組施予介入,其後的「改善」有一部分不過是向平均數迴歸而已,這一威脅將於第三十一章因果推論中再度出現。
平行、本質 tau 等值、同源:一道假設的光譜
前一節的 Kelley 估計,以及更前面推導信度的整套論證,都架在「平行測驗」這個前提之上。問題是,平行是一個極強的要求:兩份測驗必須測到完全相同的真分數,連誤差變異也要一模一樣。現實中幾乎找不到這樣的一對測驗,同一份量表裡的兩道題目更不可能滿足;若堅持唯有平行才算數,CTT 便幾乎無法用於真實資料。出路不是放棄,而是鬆綁假設。CTT 因而發展出一個由強到弱的假設層級,愈往下走假設愈弱、愈貼近資料,而能夠成立的信度估計法也隨之改變。讀完這一節,應能回答三件事:這三層假設各自要求什麼、它們容許題目在哪些方面彼此不同、以及用錯層級會讓信度被高估還是低估。至於各層級對應的估計法細節,將於第六章詳談。設有一組測驗或題目 X_1, \dots, X_k,各自的真分數為 T_1, \dots, T_k。
平行測驗(parallel)要求所有真分數相等(T_i = T)且誤差變異相等,這是最強的假設。本質 tau 等值(essentially \tau-equivalent)放寬為各真分數僅相差一個相加常數,T_i = T + a_i,誤差變異則可以不等;它保證各題所測的是同一個構念、且「單位」相同,等價於因素負荷相等,卻容許不同的難度與不同的誤差大小。這個假設之所以要緊,是因為 Cronbach’s alpha 正是在本質 tau 等值之下才恰好等於信度,否則它僅是信度的下界,這一點第六章將完整證明。同源測驗(congeneric)最為寬鬆:各真分數是同一潛在真分數的線性函數,T_i = a_i + b_i T,負荷 b_i 與誤差變異皆可不同;它也最貼近實際資料,正是因素分析與 omega 係數所採用的模型。
這三層的差別,用一組數字就看得清楚。設想一份四題的數學成就測驗。若四題的負荷都是 1.0、誤差變異都是 4,這是平行,四題可以互相替換。若負荷仍同為 1.0,誤差變異卻分別是 3、5、8、6,且第四題的平均得分比第一題低了 0.5 分,這是本質 tau 等值:每多一單位能力,在每一題上都同樣多得 1 分,但題目有難有易,有的題目作答穩定、有的浮動較大。若負荷改為 1.0、0.8、1.2、0.6,則同樣多一單位能力,在第三題上多得 1.2 分而在第四題上只多得 0.6 分,這便是同源。後果十分直接:負荷不等時,Cronbach’s alpha 會低估信度,因為它把不相等的負荷當成相等來處理,此時宜改用 omega 係數。
把這三層並置而觀,便會發現 CTT 並非單一模型,而是一道假設的光譜。研究者願意對資料做多強的假設,就決定了能採用多簡單的估計法,也決定了結論被推翻的風險有多高。這道層級同時預告了 CTT 與因素分析、與項目反應理論之間的連續關係,因為同源模型其實就是一個單因素測量模型的另一種寫法(第十四章、第十七章)。第三章所談的反映性測量方程 x_i = \lambda_i\eta + \varepsilon_i,在此獲得了具體的統計內涵:負荷 \lambda_i 對應同源模型的 b_i,而是否要求各 \lambda_i 相等,正是同源與本質 tau 等值的分野。
測量標準誤與個人分數的不確定性
至此所談的信度是一個群體層次的整體指標。它能回答「這份量表用在這群人身上夠不夠可靠」,卻回答不了另一個在實務上更迫切的問題:眼前這一位受測者得到 X 分,他的真分數大致落在哪個範圍?一個 0.85 的信度並不會告訴任何人,這一次的 78 分究竟該看成 75 到 81 之間,還是 70 到 86 之間。要把群體層次的一個比例,轉換成個人分數上一段看得見的區間,需要的是一個帶有分數單位的量。這個量就是測量標準誤(standard error of measurement, SEM),也就是誤差 E 的標準差 \sigma_E。由信度的定義可直接解出:由 \rho_{XX'} = 1 - \sigma_E^2/\sigma_X^2 移項,得 \sigma_E^2 = \sigma_X^2(1-\rho_{XX'}),開方即
信度愈高,SEM 愈小,分數愈精確;信度為 1 時 SEM 為 0,分數毫無誤差。反之,信度中等的測驗,其單一分數便帶著相當寬的不確定性。舉一個具體的例子:若某測驗的分數標準差 \sigma_X = 15、信度為 0.84,則 \sigma_E = 15\sqrt{1-0.84} = 15 \times 0.4 = 6。這代表一個觀察分數上下約 \pm 12 分(約兩個 SEM)之內都屬合理範圍。此一結果在實務上極為重要:僅憑單次分數在個人層次做重大決定,例如錄取與否只差一兩分,在測量上其實相當危險,因為那一兩分很可能落在誤差之內。若要更嚴謹地為個人真分數建構信賴區間,有兩種常見做法。較簡便的一種,是以觀察分數為中心、以 SEM 為單位畫出對稱區間,例如 X \pm 1.96\,\sigma_E 給出約 95% 的區間。較嚴謹的一種,則以 Kelley 迴歸估計 \hat{T} 為中心,並改用估計標準誤 \sigma_E\sqrt{\rho_{XX'}},因為此時要量度的是估計值 \hat{T} 與真分數之間的離散,而非觀察分數與真分數之間的離散;後者所得的區間不僅較窄,其中心也已朝群體平均數收縮,因而更能反映極端分數的真實不確定性。兩種做法在信度高時差異不大,但在信度偏低、或分數落在量尺兩端時,差距便不容忽視。
不妨就一個具體的個案,把兩種區間都算一遍。設想某大學以一份標準化的英文能力測驗作為分班依據,全校分數平均 100、標準差 15、信度 0.84,因而 \sigma_E = 6;某位學生考了 118 分,落在分班切分點 115 之上。以觀察分數為中心的 95% 區間是 118 \pm 1.96 \times 6,即約 106 到 130,下緣仍高於切分點。換以 Kelley 估計為中心,\hat{T} = 0.84 \times 118 + 0.16 \times 100 = 115.1,估計標準誤為 6\sqrt{0.84} \approx 5.5,區間約為 104 到 126,中心幾乎正壓在切分點上。同一筆分數,只因所取的中心不同,對「這位學生是否確實高於切分點」所能給出的把握便明顯不同,這正說明了攸關個人的決定為何不宜只看一個點,而應把區間一併攤開。
上述 SEM 假設誤差變異在整個分數量尺上為常數,這只是一個方便的近似。實際上,測量的精確度往往隨分數水準而變,這稱為條件測量標準誤(conditional SEM)。對答對題數這類分數,一個常用的近似來自二項誤差模型:若測驗有 n 題,觀察分數為 X,則條件誤差變異約為 X(n-X)/(n-1)。它在量尺中段最大、在兩端最小,因為極高或極低分的人幾乎題題答對或題題答錯,可供出錯的空間本就有限。這一點對高風險測驗的切分點設定尤具意義:切分點若恰好落在量尺中段,該處的測量最不精確,誤判的風險反而最高,這也預告了第十七章項目反應理論以訊息函數精細刻畫測量精度的必要。
衰減、去衰減與效度的上限
測量誤差不只使單一分數失準,還會系統性地稀釋變項之間的關係。設外向性與工作表現的真分數之間存在很強的相關,但因兩邊的測量都帶有誤差,實際觀察到的相關便會被拉低。這個現象稱為衰減(attenuation),最早由 Spearman 加以處理 (Spearman, 1904)。
設兩構念的觀察分數為 X、Y,真分數為 T_X、T_Y。在 CTT 假設下(各自的誤差與所有真分數、以及兩誤差彼此皆不相關),觀察分數的共變數等於真分數的共變數:
因為含 E 的三個交叉項皆為零。故觀察相關 \rho_{XY} = \mathrm{Cov}(T_X,T_Y)/(\sigma_X \sigma_Y),而真分數相關 \rho_{T_X T_Y} = \mathrm{Cov}(T_X,T_Y)/(\sigma_{T_X}\sigma_{T_Y})。兩者相除,並代入 \sigma_{T_X} = \sigma_X\sqrt{\rho_{XX'}} 與同理的 \sigma_{T_Y} = \sigma_Y\sqrt{\rho_{YY'}},得
也就是說,把觀察相關除以兩個信度平方根的乘積,即還原出「若測量完美」時的真實相關。
衰減校正是一把雙面刃。它在理論上告訴研究者測量誤差稀釋了多少關係,但在實務上必須審慎。當信度偏低時,分母很小,校正後的相關會被放得很大,甚至超過 1,這通常是抽樣誤差或模型設定問題的警訊,而非真的「完美相關」。因此校正值應附上信賴區間,也不宜在信度很低時濫用。現代做法多半直接改採結構方程模型(第十六章),讓潛在變項本身即是「去除誤差後」的構念,從根本上把衰減校正的邏輯內建於模型之中。衰減校正的邏輯一旦由單一研究推廣到整片文獻,便化身為研究整合的核心工具:第三十二章將介紹的 Hunter-Schmidt 心理計量後設分析,其精髓正是在彙整眾多研究的相關時,逐一扣除各研究因測量不完美與全距限制所造成的衰減,以還原構念之間的真實關聯。
衰減公式還有一個立即的推論,即效度受信度所限。把上式中的 Y 換成一個測量完美的外在效標(\rho_{YY'}=1),可得觀察效度 \rho_{XY} \le \sqrt{\rho_{XX'}}\,,這正呼應了前一節信度指標的結論:一份測驗與任何外在變項的相關,都不可能超過 \sqrt{\rho_{XX'}}。信度因而為效度設下了無法逾越的上限。這條關係在實務上意味著,若一份量表的信度只有 0.5,它與任何效標的相關至多約 0.71,無論該效標在理論上與構念關係多強。這也說明了為何第七章談效度時,信度雖非充分條件,卻是必要的前提。
同一套邏輯還揭示了一個常被忽視、卻影響縱貫研究甚鉅的陷阱,即差異分數的低信度。若以前後測之差 D = X - Y 衡量變化,其信度為
當前後測高度相關且信度相近時,分子中真分數變異的部分大量抵消,差異分數的信度便會急遽下降。這正是「以簡單差異分數衡量改變」長期受到批評的統計根源,也是第二十九章改採潛在成長模型與潛在變化分數模型的主要動機之一。
CTT 的極限:為什麼還需要 IRT
走到這裡,CTT 的主要結果已經齊備:一條分解式、一個信度定義、一組真分數的點估計與區間估計,以及一則衰減校正公式。然而本章開頭埋下的那條暗線,此刻該收線了:CTT 的優雅與它的侷限出自同一個源頭,也就是它把真分數定義在「這一份特定測驗」之上,並且把所有推論都停在測驗總分的層次。這個選擇讓數學變得極簡,代價則是幾項結構性的限制,它們並非估計技巧不夠精良所致,而是內建於理論的設定之中。以下依序檢視四項限制,其中前幾項正是其後項目反應理論(item response theory,第十七章)所要克服的。
最根本的一點是樣本與測驗依賴性。CTT 之中幾乎所有的量都不是「純粹」的。一題的難度,若以答對比例衡量,會隨受試樣本的能力而變;題目的鑑別度,乃至整份測驗的信度,也都隨樣本浮動。反過來,一個人的真分數又是「對這份特定測驗」所定義的,換一份難度不同的測驗,真分數便隨之改變。結果是題目參數依賴受試者、受試者參數依賴題目,兩者纏繞在一起難以分離。以一個具體的數字來看這種糾纏:設某道題目的真實難度,使中等能力者約有七成把握答對。當這道題交給一群普遍高能力的考生時,答對比例可能高達 0.9,看來是一道易題;同一道題交給一群普遍低能力的考生時,答對比例可能僅有 0.4,看來卻成了一道難題。難度指標就這樣隨樣本能力上下漂移,而題目本身分毫未變。鑑別度亦復如是:在能力高度同質的群體中,任何題目都難以拉開差距,鑑別度便被壓低。這種樣本依賴性使得跨樣本比較題目、或跨測驗比較受試者,都需要額外的校準工夫。其次,CTT 沒有作答歷程的模型。它只處理測驗總分層次,並不去描述「一個特定能力的人,答對某一特定題目的機率」,這使得像電腦化適性測驗這類依受試者當前能力即時選題的應用,難以在 CTT 框架下自然實現。第三,量尺不可比。因為真分數綁定特定測驗,來自不同測驗的分數很難置於同一把尺上直接比較,須仰賴額外的等化程序(第二十三章)。
項目反應理論正是針對前兩點而生:它以「潛在能力」與「題目參數」分離的機率模型,原則上讓題目參數不依賴特定樣本、能力估計不依賴特定題組,並直接建模能力與答對機率之間的關係。這條主線要到第十七章才完整展開。最後值得一提的是真分數的本體論。CTT 的真分數只是命題分布的期望值,它是一個統計建構,未必對應任何實質的心理屬性;Borsboom (2005) 便提醒,把 CTT 的真分數直接等同於「受試者真正的能力」,是一種常見卻未必成立的跳躍。真分數究竟是不是有意義的構念,最終須靠效度證據(第七章)來回答,而非靠 CTT 自身。
CTT 今天還站得住嗎?
項目反應理論問世之後,CTT 是否就此過時?答案是否定的。在絕大多數的量表發展實務裡,CTT 仍是主力:它假設少、計算透明、對小樣本穩健,一個 Cronbach’s alpha 搭配題目分析,往往就足以回答「這份量表堪不堪用」的第一線問題。更重要的是,CTT 與 IRT 並非對立。在同源模型的橋接下,兩者在許多情況下可以相互轉換、彼此互補 (Embretson & Reise, 2000)。與其說 IRT 取代了 CTT,不如說它把 CTT 隱含處理的「訊號與誤差分離」,推進到題目層次,並解開了樣本依賴的糾纏。
本章從一條加法式出發,推導出信度、信度指標、Kelley 真分數估計、測量標準誤、衰減校正與效度上限,也點出了 CTT 的極限所在。這些概念是其後兩章的地基:第六章要把「信度究竟如何估計」講透,從 Cronbach’s alpha 到 omega,再到概化理論;第七章則轉向一個更難、也更重要的問題,也就是效度,追問研究者手中的分數,究竟有沒有測到它宣稱要測的東西。