第 23 章 量尺化、等化與連結
第五部 測驗發展、應用與社會脈絡
23Chapter

量尺化、等化與連結

每年大型入學考試放榜,總有一種聲音:「今年數學特別難。」這句看似日常的抱怨,其實藏著一個心理計量的硬核問題。今年考生的平均分數比去年低了五分,這究竟是因為今年這批考生程度較弱,還是因為今年的題本本身較難?若不能把這兩種可能分開,那麼把今年的分數與去年直接相比、據以判斷「這屆學生變差了」或「今年考題出難了」,都只是各執一詞的猜測。更嚴重的是,若兩年的分數不可比,那麼以同一條錄取分數線跨年適用,便對其中一屆考生不公平。

本章要處理的,正是作業型心理計量最核心的實務問題:不同題本、不同年度、不同年級所得到的分數,如何被放到同一把尺上,以致可以公平地相互比較。這需要一整套環環相扣的技術,即先建立分數量尺,再以妥善的資料蒐集設計,配合適當的統計方法把不同題本的分數等化,最後評鑑等化的品質。本章也是前面數章的一次整合應用:它把第十七章的項目反應理論、第十三章的缺失資料原理、與第九章的複雜抽樣,組裝為一套可操作的作業流程,並以大型評量的擬真值方法學收尾。全章以「一場全國性入學考試的兩個年度題本」為貫穿實例,從「今年比較難」的輿論出發,走完設計、等化與誤差評鑑,末節再以 PISA 台灣資料的次級分析,示範擬真值的正確用法。

分數量尺的建立

在比較分數之前,得先問分數本身是什麼。最原始的原始分(raw score),即答對題數或加總得分,其問題在於它綁定於特定的題本:同樣答對三十題,在難卷與易卷上代表的能力並不相同。因此,測驗分數通常會被轉換到一個更有意義的量尺上。

常見的轉換有幾種。百分等級(percentile rank)把原始分轉為「贏過多少比例的人」,直觀卻是次序量尺,其間距不等,不宜直接做加減平均。標準分數(standard score)如 z 分數,把原始分減去平均、除以標準差,使分數以「距平均幾個標準差」表達,便於跨測驗比較,卻仍受原始分分布形狀的影響。常態化量尺(normalized scale)則進一步透過非線性轉換,把偏態的原始分分布「拉正」為常態,常見的如 T 分數與各種標準九量尺。須留意的是,分數量尺的建立本身就是一種選擇,它決定了「分數看起來如何、如何被解讀」,而不同的量尺各有其解讀上的便利與陷阱。然而,無論建立了多漂亮的量尺,只要它是從「單一題本」推導的,就仍解決不了跨題本比較的問題,這就帶到等化。

等化的定義與公平性條件

等化(equating)是一種特別嚴格的分數連結。它的目標,是在兩份「測量同一構念、且依同一規格編製」的複本測驗之間,建立一個分數轉換,使得轉換後,考生拿到哪一份題本都無所謂,其分數可以互換使用。等化之所以嚴格,在於它宣稱兩份題本「可以互相替代」,這是一個很強的主張。

概念方塊等化、連結與可比性的光譜

Holland & Dorans (2006) 把「把分數放上同一把尺」的各種作法,排成一個由強到弱的光譜:

等化(equating):最嚴格。要求兩測驗測同一構念、同一規格、信度相近,轉換後分數可完全互換。

量尺對準(scale aligning):較弱。把測不同構念、或不同規格的測驗分數放到同一量尺上,便於比較,但分數不可互換。

預測(predicting):最弱。以一份測驗的分數去預測另一份,兩者不對稱,且預測本身有誤差。

三者常被籠統地稱為「連結」,但其可比性的強度天差地別;把一個「弱連結」當成「等化」來使用,是實務中常見而危險的誤用。

等化的正當性,建立在若干嚴格的條件之上。除了同構念、同規格,還有 Lord 提出的公平性條件:一個理想的等化,應使得「對任何一位考生而言,考哪一份題本都同樣公平」,亦即轉換後兩題本在各能力水準上都給出等價的分數。這個條件其實隱含了一個近乎弔詭的結論,即唯有當兩份題本「完全相同」時,嚴格的等化才可能無瑕地達成;現實中的題本總有差異,故等化永遠是一種近似。理解這一點很重要:等化不是把差異「變不見」的魔法,而是在承認差異的前提下,盡可能建立一個公平的分數對應。就兩年的入學考試而言,唯有當兩份數學卷確實測同一套數學能力、依同一藍圖編製時,談論「把兩年分數等化」才有意義。

資料蒐集設計:等化的實驗設計學

等化要能進行,必須先有能夠「分開題本難度與考生能力」的資料。這正是一個實驗設計的問題,呼應第十章的設計思維:如何蒐集資料,才能識別出我們想要的量。主要有幾種設計,如表 23.1。

表 23.1 等化的主要資料蒐集設計
設計 作法 如何分辨難度與能力
單組 同一群人考兩份題本 能力相同,分數差即難度差
隨機組 隨機分派兩群人各考一份 能力等價,分數差即難度差
共同題非等組 兩群人各考一份,但共享一組錨題 以錨題分數估計並校正能力差

註 共同題非等組即 NEAT 設計。錨題(anchor items)是兩題本共有的一組題目,用以連結兩個非等組的能力量尺。

單組設計讓同一群人考兩份題本,由於能力相同,分數之差便純由題本難度造成;但它有疲勞與練習等順序效應,故常改用平衡的變體。隨機組設計把大群人隨機分派,各考一份題本,靠隨機化(第十章)保證兩組能力在機率上等價,於是分數差同樣可歸於難度。這兩種設計乾淨,卻要求同一時間有大量考生可供施測。最貼近實務、也最重要的,是共同題非等組設計(non-equivalent groups with anchor test, NEAT):兩年的考生本就是不同的兩群,無法隨機分派,但只要在兩年的題本中嵌入一組相同的錨題,便能以考生在錨題上的表現,估計並校正兩群之間的能力差異,再據以等化。錨題於是扮演了連結兩個非等組量尺的橋樑,其品質至關重要,這一點稍後再談。

古典等化方法

有了資料,便可施行等化。等化、量尺化與連結的整套方法,其權威的系統整理見 Kolen & Brennan (2014);古典測驗理論架構下的等化方法,依其對「分數轉換該長什麼樣」的假設,由簡到繁分為幾種。

最簡單的是平均數等化,只調整兩題本的平均差,假設難度差在所有分數點上都相同。線性等化(linear equating)則更進一步,同時對齊平均數與標準差,如下面的方塊所示。等百分位等化(equipercentile equating)最有彈性,它讓「兩題本上百分等級相同的分數」相互對應,能處理難度差在不同分數點上不一致的情形,代價是需要大樣本,且其結果常須先經前平滑(presmoothing,如對數線性平滑)以去除抽樣雜訊。

推導方塊線性等化的斜率與截距

線性等化假設兩題本分數轉換後,不僅平均數相等,標準差也相等。設題本 X 與 Y 的分數平均與標準差分別為 (\mu_X,\sigma_X) 與 (\mu_Y,\sigma_Y)。要把 X 的分數轉換到 Y 的量尺,令轉換後的 z 分數相等,即 (x-\mu_X)/\sigma_X = (y-\mu_Y)/\sigma_Y,解得

y = \frac{\sigma_Y}{\sigma_X}(x - \mu_X) + \mu_Y = \underbrace{\frac{\sigma_Y}{\sigma_X}}_{\text{斜率}}\,x + \underbrace{\left(\mu_Y - \frac{\sigma_Y}{\sigma_X}\mu_X\right)}_{\text{截距}}.

斜率與截距完全由兩題本分數的一階與二階動差決定。在 NEAT 設計下,由於兩組非等組,\mu 與 \sigma 無法直接觀測,須借助錨題來估計:Tucker 法假設「錨題對總分的迴歸」跨組相同,Levine 法則假設「真分數層次的迴歸關係」跨組相同,兩者的假設不同,在兩組能力差異較大時會給出不同的等化結果。

古典等化方法簡便,但共有一個限制:它們作用於「觀察分數」,因而其結果依賴於特定的題本與樣本,難以支撐長期、跨多個題本的量尺維護。這正是 IRT 取向的用武之地,詳見後文。就兩年入學考試而言,若兩年考生能力差異不大,線性等化往往已足;若各分數段的相對難度不一,則須動用等百分位等化。

核等化:一個統一觀

上述古典方法看似各自為政,Davier et al. (2004) 的核等化(kernel equating)則提供了一個把它們統一起來的框架。它把等百分位等化的整個流程,拆解為五個清楚的步驟:前平滑、估計目標母體上的分數機率、連續化、計算並診斷等化函數、以及計算等化標準誤。

核等化的一個關鍵貢獻,是「連續化」這一步:離散的測驗分數(如整數的答對題數)本不連續,傳統等百分位法以線性內插勉強處理,核等化則以核平滑(kernel smoothing)把離散分數分布轉為平滑的連續分布,再據以求等化函數。這個做法不僅在數學上更優雅,也讓線性等化與等百分位等化成為同一框架下、由平滑參數所調節的兩個端點:平滑帶寬取極大時趨近線性等化,取適中時則接近等百分位等化。核等化因此不只是又一種方法,更是一個能容納既有方法、並附帶一致的標準誤估計的統一觀點。

IRT 連結與等化

古典等化的樣本依賴性,使它不適合需要長期維護、反覆更新的大型題庫。項目反應理論(第十七章)的參數不變性,恰好對症下藥:只要把不同題本的題目參數放到同一個 \theta 量尺上,分數的比較便有了不依賴特定樣本的共同基礎。然而,由不同批資料分開校準所得的 IRT 參數,其量尺的原點與單位是任意的,必須先經量尺轉換對齊。

推導方塊IRT 量尺轉換與 Stocking-Lord 準則

IRT 的 \theta 量尺有一個不定性:對能力做線性轉換 \theta^* = A\theta + B,只要題目參數相應調整(a^* = a/A、b^* = Ab + B),模型的答對機率不變。因此,連結兩份分開校準的題本,等於估計出正確的 (A,B)。動差法如 mean/mean 或 mean/sigma,直接由錨題參數的平均與標準差解出 A、B,簡便卻只用到參數的動差。特徵曲線法則更充分地利用資訊。Haebara (1980) 的準則,最小化錨題在兩量尺上「個別項目反應函數」之差的平方和;Stocking & Lord (1983) 的準則則最小化「測驗特徵曲線」(所有錨題答對機率之和)之差:

\min_{A,B}\ \sum_{\theta}\Big[\sum_{i\in\text{anchor}} P_i(\theta) - \sum_{i\in\text{anchor}} P_i^{*}(\theta;A,B)\Big]^2,

在若干代表性的 \theta 點上求和。Stocking-Lord 法因整合了整條測驗特徵曲線,通常比動差法更穩健,是 IRT 連結的常用選擇。

除了「先分開校準、再轉換量尺」這條路,還有兩種替代。同時校準(concurrent calibration)把兩題本的資料合併,一次估計所有參數,錨題自動落在同一量尺上,省去了事後轉換;但它把所有假設綁在一起,錨題若有問題會汙染全局。固定參數校準(fixed parameter calibration)則在校準新題本時,把錨題參數固定為題庫中的既有值,使新題直接進入既有量尺,特別適合題庫的持續維護。這三種取向各有取捨,共同構成了 IRT 連結的工具箱。

等化誤差與母體不變性

等化不是一個確定的轉換,而是由樣本估計出來的,因而帶有抽樣誤差,即等化標準誤(standard error of equating, SEE)。等化標準誤衡量「若換一批樣本重做等化,轉換結果會變動多少」,在錄取分數線附近尤其關鍵:若切截分數落在等化誤差較大的分數段,則少數幾分的差異可能純由等化的不確定性造成,足以影響錄取結果。因此,一份負責任的等化,應報告各分數點的等化標準誤,而非只給一條轉換曲線。

一個更深刻的品質判準,是母體不變性(population invariance)。理想的等化,其轉換關係不應隨「用哪個次群體來估計」而改變:若以男生估出的等化與以女生估出的等化明顯不同,即代表兩題本並非真正的複本,對不同群體並不等價。母體不變性因此是「等化是否成立」的一個實質檢驗,它與第十九章的測量不變性一脈相承:兩者都在追問「這個轉換或這把尺,是否對所有群體都一樣」。若母體不變性嚴重不成立,則問題已不在等化方法,而在題本本身,此時任何等化都無法真正修補其不公平。

垂直量尺化:測「成長」的尺

前面談的等化,都預設兩題本測「同一構念、同一難度規格」。但有一類需求打破了這個前提,即測量跨年級的學業成長:要說「某生從三年級到五年級,數學進步了多少」,就得把三年級與五年級的分數放到同一把尺上,而這兩個年級的題目,難度與涵蓋範圍本就大不相同。這種跨越不同難度、不同年級測驗的量尺建構,稱為垂直量尺化(vertical scaling)。

垂直量尺化在技術上,常以跨年級共享的錨題,配合 IRT 把各年級的能力放到單一個連續量尺上。但它與嚴格的等化有一個根本差異,也是其詮釋風險的來源:各年級的測驗並非複本,它們測的甚至可能不完全是同一個構念,例如三年級的「數學」與五年級的「數學」在內容上已有質的變化。因此,垂直量尺上的「一個單位」,在低年級與高年級是否代表相同的成長量,是可疑的;由此量尺算出的「成長幅度」是否可跨年級直接比較,更須格外審慎。垂直量尺化提供了談論成長的共同語言,卻不保證這個語言的每個字在不同年級都是同義的。這一量尺,是第二十九章縱貫與成長模型賴以談論「變化」的基礎,但也繼承了那裡對「變化是否可比」的一切保留。

大型評量:矩陣抽樣、潛在迴歸與擬真值

國際大型評量,如 PISA、TIMSS 與美國的 NAEP,把等化與量尺化的技術推向了一個更複雜、也更精巧的高峰。它們面臨一個特殊的困境:欲測量的題庫龐大,遠非任何一位學生所能作答完畢,但目的又不在為個別學生評分,而在精確估計「群體」的能力分布及其與各種背景變項的關係。

其解法環環相扣。首先是矩陣抽樣與輪替題本(第十三章):把龐大的題庫拆成許多題組,每位學生只隨機作答其中一份題本,如此任何一位學生對「未分派到的題目」都是缺失,但由於分派隨機,這些缺失在設計上即為隨機缺失,群體參數仍能被無偏地估回。其次是潛在迴歸(latent regression):由於每位學生只答少數題目,其個別能力估計極不可靠,故模型直接把「能力的母體分布」設為背景變項(性別、社經、學校等)的迴歸函數,即所謂條件化(conditioning),藉由納入大量背景資訊,把個別的、雜訊很大的能力估計,匯集為對群體分布的精確推論。最後,也是最關鍵的一步,是擬真值(plausible values)的產生,它把前兩者的成果,轉化為可供次級分析使用的形式。

擬真值的正確使用與常見錯誤

擬真值是理解大型評量資料的鑰匙,而它的本質,正是第十三章缺失資料原理的一次漂亮應用。Mislevy (1991) 的洞見是:既然每位學生的「真實能力」從未被直接觀測、只能由其少數作答間接推知,那麼這個能力本身就是一種缺失資料;與其為每人硬估一個不可靠的點,不如自其能力的後驗分布中「抽取」若干個值。

推導方塊擬真值即潛在變項的多重插補

對每位學生,依其作答與背景變項,可導出其能力 \theta 的後驗分布 p(\theta \mid \mathbf{x}, \mathbf{z})。擬真值即自此後驗分布抽取的 M 個隨機值 \theta^{(1)}, \dots, \theta^{(M)}(典型為 M=5 或 10)。這與第十三章多重插補的邏輯完全對應:那個未觀測的潛在能力,被視為缺失資料,擬真值就是它的多重插補。因此,以擬真值做次級分析,須遵循 Rubin 的合併規則:對每一組擬真值各跑一次分析,再把 M 組結果合併,其中組間變異捕捉了「能力估計本身的不確定性」。合併後的總變異為

T = \bar{U} + \Big(1 + \tfrac{1}{M}\Big) B,

其中 \bar{U} 為各組內變異之平均、B 為 M 組估計之間的變異。忽略 B,便系統性地低估了不確定性。

理解了「擬真值即多重插補」,便能看清次級分析中兩個極常見、卻後果嚴重的錯誤。第一個錯誤,是把擬真值當成個別學生的能力分數:擬真值是為「群體推論」而生的隨機抽取,任何單一個擬真值都不是某個學生的可靠估計,用它來排名或評判個別學生,是對其本質的根本誤解。第二個錯誤,是只用一組擬真值就做分析,並把它當成確定值:這等於忽略了組間變異 B,會系統性地低估標準誤、使 p 值過度樂觀,重蹈第十三章單一插補的覆轍。正確的作法,是把全部 M 組擬真值都納入,各跑一次、再依合併規則整合。就 PISA 台灣資料而言,若要估計「數學素養與家庭社經地位的關聯」,須對每一組擬真值各跑一次迴歸,再合併其係數與標準誤;唯有如此,所得的關聯估計及其不確定性,才是誠實的。

前沿:跨模式、小樣本與題庫時代的連結

連結與等化的技術,正面臨若干新的挑戰。其一是跨模式連結:當測驗由紙筆轉為數位施測,同一份試卷在兩種模式下的難度可能系統性地不同,這種模式效應若不加校正,便會汙染跨模式的分數比較,如何建立紙筆與數位之間的連結,是當前的實務難題。其二是小樣本等化:傳統等化多假設大樣本,但許多情境,如小型證照考試,樣本有限,晚近發展的圓弧等化(circle-arc)等方法,正是為在小樣本下取得較穩健的等化而設計。其三是題庫時代的連結:在電腦化適性測驗與多階段測驗(第二十四章)中,每位考生所見的題目各不相同,傳統「兩份固定題本」的等化框架不再適用,取而代之的是持續維護整個題庫量尺的一致性,這使連結由一次性的事件,變為一項長期的品管工作。此外,機測寫作與評分者飄移(第二十六章)也會威脅跨年度的連結,而國際比較所需的跨語言可比性,則直接回到第十九章測量不變性的課題。這些前沿的共同主題是:當測驗的形式愈來愈多樣、愈來愈動態,「維持同一把尺」也就愈來愈是一項需要持續經營、而非一勞永逸的工程。

小結

本章回答了作業型心理計量最核心的問題:不同題本、年度與年級的分數,如何被放到同一把尺上,以致可以公平比較。這需要一整套環環相扣的技術:先建立分數量尺,再以妥善的資料蒐集設計,即單組、隨機組或共同題非等組,分開題本難度與考生能力,配合古典的線性與等百分位等化、統一的核等化、或不依賴樣本的 IRT 連結,把不同題本的分數對齊,最後以等化標準誤與母體不變性評鑑其品質。垂直量尺化把這套技術延伸到跨年級的成長測量,而大型評量的矩陣抽樣、潛在迴歸與擬真值,則把 IRT、缺失資料與抽樣三條線索,整合為一套精巧的群體推論方法學。

貫穿全章的兩年入學考試實例顯示,「今年比較難」這句日常的抱怨,唯有經過一整套設計、等化與誤差評鑑,才能被嚴謹地回答;而 PISA 資料的擬真值用法則提醒,即便手握精巧的資料,若不理解其背後「擬真值即多重插補」的本質,也極易誤用。至此,測驗的量尺已被建立與維護。接下來的第二十四章,將轉向另一種讓測量更有效率的技術,即依受測者的能力即時選題的電腦化適性測驗,而它對題庫量尺一致性的仰賴,正建立在本章所奠定的連結基礎之上。

參考文獻

Davier, A. A. von, Holland, P. W., & Thayer, D. T. (2004). The kernel method of test equating. Springer.
Haebara, T. (1980). Equating logistic ability scales by a weighted least squares method. Japanese Psychological Research, 22(3), 144–149. https://doi.org/10.4992/psycholres1954.22.144
Holland, P. W., & Dorans, N. J. (2006). Linking and equating. In R. L. Brennan (Ed.), Educational measurement (4th ed., pp. 187–220). American Council on Education/Praeger.
Kolen, M. J., & Brennan, R. L. (2014). Test equating, scaling, and linking: Methods and practices (3rd ed.). Springer.
Mislevy, R. J. (1991). Randomization-based inference about latent variables from complex samples. Psychometrika, 56(2), 177–196. https://doi.org/10.1007/BF02294457
Stocking, M. L., & Lord, F. M. (1983). Developing a common metric in item response theory. Applied Psychological Measurement, 7(2), 201–210. https://doi.org/10.1177/014662168300700208
本章引用格式游琇婷(2026)。量尺化、等化與連結。《計量心理學:測量、模型與推論》(第 23 章)。