量尺化、等化與連結
每年大型入學考試放榜,總有一種聲音:「今年數學特別難。」這句看似日常的抱怨,其實藏著一個心理計量的硬核問題。今年考生的平均分數比去年低了五分,這究竟是因為今年這批考生程度較弱,還是因為今年的題本本身較難?若不能把這兩種可能分開,那麼把今年的分數與去年直接相比、據以判斷「這屆學生變差了」或「今年考題出難了」,都只是各執一詞的猜測。更嚴重的是,若兩年的分數不可比,那麼以同一條錄取分數線跨年適用,便對其中一屆考生不公平。
本章要處理的,正是作業型心理計量最核心的實務問題:不同題本、不同年度、不同年級所得到的分數,如何被放到同一把尺上,以致可以公平地相互比較。這需要一整套環環相扣的技術,即先建立分數量尺,再以妥善的資料蒐集設計,配合適當的統計方法把不同題本的分數等化,最後評鑑等化的品質。本章也是前面數章的一次整合應用:它把第十七章的項目反應理論、第十三章的缺失資料原理、與第九章的複雜抽樣,組裝為一套可操作的作業流程,並以大型評量的擬真值方法學收尾。全章以「一場全國性入學考試的兩個年度題本」為貫穿實例,從「今年比較難」的輿論出發,走完設計、等化與誤差評鑑,末節再以 PISA 台灣資料的次級分析,示範擬真值的正確用法。
分數量尺的建立
在比較分數之前,得先問分數本身是什麼。最原始的原始分(raw score),即答對題數或加總得分,看起來客觀,其實只是一筆紀錄:它記下某位考生在某一份特定題本上做對了幾題,卻沒有說這個數字在能力的尺度上落在哪裡。麻煩正出在這種綁定關係。原始分綁定於特定的題本,同樣答對三十題,在難卷與易卷上代表的能力並不相同;它也綁定於特定的題數與計分方式,四十題測驗的三十分與六十題測驗的三十分,根本不是同一件事。因此,在談等化之前,得先把原始分轉換到一個意義較穩定、也較便於解讀的量尺上。本節要回答三個問題:常用的分數量尺各在做什麼樣的轉換,它們各自方便在哪裡、陷阱又在哪裡,以及為什麼量尺建立得再細緻,也仍然解決不了跨題本比較的難題。
常見的轉換有幾種。百分等級(percentile rank)把原始分轉為「贏過多少比例的人」,直觀卻是次序量尺,其間距不等,不宜直接做加減平均。標準分數(standard score)如 z 分數,把原始分減去平均、除以標準差,使分數以「距平均幾個標準差」表達,便於跨測驗比較,卻仍受原始分分布形狀的影響。常態化量尺(normalized scale)則進一步透過非線性轉換,把偏態的原始分分布「拉正」為常態,常見的如 T 分數與各種標準九量尺。須留意的是,分數量尺的建立本身就是一種選擇,它決定了「分數看起來如何、如何被解讀」,而不同的量尺各有其解讀上的便利與陷阱。
設想本章貫穿的那場入學考試。去年數學卷的原始分平均為 62 分、標準差 12 分,某位考生考了 74 分,其 z 分數為 (74-62)/12 = 1.0,換算成平均 50、標準差 10 的 T 分數就是 60,讀作「高於全體考生一個標準差」。若改以百分等級表達,在常態分布的假定下約為 84,讀作「贏過約八成四的同屆考生」。同一份成績,三種量尺說的是同一件事,但 z 分數與 T 分數的刻度等距,可以相加、平均;百分等級則不然,從百分等級 84 再往上推到 94,所需的實力增幅遠大於從 50 推到 60,把百分等級拿來算平均,等於默認了一件它並不成立的事。然而,無論建立了多漂亮的量尺,只要它是從「單一題本」推導的,就仍解決不了跨題本比較的問題,這就帶到等化。
等化的定義與公平性條件
上一節把分數放上了一把較好解讀的尺,但那把尺仍然長在單一題本上。要讓兩份題本的分數互通,需要的是另一件事:一條把甲卷的分數翻譯成乙卷分數的對應規則。等化(equating)就是這樣一種翻譯,而且是其中最嚴格的一種。它的直覺其實很單純,即回答「這位考生若當初抽到的是另一份題本,大概會拿幾分」,把這個問題對每一個分數點各回答一次,得到的對應關係就是等化函數。正式地說,等化是在兩份「測量同一構念、且依同一規格編製」的複本測驗之間,建立一個分數轉換,使得轉換之後,考生拿到哪一份題本都無所謂,其分數可以互換使用。等化之所以嚴格,在於它宣稱兩份題本「可以互相替代」,這是一個很強的主張,強到並非任何兩份測驗都配得上這個詞。本節要處理的,正是這個詞的邊界:它與較寬鬆的量尺對準、預測差在哪裡,以及它所要求的公平性條件究竟在要求什麼。
Holland & Dorans (2006) 把「把分數放上同一把尺」的各種作法,排成一個由強到弱的光譜:
等化(equating):最嚴格。要求兩測驗測同一構念、同一規格、信度相近,轉換後分數可完全互換。
量尺對準(scale aligning):較弱。把測不同構念、或不同規格的測驗分數放到同一量尺上,便於比較,但分數不可互換。
預測(predicting):最弱。以一份測驗的分數去預測另一份,兩者不對稱,且預測本身有誤差。
三者常被籠統地稱為「連結」,但其可比性的強度天差地別;把一個「弱連結」當成「等化」來使用,是實務中常見而危險的誤用。
等化的正當性,建立在若干嚴格的條件之上。除了同構念、同規格,還有 Lord 提出的公平性條件:一個理想的等化,應使得「對任何一位考生而言,考哪一份題本都同樣公平」,亦即轉換後兩題本在各能力水準上都給出等價的分數。這個條件其實隱含了一個近乎弔詭的結論,即唯有當兩份題本「完全相同」時,嚴格的等化才可能無瑕地達成;現實中的題本總有差異,故等化永遠是一種近似。理解這一點很重要:等化不是把差異「變不見」的魔法,而是在承認差異的前提下,盡可能建立一個公平的分數對應。就兩年的入學考試而言,唯有當兩份數學卷確實測同一套數學能力、依同一藍圖編製時,談論「把兩年分數等化」才有意義。
公平性條件實際上在要求什麼,用分數說最清楚。設想去年甲卷與今年乙卷經等化之後,對能力中等的考生確實對齊了,兩卷換算後的期望分數同為 62 分。但乙卷的難題比例偏高,能力最強的一群考生在乙卷上受到題目上限的擠壓,換算後仍比在甲卷少拿約 3 分。此時就整體平均而言,兩卷看起來已經等化,公平性條件卻在高分段被違反,而錄取分數線偏偏落在那一段。Lord 的條件要求的正是「在每一個能力水準上都等價」這種嚴格意義的公平,而不只是把兩條分布的中心對齊;一個只對平均負責的轉換,很可能對最需要精確的那一群考生最不公平。
資料蒐集設計:等化的實驗設計學
等化要能進行,必須先有能夠「分開題本難度與考生能力」的資料,而這件事無法靠統計方法事後補救,它取決於資料當初是怎麼蒐集的。困難的根源在於:實際觀測到的只有分數,而分數同時由兩件事決定,即這群人有多強、這份卷有多難。一個式子裡有兩個未知數,因此只看今年考生在今年題本上的表現,永遠無從判斷平均下降五分究竟該記在誰頭上。可行的出路只有一條,就是在設計上先讓其中一個未知數變成已知:或者安排兩份題本面對能力相同的人,或者讓兩群不同的人做到一組相同的題目。這正是一個實驗設計的問題,呼應第十章的設計思維:如何蒐集資料,才能識別出我們想要的量。主要的作法有三種,如表 23.1。
| 設計 | 作法 | 如何分辨難度與能力 |
|---|---|---|
| 單組 | 同一群人考兩份題本 | 能力相同,分數差即難度差 |
| 隨機組 | 隨機分派兩群人各考一份 | 能力等價,分數差即難度差 |
| 共同題非等組 | 兩群人各考一份,但共享一組錨題 | 以錨題分數估計並校正能力差 |
註 共同題非等組即 NEAT 設計。錨題(anchor items)是兩題本共有的一組題目,用以連結兩個非等組的能力量尺。
單組設計讓同一群人考兩份題本,由於能力相同,分數之差便純由題本難度造成;但它有疲勞與練習等順序效應,故常改用平衡的變體。隨機組設計把大群人隨機分派,各考一份題本,靠隨機化(第十章)保證兩組能力在機率上等價,於是分數差同樣可歸於難度。這兩種設計乾淨,卻要求同一時間有大量考生可供施測。最貼近實務、也最重要的,是共同題非等組設計(non-equivalent groups with anchor test, NEAT):兩年的考生本就是不同的兩群,無法隨機分派,但只要在兩年的題本中嵌入一組相同的錨題,便能以考生在錨題上的表現,估計並校正兩群之間的能力差異,再據以等化。錨題於是扮演了連結兩個非等組量尺的橋樑,其品質也就至關重要。
錨題的品質之所以關鍵,是因為 NEAT 設計的全部推論都壓在這一小組題目上。錨題必須是整份題本的縮影:內容涵蓋的比例與難度的分布都要像它所代表的卷子,題數一般建議占全卷的兩成以上,且在兩份題本中的位置與呈現方式盡量一致。一旦錨題本身在兩年之間並不等值,等化就會把「這幾題變簡單了」誤讀成「今年考生變強了」。設想錨題共 20 題,去年考生平均答對 12 題,今年平均答對 13 題,表面上今年程度較佳;但若其中兩題因課程調整或題型外流而變得人人會答,真正的能力差距其實接近於零,等化卻會依那多出來的一題,判定今年考生較強,於是在轉換時對今年每位考生多扣去約一分,而這一分在錄取線上足以決定去留。實務上因此會逐題檢驗錨題的難度是否飄移,把表現異常的題目自錨題組中剔除,再重新等化。
古典等化方法
有了能夠分辨難度與能力的資料,接下來要決定的是:該用什麼形狀的函數,把一份題本的分數換算到另一份上。等化、量尺化與連結的整套方法,其權威的系統整理見 Kolen & Brennan (2014);古典測驗理論架構下的各種等化方法,差別其實只在一件事,即容許這條轉換曲線擁有多大的自由度。自由度給得愈少,背後的假設就愈強,但需要的樣本也愈少;自由度給得愈多,轉換愈能貼合資料的實際形狀,卻也愈容易把抽樣雜訊一併學了進去。以下由簡到繁的三種方法,正好排在這條取捨線上,讀完本節應能判斷手上的資料適合停在哪一格。
最簡單的是平均數等化,只調整兩題本的平均差,假設難度差在所有分數點上都相同。線性等化(linear equating)則更進一步,同時對齊平均數與標準差,如下面的方塊所示。等百分位等化(equipercentile equating)最有彈性,它讓「兩題本上百分等級相同的分數」相互對應,能處理難度差在不同分數點上不一致的情形,代價是需要大樣本,且其結果常須先經前平滑(presmoothing,如對數線性平滑)以去除抽樣雜訊。
線性等化假設兩題本分數轉換後,不僅平均數相等,標準差也相等。設題本 X 與 Y 的分數平均與標準差分別為 (\mu_X,\sigma_X) 與 (\mu_Y,\sigma_Y)。要把 X 的分數轉換到 Y 的量尺,令轉換後的 z 分數相等,即 (x-\mu_X)/\sigma_X = (y-\mu_Y)/\sigma_Y,解得
斜率與截距完全由兩題本分數的一階與二階動差決定,即平均數與標準差。在 NEAT 設計下,由於兩組非等組,\mu 與 \sigma 無法直接觀測,須借助錨題來估計:Tucker 法假設「錨題對總分的迴歸」跨組相同,Levine 法則假設「真分數層次的迴歸關係」跨組相同,兩者的假設不同,在兩組能力差異較大時會給出不同的等化結果。
把數字代進去,三種方法的差別立刻看得出來。設想去年甲卷的平均為 62 分、標準差 12 分,今年乙卷的平均為 58 分、標準差 15 分,現在要把今年的分數換算到去年的量尺上。平均數等化只看兩者相差的 4 分,於是今年考 70 分的考生一律加 4 分,換算為去年的 74 分。線性等化則同時顧及離散程度,依上式得 y = (12/15)(70-58)+62 = 71.6,即今年的 70 分只相當於去年的 71.6 分。同一個分數點,兩種作法差了 2.4 分,原因在於乙卷的分數較為分散,同樣高出平均 12 分,在乙卷上的相對位置並不如在甲卷上突出。若再進一步發現兩卷的難度差在低分段有 6 分、在高分段卻只有 2 分,那麼任何一條直線都無法同時照顧兩端,此時就得改用等百分位等化,讓兩卷上百分等級相同的分數逐點對應。
古典等化方法簡便,但共有一個限制:它們作用於「觀察分數」,因而其結果依賴於特定的題本與樣本,難以支撐長期、跨多個題本的量尺維護。這正是 IRT 取向的用武之地,詳見後文。就兩年入學考試而言,若兩年考生能力差異不大,線性等化往往已足;若各分數段的相對難度不一,則須動用等百分位等化。
核等化:一個統一觀
上述古典方法看似各自為政:平均數等化、線性等化與等百分位等化各有一套推導,也各有一套標準誤公式,實務上要判斷它們孰優孰劣,往往只能憑經驗與慣例。Davier et al. (2004) 提出的核等化(kernel equating)改變了這個局面。它提供一個能把上述方法全部納入的框架,使得「該選哪一種等化」不再是換一套理論,而是在同一個框架內調節一個參數。核等化把等百分位等化的整個流程,拆解為五個界線清楚的步驟:前平滑、估計目標母體上的分數機率、連續化、計算並診斷等化函數,以及計算等化標準誤。每一步都對應明確的統計模型,估計的不確定性因此能夠一路傳遞到最後的等化函數上。
核等化的一個關鍵貢獻,是「連續化」這一步:離散的測驗分數(如整數的答對題數)本不連續,傳統等百分位法以線性內插勉強處理,核等化則以核平滑(kernel smoothing)把離散分數分布轉為平滑的連續分布,再據以求等化函數。這個做法不僅在數學上更優雅,也讓線性等化與等百分位等化成為同一框架下、由平滑參數所調節的兩個端點:平滑帶寬取極大時趨近線性等化,取適中時則接近等百分位等化。核等化因此不只是又一種方法,更是一個能容納既有方法、並附帶一致的標準誤估計的統一觀點。
IRT 連結與等化
古典等化的樣本依賴性,使它不適合需要長期維護、反覆更新的大型題庫。項目反應理論(第十七章)的參數不變性,恰好對症下藥:只要把不同題本的題目參數放到同一個 \theta 量尺上,分數的比較便有了不依賴特定樣本的共同基礎。然而,由不同批資料分開校準所得的 IRT 參數,其量尺的原點與單位是任意的,必須先經量尺轉換對齊。
IRT 的 \theta 量尺有一個不定性:對能力做線性轉換 \theta^* = A\theta + B,只要題目參數相應調整(a^* = a/A、b^* = Ab + B),模型的答對機率不變。因此,連結兩份分開校準的題本,等於估計出正確的 (A,B)。動差法如 mean/mean 或 mean/sigma,直接由錨題參數的平均與標準差解出 A、B,簡便卻只用到參數的動差。特徵曲線法則更充分地利用資訊。Haebara (1980) 的準則,最小化錨題在兩量尺上「個別項目反應函數」之差的平方和;Stocking & Lord (1983) 的準則則最小化「測驗特徵曲線」(所有錨題答對機率之和)之差:
在若干代表性的 \theta 點上求和。Stocking-Lord 法因整合了整條測驗特徵曲線,通常比動差法更穩健,是 IRT 連結的常用選擇。
這兩個常數在做什麼,用數字讀一次就清楚了。假定今年的題本單獨校準之後,其錨題參數與題庫中既有的值相比,需要 A = 1.05、B = 0.32 才能對齊。那麼今年某位考生的能力估計 \theta = 0.50,換算到題庫量尺上便是 1.05 \times 0.50 + 0.32 = 0.85。其中 B = 0.32 說的是兩次校準的原點相差約三分之一個標準差,A = 1.05 說的是單位略有伸縮。若省去這一步而直接比較兩年的 \theta,那 0.32 個純屬量尺原點的差距,就會被誤讀成今年考生的實質進步。
除了「先分開校準、再轉換量尺」這條路,還有兩種替代。同時校準(concurrent calibration)把兩題本的資料合併,一次估計所有參數,錨題自動落在同一量尺上,省去了事後轉換;但它把所有假設綁在一起,錨題若有問題會汙染全局。固定參數校準(fixed parameter calibration)則在校準新題本時,把錨題參數固定為題庫中的既有值,使新題直接進入既有量尺,特別適合題庫的持續維護。這三種取向各有取捨,共同構成了 IRT 連結的工具箱。
等化誤差與母體不變性
等化不是一個確定的轉換,而是由樣本估計出來的,因而帶有抽樣誤差,即等化標準誤(standard error of equating, SEE)。等化標準誤衡量「若換一批樣本重做等化,轉換結果會變動多少」,在錄取分數線附近尤其關鍵:若切截分數落在等化誤差較大的分數段,則少數幾分的差異可能純由等化的不確定性造成,足以影響錄取結果。因此,一份負責任的等化,應報告各分數點的等化標準誤,而非只給一條轉換曲線。
一個更深刻的品質判準,是母體不變性(population invariance)。理想的等化,其轉換關係不應隨「用哪個次群體來估計」而改變:若以男生估出的等化與以女生估出的等化明顯不同,即代表兩題本並非真正的複本,對不同群體並不等價。母體不變性因此是「等化是否成立」的一個實質檢驗,它與第十九章的測量不變性一脈相承:兩者都在追問「這個轉換或這把尺,是否對所有群體都一樣」。若母體不變性嚴重不成立,則問題已不在等化方法,而在題本本身,此時任何等化都無法真正修補其不公平。
垂直量尺化:測「成長」的尺
前面談的等化,都預設兩題本測「同一構念、同一難度規格」。但有一類需求打破了這個前提,即測量跨年級的學業成長:要說「某生從三年級到五年級,數學進步了多少」,就得把三年級與五年級的分數放到同一把尺上,而這兩個年級的題目,難度與涵蓋範圍本就大不相同。這種跨越不同難度、不同年級測驗的量尺建構,稱為垂直量尺化(vertical scaling)。
垂直量尺化在技術上,常以跨年級共享的錨題,配合 IRT 把各年級的能力放到單一個連續量尺上。但它與嚴格的等化有一個根本差異,也是其詮釋風險的來源:各年級的測驗並非複本,它們測的甚至可能不完全是同一個構念,例如三年級的「數學」與五年級的「數學」在內容上已有質的變化。因此,垂直量尺上的「一個單位」,在低年級與高年級是否代表相同的成長量,是可疑的;由此量尺算出的「成長幅度」是否可跨年級直接比較,更須格外審慎。
假定某套跨年級數學測驗的垂直量尺上,三年級的平均為 200 分、五年級的平均為 240 分,兩年之間的成長是 40 分。這 40 分裡,有多少來自「同一種數學能力長高了」,又有多少來自「五年級的數學早已換成另一批內容」,量尺本身並不會回答。水平等化的兩份題本是複本,差異只在難度;垂直量尺化的兩份題本卻連所測的東西都可能不同,這正是它遠比水平等化困難的原因。
垂直量尺化提供了談論成長的共同語言,卻不保證這個語言的每個字在不同年級都是同義的。這一量尺,是第二十九章縱貫與成長模型賴以談論「變化」的基礎,但也繼承了那裡對「變化是否可比」的一切保留。
大型評量:矩陣抽樣、潛在迴歸與擬真值
國際大型評量,如 PISA、TIMSS 與美國的 NAEP,把等化與量尺化的技術推向了一個更複雜、也更精巧的高峰。它們面臨一個特殊的困境:欲測量的題庫龐大,遠非任何一位學生所能作答完畢,但目的又不在為個別學生評分,而在精確估計「群體」的能力分布及其與各種背景變項的關係。這個目的上的翻轉,是理解後續整套作法的關鍵:一旦不必為每一位學生給出可靠的個人分數,就可以用「每人只作答一小部分題目」換取「題庫涵蓋面完整」,而所付出的代價,則轉由統計模型來承擔。本節要說明的,正是矩陣抽樣、潛在迴歸與擬真值三者如何分工,把這筆帳算平。
其解法環環相扣。首先是矩陣抽樣與輪替題本(第十三章):把龐大的題庫拆成許多題組,每位學生只隨機作答其中一份題本,如此任何一位學生對「未分派到的題目」都是缺失,但由於分派隨機,這些缺失在設計上即為隨機缺失,群體參數仍能被無偏地估回。其次是潛在迴歸(latent regression):由於每位學生只答少數題目,其個別能力估計極不可靠,故模型直接把「能力的母體分布」設為背景變項(性別、社經、學校等)的迴歸函數,即所謂條件化(conditioning),藉由納入大量背景資訊,把個別的、雜訊很大的能力估計,匯集為對群體分布的精確推論。最後,也是最關鍵的一步,是擬真值(plausible values)的產生,它把前兩者的成果,轉化為可供次級分析使用的形式。
擬真值的正確使用與常見錯誤
擬真值是理解大型評量資料的鑰匙,而它的本質,正是第十三章缺失資料原理的一次漂亮應用。Mislevy (1991) 的洞見是:既然每位學生的「真實能力」從未被直接觀測、只能由其少數作答間接推知,那麼這個能力本身就是一種缺失資料;與其為每人硬估一個不可靠的點,不如自其能力的後驗分布中「抽取」若干個值。這個作法初看有些奇怪,卻正是為了誠實面對「個別能力估不準」這件事,而不是假裝它不存在。本節要說明的,是擬真值為何以這種形式存在,以及次級分析者若不明白它的來歷,最容易犯下哪兩個錯誤。
對每位學生,依其作答與背景變項,可導出其能力 \theta 的後驗分布 p(\theta \mid \mathbf{x}, \mathbf{z})。擬真值即自此後驗分布抽取的 M 個隨機值 \theta^{(1)}, \dots, \theta^{(M)}(典型為 M=5 或 10)。這與第十三章多重插補的邏輯完全對應:那個未觀測的潛在能力,被視為缺失資料,擬真值就是它的多重插補。因此,以擬真值做次級分析,須遵循 Rubin 的合併規則:對每一組擬真值各跑一次分析,再把 M 組結果合併,其中組間變異捕捉了「能力估計本身的不確定性」。合併後的總變異為
其中 \bar{U} 為各組內變異之平均、B 為 M 組估計之間的變異。忽略 B,便系統性地低估了不確定性。
理解了「擬真值即多重插補」,便能看清次級分析中兩個極常見、卻後果嚴重的錯誤。第一個錯誤,是把擬真值當成個別學生的能力分數:擬真值是為「群體推論」而生的隨機抽取,任何單一個擬真值都不是某個學生的可靠估計,用它來排名或評判個別學生,是對其本質的根本誤解。第二個錯誤,是只用一組擬真值就做分析,並把它當成確定值:這等於忽略了組間變異 B,會系統性地低估標準誤、使 p 值過度樂觀,重蹈第十三章單一插補的覆轍。正確的作法,是把全部 M 組擬真值都納入,各跑一次、再依合併規則整合。就 PISA 台灣資料而言,若要估計「數學素養與家庭社經地位的關聯」,須對每一組擬真值各跑一次迴歸,再合併其係數與標準誤;唯有如此,所得的關聯估計及其不確定性,才是誠實的。
前沿:跨模式、小樣本與題庫時代的連結
連結與等化的技術,正面臨若干新的挑戰。其一是跨模式連結:當測驗由紙筆轉為數位施測,同一份試卷在兩種模式下的難度可能系統性地不同,這種模式效應若不加校正,便會汙染跨模式的分數比較,如何建立紙筆與數位之間的連結,是當前的實務難題。其二是小樣本等化:傳統等化多假設大樣本,但許多情境,如小型證照考試,樣本有限,晚近發展的圓弧等化(circle-arc)等方法,正是為在小樣本下取得較穩健的等化而設計。其三是題庫時代的連結:在電腦化適性測驗與多階段測驗(第二十四章)中,每位考生所見的題目各不相同,傳統「兩份固定題本」的等化框架不再適用,取而代之的是持續維護整個題庫量尺的一致性,這使連結由一次性的事件,變為一項長期的品管工作。此外,機測寫作與評分者飄移(第二十六章)也會威脅跨年度的連結,而國際比較所需的跨語言可比性,則直接回到第十九章測量不變性的課題。這些前沿的共同主題是:當測驗的形式愈來愈多樣、愈來愈動態,「維持同一把尺」也就愈來愈是一項需要持續經營、而非一勞永逸的工程。
小結
本章回答了作業型心理計量最核心的問題:不同題本、年度與年級的分數,如何被放到同一把尺上,以致可以公平比較。這需要一整套環環相扣的技術:先建立分數量尺,再以妥善的資料蒐集設計,即單組、隨機組或共同題非等組,分開題本難度與考生能力,配合古典的線性與等百分位等化、統一的核等化、或不依賴樣本的 IRT 連結,把不同題本的分數對齊,最後以等化標準誤與母體不變性評鑑其品質。垂直量尺化把這套技術延伸到跨年級的成長測量,而大型評量的矩陣抽樣、潛在迴歸與擬真值,則把 IRT、缺失資料與抽樣三條線索,整合為一套精巧的群體推論方法學。
貫穿全章的兩年入學考試實例顯示,「今年比較難」這句日常的抱怨,唯有經過一整套設計、等化與誤差評鑑,才能被嚴謹地回答;而 PISA 資料的擬真值用法則提醒,即便手握精巧的資料,若不理解其背後「擬真值即多重插補」的本質,也極易誤用。至此,測驗的量尺已被建立與維護。接下來的第二十四章,將轉向另一種讓測量更有效率的技術,即依受測者的能力即時選題的電腦化適性測驗,而它對題庫量尺一致性的仰賴,正建立在本章所奠定的連結基礎之上。