第 24 章 電腦化適性測驗
第五部 測驗發展、應用與社會脈絡
24Chapter

電腦化適性測驗

傳統的紙筆測驗有一個難以避免的浪費:每位考生都拿到同一份題本。對一位能力很強的考生而言,前面一大半的簡單題目幾乎全對,既不提供多少關於他能力的訊息,又浪費了他的時間;對一位能力較弱的考生而言,後面的難題全靠猜,同樣測不出他真正的水準。一份固定的試卷,只能在中等難度的區間對多數人測得較準,對兩端的人都失之精確。電腦化適性測驗(computerized adaptive testing, CAT)正是為了消除這個浪費而生:它讓電腦依考生「當下的表現」即時挑選下一道題,答對就給難一點的、答錯就給簡單一點的,使每一道題都盡可能貼近該考生的能力水準。

本章要把 CAT 呈現為項目反應理論的應用頂點,也是「演算法化測量」的一個原型。它把第十七章的抽象概念,即能力估計與訊息函數,轉化為一套即時運作的演算法:每答完一題,就更新一次能力估計,再據此選出「此刻最能測他」的下一題,如此循環,直到達到停止條件。這套看似簡單的循環,一旦要付諸實際的高風險考試,便牽動一連串環環相扣的作業議題,即內容如何平衡、題目如何避免過度曝光、如何在滿足眾多約束下選題、何時該停、題庫如何維護。本章將逐一展開這些組件,並收束於適性測驗在公平與透明上的當代辯論。全章以一個貫穿的實例來推進:一名考生參加線上英語聽讀檢定的二十題適性施測,其能力估計 \hat\theta 與標準誤在每答一題後如何更新、如何收斂,將成為理解各個組件的共同軸線;每引入一項新的作業考量,便為這位考生重跑一次。

即時能力估計

CAT 的每一步選題,都以「對考生當前能力的最佳估計」為依據,因此能力估計必須能夠即時、逐題地更新。這比第十七章談的、在測驗結束後一次性估計 \theta 要棘手,因為在測驗初期,作答資訊極少。

一個立即浮現的問題,出在最大概似估計(MLE)的起步。在考生答對或答錯了「全部」已作答題目之前,其能力的最大概似估計會發散到正負無限大:一個人若前三題全對,MLE 會說他的能力是無限高,這顯然荒謬且無法用於選題。因應之道,是在測驗初期改用貝氏取向的估計。期望後驗(expected a posteriori, EAP)與最大後驗(maximum a posteriori, MAP)以一個能力的先驗分布為起點,即使在零星作答下也能給出有限而穩定的估計;加權概似估計(weighted likelihood estimation, WLE)則以一個加權校正 MLE 的偏誤,兼顧穩定與較小的偏誤。

推導方塊EAP 的貝氏遞迴更新

EAP 把能力估計視為後驗分布的期望值。設答完前 k 題後,觀察到的作答為 \mathbf{u}_k=(u_1,\dots,u_k),則能力的後驗分布正比於先驗乘上概似:

p(\theta \mid \mathbf{u}_k) \propto p(\theta)\prod_{i=1}^{k} P_i(\theta)^{u_i}[1-P_i(\theta)]^{1-u_i},

而 EAP 估計即其期望值 \hat\theta_k^{\text{EAP}} = \int \theta\, p(\theta \mid \mathbf{u}_k)\, d\theta。這個更新有一個遞迴的美感:答完第 k+1 題後的後驗,等於把「答完前 k 題的後驗」當成新的先驗,再乘上第 k+1 題的概似。因此每答一題,只須把當前後驗乘上一道題的反應機率、再重新標準化,能力估計便即時更新。就英語檢定的考生而言,這意味著他每點下一個答案,系統便在背後把他的能力後驗往對應的方向推移一點。

能力估計的即時更新,也帶出了測量精度的即時追蹤。後驗分布的標準差,就是當前能力估計的標準誤;隨著作答累積,後驗逐漸集中,標準誤逐步下降。這條「標準誤隨題數下降」的軌跡,正是稍後停止規則所要監看的量。

選題準則:訊息的貪婪與其修正

有了當前的能力估計 \hat\theta,便要選出下一題。最直接、也最經典的準則,是最大訊息選題:在題庫尚未使用的題目中,挑出在 \hat\theta 處提供最大項目訊息 I_i(\hat\theta) 的那一題(第十七章)。其邏輯直白:既然訊息量衡量一道題在某能力點的測量價值,那就總是挑此刻最有價值的題。

推導方塊最大訊息選題準則

設考生當前的能力估計為 \hat\theta_k,題庫中尚未施測的題目集合為 R_k。最大訊息準則選出

i_{k+1} = \arg\max_{i \in R_k}\ I_i(\hat\theta_k), \qquad I_i(\theta) = a_i^2\, P_i(\theta)[1-P_i(\theta)],

即在當前能力估計處訊息最大的題目。由於 I_i 在題目難度 b_i 接近 \theta 時最大,這個準則傾向選出「難度與考生當前能力相稱」的題,這正是適性的核心:讓每一題都對準考生。

最大訊息準則雖然直觀,卻有一個貪婪的弱點。在測驗初期,\hat\theta 本身還很不準,此時「在一個不可靠的 \hat\theta 處訊息最大」的題,未必是真正該問的題;更麻煩的是,最大訊息準則會反覆挑出鑑別度 a 最高的少數精華題,使這些題被過度使用,也使題庫的其餘部分閒置。修正之道有幾種。Chang & Ying (1996) 提出以 Kullback-Leibler 訊息取代 Fisher 訊息作為選題準則:KL 訊息衡量的是「在一整段能力區間上」區辨的能力,而非僅在單一個點,因而在 \hat\theta 尚不可靠的早期更為穩健。此外,貝氏的選題準則則把能力的後驗不確定性直接納入,選出「能最大程度縮小後驗變異」的題。這些修正的共同精神,是不要在一個還不可靠的能力估計上過度自信地貪婪選題。

內容平衡與約束管理

純以訊息選題,會忽略一件對效度至關重要的事:測驗的內容組成。英語聽讀檢定若一味挑訊息最大的題,可能整份測驗都集中在「聽力細節」而幾乎沒有「閱讀主旨」,即使能力估計很精確,這個分數也無法支撐「英語聽讀能力」這個較廣的推論,這正是第二十二章測驗藍圖所要保障的內容效度。適性選題因此不能只顧訊息,還必須同時滿足內容平衡的約束。

約束管理的初階做法,是約束式最大訊息法:在滿足內容配額的前提下,於允許的題目中挑訊息最大者。例如規定聽力與閱讀各占一半,則系統在選題時會依當前已施測的內容比例,把選擇範圍限縮到「還需要補足的那類題目」中。更複雜的約束還包括題型、認知層次、甚至避免內容重疊的題目同時出現。當約束數目一多,逐條以規則處理便顯得笨拙,這正是稍後影子測驗以最佳化統一處理的動機。就英語檢定的考生而言,加入內容平衡之後重跑,他的作答軌跡會略為犧牲一點測量效率,換取一份內容上真正代表聽讀能力的測驗。

曝光控制與測驗安全

CAT 的一個結構性弱點,直接源於它的優點。既然最大訊息準則偏愛高鑑別度的精華題,這些題便會被反覆選給能力相近的大量考生,導致試題曝光(item exposure)過度集中。過度曝光有兩重危害:其一是測驗安全,被高頻使用的題目容易在考生間流傳、遭記憶與洩漏,一旦答案外流,該題便不再測能力;其二是題庫利用不均,少數精華題被用盡,大量題目卻閒置,題庫的整體壽命因而縮短。

曝光控制正是為了在「測量效率」與「題庫安全」之間取得平衡。Wainer et al. (2000) 系統整理了這一議題。方法上,Sympson-Hetter 法為每道題設一個「曝光控制參數」,在選出訊息最大的題之後,再以一個機率決定是否真正施測它,使高需求題目的實際曝光率被壓在一個上限之下;隨機化的做法則在「訊息最前面的幾道題」中隨機挑一道,以打散曝光;漸進式方法則在測驗初期刻意加入更多隨機性、後期再收斂到最大訊息。這些方法都以犧牲少許測量效率為代價,換取更均勻的曝光與更長的題庫壽命。曝光控制參數本身須以模擬校準,即在假想的考生母體上反覆模擬施測,調整參數直到各題的曝光率落在可接受的範圍。就英語檢定而言,加入曝光控制後,那位考生未必每題都拿到「理論上最該問」的題,卻換來了整個測驗系統的安全與永續。

影子測驗:最佳化選題

當約束愈來愈多,即內容配額、曝光上限、題型限制、作答時間等交織在一起時,逐條以規則管理選題便難以保證每一步都同時滿足所有約束。影子測驗(shadow test)提供了一個優雅的統一解,其思路承接了第二十二章組卷的最佳化取向。

推導方塊影子測驗的最佳化選題

影子測驗法由 Linden & Reese (1998) 提出。在選第 k+1 題時,它不只挑一道題,而是即時組出一整份「假想的完整測驗」,即影子測驗:這份測驗必須包含已施測的 k 題,滿足全部的內容與其他約束,並在當前能力估計 \hat\theta_k 處使整份測驗的訊息最大:

\max \sum_{i} I_i(\hat\theta_k)\, x_i \quad\text{s.t.}\quad x_i=1\ (\text{已施測題}),\ \ \text{所有內容與約束},\ \ x_i\in\{0,1\}.

解出這個 0–1 整數規劃後,實際施測的下一題,取自影子測驗中「尚未施測」的題目裡訊息最大的那一道。答完後更新 \hat\theta,再重組一份新的影子測驗。如此,每一步選出的題都保證能被擴充為一份「滿足所有約束的完整測驗」,約束因而在逐題選擇中被全程尊重。

影子測驗的精妙之處,在於它把「逐題適性選擇」與「整卷約束滿足」這兩個看似衝突的目標統一了起來:它在每一步都以「整份合格測驗」為視野來挑下一題,因而不會走到「選了幾題後才發現無法滿足內容配額」的死角。這套最佳化框架的彈性很大,幾乎任何可以寫成線性約束的要求,都能被納入。代價是每一步都要解一個整數規劃,計算量較大,但在現代硬體上已完全可行。

停止規則與測量精度

CAT 何時該停?這由停止規則決定,而不同的停止規則體現了不同的測量哲學。固定長度規則最簡單,即施測固定的題數(如英語檢定的二十題),無論考生能力高低皆然;它便於考務安排,卻使不同考生的測量精度不一。標準誤門檻規則則反過來,即持續施測直到能力估計的標準誤降到某個目標之下才停;它使所有考生都達到相近的測量精度,卻讓不同考生的測驗長度不一,能力落在題庫訊息稀薄處的考生可能需要很多題。

推導方塊標準誤停止規則與測驗訊息

在 IRT 中,能力估計的標準誤與已施測題目的測驗訊息直接相關:

SE(\hat\theta) \approx \frac{1}{\sqrt{\sum_{i \in \text{已施測}} I_i(\hat\theta)}}.

標準誤門檻規則即持續選題,直到 SE(\hat\theta) 降至預設門檻 SE_{\text{target}} 之下。由於每道題都貢獻一份訊息、使分母中的測驗訊息累加、SE 隨之下降,這個規則本質上是在問「累積的訊息是否已足夠精確」。其含意是:對能力落在題庫訊息充足處的考生,少數幾題便可達標而提早結束;對能力落在題庫訊息稀薄處(如極端能力)的考生,則需要更多題,甚至可能受限於題庫而無法達標。

實務上常採混合規則,即結合標準誤門檻與長度上下限:先設一個最短與最長題數,在此範圍內以標準誤是否達標決定何時停。這既保證了最低的測量精度,又避免了測驗過短或過長。就英語檢定的考生而言,若他的能力適中、題庫在該處訊息充足,或許十來題其標準誤便已達標;若他的能力極端,則可能需要用滿二十題,而其最終估計的精度仍略遜於能力適中者。

題庫:CAT 的地基

CAT 一切的效能,都建立在一個高品質的題庫之上;沒有好題庫,再精巧的演算法也是空中樓閣。題庫的品質有幾個維度。規模要夠大,一個過小的題庫無法支撐曝光控制,也很快會被用盡;難度分布要夠廣,尤其要在需要精確測量的能力區間,例如證照考試的及格線附近,備有足夠多、鑑別度高的題目;訊息覆蓋要能涵蓋所有可能出現的考生能力,否則能力極端的考生便會落入題庫訊息的空洞。

題庫的維護是持續的工作,其中兩件事尤為關鍵。其一是補題,即持續把新題以嵌入預試(第二十二章)的方式送進正式測驗,蒐集作答資料以校準其參數,再納入題庫,以補充被汰換或曝光過度的題目;為使新題能無縫進入既有的能力量尺,其校準須依賴第二十三章的量尺維護與連結技術,這正是題庫量尺一致性的來源。其二是參數飄移的監控,即題目的參數可能隨時間、隨課程與社會脈絡的變化而漂移,一道題今日的難度未必等於三年前校準時的難度;定期重新校準、偵測並汰換飄移的題目,是維持 CAT 分數跨年可比的必要工作。題庫因此不是一次建好的靜態資產,而是一個需要持續灌注與監控的活水。

多階段測驗:折衷的智慧

逐題適性的 CAT 效率最高,卻也帶來一些實務困擾:考生無法回頭檢查或修改前面的答案(因為後續題目已依前面的作答選出);題目層次的即時選擇也使測驗品管較難。多階段測驗(multistage testing, MST)是一個折衷的設計:它不以「單題」而以「模組」為適性單位。

MST 把題目預先組成若干難度不同的模組(題組),測驗分幾個階段進行:考生先做一個中等難度的起始模組,系統依其表現,把他導向下一階段中較難或較易的模組,如此循環數個階段。由於適性發生在「模組之間」而非「題目之間」,MST 兼具了適性的效率與固定卷的可控性:每一條可能的路徑都是一份預先組好、可事先審查的完整測驗,品管因而容易得多;考生也能在同一模組內回頭修改答案。MST 因此常被視為「CAT 的效率」與「固定卷的可控」之間的務實折衷,在許多大型證照與入學考試中被採用。其代價是適性的粒度較粗,效率略遜於逐題的 CAT。

實證效益:省了多少、準了多少

CAT 的核心賣點,是效率。那麼它究竟省了多少?大量的模擬與實證研究給出的結論相當一致:相對於達到同等測量精度所需的固定長度測驗,CAT 通常能以少約一半、有時更少的題數達標。這個效率增益的來源不難理解:CAT 不把題目浪費在「對這位考生而言過難或過易」的地方,每一題都對準考生的能力,訊息的利用率因而大幅提高。

不過,這個「省一半」的結論有其條件,不宜過度推廣。效率增益的大小,取決於題庫的品質,即題庫在各能力水準是否都備有高訊息的題目;取決於考生能力的分布,即若多數考生能力集中在中段,固定卷本就測得不差,CAT 的相對優勢便縮小;也取決於所加入的約束與曝光控制,兩者都以犧牲部分效率為代價。因此,宣稱「CAT 一律省一半」是把特定條件下的結論當成普適定律。負責任的說法是:在題庫充足、能力分布較廣的情境下,CAT 能帶來可觀的效率增益,但其實際幅度須就個案評估。這也呼應了本書一貫的立場:任何方法的效益,都須放回其成立的條件來理解。

應用版圖:從兵役分發到病人自陳

CAT 的發展史,也是它的應用擴散史。其構想可追溯至 Lord (1980) 對「量身訂做測驗」的設想,並經 Weiss 等人的系統研究而成形。最早的大規模作業化,出現在軍事人員的能力甄選與分發,即美國軍方的 ASVAB 測驗;隨後,大型入學與證照考試相繼採用,如 GRE 的電腦化適性版本。這段歷史也留下了制度教訓:一九九○年代 GRE CAT 曾發生題庫遭有計畫記憶與外洩的事件,凸顯了曝光控制與題庫安全並非學術上的細節,而是攸關測驗存續的現實。

近二十年,CAT 最重要的擴張,是走出了教育測驗,進入健康與臨床測量。Cella et al. (2010) 所建立的 PROMIS(病人自陳結果測量系統),以 IRT 校準了大量健康相關構念(如疼痛、疲勞、憂鬱)的題庫,並以 CAT 讓病人只須回答少數最相關的題目,便能精確地測得其健康狀態。這把 CAT 由「考能力」推廣到「測感受」,展現了適性測量作為一種通用工具的潛力。此外,van der Linden 與其同僚所發展的最佳化學派((Linden & Glas, 2010)),則把 CAT 的理論推向了更系統、更一般的高度,其影子測驗等技術已成為當代大型適性測驗的骨幹。

前沿:多向度、診斷與公平

CAT 仍在多個方向上快速發展。其一是把作答時間、乃至更豐富的作答歷程納入選題:既然數位施測會記錄每題的作答時間(第十八章)、甚至完整的操作軌跡(其建模與分析詳第三十四章),選題便可不只顧測量訊息,也兼顧時間效率,例如避免連續給出耗時的題目。其二是多向度 CAT,即當測驗同時測量多個相關特質時,選題須考慮「對哪一個維度、以及對維度間的組合最有訊息」,其效率與詮釋都比單向度複雜。其三是認知診斷 CAT(CD-CAT),它把選題準則由「最能精確估計能力」換成「最能區辨屬性掌握型態」,以最少的題目做出最準確的技能診斷,直接承接第二十一章的診斷模型。

而最具當代意義的一條前沿,是適性測驗的公平與透明。CAT 是一種「演算法化的測量」:每位考生看到的題目由演算法即時決定,而不同考生看到的題目各不相同。這帶來了傳統固定卷所沒有的倫理張力,即演算法的可解釋性,也就是當一位考生質疑「為什麼給我這些題、我的分數怎麼算出來的」時,一個黑箱式的選題與計分能否給出可被理解、可被申訴的交代;以及受測者的知情,即考生是否理解自己正在接受一場「會依其作答而變化」的測驗。這些議題把 CAT 由一個純技術問題,連上了測驗使用的公平與正義,其制度層面的完整討論屬於第二十七章。大型國際評量近年也開始適性化,如 PISA 的轉向,這使適性測量的公平與透明,成為一個影響範圍愈來愈廣的公共議題。

小結

電腦化適性測驗,是項目反應理論最亮眼的應用,也是「演算法化測量」的原型。它的核心循環很簡單:每答一題便即時更新能力估計,再據以選出此刻最能測他的下一題,直到達成停止條件。但要把這個循環落實為一場可信、可控、公平的高風險考試,須層層加入作業組件:以貝氏估計解決初期的發散、以 KL 或貝氏準則修正最大訊息的貪婪、以內容約束保障效度、以曝光控制維護安全、以影子測驗在眾多約束下統一選題、以標準誤或混合規則決定何時停、並以持續維護的高品質題庫作為一切的地基。多階段測驗則提供了效率與可控之間的務實折衷。

貫穿全章的英語檢定考生顯示,一場適性施測的每一步,都是測量效率與作業現實之間的權衡。CAT 帶來可觀的效率增益,卻不是無條件的魔法,其效益取決於題庫、考生分布與所加的約束。而當測驗由固定卷走向演算法選題,一個新的問題也浮現:當機器替每位考生量身出題,如何確保它對所有人都公平、且其運作可被理解與問責。這個問題,把測量帶到了它與社會相遇最尖銳的地方,也正是下一部分、尤其是第二十七章公平性專章所要正面處理的。至此,測驗的施測技術已大致完備;接下來的第二十五章,將把焦點由「能力測驗」轉向另一大類工具,即問卷,去看當受測者不是在「解題」而是在「自陳」時,測量會遇到哪些獨特的作答行為挑戰。

參考文獻

Cella, D., Riley, W., Stone, A., Rothrock, N., Reeve, B., Yount, S., Amtmann, D., et al. (2010). The Patient-Reported outcomes measurement information system (PROMIS) developed and tested its first wave of adult self-reported health outcome item banks: 2005–2008. Journal of Clinical Epidemiology, 63(11), 1179–1194. https://doi.org/10.1016/j.jclinepi.2010.04.011
Chang, H.-H., & Ying, Z. (1996). A global information approach to computerized adaptive testing. Applied Psychological Measurement, 20(3), 213–229. https://doi.org/10.1177/014662169602000303
Linden, W. J. van der, & Glas, C. A. W. (2010). Elements of adaptive testing. Springer.
Linden, W. J. van der, & Reese, L. M. (1998). A model for optimal constrained adaptive testing. Applied Psychological Measurement, 22(3), 259–270. https://doi.org/10.1177/01466216980223006
Lord, F. M. (1980). Applications of item response theory to practical testing problems. Lawrence Erlbaum Associates.
Wainer, H., Dorans, N. J., Eignor, D. R., Flaugher, R., Green, B. F., Mislevy, R. J., Steinberg, L., & Thissen, D. (2000). Computerized adaptive testing: A primer (2nd ed.). Lawrence Erlbaum.
本章引用格式游琇婷(2026)。電腦化適性測驗。《計量心理學:測量、模型與推論》(第 24 章)。