電腦化適性測驗
傳統的紙筆測驗有一個難以避免的浪費:每位考生都拿到同一份題本。對一位能力很強的考生而言,前面一大半的簡單題目幾乎全對,既不提供多少關於他能力的訊息,又浪費了他的時間;對一位能力較弱的考生而言,後面的難題全靠猜,同樣測不出他真正的水準。一份固定的試卷,只能在中等難度的區間對多數人測得較準,對兩端的人都失之精確。電腦化適性測驗(computerized adaptive testing, CAT)正是為了消除這個浪費而生:它讓電腦依考生「當下的表現」即時挑選下一道題,答對就給難一點的、答錯就給簡單一點的,使每一道題都盡可能貼近該考生的能力水準。
本章要把 CAT 呈現為項目反應理論的應用頂點,也是「演算法化測量」的一個原型。它把第十七章的抽象概念,即能力估計與訊息函數,轉化為一套即時運作的演算法:每答完一題,就更新一次能力估計,再據此選出「此刻最能測他」的下一題,如此循環,直到達到停止條件。這套看似簡單的循環,一旦要付諸實際的高風險考試,便牽動一連串環環相扣的作業議題,即內容如何平衡、題目如何避免過度曝光、如何在滿足眾多約束下選題、何時該停、題庫如何維護。本章將逐一展開這些組件,並收束於適性測驗在公平與透明上的當代辯論。全章以一個貫穿的實例來推進:一名考生參加線上英語聽讀檢定的二十題適性施測,其能力估計 \hat\theta 與標準誤在每答一題後如何更新、如何收斂,將成為理解各個組件的共同軸線;每引入一項新的作業考量,便為這位考生重跑一次。
即時能力估計
CAT 的每一步選題,都以「對考生當前能力的最佳估計」為依據,因此能力估計必須能夠即時、逐題地更新。這比第十七章談的、在測驗結束後一次性估計 \theta 要棘手,因為在測驗初期,作答資訊極少。
一個立即浮現的問題,出在最大概似估計(MLE)的起步。在考生答對或答錯了「全部」已作答題目之前,其能力的最大概似估計會發散到正負無限大:一個人若前三題全對,MLE 會說他的能力是無限高,這顯然荒謬且無法用於選題。因應之道,是在測驗初期改用貝氏取向的估計。期望後驗(expected a posteriori, EAP)與最大後驗(maximum a posteriori, MAP)以一個能力的先驗分布為起點,即使在零星作答下也能給出有限而穩定的估計;加權概似估計(weighted likelihood estimation, WLE)則以一個加權校正 MLE 的偏誤,兼顧穩定與較小的偏誤。
EAP 把能力估計視為後驗分布的期望值。設答完前 k 題後,觀察到的作答為 \mathbf{u}_k=(u_1,\dots,u_k),則能力的後驗分布正比於先驗乘上概似:
而 EAP 估計即其期望值 \hat\theta_k^{\text{EAP}} = \int \theta\, p(\theta \mid \mathbf{u}_k)\, d\theta。這個更新有一個遞迴的美感:答完第 k+1 題後的後驗,等於把「答完前 k 題的後驗」當成新的先驗,再乘上第 k+1 題的概似。因此每答一題,只須把當前後驗乘上一道題的反應機率、再重新標準化,能力估計便即時更新。就英語檢定的考生而言,這意味著他每點下一個答案,系統便在背後把他的能力後驗往對應的方向推移一點。
能力估計的即時更新,也帶出了測量精度的即時追蹤。後驗分布的標準差,就是當前能力估計的標準誤;隨著作答累積,後驗逐漸集中,標準誤逐步下降。這條「標準誤隨題數下降」的軌跡,正是稍後停止規則所要監看的量。
選題準則:訊息的貪婪與其修正
有了當前的能力估計 \hat\theta,便要選出下一題。最直接、也最經典的準則,是最大訊息選題:在題庫尚未使用的題目中,挑出在 \hat\theta 處提供最大項目訊息 I_i(\hat\theta) 的那一題(第十七章)。其邏輯直白:既然訊息量衡量一道題在某能力點的測量價值,那就總是挑此刻最有價值的題。
設考生當前的能力估計為 \hat\theta_k,題庫中尚未施測的題目集合為 R_k。最大訊息準則選出
即在當前能力估計處訊息最大的題目。由於 I_i 在題目難度 b_i 接近 \theta 時最大,這個準則傾向選出「難度與考生當前能力相稱」的題,這正是適性的核心:讓每一題都對準考生。
最大訊息準則雖然直觀,卻有一個貪婪的弱點。在測驗初期,\hat\theta 本身還很不準,此時「在一個不可靠的 \hat\theta 處訊息最大」的題,未必是真正該問的題;更麻煩的是,最大訊息準則會反覆挑出鑑別度 a 最高的少數精華題,使這些題被過度使用,也使題庫的其餘部分閒置。修正之道有幾種。Chang & Ying (1996) 提出以 Kullback-Leibler 訊息取代 Fisher 訊息作為選題準則:KL 訊息衡量的是「在一整段能力區間上」區辨的能力,而非僅在單一個點,因而在 \hat\theta 尚不可靠的早期更為穩健。此外,貝氏的選題準則則把能力的後驗不確定性直接納入,選出「能最大程度縮小後驗變異」的題。這些修正的共同精神,是不要在一個還不可靠的能力估計上過度自信地貪婪選題。
內容平衡與約束管理
純以訊息選題,會忽略一件對效度至關重要的事:測驗的內容組成。英語聽讀檢定若一味挑訊息最大的題,可能整份測驗都集中在「聽力細節」而幾乎沒有「閱讀主旨」,即使能力估計很精確,這個分數也無法支撐「英語聽讀能力」這個較廣的推論,這正是第二十二章測驗藍圖所要保障的內容效度。適性選題因此不能只顧訊息,還必須同時滿足內容平衡的約束。
約束管理的初階做法,是約束式最大訊息法:在滿足內容配額的前提下,於允許的題目中挑訊息最大者。例如規定聽力與閱讀各占一半,則系統在選題時會依當前已施測的內容比例,把選擇範圍限縮到「還需要補足的那類題目」中。更複雜的約束還包括題型、認知層次、甚至避免內容重疊的題目同時出現。當約束數目一多,逐條以規則處理便顯得笨拙,這正是稍後影子測驗以最佳化統一處理的動機。就英語檢定的考生而言,加入內容平衡之後重跑,他的作答軌跡會略為犧牲一點測量效率,換取一份內容上真正代表聽讀能力的測驗。
曝光控制與測驗安全
CAT 的一個結構性弱點,直接源於它的優點。既然最大訊息準則偏愛高鑑別度的精華題,這些題便會被反覆選給能力相近的大量考生,導致試題曝光(item exposure)過度集中。過度曝光有兩重危害:其一是測驗安全,被高頻使用的題目容易在考生間流傳、遭記憶與洩漏,一旦答案外流,該題便不再測能力;其二是題庫利用不均,少數精華題被用盡,大量題目卻閒置,題庫的整體壽命因而縮短。
曝光控制正是為了在「測量效率」與「題庫安全」之間取得平衡。Wainer et al. (2000) 系統整理了這一議題。方法上,Sympson-Hetter 法為每道題設一個「曝光控制參數」,在選出訊息最大的題之後,再以一個機率決定是否真正施測它,使高需求題目的實際曝光率被壓在一個上限之下;隨機化的做法則在「訊息最前面的幾道題」中隨機挑一道,以打散曝光;漸進式方法則在測驗初期刻意加入更多隨機性、後期再收斂到最大訊息。這些方法都以犧牲少許測量效率為代價,換取更均勻的曝光與更長的題庫壽命。曝光控制參數本身須以模擬校準,即在假想的考生母體上反覆模擬施測,調整參數直到各題的曝光率落在可接受的範圍。就英語檢定而言,加入曝光控制後,那位考生未必每題都拿到「理論上最該問」的題,卻換來了整個測驗系統的安全與永續。
影子測驗:最佳化選題
當約束愈來愈多,即內容配額、曝光上限、題型限制、作答時間等交織在一起時,逐條以規則管理選題便難以保證每一步都同時滿足所有約束。影子測驗(shadow test)提供了一個優雅的統一解,其思路承接了第二十二章組卷的最佳化取向。
影子測驗法由 Linden & Reese (1998) 提出。在選第 k+1 題時,它不只挑一道題,而是即時組出一整份「假想的完整測驗」,即影子測驗:這份測驗必須包含已施測的 k 題,滿足全部的內容與其他約束,並在當前能力估計 \hat\theta_k 處使整份測驗的訊息最大:
解出這個 0–1 整數規劃後,實際施測的下一題,取自影子測驗中「尚未施測」的題目裡訊息最大的那一道。答完後更新 \hat\theta,再重組一份新的影子測驗。如此,每一步選出的題都保證能被擴充為一份「滿足所有約束的完整測驗」,約束因而在逐題選擇中被全程尊重。
影子測驗的精妙之處,在於它把「逐題適性選擇」與「整卷約束滿足」這兩個看似衝突的目標統一了起來:它在每一步都以「整份合格測驗」為視野來挑下一題,因而不會走到「選了幾題後才發現無法滿足內容配額」的死角。這套最佳化框架的彈性很大,幾乎任何可以寫成線性約束的要求,都能被納入。代價是每一步都要解一個整數規劃,計算量較大,但在現代硬體上已完全可行。
停止規則與測量精度
CAT 何時該停?這由停止規則決定,而不同的停止規則體現了不同的測量哲學。固定長度規則最簡單,即施測固定的題數(如英語檢定的二十題),無論考生能力高低皆然;它便於考務安排,卻使不同考生的測量精度不一。標準誤門檻規則則反過來,即持續施測直到能力估計的標準誤降到某個目標之下才停;它使所有考生都達到相近的測量精度,卻讓不同考生的測驗長度不一,能力落在題庫訊息稀薄處的考生可能需要很多題。
在 IRT 中,能力估計的標準誤與已施測題目的測驗訊息直接相關:
標準誤門檻規則即持續選題,直到 SE(\hat\theta) 降至預設門檻 SE_{\text{target}} 之下。由於每道題都貢獻一份訊息、使分母中的測驗訊息累加、SE 隨之下降,這個規則本質上是在問「累積的訊息是否已足夠精確」。其含意是:對能力落在題庫訊息充足處的考生,少數幾題便可達標而提早結束;對能力落在題庫訊息稀薄處(如極端能力)的考生,則需要更多題,甚至可能受限於題庫而無法達標。
實務上常採混合規則,即結合標準誤門檻與長度上下限:先設一個最短與最長題數,在此範圍內以標準誤是否達標決定何時停。這既保證了最低的測量精度,又避免了測驗過短或過長。就英語檢定的考生而言,若他的能力適中、題庫在該處訊息充足,或許十來題其標準誤便已達標;若他的能力極端,則可能需要用滿二十題,而其最終估計的精度仍略遜於能力適中者。
題庫:CAT 的地基
CAT 一切的效能,都建立在一個高品質的題庫之上;沒有好題庫,再精巧的演算法也是空中樓閣。題庫的品質有幾個維度。規模要夠大,一個過小的題庫無法支撐曝光控制,也很快會被用盡;難度分布要夠廣,尤其要在需要精確測量的能力區間,例如證照考試的及格線附近,備有足夠多、鑑別度高的題目;訊息覆蓋要能涵蓋所有可能出現的考生能力,否則能力極端的考生便會落入題庫訊息的空洞。
題庫的維護是持續的工作,其中兩件事尤為關鍵。其一是補題,即持續把新題以嵌入預試(第二十二章)的方式送進正式測驗,蒐集作答資料以校準其參數,再納入題庫,以補充被汰換或曝光過度的題目;為使新題能無縫進入既有的能力量尺,其校準須依賴第二十三章的量尺維護與連結技術,這正是題庫量尺一致性的來源。其二是參數飄移的監控,即題目的參數可能隨時間、隨課程與社會脈絡的變化而漂移,一道題今日的難度未必等於三年前校準時的難度;定期重新校準、偵測並汰換飄移的題目,是維持 CAT 分數跨年可比的必要工作。題庫因此不是一次建好的靜態資產,而是一個需要持續灌注與監控的活水。
多階段測驗:折衷的智慧
逐題適性的 CAT 效率最高,卻也帶來一些實務困擾:考生無法回頭檢查或修改前面的答案(因為後續題目已依前面的作答選出);題目層次的即時選擇也使測驗品管較難。多階段測驗(multistage testing, MST)是一個折衷的設計:它不以「單題」而以「模組」為適性單位。
MST 把題目預先組成若干難度不同的模組(題組),測驗分幾個階段進行:考生先做一個中等難度的起始模組,系統依其表現,把他導向下一階段中較難或較易的模組,如此循環數個階段。由於適性發生在「模組之間」而非「題目之間」,MST 兼具了適性的效率與固定卷的可控性:每一條可能的路徑都是一份預先組好、可事先審查的完整測驗,品管因而容易得多;考生也能在同一模組內回頭修改答案。MST 因此常被視為「CAT 的效率」與「固定卷的可控」之間的務實折衷,在許多大型證照與入學考試中被採用。其代價是適性的粒度較粗,效率略遜於逐題的 CAT。
實證效益:省了多少、準了多少
CAT 的核心賣點,是效率。那麼它究竟省了多少?大量的模擬與實證研究給出的結論相當一致:相對於達到同等測量精度所需的固定長度測驗,CAT 通常能以少約一半、有時更少的題數達標。這個效率增益的來源不難理解:CAT 不把題目浪費在「對這位考生而言過難或過易」的地方,每一題都對準考生的能力,訊息的利用率因而大幅提高。
不過,這個「省一半」的結論有其條件,不宜過度推廣。效率增益的大小,取決於題庫的品質,即題庫在各能力水準是否都備有高訊息的題目;取決於考生能力的分布,即若多數考生能力集中在中段,固定卷本就測得不差,CAT 的相對優勢便縮小;也取決於所加入的約束與曝光控制,兩者都以犧牲部分效率為代價。因此,宣稱「CAT 一律省一半」是把特定條件下的結論當成普適定律。負責任的說法是:在題庫充足、能力分布較廣的情境下,CAT 能帶來可觀的效率增益,但其實際幅度須就個案評估。這也呼應了本書一貫的立場:任何方法的效益,都須放回其成立的條件來理解。
應用版圖:從兵役分發到病人自陳
CAT 的發展史,也是它的應用擴散史。其構想可追溯至 Lord (1980) 對「量身訂做測驗」的設想,並經 Weiss 等人的系統研究而成形。最早的大規模作業化,出現在軍事人員的能力甄選與分發,即美國軍方的 ASVAB 測驗;隨後,大型入學與證照考試相繼採用,如 GRE 的電腦化適性版本。這段歷史也留下了制度教訓:一九九○年代 GRE CAT 曾發生題庫遭有計畫記憶與外洩的事件,凸顯了曝光控制與題庫安全並非學術上的細節,而是攸關測驗存續的現實。
近二十年,CAT 最重要的擴張,是走出了教育測驗,進入健康與臨床測量。Cella et al. (2010) 所建立的 PROMIS(病人自陳結果測量系統),以 IRT 校準了大量健康相關構念(如疼痛、疲勞、憂鬱)的題庫,並以 CAT 讓病人只須回答少數最相關的題目,便能精確地測得其健康狀態。這把 CAT 由「考能力」推廣到「測感受」,展現了適性測量作為一種通用工具的潛力。此外,van der Linden 與其同僚所發展的最佳化學派((Linden & Glas, 2010)),則把 CAT 的理論推向了更系統、更一般的高度,其影子測驗等技術已成為當代大型適性測驗的骨幹。
前沿:多向度、診斷與公平
CAT 仍在多個方向上快速發展。其一是把作答時間、乃至更豐富的作答歷程納入選題:既然數位施測會記錄每題的作答時間(第十八章)、甚至完整的操作軌跡(其建模與分析詳第三十四章),選題便可不只顧測量訊息,也兼顧時間效率,例如避免連續給出耗時的題目。其二是多向度 CAT,即當測驗同時測量多個相關特質時,選題須考慮「對哪一個維度、以及對維度間的組合最有訊息」,其效率與詮釋都比單向度複雜。其三是認知診斷 CAT(CD-CAT),它把選題準則由「最能精確估計能力」換成「最能區辨屬性掌握型態」,以最少的題目做出最準確的技能診斷,直接承接第二十一章的診斷模型。
而最具當代意義的一條前沿,是適性測驗的公平與透明。CAT 是一種「演算法化的測量」:每位考生看到的題目由演算法即時決定,而不同考生看到的題目各不相同。這帶來了傳統固定卷所沒有的倫理張力,即演算法的可解釋性,也就是當一位考生質疑「為什麼給我這些題、我的分數怎麼算出來的」時,一個黑箱式的選題與計分能否給出可被理解、可被申訴的交代;以及受測者的知情,即考生是否理解自己正在接受一場「會依其作答而變化」的測驗。這些議題把 CAT 由一個純技術問題,連上了測驗使用的公平與正義,其制度層面的完整討論屬於第二十七章。大型國際評量近年也開始適性化,如 PISA 的轉向,這使適性測量的公平與透明,成為一個影響範圍愈來愈廣的公共議題。
小結
電腦化適性測驗,是項目反應理論最亮眼的應用,也是「演算法化測量」的原型。它的核心循環很簡單:每答一題便即時更新能力估計,再據以選出此刻最能測他的下一題,直到達成停止條件。但要把這個循環落實為一場可信、可控、公平的高風險考試,須層層加入作業組件:以貝氏估計解決初期的發散、以 KL 或貝氏準則修正最大訊息的貪婪、以內容約束保障效度、以曝光控制維護安全、以影子測驗在眾多約束下統一選題、以標準誤或混合規則決定何時停、並以持續維護的高品質題庫作為一切的地基。多階段測驗則提供了效率與可控之間的務實折衷。
貫穿全章的英語檢定考生顯示,一場適性施測的每一步,都是測量效率與作業現實之間的權衡。CAT 帶來可觀的效率增益,卻不是無條件的魔法,其效益取決於題庫、考生分布與所加的約束。而當測驗由固定卷走向演算法選題,一個新的問題也浮現:當機器替每位考生量身出題,如何確保它對所有人都公平、且其運作可被理解與問責。這個問題,把測量帶到了它與社會相遇最尖銳的地方,也正是下一部分、尤其是第二十七章公平性專章所要正面處理的。至此,測驗的施測技術已大致完備;接下來的第二十五章,將把焦點由「能力測驗」轉向另一大類工具,即問卷,去看當受測者不是在「解題」而是在「自陳」時,測量會遇到哪些獨特的作答行為挑戰。