第 24 章 電腦化適性測驗
第五部 測驗發展、應用與社會脈絡
24Chapter

電腦化適性測驗

傳統的紙筆測驗有一個難以避免的浪費:每位考生都拿到同一份題本。對一位能力很強的考生而言,前面一大半的簡單題目幾乎全對,既不提供多少關於他能力的訊息,又浪費了他的時間;對一位能力較弱的考生而言,後面的難題全靠猜,同樣測不出他真正的水準。一份固定的試卷,只能在中等難度的區間對多數人測得較準,對兩端的人都失之精確。電腦化適性測驗(computerized adaptive testing, CAT)正是為了消除這個浪費而生:它讓電腦依考生「當下的表現」即時挑選下一道題,答對就給難一點的、答錯就給簡單一點的,使每一道題都盡可能貼近該考生的能力水準。

本章要把 CAT 呈現為項目反應理論的應用頂點,也是「演算法化測量」的一個原型。它把第十七章的抽象概念,即能力估計與訊息函數,轉化為一套即時運作的演算法:每答完一題,就更新一次能力估計,再據此選出「此刻最能測他」的下一題,如此循環,直到達到停止條件。這套看似簡單的循環,一旦要付諸實際的高風險考試,便牽動一連串環環相扣的作業議題,即內容如何平衡、題目如何避免過度曝光、如何在滿足眾多約束下選題、何時該停、題庫如何維護。本章將逐一展開這些組件,並收束於適性測驗在公平與透明上的當代辯論。全章以一個貫穿的實例來推進:一名考生參加線上英語聽讀檢定的二十題適性施測,其能力估計 \hat\theta 與標準誤在每答一題後如何更新、如何收斂,將成為理解各個組件的共同軸線;每引入一項新的作業考量,便為這位考生重跑一次。

即時能力估計

CAT 的每一步選題,都以「對考生當前能力的最佳估計」為依據,因此能力估計必須能夠即時、逐題地更新。這件事比第十七章談的估計棘手得多。第十七章的情境是測驗已經結束、整份作答反應都在手上,再一次算出 \theta;CAT 的情境卻是測驗才剛開始,手上只有一題、兩題、三題的作答,卻必須立刻交出一個可用的能力估計,因為下一題要問什麼,完全取決於這個估計。資訊如此稀薄,估計方法的選擇就不再是技術細節,而會直接決定整套演算法能不能起步。本節要回答三個問題:測驗的第一題根據什麼選出來;為什麼在測驗結束後好用的最大概似估計,在這裡反而會失效;改用貝氏取向的估計之後,能力估計與它的精度如何隨著考生的每一次作答而更新。

先看起點。第一題無從依作答挑選,因為此時還沒有任何作答。最通行的做法,是先假定考生的能力就是母體的平均水準,即以先驗分布的平均數 \theta=0 作為起始估計,再挑一道難度接近 0、鑑別度高的中等題。設想本章開頭那位考生所參加的線上英語聽讀檢定,同時用作大學新生的英文能力分級,量尺以全體新生校準為 \theta \sim N(0,1),則他的第一題會落在難度 b 約為 0 之處,也就是全體新生大約半數會答對的題目。若手上另有旁證,起始點還可以移動:把學測英文成績頂標的學生設在 \theta_0=0.8 起步,通常可以省下兩三題「摸索這位考生大概在哪一帶」的成本。起始估計不必求準,只求不要離譜,因為作答一累積,資料很快就會把估計拉回它該去的位置。

起點定好,真正的麻煩才開始,而它出在估計方法上。最大概似估計(maximum likelihood estimation, MLE)問的是:在哪一個能力值之下,觀察到的這串作答最可能發生?作答有對有錯時,這個問題有明確的答案;但在測驗最初的幾題,它沒有。只要考生把已作答的題目全部答對,概似函數就隨 \theta 增大而單調上升,永遠找不到最高點,MLE 因而發散到正無限大;全部答錯則對稱地發散到負無限大。設想那位考生前三題全對,MLE 的回答會是「他的英文能力無限高」,這既無法寫進成績報告,也無法拿來挑第四題,因為題庫裡並不存在難度無限大的題目。

因應之道,是在測驗初期改用貝氏取向的估計,讓一個先驗分布替稀薄的資料撐住場面。期望後驗(expected a posteriori, EAP)取後驗分布的平均數,最大後驗(maximum a posteriori, MAP)取後驗分布的最高點;兩者都以能力的先驗分布為起點,因此即使只有零星作答,估計仍是有限而穩定的數值。仍以 \theta \sim N(0,1) 為先驗,前三題全對的那位考生,EAP 給出的估計大約落在 0.9 上下,而不是無限大;這個數字的意思是「資料確實指向偏高的能力,但只有三題,還不足以把估計推得更遠」。代價是估計會被先驗往中間拉,即所謂的收縮,能力真的很高或很低的考生在測驗初期會被系統性地低估或高估,直到題數累積後才逐漸修正。加權概似估計(weighted likelihood estimation, WLE)則以一個加權函數校正 MLE 的偏誤,兼顧穩定與較小的偏誤,是介於兩者之間的第三條路。

推導方塊EAP 的貝氏遞迴更新

EAP 把能力估計視為後驗分布的期望值。設答完前 k 題後,觀察到的作答為 \mathbf{u}_k=(u_1,\dots,u_k),則能力的後驗分布正比於先驗乘上概似:

p(\theta \mid \mathbf{u}_k) \propto p(\theta)\prod_{i=1}^{k} P_i(\theta)^{u_i}[1-P_i(\theta)]^{1-u_i},

而 EAP 估計即其期望值 \hat\theta_k^{\text{EAP}} = \int \theta\, p(\theta \mid \mathbf{u}_k)\, d\theta。這個更新有一個遞迴的美感:答完第 k+1 題後的後驗,等於把「答完前 k 題的後驗」當成新的先驗,再乘上第 k+1 題的概似。因此每答一題,只須把當前後驗乘上一道題的反應機率、再重新標準化,能力估計便即時更新。就英語檢定的考生而言,這意味著他每點下一個答案,系統便在背後把他的能力後驗往對應的方向推移一點。

能力估計的即時更新,也帶出了測量精度的即時追蹤。後驗分布的標準差,就是當前能力估計的標準誤;隨著作答累積,後驗逐漸集中,標準誤逐步下降。以那位考生為例,施測前他的能力只有先驗可依據,標準誤等於先驗的標準差 1.00;答完五題後或許降到 0.55,答完十題後降到 0.38。0.38 的意思是,若以估計值為中心取上下約兩個標準誤,他的能力大致落在寬度 1.5 個標準差的區間內,已足以把他和相鄰的分級區分開來。這條「標準誤隨題數下降」的軌跡,正是稍後停止規則所要監看的量。

選題準則:訊息的貪婪與其修正

有了當前的能力估計 \hat\theta,接著要決定問哪一題。這一步是 CAT 效率的來源,也是理解「為什麼更少的題目能達到同樣的精度」的關鍵。第十七章說過,一道題在某個能力點所提供的項目訊息,衡量的正是它在該點區辨能力差異的本事;某一點的訊息愈高,該點附近的能力估計就愈準。一份固定卷必須把訊息攤在整條量尺上,好讓高低不同的考生都測得到,於是對任何一位個別考生而言,只有一部分題目落在他自己的能力附近,其餘題目的訊息貢獻極低,形同白問。適性選題的作法則是把每一題都放到考生當下的位置上,讓訊息的每一分都花在刀口上,這就是同樣的精度可以用更少題目達成的原因。最直接、也最經典的準則,便是最大訊息選題:在題庫尚未使用的題目中,挑出在 \hat\theta 處提供最大項目訊息 I_i(\hat\theta) 的那一題(第十七章)。其邏輯十分直白:既然訊息量衡量一道題在某能力點的測量價值,那就總是挑此刻最有價值的那一題。

推導方塊最大訊息選題準則

設考生當前的能力估計為 \hat\theta_k,題庫中尚未施測的題目集合為 R_k。最大訊息準則選出

i_{k+1} = \arg\max_{i \in R_k}\ I_i(\hat\theta_k), \qquad I_i(\theta) = a_i^2\, P_i(\theta)[1-P_i(\theta)],

即在當前能力估計處訊息最大的題目。由於 I_i 在題目難度 b_i 接近 \theta 時最大,這個準則傾向選出「難度與考生當前能力相稱」的題,這正是適性的核心:讓每一題都對準考生。

把這個循環在那位考生身上走一遍,選題與更新的關係會更具體。他的起始估計是 \hat\theta_0=0,系統挑出難度 b=0.05 的一道閱讀題;他答對了,後驗往右移,\hat\theta_1 上升到 0.32,標準誤由 1.00 降到 0.83。第二題因而挑在 \theta=0.32 附近,是一道難度 b=0.30 的聽力題;他又答對,估計來到 \hat\theta_2=0.58,標準誤 0.72。第三題的難度隨之升到 b=0.55,這次他答錯了,估計不升反降到 \hat\theta_3=0.41,標準誤則繼續下滑到 0.63。答錯使估計下修卻仍使精度提高,是因為「這個難度他做不出來」同樣是關於能力的資訊。第四題於是回到難度 0.40 上下。短短四題,估計已從一無所知的 0 收斂到 0.4 附近,而每一題的難度都貼著他當時的位置走,沒有一題浪費在對他過易或過難的區間。

最大訊息準則雖然直觀,卻有一個貪婪的弱點。在測驗初期,\hat\theta 本身還很不準,此時「在一個不可靠的 \hat\theta 處訊息最大」的題,未必是真正該問的題;更麻煩的是曝光的不均。項目訊息與鑑別度的平方成正比,因此在任何一個能力點上,鑑別度高的題目幾乎都排在候選名單的最前面;再加上考生的能力多半集中在量尺中段,難度接近 0 而鑑別度又高的那少數幾十道「精華題」,便會被一再選給大量考生。結果是題庫的使用型態極端不均:少數題目場場出現,多數題目幾乎從未被抽中,測驗安全與題庫壽命同時受害。修正之道有幾種。Chang & Ying (1996) 提出以 Kullback-Leibler 訊息取代 Fisher 訊息作為選題準則:KL 訊息衡量的是「在一整段能力區間上」區辨的能力,而非僅在單一個點,因而在 \hat\theta 尚不可靠的早期更為穩健。此外,貝氏的選題準則則把能力的後驗不確定性直接納入,選出「能最大程度縮小後驗變異」的題。這些修正的共同精神,是不要在一個還不可靠的能力估計上過度自信地貪婪選題。

內容平衡與約束管理

純以訊息選題,會忽略一件對效度至關重要的事:測驗的內容組成。英語聽讀檢定若一味挑訊息最大的題,可能整份測驗都集中在「聽力細節」而幾乎沒有「閱讀主旨」,即使能力估計很精確,這個分數也無法支撐「英語聽讀能力」這個較廣的推論,這正是第二十二章測驗藍圖所要保障的內容效度。適性選題因此不能只顧訊息,還必須同時滿足內容平衡的約束。

約束管理的初階做法,是約束式最大訊息法:在滿足內容配額的前提下,於允許的題目中挑訊息最大者。例如規定聽力與閱讀各占一半,則系統在選題時會依當前已施測的內容比例,把選擇範圍限縮到「還需要補足的那類題目」中。設想那份分級測驗規定二十題裡聽力十題、閱讀十題。當考生已作答十二題,其中聽力九題、閱讀只有三題時,聽力僅剩一個名額,系統便會把後續的候選範圍幾乎全部限縮在閱讀題上;即使某道聽力題此刻的訊息明顯更高,也不會被選中。這就是以少許測量效率換取內容代表性的具體樣貌。更複雜的約束還包括題型、認知層次、甚至避免內容重疊的題目同時出現。當約束數目一多,逐條以規則處理便顯得笨拙,這正是稍後影子測驗以最佳化統一處理的動機。就英語檢定的考生而言,加入內容平衡之後重跑,他的作答軌跡會略為犧牲一點測量效率,換取一份內容上真正代表聽讀能力的測驗。

曝光控制與測驗安全

CAT 的一個結構性弱點,直接源於它的優點。既然最大訊息準則偏愛高鑑別度的精華題,這些題便會被反覆選給能力相近的大量考生,導致試題曝光(item exposure)過度集中。過度曝光有兩重危害:其一是測驗安全,被高頻使用的題目容易在考生間流傳、遭記憶與洩漏,一旦答案外流,該題便不再測能力;其二是題庫利用不均,少數精華題被用盡,大量題目卻閒置,題庫的整體壽命因而縮短。

曝光控制正是為了在「測量效率」與「題庫安全」之間取得平衡。Wainer et al. (2000) 系統整理了這一議題。方法上,Sympson-Hetter 法為每道題設一個「曝光控制參數」,在選出訊息最大的題之後,再以一個機率決定是否真正施測它,使高需求題目的實際曝光率被壓在一個上限之下。設想模擬校準顯示,不加控制時題庫裡最熱門的一道題會出現在四成的測驗中;把曝光上限訂在 0.20 之後,這道題每次被選中時只有約一半的機率真正施測,其餘機會讓給訊息次高的題,代價是全體考生的平均標準誤由 0.30 略升到 0.32,換來的是沒有任何一道題出現在超過兩成的測驗裡。隨機化的做法則在「訊息最前面的幾道題」中隨機挑一道,以打散曝光;漸進式方法則在測驗初期刻意加入更多隨機性、後期再收斂到最大訊息。這些方法都以犧牲少許測量效率為代價,換取更均勻的曝光與更長的題庫壽命。曝光控制參數本身須以模擬校準,即在假想的考生母體上反覆模擬施測,調整參數直到各題的曝光率落在可接受的範圍。就英語檢定而言,加入曝光控制後,那位考生未必每題都拿到「理論上最該問」的題,卻換來了整個測驗系統的安全與永續。

影子測驗:最佳化選題

前兩節各自加進了一組約束:內容配額要求聽力與閱讀各半,曝光控制要求熱門題不得超過使用上限,實務上還會再疊上題型限制、認知層次配比、作答時間上限等。這些約束若各以一條規則獨立處理,彼此之間便無人協調,於是可能走進一種尷尬的局面:前十五題每一步都合規,卻在剩下的五題裡再也找不到任何一道題能同時補足內容配額又不違反曝光上限。問題的根源在於,逐題的規則只看得到眼前這一步,看不到整份測驗。影子測驗(shadow test)提供了一個優雅的統一解,其思路承接第二十二章組卷的最佳化取向:既然約束是對整份測驗下的,選題時就該以整份測驗為單位來思考。

推導方塊影子測驗的最佳化選題

影子測驗法由 Linden & Reese (1998) 提出。在選第 k+1 題時,它不只挑一道題,而是即時組出一整份「假想的完整測驗」,即影子測驗:這份測驗必須包含已施測的 k 題,滿足全部的內容與其他約束,並在當前能力估計 \hat\theta_k 處使整份測驗的訊息最大:

\max \sum_{i} I_i(\hat\theta_k)\, x_i \quad\text{s.t.}\quad x_i=1\ (\text{已施測題}),\ \ \text{所有內容與約束},\ \ x_i\in\{0,1\}.

解出這個 0–1 整數規劃後,實際施測的下一題,取自影子測驗中「尚未施測」的題目裡訊息最大的那一道。答完後更新 \hat\theta,再重組一份新的影子測驗。如此,每一步選出的題都保證能被擴充為一份「滿足所有約束的完整測驗」,約束因而在逐題選擇中被全程尊重。

所謂「可以寫成線性約束」,具體是這樣的意思。以 x_i 表示第 i 題是否入選,入選為 1、未選為 0:「聽力恰好十題」就寫成所有聽力題的 x_i 加總等於 10;「全卷二十題」就是所有 x_i 加總等於 20;「曝光率已達上限的題不得再用」就是把那些題的 x_i 固定為 0;「同一篇文章底下至多取三題」則是該篇各題的 x_i 加總不超過 3。目標函數則是各題訊息乘上 x_i 後的加總,要求其最大。整個選題問題於是成為一個變數只能取 0 或 1 的線性規劃,可以交給標準的最佳化求解器處理。

影子測驗的精妙之處,在於它把「逐題適性選擇」與「整卷約束滿足」這兩個看似衝突的目標統一了起來:它在每一步都以「整份合格測驗」為視野來挑下一題,因而不會走到「選了幾題後才發現無法滿足內容配額」的死角。這套最佳化框架的彈性很大,幾乎任何可以寫成線性約束的要求,都能被納入。代價是每一步都要解一個整數規劃,計算量較大,但在現代硬體上已完全可行。

停止規則與測量精度

CAT 何時該停?這由停止規則決定,而不同的停止規則體現了不同的測量哲學。固定長度規則最簡單,即施測固定的題數(如英語檢定的二十題),無論考生能力高低皆然;它便於考務安排,卻使不同考生的測量精度不一。標準誤門檻規則則反過來,即持續施測直到能力估計的標準誤降到某個目標之下才停;它使所有考生都達到相近的測量精度,卻讓不同考生的測驗長度不一,能力落在題庫訊息稀薄處的考生可能需要很多題。兩者的適用場合並不相同。固定長度適合考務條件受限、所有考生必須在同一時段結束的情境,例如全校新生同時上機的英文分級施測,教室與時段都得事先排定,而測驗結果只用於分班,各人精度略有出入尚可接受。標準誤門檻則適合以個人分數作出重大決定的場合,例如專業證照考試,此時「每個人的分數同樣可信」遠比「每個人考一樣多題」重要。

推導方塊標準誤停止規則與測驗訊息

在 IRT 中,能力估計的標準誤與已施測題目的測驗訊息直接相關:

SE(\hat\theta) \approx \frac{1}{\sqrt{\sum_{i \in \text{已施測}} I_i(\hat\theta)}}.

標準誤門檻規則即持續選題,直到 SE(\hat\theta) 降至預設門檻 SE_{\text{target}} 之下。由於每道題都貢獻一份訊息、使分母中的測驗訊息累加、SE 隨之下降,這個規則本質上是在問「累積的訊息是否已足夠精確」。其含意是:對能力落在題庫訊息充足處的考生,少數幾題便可達標而提早結束;對能力落在題庫訊息稀薄處(如極端能力)的考生,則需要更多題,甚至可能受限於題庫而無法達標。

實務上常採混合規則,即結合標準誤門檻與長度上下限:先設一個最短與最長題數,在此範圍內以標準誤是否達標決定何時停。這既保證了最低的測量精度,又避免了測驗過短或過長。就英語檢定的考生而言,若他的能力適中、題庫在該處訊息充足,或許十來題其標準誤便已達標;若他的能力極端,則可能需要用滿二十題,而其最終估計的精度仍略遜於能力適中者。

題庫:CAT 的地基

CAT 一切的效能,都建立在一個高品質的題庫之上;沒有好題庫,再精巧的演算法也是空中樓閣。題庫的品質有幾個維度。規模要夠大,一個過小的題庫無法支撐曝光控制,也很快會被用盡;難度分布要夠廣,尤其要在需要精確測量的能力區間,例如證照考試的及格線附近,備有足夠多、鑑別度高的題目;訊息覆蓋要能涵蓋所有可能出現的考生能力,否則能力極端的考生便會落入題庫訊息的空洞。

題庫的維護是持續的工作,其中兩件事尤為關鍵。其一是補題,即持續把新題以嵌入預試(第二十二章)的方式送進正式測驗,蒐集作答資料以校準其參數,再納入題庫,以補充被汰換或曝光過度的題目;為使新題能無縫進入既有的能力量尺,其校準須依賴第二十三章的量尺維護與連結技術,這正是題庫量尺一致性的來源。其二是參數飄移的監控,即題目的參數可能隨時間、隨課程與社會脈絡的變化而漂移,一道題今日的難度未必等於三年前校準時的難度;定期重新校準、偵測並汰換飄移的題目,是維持 CAT 分數跨年可比的必要工作。題庫因此不是一次建好的靜態資產,而是一個需要持續灌注與監控的活水。

多階段測驗:折衷的智慧

逐題適性的 CAT 效率最高,卻也帶來一些實務上的困擾。其一是考生無法回頭檢查或修改前面的答案,因為後續題目正是依前面的作答選出來的,一旦允許更動,整條選題路徑的依據就被抽掉了;對習慣先跳過難題、最後再回頭處理的考生而言,這等於剝奪了一種慣用的作答策略。其二是品管:試卷在施測當下才由演算法即時組成,出題單位事前無法逐份審閱考生真正會看到的題目組合,也就難以預先排除內容重疊、或前後兩題彼此洩漏答案的情形。多階段測驗(multistage testing, MST)正是針對這兩點的折衷設計:它不以「單題」而以「模組」作為適性的單位。

MST 把題目預先組成若干難度不同的模組(題組),測驗分幾個階段進行:考生先做一個中等難度的起始模組,系統依其表現,把他導向下一階段中較難或較易的模組,如此循環數個階段。由於適性發生在「模組之間」而非「題目之間」,MST 兼具了適性的效率與固定卷的可控性:每一條可能的路徑都是一份預先組好、可事先審查的完整測驗,品管因而容易得多;考生也能在同一模組內回頭修改答案。MST 因此常被視為「CAT 的效率」與「固定卷的可控」之間的務實折衷,在許多大型證照與入學考試中被採用。其代價是適性的粒度較粗,效率略遜於逐題的 CAT。

實證效益:省了多少、準了多少

CAT 的核心賣點,是效率。那麼它究竟省了多少?大量的模擬與實證研究給出的結論相當一致:相對於達到同等測量精度所需的固定長度測驗,CAT 通常能以少約一半、有時更少的題數達標。這個效率增益的來源不難理解:CAT 不把題目浪費在「對這位考生而言過難或過易」的地方,每一題都對準考生的能力,訊息的利用率因而大幅提高。

不過,這個「省一半」的結論有其條件,不宜過度推廣。效率增益的大小,取決於題庫的品質,即題庫在各能力水準是否都備有高訊息的題目;取決於考生能力的分布,即若多數考生能力集中在中段,固定卷本就測得不差,CAT 的相對優勢便縮小;也取決於所加入的約束與曝光控制,兩者都以犧牲部分效率為代價。因此,宣稱「CAT 一律省一半」是把特定條件下的結論當成普適定律。負責任的說法是:在題庫充足、能力分布較廣的情境下,CAT 能帶來可觀的效率增益,但其實際幅度須就個案評估。這也呼應了本書一貫的立場:任何方法的效益,都須放回其成立的條件來理解。

應用版圖:從兵役分發到病人自陳

CAT 的發展史,也是它的應用擴散史。其構想可追溯至 Lord (1980) 對「量身訂做測驗」的設想,並經 Weiss 等人的系統研究而成形。最早的大規模作業化,出現在軍事人員的能力甄選與分發,即美國軍方的 ASVAB 測驗;隨後,大型入學與證照考試相繼採用,如 GRE 的電腦化適性版本。這段歷史也留下了制度教訓:一九九○年代 GRE CAT 曾發生題庫遭有計畫記憶與外洩的事件,凸顯了曝光控制與題庫安全並非學術上的細節,而是攸關測驗存續的現實。

近二十年,CAT 最重要的擴張,是走出了教育測驗,進入健康與臨床測量。Cella et al. (2010) 所建立的 PROMIS(病人自陳結果測量系統),以 IRT 校準了大量健康相關構念(如疼痛、疲勞、憂鬱)的題庫,並以 CAT 讓病人只須回答少數最相關的題目,便能精確地測得其健康狀態。這把 CAT 由「考能力」推廣到「測感受」,展現了適性測量作為一種通用工具的潛力。此外,van der Linden 與其同僚所發展的最佳化學派((Linden & Glas, 2010)),則把 CAT 的理論推向了更系統、更一般的高度,其影子測驗等技術已成為當代大型適性測驗的骨幹。

前沿:多向度、診斷與公平

CAT 仍在多個方向上快速發展。其一是把作答時間、乃至更豐富的作答歷程納入選題:既然數位施測會記錄每題的作答時間(第十八章)、甚至完整的操作軌跡(其建模與分析詳第三十四章),選題便可不只顧測量訊息,也兼顧時間效率,例如避免連續給出耗時的題目。其二是多向度 CAT,即當測驗同時測量多個相關特質時,選題須考慮「對哪一個維度、以及對維度間的組合最有訊息」,其效率與詮釋都比單向度複雜。其三是認知診斷 CAT(CD-CAT),它把選題準則由「最能精確估計能力」換成「最能區辨屬性掌握型態」,以最少的題目做出最準確的技能診斷,直接承接第二十一章的診斷模型。

而最具當代意義的一條前沿,是適性測驗的公平與透明。CAT 是一種「演算法化的測量」,每位考生看到的題目由演算法即時決定,而不同考生看到的題目各不相同。這帶來了傳統固定卷所沒有的倫理張力,即演算法的可解釋性,也就是當一位考生質疑「為什麼給我這些題、我的分數怎麼算出來的」時,一個黑箱式的選題與計分能否給出可被理解、可被申訴的交代;以及受測者的知情,即考生是否理解自己正在接受一場「會依其作答而變化」的測驗。這些議題把 CAT 由一個純技術問題,連上了測驗使用的公平與正義,其制度層面的完整討論屬於第二十七章。大型國際評量近年也開始適性化,如 PISA 的轉向,這使適性測量的公平與透明,成為一個影響範圍愈來愈廣的公共議題。

小結

電腦化適性測驗,是項目反應理論最亮眼的應用,也是「演算法化測量」的原型。它的核心循環很簡單:每答一題便即時更新能力估計,再據以選出此刻最能測他的下一題,直到達成停止條件。但要把這個循環落實為一場可信、可控、公平的高風險考試,須層層加入作業組件:以貝氏估計解決初期的發散、以 KL 或貝氏準則修正最大訊息的貪婪、以內容約束保障效度、以曝光控制維護安全、以影子測驗在眾多約束下統一選題、以標準誤或混合規則決定何時停、並以持續維護的高品質題庫作為一切的地基。多階段測驗則提供了效率與可控之間的務實折衷。

貫穿全章的英語檢定考生顯示,一場適性施測的每一步,都是測量效率與作業現實之間的權衡。CAT 帶來可觀的效率增益,卻不是無條件的魔法,其效益取決於題庫、考生分布與所加的約束。而當測驗由固定卷走向演算法選題,一個新的問題也浮現:當機器替每位考生量身出題,如何確保它對所有人都公平、且其運作可被理解與問責。這個問題,把測量帶到了它與社會相遇最尖銳的地方,也正是下一部分、尤其是第二十七章公平性專章所要正面處理的。至此,測驗的施測技術已大致完備;接下來的第二十五章,將把焦點由「能力測驗」轉向另一大類工具,即問卷,去看當受測者不是在「解題」而是在「自陳」時,測量會遇到哪些獨特的作答行為挑戰。

參考文獻

Cella, D., Riley, W., Stone, A., Rothrock, N., Reeve, B., Yount, S., Amtmann, D., et al. (2010). The Patient-Reported outcomes measurement information system (PROMIS) developed and tested its first wave of adult self-reported health outcome item banks: 2005–2008. Journal of Clinical Epidemiology, 63(11), 1179–1194. https://doi.org/10.1016/j.jclinepi.2010.04.011
Chang, H.-H., & Ying, Z. (1996). A global information approach to computerized adaptive testing. Applied Psychological Measurement, 20(3), 213–229. https://doi.org/10.1177/014662169602000303
Linden, W. J. van der, & Glas, C. A. W. (2010). Elements of adaptive testing. Springer.
Linden, W. J. van der, & Reese, L. M. (1998). A model for optimal constrained adaptive testing. Applied Psychological Measurement, 22(3), 259–270. https://doi.org/10.1177/01466216980223006
Lord, F. M. (1980). Applications of item response theory to practical testing problems. Lawrence Erlbaum Associates.
Wainer, H., Dorans, N. J., Eignor, D. R., Flaugher, R., Green, B. F., Mislevy, R. J., Steinberg, L., & Thissen, D. (2000). Computerized adaptive testing: A primer (2nd ed.). Lawrence Erlbaum.
本章引用格式游琇婷(2026)。電腦化適性測驗。《計量心理學:測量、模型與推論》(第 24 章)。