項目反應理論
設想一份三十題的國中數學能力測驗,兩位學生都答對了二十題,成績單上分數一模一樣。但翻開作答明細會看到,甲答對的全是班上答對率最高的基本計算題,後面的代數應用題一題也沒對;乙在基本題上因粗心失了幾分,卻穩穩答對了好幾道最難的應用題。同樣是二十分,兩份答案卷透露的數學能力並不相同,總分卻把這個差異整個抹平了。在古典測驗理論裡(第五章),一份測驗分數的意義,綁定於「這份特定的測驗」;而一題的難度,又取決於「是誰來考」,同一題,給強的人考顯得簡單、給弱的人考顯得困難。分數依賴測驗、題目依賴樣本,這兩條互相纏繞的鎖鏈,使跨測驗、跨群體的比較始終難以理直氣壯。
項目反應理論(item response theory, IRT)一舉打破了這兩條鎖鏈。它不看總分,而是直接為「一個人答對某一題的機率」建模,把它寫成「這個人的潛在能力 \theta」與「這一題的性質」的函數,讓「人」與「題」落在同一把尺上。人與題一旦共用同一把尺,前述兩位學生的差別就有了安放之處:答對難題所需的能力較高,這件事會直接寫進機率模型,而不必指望總分去反映。而這裡,正要兌現第十一章埋下的伏筆:IRT 的主力模型,也就是雙參數模型,在數學上其實就是一個「跑在潛在能力上的 logistic 迴歸」。IRT 是現代測驗,從入學考試到健康量表的測量骨幹,本章就從「項目反應函數」開始,把它一塊塊建立起來,依序處理模型形式、多元計分、測量精度、參數估計與模型適配,最後回到它與因素分析的統一。
從總分到題目:IRT 的問題意識
這一節要回答一個很單純的問題:既然古典測驗理論已經能算分數、也能估信度,為什麼還要另起爐灶?答案在於 CTT 的幾個侷限(第五章),而它們不是計算上的小瑕疵,而是定義方式本身帶來的。它把「難度」定義為答對比例,但這個比例會隨受試樣本浮動,樣本能力高,題目看起來就容易。它把一個人的「真分數」綁在特定測驗上,換一份難度不同的測驗,真分數便隨之改變。它只有一個信度數字,等於假定這份測驗對每個人一樣準。而且它只在「總分」層次工作,不去描述「單一一題」發生了什麼。
同一道題在不同樣本裡忽難忽易,是最容易感受到的侷限。假定某道二元一次方程式的應用題,在一所升學競爭激烈的學校施測,答對率為 0.78;同一道題移到另一所學生數學基礎較弱的學校,答對率掉到 0.42。在 CTT 的語言裡,這道題的難度就從 0.78 變成 0.42,可是題目一個字也沒改,改變的只是「誰來考」。難度會隨施測對象漂移,題庫便無從累積:兩批在不同時間、對不同對象校準出來的題目,其參數放不到一起用。
IRT 的破局之道,是把焦點由「總分」下降到「題目」。它假設每個人身上有一個潛在特質 \theta(如能力、態度),然後為「\theta 為某值的人,答對第 i 題的機率」建立一個機率模型。這個模型同時包含「人的參數 \theta」與「題的參數(難度、鑑別度等)」,兩者被放到同一個連續尺度上。IRT 因此帶來一個 CTT 給不了的漂亮性質,也就是參數不變性(parameter invariance):在理想情況下,題目參數不依賴於「用哪群人估的」,能力估計也不依賴於「用哪些題估的」。這條思想線,可上溯至 Lazarsfeld 的潛在結構分析與 Lord 於一九五○年代開創的潛在特質理論,經 Rasch 的測量模型與 Birnbaum 的 logistic 模型集其大成(後者收於 (Lord & Novick, 1968)),再由 Embretson & Reise (2000) 系統地引介給心理學界,才逐漸由教育測量的專門技術,成為整個心理計量的共同語言。
這條系譜還可以再往前追溯一步,接回第四章的量尺化傳統。第四章談過的 Bradley-Terry-Luce(BTL)模型,以 logistic 函數刻畫「甲勝過乙」的成對比較機率,本質上已是一個把刺激置於同一潛在量尺的機率模型;把「兩個刺激相比」換成「一個人面對一道題」、把「甲的價值減乙的價值」換成「能力減難度」,BTL 的比較結構便平滑地過渡為 Rasch 的項目反應模型。這一系譜揭示了一個常被忽略的事實:IRT 並非憑空誕生的測驗技術,而是 Thurstone 比較判斷與 logistic 量尺化這條老脈絡,在「個別差異測量」上的延伸。也正因如此,Rasch 所珍視的特定客觀性,即比較不受工具與樣本影響,其實正是 Thurstone 當年追求的量尺不變性理想,在機率測量架構中的再現;兩位相隔一個世代的學者,追求的其實是同一個「測量應獨立於測量工具」的夢想。
項目反應函數與 logistic 模型
上一節說明了為什麼要把焦點從總分下移到題目,這一節要把這個想法寫成一個具體的函數。IRT 的核心物件,是項目反應函數(item response function, IRF),又稱試題特徵曲線(item characteristic curve)。先講直覺:橫軸畫能力、縱軸畫答對機率,一道好題目應該長成一條由左下往右上爬升的曲線,能力很低的人幾乎答不對,能力很高的人幾乎一定答對,而在中間某個區段,機率隨能力快速上升。這條先平緩、再變陡、又趨平緩的 S 形曲線,就是 IRF。正式地說,它把答對機率寫成能力 \theta 的函數 P_i(\theta),下標 i 標記這是第幾題,\theta 則是這個人身上那個看不見的潛在特質值。不同的模型,以不同數目的參數來刻畫這條曲線,如下面的方塊所示。
設某人的潛在能力為 \theta,第 i 題答對的機率為 P_i(\theta)。
雙參數模型(2PL):
其中 b_i 是難度(difficulty)參數,即「答對機率剛好等於 0.5」時的 \theta 值,b 愈大題目愈難;a_i 是鑑別度(discrimination)參數,即曲線在 b_i 處的斜率,a 愈大,這題愈能把「能力略高」與「能力略低」的人區分開。
單參數模型(1PL/Rasch):把所有題目的鑑別度設為相等(a 為常數,常取 1),只讓難度 b 變動。
三參數模型(3PL):在 2PL 之上,加一個下漸近線 c_i(猜測參數),容許「能力很低的人也可能猜對」:
仔細看 2PL 那條式子,它其實就是第十一章的 logistic 迴歸。把 \theta 當成「預測變項」,a_i 就是斜率係數、-a_i b_i 就是截距。差別只在:這裡的預測變項 \theta 是「潛在的、看不見的」,須由反應本身估出來。這正是本書一再強調的統一:只要真懂了 logistic 迴歸,IRT 就懂了一半。歷史上,IRF 最早採用的其實是常態肩形(normal ogive)函數,也就是以常態累積分布為形;後來因 logistic 函數計算便利而取代之,兩者在乘上約 1.7 的尺度常數後幾乎重合,這也埋下了後文 IRT 與因素分析等價的線索。
這裡有一個初學者常卡住的問題:\theta 這把尺究竟從哪裡來,它的「零」代表什麼?\theta 的量尺並不是測量之前就存在的物理刻度,而是由模型與資料一起定出來的。式子裡真正起作用的只有 a_i(\theta - b_i) 這個差值,把所有人的 \theta 與所有題的 b 同時平移一個常數,答對機率完全不變;量尺的原點與單位因而不確定,必須另行規定。慣例是把校準樣本的能力分布設為平均數 0、標準差 1。於是 \theta = 1 是「比校準樣本的平均高一個標準差」,而不是「擁有一單位的數學能力」;\theta = 0 只是參照群體的中心,不代表能力為零。這就是所謂 \theta 沒有絕對原點,它也意味著兩份以不同樣本校準的測驗,\theta 不能直接對照,除非先經等化把兩把尺對齊(第二十三章)。
回到那份國中數學能力測驗,用具體的數字最能體會難度與鑑別度。設想其中一道二元一次方程式的應用題,校準後得到難度 b=0、鑑別度 a=1.5。對能力恰為 \theta=0 的學生,也就是校準樣本裡程度中等的那一位,答對機率為 1/(1+e^{0})=0.5,正落在曲線的轉折處;對 \theta=1 的學生,機率為 1/(1+e^{-1.5})\approx 0.82;對 \theta=-1 的學生則約為 0.18。能力相差兩個標準差的兩位學生,在這道題上的答對機率相差六成以上,這題確實分得開人。再設想同一份測驗裡另有一道題,難度同為 b=0,鑑別度卻只有 a=0.4:此時 \theta=1 的學生答對機率約 0.60、\theta=-1 的學生約 0.40,兩人差距不到兩成,這道題幾乎白問。可見鑑別度愈高,曲線在難度附近愈陡,能力略有高低便使答對機率明顯分開;反之,鑑別度低的題目曲線平緩,對「誰比較強」幾乎不敏感。這也解釋了何以低鑑別度的題目,在後面的訊息函數裡貢獻甚微。
難度與鑑別度之外,3PL 的猜測參數 c_i 也值得單獨說明。它是曲線的下漸近線,意思是「即使能力低到不能再低,答對機率也不會掉到 c_i 以下」。對一道四選一的選擇題,完全不會的學生亂猜也有四分之一的機會蒙對,因此 c 常落在 0.2 上下。假定前述那道應用題改以四選一呈現,估得 c=0.20,則能力極低的學生答對機率不趨近 0 而趨近 0.20;b 的意義也要跟著調整,它不再是答對機率 0.5 之處,而是機率落在 c 與 1 正中間,即 (1+c)/2 = 0.60 之處。須留意的是,c 並非實際觀察到的猜對率,而是模型外推到能力極低端所得的參數,樣本中若缺少足夠多的低能力受試者,它往往估得很不穩,這正是 3PL 遠比 2PL 難估的原因。
人與題共用一把尺,這件事的實務威力值得再說明一次。在 CTT 裡,題目難度是答對比例、人的成績是總分,兩者單位不同、無法並列;在 IRT 裡,b 與 \theta 住在同一條實數線上,於是「這位學生的能力是 \theta=0.8,這道題的難度是 b=0.8」是一句有意義的話,意思是他答對此題的機率恰為 0.5。正因如此,題目可以像零件一樣入庫:每道題校準後帶著參數存進題庫,日後不論編進哪一份試卷,難度都不變。兩份題目完全不同的試卷,只要含有若干共同題把量尺對起來,兩批考生的 \theta 便能直接比較,這是測驗等化(第二十三章)與電腦化適性測驗(第二十四章)的根本前提。
Rasch 模型與「典範之爭」
表面上,Rasch 模型只是「把所有鑑別度設為相等」的 1PL,聽來像是 2PL 的一個受限特例,少了一個參數,彈性也就少了一分。若只從統計適配的角度看,這樣的理解不算錯,卻完全錯過了重點。對 Rasch 學派而言,這個看似退讓的限制,換來的是其他模型都沒有的一組測量性質,因此它遠不只是一個模型,而是一套關於「什麼才配稱為測量」的哲學主張。這一節要說明的,正是這個限制究竟換到了什麼,以及為什麼這件事會在 IRT 內部引發一場延續半世紀的路線之爭。讀完之後,應該能回答一個乍看難以理解的現象:為什麼有人寧可刪掉題目,也不肯放寬模型。
Rasch 珍視的,是一個稱為「特定客觀性」(specific objectivity)的性質:兩個人能力的比較,不該取決於「用哪些題目來比」;兩道題目難度的比較,也不該取決於「用哪群人來比」。在 Rasch 模型裡,這個性質嚴格成立,因為總分是能力的「充分統計量」,使比較可以完全獨立於特定的題目或樣本,並容許以條件最大概似把能力參數「消去」而單獨、乾淨地估計題目難度。在 Rasch 看來,這種「比較不受工具影響」的特性,正是「真正的測量」該有的標誌,而它其實與第二章的基本測量、連加測量傳統遙相呼應,可視為連加測量理想在機率架構中的實現。
這個性質用數字說最清楚。設想那份國中數學測驗中,甲的能力為 \theta=1.0、乙為 \theta=0.0。面對一道 b=0.5 的中等題,甲答對機率約 0.62、乙約 0.38,兩人的勝算比(odds ratio)約為 2.7;換到一道 b=2.0 的難題,甲降到 0.27、乙降到 0.12,勝算比仍是 2.7。題目變難,兩人的機率都往下掉,但「甲比乙強多少」的結論分毫未動,因為難度在相除時消掉了。這就是特定客觀性的具體樣貌:比較的結果,不隨用來比較的題目而改變。
由此,便長出了一場延續至今的「典範之爭」。Rasch 陣營(測量優先)主張:模型是標準,資料要來遷就模型,若題目不符合 Rasch 模型,那就修改題目、剔除不良試題,直到資料符合這個「良好測量」的理想。Lord 與 Birnbaum 陣營(適配優先)則主張:資料是標準,模型要來遷就資料,既然真實題目的鑑別度本來就不同、還可能有猜測,那就用 2PL、3PL 這些更有彈性的模型,去把資料配得更好。這是一個真實而深刻的哲學分歧,沒有簡單的對錯:前者換來優美的測量性質,代價是可能得捨棄很多題目;後者換來對資料的貼合,代價是失去了特定客觀性。理解這場爭論,比死背「幾參數模型」更能看懂 IRT 的靈魂。
前面提到的條件最大概似(conditional ML),正是這套哲學在估計層次的兌現:給定每個人的總分後,能力參數會從概似中消去,題目難度因而可以完全不依賴任何關於能力分布的假設而被一致地估計。近年更有研究以連加測量的公理,對 Rasch 模型所要求的可加結構做實證檢驗,把「這批資料是否配得上如此嚴格的測量」由信念轉為可否證的問題,呼應了第二章的量化預設之辯。
多元計分模型
至此都在講「答對/答錯」的二元題,也就是一題只有兩種結果的情形。但心理計量最常見的題目,其實是多級的:李克特量表從「非常不同意」到「非常同意」有四到七個等級,臨床憂鬱量表如 CES-D 以四級記錄症狀出現的頻率,數學解題也常有部分給分,寫對關鍵步驟得一分、完全正確得兩分。這些反應顯然帶著順序訊息,若粗暴地二分化,例如把「同意」與「非常同意」併成一類,等於白白丟掉一部分區辨力。IRT 為此發展了一整套多元計分模型(polytomous models),而它們要回答的核心問題只有一個:當結果不只兩種時,究竟該把哪一種機率寫成 \theta 的 S 形函數?不同的答案,就長成不同的模型家族。
等級反應模型(graded response model, GRM;(Samejima, 1969))適用於「有序類別」:它為「答在第 k 級或更高」這種累積機率建模,一題有幾級,就有幾條累積曲線。部分計分模型(partial credit model, PCM;(Masters, 1982))屬於 Rasch 家族,以「相鄰兩級之間」的機率來刻畫,適合「一步步得分」的情境,如數學解題的階段給分。廣義部分計分模型(generalized partial credit model, GPCM;(Muraki, 1992))則在 PCM 之上,容許各題有不同的鑑別度,可說是 PCM 與 2PL 精神的結合。此外還有兩個成員值得一提:評定量表模型把各題的「級距結構」約束為相同,適合同一套選項反覆使用的量表;而名義反應模型則處理「無序類別」,例如選擇題各選項本身即帶診斷意義的情形。這些模型大致可分為兩系:GRM 屬「累積」取向,PCM 家族屬「相鄰類別」取向。它們的選擇,一樣要看資料的性質與測量立場(Rasch 家族或容許鑑別度變動),但都共享同一個 IRT 的核心邏輯:以潛在特質去解釋類別反應。
這兩系的分野,以一個具體情境最能說清。設想一道四點的李克特題,選項為「非常不同意、不同意、同意、非常同意」。GRM 的做法,是把它拆成三個累積的二分問題,即「至少到第 1 級以上嗎」「至少到第 2 級以上嗎」「至少到第 3 級以上嗎」,每一個都以一條 2PL 式的曲線刻畫,因此一道四級題會給出三個依序排列的閾值參數,加上一個共用的鑑別度;由於各累積曲線共用鑑別度,這些累積機率曲線彼此平行、不會交叉。GPCM 的做法則不同,它直接刻畫「既然作答者已到達第 k-1 級,會不會再跨一步到第 k 級」這種相鄰類別的條件機率,因此參數是各相鄰級之間的步階難度(step difficulty)。兩者最實際的差別,在於對「級」的界定:GRM 問的是「答在此級或更高」的累積門檻,GPCM 問的是「由前一級跨到本級」的局部轉換。當某些中間類別很少人選、或類別順序在實證上並不嚴格單調時,兩者可能給出頗為不同的參數與詮釋,因而報告時務必言明採用的是哪一個取向。
訊息量與測量精度
前幾節處理的是「模型長什麼樣」,這一節要處理「測得準不準」。IRT 在這裡有一個 CTT 完全給不了的重要概念:測量的精度,可以「隨能力水準而變」。CTT 只有一個信度數字、一個測量標準誤,等於暗示「整份測驗對所有人的精度都一樣」;但這顯然不對。一份為國中畢業生編的數學測驗,題目難度多半集中在中等程度,它對中間那一大群學生分得很細,對頂尖的學生卻因為題題都會而分不出高下,對基礎最弱的學生也因為題題都不會而只剩亂猜。同一個信度數字,落在不同能力的人身上其實是不同的精確度。IRT 以「訊息函數」精確地捕捉了這件事,把單一個信度,換成一條隨 \theta 起伏的曲線,如下面的方塊所示。
在 IRT 裡,一道題目在能力 \theta 處提供多少「測量訊息」,由項目訊息函數(item information function)刻畫。以 2PL 為例:
它有兩個直覺:其一,一道題在「P_i(\theta) = 0.5」處(即 \theta 接近該題難度 b_i 時)訊息最大,題目在它「難度相稱」的能力區間最能測人;其二,鑑別度 a_i 愈大,訊息愈多(a 以平方進入),好題目提供更多訊息。整份測驗的訊息,是各題訊息之和:
其中 SE(\theta) 是在能力 \theta 處的測量標準誤:訊息愈多,SE 愈小、估計愈精確。
這個訊息函數,與第八章的 Fisher 訊息是同一回事,它衡量「概似函數在 \theta 處彎得多陡」。它帶來兩個深遠的實務意涵。第一,測量精度是 \theta 的函數:同一份測驗,可能在中等能力處很準、在兩端很不準,這是單一個信度數字永遠說不出的細節;若要一個整體性的摘要,可計算「邊際信度」,即對能力分布積分後的平均精度,作為 CTT 信度在 IRT 中的對應。第二,也是最關鍵的:既然每道題的訊息在不同能力處不同,研究者便可以「因人選題」,對一個當前能力估計偏高的人,就挑在高能力處訊息最大的題目給他。這正是電腦化適性測驗(computerized adaptive testing, CAT)的理論基礎,依受試者當前的 \theta 估計,即時選出「此刻最能測他」的那一題。這條線,會在第二十四章完整展開。
訊息的數值其實不難讀。仍以那道 a=1.5、b=0 的數學題為例,在 \theta=0 處 P=0.5,訊息為 1.5^2 \times 0.5 \times 0.5 \approx 0.56;到了 \theta=2 處 P \approx 0.95,訊息只剩約 0.10,不到中間的五分之一,因為這道題問的東西,那位學生早就會了。整份測驗的訊息若在 \theta=0 處累積到 I(0)=10,該處的測量標準誤為 1/\sqrt{10}\approx 0.32;若在 \theta=2 處只累積到 2.5,標準誤便升到 1/\sqrt{2.5}\approx 0.63,整整是前者的兩倍。同一份測驗,量中間的學生誤差帶約正負 0.32,量頂端的學生卻寬達一倍,這正是單一個信度值說不出口的事。
以測驗訊息的角度看題目配置,會帶來直接的實務啟示。若要編一份「在所有能力水準都測得準」的測驗,就該讓題目難度沿能力量尺均勻散布,使測驗訊息函數盡量平坦而寬廣;若目的是「在某個切分點附近做通過與否的決定」,則應把題目難度集中在該切分點,使訊息在該處最大。這種「依測量目的來配置題目難度」的思路,正是題庫建置與 CAT 選題(第二十四章)的核心,也把抽象的訊息函數,變成了可操作的編題準則。
參數估計
IRT 要估兩種東西:題目的參數(a、b、c),以及每個人的能力 \theta。這比 CTT「算個總分」複雜得多,因為 \theta 是潛在的,沒有任何一欄資料直接記錄它,看得見的只有一格一格的對與錯。估計的邏輯因此必須倒過來走:先假定某人的能力是某個值,算出他在各題的答對機率,再問「照這組機率,出現手上這份作答型態的可能性有多大」,最後挑出使這個可能性最大的能力值。而要把各題的機率相乘成整份作答型態的機率,還需要一個關鍵假設,即局部獨立,稍後細說。估計的引擎,仍是第八、第十二章的最大概似,如下面的方塊所示。
假設「局部獨立」(第三章):在能力 \theta 給定下,各題的作答互相獨立。那麼某人一整組作答 (x_1, \dots, x_n)(x_i = 1 為答對、0 為答錯)的概似,為各題機率的連乘:
由此可延伸出兩種估計策略。聯合最大概似(joint ML, JML):同時估計所有人的 \theta 與所有題的參數。問題是,人數愈多、要估的 \theta 也愈多,這種「附帶參數」(incidental parameters)會使題目參數的估計不一致(即使樣本無限大,也不收斂到真值)。邊際最大概似(marginal ML, MML):先假設 \theta 在母體中服從某個分布(通常是標準常態),把 \theta「積分掉」,只估計題目參數;題目參數估好後,再回頭估每個人的 \theta。MML 避開了附帶參數問題,是當今 IRT 參數估計的主流。
方塊裡那個連乘,把局部獨立(local independence)用得理所當然,值得停下來說清楚它在講什麼。它並不是說各題作答彼此無關,恰恰相反,在整個樣本裡,答對第 1 題的人通常也比較會答對第 2 題。局部獨立說的是:這些相關全部來自能力的差異,一旦把能力固定住,只看能力同為 \theta=0.5 的那群學生,兩題的對錯就應該不再相關,\theta 是題目間相關的唯一來源。什麼時候會違反?設想那份數學測驗裡有兩題共用同一段情境敘述,第 2 題還必須用到第 1 題算出的中間結果,那麼第 1 題算錯的學生,第 2 題幾乎注定跟著錯。這份額外的連動與能力無關,卻會讓模型誤以為測驗提供的訊息比實際更多,精度因而被高估。
MML 之所以在實務上可行,關鍵是 Bock & Aitkin (1981) 以 EM 演算法(第二十章)把那個對 \theta 的積分化為可計算的程序,這使含潛在能力的最大概似估計首度得以大規模實作,堪稱現代 IRT 軟體的引擎。至於個別能力的估計,題目參數定妥後,可用最大概似、期望後驗(EAP)、最大後驗(MAP)或加權概似(WLE)等方法,各自在偏誤與變異之間有不同的取捨,例如 EAP 較穩定卻對極端能力有向中收縮的傾向。此外,貝氏估計(以 MCMC 抽樣)近年日益普及,它能自然地把題目參數與能力的不確定性一併納入,並靈活處理複雜的設計;Bürkner (2021) 便示範了如何在通用的貝氏迴歸框架中,把各種 IRT 模型當作廣義線性混合模型來配適,大幅降低了實作門檻。這一取向的細節,是第三十三章的主題。
模型與資料適配
前面幾節描繪的,都是 IRT 順利運作時的樣子:參數不變、訊息可加、人與題共用一把尺。這些漂亮性質沒有一項是免費的,它們全都建立在「模型設定正確」這個前提上。\theta 真的只有一個維度嗎?曲線真的是 logistic 那個形狀嗎?控制能力之後各題真的互不相關嗎?只要其中一條不成立,估出來的參數就不再是它所宣稱的那個東西,換樣本、換題目時的不變性也隨之瓦解。因此,檢驗模型與資料的適配(model-data fit),不是分析做完後補上的形式手續,而是負責任的 IRT 分析不可或缺的一步。
有幾個假設特別需要檢查。單維性(unidimensionality):多數基本 IRT 模型假設只有「一個」潛在特質在起作用;若題目其實測了好幾個維度,模型就被誤設,此時可先以因素分析或殘差的主成分分析評估維度性。局部獨立(local independence):控制 \theta 後各題應獨立;若某兩題因題幹相關、或共用材料而額外相關,就違反了這個假設,常以 Yen 的 Q_3 之類的殘差相關統計量偵測。反應函數的形式:真實的曲線,是不是真的長 logistic 那個樣子?這可用各種試題適配統計量,例如比較「觀察」與「模型預期」答對率的 S\text{-}X^2,以及殘差圖來檢查。忽略適配、硬套模型的後果是嚴重的:參數估計會偏誤,不變性也不再成立,那些「參數不受樣本影響」的美好承諾,只有在模型正確時才兌現。
適配的檢查還有兩個延伸值得一提。其一是差異試題功能(differential item functioning, DIF):同一道題,對能力相同、但屬於不同群體的人,若答對機率仍有系統差異,即代表該題在群體間並非「同一把尺」,這是第十九章的主題。其二是人員適配(person fit):不只題目可能不合模型,個別受試者的作答型態也可能異常,例如粗心、作弊或亂答,會產生與其能力估計不符的反應,人員適配統計量正是用以標記這類可疑個案。其中維度性的檢查尤其不可省,因為把多維資料硬套單維模型,會使能力估計混同不同的特質,讓分數的意義變得含糊。
IRT 與 CFA 的深層統一
到這裡,可以揭示一個把整個第四部分縫合起來的深刻洞見:IRT 與因素分析,其實是同一件事的兩種說法。這個說法初聽並不容易接受,因為兩者的外觀、術語與軟體幾乎沒有交集:因素分析談負荷量與共同性,畫的是路徑圖,處理的多半是連續指標;IRT 談難度與鑑別度,畫的是 S 形曲線,處理的是對錯或等級。然而只要把類別指標背後那個潛在的連續反應攤開來看,兩套符號其實可以逐項對譯。
具體地說,對二元或次序的題目,IRT 模型在數學上,等價於一個「帶類別指標的 CFA」,也就是第十五章那個以 WLSMV、以潛在連續變項與閾值處理次序資料的取徑。兩者的參數還能互相換算:IRT 的鑑別度 a,對應於 CFA 的因素負荷;IRT 的難度 b,對應於 CFA 的閾值。而這一對應在採用常態肩形模型時尤其乾淨,因為此時的 IRF 正是一個以常態閾值切分潛在連續反應的因素模型。兩個傳統的差別,更多在於估計的哲學:IRT 慣用「完全訊息」的邊際最大概似,直接對整組作答型態建模;類別 CFA 則常用「有限訊息」的 WLSMV,只利用一階與二階的邊際訊息。
這正好回到第三章 Bartholomew 的二維類型學:潛在變項連續、觀測變項類別的那一格,就是 IRT。於是,看似分屬「測驗理論」與「因素分析」兩大傳統的東西,一個由教育測驗長出、一個由智力研究長出,在數學上匯流成了一條河。理解這個統一,研究者便不會再把 CFA、IRT 當成要各自從頭學的兩套技術,而會看見它們共享的那副潛在變項骨架。
分析實務:模型選擇與樣本數
把前述原理落到實作,有幾個決策反覆出現。第一是模型選擇:資料是二元還是多級?該用 Rasch 家族(重測量性質、題目較少時較穩)還是 2PL/3PL(重適配、題目鑑別度差異大時較貼切)?這既是統計問題,也是測量立場的問題,宜以巢狀模型比較與資訊準則(第十二章)輔以理論判斷。第二是樣本數:IRT 遠比 CTT 吃資料,Rasch 模型或許數百人即可穩定估計,2PL 通常需要數百至上千,3PL 的猜測參數尤其難估,往往需要更大的樣本,並常以貝氏先驗加以穩定。第三是工具:R 的 mirt、TAM 與貝氏取向的 Stan/brms 都已成熟,但一如全書反覆強調,工具再強,也取代不了對模型假設與適配的實質判斷。
前沿與應用
IRT 是一個仍在蓬勃發展、應用極廣的領域,其當代擴展大致沿三條軸線推進,本章僅作預告,各留待專章展開。其一是向度的擴展,即多向度 IRT(multidimensional IRT),容許同時存在多個潛在特質,是 IRT 與因素分析在高維度上的匯合。其二是解釋的擴展,即解釋型 IRT(explanatory IRT;(De Boeck & Wilson, 2004)),把 IRT 放進廣義線性混合模型的框架,不只估「這題有多難」,還進一步以題目特徵去預測難度、以受試者特徵去預測能力,把測量與解釋結合起來。其三是資料的擴展,把作答時間乃至完整反應歷程納入模型。這三條軸線的完整發展,構成第十八章進階項目反應模型的主體。而與 IRT 血緣最近、卻以類別潛在變項取代連續能力的認知診斷模型,則自成一系,留待第二十一章展開。至於貝氏取向如何讓這些複雜的設計變得可行,前已述及通用的機率程式已使其實作大為簡便 (Bürkner, 2021),其細節屬第三十三章。
在應用面,IRT 更是現代測驗的引擎。大型入學與證照考試(如 GRE)、國際教育評比(如 PISA),其計分與等化的背後都是 IRT;而在健康與臨床領域,Reise & Waller (2009) 回顧了 IRT 如何用於量表連結、電腦化適性測驗與差異試題功能分析,像 PROMIS(病人自陳結果測量系統)這樣的大型計畫,也全靠 IRT 來建立可跨測驗比較的量尺、並支撐電腦化適性測驗。這些具體的應用,連同測驗編製與電腦化適性測驗的完整方法,將分別於第二十二章與第二十四章展開。
最後值得一提一個極新的方向。隨著大型語言模型的興起,自動試題生成與自動計分正被重新想像,研究者開始探索以模型大量產生題目、再以 IRT 校準其參數的可能;不過這類自動生成試題的效度與品管,屬於測驗編製方法學的範疇,其完整討論留待第二十二章。反過來,把 IRT 用於分析人工智慧模型本身的能力,也成為一個新興的「機器心理計量」課題。這些方向多屬推測性、仍待更嚴謹的效度檢驗,但它們預示了 IRT 作為一種通用測量語言,其適用範圍正持續擴張。
小結
項目反應理論,為「\theta 為某值的人,答對某題的機率」建立機率模型,把人與題放上同一把尺,由此換來 CTT 給不了的參數不變性,以及隨能力而變的測量精度(訊息函數)。本章的幾個核心連結值得記牢:2PL 就是潛在能力上的 logistic 迴歸(第十一章);訊息函數就是 Fisher 訊息(第八章),也是 CAT 的基礎(第二十四章);而對類別資料,IRT 與 CFA 根本是同一個模型的兩種面貌(第三、十五章)。至於 Rasch 與 2PL/3PL 之爭,則折射出第二章「什麼才算測量」那個古老問題的當代回聲。
理解了 IRT,便掌握了現代測量最強大的工具。而本章所建立的單向度計分模型,只是 IRT 家族的起點:第十八章的進階項目反應模型,將沿著向度、解釋與作答歷程三條軸線,把它擴展為當代測量研究的建模語言。至於另一個關鍵問題,當我們拿同一份量表,去比較不同群體(如不同性別、文化)、或同一群人的不同時點時,如何確定「這份量表在他們身上,測的是同一件事」,這個「跨群體、跨時間比較是否成立」的問題,則是第十九章的測量不變性與差異試題功能所要正面處理的。