第 17 章 項目反應理論
第四部 潛在變項測量模型
17Chapter

項目反應理論

在古典測驗理論裡(第五章),一份測驗分數的意義,綁定於「這份特定的測驗」;而一題的難度,又取決於「是誰來考」,同一題,給強的人考顯得簡單、給弱的人考顯得困難。項目反應理論(item response theory, IRT)一舉打破了這兩條鎖鏈。它不看總分,而是直接為「一個人答對某一題的機率」建模,把它寫成「這個人的潛在能力 \theta」與「這一題的性質」的函數,讓「人」與「題」落在同一把尺上。而這裡,正要兌現第十一章埋下的伏筆:IRT 的主力模型,也就是雙參數模型,在數學上其實就是一個「跑在潛在能力上的 logistic 迴歸」。IRT 是現代測驗,從入學考試到健康量表的測量骨幹,本章就從「項目反應函數」開始,把它一塊塊建立起來。

從總分到題目:IRT 的問題意識

先回顧 CTT 的幾個侷限(第五章)。它把「難度」定義為答對比例,但這個比例會隨受試樣本浮動,樣本能力高,題目看起來就容易。它把一個人的「真分數」綁在特定測驗上,換一份難度不同的測驗,真分數便隨之改變。而且它只在「總分」層次工作,不去描述「單一一題」發生了什麼。

IRT 的破局之道,是把焦點由「總分」下降到「題目」。它假設每個人身上有一個潛在特質 \theta(如能力、態度),然後為「\theta 為某值的人,答對第 i 題的機率」建立一個機率模型。這個模型同時包含「人的參數 \theta」與「題的參數(難度、鑑別度等)」,兩者被放到同一個連續尺度上。IRT 因此帶來一個 CTT 給不了的漂亮性質,也就是參數不變性(parameter invariance):在理想情況下,題目參數不依賴於「用哪群人估的」,能力估計也不依賴於「用哪些題估的」。這條思想線,可上溯至 Lazarsfeld 的潛在結構分析與 Lord 於一九五○年代開創的潛在特質理論,經 Rasch 的測量模型與 Birnbaum 的 logistic 模型集其大成(後者收於 (Lord & Novick, 1968)),再由 Embretson & Reise (2000) 系統地引介給心理學界,才逐漸由教育測量的專門技術,成為整個心理計量的共同語言。

這條系譜還可以再往前追溯一步,接回第四章的量尺化傳統。第四章談過的 Bradley-Terry-Luce(BTL)模型,以 logistic 函數刻畫「甲勝過乙」的成對比較機率,本質上已是一個把刺激置於同一潛在量尺的機率模型;把「兩個刺激相比」換成「一個人面對一道題」、把「甲的價值減乙的價值」換成「能力減難度」,BTL 的比較結構便平滑地過渡為 Rasch 的項目反應模型。這一系譜揭示了一個常被忽略的事實:IRT 並非憑空誕生的測驗技術,而是 Thurstone 比較判斷與 logistic 量尺化這條老脈絡,在「個別差異測量」上的延伸。也正因如此,Rasch 所珍視的特定客觀性,即比較不受工具與樣本影響,其實正是 Thurstone 當年追求的量尺不變性理想,在機率測量架構中的再現;兩位相隔一個世代的學者,追求的其實是同一個「測量應獨立於測量工具」的夢想。

項目反應函數與 logistic 模型

IRT 的核心物件,是項目反應函數(item response function, IRF),又稱試題特徵曲線:它把「答對機率」畫成能力 \theta 的一條 S 形曲線,能力愈高,答對機率愈高。不同的模型,以不同數目的參數來刻畫這條曲線,如下面的方塊所示。

推導方塊二元 IRT 模型

設某人的潛在能力為 \theta,第 i 題答對的機率為 P_i(\theta)。

雙參數模型(2PL):

P_i(\theta) = \frac{1}{1 + e^{-a_i(\theta - b_i)}},

其中 b_i 是難度(difficulty)參數,即「答對機率剛好等於 0.5」時的 \theta 值,b 愈大題目愈難;a_i 是鑑別度(discrimination)參數,即曲線在 b_i 處的斜率,a 愈大,這題愈能把「能力略高」與「能力略低」的人區分開。

單參數模型(1PL/Rasch):把所有題目的鑑別度設為相等(a 為常數,常取 1),只讓難度 b 變動。

三參數模型(3PL):在 2PL 之上,加一個下漸近線 c_i(猜測參數),容許「能力很低的人也可能猜對」:

P_i(\theta) = c_i + \frac{1 - c_i}{1 + e^{-a_i(\theta - b_i)}}.

仔細看 2PL 那條式子,它其實就是第十一章的 logistic 迴歸。把 \theta 當成「預測變項」,a_i 就是斜率係數、-a_i b_i 就是截距。差別只在:這裡的預測變項 \theta 是「潛在的、看不見的」,須由反應本身估出來。這正是本書一再強調的統一:只要真懂了 logistic 迴歸,IRT 就懂了一半。歷史上,IRF 最早採用的其實是常態肩形(normal ogive)函數,也就是以常態累積分布為形;後來因 logistic 函數計算便利而取代之,兩者在乘上約 1.7 的尺度常數後幾乎重合,這也埋下了後文 IRT 與因素分析等價的線索。

舉一個具體的數字,有助於體會這些參數。設一道題的難度 b=0、鑑別度 a=1.5。對能力恰為 \theta=0 的人,其答對機率為 1/(1+e^{0})=0.5,正落在曲線的轉折處;對 \theta=1 的人,機率為 1/(1+e^{-1.5})\approx 0.82;對 \theta=-1 的人則約為 0.18。可見鑑別度愈高,曲線在難度附近愈陡,能力略有高低便使答對機率明顯分開;反之,鑑別度低的題目曲線平緩,對「誰比較強」幾乎不敏感。這也解釋了何以低鑑別度的題目,在後面的訊息函數裡貢獻甚微。

Rasch 模型與「典範之爭」

表面上,Rasch 模型只是「把所有鑑別度設為相等」的 1PL,聽來像是 2PL 的一個受限特例。但對 Rasch 學派而言,它遠不只如此,它是一套測量哲學。

Rasch 珍視的,是一個稱為「特定客觀性」(specific objectivity)的性質:兩個人能力的比較,不該取決於「用哪些題目來比」;兩道題目難度的比較,也不該取決於「用哪群人來比」。在 Rasch 模型裡,這個性質嚴格成立,因為總分是能力的「充分統計量」,使比較可以完全獨立於特定的題目或樣本,並容許以條件最大概似把能力參數「消去」而單獨、乾淨地估計題目難度。在 Rasch 看來,這種「比較不受工具影響」的特性,正是「真正的測量」該有的標誌,而它其實與第二章的基本測量、連加測量傳統遙相呼應,可視為連加測量理想在機率架構中的實現。

由此,便長出了一場延續至今的「典範之爭」。Rasch 陣營(測量優先)主張:模型是標準,資料要來遷就模型,若題目不符合 Rasch 模型,那就修改題目、剔除不良試題,直到資料符合這個「良好測量」的理想。Lord 與 Birnbaum 陣營(適配優先)則主張:資料是標準,模型要來遷就資料,既然真實題目的鑑別度本來就不同、還可能有猜測,那就用 2PL、3PL 這些更有彈性的模型,去把資料配得更好。這是一個真實而深刻的哲學分歧,沒有簡單的對錯:前者換來優美的測量性質,代價是可能得捨棄很多題目;後者換來對資料的貼合,代價是失去了特定客觀性。理解這場爭論,比死背「幾參數模型」更能看懂 IRT 的靈魂。

值得補充的是,Rasch 模型的「充分統計量」性質有一個實用的推論,即條件最大概似(conditional ML):在給定每個人總分的條件下,能力參數會從概似中消去,於是題目難度可以完全不依賴任何關於能力分布的假設而被一致地估計。這正是「特定客觀性」在估計層次的體現,也是 Rasch 學派引以為傲之處。近年更有研究以連加測量的公理,對 Rasch 模型所要求的可加結構做實證檢驗,把「這批資料是否配得上如此嚴格的測量」由信念轉為可否證的問題,呼應了第二章的量化預設之辯。

多元計分模型

至此都在講「答對/答錯」的二元題。但心理計量最常見的題目,其實是多級的,例如李克特量表的「非常不同意」到「非常同意」,或作答有「部分給分」。IRT 為此發展了一整套多元計分模型(polytomous models)。

等級反應模型(graded response model, GRM;(Samejima, 1969))適用於「有序類別」:它為「答在第 k 級或更高」這種累積機率建模,一題有幾級,就有幾條累積曲線。部分計分模型(partial credit model, PCM;(Masters, 1982))屬於 Rasch 家族,以「相鄰兩級之間」的機率來刻畫,適合「一步步得分」的情境,如數學解題的階段給分。廣義部分計分模型(generalized partial credit model, GPCM;(Muraki, 1992))則在 PCM 之上,容許各題有不同的鑑別度,可說是 PCM 與 2PL 精神的結合。此外還有兩個成員值得一提:評定量表模型把各題的「級距結構」約束為相同,適合同一套選項反覆使用的量表;而名義反應模型則處理「無序類別」,例如選擇題各選項本身即帶診斷意義的情形。這些模型大致可分為兩系:GRM 屬「累積」取向,PCM 家族屬「相鄰類別」取向,兩者對「級」的機率界定不同,詮釋時不宜混淆。它們的選擇,一樣要看資料的性質與測量立場(Rasch 家族或容許鑑別度變動),但都共享同一個 IRT 的核心邏輯:以潛在特質去解釋類別反應。

這兩系的分野,以一個具體情境最能說清。設想一道四點的李克特題,選項為「非常不同意、不同意、同意、非常同意」。GRM 的做法,是把它拆成三個累積的二分問題,即「至少到第 1 級以上嗎」「至少到第 2 級以上嗎」「至少到第 3 級以上嗎」,每一個都以一條 2PL 式的曲線刻畫,因此一道四級題會給出三個依序排列的閾值參數,加上一個共用的鑑別度;由於各累積曲線共用鑑別度,這些累積機率曲線彼此平行、不會交叉。GPCM 的做法則不同,它直接刻畫「既然作答者已到達第 k-1 級,會不會再跨一步到第 k 級」這種相鄰類別的條件機率,因此參數是各相鄰級之間的步階難度(step difficulty)。兩者最實際的差別,在於對「級」的界定:GRM 問的是「答在此級或更高」的累積門檻,GPCM 問的是「由前一級跨到本級」的局部轉換。當某些中間類別很少人選、或類別順序在實證上並不嚴格單調時,兩者可能給出頗為不同的參數與詮釋,因而報告時務必言明所採用的是累積取向或相鄰類別取向,切莫混為一談。

訊息量與測量精度

IRT 有一個 CTT 完全給不了的重要概念:測量的精度,可以「隨能力水準而變」。CTT 只有一個信度數字,暗示「整份測驗對所有人的精度都一樣」;但這顯然不對,一份對高能力者鑑別力很好的測驗,對低能力者可能形同亂猜。IRT 以「訊息函數」精確地捕捉了這件事,如下面的方塊所示。

推導方塊項目與測驗訊息函數

在 IRT 裡,一道題目在能力 \theta 處提供多少「測量訊息」,由項目訊息函數(item information function)刻畫。以 2PL 為例:

I_i(\theta) = a_i^2\, P_i(\theta)\,[1 - P_i(\theta)].

它有兩個直覺:其一,一道題在「P_i(\theta) = 0.5」處(即 \theta 接近該題難度 b_i 時)訊息最大,題目在它「難度相稱」的能力區間最能測人;其二,鑑別度 a_i 愈大,訊息愈多(a 以平方進入),好題目提供更多訊息。整份測驗的訊息,是各題訊息之和:

I(\theta) = \sum_i I_i(\theta), \qquad SE(\theta) = \frac{1}{\sqrt{I(\theta)}}.

其中 SE(\theta) 是在能力 \theta 處的測量標準誤:訊息愈多,SE 愈小、估計愈精確。

這個訊息函數,與第八章的 Fisher 訊息是同一回事,它衡量「概似函數在 \theta 處彎得多陡」。它帶來兩個深遠的實務意涵。第一,測量精度是 \theta 的函數:同一份測驗,可能在中等能力處很準、在兩端很不準,這是單一個信度數字永遠說不出的細節;若要一個整體性的摘要,可計算「邊際信度」,即對能力分布積分後的平均精度,作為 CTT 信度在 IRT 中的對應。第二,也是最關鍵的:既然每道題的訊息在不同能力處不同,研究者便可以「因人選題」,對一個當前能力估計偏高的人,就挑在高能力處訊息最大的題目給他。這正是電腦化適性測驗(computerized adaptive testing, CAT)的理論基礎,依受試者當前的 \theta 估計,即時選出「此刻最能測他」的那一題。這條線,會在第二十四章完整展開。

以測驗訊息的角度看題目配置,會帶來直接的實務啟示。若要編一份「在所有能力水準都測得準」的測驗,就該讓題目難度沿能力量尺均勻散布,使測驗訊息函數盡量平坦而寬廣;若目的是「在某個切分點附近做通過與否的決定」,則應把題目難度集中在該切分點,使訊息在該處最大。這種「依測量目的來配置題目難度」的思路,正是題庫建置與 CAT 選題(第二十四章)的核心,也把抽象的訊息函數,變成了可操作的編題準則。

參數估計

IRT 要估兩種東西:題目的參數(a、b、c),以及每個人的能力 \theta。這比 CTT「算個總分」複雜得多,因為 \theta 是潛在的。估計的引擎,仍是第八、第十二章的最大概似,如下面的方塊所示。

推導方塊概似與兩種估計

假設「局部獨立」(第三章):在能力 \theta 給定下,各題的作答互相獨立。那麼某人一整組作答 (x_1, \dots, x_n)(x_i = 1 為答對、0 為答錯)的概似,為各題機率的連乘:

L(\theta) = \prod_{i} P_i(\theta)^{x_i}\,[1 - P_i(\theta)]^{1 - x_i}.

由此可延伸出兩種估計策略。聯合最大概似(joint ML, JML):同時估計所有人的 \theta 與所有題的參數。問題是,人數愈多、要估的 \theta 也愈多,這種「附帶參數」(incidental parameters)會使題目參數的估計不一致(即使樣本無限大,也不收斂到真值)。邊際最大概似(marginal ML, MML):先假設 \theta 在母體中服從某個分布(通常是標準常態),把 \theta「積分掉」,只估計題目參數;題目參數估好後,再回頭估每個人的 \theta。MML 避開了附帶參數問題,是當今 IRT 參數估計的主流。

MML 之所以在實務上可行,關鍵是 Bock & Aitkin (1981) 以 EM 演算法(第二十章)把那個對 \theta 的積分化為可計算的程序,這使含潛在能力的最大概似估計首度得以大規模實作,堪稱現代 IRT 軟體的引擎。至於個別能力的估計,題目參數定妥後,可用最大概似、期望後驗(EAP)、最大後驗(MAP)或加權概似(WLE)等方法,各自在偏誤與變異之間有不同的取捨,例如 EAP 較穩定卻對極端能力有向中收縮的傾向。此外,貝氏估計(以 MCMC 抽樣)近年日益普及,它能自然地把題目參數與能力的不確定性一併納入,並靈活處理複雜的設計;Bürkner (2021) 便示範了如何在通用的貝氏迴歸框架中,把各種 IRT 模型當作廣義線性混合模型來配適,大幅降低了實作門檻。這一取向的細節,是第三十三章的主題。

模型與資料適配

IRT 的漂亮性質,包括參數不變性與訊息函數,全都建立在「模型設定正確」之上,一旦模型與資料不合,這些性質便會失效。因此,檢驗模型與資料的適配(model-data fit),是負責任的 IRT 分析不可或缺的一步。

有幾個假設特別需要檢查。單維性(unidimensionality):多數基本 IRT 模型假設只有「一個」潛在特質在起作用;若題目其實測了好幾個維度,模型就被誤設,此時可先以因素分析或殘差的主成分分析評估維度性。局部獨立(local independence):控制 \theta 後各題應獨立;若某兩題因題幹相關、或共用材料而額外相關,就違反了這個假設,常以 Yen 的 Q_3 之類的殘差相關統計量偵測。反應函數的形式:真實的曲線,是不是真的長 logistic 那個樣子?這可用各種試題適配統計量,例如比較「觀察」與「模型預期」答對率的 S\text{-}X^2,以及殘差圖來檢查。忽略適配、硬套模型的後果是嚴重的:參數估計會偏誤,不變性也不再成立,那些「參數不受樣本影響」的美好承諾,只有在模型正確時才兌現。

適配的檢查還有兩個延伸值得一提。其一是差異試題功能(differential item functioning, DIF):同一道題,對能力相同、但屬於不同群體的人,若答對機率仍有系統差異,即代表該題在群體間並非「同一把尺」,這是第十九章的主題。其二是人員適配(person fit):不只題目可能不合模型,個別受試者的作答型態也可能異常,例如粗心、作弊或亂答,會產生與其能力估計不符的反應,人員適配統計量正是用以標記這類可疑個案。忽略維度性尤其危險,因為把多維資料硬套單維模型,會使能力估計混同了不同的特質,讓分數的意義變得含糊。

IRT 與 CFA 的深層統一

到這裡,可以揭示一個把整個第四部分縫合起來的深刻洞見:IRT 與因素分析,其實是同一件事的兩種說法。

具體地說,對二元或次序的題目,IRT 模型在數學上,等價於一個「帶類別指標的 CFA」,也就是第十五章那個以 WLSMV、以潛在連續變項與閾值處理次序資料的取徑。兩者的參數還能互相換算:IRT 的鑑別度 a,對應於 CFA 的因素負荷;IRT 的難度 b,對應於 CFA 的閾值。而這一對應在採用常態肩形模型時尤其乾淨,因為此時的 IRF 正是一個以常態閾值切分潛在連續反應的因素模型。兩個傳統的差別,更多在於估計的哲學:IRT 慣用「完全訊息」的邊際最大概似,直接對整組作答型態建模;類別 CFA 則常用「有限訊息」的 WLSMV,只利用一階與二階的邊際訊息。

這正好回到第三章 Bartholomew 的二維類型學:潛在變項連續、觀測變項類別的那一格,就是 IRT。於是,看似分屬「測驗理論」與「因素分析」兩大傳統的東西,一個由教育測驗長出、一個由智力研究長出,在數學上匯流成了一條河。理解這個統一,研究者便不會再把 CFA、IRT 當成要各自從頭學的兩套技術,而會看見它們共享的那副潛在變項骨架。

分析實務:模型選擇與樣本數

把前述原理落到實作,有幾個決策反覆出現。第一是模型選擇:資料是二元還是多級?該用 Rasch 家族(重測量性質、題目較少時較穩)還是 2PL/3PL(重適配、題目鑑別度差異大時較貼切)?這既是統計問題,也是測量立場的問題,宜以巢狀模型比較與資訊準則(第十二章)輔以理論判斷。第二是樣本數:IRT 遠比 CTT 吃資料,Rasch 模型或許數百人即可穩定估計,2PL 通常需要數百至上千,3PL 的猜測參數尤其難估,往往需要更大的樣本,並常以貝氏先驗加以穩定。第三是工具:R 的 mirt、TAM 與貝氏取向的 Stan/brms 都已成熟,但一如全書反覆強調,工具再強,也取代不了對模型假設與適配的實質判斷。

前沿與應用

IRT 是一個仍在蓬勃發展、應用極廣的領域,其當代擴展大致沿三條軸線推進,本章僅作預告,各留待專章展開。其一是向度的擴展,即多向度 IRT(multidimensional IRT),容許同時存在多個潛在特質,是 IRT 與因素分析在高維度上的匯合。其二是解釋的擴展,即解釋型 IRT(explanatory IRT;(De Boeck & Wilson, 2004)),把 IRT 放進廣義線性混合模型的框架,不只估「這題有多難」,還進一步以題目特徵去預測難度、以受試者特徵去預測能力,把測量與解釋結合起來。其三是資料的擴展,把作答時間乃至完整反應歷程納入模型。這三條軸線的完整發展,構成第十八章進階項目反應模型的主體。而與 IRT 血緣最近、卻以類別潛在變項取代連續能力的認知診斷模型,則自成一系,留待第二十一章展開。至於貝氏取向如何讓這些複雜的設計變得可行,前已述及通用的機率程式已使其實作大為簡便 (Bürkner, 2021),其細節屬第三十三章。

在應用面,IRT 更是現代測驗的引擎。大型入學與證照考試(如 GRE)、國際教育評比(如 PISA),其計分與等化的背後都是 IRT;而在健康與臨床領域,Reise & Waller (2009) 回顧了 IRT 如何用於量表連結、電腦化適性測驗與差異試題功能分析,像 PROMIS(病人自陳結果測量系統)這樣的大型計畫,也全靠 IRT 來建立可跨測驗比較的量尺、並支撐電腦化適性測驗。這些具體的應用,連同測驗編製與電腦化適性測驗的完整方法,將分別於第二十二章與第二十四章展開。

最後值得一提一個極新的方向。隨著大型語言模型的興起,自動試題生成與自動計分正被重新想像,研究者開始探索以模型大量產生題目、再以 IRT 校準其參數的可能;不過這類自動生成試題的效度與品管,屬於測驗編製方法學的範疇,其完整討論留待第二十二章。反過來,把 IRT 用於分析人工智慧模型本身的能力,也成為一個新興的「機器心理計量」課題。這些方向多屬推測性、仍待更嚴謹的效度檢驗,但它們預示了 IRT 作為一種通用測量語言,其適用範圍正持續擴張。

小結

項目反應理論,為「\theta 為某值的人,答對某題的機率」建立機率模型,把人與題放上同一把尺,由此換來 CTT 給不了的參數不變性,以及隨能力而變的測量精度(訊息函數)。本章的幾個核心連結值得記牢:2PL 就是潛在能力上的 logistic 迴歸(第十一章);訊息函數就是 Fisher 訊息(第八章),也是 CAT 的基礎(第二十四章);而對類別資料,IRT 與 CFA 根本是同一個模型的兩種面貌(第三、十五章)。至於 Rasch 與 2PL/3PL 之爭,則折射出第二章「什麼才算測量」那個古老問題的當代回聲。

理解了 IRT,便掌握了現代測量最強大的工具。而本章所建立的單向度計分模型,只是 IRT 家族的起點:第十八章的進階項目反應模型,將沿著向度、解釋與作答歷程三條軸線,把它擴展為當代測量研究的建模語言。至於另一個關鍵問題,當我們拿同一份量表,去比較不同群體(如不同性別、文化)、或同一群人的不同時點時,如何確定「這份量表在他們身上,測的是同一件事」,這個「跨群體、跨時間比較是否成立」的問題,則是第十九章的測量不變性與差異試題功能所要正面處理的。

參考文獻

Bock, R. D., & Aitkin, M. (1981). Marginal maximum likelihood estimation of item parameters: Application of an EM algorithm. Psychometrika, 46(4), 443–459. https://doi.org/10.1007/BF02293801
Bürkner, P.-C. (2021). Bayesian item response modeling in R with brms and Stan. Journal of Statistical Software, 100(5), 1–54. https://doi.org/10.18637/jss.v100.i05
De Boeck, P., & Wilson, M. (2004). Explanatory item response models: A generalized linear and nonlinear approach. Springer.
Embretson, S. E., & Reise, S. P. (2000). Item response theory for psychologists. Lawrence Erlbaum Associates.
Lord, F. M., & Novick, M. R. (1968). Statistical theories of mental test scores. Addison-Wesley.
Masters, G. N. (1982). A Rasch model for partial credit scoring. Psychometrika, 47(2), 149–174. https://doi.org/10.1007/BF02296272
Muraki, E. (1992). A generalized partial credit model: Application of an EM algorithm. Applied Psychological Measurement, 16(2), 159–176. https://doi.org/10.1177/014662169201600206
Reise, S. P., & Waller, N. G. (2009). Item response theory and clinical measurement. Annual Review of Clinical Psychology, 5, 27–48. https://doi.org/10.1146/annurev.clinpsy.032408.153553
Samejima, F. (1969). Estimation of latent ability using a response pattern of graded scores. Psychometrika Monograph Supplement, 34(4), 1–97. https://doi.org/10.1007/bf03372160
本章引用格式游琇婷(2026)。項目反應理論。《計量心理學:測量、模型與推論》(第 17 章)。