第 18 章 進階項目反應模型:多向度、解釋型與作答歷程
第四部 潛在變項測量模型
18Chapter

進階項目反應模型:多向度、解釋型與作答歷程

第十七章把項目反應理論建立為一套單向度的計分工具:一個潛在能力 \theta、一組題目參數,共同決定答對的機率。這個架構優雅而強大,卻也對真實的測驗做了三重簡化,即假設只有一個潛在維度、假設每道題彼此獨立、且假設題目參數是無從解釋的黑箱。本章要沿著三條軸線鬆開這些簡化,把 IRT 由計分工具擴展為當代測量研究的一種建模語言:向度的軸線,容許多個潛在特質與題組結構;解釋的軸線,把題目參數本身變成可預測的迴歸結果;資料的軸線,把作答時間乃至完整的反應歷程納入模型。

為使這些抽象的擴展有所依附,全章以一個貫穿的實例來推進:設想一份數學素養測驗中,以「一張水費帳單」為共同情境的題組,底下有四道小題,分別要求讀出用量、計算費率、比較兩個月的差異、並判斷一項收費是否合理。這個題組將依次展示:四道小題為何彼此局部依賴、題組效應該如何建模、如何以「步驟數」與「文字量」這類試題特徵去解釋各題的難度,以及作答時間能為診斷帶來什麼。本章的兩條暗線是:其一,第十七章末所揭示的 IRT 與因素分析的等價,在多向度下依然成立,兩者只是同一件事的兩種方言;其二,這些看似各異的進階模型,多數都可統一在廣義線性混合模型的框架之下,而那正是通往第二十八章多層次架構的橋樑。本章也是第二十一章診斷模型、第二十四章適性測驗前沿與第二十五章作答行為模型的方法基座。

一個維度為何不夠

單向度假設要求:一份測驗背後只有一個潛在特質在驅動所有的作答。這個假設在許多情境下站不住腳。一道數學文字題,同時考驗數學能力與閱讀理解;一份憂鬱量表,可能混入了與焦慮共享的成分;本章的水費帳單題組,答對與否既取決於數感,也取決於讀懂帳單這種真實情境的素養。當一份測驗實際上由多個特質共同決定,卻硬套單向度模型時,後果是具體而嚴重的:估出的單一 \theta 成了幾個特質的混合物,其意義變得含糊;題目參數會有偏誤;而第十七章所珍視的參數不變性,也不再成立。

多向度項目反應理論(multidimensional item response theory, MIRT)正是為此而生 (Reckase, 2009)。它容許同時存在多個潛在特質,並區分兩種不同的多向度結構。題間多向度(between-item multidimensionality)指每道題仍只負荷於單一個特質,只是不同題目分屬不同特質,這其實就是一個簡單結構的驗證性測量模型。題內多向度(within-item multidimensionality)則指同一道題同時負荷於多個特質,例如水費帳單題組中的每一小題,都同時仰賴數感與閱讀。兩者的區辨並非咬文嚼字,而直接牽動分數該如何報告:題間多向度可以乾淨地為每個特質給一個分數,題內多向度則使各分數彼此糾纏,詮釋須格外小心。

補償式與部分補償式 MIRT

上一節確立了測驗背後可能不只一個維度,卻還留下一個更關鍵的問題沒有回答:當一道題同時仰賴兩種以上的能力時,這幾種能力究竟以什麼方式合成一個答對機率。這不是技術細節,而是對認知歷程的實質主張。若把各項能力先加權相加、再轉成機率,等於主張能力之間可以互相替代,此強彼弱無妨;若把各分項各自的成功機率相乘,則等於主張它們缺一不可,任何一環斷掉就整題失守。本節先給出前一種、也是最常用的推廣,即把 2PL 裡的能力與鑑別度都換成向量,得到多向度二參數模型(M2PL),如下面的方塊所示;再回頭說明另一種合成方式,以及兩者在實務上該如何區辨。

推導方塊多向度 2PL 與補償式結構

設某人在 m 個潛在特質上的能力為向量 \boldsymbol{\theta}=(\theta_1,\dots,\theta_m)',第 i 題在各特質上的鑑別度為 \mathbf{a}_i=(a_{i1},\dots,a_{im})',並設一個純量截距 d_i。補償式的多向度 2PL 反應函數為

P_i(\boldsymbol{\theta}) = \frac{1}{1 + \exp[-(\mathbf{a}_i'\boldsymbol{\theta} + d_i)]} = \mathrm{logistic}(a_{i1}\theta_1 + \cdots + a_{im}\theta_m + d_i).

關鍵在於線性預測式 \mathbf{a}_i'\boldsymbol{\theta} 是各特質的加權和:某一個特質偏低,可以被另一個特質偏高「補」回來,只要加權和夠大,答對機率就高。這正是「補償式」(compensatory)一詞的由來。此模型與第十七章單向度 2PL 的差別,僅在於把純量的 a(\theta-b) 換成了向量的內積 \mathbf{a}_i'\boldsymbol{\theta}+d_i,其餘邏輯完全相同。

補償式並非唯一的選擇。在某些認知歷程中,各項能力其實是「缺一不可」的:一道題若既需要正確列式、又需要正確計算,那麼列式能力再高,也補不了計算能力的不足。部分補償式模型(partial compensatory model)為此把各分項的成功機率相乘,使任何一個分項的低落都會把整體答對機率往下拖,難以被其他分項挽救。兩者的差別,在等機率曲線上看得最清楚:把「答對機率相同的能力組合」連成線,補償式模型的等機率線是一條斜直線,斜率反映各特質的相對權重,缺此補彼;部分補償式模型的等機率線則向座標軸彎曲成 L 形,逼近軸線時陡然上揚,顯示任一特質趨近下限便無從補救。選擇哪一種,不該由適配優劣單方面裁決,而應回到「這道題所要求的認知歷程,究竟是可替代還是缺一不可」這個實質問題。

一個帶數字的對照,能讓這個差別立刻具體起來。設想水費帳單題組中的一道小題,在數感上的鑑別度為 a_{i1}=1.2、在閱讀上的鑑別度為 a_{i2}=0.8,截距 d_i=0。一位兩項都在平均水準的考生(\theta_1=\theta_2=0),線性預測式為 0,答對機率恰為 0.50。另一位考生閱讀低了一個標準差(\theta_2=-1),數感則高出三分之二個標準差(\theta_1=0.67),其線性預測式為 1.2\times 0.67 + 0.8\times(-1)\approx 0,答對機率仍是 0.50。也就是說,閱讀上少掉的那一截,被數感原封不動地補了回來,兩人在補償式模型眼中毫無差別。若改以部分補償式模型看同一位考生,答對機率會明顯掉到 0.50 之下,因為閱讀那一項偏低的成功機率會把乘積整個拖住,數感再高也拉不回來。這道題該歸哪一類,最終取決於「讀不懂帳單的人,能不能靠計算能力硬解出答案」這個可以驗證的實證問題。

因素分析語言與 IRT 語言的字典

多向度模型帶來一個現實的困擾:同一批資料,常被兩群人用兩套詞彙分析。測驗學界說鑑別度與難度,結構方程學界說負荷與閾值,兩篇論文擺在一起,彷彿是兩種互相競爭的方法,讀者也就不知道該信誰。事實並非如此。第十七章末已點出,對類別指標而言,IRT 與因素分析根本是同一個模型的兩種說法。到了多向度,這個等價非但沒有消失,反而更清楚地顯現為一部可以逐項對譯的字典,其整理者正是把兩傳統統一起來的 McDonald (1999)。讀完這一節,應能把一份 MIRT 報表翻譯成因素分析的說法、也能反向翻譯回來,並且明白兩者真正的分歧落在估計方法,而不在模型本身。

概念方塊IRT 與因素分析的對譯字典

對二元或次序指標,多向度 IRT 與類別驗證性因素分析在數學上等價,其參數一一對應:

IRT 的鑑別度向量 \mathbf{a}_i,對應因素分析的因素負荷向量;某題在某特質上鑑別度為零,即該題在該因素上負荷為零。

IRT 的截距 d_i(或難度),對應因素分析的閾值(threshold)。

IRT 的「題間多向度」,對應因素分析的「簡單結構」;「題內多向度」則對應「交叉負荷」。

兩者的差別更多在估計哲學:IRT 慣用完全訊息的邊際最大概似,直接對整組作答型態建模;類別因素分析則常用有限訊息的 WLSMV(第十五章),只利用一階與二階的邊際訊息。

這部字典的實用價值,在於它讓研究者不必把 MIRT 與驗證性因素分析當成兩套要各自從頭學的技術。一個習慣以因素負荷思考的人,可以把 MIRT 的鑑別度讀成「類別指標上的負荷」;一個習慣以 IRT 訊息量思考的人,也可以把因素模型的閾值讀成「難度」。而且這種對譯不止於概念上的比附,還可以換算成具體的數字:在常態肩形(normal ogive)的參數化下,某題的標準化因素負荷 \lambda 與鑑別度 a^{*} 的關係為 a^{*}=\lambda/\sqrt{1-\lambda^{2}}。設想一道大學課程評量的題目,其標準化負荷為 \lambda=0.80,代入可得 a^{*}=0.80/0.60\approx 1.33,再乘上把常態肩形尺度換成 logistic 尺度的常數 1.7,便得到 a\approx 2.27,在 IRT 的慣例裡屬於鑑別度相當高的題目。反過來,一道 logistic 鑑別度為 1.0 的中等題目,換算回去的負荷約為 0.51,在因素分析的慣例裡恰好落在勉強可用的邊緣。同一道題的好壞,兩套語言給的是同一個判斷,只是刻度不同。這一互通,是理解本章其後各種進階模型的共同底盤,因為它們幾乎都可以在任一種語言中被等價地表述。

題組效應:局部依賴的正面處理

回到水費帳單題組。它底下的四道小題,違反了第十七章的一個核心假設,即局部獨立:在控制了能力之後,各題的作答仍彼此相關,因為它們共享同一張帳單、同一段情境文字,一個讀錯帳單的人,很可能連著幾題都錯。這種因共享材料而生的局部依賴,稱為題組效應(testlet effect)。若視而不見、硬套獨立性假設,後果是系統性的:測驗訊息被高估,因為相依的題目其實提供的獨立資訊比表面上少,於是標準誤被低估、信度被灌水,能力估計也可能偏誤。

處理之道,不是把相依當成瑕疵去消除,而是把它當成結構正面地建模。題組反應模型(testlet response model)為每一個題組引入一個額外的隨機效果,如下面的方塊所示 (Wainer et al., 2007)。

推導方塊題組模型作為隨機效應

在標準的單向度模型上,為屬於題組 d(i) 的第 i 題,於線性預測式中加入一個受試者專屬、題組專屬的隨機效果 \gamma_{p\,d(i)}:

\mathrm{logit}\,P_{pi} = a_i\big(\theta_p - b_i\big) + \gamma_{p\,d(i)}, \qquad \gamma_{p\,d(i)} \sim N(0,\ \sigma^2_{d(i)}).

其中 \gamma_{p\,d(i)} 捕捉了「此人在此題組上、超出其一般能力之外的特有傾向」,其變異數 \sigma^2_{d(i)} 度量題組效應的強度:\sigma^2=0 時退回局部獨立的標準模型,\sigma^2 愈大,題組內的相依愈強。這個隨機效果,在數學上正是一個受限的雙因子結構,即一個貫穿全測驗的一般因素,加上一個只涵蓋該題組題目的群組因素。

把題組效應寫成隨機效果,帶來兩個好處。其一,它誠實地扣除了相依所虛增的訊息,還原了正確的標準誤與信度。其二,它把題組模型接上了本章稍後的兩條線:既然題組隨機效果就是一個受限的雙因子結構,它便與下一節的雙因子 IRT 相通;而既然它是一個作用於受試者的隨機效果,它也預示了把 IRT 視為混合模型的統一視角。在適性測驗中,題組更是常見的施測單位,如何在保有題組完整性的前提下選題,是第二十四章的議題。

雙因子 IRT 與分數報告

上一節的題組結構,是雙因子模型(bifactor model)的一個特例。雙因子 IRT 讓每一道題同時負荷於一個貫穿全測驗的一般因素,與一個只涵蓋部分題目的群組因素,且一般因素與各群組因素彼此正交。它回答的核心問題與第十五章一致:一份測驗的總分,究竟主要反映單一個一般構念,還是好幾個成分的混合?差別在於,第十五章以類別因素分析的語言與 ECV、階層 omega 等指標處理這個問題,本章則從 IRT 的計分意涵切入。

雙因子結構對分數報告的意涵,相當實際。若一般因素解釋了絕大部分的共同變異,那麼即使測驗在形式上是多向度的,報告一個總分仍屬正當,因為那個總分主要承載的是一般因素;反之,若各群組因素也解釋了可觀的變異,則單一總分會抹去有意義的側面資訊,此時應改採側寫分數(profile scores),為各群組因素分別報告。就水費帳單這類情境化題組而言,雙因子模型能把「一般數學素養」與「這一情境所特有的作答傾向」分離開來,前者是可跨情境比較的能力,後者則往往是我們不希望混入分數的情境雜訊。雙因子 IRT 因此不只是一個統計模型,更是一套決定「該報告幾個分數、報告什麼分數」的框架,其群組因素的辨識與 ECV、omega 等指標的細節,可與第十五章相互參看。

解釋型 IRT:把難度變成迴歸

到此為止,本章鬆開的都是向度與獨立性的假設,題目參數本身卻始終是一個個被「估出來」的數字:估完之後只知道哪一題難、哪一題易,卻不知道它為什麼難。這個侷限有實際代價。每換一批新題,就得重新施測、重新估計;命題者拿到一張難度表,也得不到任何可操作的指引;更麻煩的是,難度若無法解釋,就無從在題目編出來之前預測它會有多難。解釋型 IRT(explanatory item response models)補上了這一塊,它把原本無從解釋的題目參數,本身變成一個迴歸的結果 (De Boeck & Wilson, 2004)。這一思路的源頭,是 Fischer (1973) 的線性 logistic 檢定模型(linear logistic test model, LLTM),如下面的方塊所示。

推導方塊LLTM:以試題特徵分解難度

LLTM 把 Rasch 模型中每一道題的難度 b_i,進一步分解為若干「認知操作」或「試題特徵」的加權和:

b_i = \sum_{k=1}^{K} q_{ik}\,\eta_k,

其中 q_{ik} 是預先編碼的設計矩陣元素,記錄第 i 題「用到第 k 個特徵幾次」(例如需要幾個運算步驟、含多少字),\eta_k 則是該特徵對難度的貢獻,是真正要估計的參數。就水費帳單題組而言,可令 q 記錄各小題的「運算步驟數」與「情境文字量」,於是 \eta 便回答了「每多一個步驟、每多一段文字,題目難多少」。LLTM 的深刻之處在於它可被否證:它以遠少於題數的 K 個特徵去重建全部的難度,若重建得好,代表這些特徵確實解釋了難度;若重建得差,代表還有未被捕捉的難度來源。

這個分解一旦估出來,讀法非常直接。假定把水費帳單這一類情境題共二十四題,依「運算步驟數」與「情境文字量(每五十字算一單位)」編碼後配適 LLTM,估得 \eta_1=0.45、\eta_2=0.20。這表示題目每多要求一個運算步驟,難度就上升 0.45 個 logit;情境文字每多五十字,難度上升 0.20 個 logit。於是一道三步驟、一百五十字的題目,重建難度為 3\times 0.45+3\times 0.20=1.95 logit,比一道一步驟、五十字的題目(0.65 logit)高出 1.3 個 logit;對一位能力恰好等於 1.95 的考生而言,前一題的答對機率是 0.50,後一題則約為 0.79。若這二十四題的重建難度與自由估計的難度相關達 0.85,即代表兩個特徵已經抓住難度變異的七成左右,命題者於是能在題目出好之前,先估出它大概會落在什麼難度。

LLTM 只是解釋的一端,即以題目特徵解釋難度。同樣的邏輯可以施加於受試者一端,即以受試者的共變項(如年齡、教學方式)去預測其能力 \theta,這就是人側的解釋型模型。更進一步,還可以納入「人與題的交互作用」,也就是某個題目特徵的難度貢獻,是否隨受試者的群體而異。這個交互作用有一個熟悉的名字:差異試題功能(DIF)。從解釋型 IRT 的視角看,DIF 不過是「試題特徵 \times 受試者群體」的交互作用項,一道題若對某群體特別難,即代表它的難度與群體有交互。本章只給出這個「DIF 即人題交互」的建模視角,其正式的偵測程序與錨定策略,則是第十九章的主題。

IRT 即廣義線性混合模型

讀到這裡,本章已經介紹了好幾個看似各自為政的模型:多向度 IRT、題組模型、LLTM、人側的解釋型模型。若把它們當成好幾套彼此無關的技術逐一背誦,不但負擔沉重,還會錯過它們之間真正的關係。事實上,前幾節的模型共享同一副骨架,把它們縫合起來的關鍵洞見是:IRT 本質上是一個廣義線性混合模型(generalized linear mixed model, GLMM)。De Boeck & Wilson (2004) 的整合工程正在於此。掌握了這個視角,往後遇到新的模型便不必從頭學起,只需要問兩個問題:它在線性預測式裡多放了什麼效果,以及那個效果是固定的還是隨機的。

這個統一的邏輯是這樣的。IRT 的反應是二元或類別的,故取 logit 或其他連結函數,這是「廣義」;線性預測式裡,能力 \theta 是隨受試者變動的隨機效果,題目難度則可視為固定效果,這是「混合」;而把題目特徵放進去解釋難度、把受試者共變項放進去解釋能力,不過是在這個混合模型裡多加幾個固定效果的預測項。於是,Rasch 模型是「以受試者為隨機效果、題目為固定效果的 logistic 混合模型」;LLTM 是「把題目固定效果再以特徵分解」;題組模型是「多加一個題組層的隨機效果」;多向度 IRT 是「隨機效果變成多維」。一旦看清這一點,IRT 便不再是一組要逐一背誦的模型,而是同一個混合模型架構在不同設定下的面貌,研究者甚至能以通用的混合模型或貝氏迴歸軟體來配適它們。

這個視角最實用的一個推論,是它讓「再多加一個面向」變成理所當然的事。設想一份大學寫作課的評分作業,每份作品由兩位評閱者各自評等第:此時線性預測式裡除了作者的寫作能力與題目難度,還應再放進一個評閱者的寬嚴參數,這便是多面向 Rasch 模型(many-facet Rasch model)。假定甲評閱者的嚴格度估為 0.6 logit、乙評閱者為 -0.4 logit,兩人相差 1.0 個 logit,意思是同一份作品交到甲手上,被評為通過的對數勝算會比交到乙手上低 1.0。若這份作品在乙那裡有 0.73 的機率被評為通過,在甲那裡就只剩 0.50,錄取與否可能就此翻盤。把這 1.0 個 logit 明白地估出來,模型便能在計分時將它扣除,讓分數反映作品本身,而不是碰上哪一位評閱者的運氣。這正是評分者的寬嚴應該被建模,而不是被平均掉的理由。

這個「IRT 即 GLMM」的視角,也正式把測量模型接上了第二十八章的多層次架構:受試者巢套於群體、題目巢套於題組,本質上都是同一種相依結構的建模。

非參數取向:Mokken 與核平滑

前述所有模型,無論多向度、題組還是解釋型,都建立在同一個未經檢驗的前提上:項目反應函數長成某個特定的參數形式,通常是 logistic。這個前提平時不引人注意,卻承擔著不小的分量,因為形式一旦誤設,估出的能力與難度都會跟著偏斜,而模型適配指標未必抓得出來。非參數項目反應理論(nonparametric IRT)因此後退一步,不預設曲線的代數形式,只要求它滿足若干更弱、更基本的次序性質 (Sijtsma & Molenaar, 2002)。讀完這一節,應能回答一個很實際的問題:在不敢假設 logistic 的情況下,一份量表至少要滿足什麼條件,用總分為受試者排序才算有意義。其中最具代表性的取向,是 Mokken (1971) 的量尺分析。

Mokken 量尺分析的核心,是兩個由弱到強的假設。單調同質性(monotone homogeneity)只要求:所有題目的反應函數都隨能力單調遞增,且共享單一個潛在維度;滿足它,便足以保證以總分為受試者排序是有意義的。雙重單調性(double monotonicity)更進一步要求各題的反應函數彼此不交叉,也就是題目的難度次序在所有能力水準上都一致;滿足它,題目的難度排序才在全體受試者間穩定。檢驗這些性質的實用工具,是 Loevinger 的同質性係數 H,如下面的方塊所示。

推導方塊Mokken 的 H 係數與 Guttman 量尺

對一組題目,可定義 Guttman 誤差(Guttman error):若某人答對了難題卻答錯了更容易的題,便是一個違反完美量尺型態的誤差。H 係數的構想,是把「觀察到的 Guttman 誤差」與「在題目彼此獨立時所期望的 Guttman 誤差」相比:

H = 1 - \frac{\text{觀察到的 Guttman 誤差}}{\text{獨立假設下期望的 Guttman 誤差}}.

H=1 代表沒有任何 Guttman 誤差,即完美的 Guttman 量尺(第四章),題目與受試者可嚴格排成一列;H 愈接近 0,量尺性愈弱。實務上常以 H\ge 0.3 為一個弱量尺、H\ge 0.5 為強量尺的參考。H 因此把第四章那個確定性、易被單一例外推翻的 Guttman 量尺,鬆綁為一個機率性、可容許誤差的量尺概念。

除了 Mokken 這種基於次序公理的取向,另一支非參數方法是核平滑(kernel smoothing):不假設任何代數形式,直接以局部加權平均,從資料把每道題的反應函數「畫」出來,用以目視檢查曲線是否真的長 logistic 那個樣子,或有無違反單調的異狀。非參數取向的價值,不在於取代參數模型,而在於提供一個假設更少的對照:當非參數與參數模型給出的結論一致時,研究者對參數模型的信心便增強;當兩者分歧時,往往正是參數形式被誤設的警訊。

理想點模型的 IRT 化

至此的所有模型,都內建一個「愈多愈好」的單調假設:能力愈高、態度愈強,答對或同意的機率就愈高。這對能力測驗大致成立,對態度測量卻未必。第四章談展開模型時已指出,一個溫和派受試者,對「態度太激進」與「態度太保守」的兩種題目都會不同意,他同意的只是「與自己立場相近」的題目。這種「近則同意、遠則不同意」的單峰反應,單調的 IRT 模型根本無法刻畫。

理想點 IRT 為此把單調的反應函數換成單峰的。其代表是 Roberts et al. (2000) 的廣義分級展開模型(generalized graded unfolding model, GGUM):它假設受試者與題目都落在同一條潛在連續體上,而某人同意某題的機率,取決於兩者在該連續體上的「距離」,距離愈近、同意機率愈高,於是反應函數呈現一個以題目位置為中心的單峰曲線。GGUM 因此把第四章 Thurstone 與 Coombs 的展開、理想點傳統,正式接進了 IRT 的機率框架,成為連加式主導的 IRT 家族中,罕見地承接了展開傳統的一支。近年在人格與態度測量中,有證據顯示對某些構念,理想點模型比傳統的單調模型更貼合實際的作答,這使 GGUM 這類模型出現了一波復興。這也提醒一個常被忽略的前提:把單調 IRT 套到本質上是理想點的資料上,會系統性地低估中間立場者的特質,是一個值得警惕的模型誤設。

作答時間:速度與正確性的聯合建模

前面各節無論怎麼擴展,用到的資料始終只有一種:答對與否。這是紙筆測驗時代留下的限制,每位受試者在每道題上只留下一個 0 或 1,能承載的訊息本來就有限。但電腦化施測會順帶記錄一件過去拿不到的東西:每道題花了多少時間。同樣是答對,花八秒與花八十秒背後的歷程顯然不同;同樣是答錯,草草跳過與苦思良久也不該一概而論。作答時間因此不是雜訊,而是關於作答歷程的第二條資訊管道,值得與正確性一起正式建模,而不是事後才拿來充當旁證。

Linden (2007) 的階層速度-正確性框架,是把兩者聯合起來的經典架構,如下面的方塊所示。

推導方塊階層作答時間模型的兩層結構

這個模型分兩層。在題內的測量層,作答正確性由標準的 IRT 模型刻畫,作答時間 T_{pi} 則另以一個對數常態模型刻畫,其位置取決於「此人的速度 \tau_p」與「此題的時間強度 \beta_i」:

\ln T_{pi} \sim N\big(\beta_i - \tau_p,\ \sigma_i^2\big).

速度 \tau_p 愈大,作答時間愈短。在受試者的結構層,把每個人的「能力 \theta_p」與「速度 \tau_p」視為一組相關的潛在變項,聯合服從一個二維常態分布,其相關刻畫了「快與準之間」的個體差異。

這個兩層架構的精妙,在於它把「能力」與「速度」明確地分開,卻又容許兩者相關,從而讓「速度與正確性的權衡」成為一個可估計的量,而非只能臆測。它帶來的實務價值是多重的:作答時間可用以偵測異常的作答歷程,例如某人在難題上只花了兩秒便作答,很可能是放棄或亂猜;可用以改善能力估計,把「答得又快又對」與「慢慢磨才對」區分開;也可用於適性測驗中兼顧時間的選題。就水費帳單題組而言,若某位受試者在需要多步計算的小題上作答時間異常地短卻仍答對,這個「快而準」的組合本身就值得追究,或許反映了捷徑策略,或許是題目洩漏了線索。

這類判斷可以做得比印象更精確。設想那道多步計算的小題,其時間強度估為 \beta_i=4.0、殘差標準差 \sigma_i=0.4。對一位速度參數為 0 的平均受試者而言,預期的對數作答時間就是 4.0,換算回來約 e^{4.0}\approx 55 秒;速度較快的人(\tau_p=0.5)預期約 33 秒,速度較慢的人(\tau_p=-0.5)則約 90 秒。現在若某位考生在這一題只花了 6 秒,其對數時間為 \ln 6\approx 1.8,比模型的預期低了五個殘差標準差以上。這已經不是「手腳俐落」所能解釋,而幾乎可以斷定是放棄作答或隨機猜測。同樣一筆 0 或 1 的作答紀錄,唯有加進時間,才分得出「會做」與「碰運氣」。

作答時間因此把測量由「量結果」推進到「窺歷程」的門口。

前沿:歷程資料與深度模型

作答時間只是「歷程資料」的冰山一角。在數位化施測中,系統還能記錄更細緻的行為軌跡,即歷程資料(process data)或日誌資料:受試者點擊了什麼、修改過幾次答案、在頁面間如何移動、於何處停頓。這些資料承載了關於解題策略的豐富訊息,卻也對測量提出了新的挑戰,因為它們高維、非結構化,且其與目標構念的關係往往並不清楚,如何從中萃取出具有效度的測量,是一個仍在開放的問題,其分析多借重第三十四章的機器學習方法。

與此並行的一條前沿,是把 IRT 與機器學習相混種,例如以神經網路取代 logistic 的反應函數,或以深度模型直接由原始歷程預測能力。這類「深度 IRT」在預測上可能表現亮眼,卻帶來一個尖銳的張力,即詮釋風險:IRT 之所以是測量模型而非單純的預測機器,正在於它的參數有明確的心理計量意義,一旦以難以解讀的神經網路取而代之,所得到的究竟還是不是「測量」,便成了疑問。這些方向多屬推測性、仍待更嚴謹的效度檢驗。至於高向度 MIRT 本身的估計難題,即當維度一多,那個對潛在向量的積分便難以計算,近年也有適應性求積、Metropolis-Hastings Robbins-Monro 演算法與變分近似等進展,使高維測量模型的實作逐步成為可能。這些發展的共同方向,是讓 IRT 這套測量語言,能承載愈來愈豐富、也愈來愈複雜的作答資料。

小結

本章沿三條軸線,把單向度的 IRT 擴展為當代測量研究的建模語言。向度的軸線,帶來多向度 IRT 與其補償式、部分補償式之別、題組模型對局部依賴的正面處理,以及雙因子結構對分數報告的指引;解釋的軸線,帶來 LLTM 以試題特徵分解難度、以受試者共變項預測能力、並把 DIF 重新理解為人題交互;資料的軸線,帶來作答時間的聯合建模與歷程資料的前沿。貫穿這一切的,是兩個統一的觀點:其一,IRT 與因素分析在多向度下依然是同一件事的兩種方言;其二,這些進階模型多可收攏於廣義線性混合模型的框架,而那正通往第二十八章的多層次架構。

理解了這些擴展,IRT 便不再只是一種替測驗計分的技術,而成為一種能把測量、認知歷程與作答行為一併納入的建模語言。本章所鋪設的方法基座,將在其後數章各自開花:以類別潛在變項取代連續能力的認知診斷模型(第二十一章),把這些進階模型用於適性測驗的前沿(第二十四章),以及以 IRTree 等模型正面處理反應風格的作答行為研究(第二十五章)。而在此之前,還有一個更基礎的問題必須先行釐清,即當我們拿同一份量表去比較不同群體時,如何確定它測的是同一件事,這正是下一章測量不變性與差異試題功能的主題。

參考文獻

De Boeck, P., & Wilson, M. (2004). Explanatory item response models: A generalized linear and nonlinear approach. Springer.
Fischer, G. H. (1973). The linear logistic test model as an instrument in educational research. Acta Psychologica, 37(6), 359–374. https://doi.org/10.1016/0001-6918(73)90003-6
Linden, W. J. van der. (2007). A hierarchical framework for modeling speed and accuracy on test items. Psychometrika, 72(3), 287–308. https://doi.org/10.1007/s11336-006-1478-z
McDonald, R. P. (1999). Test theory: A unified treatment. Lawrence Erlbaum Associates.
Mokken, R. J. (1971). A theory and procedure of scale analysis: With applications in political research. Mouton.
Reckase, M. D. (2009). Multidimensional item response theory. Springer.
Roberts, J. S., Donoghue, J. R., & Laughlin, J. E. (2000). A general item response theory model for unfolding unidimensional polytomous responses. Applied Psychological Measurement, 24(1), 3–32. https://doi.org/10.1177/01466216000241001
Sijtsma, K., & Molenaar, I. W. (2002). Introduction to nonparametric item response theory. Sage.
Wainer, H., Bradlow, E. T., & Wang, X. (2007). Testlet response theory and its applications. Cambridge University Press.
本章引用格式游琇婷(2026)。進階項目反應模型:多向度、解釋型與作答歷程。《計量心理學:測量、模型與推論》(第 18 章)。