第 21 章 認知診斷與診斷分類模型
第四部 潛在變項測量模型
21Chapter

認知診斷與診斷分類模型

前面數章的測量模型,無論是連續潛在能力的項目反應理論,或離散潛在類別的混合模型,回答的都是「這個人在某條潛在向度上位於何處」這類程度問題。然而在教學現場,教師真正想知道的往往不是「這名學生數學多強」,而是「他究竟會了哪些、還不會哪些」。一個總分七十分的學生,可能是「四項技能各掌握一半」,也可能是「三項全會、一項全不會」,這兩種人需要的補救截然不同,而一個連續的能力分數卻把他們混為一談。診斷分類模型(diagnostic classification models, DCM),又稱認知診斷模型,正是為回答這類「會不會」的問題而生:它不問「這個人有多強」,而問「這個人掌握了哪幾項細部技能」。

本章要建立 DCM 作為一個「多向度、類別、驗證性」的測量模型家族。多向度,因為它同時判定多項技能;類別,因為每項技能的掌握與否是離散的;驗證性,因為技能與試題的對應關係由研究者事先以理論界定。DCM 有著雙重血緣:從第二十章看,它是加了理論約束的受限潛在類別分析;從第十七、十八章看,它是把連續的潛在能力,換成了一組離散的潛在屬性剖面。為使討論具體,全章以認知診斷研究的一份經典資料為貫穿實例,即分數減法測驗:它要診斷四項技能,即借位、通分、化簡與整數處理,而每一道分數減法題各自需要其中的某些技能組合。本章將以這個例子,一路走過模型設定、估計、分類報告與教學回饋。

換一個測量問題:從「多強」到「會不會」

認知診斷的思想根源,可追溯至 Tatsuoka (1983) 的規則空間(rule space)取向。她的洞見來自對學生錯誤的細膩觀察:學生在分數減法上的錯誤並非隨機,而往往源於系統性地誤用或缺漏某一條運算規則,例如「該借位時未借位」。若能由作答型態反推學生「缺了哪條規則」,測量便由「排出高低」轉為「診斷病灶」。這一取向把測量的目的,從常模參照的排序,移向標準參照的、可指引補救的細部回饋。

這個轉向也重新定義了測量的目標對象。傳統 IRT 的目標是估計一個連續的潛在能力 \theta;DCM 的目標則是判定一個離散的屬性剖面(attribute profile),即一組「會或不會」的二元判斷。就分數減法而言,模型要輸出的不是一個分數,而是一份形如「借位:會;通分:不會;化簡:會;整數處理:會」的診斷報告。這種以離散技能剖面為目標的測量,天生就與形成性評量、學習診斷的需求相契合,也是 DCM 近年在教育測量中復興的動力。

屬性、剖面與 Q 矩陣

上一節說明了測量問題的轉向,但光是想問「會不會」還不夠。要把這個問題交給統計模型回答,必須先把三件事講明白:打算診斷的技能有哪些、一個人的掌握狀態要用什麼形式記錄下來、以及每一道題究竟調動了哪些技能。少了其中任何一件,模型都無從下手:不界定技能,診斷就沒有對象;不規定記錄形式,結果就無法比較;不說明題目與技能的對應,作答資料也就無法反推出技能狀態。這三件事分別對應本節要建立的三個基本構件。讀完本節應能回答:屬性剖面為何恰好有 2^K 種、一張 Q 矩陣長什麼樣子、以及為什麼說它是整個診斷模型成敗的關鍵。

DCM 的三個基本構件是屬性、屬性剖面與 Q 矩陣。屬性(attribute)指所欲診斷的細部技能或知識成分,通常設為二元的潛在變項,即掌握(記為 1)或未掌握(記為 0)。屬性剖面(attribute profile)\boldsymbol{\alpha} = (\alpha_1, \dots, \alpha_K) 是某位受測者在全部 K 個屬性上的掌握型態;K 個二元屬性共可組成 2^K 種剖面,就分數減法的四個屬性而言,即 2^4 = 16 種可能的技能組合。

2^K 這個數字增長得很快,值得先把它的意涵讀出來。四個屬性是 16 種剖面,八個屬性是 256 種,十二個屬性則超過四千種。這件事有兩面。就回饋而言,屬性愈多,診斷報告愈細緻,教師拿到的資訊也愈具體。就估計而言,剖面愈多,平均分到每一種剖面上的受測者就愈少,模型要穩定地估出各剖面所佔的比例也就愈吃力,而每個屬性又都需要足夠的題目來支撐。實務上診斷測驗的屬性數多半訂在三到八個之間,正是在細緻度與可估計性之間所取的平衡。

連結「屬性」與「試題」的橋樑,是 Q 矩陣(Q-matrix)。它是一個「試題 \times 屬性」的矩陣,其元素 q_{ik}=1 表示答對第 i 題需要掌握第 k 個屬性,q_{ik}=0 表示不需要。Q 矩陣把研究者對「每道題考什麼技能」的認知理論,寫成一張可供模型使用的設定表,如表 21.1 的分數減法例示。

表 21.1 分數減法測驗的 Q 矩陣(節錄)
試題 借位 通分 化簡 整數處理
\frac{3}{4}-\frac{1}{4} 0 0 1 0
\frac{2}{3}-\frac{1}{6} 0 1 1 0
3\frac{1}{4}-1\frac{3}{4} 1 0 1 1
4\frac{1}{3}-1\frac{5}{6} 1 1 1 1

註. q_{ik}=1 表示答對該題需要該屬性。Q 矩陣把「每道題需要哪些技能」的認知理論明文化,是 DCM 模型設定的核心,其正確與否直接左右診斷結果。

表 21.1 的四列可以逐列讀出來。第一題 \frac{3}{4}-\frac{1}{4} 同分母、不必借位,只需在最後把 \frac{2}{4} 化為 \frac{1}{2},因此僅在「化簡」一欄標 1。第二題兩個分母不同,必須先通分再化簡,於是「通分」與「化簡」兩欄為 1。第四題 4\frac{1}{3}-1\frac{5}{6} 則四項技能全數用上:先通分,再向整數部分借位,接著處理帶分數的整數相減,最後化簡。一道題標了幾個 1,就等於宣告它是幾項技能的聯合考驗。反過來看,若一名學生只在第一題答對、其餘三題皆錯,Q 矩陣立刻給出線索:他的化簡大致沒問題,卡住的地方很可能是通分。

Q 矩陣的地位,在 DCM 中無可取代:它既是測驗設計的藍圖,也是模型設定的核心,更是連結認知理論與統計模型的接榫。正因如此,Q 矩陣一旦界定錯誤,整個診斷都會隨之偏斜,這一風險將於後文專門討論。就測驗編製而言,如何由構念界定推導出 Q 矩陣、並把它落實為測驗藍圖,是第二十二章測驗編製方法學的一環;本章則聚焦於「給定 Q 矩陣之後,模型與推論如何運作」。

DINA 與 DINO:兩種最簡規則

有了 Q 矩陣,模型還缺一塊關鍵的零件。Q 矩陣只說明「這一題需要哪些屬性」,卻沒有說「屬性不足時會發生什麼事」。一名學生若三項所需技能只掌握了兩項,他答對的機率究竟是多少?Q 矩陣本身給不出答案。補上這一段的,是所謂的反應規則(response rule),它負責把一個人的屬性剖面翻譯成他在每一道題上的答對機率。可以設想的規則有許多種,本節先看兩條最極端、也最容易理解的:一條假設所需技能缺一不可,另一條假設具備其一即可。掌握了這兩條,後面更一般的模型就只是它們之間的填空。前者即 DINA 模型(deterministic inputs, noisy-and gate),如下面的方塊所示 (Junker & Sijtsma, 2001; Torre, 2009)。

推導方塊DINA 模型的反應函數

DINA 採取一種「全有全無」的連結邏輯:唯有當受測者掌握了某題所需的「全部」屬性時,才被期望答對;缺任一項,即被期望答錯。這一期望以理想反應(ideal response)\eta_{ij} 表示:

\eta_{ij} = \prod_{k=1}^{K} \alpha_{jk}^{\,q_{ik}},

當受測者 j 掌握了第 i 題所需的每一個屬性時 \eta_{ij}=1,否則為 0(此即「and 閘」,缺一不可)。但真實作答帶有雜訊,故引入兩個試題參數:失誤率 s_i = P(X_{ij}=0 \mid \eta_{ij}=1),即已掌握卻答錯的機率;猜測率 g_i = P(X_{ij}=1 \mid \eta_{ij}=0),即未掌握卻答對的機率。反應函數遂為

P(X_{ij}=1 \mid \boldsymbol{\alpha}_j) = (1-s_i)^{\,\eta_{ij}}\, g_i^{\,1-\eta_{ij}}.

其意涵一目了然:\eta_{ij}=1 者答對機率為 1-s_i(高),\eta_{ij}=0 者答對機率為 g_i(低)。DINA 因此只用兩個參數,就刻畫了一道題的全部作答行為。

s_i 與 g_i 這兩個數字可以直接讀出意義。設想表 21.1 第三題估得猜測率 g_i = 0.12、失誤率 s_i = 0.10。前者說的是:所需技能並未全數掌握的學生,仍有一成二的機會答對,多半來自猜測,或碰巧繞過了缺漏的那一步。後者說的是:技能全數掌握的學生,答對機率為 1 - 0.10 = 0.90,仍有一成因粗心或計算失誤而失手。兩者相差 0.78,表示這道題把「會」與「不會」分得相當開,是一道有診斷力的好題。相對地,若某題估得 g_i = 0.45、s_i = 0.30,會與不會的答對機率只差 0.25,這道題幾乎無法區辨兩種學生,而這通常也正是 Q 矩陣標錯、或題目本身有瑕疵的訊號。

DINA 的「缺一不可」是一種合取(conjunctive)邏輯,適合「所有步驟都對才算對」的題目,例如需要同時借位與通分的分數減法題。它的鏡像是 DINO 模型(deterministic inputs, noisy-or gate),採取析取(disjunctive)邏輯:只要掌握了所需屬性中的「任何一個」即被期望答對,適合「條條大路通羅馬」、有替代解法的情境。舉例而言,比較 \frac{3}{8} 與 \frac{2}{5} 何者較大,可以通分後比較分子,也可以各自化為小數再比較,學生只要走得通其中一條路就能答對。這樣的題目適合以 DINO 描述;若硬套 DINA,模型會誤以為兩種技能缺一不可,於是把那些只會一條路卻順利答對的學生,統統記成猜對,猜測率因而被高估,診斷也隨之失真。DINA 與 DINO 是最簡的兩種規則,各自對應一種極端的認知假設,其價值在於直觀與精簡;但真實的認知歷程往往介於「缺一不可」與「有一即可」之間,這便需要更一般的模型。

一般化:G-DINA 與 LCDM

DINA 與 DINO 各站在一個極端,而真實的認知歷程多半落在兩者之間。DINA 的問題出在它把「掌握部分屬性」的所有情形,都壓成同一個低機率 g_i。以表 21.1 第二題為例,這題需要通分與化簡,一名只會化簡的學生與一名兩項皆不會的學生,在 DINA 眼中的答對機率完全相同,都是 g_i。這在直覺上顯然過於粗糙,會了一半,總該比全然不會更有機會答對。DINO 則犯了對稱的錯誤,它把「只會一項」與「兩項全會」看成一樣好,同樣抹平了中間地帶。本節要介紹的一般化模型,正是為鬆開這道限制而來:它不再預先規定部分掌握該落在哪一端,而是讓每一種掌握組合都有自己的答對機率,再由資料決定它們的高低。

推導方塊G-DINA 的飽和參數化

Torre (2011) 的一般化 DINA(G-DINA)不再只分「全掌握」與「非全掌握」兩檔,而是為某題所需屬性的「每一種掌握組合」各設一個答對機率。設第 i 題需要 K_i^* 個屬性,則其飽和參數化為

P(\boldsymbol{\alpha}_i^*) = \delta_{i0} + \sum_{k} \delta_{ik}\,\alpha_k + \sum_{k<k'} \delta_{ikk'}\,\alpha_k\alpha_{k'} + \cdots,

其中 \delta_{i0} 是截距(一項所需屬性都未掌握時的基準答對機率),各 \delta_{ik} 是單一屬性的主效果,各 \delta_{ikk'} 是屬性間的交互效果。這個式子與變異數分析或迴歸的飽和模型形式上完全相同,只是預測變項換成了二元的屬性掌握指標。DINA、DINO 以及其他常見模型,都可由對這組 \delta 參數施加特定約束而得到,因而 G-DINA 成為一個能統攝眾多特例的一般框架。

這組 \delta 參數同樣可以讀出實質意義。設想表 21.1 第二題(需要通分與化簡)估得四個答對機率:兩項皆未掌握者 0.15,只會化簡者 0.30,只會通分者 0.55,兩項皆掌握者 0.88。換成 \delta 的語言,截距 \delta_{i0}=0.15 是基準;通分的主效果為 0.55-0.15=0.40,遠大於化簡的 0.30-0.15=0.15,顯示這道題的瓶頸在通分;交互效果為 0.88-0.55-0.30+0.15=0.18,為正值,表示兩項技能兼具時還有額外的加成,並非各自貢獻的簡單相加。這張表也讓 DINA 與 DINO 的位置一目了然:DINA 相當於強制前三個機率相等,DINO 相當於強制後三個機率相等,兩者都只是對這四個數字所施加的特定約束。

與 G-DINA 精神相通、卻由另一條路建構的,是 Henson et al. (2009) 的對數線性認知診斷模型(log-linear cognitive diagnosis model, LCDM)。它把答對機率的 logit 寫成屬性主效果與交互效果的對數線性組合,本質上是把 G-DINA 放進廣義線性模型的語言,這也再次呼應了第十八章「測量模型多可統一於廣義線性混合模型」的主題。更廣的一般診斷模型(general diagnostic model, GDM;(Davier, 2008))則進一步容許屬性為多級而非僅二元,並以連結函數統攝連續與離散的潛在結構。這些一般化模型的共同貢獻,是把原本各自為政的診斷模型,收攏為一個由連結函數與參數約束所組織的統一家族,其系統整理見 Rupp et al. (2010) 與 Davier & Lee (2019)。

三張地圖:DCM、受限 LCA 與 MIRT

到此為止,DCM 的零件已經齊備:屬性、Q 矩陣與反應規則。但它在整個測量模型的版圖上究竟站在哪個位置,還沒有交代。這並不是分類上的整齊癖,而有實際的用處:知道一個模型與既有模型的親緣關係,才知道哪些已經熟悉的工具、直覺與檢驗方法可以直接搬過來用,不必從零學起。DCM 恰好可以從三個方向被定位,其一是第二十章的潛在類別分析,其二是第十八章的多向度項目反應理論,其三是驗證性因素分析所代表的「先設定、後檢驗」傳統。下面的概念方塊,即由這三個方向替 DCM 標出座標。

概念方塊DCM 的三重身分

同一個 DCM,可以在三種語言中被等價地描述:

作為受限 LCA:K 個二元屬性界定了 2^K 個潛在類別,而 Q 矩陣與反應規則對各類別的答對機率施加了約束。無約束時即退回一般的潛在類別分析(第二十章)。

作為離散化的 MIRT:把多向度 IRT(第十八章)的連續潛在能力向量,換成離散的二元屬性向量,即得 DCM。兩者共享「多個潛在維度共同決定答對機率」的骨架。

作為驗證性的測量模型:Q 矩陣扮演了如同驗證性因素分析中「負荷型態」的角色,事先規定哪道題載於哪個屬性,使模型可被資料否證。

三種身分並非三個模型,而是同一模型的三個切面,各自接通了本書不同章節所建立的機制。

這三張地圖的實用價值,在於它讓 DCM 不再是一套要從頭學起的孤立技術。理解 LCA 的人,可把 DCM 看成「加了 Q 矩陣約束的 LCA」;熟悉 IRT 的人,可把它看成「屬性離散化的 MIRT」;而習慣因素分析的人,則可把 Q 矩陣看成一張二元的、事先固定的負荷型態。本章其後所談的估計、適配與分類,也都可在這三種語言之間自由轉譯。

估計與適配

DCM 的估計,沿用了混合模型的引擎。由於屬性剖面是未觀測的潛在類別,估計時須對其邊際化:一個反應組型的邊際機率,是各屬性剖面條件機率以剖面比例加權之和。在此基礎上,題目參數(如各題的 s_i、g_i 或 \delta)以邊際最大概似搭配 EM 演算法估計,與第二十章混合模型的估計邏輯完全平行;而屬性剖面的分布,可設為飽和(估計全部 2^K 個比例)或加以結構化(如假設屬性間獨立或服從高階模型)以節省參數。當屬性數眾多、2^K 過大時,貝氏取向以 MCMC 抽樣往往更為可行,其細節屬第三十三章。

模型與資料的適配檢驗,在 DCM 中同樣不可或缺,且分三個層次。絕對適配問「模型整體能否重現觀測資料」,常以反應組型的期望與觀察次數比較,或以邊際的雙題關聯統計量檢查局部依賴。試題適配(item fit)問「哪幾道題的模型設定有問題」,往往正是 Q 矩陣界定錯誤的線索。相對適配則以資訊準則(第十二章)在競爭模型間比較,例如判斷某題該用精簡的 DINA 或飽和的 G-DINA。忽略適配而逕自解讀診斷結果,與前面各章的告誡如出一轍:DCM 的分類再細緻,也唯有在模型設定正確時才有意義。

分類品質:正確率與屬性信度

模型與資料適配良好,並不等於診斷結果可信,這一節要處理的正是後者。連續模型談精度時問的是「估計值離真值有多遠」,答案是一個標準誤,誤差小一點大一點只是程度之別。DCM 的產出卻是分類:一名學生被判為「通分已經過關」,若這個判定是錯的,錯的不是幾分之差,而是整個結論的方向,後續的補救教學也會整個瞄錯目標。因此 DCM 需要一套屬於自己的精度語言,回答的是「判對的機會有多大」與「重測一次會不會翻盤」。以下先說明分類究竟是怎麼做出來的,再說明其品質如何量化。估計完成後,每位受測者被指派一個屬性剖面,依據是後驗機率:對每一種可能的剖面,計算「在觀察到此人作答的條件下,他屬於該剖面的機率」,再取後驗機率最大者為其診斷(最大後驗,MAP),或報告各屬性掌握的後驗期望(EAP)。

推導方塊屬性的後驗分類

給定題目參數,受測者 j 屬於屬性剖面 \boldsymbol{\alpha} 的後驗機率,由貝氏定理給出:

P(\boldsymbol{\alpha} \mid \mathbf{x}_j) = \frac{P(\boldsymbol{\alpha})\, \prod_i P(x_{ij}\mid \boldsymbol{\alpha})}{\sum_{\boldsymbol{\alpha}'} P(\boldsymbol{\alpha}')\, \prod_i P(x_{ij}\mid \boldsymbol{\alpha}')},

分子為剖面先驗機率乘上各題反應機率之積(在局部獨立下),分母對所有 2^K 個剖面加總。最大後驗分類取後驗機率最大的剖面;而單一屬性 k 的掌握機率,則由所有「\alpha_k=1」的剖面後驗機率加總而得。當某人的後驗機率高度集中於單一剖面時,分類明確;若後驗分散於數個剖面,則診斷帶有不確定性。

分類既然帶有不確定性,就須有指標量化其可靠程度。分類正確率(correct classification rate)以模擬估計「被正確歸類的比例」,可分屬性層次(每項技能判對的比例)與剖面層次(整份剖面完全判對的比例)。而屬性層次的分類一致性與精確性指標,則扮演了 DCM 版本的信度,回答「若重測,屬性判定有多穩定」。

這兩個層次的數字通常差距不小,值得把它讀清楚。設想一份四屬性的分數減法診斷測驗,四項技能的屬性層次分類正確率分別為 0.93、0.88、0.91 與 0.90,單看每一項都相當理想。但整份剖面要判對,四項必須同時判對;若各項判定大致獨立,剖面層次的正確率約為這四個數字相乘,即 0.67 左右。換句話說,每三名學生就約有一名的診斷報告至少有一項技能被判錯。這並不表示模型失效,而是提醒報告的使用方式:單項屬性的回饋可以放心據以補救,整份剖面則宜視為一個帶有不確定性的建議,而非確定的結論。

此處與第六章的信度概念遙相呼應:連續測量以測量誤差刻畫精度,分類測量則以「判對、判穩的機率」刻畫精度,兩者形異而神同。一份負責任的診斷報告,不應只給出剖面,還應交代其分類的可靠程度。

Q 矩陣的效度與修訂

前面幾節的討論,都建立在一個始終未經檢驗的前提上:Q 矩陣是對的。這個前提值得單獨拿出來檢視,因為 DCM 一切推論的正當性都繫於它。這使 Q 矩陣的效度,成為診斷測量中最關鍵、也最脆弱的一環。若某道題實際需要的屬性與 Q 矩陣所載不符,例如漏標了一個實際需要的屬性,或多標了一個其實不需要的,則該題的參數估計會偏誤,連帶扭曲相關受測者的分類。以表 21.1 第三題為例,假定這一題其實還需要通分,Q 矩陣卻漏標了這一欄:那些通分尚未過關的學生會頻頻在此題失手,而模型無從得知真正的原因,只能把這筆帳算到失誤率上,於是 s_i 被高估,借位一項的診斷也跟著被拖累。

因應之道分兩個層次。事前,Q 矩陣應由領域專家依認知理論審慎界定,並輔以認知實驗室的作答歷程分析(如放聲思考)加以檢核,使它真正反映題目所調動的認知歷程,而非事後憑統計湊出。事後,則發展出多種以資料驅動的 Q 矩陣修訂方法,其思路是比較「Q 矩陣所預測的作答型態」與「實際觀察到的型態」,標記出兩者不合的試題與屬性,建議增刪某個 q_{ik}。這些方法能有效指出可疑之處,卻不能取代理論判斷:一個純由資料修出的 Q 矩陣,可能適配良好卻喪失了認知詮釋。Q 矩陣的建立,因而始終是理論與資料交互驗證的歷程,而非任一方可獨力完成。

至於 Q 矩陣在什麼條件下能被唯一辨識,是一個技術性的問題,其結論的直覺是:每個屬性都必須有足夠多、且型態夠分散的題目來「定位」它。若某個屬性只被極少數題目所需要,或若干屬性總是成對出現、從不單獨出現,模型便難以把它們分開,屬性的掌握狀態也就無法被可靠地估計。完備性,即每個屬性至少須有題目單獨測量,是可辨識性的一個直觀必要條件。

retrofitting 的誘惑與風險

上一節談的是 Q 矩陣可能標錯,本節要談的問題更根本:有些測驗,無論 Q 矩陣標得多麼仔細,都不適合拿來做診斷。DCM 能輸出細緻的技能診斷,這個誘人的前景,催生了一種普遍卻危險的做法,即所謂的 retrofitting:把 DCM 事後套用到一份「原本並非為診斷而設計」的既有測驗上,例如一份現成的大型成就測驗,事後補一張 Q 矩陣,宣稱由此得到了技能診斷。設想有人取來國中教育會考數學科的既有題本,事後編出一張含十個屬性的 Q 矩陣,宣稱能逐一告訴每位考生這十項能力各自過關與否,這便是典型的 retrofitting。乍看之下,原本只有一個等級的成績單,突然變成十項技能的診斷報告,資訊量增加了許多;但這些新增的資訊究竟從何而來,值得追問。

這個做法的風險,根源於 DCM 與傳統測驗在設計哲學上的根本差異。一份為排序而設計的測驗,其題目通常各自測量寬泛而混合的能力,並不刻意讓每項細部技能都有足夠多、足夠純的題目來支撐診斷;把 Q 矩陣硬套上去,往往得到辨識不良、屬性彼此糾纏的模型,其「診斷」的細部宣稱缺乏足夠的資訊支撐。更深一層,測量的效度是設計出來的,不是事後套模型套出來的:若一份測驗從未依診斷目的來規劃其藍圖與題目,那麼即使 DCM 在統計上勉強收斂,其屬性分類的效度也高度可疑。這一警示與第七章效度論證取向、以及本書一貫的立場一致:模型的適配,永遠不能替代設計的正當性。真正的診斷測驗,應如第二十二章所述,自屬性界定與 Q 矩陣出發,正向地設計出來。

應用:形成性評量與學習診斷

DCM 最自然的應用場域,是形成性評量。相對於總結性評量只給一個分數,形成性評量的目的是回饋於教與學,而 DCM 所輸出的屬性剖面,恰好提供了可操作的回饋:它告訴教師「這名學生會了借位與化簡,卻卡在通分」,於是補救可以精準地對準那個未掌握的屬性,而非籠統地「多練幾題」。就分數減法而言,一份 DCM 報告能把全班學生依其未掌握的技能分群,讓教學資源投注於最需要的環節。設想一個三十人的班級,診斷結果顯示十八人四項技能全數掌握,七人只卡在通分,三人只卡在借位,另外兩人則是通分與借位都尚未過關。這樣的一張分布表,直接指向一套可執行的安排:全班不必從頭複習,只需為七人與兩人合開一節通分的補救,再為另外五人處理借位。若只有一個平均七十分的班級成績,這些安排無從做起。

這類應用也延伸到大型評量的診斷再分析,以及線上學習系統的即時診斷。然而,診斷回饋的價值,最終取決於一個仍待更多實證的問題:這些細緻的分類報告,是否真的改變了教學、進而提升了學習?一份技術上精確的診斷,若無法轉化為有效的教學行動,其實務意義便有限。因此,DCM 的效度評鑑,不能止於分類的統計品質,還須延伸到「診斷回饋是否帶來學習上的實質改善」這一後果層次的證據,這也正是第七章後果效度關切的具體體現。

前沿:階層、縱貫與知識追蹤

DCM 仍是一個活躍發展的領域,幾個方向特別值得一提。其一是屬性階層模型:許多技能之間存在先備關係,例如須先會通分才能做異分母加減,把這類階層約束納入模型,能減少參數、貼合認知現實,並勾勒出學習路徑。其二是縱貫診斷模型:把 DCM 與潛在轉移的思路結合,追蹤同一名學生的屬性掌握如何隨學習而變動,等於為學習軌跡提供了逐項技能的診斷追蹤,與第二十九章的縱貫建模相呼應。其三是探索式或正則化的 Q 矩陣估計:以懲罰或搜尋的方法,讓資料協助判定 Q 矩陣的元素,緩解純靠專家界定的主觀性。

一個尤其值得關注的前沿對話,是 DCM 與知識追蹤(knowledge tracing)的相遇。知識追蹤源自教育資料探勘與機器學習的傳統,同樣試圖由學生的作答序列,即時推斷其對各知識點的掌握狀態,晚近更以深度神經網路實作。它與 DCM 追求的目標高度重疊,卻來自迥異的學術傳統:DCM 重視參數的可解釋性與模型的效度論證,知識追蹤則重視預測的準確性與對大規模序列資料的擴充性。兩個傳統如何相互借鏡,即 DCM 如何吸納知識追蹤的縱貫預測力,知識追蹤又如何補上 DCM 的心理計量嚴謹性,是一場正在進行、尚無定論的對話,其計算面的細節與機器學習的交會,將於第三十四章再現。

小結

診斷分類模型把測量的問題,由「這個人多強」轉為「他會了哪幾項技能」,從而把測量的產出,由一個連續分數轉為一份可指引補救的技能剖面。本章的核心可收攏為幾點:屬性、屬性剖面與 Q 矩陣是 DCM 的三個基本構件,而 Q 矩陣作為認知理論與統計模型的接榫,其效度是一切診斷的地基;DINA 與 DINO 是最簡的合取與析取規則,G-DINA 與 LCDM 則把它們統攝為一個由參數約束與連結函數組織的一般家族;而 DCM 的三重身分,即受限 LCA、離散化 MIRT 與驗證性測量模型,把它接回了本書前面各章所建立的機制。

DCM 也標誌著第四部「潛在變項測量模型」的收束。回望這一部,從連續潛在變項的因素分析、結構方程與項目反應理論,到離散潛在變項的混合模型與診斷分類模型,看似分歧的技術,其實共享同一副潛在變項的骨架,差別只在潛在變項是連續或類別、測量是探索或驗證、目的是排序或診斷。理解了這副共同骨架,這些模型便不再是一份要逐一背誦的清單,而是同一種思考方式在不同設定下的展開。至此,測量的模型已大致齊備;接下來的第五部,將把這些測量理論帶出實驗室,落實到測驗如何編製、如何等化、如何適性施測、如何確保公平這些最貼近實務與社會的層面。

參考文獻

Davier, M. von. (2008). A general diagnostic model applied to language testing data. British Journal of Mathematical and Statistical Psychology, 61(2), 287–307. https://doi.org/10.1348/000711007X193957
Davier, M. von, & Lee, Y.-S. (2019). Handbook of diagnostic classification models: Models and model extensions, applications, software packages. Springer.
Henson, R. A., Templin, J. L., & Willse, J. T. (2009). Defining a family of cognitive diagnosis models using log-linear models with latent variables. Psychometrika, 74(2), 191–210. https://doi.org/10.1007/s11336-008-9089-5
Junker, B. W., & Sijtsma, K. (2001). Cognitive assessment models with few assumptions, and connections with nonparametric item response theory. Applied Psychological Measurement, 25(3), 258–272. https://doi.org/10.1177/01466210122032064
Rupp, A. A., Templin, J., & Henson, R. A. (2010). Diagnostic measurement: Theory, methods, and applications. Guilford Press.
Tatsuoka, K. K. (1983). Rule space: An approach for dealing with misconceptions based on item response theory. Journal of Educational Measurement, 20(4), 345–354. https://doi.org/10.1111/j.1745-3984.1983.tb00212.x
Torre, J. de la. (2009). DINA model and parameter estimation: A didactic. Journal of Educational and Behavioral Statistics, 34(1), 115–130. https://doi.org/10.3102/1076998607309474
Torre, J. de la. (2011). The generalized DINA model framework. Psychometrika, 76(2), 179–199. https://doi.org/10.1007/s11336-011-9207-7
本章引用格式游琇婷(2026)。認知診斷與診斷分類模型。《計量心理學:測量、模型與推論》(第 21 章)。