第 21 章 認知診斷與診斷分類模型
第四部 潛在變項測量模型
21Chapter

認知診斷與診斷分類模型

前面數章的測量模型,無論是連續潛在能力的項目反應理論,或離散潛在類別的混合模型,回答的都是「這個人在某條潛在向度上位於何處」這類程度問題。然而在教學現場,教師真正想知道的往往不是「這名學生數學多強」,而是「他究竟會了哪些、還不會哪些」。一個總分七十分的學生,可能是「四項技能各掌握一半」,也可能是「三項全會、一項全不會」,這兩種人需要的補救截然不同,而一個連續的能力分數卻把他們混為一談。診斷分類模型(diagnostic classification models, DCM),又稱認知診斷模型,正是為回答這類「會不會」的問題而生:它不問「你多強」,而問「你掌握了哪幾項細部技能」。

本章要建立 DCM 作為一個「多向度、類別、驗證性」的測量模型家族。多向度,因為它同時判定多項技能;類別,因為每項技能的掌握與否是離散的;驗證性,因為技能與試題的對應關係由研究者事先以理論界定。DCM 有著雙重血緣:從第二十章看,它是加了理論約束的受限潛在類別分析;從第十七、十八章看,它是把連續的潛在能力,換成了一組離散的潛在屬性剖面。為使討論具體,全章以認知診斷研究的一份經典資料為貫穿實例,即分數減法測驗:它要診斷四項技能,即借位、通分、化簡與整數處理,而每一道分數減法題各自需要其中的某些技能組合。本章將以這個例子,一路走過模型設定、估計、分類報告與教學回饋。

換一個測量問題:從「多強」到「會不會」

認知診斷的思想根源,可追溯至 Tatsuoka (1983) 的規則空間(rule space)取向。她的洞見來自對學生錯誤的細膩觀察:學生在分數減法上的錯誤並非隨機,而往往源於系統性地誤用或缺漏某一條運算規則,例如「該借位時未借位」。若能由作答型態反推學生「缺了哪條規則」,測量便由「排出高低」轉為「診斷病灶」。這一取向把測量的目的,從常模參照的排序,移向標準參照的、可指引補救的細部回饋。

這個轉向也重新定義了測量的目標對象。傳統 IRT 的目標是估計一個連續的潛在能力 \theta;DCM 的目標則是判定一個離散的屬性剖面(attribute profile),即一組「會或不會」的二元判斷。就分數減法而言,模型要輸出的不是一個分數,而是一份形如「借位:會;通分:不會;化簡:會;整數處理:會」的診斷報告。這種以離散技能剖面為目標的測量,天生就與形成性評量、學習診斷的需求相契合,也是 DCM 近年在教育測量中復興的動力。

屬性、剖面與 Q 矩陣

DCM 的三個基本構件是屬性、屬性剖面與 Q 矩陣。屬性(attribute)指所欲診斷的細部技能或知識成分,通常設為二元的潛在變項,即掌握(記為 1)或未掌握(記為 0)。屬性剖面(attribute profile)\boldsymbol{\alpha} = (\alpha_1, \dots, \alpha_K) 是某位受測者在全部 K 個屬性上的掌握型態;K 個二元屬性共可組成 2^K 種剖面,就分數減法的四個屬性而言,即 2^4 = 16 種可能的技能組合。

連結「屬性」與「試題」的橋樑,是 Q 矩陣(Q-matrix)。它是一個「試題 \times 屬性」的矩陣,其元素 q_{ik}=1 表示答對第 i 題需要掌握第 k 個屬性,q_{ik}=0 表示不需要。Q 矩陣把研究者對「每道題考什麼技能」的認知理論,寫成一張可供模型使用的設定表,如表 21.1 的分數減法例示。

表 21.1 分數減法測驗的 Q 矩陣(節錄)
試題 借位 通分 化簡 整數處理
\frac{3}{4}-\frac{1}{4} 0 0 1 0
\frac{2}{3}-\frac{1}{6} 0 1 1 0
3\frac{1}{4}-1\frac{3}{4} 1 0 1 1
4\frac{1}{3}-1\frac{5}{6} 1 1 1 1

註. q_{ik}=1 表示答對該題需要該屬性。Q 矩陣把「每道題需要哪些技能」的認知理論明文化,是 DCM 模型設定的核心,其正確與否直接左右診斷結果。

Q 矩陣的地位,在 DCM 中無可取代:它既是測驗設計的藍圖,也是模型設定的核心,更是連結認知理論與統計模型的接榫。正因如此,Q 矩陣一旦界定錯誤,整個診斷都會隨之偏斜,這一風險將於後文專門討論。就測驗編製而言,如何由構念界定推導出 Q 矩陣、並把它落實為測驗藍圖,是第二十二章測驗編製方法學的一環;本章則聚焦於「給定 Q 矩陣之後,模型與推論如何運作」。

DINA 與 DINO:兩種最簡規則

有了 Q 矩陣,還須指定一條「反應規則」,說明「一個人的屬性剖面,如何決定他答對某題的機率」。最簡單、也最具代表性的一條,是 DINA 模型(deterministic inputs, noisy-and gate),如下面的方塊所示 (Junker & Sijtsma, 2001; Torre, 2009)。

推導方塊DINA 模型的反應函數

DINA 採取一種「全有全無」的連結邏輯:唯有當受測者掌握了某題所需的「全部」屬性時,才被期望答對;缺任一項,即被期望答錯。這一期望以理想反應(ideal response)\eta_{ij} 表示:

\eta_{ij} = \prod_{k=1}^{K} \alpha_{jk}^{\,q_{ik}},

當受測者 j 掌握了第 i 題所需的每一個屬性時 \eta_{ij}=1,否則為 0(此即「and 閘」,缺一不可)。但真實作答帶有雜訊,故引入兩個試題參數:失誤率 s_i = P(X_{ij}=0 \mid \eta_{ij}=1),即已掌握卻答錯的機率;猜測率 g_i = P(X_{ij}=1 \mid \eta_{ij}=0),即未掌握卻答對的機率。反應函數遂為

P(X_{ij}=1 \mid \boldsymbol{\alpha}_j) = (1-s_i)^{\,\eta_{ij}}\, g_i^{\,1-\eta_{ij}}.

其意涵一目了然:\eta_{ij}=1 者答對機率為 1-s_i(高),\eta_{ij}=0 者答對機率為 g_i(低)。DINA 因此只用兩個參數,就刻畫了一道題的全部作答行為。

DINA 的「缺一不可」是一種合取(conjunctive)邏輯,適合「所有步驟都對才算對」的題目,例如需要同時借位與通分的分數減法題。它的鏡像是 DINO 模型(deterministic inputs, noisy-or gate),採取析取(disjunctive)邏輯:只要掌握了所需屬性中的「任何一個」即被期望答對,適合「條條大路通羅馬」、有替代解法的情境。DINA 與 DINO 是最簡的兩種規則,各自對應一種極端的認知假設,其價值在於直觀與精簡;但真實的認知歷程往往介於「缺一不可」與「有一即可」之間,這便需要更一般的模型。

一般化:G-DINA 與 LCDM

DINA 把「掌握部分屬性」的所有情形都壓成同一個低機率 g_i,這在許多情境下過於粗糙:掌握了三項所需屬性中的兩項,直覺上應比一項都沒掌握更可能答對,DINA 卻視之為相同。一般化的模型鬆開了這個限制,讓「部分掌握」也能有區別地提升答對機率。

推導方塊G-DINA 的飽和參數化

Torre (2011) 的一般化 DINA(G-DINA)不再只分「全掌握」與「非全掌握」兩檔,而是為某題所需屬性的「每一種掌握組合」各設一個答對機率。設第 i 題需要 K_i^* 個屬性,則其飽和參數化為

P(\boldsymbol{\alpha}_i^*) = \delta_{i0} + \sum_{k} \delta_{ik}\,\alpha_k + \sum_{k<k'} \delta_{ikk'}\,\alpha_k\alpha_{k'} + \cdots,

其中 \delta_{i0} 是截距(一項所需屬性都未掌握時的基準答對機率),各 \delta_{ik} 是單一屬性的主效果,各 \delta_{ikk'} 是屬性間的交互效果。這個式子與變異數分析或迴歸的飽和模型形式上完全相同,只是預測變項換成了二元的屬性掌握指標。DINA、DINO 以及其他常見模型,都可由對這組 \delta 參數施加特定約束而得到,因而 G-DINA 成為一個能統攝眾多特例的一般框架。

與 G-DINA 精神相通、卻由另一條路建構的,是 Henson et al. (2009) 的對數線性認知診斷模型(log-linear cognitive diagnosis model, LCDM)。它把答對機率的 logit 寫成屬性主效果與交互效果的對數線性組合,本質上是把 G-DINA 放進廣義線性模型的語言,這也再次呼應了第十八章「測量模型多可統一於廣義線性混合模型」的主題。更廣的一般診斷模型(general diagnostic model, GDM;(Davier, 2008))則進一步容許屬性為多級而非僅二元,並以連結函數統攝連續與離散的潛在結構。這些一般化模型的共同貢獻,是把原本各自為政的診斷模型,收攏為一個由連結函數與參數約束所組織的統一家族,其系統整理見 Rupp et al. (2010) 與 Davier & Lee (2019)。

三張地圖:DCM、受限 LCA 與 MIRT

DCM 的位置,可由它與另外兩類模型的關係來三角定位,如下面的概念方塊所示。

概念方塊DCM 的三重身分

同一個 DCM,可以在三種語言中被等價地描述:

作為受限 LCA:K 個二元屬性界定了 2^K 個潛在類別,而 Q 矩陣與反應規則對各類別的答對機率施加了約束。無約束時即退回一般的潛在類別分析(第二十章)。

作為離散化的 MIRT:把多向度 IRT(第十八章)的連續潛在能力向量,換成離散的二元屬性向量,即得 DCM。兩者共享「多個潛在維度共同決定答對機率」的骨架。

作為驗證性的測量模型:Q 矩陣扮演了如同驗證性因素分析中「負荷型態」的角色,事先規定哪道題載於哪個屬性,使模型可被資料否證。

三種身分並非三個模型,而是同一模型的三個切面,各自接通了本書不同章節所建立的機制。

這三張地圖的實用價值,在於它讓 DCM 不再是一套要從頭學起的孤立技術。理解 LCA 的人,可把 DCM 看成「加了 Q 矩陣約束的 LCA」;熟悉 IRT 的人,可把它看成「屬性離散化的 MIRT」;而習慣因素分析的人,則可把 Q 矩陣看成一張二元的、事先固定的負荷型態。本章其後所談的估計、適配與分類,也都可在這三種語言之間自由轉譯。

估計與適配

DCM 的估計,沿用了混合模型的引擎。由於屬性剖面是未觀測的潛在類別,估計時須對其邊際化:一個反應組型的邊際機率,是各屬性剖面條件機率以剖面比例加權之和。在此基礎上,題目參數(如各題的 s_i、g_i 或 \delta)以邊際最大概似搭配 EM 演算法估計,與第二十章混合模型的估計邏輯完全平行;而屬性剖面的分布,可設為飽和(估計全部 2^K 個比例)或加以結構化(如假設屬性間獨立或服從高階模型)以節省參數。當屬性數眾多、2^K 過大時,貝氏取向以 MCMC 抽樣往往更為可行,其細節屬第三十三章。

模型與資料的適配檢驗,在 DCM 中同樣不可或缺,且分三個層次。絕對適配問「模型整體能否重現觀測資料」,常以反應組型的期望與觀察次數比較,或以邊際的雙題關聯統計量檢查局部依賴。試題適配(item fit)問「哪幾道題的模型設定有問題」,往往正是 Q 矩陣界定錯誤的線索。相對適配則以資訊準則(第十二章)在競爭模型間比較,例如判斷某題該用精簡的 DINA 或飽和的 G-DINA。忽略適配而逕自解讀診斷結果,與前面各章的告誡如出一轍:DCM 的分類再細緻,也唯有在模型設定正確時才有意義。

分類品質:正確率與屬性信度

DCM 的產出是分類,因此評估其品質的方式也與連續模型不同。估計完成後,每位受測者被指派一個屬性剖面,依據是後驗機率:對每一種可能的剖面,計算「在觀察到此人作答的條件下,他屬於該剖面的機率」,再取後驗機率最大者為其診斷(最大後驗,MAP),或報告各屬性掌握的後驗期望(EAP)。

推導方塊屬性的後驗分類

給定題目參數,受測者 j 屬於屬性剖面 \boldsymbol{\alpha} 的後驗機率,由貝氏定理給出:

P(\boldsymbol{\alpha} \mid \mathbf{x}_j) = \frac{P(\boldsymbol{\alpha})\, \prod_i P(x_{ij}\mid \boldsymbol{\alpha})}{\sum_{\boldsymbol{\alpha}'} P(\boldsymbol{\alpha}')\, \prod_i P(x_{ij}\mid \boldsymbol{\alpha}')},

分子為剖面先驗機率乘上各題反應機率之積(在局部獨立下),分母對所有 2^K 個剖面加總。最大後驗分類取後驗機率最大的剖面;而單一屬性 k 的掌握機率,則由所有「\alpha_k=1」的剖面後驗機率加總而得。當某人的後驗機率高度集中於單一剖面時,分類明確;若後驗分散於數個剖面,則診斷帶有不確定性。

分類既然帶有不確定性,就須有指標量化其可靠程度。分類正確率(correct classification rate)以模擬估計「被正確歸類的比例」,可分屬性層次(每項技能判對的比例)與剖面層次(整份剖面完全判對的比例)。而屬性層次的分類一致性與精確性指標,則扮演了 DCM 版本的信度,回答「若重測,屬性判定有多穩定」。此處與第六章的信度概念遙相呼應:連續測量以測量誤差刻畫精度,分類測量則以「判對、判穩的機率」刻畫精度,兩者形異而神同。一份負責任的診斷報告,不應只給出剖面,還應交代其分類的可靠程度。

Q 矩陣的效度與修訂

DCM 一切推論的正當性,都繫於 Q 矩陣是否正確。這使 Q 矩陣的效度,成為診斷測量中最關鍵、也最脆弱的一環。若某道題實際需要的屬性與 Q 矩陣所載不符,例如漏標了一個實際需要的屬性,或多標了一個其實不需要的,則該題的參數估計會偏誤,連帶扭曲相關受測者的分類。

因應之道分兩個層次。事前,Q 矩陣應由領域專家依認知理論審慎界定,並輔以認知實驗室的作答歷程分析(如放聲思考)加以檢核,使它真正反映題目所調動的認知歷程,而非事後憑統計湊出。事後,則發展出多種以資料驅動的 Q 矩陣修訂方法,其思路是比較「Q 矩陣所預測的作答型態」與「實際觀察到的型態」,標記出兩者不合的試題與屬性,建議增刪某個 q_{ik}。這些方法能有效指出可疑之處,卻不能取代理論判斷:一個純由資料修出的 Q 矩陣,可能適配良好卻喪失了認知詮釋。Q 矩陣的建立,因而始終是理論與資料交互驗證的歷程,而非任一方可獨力完成。

至於 Q 矩陣在什麼條件下能被唯一辨識,是一個技術性的問題,其結論的直覺是:每個屬性都必須有足夠多、且型態夠分散的題目來「定位」它。若某個屬性只被極少數題目所需要,或若干屬性總是成對出現、從不單獨出現,模型便難以把它們分開,屬性的掌握狀態也就無法被可靠地估計。完備性,即每個屬性至少須有題目單獨測量,是可辨識性的一個直觀必要條件。

retrofitting 的誘惑與風險

DCM 能輸出細緻的技能診斷,這個誘人的前景,催生了一種普遍卻危險的做法,即所謂的 retrofitting:把 DCM 事後套用到一份「原本並非為診斷而設計」的既有測驗上,例如一份現成的大型成就測驗,事後補一張 Q 矩陣,宣稱由此得到了技能診斷。

這個做法的風險,根源於 DCM 與傳統測驗在設計哲學上的根本差異。一份為排序而設計的測驗,其題目通常各自測量寬泛而混合的能力,並不刻意讓每項細部技能都有足夠多、足夠純的題目來支撐診斷;把 Q 矩陣硬套上去,往往得到辨識不良、屬性彼此糾纏的模型,其「診斷」的細部宣稱缺乏足夠的資訊支撐。更深一層,測量的效度是設計出來的,不是事後套模型套出來的:若一份測驗從未依診斷目的來規劃其藍圖與題目,那麼即使 DCM 在統計上勉強收斂,其屬性分類的效度也高度可疑。這一警示與第七章效度論證取向、以及本書一貫的立場一致:模型的適配,永遠不能替代設計的正當性。真正的診斷測驗,應如第二十二章所述,自屬性界定與 Q 矩陣出發,正向地設計出來。

應用:形成性評量與學習診斷

DCM 最自然的應用場域,是形成性評量。相對於總結性評量只給一個分數,形成性評量的目的是回饋於教與學,而 DCM 所輸出的屬性剖面,恰好提供了可操作的回饋:它告訴教師「這名學生會了借位與化簡,卻卡在通分」,於是補救可以精準地對準那個未掌握的屬性,而非籠統地「多練幾題」。就分數減法而言,一份 DCM 報告能把全班學生依其未掌握的技能分群,讓教學資源投注於最需要的環節。

這類應用也延伸到大型評量的診斷再分析,以及線上學習系統的即時診斷。然而,診斷回饋的價值,最終取決於一個仍待更多實證的問題:這些細緻的分類報告,是否真的改變了教學、進而提升了學習?一份技術上精確的診斷,若無法轉化為有效的教學行動,其實務意義便有限。因此,DCM 的效度評鑑,不能止於分類的統計品質,還須延伸到「診斷回饋是否帶來學習上的實質改善」這一後果層次的證據,這也正是第七章後果效度關切的具體體現。

前沿:階層、縱貫與知識追蹤

DCM 仍是一個活躍發展的領域,幾個方向特別值得一提。其一是屬性階層模型:許多技能之間存在先備關係,例如須先會通分才能做異分母加減,把這類階層約束納入模型,能減少參數、貼合認知現實,並勾勒出學習路徑。其二是縱貫診斷模型:把 DCM 與潛在轉移的思路結合,追蹤同一名學生的屬性掌握如何隨學習而變動,等於為學習軌跡提供了逐項技能的診斷追蹤,與第二十九章的縱貫建模相呼應。其三是探索式或正則化的 Q 矩陣估計:以懲罰或搜尋的方法,讓資料協助判定 Q 矩陣的元素,緩解純靠專家界定的主觀性。

一個尤其值得關注的前沿對話,是 DCM 與知識追蹤(knowledge tracing)的相遇。知識追蹤源自教育資料探勘與機器學習的傳統,同樣試圖由學生的作答序列,即時推斷其對各知識點的掌握狀態,晚近更以深度神經網路實作。它與 DCM 追求的目標高度重疊,卻來自迥異的學術傳統:DCM 重視參數的可解釋性與模型的效度論證,知識追蹤則重視預測的準確性與對大規模序列資料的擴充性。兩個傳統如何相互借鏡,即 DCM 如何吸納知識追蹤的縱貫預測力,知識追蹤又如何補上 DCM 的心理計量嚴謹性,是一場正在進行、尚無定論的對話,其計算面的細節與機器學習的交會,將於第三十四章再現。

小結

診斷分類模型把測量的問題,由「這個人多強」轉為「他會了哪幾項技能」,從而把測量的產出,由一個連續分數轉為一份可指引補救的技能剖面。本章的核心可收攏為幾點:屬性、屬性剖面與 Q 矩陣是 DCM 的三個基本構件,而 Q 矩陣作為認知理論與統計模型的接榫,其效度是一切診斷的地基;DINA 與 DINO 是最簡的合取與析取規則,G-DINA 與 LCDM 則把它們統攝為一個由參數約束與連結函數組織的一般家族;而 DCM 的三重身分,即受限 LCA、離散化 MIRT 與驗證性測量模型,把它接回了本書前面各章所建立的機制。

DCM 也標誌著第四部「潛在變項測量模型」的收束。回望這一部,從連續潛在變項的因素分析、結構方程與項目反應理論,到離散潛在變項的混合模型與診斷分類模型,看似分歧的技術,其實共享同一副潛在變項的骨架,差別只在潛在變項是連續或類別、測量是探索或驗證、目的是排序或診斷。理解了這副共同骨架,這些模型便不再是一份要逐一背誦的清單,而是同一種思考方式在不同設定下的展開。至此,測量的模型已大致齊備;接下來的第五部,將把這些測量理論帶出實驗室,落實到測驗如何編製、如何等化、如何適性施測、如何確保公平這些最貼近實務與社會的層面。

參考文獻

Davier, M. von. (2008). A general diagnostic model applied to language testing data. British Journal of Mathematical and Statistical Psychology, 61(2), 287–307. https://doi.org/10.1348/000711007X193957
Davier, M. von, & Lee, Y.-S. (2019). Handbook of diagnostic classification models: Models and model extensions, applications, software packages. Springer.
Henson, R. A., Templin, J. L., & Willse, J. T. (2009). Defining a family of cognitive diagnosis models using log-linear models with latent variables. Psychometrika, 74(2), 191–210. https://doi.org/10.1007/s11336-008-9089-5
Junker, B. W., & Sijtsma, K. (2001). Cognitive assessment models with few assumptions, and connections with nonparametric item response theory. Applied Psychological Measurement, 25(3), 258–272. https://doi.org/10.1177/01466210122032064
Rupp, A. A., Templin, J., & Henson, R. A. (2010). Diagnostic measurement: Theory, methods, and applications. Guilford Press.
Tatsuoka, K. K. (1983). Rule space: An approach for dealing with misconceptions based on item response theory. Journal of Educational Measurement, 20(4), 345–354. https://doi.org/10.1111/j.1745-3984.1983.tb00212.x
Torre, J. de la. (2009). DINA model and parameter estimation: A didactic. Journal of Educational and Behavioral Statistics, 34(1), 115–130. https://doi.org/10.3102/1076998607309474
Torre, J. de la. (2011). The generalized DINA model framework. Psychometrika, 76(2), 179–199. https://doi.org/10.1007/s11336-011-9207-7
本章引用格式游琇婷(2026)。認知診斷與診斷分類模型。《計量心理學:測量、模型與推論》(第 21 章)。