評分者效果與實作評量
前一章處理的是受測者自己填答的問卷,其誤差來自作答者如何理解與回應題目。本章要把場景換到另一種同樣普遍、卻更常被低估的測量情境,即分數不是由受測者填出來的,而是由人來評判出來的。一篇作文的優劣、一段口說表達的流暢、一次臨床晤談中症狀的嚴重程度、一場實作測驗中操作的正確性,這些都無法用選項勾選,而必須交由一位或多位評分者依其專業判斷給分。這類由人(或近年逐漸加入的演算法)評判表現的測量,一般稱為實作評量(performance assessment)。它最能貼近我們真正關心的能力,卻也因為引入了評分者這個新的環節,而承擔了一種問卷所沒有的誤差來源,即評分者本身的系統性傾向。 實作評量的吸引力在於真實性。要知道一個人能不能寫論說文,最直接的辦法就是請他寫一篇,而不是問他一堆關於寫作的選擇題。這種真實性換來的代價,是標準化的喪失與評分主觀性的引入。選擇題的計分是機械而完全可複製的,作文的評分卻繫於閱卷者當下的判斷,不同的人、甚至同一個人在不同時點,都可能給出不同的分數。本章的任務,就是把這種主觀性從無法言說的黑箱,轉化為可以測量、可以建模、可以校正的量。為使討論具體,全章以一個台灣讀者熟悉的場景為貫穿實例,即大型考試的國文作文閱卷:每份考卷由兩位閱卷者依一套六級分規準獨立評分,我們將依序為它計算一致性指標、進行概化理論的評分設計分析、以多面向 Rasch 模型校正閱卷者的寬嚴,最後把同一批作文交給自動計分系統作對照。
當測量需要評審
實作評量的效度理據,來自它對構念的直接代表。當我們關心的構念本質上是一種產出或表現,例如寫作能力、臨床晤談技巧、外科縫合的熟練度,任何以紙筆選擇題間接測量的做法,都會面臨構念代表性不足的質疑。實作評量以任務本身作為測量的場景,因而在構念效度上具有先天的優勢。然而這份優勢並非沒有代價,其中最根本的一項是任務特定性(task specificity)。一個人在某一道作文題上的表現,未必能推論到另一道題目;一次晤談的表現,也未必能代表其整體臨床能力。這使得單一任務的分數在跨任務推論上格外脆弱,也預示了本章稍後將反覆出現的一個結論,即在實作評量裡,任務層次的變異往往比評分者層次的變異更難駕馭。此處的效度概念延續第七章的架構,成就與能力測驗的規準編製流程則見第二十二章,本章聚焦於「由人評判」這一環所特有的測量問題。
一致還是可靠:兩個不同的問題
面對兩位閱卷者給出的分數,最自然的問題是「他們一致嗎」。但這個問題其實藏著兩個不同的追問,混淆它們是評分者研究中最常見的錯誤。第一個追問是絕對一致(absolute agreement):兩位閱卷者是否給出相同的分數,例如都給了四級分。第二個追問是相對一致或稱信度(consistency, reliability):兩位閱卷者是否對考生排出相同的高下順序,即使一位普遍給得比另一位高。這兩者可以嚴重分歧。設想閱卷者乙總是比閱卷者甲高一級分,則兩人的絕對一致極差,因為幾乎沒有一份考卷得到相同分數;但兩人的相對一致卻可以是完美的,因為乙的分數不過是甲的分數加一,兩者的排序完全相同。 哪一種一致才重要,取決於分數將如何使用。若作文分數要與其他考科加總、只看考生之間的相對高下,則相對一致(信度)才是關鍵,閱卷者整體的寬嚴可以事後以量尺調整吸收。若分數要對照一個絕對的通過標準,例如「四級分以上及格」,則閱卷者的系統性寬嚴會直接改變及格與否,此時絕對一致才是真正該擔心的。這一區分呼應了第六章把信度界定為「真分數變異占觀察分數變異之比」的架構,評分者在該架構下只是誤差的又一個來源。下文的各種係數,正是為了分別回答這兩個不同的問題而設計的。
kappa 與它的悖論
當分數是類別而非連續時,最廣為使用的一致性指標是 Cohen (1960) 提出的 kappa 係數。它的核心洞見是,單純計算兩位評分者給出相同類別的百分比並不公允,因為即使兩人閉眼亂猜,也會有一定比例的巧合一致。kappa 的作法是把觀察到的一致率扣除純由機遇造成的期望一致率,再以最大可能的改善量標準化,如下面的推導方塊所示。
設 p_o 為兩位評分者實際給出相同類別的比例(觀察一致率),p_e 為在兩人邊際分布下、純由獨立巧合造成的期望一致率。kappa 定義為
分子 p_o-p_e 是超出機遇的一致,分母 1-p_e 是機遇之上最大可能的改善。當一致完全由機遇解釋時 \kappa=0,完全一致時 \kappa=1。
悖論的來源在於 p_e 對邊際分布的依賴。當某一類別的邊際比例極高,例如兩位評分者都把九成的個案判為同一類,則 p_e 會非常接近 1,使分母 1-p_e 趨近於零。此時即使 p_o 高達九成,\kappa 卻可能低得離譜,甚至為負。這就是 Feinstein & Cicchetti (1990) 所刻畫的「高一致、低 kappa」悖論。它提醒我們,\kappa 衡量的並非一致的絕對水準,而是相對於該邊際分布下機遇基準的超額一致,因而在類別分布高度不均時會嚴重失真。
kappa 還有兩項值得留意的延伸與限制。其一,當類別是有序的,例如六級分作文,把「差一級」與「差三級」的分歧同等對待並不合理,Cohen (1968) 的加權 kappa 因此為不同程度的分歧賦予不同權重,其中以二次權重最常用,可證明在特定條件下它與後述的組內相關等價。其二,kappa 對邊際的敏感使得跨研究比較 kappa 值時必須格外謹慎,兩個 kappa 相同的研究,其實際一致水準可能相差甚遠,反之亦然。因此在作文閱卷這類有序評分的情境,實務上更常改用下一節的組內相關家族。
ICC 家族:一張選用地圖
當分數是連續或近似連續時,評分者信度最恰當的指標是組內相關(intraclass correlation, ICC)。ICC 的基本精神與第六章的信度定義一脈相承,即把觀察分數的變異拆解為受評對象之間的真實變異與各種誤差變異,再取真實變異所占的比例。困難之處在於,ICC 並非單一係數,而是一整個家族,選錯型別會得到看似合理卻答非所問的數字。Shrout & Fleiss (1979) 的經典分類與 McGraw & Wong (1996) 的補充,把選用決策整理為三個必須依序回答的問題,如下面的概念方塊所示。
在計算組內相關前,須依序回答三個問題,每個問題對應一組變異成分的處理方式:
問題一(模型):評分者是如何產生的?若每個受評對象都由不同且隨機抽取的評分者評分,屬單向設計;若同一組評分者評所有對象,屬雙向設計。雙向設計又分評分者為隨機效果(欲推論到更大的評分者母群)或固定效果(只關心這幾位評分者)。
問題二(定義):要的是絕對一致還是相對一致?絕對同意型把評分者間的系統性寬嚴差異計入誤差;一致型則把它排除在誤差之外,只問排序是否一致。此即前述兩種一致的正式對應。
問題三(單位):分數將以單一評分者計,還是以多位評分者的平均計?平均型的信度依 Spearman-Brown 原理高於單一型,因為平均能抵銷部分評分者誤差。
這張選用地圖的實務意義在作文閱卷中格外清楚。若最終分數取兩位閱卷者的平均、且只在意考生的相對高下,應選雙向隨機、一致型、平均值的 ICC;若及格與否繫於絕對標準、且每份卷實際只由一位閱卷者定分,則應選絕對同意型、單一評分者的 ICC。兩者算出的數字往往差距可觀,報告時因此必須明確交代所選的型別及其理由,否則讀者無從判斷該信度係數究竟回答了哪一個問題。
概化理論的主場:評分設計
前述的 kappa 與 ICC 各自回答一個一致性問題,卻無法同時處理多個誤差來源。作文閱卷的真實情境往往是:每位考生(p)寫若干道題(t),每道題由若干位閱卷者(r)評分。此時評分者不是唯一的誤差來源,題目也是,而且兩者可能交互作用。概化理論(generalizability theory)正是為這種多面向的誤差結構而生,第六章已引入其基本架構,本章則展示它在評分設計上最重要的應用。在一個 p\times r\times t 的完全交叉設計中,觀察分數的變異被拆解為受測者主效果、評分者主效果、題目主效果,以及三者之間的各階交互作用與殘差,各成為一個變異成分。 概化理論真正的力量在於它區分了兩種研究。概化研究(G 研究)從現有資料估計各個變異成分,回答「誤差主要來自哪裡」。決策研究(D 研究)則據此推算,若改變評分設計,例如增加閱卷者人數或增加題數,信度會如何變化,回答「該把資源投在哪裡」。這裡浮現了實作評量最重要也最反直覺的一個經典結論,即在絕大多數實作評量中,主導誤差的並非評分者,而是任務。人在不同題目上的表現本就不穩定,這種人與題的交互作用變異,通常遠大於評分者之間的變異。其直接推論是,若想提升信度,增加題數幾乎總是比增加閱卷者人數更有效;把同一篇作文交給第三位、第四位閱卷者,所能挽回的信度,往往遠不及讓考生多寫一題。這個結論延續自第六章的概化理論框架,並在此得到它最具說服力的應用場景。多層次視角下的信度另見第三十章,信度的跨研究整合則見第三十二章。
評分者效應的類型學
把評分者視為一個誤差來源之後,下一步是辨認這個來源有哪些系統性的型態。評分者效應並非雜亂無章,而是有幾種反覆出現、可以命名的類型。最基本的一種是寬嚴(severity/leniency),即某位評分者整體偏高或偏低地給分,這是作文閱卷中最普遍、也最容易以模型校正的效應。第二種是趨中(centrality)或稱範圍限縮,即評分者避用量尺兩端、把分數擠在中間,使其評分的鑑別度下降。第三種是月暈效應(halo effect),即評分者對某一向度的整體印象污染了對其他向度的評分,例如一篇字跡工整的作文在內容、結構、修辭各項都被連帶給高分,使本應獨立的評分向度失去區辨。第四種是飄移(drift),即評分者的標準隨閱卷歷程而系統性地變化,可能因疲勞而趨嚴,也可能因適應而趨寬;當閱卷跨越多個場次時,這種飄移會直接威脅到不同場次分數的可比性與其後的等化連結,此議題與第二十三章相接。 這些效應的共同特徵,是它們都屬於系統性而非隨機的誤差。這一點至關重要,因為系統性的東西才可能被建模與扣除。若評分者的偏差只是隨機的抖動,唯一的對策是增加評分者人數以求平均;但既然寬嚴、趨中、飄移都是有結構的傾向,就有可能把它們放進一個測量模型,估計出每位評分者偏離的方向與幅度,再從分數中校正回來。這正是下一節多面向 Rasch 模型的核心構想,也再次體現本書一以貫之的主張,即測量誤差有結構,因而可以被理解與扣除。
多面向 Rasch:把評分者放進模型
一致性係數與概化理論都把評分者當成籠統的誤差來源,量化其整體影響,卻不告訴我們「這一位」閱卷者到底偏了多少、該如何校正某一份特定考卷的分數。多面向 Rasch 測量模型(many-facet Rasch measurement, MFRM)由 Linacre (1989) 提出,正是為了填補這個缺口。它的構想是把 Rasch 模型從「受測者與題目」兩個面向,擴充到納入評分者的寬嚴為第三個面向,讓每位評分者的嚴苛度成為模型中一個可估計的參數。Rasch 模型的基礎已在第十七章鋪陳,此處僅呈現其多面向的加法推廣。
設受測者 n 在題目 i 上由評分者 j 評分,得到等級 k 而非 k-1 的對數勝算為各面向參數的簡單相加:
其中 \theta_n 為受測者能力,\delta_i 為題目難度,\rho_j 為評分者 j 的嚴苛度,\tau_k 為等級 k 的門檻。嚴苛的評分者 \rho_j 較大,會系統性地壓低其所評對象達到高等級的機率。
由於嚴苛度 \rho_j 被明確估計出來,就可以計算公平分數(fair score),即若這份作答改由一位嚴苛度為平均水準的評分者來評,受測者「應該」得到的分數。如此,一位考生不會因為運氣不好被分派到嚴格的閱卷者而受懲罰。這正是把系統性誤差建模、再從分數中扣除的具體實現。
MFRM 的另一項副產品,是它為每位評分者提供了適配(fit)統計量,用以偵測評分行為異常的個案。一位評分者若其實際評分與模型預期系統性地偏離,例如評分過於雜亂而無法以單一嚴苛度參數概括,其適配統計量會偏離期望值,從而被標記出來供進一步檢視。這使 MFRM 不僅能校正寬嚴,還能作為評分品質監控的診斷工具。當評分結構更複雜,例如同一份作答被多位評分者評、且欲同時建模評分者的準確度與一致度時,可進一步採用 Patz et al. (2002) 的階層評分者模型,它把受測者的真實表現視為潛在的離散變項,並在其上疊加評分者評分的機率結構,為大型評量中的多評分者資料提供了更細緻的刻畫。
訓練、校準與監控
模型能校正評分者偏差,並不意味著評分現場就可以放任偏差滋生。事前的評分者訓練與校準,仍是實作評量品質的第一道防線。標準的作法包括,以一套明確的評分規準界定各等級的判準,以事先由專家定分的定錨樣本(anchor papers)示範各等級的典型表現,並在正式閱卷前以校準測驗檢核每位閱卷者是否已對齊標準。這些程序的目的,是把評分者之間的變異在源頭壓到最低,減輕事後校正的負擔;評分規準本身的編製流程屬第二十二章的範疇。 訓練不能一勞永逸,因為前一節所述的飄移會在冗長的閱卷歷程中悄然發生。因此持續監控與訓練同等重要。常見的監控機制包括,週期性地插入已知分數的種子卷以檢核評分者是否偏離,計算評分者之間的即時一致性以發現異常者,以及運用 MFRM 的嚴苛度與適配統計量作定期的品質稽核。當監控發現某位評分者系統性地偏移,可即時介入再訓練,或在事後以模型校正其分數。這一整套「訓練—校準—監控—校正」的循環,體現了實作評量把評分者視為一個需要持續管理、而非一次到位的測量環節的專業立場。
自動化計分:從 Page 到 LLM
若評分者的主觀與不穩定是實作評量的根本負擔,一個自然的念頭便是讓機器來評分。這個念頭並不新。早在 Page (1966) 就提出以電腦評改作文的構想,其開創的系統以一系列可計算的文本表面特徵,例如文章長度、句長、詞彙多樣性,去預測人類評分者會給的分數。這條「以易測的代理特徵預測人評分數」的路線,奠定了往後數十年自動作文評分的基本邏輯。其後,教育測驗機構把這套邏輯工程化,發展出以更豐富的語言特徵為基礎、並經大規模人評資料訓練的商用評分引擎,使自動計分在若干大型測驗中進入實際運作。 近年的深度學習與大型語言模型,為自動計分帶來了新的能力與新的隱憂。與早期依賴人工設計特徵的系統不同,當代模型能直接從文本學習複雜的表徵,在與人評分數的一致性上往往表現亮眼。然而,愈強的模型也愈難解釋其評分依據,且更容易被鑽漏洞:一篇語意空洞卻堆砌了模型偏好之表面特徵的作文,可能騙得高分。大型語言模型作為評分者的一致性、偏誤與次群體公平,是一個剛浮現、標記為新興而尚無定論的議題,其中的次群體公平問題與第二十七章相接,演算法層面的技術細節則屬第三十四章。無論技術如何演進,一個核心問題始終不變,即「機器給的分數,是否真的測到了我們關心的構念」,這正是下一節效度框架要回答的。
自動計分的效度框架
評鑑一套自動計分系統,最容易犯的錯誤是把「與人評分數的一致性」當成唯一、甚至充分的效標。這個錯誤之所以危險,是因為高度的人機一致既可能來自系統真的捕捉到了寫作品質,也可能來自系統學會了模仿人類評分者的表面偏誤,兩者在一致性數字上無法區分。Williamson et al. (2012) 因此提出一個更完整的效度框架,主張自動計分的評鑑必須超越人機一致,至少納入以下幾個面向:構念代表性,即系統所倚重的特徵是否真正對應目標構念,而非僅是與之相關的表面代理;可操弄性,即系統是否容易被刻意鑽漏洞的作答所欺騙;跨任務與跨測驗版本的類推性;以及對不同次群體的影響與後果。這一框架把自動計分的評鑑,從單一的一致性指標,提升為與第七章效度論證同構的多面向論證。 這個框架也照見了常用一致性指標本身的限制。以二次加權 kappa 為例,它固然比未加權 kappa 更適合有序評分,但它終究只衡量機器分數與人類分數的吻合程度,而對「人類分數本身是否有效」以及「機器是否以正當理由達成吻合」保持沉默。一套在二次加權 kappa 上表現優異的系統,仍可能在構念代表性或可操弄性上不堪一擊。效度框架的價值,正在於提醒我們把評鑑的問題從「機器像不像人」轉回到測量的根本問題,即「這個分數是否支持我們想做的推論與決策」。
前沿:人機協作與歷程資料
自動計分的成熟,並未把人類評分者逐出評分現場,反而催生了人機協作的評分設計。一種常見的架構是,讓機器承擔第一輪的大量評分,再由人類評分者集中處理機器信心不足或人機分歧的個案,兼顧效率與品質。另一種架構則以機器作為即時的品質監控,在人類閱卷的過程中標記出可能偏離標準的評分供覆核。這些設計的共同前提,是清楚認知機器與人各自的長短,而非把任一方當成絕對的標準。 另一條前沿是把歷程資料納入表現評量。傳統的作文評分只看最終的成品,但數位化的寫作環境還記錄了大量的歷程資訊,例如鍵擊的節奏、修改與刪除的軌跡、停頓的分布。這些歷程特徵有可能揭示成品所掩蓋的能力側面,例如規劃與修改的策略,其特徵工程與建模與第三十四章的計算取向相接,作答歷程資料的一般性方法則承接自第十八章。這些前沿的共同主題是,實作評量正從「只評成品的單一人類判斷」,走向「整合機器、歷程與多方判斷的複合測量」,而貫穿其中的評鑑準則,始終是本章所強調的效度與公平。
小結
本章把測量誤差有結構、因而可被建模與扣除的思想,帶到了由人評判表現的實作評量場景。當分數來自評分者而非受測者自陳時,評分者本身成為一個新的系統性誤差來源,本章即環繞如何測量、建模與校正這個來源而展開。開篇先辨明了一致性研究中最易混淆的區分,即絕對一致與相對信度是兩個不同的問題,須依分數的使用方式擇一回答。其後依序引入回答這些問題的工具:類別評分用的 kappa 及其對邊際分布敏感的悖論、連續評分用的組內相關家族及其三問的選用地圖、以及能同時處理評分者與任務多重誤差的概化理論,並在其中得出實作評量最重要的經典結論,即任務變異通常主導誤差,故增加題數多半比增加評分者更有效。 從係數走向模型,本章接著把評分者的寬嚴放進多面向 Rasch 模型,示範如何估計每位評分者的嚴苛度、計算不受運氣分派影響的公平分數,並以適配統計量偵測異常評分。這條把系統性偏差明確參數化的路線,配合事前的訓練校準與事中的持續監控,構成了管理人類評分者的完整循環。最後,本章追溯了自動計分從 Page 的先聲到大型語言模型的發展,並強調無論評分者是人是機,評鑑的根本準則都不是狹義的人機一致,而是構念代表性、可操弄性與次群體公平所構成的完整效度論證。接下來的第二十七章,將把公平的問題從評分現場推向更廣的制度與社會脈絡,探討測驗的預測偏誤、甄選效用,以及演算法時代測驗使用所引發的法理與倫理爭議。