測驗編製方法學:從構念到題庫
前面四部所建立的,是測量的理論與模型:構念如何界定、信度與效度如何論證、潛在變項如何以因素分析或項目反應理論刻畫。然而理論再精緻,最終都須落實為一份真實的測驗,即一組具體的題目、一套計分規則、一條解讀分數的依據。本部要處理的,正是這一步「心理計量與真實世界相遇」的落地過程,也就是測驗的完整生命週期:編製、量尺化與等化、適性施測、作答行為、評分、以及公平與使用。本章是這趟旅程的起點,處理最前端的一環,即測驗如何從一個抽象的構念,一步步被編製為一個可用、可信、可審計的評量工具。
本章的核心立場,可先以一句話點明:測驗發展是一套可審計的工程流程,而非一次仰賴命題者靈感的即興創作。一份好的測驗,其品質不是在題目寫完之後才「檢測」出來的,而是透過一套有紀律的流程,從構念界定開始就被「設計」進去的。為使這個抽象的主張具體可感,全章以一個貫穿的實例來推進:設想一份充滿撰寫缺陷、命題隨性的國中數學段考卷,本章將示範如何把它逐步改造為一份符合測驗藍圖、經預試校準、有標準設定與技術文件支撐的正式評量。這趟「段考卷的重生」,正是測驗編製方法學的縮影。
測驗發展是一套流程,而非一次靈感
許多測驗的編製,始於一位命題者對著空白文件即興發想題目,寫完便直接施測。這種「靈感式」命題的問題,不在於命題者能力不足,而在於它缺乏一套可以檢驗、可以複製、可以問責的流程。當被問及「這份測驗為什麼這樣考、憑什麼說它測到了該測的東西」時,靈感式命題往往無言以對。
專業的測驗發展則反其道而行,把編製視為一條由若干可審計環節串成的流水線:先界定構念與用途、再訂出測驗規格與藍圖、據以撰寫或生成試題、經預試蒐集實證、以試題分析汰選校準、建置題庫、組卷、設定切截分數、建立常模、最後以技術文件把整個歷程記錄下來。這條流水線的每一環都留下證據,使得「這份測驗是否可信」不再是一個信念問題,而是一個可以逐環查核的問題。這一整套流程化的思維,其歷史可上溯至 Binet 的實用主義測驗傳統,並在大型測驗機構的品管制度化中臻於成熟;本章其後各節,便是這條流水線的逐環展開。
構念界定與測驗藍圖
一切測驗發展的起點,是回到第三章的問題:這份測驗到底要測什麼?構念界定看似老生常談,卻是最常被草率帶過、也最致命的一環。就段考卷的例子而言,「國中數學」這個標籤過於籠統,必須進一步界定:它涵蓋哪些內容主題(數與量、代數、幾何、統計),又要測哪些認知歷程(記憶、程序執行、概念理解、解題)。構念界定得不清楚,後面的一切都失去了準繩。
把構念界定轉化為可操作的命題指南,靠的是測驗藍圖(test blueprint),其經典形式是雙向細目表(two-way specification table),一軸為內容主題、另一軸為認知歷程,格中數字則規定各交會處應占的題數或分數比重,如表 22.1。
| 內容主題 | 記憶 | 程序執行 | 概念理解 | 小計 |
|---|---|---|---|---|
| 數與量 | 1 | 3 | 2 | 6 |
| 代數 | 1 | 4 | 3 | 8 |
| 幾何 | 1 | 2 | 3 | 6 |
| 統計 | 0 | 2 | 3 | 5 |
| 小計 | 3 | 11 | 11 | 25 |
註. 格中數字為該內容與認知歷程交會處的預定題數。雙向細目表把構念界定落實為可稽核的命題配額,是內容效度的具體保障。
測驗藍圖的意義,遠不止於「湊足題數」。它是內容效度的具體保障:一份聲稱測「國中數學」的考卷,若九成題目都是代數的程序計算,那麼無論它的信度多高,其分數也無法支撐「數學能力」這個較廣的推論。段考卷的第一步改造,就是攤開它的實際題目分布,對照藍圖,找出被過度偏重與被完全遺漏的格子,重新配置。藍圖也把命題由個人品味的展現,轉為對一份公開規格的實現,這正是可審計性的第一步。值得一提的是,對第二十一章所述的診斷測驗而言,這張測驗藍圖進一步具體化為規定「每道題需要哪些屬性」的 Q 矩陣,是同一套「先訂規格、再據以命題」的邏輯在診斷情境的延伸。
證據中心設計:把效度做進流程
雙向細目表雖然實用,卻主要著眼於「內容涵蓋」,對「一道題如何構成關於構念的證據」著墨較少。證據中心設計(evidence-centered design, ECD;(Mislevy et al., 2003))提供了一套更根本的框架,把效度的邏輯直接編織進設計流程。
ECD 主張,任何評量的設計,都應明確回答三個相互扣連的問題,對應三個模型:
學生模型(student model):我們想推論受測者的哪些構念或能力?這界定了推論的目標。
證據模型(evidence model):什麼樣的作答表現,能作為該構念的證據?又該如何由作答評分、並更新對構念的信念?這是連結表現與構念的樞紐。
任務模型(task model):什麼樣的任務或試題,能引出上述的證據?這規範了題目該長什麼樣。
三者形成一條「構念 → 證據 → 任務」的推論鏈,使每一道題的存在都有明確的效度理由。
ECD 的深刻之處,在於它把效度論證(第七章)由測驗編成之後的事後檢驗,前移為設計之初的指導原則。傳統流程常是先憑直覺寫題、再回頭論證效度;ECD 則要求先講清楚「要推論什麼、什麼算證據、什麼任務能引出證據」,再據此設計題目。這條「構念 → 證據 → 任務」的推論鏈,與第七章 Kane 的論證取向前後呼應:兩者都主張,測量的正當性須在設計層次就被明白地建構,而非事後補述。對段考卷而言,採用 ECD 的視角,意味著為每一道題追問「它究竟要作為哪一項數學能力的證據」,凡答不上來的題目,其存在的正當性便可疑。
試題撰寫:手藝的實證化
試題撰寫長期被視為一門仰賴經驗的手藝,但過去數十年的研究已把它相當程度地實證化。Haladyna & Rodriguez (2013) 系統整理了一整套以證據為基礎的試題撰寫指引,指出許多常見的撰寫缺陷不僅是文字瑕疵,更會帶來可量化的心理計量後果,即實質損害試題品質所支撐的信度與效度(第六、七章)。
這些缺陷值得具體點名。題幹敘述冗長、含混或使用雙重否定,會使題目在無意間測到了閱讀能力而非目標構念,引入與構念無關的變異。選項之間長度或文法不一致、正確選項總是特別長,會提供作答線索,讓不會的人也能猜對,虛增了答對率並降低鑑別度。使用「以上皆是」「以上皆非」這類選項,在測量上往往弊多於利。而如「絕對」「總是」這類決斷詞出現在錯誤選項、「可能」「通常」出現在正確選項,也都是精明作答者熟知的破綻。就段考卷的改造而言,逐題檢視這些缺陷並加以修正,往往不必更動所測的內容,卻能顯著提升題目的心理計量品質。這正說明了:試題撰寫的良窳,並非玄妙的天分,而是一組可學習、可檢核的原則。
選擇題設計的實證知識
選擇題設計中一個看似瑣碎、實則影響深遠的問題,是「一道題該有幾個選項」。長久以來的慣例是四或五個選項,其潛在假設是選項愈多、猜對的機率愈低、題目愈可靠。這個直覺卻未必成立。
Rodriguez (2005) 以一項涵蓋八十年研究的後設分析,為這個問題提供了明確的答案:三個選項通常就是最適的。其論證是,多出來的第四、第五個選項,往往是命題者勉強湊出、極少人選擇的「無效誘答項」,它們既不能有效鑑別,還徒然增加了命題與作答的成本;把寫兩個劣質誘答項的力氣,省下來多寫幾道三選項的好題,對整份測驗的訊息量更有助益。這個結論之所以重要,不僅在於它挑戰了根深柢固的慣例,更在於它示範了測驗編製中一種可貴的態度:連「幾個選項」這樣的細節,都應交由實證證據而非慣性來決定。對段考卷而言,把冗餘的第四、第五選項檢視一遍,刪去那些幾乎無人選擇的誘答項,往往是一項低成本而有實效的改進。
自動試題生成與 LLM:品管而非魔法
當題庫需要大量題目時,逐題手工命題的成本變得難以承受,自動試題生成(automatic item generation, AIG)於是應運而生。傳統的 AIG 採模板取向:先由專家設計一個「試題模型」,即一個帶有若干可替換元素的題目骨架,再以演算法填入不同的數值或情境,批量生成大量同源題目;更進階的認知模型取向,則試圖讓生成的難度可由設計參數預測 (Gierl & Haladyna, 2013)。
近年大型語言模型的興起,把 AIG 推向了一個新的、也更需警惕的階段。以 LLM 生成試題,看似能瞬間產出無數題目,卻絕不能被當成免除品管的魔法。至少有三個心理計量問題必須正視,其現況也應誠實分級。其一是等值性與品質:LLM 生成的題目在難度、鑑別度上是否穩定、是否真的測到目標構念,仍須經預試校準來確認,這一點屬於已相當確立的要求。其二是偏誤:模型可能複製訓練資料中的刻板印象或對特定群體不利的表述,故生成題目仍須經第二十七章所述的公平性審查,這是進行中、尚無完整解方的議題。其三是資料汙染:若測驗題目或其近似變體已存在於模型的訓練資料中,則以該模型作答或生成,都可能使測驗失去效度,這在以 LLM 能力評估為目的時尤其棘手,目前仍屬爭議與推測交織的前沿。總結而言,LLM 為題目「生成」帶來了規模,卻沒有豁免「品管」的責任;生成得快,不等於生成得好,一道題是否堪用,終究要回到預試與試題分析的檢驗。
預試與試題分析
無論題目是手寫還是生成,在正式使用之前,都應經過預試(pilot testing / field testing),即先在一個代表性樣本上施測,蒐集實際的作答資料,據以評估每道題的表現。這一步把題目由「設計者以為好」推進到「資料證明好」。評估的工具,是試題分析(item analysis),其古典指標如下面的方塊所示。
難度(difficulty):以答對率 p_i 表示,即答對第 i 題的人數比例。p 值愈高題目愈易。就鑑別與訊息而言,中等難度(p 約 .3 至 .7)的題目通常最有價值,但一份測驗仍須依其目的涵蓋不同難度。
鑑別度(discrimination):衡量「答對此題」與「整體能力高低」的關聯。常用點二系列相關(point-biserial correlation)r_{pb},即該題(答對為 1、答錯為 0)與總分的相關;亦有以高分組與低分組答對率之差 D 表示者。鑑別度愈高,題目愈能區分能力強弱;接近零或為負的鑑別度,是題目有瑕疵(如答案有誤、選項誤導)的警訊。
古典試題分析簡便直觀,卻有一個先天限制:其指標依賴於受測樣本,樣本能力高則題目顯得容易,難度與鑑別度都會隨樣本浮動。這正是第十七章項目反應理論的用武之地:IRT 校準把題目參數放到一個不依賴特定樣本的量尺上,使不同批次預試的題目得以在同一把尺上累積,這對長期維護的題庫至關重要。古典指標與 IRT 校準因此是互補的:前者快速、直觀,適合初步篩檢;後者嚴謹、可跨樣本連結,適合正式的題庫建置。就段考卷而言,即使無法對每道題做完整的 IRT 校準,至少應以古典試題分析檢視答對率與鑑別度,剔除鑑別度為負或過低的問題題目。
題庫:建置、維護與安全
當題目經校準而可信,便可納入題庫(item bank),即一個儲存了大量題目及其校準參數、內容標籤、使用紀錄的資料庫。題庫的價值,在於它把「題目」由一次性的消耗品,轉為可長期累積、反覆調用的資產:組一份新卷,不再需要從零命題,而是依規格自題庫中挑選。
題庫的維護與安全,是持續而非一次性的工作。維護方面,題目會隨課綱變動、社會脈絡改變而過時,須定期檢視、汰換,並持續補入新題以擴充涵蓋。安全方面,最大的威脅是試題暴露(item exposure):一道題若被過度使用、或遭洩題,其答案便可能在考生間流傳,使它不再測到能力而只測到「是否看過這題」。控制試題暴露,一方面靠擴大題庫規模、輪換使用,另一方面在適性測驗中則有專門的曝光控制演算法(第二十四章)。近年還多了一重新的威脅,即前述的資料汙染:當題庫題目流入了大型語言模型的訓練資料,其效度同樣受損。題庫因此不是一個建好就一勞永逸的靜態倉庫,而是一個需要持續照料的活的資產。
組卷:從人工到最佳化
有了題庫,下一步是組卷(test assembly),即從題庫中挑出一組題目,構成一份符合規格的試卷。人工組卷仰賴命題者的經驗逐題挑選,既費時,也難以同時滿足眾多相互牽制的約束,例如既要符合藍圖的內容配額、又要達到目標的難度分布與測驗訊息、還要控制題長與作答時間。
自動化組卷把這個問題形式化為一個最佳化問題,如下面的方塊所示。
自動化測驗組卷(automated test assembly, ATA)為每道題設一個 0–1 的決策變項 x_i,x_i=1 表示選入、0 表示不選。組卷即在一組線性約束下,求一個目標函數的最佳解。一個典型的設定,是在滿足所有約束的前提下,使測驗在某個關鍵能力點 \theta_0 的訊息最大:
其中 I_i(\theta_0) 為第 i 題在 \theta_0 的訊息、n_c 為內容類別 c 的配額、t_i 為作答時間、T 為時限上限。這是一個 0–1 整數規劃問題,可以線性規劃的標準演算法求解,讓電腦在數以千計的題目中,自動找出同時滿足所有約束的最佳試卷。
把組卷形式化為最佳化,帶來的不只是效率,更是可稽核性:所有的規格要求都被明白地寫成約束,組出的卷子必然滿足它們,而非仰賴人工挑選的良心。這套線性規劃的思路,在固定卷之外,更是電腦化適性測驗即時選題的基礎,其中「影子測驗」等技術把整卷的約束帶進逐題選擇,這將於第二十四章展開。就段考卷而言,即便規模不足以動用完整的最佳化組卷,把「這份卷要滿足哪些明確約束」寫下來,本身就是一種紀律的提升。
標準設定:分數線的效度論證
許多測驗的用途,是做出通過與否、及格與否、精熟與否的分類決定。這就需要一條切截分數(cut score)。切截分數從何而來?它不是一個等待被發現的客觀真值,而是一個須經正當程序建立、並須提出效度論證的判斷。設定切截分數的方法學,即標準設定(standard setting;(Cizek & Bunch, 2007))。
標準設定方法眾多,其思路可分兩類。以試題為中心的方法,如 Angoff 法,請一組專家評判「一個剛好達到及格標準的臨界考生,答對每一道題的機率是多少」,再把這些機率加總,即得該專家心中的切截分數,最後彙整各專家的判斷。以受測者為中心的方法,如對照組法,則直接找出已知精熟與未精熟的兩群人,觀察其分數分布的交會處作為切截點。書籤法則把題目依難度排序,請專家在「臨界考生恰好不再有把握答對」之處放下書籤。這些方法各有假設與偏誤,但共同的精神是:切截分數必須來自一套有紀律、可記錄、可辯護的程序,而非由主事者一句「六十分及格」隨意訂定。須強調的是,Angoff 這類方法所彙整的專家判斷,本身帶有可觀的變異,故標準設定的過程也須報告專家間的一致性,並把切截分數所隱含的分類錯誤如實呈現。一條切截分數的正當性,最終同樣是一個效度論證的問題。
常模與分數解讀
測驗分數本身往往不具意義,一個學生數學考了四十分,究竟是好是壞,取決於與什麼相比。常模參照的解讀,把個人分數放到一個常模樣本(norm group)的分布中,以百分等級、標準分數等形式表達其相對位置。建立常模的關鍵,在於常模樣本必須能代表所欲比較的母體,一個以都會明星學校為常模的測驗,用來解讀偏鄉學生的分數便會失真;因此常模樣本的設計,本質上是第九章抽樣代表性問題的具體應用。
常模參照之外,還有標準參照的解讀,即以分數對照一套事先界定的能力描述(如「精熟」「基礎」「待加強」),回答「這個人會了什麼」而非「贏過多少人」,這正與上一節的標準設定相銜接。近年大型測驗也發展出連續常模等技術,以模型平滑地估計各分數點的常模資訊,取代逐級查表。無論採哪一種解讀框架,其共同要求是:分數的意義必須被明白地界定,而非任由使用者望文生義。就段考卷而言,若只回報一個原始分數而不交代其解讀依據,這份分數的意義便懸而未決。
技術文件:測驗的履歷
測驗編製流程的最後一環,是把前面所有的環節記錄下來,形成技術文件(technical documentation / technical manual)。它是測驗的履歷,交代了構念界定、測驗藍圖、試題來源與分析、信度與效度證據、標準設定的程序、常模樣本的組成等一切關鍵資訊。
技術文件的重要性,正呼應了本章開篇的核心立場:測驗發展是一套可審計的流程。沒有技術文件的測驗,即使題目本身尚可,也無從被外部檢驗其品質,使用者只能被動地信任。當代《教育與心理測驗標準》(AERA, APA, and NCME, 2014) 明確要求(其效度架構詳見第七章),任何具重要用途的測驗,都應提供充分的技術文件,使其分數詮釋與使用的正當性得以被獨立審查。就段考卷這樣的校內評量而言,固然不必如大型測驗般製作完整手冊,但至少應留下藍圖、試題分析結果與切截分數的依據,使這份考卷的品質有據可查。技術文件把測驗由一個黑箱,轉為一個可問責的公共製品,這正是專業測驗發展與隨性命題的分野所在。
小結
本章把測驗編製呈現為一套可審計的工程流程,而非一次仰賴靈感的即興。這條流程由若干環節串成:以構念界定與測驗藍圖確立要測什麼,以證據中心設計把效度做進設計,以實證化的試題撰寫指引與選項數研究提升題目品質,以預試與試題分析、乃至 IRT 校準把品質由「設計者以為」變為「資料證明」,再以題庫、組卷、標準設定、常模與技術文件,把題目經營為可長期使用、可解讀、可問責的評量系統。貫穿其間的段考卷實例顯示,即使是一份校內考卷,套用這套流程的思維,也能被顯著地改善。
本章也開啟了第五部的旅程,即把測量理論帶出實驗室、落實為測驗的生命週期。編製只是這趟旅程的起點。一份題庫要能在不同年度、不同版本之間維持分數的可比較性,須靠量尺化與等化(第二十三章);要能依受測者的能力即時選題、大幅提升效率,須靠電腦化適性測驗(第二十四章);而本章屢次點到、卻留待專章處理的公平性審查與無障礙設計,則是第二十七章的主題。測量與真實世界的相遇,才剛剛開始。