測驗編製方法學:從構念到題庫
前面四部所建立的,是測量的理論與模型:構念如何界定、信度與效度如何論證、潛在變項如何以因素分析或項目反應理論刻畫。然而理論再精緻,最終都須落實為一份真實的測驗,即一組具體的題目、一套計分規則、一條解讀分數的依據。本部要處理的,正是這一步「心理計量與真實世界相遇」的落地過程,也就是測驗的完整生命週期:編製、量尺化與等化、適性施測、作答行為、評分、以及公平與使用。本章是這趟旅程的起點,處理最前端的一環,即測驗如何從一個抽象的構念,一步步被編製為一個可用、可信、可審計的評量工具。
本章的核心立場,可先以一句話點明:測驗發展是一套可審計的工程流程,而非一次仰賴命題者靈感的即興創作。一份好的測驗,其品質不是在題目寫完之後才「檢測」出來的,而是透過一套有紀律的流程,從構念界定開始就被「設計」進去的。為使這個抽象的主張具體可感,全章以一個貫穿的實例來推進:設想一份充滿撰寫缺陷、命題隨性的國中數學段考卷,本章將示範如何把它逐步改造為一份符合測驗藍圖、經預試校準、有標準設定與技術文件支撐的正式評量。這趟「段考卷的重生」,正是測驗編製方法學的縮影。
測驗發展是一套流程,而非一次靈感
許多測驗的編製,始於一位命題者對著空白文件即興發想題目,寫滿一頁便直接施測。這種「靈感式」命題的問題,不在於命題者能力不足,而在於它缺乏一套可以檢驗、可以複製、可以問責的流程。經驗豐富的教師確實可能憑直覺寫出好題,但這份好只存在於他個人的判斷裡:換一個人命題、換一個學期施測,品質便無從保證。更關鍵的是,當被問及「這份測驗為什麼這樣考、憑什麼說它測到了該測的東西、憑什麼用這個分數做決定」時,靈感式命題往往無言以對。
專業的測驗發展則反其道而行,把編製視為一條由若干可審計環節串成的流水線:先界定構念與用途、再訂出測驗規格與藍圖、據以撰寫或生成試題、經預試蒐集實證、以試題分析汰選校準、建置題庫、組卷、設定切截分數、建立常模、最後以技術文件把整個歷程記錄下來。這條流水線的每一環都留下證據,使得「這份測驗是否可信」不再是一個信念問題,而是一個可以逐環查核的問題。這一整套流程化的思維,其歷史可上溯至 Binet 的實用主義測驗傳統,並在大型測驗機構的品管制度化中臻於成熟;本章其後各節,便是這條流水線的逐環展開。
構念界定與測驗藍圖
一切測驗發展的起點,是回到第三章的問題:這份測驗到底要測什麼?構念界定看似老生常談,卻是最常被草率帶過、也最致命的一環。就段考卷的例子而言,「國中數學」這個標籤過於籠統,必須進一步界定:它涵蓋哪些內容主題(數與量、代數、幾何、統計),又要測哪些認知歷程(記憶、程序執行、概念理解、解題)。構念界定得不清楚,後面的一切都失去了準繩。
構念界定的實作要領,是同時寫下「包含什麼」與「排除什麼」。本章在段考卷之外,再引入一個貫穿其後各節的例子:設想某大學要編製一份校內英文能力分級測驗,用以把大一新生分入初級、中級、進階三種必修班。它要測的是一般學術情境下的英文理解能力,包含字彙辨識、句子結構與短文閱讀理解;而口語流利度、專業領域術語與寫作組織能力,則明白列為不在此測驗的範圍內。這份排除清單看似消極,實則極為有用:它既阻止命題者把個人偏好的內容偷渡進來,也預先劃定了分數詮釋的界線,使日後無人能拿這份分數去主張某位學生「英文寫作能力不足」。構念界定寫到這個地步,才算真正可操作。
把構念界定轉化為可操作的命題指南,靠的是測驗藍圖(test blueprint),其經典形式是雙向細目表(two-way specification table),一軸為內容主題、另一軸為認知歷程,格中數字則規定各交會處應占的題數或分數比重,如表 22.1。藍圖之外,一份完整的測驗規格(test specifications)還須寫明測驗的用途、目標母體、題型與題數、作答時限、計分方式與預期的難度分布。以前述分級測驗為例,規格可能寫成:四十題選擇題、作答六十分鐘、字彙十六題、句構十題、閱讀十四題、預期全卷平均答對率約 0.55,並要求在兩條切截分數附近提供最高的測量精確度。規格細到這個顆粒度,命題者才知道自己要交付什麼,審題者也才有對照的依據。
| 內容主題 | 記憶 | 程序執行 | 概念理解 | 小計 |
|---|---|---|---|---|
| 數與量 | 1 | 3 | 2 | 6 |
| 代數 | 1 | 4 | 3 | 8 |
| 幾何 | 1 | 2 | 3 | 6 |
| 統計 | 0 | 2 | 3 | 5 |
| 小計 | 3 | 11 | 11 | 25 |
註. 格中數字為該內容與認知歷程交會處的預定題數。雙向細目表把構念界定落實為可稽核的命題配額,是內容效度的具體保障。
測驗藍圖的意義,遠不止於「湊足題數」。它是內容效度的具體保障:一份聲稱測「國中數學」的考卷,若九成題目都是代數的程序計算,那麼無論它的信度多高,其分數也無法支撐「數學能力」這個較廣的推論。段考卷的第一步改造,就是攤開它的實際題目分布,對照藍圖,找出被過度偏重與被完全遺漏的格子,重新配置。藍圖也把命題由個人品味的展現,轉為對一份公開規格的實現,這正是可審計性的第一步。值得一提的是,對第二十一章所述的診斷測驗而言,這張測驗藍圖進一步具體化為規定「每道題需要哪些屬性」的 Q 矩陣,是同一套「先訂規格、再據以命題」的邏輯在診斷情境的延伸。
證據中心設計:把效度做進流程
雙向細目表雖然實用,卻主要著眼於「內容涵蓋」:它能保證各主題的題數合乎規畫,卻回答不了一個更根本的問題,即一道題答對或答錯,究竟如何構成關於構念的證據。兩份細目表相同的考卷,可能一份題題切中推理歷程,另一份題題只考背誦,因為細目表管得到格子裡該有幾題,管不到題目長什麼樣。證據中心設計(evidence-centered design, ECD;(Mislevy et al., 2003))正是為填補這個空缺而生。它要求設計者在動筆寫題之前,先把推論的目標、可算作證據的表現、以及能引出證據的任務三者交代清楚,藉此把效度的邏輯直接編織進設計流程,而不是等測驗編成之後再回頭辯護。
ECD 主張,任何評量的設計,都應明確回答三個相互扣連的問題,對應三個模型:
學生模型(student model):我們想推論受測者的哪些構念或能力?這界定了推論的目標。
證據模型(evidence model):什麼樣的作答表現,能作為該構念的證據?又該如何由作答評分、並更新對構念的信念?這是連結表現與構念的樞紐。
任務模型(task model):什麼樣的任務或試題,能引出上述的證據?這規範了題目該長什麼樣。
三者形成一條「構念 → 證據 → 任務」的推論鏈,使每一道題的存在都有明確的效度理由。
三個模型的分工,可以用前述的英文分級測驗說明。學生模型回答「要推論什麼」:此處是由字彙、句構、閱讀理解構成的學術英文理解能力,並約定以單一連續量尺表示,用以支撐分班決定。證據模型回答「什麼算證據、如何由表現更新對能力的信念」:選擇題答對計一分,而閱讀題組因共享同一篇文章、彼此並非條件獨立,計分時須以題組為單位處理。任務模型回答「什麼任務能引出證據」:閱讀短文須取自未曾在課本出現的材料,長度二百五十至三百字,提問聚焦於推論與主旨而非字面搜尋,以免受測者靠掃描關鍵字便能答對。三個模型一旦寫定,命題者收到的就不再是「請出十四道閱讀題」這樣的模糊指令。
ECD 的深刻之處,在於它把效度論證(第七章)由測驗編成之後的事後檢驗,前移為設計之初的指導原則。傳統流程常是先憑直覺寫題、再回頭論證效度,ECD 則把順序倒轉過來。這條「構念 → 證據 → 任務」的推論鏈,與第七章 Kane 的論證取向前後呼應:兩者都主張,測量的正當性須在設計層次就被明白地建構,而非事後補述。對段考卷而言,採用 ECD 的視角,意味著為每一道題追問「它究竟要作為哪一項數學能力的證據」,凡答不上來的題目,其存在的正當性便可疑。
試題撰寫:手藝的實證化
藍圖與 ECD 決定了要寫哪些題、每道題要作為什麼證據,接下來才輪到題目本身該怎麼寫。試題撰寫長期被視為一門仰賴經驗的手藝,彷彿只能靠資深教師口傳心授;但過去數十年的研究已把它相當程度地實證化,累積出一批經得起檢驗的撰寫原則。Haladyna & Rodriguez (2013) 系統整理了一整套以證據為基礎的試題撰寫指引,指出許多常見的撰寫缺陷不僅是文字瑕疵,更會帶來可量化的心理計量後果,即實質損害試題品質所支撐的信度與效度(第六、七章)。換句話說,一個沒寫好的題幹,最後會反映在偏掉的答對率、縮水的鑑別度與站不住腳的分數詮釋上。
這些缺陷值得具體點名。題幹敘述冗長、含混或使用雙重否定,會使題目在無意間測到了閱讀能力而非目標構念,引入與構念無關的變異。選項之間長度或文法不一致、正確選項總是特別長,會提供作答線索,讓不會的人也能猜對,虛增了答對率並降低鑑別度。使用「以上皆是」「以上皆非」這類選項,在測量上往往弊多於利。而如「絕對」「總是」這類決斷詞出現在錯誤選項、「可能」「通常」出現在正確選項,也都是精明作答者熟知的破綻。
把這些缺陷放進具體題目裡看會更清楚。設想分級測驗初稿中有一題,題幹寫著「下列關於本文的敘述,何者並非不正確」,雙重否定使受測者得先解開語意糾結才能開始作答,測到的其實是耐心;改寫為「下列敘述何者正確」,題意立刻回到閱讀理解本身。另一題的正確選項寫了二十八個英文字,三個誘答項各只有六至八字,長度本身就成了線索;把四個選項的長度拉齊之後,該題的答對率由 0.81 降到 0.62,反而更貼近其真實難度。這兩處修改都沒有更動所考的知識,卻讓題目所測的東西更為純粹。
就段考卷的改造而言,逐題檢視這些缺陷並加以修正,往往不必更動所測的內容,卻能顯著提升題目的心理計量品質。這正說明了:試題撰寫的良窳,並非玄妙的天分,而是一組可學習、可檢核的原則。
選擇題設計的實證知識
上一節談的是題目怎麼寫得乾淨,本節則要示範,連「一道題該有幾個選項」這種看似瑣碎的格式決定,也已經有實證答案可以依循。長久以來的慣例是四個或五個選項,其潛在假設相當直覺:選項愈多,亂猜答對的機率愈低,四選一是 0.25、五選一是 0.20,題目自然愈可靠。這個推理只對了一半。它假定每一個誘答項都真的在發揮誘答的作用,而這個假定往往落空。真正該問的問題因此不是「幾個選項最不容易猜對」,而是「在固定的作答時間內,怎樣配置選項能換得最多的測量訊息」。
Rodriguez (2005) 以一項涵蓋八十年研究的後設分析,為這個問題提供了明確的答案:三個選項通常就是最適的。其論證是,多出來的第四、第五個選項往往是命題者勉強湊出、極少人選擇的「無效誘答項」,既不能有效鑑別,又徒然增加命題與作答的成本;把寫兩個劣質誘答項的力氣,省下來多寫幾道三選項的好題,對整份測驗的訊息量更有助益。這個結論之所以重要,不僅在於它挑戰了根深柢固的慣例,更在於它示範了一種態度:連「幾個選項」這樣的細節,都應交由證據而非慣性來決定。對段考卷而言,把冗餘的第四、第五選項檢視一遍,刪去那些幾乎無人選擇的誘答項,往往是一項低成本而有實效的改進。
自動試題生成與 LLM:品管而非魔法
前兩節所談的撰寫原則,預設題目是人一題一題寫出來的。但當一份測驗要在同一年內多次施測,或要支撐適性測驗所需的大型題庫時,逐題手工命題的成本很快變得難以承受,因為一個像樣的題庫動輒需要上千道經過審題與預試的題目。自動試題生成(automatic item generation, AIG)於是應運而生。傳統的 AIG 採模板取向:先由專家設計一個「試題模型」,即一個帶有若干可替換元素的題目骨架,再以演算法填入不同的數值或情境,批量生成大量同源題目;更進階的認知模型取向,則試圖讓生成的難度可由設計參數預測 (Gierl & Haladyna, 2013)。
近年大型語言模型的興起,把 AIG 推向一個新的、也更需警惕的階段。以 LLM 生成試題看似能瞬間產出無數題目,卻絕不能被當成免除品管的魔法。至少有三個心理計量問題必須正視,其現況也應誠實分級。其一是等值性與品質:LLM 生成的題目在難度、鑑別度上是否穩定、是否真的測到目標構念,仍須經預試校準來確認,這一點屬於已相當確立的要求。其二是偏誤:模型可能複製訓練資料中的刻板印象或對特定群體不利的表述,故生成題目仍須經第二十七章所述的公平性審查,這是進行中、尚無完整解方的議題。其三是資料汙染:若測驗題目或其近似變體已存在於模型的訓練資料中,則以該模型作答或生成,都可能使測驗失去效度,這在以 LLM 能力評估為目的時尤其棘手,目前仍屬爭議與推測交織的前沿。總結而言,LLM 為題目「生成」帶來了規模,卻沒有豁免「品管」的責任;生成得快,不等於生成得好,一道題是否堪用,終究要回到預試與試題分析的檢驗。
預試與試題分析
無論題目是手寫還是生成,在正式使用之前,都應經過預試(pilot testing / field testing),即先在一個代表性樣本上施測,蒐集實際的作答資料,據以評估每道題的表現。這一步把題目由「設計者以為好」推進到「資料證明好」,也是整條流程中道理最明白、卻最常因時程壓力而被省略的一環。省略的代價往往要到正式施測後才浮現:一道答案登錄錯誤的題目,屆時已經影響了數百人的分數。評估的工具,是試題分析(item analysis),其古典指標如下面的方塊所示。
預試該收多少人,沒有放諸四海皆準的數字,但可由「要估什麼」推出量級。若只做古典試題分析,即估計每題的答對率與題總相關,一般建議至少一百至兩百人;答對率是一個比例,一百人的樣本使其標準誤約在 0.05 上下,足以分辨難題與中等難度題。若要做 IRT 校準,所需樣本隨模型複雜度上升:單參數模型數百人可能足夠,二參數模型一般建議五百人以上,三參數模型因多估一個猜測參數,常需上千人才穩定。比人數更要緊的是樣本的組成:它必須涵蓋正式施測時會遇到的能力範圍。若分級測驗的預試只找了英語相關科系的學生,估出的難度將全面偏低,把這組參數帶到全校施測必然失準。
難度(difficulty):以答對率 p_i 表示,即答對第 i 題的人數比例。p 值愈高題目愈易。就鑑別與訊息而言,中等難度(p 約 .3 至 .7)的題目通常最有價值,但一份測驗仍須依其目的涵蓋不同難度。
鑑別度(discrimination):衡量「答對此題」與「整體能力高低」的關聯。常用點二系列相關(point-biserial correlation)r_{pb},即該題(答對為 1、答錯為 0)與總分的相關;亦有以高分組與低分組答對率之差 D 表示者。鑑別度愈高,題目愈能區分能力強弱;接近零或為負的鑑別度,是題目有瑕疵(如答案有誤、選項誤導)的警訊。
這兩個指標怎麼讀,用具體數字最清楚。設想分級測驗以三百名大一新生預試,其中四題的結果如下。第 7 題 p=0.52、r_{pb}=0.45:約一半的人答對,且答對者以總分較高者居多,這是一道理想的題目,難度貼近受測群體的平均水準且鑑別力強。第 12 題 p=0.94、r_{pb}=0.08:九成四的人答對,題目太簡單,答對與否自然和整體能力沒什麼關聯,鑑別度趨近於零;這樣的題目未必不能用,但放在切截分數附近的貢獻極小。第 23 題 p=0.21、r_{pb}=0.31:只有兩成的人答對,是一道難題,但鑑別度仍可接受,答對者確實多為能力較強者,可留給高分段使用。
最需要警覺的是第 31 題:p=0.44、r_{pb}=-0.22。鑑別度為負,意思是總分愈高的人反而愈容易答錯這一題。這幾乎不可能是「此題專門考驗高手」,而是題目本身出了問題,常見的原因有三:標準答案登錄錯誤、題幹措辭誤導使程度好的人想得太多、或某個誘答項在技術上其實也說得通。這樣的題目不該降級使用,而應直接抽出重新檢視,因為它正把測驗的訊息往反方向拉。
誘答選項分析(distractor analysis)把診斷再推進一層,看的不只是有多少人答對,而是每個選項分別被誰選走。做法是把受測者依總分分為高、中、低三組,列出各組在每個選項上的選答比例,然後看三件事:每個誘答項是否都有人選,被選率低於 0.05 者形同虛設,應改寫或刪除;誘答項的吸引力是否隨能力遞減,健康的誘答項應是低分組選得比高分組多;以及是否有誘答項對高分組特別有吸引力。承前例,若第 31 題的高分組有 0.48 選了選項 C、僅 0.30 選了標準答案 B,這強烈暗示 C 在某種合理的解讀下也成立,或 B 的敘述有瑕疵。誘答選項分析因此不只是汰題的工具,也常是發現學生共同迷思概念的窗口。
古典試題分析簡便直觀,卻有一個先天限制:其指標依賴於受測樣本,樣本能力高則題目顯得容易,難度與鑑別度都會隨樣本浮動。這正是第十七章項目反應理論的用武之地:IRT 校準把題目參數放到一個不依賴特定樣本的量尺上,使不同批次預試的題目得以在同一把尺上累積,這對長期維護的題庫至關重要。古典指標與 IRT 校準因此是互補的:前者快速、直觀,適合初步篩檢;後者嚴謹、可跨樣本連結,適合正式的題庫建置。就段考卷而言,即使無法對每道題做完整的 IRT 校準,至少應以古典試題分析檢視答對率與鑑別度,剔除鑑別度為負或過低的問題題目。
題庫:建置、維護與安全
題目經預試與校準而確認可信之後,下一個問題是把它們放到哪裡。答案是題庫(item bank),即一個儲存了大量題目及其校準參數、內容標籤、認知歷程標籤、版本與使用紀錄的資料庫。題庫的價值,在於它把「題目」由一次性的消耗品,轉為可長期累積、反覆調用的資產:組一份新卷,不再需要從零命題,而是依規格自題庫中挑選。但題庫要發揮這個功能,有一個前提常被忽略:庫中所有題目的參數必須落在同一把尺上,否則「這題比那題難」只是兩批不同受測者留下的印象,而非可以相互比較的事實。
要把不同批次預試的題目放到同一把尺上,靠的是共同題設計(common-item design),即所謂錨定題(anchor items)設計。設想分級測驗第一年預試了四十題,第二年要擴充三十道新題,則第二年的預試卷刻意放入第一年的十二道舊題與三十道新題。這十二道錨定題的參數已知,如同兩張地圖上的共同地標,可用來估計兩批樣本能力分布的落差,再把新題的參數轉換到既有的量尺上。錨定題的選取有其講究:數量通常建議占全卷兩成以上,難度須橫跨整個量尺,內容組成宜像一份縮小版的正式測驗。其技術細節屬於量尺化與等化的範疇(第二十三章),此處要建立的觀念是:題庫的可累積性不是儲存問題,而是設計問題。
題庫的維護與安全,是持續而非一次性的工作。維護方面,題目會隨課綱變動、社會脈絡改變而過時,須定期檢視、汰換,並持續補入新題以擴充涵蓋。安全方面,最大的威脅是試題暴露(item exposure):一道題若被過度使用、或遭洩題,其答案便可能在考生間流傳,使它不再測到能力而只測到「是否看過這題」。控制試題暴露,一方面靠擴大題庫規模、輪換使用,另一方面在適性測驗中則有專門的曝光控制演算法(第二十四章)。近年還多了一重新的威脅,即前述的資料汙染:當題庫題目流入了大型語言模型的訓練資料,其效度同樣受損。題庫因此不是一個建好就一勞永逸的靜態倉庫,而是一個需要持續照料的活的資產。
組卷:從人工到最佳化
有了題庫,下一步是組卷(test assembly),即從題庫中挑出一組題目,構成一份符合規格的試卷。人工組卷仰賴命題者的經驗逐題挑選,既費時,也難以同時滿足眾多彼此牽制的約束:既要符合藍圖的內容配額、又要達到目標的難度分布與測驗訊息、還要控制題長與作答時間。為了補足統計主題的配額而換進一道題,可能就破壞了原本調好的難度分布。題庫有三千題、約束有二十條時,靠人腦逐一試錯不僅沒有效率,也說不清「為什麼是這一份卷而不是另一份」。
自動化組卷把這個問題形式化為一個最佳化問題,如下面的方塊所示。
自動化測驗組卷(automated test assembly, ATA)為每道題設一個 0–1 的決策變項 x_i,x_i=1 表示選入、0 表示不選。組卷即在一組線性約束下,求一個目標函數的最佳解。一個典型的設定,是在滿足所有約束的前提下,使測驗在某個關鍵能力點 \theta_0 的訊息最大:
其中 I_i(\theta_0) 為第 i 題在 \theta_0 的訊息、n_c 為內容類別 c 的配額、t_i 為作答時間、T 為時限上限。這是一個 0–1 整數規劃問題,可以線性規劃的標準演算法求解,讓電腦在數以千計的題目中,自動找出同時滿足所有約束的最佳試卷。
把組卷形式化為最佳化,帶來的不只是效率,更是可稽核性:所有的規格要求都被明白地寫成約束,組出的卷子必然滿足它們,而非仰賴人工挑選的良心。這套線性規劃的思路,在固定卷之外,更是電腦化適性測驗即時選題的基礎,其中「影子測驗」等技術把整卷的約束帶進逐題選擇,這將於第二十四章展開。就段考卷而言,即便規模不足以動用完整的最佳化組卷,把「這份卷要滿足哪些明確約束」寫下來,本身就是一種紀律的提升。
標準設定:分數線的效度論證
前面幾節處理的是如何得到一份好的試卷與一個可信的分數,但許多測驗的用途並不停在分數,而是要據以做出分類決定:通過與否、及格與否、精熟與否,或如本章的英文分級測驗,要把新生分入三種班級。這就需要一條切截分數(cut score)。切截分數從何而來?它不是能力連續體上一道天然存在、等著被發現的界線,而是價值判斷與實證資料交會的產物,回答的是「達到什麼程度才算足夠」這個政策問題,因而是一個須經正當程序建立、並須提出效度論證的判斷。設定切截分數的方法學,即標準設定(standard setting;(Cizek & Bunch, 2007))。
標準設定方法眾多,其思路可分兩類。以試題為中心的方法,如 Angoff 法,請一組專家評判「一個剛好達到及格標準的臨界考生,答對每一道題的機率是多少」,再把這些機率加總,即得該專家心中的切截分數,最後彙整各專家的判斷。以受測者為中心的方法,如對照組法,則直接找出已知精熟與未精熟的兩群人,觀察其分數分布的交會處作為切截點。書籤法則把題目依難度排序,請專家在「臨界考生恰好不再有把握答對」之處放下書籤。這些方法各有假設與偏誤,但共同的精神是:切截分數必須來自一套有紀律、可記錄、可辯護的程序,而非由主事者一句「六十分及格」隨意訂定。Angoff 這類方法所彙整的專家判斷,本身帶有可觀的變異。設想十位專家對同一份分級測驗給出的切截分數落在 21 至 27 分之間,這個離散本身就是應報告的資訊:它提醒使用者,把切截分數當成精確到小數點的門檻並不誠實。標準設定的過程因此也須報告專家間的一致性,並把切截分數所隱含的分類錯誤如實呈現。一條切截分數的正當性,最終同樣是一個效度論證的問題。
常模與分數解讀
測驗分數本身往往不具意義,一個學生數學考了四十分,究竟是好是壞,取決於與什麼相比。常模參照的解讀,把個人分數放到一個常模樣本(norm group)的分布中,以百分等級、標準分數等形式表達其相對位置。建立常模的關鍵,在於常模樣本必須能代表所欲比較的母體,一個以都會明星學校為常模的測驗,用來解讀偏鄉學生的分數便會失真;因此常模樣本的設計,本質上是第九章抽樣代表性問題的具體應用。
常模參照之外,還有標準參照的解讀,即以分數對照一套事先界定的能力描述(如「精熟」「基礎」「待加強」),回答「這個人會了什麼」而非「贏過多少人」,這正與上一節的標準設定相銜接。近年大型測驗也發展出連續常模等技術,以模型平滑地估計各分數點的常模資訊,取代逐級查表。無論採哪一種解讀框架,其共同要求是:分數的意義必須被明白地界定,而非任由使用者望文生義。就段考卷而言,若只回報一個原始分數而不交代其解讀依據,這份分數的意義便懸而未決。
技術文件:測驗的履歷
走到這裡,一份測驗已經有了構念界定、藍圖、經預試校準的題目、題庫、組卷規則、切截分數與常模。但這些工作若只留在承辦人員的硬碟與記憶裡,一旦人員更迭便隨之蒸發,日後也無人能重建當初的判斷是怎麼做成的。測驗編製流程的最後一環,因此是把前面所有的環節記錄下來,形成技術文件(technical documentation / technical manual)。它是測驗的履歷,交代了構念界定、測驗藍圖、試題來源與分析、信度與效度證據、標準設定的程序、常模樣本的組成等一切關鍵資訊。
技術文件的重要性,正呼應了本章開篇的核心立場:測驗發展是一套可審計的流程。沒有技術文件的測驗,即使題目本身尚可,也無從被外部檢驗其品質,使用者只能被動地信任。當代《教育與心理測驗標準》(AERA, APA, and NCME, 2014) 明確要求(其效度架構詳見第七章),任何具重要用途的測驗,都應提供充分的技術文件,使其分數詮釋與使用的正當性得以被獨立審查。就段考卷這樣的校內評量而言,固然不必如大型測驗般製作完整手冊,但至少應留下藍圖、試題分析結果與切截分數的依據,使這份考卷的品質有據可查。技術文件把測驗由一個黑箱,轉為一個可問責的公共製品,這正是專業測驗發展與隨性命題的分野所在。
小結
本章把測驗編製呈現為一套可審計的工程流程,而非一次仰賴靈感的即興。這條流程由若干環節串成:以構念界定與測驗藍圖確立要測什麼,以證據中心設計把效度做進設計,以實證化的試題撰寫指引與選項數研究提升題目品質,以預試與試題分析、乃至 IRT 校準把品質由「設計者以為」變為「資料證明」,再以題庫、組卷、標準設定、常模與技術文件,把題目經營為可長期使用、可解讀、可問責的評量系統。貫穿其間的段考卷與英文分級測驗兩個實例顯示,無論是一份校內考卷,還是一項用來分班的能力測驗,套用這套流程的思維都能顯著改善其品質。
本章也開啟了第五部的旅程,即把測量理論帶出實驗室、落實為測驗的生命週期。編製只是這趟旅程的起點。一份題庫要能在不同年度、不同版本之間維持分數的可比較性,須靠量尺化與等化(第二十三章);要能依受測者的能力即時選題、大幅提升效率,須靠電腦化適性測驗(第二十四章);而本章屢次點到、卻留待專章處理的公平性審查與無障礙設計,則是第二十七章的主題。測量與真實世界的相遇,才剛剛開始。