效度:概念演進與論證取向
上一章結尾留下一句話:信度管的是「測得穩不穩」,效度管的是「測得對不對」。本章便來處理「對不對」這個更為棘手的問題。一個生活化的畫面或許有助於進入狀況:家中浴室的體重計,每次站上去都穩穩顯示比實際重五公斤。它非常可靠,每次都給出一模一樣的數字;卻也完全無效,因為它根本沒有告訴使用者真正的體重。信度高而效度低,這樣的情形在心理測量中天天上演。
不過,效度真正棘手的地方,還不只在於「難以達成」,更在於「它究竟是什麼」這個問題,過去七十餘年來被反覆重新界定。它起初被當成「測驗的一種性質」,漸漸轉為「分數詮釋的性質」,再轉為「一套需要持續辯護的論證」,最後還被人自實在論的立場反問:效度會不會其實是一個相當單純的因果問題,只是被學界講複雜了?本章便順著這條概念演化的軸線,一路走下來,並在結尾對照理論與實務之間那道尷尬的落差。
效度不是測驗的性質,而是詮釋的性質
最常見的誤解,是把效度說成「這份測驗是有效的」,彷彿效度是測驗本身內建的一個標籤。當代的共識恰恰相反:效度所關切的不是測驗,而是「對分數的某一種詮釋、以及某一種使用」究竟站不站得住 (Messick, 1989)。同一份測驗,用於甲用途可能有效,用於乙用途卻可能完全無效。一份數學測驗,用來評估數學能力也許有效;但若以同樣的分數去推論一個人的「一般智力」,或去預測他將來的工作表現,那便是另外兩個效度問題,各自須另行舉證。
因此,效度不是非有即無的二分,而是一個程度問題,是一項須靠證據與理論去支撐的評價性判斷。這也說明了何以效度不能像信度那樣,以單一個係數打發。信度有 alpha、有 omega;效度卻沒有一個「效度係數」,因為它所問的是一個整合性的問題:所有證據加總起來,究竟夠不夠支持所欲進行的那個詮釋與決定?正因如此,本章不提供一條公式,而提供一套「如何論證效度」的架構。
此處還須辨明一組容易混淆的用語,即效度(validity)與效度驗證(validation)。效度是那個評價性判斷本身,也就是「這個詮釋是否恰當」的最終結論;效度驗證則是為建立這一判斷所進行的整套研究歷程。研究者能夠著手去做的,其實始終是後者,也就是持續蒐集、評估支持或反駁某一詮釋的證據,而效度不過是這一歷程在某個時點上的暫時結算。把兩者混同,往往導致把「做過一次效度研究」誤當成「這份測驗已經有效」,而這正是後文將批評的實務通病之一。
傳統的三種效度:內容、效標、構念
欲看懂當代的效度觀,須先知道它從何而來。二十世紀中葉,效度被切分為三種類型,各司一塊。
內容效度(content validity)所問的是:測驗的題目,是否充分代表了它所宣稱要測的那片內容領域?例如一份「國中數學」測驗,若只考代數、完全不考幾何,內容效度便有疑慮。這一塊主要仰賴專家判斷,而非統計。效標關聯效度(criterion-related validity)所問的是:測驗分數,與某個外在標準(效標)相不相關?它又分為兩種:若效標與測驗大致同時取得,例如新編的憂鬱量表與臨床診斷比對,稱為同時效度;若效標在未來,例如以入學考試分數預測大學成績,稱為預測效度。這一塊是實打實的相關或迴歸。構念效度(construct validity)問得最深:測驗究竟有沒有測到那個理論構念本身?當所欲測量之物,例如智力、焦慮,根本沒有任何現成的黃金標準可供對照時,這便成了唯一能問、卻也最難回答的問題。
這裡有兩個容易被忽略的陷阱值得一提。其一是表面效度(face validity),也就是測驗「看起來」像在測某個東西。表面效度並不是真正的效度,因為看起來合理與實際上有效是兩回事;然而它在受試者的接受度與作答動機上仍有實務價值,不宜全然無視。其二是效標本身的問題,即所謂效標問題(criterion problem):效標關聯效度的說服力,完全取決於效標本身是否可信而恰當。若效標本身信度不足,會使觀察到的效度係數受到衰減(第五章)而被低估;若效標本身受到測驗分數的汙染,例如評分者事先看過測驗分數,又會使效度被虛假地高估。換言之,效標關聯效度把一部分的舉證責任,轉嫁到了效標的品質之上。
與效標關聯密切相關的另一個實務概念,是增量效度(incremental validity):一份測驗除了本身與效標相關之外,是否還能在既有測量之上,提供額外的預測力?這一問題之所以重要,是因為一份測驗即使與效標高度相關,若它所提供的資訊早已被更簡便、更廉價的既有測量所涵蓋,其實用價值便相當有限。舉例而言,一份耗時的新編人格量表,若對工作表現的預測力並未超過既有的簡短量表,那麼採用它的正當性便須重新斟酌。增量效度因此把效度的討論,由「這份測驗有沒有用」推進到「在既有工具之外,它是否還值得多花成本」,這也是選才與臨床決策中極為現實的考量。
早期把這三種效度當成「三選一」的並列選項,彷彿研究者可以挑一種來做即可。然而學界很快便發現,這種切法有根本的問題,而解方來自 Cronbach 與 Meehl。這一演變也記錄在《教育與心理測驗標準》歷次改版之中:由一九五○與六○年代把效度視為並列的類型,到一九八五年版確立構念效度的統攝地位,再到當代版本把效度界定為對詮釋與使用的整合論證,效度概念的重心一路由測驗移向詮釋(其歷史梳理見 (Newton & Shaw, 2014))。
構念效度與法則網絡
Cronbach & Meehl (1955) 這篇經典之作,把構念效度推上了核心的位置。他們的洞見是:當一個構念沒有黃金標準時,要如何證明測驗真的測到了它?答案是,把這個構念嵌入一張「法則網絡」(nomological network)之中。這張網,由一組關於「該構念應與哪些其他構念、哪些可觀察指標,維持何種關係」的理論命題所織成。舉例而言,若「考試焦慮」這個構念成立,那麼它應與一般焦慮正相關、與考試表現負相關、並在放鬆訓練之後下降。把這些預測逐條拿去對照資料,若大多得到印證,構念效度便獲得支持;若對不上,那麼要嘛是測驗有問題,要嘛是理論有問題。約略同時,Loevinger (1957) 更進一步主張,從科學的角度看,構念效度根本就是效度的全部,並把它拆解為實質、結構與外部三個成分,這一劃分後來被 Messick 所吸收。
這裡藏著一個深刻、卻常被忽略的重點:構念效度的檢驗,永遠是「測驗」與「理論」綁在一起受檢。研究者無法在「假設理論為真」之外,單獨驗證測驗;也無法在「假設測驗有效」之外,單獨驗證理論。兩者如鞋帶般相互牽引而上,此即所謂的拔靴(bootstrapping)歷程。Cronbach 與 Meehl 這一步,使內容效度與效標效度都轉化為「構念效度的證據」,它們不再是三種平行的效度,而是替同一個構念效度服務的不同證據來源。這一整併,是通往當代統一效度觀的關鍵一步。
構念效度的思想也直接指導了量表發展的實作。Clark & Watson (1995) 便主張,一份良好量表的建構,必須自清楚的構念界定開始,經由題目撰寫、以因素分析檢視單維性與區辨性,再到與外部變項關係的檢驗,環環相扣;換言之,效度不是量表編成之後才補做的一道手續,而是應貫穿整個編製歷程的指導原則。這一主張與第三章所談的操作化歷程前後呼應:測量的品質,早在題目寫下之前,便已由構念界定的清晰程度所預先框定。
多特質多方法矩陣:聚斂與區辨
構念效度聽來抽象,Campbell & Fiske (1959) 卻為它提供了一個相當具體、可操作的檢驗工具,也就是多特質多方法矩陣(multitrait-multimethod matrix, MTMM)。他們的構想相當巧妙。要證明測驗真的在測某個構念,光是「它與別的東西相關」還不夠,還須同時證明兩件相反的事。第一件是聚斂效度(convergent validity):以不同方法去測同一個特質,結果應高度相關。若「外向性」這個特質是真實的,那麼無論以自陳量表測、或以他人評定測,兩者都應對得上。第二件是區辨效度(discriminant validity):去測不同的特質,即使用的是同一種方法,也不應相關得太高。若自陳的外向性與自陳的親和性相關到近乎重疊,那麼所量到的可能不是兩個特質,而是「自陳」這一方法本身帶進來的東西。
要同時檢查這兩件事,便把「若干特質 \times 若干方法」交叉起來,算出所有兩兩相關,排成一個矩陣。矩陣中的係數,依「特質同不同、方法同不同」,恰好分為四類,如表 7.1 所示。
| 係數類型 | 特質 | 方法 | 效度上的期望 |
|---|---|---|---|
| 信度(單特質單方法) | 同 | 同 | 最高(矩陣對角線) |
| 聚斂效度(單特質異方法) | 同 | 異 | 應偏高 |
| 異特質單方法 | 異 | 同 | 應偏低,否則有方法變異 |
| 異特質異方法 | 異 | 異 | 應最低 |
Campbell 與 Fiske 據此提出四條判讀準則:聚斂效度係數應顯著且夠大;同一特質異方法的係數,應高於「與它共享方法、卻不同特質」的係數;也應高於「既不同特質、亦不同方法」的係數;並且各方法內部的特質間關係型態應大致一致。這套準則所要凸顯的核心警訊,是方法變異(method variance)。若「異特質同方法」那一格的相關偏高,也就是不同特質僅因採用同一種方法測量便相關了起來,即代表分數之中混入了大量與構念無關、純粹來自測量方法的成分。MTMM 的貢獻,在於它把抽象的構念效度,翻譯為一組「哪幾格該高、哪幾格該低」的具體型態,讓研究者有實實在在的東西可供檢查。這套邏輯後來也被吸收進驗證性因素分析(第十五章),以潛在的特質因素與方法因素,把兩者正式拆開。具體而言,最直接的設定是相關特質-相關方法模型,讓每個觀測變項同時負荷於一個特質因素與一個方法因素;然而此模型經常無法收斂或產生不當解。為求穩定,實務上常改採相關特質-相關殘差模型,以殘差之間的相關來代表方法效果,而不明確設立方法因素。模型選擇本身即牽動對方法變異的詮釋,這也說明了何以將 MTMM 的直覺形式化,遠比它看似簡單的表格來得棘手,而 MTMM 的檢驗雖概念清晰,落實為統計模型時卻未必輕鬆。
Messick 的統一效度觀
到了一九八○年代,Messick (1989) 把「所有效度都是構念效度」這個方向推向極致,提出了統一效度觀(unified view of validity)。他主張,效度不是若干類型的拼盤,而是一個整合性的概念,也就是對「分數詮釋與使用」是否恰當所做的整體評價性判斷。他把這個判斷拆解為六個必須一併考量的面向,整理於下面的概念方塊。
Messick 主張,對「分數詮釋與使用」的效度判斷,應統整以下六個面向:
內容(content):題目是否切題、具代表性,涵蓋構念的領域。
實質(substantive):受試者的實際作答歷程,是否與構念的理論歷程相符。
結構(structural):計分的內部結構,是否與構念本身的結構一致。
概化(generalizability):結論能否跨題目、情境、時間與群體推廣。
外部(external):與其他變項的關係,是否符合法則網絡的預期(含聚斂與區辨)。
後果(consequential):測驗使用所帶來的社會後果,是否可接受、是否符合構念的意涵。
六者不是六種獨立的效度,而是同一個構念效度必須通盤檢視的六道面向。
須說明的是,Messick 的架構其實出自一個更簡潔的二維設計:一軸區分證據的來源(測驗詮釋本身,抑或測驗使用的後果),另一軸區分關切的功能(提供證據基礎,抑或提供價值判斷),六個面向即由此交織而生。這一設計的用意,是把長期被分置的「科學證據」與「價值後果」統合於單一個效度概念之下。而 Messick 最著名、也最具爭議的一步,正是把「後果」納入效度。他主張,一個測驗用下去會造成什麼社會後果,也是效度的一部分。例如一份看似中性的入學測驗,若系統性地對某些群體不利,那麼「以這個分數來錄取」這件事的效度,便應被打折扣。反對者認為,把社會後果算進效度,會使這個概念膨脹到失焦,也混淆了「測得準不準」與「用得公不公平」兩件事;支持者則認為,測驗的意義本就內含它的使用後果,兩者切割不開。這場爭論的一個折衷立場主張,測驗使用的後果固然重要,卻應區分兩種情形:若不良後果源於測驗本身的構念效度缺陷,例如測到了不該測的無關變異,那麼它確實是效度問題;若不良後果純粹來自社會如何運用一個本身有效的分數,則屬於政策與倫理的範疇,未必須塞進效度概念之內。這一區分試圖在「效度應涵蓋後果」與「效度不宜無限膨脹」之間求取平衡,只是何謂「源於測驗本身」,實務上往往難以一刀切開。這個折衷立場的兩端,恰好把後續兩章的分工預先勾勒了出來:後半端,也就是「一個本身有效的分數在制度中如何被使用、又對誰造成何種後果」,其倫理、治理與社會脈絡的完整處理將留待第二十七章;至於後果問題的另一種根源,也就是不良後果並非來自測驗的使用、而是來自測量本身的草率與未經驗證,則與第三十六章所論的測量再現性連成一氣,屆時將指出許多所謂的後果爭議,其實根源於效度證據自始便未曾被認真建立。這場爭論至今未歇,但 Messick 的統一觀確立了一件事:效度是一項必須把證據、理論與價值一併端上檯面的整合判斷。
Kane 的論證取向:把效度變得可以做
Messick 的統一觀在理論上相當完整,卻在實務上令人手足無措:它幾乎要求研究者「什麼都驗」,卻沒有告訴他「從何處開始、驗到哪裡算夠」。Kane (2013) 的論證取向(argument-based approach),正是要把效度從一個崇高卻模糊的理想,轉化為一件可以按部就班去做的事。
Kane 的核心比喻是:效度驗證,就是替「從測驗表現到最終結論」這一整條推論鏈,建立一個站得住腳的論證。他要求研究者先把這條鏈明白地攤開,究竟做了哪幾步跳躍,才從「受試者在這些題目上的作答」,一路走到「所以可以如此使用這個分數」?隨後,針對每一步跳躍,各自蒐集證據去支撐。這條鏈通常包含四段推論,整理於下面的概念方塊。
從觀察到的作答,到最終的結論與決定,通常經過四段推論;效度驗證,就是為每一段提出支撐證據:
計分(scoring):從「觀察到的作答」到「觀察分數」。證據:計分規則是否恰當、評分者是否一致。
概化(generalization):從「這一次的觀察分數」到「在所有類似題目與場合上的期望分數」。證據:信度、概化理論(第六章)。
外推(extrapolation):從「測驗情境中的表現」到「真實情境中的目標構念」。證據:與效標的關聯、與其他測量的聚斂。
蘊涵/決定(implication/decision):從「構念層次的結論」到「據以做出的解釋與決定」。證據:決定的後果是否恰當、是否公平。
每一段推論都是一個可能斷裂的環節;整個論證的強度,取決於最弱的那一環。
論證取向的高明之處,在於它把效度驗證從一份「什麼證據都蒐集一點」的無盡清單,轉化為一個有優先順序、有明確終點的計畫:最該投注心力的地方,正是那條推論鏈上「最弱、最可疑」的一環。它也讓效度驗證變得誠實,因為研究者必須先把「打算怎麼詮釋、怎麼使用這個分數」講清楚,才有辦法去驗證它;含糊其詞的詮釋,根本無從驗證起。這種「先明確界定詮釋與使用論證,再據以規劃證據」的思路,也正是當代《教育與心理測驗標準》所採取的立場 (AERA, APA, and NCME, 2014)。就實務操作而言,論證取向給出的建議相當具體:先寫下完整的詮釋與使用論證,找出其中最薄弱或最具爭議的假設,優先設計研究去檢驗它,若證據不利便修正詮釋或改進測驗,如此循環,直到整條論證鏈的每一環都獲得與其風險相稱的支持。
效度到底是什麼?Borsboom 的當代反問
就在論證取向逐漸成為主流之際,Borsboom et al. (2004) 投下一顆震撼彈。他們回頭問了一個最素樸、卻也最尖銳的問題:把效度講得這麼複雜,包括法則網絡、六大面向、推論鏈與整合判斷,會不會其實是把「效度」與「效度的證據」混為一談了?
他們的主張簡單到近乎挑釁:一份測驗對某個屬性是有效的,若且唯若,第一,那個屬性確實存在;第二,那個屬性的變異,會「因果地」造成測驗分數的變異。兩個條件,如此而已。值得注意的是,這個定義把效度從一個「靠累積相關證據去支持的評價判斷」,重新拉回為一個「關於世界的因果事實」:重點不在於「分數與一大堆別的變項相不相關」,而在於「是不是所欲測量的那個屬性,透過某個因果歷程,產生了這些分數」。
這個定義有其強大之處。它把第三章所談的反映性測量模型接了起來:反映性模型說「構念是指標的共同原因」,Borsboom 等人便說「效度,正是這個因果宣稱為真」。它也把效度與第三十一章的因果推論綁在一起,問「這個測驗有效嗎」,本質上就是在問一個因果問題。當然,它同樣招致批評:「屬性存在」「因果產生」這類話在本體論上分量很重,實務上又難以直接驗證,批評者質疑它把效度定義得很乾淨、卻也很難操作。無論如何,這場「效度是論證,還是因果事實」的爭論,把一個看似塵埃落定的概念重新掀開檢視,也逼使這個領域去想清楚一件事:追求效度的時候,究竟在追求什麼?
效度與公平:測驗偏誤作為效度議題
效度的討論若只停留在「分數是否測到了構念」,便遺漏了一個在應用上至關緊要的層面,即測驗公平(test fairness)。當代《教育與心理測驗標準》把公平性與效度、信度並列為測驗品質的三大基石,而其立場的高明之處,在於不把公平當成一句抽象的價值宣示,而把它拆解為一組可以逐項檢驗的效度主張:測驗應免於測量偏誤、應對所有受試者維持可及性、並應在通用設計的原則下儘量降低與目標構念無關的作答障礙 (AERA, APA, and NCME, 2014)。從論證取向的眼光看,公平其實不是效度之外另立的一項要求,而是效度推論鏈在「跨群體」這個維度上的延伸:同一個分數,若要在不同性別、族群、語言或文化背景的受試者之間承載相同的意義,那麼前一節所述由計分、概化、外推到決定的每一段推論,都必須在各群體之中同樣站得住。公平因此是效度問題的一個切面,而非與效度並列的另一個範疇。
把這個邏輯位置界定清楚之後,公平在技術上便分岔為兩條互補、卻須嚴格區辨的路線,而兩者的操作細節都不由本章承載,僅在此標明其在全書中的位置。第一條是測量偏誤(measurement bias):問題出在測量本身,也就是同一道題目或同一份量表,在構念水準相當的不同群體之間,是否仍系統性地給出不同的反應機率。其最精細的技術化身,是差異試題功能(differential item functioning, DIF),而 DIF 的正式偵測必須奠基於測量不變性的檢驗,這正是第十九章的主題。此處須澄清一個屢遭誤解的分辨:群體之間分數的平均差異,本身並不等同於偏誤;偏誤指的是「在構念水準相同的前提下,分數仍存在系統差異」,唯有透過不變性的正式模型,才能把前者與後者分離開來。第二條是預測偏誤(predictive bias)與測驗使用的制度層面:這裡的問題不在測量是否等值,而在一個縱使測量等值的分數,被拿去預測外部效標、或據以做出甄選與分流決定時,是否對某些群體造成差別待遇。這一層牽涉差異預測模型、選才效用的權衡,以及圍繞測驗使用的法理與制度脈絡,其完整處理留待第二十七章。把公平析為這兩條路線,一方面呼應了 Messick 對後果的關切,另一方面也把效度由一個純粹的統計問題,接上了測驗使用的倫理與社會責任。
效度證據的整合:從技術文件到跨研究累積
前面幾節所鋪陳的架構,無論是 Messick 的六面向、Kane 的推論鏈,抑或 Borsboom 的因果定義,最終都要面對同一個操作性的問題:散落在不同研究、不同樣本、不同時間點上的效度證據,究竟該如何被整合為一個可供決策者信賴的整體判斷?這一整合並非把證據堆在一起取個平均那麼簡單,而是要依循詮釋與使用論證的骨架,把每一則證據對應到它所支撐的那一段推論之上,再評估整條論證鏈是否獲得與其風險相稱的支持 (Kane, 2013)。論證取向之所以能在當代測驗實務中站穩腳跟,正因為它提供了這樣一副骨架,使原本零散的效度研究得以被組織為一份有結構、有優先順序、且可被外部檢視的證據檔案,而非一堆彼此無關的相關係數。
這副骨架在實務上有兩個主要的操作化場域,剛好是一縱一橫的互補。其一是單一測驗方案內部的縱向整合,體現於測驗的技術文件:大型測驗方案依《標準》的要求,必須在技術手冊中明白交代所欲支持的分數詮釋、對應的效度證據來源,以及尚未獲得充分支持的推論環節,使效度論證由學術論文中的抽象主張,落實為一份可供審查、可被問責的正式文件,其具體的編製規範將在第二十二章隨測驗編製方法學一併展開。其二是跨測驗、跨研究的橫向累積:任何單一研究的效度證據都受限於特定樣本與情境,唯有把同一類詮釋在多項研究中的證據系統性地整合,才能判斷某一效度宣稱究竟能推廣到多廣的範圍。這正是效度概化(validity generalization)所處理的問題,它把效度論證由單一研究的內在說服力,推進到跨研究的外部穩健性,方法學上屬於後設分析的範疇,將於第三十二章詳述。技術文件回答「這一個測驗方案的證據夠不夠」,效度概化回答「這一類詮釋在多大範圍內站得住」,兩者共同把效度由一次性的宣稱,轉化為持續累積、可被修正的科學結論。
從理論到實務:一道尷尬的落差
效度理論講了七十餘年,如此精緻;然而回到研究現場,畫面卻相當難堪。大量已發表的研究,對自己所用的量表,往往只報一個 Cronbach’s alpha 便算交代完畢,幾乎不提任何效度證據;不少量表甚至是研究者臨時自編、未經任何驗證便投入使用的。Flake et al. (2017) 系統檢視社會與人格心理學文獻後便發現,儘管潛在變項測量在該領域無所不在,研究者卻普遍未落實構念效度驗證的基本做法,多數研究對量表的交代止步於信度係數。更廣泛地,Flake & Fried (2020) 把這種對測量的隨意,直指為整個實證體系的一項系統性弱點。換言之,效度理論的天花板極高,效度實務的地板卻很低。這道落差本身,正是第三十六章將討論的再現性危機的一個重要根源:當整座實證大廈蓋在一堆效度不明的測量之上,結論的可重複性自然堪慮。
對實務研究者而言,本章的結論可收攏為幾句話。效度不是一次性的檢查表,而是一個持續進行的驗證計畫。動手之前,先把「打算怎麼詮釋這個分數、又要拿它做什麼決定」講清楚,隨後針對這條詮釋與使用的推論鏈,一環一環去尋找證據,並優先補強最弱的一環。無論偏好 Messick 的整合判斷、Kane 的論證架構,抑或 Borsboom 的因果定義,它們都共同指向同一項要求:切莫把「算得出一個係數」誤當成「測到了該測的東西」。落實到具體做法,至少有三件事值得堅持:其一,在論文中明確報告所用量表的效度證據來源,而非僅止於信度;其二,若採用自編或改編量表,應說明其構念界定與驗證歷程,而非視為理所當然;其三,在跨群體比較之前,先檢驗測量不變性。這些要求看似繁瑣,卻是使實證結論得以被信任的最低門檻。
本章也為本書第二部分「測量基礎:量尺化與古典測驗理論」畫下句點。從第三章的測量架構、第四章的心理量尺化、第五章的真分數與誤差、第六章的信度,到本章的效度,「單一測驗」這個層次的核心概念已鋪陳完畢。接下來的第三部分要換一個檔次:在深入因素分析、項目反應理論這些重型的潛在變項模型之前,先把它們共同仰賴的統計工具箱,從統計推論、抽樣與檢定力、實驗設計與變異數分析、迴歸,到估計、模型適配與缺失資料,一次備齊。