第 27 章 測驗公平性、偏誤與測驗使用的社會脈絡
第五部 測驗發展、應用與社會脈絡
27Chapter

測驗公平性、偏誤與測驗使用的社會脈絡

到目前為止,本書處理公平問題大多停留在技術層次。第十九章的測量不變性與差異試題功能,回答的是「同一道題對不同群體是否以相同方式運作」;那是一個關於測量本身的、可以用統計檢定的問題。然而,當一份測驗被用來決定誰能進大學、誰能獲聘、誰能取得專業證照時,公平的問題就溢出了測量的邊界,進入決策與制度的領域。一個在試題層次毫無偏誤的測驗,仍可能在群體之間造成極不相等的錄取率;一種看似公正的錄取規則,可能與另一種同樣有理的公正標準彼此矛盾。本章要完成從「技術性的差異試題功能,到測量不變性,到預測公平,再到使用正義」的最後一哩,把公平性同時當作心理計量的技術問題、決策理論的問題與制度的問題來處理。 本章有一個或許令讀者意外的副線索,即心理計量學對當代演算法公平的先驅性貢獻。近年機器學習社群熱烈辯論的許多公平準則及其不相容性,其實在一九七零年代的測驗公平文獻中就已被形式化地提出並證明。把這段歷史重新接上,不僅是為心理計量正名,更是要提醒讀者,公平的困難有很大一部分不是技術能夠消解的,而是價值選擇本身的困難。為使討論具體,全章以一項公職甄選測驗的公平審查為貫穿實例,讓同一筆甄選資料依序經過差異試題功能篩檢、差異預測分析、效用與切截分數分析、以及不利影響評估,並刻意呈現各層結論如何可能彼此衝突,以及制度上最終如何裁量。此處須先言明本書的方法論立場,即本章致力於把「可由測量學澄清的部分」與「必須由社會協商決定的部分」劃分清楚,前者是本書的專業所在,後者則明示為規範性的政策判斷,非測量科學所能獨斷。

公平不是一個定義,而是一組張力

初學者常以為公平是一個可以一勞永逸定義清楚的性質,只要測驗滿足了那個定義,就算公平。這個想法在遇到真實的甄選情境時很快就會瓦解。問題不在於我們找不到公平的定義,而在於我們找到了太多個彼此都合理、卻在數學上不能同時成立的定義。一種直覺說,公平意味著同樣分數的人不論群體都該有同樣的錄取機會;另一種直覺說,公平意味著兩個群體的錄取率應該相當;還有一種直覺說,公平意味著測驗對兩個群體的預測準確度應該一致。每一種直覺單獨看都站得住腳,但後文將證明,當群體之間在效標上的真實分布本就不同時,這幾種公平往往無法兼得。 因此,本章不把公平當作一個待勾選的定義,而當作一組必須權衡的張力。這個立場的實際意涵是,公平審查的產物不應該是「這個測驗公平/不公平」的二元判決,而應該是一份把各種公平準則下的結論並陳、把它們之間的衝突攤開、並清楚標明哪些衝突源於測量缺陷、哪些衝突源於無可迴避之價值取捨的分析報告。《測驗標準》((AERA, APA, and NCME, 2014))晚近各版對公平的處理,正是朝這個方向演進,從早期把公平窄化為預測偏誤的檢定,擴展為涵蓋測量偏誤之免除、測驗之可及性、以及通用設計等多重面向的架構。

測量偏誤與預測偏誤:分清楚兩件事

釐清公平問題的第一步,是把兩種截然不同的偏誤分開。測量偏誤(measurement bias)是關於測驗本身的性質,問的是同一個潛在構念水準的兩個人,若分屬不同群體,是否會得到系統性不同的分數。這正是第十九章差異試題功能與測量不變性所處理的問題,其判準完全落在測驗內部,與測驗要預測什麼無關。預測偏誤(predictive bias)則是關於測驗與外部效標之關係的性質,問的是同一個測驗分數的兩個人,若分屬不同群體,是否會有系統性不同的效標表現。前者是測量的內在一致,後者是預測的外在公正,兩者在概念上與統計上都彼此獨立。 混淆這兩者會導致嚴重的推論錯誤。一個常見的謬誤是,看到兩群體的測驗平均分數有差距,就斷言測驗有偏誤。平均分數的差距本身既不證明也不否證任何一種偏誤,它可能反映測量偏誤、可能反映效標上的真實差異、也可能兩者皆有;單憑分數差距無從區辨。同樣地,一個通過了所有差異試題功能檢定、測量不變性完美成立的測驗,仍可能有預測偏誤,反之亦然。本章的其餘部分聚焦於預測偏誤與其下游的決策問題,測量偏誤的統計偵測請參第十九章。

Cleary 模型與差異預測

預測偏誤的第一個形式化,由 Cleary (1968) 提出,至今仍是主導性的框架。其構想直接而優雅,即把測驗分數對效標做迴歸,然後檢查這條迴歸線在不同群體間是否相同。若不同,測驗對某一群體就系統性地高估或低估其效標表現,此即預測偏誤。這個模型把公平的問題轉化為一個可檢定的統計假設,如下面的推導方塊所示。

推導方塊Cleary 差異預測模型與 Kelley 迴歸效應的陷阱

設效標 Y 對測驗分數 X 的群體別迴歸為

Y=a_g+b_g X+\varepsilon,\qquad g\in\{\text{群體1},\text{群體2}\}.

Cleary 模型以是否 a_1=a_2(截距相等)與 b_1=b_2(斜率相等)來界定預測公平。截距偏誤意指以共同迴歸線預測時,對某群體一致地高估或低估;斜率偏誤意指測驗對兩群體的預測效度不同。無偏誤要求兩條迴歸線重合。

此模型有一個常被忽略的陷阱。當測驗分數含測量誤差,且兩群體在構念真值上的平均本就不同時,迴歸稀釋(regression dilution)會機械性地製造出表面的截距偏誤,即使測驗對兩群體完全等效。其根源是 Kelley 迴歸效應,即以不完全信度的分數預測時,估計值會朝各自群體的平均回歸,回歸的幅度隨群體平均不同而不同,於是在共同迴歸線下產生系統性的預測落差。因此,觀察到的截距差異未必來自測驗的不公,而可能只是測量誤差與群體平均差交互作用的假象;把它逕自解讀為偏誤,是一種推論上的過度。

在公職甄選的實例中,差異預測分析可能顯示,共同迴歸線對某一群體略微低估其到職後的實際績效。Cleary 模型會把這標記為截距偏誤,但上述陷阱提醒審查者,在下結論之前必須先排除測量誤差與群體平均差所造成的假象,例如以信度校正或潛在變項迴歸重新估計。這個看似技術性的細節,其實承載了重要的公平意涵,因為把假象誤判為偏誤,與把真偏誤誤判為假象,都會導致錯誤的制度回應。

一個弔詭:測量公平與預測公平不可兼得

差異試題功能與差異預測分別刻畫了測量公平與預測公平,一個自然的期望是,若測驗在測量層次完全公平(測量不變性成立),它在預測層次也應當公平。這個期望是錯的,而且錯得深具意涵。Millsap (1997) 以形式化的論證證明,測量不變性與預測不變性一般而言不能同時成立,除非在極特殊的條件下。換言之,一個測量完全公平的測驗,恰恰因為它測量公平,反而可能表現出預測偏誤;反之,一個經過調整以達成預測公平的測驗,往往必須犧牲其測量不變性。 這個弔詭的意義不在於技術細節,而在於它擊碎了「存在某種一勞永逸的公平測驗」的幻想。兩種公平各自對應不同的規範立場,即測量公平關注的是「同構念者同分數」的程序正義,預測公平關注的是「同分數者同待遇」的結果一致,而數學結構使得兩者在群體分布不同時無法兼得。這意味著公平的選擇無法純由測量科學代勞,它逼使決策者明確表態,究竟要優先保障哪一種公平。本章稍後將看到,這個一九九零年代的心理計量弔詭,與二十年後演算法公平社群獨立發現的不可能定理,其實是同一個數學事實的兩種表述。

甄選作為決策:效用分析

公平的討論若只停在偏誤的偵測,便錯過了測驗使用最核心的一環,即甄選終究是一個決策,而決策有其效用與代價。決策理論的視角把測驗分數視為決策的輸入,把錄取與否視為決策的輸出,並問一個測驗究竟為決策帶來多少實際的效益。這一傳統始於 Taylor & Russell (1939),成熟於 Cronbach & Gleser (1965),如下面的概念方塊所示。

概念方塊從 Taylor-Russell 到 Brogden-Cronbach-Gleser

Taylor 與 Russell(1939)指出,一個測驗的實用價值不只取決於其效度係數,還取決於兩個情境參數,即基本率(base rate,母群中「合格者」的比例)與選擇率(selection ratio,實際錄取的比例)。同樣的效度係數,在不同的基本率與選擇率下,帶來的正確錄取比例可以天差地別;效度高但選擇率接近一(幾乎全錄取)時,測驗幾乎沒有篩選的餘地,實用價值有限。

Brogden、Cronbach 與 Gleser 進一步把效益量化為金錢或效標單位。其核心結論是,甄選帶來的每位錄取者平均效用增益,正比於三個量的乘積,即測驗效度 r_{xy}、效標的標準差 SD_y、以及被錄取者在測驗分數上的平均標準分數。這個模型清楚顯示,測驗的價值高度依賴其效度係數,也依賴選擇率所決定的錄取者分數水準,因此效度上的小幅差異,在大規模甄選中可累積為可觀的效益差距。

效用分析為公平辯論注入了常被忽略的一面。放寬錄取標準以提升某群體的錄取率,其代價可以用效用模型明確估計,即被犧牲的預測效度會轉化為多少到職後的績效損失。反過來,堅持純以分數高低錄取,其代價則是群體錄取率的懸殊。效用分析本身不告訴我們該如何取捨,那是價值問題,但它把每一種取捨的代價量化出來,使制度得以在知情的情況下做決定,而非在對代價一無所知的情況下空談原則。

切截分數與分類錯誤:SDT 的回歸

甄選的另一個關鍵環節是切截分數的設定,即在連續的測驗分數上劃一條線,線上錄取、線下淘汰。這條線一旦劃下,就必然製造兩類錯誤,即把本該錄取的合格者淘汰的誤拒(false negative),與把本不合格者錄取的誤納(false positive)。這正是第四章訊號偵測理論的決策結構在甄選情境的再現,切截分數即決策準則,移動它會在兩類錯誤之間權衡:切截提高則誤納減少但誤拒增加,切截降低則反之。基本率在此再度扮演關鍵角色,當合格者的基本率很低時,即使測驗頗準,線上的人裡仍可能有相當比例其實不合格。 切截分數的公平意涵,在於同一條切截線施加於基本率不同的群體時,會產生不同的分類錯誤結構。若某群體在效標上的合格基本率較低,則同一切截分數會使該群體承受較高的誤拒率或較低的錄取後成功率,端視切截落點而定。這把前述「多種公平不可兼得」的抽象弔詭,落實為一個具體的操作選擇,即究竟要固定切截分數以求「同分同標準」的程序公平,還是要為不同群體調整切截以求某種結果的均等。這個選擇沒有純技術的正解,但訊號偵測理論的框架至少讓我們把每一種選擇的錯誤代價算清楚。

不利影響與效度-多樣性權衡

當一項甄選測驗使某群體的錄取率顯著低於另一群體時,即構成法理上所稱的不利影響(adverse impact)。美國就業歧視法制中著名的四分之五法則,以「弱勢群體錄取率低於優勢群體錄取率之八成」作為不利影響的初步判準。須強調的是,不利影響是一個關於結果分布的統計性描述,它本身並不等同於測驗有偏誤或違法,而是觸發進一步效度審查與必要性論證的門檻。一個效度充分、與工作績效確實相關的測驗,仍可能產生不利影響。 這就引出了甄選領域最棘手的一個經驗性張力,即效度與多樣性之間的權衡。認知能力測驗往往具有跨情境的高預測效度,卻也往往在群體間產生較大的分數差距,因而傾向造成較強的不利影響。若純以最大化預測效度為目標,可能加劇群體錄取率的失衡;若為提升多樣性而犧牲效度,則須承擔前述效用模型所量化的績效代價。這個權衡的確切幅度在不同職類與不同預測組合下差異很大,其最新的估計與爭論仍在進行,本書不宜給出單一結論。此處的方法論立場是,把效度與不利影響的經驗事實盡量估計清楚,而把「該如何在兩者間取捨」明確歸還給價值判斷與政策決定。

歷史的法庭:判例與智力測驗爭議的科學檢視

測驗公平的議題從來不只在期刊裡,也在法庭上與公共輿論中。二十世紀的美國,一系列就業與教育的訴訟,把測驗的差異影響推上司法審查的檯面,也反過來塑造了心理計量對效度與公平的專業標準。這些判例的方法論意涵,在於它們迫使測驗使用者把「測驗與工作或學業的實質關聯」從一個學術概念,變成一個必須在制度上舉證的責任。與其把這段歷史當作立場的宣示,本書主張以測量的語言重新檢視它,即每一樁爭議背後,其實都是關於效度證據是否充分、差異影響是否有工作相關性辯護的具體問題。 智力測驗的爭議史尤其需要這種冷靜的科學檢視。圍繞群體間測驗分數差距的辯論,長期夾雜著科學主張與意識形態,本書的處理原則是把可檢驗的測量問題與不可由測量裁決的價值問題分開。測量能回答的問題包括,分數差距中有多少可歸因於測量偏誤、測驗對不同群體的預測效度是否一致、以及觀察到的差距對不同的公平準則各有何意涵。測量不能回答的問題則包括,分數差距的終極成因為何、以及社會應如何回應這些差距。把批判與回應平衡呈現、把證據與立場清楚區分,是本書認為對待這段爭議史唯一負責任的方式。

無障礙、調整措施與分數可比性

公平不僅關乎群體之間的比較,也關乎讓每一位受測者都能在不受無關障礙妨礙的情況下展現其真實能力。對身心障礙受測者提供的調整措施(accommodations),例如延長作答時間、放大字體、提供報讀,其目的正是移除與目標構念無關的障礙,使分數更能反映構念本身。通用設計(universal design)的理念更進一步,主張在測驗設計之初就把可及性納入考量,而非事後補救。 然而調整措施帶來一個微妙的測量問題,即調整後所得的分數,是否仍與標準條件下的分數可比。若延長時間顯著提升了與構念無關的表現成分,則調整後分數與標準分數就不在同一量尺上,逕自比較便不公平。這個問題在本質上是一個等化與連結的問題,與第二十三章的架構相通,即須確認兩種施測條件下的分數是否測量同一構念、是否可以放到共同量尺上比較。理想的調整應當只移除無關障礙而不改變所測構念,此時可比性得以維持;判斷某項調整是否符合這個理想,則需要構念層次的效度證據,而非僅憑直覺。

演算法公平:心理計量的先聲

近十年,隨著演算法被廣泛用於信用、司法與招募的風險評分,機器學習社群展開了關於演算法公平的激烈辯論,並得出一個令許多人震驚的結論,即幾種直覺上都合理的公平準則,在數學上不能同時滿足。Chouldechova (2017) 與 Kleinberg et al. (2016) 各自證明,當不同群體的事件基本率不同時,校準(同一風險分數對應同一真實機率)與錯誤率平衡(各群體的誤判率相等)無法兼得。這個結果在演算法公平社群引起巨大迴響,卻少有人意識到,它其實是心理計量學半世紀前結論的重新發現。

推導方塊不可能定理的代數素描

考慮一個二元風險分類器,對某群體而言,設事件基本率為 p,陽性預測值為 \mathrm{PPV},偽陰性率為 \mathrm{FNR},偽陽性率為 \mathrm{FPR}。由條件機率的定義可導出三者的恆等關係

\mathrm{FPR}=\frac{p}{1-p}\cdot\frac{1-\mathrm{PPV}}{\mathrm{PPV}}\,(1-\mathrm{FNR}).

此式顯示,一旦固定了 \mathrm{PPV}(即要求跨群體的校準或預測值平等),偽陽性率就完全由基本率 p 決定。因此,當兩群體的基本率 p 不同時,若強令兩群體的 \mathrm{PPV} 相等,其偽陽性率必然不等,錯誤率平衡遂告破滅。除非兩群體基本率恰好相同,或分類器完美無誤,校準與錯誤率平衡不可兼得。這正是 Chouldechova (2017) 的核心論證,而其精神與 Petersen & Novick (1976) 及 Darlington (1971) 在文化公平甄選模型中的結論如出一轍。

把這段譜系接上,有兩層價值。其一是學術正義,即 Cleary (1968)、Darlington (1971)、Petersen & Novick (1976) 早已在甄選脈絡中形式化並辯論過這些不相容性,當代的演算法公平研究是站在他們的肩膀上。其二,也是更重要的,是這段譜系再度確認了本章的核心訊息,即公平準則的不相容不是某個演算法或某個測驗的缺陷,而是一個關於群體分布的數學事實,因此無論工具是人是機、是迴歸是深度學習,這個張力都無法以更精巧的技術繞過。當代 AI 化甄選與計分的公平治理,其技術面雖屬第二十六與三十四章,但其規範性的困境,早已寫在心理計量的舊文獻裡。

測驗使用的倫理與治理

公平最終落實於測驗如何被使用,這是一個治理的問題。負責任的測驗使用至少包含幾項制度要素。其一是知情,即受測者有權知道測驗將如何影響對他的決定,以及分數將如何被詮釋與使用。其二是申訴,即受測者應有質疑分數、要求複核的管道,尤其在高風險的決定中。其三是後果監測,即測驗的使用者有持續追蹤測驗實際後果的責任,包括它對不同群體造成的差異影響,而非在測驗上線後便不聞不問。這一後果導向的視角,與第七章效度論證中的後果面向、以及第三十六章對開放科學與研究後果的討論相互呼應。 演算法時代使這些倫理要求更形迫切也更形複雜。當甄選與計分交由不透明的模型執行時,知情與申訴的落實面臨新的障礙,因為連使用者自己都未必能解釋模型為何做出某個判斷。這使得可解釋性、可稽核性與人為監督,從技術上的加分項變成治理上的必需品。本書在此重申其一貫立場,即測量科學能夠且應該做的,是把測驗的效度、偏誤與差異影響盡可能澄清並如實呈現;而測驗該不該用、該如何在效率與公平之間權衡、以及誰有權做這個權衡,則是超出測量科學、屬於民主社會須共同協商的規範性問題。把這兩者混為一談,無論是以科學之名行價值獨斷,或以價值之名否定可檢驗的證據,都是本書所要避免的。

小結

本章把公平性從第十九章的技術性差異試題功能,推進到預測、決策與制度的層次,完成了測量公平論述的最後一哩。核心的分析步驟包括,先區辨測量偏誤與預測偏誤這兩件常被混淆的事,再以 Cleary 的差異預測模型形式化預測公平,並揭示迴歸稀釋如何製造表面的截距偏誤這一推論陷阱。接著,透過 Millsap 弔詭與演算法公平的不可能定理,本章論證了一個貫穿全章的中心事實,即當群體在效標分布上本就不同時,測量公平與預測公平、校準與錯誤率平衡等多種合理的公平準則,在數學上不能同時滿足,這不是任何工具的缺陷,而是價值取捨無可迴避的結構。 在決策的層次,本章以 Taylor-Russell 與 Brogden-Cronbach-Gleser 的效用模型,把每一種公平取捨的代價量化,以訊號偵測理論的框架分析切截分數的分類錯誤,並以效度-多樣性權衡與不利影響,呈現了甄選在效率與均等之間的真實張力。最後,透過對判例史、智力測驗爭議、調整措施可比性、以及演算法公平譜系的檢視,本章反覆申明其方法論立場,即把可由測量學澄清的部分與須由社會協商的部分劃分清楚。至此,第五部完成了測驗從編製、量尺、施測到公平使用的完整生命週期。接下來的第六部將轉向另一大類問題,即當資料不再是單一時點的獨立觀測,而是具有階層、時間或空間相依結構時,測量與建模所面臨的新挑戰。

參考文獻

AERA, APA, and NCME. (2014). Standards for educational and psychological testing. American Educational Research Association.
Chouldechova, A. (2017). Fair prediction with disparate impact: A study of bias in recidivism prediction instruments. Big Data, 5(2), 153–163. https://doi.org/10.1089/big.2016.0047
Cleary, T. A. (1968). Test bias: Prediction of grades of Negro and white students in integrated colleges. Journal of Educational Measurement, 5(2), 115–124. https://doi.org/10.1111/j.1745-3984.1968.tb00613.x
Cronbach, L. J., & Gleser, G. C. (1965). Psychological tests and personnel decisions (2nd ed.). University of Illinois Press.
Darlington, R. B. (1971). Another look at “cultural fairness.” Journal of Educational Measurement, 8(2), 71–82. https://doi.org/10.1111/j.1745-3984.1971.tb00908.x
Kleinberg, J., Mullainathan, S., & Raghavan, M. (2016). Inherent trade-offs in the fair determination of risk scores. arXiv Preprint arXiv:1609.05807. https://doi.org/10.48550/arXiv.1609.05807
Millsap, R. E. (1997). Invariance in measurement and prediction: Their relationship in the single-factor case. Psychological Methods, 2(3), 248–260. https://doi.org/10.1037/1082-989X.2.3.248
Petersen, N. S., & Novick, M. R. (1976). An evaluation of some models for culture-fair selection. Journal of Educational Measurement, 13(1), 3–29. https://doi.org/10.1111/j.1745-3984.1976.tb00178.x
Taylor, H. C., & Russell, J. T. (1939). The relationship of validity coefficients to the practical effectiveness of tests in selection: Discussion and tables. Journal of Applied Psychology, 23(5), 565–578. https://doi.org/10.1037/h0057079
本章引用格式游琇婷(2026)。測驗公平性、偏誤與測驗使用的社會脈絡。《計量心理學:測量、模型與推論》(第 27 章)。