信度:從係數到概化理論
第五章證明了一件優雅的事:信度等於兩份平行測驗分數的相關。然而這一結果在實務上隨即遭遇困難,因為要製作兩份「完全平行」的測驗幾乎是不可能的,甚至連讓同一個人在不受干擾的情況下重考一次,都相當棘手。那麼,信度究竟該如何估計?本章正是要回答這個問題。討論將從三種傳統做法談起,一路走到心理計量史上最著名、卻也最常被誤解的一個數字,也就是 Cronbach’s alpha,說明它為何往往低估信度,又為何「alpha 高」並不等於「量表只測一個構念」。接著介紹較為合理的替代品 omega,最後把整個信度概念推廣至概化理論,學會把單一個「誤差」拆解為多個來源分別處理。本章的技術密度較高,但每一條公式背後的直覺,都會先予釐清,再進入推導。
貫穿全章的一條主線是:不同的信度估計法,其實對應著對「誤差來自哪裡」的不同想像。看清這一點,便能理解為何同一份測驗、同一批人,換一種估計法就得到不同的信度,也能理解概化理論何以是這一系列方法的自然歸宿。
三種傳統的信度估計法
既然無法直接計算 \sigma_T^2/\sigma_X^2,實務上便須設法繞道估計信度。歷史上發展出三種主要策略,各自對應著對「誤差來源」的不同界定,而這一界定往往比係數的數值本身更值得留意。
第一種是再測信度(test-retest reliability)。同一份測驗,相隔一段時間後讓同一批人再考一次,兩次分數的相關即為信度的估計,稱為穩定係數(coefficient of stability)。它把「時間」視為誤差的來源:凡是兩次施測之間造成分數波動的因素,都被算作誤差。這也正是它的難處所在。兩次之間,受試者可能真的改變了,無論是學習、成熟或遺忘,而這種真實的變化會被誤判為誤差;反之,若間隔過短,受試者可能記得上次的作答而人為地拉高相關,導致高估。換言之,再測信度先天地混淆了「測量誤差」與「真實變化」,而兩者的分野,正是第二十九章縱貫建模的核心議題。
第二種是複本信度(alternate-forms reliability)。研究者準備兩份內容不同、卻測量同一構念的測驗,即複本,讓同一批人各考一份,兩份分數的相關即為估計,稱為等值係數(coefficient of equivalence)。它把「題目的抽取」視為誤差的來源:換一組題目所造成的分數變動,即為此處所關切的誤差。相較於再測,它在概念上較為乾淨,代價卻高昂,因為要編製兩份真正等值的測驗極其困難。若同時跨越時間與複本施測,所得的等值穩定係數,則同時把時間與題目兩個來源都納入誤差,因而通常最為保守。
第三種、也是今日最常用的,是內部一致性(internal consistency)。它最精巧之處在於:只須施測一次,便可由「題目與題目之間的關係」推估信度。其背後的邏輯是,若所有題目都測量同一構念,它們彼此便應高度相關;題間相關愈高,總分之中的訊號成分便愈大。它把誤差界定為「題目特定性」,也就是各題不共享的部分。折半法(split-half)是最早的一種做法:把測驗拆成兩半,計算兩半分數的相關。然而拆法本身即藏著一個問題,正好帶出下一節的主角。值得補充的是,Guttman (1945) 曾系統地推導出六個僅憑單次施測即可計算的信度下界,其中第三個下界 \lambda_3 恰好等於稍後要談的 Cronbach’s alpha;這說明 alpha 並非橫空出世,而是內部一致性這一整個下界家族中的一員。
把三者並置而觀,一個關鍵的觀念便浮現出來:所謂「信度」並不是單一個數字,而是相對於某一組被視為誤差的來源而定義的。同一份測驗,若只把題目抽取算作誤差,得到的是內部一致性;若把時間也算進來,得到的是穩定係數;兩者未必相等,而它們的差距本身即富含資訊。這一洞見,正是概化理論得以把各種誤差來源統一處理的思想起點。
Spearman-Brown:加長測驗如何提升信度
折半法有一個先天的問題:它算出的是「半份測驗」的信度,而非整份測驗的信度。而測驗愈長、題目愈多,信度通常愈高,因為隨機誤差在加總時會相互抵消,訊號卻持續累積。因此直接以折半相關充當信度,會系統性地低估。解決之道是 Spearman-Brown 加長公式,它讓研究者得以由「半份的信度」推算「整份的信度」,更一般地,還能預測把測驗加長 k 倍後的信度。這條公式由 Spearman 與 Brown 於一九一○年同期各自獨立提出 (Brown, 1910; Spearman, 1910)。
設一份測驗的信度為 \rho,今將其加長為原來的 k 倍,即把 k 份彼此平行的複本合併為一份長測驗。此長測驗的總分為 k 份平行測驗之和,其真分數與誤差的變異以不同速度成長:因各複本測到相同的真分數 T,合併真分數為 kT,變異為 k^2\sigma_T^2;因各複本的誤差互不相關且變異相等,合併誤差變異僅為 k\sigma_E^2。故加長後的信度為
將分子分母同除以 \sigma_X^2 = \sigma_T^2+\sigma_E^2,並代入 \rho = \sigma_T^2/\sigma_X^2 與 1-\rho = \sigma_E^2/\sigma_X^2,得
折半法的校正是 k=2 的特例:\rho_{\text{full}} = 2\rho_{\text{half}}/(1+\rho_{\text{half}})。
這條公式有兩項實用的啟示。其一,它讓折半估計得以校正回整份測驗的信度。其二,它是測驗編製的規劃工具:若已知現有測驗信度為 0.7、目標為 0.9,可反解出須把測驗加長幾倍。代入公式可得 k = \rho^{*}(1-\rho)/[\rho(1-\rho^{*})] = 0.9 \times 0.3 / (0.7 \times 0.1) \approx 3.86,也就是說,測驗長度須增為原來的近四倍。這個數字本身即帶有警訊:信度的提升遵循報酬遞減,愈接近 1 就愈昂貴。而且公式假設新增的題目與原有題目平行,亦即品質相同;現實中若不斷加題,題目品質往往下降,過長的測驗又會引入疲勞效應,因此信度的提升終究有其上限。當加題的邊際成本過高時,改善題目品質、或如後文所述改採增加評分者等其他設計,往往更為有效。
Cronbach’s alpha:最常用、也最常被誤解的係數
折半法還有另一個麻煩:一份測驗有許多種拆成兩半的方式,每一種拆法給出的折半信度都不相同,究竟該採用哪一個?Cronbach (1951) 的 alpha 係數優雅地化解了這個難題,因為它恰好等於「所有可能折半方式的信度之平均」。alpha 只須施測一次、用上全部題目即可計算:
其中 k 為題數,\sigma_i^2 為第 i 題的變異,\sigma_X^2 為總分的變異。就直觀而言,括號內衡量的是「各題變異之總和相對於總分變異」有多小,也就是題目之間「共享」了多少變異;當題目高度相關時,\alpha 趨近 1。針對二元計分(對與錯)的題目,alpha 會化簡為更早提出的 Kuder-Richardson 20 號公式 (Kuder & Richardson, 1937);若進一步假設各題難度相等,則得到更簡便的 KR-21。alpha 之所以風行,正因它太過方便:一次施測、一條公式。然而也正因為方便,它遭到嚴重的誤解與濫用。欲看清問題,須先弄清楚 alpha 究竟等於什麼。
把總分寫成各題之和,X = \sum_i X_i。因各題誤差互不相關,跨題共變僅來自真分數,\mathrm{Cov}(X_i,X_j) = \mathrm{Cov}(T_i,T_j)(i \neq j)。於是 alpha 可改寫為
而測驗真分數變異為 \sigma_T^2 = \sum_i \mathrm{Var}(T_i) + \sum_{i \neq j}\mathrm{Cov}(T_i,T_j),信度 \rho_{XX'} = \sigma_T^2/\sigma_X^2。
本質 tau 等值下兩者相等。 若 T_i = T + a_i,則各 \mathrm{Var}(T_i) = \mathrm{Var}(T) \equiv v、各 \mathrm{Cov}(T_i,T_j) = v。故 \sum_{i\neq j}\mathrm{Cov}(T_i,T_j) = k(k-1)v,代入得
同時 \sigma_T^2 = kv + k(k-1)v = k^2 v,故 \rho_{XX'} = k^2 v/\sigma_X^2 = \alpha。 一般情況下 alpha 是下界。 當題目偏離 tau 等值(真分數變異或負荷不等)時,可證 \alpha \le \rho_{XX'},即 alpha 系統性地低估信度,且低估程度隨題目間的異質性而增加(完整證明見 (Novick & Lewis, 1967))。
須強調的是,上述推導有一個關鍵前提,即各題誤差互不相關。這一前提在真實資料中常被違反,例如相鄰題目共用同一段題幹、或若干題目共享一種作答方法,都會使誤差之間產生正相關。一旦誤差相關,alpha 的「下界」性質便可能反轉,使 alpha 反而高估信度。因此 alpha 偏低固然常見,偏高卻也並非不可能,而後者往往更為隱蔽,因為它披著「信度良好」的外衣。
一個簡單的數字可具體說明 alpha 的低估。設一份五題量表,各題的標準化負荷分別為 0.9、0.8、0.5、0.3、0.2。依 omega 公式,其信度約為 0.70;而 alpha 因假設負荷相等,僅得約 0.65。負荷愈參差,alpha 的低估便愈明顯。在負荷高度不齊的量表上,這一差距足以使一份實則堪用的量表,因 alpha 偏低而被誤判為信度不足,而這類誤判在量表發展的初期篩題階段尤其容易造成誤刪好題。
alpha 的系統性誤用
弄懂了 alpha 等於什麼,便能看穿環繞著它的幾個迷思 (Revelle & Zinbarg, 2009; Sijtsma, 2009)。
第一個迷思是,alpha 高即代表量表為單維。這是錯的。alpha 主要由題數與平均題間共變所決定;題目一多,即使構念其實橫跨數個維度,alpha 照樣可以很高。反之,一份真正單維但題數偏少的量表,alpha 也可能偏低。alpha 根本不是維度的指標,欲判斷是否單維,須訴諸因素分析(第十四章)。
第二個迷思是,alpha 就是信度。這並不精確。如前所示,唯有在本質 tau 等值這個相當嚴格的條件之下,alpha 才等於信度;而真實量表幾乎都屬同源(負荷不等)而非 tau 等值,此時 alpha 會系統性地低估。也就是說,研究者習慣把 alpha 當作信度來報告,實際報的通常是一個偏保守的下界。
第三個迷思是,alpha 愈高愈好。這同樣不對。過高的 alpha,例如 0.95 以上,往往是題目高度重複、彼此換句話說的結果,這在測量上反而是冗餘,可能窄化了構念的涵蓋面。alpha 適中、而題目又能涵蓋構念的不同面向,通常才是較理想的狀態。
耐人尋味的是,對 alpha 最深刻的反省,來自 Cronbach 本人。在晚年的一篇回顧中,Cronbach & Shavelson (2004) 坦言,他早已不認為 alpha 是判斷信度的最佳方式,並主張應把它放進概化理論這個更寬廣的架構中來看待。換言之,alpha 只涵蓋了信度所關切之問題的一個狹小切面。綜合這些批評,晚近的方法學文獻,例如 McNeish (2018),已明確呼籲研究者放下對 alpha 的慣性依賴,改採更貼近真實測量結構的估計。一言以蔽之,alpha 既不是良好的單維指標,在一般情況下也不是良好的信度估計;它之所以至今仍普遍存活,多半是慣性使然。那麼,該改用什麼?
omega 與因素分析取向的信度
較為合理的替代品,是建立在因素分析(第十四章)之上的 omega 係數 (McDonald, 1999)。其想法相當直接:既然真實題目多半屬於同源模型(各題負荷不同),那就據實以一個因素模型估計各題的負荷與誤差變異,再據以計算信度。
設單因素同源模型 X_i = \lambda_i \eta + \varepsilon_i,其中 \eta 為潛在構念(令 \mathrm{Var}(\eta)=1),\lambda_i 為負荷,\varepsilon_i 為誤差且 \mathrm{Var}(\varepsilon_i)=\psi_i,各 \varepsilon 互不相關、亦與 \eta 無關。總分 X = \sum_i X_i 的真分數部分為 \big(\sum_i \lambda_i\big)\eta,故真分數變異為 \big(\sum_i \lambda_i\big)^2,誤差變異為 \sum_i \psi_i。信度(此處記為 \omega)為
在負荷相等(\lambda_i = \lambda)的特例下,\omega 退化為 alpha,可見 alpha 只是 omega 的一個特例。當負荷不等時,\omega 用上了各題不同的負荷資訊,因而比 alpha 更準確地估到信度,也不再受 tau 等值假設所限。
omega 有數種變體,其區別對詮釋至關重要。上式所算的是總信度 \omega_t,衡量的是總分變異中一切共同因素所占的比例。若構念其實是「一個一般因素加上若干群組因素」的階層結構,則可進一步計算階層 omega(\omega_h),專門估計一般因素單獨所解釋的比例。\omega_t 與 \omega_h 的落差本身極富診斷價值:當 \omega_t 高而 \omega_h 偏低時,即意味著總分雖然內部一致,卻反映了多個成分的混合,而非單一構念,此時把總分當成單一構念的測量便有失允當。這一分析須藉助雙因子模型(bifactor model,第十五章)進行,也再次印證信度與維度是兩個不可混為一談的問題。
尚有兩點須予補充。其一,對順序類別的題目,例如李克特量尺,以皮爾森相關為基礎的 alpha 與 omega 都會低估信度;較妥當的做法是改以多分相關(polychoric correlation)估計因素模型,再計算所謂的順序 omega。其二,理論上頗具吸引力的另一個量是最大下界(greatest lower bound, glb),它在所有滿足 CTT 的分解中給出最緊的信度下界;然而其實務上有一個麻煩,即在有限樣本中,glb 會因抽樣而系統性地高估,把抽樣雜訊也誤當作真分數變異,小樣本尤其嚴重 (Revelle & Zinbarg, 2009)。綜合以上,當前多數方法學者的建議相當一致:日常的量表發展,宜優先報告 omega,並輔以拔靴法(bootstrap)所得的信賴區間,而非 alpha 或 glb。
最後須提醒,omega 的準確性繫於其所依據的因素模型是否成立。若單因素模型與資料適配不佳,據以計算的 omega 便同樣可疑;因此在報告 omega 之前,理應先檢視因素模型的適配(第十五章)。這一點凸顯了信度與維度分析的內在連動:一個可信的 omega,預設了對測驗維度結構的正確理解,而非可以脫離模型單獨產出的數字。
信度是分數的屬性,不是測驗的屬性
第五章已初步指出,信度並非測驗的固定屬性,此處把這一觀念講到底,因為它極為常見、影響卻深遠。人們常說「這份量表的信度是 0.85」,彷彿信度是測驗本身的固有性質。實則不然。回到定義 \rho_{XX'} = \sigma_T^2/\sigma_X^2:它是一個比例,而分母中的真分數變異 \sigma_T^2,取決於測驗被施用於哪一群人。同一份測驗,用於能力分布很廣的群體(\sigma_T^2 大),信度偏高;用於同質性很高的群體(\sigma_T^2 小),信度偏低,因為訊號的變異本身縮小了。
這帶來兩個重要的實務結論。其一,信度必須連同其所適用的母體一併報告;把某研究算出的 alpha 直接搬用於另一個性質迥異的樣本,是站不住腳的。文獻中「信度概化」(reliability generalization)研究之所以有其必要,正是為了系統地檢視同一量表的信度如何隨樣本而變;這類研究彙整同一量表在眾多研究中的信度估計,把「信度是分數而非測驗的屬性」由一句原則,落實為可累積的跨研究證據,其方法將於第三十二章研究整合一章詳論。其二,相較於信度係數,測量標準誤(第五章)反而是較為「可攜」的精確度指標,因為它以分數的原始單位表達誤差大小,較不受母體變異範圍的影響。當代的信度報告規範因此要求:講清楚採用的是哪一個係數(alpha 抑或 omega)、算在哪一個母體之上、並附上信賴區間,而非丟出一個沒有脈絡的孤立數字。更進一步地,項目反應理論以訊息函數把「精確度」表達為能力水準的函數,使測量精度不再是全量尺上一個籠統的常數,而能隨分數所在的位置精細地變化,這是單一個信度係數所無法企及的(第十七章)。
評分者作為另一個誤差面向
前述各法主要處理紙筆測驗題目層次的誤差,但在許多情境中,分數並非由題目直接產生,而是由評分者的判斷而來,例如作文評分、臨床診斷、行為觀察編碼。此時最關鍵的誤差來源是評分者,而衡量「不同評分者對同一對象的評分有多一致」的指標,即評分者間信度(inter-rater reliability)。就本章的架構而言,這件事其實無須另起爐灶:評分者不過是又一個誤差面向,「換一位評分者,分數會不會變」與「換一組題目,分數會不會變」在邏輯上本是同一類問題。對連續評分,最常用的組內相關(intraclass correlation, ICC)其精神正與 CTT 的信度定義如出一轍,都是把變異拆為對象之間的真實差異與評分者所引入的誤差,再取前者的占比;對類別評分,則常用 Cohen’s kappa 一族的指標。
這些指標各有其版本與陷阱,例如 ICC 依「評分者是隨機抽取還是固定、關切單一還是多位平均、要求絕對一致還是排序一致」而分出多種形式,kappa 則在類別分布極不平衡時會出現弔詭的低值。這些係數家族的完整細節,以及如何為實作評量最佳化評分設計,屬於「評分作為一種測量方式」的專門課題,將於第二十六章實作評量一章完整處理。就本章而言,只須把握一個統整的觀點:評分者信度並非獨立於信度理論之外的另一套東西,而是同一套「訊號與誤差分離」邏輯在評分情境下的應用;而能把評分者、題目、場合等多個誤差來源統合於單一架構、並據以最佳化設計的,正是下一節的概化理論。
概化理論:把「誤差」拆開來看
至此,CTT 都把一切不準確一股腦塞入單一個誤差項 E。但真實的誤差其實有多個來源:題目抽得不同(換一組題目,分數會變)、評分者不同(換一位評分者,分數會變)、施測場合不同(換一天施測,分數會變)。把這些全數混為一個 E,等於放棄追問「誤差究竟來自哪裡」。概化理論(generalizability theory,簡稱 G 理論)正是為此而生 (Brennan, 2001; Cronbach et al., 1972)。它是 CTT 的推廣,借用變異數分析(ANOVA)的架構,把觀察分數的變異拆解為多個來源。在 G 理論的語彙裡,這些誤差來源稱為面向(facet);例如一個「受試者 \times 題目」的設計,便含有一個受試者面向與一個題目面向。
考慮每位受試者都作答同一組 n_i 題的設計。觀察分數 X_{pi}(受試者 p、題目 i)可分解為
即總平均、受試者主效果、題目主效果,以及受試者與題目的交互作用(在此設計中與殘差混同)。以 ANOVA 估出三個變異成分 \sigma_p^2、\sigma_i^2、\sigma_{pi,e}^2 後,可定義兩種係數:
兩者的差別在於:相對決策(例如排名)不受題目整體難度的影響,故分母不含 \sigma_i^2;絕對決策(例如是否達到某分數標準)則會受題目難度影響,分母必須納入 \sigma_i^2。當只有題目一個誤差面向、且做相對決策時,概化係數正好回到 CTT 的信度;而 \sigma_{pi,e}^2/n_i 隨題數 n_i 增加而縮小,這正是 Spearman-Brown 加長效果的一般化。
G 理論在實務上分兩步進行。第一步是 G 研究(G-study):蒐集資料、估出各個變異成分,回答「每一個誤差來源各占多少」。第二步是 D 研究(D-study):以這些變異成分為素材,去規劃未來測量的設計,回答「須用幾題、幾位評分者,才能把可靠度拉到目標水準」。這正是 G 理論最強大之處:它不僅診斷現況,更能為不同的測量設計進行假設性試算。舉例而言,若發現評分者才是主要的誤差來源,那麼與其拼命加題,不如增加評分者來得有效;反過來,若題目間的變異才是大宗,則加題方為正解。CTT 只能告訴研究者「信度不夠」,G 理論卻能進一步指出「不夠在哪裡、該往何處補」。
G 理論的設計還有兩層區分值得一提。其一是交叉(crossed)與巢狀(nested):若每位受試者都作答同一組題目,題目與受試者即為交叉;若不同受試者作答不同題組,題目便巢狀於受試者之下,此時某些變異成分將無法分離。其二是隨機(random)與固定(fixed)面向:若題目被視為由一個更大的題庫隨機抽取,則題目為隨機面向,結論可推廣至該題庫;若所關切的僅是這幾道特定題目,則題目為固定面向,不涉及對外推廣。這兩層區分,使 G 理論在概念上與第二十八章的多層次模型緊密相連,因為兩者其實都是在估計變異成分、並據以進行推論;事實上,G 理論的變異成分,如今多半正是透過混合效果模型來估計的。這一以變異成分刻畫信度的思路,在當代還有一個方興未艾的延伸:當資料變為密集縱貫的形式,也就是同一個人被高頻率地反覆測量時,信度的問題便自然分裂為兩層,即跨人的信度與個人內的信度。後者,也就是所謂多層次信度或個人內信度,追問的是「同一個人在不同時刻的重複測量,有多少是穩定的訊號、多少是瞬時的雜訊」,其估計邏輯正是概化理論變異成分分解在多層次架構下的翻版,這一當代議題將於第三十章討論密集縱貫資料時再作展開。
為使 G 理論的實用價值更為具體,設想一個作文評量:每位學生(受試者 p)撰寫若干篇作文(題目 i),每篇由數位評分者(評分者 r)評分,構成一個受試者 \times 題目 \times 評分者的三面向設計。G 研究會估出多個變異成分,涵蓋三個主效果與各交互作用。假設結果顯示,受試者變異占大宗、評分者變異甚小,而「受試者 \times 題目」的交互作用卻異常龐大,這便傳遞了一個明確的訊息:學生的表現高度依賴於題目,換一個題目排名就會洗牌,因此提升可靠度的關鍵不在增聘評分者,而在增加作文篇數。D 研究接著便可試算:在兩位評分者的前提下,究竟須考幾篇作文,概化係數才能達到 0.80。這種「先診斷誤差來源,再據以最佳化設計」的能力,是單一個 alpha 永遠無法提供的,也正是概化理論最核心的貢獻。
小結:一份給實務的建議清單
把本章收攏為幾條可操作的建議。第一,不宜再反射性地只報告 alpha;在絕大多數情況下,改報 omega 更貼近真實的信度,因為它不受 tau 等值假設所限,且能同時處理順序資料與階層結構。第二,信度是分數在特定母體上的屬性,報告時須交代母體、附上信賴區間,並一併報告測量標準誤,因為後者對個人層次的分數解讀更為直接。第三,當測量涉及多個誤差來源(題目、評分者、場合)時,宜以概化理論把誤差拆開,並以 D 研究來規劃設計,這遠比單一個 alpha 有用。
最後須提醒一件根本的事:信度再高,也只是「測得穩不穩」,完全不保證「測得對不對」。一把刻度均勻、零點卻錯位的尺,量起來非常一致(高信度),量到的卻不是所欲測量之物(無效度)。信度是效度的必要條件,卻遠非充分條件。下一章,討論便轉向這個更難、也更重要的問題,也就是效度。