信度:從係數到概化理論
第五章證明了一件優雅的事:信度等於兩份平行測驗分數的相關。然而這一結果在實務上隨即遭遇困難,因為要製作兩份「完全平行」的測驗幾乎是不可能的,甚至連讓同一個人在不受干擾的情況下重考一次,都相當棘手。那麼,信度究竟該如何估計?本章正是要回答這個問題。討論將從三種傳統做法談起,一路走到心理計量史上最著名、卻也最常被誤解的一個數字,也就是 Cronbach’s alpha,說明它為何往往低估信度,又為何「alpha 高」並不等於「量表只測一個構念」。接著介紹較為合理的替代品 omega,最後把整個信度概念推廣至概化理論,學會把單一個「誤差」拆解為多個來源分別處理。本章的技術密度較高,但每一條公式背後的直覺,都會先予釐清,再進入推導。
貫穿全章的一條主線是:不同的信度估計法,其實對應著對「誤差來自哪裡」的不同想像。看清這一點,便能理解為何同一份測驗、同一批人,換一種估計法就得到不同的信度,也能理解概化理論何以是這一系列方法的自然歸宿。
三種傳統的信度估計法
信度的定義 \rho_{XX'} = \sigma_T^2/\sigma_X^2 雖然簡潔,卻無法直接拿來計算,因為分子裡的真分數變異看不見,也量不到。實務上只能繞道而行:設法製造一種「同一件事被測到兩次」的情境,再由兩次分數的一致程度反推信度。難處在於,「兩次」可以有很多種意思。隔一段時間再考一次是兩次,換一份題目再考一次也是兩次,而選擇哪一種重複方式,等於默默決定了什麼算誤差、什麼不算。歷史上發展出的三種主要策略,即再測、複本與內部一致性,正是這三種不同想像的產物,各自對應著對「誤差來源」的不同界定,而這一界定往往比係數的數值本身更值得留意。讀完本節,應能說出每一種係數把什麼算進了誤差,也能理解為何同一份測驗會有好幾個都站得住腳、卻互不相等的信度。
第一種是再測信度(test-retest reliability)。同一份測驗,相隔一段時間後讓同一批人再考一次,兩次分數的相關即為信度的估計,稱為穩定係數(coefficient of stability)。它把「時間」視為誤差的來源:凡是兩次施測之間造成分數波動的因素,都被算作誤差。這也正是它的難處所在。兩次之間,受試者可能真的改變了,無論是學習、成熟或遺忘,而這種真實的變化會被誤判為誤差;反之,若間隔過短,受試者可能記得上次的作答而人為地拉高相關,導致高估。換言之,再測信度先天地混淆了「測量誤差」與「真實變化」,而兩者的分野,正是第二十九章縱貫建模的核心議題。
第二種是複本信度(alternate-forms reliability)。研究者準備兩份內容不同、卻測量同一構念的測驗,即複本,讓同一批人各考一份,兩份分數的相關即為估計,稱為等值係數(coefficient of equivalence)。它把「題目的抽取」視為誤差的來源:換一組題目所造成的分數變動,即為此處所關切的誤差。相較於再測,它在概念上較為乾淨,代價卻高昂,因為要編製兩份真正等值的測驗極其困難。若同時跨越時間與複本施測,所得的等值穩定係數,則同時把時間與題目兩個來源都納入誤差,因而通常最為保守。
第三種、也是今日最常用的,是內部一致性(internal consistency)。它最精巧之處在於:只須施測一次,便可由「題目與題目之間的關係」推估信度。其背後的邏輯是,若所有題目都測量同一構念,它們彼此便應高度相關;題間相關愈高,總分之中的訊號成分便愈大。它把誤差界定為「題目特定性」,也就是各題不共享的部分。折半法(split-half)是最早的一種做法:把測驗拆成兩半,計算兩半分數的相關。然而拆法本身即藏著一個問題,正好帶出下一節的主角。值得補充的是,Guttman (1945) 曾系統地推導出六個僅憑單次施測即可計算的信度下界,其中第三個下界 \lambda_3 恰好等於稍後要談的 Cronbach’s alpha;這說明 alpha 並非橫空出世,而是內部一致性這一整個下界家族中的一員。
把三者並置而觀,一個關鍵的觀念便浮現出來:所謂「信度」並不是單一個數字,而是相對於某一組被視為誤差的來源而定義的。同一份測驗,若只把題目抽取算作誤差,得到的是內部一致性;若把時間也算進來,得到的是穩定係數;兩者未必相等,而它們的差距本身即富含資訊。這一洞見,正是概化理論得以把各種誤差來源統一處理的思想起點。
Spearman-Brown:加長測驗如何提升信度
折半法有一個先天的問題:它算出的是「半份測驗」的信度,而非整份測驗的信度。而測驗愈長、題目愈多,信度通常愈高,因為隨機誤差在加總時會相互抵消,訊號卻持續累積。因此直接以折半相關充當信度,會系統性地低估。解決之道是 Spearman-Brown 加長公式,它讓研究者得以由「半份的信度」推算「整份的信度」,更一般地,還能預測把測驗加長 k 倍後的信度。這條公式由 Spearman 與 Brown 於一九一○年同期各自獨立提出 (Brown, 1910; Spearman, 1910)。
設一份測驗的信度為 \rho,今將其加長為原來的 k 倍,即把 k 份彼此平行的複本合併為一份長測驗。此長測驗的總分為 k 份平行測驗之和,其真分數與誤差的變異以不同速度成長:因各複本測到相同的真分數 T,合併真分數為 kT,變異為 k^2\sigma_T^2;因各複本的誤差互不相關且變異相等,合併誤差變異僅為 k\sigma_E^2。故加長後的信度為
將分子分母同除以 \sigma_X^2 = \sigma_T^2+\sigma_E^2,並代入 \rho = \sigma_T^2/\sigma_X^2 與 1-\rho = \sigma_E^2/\sigma_X^2,得
折半法的校正是 k=2 的特例:\rho_{\text{full}} = 2\rho_{\text{half}}/(1+\rho_{\text{half}})。
這條公式有兩項實用的啟示。其一,它讓折半估計得以校正回整份測驗的信度。其二,它是測驗編製的規劃工具:若已知現有測驗信度為 0.7、目標為 0.9,可反解出須把測驗加長幾倍。代入公式可得 k = \rho^{*}(1-\rho)/[\rho(1-\rho^{*})] = 0.9 \times 0.3 / (0.7 \times 0.1) \approx 3.86,也就是說,測驗長度須增為原來的近四倍。這個數字本身即帶有警訊:信度的提升遵循報酬遞減,愈接近 1 就愈昂貴。而且公式假設新增的題目與原有題目平行,亦即品質相同;現實中若不斷加題,題目品質往往下降,過長的測驗又會引入疲勞效應,因此信度的提升終究有其上限。當加題的邊際成本過高時,改善題目品質、或如後文所述改採增加評分者等其他設計,往往更為有效。
Cronbach’s alpha:最常用、也最常被誤解的係數
折半法還有另一個麻煩:一份測驗有許多種拆成兩半的方式,每一種拆法給出的折半信度都不相同,究竟該採用哪一個?Cronbach (1951) 的 alpha 係數優雅地化解了這個難題,因為它恰好等於「所有可能折半方式的信度之平均」。alpha 只須施測一次、用上全部題目即可計算:
其中 k 為題數,\sigma_i^2 為第 i 題的變異,\sigma_X^2 為總分的變異。就直觀而言,括號內衡量的是「各題變異之總和相對於總分變異」有多小,也就是題目之間「共享」了多少變異;當題目高度相關時,\alpha 趨近 1。這個比值為何能衡量共享,看兩個極端最清楚。若各題彼此完全無關,總分變異恰好等於各題變異之和,括號內為零,\alpha 也是零,意思是把這些題目加起來並未累積出任何共同的訊號。反之,題間相關愈高,共變就把總分變異推得愈大,遠超過各題變異之和,括號內便愈接近 1。至於前面的 k/(k-1),補的是一塊被漏掉的東西:括號內只加總了共變矩陣上非對角的 k(k-1) 格,對角線那 k 格各題自身的變異被排除在外,乘上 k/(k-1) 等於把對角線也按平均共變的水準填回去,題數愈多,這個修正愈接近 1。設想一份五題的課堂學習投入量表,以五點量尺作答,各題變異皆約 1.0,合計 5.0,而總分變異為 12.5;括號內即為 1-5.0/12.5=0.6,讀作總分變異中有六成來自題目之間的共變,四成是各題自己的部分,再乘以 5/4 這個修正,便得 \alpha=0.75。
針對二元計分(對與錯)的題目,alpha 會化簡為更早提出的 Kuder-Richardson 20 號公式 (Kuder & Richardson, 1937);若進一步假設各題難度相等,則得到更簡便的 KR-21。alpha 之所以風行,正因它太過方便:一次施測、一條公式。然而也正因為方便,它遭到嚴重的誤解與濫用。欲看清問題,須先弄清楚 alpha 究竟等於什麼。
把總分寫成各題之和,X = \sum_i X_i。因各題誤差互不相關,跨題共變僅來自真分數,\mathrm{Cov}(X_i,X_j) = \mathrm{Cov}(T_i,T_j)(i \neq j)。於是 alpha 可改寫為
而測驗真分數變異為 \sigma_T^2 = \sum_i \mathrm{Var}(T_i) + \sum_{i \neq j}\mathrm{Cov}(T_i,T_j),信度 \rho_{XX'} = \sigma_T^2/\sigma_X^2。
本質 tau 等值下兩者相等。 若 T_i = T + a_i,則各 \mathrm{Var}(T_i) = \mathrm{Var}(T) \equiv v、各 \mathrm{Cov}(T_i,T_j) = v。故 \sum_{i\neq j}\mathrm{Cov}(T_i,T_j) = k(k-1)v,代入得
同時 \sigma_T^2 = kv + k(k-1)v = k^2 v,故 \rho_{XX'} = k^2 v/\sigma_X^2 = \alpha。 一般情況下 alpha 是下界。 當題目偏離 tau 等值(真分數變異或負荷不等)時,可證 \alpha \le \rho_{XX'},即 alpha 系統性地低估信度,且低估程度隨題目間的異質性而增加(完整證明見 (Novick & Lewis, 1967))。
本質 tau 等值這個條件,值得用白話再說一遍。它要求各題的真分數彼此只差一個常數,也就是每一題對構念變化的敏感度相同,題與題之間只有寬嚴之別,沒有靈敏度之別;換成因素模型的語言,就是各題的負荷相等。現實中的量表幾乎不可能這樣整齊,一份量表裡總有幾題切中要害、幾題只沾到邊。當負荷參差時,alpha 仍依「所有題目一樣好」的前提,拿一個平均的共變去代表全部的題間關係,於是低估了高負荷題目之間實際上更強的連結,也就低估了總分裡的訊號。這正是下界性質的來源:alpha 偏低並非保守的報告習慣,而是假設與現實落差的必然結果,落差愈大,低估愈多。
須強調的是,上述推導有一個關鍵前提,即各題誤差互不相關。這一前提在真實資料中常被違反,例如相鄰題目共用同一段題幹、或若干題目共享一種作答方法,都會使誤差之間產生正相關。一旦誤差相關,alpha 的「下界」性質便可能反轉,使 alpha 反而高估信度。因此 alpha 偏低固然常見,偏高卻也並非不可能,而後者往往更為隱蔽,因為它披著「信度良好」的外衣。
回到那份五題的課堂學習投入量表,把負荷攤開來看,就量得出低估有多大。假定五題的標準化負荷分別為 0.9、0.8、0.5、0.3、0.2:前兩題問的是上課時的專注與參與,直接命中構念;後兩題問的是課後是否找同學討論、是否額外補充資料,與投入雖然有關,卻摻進了不少別的東西。依 omega 公式,這份量表的信度約為 0.70,意思是總分變異中有七成來自受測者在學習投入上的真實差異;alpha 卻只給出約 0.65,因為它把負荷 0.9 與負荷 0.2 的題目一視同仁。0.70 與 0.65 的差距看似不大,但若採用 0.70 這條慣用門檻,同一份量表在 omega 之下堪用,在 alpha 之下卻被判為信度不足。負荷愈參差,這個缺口愈寬;而在量表發展初期的篩題階段,這類誤判尤其容易造成誤刪好題。
alpha 的系統性誤用
弄懂了 alpha 在數學上等於什麼,就能看穿環繞著它的幾個迷思 (Revelle & Zinbarg, 2009; Sijtsma, 2009)。這些迷思之所以難以根除,並不是因為它們有多精巧,而是因為 alpha 實在太容易取得:軟體按一個鍵就回傳一個介於 0 與 1 之間的數字,而人對現成的數字,總傾向於賦予它比應得更多的意義。前一節的推導其實已把界線劃得很清楚:alpha 是在「各題誤差互不相關,且各題真分數彼此只差一個常數」這組條件下的信度;一旦離開這組條件,它就退回為總分變異中題間共享成分的一個摘要而已。以下三個常見的說法,都是把這個摘要當成了它並不是的東西。
第一個迷思是,alpha 高即代表量表為單維。這是錯的。alpha 主要由題數與平均題間共變所決定;題目一多,即使構念其實橫跨數個維度,alpha 照樣可以很高。反之,一份真正單維但題數偏少的量表,alpha 也可能偏低。一個假設性的算例可以把這件事說死。設想一份二十題的大學課程評量問卷,其中十題問教師的教學表現,十題問課程教材與作業負擔;兩組題目各自內部的相關約為 0.5,跨組的相關卻只有 0.1,也就是兩個維度分得相當開。把這些數字代入,平均題間相關約為 0.29,\alpha 卻高達 0.89。任何人看到 0.89 都會說這份問卷內部一致性極佳,但它明明測了兩個不同的東西;alpha 撐得住,靠的是二十這個題數,而不是結構的單純。alpha 根本不是維度的指標,欲判斷是否單維,須訴諸因素分析(第十四章)。
第二個迷思是,alpha 就是信度。這並不精確。如前所示,唯有在本質 tau 等值這個相當嚴格的條件之下,alpha 才等於信度;而真實量表幾乎都屬同源(負荷不等)而非 tau 等值,此時 alpha 會系統性地低估。也就是說,研究者習慣把 alpha 當作信度來報告,實際報的通常是一個偏保守的下界。
第三個迷思是,alpha 愈高愈好。這同樣不對。過高的 alpha,例如 0.95 以上,往往是題目高度重複、彼此換句話說的結果,這在測量上反而是冗餘,可能窄化了構念的涵蓋面。alpha 適中、而題目又能涵蓋構念的不同面向,通常才是較理想的狀態。
耐人尋味的是,對 alpha 最深刻的反省,來自 Cronbach 本人。在晚年的一篇回顧中,Cronbach & Shavelson (2004) 坦言,他早已不認為 alpha 是判斷信度的最佳方式,並主張應把它放進概化理論這個更寬廣的架構中來看待。綜合這些批評,晚近的方法學文獻,例如 McNeish (2018),已明確呼籲研究者放下對 alpha 的慣性依賴,改採更貼近真實測量結構的估計。一言以蔽之,alpha 既不是良好的單維指標,在一般情況下也不是良好的信度估計;它之所以至今仍普遍存活,多半是慣性使然。那麼,該改用什麼?
omega 與因素分析取向的信度
較為合理的替代品,是建立在因素分析(第十四章)之上的 omega 係數 (McDonald, 1999)。其想法相當直接:既然真實題目多半屬於同源模型(各題負荷不同),那就據實以一個因素模型估計各題的負荷與誤差變異,再據以計算信度。
設單因素同源模型 X_i = \lambda_i \eta + \varepsilon_i,其中 \eta 為潛在構念(令 \mathrm{Var}(\eta)=1),\lambda_i 為負荷,\varepsilon_i 為誤差且 \mathrm{Var}(\varepsilon_i)=\psi_i,各 \varepsilon 互不相關、亦與 \eta 無關。總分 X = \sum_i X_i 的真分數部分為 \big(\sum_i \lambda_i\big)\eta,故真分數變異為 \big(\sum_i \lambda_i\big)^2,誤差變異為 \sum_i \psi_i。信度(此處記為 \omega)為
在負荷相等(\lambda_i = \lambda)的特例下,\omega 退化為 alpha,可見 alpha 只是 omega 的一個特例。當負荷不等時,\omega 用上了各題不同的負荷資訊,因而比 alpha 更準確地估到信度,也不再受 tau 等值假設所限。
用前面那份五題量表把 omega 算一遍,兩者的分歧便一目了然。負荷之和為 0.9+0.8+0.5+0.3+0.2=2.7,故真分數變異為 2.7^2=7.29;各題誤差變異為 1-\lambda_i^2,依序是 0.19、0.36、0.75、0.91、0.96,合計 3.17。兩者相加為 10.46,於是 \omega = 7.29/10.46 \approx 0.70。關鍵全在分子:(\sum_i \lambda_i)^2 讓每一題按自身的負荷貢獻訊號,負荷 0.9 的題目所貢獻的權重是負荷 0.2 那題的四倍有餘;alpha 則因假設負荷相等,只能拿一個平均值去代表全部五題。兩者的差別,說到底就落在這一步。
omega 有數種變體,其區別對詮釋至關重要。上式所算的是總信度 \omega_t,衡量的是總分變異中一切共同因素所占的比例。若構念其實是「一個一般因素加上若干群組因素」的階層結構,則可進一步計算階層 omega(\omega_h),專門估計一般因素單獨所解釋的比例。\omega_t 與 \omega_h 的落差本身極富診斷價值:當 \omega_t 高而 \omega_h 偏低時,即意味著總分雖然內部一致,卻反映了多個成分的混合,而非單一構念,此時把總分當成單一構念的測量便有失允當。這一分析須藉助雙因子模型(bifactor model,第十五章)進行,也再次印證信度與維度是兩個不可混為一談的問題。
尚有兩點須予補充。其一,對順序類別的題目,例如李克特量尺,以皮爾森相關為基礎的 alpha 與 omega 都會低估信度;較妥當的做法是改以多分相關(polychoric correlation)估計因素模型,再計算所謂的順序 omega。其二,理論上頗具吸引力的另一個量是最大下界(greatest lower bound, glb),它在所有滿足 CTT 的分解中給出最緊的信度下界;然而其實務上有一個麻煩,即在有限樣本中,glb 會因抽樣而系統性地高估,把抽樣雜訊也誤當作真分數變異,小樣本尤其嚴重 (Revelle & Zinbarg, 2009)。綜合以上,當前多數方法學者的建議相當一致:日常的量表發展,宜優先報告 omega,並輔以拔靴法(bootstrap)所得的信賴區間,而非 alpha 或 glb。
最後須提醒,omega 的準確性繫於其所依據的因素模型是否成立。若單因素模型與資料適配不佳,據以計算的 omega 便同樣可疑;因此在報告 omega 之前,理應先檢視因素模型的適配(第十五章)。這一點凸顯了信度與維度分析的內在連動:一個可信的 omega,預設了對測驗維度結構的正確理解,而非可以脫離模型單獨產出的數字。而在模型之外,還有一個同樣關鍵卻更常被略過的條件,也就是這個係數究竟算在誰身上,這正是下一節要處理的問題。
信度是分數的屬性,不是測驗的屬性
第五章已初步指出,信度並非測驗的固定屬性,此處把這一觀念講到底,因為它極為常見、影響卻深遠。人們常說「這份量表的信度是 0.85」,彷彿信度是測驗本身的固有性質。實則不然。回到定義 \rho_{XX'} = \sigma_T^2/\sigma_X^2:它是一個比例,而分母中的真分數變異 \sigma_T^2,取決於測驗被施用於哪一群人。同一份測驗,用於能力分布很廣的群體(\sigma_T^2 大),信度偏高;用於同質性很高的群體(\sigma_T^2 小),信度偏低,因為訊號的變異本身縮小了。
這帶來兩個重要的實務結論。其一,信度必須連同其所適用的母體一併報告;把某研究算出的 alpha 直接搬用於另一個性質迥異的樣本,是站不住腳的。文獻中的「信度概化」(reliability generalization)研究正是為此而設:它彙整同一量表在眾多研究中的信度估計,系統地檢視信度如何隨樣本而變,把「信度是分數而非測驗的屬性」由一句原則,落實為可累積的跨研究證據,其方法將於第三十二章研究整合一章詳論。其二,相較於信度係數,測量標準誤(第五章)反而是較為「可攜」的精確度指標,因為它以分數的原始單位表達誤差大小,較不受母體變異範圍的影響。當代的信度報告規範因此要求:講清楚採用的是哪一個係數(alpha 抑或 omega)、算在哪一個母體之上、並附上信賴區間,而非丟出一個沒有脈絡的孤立數字。更進一步地,項目反應理論以訊息函數把「精確度」表達為能力水準的函數,使測量精度不再是全量尺上一個籠統的常數,而能隨分數所在的位置精細地變化,這是單一個信度係數所無法企及的(第十七章)。
評分者作為另一個誤差面向
前述各法主要處理紙筆測驗題目層次的誤差,但在許多情境中,分數並非由題目直接產生,而是由評分者的判斷而來,例如作文評分、臨床診斷、行為觀察編碼。此時最關鍵的誤差來源是評分者,而衡量「不同評分者對同一對象的評分有多一致」的指標,即評分者間信度(inter-rater reliability)。就本章的架構而言,這件事其實無須另起爐灶:評分者不過是又一個誤差面向,「換一位評分者,分數會不會變」與「換一組題目,分數會不會變」在邏輯上本是同一類問題。對連續評分,最常用的組內相關(intraclass correlation, ICC)其精神正與 CTT 的信度定義如出一轍,都是把變異拆為對象之間的真實差異與評分者所引入的誤差,再取前者的占比;對類別評分,則常用 Cohen’s kappa 一族的指標。
這些指標各有其版本與陷阱,例如 ICC 依「評分者是隨機抽取還是固定、關切單一還是多位平均、要求絕對一致還是排序一致」而分出多種形式,kappa 則在類別分布極不平衡時會出現弔詭的低值。這些係數家族的細節,以及如何為實作評量最佳化評分設計,屬於「評分作為一種測量方式」的專門課題,將於第二十六章完整處理。就本章而言,只須把握一個統整的觀點:評分者信度並非獨立於信度理論之外的另一套東西,而是同一套「訊號與誤差分離」邏輯在評分情境下的應用;而能把評分者、題目、場合等多個誤差來源統合於單一架構、並據以最佳化設計的,正是下一節的概化理論。
概化理論:把「誤差」拆開來看
至此,CTT 都把一切不準確一股腦塞入單一個誤差項 E。但真實的誤差其實有多個來源:題目抽得不同(換一組題目,分數會變)、評分者不同(換一位評分者,分數會變)、施測場合不同(換一天施測,分數會變)。把這些全數混為一個 E,等於放棄追問「誤差究竟來自哪裡」。概化理論(generalizability theory,簡稱 G 理論)正是為此而生 (Brennan, 2001; Cronbach et al., 1972)。它是 CTT 的推廣,借用變異數分析(ANOVA)的架構,把觀察分數的變異拆解為多個來源。在 G 理論的語彙裡,這些誤差來源稱為面向(facet);例如一個「受試者 \times 題目」的設計,便含有一個受試者面向與一個題目面向。
考慮每位受試者都作答同一組 n_i 題的設計。觀察分數 X_{pi}(受試者 p、題目 i)可分解為
即總平均、受試者主效果、題目主效果,以及受試者與題目的交互作用(在此設計中與殘差混同)。以 ANOVA 估出三個變異成分 \sigma_p^2、\sigma_i^2、\sigma_{pi,e}^2 後,可定義兩種係數:
兩者的差別在於:相對決策(例如排名)不受題目整體難度的影響,故分母不含 \sigma_i^2;絕對決策(例如是否達到某分數標準)則會受題目難度影響,分母必須納入 \sigma_i^2。當只有題目一個誤差面向、且做相對決策時,概化係數正好回到 CTT 的信度;而 \sigma_{pi,e}^2/n_i 隨題數 n_i 增加而縮小,這正是 Spearman-Brown 加長效果的一般化。
G 理論在實務上分兩步進行。第一步是 G 研究(G-study):蒐集資料、估出各個變異成分,回答「每一個誤差來源各占多少」。第二步是 D 研究(D-study):以這些變異成分為素材,去規劃未來測量的設計,回答「須用幾題、幾位評分者,才能把可靠度拉到目標水準」。若評分者才是主要的誤差來源,增加評分者便遠比拼命加題有效;反之,若題目所引入的變異才是大宗,加題方為正解。CTT 只能告訴研究者「信度不夠」,G 理論卻能進一步指出「不夠在哪裡、該往何處補」。
G 理論的設計還有兩層區分值得一提。其一是交叉(crossed)與巢狀(nested):若每位受試者都作答同一組題目,題目與受試者即為交叉;若不同受試者作答不同題組,題目便巢狀於受試者之下,此時某些變異成分將無法分離。其二是隨機(random)與固定(fixed)面向:若題目被視為由一個更大的題庫隨機抽取,則題目為隨機面向,結論可推廣至該題庫;若所關切的僅是這幾道特定題目,則題目為固定面向,不涉及對外推廣。這兩層區分,使 G 理論在概念上與第二十八章的多層次模型緊密相連,因為兩者其實都是在估計變異成分、並據以進行推論;事實上,G 理論的變異成分,如今多半正是透過混合效果模型來估計的。這一以變異成分刻畫信度的思路,在當代還有一個方興未艾的延伸:當資料變為密集縱貫的形式,也就是同一個人被高頻率地反覆測量時,信度的問題便自然分裂為兩層,即跨人的信度與個人內的信度。後者,即所謂多層次信度,追問的是「同一個人在不同時刻的重複測量,有多少是穩定的訊號、多少是瞬時的雜訊」,其估計邏輯正是概化理論變異成分分解在多層次架構下的翻版,這一當代議題將於第三十章討論密集縱貫資料時再作展開。
為使 G 理論的實用價值更為具體,設想一項高中作文評量:每位學生(受試者 p)撰寫若干篇作文(題目 i),每篇由數位評分者(評分者 r)獨立評分,構成一個受試者 \times 題目 \times 評分者的三面向設計。G 研究會估出七個變異成分,包括三個主效果、三個兩兩交互作用,以及三階交互作用與殘差。假定各成分換算成百分比之後是這樣:受試者主效果占四成,代表學生之間寫作能力的真實差異;題目主效果占百分之四,表示各作文題的整體難度相差不大;評分者主效果占百分之二,表示評分者之間並無明顯的寬嚴落差;「受試者 \times 題目」的交互作用則占了三成,三階交互作用與殘差占兩成,其餘兩個交互作用合計不到百分之五。
這組數字說了一個很清楚的故事:評分者這個面向幾乎不構成問題,真正的亂源是學生與題目的交互作用。學生的表現高度依賴於題目,寫記敘文名列前茅的人,換成論說文可能就掉到中段,排名於是隨題目而洗牌。D 研究接著便可據此試算不同設計的後果:在現行的兩篇作文、兩位評分者之下,概化係數約為 0.65;若把評分者加倍為四位、作文仍維持兩篇,也只升到約 0.69,因為評分者本來就不是誤差的大宗;但若維持兩位評分者、把作文增為五篇,概化係數便躍升至約 0.81。同樣是追加成本,投在題目上的效益遠高於投在評分者上。這種「先診斷誤差來源,再據以最佳化設計」的能力,是單一個 alpha 永遠無法提供的,也正是概化理論最核心的貢獻。
小結:一份給實務的建議清單
把本章收攏為幾條可操作的建議。第一,不宜再反射性地只報告 alpha;在絕大多數情況下,改報 omega 更貼近真實的信度,因為它不受 tau 等值假設所限,且能同時處理順序資料與階層結構。第二,信度是分數在特定母體上的屬性,報告時須交代母體、附上信賴區間,並一併報告測量標準誤,因為後者對個人層次的分數解讀更為直接。第三,當測量涉及多個誤差來源(題目、評分者、場合)時,宜以概化理論把誤差拆開,並以 D 研究來規劃設計,這遠比單一個 alpha 有用。
最後須提醒一件根本的事:信度再高,也只是「測得穩不穩」,完全不保證「測得對不對」。一把刻度均勻、零點卻錯位的尺,量起來非常一致(高信度),量到的卻不是所欲測量之物(無效度)。信度是效度的必要條件,卻遠非充分條件。下一章,討論便轉向這個更難、也更重要的問題,也就是效度。