第 13 章 缺失資料的原理與處理
第三部 統計推論與研究設計的方法基礎
13Chapter

缺失資料的原理與處理

真實的資料,永遠有缺。受訪者跳過一題敏感問題、參與者中途退出研究、儀器某次故障沒能記錄,無論研究者多麼小心,攤開資料總會看到一格格的空白。面對這些空白,最直覺的反應是把有缺漏的那幾筆整筆刪除,用「乾淨」的剩餘資料繼續分析。這個反應看似無害,實則可能悄悄地把每一個結論都帶偏。本章要說明的是:缺失資料不是一個「掃到地毯底下」就好的麻煩,而是一個「該如何處理,取決於它為何而缺」的問題;而現代方法,也就是完全訊息最大概似與多重插補,能在傳統刪除法失效之處,救回有效的推論。

本章的一條暗線,是第十二章埋下的最大概似與模型評鑑,將在此化為處理缺失的兩大引擎;而第八、九章關於偏誤與檢定力的關切,也會在「刪除為何危險」的討論中再度浮現。

缺失無所不在,而刪除很危險

先看看隨手刪除的代價。最常見的做法稱為列表刪除(listwise deletion),又稱完整個案分析:只要一筆資料在任何一個變項上有缺,就把整筆丟棄。它有兩個代價。第一個是浪費:辛苦蒐集的資料,可能因為零星的缺漏被大量丟棄,樣本數與檢定力(第九章)白白流失。設想一份 20 題的問卷,若每題各有 5% 的人漏答,即使漏答完全隨機,最後「每一題都答滿」的完整個案,也可能只剩下約六成,因為 0.95^{20}\approx 0.36,缺漏的機會會隨題數累積而放大。

但第二個代價更為嚴重,那就是偏誤。舉一個具體的例子:假設在一份憂鬱量表上,愈憂鬱的人愈傾向跳過某些題目。若把這些人刪掉,剩下的樣本便系統性地偏向「比較不憂鬱」的人,於是所算出的平均憂鬱程度會被低估,而且無論樣本多大,這個偏誤都不會消失。刪除法之所以危險,正在於它把「為何而缺」這個關鍵問題,粗暴地當成了「反正與結論無關」,而這個假設往往是錯的。

在進入原理之前,還須認識缺失的「型態」(missing data pattern),它與稍後要談的「機制」是兩回事。若只有單一變項有缺,稱為單變項型態;若把變項適當排序後,缺失呈階梯狀,也就是一旦某變項缺失、其後變項也全缺,稱為單調型態,縱貫研究的中途流失即屬此類;若缺失散布得毫無規律,則為任意型態。型態描述的是「哪些格子空著」,機制描述的是「為何空著」,前者可由資料直接看出,後者卻須靠推理與假設,這正是下一節的主題。

為什麼資料會缺?Rubin 的三種機制

處理缺失資料的一切,都繫於一個核心洞見:能正當地做什麼,取決於資料「為何」而缺。上一節談的型態只告訴研究者空白落在哪裡,並不足以判斷這些空白能否被安全地略過。同樣是流失兩成,若流失純屬偶然,剩下的八成仍是母體的縮影;若流失的正是狀況最差的那一群,剩下的八成便是一個被篩選過的樣本,算出來的平均數自然偏低。這個區分由 Rubin (1976) 形式化,他不從「缺了多少」著眼,而從「缺失與資料之間的依賴關係」著眼,把缺失機制分為三類,如下面的方塊所示。

推導方塊缺失機制的形式定義

令完整資料為 \mathbf{Y} = (\mathbf{Y}_{\text{obs}}, \mathbf{Y}_{\text{mis}}),分別是「觀測到的部分」與「缺失的部分」;再令 \mathbf{R} 為缺失指示變項(記錄每一格是否缺失)。三種機制以「\mathbf{R} 依賴於什麼」來區分:

完全隨機缺失(MCAR):P(\mathbf{R}\mid\mathbf{Y}) = P(\mathbf{R})。缺不缺,與任何變項都無關,純屬隨機。例:實驗室某天跳電,隨機遺失了一批資料。

隨機缺失(MAR):P(\mathbf{R}\mid\mathbf{Y}) = P(\mathbf{R}\mid\mathbf{Y}_{\text{obs}})。在控制了「觀測到的資料」之後,缺失與「缺失的值本身」無關。例:男性比女性更常跳過情緒題,只要性別有被觀測到,缺失就可由觀測變項解釋。

非隨機缺失(MNAR):即使控制了 \mathbf{Y}_{\text{obs}},缺失仍依賴於 \mathbf{Y}_{\text{mis}} 本身。例:愈憂鬱的人愈會跳過憂鬱題,而正是那個沒被記錄到的憂鬱程度,決定了他跳不跳。

MCAR 最單純但罕見;MAR 是現代方法賴以有效的關鍵假設;MNAR 最棘手。

這三個名稱之中,MAR 這個名字取得極差,是本章最容易被誤解的一處。「隨機缺失」聽起來像是「缺得很隨機」,但它真正的意思是「在觀測到的資料之上,缺失才是隨機的」,講的是條件式的隨機,而不是無條件的隨機。把三者並排來看就清楚了:缺失所依賴的東西,從「什麼都不依賴」(MCAR),走到「只依賴看得見的」(MAR),再走到「還依賴看不見的」(MNAR)。

用一個貫穿本章的情境會更具體。設想一項追蹤大學生心理健康的縱貫研究:第一波在大一上學期,1,000 名學生全數完成 CES-D 憂鬱量表;一年後的第二波卻有 200 人沒有回來,流失兩成。若流失是因為邀請信在某週因系統故障隨機漏寄,誰收不到與任何變項都無關,這是 MCAR。若流失是因為第一波分數偏高的學生比較不願再填,例如第一波達 16 分以上者的回覆率是 65%、未達者是 85%,那麼在控制了第一波分數之後,回不回來就與第二波的分數無關,這是 MAR,而第一波分數正是那把解釋缺失的鑰匙。若流失是因為「這一年憂鬱惡化的人不願再面對量表」,決定缺失的是第二波分數本身,而那個分數恰恰沒被記錄下來,這就是 MNAR。三種情境攤開來的資料完全一樣,都是 200 格空白,差別只在背後的故事。

這裡有一個技術上的補充值得一提,即可忽略性(ignorability)。這個詞常被誤讀成「缺失可以忽略不管」,其實可以被忽略的不是缺失本身,而是「缺失如何發生」的那個模型。可忽略性要求兩個條件同時成立:其一是缺失為 MAR,也就是缺失能被觀測資料完全解釋;其二是缺失機制的參數與資料模型的參數彼此獨立,也就是「誰會漏答」的那組參數,不會反過來透露「憂鬱的平均是多少」。兩者兼備時,缺失機制便是「可忽略的」,研究者只要對觀測資料正確地做概似推論即可。這正是 FIML 與多重插補之所以有效的理論基礎:它們並不去建模缺失機制,而是在可忽略性成立時,直接對觀測資料做有效的推論。反之,MNAR 之下缺失不可忽略,就必須明確地為缺失機制建模,這也是它棘手的根源。

還有一個令人不安、卻必須正視的事實:研究者通常無法用資料本身,去檢驗到底是 MAR 還是 MNAR。原因很簡單,要區分它們,必須知道「那些缺失的值」與缺失之間的關係,但那些值正好就是缺失的、看不到的。這個「不可檢驗性」是本章反覆出現的主題;它意味著,缺失機制在很大程度上,是一個需要靠實質判斷、而非統計檢定來論證的假設。相對地,MCAR 倒是可以做部分檢驗:Little (1988) 提出的檢定,比較不同缺失型態的個案在觀測變項上的平均是否一致,若顯著不同便可拒絕 MCAR。惟須留意,這個檢定只能否定 MCAR,無法區分 MAR 與 MNAR,因此它的用途相當有限,不宜過度解讀。

傳統方法為什麼不夠

上一節確立了「機制決定做法」的原則,本節就用這個原則,回頭檢驗研究者長期沿用的那些權宜之計。在現代方法普及之前,面對空白的標準反應不外乎兩種:把有缺漏的個案刪掉,或者拿某個看似合理的數字把空白填滿。這些做法之所以流行,是因為它們簡單,而且做完之後資料看起來很整齊。問題在於,整齊不等於正確。以下依序檢視列表刪除、配對刪除、平均數插補、迴歸插補與末次觀測值遞補,看它們各自需要什麼假設,又分別破壞了資料的哪一個性質。理解它們錯在哪裡,才能看懂新方法究竟好在哪裡,也才不會把 FIML 與多重插補誤當成另一種「比較高級的填法」。

列表刪除前面談過:只有在 MCAR 之下才不偏,且浪費資料。配對刪除(pairwise deletion)想省一點:計算每一對變項的相關時,只用「這兩個變項都有值」的個案。它用到的資料比列表刪除多,卻會製造新的麻煩,因為不同的相關係數建立在不同的、大小不一的子樣本之上,拼起來的共變數矩陣可能不一致、甚至變成非正定(第十二章),使後續模型無法估計。

單一插補的各種做法,問題更為根本。最該被淘汰、卻仍常見的,是平均數插補(mean imputation):把每個缺失格,用該變項的平均數填滿。它的問題是雙重的。其一,它人為地把大量觀測堆在平均數上,硬生生壓低了變異數,使資料看起來比實際更「一致」。其二,它會稀釋變項之間的相關,因為那些填進去的平均數,與其他變項完全沒有真實關聯。稍微高明一點的是迴歸插補,也就是以其他變項迴歸預測缺失值再填入,它至少保住了變項間的關係,卻走向另一個極端:所有填補值都恰好落在迴歸線上,反而把相關「灌得過強」、把變異壓得過小。要修補這一點,可改用隨機迴歸插補,在迴歸預測值上再加一個隨機誤差,使填補值的散布回到合理範圍;這一步看似瑣碎,卻正是通往多重插補的關鍵一步。

這些單一插補法共同的致命傷是:它們把「猜出來的值」當成「確定知道的值」。研究者明明是在不確定的情況下填補,卻在後續分析裡假裝這些填補值與真實觀測一樣可靠。結果就是,標準誤被低估、信賴區間過窄、p 值過度樂觀,對結論的信心被虛假地灌了水。在縱貫研究裡還有一個惡名昭彰的「末次觀測值遞補」(last observation carried forward, LOCF):以某人最後一次的觀測,填補他之後所有的缺失,這在假設「病情不再變化」上幾乎必然出錯,早已被方法學界揚棄 (Schafer & Graham, 2002)。

完全訊息最大概似(FIML)

現代處理缺失的第一條主線,順著第十二章的最大概似而來。它的想法優雅得近乎顛覆:與其「填補」空白,不如「根本不填」,直接用每一筆資料「已有的部分」去貢獻概似函數。這就是完全訊息最大概似(full information maximum likelihood, FIML),如下面的方塊所示。

推導方塊FIML 的原理

回顧第十二章:最大概似把「所有觀測的聯合對數概似」加總起來,再找出使其最大的參數。FIML 的關鍵一步,是允許每一筆個案,只用它「實際觀測到的那些變項」來計算自己的那一份概似。設第 i 筆個案觀測到的變項子集為 \mathbf{y}_i^{\text{obs}},其對整體對數概似的貢獻,是這個子集在模型下的邊際對數概似 \ell_i(\boldsymbol{\theta};\, \mathbf{y}_i^{\text{obs}})。整體對數概似為

\ell(\boldsymbol{\theta}) = \sum_{i} \ell_i(\boldsymbol{\theta};\, \mathbf{y}_i^{\text{obs}}).

也就是說,答滿 20 題的人,貢獻一個 20 維的概似;只答了 15 題的人,就貢獻一個 15 維的概似,沒有人被丟棄,也沒有任何值被「編造」。在 MAR(與 MCAR)假設下,這樣得到的估計具有一致性與漸近效率。

回到那項縱貫研究,流失的 200 人雖然沒有第二波的分數,他們的第一波分數仍透過兩波之間的相關,把「這群人原本大概落在哪裡」的訊息帶進估計。列表刪除與 FIML 的分水嶺正在這裡:前者把這 200 人整筆丟棄,連同唯一能校正偏誤的線索一起丟了,剩下的 800 人於是成了一群自我選擇的倖存者。

FIML 之所以成為潛在變項模型(第十五、十六章)的預設做法,有幾個實在的好處。它不丟資料,因此比列表刪除更有效率;它一次就給出估計與正確的標準誤,不需要插補的隨機性;而且它已內建於主流的 SEM 軟體之中。它的前提是:須為資料設定一個聯合分布(通常假設多元常態),並且缺失機制為 MAR。當常態假設可疑時,可搭配第十二章的穩健校正(如 MLR)以取得可信的標準誤;當結果為次序類別時,則有對應的類別型 FIML 處理。此外,FIML 也能透過「飽和相關」(saturated correlates)的設定納入輔助變項,這一點下一節將再展開。

多重插補

第二條主線,是多重插補(multiple imputation, MI),同樣出自 Rubin (Rubin, 1987)。它的巧思,正是為了解決單一插補「假裝填補值是確定的」這個致命傷:既然我們對缺失的值有不確定性,那就不要只填一個值,而是填好幾套。多填幾套的用意不在於「多猜幾次比較準」,而在於讓各套填補值彼此的差異,把這份不確定性顯露出來:各套若很接近,代表觀測資料已把缺失的部分框得相當緊;各套若天差地遠,代表這些空白本來就難以還原,後續推論理應反映這份猶疑。具體流程分三步。第一步(插補):根據觀測資料,為每個缺失格「抽取」一個合理的值,注意是「抽取」而非「取平均」,因此每次抽到的會略有不同;重複 m 次,便得到 m 套「補齊」的完整資料集。第二步(分析):把原本要做的分析,如迴歸、SEM 等,在這 m 套資料上各跑一遍,得到 m 組估計。第三步(合併):以 Rubin 的合併規則,把這 m 組結果併成一個,如下面的方塊所示。

推導方塊Rubin 合併規則

設對某個參數,m 套插補分別給出估計 \hat{\theta}_1, \dots, \hat{\theta}_m,以及各自的變異(平方標準誤)U_1, \dots, U_m。合併後的點估計是簡單平均:

\bar{\theta} = \frac{1}{m}\sum_{j=1}^{m} \hat{\theta}_j.

合併後的總變異,則由兩部分組成:

T = \bar{U} + \Big(1 + \tfrac{1}{m}\Big)\,B, \qquad \bar{U} = \frac{1}{m}\sum_{j} U_j, \quad B = \frac{1}{m-1}\sum_{j}(\hat{\theta}_j - \bar{\theta})^2,

其中 \bar{U} 是組內變異(各套自身抽樣不確定性的平均),B 是組間變異(m 個估計彼此的差異)。關鍵就在 B 這一項:它捕捉的正是「因為值是缺失的、我們對它有多不確定」,插補之間差愈多,B 愈大,總變異愈大。單一插補之所以低估不確定性,正因它完全漏掉了這個組間變異;多重插補把它加了回來,這才誠實。由 B 與 \bar{U} 還可算出缺失訊息比例(fraction of missing information),衡量某參數的不確定性有多少來自缺失,是判斷缺失影響大小的實用指標。

兩個變異成分的分工,用數字最容易看清楚。設想在那項縱貫研究中,研究者以第一波憂鬱預測第二波憂鬱,並採 m=20 套插補。假定各套的迴歸係數平均為 \bar{\theta}=0.42,各套自身的平方標準誤平均為 \bar{U}=0.0049,換算成標準誤約 0.07;而 20 個係數彼此的變異為 B=0.0011。代入合併公式,總變異為 T = 0.0049 + 1.05\times 0.0011 \approx 0.0061,開根號後標準誤約 0.078。若只填一套,報出來的標準誤會是 0.07,比誠實的數字小了約一成,信賴區間也就窄了一成。此例的缺失訊息比例約為 1.05\times 0.0011 / 0.0061 \approx 0.19,讀法是:這個迴歸係數的不確定性中,大約兩成來自「有人沒回來」,八成來自一般的抽樣誤差。此值愈接近 1,表示該參數愈是全靠插補在撐,結論也就愈脆弱。

多重插補在計算上有多種實現。Schafer (1997) 發展了假設聯合分布的取徑;Buuren (2018) 推廣的「鏈式方程多重插補」(multivariate imputation by chained equations, MICE)則更有彈性,逐一變項地建立插補模型,能自然處理連續與類別混雜的資料,是目前最流行的做法之一。使用 MI 時有兩個要點值得強調。其一是插補的套數 m:早期建議三到五套即可,但近年鑑於檢定力與估計穩定,多主張採用更多套,例如二十套以上,尤其當缺失比例高時。其二是相合性(congeniality):插補模型必須至少與分析模型「一樣豐富」,若分析模型含有交互作用或非線性項,插補模型卻未納入,插補反而會抹去這些效果,這是實務上極常見的錯誤。至於多參數的整體檢定(如比較巢狀模型),也有對應的合併程序,不能只把單一參數的規則生搬硬套。

多重插補的觀念,還有一個在心理計量中影響深遠、卻常被視為獨立技術的化身,即大型評量中的擬真值(plausible values)。Mislevy (1991) 的洞見是:在 PISA、NAEP 這類評量中,每位受試者只作答少數題目,因而其個別能力估計極不可靠,若逕以單一的能力點估計去做後續的次級分析,會嚴重低估不確定性、扭曲母體推論。Mislevy 的解法,是不為每人估一個能力值,而是自每位受試者的能力後驗分布中抽取若干個擬真值,再以 Rubin 的合併規則據以推論。就形式而言,這正是把多重插補施加於一個潛在變項:那個未被直接觀測、只能透過作答間接推知的「真實能力」,本身即是一種缺失資料,而擬真值就是它的多重插補。看清這一等價,便能明白何以擬真值必須成套使用、不可只取其一,也把本章的缺失資料原理,與第二十三章大型評量的量尺化實作正式接連了起來。

使用 MICE 這類迭代式插補時,還須檢查其收斂:由於它反覆循環各變項的插補模型,實務上會檢視多次迭代之間插補值的軌跡圖,確認已趨於穩定而非仍在漂移。而當資料具有巢狀結構(第二十八章)時,插補模型也必須納入分層,這類多層次多重插補是近年方法發展的重點之一,稍後還會再談。

那麼 FIML 與 MI 該選哪一個?在「MAR 加多元常態」的情境下,兩者常給出近乎相同的結果。實務上的差別在彈性:FIML 一步到位、簡單,但要求插補與分析共用同一個模型;MI 較靈活,允許「插補模型」與「分析模型」不同,因此更容易納入額外的輔助變項,這就帶到下一節。

輔助變項:讓 MAR 更站得住腳

前兩節的 FIML 與多重插補,都把 MAR 當成前提,而 MAR 要求「缺失可由觀測變項完全解釋」,聽起來相當強,讀者難免懷疑它憑什麼成立。這裡有一個常被忽略的重點:MAR 並非資料與生俱來、只能被動接受的性質,而是可以由研究者主動經營的。因為它是一個關於「已經觀測到什麼」的條件式敘述,只要多測到一些有用的東西,這個條件就更容易被滿足。訣竅在於輔助變項(auxiliary variables):那些本身不在實質模型裡、卻能「預測缺失、或預測缺失的值」的變項。本節要說明的,就是這類變項為何能把原本看似 MNAR 的情境拉近 MAR,以及該挑哪些變項、又該把它們放進哪個環節。

道理是這樣的:MAR 要求的是「在觀測到的東西之後,缺失就與缺失值無關」。觀測到的相關變項愈多,這個條件就愈容易成立。其中的機制值得說白:輔助變項的作用,是把那個看不見的量的訊息,部分地搬到觀測面上來。假定在那項縱貫研究中,第二波是否回來真正取決於第二波的憂鬱程度,這在形式上是 MNAR;但若第二波憂鬱與第一波憂鬱相關 0.60、與第一波睡眠品質相關 0.45,把這兩者一併納入後,第二波憂鬱中無法由觀測資料解釋的變異便降到不足一半。缺失所依賴的東西,於是大半落在看得見的那一側,MAR 的違反程度隨之大幅減輕。這說明輔助變項無法證明 MAR 成立,卻能實質地把偏誤壓小。Collins et al. (2001) 因此主張採取「包容策略」(inclusive strategy):寧可多放一些好的輔助變項,也不要吝嗇,這既能降低偏誤,又能提升效率,幾乎沒有壞處。挑選輔助變項的原則,是找「與含缺變項相關高」或「與缺失與否相關」的變項。FIML 可透過「飽和相關」的設定納入輔助變項,MI 則可直接把它們放進插補模型。Graham (2009) 與 Newman (2014) 對如何在真實研究中落實這些做法,提供了實用而具體的整理。

當缺失非隨機:MNAR 與敏感度分析

上一節說明了輔助變項如何讓 MAR 更站得住腳,卻留下一個沒有解決的可能:萬一再怎麼增補觀測變項,缺失仍然直接取決於那個沒被記錄下來的值呢?FIML 與 MI 的有效性都建立在 MAR 之上,一旦缺失真是 MNAR,這兩種方法便會有偏誤,而且偏誤的方向與大小都無從由資料本身讀出。更難堪的是,正如前面反覆強調的,研究者也無法用資料證明「不是 MNAR」,因為要檢驗這件事,得先知道那些看不見的值。這是缺失資料問題最硬的核心。本節要處理的,因此不是「如何消除 MNAR」,而是「在無法檢驗的處境下,如何仍然做出負責任的推論」。

統計學為 MNAR 發展了幾類模型,但它們都需要對「缺失機制」做出無法檢驗的假設。選擇模型(selection model)把「結果」與「缺失發生的機制」聯合建模:先假設一個結果的分布,再假設一個「值愈極端、愈容易缺」的缺失模型,其源頭可追溯至 Heckman 的計量經濟工作。型態混合模型(pattern-mixture model)則反過來:把樣本按「缺失型態」分組,允許不同組的結果分布不同,再加權平均。還有一類共享參數模型,以一個潛在變項同時驅動結果與缺失。三者從不同角度切入,卻有一個共同的軟肋:結論高度依賴那個「猜的、又驗不了的」缺失機制假設,換一個假設,答案可能就變了。

既然沒有一個 MNAR 模型能「證明自己對」,誠實的做法就不是硬選一個,而是敏感度分析(sensitivity analysis)。它的精神是:與其賭一個假設,不如試一整排。研究者在一個合理的範圍內,嘗試好幾種不同強度的 MNAR 假設,一個常見的做法是所謂的 delta 調整,也就是系統性地假設「缺失者的真實值,比 MAR 下的預測平均高出 delta 分」,並讓 delta 由零逐步增大,觀察核心結論何時翻轉,那個翻轉點便稱為傾覆點(tipping point)。如果在各種合理假設下結論都穩健,研究者便有底氣;如果結論一碰到輕微的 MNAR 就崩潰,那麼這個脆弱性本身,就是必須誠實報告的重要發現。敏感度分析把「一個無法檢驗的假設」,轉化為「一整幅結論如何隨假設變動的圖像」,這是面對 MNAR 最負責任的態度。

在臨床試驗中,還發展出一類參照式插補(reference-based imputation)作為 MNAR 敏感度分析的具體實作:例如假設中途退出治療組的病人,其後續反應「回復」到對照組的水準,據此插補。這類假設雖然同樣無法檢驗,卻具有清楚的臨床意涵,因而在藥政審查中被廣泛採用,示範了如何把一個抽象的 MNAR 假設,翻譯為一個可溝通、可辯護的具體情境。

缺失與縱貫、多層次資料

缺失在縱貫與多層次研究中,帶有一些特有的面貌,值得單獨一提。縱貫研究最典型的缺失是流失(attrition),也就是參與者在某個時點之後不再回來,形成前一節提過的單調型態。流失的棘手之處在於,它常與所研究的結果有關,例如病情惡化者更可能退出治療研究,這正是 MNAR 的溫床。然而縱貫設計也帶來一線生機:由於每位參與者在退出前累積了多次觀測,這些先前的觀測本身就是強而有力的輔助資訊,使 MAR 假設遠比橫斷研究來得可信,因為「一個人退出前的軌跡」往往能相當程度地解釋他為何退出。

在多層次資料中,缺失可能發生在不同層次,例如個體層次的漏答與群集層次的變項缺失,兩者的處理並不相同;而插補時若忽略了資料的巢狀結構,例如未把群集納入插補模型,便會低估群內相關、扭曲跨層次的關係。因此,縱貫與多層次情境下的缺失處理,需要能反映資料相依結構的插補與估計方法,這也是當前方法學仍在積極發展的前沿,並與第二十八、二十九章的建模緊密相扣。

近年的發展:機器學習、深度學習與雙重穩健

到此為止,本章介紹的工具都共用一副骨架:先為資料設定一個分布,通常是多元常態,再據此寫出概似函數或插補模型。這副骨架在心理計量的多數場合運作良好,但當變項數目很多、連續與類別混雜,或變項之間存在明顯的非線性與交互作用時,多元常態就顯得侷促。近十餘年,隨著機器學習的興起,一批不再倚賴這類分布假設的插補方法逐漸普及,它們改以演算法而非分布來刻畫變項之間的關係。這些方法值得認識,也確實補上了傳統做法的一些短處,但仍須審慎看待。以下依序介紹機器學習插補、深度學習插補與雙重穩健估計三條路線,最後再回到這條界線。

第一類是以機器學習演算法作為插補引擎。最具代表性的是隨機森林插補:Stekhoven & Bühlmann (2012) 提出的 missForest,以隨機森林反覆預測各變項的缺失值,能自動捕捉變項間的非線性與交互作用,且對連續與類別混雜的資料一體適用,無須研究者事先設定分布。與之精神相近的,還有把 MICE 的逐變項迴歸替換為分類與迴歸樹或隨機森林的做法,以及以最鄰近個案填補的 k 近鄰插補。這類方法的優點是彈性高、對模型設定的錯誤較不敏感;代價則是計算量大,且較難給出理論性的標準誤。

第二類是深度學習插補。Lall & Robinson (2022) 的 MIDAS 以去噪自編碼器(denoising autoencoder)為核心:訓練一個神經網路,刻意將部分輸入抹除再令其重建,藉此學會由資料的整體結構回填缺失。此類方法在變項極多、樣本極大的情境下具有可觀的擴充性,也能自然產生多重插補所需的多套填補;相關取徑還包括以生成對抗網路進行的插補。它們代表了插補與現代機器學習的合流,但在心理計量常見的中小樣本情境下,其相對於傳統多重插補的優勢仍有待更多實證檢驗。

第三類走的是另一條路,即雙重穩健(doubly robust)估計。它把兩種思路結合:一是為結果建模並插補,二是以逆機率加權(inverse probability weighting)依「被觀測到的機率」對完整個案加權。Seaman & White (2013) 的回顧指出,雙重穩健估計的迷人之處在於,只要「結果模型」與「缺失模型」兩者之中至少有一個設定正確,估計便具一致性,等於為研究者上了一道雙保險。此外,把缺失值直接視為未知參數、以 MCMC 一併估計的全貝氏插補(第三十三章),也在近年隨機率程式語言的普及而更易實作。

面對這些新工具,有一個原則必須把握:預測得準,不等於推論得對。機器學習插補即使把缺失值猜得再接近真值,若只填一套、把填補值當成確定值,仍會低估不確定性;因此這些方法唯有納入多重插補的框架、據實傳遞插補的變異,才能給出誠實的推論。此外,絕大多數這類方法,骨子裡仍以 MAR 為前提;機器學習的彈性能讓 MAR 更容易近似成立,卻無法憑空解決 MNAR 的根本難題。換言之,新方法擴充的是「如何插補」的工具,而非豁免了「為何而缺」的思考。

從補救到設計:計畫性缺失與前沿

到目前為止,缺失都被當成「壞事」,彷彿是資料蒐集出了差錯、事後補救。但有一個漂亮的翻轉:如果缺失是研究者「故意」製造、且是隨機的,它反而可以成為一種設計工具。這就是計畫性缺失設計(planned missingness design)。最典型的是「三式設計」(three-form design):把一份很長的問卷拆成幾個區塊,每位受試者只隨機分到其中一部分作答。如此一來,每個人的負擔大幅減輕,避免疲勞、提升作答品質,而由於「誰缺哪一塊」是隨機決定的,這些缺失便是 MCAR,前面的現代方法可以毫無偏誤地把整體參數估回來。另一種是雙方法測量設計,以一個昂貴但精確的測量施測於部分樣本、以一個便宜的測量施測於全體,藉由兩者的重疊來校正便宜測量的偏誤。缺失,就這樣從一個要被動補救的麻煩,變成了一個主動運用的資源。

這個由計畫性缺失所體現的智慧,在大型教育評量中被推向了制度化的極致,即輪替題本設計(rotated booklet design)。像 PISA、TIMSS 或美國的 NAEP 這類評量,其欲測量的題庫規模龐大,遠非任何一位學生所能作答完畢;解法是把題目編組為若干題組,再依平衡不完全區塊設計,將題組輪替地組成多份題本,每位學生只隨機分派到其中一份。如此一來,任何一位學生對於「未被分派到的題目」都是缺失的,但由於題本的分派是隨機的,這些大規模的缺失在設計上即為 MCAR,母體層次的能力分布因而能被無偏地估回。輪替題本把三式設計的邏輯,由單一問卷放大到整個國家評量的尺度,而其跨題本、跨年度的分數如何連結為同一把量尺,則涉及等化與連結的技術,留待第二十三章處理。

在前沿與整合的層面,還有幾件事值得一提。缺失資料方法與多層次、SEM 的結合日趨成熟,但在複雜模型下仍有技術挑戰。而從開放科學(第三十六章)的角度看,「缺失資料如何處理」其實是一個常被忽略的研究者自由度:同一份資料,選列表刪除或選多重插補,結論可能不同。因此,如何處理缺失,理應在分析之前就寫進計畫、預先註冊,而非事後挑一個「結果最漂亮」的做法。Little & Rubin (2019) 與 Enders (2010) 對這整套理論與實務,提供了權威而完整的參考。

小結

本章的核心訊息只有一句:缺失資料不是拿來刪的麻煩,而是拿來建模的問題。處理的流程可收攏為幾步。第一,先思考機制,這批資料為何而缺,比較接近 MCAR、MAR 還是 MNAR?第二,在 MAR 的預設下,用 FIML 或多重插補,而非反射性地列表刪除,更絕不用平均數插補。第三,慷慨地納入輔助變項,讓 MAR 更站得住腳。第四,若懷疑 MNAR,就做敏感度分析,誠實地呈現結論有多穩健。第五,把這一切事前寫進分析計畫。

至此,第三部分「統計推論與研究設計的方法基礎」全部完成。從第八章的推論邏輯、第九章的研究規劃、第十章的實驗設計與變異數分析、第十一章的迴歸、第十二章的估計與模型評鑑,到本章的缺失資料,我們已備妥一整套橫貫全書的統計工具箱。接下來的第四部分,將把這些工具,也就是最大概似、模型適配、缺失處理,正式帶到心理計量的核心舞台,也就是潛在變項模型。第十四章,便從探索性因素分析開始。

參考文獻

Buuren, S. van. (2018). Flexible imputation of missing data (2nd ed.). CRC Press.
Collins, L. M., Schafer, J. L., & Kam, C.-M. (2001). A comparison of inclusive and restrictive strategies in modern missing data procedures. Psychological Methods, 6(4), 330–351. https://doi.org/10.1037/1082-989X.6.4.330
Enders, C. K. (2010). Applied missing data analysis. Guilford Press.
Graham, J. W. (2009). Missing data analysis: Making it work in the real world. Annual Review of Psychology, 60, 549–576. https://doi.org/10.1146/annurev.psych.58.110405.085530
Lall, R., & Robinson, T. (2022). The MIDAS touch: Accurate and scalable missing-data imputation with deep learning. Political Analysis, 30(2), 179–196. https://doi.org/10.1017/pan.2020.49
Little, R. J. A. (1988). A test of missing completely at random for multivariate data with missing values. Journal of the American Statistical Association, 83(404), 1198–1202. https://doi.org/10.1080/01621459.1988.10478722
Little, R. J. A., & Rubin, D. B. (2019). Statistical analysis with missing data (3rd ed.). John Wiley & Sons.
Mislevy, R. J. (1991). Randomization-based inference about latent variables from complex samples. Psychometrika, 56(2), 177–196. https://doi.org/10.1007/BF02294457
Newman, D. A. (2014). Missing data: Five practical guidelines. Organizational Research Methods, 17(4), 372–411. https://doi.org/10.1177/1094428114548590
Rubin, D. B. (1976). Inference and missing data. Biometrika, 63(3), 581–592. https://doi.org/10.1093/biomet/63.3.581
Rubin, D. B. (1987). Multiple imputation for nonresponse in surveys. John Wiley & Sons.
Schafer, J. L. (1997). Analysis of incomplete multivariate data. Chapman; Hall.
Schafer, J. L., & Graham, J. W. (2002). Missing data: Our view of the state of the art. Psychological Methods, 7(2), 147–177. https://doi.org/10.1037/1082-989X.7.2.147
Seaman, S. R., & White, I. R. (2013). Review of inverse probability weighting for dealing with missing data. Statistical Methods in Medical Research, 22(3), 278–295. https://doi.org/10.1177/0962280210395740
Stekhoven, D. J., & Bühlmann, P. (2012). MissForest—non-parametric missing value imputation for mixed-type data. Bioinformatics, 28(1), 112–118. https://doi.org/10.1093/bioinformatics/btr597
本章引用格式游琇婷(2026)。缺失資料的原理與處理。《計量心理學:測量、模型與推論》(第 13 章)。