第 14 章 探索性因素分析
第四部 潛在變項測量模型
14Chapter

探索性因素分析

一份問卷有四十道題。它們究竟在測「一件事」,還是「三件事」?背後有幾個潛在的向度?哪幾題又對應哪一個向度?探索性因素分析(exploratory factor analysis, EFA)正是回答這類問題的工具。它的妙處在於:研究者無須事先告訴它結構,它便能從「一大堆觀測變項彼此的相關」之中,找出少數幾個足以解釋這些相關的潛在因素。一堆糾纏在一起的題目,經它一提煉,就可能濃縮為「外向性」「語文能力」這類可詮釋的向度。這件事之所以可能,關鍵在一個簡單而有力的想法:若兩道題會一起高、一起低,多半是因為背後有同一個原因同時推動了它們;那麼題目之間的相關型態,本身就攜帶著關於那個原因的訊息。因素分析要做的,就是把這份訊息反解出來。

為了讓後續的討論有一個共同的落腳處,本章將以一份假想的量表貫穿說明。設想研究者編製了一份二十題的大學生學習投入量表,內容涵蓋上課時的專注、投入作業的時間、對修課內容的興趣、遇到困難時的堅持,以及學習上的疲憊感,以六點量尺施測於一千名大學生。這份資料會在往後各節反覆出現,用來說明負荷矩陣該怎麼讀、共同性代表什麼、旋轉前後為何詮釋會變,以及不同判準為何常常給出不同的因素數目。本章要把 EFA 的核心,也就是共同因素模型,建立起來,把它與一個經常被混淆的近親(主成分分析)區分清楚,並正面迎戰 EFA 最難的兩個判斷:究竟有幾個因素,以及該如何旋轉。開篇之前,先花一節回顧這門技術的思想史,因為 EFA 的許多爭議,其實從它誕生的那一刻起便已埋下。

從相關到因素:一段思想史

因素分析的故事,要從一個觀察說起。當一群人接受各式各樣的認知測驗,例如語文、數學、空間,會發現一件耐人尋味的事:這些分數幾乎全都正相關,某方面強的人,其他方面往往也不弱。Spearman (1904) 正是由這個「正流形」(positive manifold)出發,提出以單一個「一般智力」因素 g 來解釋,並輔以各測驗的特殊因素,這便是著名的雙因素理論。Spearman 甚至給出一個可檢驗的印記,即第二章提過的四差分:若一組測驗確由單一共同因素支配,則任取四個測驗的相關會滿足特定的乘積等式。這使「背後是否只有一個因素」由玄想化為可用資料檢驗的命題,堪稱因素分析的濫觴。

然而世界顯然不只一個因素。二十世紀三○年代,Thurstone 提出多因素理論,主張人的能力由多個共同因素(語文、數值、空間等)構成,並在《心智的向量》一書中,把因素分析改寫為一套線性代數:觀測變項是若干共同因素的線性組合,因素分析的任務便是由相關矩陣反解出這組負荷。在電子計算機問世之前,他以繁複的形心法(centroid method)手工逼近這一分解,其計算量之大,今日難以想像。Thurstone 更提出兩個至今仍居核心的概念:一是簡單結構(simple structure),主張應把因素旋轉到「每個變項只在少數因素上有高負荷」的位置以利詮釋;二是以著名的「盒子問題」示範,因素分析能由一批盒子的各種測量,回復出長、寬、高這三個實質的維度,藉此論證因素並非純粹的數學虛構。差不多同時,Hotelling (1933) 發展出主成分分析,雖在數學上與因素分析相鄰,出發點卻不同,這一區別將於後文詳論。

Thurstone 的簡單結構,其實是對一個更深難題的回應,這個難題便是旋轉不定性,也是本章稍後要正式推導的核心。早在因素分析數學化的初期,學者便已察覺一件令人不安的事:由相關矩陣反解出的因素負荷,在數學上並非唯一,任意一個正交旋轉都給出適配完全相同的另一組負荷。這意味著,因素分析本身無法指出哪一組負荷才是「對的」,於是萃取之後「該把座標軸轉到哪裡」便成了一個懸而未決的問題,史稱旋轉問題(rotation problem)。Thurstone 主張以簡單結構為準繩,把軸轉到最易詮釋的位置,這是一種訴諸可解釋性的實質判準;然而何謂「簡單」本身帶有主觀性,也因此招來「因素分析不夠客觀」的長年批評。到了一九五○年代,Kaiser 的 varimax 試圖以一個明確的數學準則,把簡單結構形式化為可由電腦自動求解的最佳化問題,旋轉才由手工的藝術,部分地轉為可程式化的程序。這段圍繞旋轉的爭論說明,因素分析的不確定性並非後人吹毛求疵,而是深植於模型結構、自其誕生便已存在。

其後的發展,大致沿兩條線推進。理論線上,Lawley 於一九四○年代把因素分析放進最大概似的框架,使它得以「自帶推論」,這條線後來由 Jöreskog 推向驗證性因素分析(第十五章)。計算線上,Kaiser 於一九五八年提出 varimax 正交旋轉,並適逢電子計算機普及,因素分析遂由少數專家的手藝,變成一般研究者按鍵可得的日常工具,其副作用則是誤用的氾濫。至於 Spearman 與 Thurstone 之間「一個 g 還是多個因素」的爭論,最終在階層模型中獲得調和:多個一階因素之上,可再抽取一個高階的一般因素,Cattell 的流體與晶體智力、以至 Carroll 的三階層理論,都是這一調和的體現。這段歷史留下的教訓是:因素分析既是一套統計技術,也承載著關於「心智結構為何」的實質理論主張,兩者從未真正分開。

因素分析的歷史,也留下了一則必須銘記的警示,即命名不等於證成。一個因素被抽取出來、被冠上「一般智力」或「內化問題」之名後,人們往往不自覺地把它當成真實存在的實體,這便是所謂的具體化謬誤(reification)。然而,一個能重現相關結構的數學因素,未必對應任何實質的心理實體;它究竟是真實的共同原因,還是僅為統計上的方便,須靠第二章的量化預設與第七章的效度證據來論斷,而非因素分析本身所能回答。這一自省,貫穿了因素分析百年的爭論,也預告了第三十五章網絡取向對「共同潛在原因」本體論的正面挑戰。

共同因素模型

把上述直覺寫成數學,就是共同因素模型(common factor model)。它主張:每一個觀測變項,都可拆解為「共同因素的加權和」加上「一個專屬於它自己的部分」,如下面的方塊所示。

推導方塊共同因素模型與其隱含共變數

設有 p 個觀測變項、m 個共同因素(m 遠小於 p)。第 i 個變項為

x_i = \lambda_{i1}\eta_1 + \lambda_{i2}\eta_2 + \cdots + \lambda_{im}\eta_m + \varepsilon_i,

其中 \eta 是共同因素、\lambda 是因素負荷(loading)、\varepsilon_i 是該變項的獨特因素(unique factor,含測量誤差與變項特有的變異)。以矩陣寫為 \mathbf{x} = \boldsymbol{\Lambda}\boldsymbol{\eta} + \boldsymbol{\varepsilon}。假設共同因素與獨特因素不相關、各獨特因素之間也不相關(即 \boldsymbol{\Psi} = \mathrm{Cov}(\boldsymbol{\varepsilon}) 為對角矩陣),則觀測變項的隱含共變數矩陣為

\boldsymbol{\Sigma} = \boldsymbol{\Lambda}\,\boldsymbol{\Phi}\,\boldsymbol{\Lambda}' + \boldsymbol{\Psi},

其中 \boldsymbol{\Phi} = \mathrm{Cov}(\boldsymbol{\eta}) 是因素間的共變數矩陣、\boldsymbol{\Psi} 是獨特變異的對角矩陣。這條式子是全章的核心:因素分析的整個任務,就是找出一組 \boldsymbol{\Lambda}、\boldsymbol{\Phi}、\boldsymbol{\Psi},使模型隱含的 \boldsymbol{\Sigma} 盡量貼近樣本的相關(或共變數)矩陣。每個變項被共同因素解釋的變異比例,稱為共同性(communality,記為 h_i^2);剩下的 1 - h_i^2 便是獨特性(uniqueness)。

共同性與獨特性這組數字的讀法相當直接,值得先用實例熟悉。回到前述的學習投入量表:假定「我上課時很難分心」這一題的共同性為 h^2 = 0.64,意思是這題分數的變異中,有六成四可由量表背後的共同因素解釋,剩下的三成六屬於它自己,其中既含測量誤差,也含這道題特有而不與其他題共享的內容。相對地,若「我會利用通勤時間讀課本」的共同性只有 0.18,就代表它八成以上的變異與其他題無關,它多半在問一件別的事,或者題意不夠清楚。實務上,共同性偏低的題目是刪題的第一順位。

值得停下來體會一件事:這個共同因素模型,其實就是第三章所談的反映性測量模型,因素是「因」、指標是「果」,每個指標等於「負荷乘以構念,加上誤差」。因素分析,正是估計這個測量模型的方法。這也是何以「因素分析」與「潛在變項」在心理計量裡幾乎成為同義詞。

因素分析與主成分分析:一個常見的混淆

在應用心理學裡,最普遍的一個技術混淆,就是把主成分分析(principal component analysis, PCA)當成因素分析。許多論文寫著「做了因素分析」,實際上跑的卻是 PCA,這往往是舊版統計軟體預設選項所致。兩者表面相似,都給出一個「負荷矩陣」、都把一堆變項化約成少數幾個維度,連報表的長相都極為接近,本質卻南轅北轍。上一節建立的共同因素模型之所以要特地寫出獨特變異 \boldsymbol{\Psi} 這一項,正是這場混淆的分水嶺所在:有沒有把「屬於每一題自己的那部分」單獨挪出去,決定了一個方法算不算測量模型。這一節要說清楚三件事:兩者各自在回答什麼問題、為什麼在測量的脈絡下只有一個是對的,以及誤用另一個要付出什麼代價。

差別的關鍵,在於「有沒有誤差」。PCA 把主成分定義為觀測變項的加權和,成分是觀測變項「湊出來的」,方向反而與第三章的形成性測量較為相近;它的目標是以少數成分重現「全部」的變異,模型裡沒有獨特因素、沒有誤差項。因素分析則相反:因素是潛在的共同原因,只解釋變項之間「共享」的那部分變異(共同性),並明確地把「獨特/誤差」那部分分離出去。這也正是 Hotelling (1933) 的成分取向與 Thurstone 的因素取向自始便分道揚鑣之處。

這個差別有實質後果。因為 PCA 把「誤差變異」也算進去一起解釋,它估出的負荷通常會系統性地偏高,也無法把測量誤差與真實共變分開。因此,若目的是「測量一個潛在構念」,而這正是心理計量的核心目的,那麼共同因素模型才是正確的選擇,PCA 並不是一個測量模型。Fabrigar et al. (1999) 與 Preacher & MacCallum (2003) 對心理學界濫用 PCA、以及其他 EFA 陋習,提出了經典的批評與可操作的建議。一個簡單的判準是:若研究者相信題目背後有一個「造成」它們的潛在構念,就用因素分析;若只是想把一堆變項壓縮成幾個綜合指標、不假設任何潛在原因,PCA 才適用。

差距有多大,用數字看最清楚。設想以前述二十題學習投入量表的資料,分別跑一次 PCA 與一次共同因素分析,都取三個維度。兩份報表的分群幾乎一模一樣,數字卻不同:同一道「我上課時很難分心」,在 PCA 的成分負荷是 0.78,在因素分析裡的負荷則是 0.69。這個落差並非估計誤差,而是 PCA 把這題自身的測量誤差也算成「被成分解釋」的一部分,因素分析則把它撥給了獨特因素。若研究者拿 PCA 的負荷去估信度或比較構念間的關聯強度,得到的數字便會系統性地偏樂觀。

因素萃取:主軸因素與最大概似

確立了模型,下一步是「萃取」(extraction),也就是由樣本相關矩陣估出負荷 \boldsymbol{\Lambda} 與獨特變異 \boldsymbol{\Psi}。這一步在概念上是把共同因素模型的等式反過來讀:前面是給定一組參數,推出模型隱含的 \boldsymbol{\Sigma};萃取則是拿著手上的樣本相關矩陣,回頭去找一組參數,使它隱含的相關盡量貼近實際觀察到的相關。困難之處在於,負荷與共同性彼此牽制:要估負荷,得先知道每一題有多少變異屬於共同的部分;要知道共同性,又得先有負荷。萃取法的差別,正在於如何處理這個循環,以及願意為此付出多少分布假設的代價。以下介紹兩種主流的做法。

主軸因素法(principal axis factoring, PAF)是較傳統的做法。它的巧思在於:先把相關矩陣對角線上的「1」換成「共同性的估計」,因為因素只該解釋共同變異、不該解釋獨特變異,再對這個「化約後的相關矩陣」做特徵分解;由於共同性一開始未知,通常以迭代方式逐步逼近。與之相近的還有最小殘差法(MINRES)等,皆屬幾乎不依賴分布假設的穩健取徑。最大概似法(maximum likelihood, ML)則把因素分析放進第十二章的最大概似框架:假設資料多元常態,找出使概似最大的 \boldsymbol{\Lambda} 與 \boldsymbol{\Psi}。它最大的優點,是「自帶推論」,提供整體適配的卡方檢定、參數的標準誤,也讓研究者能以第十二章的資訊準則去比較不同因素數目的模型。代價是它要求常態假設,違反時檢定會失真。

實務上的取捨相當清楚:資料大致常態、又想要推論統計,用 ML;資料明顯不常態,PAF 較安全。而當題目是次序類別(如李克特量尺)時,兩者都不理想,應改以第十五章將詳談的多分相關為基礎進行萃取,否則會低估負荷、甚至憑空生出因人為的「難度因素」。無論哪一種萃取法,萃取出的初始負荷矩陣,都還不是最終、最易詮釋的版本,因為它面臨一個根本的不定性問題,這就帶到旋轉。

因素旋轉與旋轉不定性

因素分析有一個內建的、深刻的不確定性:同一個模型,有無限多組同樣好的負荷矩陣。這不是估計不夠準的問題,而是模型本身的數學性質,如下面的方塊所示。

推導方塊旋轉不定性

回顧隱含共變數 \boldsymbol{\Sigma} = \boldsymbol{\Lambda}\boldsymbol{\Phi}\boldsymbol{\Lambda}' + \boldsymbol{\Psi}(先看正交情形,\boldsymbol{\Phi} = \mathbf{I},故 \boldsymbol{\Sigma} = \boldsymbol{\Lambda}\boldsymbol{\Lambda}' + \boldsymbol{\Psi})。取任意一個正交矩陣 \mathbf{T}(滿足 \mathbf{T}\mathbf{T}' = \mathbf{I}),令新的負荷為 \boldsymbol{\Lambda}^{*} = \boldsymbol{\Lambda}\mathbf{T}。則

\boldsymbol{\Lambda}^{*}\boldsymbol{\Lambda}^{*\prime} = (\boldsymbol{\Lambda}\mathbf{T})(\boldsymbol{\Lambda}\mathbf{T})' = \boldsymbol{\Lambda}\,\mathbf{T}\mathbf{T}'\,\boldsymbol{\Lambda}' = \boldsymbol{\Lambda}\boldsymbol{\Lambda}'.

也就是說,\boldsymbol{\Lambda}^{*} 隱含的共變數與 \boldsymbol{\Lambda} 完全相同。換言之,只要把負荷矩陣「旋轉」一下,模型的適配一絲一毫都不會變。因此,萃取出的初始負荷,只是無限多個「等價好」的解之一;研究者有自由、也有必要,從中挑一個「最易詮釋」的版本。這就是旋轉(rotation)。

既然可以自由旋轉,該往哪裡轉?Thurstone 的答案是簡單結構:把因素轉到「每個變項只在少數幾個因素上有高負荷、在其他因素上接近零」的位置。這樣的負荷矩陣最易詮釋,一看便知哪題屬於哪個因素。旋轉分兩大類。正交旋轉(orthogonal rotation,如 varimax、quartimax)強迫因素之間彼此不相關;斜交旋轉(oblique rotation,如 oblimin、promax、geomin)則允許因素相關。這裡有一個常被忽略卻重要的建議:心理學的構念彼此往往相關,例如焦慮與憂鬱、語文與推理,硬要求它們正交,反而扭曲了現實。因此除非有特別理由,斜交旋轉通常是更誠實、更合理的預設。斜交旋轉會給出兩個矩陣:型態矩陣(pattern matrix,各因素對變項的「偏」效果,用以詮釋)與結構矩陣(structure matrix,變項與因素的相關),詮釋時主要看型態矩陣。

旋轉如何在不改變適配的前提下改變詮釋,用數字最容易看清楚。設想學習投入量表萃取出兩個因素,未旋轉的初始解裡,二十題幾乎全部在第一個因素上有中高負荷(多落在 0.45 到 0.65 之間),在第二個因素上則有一半的題目約為 0.30、另一半約為 -0.30。這組負荷已經完全重現了題目間的相關,卻沒有人讀得出它在說什麼:第一個因素像是「所有題目的總平均」,第二個像是「前十題減後十題」。旋轉之後,適配一絲一毫未變,負荷卻重新分配:行為投入的十題在因素一上落在 0.62 到 0.81、在因素二上全都低於 0.20,情感投入的十題恰好相反,哪一題屬於哪一個因素一望即知。旋轉並沒有讓模型變好,它只是換了一組座標軸,把同一個解說成人話。

正交與斜交的取捨,也可用同一份資料說明。假定斜交旋轉估出的兩個因素相關為 \phi = 0.52,意思是行為投入高的學生情感投入通常也高,兩者共享約四分之一的變異。若硬用正交旋轉把這個 0.52 壓成零,因素間本來存在的關聯無處可去,只好被擠進負荷裡,結果是每題在「不屬於它」的那個因素上都留下 0.25 上下的殘餘負荷,簡單結構反而變模糊。反之,若斜交解算出的因素相關僅為 0.08,正交解便已夠用。斜交較安全的理由正在於此:它不預設因素無關,卻容許結果接近無關。

到底有幾個因素?

這是 EFA 最難、也最主觀的一步。抽太多因素(over-extraction),會把雜訊當成結構、擠出一些湊數的小因素;抽太少(under-extraction),則會把不同的向度硬揉成一團。可惜沒有一個完美的判準,只有一組各有優劣的工具,如下面的概念方塊所示。

概念方塊決定因素數目的常用方法

Kaiser 準則(特徵值 >1):最古老、也最常被誤用;它幾乎總是傾向「抽太多」,方法學界普遍不建議單獨使用 (Kaiser, 1960)。

陡坡圖(scree plot):把特徵值由大到小畫出,找「手肘」轉折點 (Cattell, 1966);直觀,但轉折點常不明確、判讀主觀。

平行分析(parallel analysis):古典方法中表現最穩健者 (Horn, 1965)。它以「同樣大小的隨機資料」所產生的特徵值為基準,只保留「觀測特徵值大於隨機特徵值」的因素,等於在問「這個因素解釋的,是否比純雜訊多」。

最小平均偏相關(MAP):以偏相關為基礎的另一種統計判準,常與平行分析並用 (Velicer, 1976)。

模型適配與資訊準則:以 ML 萃取時,可比較不同因素數目模型的卡方、AIC、BIC(第十二章)。

判準之間為何常常打架,看一次實例就會明白。設想對學習投入量表的資料同時跑三種判準:特徵值大於一的共有五個,Kaiser 準則於是主張抽五個因素;陡坡圖在第三個特徵值之後開始走平,但第二與第四個轉折也都說得過去,讀圖的人各執一詞;平行分析則顯示,只有前三個觀測特徵值高過隨機資料的對應值,第四個已經落在雜訊水準之下。三個數字並不矛盾,它們只是在問不同的問題:Kaiser 準則問「這個因素解釋的變異是否多過一題」,門檻寬鬆,因此幾乎總是高估;陡坡圖問「哪裡出現明顯的落差」,答案取決於肉眼;平行分析問「這個因素解釋的是否多於純雜訊」,這才是研究者真正關心的問題。結論不一致並非分析出錯,而是提醒研究者回到題目內容去判斷。

近年一個大規模的模擬比較 (Auerswald & Moshagen, 2019) 更新了這方面的建議:在多數實際情境下,平行分析與經驗 Kaiser 準則表現優異,而傳統 Kaiser 準則與陡坡圖則不可靠。另有一類「比較資料」取向,以已知因素結構的模擬資料為對照,逐步逼近最能重現實際相關型態的因素數目。這些方法各有適用邊界,因此實務上的黃金守則是:不要只靠單一判準,而應以平行分析等穩健方法為主,輔以理論的可解釋性,並比較「相鄰幾個因素數目」的解,看哪一個最穩定、最說得通。因素數目終究是統計證據與實質判斷的合議,而非某個門檻自動吐出的答案。

因素分數的不定性

配好因素模型後,研究者可能想為每個人算一個「因素分數」,例如某人的「外向性」有多高。但這裡潛藏一個深刻、卻常被忽略的問題:因素分數是不定的(factor score indeterminacy)。

推導方塊因素分數不定性

共同因素模型 \mathbf{x} = \boldsymbol{\Lambda}\boldsymbol{\eta} + \boldsymbol{\varepsilon} 中,潛在因素 \boldsymbol{\eta} 並未被觀測變項 \mathbf{x} 唯一決定。直觀地說:我們有 p 個觀測變項,卻要反推 p 個獨特因素再加上 m 個共同因素,未知的「因素分」比方程式還多,因此存在無限多組因素分,全都與同一個模型、同一批資料完全相容。這不是估計誤差,而是模型的先天結構:即使樣本無限大、參數估得完美,因素分數仍不唯一。實務上,不同的計分法(如迴歸法、Bartlett 法)會給出不同的分數,彼此甚至可能相關不高。

這個不定性有實質含意:當研究者把因素分數當成「那個人真正的構念值」拿去做後續分析,例如作為另一個迴歸的預測變項,其實是在一個本質上不唯一的量上操作,可能引入偏誤。因應之道有幾種:若測量模型接近 tau 等值,簡單的加總分數(第五章)往往夠用、也更透明;若要嚴謹地把「構念間關係」與「測量」一併處理,最好的辦法是直接用結構方程模型(第十六章),讓潛在變項留在模型裡,根本不必先算出因素分數。換言之,因素分數不定性,正是 SEM 之所以更受青睞的理由之一。

分析實務

把前面的原理,收攏成一套可操作的工作流程。動手之前,先確認「這批資料到底適不適合做因素分析」。兩個常用的檢核是:KMO 取樣適切性量數(衡量變項間是否有足夠的共同變異,一般要求 0.6 以上),以及 Bartlett 球形檢定(檢定相關矩陣是否顯著偏離單位矩陣;若不顯著,表示變項間根本沒什麼相關,做因素分析並無意義)。樣本數方面,與其套用「每題幾人」的粗略規則,不如記住一個原則:當共同性高、每個因素有夠多高負荷的指標時,所需樣本較小,反之則需要相當大的樣本。

接著是決策流程:檢核適切性、選萃取法(常態用 ML,否則 PAF,次序類別用多分相關取徑)、決定因素數目(以平行分析為主、參酌理論)、斜交旋轉、判讀型態矩陣。判讀時要留意幾個訊號:交叉負荷(一題在多個因素上都高,暗示它不乾淨)、過低的共同性(這題與其他題共享太少,或許該刪),以及第十二章提過的 Heywood case(負的獨特變異,是模型有問題的警訊)。最後,列幾個心理學文獻裡最常見的 EFA 陋習作為反面提醒:把 PCA 當因素分析報告;只用 Kaiser 準則決定因素數;不假思索地用正交旋轉;把很小的負荷(如 0.2)也拿來詮釋;以及最根本的,把「探索」得到的結構,當成「驗證」過的結論來報告。就軟體而言,R 的 psych 套件與 lavaan 的 efa 功能都能勝任,但工具再好,也取代不了上述的判斷。

把上述要點串成一棵決策樹,並在每一個分叉點標出最常見的誤用,或許最能幫助研究者避開陷阱。第一個分叉是資料檢核:若 KMO 過低或 Bartlett 檢定不顯著,本就不該勉強進行因素分析,然而實務上常見的誤用,是跳過這一步、對根本不相關的變項硬抽因素,抽出的自然是無意義的雜訊結構。第二個分叉是萃取法的選擇:面對明顯偏態或次序的資料仍套用假設常態的最大概似,是這一步最典型的錯誤,其後果是負荷被低估、甚至憑空生出因作答難度而非構念所致的假因素。第三個分叉是因素數目:僅憑 Kaiser 準則便定案,幾乎必然抽出過多因素,正確的做法是以平行分析或 EGA 為主,輔以理論與相鄰解的比較。第四個分叉是旋轉:對彼此相關的心理構念強加正交旋轉,會扭曲因素間的真實關係,斜交旋轉通常才是誠實的預設。最後一個分叉是詮釋:把 0.2 這類微弱負荷也拿來命名因素、或把交叉負荷嚴重的題目強行歸類,都會製造出比資料所支持的更「乾淨」的假象。這棵決策樹真正的終點,其實不在旋轉後的負荷矩陣,而在一個誠實的認知,即這裡得到的一切都只是有待驗證的假設。

前沿與新近研究

因素分析看似古老,近十年卻是方法學的活躍前沿。前面幾節處理的是這套技術的古典骨幹,它們大致在一九六○年代之前便已定型。然而過去十餘年間,計算能力、網絡科學與機器學習的進展,讓因素分析的三個老問題有了新的處理方式,也就是「究竟有幾個維度」「探索與驗證的界線該畫在哪裡」,以及「模型的不確定性如何誠實地表達」。本節擇要介紹幾條新近的發展,目的不在教會操作,而在讓研究者知道它們各自替代或補足了古典流程中的哪一環。

第一是網絡取向對「維度」的重新想像。探索性圖論分析(exploratory graph analysis, EGA)不從特徵值下手,而是把變項間的關聯畫成一張網絡圖,再以社群偵測演算法找出網絡中「抱團」的變項群,每一個社群便對應一個維度 (H. F. Golino & Epskamp, 2017)。就決定因素數目而言,EGA 提供了一個與平行分析並列的網絡替代方案,在若干模擬情境下的準確度可與之比肩,並附帶一張同時回答「有幾維」與「哪些題聚在一起」的直觀圖形 (H. Golino et al., 2020)。對本章的實務目的,可將 EGA 視為決定維度數目的另一件工具,與平行分析交叉參照即可;至於其網絡估計的技術細節、與傳統方法的系統性效能比較,以及拔靴穩定性與階層版本等延伸,則屬網絡心理計量的範疇,留待第三十五章詳述。

第二是機器學習進入因素數目的決定。Goretzko & Bühner (2020) 以大量模擬資料訓練隨機森林等演算法,由相關矩陣萃取上百個特徵,學習「該保留幾個因素」,其準確度在若干情境下超越了傳統判準。這代表因素保留由「單一統計量對照門檻」,走向「以資料驅動的預測模型綜合眾多線索」,也與其他領域的「次一特徵值充分性檢定」等新判準,共同構成一個更豐富的工具箱。

第三是探索與驗證之間的鬆綁。探索性結構方程模型(exploratory structural equation modeling, ESEM;(Asparouhov & Muthén, 2009))意在化解 EFA 與 CFA 之間的僵硬二分。傳統 CFA(第十五章)要求「每題只負荷在它該屬的因素、在其他因素上嚴格為零」,這個要求常常過嚴,導致適配不良;ESEM 則允許在一個驗證性的 SEM 架構裡,對某些因素採用探索性的旋轉,等於容許次要的交叉負荷存在。與之精神相近的還有正則化因素分析,以懲罰項自動把微小的負荷壓成零,直接估出稀疏而易詮釋的結構,可視為 lasso(第十一章)在測量模型上的應用。這些取向讓研究者在「完全探索」與「完全驗證」之間,有了一塊更貼近真實資料的中間地帶。

此外還有兩條較新的線索值得留意。其一是貝氏因素分析(第三十三章),它以弱資訊先驗把「近乎零」的交叉負荷輕輕壓向零,既保留了 ESEM 的彈性,又給出完整的後驗不確定性,是近似不變性與稀疏測量的自然工具。其二是把因素分析帶入時間維度,以密集追蹤資料(第三十章)對「個體內」的共變結構做因素分析,藉此檢驗一個在群體層次成立的因素結構,是否也在單一個體隨時間的波動中成立,這正呼應了第三章齊質性的關切。這些發展的共同方向,是把因素分析由一張靜態、跨個體的快照,推向更能反映不確定性與動態的模型。

與再現性的關切相呼應,近年也更強調對因素結構本身做交叉驗證,例如以一半樣本探索、另一半以 CFA 確認,或以拔靴法評估負荷與維度估計的穩定性。這類做法把「這個結構是否可複製」由事後的期望,變成分析流程內建的檢驗,與第十二章交叉驗證的精神一脈相承。

最後一個老問題,在再現性的時代更值得警惕,也就是本章一再強調的:一個 EFA 找出的結構,只是「假設」,它需要以獨立樣本、用 CFA 去確認,才能真正站得住腳。無論工具多麼新穎,把探索性結果當成驗證性結論來報告,都是不可取的。

小結

探索性因素分析,把一大堆彼此相關的指標,透過共同因素模型(\boldsymbol{\Sigma} = \boldsymbol{\Lambda}\boldsymbol{\Phi}\boldsymbol{\Lambda}' + \boldsymbol{\Psi})提煉為少數幾個潛在因素,而這個模型,正是第三章反映性測量模型的實作。本章的幾個關鍵訊息值得複誦:因素分析不是主成分分析,前者是測量模型、後者不是;EFA 有兩個最難的判斷,因素數目該靠平行分析、EGA 等工具而非 Kaiser 準則,旋轉該用斜交以逼近簡單結構;而因素分數的先天不定性,提醒我們謹慎,並指向 SEM 這條更嚴謹的路。

最重要的是記住 EFA 的定位:它是「探索」,它生成關於測量結構的假設。這些假設要成為可靠的知識,還必須經過「驗證」。下一章的驗證性因素分析,就是拿一個明確的因素結構假設,以第十二章的估計與適配工具,嚴格地放到資料面前受檢的方法。

參考文獻

Asparouhov, T., & Muthén, B. (2009). Exploratory structural equation modeling. Structural Equation Modeling, 16(3), 397–438. https://doi.org/10.1080/10705510903008204
Auerswald, M., & Moshagen, M. (2019). How to determine the number of factors to retain in exploratory factor analysis: A comparison of extraction methods under realistic conditions. Psychological Methods, 24(4), 468–491. https://doi.org/10.1037/met0000200
Cattell, R. B. (1966). The scree test for the number of factors. Multivariate Behavioral Research, 1(2), 245–276. https://doi.org/10.1207/s15327906mbr0102_10
Fabrigar, L. R., Wegener, D. T., MacCallum, R. C., & Strahan, E. J. (1999). Evaluating the use of exploratory factor analysis in psychological research. Psychological Methods, 4(3), 272–299. https://doi.org/10.1037/1082-989X.4.3.272
Golino, H. F., & Epskamp, S. (2017). Exploratory graph analysis: A new approach for estimating the number of dimensions in psychological research. PLOS ONE, 12(6), e0174035. https://doi.org/10.1371/journal.pone.0174035
Golino, H., Shi, D., Christensen, A. P., Garrido, L. E., Nieto, M. D., Sadana, R., Thiyagarajan, J. A., & Martinez-Molina, A. (2020). Investigating the performance of exploratory graph analysis and traditional techniques to identify the number of latent factors: A simulation and tutorial. Psychological Methods, 25(3), 292–320. https://doi.org/10.1037/met0000255
Goretzko, D., & Bühner, M. (2020). One model to rule them all? Using machine learning algorithms to determine the number of factors in exploratory factor analysis. Psychological Methods, 25(6), 776–786. https://doi.org/10.1037/met0000262
Horn, J. L. (1965). A rationale and test for the number of factors in factor analysis. Psychometrika, 30(2), 179–185. https://doi.org/10.1007/BF02289447
Hotelling, H. (1933). Analysis of a complex of statistical variables into principal components. Journal of Educational Psychology, 24(6), 417–441. https://doi.org/10.1037/h0071325
Kaiser, H. F. (1960). The application of electronic computers to factor analysis. Educational and Psychological Measurement, 20(1), 141–151. https://doi.org/10.1177/001316446002000116
Preacher, K. J., & MacCallum, R. C. (2003). Repairing Tom Swift’s electric factor analysis machine. Understanding Statistics, 2(1), 13–43. https://doi.org/10.1207/S15328031US0201_02
Spearman, C. (1904). “General intelligence,” objectively determined and measured. The American Journal of Psychology, 15(2), 201–292. https://doi.org/10.2307/1412107
Velicer, W. F. (1976). Determining the number of components from the matrix of partial correlations. Psychometrika, 41(3), 321–327. https://doi.org/10.1007/BF02293557
本章引用格式游琇婷(2026)。探索性因素分析。《計量心理學:測量、模型與推論》(第 14 章)。