迴歸與廣義線性模型
迴歸(regression)是量化科學的主力工具,幾乎沒有哪個實證研究不曾用到它。饒富意味的是,它的名字與第二章那位測量「差異」的 Galton 有直接淵源,「迴歸」二字,正來自他所觀察到的「子代身高向平均迴歸」現象。撇開歷史不談,迴歸的核心概念其實只有一個:以一個或一組變項,去預測或解釋另一個變項,方法是配上一條線(或一個平面)。本章要把這個看似樸素的想法,從普通最小平方一路嚴謹地建立起來,再把它推廣到「結果不是常態連續量」的廣義線性模型,包括 logistic 與 Poisson,最後停在機器學習的門口,也就是正則化。
之所以以一整章的篇幅談迴歸,是因為它是本書後半的共同祖先。第二十八章的多層次模型,是「迴歸加上隨機效果」;第十七章 IRT 的雙參數模型,本質上是「把 logistic 迴歸跑在一個潛在的預測變項上」;第三十四章的許多機器學習方法,則是「正則化或更有彈性的迴歸」。看懂迴歸,就等於拿到了一把貫穿全書後半的鑰匙。本章也將反覆回到第八章所埋下的兩條線:最大概似作為估計引擎,以及解釋與預測兩種取向的張力。
迴歸的基本設定
多元迴歸模型可寫成 y_i = \beta_0 + \beta_1 x_{i1} + \cdots + \beta_p x_{ip} + \varepsilon_i,或以矩陣形式表示為 \mathbf{y} = \mathbf{X}\boldsymbol{\beta} + \boldsymbol{\varepsilon}。此處 \mathbf{y} 為結果變項,\mathbf{X} 為預測變項,\boldsymbol{\beta} 為待估計的迴歸係數,\boldsymbol{\varepsilon} 為誤差。就其本質而言,迴歸模型刻畫的是結果在給定預測變項下的條件期望,即 \mathbb{E}(y\mid\mathbf{x}) = \mathbf{x}'\boldsymbol{\beta};換言之,迴歸線是「對每一組 \mathbf{x},y 平均而言落在哪裡」的軌跡,而非對個別觀測的精確預言。
迴歸係數的解讀,是全章最須講清楚的一件事。\beta_j 代表:在「其他預測變項都固定不動」的條件下,x_j 每增加一單位,y 平均改變多少。這個「固定其他變項」的但書至關重要,它使 \beta_j 成為一個偏效果(partial effect),而非 x_j 與 y 的單純關聯。也正是這個但書,日後會成為迴歸係數被過度解讀為「因果效果」的溫床。此外,係數的尺度依賴於變項的單位:未標準化係數以原始單位表達,便於實質溝通;標準化係數則以標準差為單位,便於比較不同預測變項的相對重要性,但它同樣受各變項變異範圍的影響,跨樣本比較時須格外謹慎。
標準迴歸有幾個假設:線性(y 與 x 的關係為線性)、獨立(各觀測的誤差互相獨立)、同質變異(homoscedasticity,誤差變異不隨 x 改變),以及誤差常態。這幾個假設的分量並不相同,有些是估計不偏的關鍵,有些只影響標準誤,有些只在小樣本的精確推論時才要緊,這一點稍後將細講。歷史上,迴歸與相關的原始構想來自 Galton 與 Pearson(第二章),而 Fisher (1925) 則把變異數分析與迴歸統一於同一個線性模型的框架之下,奠定了今日的樣貌。
還須先釐清迴歸的兩種用途,因為它們牽動了整章的取捨。用於解釋時,研究者在意的是個別係數 \beta_j 的大小、方向與可解釋性;用於預測時,在意的則是模型對新觀測 y 的整體預測準確度,個別係數是否漂亮反倒其次。這兩種用途對應第一章所談的兩種知識文化,也解釋了何以同一個迴歸,在解釋取向與預測取向之下會有截然不同的評鑑標準(第十二、三十四章)。此外還須澄清,「線性」指的是對參數為線性,而非對變項為線性;只要把 x^2、\ln x 或樣條基底當成新的預測變項納入,同一套 OLS 機制便能配適彎曲的關係。因此迴歸的線性框架,其實遠比「配一條直線」所暗示的更有彈性。
普通最小平方
如何從資料中把 \boldsymbol{\beta} 估出來?最經典的答案是普通最小平方(ordinary least squares, OLS):挑一組 \boldsymbol{\beta},使「預測值與實際值的差距(殘差)平方和」最小。這個準則之所以特別,不僅因為計算方便,更因為它在一組合理假設之下,具有優良的最適性質,如下面的方塊所示。
設線性模型 \mathbf{y} = \mathbf{X}\boldsymbol{\beta} + \boldsymbol{\varepsilon},其中 \mathbf{X} 為 n \times (p+1) 的設計矩陣。OLS 的目標是最小化殘差平方和
對 \boldsymbol{\beta} 求導並令其為零,得到正規方程(normal equations):
在 \mathbf{X}'\mathbf{X} 可逆時,解得 OLS 估計式
Gauss-Markov 定理:若誤差滿足 \mathbb{E}(\boldsymbol{\varepsilon}\mid\mathbf{X})=\mathbf{0}(外生性)與 \mathrm{Var}(\boldsymbol{\varepsilon}\mid\mathbf{X})=\sigma^2\mathbf{I}(同質且不相關),則在所有「線性且不偏」的估計量中,OLS 的變異最小,即最佳線性不偏估計量(best linear unbiased estimator, BLUE)。值得注意的是,這個結論並不需要誤差常態;常態假設只在「小樣本的精確 t 檢定與 F 檢定」時才用得上。
OLS 還有一個優雅的幾何詮釋。預測值 \hat{\mathbf{y}} = \mathbf{X}\hat{\boldsymbol{\beta}} = \mathbf{H}\mathbf{y},其中 \mathbf{H} = \mathbf{X}(\mathbf{X}'\mathbf{X})^{-1}\mathbf{X}' 稱為帽子矩陣(hat matrix),它把 \mathbf{y} 正交投影到由預測變項所張成的空間;殘差則正好垂直於這個空間。這一投影觀點不只賞心悅目,更是下一章迴歸診斷的基礎,因為帽子矩陣的對角元素(槓桿值)恰好刻畫了每個觀測對其自身預測值的影響。此外,當誤差為常態時,OLS 估計與最大概似估計(第八章)完全一致,這也說明了 OLS 何以能無縫接軌到其後以概似為引擎的各種模型。
模型解釋了多少變異,以決定係數 R^2 衡量,它是「被模型解釋的變異」占「總變異」的比例,與第九章的效果量 f^2 = R^2/(1-R^2) 直接相通。須留意的是,R^2 只會隨預測變項的增加而上升,即使那些變項毫無實質作用;因此在比較不同變項數的模型時,應改看調整後 R^2,它對多餘的參數施以懲罰,這也預告了第十二章模型選擇「在適配與簡約之間權衡」的主題。
迴歸假設的分量:哪些要緊、怎麼出錯
前面列出了迴歸的四個假設,但它們的重要性天差地別;看清這一點,遠比死記假設清單有用。
外生性(\mathbb{E}(\boldsymbol{\varepsilon}\mid\mathbf{X})=\mathbf{0})是估計不偏的關鍵。若誤差與預測變項相關,例如漏掉了一個同時影響 x 與 y 的變項,\hat{\boldsymbol{\beta}} 便會有偏誤,這就是遺漏變項偏誤,也是因果詮釋最大的敵人。同質變異與獨立性主要影響的是標準誤而非係數本身:一旦違反,\hat{\boldsymbol{\beta}} 仍然不偏,但算出的標準誤會錯,連帶 p 值與信賴區間都不可信;補救之道是穩健標準誤(robust/sandwich SE),或改用能處理相依結構的模型(第二十八章)。誤差常態則分量最輕:在大樣本下,靠中央極限定理,即使誤差不常態,係數的抽樣分配仍近似常態,因此常態假設幾乎只在小樣本才要緊。把這四個假設按其後果分級,勝過把它們一視同仁地背誦。
還有兩個實務上常見的麻煩。其一是多元共線性(multicollinearity):當預測變項彼此高度相關,\mathbf{X}'\mathbf{X} 接近不可逆,\hat{\boldsymbol{\beta}} 會變得極不穩定、標準誤暴增,可用變異數膨脹因子(variance inflation factor, VIF)診斷。須強調的是,共線性並不使估計產生偏誤,它損害的是精確度與可解釋性,而非不偏性;因此若目的僅在整體預測,輕度共線性未必是問題。其二是影響點與離群值:少數極端的觀測,可能主宰整條迴歸線。這些診斷的完整處理,是下一章的主題,此處先埋下伏筆。
除了上述問題,還有一類更根本的毛病,即函數形式的設定誤。若真實關係是彎曲的,卻硬配一條直線,殘差會呈現系統性的型態,此時任何對標準誤的修補都無濟於事,因為模型本身就設定錯了。偵測之道包括檢視殘差對預測值的圖、偏殘差圖,以及以多項式或樣條檢驗是否存在顯著的非線性。這也提醒,迴歸診斷不只是「檢查假設有沒有被違反」的例行公事,更是一次重新審視「模型是否問對了問題」的機會。
測量誤差與迴歸:一個反直覺的陷阱
前面幾章關於信度的討論,在迴歸的脈絡中留下了一道深刻卻常被忽略的印記,值得單獨一節說明。第五章曾證明,測量誤差會使兩變項的觀察相關被衰減。當這一現象進入迴歸,其後果比單變項的情形更為棘手,也更反直覺。
在只有一個預測變項的簡單迴歸中,若該預測變項帶有測量誤差,其迴歸係數會朝零衰減,衰減的比例大致等於預測變項的信度。這已足以誤導結論,但至少方向是可預測的。真正棘手的是多元迴歸:當多個預測變項各自帶有不同程度的測量誤差時,各係數的偏誤方向不再一致,某些可能被低估,某些卻可能被高估,端視變項之間的相關結構而定。這意味著,測量誤差在多元迴歸中造成的偏誤,無法靠「反正都是衰減」的直覺來校正。
這一陷阱在一個常見的研究情境中格外致命,即「控制干擾變項」。研究者常在迴歸中納入某個干擾變項,以宣稱「在控制了它之後,x 對 y 仍有獨立效果」。然而 Westfall & Yarkoni (2016) 證明,若被控制的干擾變項本身測量得不夠可靠,這種「統計控制」其實無法充分去除干擾,殘餘的干擾會被錯誤地歸給 x,使得增量效度的宣稱出現極高的偽陽性率,在大樣本、中等信度時甚至可能逼近百分之百。這一結果與第七章的增量效度前後呼應,也再次印證本書的核心主張:測量品質不是分析之前的雜務,而會一路滲透到最終的統計結論之中。面對這一陷阱,本書其後提供了兩條治理路徑。其一是潛在變項模型(第十五、十六章),它們以多個指標估計出近乎無誤差的潛在構念,把測量誤差正式納入模型,從根本上緩解了偏誤;其二是後設分析式的校正(第三十二章),在無法重新設計研究、只能就既有結果補救時,藉由信度已知的估計對衰減加以還原,於統計整合的層次上作事後修正。兩者一為事前建模、一為事後校正,共同回應了測量誤差對迴歸結論的滲透。
交互作用與調節
至此,都假設每個 x 對 y 的效果是固定的。但現實中,一個變項的效果,常常「須視另一個變項而定」。這就是交互作用(interaction),在心理學裡也常稱為調節(moderation)。最簡單的形式,是在模型中放進兩個變項的乘積項:
關鍵在 \beta_3。它捕捉的是「x 對 y 的效果如何隨 z 改變」:當 z 變動一單位,x 的斜率便改變 \beta_3。舉例而言,若 x 是「讀書時數」、z 是「睡眠是否充足」,顯著的 \beta_3 可能意味著,讀書時數對成績的助益,在睡眠充足時比睡眠不足時更大。
這裡有幾個容易踩的坑 (Aiken & West, 1991; Cohen et al., 2003)。其一,一旦放了乘積項,\beta_1 就不再是「x 的整體效果」,而是「z=0 時 x 的效果」;因此若 z 的 0 沒有實質意義,例如 z 是年齡,主效果便很難解讀,把變項置中(centering,減去平均)可使主效果回到「在平均水準的 z 之下」,較易詮釋。其二,交互作用的詮釋通常須輔以簡單斜率分析,也就是在 z 的幾個代表性水準(例如平均數上下一個標準差)分別描繪 x 的斜率;更精細的 Johnson-Neyman 技術,則能標出 x 的效果由顯著轉為不顯著的 z 臨界值。其三,交互作用的偵測往往需要相當大的樣本(呼應第九章),因為乘積項所能解釋的變異通常不大,心理學文獻裡許多宣稱的調節效果,其實檢定力不足、難以重現。調節這一概念,會在第十六章的中介與調節模型裡再度出現。
交互作用的形式還不止於連續變項之間。當調節變項為類別時,例如比較不同組別,交互作用等價於容許各組有不同的斜率,這也是變異數分析中「處理與共變項交互作用」的迴歸表述;至於類別預測變項的各種編碼方式,以及變異數分析與迴歸之間的完整對應,已在第十章交代,本章的架構則以連續預測變項為主軸,於此僅作交叉引用。至於在廣義線性模型中,交互作用的解讀更須謹慎,因為 logistic 或 Poisson 迴歸的係數作用於連結後的尺度(對數勝算或對數期望),在該尺度上沒有交互作用,換回機率或計數的原始尺度後卻可能出現交互作用,反之亦然。因此「有無交互作用」在非線性模型中並不是一個尺度無關的事實,報告時務必說明所依據的是哪一個尺度。
廣義線性模型:當結果不是常態連續量
OLS 有一個內建假設:結果 y 是個大致常態的連續量。然而心理學的結果,常常並非如此。它可能是二元的(通過或不通過、復發或未復發)、計數的(一段時間內犯錯幾次),或有界的比例。硬把 OLS 套上去,會得到荒謬的預測,例如機率跑到 0 以下或 1 以上。
廣義線性模型(generalized linear model, GLM)優雅地解決了這個問題。Nelder & Wedderburn (1972) 指出,許多看似不同的迴歸,其實共享同一個三件式結構:一個隨機成分(結果變項服從指數族的某個分布,如常態、二項、Poisson)、一個系統成分(線性預測式 \eta = \mathbf{X}\boldsymbol{\beta}),以及一個連結函數(link function)g,把結果的期望值 \mu 與線性預測式接起來,g(\mu) = \eta。普通迴歸只是「常態分布加恆等連結」的特例;換一個分布、換一個連結,便得到不同的模型。最重要的例子是 logistic 迴歸,如下面的方塊所示。
設結果 y 為二元(0 或 1),令 p = P(y=1\mid \mathbf{x})。logistic 迴歸採用 logit 連結,把「勝算的對數」設為線性預測式:
係數的解讀是對數勝算比(log odds ratio):x_j 每增加一單位,勝算 p/(1-p) 乘以 e^{\beta_j}。與 OLS 不同,logistic 迴歸沒有封閉解,\boldsymbol{\beta} 須以最大概似估計(第八章)、透過迭代數值方法求得。至於計數結果,則常用 Poisson 迴歸:結果服從 Poisson 分布、採對數連結 \ln(\mu) = \mathbf{X}\boldsymbol{\beta}。
GLM 的家族遠不止於此,而其細節在實務上往往至關緊要。就二元結果而言,除 logit 之外,尚有 probit 連結(以常態累積分布為基礎)與互補雙對數連結(complementary log-log),三者在中段相近、在尾端有別。就計數結果而言,Poisson 迴歸有一個嚴格的前提,即期望值等於變異;一旦資料呈現過度分散(overdispersion,變異大於期望),便須改採類 Poisson 或負二項迴歸,否則標準誤會嚴重低估。至於次序與無序的多類結果,其專屬模型將於下一節專門處理。此外還有兩個常見陷阱值得一提:其一,當某個預測變項能完美區分結果時會發生「完全分離」,使最大概似估計發散,須以懲罰或貝氏方法處理;其二,GLM 的整體適配常以離差(deviance)評估,它是概似比檢定的自然延伸(第十二章)。
在這些細節背後,是一個統一的數學結構。指數族分布都可寫成一個共同的標準形式,其自然參數與期望值之間的對應,決定了所謂的標準連結(canonical link),logit 之於二項、對數之於 Poisson 皆屬此類,這也是何以這些連結在數學上格外自然。至於估計,GLM 的最大概似通常透過反覆加權最小平方(iteratively reweighted least squares, IRLS)求解,也就是把非線性的概似最大化,化為一連串加權的線性迴歸,這既解釋了 GLM 與 OLS 的血緣,也預告了第十二章對一般估計演算法的討論。最後值得一提的是邊際效果與條件效果之別:在非線性的 GLM 中,一個預測變項對機率的影響會隨其他變項的取值而變,因此除了報告係數,往往還須報告在代表性情境下的邊際效果,方能讓結果為實務所理解。
GLM 的統整威力,不只在於「一個框架收納多種模型」,更在於它與本書其他部分的深層連結:第十七章的雙參數 IRT 模型,數學上就是一個「以潛在能力 \theta 為預測變項」的 logistic 迴歸。可以說,只要真正弄懂了 logistic 迴歸,IRT 便已懂了一半。
次序與多項結果
廣義線性模型的框架,還能自然地延伸到兩類在心理與社會研究中極為常見、卻不宜當成連續量處理的結果,即次序類別與無序類別。把李克特式的「非常不同意」到「非常同意」硬當成等距連續分數來跑 OLS,是文獻中屢見不鮮、卻在測量層次上站不住腳的做法,因為次序類別只保證等級的高低,並不保證相鄰等級之間的間距相等。
對次序結果,最常用的是比例勝算模型(proportional odds model),又稱累積 logit 模型,其構想是不去預測落在某一類的機率,而去預測「落在某個門檻以下」的累積機率。McCullagh (1980) 的設定是,對每一個可能的切點都以一個累積 logit 連結建立線性模型,而所有切點共用同一組迴歸斜率,僅截距(門檻)不同。這一「共用斜率」的設定,即所謂比例勝算假設或平行線假設,它讓模型精簡,也讓每個係數得以解讀為對整體等級的一致效果。然而這個假設本身必須被檢驗;當某個預測變項對不同門檻的作用明顯不一致時,平行線假設便被違反,此時可退而採用部分比例勝算模型,容許該變項的斜率隨門檻而變。
對無序的多類結果,例如在彼此並無高低之分的甲、乙、丙三個選項中擇一,則採多項 logistic 迴歸(multinomial logistic regression),又稱基準類別 logit 模型。它的做法,是選定一個參照類別,再為其餘每一類各建立一個「該類相對於參照類別」的 logit 模型;因此一個有 K 類的結果,會估出 K-1 組係數,各自解讀為相對於參照類別的對數勝算。多項模型的彈性較大,代價是參數迅速增多,也犧牲了次序資訊,因此當結果本有次序時,比例勝算模型通常是更精簡而有力的選擇。
這一節看似只是 GLM 的兩個延伸,實則補齊了本書處理類別結果的一塊重要拼圖,並與後續兩處遙相呼應。其一,比例勝算模型的累積 logit 結構,正是第十七章多元計分項目反應理論中等級反應模型(graded response model)的骨幹,差別僅在於後者的預測變項是一個潛在特質而非觀察變項;換言之,等級反應模型可視為「跑在潛在能力上的比例勝算模型」。其二,這些模型直接關係到第二十五章對評定量尺與作答行為的處理,因為問卷中李克特反應的統計建模,本質上就是一個次序結果的迴歸問題。看清這層關聯,李克特資料「究竟該當成連續還是次序」這個長年爭論,便有了明確的方法學座標。
正則化:通往機器學習的門
迴歸還有一個現代的難題:當預測變項非常多(高維度),甚至比觀測數還多(p > n)時,OLS 會崩潰,\mathbf{X}'\mathbf{X} 不可逆,估計要嘛不穩定、要嘛根本無解;即使勉強估出,也極易過度配適(overfitting),在訓練資料上表現漂亮、換到新資料就一敗塗地。正則化(regularization)正是為此而生:在「殘差平方和」之外,加上一個「懲罰係數過大」的項,迫使模型不把係數估得太離譜。最經典的是脊迴歸(ridge regression),如下面的方塊所示。
ridge 在殘差平方和之外,加上係數的 L_2 懲罰,目標函數為
其中 \lambda \ge 0 為懲罰強度。對 \boldsymbol{\beta} 求導並令其為零,解得
與 OLS 相比,多出的 \lambda\mathbf{I} 有兩個效果。其一,即使 \mathbf{X}'\mathbf{X} 本身不可逆(共線性或 p > n),加上 \lambda\mathbf{I} 後也必然可逆,估計因此穩定。其二,它把係數整體「收縮」(shrink)向 0,\lambda 愈大、收縮愈強。這是一筆刻意的交易:引入一點偏誤,換取變異的大幅下降,也就是偏誤-變異權衡(bias-variance tradeoff);在預測導向的任務裡,這筆交易往往非常划算 (Hoerl & Kennard, 1970)。
另一種是 Tibshirani (1996) 的 lasso,它把懲罰換成 L_1(係數絕對值之和)。這個看似微小的改動有一個關鍵後果:lasso 會把一些係數壓成「恰好等於 0」,因此它同時完成了「估計」與「變項選擇」兩件事,特別適合高維度、想找出少數重要變項的情境。就幾何而言,L_1 懲罰的約束區域帶有尖角,最適解容易落在座標軸上,這正是它能產生稀疏解的原因,而 L_2 的圓形約束則不會。當預測變項高度相關時,lasso 傾向任意只留其一,Zou & Hastie (2005) 的彈性網(elastic net)遂結合 L_1 與 L_2 兩種懲罰,兼取變項選擇與穩定收縮之長。無論何種正則化,其懲罰強度 \lambda 都不是憑空指定,而是透過交叉驗證(第十二章、第三十四章)選出「在新資料上表現最好」的值,這正把偏誤-變異權衡由抽象原則落實為可操作的程序。從這個角度看,統計學的迴歸與機器學習之間並無鴻溝,後者很大程度上,就是「為了預測而刻意接受一點偏誤」的迴歸,這條線索將在第三十四章展開。
正則化的正當性,可由預測誤差的分解看得更清楚。一個模型在新資料上的期望預測誤差,可拆為三個部分:不可化約的雜訊、偏誤的平方,以及估計的變異。OLS 在不偏的前提下把偏誤壓到零,卻可能付出巨大的變異;正則化則刻意引入少許偏誤,以換取變異的大幅縮減,只要後者的下降超過前者的上升,整體預測誤差便下降。這一分解正是整個機器學習的思想核心(第三十四章)。還須提醒一個實作要點:由於懲罰項作用於係數的大小,而係數的大小取決於變項的尺度,因此在施行正則化之前,通常須先把預測變項標準化,否則單位較大的變項會被不成比例地懲罰。
迴歸係數的因果詮釋陷阱
最後,一個怎麼強調都不為過的警告。迴歸太過好用,好用到讓人忍不住把 \beta_j 直接讀成「x_j 對 y 的因果效果」。這是量化研究裡最普遍、也最危險的錯誤之一。
迴歸係數的本質,是一個條件關聯,也就是在其他納入變項固定之下的偏關聯,而非因果效果。要讓 \beta_j 具有因果意義,需要一整套很強、且通常無法檢驗的假設,包括沒有遺漏的干擾變項、模型設定正確、沒有選擇偏誤等等,這正是第三十一章因果推論的全部主題。遺漏變項偏誤有一個簡潔的形式:漏掉的干擾變項對結果的效果,乘以它與所納入預測變項的關係,恰為偏誤的大小與方向,這說明了偏誤既可能放大、也可能抵消真實效果。特別要澄清一個常見誤解:「控制」某個變項(把它放進迴歸),與實驗裡的「控制」根本是兩回事;統計上的「控制」有時不但不能去除偏誤,反而可能因為納入了「對撞變項」(collider)而製造出假關聯。此外還有一個相關的坑,稱為「表二謬誤」(Table 2 fallacy):把一個多變項模型裡「每一個」係數,都當成該變項的因果效果來解讀;事實上,在一個為估計「x 的效果」而設定的模型裡,其他共變項的係數往往沒有乾淨的因果詮釋。與之相映成趣的還有抑制效應(suppression),即某個變項本身與結果幾無關聯,納入後卻使另一變項的係數變大,這再次提醒偏係數的意義高度依賴模型中還有哪些變項。這些陷阱共同的根源,是「該把哪些變項放進迴歸」本身就是一個因果問題,無法由資料自身回答。第三十一章將以因果圖與後門準則說明:控制共同原因(干擾變項)通常有益,控制中介變項會抹去欲估計的效果,控制對撞變項則會憑空製造關聯;在缺乏這一因果框架的情況下,機械地「把想到的變項都放進去控制」,往往弊多於利。守則其實很簡單:除非研究設計與假設撐得起因果宣稱,否則就老實地把迴歸係數說成「關聯」,而非「效果」。
小結
迴歸是本書後半的樞紐。連續結果用 OLS,非常態結果用 GLM(logistic、Poisson),高維度與預測導向用正則化,它們共享同一套線性預測的骨架。更重要的是,它是許多後續模型的共同祖先:多層次模型(第二十八章)是迴歸加隨機效果,IRT(第十七章)是潛在變項上的 logistic 迴歸,機器學習(第三十四章)是正則化或更有彈性的迴歸。與此同時,本章也反覆提醒了迴歸兩大交纏的陷阱,即測量誤差對係數的滲透,以及把關聯誤讀為因果的誘惑。
方法上,本章把第八章的最大概似,落實成了估計 logistic 與其他 GLM 的引擎。至於「估出模型之後,如何評鑑它的好壞、如何在多個模型之間抉擇、如何診斷它有無出問題」,這些橫貫所有模型的共通課題,正是下一章的主題,而它將以本章的迴歸,作為最主要的示範載體。