測量的基本架構:構念、尺度與測量模型
第二章追問的是「心理究竟能否測量」這一層哲學問題,本章的任務則是把那些抽象的爭論,落實為研究者日常真正用得上的模型語彙。全章環繞一個看似細微、實則牽動全局的問題展開:當研究者寫下一份量表,那些題目與所欲測量的構念之間,因果的箭頭究竟指向何方?是構念驅動了作答,還是作答湊成了構念?這個方向的判定絕非咬文嚼字,它會一路決定信度該如何估計、效度該如何論證,甚至決定研究者手上那個「構念」是否真正立得住。本章先釐清測量模型的基本語彙,接著剖析兩種方向相反的測量設定,最後以一張類型學的表格,把其後整整七章的潛在變項模型收攏進同一個框架。
構念、指標與測量模型:三個基本語彙
計量心理學所處理的核心對象,是潛在構念(latent construct),也就是無法直接觀察、必須藉理論加以界定的心理屬性,例如焦慮、外向或工作滿意度。研究者真正記錄到的並非構念本身,而是指標(indicator),又稱外顯變項,例如量表上某一題的評分,或某項行為在一段時間內出現的次數。連結兩者的,則是測量模型(measurement model),也就是對「構念與指標之間究竟維持何種關係」所給出的正式陳述。此處須著重一點:測量模型既是統計假設,也是理論主張。它宣稱指標以某種特定方式與構念相繫,而這項宣稱可能為真,也可能為誤,其真偽終須訴諸證據,而非施行測量前即被默認。
在這套語彙之下,一個常被略過卻至關重要的問題隨即浮現:構念與指標之間,因果的箭頭指向哪一方?是構念決定了指標的取值,還是指標共同構成了構念?前者稱為反映性(reflective),後者稱為形成性(formative)。方向的選擇並非枝節,它牽動的是一連串環環相扣的推論,包括指標之間應否相關、指標能否互換、測量誤差如何界定,乃至整個模型能否被辨識、又該如何詮釋。其後兩節,便分別解剖這兩種相反的設定。
在進入細節之前,另有一組容易混淆的詞彙須先釐清。測量模型連結的是「構念與其指標」,回答的是「如何測量」的問題;結構模型(structural model)連結的則是「構念與構念」,回答的是構念彼此之間的關係,例如某一構念是否影響另一構念,那是第十六章結構方程模型所處理的範疇。本書第五至二十一章的大半篇幅,皆可視為對各類測量模型的深入展開,而本章所提供的,正是看懂這些模型的共同座標。這一分工也呼應第二章的核心提醒:測量先於一切實質推論,測量模型設定得是否恰當,界定了其後結構推論所能達到的可信程度。
刺激、受試者與反應:測量資料的三方
在深入反映性與形成性之前,值得先退一步,看清任何一次測量在最素樸的層次上都牽涉三個角色:一個受試者、一個刺激,以及由兩者相遇所生的反應。所謂刺激,可以是一道試題、一個待評的對象、一項供人取捨的政策;所謂反應,則是被記錄下來的那個資料點,例如答對與否、同意的程度、偏好誰勝於誰。心理計量所有的技術,追根究柢,都是在回答同一個問題的不同版本:如何由這些可觀察的反應,回推出藏在受試者或刺激背後的量。
耐人尋味的是,同一批反應,其實可以朝兩個相反的方向去解讀,而這正是心理計量兩大傳統的分水嶺。研究者可以固定受試者、把焦點放在刺激上,問「這些刺激在某條心理連續體上各自落於何處」,例如各項政策受支持的程度、各種顏色彼此的相似遠近,這是刺激中心(stimulus-centered)的量尺化取向。研究者也可以反過來固定刺激、把焦點放在受試者上,問「面對同一批試題,這些人各自落在能力或態度連續體上的哪個位置」,這是受試者中心(person-centered)的測驗取向。同樣一張「人乘以題」的資料表,量尺化取向沿著「題」的方向抽取結構,測驗理論則沿著「人」的方向抽取結構,兩者所問的並非同一個問題。
把這層區分講得最透澈的,是 Coombs (1964) 的資料理論(theory of data)。Coombs 主張,研究者拿到手的從來不是「純粹的資料」,而是研究設計與比較方式所預先框定的產物;依比較的對象是「人與題」還是「題與題」、以及比較所依循的是「超越」還是「接近」的邏輯,資料可被系統性地分成不同類型,而每一類型所能支撐的量尺化方法各不相同。其中一個影響尤其深遠的區分,是優勢資料(dominance data)與接近資料(proximity data):前者的邏輯是「受試者的位置超越了刺激的位置」,答對一題意味著能力高過該題的難度,這正是測驗理論與項目反應理論的底層邏輯;後者的邏輯則是「受試者偏好與其理想點最接近的刺激」,越接近越好、過猶不及,這是偏好與態度量尺化的核心,也是第四章展開模型(unfolding)所要處理的對象。
這一「刺激側」與「受試者側」的分工,恰好界定了接下來三章的版圖。第四章接手刺激側的量尺化傳統,從 Thurstone 的比較判斷、態度量尺,一路談到選擇模型與多向度量尺法,回答「如何為刺激立一把尺」;第五章起則轉向受試者側,以古典測驗理論及其後的潛在變項模型,回答「如何為人立一把尺」。本章其餘各節所鋪陳的反映性測量模型,骨子裡屬於受試者側:它把每一道題,設想為對受試者某一屬性的一次不完美觀測。先在此點明這條分工線,是為了讓讀者在後續章節之間穿行時,始終記得自己究竟站在「量刺激」還是「量人」的哪一側。
從構念到指標:操作化的歷程
測量模型描繪的是構念與指標之間的既定關係,但在寫下任何一條方程之前,研究者還須先走完一段常被輕忽的路,即操作化(operationalization)。操作化是把一個抽象的理論構念,逐步轉譯為一組可觀察、可記錄之指標的歷程,其品質往往在研究設計的最前端,便悄悄框定了整項研究所能達到的上限。這一歷程大致包含三個環節。首先是構念的界定,也就是清楚說明該構念的內涵與外延,並劃出它與相鄰構念的邊界,例如把焦慮與恐懼、憂鬱明確區隔開來。其次是內容領域的擘劃,即列出構念所涵蓋的各個層面,確保指標能對這片領域做出代表性的取樣,這正是內容效度(第七章)的核心關切。最後才是題目的撰寫與篩選,把界定好的內容領域化為一道道具體的題目,其技藝與陷阱將於第二十二章測驗編製方法學詳論。
操作化最關鍵的教訓在於,構念先於題目,而非題目先於構念。一份未經清楚界定便匆促編寫的量表,即使日後統計指標再漂亮,也難保它所測到的正是研究者心中所想的那個構念。這一點與第二章對操作論的批判前後呼應:把構念草率地等同於某一組題目,正是 jingle-jangle 謬誤與構念泛濫的溫床。反映性與形成性之分,其實也須在操作化階段便納入考量,因為指標究竟被設想為構念的果還是因,會直接左右內容領域該如何擘劃,以及哪些題目算是「代表性」的。
反映性測量:構念為因,指標為果
反映性測量模型的核心假設,是把構念視為指標的共同原因(common cause)。在這一設定裡,構念居於因果的上游,指標則是構念在可觀察層次留下的投影,因而稱為效果指標(effect indicators)。這幅因果圖像會導出若干可供檢驗的推論。首先,既然這些指標同受一個原因驅動,它們彼此便應呈正相關。其次,指標原則上可以互換,抽換其中一題並不改變所測構念的本質,至多稍微影響測量的精確度。第三,一旦將構念的取值固定下來,指標之間便應不再相關,此即局部獨立(local independence);換言之,扣除共同原因的作用之後,指標之間不應殘留系統性的關聯。
反映性模型可寫為 x_i = \lambda_i \eta + \varepsilon_i,其中 \eta 為潛在構念,\lambda_i 為第 i 題的負荷(loading),\varepsilon_i 為誤差。這一寫法的一大優點,在於它使測量誤差獲得了明確的意義:因為存在一個獨立於任何單一指標的構念真值,每一題偏離真值的部分即為誤差,信度也因此得以定義為「構念變異占觀察變異的比例」。這正是第五章古典測驗理論、第十四至十六章因素分析,以及第十七章項目反應理論所共用的測量骨架。就內容效度而言,反映性模型要求指標構成構念所涵蓋領域的代表性樣本,因為每一題都被視為對同一底層構念的一次不完美觀測。
反映性模型內部其實還有一道由鬆到嚴的假設階梯,這道階梯將於第五、六章正式登場,此處先予預告。最寬鬆的同源模型(congeneric)允許各題有不同的負荷與不同的誤差變異,只要求它們共享同一個潛在構念;本質 tau 等值模型(essentially tau-equivalent)進一步要求各題負荷相等,這正是以 Cronbach’s alpha 估計信度時所暗含的前提;最嚴格的平行模型(parallel)則連誤差變異也要求相等。假設愈嚴,可得的結論愈強,被資料推翻的風險卻也愈高。以憂鬱量表為例,若各題確實同源,則不同題目對憂鬱的敏感度容有高低,卻仍共同指向同一個底層構念;一旦誤把負荷懸殊的題目當成本質 tau 等值來等權加總,信度的估計便會產生系統性的偏誤。這道假設階梯,正是第五章古典測驗理論與第六章信度理論展開的主軸。
反映性設定還隱含了一個常被忽略的前提,即單維性(unidimensionality)或至少是良好界定的維度結構。當一組指標果真僅由單一構念所支配時,局部獨立方能成立;一旦資料中殘留了扣除主構念後仍存在的條件相關,便意味著另有一個未被建模的維度或方法效果潛藏其間。就此而言,局部獨立不僅是一項技術假設,更是「這些指標背後是否確實只有單一共同原因」這一實質命題的統計試金石。第六章的信度、第十四章的因素數目決定,以及第十五章的模型適配評鑑,說到底都在反覆檢驗這同一個前提。
形成性測量:指標為因,構念為果
形成性測量恰好把箭頭反轉:構念被視為指標的組合或結果,指標「湊成」或「造成」構念,因而稱為形成性指標或因果指標。一個典型的例子是社經地位,它由教育、收入與職業聲望等成分所定義;另一個例子是生活壓力量表,它把一連串彼此未必相關的壓力事件,例如喪偶、失業與搬遷,加總起來。在這些例子裡,把構念視為指標的共同原因並不合理:並非「社經地位高」導致某人收入高、學歷高,而是後者共同界定了前者。
形成性模型導出的推論,與反映性截然不同。第一,指標之間未必相關,收入高者未必學歷亦高,因此指標間的低相關在此非但不是缺陷,反而理所當然。第二,指標不可互換,抽掉任何一題,構念的涵蓋範圍與意義都會隨之改變;把「喪偶」自壓力量表中刪去,所量到的便是一個實質不同的壓力構念。第三,此處沒有題目層次的獨立誤差項,誤差被上移至構念層次。形成性模型可寫為 \eta = \sum_i \gamma_i x_i + \zeta。這一寫法立刻帶出形成性模型最棘手的技術難題,即辨識(identification)。純粹的形成性模型,僅憑指標自身的共變結構是無法辨識的;構念的尺度與權重 \gamma_i,唯有在該構念另行射出路徑、連向至少兩個反映性指標或其他構念時,方能估得,此即所謂的 MIMIC 設定 (MacCallum & Browne, 1993)。
形成性一詞其實混雜了數個彼此有別的概念,晚近的釐清有助於避免混淆。Bollen & Bauldry (2011) 主張,凡位於潛在變項上游的變項,至少可再區分為三類,可稱之為「三個 C」。因果指標(causal indicators)具有概念上的統一性,對潛在變項的作用屬於結構性的因果效果;複合指標(composite indicators)則僅是若干變項的加權線性組合,各成分之間不必共享同一概念,其係數為權重而非結構效果,複合構念本身更多是為了分析便利而設;至於共變項(covariates)則根本不是構念的測量,而是為避免估計偏誤所須納入控制的變項。這一區分之所以重要,是因為它揭示了「形成性」旗號下常被混為一談的異質內涵:一個由因果指標界定的構念,與一個純為便利而拼湊的複合分數,在本體論地位與統計性質上並不相同。
這一區分在方法實作上亦有實際後果。因果指標所界定的構念,通常透過 MIMIC 模型(multiple indicators and multiple causes)在結構方程的框架內估計,藉由該構念同時射向若干反映性指標來取得辨識;複合指標所界定的構念,則更常以偏最小平方(partial least squares, PLS)之類的成分取向方法處理,其本質是把指標加權為一個複合分數,而非估計一個具因果生成作用的潛在變項。兩條路徑產出的「構念」名稱或許相同,統計意義卻大相逕庭:前者是一個假設存在、可與誤差分離的潛在實體,後者則是一個依定義即等於其成分加權和的複合量。研究者若不先辨明自己要的是哪一種,便貿然套用軟體的預設程序,極易在不自覺間讓構念的意義發生位移。
反映性模型設 x_i = \lambda_i \eta + \varepsilon_i,箭頭由構念 \eta 指向指標 x_i。在局部獨立假設下,其隱含的指標共變為
故指標間的相關源於共同因素,指標的正相關與可互換性遂成為模型可檢驗的推論;誤差 \varepsilon_i 界定明確,信度可估。
形成性模型設 \eta = \sum_i \gamma_i x_i + \zeta,箭頭由指標 x_i 指向構念 \eta。指標間的相關不受模型約束,可正、可負、可為零;且無指標層次的誤差項。此模型無法由指標的共變結構單獨辨識:\eta 的尺度與權重 \gamma_i 僅在 \eta 另射出至至少兩個反映性指標或其他構念時方可估計。
兩模型的根本差異不在統計技術,而在對「構念與指標何者為因」的實質主張。把本屬形成性的指標當作反映性處理,或反其道而行,即構成測量模型的設定錯誤(measurement model misspecification),其後果包括參數偏誤、適配假象與結論失真 (Jarvis et al., 2003)。
該用哪一種?實質理論問題,而非統計問題
反映性與形成性之間的取捨,是一個關乎「構念本質」的實質理論問題,資料本身無從代為裁決。文獻中已累積若干可供依循的判準 (Bollen & Lennox, 1991; Edwards & Bagozzi, 2000; Jarvis et al., 2003):這些指標在概念上可以互換嗎?抽掉一題會改變構念的意義嗎?指標之間是否預期相關?以及最為關鍵的,究竟是構念先變動而後帶動指標(反映性),還是指標先變動而後改變構念(形成性)?這些問題的答案,共同界定了正確的測量方向。
設定錯誤的代價不容小覷。當一個本應以形成性建模的複合構念被硬套入反映性模型時,研究者往往會把那些「與其他題目相關偏低」的題目視為劣質題項而加以刪除,殊不知這些題目可能正承載著構念不可或缺的成分;一味追求內部一致性的結果,反而把構念做窄、做偏。反過來,把反映性指標誤設為形成性,則等於放棄了估計測量誤差與信度的基礎。Jarvis et al. (2003) 以模擬顯示,這類設定錯誤會系統性地扭曲結構參數的估計,且其偏誤未必反映在整體適配指標上,因而格外隱蔽。
平心而論,形成性測量自身亦非全無爭議。Howell et al. (2007) 便主張,形成性測量並不是與反映性同等可取的替代方案,其理由之一是所謂的詮釋性混淆(interpretational confounding):由於形成性構念的意義取決於它所連向的結果變項,同一組形成性指標在接上不同的下游變項時,可能界定出實質不同的構念,使構念的意義變得漂浮不定,甚至隨模型而漂移。更根本的質疑在於:一個意義完全繫於特定指標集合、又缺乏獨立於操作之存在的「構念」,究竟還算不算真正的構念,抑或只是操作論式的複合分數換了一個名稱。Bollen & Lennox (1991) 對「測量的傳統智慧」的批判,提醒研究者切莫不加思索地把反映性模型套用於一切量表;但這並不意味形成性模型可以無代價地取而代之。兩種模型各有其適用範圍與限制,抉擇的依歸永遠是回到構念的實質理論。
值得強調的是,方向的判定終究是理論工作,資料至多只能提供旁證,而無法代為定奪。縱然如此,若干實徵線索仍具參考價值:多特質多方法矩陣(第七章)可揭示指標是否如反映性所預期般,隨同一特質而聚斂、隨不同方法而分化;指標與外部變項關聯的穩定性,也能用以檢驗形成性構念是否受詮釋性混淆之累。這些工具能收窄可能性,卻無法取代研究者對構念本質的實質判斷。
潛在變項究竟是什麼?本體論與因果
測量模型的選擇,最終會逼出一個本體論問題:潛在變項究竟是什麼?Borsboom et al. (2003) 指出,潛在變項至少存在三種讀法。實在論的讀法把它視為獨立存在的屬性,測驗只是去偵測它;建構論的讀法把它視為研究者為整理資料而建構出來的產物;操作論的讀法則乾脆把它等同於測量程序本身。這三種立場並非純然思辨,它們對效度的理解有著直接的後果。
在反映性模型的實在論讀法之下,潛在變項是指標的共同原因,對個體的作答具有因果生成(causal-productive)的作用:正是個體在該屬性上的位置,造成了其在各題上的作答傾向。這一讀法為第六章的效度觀鋪好了路,也就是說,效度的核心問題,其實是「所欲測量的屬性,是否確實因果地造成了分數的變異」。而效果指標與因果指標之分,恰好對應反映性與形成性兩個相反的箭頭方向:前者為屬性之果,後者為屬性之因。
局部獨立在此獲得了更深一層的意義,它是「共同原因」在資料上留下的統計簽名。倘若潛在變項 \eta 果真是所有指標唯一的共同原因,那麼將 \eta 固定之後,指標之間便應彼此獨立;一旦資料中出現殘留的條件相關,即暗示尚有一個未被建模的維度或方法效果潛伏其中。因此,局部獨立既是反映性測量模型的核心假設,也是檢驗「背後是否真的只有單一共同原因」這一本體論主張的實徵抓手。透過這層因果讀法,測量便與第三十一章的因果推論接上了線:測量模型本身,其實就是一個關於「屬性如何產生反應」的因果模型,這也正是第二章末所預告的模型本位測量觀在此的具體展開。
這層因果讀法還逼出一個常被忽略、卻影響深遠的區分,即個體間與個體內的分野。反映性模型通常是在個體間的層次上界定的:它描述的是「為什麼在人群之中,某些人各題得分普遍偏高、某些人普遍偏低」。然而,一個在個體間成立的共同原因結構,未必能原封不動地搬到個體內的層次,去描述「同一個人在不同時刻,各指標為何一起起伏」。唯有在相當嚴格的齊質性(ergodicity)條件下,個體間與個體內的結構才會一致,而心理歷程多半並不滿足這一條件。這意味著,以橫斷、跨個體資料建立起來的測量模型,若被直接用來詮釋單一個體隨時間的變化,可能得出誤導的結論。這一警訊將在第二十九、三十章討論縱貫與密集追蹤資料時再度浮現,並成為個體內動態建模的核心關切。
近年還興起一種對「共同原因」本體論的正面挑戰,即網絡取向(network approach,第三十五章)。它主張,指標之間的正相關未必來自單一潛在共因,也可能源於指標彼此之間的直接互動:失眠導致疲憊,疲憊又加深情緒低落,這些症狀相互激盪,即使沒有一個統攝全局的「憂鬱」潛在變項,也足以產生所觀察到的相關結構。在這一觀點下,反映性測量所預設的潛在共因,便從一個理所當然的前提,轉為一個需要與網絡模型相互競逐、由證據裁決的假設。本書於此不預作定論,只提醒讀者:共同原因模型雖已主導心理測量近一個世紀,卻始終只是眾多可能的資料生成機制之一。
一張表收攏所有測量模型
反映性測量的邏輯,還可以再推廣為一套統整全書測量模型的類型學。Bartholomew et al. (2011) 提出了一個簡潔而有力的分類:依潛在變項與觀測變項各自為「連續」或「類別」,即可將主要的潛在變項模型分入四格,如表 3.1 所示。
| 連續潛在變項 | 類別潛在變項 | |
|---|---|---|
| 連續觀測變項 | 因素分析(第 14–16 章) | 潛在剖面分析(第 20 章) |
| 類別觀測變項 | 潛在特質/IRT(第 17 章) | 潛在類別分析(第 20 章) |
這張表的深意不在分類本身,而在於它點破了四類模型所共用的骨架。無論潛在與觀測變項屬於何種尺度,這四者一致假設:在潛在變項固定的條件下,觀測變項彼此獨立,也就是全都以局部獨立為核心。它們的差別,僅在於潛在變項與觀測變項各自的尺度型態。因素分析假設連續潛在配連續觀測;項目反應理論以連續的潛在特質去解釋類別反應,例如答對或答錯;潛在剖面分析以類別的潛在類別去解釋連續觀測;潛在類別分析則潛在與觀測皆為類別。看懂這一共同骨架,便能把其後看似各自獨立的第十四至二十一章,理解為同一測量理念在不同尺度情境下的各種化身。值得補充的是,這四格並非壁壘分明的邊界:因素混合模型與成長混合模型(第二十、二十九章)便同時納入了連續與類別的潛在變項,可視為在這張表的格線之間游走的混血結構,而它們之所以能被一致地理解,仍是憑藉局部獨立這一共同前提。
選對格子,實質上就是為手上資料的尺度型態選對模型,而選錯的代價往往被低估。一個最常見的失誤,是把本質上屬於次序類別的評定資料(例如李克特量尺)當成連續變項,逕以一般的因素分析處理;此時較穩健的做法,是改採適用於類別觀測的估計方式,例如第十五章將討論的加權最小平方(WLSMV)。這張表的價值,因而不只在於分類上的整潔,更在於它提醒研究者:潛在變項與觀測變項的尺度型態,本身即是模型設定的一部分,不容隨手忽略。
更值得強調的是,這張表不只是一份整齊的分類,它其實是全書測量模型的一張總索引,而索引的邊緣與界外,還安置著兩個同樣重要的模型家族。其一是認知診斷模型(diagnostic classification model,第二十一章)。它落在「類別潛在配類別觀測」這一格,卻不是一般的潛在類別分析,而是一種受了嚴格約束的潛在類別:它以多個二元的認知屬性取代單一的類別變項,並藉一張界定「哪道題需要哪些屬性」的 Q 矩陣加上結構,使模型從「把人分群」升級為「診斷人究竟掌握了哪些技能」 (Rupp et al., 2010)。其二是網絡模型(第三十五章),它索性站到了整張表的界外,因為它根本否定了表格所預設的前提,也就是指標背後必有一個潛在共因;網絡取向主張,觀測變項之間的關聯可以直接源於彼此的互動,而無須任何潛在變項居中統攝 (Borsboom & Cramer, 2013; Epskamp et al., 2018)。把這兩個家族一併標注上去,這張表便由單純的四格分類,擴充為一幅涵蓋全書、標示各模型相對位置的定位圖:由連續到類別、由單一潛在共因到多重診斷屬性、再到全無潛在變項的網絡,測量模型的整片版圖,於焉一目了然。
分數究竟代表什麼?兼論 jingle-jangle
測量模型的選擇,也直接決定了所計算出的分數代表什麼。最常見的加總分數把各題等權相加,其實暗中假設了每一題對構念的貢獻皆相等,也就是等負荷的本質 tau 等值(essentially tau-equivalent)條件;一旦這一假設不成立,等權加總便把各題實際上並不相等的貢獻混為一談。相對地,因素分數雖然顧及了負荷的差異,卻須面對第十四章將討論的因素分數不定性問題。無論採取何種計分方式,分數的意義都不是自明的,它始終是相對於某個測量模型才得以成立。這也解釋了為何同一份作答,經不同計分方式處理後,可能得出並不等價的分數。加總分數簡單透明,卻假設各題等權;因素分數顧及了負荷的差異,代價是不定性;而項目反應理論的能力估計(第十七章)雖能同時處理試題難度與鑑別度的差異,卻依賴模型設定的正確。實務上並沒有一種放諸四海皆準的「最佳」計分方式,只有「相對於某個測量模型與研究目的最為恰當」的選擇。研究者真正該問的,不是「該用加總分數還是因素分數」,而是「我所假設的測量模型是什麼,以及在該模型之下,什麼樣的分數才忠實反映了構念」。
分數能否互相比較,又牽涉另一層假設。當研究者比較不同個體、不同群體或不同時間點的分數時,這一比較的正當性,預設了測量不變性(measurement invariance),也就是測量模型的參數在被比較的單位之間保持一致。倘若不變性不成立,所觀察到的分數差異,可能來自測量方式的不同,而非構念本身的差異,這正是第十九章所要處理的核心議題。
最後須提醒一個在構念研究中反覆出現的陷阱,即 jingle-jangle 謬誤。所謂 jingle 謬誤,是誤以為名稱相同的兩個測量便在測量同一構念;jangle 謬誤則恰好相反,誤以為名稱不同便在測量不同構念。兩者交相作用,養成了「構念泛濫」(construct proliferation)的亂象:文獻中充斥著名異實同、或名同實異的構念,使知識難以累積與整合。一個為人熟知的例子,是近年關於恆毅力與盡責性之間高度重疊的爭論,兩者是否構成名異實同,至今仍有辯論。這一亂象的根源,正在於研究者對構念的界定與命名不夠審慎,也再次印證本章的核心主張,即測量始於清楚的構念理論,而非始於題目的撰寫。
小結
本章把第二章的哲學議題,翻譯為可供操作的模型語彙,其核心訊息可濃縮為一句話:測量模型是一項理論承諾,而非技術上的附屬品。選擇反映性抑或形成性、假設潛在與觀測變項屬於何種尺度、決定如何計分又如何跨單位比較,每一步都是對「構念本質」的實質主張,而非中立的技術取捨。忽略這一點,研究者極可能在精緻的統計外表之下,量度著一堆意義不明的數字。
本章所立起的座標,將貫穿其後各章。第五章由反映性測量模型出發,把此處寫下的 x_i = \lambda_i \eta + \varepsilon_i,展開為古典測驗理論完整的真分數與誤差理論;第六、第七章接續深化信度與效度;而第四部分則會逐格填滿本章表 3.1 的類型學,把每一種潛在變項模型的估計、辨識與詮釋,一一攤開細論。