開放科學、再現性與計量心理學的未來
=1.5em
本書自 Fechner 的心理物理學與 Spearman 的因素分析出發,歷經古典測驗理論、信度與效度、統計推論的基礎與爭議、實驗設計與變異數分析、迴歸與廣義線性模型、因素分析、結構方程、項目反應理論、認知診斷、測量不變性、測驗編製與等化、電腦化適性測驗、問卷與作答行為、評分者與實作評量、測驗公平、多層次與成長模型、密集縱貫、因果推論、後設分析、貝氏方法、機器學習,直至網絡心理計量學,走過了一段跨越百餘年、涵蓋整個計量心理學版圖的漫長旅程。這最後一章不再引入新的方法,而是後退一步,俯瞰全局:辨識貫穿全書的幾條主線,反思它們如何交織成一個整體,並前瞻計量心理學在開放科學與計算轉向下的未來走向。
一門成熟學科的價值,不僅在於其工具的精巧,更在於其對這些工具之限度的清醒認識。本章的核心關切,因而不是技術的堆疊,而是方法背後那些反覆出現的觀念與教訓:測量作為最深的問題、不確定性下推論的共同邏輯、潛在變項作為統一的建模架構、從關聯到因果與從解釋到預測的張力,以及貫穿一切的一個認識,即統計結果從不單由資料給定,而總是資料與假設的共同產物。這些主線的交會處,正是計量心理學作為一門學科的自我理解之所在。
一段旅程的回顧
回望全書的結構,其安排並非任意,而是循著一條由基礎至前沿、由測量至推論、由靜態至動態的內在邏輯。前半部奠立了測量的理論根基:何為構念、如何以量尺與模型加以刻畫、如何評估信度與效度。中段轉入統計推論與潛在變項建模:自 NHST 的爭議與估計的原理,到因素分析、結構方程與項目反應理論這一潛在變項模型的大家族。
後半部則邁向更複雜的結構與更前沿的取向:縱貫與多層次的變化建模、因果推論的形式框架、貝氏的統一推論典範、以及機器學習的預測轉向。這樣的排序有其道理:不先弄清楚一個分數究竟測到了什麼,就無從判斷以它算出的迴歸係數或路徑係數意味著什麼。這條路徑本身即傳遞了一個訊息:計量心理學不是一堆彼此孤立的技術,而是一個層層相扣、概念相通的知識體系。
貫穿全書的主線
若將全書化約為幾條反覆出現的主線,可得到表 36.1 所列的七個主題。它們並非彼此獨立的章節群,而是交織於全書之中的觀念脈絡:同一章往往同時觸及數條主線,而同一主線亦貫穿於相隔甚遠的各章。閱讀這張表的方式,不是把它當成章節索引,而是把它當成一組隨身的追問:面對一份新資料或一個新模型時,先問此刻真正處理的究竟是測量、推論、結構,還是預測的問題。類型一旦辨明,該調用哪一章的工具往往也就清楚了。
| 主線 | 核心問題 | 主要呼應章節 |
|---|---|---|
| 測量 | 如何測量看不見的構念 | 第 2–7、17、19、22、25–27 章 |
| 推論 | 如何在不確定下作判斷 | 第 8–13、33 章 |
| 潛在變項 | 觀測背後的結構為何 | 第 3、14–21 章 |
| 變化與時間 | 如何刻畫隨時間的變化 | 第 28–30 章 |
| 因果與整合 | 如何推論成因、如何彙整證據 | 第 31–32 章 |
| 預測 | 如何以模型預測新資料 | 第 11、34 章 |
| 計算 | 如何馴服複雜與高維 | 第 33–35 章 |
註. 七條主線相互交織而非彼此獨立;同一章常同時觸及數條主線,如第十七章項目反應理論同時屬於測量與潛在變項,第三十三章貝氏方法同時屬於推論與計算。
這七條主線的交織,正是計量心理學統一性的體現。以下數節將擇其要者,闡明它們如何在全書中反覆迴響,並在交會處揭示這門學科的核心關懷。
測量:最深的問題
若要指認計量心理學最根本、也最常被低估的問題,那便是測量本身。物理科學的許多構念有相對明確的操作與單位,而心理學所欲測量的憂鬱、智力、態度、人格,皆為無法直接觀測的潛在構念,其測量始終隔著一層由指標到構念的推論。本書自第二章的測量哲學、第三章的構念與量尺、到第五至七章的信度與效度,反覆回到這一核心:一個分數究竟測到了什麼,以及我們憑什麼相信它測到了所宣稱的構念。
效度作為一種持續的論證(第七章的 Messick (1989) 與 Kane (2013)),而非一次性的檢定,正凸顯了測量問題的開放性與艱難。令人憂心的是,這一最基礎的問題在實務中卻常被草率對待。Flake & Fried (2020) 所揭示的「可疑測量實踐」,指出大量研究對其測量工具的效度未加檢驗、對量表的修改未加報告,使建立於其上的一切統計推論根基動搖。這與再現危機互為表裡:若測量本身不可信,則再精巧的統計也只是在流沙上築樓。
本書一再強調測量不變性(第十九章)、效度論證(第七章)與測量誤差對後續推論的汙染(第十六、三十一章),正是要凸顯一個立場:測量不是統計分析的前奏,而是計量心理學的核心。一切始於測量,也受限於測量。
不確定性下的推論
計量心理學的第二條主線,是如何在不確定下作出可辯護的判斷。本書對此的處理,橫跨了看似對立、實則相通的數個框架。第八、九章剖析了 NHST 的爭議:p 值的誤解、對顯著性的過度倚賴、以及效果量與檢定力的忽視,如何助長了不可靠的文獻。第十二章轉向估計與模型選擇,以資訊準則將推論的焦點自「拒絕虛無」移向「哪個模型較能預測」。第三十三章的貝氏方法則提供了一個統一的框架,以後驗分布直接表徵參數的不確定性,並給出人們直覺所欲求的機率陳述。
這些框架表面上分歧,深層卻共享一個邏輯:推論即是在資料的證據與其固有的不確定性之間,作出審慎而透明的權衡。無論是頻率派的信賴區間、資訊準則的模型比較、還是貝氏的後驗,其共同目標都是量化「我們對某結論有多少把握」,並誠實地標示這份把握的界限。本書對此的一貫立場是:沒有任何單一的推論工具是萬能的,方法論的成熟不在於信奉某一典範,而在於理解每一框架的假設、適用範圍與限度,並據問題的性質作出恰當的選擇。統計顯著、實務重要與推論不確定,三者必須分辨;而對不確定性的誠實,是一切可信推論的前提。
潛在變項作為統一架構
本書中段的大半篇幅,圍繞著一個統一的建模架構:潛在變項模型。乍看之下,探索性與驗證性因素分析、結構方程、項目反應理論、潛在類別、成長曲線與多層次模型,是一組各自為政的技術;但本書反覆揭示,它們實為同一觀念在不同設定下的展開。第二十章的四重分類清楚地顯示,因素分析、項目反應理論、潛在剖面與潛在類別,僅是「潛在變項與觀測變項各為連續或類別」四種組合的產物。第二十八、二十九章更進一步指出,多層次模型與結構方程的成長曲線在寬鬆條件下分析等價,隨機效果本身即可視為潛在變項。
這一統一性有深刻的意涵。它意味著,一旦掌握了潛在變項的核心邏輯,即觀測指標之間的關聯由不可觀測的潛在結構所解釋,便掌握了理解這一龐大模型家族的鑰匙。局部獨立、參數估計、識別、適配評估、以及測量不變性等概念,在各模型間彼此呼應、相互闡明。本書刻意凸顯這些橫向的連結,如將二參數項目反應模型視為廣義線性混合模型(第二十八章)、將認知診斷模型連結至潛在類別(第二十、二十一章),正是為了讓讀者看見表象之下的統一結構,而非困於各自孤立的技術細節。潛在變項,是計量心理學建模思維的中樞。
從關聯到因果,從解釋到預測
計量心理學的抱負,最終指向兩個超越描述的目標:解釋成因與預測未來。第三十一章闡明了自關聯邁向因果所需的嚴謹:因果結論從不單由資料給定,而依賴一組不可由資料檢驗的假設,如可忽略性與排除限制;潛在結果與因果圖兩個框架,使這些假設得以明確、可辯護。尤其發人深省的是,因果推論最終回指測量:可操弄性的爭議揭示,一個界定含糊的構念,其「因果效果」也必然含糊,因果的嚴謹於是與測量的清晰緊密相繫。
第三十四章則引入了另一個維度:預測。Breiman (2001) 的兩種文化與 Yarkoni & Westfall (2017) 對心理學的針砭提醒我們,解釋與預測是兩種不同的目標,而心理學長期偏重前者、忽視後者,以致許多「顯著」的發現毫無樣本外預測力。描述、解釋與預測,構成了計量研究的三種模式:描述回答「是什麼」,解釋回答「為什麼」,預測回答「接下來會如何」。三者互補而非互斥,一個成熟的計量心理學,理應在恰當的問題上運用恰當的模式,並清醒地辨明自己究竟在做哪一件事。將預測的成功誤認為解釋的達成、或將關聯的發現誇大為因果的證立,是本書反覆警戒的混淆。
一個反覆的教訓:模型即假設的載體
若要自全書提煉出單一最重要的方法論教訓,那便是:統計結果從不單由資料給定,而總是資料與一組假設的共同產物,而這些假設多半無法由資料本身完全檢驗。這一教訓在每一章反覆迴響。它之所以關鍵,是因為統計軟體的輸出格式讓假設隱形:報表印出的是係數、標準誤與適配指標,卻不會印出「本結果得以成立的前提」。研究者若不主動說出這些前提,讀者便無從判斷結論有多脆弱。下方的清單即是要讓這份隱形的前提顯形。
本書所論的每一種方法,其結論的效力都繫於一組關鍵而常不可檢驗的假設:
古典測驗理論的信度,繫於平行測驗或其弱化形式的假設(第五章)。
因素分析與結構方程的估計,繫於正確的維度數、局部獨立、以及正確設定的模型結構(第十四至十六章)。
缺失資料的無偏估計,繫於隨機缺失(MAR)這一不可檢驗的假設(第十三章)。
多層次模型的效度,繫於隨機效果與預測變項不相關(第二十八章)。
成長模型的「變化」,繫於正確的軌跡形狀與縱貫測量不變性(第二十九章)。
因果推論的識別,繫於可忽略性、SUTVA 或排除限制(第三十一章)。
貝氏推論的後驗,繫於先驗與概似的設定(第三十三章)。
一個良好方法的價值,不在於它消除了假設,而在於它使假設明確、精確、且可受檢視與辯論。
這一認識帶來的不是虛無主義,而是一種方法論的成熟。它意味著,任何統計結論都應伴隨對其所依賴假設的明示與辯護,並輔以敏感度分析與穩健性檢查,以評估結論對假設違反的脆弱程度。它也意味著,方法之間的高下,往往不在於孰能給出更確定的答案,而在於孰能更透明地承載其假設。計量心理學的專業素養,因而不在於追求虛假的確定性,而在於有紀律地管理不確定性與假設。這正是本書希望讀者帶走的核心心智習慣。
再現危機與開放科學
過去十餘年,心理學經歷了一場深刻的再現危機。Open Science Collaboration (2015) 的大規模重複研究獨立重做了一百項心理學研究,其結果動搖了學界對文獻可信度的信心:原始研究中有九成七得到統計顯著的結果,重複研究達到顯著的卻只有三成六,而重複所得的平均效果量約僅原始研究的一半。把這組數字讀出來便是:一篇已發表論文所報告的效果,要在獨立樣本中再度浮現,機會並不比擲一枚硬幣高多少;即使浮現了,其強度多半也被原始文獻高估了一倍。
這場危機的根源,與本書的核心關切緊密相連。Simmons et al. (2011) 揭示,資料收集與分析中未揭露的彈性,即所謂研究者自由度,足以將幾乎任何結果包裝為顯著,這正是第八、九章所論 NHST 誤用的極端後果。這種彈性有多大,稍加盤點便知。設想一份二十題的情緒量表,研究者可用總分、可拆成兩個分量表、可刪去三題偏態嚴重的題目、也可改用因素分數;再乘上是否排除作答過快者、是否納入年齡與性別為共變項,光是這幾個看似無害的決定,就組合出上百條分析路徑,其中總會有一條落在 p<.05 的一側。而如前所述,Flake & Fried (2020) 更指出危機亦有其測量的根源:草率的測量實踐使建立其上的推論根基不穩。
回應這場危機的,是開放科學運動。其核心實踐,包括預先註冊(preregistration)以區分驗證性與探索性分析、註冊報告(registered reports)以在資料收集前即審查研究設計、以及資料、材料與程式碼的公開共享以容許獨立檢驗。
這三項實踐攔截的其實是不同的東西。預先註冊要求分析計畫在看見資料之前就寫定並存放於公開平台,於是上述那上百條路徑必須先擇定一條;事後若改道,也必須說明何處偏離了原計畫,探索性的發現因而無法再偽裝成驗證性的檢驗。註冊報告則把同儕審查切成兩段:期刊在資料收集之前先審查研究問題與設計,通過者取得原則接受,此後無論結果是否顯著都予以刊登。前者管住的是研究者的分析彈性,後者管住的是期刊的結果偏好,缺了任何一環,另一環都容易被繞過。
至於共享,它是三項實踐中最容易宣示、也最難落實的一項,障礙相當具體。臨床與教育資料常含可識別的個人資訊,去識別化需要時間與專業判斷;受試者當初簽署的同意書若未載明資料會公開,事後補正往往不可行;分析程式多半是一次性的腳本,變項名稱只有作者看得懂,整理成他人能執行的版本可能得花上數日;測驗題目更有其特殊困境,題本一旦公開,題目的安全性即告終結。因此,把共享寫進投稿規範只是第一步,真正需要的是配套:受管制取用的資料庫、可引用且有版本紀錄的資料典藏,以及把資料與程式碼視為正式學術產出的評鑑制度。
對於已經完成的研究,另一種回應是把分析的彈性攤在陽光下,而非假裝它不存在。多重宇宙分析(multiverse analysis)把每一個同樣合理的分析決定,如離群值的處理、共變項的取捨、量表的計分方式,列成並行的選項,再把所有組合都跑過一遍;規格曲線分析(specification curve analysis)則把這數百個結果依效果量排序畫成一條曲線。設想同一份資料在三百餘種合理設定下的結果:若九成落在 0.20 至 0.30 之間,這個發現相當穩健;若一半為正、一半為負而中位數貼近零,那麼原先那個顯著結果,不過是研究者在分岔路徑中選中的一條小徑。
Nosek et al. (2015) 的透明與開放促進準則,以及 Munafò et al. (2017) 的可再現科學宣言,系統地闡述了這些實踐如何自方法、報告、再現與獎勵等環節重塑科學文化。這些實踐與本書一貫的立場深相契合:明示假設、公開先驗(第三十三章)、報告效果量與不確定性(第九章)、以及誠實的樣本外評估(第三十四章),本質上都是同一種透明性的要求。開放科學不是外加於計量方法的行政負擔,而是計量嚴謹在研究實踐層面的自然延伸。
發表偏誤即是這一文化問題的縮影:其統計的偵測與校正工具屬第三十二章的範疇,而其制度成因,即期刊對顯著結果的偏好如何系統性地扭曲了可得的文獻,則須以出版文化的改革來回應。
開放科學運動最富企圖的一步,是把累積科學的邏輯前置到研究設計之中,即大團隊科學與多實驗室的協同複製計畫,預先協調眾多實驗室以共同的方案執行同一研究,其成果本質上是一個設計出來的、從源頭免除發表偏誤的累積科學,而非對既有零散文獻的事後打撈。
測量的再現性:被忽視的一環
關於再現危機的討論,多聚焦於統計實踐,如 p 值操弄與研究者自由度,而相對忽略了一個同樣根本的源頭,即測量本身的再現性。一條推論鏈的可信度,不會強於其最脆弱的一環,而測量往往正是那最脆弱、卻最少受檢視的一環。若一份量表的效度證據不足,則無論其後的統計分析多麼嚴謹、樣本多麼龐大,所得的結論都繼承了測量的不確定,這一汙染會沿著整條推論鏈向下傳遞而難以事後補救。
這不只是修辭,而是可以算出來的。衰減關係指出,兩個構念的觀測相關約等於其真實相關乘上兩份工具信度的幾何平均。設想某研究關心學業自我概念與數學成就的關聯,真實相關為 0.50,而兩份工具的信度都只有 0.60,則觀測相關的期望值降到 0.50\times\sqrt{0.60\times0.60}=0.30,一個中等強度的關聯就這樣被壓成了弱關聯。低信度同時放大了估計的抽樣變異:同一個真實效果,甲實驗室測得 0.18、乙實驗室測得 0.42,看似一次複製失敗,實則兩邊只是各自被自己的測量誤差推向不同方向。測量品質不佳,因而不只讓效果變小,更讓效果變得不穩定,而不穩定正是再現危機在數字上的樣貌。本書第七章所強調的效度論證、以及第二十五章所論的作答行為與測量實務,正是為了在源頭上鞏固這最脆弱的一環。
測量再現性的問題,還有其制度性的成因。學界對新量表的獎勵、對既有工具的忽視,助長了量表的氾濫:同一個構念名稱下,流通著數十份彼此低度相關的量表(jingle 謬誤),而名稱相異的量表卻可能測量著幾乎相同的東西(jangle 謬誤)。這一 jingle-jangle 的混亂,使跨研究的證據難以累積,因為表面上研究「同一構念」的文獻,其實測量的並非同一事物。此一問題延續自第三章對構念與量尺的討論,其解方不在於再多發明幾份量表,而在於測量的整合與標準化,以及一種把「我們究竟在測量什麼」置於研究核心的學術文化。
這種文化要落地,靠的是測量素養成為訓練與審查的常規內容,而測量素養的內涵相當具體。就研究者而言,一篇論文至少應交代:量表的來源與版本、題數與作答格式、是否經過翻譯或改編以及改了什麼、在本樣本中重新估計的信度(而非逕自引用原文獻的數值)、支持分數詮釋的效度證據,以及若涉及跨組或跨時點的比較,測量不變性是否檢驗過。就審查者而言,該問的問題同樣可以條列:這份量表測的是不是作者宣稱的構念、刪題或併題的決定在何時作成、分數的量尺是否支持所作的比較、若換一份測同一構念的工具,結論是否仍然成立。這些問題並不刁鑽,卻能攔下相當比例的可疑測量實踐。測量的再現性因而不只是技術問題,更是學科如何獎勵與累積知識的制度問題。
理論的不可或缺
在方法日益強大、資料日益龐大的時代,一個容易滋生的錯覺是:只要有足夠的資料與夠彈性的演算法,理論便可有可無。本書的立場恰恰相反。第三十四章已指出,缺乏理論約束的高維探勘,極易將樣本的偶然特異當成規律;而第二章與 Meehl 對心理學理論的長期針砭則提醒,以 NHST 進行的鬆散理論檢驗,因缺乏風險性的預測,其實對理論的考驗甚微。理論在計量研究中扮演著不可替代的三重角色:它約束了假設空間,使模型不致在無窮的可能性中過度擬合;它賦予所發現的模式以意義,將統計的關聯轉譯為實質的理解;它提供了可被嚴格否證的預測,使資料得以真正地考驗觀念。
方法與理論的關係,因而不是主從,而是對話。統計方法若無理論的引導,易淪為漫無目的的資料探勘;理論若無嚴謹方法的檢驗,則流於無法否證的思辨。計量心理學最富成效的進展,往往發生於方法的創新與理論的深化彼此激盪之處,如潛在變項模型之於構念理論、因果框架之於機制假設、網絡取向之於心理病理的結構理論。本書所介紹的一切技術,其終極目的都不是技術本身,而是服務於對人類心智更清晰、更嚴謹、更可檢驗的理解。
未來走向
展望未來,計量心理學正經歷數個相互交織的轉向。其一是密集縱貫與個殊化的取向。隨著經驗取樣、穿戴裝置與數位表徵技術的普及,研究者得以高頻率地追蹤個體的動態,這使焦點自群體平均移向個體內的歷程。Molenaar (2004) 援引遍歷性(ergodicity)理論指出,群體間的變異結構未必等同於個體內的變異結構,因而以橫斷的組間資料推論個體內的動態,往往並不合法。這一洞見呼應了 Cronbach (1957) 對相關與實驗兩種科學傳統的經典區分,並推動著動態系統、個體網絡與人本位模型的興起,讓「把人帶回科學心理學」成為可能。
其二是機器學習與心理計量的深度整合:自然語言處理將開放式文本轉為可測量的訊號、作答歷程資料揭示了超越最終作答的認知過程、而預測與測量的結合正拓展著測量所能捕捉的行為邊界(第十八、三十四章)。其三是貝氏工作流程的日益標準化,使不確定性的表徵、複雜階層模型的估計與透明的模型檢查成為常規(第三十三章)。其四是穩健性與可推廣性的方法自覺,如多重宇宙分析與規格曲線,以系統地檢視結論對分析決策的敏感。
其中最需要計量心理學嚴肅以對的,是大型語言模型帶來的三重挑戰。其一是自動命題:模型能在數秒內產出數百道看似合格的題目,但「看起來像題目」與「具有已知心理計量性質的題目」是兩回事,難度、鑑別度與差異試題功能仍須以真實受試者的作答資料估計。其二是自動計分:以模型評閱申論題,必須通過與人類評分者一致性的檢驗,並確認模型不會系統性偏袒某種文體或某個群體的表達方式,這是第二十六、二十七章評分者與公平議題的延伸。其三最為根本,即以模型模擬受試者,用生成的作答替代真人樣本來預試題目或估計量表結構。模型再現的是訓練語料中的語言規律,而非某個母體的心理歷程,其產生的相關矩陣可能相當漂亮,卻沒有對應的受試者;把這樣的資料當成效度證據,等於把構念效度的問題偷換成語言模型的模仿能力問題。
與這些技術轉向並行的,是倫理與公平的關切日益迫切:演算法的偏誤、測量的文化偏差、以及自動化決策的問責,使公平性自邊緣議題移向方法論的核心(第十九、三十四章)。貫穿這些轉向的,是計量心理學與資料科學、統計學與計算科學日深的跨域對話。然而無論工具如何演進,測量的效度與推論的嚴謹這兩塊基石,始終是這門學科不可動搖的根本。
若把這些轉向收束為對整個學科的展望,有三個議題尤其值得計量心理學社群正視。其一是測量理論與人工智慧的相互滲透,即心理計量的效度框架反過來被用以評鑑演算法所測得之物,兩個傳統的對話才剛開始。其二是作業型心理計量的人才斷層,即等化、量尺維護、大型評量與題庫管理這些支撐真實測驗運作的專門技藝,其人才培養遠跟不上需求,形成學術訓練與實務需求之間的落差。其三是開放測量(open measurement)運動的興起,即把開放科學的透明精神延伸到測量本身,主張量表的題目、計分規則、效度證據與心理計量性質都應公開共享,使測量得以被獨立檢驗、被累積、被改進。這三個議題共同指向一個判斷,即計量心理學的未來,將不僅取決於統計模型的精巧,更取決於它能否守住並更新其對測量本身的關注。
結語
計量心理學,歸根結柢,是一門讓關於心智的主張變得可辯護的學問。它的全部技術,無論是一個信度係數、一組因素負荷、一條成長軌跡、一個因果效果、還是一個後驗分布,都服務於同一個目的:在無法直接觀測的心理世界與可觀測的資料之間,架起一座既嚴謹又誠實的橋梁。本書所走過的旅程,表面上是一連串方法的展開,深層卻是同一組核心關懷的反覆迴響:我們測到了什麼、我們有多少把握、我們的結論依賴哪些假設、以及我們能否清醒地分辨描述、解釋與預測。
這門學科教給我們的,或許最終不是某種確定性,而是一種面對不確定性的成熟姿態。它要求我們在每一個數字背後,看見其所依賴的假設;在每一個顯著結果面前,追問其實質的意義與再現的可能;在每一次以模型逼近現實時,記得模型終究只是地圖而非疆域。這份謙遜並不削弱計量方法的力量,反而是其力量的來源:唯有清楚地知道一個方法能做什麼、不能做什麼,我們才能負責任地運用它。
全書開篇曾提出一個看似樸素的主張:在計量心理學裡,測量不是通往統計分析的前置作業,而是整齣戲的主角。走完三十六章之後,這句話的分量應當更清楚了。無論模型多麼精巧,其結論的上限都由分數的品質所設定;無論演算法多麼強大,它所預測的仍是某個被測量出來的東西。回到起點,正是這門學科最重要的一課。
計量心理學的未來,將由更豐富的資料、更強大的計算與更精巧的模型所形塑,但它的靈魂始終在於那些方法所服務的、關於人的根本問題:人如何思考、感受、學習與改變,人與人之間又如何異同。方法會演進,工具會更替,而以嚴謹的量化去逼近這些問題、並對自己所知的界限保持誠實,這份志業將長存。願讀者帶著這份對測量的敬重、對不確定性的誠實、與對理解的執著,走向自己的研究之路。