第 25 章 問卷設計與作答行為
第五部 測驗發展、應用與社會脈絡
25Chapter

問卷設計與作答行為

自陳問卷是社會科學研究者最常自建、也最常低估的測量工具。相較於一份標準化的能力測驗須經第二十二章所述的完整編製流程,一份研究用的態度或人格量表,往往是研究者對著空白文件、憑感覺寫出幾道題便投入使用。這種隨性的背後,藏著一個危險的預設,即「問卷不過是把想問的問題寫下來」,彷彿受測者會像一台誠實的儀器,忠實回報其內在的真實狀態。然而,回答一道問卷題,其實是一段複雜的認知歷程,其間佈滿了可以系統性地扭曲答案的環節。本章要把自陳問卷,從「憑感覺寫題」提升為一門有實證基礎的測量科學。 本章沿兩條軸線並進。設計端處理「如何把題目與反應格式寫好」的實證知識,即題目撰寫的常見缺陷、反應格式的抉擇、反向題的取捨。作答端則處理「受測者如何作答」的實質理論與其建模,即反應風格、社會期許、粗心作答等系統性的作答傾向,以及如何以模型把它們與真實的構念分離。這兩條軸線共同體現了本書一以貫之的思想,即測量誤差不是隨機的雜訊,而是有結構的,因而是可以被建模、被扣除的。為使討論具體,全章以一份五題的生活滿意度量表為貫穿實例,依序為它做題目缺陷診斷、格式改版、反向題效應檢視、IRTree 分析與粗心篩檢,逐步呈現每一步對分數與因素結構的實際影響。

每一份問卷都是一段認知歷程

要理解問卷作答為何充滿誤差來源,最好的起點是把「回答一道題」拆解為一段認知歷程。Tourangeau et al. (2000) 的經典模型,把作答分為四個階段,如下面的概念方塊所示。

概念方塊問卷作答的四階段認知歷程

回答一道自陳題,通常經歷四個階段,每一階段都是誤差的潛在來源:

理解(comprehension):受測者如何解讀題目的字面與意圖。題目含混、雙重否定或使用陌生詞彙,會使不同人理解不一。

提取(retrieval):受測者從記憶中檢索相關的資訊或感受。提取受題目措辭、近因與情境線索影響,未必是完整而中立的。

判斷(judgment):受測者把提取到的片段整合為一個評價。此階段易受參照點、比較標準與情緒狀態左右。

對應反應(response mapping):受測者把內在的判斷,對應到題目提供的反應選項上。此階段正是反應格式與反應風格施加影響之處。

一個「誠實」的受測者,仍可能在任一階段偏離其真實狀態;問卷設計的目標,是讓這四階段盡可能忠實。

這個四階段模型的價值,在於它把「問卷誤差」由一團模糊的印象,解析為可定位、可預防的具體環節。Krosnick (1999) 對調查研究的綜述進一步指出,當作答的認知成本過高時,受測者常轉而採取「滿意即可」的捷徑,即不追求最佳答案,而只求一個過得去的答案,例如一律選中間、一律同意。這種認知節省,正是後文諸多反應偏誤的心理根源。就生活滿意度量表而言,一道措辭含混的題目,可能在「理解」階段就已讓不同受測者答的其實是不同的問題。

題目撰寫的實證知識

問卷設計最前端的一環,是把題目寫好。這裡的許多原則與第二十二章成就測驗的試題撰寫相通,但態度與自陳題有其特有的陷阱。 最常見、也最隱蔽的缺陷,是雙管題(double-barreled item),即一道題其實同時問了兩件事,例如「我對我的工作與薪水感到滿意」。對工作滿意卻對薪水不滿的受測者,無論選同意或不同意都無法忠實作答,這道題的答案因而意義不明。第二個缺陷是否定句,尤其是雙重否定,例如「我並非不快樂」,它增加了理解階段的認知負擔,容易被誤讀。第三個是模糊量詞(vague quantifiers),例如以「經常」「有時」作為選項,不同受測者對「經常」的界定天差地別,使答案不可比。就生活滿意度量表的體檢而言,第一步便是逐題檢視有無這些缺陷:把雙管題拆成兩題、把否定句改為正面陳述、把模糊量詞換成較明確的錨定,往往不必更動所測的構念,卻能顯著提升作答的一致性。

反應格式:幾點量尺、要不要中點

題目寫好之後,還須決定「受測者怎麼答」,也就是反應格式。這一系列看似瑣碎的設計抉擇,其實各有可觀的實證後果。 反應選項的數目,是第一個抉擇。選項太少(如二分的是非)會損失資訊、降低信度;選項太多(如十一點)則超出多數人能穩定區辨的粒度,徒增雜訊。實證上,五至七個選項通常在資訊量與可靠性之間取得較好的平衡。第二個抉擇是中間點的有無。提供中點(如「無意見」)容許真正持中立態度者忠實作答,卻也給了想省事或迴避的受測者一個逃避的出口,使中點反應的意義變得含混。第三是選項標籤:只標端點、或每一點都給文字標籤,會影響受測者對量尺的解讀,而全標籤通常使各點的意義較為明確。第四是方向,即量尺由「非常不同意」到「非常同意」或反之,這看似無關緊要,卻可能與作答習慣交互而產生細微的偏誤。就生活滿意度量表而言,把原本的四點無中點格式,改為附文字標籤的五點格式,往往能讓分數的分布與解讀都更為合理。

反向題:解藥還是毒藥

為了對抗受測者「一路同意到底」的惰性,問卷設計常摻入反向題,即措辭方向與其他題相反的題目,例如在一份滿意度量表中插入「我對生活感到失望」。其用意是逼使受測者逐題細讀、而非機械式地全選同意。然而,反向題是一帖有副作用的解藥。

推導方塊反向題的方法效應與其對因素結構的汙染

設一份量表由正向題與反向題混合而成,計分時反向題已先反向計分,理論上所有題都應正向載於同一個構念因素。然而,若受測者帶有默從傾向,即傾向對任何陳述都表示同意,則其對正向題與反向題的作答,會在「反向計分」之後產生相反方向的偏移:默從者的正向題分數被墊高、反向計分後的反向題分數被壓低。這在相關矩陣中的表現是:正向題彼此、反向題彼此的相關,會高於正向題與反向題之間的相關。當研究者對這樣的矩陣做因素分析,便極可能抽出「兩個因素」,一個由正向題構成、一個由反向題構成,並誤以為量表測了兩個構念。但這第二個因素其實不是實質構念,而是措辭方向所引入的方法因素(method factor)。

這個現象,正是第十五章相關殘差與方法因素的一個典型應用場景,在此得到了實質心理學的解釋:所謂的「用詞效應」,其機制正是默從等反應風格與題目措辭方向的交互。因應之道並非棄用反向題,而是在測量模型中把方法效應明確建模,例如以一個方法因素吸收正反向題的共同措辭變異,或允許同方向題目的殘差相關。就生活滿意度量表而言,若不加處理,那道反向題可能讓一個單維量表在因素分析中看似雙維;正確的做法,是把措辭方向的方法效應納入模型,還原量表本應有的單維結構。

反應風格:測量中的系統性人格

反向題的問題,只是一個更大現象的冰山一角,這個現象即反應風格(response styles),指受測者不論題目內容為何,都傾向以某種固定方式作答的系統性習慣。反應風格是自陳測量中最頑固的一類方法變異,因為它與構念無關,卻穩定地作用於作答。 幾種主要的反應風格值得辨明。默從反應風格(acquiescence),即傾向同意任何陳述,是前一節反向題問題的根源。極端反應風格(extreme responding),即傾向使用量尺的兩端而少用中間;其鏡像是中庸反應風格,即傾向縮在中間而避免極端。這兩者都會扭曲分數的變異,也在跨文化比較中造成困擾,因為不同文化的極端與中庸傾向本就不同。另一類影響深遠的是社會期許(social desirability),即傾向以「看起來好」的方式作答。Paulhus (1984) 的重要貢獻,是把社會期許拆解為兩個成分:自欺(self-deception),即真誠地相信自己較好的正向偏誤;與印象整飾(impression management),即有意識地為在他人面前塑造好形象而作假。這一區分之所以重要,在於兩者的成因與因應不同:自欺較接近人格特質,印象整飾則對情境,尤其是高風險情境,如人事甄選,特別敏感;作假在此類高風險甄選中對測驗公平與效度的威脅,則屬第二十七章的議題。反應風格的存在提醒我們,一份自陳分數,從來不只反映目標構念,還混入了受測者「如何作答」這個系統性的人格印記。

建模反應風格:從方法因子到 IRTree

既然反應風格是有結構的系統性變異,它便可以被建模與分離,而非只能徒呼負負。方法有幾個層次。最簡單的是在因素模型中設一個方法因子(第十五章),讓它吸收與構念無關的共同作答傾向;也有以多向度 IRT 把反應風格設為額外潛在維度的取向。而近年最具啟發性的一條路,是把一次作答本身拆解為一連串決策的 IRTree。

推導方塊IRTree:把一個李克特作答拆解為序列決策

IRTree 的核心構想,是把受測者對一道五點量表題的「一次作答」,重新理解為一連串的二元決策,並各以一道偽題(pseudo-item)與其 IRT 模型刻畫 (Böckenholt, 2012)。以一個五點作答為例,可拆為三個序列節點:

節點一(方向):先決定整體傾向是偏同意還是偏不同意(跳過中點)。

節點二(中點選擇):決定是否選擇中間的無意見選項。

節點三(強度):在已決定方向後,決定是普通同意還是非常同意(即是否極端)。

每個節點各由一個潛在變項驅動:節點一由目標構念(如生活滿意度)驅動,節點二與節點三則可由「中庸傾向」與「極端傾向」這兩個反應風格潛在變項驅動。如此,一次作答被分解為「構念」與「反應風格」各自的貢獻,兩者遂能被分開估計。

IRTree 的優雅之處,在於它把反應風格由「必須事後校正的汙染」,轉化為「模型內建、可與構念一併估計的潛在變項」。它也把第十八章的樹狀 IRT 思路,落實到問卷作答這個最貼近日常的場景。就生活滿意度量表而言,對同一批資料做 IRTree 分析,可能揭示某些受測者的高分,有一部分其實來自其極端反應傾向、而非真正較高的滿意度;把這部分分離出來,滿意度的估計才更純粹。

定錨情境題:讓量尺可以跨人比較

反應風格帶來的一個深層難題,是量尺的跨人不可比:當甲、乙兩人對「你的健康狀況如何」都選「好」,但甲對「好」的標準遠比乙嚴苛時,兩人相同的作答其實對應不同的真實狀態。這種因人而異的量尺解讀,使跨人、尤其是跨文化的直接比較失去共同基準。 King et al. (2004) 提出的定錨情境題(anchoring vignettes),為此提供了一個巧妙的解法。其做法是,除了問受測者關於自己的問題,另請他以同一把量尺去評定若干個描述假想人物的情境短文,例如「張三每天走一小時路都不覺得累,你認為他的健康狀況如何」。由於這些假想人物的「客觀狀態」對所有受測者都相同,受測者對它們的評定差異,便純粹反映了各自量尺解讀的不同。研究者於是能以受測者對定錨情境的評定為基準,去校正其對自身的評定,使不同人的分數被放到一個可比的共同量尺上。定錨情境題因此是對抗量尺不可比性的一項利器,尤其在跨文化研究中價值甚高,它把「每個人的量尺都不一樣」這個困擾,轉化為一個可以測量並校正的量。

強迫選擇與 Thurstonian IRT

對抗反應風格,還有一條更根本的路,即改變反應格式本身。強迫選擇(forced-choice)格式不讓受測者對每個陳述獨立評分,而是呈現若干個內容相近、但屬不同構念的陳述,請受測者從中挑出「最符合」與「最不符合」自己的。由於各陳述在社會期許上被刻意配對得相當,受測者無法靠「全選好聽的」來作假,默從與極端反應也因無獨立量尺可施而被抑制。 然而,強迫選擇傳統上帶有一個致命的統計缺陷,即自比性(ipsativity):受測者的各構念分數彼此相依、加總為一常數,使得「甲的外向性高於乙」這類跨人的常模性比較失去意義。這個缺陷一度使強迫選擇格式在人事甄選中興衰起伏。Brown & Maydeu-Olivares (2011) 的 Thurstonian IRT 帶來了轉機。

推導方塊Thurstonian IRT:從成對比較回復常模性分數

Thurstonian IRT 把每一次「在兩個陳述間的選擇」,建模為第四章 Thurstone 比較判斷的機率過程:每個陳述 i 對受測者有一個潛在效用 u_i,而受測者選擇 i 而非 j,若且唯若 u_i > u_j。把各陳述的效用設為其所屬構念潛在特質的因素模型,即 u_i = \mu_i + \lambda_i \eta_{d(i)} + \varepsilon_i,則一次成對選擇的機率,便可由兩陳述效用差 u_i - u_j 的分布導出。關鍵在於:由於模型直接估計的是潛在特質 \boldsymbol{\eta},而非受自比性束縛的觀察分數,只要設計滿足適當的辨識條件,如各構念有足夠多的區塊與跨構念的配對,便能從強迫選擇的成對資料中,回復出具有常模性、可跨人比較的特質分數。

Thurstonian IRT 的意義,在於它把強迫選擇由一個「能抗作假、卻不能跨人比較」的兩難,解放為一個「既抗作假、又可常模比較」的可行選項,這也正式回接了第四章的比較判斷傳統:一個世紀前 Thurstone 用以量尺化刺激的成對比較邏輯,在此被用來量尺化「人」。這使強迫選擇格式在高風險的人事甄選中重獲生機。

粗心作答:偵測與預防

前面談的反應風格,好歹還是「在回答問題」,只是帶著系統性的傾向。但還有一類更根本的資料品質威脅,即受測者根本沒有認真作答,稱為粗心作答或投入不足作答(careless or insufficient effort responding)。在冗長、無聊或缺乏動機的線上問卷中,其盛行率可能高得驚人。 Meade & Craig (2012) 系統比較了偵測粗心作答的多種指標,其思路各異。長串同答指標偵測「連續多題選同一個選項」的異常型態。奇偶一致性等指標,把一份量表拆成兩半,檢查同一構念的兩半分數是否一致,粗心者的兩半往往彼此矛盾。以馬氏距離(第十三章的多變項離群概念)偵測「作答型態在多變項空間中極端偏離」的個案。作答時間門檻則標記「快到不可能認真讀完題目」的作答。這些指標各有其偵測的粗心類型與錯誤率的權衡,實務上常聯合使用。至於預防,最常見的是注意力檢核題,即在問卷中埋入「請在此題選非常不同意」這類指令題,答錯者即被視為未認真;但注意力檢核題本身是否會干擾正常受測者、甚至傷害量表效度,仍是一個進行中的辯論。就生活滿意度量表而言,在正式分析之前,以這些指標篩檢並剔除粗心作答者,往往能顯著改善量表的信度與因素結構的清晰度⸺但剔除的準則須事前訂定並如實報告,而非事後為了讓結果好看而挑選。

跨語言與跨文化的問卷

當一份問卷要跨越語言與文化使用時,前述的一切挑戰都會被放大,並添上新的一層。把一份量表由甲語言譯為乙語言,遠不只是文字的轉換,而是一個須確保「所測構念在兩個文化中對等」的測量問題。粗劣的翻譯會在最根本的「理解」階段就使兩個語言版本的受測者答的是不同的題。 國際測驗委員會的翻譯與適配指引((International Test Commission, 2017))為此提供了一套系統的程序,涵蓋由前置條件、翻譯、確認、施測到計分與文件的各個環節,其核心精神是以回譯、專家審查與實證檢驗,確保譯本與原版的構念對等,而非僅止於字面對應。而「兩個語言版本是否真的測到同一件事」這個問題,最終須以第十九章的測量不變性與差異試題功能來正式檢驗:唯有當各題在跨語言群體間展現不變性時,跨文化的分數比較才站得住腳。反應風格的跨文化差異,如某些文化較傾向極端或默從,更使這一檢驗不可或缺。跨語言問卷因此把本章的作答行為議題,與第十九章的不變性架構緊密地連在一起。

前沿:線上樣本、機器偵測與 LLM

自陳測量正面臨數位時代帶來的新挑戰與新工具。其一是線上樣本池與群眾外包樣本的資料品質:透過線上平台快速蒐集大樣本已成常態,但這類樣本中粗心作答、重複作答、乃至為報酬而敷衍的比例,往往高於傳統樣本,使資料品質的把關比以往更為關鍵。其二是以機器學習偵測粗心作答:相對於前述基於少數指標的偵測,機器學習能綜合作答型態、時間、軌跡等多維線索,更靈敏地標記可疑個案,其方法與計算面的細節屬於第三十四章。其三,也是最新興的,是大型語言模型代填問卷的威脅:當研究者以線上平台蒐集資料時,部分「受測者」可能是由 LLM 代為作答的機器人,其作答看似合理卻不對應任何真實的人類心理,如何偵測這類非人作答,是一個剛浮現、尚無成熟解方的問題。此外,「注意力檢核題是否反而傷害量表效度」的辯論也仍在進行。這些前沿的共同主題是:當自陳資料的蒐集愈來愈廉價、愈來愈遠端,確保「作答的是認真的人、且答的是真話」也就愈來愈成為測量效度的第一道防線。

小結

本章把自陳問卷,由「憑感覺寫題」提升為一門有實證基礎的測量科學,並沿設計與作答兩條軸線展開。設計端,從把作答理解為理解、提取、判斷、對應反應的認知歷程出發,導出題目撰寫的實證原則、反應格式的抉擇、以及反向題的兩面性。作答端,則辨明了默從、極端、社會期許等反應風格,並展示如何以方法因子、多向度 IRT 與 IRTree 把它們與構念分離;以定錨情境題校正量尺的跨人不可比;以 Thurstonian IRT 讓抗作假的強迫選擇格式重獲常模性;並以多種指標偵測粗心作答。貫穿全章的生活滿意度量表體檢顯示,同一份五題量表,經過缺陷診斷、格式改版、反向題與反應風格的建模、以及粗心篩檢,其分數與因素結構會有實質的改變。 本章最深的一條線索,是本書一以貫之的主張在自陳測量的具體化:測量誤差不是隨機的雜訊,而是有結構的;而正因為有結構,它便可以被理解、被建模、被扣除。反應風格不是無可奈何的干擾,而是可以納入模型的潛在變項;粗心作答不是隱形的污染,而是可以偵測的型態。理解了這一點,研究者面對一份自陳分數時,便不會天真地把它當成受測者內在狀態的忠實回報,而會追問:這個分數裡,有多少是構念、有多少是作答的方式。接下來的第二十六章,將把測量誤差有結構的思想,帶到另一個「由人來評判」的場景,即當分數不是來自受測者的自陳、而是來自評分者對其表現的判斷時,評分者本身會成為一個新的、系統性的誤差來源。

參考文獻

Böckenholt, U. (2012). Modeling multiple response processes in judgment and choice. Psychological Methods, 17(4), 665–678. https://doi.org/10.1037/a0028111
Brown, A., & Maydeu-Olivares, A. (2011). Item response modeling of forced-choice questionnaires. Educational and Psychological Measurement, 71(3), 460–502. https://doi.org/10.1177/0013164410375112
International Test Commission. (2017). The ITC guidelines for translating and adapting tests (second edition). International Journal of Testing, 18(2), 101–134. https://doi.org/10.1080/15305058.2017.1398166
King, G., Murray, C. J. L., Salomon, J. A., & Tandon, A. (2004). Enhancing the validity and cross-cultural comparability of measurement in survey research. American Political Science Review, 98(1), 191–207. https://doi.org/10.1017/S000305540400108X
Krosnick, J. A. (1999). Survey research. Annual Review of Psychology, 50, 537–567. https://doi.org/10.1146/annurev.psych.50.1.537
Meade, A. W., & Craig, S. B. (2012). Identifying careless responses in survey data. Psychological Methods, 17(3), 437–455. https://doi.org/10.1037/a0028085
Paulhus, D. L. (1984). Two-component models of socially desirable responding. Journal of Personality and Social Psychology, 46(3), 598–609. https://doi.org/10.1037/0022-3514.46.3.598
Tourangeau, R., Rips, L. J., & Rasinski, K. (2000). The psychology of survey response. Cambridge University Press.
本章引用格式游琇婷(2026)。問卷設計與作答行為。《計量心理學:測量、模型與推論》(第 25 章)。