第 25 章 問卷設計與作答行為
第五部 測驗發展、應用與社會脈絡
25Chapter

問卷設計與作答行為

自陳問卷是社會科學研究者最常自建、也最常低估的測量工具。相較於一份標準化的能力測驗須經第二十二章所述的完整編製流程,一份研究用的態度或人格量表,往往是研究者對著空白文件、憑感覺寫出幾道題便投入使用。這種隨性的背後,藏著一個危險的預設,即「問卷不過是把想問的問題寫下來」,彷彿受測者會像一台誠實的儀器,忠實回報其內在的真實狀態。然而,回答一道問卷題,其實是一段複雜的認知歷程,其間佈滿了可以系統性地扭曲答案的環節:題目裡多一個否定詞、量尺上多給或少給一個選項、甚至前一題留下的比較基準,都足以讓同一個人給出不同的答案。這些變動不是隨機的手滑,而是有方向、有規律的偏移,會原封不動地進入平均數、相關係數與因素負荷之中,最後被當成心理學的發現讀出來。本章要把自陳問卷,從「憑感覺寫題」提升為一門有實證基礎的測量科學。

本章沿兩條軸線並進。設計端處理「如何把題目與反應格式寫好」的實證知識,即題目撰寫的常見缺陷、反應格式的抉擇、反向題的取捨。作答端則處理「受測者如何作答」的實質理論與其建模,即反應風格、社會期許、粗心作答等系統性的作答傾向,以及如何以模型把它們與真實的構念分離。這兩條軸線共同體現了本書一以貫之的思想,即測量誤差不是隨機的雜訊,而是有結構的,因而是可以被建模、被扣除的。為使討論具體,全章以一份五題的生活滿意度量表為貫穿實例。設想這份量表的初稿依序是這五道題:「整體而言,我對目前的生活感到滿意」「我的生活條件很好」「我對我的工作與薪水感到滿意」「我並非不快樂」「我對生活感到失望」,採四點量尺作答,由「非常不同意」到「非常同意」計為一到四分,總分介於五到二十分。這五道題乍看平常,其實已經埋了雙管題、雙重否定與反向題三顆地雷。以下各節將依序為它做題目缺陷診斷、格式改版、反向題效應檢視、IRTree 分析與粗心篩檢,逐步呈現每一步對分數與因素結構的實際影響。

每一份問卷都是一段認知歷程

要理解問卷作答為何充滿誤差來源,最好的起點不是去背一張「常見錯誤清單」,而是先問一個更基本的問題:受測者從看到題目到圈下選項,這短短幾秒鐘裡究竟發生了什麼。把「回答一道題」拆解為一段認知歷程,好處是誤差不再是一團說不清的雜訊,而可以被定位到某個特定的環節,也因此可以針對那個環節去預防。Tourangeau et al. (2000) 的經典模型,把作答分為四個階段,如下面的概念方塊所示。讀完這一節,面對任何一道問卷題都應該能追問兩件事:這道題最可能在哪一個階段出錯,以及打算做的修改究竟修的是哪一個階段。

概念方塊問卷作答的四階段認知歷程

回答一道自陳題,通常經歷四個階段,每一階段都是誤差的潛在來源:

理解(comprehension):受測者如何解讀題目的字面與意圖。題目含混、雙重否定或使用陌生詞彙,會使不同人理解不一。

提取(retrieval):受測者從記憶中檢索相關的資訊或感受。提取受題目措辭、近因與情境線索影響,未必是完整而中立的。

判斷(judgment):受測者把提取到的片段整合為一個評價。此階段易受參照點、比較標準與情緒狀態左右。

對應反應(response mapping):受測者把內在的判斷,對應到題目提供的反應選項上。此階段正是反應格式與反應風格施加影響之處。

一個「誠實」的受測者,仍可能在任一階段偏離其真實狀態;問卷設計的目標,是讓這四階段盡可能忠實。

這個四階段模型的價值,在於它把「問卷誤差」由一團模糊的印象,解析為可定位、可預防的具體環節。Krosnick (1999) 對調查研究的綜述進一步指出,當作答的認知成本過高時,受測者常轉而採取「滿意即可」的捷徑,即不追求最佳答案,而只求一個過得去的答案,例如一律選中間、一律同意。這種認知節省,正是後文諸多反應偏誤的心理根源。就生活滿意度量表而言,一道措辭含混的題目,可能在「理解」階段就已讓不同受測者答的其實是不同的問題。

以大學課程評量問卷中常見的一題為例:「這門課的作業份量適當」。理解階段,「適當」對只修四門課與同時修七門課的學生並非同一件事。提取階段,學生在期末填答,腦中浮現的多半是最近一次期末報告的壓力,而不是整學期的平均負荷。判斷階段,學生會拿這門課與同學期其他課相比,參照點一換,答案就跟著換。對應反應階段,兩位同樣覺得「稍微多了一點」的學生,一位勾三分、一位勾二分,差別只在他們使用量尺的習慣。四個階段各偏一點,最後匯總成一個看似客觀的班級平均 3.8 分,而這個數字裡有多少是課程本身的性質,其實並不容易說清楚。

題目撰寫的實證知識

問卷設計最前端的一環,是把題目寫好。這件事之所以值得單獨處理,是因為題目的缺陷無法在後端補救:一道問法有問題的題,不論後續用多精緻的模型去分析,模型都只會忠實地把它的偏誤傳遞下去。這裡的許多原則與第二十二章成就測驗的試題撰寫相通,例如語句要簡短、用詞要落在受測者的詞彙範圍之內、不要在題幹裡暗示期待中的答案。但態度與自陳題另有其特有的陷阱:它問的不是有標準答案的知識,而是一個沒有外部對照的內在狀態,受測者無從察覺自己被題目帶偏,研究者也沒有答對率之類的指標可以事後補救。以下三種缺陷最常見,也最容易在自己親手寫的題目上看不出來。

最常見、也最隱蔽的缺陷,是雙管題(double-barreled item),即一道題其實同時問了兩件事,例如「我對我的工作與薪水感到滿意」。對工作滿意卻對薪水不滿的受測者,無論選同意或不同意都無法忠實作答,這道題的答案因而意義不明。設想這份生活滿意度量表施測於三百位在職者,其中約有四分之一的人正處於「工作還可以、薪水不行」的狀態,他們的作答會依各自臨場的權衡分裂到量尺兩側;結果是這道題與其餘四題的平均相關只剩 0.20,而其餘四題彼此的平均相關有 0.55。0.20 這個數字看起來像是這道題「測到了別的東西」,實情是它同時測了兩件事,再把兩件事壓成一個數字。

第二個缺陷是否定句,尤其是雙重否定,例如量表中的第四題「我並非不快樂」。這種句子要求受測者先在心裡解一次邏輯再作答,增加了理解階段的認知負擔;匆忙作答者往往只讀到「不快樂」三個字就勾選,答出與本意完全相反的分數。改寫為正面陳述的「我感到快樂」,語意並未改變,卻拿掉了一層不必要的運算。第三個是模糊量詞(vague quantifiers),例如以「經常」「有時」作為選項。不同受測者對「經常」的界定天差地別:假定請一群大學生把「經常運動」換算成每週次數,答案會從一週兩次一路散到一週六次。當甲心中的「經常」是兩次、乙心中的「經常」是六次,兩人勾選了相同的選項,這個相同的答案卻對應到相差三倍的行為頻率,分數自然不可比。改用「每週三次以上」這類有明確錨定的選項,等於把界定的工作從受測者手上收回研究者手上,代價只是題目長了幾個字。

就生活滿意度量表的體檢而言,第一步便是逐題檢視有無這些缺陷:把雙管題拆成兩題、把否定句改為正面陳述、把模糊量詞換成較明確的錨定,往往不必更動所測的構念,卻能顯著提升作答的一致性。題目寫乾淨之後,下一個問題隨即浮現:同樣一道乾淨的題目,配上不同的作答格式,得到的分布仍然可以差很多。

反應格式:幾點量尺、要不要中點

題目寫好之後,還須決定「受測者怎麼答」,也就是反應格式。這一系列抉擇看似瑣碎,往往是排版時順手決定的細節,實際上每一個都會改變分數的分布,進而改變信度、因素負荷,以及建立在這些量之上的所有結論。上一節處理的是題目說了什麼,這一節處理的是量尺允許受測者說什麼:一把只有四個刻度的尺,再誠實的人也無法用它表達第五種程度的差別;刻度過細的尺,則會逼受測者在自己分辨不出的位置之間硬做選擇。以下依序討論四個抉擇:選項的數目、中間點的有無、選項標籤的方式,以及量尺的方向。

反應選項的數目,是第一個抉擇。選項太少(如二分的是非)會損失資訊、降低信度;選項太多(如十一點)則超出多數人能穩定區辨的粒度,徒增雜訊。實證上,五至七個選項通常在資訊量與可靠性之間取得較好的平衡。設想把生活滿意度量表的四點格式改為五點,五題總分的可能範圍由五到二十分擴大為五到二十五分,恰好同分的人變少,量表區辨兩個相近受測者的能力隨之提升。但若再擴張到十一點,多數人其實只穩定使用其中的三、四個位置,多出來的刻度並沒有承載新的判斷,只是把同一個判斷隨機地灑到鄰近選項,反而拉低了再測的一致性。

第二個抉擇是中間點的有無,這是問卷設計中爭論最久的一題。提供中點(如「普通」或「無意見」)容許真正持中立態度者忠實作答,卻也給了想省事或迴避的受測者一個出口:同樣勾選中點的兩個人,一個是斟酌之後認為自己確實不偏不倚,另一個只是不想花力氣表態,資料本身分不出這兩種人。假定五點版本中有一成八的作答落在中點,這一成八該怎麼解讀就成了懸案。移除中點雖然逼出了方向,卻也把真正中立的人推向某一側,製造出實際上不存在的傾向。務實的原則是回頭看用途:若目的是估計母體中支持與反對的比例,中點會吸走大量本可歸類的資訊,不給為宜;若目的是估計一個連續構念的個別分數,保留中點較能忠實反映真實的中立,並可在需要時以後文的 IRTree 把「是否選中點」這個決策單獨取出來分析。

第三是選項標籤:只標兩端、或每一點都給文字標籤,會影響受測者對量尺的解讀。只標端點時,中間各點的間距要靠受測者自行想像;全標籤(如「非常不同意、不同意、普通、同意、非常同意」)則把每一點的意義固定下來,各點在受測者心中的間距較為一致,也較能支撐後續把作答當成等距量數來處理的做法。第四是方向,即量尺由「非常不同意」到「非常同意」或反之。這看似無關緊要,卻可能與作答習慣交互而產生細微的偏誤,因為多數人的視線由左而右、由上而下,排在前面的選項天生佔便宜。線上問卷還多出兩個常被忽略的機制。其一是預設值:若系統預先把游標停在某個選項上,這個預設會把大量本應分散的作答吸到同一格;設想課程評量系統把每題預設在中間的三分,只要有一成的學生一路按「下一頁」,全班平均就會被拉向三分。其二是題序效應:前面的題目會為後面的題目設定參照點,先問「這學期整體的學習壓力」再問「這門課的作業份量」,與倒過來問,答案的分布並不相同。這兩者都不是受測者不誠實,而是格式與順序替他先做掉了一部分判斷。

就生活滿意度量表而言,把原本的四點無中點格式,改為附文字標籤的五點格式,往往能讓分數的分布與解讀都更為合理:原本擠在「同意」一格的人被攤開到「普通」與「同意」兩格,天花板效應減輕,量表在中高分區的區辨力也隨之改善。格式調妥之後,還剩一個設計上的老問題,即要不要在量表中摻入措辭方向相反的題目。

反向題:解藥還是毒藥

為了對抗受測者「一路同意到底」的惰性,問卷設計常摻入反向題,即措辭方向與其他題相反的題目,例如生活滿意度量表中的第五題「我對生活感到失望」。其用意很直觀:一路勾同意的人碰到這道題會被絆一下,若他仍舊勾了同意,作答的矛盾便會浮現,研究者也就多了一個檢核的著力點。正因為這個道理聽起來無懈可擊,摻入反向題幾乎成了量表編製的預設動作。然而本節要說明的是,反向題是一帖有副作用的解藥:它確實能減緩機械式作答,卻同時在資料裡留下一道與構念無關的痕跡,而這道痕跡足以讓因素分析得出錯誤的結論。

推導方塊反向題的方法效應與其對因素結構的汙染

設一份量表由正向題與反向題混合而成,計分時反向題已先反向計分,理論上所有題都應正向載於同一個構念因素。然而,若受測者帶有默從傾向,即傾向對任何陳述都表示同意,則其對正向題與反向題的作答,會在「反向計分」之後產生相反方向的偏移:默從者的正向題分數被墊高、反向計分後的反向題分數被壓低。這在相關矩陣中的表現是:正向題彼此、反向題彼此的相關,會高於正向題與反向題之間的相關。當研究者對這樣的矩陣做因素分析,便極可能抽出「兩個因素」,一個由正向題構成、一個由反向題構成,並誤以為量表測了兩個構念。但這第二個因素其實不是實質構念,而是措辭方向所引入的方法因素(method factor)。

這個現象,正是第十五章相關殘差與方法因素的一個典型應用場景,在此得到了實質心理學的解釋:所謂的「用詞效應」,其機制正是默從等反應風格與題目措辭方向的交互。方法因素這個名詞值得停下來說清楚。直覺上,它是一個「不代表任何實質心理特質、只代表一群題目被用同一種方式作答」的因素;形式上,它是因素模型中的一個潛在變項,只不過載荷不依內容分群,而依施測方式分群,此處即依措辭方向分群;意涵上,載荷若不小,代表資料中有相當份量的共變來自格式而非構念,忽略它就會把格式讀成內容。設想量表施測於四百人,四道正向題彼此的平均相關為 0.55,它們與反向計分後第五題的相關卻只有 0.30。單因素模型的適配並不理想,CFI 為 0.89、RMSEA 為 0.11;前者衡量模型比起「各題毫不相關」的基線改善了多少,後者衡量平均每個自由度還殘留多少不契合。加入一個只由反向題載荷的方法因素後,兩者分別改善到 0.98 與 0.04。這 0.09 的 CFI 差距說的不是量表變好了,而是原先被誤算進構念的措辭變異,終於被放回它該去的位置。

因應之道並非棄用反向題,而是在測量模型中把方法效應明確建模,例如以一個方法因素吸收正反向題的共同措辭變異,或允許同方向題目的殘差相關。就生活滿意度量表而言,若不加處理,那道反向題可能讓一個單維量表在因素分析中看似雙維;正確的做法,是把措辭方向的方法效應納入模型,還原量表本應有的單維結構。

反應風格:測量中的系統性人格

反向題的問題,只是一個更大現象的冰山一角,這個現象即反應風格(response styles),指受測者不論題目內容為何,都傾向以某種固定方式作答的系統性習慣。直覺上,它就像一個人握筆的姿勢:與要寫什麼無關,卻穩定地留在每一個字上。反應風格是自陳測量中最頑固的一類方法變異,因為它與構念無關,卻穩定地作用於每一道題;更麻煩的是,它不會隨題數增加而互相抵銷,反而隨題數增加而累積,使加總分數不但不會更純粹,還可能更偏。本節先辨明幾種主要的反應風格,下一節再談如何把它們從分數中分離出來。

幾種主要的反應風格值得辨明。默從反應風格(acquiescence),即傾向同意任何陳述,是前一節反向題問題的根源。極端反應風格(extreme responding),即傾向使用量尺的兩端而少用中間;其鏡像是中庸反應風格,即傾向縮在中間而避免極端。這兩者扭曲的主要是變異而不只是平均:設想兩位受測者對生活的真實感受完全相同,都算得上滿意,但甲慣用五點量尺的兩端、乙慣用中間三點,甲的五題作答可能是 5、5、4、5、5,總分 24 分,乙則是 4、4、3、4、4,總分 19 分。同樣的內在狀態,總分差了五分,佔量表全距的四分之一。跨文化比較尤其棘手,因為不同文化的極端與中庸傾向本就不同,兩國樣本的平均差距究竟是幸福感的差距、還是用尺習慣的差距,只看總分無從分辨。

另一類影響深遠的是社會期許(social desirability),即傾向以「看起來好」的方式作答。Paulhus (1984) 的重要貢獻,是把社會期許拆解為兩個成分:自欺(self-deception),即真誠地相信自己較好的正向偏誤;與印象整飾(impression management),即有意識地為在他人面前塑造好形象而作假。這一區分之所以重要,在於兩者的成因與因應不同:自欺較接近人格特質,印象整飾則對情境特別敏感,尤其是高風險情境。設想同一份盡責性量表,先請在職員工在匿名的研究情境下填答,再請一批應徵同一職缺的求職者填答,求職者的平均分數通常明顯較高,而變異明顯較小,因為多數人都往量尺上端集中。這個差距不代表求職者真的比較盡責,而是印象整飾在有利害關係時被啟動了;作假在此類高風險甄選中對測驗公平與效度的威脅,則屬第二十七章的議題。反應風格的存在提醒我們,一份自陳分數,從來不只反映目標構念,還混入了受測者「如何作答」這個系統性的人格印記。

建模反應風格:從方法因子到 IRTree

既然反應風格是有結構的系統性變異,它便可以被建模與分離,而非只能徒呼負負。方法有幾個層次。最簡單的是在因素模型中設一個方法因子(第十五章),讓它吸收與構念無關的共同作答傾向;也有以多向度 IRT 把反應風格設為額外潛在維度的取向。而近年最具啟發性的一條路,是把一次作答本身拆解為一連串決策的 IRTree。

推導方塊IRTree:把一個李克特作答拆解為序列決策

IRTree 的核心構想,是把受測者對一道五點量表題的「一次作答」,重新理解為一連串的二元決策,並各以一道偽題(pseudo-item)與其 IRT 模型刻畫 (Böckenholt, 2012)。以一個五點作答為例,可拆為三個序列節點:

節點一(方向):先決定整體傾向是偏同意還是偏不同意(跳過中點)。

節點二(中點選擇):決定是否選擇中間的無意見選項。

節點三(強度):在已決定方向後,決定是普通同意還是非常同意(即是否極端)。

每個節點各由一個潛在變項驅動:節點一由目標構念(如生活滿意度)驅動,節點二與節點三則可由「中庸傾向」與「極端傾向」這兩個反應風格潛在變項驅動。如此,一次作答被分解為「構念」與「反應風格」各自的貢獻,兩者遂能被分開估計。

IRTree 的優雅之處,在於它把反應風格由「必須事後校正的汙染」,轉化為「模型內建、可與構念一併估計的潛在變項」。它也把第十八章的樹狀 IRT 思路,落實到問卷作答這個最貼近日常的場景。就生活滿意度量表而言,對同一批資料做 IRTree 分析,可能揭示某些受測者的高分,有一部分其實來自極端反應傾向,而非真正較高的滿意度。設想一位受測者五題全選 5、原始總分 25 分,在只看總分的分析裡他是全樣本最滿意的人;但 IRTree 的估計顯示,他在節點三的極端傾向高出平均 1.2 個標準差,節點一的滿意度卻只高出 0.3 個標準差。換句話說,他確實偏滿意,但滿分的來源有很大一部分是「習慣把話說滿」。把這一部分分離出來,滿意度的估計才更純粹,後續的相關分析也才不會把「愛用極端選項」錯當成滿意度的效果。

定錨情境題:讓量尺可以跨人比較

反應風格帶來的一個深層難題,是量尺的跨人不可比:設想一道自評題「整體而言,我的健康狀況如何」,甲、乙兩人都選了「好」;但甲運動員出身,對「好」的標準遠比乙嚴苛,乙則只要沒生病就算好。兩人相同的作答,其實對應著相差甚遠的真實狀態。這個問題比極端或中庸反應風格更根本:後者至少還是同一把尺被用得偏了一邊,前者則是兩人手上根本是兩把刻度不同的尺。只要量尺的解讀因人而異,跨人、尤其是跨文化的直接比較就失去共同基準,而這件事無法靠加大樣本或增加題數來補救。

King et al. (2004) 提出的定錨情境題(anchoring vignettes),為此提供了一個巧妙的解法。其做法是,除了問受測者關於自己的問題,另請他以同一把量尺去評定若干個描述假想人物的情境短文,例如「張三每天走一小時路都不覺得累,請問張三的健康狀況如何」。由於這些假想人物的「客觀狀態」對所有受測者都相同,受測者對它們的評定差異,便純粹反映了各自量尺解讀的不同。研究者於是能以受測者對定錨情境的評定為基準,去校正其對自身的評定,使不同人的分數被放到一個可比的共同量尺上。承接前例,甲、乙的自評都是「好」,但對張三這則情境,甲只給「普通」而乙給了「非常好」,可見甲整把尺都比乙嚴。校正之後,甲的健康狀況其實高於乙,與原始作答給人的印象恰好相反。定錨情境題因此是對抗量尺不可比性的一項利器,尤其在跨文化研究中價值甚高,它把「每個人的量尺都不一樣」這個困擾,轉化為一個可以測量並校正的量。

強迫選擇與 Thurstonian IRT

對抗反應風格,還有一條更根本的路,即改變反應格式本身。強迫選擇(forced-choice)格式不讓受測者對每個陳述獨立評分,而是呈現若干個內容相近、但屬不同構念的陳述,請受測者從中挑出「最符合」與「最不符合」自己的。由於各陳述在社會期許上被刻意配對得相當,受測者無法靠「全選好聽的」來作假,默從與極端反應也因無獨立量尺可施而被抑制。

然而,強迫選擇傳統上帶有一個致命的統計缺陷,即自比性(ipsativity)。直覺上,它的意思是每個人手上的籌碼總額固定,多押在一個構念上,就得從另一個構念抽走;形式上,受測者在各構念上的分數彼此相依,加總為一個對所有人都相同的常數;意涵上,這樣的分數只能回答「這個人自己內部哪個特質相對突出」,不能回答「甲的外向性是否高於乙」。設想一份測量五個構念的強迫選擇量表,每人的五個分數必然加總為 60 分,那麼甲的外向性 18 分與乙的外向性 18 分,是在各自不同的總額配置下得到的,未必代表同樣的外向程度。更麻煩的是,分數之間會被迫產生人為的負相關,五個構念兩兩相關的平均值在數學上必為負,於是連「外向性與盡責性是否正相關」這種基本問題都先天失真。這個缺陷一度使強迫選擇格式在人事甄選中興衰起伏。Brown & Maydeu-Olivares (2011) 的 Thurstonian IRT 帶來了轉機。

推導方塊Thurstonian IRT:從成對比較回復常模性分數

Thurstonian IRT 把每一次「在兩個陳述間的選擇」,建模為第四章 Thurstone 比較判斷的機率過程:每個陳述 i 對受測者有一個潛在效用 u_i,而受測者選擇 i 而非 j,若且唯若 u_i > u_j。把各陳述的效用設為其所屬構念潛在特質的因素模型,即 u_i = \mu_i + \lambda_i \eta_{d(i)} + \varepsilon_i,則一次成對選擇的機率,便可由兩陳述效用差 u_i - u_j 的分布導出。關鍵在於:由於模型直接估計的是潛在特質 \boldsymbol{\eta},而非受自比性束縛的觀察分數,只要設計滿足適當的辨識條件,如各構念有足夠多的區塊與跨構念的配對,便能從強迫選擇的成對資料中,回復出具有常模性、可跨人比較的特質分數。

Thurstonian IRT 的意義,在於它把強迫選擇由一個「能抗作假、卻不能跨人比較」的兩難,解放為一個「既抗作假、又可常模比較」的可行選項,這也正式回接了第四章的比較判斷傳統:一個世紀前 Thurstone 用以量尺化刺激的成對比較邏輯,在此被用來量尺化「人」。這使強迫選擇格式在高風險的人事甄選中重獲生機。

粗心作答:偵測與預防

前面談的反應風格,好歹還是「在回答問題」,受測者仍舊讀了題,只是把讀到的內容映射到量尺上時偏了一邊。但還有一類更根本的資料品質威脅,即受測者根本沒有認真讀題,稱為粗心作答或投入不足作答(careless or insufficient effort responding)。它與反應風格的關鍵差別在於,粗心作答與題目內容毫無關聯,因此不僅稀釋相關、壓低信度,還可能憑空製造出因素:一群一路勾同一個選項的人,會讓正向題與反向題之間出現本不該有的正相關。在冗長、無聊或缺乏動機的線上問卷中,其盛行率可能高得驚人,而它在總分上往往看不出異狀,需要專門的指標才揪得出來。

Meade & Craig (2012) 系統比較了偵測粗心作答的多種指標,其思路各異。長串同答指標偵測「連續多題選同一個選項」的異常型態。奇偶一致性等指標,把一份量表拆成兩半,檢查同一構念的兩半分數是否一致,粗心者的兩半往往彼此矛盾。以馬氏距離(第十三章的多變項離群概念)偵測「作答型態在多變項空間中極端偏離」的個案:它問的是某人的整組作答離「大家通常怎麼答」有多遠,而且這個遠近已把各題之間的相關考慮進去,因此一個在每一題上都不算極端、組合起來卻自相矛盾的型態,也會被標記出來。作答時間門檻則標記「快到不可能認真讀完題目」的作答;設想一份六十題的線上問卷,認真填答約需十分鐘,若有人三分鐘就送出,平均每題三秒,連讀完題幹都不夠。這些指標各有其偵測的粗心類型與錯誤率的權衡,實務上常聯合使用。

至於預防,最常見的是注意力檢核題,即在問卷中埋入「請在此題選非常不同意」這類指令題,答錯者即被視為未認真;但注意力檢核題本身是否會干擾正常受測者、甚至傷害量表效度,仍是一個進行中的辯論。就生活滿意度量表而言,在正式分析之前,以這些指標篩檢並剔除粗心作答者,往往能顯著改善量表的信度與因素結構的清晰度。設想在一份四百人的樣本中,以長串同答與作答時間兩項指標篩出約百分之六的個案並予剔除,量表的 \alpha 由 0.74 升到 0.82,正向題與反向計分後的反向題之間原本異常的關聯也隨之收斂。不過,剔除的準則必須事前訂定並如實報告,而非事後為了讓結果好看而挑選;否則篩檢就從品質控管變成了另一種形式的資料操弄。

跨語言與跨文化的問卷

當一份問卷要跨越語言與文化使用時,前述的一切挑戰都會被放大,並添上新的一層。把一份量表由甲語言譯為乙語言,遠不只是文字的轉換,而是一個須確保「所測構念在兩個文化中對等」的測量問題:同一個詞在兩種語言中的強度未必相同,同一個行為在兩個社會中的常見程度也未必相同。粗劣的翻譯會在最根本的「理解」階段,就使兩個語言版本的受測者答的其實是不同的題,而這種差異一旦進入資料,再精緻的統計都無法事後補救。

國際測驗委員會的翻譯與適配指引((International Test Commission, 2017))為此提供了一套系統的程序,涵蓋由前置條件、翻譯、確認、施測到計分與文件的各個環節,其核心精神是以回譯、專家審查與實證檢驗,確保譯本與原版的構念對等,而非僅止於字面對應。而「兩個語言版本是否真的測到同一件事」這個問題,最終須以第十九章的測量不變性與差異試題功能來正式檢驗:唯有當各題在跨語言群體間展現不變性時,跨文化的分數比較才站得住腳。反應風格的跨文化差異,如某些文化較傾向極端或默從,更使這一檢驗不可或缺。跨語言問卷因此把本章的作答行為議題,與第十九章的不變性架構緊密地連在一起。

前沿:線上樣本、機器偵測與 LLM

自陳測量正面臨數位時代帶來的新挑戰與新工具。前面各節所談的誤差來源,都預設了一件事:坐在問卷另一端的是一個真實的人,只是他會累、會敷衍、會有自己的作答習慣。當資料蒐集全面移到線上,這個預設本身開始鬆動,本章的核心問題於是被推前了一步:在評估作答的品質之前,得先確認作答的是誰。以下三個發展值得留意。

其一是線上樣本池與群眾外包樣本的資料品質:透過線上平台快速蒐集大樣本已成常態,但這類樣本中粗心作答、重複作答、乃至為報酬而敷衍的比例,往往高於傳統樣本,使資料品質的把關比以往更為關鍵。其二是以機器學習偵測粗心作答:相對於前述基於少數指標的偵測,機器學習能綜合作答型態、時間、軌跡等多維線索,更靈敏地標記可疑個案,其方法與計算面的細節屬於第三十四章。其三,也是最新興的,是大型語言模型代填問卷的威脅:當研究者以線上平台蒐集資料時,部分「受測者」可能是由 LLM 代為作答的機器人,其作答看似合理卻不對應任何真實的人類心理,如何偵測這類非人作答,是一個剛浮現、尚無成熟解方的問題。此外,「注意力檢核題是否反而傷害量表效度」的辯論也仍在進行。這些前沿的共同主題是:當自陳資料的蒐集愈來愈廉價、愈來愈遠端,確保「作答的是認真的人、且答的是真話」也就愈來愈成為測量效度的第一道防線。

小結

本章把自陳問卷,由「憑感覺寫題」提升為一門有實證基礎的測量科學,並沿設計與作答兩條軸線展開。設計端,從把作答理解為理解、提取、判斷、對應反應的認知歷程出發,導出題目撰寫的實證原則,包括雙管題、否定句與模糊量詞三類缺陷的辨識與修正;接著是反應格式的一連串抉擇,即量尺的點數、中間點的有無、選項標籤的方式,以及預設值與題序這些常被當成排版細節的機制;最後是反向題的兩面性。

作答端,則辨明了默從、極端、社會期許等反應風格,並展示如何以方法因子、多向度 IRT 與 IRTree 把它們與構念分離;以定錨情境題校正量尺的跨人不可比;以 Thurstonian IRT 讓抗作假的強迫選擇格式重獲常模性;並以多種指標偵測粗心作答。貫穿全章的生活滿意度量表體檢顯示,同一份五題量表,經過缺陷診斷、格式改版、反向題與反應風格的建模、以及粗心篩檢,其分數與因素結構會有實質的改變。

本章最深的一條線索,是本書一以貫之的主張在自陳測量的具體化:測量誤差不是隨機的雜訊,而是有結構的;而正因為有結構,它便可以被理解、被建模、被扣除。反應風格不是無可奈何的干擾,而是可以納入模型的潛在變項;粗心作答不是隱形的污染,而是可以偵測的型態。理解了這一點,研究者面對一份自陳分數時,便不會天真地把它當成受測者內在狀態的忠實回報,而會追問:這個分數裡,有多少是構念、有多少是作答的方式。接下來的第二十六章,將把測量誤差有結構的思想,帶到另一個「由人來評判」的場景,即當分數不是來自受測者的自陳、而是來自評分者對其表現的判斷時,評分者本身會成為一個新的、系統性的誤差來源。

參考文獻

Böckenholt, U. (2012). Modeling multiple response processes in judgment and choice. Psychological Methods, 17(4), 665–678. https://doi.org/10.1037/a0028111
Brown, A., & Maydeu-Olivares, A. (2011). Item response modeling of forced-choice questionnaires. Educational and Psychological Measurement, 71(3), 460–502. https://doi.org/10.1177/0013164410375112
International Test Commission. (2017). The ITC guidelines for translating and adapting tests (second edition). International Journal of Testing, 18(2), 101–134. https://doi.org/10.1080/15305058.2017.1398166
King, G., Murray, C. J. L., Salomon, J. A., & Tandon, A. (2004). Enhancing the validity and cross-cultural comparability of measurement in survey research. American Political Science Review, 98(1), 191–207. https://doi.org/10.1017/S000305540400108X
Krosnick, J. A. (1999). Survey research. Annual Review of Psychology, 50, 537–567. https://doi.org/10.1146/annurev.psych.50.1.537
Meade, A. W., & Craig, S. B. (2012). Identifying careless responses in survey data. Psychological Methods, 17(3), 437–455. https://doi.org/10.1037/a0028085
Paulhus, D. L. (1984). Two-component models of socially desirable responding. Journal of Personality and Social Psychology, 46(3), 598–609. https://doi.org/10.1037/0022-3514.46.3.598
Tourangeau, R., Rips, L. J., & Rasinski, K. (2000). The psychology of survey response. Cambridge University Press.
本章引用格式游琇婷(2026)。問卷設計與作答行為。《計量心理學:測量、模型與推論》(第 25 章)。