面向標註研究的經過驗證的調查量表:人格、情緒、身心健康與人口統計
當誰來標註很重要時,一份經過驗證的問卷勝過一道你自己憑空寫出的題目。這是對 Potato 內建的 55 份調查量表的一次巡禮,以及每一份何時值得進入你的研究。
一旦你接受了做標註的人塑造著標籤這一點,下一個問題就是要測量他們的什麼。年齡和受教育程度是顯而易見的起點,但對主觀任務來說,有意思的預測變數往往更遙遠一些:人格、價值觀、當天的心情、對被評判之物的親身經歷。誘惑在於隨手寫幾道題就往下走。這通常是個錯誤,因為你自己憑空寫出的題目沒有既往記錄,沒有可比對照組,而且常常帶著一處細微的措辭缺陷,直到分析階段你才會注意到。
當你想測量標註員身上的某樣東西時,先去找一份經過驗證的調查量表,而不是自己動筆。像 Big Five(大五人格)、PANAS(正負性情緒量表)或一套標準的人口統計題組這樣的量表,自帶經過檢驗的措辭、已知的信度,以及與大量既往工作可比的結果,這些都是臨時自擬的問題給不了你的。Potato 內建了 55 份,只要一行配置,就能用在前置調查或後置調查階段。只採集你會拿來分析的東西,把心理健康篩查量表當作敏感資料對待,並取得知情同意。 這篇文章帶你巡覽這個量表庫裡有什麼,以及其中每一部分何時值得佔據一席之地。
為什麼不乾脆自己出題
一份經過驗證的量表,是研究者已經檢驗過其信度(能否給出一致的結果?)和效度(是否測量了它所聲稱的東西?)的問卷,通常跨越大樣本和許多項研究。借用一份現成的,能買到自制題目給不了的三樣東西:已經檢查過歧義與偏差的措辭、帶有已發表常模的計分方法,以及可比性,因為你的數字能和其他所有用過同一份量表的人對得上。
自己動手的代價會在後面顯現。一道選項設錯的性別題、一把帶著細微引導性的滿意度量表、一道有一半標註員理解得不一樣的人格題:每一項都悄悄加進你無法與訊號分離的噪聲或偏差。量表的作者們已經替你付過這筆代價,好讓你不必再付。
你可能測量什麼,以及它為何會顯現在標籤裡
不是每樣東西都適合進入每一項研究。要讓量表對應上它對你任務的一個說得通的影響。
- 人口統計:是誰在標註。 人口統計題組(ANES、GSS、ACS 等)用標準化的措辭采集年齡、種族、受教育程度等等。在冒犯性、毒性和禮貌度這類任務上,這些是背後證據最充分的預測變數。
- 人格與價值觀:一個人如何評判。 Big Five(Soto and John, 2017)及其超簡版表親十項人格量表(Ten-Item Personality Inventory,Gosling et al., 2003)採集能夠塑造主觀評分的穩定傾向。道德基礎問卷(Moral Foundations Questionnaire,Graham et al., 2011)在標籤本身就是道德判斷時是天然的選擇,因為它測量的正是驅動這些判斷的道德直覺。
- 情緒:標註當下的心情。 PANAS(Watson et al., 1988)測量正性和負性情緒狀態。把它放在後置調查階段跑一次,你就能檢視心情是否與評分同步變化,這對情緒負荷較重的內容很重要。
- 親身經歷:評判的立場。 日常歧視量表(Everyday Discrimination Scale,Williams et al., 1997)測量日常經歷到的歧視。對於涉及針對某個群體的冒犯性或仇恨的任務,一個標註員是否親身經歷過,很可能與他如何解讀這些內容相關。
- 身心健康:保護標註員。 像 PHQ-9(Kroenke et al., 2001)和 GAD-7 這樣的篩查量表,根本不是衝著標籤去的。在帶有有害或令人不安內容的項目上,一次輕量的身心健康檢查能幫你察覺壓力,前提是你以這些回答所要求的謹慎去處理它們。
這個含 55 份量表的庫,按類別分組,並高亮出與標註相關的那些
需要留意的地方:敏感性、負擔與知情同意
測量你的標註員並非沒有風險,而這些類別裡有兩個分量很重。
心理健康篩查量表屬於敏感的個人資料。一個 PHQ-9 分數不是診斷,絕不應被當作診斷,也不應被用來把某人排除在工作之外。如果你要跑一次,就說清楚為什麼,保持它可選,把它和任何可識別身份的資訊分開存放,並在採集之前就想好一個令人擔憂的分數意味著什麼、該怎麼辦。拿不準時,這是一場該和倫理委員會談的對話。
長度本身就是一種稅。Big Five Inventory-2(BFI-2)有 60 道題;一整摞題組疊起來可能比標註本身還耗時。每多一道題都要付出完成率和注意力的代價,所以除非你確實需要長版本,否則就靠簡版(10 項的 TIPI、2 項的 PHQ-2),並砍掉任何你實際不會去分析的東西。和人口統計一樣,規則仍然成立:如果沒有一個你打算用它來跑的比對,它就不該上表。
在 Potato 裡怎麼做
Potato 內建一個含 55 份經過驗證的量表的庫,覆蓋人格、心理健康、情緒、社會與政治態度,以及八套人口統計題組,全部記錄在調查量表裡。這些問卷你不必自己搭建;你只需點它們的名字。
在前置調查或後置調查階段按 ID 引用一份量表:
phases:
order: [consent, prestudy, annotation, poststudy]
prestudy:
type: prestudy
instrument: "tipi" # 10-item Big Five
poststudy:
type: poststudy
instrument: "panas" # affect, measured after the task用 instruments: 疊加幾份,並在一套題組後面附上你自己的、針對本研究的題目:
phases:
prestudy:
type: prestudy
instruments:
- "gss-demographics" # standardized demographics
- "srh" # single self-rated health item
file: "surveys/study_specific.json" # appended after the instruments每份量表都帶著它的計分後設資料(方法、反向計分的題項、取值範圍和分界點),不過 Potato 把計分留給你的分析,而不是替你算出來,對於任何臨床性質的東西,這才是正確的選擇。含知情同意的人口統計展示把整個流程串在一起:一道知情同意關卡、一套放在前置調查階段的標準化人口統計題組,以及一個主觀評分任務,好讓標註員背景落在標籤旁邊,你就能在那裡分析它。
接下來讀什麼
- 《負責任地採集標註員的人口統計資訊》,講如何把人口統計題組做對。
- 《分歧是訊號,不是噪聲》,講為什麼標籤裡的人格與價值觀差異往往正是你想要的。
- 《記錄你的標註資料集》,講如何報告你測量了標註員的哪些東西。
- 調查量表,全部 55 份的完整清單,附 ID 和題項數。