Skip to content
Announcements1 min read

Potato 2.7:測量標籤是怎麼產生的

Potato 2.7 帶來帶誤差範圍的標籤、即時規範化協作房間、反事實邊界探針、同伴預測評分、本地語音理由記錄、一條命令生成資料集報告,以及移動端標註,這些都不需要 LLM。此外還有多智慧體與多模態智慧體評測。

Potato Team

標註工具的工作是收集標籤。這一直是它的本職,Potato 從 2022 年起也一直在做。但標籤是一個決策的產物,而在過去十年的大部分時間裡,決策本身是不可見的:你拿到的是答案,而不是產生它的推理、信心或分歧。

Potato 2.7 建立在一個想法之上:標註工具應當測量判斷是怎麼做出來的,而不只是記錄它們是什麼。這一點對兩種評審都成立:做標註的人,和被評測的 AI 模型。

Potato 2.7:測量標籤是怎麼產生的,無論評審是人還是模型Potato 2.7

帶誤差範圍的標籤

心理測量引擎會在標註陸續到達的過程中擬合一個項目反應理論模型,僅憑一致性的分佈模式就能估計出每位標註者的能力和每條資料的難度。不需要黃金標籤,也不需要 LLM。

匯出結果不再是 sarcastic(3 票中的 2 票),而是 sarcastic, p = 0.94 [0.88 – 0.97]。這個機率衡量的是投了票,而不只是有多少人投票。

yaml
assignment_strategy: psychometric
psychometrics:
  enabled: true
  confidence_threshold: 0.95   # items above this stop consuming budget

從這個模型裡會自然掉出兩樣東西。後驗已經足夠確定的資料不再被分發,冗餘標註就流向真正需要它的地方。而當一條資料的區分度變成負值——也就是你最好的標註者恰恰是與大多數人意見相左的那些人——問題通常出在標註指南,而不是標註者。面板會把它標記為疑似碼本缺陷。

校準會議

每個標註團隊都會開規範化會議,而這些會議幾乎總是通過螢幕共享進行,結論留在某個人的筆記裡。多人協作房間把這樣的會議搬進 Potato 並加以記錄。

所有人先盲投。主持人揭曉結果。大家開始爭論。任何人都可以改票,而揭曉之後的每一次改動都會對照當時的多數意見記錄下來,形成一份逐人的從眾記錄。一個即時的 Krippendorff's α 指標會同時在盲投和當前投票上執行,兩者之間的差距就說明了這場討論的價值——而且是在討論進行時就能看到。

碰頭房間會自動從團隊當前存在分歧的資料中取樣。旁觀房間則讓新人觀摩資深標註者如何工作,連高亮操作都能看到。

沒有黃金標籤的品質控制

有兩項功能從不同方向攻擊同一個問題,而且都不需要埋入偽造的題目。

Truth Serum 在每次打標之後追問一個問題:你認為有百分之多少的其他標註者會選擇和你一樣的答案?這些預測會餵給"出人意料地流行"估計量(Prelec、Seung & McCoy 2017Nature),在標註困難時它優於多數投票:也就是自信的大多數判錯、而掌握資訊的少數判對的場合。據我們所知,Potato 是第一個提供同伴預測評分的標註工具。

Boundary Lab 在一個標籤落定之後立刻展示一處最小的反事實改寫,並詢問該標籤是否依然成立。回答只需一次點選,普通的標註流程就順帶產出了對比集(Gardner 等 2020)。有些探針是保義改寫,如果標註者在這類探針上翻轉了答案,那就說明這個標籤原本並沒有跟著語義走——而這一切不需要埋入任何一條黃金資料。

逐字記錄的人類推理

Think-Aloud 模式讓標註者一邊工作一邊講述。語音轉文字通過 faster-whisper 在本地執行,因此沒有任何資料離開這臺機器,也不產生按 token 計費的成本。轉寫稿逐字儲存,並刻意不做摘要,因為對出聲思考記錄做轉述,會毀掉你原本想採集的那件東西。

它記錄的是如何推理到一個標籤,與切分模型推理過程的過程獎勵工具正好構成一對。同一條資料,兩條思維鏈。

Paper 模式與 Pocket 模式

Paper 模式用一條命令把一個項目變成可編譯的 LaTeX 資料集報告:標籤分佈、標註者表格、帶正確引用的一致性統計、耗時資料,以及一段帶真實數字的侷限性說明。

bash
python -m potato.paper config.yaml -o paper_export

Pocket 模式為移動端標註提供了真正可用的介面:觸屏裝置會得到可滑動的卡片堆,按鈕落在拇指可及的區域,並支援離線同步。那些確實需要桌面端的任務(區間、邊界框、影片)不會被硬塞進手機,而是會給出提示。

評測 AI 智慧體

2.7 的另一半把同樣的理念對準了模型。智慧體評測套件現在會把一次多智慧體運行當作一個團隊來標註,而不是一份扁平的對話記錄:可點選的互動圖、跨智慧體的失敗歸因、交接審查、逐智慧體與全隊的評分卡、工具爭用時間線,以及跨智慧體的湧現行為打標。

多模態智慧體有自己的專屬介面:帶點選落點定位的 GUI 與計算機操作軌跡、帶插話檢測的全雙工語音時間線、帶即時 IoU 的影片時間定位,以及文件表格結構。

如果你想看的是完整走查而不是清單,我們寫過一篇關於排查多智慧體系統故障的文章。

兩半在哪裡匯合

它們是同一個想法對準了兩種不同的評審,而 2.7 把它們接了起來。

Think-Aloud 記錄人如何推理到一個標籤。過程獎勵標註逐步捕捉模型如何推理。把它們並排放在同一條資料上,你就能看出人與機器的判斷在哪裡分道揚鑣。

而一個 LLM 評審的可信度,上限就是你用來驗證它的那批人工標籤的可信度。評審—人類對齊面板告訴你評審與人的一致程度;心理測量和 Truth Serum 則給這些人的標籤配上置信區間。"評審與人類一致"於是成了一個帶區間的主張。

其餘更新

跨文件事件標註、對話與軌跡上的話輪級標註、帶整頁編輯器的活文件式碼本、可選 OCR 的 PDF 跨頁連結、帶分組模式的 RBAC 角色,以及支援十種語言的管理端與標註端面板。

安裝也變輕了。AI SDK 現在改為延遲載入,因此一條普通的 pip install potato-annotation 完全不會拉入任何 AI SDK,啟動時間也從大約 2.0 秒降到 0.7 秒。

如何獲取

bash
pip install --upgrade potato-annotation

Potato 免費、以 GPL-3.0-or-later 開源,可自行部署。上面這七項功能都是選擇性啟用的、與任務無關的,且沒有一項需要 LLM。如果你的資料不能離開所在機構,或者你的預算撐不起按 token 計費的賬單,這一點就很重要。

Potato 2.0 發表於 ACL 2026(系統演示專場)。如果 Potato 對你的研究有幫助,引用這篇論文即可。

可以從快速開始入手,瀏覽新特性,或者讀一讀帶誤差範圍的標籤沒有黃金標籤時的品質控制這兩篇深入文章。