Skip to content
Announcements1 min read

Potato 2.7:ラベルがどう作られるかを測る

Potato 2.7では、エラーバーつきのラベル、ライブのノーミングルーム、反実仮想の境界プローブ、ピア予測によるスコアリング、ローカルで動く音声の根拠、1コマンドのデータセットレポート、モバイルアノテーションが加わりました。どれもLLMを必要としません。さらにマルチエージェントとマルチモーダルのエージェント評価も。

Potato Team

アノテーションツールはラベルを集めます。それが仕事で、Potatoは2022年からそれをやってきました。しかしラベルは判断の出力であり、この10年のほとんどの期間、判断そのものは見えないままでした。手に入るのは答えだけで、そこに至った推論も、確信の度合いも、意見の割れ方も残りません。

Potato 2.7は1つの考えの上に立っています。アノテーションツールは、判断が何だったかを記録するだけでなく、判断がどう下されたかを測るべきだ、という考えです。これは2種類の判断者、つまりアノテーションする人間と、評価されるAIモデルの両方に当てはまります。

Potato 2.7:判断者が人でもモデルでも、ラベルがどう作られるかを測るPotato 2.7

エラーバーつきのラベル

心理測定エンジンは、アノテーションが届くのに合わせて項目反応理論のモデルを当てはめ、一致のパターンだけから各アノテーターの能力と各アイテムの難易度を推定します。ゴールドラベルもLLMも使いません。

エクスポートには sarcastic (2 of 3 votes) ではなく sarcastic, p = 0.94 [0.88 – 0.97] と出ます。この確率は、何人が投票したかだけでなく誰が投票したかを重み付けしています。

yaml
assignment_strategy: psychometric
psychometrics:
  enabled: true
  confidence_threshold: 0.95   # items above this stop consuming budget

このモデルからは2つのことが出てきます。事後確率がすでに十分に高いアイテムは配られなくなるので、重複は本当に必要なところに回ります。そして、あるアイテムの識別力が負に振れたとき、つまり最も優秀なアノテーターこそが多数派と食い違っているとき、それはたいてい悪いアノテーターではなく壊れたガイドラインの話です。ダッシュボードはそれをコードブックのバグの疑いとしてフラグ付けします。

キャリブレーション会議を、ツールの中へ

どのアノテーションチームもノーミングセッションをやっていますが、それはほぼ必ず画面共有で行われ、結果は誰かのメモの中に残ります。Multiplayer Roomsは、そのセッションをPotatoの中に移し、計測できるようにします。

全員がブラインドで投票します。ホストが公開します。グループで議論します。誰でも投票を変えられて、公開後の変更はすべて、その時点で多数派が何だったかと合わせて記録されます。これがメンバーごとの同調の記録になります。ライブのKrippendorff's αメーターが、ブラインド投票と現在の投票の両方に対して同時に走るので、その差から、いま進行中の議論に何の意味があったのかが分かります。

Huddleルームは、チームがいま意見の割れているアイテムを自分で拾ってきます。Shadowルームでは、研修中のアノテーターが先輩の作業を、ハイライトも含めて見られます。

ゴールドラベルなしの品質管理

2つの機能が同じ問題に別の方向から挑みます。どちらも偽のアイテムを仕込みません。

Truth Serumは、各ラベルのあとに質問を1つ足します。他のアノテーターの何パーセントが、あなたと同じものを選ぶと思いますか、というものです。この予測が、意外に多い(surprisingly popular)推定量を動かします(Prelec, Seung & McCoy 2017Nature)。これは、アノテーションが難しいまさにその場所、つまり自信を持った多数派が誤っていて事情を知る少数派が正しいときに、多数決を上回ります。私たちの知る限り、ピア予測によるスコアリングを搭載したアノテーションツールはPotatoが初めてです。

Boundary Labは、ラベルが付いた直後に最小限の反実仮想的な編集を提示し、そのラベルが保たれるかを尋ねます。回答はクリック1回で済み、通常のアノテーションから副産物としてコントラストセット(Gardner et al. 2020)が生まれます。プローブの一部は意味を保つ言い換えなので、そこで判断を変えるアノテーターは何かを教えてくれています。ゴールドアイテムを1つも仕込まずに、です。

人間の推論を、逐語で残す

Think-Aloud モードは、アノテーターが作業しながら話せるようにします。音声認識はfaster-whisperを通じてローカルで動くので、何も端末の外に出ず、トークン単位の費用もかかりません。文字起こしは逐語で、あえて要約せずに保存されます。think-aloudプロトコルを言い換えてしまうと、集めようとしていた資料が壊れるからです。

目的は根拠だけではありません。これはがどうラベルへたどり着くかの記録であり、モデルの推論を切り分けるプロセス報酬まわりの機能の、人間側の対応物です。同じアイテム、2つの思考の連鎖。

あと2つ、そしてエージェントの話

Paper Modeは、プロジェクトを1コマンドでコンパイル可能なLaTeXのデータセットレポートに変えます。ラベル分布、アノテーター表、正しい引用付きの一致度統計、所要時間、そして実数値の入った正直な限界の段落まで出ます。

bash
python -m potato.paper config.yaml -o paper_export

Pocket Modeは、モバイルでのアノテーションを一級の機能にします。タッチデバイスには、親指の届く位置にボタンを置いたスワイプ式のカードスタックとオフライン同期が提供されます。デスクトップが本当に必要なタスク(スパン、バウンディングボックス、動画)が、スマートフォン向けに劣化させられることはありません。代わりに警告が出ます。

AIエージェントを評価する

2.7のもう半分は、同じ考え方をモデルに向けます。エージェント評価スイートは、マルチエージェントの実行をフラットなトランスクリプトではなくチームとしてアノテーションできるようになりました。クリック可能な相互作用グラフ、エージェント間の失敗の帰属、引き継ぎのレビュー、エージェント別とチーム別のスコアカード、ツール競合のタイムライン、エージェントをまたぐ創発的な振る舞いのタグ付けが入っています。

マルチモーダルエージェントにも専用の面があります。クリックのグラウンディング付きのGUI・コンピュータ操作の軌跡、バージインの検出を伴う全二重の音声タイムライン、ライブIoU付きの動画の時間グラウンディング、そして文書の表構造です。

一覧ではなく実際の手順が見たい場合は、マルチエージェントの失敗をデバッグするを書いてあります。

2つの半分が出会うところ

これらは同じ考えを2種類の判断者に向けたもので、2.7は両者を配線でつないでいます。

Think-Aloudは、人がどうラベルへたどり着くかを記録します。プロセス報酬アノテーションは、モデルがどう推論するかをステップごとに捉えます。同じアイテムの上に並べれば、人間と機械の判断がどこで分かれるかが見えます。

そしてLLMジャッジが信頼できるのは、それを検証した相手である人間のラベルが信頼できる範囲までです。ジャッジと人間のアラインメントを見るダッシュボードは、ジャッジが人とどれだけ一致するかを教えてくれます。心理測定とTruth Serumは、その人たちのラベルに信頼区間を与えます。「ジャッジは人間と一致する」は雰囲気の話ではなくなり、区間の付いた主張になります。

そのほか

文書をまたぐイベントアノテーション、会話やトレースに対するターン単位のアノテーション、全画面エディタを備えた生きたドキュメントとしてのコードブック、任意でOCRを使えるPDFのページ間リンク、コホートごとのスキーマを持つRBACのロール、そして10言語対応の管理者・アノテーターダッシュボード。

インストールも軽くなりました。AI SDKは遅延読み込みになったので、素の pip install potato-annotation ではAI SDKを一切引き込まず、起動時間はおよそ2.0秒から0.7秒に下がりました。

入手方法

bash
pip install --upgrade potato-annotation

Potatoは無料で、GPL-3.0-or-laterのオープンソースで、自前でホストできます。上に挙げた7つの機能はどれもオプトインで、タスクに依存せず、LLMを必要としません。データを機関の外に出せない場合や、トークン単位の請求を予算が飲み込めない場合には、これが効いてきます。

Potato 2.0はACL 2026(System Demonstrations)で発表されました。研究でPotatoが役に立ったら、引用するのはこの論文です。

まずはクイックスタートから始めるか、新機能を眺めるか、掘り下げた記事のエラーバーつきのラベルゴールドラベルなしの品質管理を読んでください。