Skip to content

測定と健全性

Potato はジオメトリ、時間、3D 直方体、キャプション、世界モデルの破綻点について偶然一致を補正した一致度を報告し、そのアノテーションがどう作られたかも記録します。測定機能の概要。

Potato のすべてのアノテーション形式には、アノテーター同士が一致しているかを偶然一致補正のうえで測る手段が付属し、その手法が破綻する条件も明記されています。 これは空間系・時間系の形式にも当てはまります。これらの分野では生の IoU や一致率が業界標準ですが、どちらも偶然一致を補正していません。

本セクションは問いの両側、すなわちラベルが一致しているかと、それがどう作られたかを扱います。

一貫した見取り図

問い測度
アノテーターは同じ対象を見つけたか検出 α
同じ名前で呼んだか分類 α
同じ位置に置いたか経験的な偶然ベースラインに対する σ と KS
どのマスクを信頼するかSTAPLE
イベントの開始時点で一致するか時間 IoU と境界 α
3D ボックスで一致するか厳密な回転 3D IoU
同じ領域を同じように記述するかテキスト上の意味距離を用いた α
世界が破綻した時点で一致するか許容幅スイープ付きの破綻点一致度
そのアノテーターは有能か本当にカテゴリカルな部分については MACE

なぜ偶然一致補正が要るのか

生の一致度は、ある一つの答えが支配的なときに必ず過大評価されます。そしてほとんどの場合、一つの答えが支配的です。

もっとも分かりやすいのは空間系です。すべての画像に大きな対象が一つ中央に写っているコーパスでは、誰がアノテーションしても平均 IoU は 0.95 前後になります。画像を一度も見ずに中央へボックスを描いたアノテーターでも同じです。「このアノテーターたちは一致している」と「この課題は不一致が起きようもないほど簡単だ」を切り分けるのが偶然一致補正です。

多くのアノテーションプラットフォームは、一致度を生の IoU、完全一致、あるいは正解ジョブに対する一致率として報告します。それらは有用な数値ですが、答えている問いが違います。空間ラベルについて偶然一致補正した係数を報告するアノテーションプラットフォームは、ほかに見つかっていません。

二つの設計方針

未定義の値は自分で説明します。 全員一致のコーパスでは α は本当に未定義です。むき出しの NaN は計算が壊れたように見え、1.0 を返せば嘘になるため、レポートはどちらなのかを言葉で述べます。

黙って打ち切ることはしません。 ペア比較の上限に達したレポートはその旨を述べ、何件を対象にしたかを明示します。標本上の計算結果を全件の計算結果であるかのように見せる数値は、数値がないより悪いものです。

この層が存在する理由となったバグ

かつて調停処理はアノテーションのキー同士を比較しており、画像スキーマは _data という単一のキーにすべてを格納します。そのため画像のペアはすべて一致度 1.0 と採点されていました。何ひとつ一致していない二人のアノテーターが全員一致に見え、レビューに回される画像は一つもありませんでした。

これは修正済みであり、一致度の層を各アノテーション形式に後付けせず組み込みで持たせている理由でもあります。

データがどう作られたか

一致度では、二人のアノテーターが自信を持って同じ誤りに合意した場合を捉えられませんし、読まずに受け入れられた事前ラベルも捉えられません。それに対応する二つの機能があります。

  • 描画テレメトリは、図形ごとの所要時間、ストロークの動態、修正回数、AI 提案の受け入れ遅延を記録します。
  • キーストロークログはそのテキスト側の対応物で、自由記述の回答がどう作られたかを記録します。

どちらもオプトインで、アノテーターには記録中である旨が表示されます。

信頼性と配備

  • エアギャップ環境での配備 — すべてのアセットが自分のインストールから配信され、外部リクエストがゼロであることを検証済みです。
  • 機械可読な仕様 — JSON Schema と OpenAPI ドキュメントで、いずれもコードから生成され CI で検査されます。

関連ページ