画像アノテーションツールの比較:CVAT、Label Studio、Roboflow、V7、Potato
CVAT、Label Studio、Roboflow、V7、Supervisely、Segments.ai、X-AnyLabeling、VIA、Potato を、ボックス、セグメンテーション、キーポイント、ギガピクセル画像、3D 点群について比較します。
大量のコンピュータビジョンのラベル付けでは、CVAT がオープンソースの定番ツールです。Roboflow、V7、Supervisely は、モデルの学習や管理されたワークフローを加えた商用製品です。Potato が向いているのは、画像ラベルが研究データである場合です。複数のアノテーターが同じ画像にラベルを付け、研究として一致度を報告する必要があるときです。画像がテキスト、音声、モデルの出力と同じ研究に含まれる場合にも向いています。
バウンディングボックスは物体を囲む長方形です。画像セグメンテーションは、ピクセルをポリゴンやマスクとして物体に割り当てます。キーポイントは関節のような目印を示し、スケルトンがそれらを結びます。IoU(Intersection over Union)は二つの形がどれだけ重なるかを測る指標で、多くのツールがアノテーター同士の比較に使います。
このページは画像、ギガピクセルのスライド、3D 点群を扱います。すべてのデータの種類を 1 ページで比べたものは AI アノテーションツールの比較にあります。
比較する価値のある画像アノテーションツールは?
| ツール | 動作形態 | 費用 | 向いている用途 |
|---|---|---|---|
| Potato | セルフホスト(GPL-3.0) | 無料 | 一致度を報告する、複数アノテーターによる研究 |
| CVAT | セルフホスト(MIT)またはホスティング | 無料。ホスティング版は 1 ユーザー月額 33 ドル | 大量のボックス、マスク、動画トラッキング |
| Label Studio | セルフホストまたはホスティング | Community Edition は無料。有料プランは月額 99 ドルから | テキスト、音声、動画もラベル付けするプロジェクトの画像 |
| Roboflow | ホスティング | 商用 | ラベルから学習済みの検出器をデプロイするまで |
| V7 | ホスティング | 商用 | 管理されたワークフロー、医用画像形式、モデル支援のラベル付け |
| Supervisely | セルフホストまたはホスティング | Community Edition と商用プラン | 大きな画像、3D、同じ製品内でのモデル学習 |
| Segments.ai | ホスティング | 商用 | 3D 点群とセンサーフュージョン |
| X-AnyLabeling | デスクトップアプリ | 無料 | 1 人がローカルで多くのモデルを使ってラベル付けする |
| VIA | 単一の HTML ファイル、ブラウザでオフライン動作 | 無料(BSD-2-Clause) | 何もインストールしない小規模プロジェクト |
ボックス、ポリゴン、キーポイント
ここにあるツールはどれもボックスとポリゴンを描けます。CVAT、Label Studio、Roboflow、V7、Supervisely、Segments.ai、Potato は、スケルトン付きのキーポイントにも対応しています。Potato はさらに、ポリライン、楕円、2D 直方体、インスタンスごとのブラシマスクを備えています。
成熟したコンピュータビジョンのプラットフォームは、隠れの程度、切れ(トランケーション)のフラグ、下位の種類といった属性を物体ごとに付けられます。Potato はまだ対応していません。形状にはラベルが一つ付くだけで、追加の属性には別のスキームを組み合わせる必要があります。
モデルの助けを借りたセグメンテーション
インタラクティブセグメンテーションは、クリックや大まかな輪郭をぴったりしたマスクに変えます。Potato はこれをブラウザで実行するので、GPU を用意する必要がありません。CVAT は Nuclio 関数か AI エージェント経由で、Label Studio は ML バックエンド経由でこの機能を使います。Roboflow、V7、Supervisely、Segments.ai は製品に組み込んでいます。
テキストプロンプトによるセグメンテーションは、名前を入力した物体のマスクを返します。Potato は Apache-2.0 ライセンスのモデルでこれをブラウザ内で実行します。Roboflow と V7 は自社サーバー上で SAM 3 を使い、Supervisely はアプリ経由、Label Studio は ML バックエンド経由で提供します。X-AnyLabeling は Grounding DINO、Grounded-SAM 2、SAM 2.1、YOLO をデスクトップアプリにまとめており、1 人がローカルで多くのモデルを使うならまず敵いません。Potato の強みは、アノテーターが 2 人以上になったときに出てきます。
画像セグメンテーションマスクのアノテーション方法と名前を入力して物体にラベルを付けるを参照してください。
ギガピクセル画像と病理スライド
Potato はタイルピラミッドを作り、DZI と IIIF Image API 3.0 の両方で配信します。マスクバッファーは GPU テクスチャではなく画像のピクセルを参照するため、ブラシマスクは元画像のフル解像度で動作し、テクスチャサイズの上限がありません。16 ビットの科学用 TIFF にはパーセンタイルによる表示範囲が設定され、かすかな構造も見えるようになります。V7 と Supervisely も非常に大きな画像を扱え、CVAT は一部対応です。ディープズームによるギガピクセル画像のアノテーションを参照してください。
デジタル病理には、QuPath(オープンソースのデスクトップアプリで、この分野の標準)と Cytomine(複数ユーザーでの盲検アノテーションに対応したオープンソースの Web アプリ)という専用ツールがあります。Potato は SVS、DICOM、NIfTI を読み込めません。
3D 点群
Potato は PCD、PLY、LAS、KITTI .bin、.xyz の点群に、3D 直方体、点、ポリライン、点ごとのセグメントでアノテーションします。直方体の回転はクォータニオンで保存するので、ピッチとロールが変換を往復しても失われません。直方体同士は、回転を考慮した正確な 3D IoU で比較します。アノテーションはフレーム単位です。
Segments.ai、Kognic、Deepen AI、Supervisely、Xtreme1/BasicAI は専門ツールで、自動運転の本番パイプラインではこちらが進んでいます。トラックを伝播させるシーケンス単位のワークフロー、レーダーや複数 LiDAR への対応、直方体の自動フィットがあります。CVAT、Supervisely、Segments.ai は点群シーケンスを扱えますが、Potato は扱えません。3D 点群のアノテーション方法を参照してください。
画像ラベルの一致度を測る
コンピュータビジョンのツールの多くは、アノテーター同士を重なりで比較します。CVAT のコンセンサスエンジンと V7 のコンセンサスステージは、クラスごとのしきい値に対して生の IoU で比較します。Label Studio Enterprise が挙げている指標は、完全一致、数値の差、IoU、スパンの重なりです。いずれも偶然による一致を補正しておらず、大きな物体に描いた二つのボックスは、どちらも雑に描いていても IoU が高くなります。
Potato は、形状の一致度を経験的な偶然のベースラインとともに報告します。空間ラベルについて偶然を補正した一致度を報告するアノテーションプラットフォームを、私たちはほかに見つけていません。方法はバウンディングボックスのアノテーター間一致度の測り方で説明しています。
事前ラベル付けには別の問題もあります。モデルの提案を確認せずに受け入れるアノテーターは、一致度の数字をすべて押し上げながら、正確さを下げてしまいます。Potato は描画のタイミングを記録しており、それによって見直した提案と素通しで受け入れた提案を区別できます。素通しで受け入れた事前ラベルを見つけるを参照してください。
形式
Potato は 15 種類のコンピュータビジョン形式を読み込み、そのうち 11 種類は読み書きの往復ができます。書き出し先は COCO、YOLO、Pascal VOC、CVAT、LabelMe、Cityscapes、KITTI、V7 Darwin、PNG マスク、MOT、DAVIS です。コンピュータビジョンの形式を参照してください。
1 枚の画像に 2 人のアノテーターが付くバウンディングボックスのタスク
agreement_metrics:
enabled: true
annotation_schemes:
- annotation_type: image_annotation
name: objects
description: "Draw a tight box around every vehicle."
source_field: image
tools: [bbox]
labels:
- {name: car, color: "#FF6B6B"}
- {name: truck, color: "#4ECDC4"}
num_annotators_per_item:
default: 2各画像は 2 人のアノテーターに割り当てられ、管理ダッシュボードにボックスの一致度が表示されます。
画像で Potato ができないこと
- モデルの学習はしません。 Potato は既存のモデルで事前ラベル付けをしますが、検出器は学習しません。Roboflow、V7、Supervisely、Labelbox は学習できます。
- 物体ごとの属性にはまだ対応していません。
- 点群シーケンスには対応していません。 3D アノテーションはフレーム単位です。
- DICOM、NIfTI、ホールスライド形式には対応していません。
- アノテーターの提供はありません。 自分で集めるか、Prolific で募集してください。
2026 年 8 月と 9 月に、各プロジェクトのドキュメントと料金ページで確認しました。
よくある質問
無料の画像アノテーションツールで一番良いものは?
コンピュータビジョンだけの大量の作業なら、CVAT が無料で成熟しており、セルフホストできます。テキストや音声もラベル付けするプロジェクトの画像なら、Label Studio の Community Edition と Potato のどちらも幅広く対応しています。複数のアノテーターが同じ画像にラベルを付け、一致度を報告する研究なら、Potato は無料でそれを備えています。インストールせずに少数の画像を扱うなら、VIA が単一の HTML ファイルで動きます。
Labelbox のオープンソースの代替はありますか?
CVAT、Label Studio の Community Edition、Potato はオープンソースでセルフホストできます。Labelbox は管理されたプラットフォームとラベル付けの人員を販売しています。オープンソースのツールが提供するのはソフトウェアで、アノテーターではありません。自分のチームを使うか、Prolific のようなプラットフォームで募集します。
GPU サーバーなしでモデル支援のセグメンテーションを使えますか?
はい。Potato はインタラクティブセグメンテーションとテキストプロンプトによるセグメンテーションを ONNX Runtime Web でブラウザ内で実行し、モデルの重みがマシンにあればネットワークなしで動きます。SAM 2 による動画のマスク伝播はサーバー側で実行されます。X-AnyLabeling はデスクトップ上でローカルにモデルを実行します。CVAT と Label Studio はモデルサーバーを呼び出します。
バウンディングボックスのアノテーター間一致度はどう測りますか?
各画像を 2 人以上のアノテーターに割り当て、ボックスを対応づけて、偶然を考慮した一致度を報告します。大きな物体では、アノテーターが何をしても生の IoU は高くなるからです。バウンディングボックスの一致度ガイドで、対応づけ、偶然のベースライン、報告すべき内容を説明しています。
3D 点群にはどのアノテーションツールを使うべきですか?
シーケンスとトラック伝播を伴う本番の走行データなら、Segments.ai、Kognic、Supervisely などの専門ツールを、オープンソースが必須なら CVAT を使ってください。一致度の統計が必要なフレーム単位の直方体や、3D がマルチモーダル研究の一部である場合は、Potato が向いています。