Strumenti di annotazione delle immagini a confronto: CVAT, Label Studio, Roboflow, V7 e Potato
Confronta CVAT, Label Studio, Roboflow, V7, Supervisely, Segments.ai, X-AnyLabeling, VIA e Potato per box, segmentazione, keypoint, immagini gigapixel e nuvole di punti 3D.
Per l'etichettatura di computer vision su larga scala, CVAT è lo strumento open source di riferimento, e Roboflow, V7 e Supervisely aggiungono, come prodotti commerciali, l'addestramento di modelli o flussi di lavoro gestiti. Potato è adatto quando le etichette delle immagini sono dati di ricerca: più annotatori etichettano le stesse immagini, e lo studio deve riportare quanto concordano. È adatto anche quando le immagini condividono uno studio con testo, audio o output di modelli.
Un bounding box è il rettangolo intorno a un oggetto. La segmentazione delle immagini assegna i pixel agli oggetti, come poligoni o come maschere. I keypoint segnano punti di riferimento come le articolazioni, e uno scheletro li collega. L'intersection over union (IoU) misura quanto si sovrappongono due forme, e la maggior parte degli strumenti la usa per confrontare gli annotatori.
Questa pagina tratta immagini, vetrini gigapixel e nuvole di punti 3D. Strumenti di annotazione con IA a confronto copre tutti i tipi di dati in una sola pagina.
Quali strumenti di annotazione delle immagini conviene confrontare?
| Strumento | Funziona come | Costo | Adatto a |
|---|---|---|---|
| Potato | Ospitato in proprio (GPL-3.0) | Gratuito | Studi con più annotatori che riportano l'accordo |
| CVAT | Ospitato in proprio (MIT) o in hosting | Gratuito; in hosting 33 $ per utente al mese | Box, maschere e tracciamento video su grandi volumi |
| Label Studio | Ospitato in proprio o in hosting | Community Edition gratuita; piani a pagamento da 99 $ al mese | Immagini in progetti che etichettano anche testo, audio o video |
| Roboflow | In hosting | Commerciale | Passare dalle etichette a un rilevatore addestrato e distribuito |
| V7 | In hosting | Commerciale | Flussi gestiti, formati di imaging medico, etichettatura assistita da modelli |
| Supervisely | Ospitato in proprio o in hosting | Community Edition; livelli commerciali | Immagini grandi, 3D e addestramento di modelli nello stesso prodotto |
| Segments.ai | In hosting | Commerciale | Nuvole di punti 3D e fusione di sensori |
| X-AnyLabeling | App desktop | Gratuito | Una persona che etichetta in locale con molti modelli |
| VIA | Un singolo file HTML, offline nel browser | Gratuito (BSD-2-Clause) | Piccoli progetti senza installare nulla |
Box, poligoni e keypoint
Tutti questi strumenti disegnano box e poligoni. CVAT, Label Studio, Roboflow, V7, Supervisely, Segments.ai e Potato gestiscono anche keypoint con scheletri. Potato aggiunge polilinee, ellissi, cuboidi 2D e maschere a pennello per istanza.
Le piattaforme mature di computer vision associano attributi a ogni oggetto, come un livello di occlusione, un indicatore di troncamento o un sottotipo. Potato non lo fa ancora. Lì la geometria porta un'etichetta, e gli attributi aggiuntivi richiedono uno schema di accompagnamento.
Segmentazione con l'aiuto di un modello
La segmentazione interattiva trasforma un clic o un contorno approssimativo in una maschera aderente. Potato la esegue nel browser, senza GPU da predisporre. CVAT ci arriva tramite funzioni Nuclio o la sua via ad agenti IA, e Label Studio tramite un backend ML. Roboflow, V7, Supervisely e Segments.ai la integrano nel prodotto.
La segmentazione da testo restituisce una maschera per l'oggetto che nomini. Potato la esegue nel browser con un modello sotto licenza Apache-2.0. Roboflow e V7 usano SAM 3 sui propri server, Supervisely la offre tramite app e Label Studio tramite un backend ML. X-AnyLabeling riunisce Grounding DINO, Grounded-SAM 2, SAM 2.1 e YOLO in un'app desktop, e per una persona che etichetta in locale con molti modelli è difficile da battere. Il vantaggio di Potato inizia quando c'è più di un annotatore.
Vedi Come annotare maschere di segmentazione delle immagini ed etichettare oggetti digitandone il nome.
Immagini gigapixel e vetrini di patologia
Potato costruisce una piramide di tasselli servita sia come DZI sia come IIIF Image API 3.0. Le maschere a pennello lavorano alla piena risoluzione della sorgente, perché il buffer della maschera indicizza i pixel dell'immagine e non una texture della GPU, quindi non c'è un limite alla dimensione della texture. I TIFF scientifici a 16 bit ricevono una finestra per percentili, così le strutture deboli restano visibili. Anche V7 e Supervisely gestiscono immagini molto grandi, e CVAT in parte. Vedi Annotazione di immagini gigapixel con il deep zoom.
Per la patologia digitale, QuPath (app desktop open source, lo standard del settore) e Cytomine (app web open source con annotazione in cieco multiutente) sono costruiti apposta. Potato non legge SVS, DICOM né NIfTI.
Nuvole di punti 3D
Potato annota nuvole PCD, PLY, LAS, KITTI .bin e .xyz con cuboidi 3D, punti, polilinee e segmenti per punto. Memorizza la rotazione dei cuboidi come quaternione, così beccheggio e rollio sopravvivono a una conversione andata e ritorno, e confronta i cuboidi con IoU 3D ruotata esatta. L'annotazione è per fotogramma.
Segments.ai, Kognic, Deepen AI, Supervisely e Xtreme1/BasicAI sono specialisti e, per le pipeline di produzione della guida autonoma, sono più avanti: flussi su sequenze con propagazione delle tracce, supporto per radar e più LiDAR, e cuboidi adattati automaticamente. CVAT, Supervisely e Segments.ai gestiscono sequenze di nuvole di punti, cosa che Potato non fa. Vedi Come annotare nuvole di punti 3D.
Misurare l'accordo sulle etichette delle immagini
La maggior parte degli strumenti di computer vision confronta gli annotatori in base alla sovrapposizione. Il motore di consenso di CVAT e la fase di consenso di V7 confrontano gli annotatori con la IoU grezza rispetto a una soglia per classe, e Label Studio Enterprise elenca corrispondenza esatta, differenza numerica, IoU e sovrapposizione degli span. Nessuna di queste misure corregge per il caso, e la IoU di due box su un oggetto grande è alta anche se entrambi sono disegnati con poca cura.
Potato riporta l'accordo sulla geometria con una linea di base empirica del caso. Non abbiamo trovato altre piattaforme di annotazione che riportino un accordo corretto per il caso su etichette spaziali. Come misurare l'accordo tra annotatori sui bounding box spiega il metodo.
La pre-etichettatura aggiunge un secondo problema. Gli annotatori che accettano i suggerimenti del modello senza verificarli fanno salire ogni valore di accordo e scendere l'accuratezza. Potato registra i tempi di disegno, che distinguono un suggerimento rivisto da uno accettato a occhi chiusi. Vedi Riconoscere le pre-etichette accettate senza controllo.
Formati
Potato importa 15 formati di computer vision, 11 dei quali andata e ritorno. Esporta COCO, YOLO, Pascal VOC, CVAT, LabelMe, Cityscapes, KITTI, V7 Darwin, maschere PNG, MOT e DAVIS. Vedi Formati di computer vision.
Un compito di bounding box con due annotatori per immagine
agreement_metrics:
enabled: true
annotation_schemes:
- annotation_type: image_annotation
name: objects
description: "Draw a tight box around every vehicle."
source_field: image
tools: [bbox]
labels:
- {name: car, color: "#FF6B6B"}
- {name: truck, color: "#4ECDC4"}
num_annotators_per_item:
default: 2Ogni immagine va a due annotatori, e la dashboard di amministrazione riporta il loro accordo sui box.
Cosa non fa Potato con le immagini
- Nessun addestramento di modelli. Potato pre-etichetta con modelli esistenti ma non addestra rilevatori. Roboflow, V7, Supervisely e Labelbox sì.
- Ancora nessun attributo per oggetto.
- Nessuna sequenza di nuvole di punti. L'annotazione 3D è per fotogramma.
- Nessun DICOM, NIfTI o formato whole-slide.
- Nessuna forza lavoro gestita. Porta i tuoi annotatori, o reclutali su Prolific.
Verificato su documentazione e pagina dei prezzi di ciascun progetto ad agosto e settembre 2026.
Domande frequenti
Qual è il miglior strumento gratuito di annotazione delle immagini?
Per grandi volumi di lavoro solo di computer vision, CVAT è gratuito, maturo e ospitato in proprio. Per immagini in un progetto che etichetta anche testo o audio, la Community Edition di Label Studio e Potato coprono entrambi tutta la gamma. Per studi in cui più annotatori etichettano le stesse immagini e l'accordo va riportato, Potato lo include senza costi. Per una manciata di immagini senza installare nulla, VIA funziona da un singolo file HTML.
Esiste un'alternativa open source a Labelbox?
CVAT, la Community Edition di Label Studio e Potato sono open source e ospitati in proprio. Labelbox vende una piattaforma gestita e una forza lavoro di etichettatori. Gli strumenti open source forniscono il software, non gli annotatori: porti il tuo team o recluti tramite una piattaforma come Prolific.
Posso usare la segmentazione assistita da modelli senza un server GPU?
Sì. Potato esegue la segmentazione interattiva e da testo nel browser tramite ONNX Runtime Web, e funziona senza rete una volta che i pesi del modello sono sulla macchina. La propagazione delle maschere video con SAM 2 gira sul server. X-AnyLabeling esegue i modelli in locale sul desktop. CVAT e Label Studio chiamano un server di modelli.
Come misuro l'accordo tra annotatori sui bounding box?
Assegna ogni immagine ad almeno due annotatori, abbina i loro box e riporta un accordo che tenga conto del caso, perché la IoU grezza è alta sugli oggetti grandi qualunque cosa facciano gli annotatori. La guida sull'accordo per i bounding box tratta l'abbinamento, la linea di base del caso e cosa riportare.
Quale strumento di annotazione usare per le nuvole di punti 3D?
Per dati di guida in produzione con sequenze e propagazione delle tracce, usa uno specialista come Segments.ai, Kognic o Supervisely, oppure CVAT se deve essere open source. Per cuboidi per fotogramma in cui servono statistiche di accordo, o quando il 3D è una parte di uno studio multimodale, Potato è adatto.
Approfondimenti
- Strumenti di annotazione con IA a confronto, tutti i tipi di dati in una pagina
- Strumenti di annotazione del testo a confronto
- Strumenti di annotazione audio a confronto
- Strumenti di annotazione video a confronto
- Strumenti di valutazione degli agenti IA a confronto
- Strumenti di valutazione di world model ed episodi robotici a confronto
- Annotazione di immagini