Skip to content

Strumenti di annotazione con IA a confronto: open source e a pagamento

Confronto tra 14 strumenti e piattaforme di annotazione per testo, visione, 3D e valutazione di agenti: quali pre-etichettano con l'IA e cosa include davvero ciascuna versione gratuita.

Uno strumento di annotazione è un software che applica etichette a testo, immagini, audio, video o output di un modello, in modo che il risultato serva ad addestrare o valutare un sistema. Questa guida confronta 14 strumenti open source e commerciali su copertura delle modalità, annotazione assistita da IA, metriche di accordo e ciò che ciascuna versione gratuita include davvero.

Non esiste uno strumento migliore in assoluto. La scelta giusta dipende da cosa annoti, dal budget, dal fatto che tu debba valutare agenti o LLM e da quanta configurazione sei disposto a sopportare.

Quali strumenti di annotazione conviene confrontare?

StrumentoLicenzaPunti di forzaQuando conviene
PotatoGratuito, open source (ricerca)61 tipi di task su testo, immagini, audio, video, 3D e robotica, valutazione di agenti e LLM, YAML senza codice, metriche di accordo integrateRicerca, valutazione di agenti e LLM, configurazione rapida senza scrivere codice
Label StudioOpen source + piani a pagamentoAmpia copertura di modalità, interfaccia curata, ecosistema estesoTeam che vogliono una piattaforma sostenuta da un'azienda
ProdigyA pagamento (commerciale)Programmabile, pensato attorno all'active learning, integrazione stretta con spaCyChi usa spaCy e non ha problemi con uno strumento a pagamento guidato dal codice
DoccanoOpen sourceSemplice, pulito, facile da ospitare in proprioClassificazione di testo e NER senza complicazioni
bratOpen sourceAnnotazione matura di testo e relazioniAnnotazione linguistica di entità e relazioni
INCEpTIONOpen sourceAnnotazione linguistica ricca, collegamento a knowledge baseProgetti linguistici approfonditi che possono investire nella configurazione
ArgillaOpen sourceFocus sui dati per LLM, integrazione con Hugging FaceRaccolta di dati di feedback/RLHF nello stack HF
CVATOpen sourceAnnotazione di immagini e video per la computer visionBounding box, maschere ed etichettatura video per la CV
Labelbox / ScaleCommerciale (a pagamento)Piattaforma gestita, servizi di manodopera su larga scalaAziende che comprano insieme gli strumenti e la forza lavoro di etichettatura

(I dettagli cambiano nel tempo, controlla su ciascun progetto le licenze e le funzionalità attuali.)

C'è una cosa che la colonna delle licenze nasconde: cosa comprende davvero un piano gratuito. L'edizione community di Label Studio non include alcuna metrica di accordo tra annotatori, e la marcatura della ground truth e le dashboard di qualità partono da 99 $ per utente al mese. Prodigy non ha un piano gratuito. CVAT indica come a pagamento la sua interfaccia di controllo qualità. Se stai scegliendo in base al controllo qualità e non alla copertura delle modalità, confronta le edizioni gratuite, non le pagine di marketing. Manteniamo una matrice delle funzionalità per undici strumenti, verificata sulla documentazione di ciascuno.

Quali strumenti di annotazione usano l'IA per pre-etichettare?

"Strumento di annotazione con IA" copre tre capacità che di solito vengono vendute come una sola, e uno strumento che ne ha una spesso non ha le altre.

  • Geometria assistita dal modello. Clicca o disegna in modo approssimativo e un modello di segmentazione stringe il contorno. Potato lo esegue nel browser senza GPU; CVAT ci arriva tramite Nuclio o il suo percorso ad agenti IA; Label Studio tramite un backend ML; Roboflow, V7, Supervisely e Segments.ai lo includono nel prodotto.
  • Etichettatura guidata da prompt. Digita il nome di un oggetto e ricevi una maschera o un riquadro, invece di scegliere da un elenco fisso. Potato, Roboflow e V7 lo supportano. Vedi etichettare oggetti digitandone il nome.
  • Pre-annotazione con LLM e VLM. Un modello propone etichette per un intero lotto e gli annotatori le rivedono. Potato raggiunge 13 tipi di endpoint per questo scopo e può anche far criticare a un modello visione-linguaggio le annotazioni già completate.

La pre-etichettatura cambia ciò che il controllo qualità deve intercettare. Gli annotatori che accettano i suggerimenti senza leggerli alzano ogni cifra di accordo abbassando l'accuratezza, e il tempo impiegato è l'unico segnale che separa la revisione dal timbro automatico. Vedi riconoscere le pre-etichette accettate senza revisione.

Potato non addestra né serve modelli. Ordina gli item, chiama i modelli che gli indichi e registra cosa ha fatto l'annotatore con il risultato.

Visione, 3D e valutazione dei modelli

Le parti di Potato dedicate alla computer vision, allo spazio e alla valutazione sono più recenti di quelle dedicate al testo. Questa tabella registra dove ciascuno strumento è forte, invece di stilare una classifica.

FunzionalitàPotatoCVATLabel StudioRoboflowV7SuperviselySegments.ai
Self-hosting gratuitoSì (MIT)Ed. community--Ed. community-
Box, poligoni, maschere
Segmentazione interattivaNel browser, senza GPUTramite NuclioTramite backend ML
Segmentazione da prompt testualeSì (nel browser)-Tramite backend MLSì (SAM 3)Sì (SAM 3)Tramite app-
Keypoint / scheletri
Polilinee, ellissi, cuboidi 2DParzialeParziale
Attributi per oggetto-
Tracciamento video con interpolazioneParzialeParziale
Propagazione delle maschere tramite modelloSì (SAM 2, lato server)Tramite agenti AITramite backend ML
Deep zoom / gigapixelSì (DZI + IIIF)Parziale---
Nuvole di punti 3D e cuboidi---
Sequenze di nuvole di punti----
Fusione di sensori (2D↔3D)Parziale---
Mappe di profondità con finestratura---Parziale--
DICOM / NIfTI / WSI-----
Addestramento dei modelli nello stesso prodotto-Parziale--
Importazione di formati CV15 formatiEstesaParzialeEstesaParzialeEstesaParziale
Accordo corretto per il caso sulla geometria------
Episodi robotici (LeRobot, RLDS, HDF5)------
Valutazione di video generativi e world model------
Valutazione di grounding e pointing dei VLM------

Sulla maggior parte delle righe le piattaforme CV mature eguagliano o superano Potato. Due meritano una lettura attenta invece di una semplice spunta: la segmentazione da prompt testuale di Potato gira nel browser con un modello Apache-2.0, mentre gli equivalenti commerciali girano lato server sotto i termini non commerciali di SAM 3, e la sua propagazione delle maschere gira sul server, quindi la versione gratuita ottiene la funzionalità ma non dentro al browser. Nelle ultime quattro righe Potato fa qualcosa che gli altri strumenti non offrono.

Computer vision su grandi volumi

CVAT è il riferimento tra gli strumenti CV open source e resta la scelta migliore per pipeline a grande volume dedicate solo alla CV: gestione più fine di task e job, attributi per oggetto, un ecosistema di formati più ampio grazie a Datumaro e una comunità molto vasta. Scegli Potato quando il lavoro di CV convive con task di testo, audio o valutazione, o quando ti serve l'accordo tra annotatori invece dell'accuratezza rispetto a un job di riferimento.

Roboflow è ottimo se il tuo obiettivo è un modello addestrato: Smart Polygon, etichettatura automatica in blocco, Label Assist a partire dal tuo modello, e addestramento e deploy ospitati in un unico ciclo. Potato non addestra rilevatori. Scegli Potato quando le etichette stesse sono il risultato della ricerca e la loro affidabilità deve poter essere difesa.

Labelbox, SuperAnnotate, Encord, Kili e V7 sono piattaforme commerciali mature con gestione della forza lavoro, governance aziendale e una solida etichettatura assistita dai modelli. Se ti serve una forza lavoro gestita, certificazioni di conformità o curation su scala di petabyte, sono loro la risposta giusta.

X-AnyLabeling riunisce Grounding DINO, Grounded-SAM 2, SAM 2.1 e YOLO in un'applicazione desktop e, per una singola persona che etichetta in locale con una gamma ampia di modelli, è difficile da battere. Potato porta con sé un insieme di modelli più ristretto e gira nel browser, quindi sulla macchina dell'annotatore non si installa nulla; il suo vantaggio comincia quando gli annotatori sono più di uno.

Gigapixel e patologia digitale

Potato costruisce una piramide di tile servita sia come DZI sia tramite IIIF Image API 3.0, e le maschere a pennello funzionano alla piena risoluzione dell'originale perché il buffer della maschera indicizza i pixel dell'immagine e non una texture della GPU.

Per la patologia digitale in particolare, QuPath (desktop, open source, lo standard del settore) e Cytomine (web, open source, multiutente con annotazione cieca) sono costruiti apposta, e Potato non legge SVS, DICOM né NIfTI. Usa Potato qui quando le tue immagini sono grandi ma non in formato clinico, o quando ti servono sopra i suoi livelli di accordo e di workflow.

3D e fusione di sensori

Segments.ai, Kognic, Deepen AI, Supervisely e Xtreme1/BasicAI sono specialisti e, per le pipeline di guida autonoma in produzione, sono avanti: flussi a sequenze ed episodi con propagazione delle tracce, supporto per radar e più LiDAR, modelli di fit automatico dei cuboidi, ontologie di attributi per oggetto e, nel caso di Deepen, un prodotto completo di calibrazione senza target. Supervisely e Xtreme1 si possono entrambi ospitare in proprio, e Supervisely gestisce nuvole molto più grandi.

Scegli Potato per il 3D quando vuoi statistiche di affidabilità sulle etichette spaziali, o quando il 3D è una parte di uno studio multimodale.

Robotica, world model e grounding

Per gli episodi robotici, ATLAS (TU Wien) è uno strumento desktop mirato alla segmentazione di azioni a lungo orizzonte, con supporto nativo per ROS bag e RLDS, ed è pensato per la precisione dei confini con un solo annotatore. ELAN e BORIS restano gli standard per la codifica comportamentale, e Rerun e Foxglove sono i migliori strumenti di visualizzazione per la robotica.

Per il video generativo, l'ecosistema è fatto soprattutto di benchmark (VBench, WorldModelBench, Physics-IQ) più panel di crowd per la raccolta di preferenze su larga scala. Quelli forniscono le metriche e i protocolli di riferimento; Potato fornisce uno strumento per condurre ripetutamente la parte umana con l'affidabilità misurata, il che è complementare invece che concorrente.

Per il grounding dei VLM, l'area è definita da dataset e harness di valutazione (RefCOCO, PixMo-Points, PointBench, lmms-eval, VLMEvalKit) più che da prodotti di annotazione. Il ruolo di Potato è raccogliere e misurare la ground truth umana su cui quei benchmark sono costruiti.

Cosa non fa Potato

Perché una valutazione non se ne accorga troppo tardi:

  • Non addestra modelli. Potato ordina gli item, pre-etichetta con modelli esistenti e critica le annotazioni con un VLM. Non addestra né serve rilevatori. Roboflow, V7, Supervisely e Labelbox lo fanno.
  • Non ha ancora attributi per oggetto. La geometria porta un'etichetta; livelli di occlusione, flag di troncamento e attributi di sottotipo richiedono uno schema a parte.
  • Non ha una modalità a sequenze per le nuvole di punti. L'annotazione 3D è per fotogramma; la propagazione delle tracce lungo una scansione non è implementata.
  • Non supporta DICOM, NIfTI o WSI. Il deep zoom e la finestratura a 16 bit coprono immagini scientifiche di grandi dimensioni, non quelle cliniche.
  • Niente forza lavoro gestita, SAML/SCIM o certificazioni di conformità. Potato è software che esegui tu. RBAC e OAuth sono supportati; la governance aziendale no.

Numero di funzionalità

CategoriaPotato
Schemi di annotazione61
Tipi di visualizzazione24
Formati di esportazione29
Formati di importazione15
Tipi di endpoint AI/LLM13
Tipi di sorgente dati8
Strategie di assegnazione11
Strumenti di sondaggio55
Integrazioni per il crowdsourcing9
Fasi del workflow8

I conteggi sono generati dai registri interni di Potato. Non c'è una colonna «migliore alternativa», perché gli strumenti qui sopra organizzano le proprie funzionalità in modi abbastanza diversi da rendere ingannevole un confronto ridotto a un solo numero.

Come scelgo uno strumento di annotazione?

  • Cosa stai annotando? Per il NER su solo testo, Doccano o brat sono semplici. Per un misto di testo/immagini/audio/video, Potato e Label Studio coprono tutto l'arco.
  • Ti serve valutare agenti o LLM? È qui che Potato è insolito: legge le tracce degli agenti in molti formati e ha strumenti dedicati per la valutazione di traiettoria, process reward, agenti web, agenti di programmazione, team multi-agente e computer use e multimodalità. Gli strumenti generalisti in genere non lo fanno.
  • Budget. Potato, Label Studio (nucleo), Doccano, brat e Argilla sono gratuiti e open source; Prodigy e alcuni piani di Label Studio sono a pagamento.
  • Sforzo di configurazione. Potato si configura con un file YAML e non richiede codice; Prodigy parte dal codice; gli altri stanno nel mezzo.
  • Ecosistema. Prodigy si sposa con spaCy; Argilla con Hugging Face; Potato esporta in molti formati per il machine learning, tra cui CoNLL, spaCy, Hugging Face e COCO/YOLO.

Quando Potato è lo strumento giusto?

Potato nasce dall'NLP accademico. Il sistema originale è stato presentato a EMNLP 2022 e Potato 2.0 a ACL 2026, ed è costruito per l'intero flusso di lavoro della ricerca: molti tipi di task, controllo qualità e metriche di accordo già inclusi, integrazioni per il crowdsourcing e un ampio insieme di strumenti per la valutazione di agenti AI. Se il tuo lavoro attraversa più modalità o comprende la valutazione di LLM e agenti, vale la pena dargli un'occhiata.

Se invece ti serve soprattutto un singolo task testuale con un prodotto commerciale ospitato, o vivi interamente dentro spaCy o Hugging Face, uno degli altri potrebbe starti meglio.

Domande frequenti

Qual è il miglior strumento di annotazione gratuito?

Dipende dalla modalità. Per classificazione e NER solo testuali, Doccano e brat sono i più rapidi da mettere in piedi. Per testo, immagini, audio e video in un unico progetto, sia Potato sia l'edizione community di Label Studio coprono la gamma, e la differenza emerge nel controllo qualità: Potato include metriche di accordo e dashboard di qualità senza costi, mentre Label Studio le colloca in un piano a pagamento. Per la computer vision su grandi volumi, CVAT è gratuito e maturo.

Potato è un'alternativa gratuita a Label Studio?

Sì. Potato è gratuito e open source, e copre testo, immagini, audio, video e valutazione di agenti e LLM da un unico file YAML, senza codice. Label Studio è più ampio su alcune integrazioni ma spinge i team verso i piani a pagamento; Potato resta gratuito e self-hosted, il che si adatta al lavoro accademico e alla ricerca riproducibile.

Potato è un'alternativa gratuita e open source a Prodigy?

Sì. Prodigy è un ottimo strumento a pagamento, orientato al codice e legato strettamente a spaCy; Potato è gratuito, si configura in YAML senza codice ed esporta nei formati spaCy, CoNLL e Hugging Face. Se vuoi l'active learning senza una licenza commerciale, Potato è l'opzione open source.

Come si confronta Potato con INCEpTION per l'annotazione linguistica?

INCEpTION è potente per l'annotazione linguistica approfondita e per il collegamento a knowledge base, ma è più pesante da mettere in produzione. Potato si avvia più facilmente, un file YAML e un comando, ed è di solito più rapido per i task di span, relazione e classificazione che non hanno bisogno di tutto l'apparato linguistico di INCEpTION.

Perché usare Potato invece di una piattaforma commerciale come Labelbox o Scale AI?

Labelbox e Scale vendono una piattaforma gestita e una forza lavoro di etichettatura, cosa che si adatta alle aziende che comprano entrambe. Per i gruppi di ricerca che portano i propri annotatori e hanno bisogno che i dati restino sui propri server, Potato è l'alternativa gratuita e self-hosted, con le metriche di accordo tra annotatori già incluse.

Qual è il miglior strumento open source per annotare le traiettorie degli agenti AI?

È qui che Potato è insolito tra gli strumenti di annotazione generalisti: legge le tracce degli agenti in 15 formati e ha visualizzazioni dedicate per la valutazione di traiettoria, singoli passi, agenti web e agenti di programmazione. Annota anche i team multi-agente su un grafo di interazione cliccabile e gli agenti multimodali, come quelli di computer use e quelli vocali. La maggior parte degli strumenti, open source o commerciali, non annota affatto i run degli agenti.

Cosa può valutare Potato che gli strumenti di observability e le piattaforme di etichettatura non valutano?

Due categorie di superficie di annotazione per agenti, nessuna delle quali compare come funzionalità configurabile e self-hosted negli strumenti con cui Potato viene di solito confrontato (LangSmith, Langfuse, Labelbox, Scale AI, Label Studio, Argilla, Braintrust), verificato sulla loro documentazione a giugno 2026:

  • Struttura dei team multi-agente. Un grafo di interazione modificabile dall'annotatore (marca il percorso critico, segnala un passaggio di consegne sbagliato), l'attribuzione dei fallimenti tra agenti come tripla agente responsabile / passo decisivo / motivo, la revisione dei passaggi di consegne come oggetto di prima classe, scorecard per agente e per team, una timeline della contesa sugli strumenti e la marcatura dei comportamenti emergenti. La cosa più vicina altrove sono gli «Agent Graphs» di Langfuse, che però è una vista di debug in sola lettura e non una superficie di annotazione.
  • Agenti multimodali. Traiettorie di computer use con un marcatore per il grounding dei clic, timeline vocali full-duplex con punteggio delle interruzioni, e grounding temporale su video con un IoU calcolato dal vivo rispetto all'intervallo previsto dal modello. Scale AI fa grounding su GUI e valutazione vocale, ma sotto forma di incarichi gestiti su dataset, e la sua arena vocale procede per turni invece che in full-duplex.

Gli strumenti di observability (LangSmith, Langfuse, Braintrust) attaccano punteggi e commenti a livello di span, che è annotazione per passo a tutti gli effetti ma non copre queste superfici legate alla struttura degli agenti. Le piattaforme di etichettatura (Labelbox, Scale) offrono prodotti di dati per la valutazione degli agenti, ma come servizi cloud o gestiti a pagamento, non come uno strumento da ospitare in proprio e configurare in YAML. Le funzionalità si muovono in fretta, quindi questa è una fotografia di giugno 2026; il post di confronto completo elenca le versioni verificate.

Approfondimenti