Strumenti di annotazione del testo a confronto: NLP open source e a pagamento
Confronta Potato, INCEpTION, Prodigy, Label Studio, doccano, brat e Argilla per NER, relazioni, coreferenza e classificazione: licenze, prezzi e metriche di accordo.
Uno strumento di annotazione del testo mostra i documenti agli annotatori e registra ciò che segnano: un'etichetta per l'intero testo, span evidenziati come le entità nominate, e collegamenti tra span. Potato, INCEpTION, doccano e la Community Edition di Label Studio si possono ospitare gratis in proprio, e tutti gestiscono il riconoscimento di entità nominate e le relazioni. Si differenziano su coreferenza, collegamento a basi di conoscenza e sulla possibilità di misurare l'accordo tra annotatori senza un piano a pagamento. Prodigy è l'opzione a pagamento. brat e Argilla non aggiungono più funzionalità.
La maggior parte dei compiti sul testo ha una di tre forme. La classificazione dei testi dà un'etichetta all'intero documento. Il riconoscimento di entità nominate e gli altri compiti a span segnano porzioni di testo. L'estrazione di relazioni e la risoluzione della coreferenza collegano gli span tra loro. Tutti gli strumenti di questa pagina gestiscono gli span, ed è nei collegamenti che si differenziano di più.
Questa pagina tratta solo il testo. Strumenti di annotazione con IA a confronto copre tutti i tipi di dati in una sola pagina.
Quali strumenti di annotazione del testo conviene confrontare?
| Strumento | Licenza | Prezzo | Adatto a |
|---|---|---|---|
| Potato | GPL-3.0 | Gratuito | Studi con più annotatori per elemento, in cui l'accordo va riportato |
| INCEpTION | Apache-2.0 | Gratuito | Annotazione linguistica collegata a basi di conoscenza |
| Prodigy | Proprietaria | 390 $, oppure 490 $ a postazione con un minimo di cinque postazioni | Utenti di spaCy che vogliono un'annotazione programmabile con un modello nel ciclo |
| Label Studio | Apache-2.0 (Community Edition) | Gratuito; il piano Starter costa 99 $ al mese più 49 $ per ogni utente aggiuntivo | Team che annotano testo insieme a immagini, audio o video |
| doccano | MIT | Gratuito | Avviare in fretta un progetto di NER o di classificazione |
| brat | MIT | Gratuito | Leggere o ampliare un corpus già annotato in brat |
| Argilla | Apache-2.0 | Gratuito | Dati di feedback e di preferenza nell'ecosistema Hugging Face |
Funzionalità a confronto
| Potato | INCEpTION | Prodigy | Label Studio | doccano | |
|---|---|---|---|---|---|
| Classificazione di documenti | Sì | Sì | Sì | Sì | Sì |
| Span (NER) | Sì | Sì | Sì | Sì | Sì |
| Relazioni tra span | Sì (span_link) | Sì | Sì | Sì (tag Relations) | Sì, come opzione di progetto |
| Metriche di accordo | Sì, gratis | Sì, gratis | Sì, nel prodotto a pagamento | Solo nei piani a pagamento | No |
| Suggerimenti da modelli o LLM | 13 tipi di endpoint | Recommender, più supporto sperimentale agli LLM | spacy-llm | Backend ML | Auto-etichettatura tramite un'API esterna |
| Ospitabile in proprio | Sì | Sì | Sì | Sì | Sì |
Accordo sulle etichette di testo
Due annotatori che segnano la stessa entità concordano di rado sui suoi confini esatti, e una metrica che confronta le etichette token per token conta ogni differenza di confine come un disaccordo sull'etichetta. Il modo in cui uno strumento misura l'accordo sugli span conta quanto il fatto che lo riporti.
- Potato riporta la κ a livello di token sui tag BIO, la F1 degli span con corrispondenza esatta e parziale, l'α di Krippendorff nella forma di unitizzazione, e la γ di Mathet et al. (2015). Le ultime due valutano dove uno span inizia e finisce, oltre a come è stato etichettato. Vedi misurare l'accordo sugli span.
- INCEpTION calcola la κ di Cohen, la κ di Fleiss e l'α di Krippendorff, e ha un'interfaccia di curatela per risolvere i disaccordi.
- Prodigy include l'α di Krippendorff e l'AC2 di Gwet, e una ricetta
reviewper l'aggiudicazione. - Label Studio riserva l'accordo ai piani a pagamento. Le metriche elencate per la sua edizione Enterprise sono corrispondenza esatta, differenza numerica, IoU e sovrapposizione degli span.
- doccano non ha metriche di accordo.
Per il caso generale, vedi L'accordo tra annotatori spiegato.
Gli strumenti nel dettaglio
INCEpTION
INCEpTION, della TU Darmstadt, è il successore di WebAnno ed è il confronto più vicino per il lavoro linguistico. Ha livelli di relazione, livelli a catena per la coreferenza, annotazione a livello di documento, e tratti di concetto che collegano un'annotazione a una voce di una base di conoscenza come Wikidata o DBpedia. Sul collegamento alle basi di conoscenza è più avanti di Potato. I suoi recommender suggeriscono annotazioni, con apprendimento attivo integrato. È un'applicazione Java e richiede più lavoro per il deploy rispetto agli altri strumenti di questa pagina. Il sistema è descritto in Eckart de Castilho et al. (EMNLP 2024).
Prodigy
Prodigy, di Explosion, è costruito intorno all'annotazione con un modello nel ciclo e si integra con spaCy più strettamente di qualsiasi altro strumento qui. Copre classificazione, span, relazioni con la ricetta rel.manual e coreferenza con coref.manual, e raggiunge gli LLM tramite spacy-llm. I compiti si definiscono in ricette Python. È l'unico strumento a pagamento di questa pagina.
Label Studio
Il supporto al testo di Label Studio è una parte di uno strumento che gestisce anche immagini, audio, video e serie temporali. Il suo tag Relations collega regioni etichettate. La Community Edition è gratuita e open source. Accordo, revisione rispetto ai dati di riferimento e dashboard di qualità sono nei piani a pagamento, a partire da Starter a 99 $ al mese.
doccano
doccano è il più rapido da configurare per il testo. I suoi tipi di progetto sono classificazione di documenti, etichettatura di sequenze, sequence-to-sequence, riconoscimento di intenti con riempimento di slot, e speech-to-text. I progetti di etichettatura di sequenze possono ammettere span sovrapposti e relazioni. Non ha annotazione di coreferenza o di eventi, né metriche di accordo.
brat
Molti corpora di NLP sono stati costruiti in brat, e il suo formato standoff copre entità, eventi n-ari, relazioni binarie, insiemi di equivalenza, attributi e normalizzazioni. L'ultima versione è la v1.3 di novembre 2012, e l'ultimo commit su master risale a ottobre 2021. Il suo server autonomo importa il modulo cgi di Python, rimosso in Python 3.13, quindi non si avvia su un Python recente senza un adattamento. Leggere un corpus brat vale ancora la pena. Avviare un nuovo progetto in brat è più difficile da giustificare.
Argilla
Argilla si concentra sui dati di feedback e di preferenza per i modelli linguistici e si integra con Hugging Face Datasets. Supporta la classificazione dei testi, la classificazione dei token e la valutazione del testo generato. Il suo repository ora dice che gli autori originali sono passati ad altri progetti e che il progetto riceverà correzioni di bug e patch, ma nessuna nuova funzionalità.
Sistemi di ricerca
Diversi sistemi di annotazione sono stati pubblicati come dimostrazioni di sistemi all'ACL. Thresh configura in YAML compiti di valutazione fine del testo, per riassunto, semplificazione e traduzione automatica. GATE Teamware 2 gestisce la classificazione di documenti con formazione degli annotatori e controllo di qualità.
Verificato su documentazione, pagina dei prezzi e repository di ciascun progetto ad agosto e settembre 2026.
Spostare un corpus da uno strumento all'altro
Dalla versione 2.9, Potato importa lo standoff di brat, il JSONL di doccano, i file db-out di Prodigy e il CoNLL, così un progetto iniziato in uno di questi può proseguire in Potato. Le etichette esistenti arrivano come pre-annotazioni. Le relazioni e gli eventi di brat compaiono negli avvisi dell'importazione e non vengono importati. Vedi Importare un progetto.
Nella direzione opposta, Potato esporta CoNLL-2003, CoNLL-U, dataset Hugging Face, JSONL, CSV e Parquet. Vedi Esportare le annotazioni per il ML.
Un compito di entità e relazioni in Potato
annotation_schemes:
- annotation_type: span
name: entities
description: "Highlight each person, organization and location."
labels: [PERSON, ORGANIZATION, LOCATION]
- annotation_type: span_link
name: relations
description: "Link each person to the organization they work for."
span_schema: entities
link_types:
- name: WORKS_FOR
directed: true
allowed_source_labels: [PERSON]
allowed_target_labels: [ORGANIZATION]span_link traccia collegamenti tipizzati tra gli span dello schema entities, e allowed_source_labels impedisce a un annotatore di collegare i tipi di entità sbagliati. Estrazione di relazioni ed eventi tratta eventi e relazioni n-arie, e Risoluzione della coreferenza tratta le catene.
Cosa non fa Potato con il testo
- Il suo collegamento alle basi di conoscenza è più semplice di quello di INCEpTION.
- Non aggiorna un modello spaCy mentre gli annotatori lavorano, come possono fare le ricette di Prodigy.
- Non ha un esportatore spaCy. Converti da CoNLL o JSONL.
- L'importazione da brat salta relazioni ed eventi.
Domande frequenti
Qual è il miglior strumento gratuito di annotazione del testo?
Per un singolo progetto di NER o di classificazione, doccano è quello che richiede meno lavoro. Per l'annotazione linguistica che collega le entità a una base di conoscenza, INCEpTION è il più completo. Per uno studio con più annotatori per elemento, crowdworker e un valore di accordo da riportare, Potato include tutto questo senza piano a pagamento.
Esiste un'alternativa open source a Prodigy?
Potato, INCEpTION e doccano sono gratuiti e open source. Potato si configura in YAML dove Prodigy usa ricette Python, e importa i file db-out di Prodigy, così le annotazioni già raccolte in Prodigy vengono mantenute.
Quali strumenti di annotazione del testo riportano l'accordo tra annotatori?
Potato e INCEpTION lo fanno nelle versioni gratuite, Prodigy nel suo prodotto a pagamento. Label Studio riserva l'accordo ai piani a pagamento, e doccano non ne ha. Per i compiti a span, verifica se la metrica tiene conto dei disaccordi sui confini, come fanno l'α di unitizzazione di Krippendorff e la γ.
brat è ancora mantenuto?
No. La sua ultima versione è stata la v1.3, a novembre 2012, e il suo server autonomo non si avvia su Python 3.13 senza un adattamento. Dalla versione 2.9, Potato importa i corpora brat e conserva le entità esistenti come pre-annotazioni.
Posso annotare la coreferenza con uno strumento gratuito?
Sì. INCEpTION ha livelli a catena per la coreferenza, e Potato ha uno schema coreference che raggruppa le menzioni in catene. doccano non supporta la coreferenza.
Approfondimenti
- Strumenti di annotazione con IA a confronto, tutti i tipi di dati in una pagina
- Strumenti di annotazione audio a confronto
- Strumenti di annotazione delle immagini a confronto
- Strumenti di annotazione video a confronto
- Strumenti di valutazione degli agenti IA a confronto
- Strumenti di valutazione di world model ed episodi robotici a confronto
- Annotazione a span
- Riconoscimento di entità nominate