Skip to content

Strumenti di annotazione del testo a confronto: NLP open source e a pagamento

Confronta Potato, INCEpTION, Prodigy, Label Studio, doccano, brat e Argilla per NER, relazioni, coreferenza e classificazione: licenze, prezzi e metriche di accordo.

Uno strumento di annotazione del testo mostra i documenti agli annotatori e registra ciò che segnano: un'etichetta per l'intero testo, span evidenziati come le entità nominate, e collegamenti tra span. Potato, INCEpTION, doccano e la Community Edition di Label Studio si possono ospitare gratis in proprio, e tutti gestiscono il riconoscimento di entità nominate e le relazioni. Si differenziano su coreferenza, collegamento a basi di conoscenza e sulla possibilità di misurare l'accordo tra annotatori senza un piano a pagamento. Prodigy è l'opzione a pagamento. brat e Argilla non aggiungono più funzionalità.

La maggior parte dei compiti sul testo ha una di tre forme. La classificazione dei testi dà un'etichetta all'intero documento. Il riconoscimento di entità nominate e gli altri compiti a span segnano porzioni di testo. L'estrazione di relazioni e la risoluzione della coreferenza collegano gli span tra loro. Tutti gli strumenti di questa pagina gestiscono gli span, ed è nei collegamenti che si differenziano di più.

Questa pagina tratta solo il testo. Strumenti di annotazione con IA a confronto copre tutti i tipi di dati in una sola pagina.

Quali strumenti di annotazione del testo conviene confrontare?

StrumentoLicenzaPrezzoAdatto a
PotatoGPL-3.0GratuitoStudi con più annotatori per elemento, in cui l'accordo va riportato
INCEpTIONApache-2.0GratuitoAnnotazione linguistica collegata a basi di conoscenza
ProdigyProprietaria390 $, oppure 490 $ a postazione con un minimo di cinque postazioniUtenti di spaCy che vogliono un'annotazione programmabile con un modello nel ciclo
Label StudioApache-2.0 (Community Edition)Gratuito; il piano Starter costa 99 $ al mese più 49 $ per ogni utente aggiuntivoTeam che annotano testo insieme a immagini, audio o video
doccanoMITGratuitoAvviare in fretta un progetto di NER o di classificazione
bratMITGratuitoLeggere o ampliare un corpus già annotato in brat
ArgillaApache-2.0GratuitoDati di feedback e di preferenza nell'ecosistema Hugging Face

Funzionalità a confronto

PotatoINCEpTIONProdigyLabel Studiodoccano
Classificazione di documenti
Span (NER)
Relazioni tra spanSì (span_link)Sì (tag Relations)Sì, come opzione di progetto
Metriche di accordoSì, gratisSì, gratisSì, nel prodotto a pagamentoSolo nei piani a pagamentoNo
Suggerimenti da modelli o LLM13 tipi di endpointRecommender, più supporto sperimentale agli LLMspacy-llmBackend MLAuto-etichettatura tramite un'API esterna
Ospitabile in proprio

Accordo sulle etichette di testo

Due annotatori che segnano la stessa entità concordano di rado sui suoi confini esatti, e una metrica che confronta le etichette token per token conta ogni differenza di confine come un disaccordo sull'etichetta. Il modo in cui uno strumento misura l'accordo sugli span conta quanto il fatto che lo riporti.

  • Potato riporta la κ a livello di token sui tag BIO, la F1 degli span con corrispondenza esatta e parziale, l'α di Krippendorff nella forma di unitizzazione, e la γ di Mathet et al. (2015). Le ultime due valutano dove uno span inizia e finisce, oltre a come è stato etichettato. Vedi misurare l'accordo sugli span.
  • INCEpTION calcola la κ di Cohen, la κ di Fleiss e l'α di Krippendorff, e ha un'interfaccia di curatela per risolvere i disaccordi.
  • Prodigy include l'α di Krippendorff e l'AC2 di Gwet, e una ricetta review per l'aggiudicazione.
  • Label Studio riserva l'accordo ai piani a pagamento. Le metriche elencate per la sua edizione Enterprise sono corrispondenza esatta, differenza numerica, IoU e sovrapposizione degli span.
  • doccano non ha metriche di accordo.

Per il caso generale, vedi L'accordo tra annotatori spiegato.

Gli strumenti nel dettaglio

INCEpTION

INCEpTION, della TU Darmstadt, è il successore di WebAnno ed è il confronto più vicino per il lavoro linguistico. Ha livelli di relazione, livelli a catena per la coreferenza, annotazione a livello di documento, e tratti di concetto che collegano un'annotazione a una voce di una base di conoscenza come Wikidata o DBpedia. Sul collegamento alle basi di conoscenza è più avanti di Potato. I suoi recommender suggeriscono annotazioni, con apprendimento attivo integrato. È un'applicazione Java e richiede più lavoro per il deploy rispetto agli altri strumenti di questa pagina. Il sistema è descritto in Eckart de Castilho et al. (EMNLP 2024).

Prodigy

Prodigy, di Explosion, è costruito intorno all'annotazione con un modello nel ciclo e si integra con spaCy più strettamente di qualsiasi altro strumento qui. Copre classificazione, span, relazioni con la ricetta rel.manual e coreferenza con coref.manual, e raggiunge gli LLM tramite spacy-llm. I compiti si definiscono in ricette Python. È l'unico strumento a pagamento di questa pagina.

Label Studio

Il supporto al testo di Label Studio è una parte di uno strumento che gestisce anche immagini, audio, video e serie temporali. Il suo tag Relations collega regioni etichettate. La Community Edition è gratuita e open source. Accordo, revisione rispetto ai dati di riferimento e dashboard di qualità sono nei piani a pagamento, a partire da Starter a 99 $ al mese.

doccano

doccano è il più rapido da configurare per il testo. I suoi tipi di progetto sono classificazione di documenti, etichettatura di sequenze, sequence-to-sequence, riconoscimento di intenti con riempimento di slot, e speech-to-text. I progetti di etichettatura di sequenze possono ammettere span sovrapposti e relazioni. Non ha annotazione di coreferenza o di eventi, né metriche di accordo.

brat

Molti corpora di NLP sono stati costruiti in brat, e il suo formato standoff copre entità, eventi n-ari, relazioni binarie, insiemi di equivalenza, attributi e normalizzazioni. L'ultima versione è la v1.3 di novembre 2012, e l'ultimo commit su master risale a ottobre 2021. Il suo server autonomo importa il modulo cgi di Python, rimosso in Python 3.13, quindi non si avvia su un Python recente senza un adattamento. Leggere un corpus brat vale ancora la pena. Avviare un nuovo progetto in brat è più difficile da giustificare.

Argilla

Argilla si concentra sui dati di feedback e di preferenza per i modelli linguistici e si integra con Hugging Face Datasets. Supporta la classificazione dei testi, la classificazione dei token e la valutazione del testo generato. Il suo repository ora dice che gli autori originali sono passati ad altri progetti e che il progetto riceverà correzioni di bug e patch, ma nessuna nuova funzionalità.

Sistemi di ricerca

Diversi sistemi di annotazione sono stati pubblicati come dimostrazioni di sistemi all'ACL. Thresh configura in YAML compiti di valutazione fine del testo, per riassunto, semplificazione e traduzione automatica. GATE Teamware 2 gestisce la classificazione di documenti con formazione degli annotatori e controllo di qualità.

Verificato su documentazione, pagina dei prezzi e repository di ciascun progetto ad agosto e settembre 2026.

Spostare un corpus da uno strumento all'altro

Dalla versione 2.9, Potato importa lo standoff di brat, il JSONL di doccano, i file db-out di Prodigy e il CoNLL, così un progetto iniziato in uno di questi può proseguire in Potato. Le etichette esistenti arrivano come pre-annotazioni. Le relazioni e gli eventi di brat compaiono negli avvisi dell'importazione e non vengono importati. Vedi Importare un progetto.

Nella direzione opposta, Potato esporta CoNLL-2003, CoNLL-U, dataset Hugging Face, JSONL, CSV e Parquet. Vedi Esportare le annotazioni per il ML.

Un compito di entità e relazioni in Potato

yaml
annotation_schemes:
  - annotation_type: span
    name: entities
    description: "Highlight each person, organization and location."
    labels: [PERSON, ORGANIZATION, LOCATION]
  - annotation_type: span_link
    name: relations
    description: "Link each person to the organization they work for."
    span_schema: entities
    link_types:
      - name: WORKS_FOR
        directed: true
        allowed_source_labels: [PERSON]
        allowed_target_labels: [ORGANIZATION]

span_link traccia collegamenti tipizzati tra gli span dello schema entities, e allowed_source_labels impedisce a un annotatore di collegare i tipi di entità sbagliati. Estrazione di relazioni ed eventi tratta eventi e relazioni n-arie, e Risoluzione della coreferenza tratta le catene.

Cosa non fa Potato con il testo

  • Il suo collegamento alle basi di conoscenza è più semplice di quello di INCEpTION.
  • Non aggiorna un modello spaCy mentre gli annotatori lavorano, come possono fare le ricette di Prodigy.
  • Non ha un esportatore spaCy. Converti da CoNLL o JSONL.
  • L'importazione da brat salta relazioni ed eventi.

Domande frequenti

Qual è il miglior strumento gratuito di annotazione del testo?

Per un singolo progetto di NER o di classificazione, doccano è quello che richiede meno lavoro. Per l'annotazione linguistica che collega le entità a una base di conoscenza, INCEpTION è il più completo. Per uno studio con più annotatori per elemento, crowdworker e un valore di accordo da riportare, Potato include tutto questo senza piano a pagamento.

Esiste un'alternativa open source a Prodigy?

Potato, INCEpTION e doccano sono gratuiti e open source. Potato si configura in YAML dove Prodigy usa ricette Python, e importa i file db-out di Prodigy, così le annotazioni già raccolte in Prodigy vengono mantenute.

Quali strumenti di annotazione del testo riportano l'accordo tra annotatori?

Potato e INCEpTION lo fanno nelle versioni gratuite, Prodigy nel suo prodotto a pagamento. Label Studio riserva l'accordo ai piani a pagamento, e doccano non ne ha. Per i compiti a span, verifica se la metrica tiene conto dei disaccordi sui confini, come fanno l'α di unitizzazione di Krippendorff e la γ.

brat è ancora mantenuto?

No. La sua ultima versione è stata la v1.3, a novembre 2012, e il suo server autonomo non si avvia su Python 3.13 senza un adattamento. Dalla versione 2.9, Potato importa i corpora brat e conserva le entità esistenti come pre-annotazioni.

Posso annotare la coreferenza con uno strumento gratuito?

Sì. INCEpTION ha livelli a catena per la coreferenza, e Potato ha uno schema coreference che raggruppa le menzioni in catene. doccano non supporta la coreferenza.

Approfondimenti