Comparatif des outils d'annotation de texte : outils de TAL open source et payants
Compare Potato, INCEpTION, Prodigy, Label Studio, doccano, brat et Argilla pour la NER, les relations, la coréférence et la classification : licences, prix et mesures d'accord.
Un outil d'annotation de texte présente des documents aux annotateurs et enregistre ce qu'ils marquent : une étiquette pour tout le texte, des segments surlignés comme les entités nommées, et des liens entre segments. Potato, INCEpTION, doccano et la Community Edition de Label Studio s'hébergent gratuitement, et tous gèrent la reconnaissance d'entités nommées et les relations. Ils diffèrent sur la coréférence, le lien avec des bases de connaissances, et la possibilité de mesurer l'accord entre annotateurs sans offre payante. Prodigy est l'option payante. brat et Argilla n'ajoutent plus de fonctionnalités.
La plupart des tâches sur le texte prennent l'une de trois formes. La classification de textes donne une étiquette au document entier. La reconnaissance d'entités nommées et les autres tâches de segments marquent des portions de texte. L'extraction de relations et la résolution de la coréférence relient les segments entre eux. Tous les outils de cette page gèrent les segments, et c'est sur les liens qu'ils diffèrent le plus.
Cette page ne traite que du texte. Le comparatif des outils d'annotation par IA couvre tous les types de données sur une seule page.
Quels outils d'annotation de texte faut-il comparer ?
| Outil | Licence | Prix | Adapté à |
|---|---|---|---|
| Potato | GPL-3.0 | Gratuit | Les études avec plusieurs annotateurs par élément, où l'accord doit être rapporté |
| INCEpTION | Apache-2.0 | Gratuit | L'annotation linguistique liée à des bases de connaissances |
| Prodigy | Propriétaire | 390 $, ou 490 $ par poste avec un minimum de cinq postes | Les utilisateurs de spaCy qui veulent une annotation scriptable avec un modèle dans la boucle |
| Label Studio | Apache-2.0 (Community Edition) | Gratuit ; l'offre Starter coûte 99 $ par mois plus 49 $ par utilisateur supplémentaire | Les équipes qui annotent du texte à côté d'images, d'audio ou de vidéo |
| doccano | MIT | Gratuit | Lancer rapidement un projet de NER ou de classification |
| brat | MIT | Gratuit | Lire ou compléter un corpus déjà annoté dans brat |
| Argilla | Apache-2.0 | Gratuit | Les données de retour et de préférence dans l'écosystème Hugging Face |
Les fonctionnalités côte à côte
| Potato | INCEpTION | Prodigy | Label Studio | doccano | |
|---|---|---|---|---|---|
| Classification de documents | Oui | Oui | Oui | Oui | Oui |
| Segments (NER) | Oui | Oui | Oui | Oui | Oui |
| Relations entre segments | Oui (span_link) | Oui | Oui | Oui (balise Relations) | Oui, en option de projet |
| Mesures d'accord | Oui, gratuit | Oui, gratuit | Oui, dans le produit payant | Offres payantes uniquement | Non |
| Suggestions de modèles ou de LLM | 13 types de points d'accès | Recommandeurs, plus un support expérimental des LLM | spacy-llm | Backend ML | Pré-étiquetage via une API externe |
| Auto-hébergeable | Oui | Oui | Oui | Oui | Oui |
L'accord sur les étiquettes de texte
Deux annotateurs qui marquent la même entité s'accordent rarement sur ses limites exactes, et une mesure qui compare les étiquettes jeton par jeton compte chaque écart de limite comme un désaccord sur l'étiquette. La façon dont un outil évalue l'accord sur les segments compte autant que le fait qu'il le rapporte.
- Potato rapporte le κ au niveau des jetons sur les étiquettes BIO, le F1 des segments en correspondance exacte et partielle, l'α de Krippendorff dans sa forme d'unitisation, et le γ de Mathet et al. (2015). Les deux derniers évaluent où un segment commence et finit, en plus de son étiquette. Voir mesurer l'accord sur les segments.
- INCEpTION calcule le κ de Cohen, le κ de Fleiss et l'α de Krippendorff, et dispose d'une interface de curation pour trancher les désaccords.
- Prodigy fournit l'α de Krippendorff et l'AC2 de Gwet, ainsi qu'une recette
reviewpour l'adjudication. - Label Studio réserve l'accord à ses offres payantes. Les mesures indiquées pour son édition Enterprise sont la correspondance exacte, l'écart numérique, l'IoU et le chevauchement de segments.
- doccano n'a aucune mesure d'accord.
Pour le cas général, voir L'accord inter-annotateurs expliqué.
Les outils en détail
INCEpTION
INCEpTION, de la TU Darmstadt, a succédé à WebAnno et c'est la comparaison la plus proche pour le travail linguistique. Il propose des couches de relations, des couches de chaînes pour la coréférence, l'annotation au niveau du document, et des traits de concept qui relient une annotation à une entrée d'une base de connaissances comme Wikidata ou DBpedia. Sur le lien avec les bases de connaissances, il devance Potato. Ses recommandeurs suggèrent des annotations, avec apprentissage actif intégré. C'est une application Java, plus lourde à déployer que les autres outils de cette page. Le système est décrit dans Eckart de Castilho et al. (EMNLP 2024).
Prodigy
Prodigy, d'Explosion, est construit autour de l'annotation avec un modèle dans la boucle et s'intègre à spaCy plus étroitement que tout autre outil ici. Il couvre la classification, les segments, les relations avec sa recette rel.manual et la coréférence avec coref.manual, et accède aux LLM via spacy-llm. Les tâches se définissent dans des recettes Python. C'est le seul outil payant de cette page.
Label Studio
La prise en charge du texte dans Label Studio n'est qu'une partie d'un outil qui gère aussi les images, l'audio, la vidéo et les séries temporelles. Sa balise Relations relie des régions étiquetées. La Community Edition est gratuite et open source. L'accord, la revue par rapport à une vérité terrain et les tableaux de bord qualité relèvent des offres payantes, à partir de Starter à 99 $ par mois.
doccano
doccano est le plus rapide à mettre en place pour du texte. Ses types de projet sont la classification de documents, l'étiquetage de séquences, le séquence-à-séquence, la détection d'intention avec remplissage de slots, et la transcription de la parole. Les projets d'étiquetage de séquences peuvent autoriser les segments qui se chevauchent et les relations. Il n'a ni annotation de coréférence ou d'événements, ni mesure d'accord.
brat
Beaucoup de corpus de TAL ont été construits dans brat, et son format standoff couvre les entités, les événements n-aires, les relations binaires, les ensembles d'équivalence, les attributs et les normalisations. La dernière version est la v1.3 de novembre 2012, et le dernier commit sur master date d'octobre 2021. Son serveur autonome importe le module cgi de Python, supprimé dans Python 3.13, et ne démarre donc pas sur un Python récent sans rustine. Lire un corpus brat reste utile. Démarrer un nouveau projet dans brat est plus difficile à justifier.
Argilla
Argilla se concentre sur les données de retour et de préférence pour les modèles de langue, et s'intègre à Hugging Face Datasets. Il prend en charge la classification de textes, la classification de jetons et l'évaluation de textes générés. Son dépôt indique désormais que les auteurs d'origine sont passés à d'autres projets, et que le projet recevra des corrections de bogues et des correctifs, mais plus de nouvelles fonctionnalités.
Systèmes de recherche
Plusieurs systèmes d'annotation ont été publiés comme démonstrations de systèmes à l'ACL. Thresh configure en YAML des tâches d'évaluation fine de textes, pour le résumé, la simplification et la traduction automatique. GATE Teamware 2 gère la classification de documents avec formation des annotateurs et contrôle qualité.
Vérifié dans la documentation, la page de prix et le dépôt de chaque projet en août et septembre 2026.
Faire passer un corpus d'un outil à l'autre
Depuis la version 2.9, Potato importe le standoff de brat, le JSONL de doccano, les fichiers db-out de Prodigy et le CoNLL, de sorte qu'un projet commencé dans l'un d'eux peut continuer dans Potato. Les étiquettes existantes arrivent comme pré-annotations. Les relations et les événements de brat figurent dans les avertissements de l'import et ne sont pas importés. Voir Importer un projet.
Dans l'autre sens, Potato exporte en CoNLL-2003, CoNLL-U, datasets Hugging Face, JSONL, CSV et Parquet. Voir Exporter des annotations pour le ML.
Une tâche d'entités et de relations dans Potato
annotation_schemes:
- annotation_type: span
name: entities
description: "Highlight each person, organization and location."
labels: [PERSON, ORGANIZATION, LOCATION]
- annotation_type: span_link
name: relations
description: "Link each person to the organization they work for."
span_schema: entities
link_types:
- name: WORKS_FOR
directed: true
allowed_source_labels: [PERSON]
allowed_target_labels: [ORGANIZATION]span_link trace des liens typés entre les segments du schéma entities, et allowed_source_labels empêche un annotateur de relier les mauvais types d'entités. Extraction de relations et d'événements traite les événements et les relations n-aires, et Résolution de la coréférence traite les chaînes.
Ce que Potato ne fait pas pour le texte
- Son lien avec les bases de connaissances est plus simple que celui d'INCEpTION.
- Il ne met pas à jour un modèle spaCy pendant que les annotateurs travaillent, comme le peuvent les recettes de Prodigy.
- Il n'a pas d'exportateur spaCy. Convertissez depuis le CoNLL ou le JSONL.
- L'import depuis brat ignore les relations et les événements.
Questions fréquentes
Quel est le meilleur outil gratuit d'annotation de texte ?
Pour un seul projet de NER ou de classification, doccano demande le moins de travail. Pour l'annotation linguistique qui relie des entités à une base de connaissances, INCEpTION est le plus complet. Pour une étude avec plusieurs annotateurs par élément, des travailleurs de crowdsourcing et un chiffre d'accord à rapporter, Potato inclut tout cela sans offre payante.
Existe-t-il une alternative open source à Prodigy ?
Potato, INCEpTION et doccano sont gratuits et open source. Potato se configure en YAML là où Prodigy utilise des recettes Python, et il importe les fichiers db-out de Prodigy, si bien que les annotations déjà collectées dans Prodigy sont conservées.
Quels outils d'annotation de texte rapportent l'accord inter-annotateurs ?
Potato et INCEpTION le font dans leurs versions gratuites, et Prodigy dans son produit payant. Label Studio réserve l'accord à ses offres payantes, et doccano n'en a aucun. Pour les tâches de segments, vérifiez si la mesure tient compte des désaccords de limites, comme le font l'α d'unitisation de Krippendorff et γ.
brat est-il encore maintenu ?
Non. Sa dernière version date de novembre 2012 (v1.3), et son serveur autonome ne démarre pas sur Python 3.13 sans rustine. Depuis la version 2.9, Potato importe les corpus brat et reprend les entités existantes comme pré-annotations.
Peut-on annoter la coréférence avec un outil gratuit ?
Oui. INCEpTION a des couches de chaînes pour la coréférence, et Potato a un schéma coreference qui regroupe les mentions en chaînes. doccano ne gère pas la coréférence.
Pour aller plus loin
- Comparatif des outils d'annotation par IA, tous les types de données sur une page
- Comparatif des outils d'annotation audio
- Comparatif des outils d'annotation d'images
- Comparatif des outils d'annotation vidéo
- Comparatif des outils d'évaluation d'agents IA
- Comparatif des outils d'évaluation des modèles du monde et des épisodes robotiques
- Annotation de segments
- Reconnaissance d'entités nommées