Skip to content

Herramientas de anotación con IA, comparadas: código abierto y de pago

Comparación de 14 herramientas y plataformas de anotación en texto, visión, 3D y evaluación de agentes: cuáles usan IA para preetiquetar y qué incluye realmente cada versión gratuita.

Una herramienta de anotación es software para adjuntar etiquetas a texto, imágenes, audio, vídeo o salidas de un modelo, de modo que el resultado sirva para entrenar o evaluar un sistema. Esta guía compara 14 herramientas de código abierto y comerciales según su cobertura de modalidades, la anotación asistida por IA, las métricas de concordancia y lo que incluye realmente cada versión gratuita.

No hay una única mejor herramienta. La elección correcta depende de qué anotes, de tu presupuesto, de si necesitas evaluar agentes o LLM y de cuánta configuración estés dispuesto a asumir.

¿Qué herramientas de anotación debería comparar?

HerramientaLicenciaPuntos fuertesMejor cuando
PotatoGratis, código abierto (investigación)61 tipos de tarea en texto, imagen, audio, vídeo, 3D y robótica, evaluación de agentes y LLM, YAML sin código, métricas de concordancia integradasInvestigación, evaluación de agentes/LLM, configuración rápida sin código
Label StudioCódigo abierto + niveles de pagoAmplio soporte de modalidades, interfaz cuidada, gran ecosistemaEquipos que quieren una plataforma con respaldo comercial
ProdigyDe pago (comercial)Programable, orientada al aprendizaje activo, integración estrecha con spaCyUsuarios de spaCy cómodos con una herramienta de pago basada en código
DoccanoCódigo abiertoSencilla, limpia, fácil de autoalojarClasificación de texto y NER directos
bratCódigo abierto (sin mantenimiento)Spans, relaciones, eventos n-arios, correferenciaLeer o ampliar un corpus ya anotado en brat
INCEpTIONCódigo abiertoAnotación lingüística rica, enlace con bases de conocimientoProyectos lingüísticos profundos que puedan invertir en la configuración
ArgillaCódigo abiertoEnfoque en datos para LLM, integración con Hugging FaceRecolección de datos de feedback/RLHF en el stack de HF
CVATCódigo abiertoAnotación de visión por computador en imagen/vídeoCajas delimitadoras, máscaras y etiquetado de visión en vídeo
Labelbox / ScaleComercial (de pago)Plataforma gestionada, servicios con gran fuerza de trabajoEmpresas que compran las herramientas más una fuerza de trabajo de etiquetado

(Los detalles cambian con el tiempo; consulta cada proyecto para conocer su licencia y funciones actuales.)

Hay algo que la columna de licencia esconde: qué incluye de verdad un plan gratuito. La edición comunitaria de Label Studio no trae ninguna métrica de acuerdo entre anotadores. Su plan Starter, de 99 $ al mes más 49 $ por usuario adicional, añade métricas de acuerdo limitadas y paneles de rendimiento de los anotadores, y el conjunto completo está en Enterprise. Prodigy no tiene plan gratuito. CVAT indica que su interfaz de control de calidad es de pago. Si eliges por control de calidad y no por cobertura de modalidades, compara las ediciones gratuitas, no las páginas de marketing. Mantenemos una matriz de capacidades de once herramientas, contrastada con su propia documentación.

Comparativas por tipo de datos

Cada una de estas páginas trata un tipo de datos con más detalle, con más herramientas y los aspectos que importan en ese caso:

¿Qué herramientas de anotación usan IA para preetiquetar?

"Herramienta de anotación con IA" abarca tres capacidades que suelen venderse como una sola, y una herramienta que tiene una a menudo carece de las otras.

  • Geometría asistida por modelo. Haz clic o dibuja de forma aproximada y un modelo de segmentación ajusta el contorno. Potato lo ejecuta en el navegador sin GPU; CVAT llega a ello mediante Nuclio o su vía de agentes de IA; Label Studio, mediante un backend de ML; Roboflow, V7, Supervisely y Segments.ai lo incorporan en el producto.
  • Etiquetado guiado por prompts. Escribe el nombre de un objeto y recibe una máscara o una caja, en lugar de elegir de una lista fija. Potato, Roboflow y V7 lo admiten. Véase cómo etiquetar objetos escribiendo su nombre.
  • Preanotación con LLM y VLM. Un modelo propone etiquetas para un lote y los anotadores las revisan. Potato dispone de 13 tipos de endpoint para esto y también puede hacer que un modelo de visión y lenguaje critique anotaciones ya terminadas.

La preetiquetación cambia lo que el control de calidad tiene que detectar. Los anotadores que aceptan las sugerencias sin leerlas elevan todas las cifras de concordancia mientras bajan la exactitud, y el tiempo es la única señal que separa la revisión del sello automático. Véase cómo detectar preetiquetas aceptadas sin revisar.

Potato no entrena ni sirve modelos. Ordena los elementos, llama a los modelos que le indiques y registra qué hizo el anotador con el resultado.

Texto y PLN

Potato empezó como herramienta de texto. El sistema presentado en EMNLP 2022 anotaba texto y nada más, y todas las capacidades de visión de la sección siguiente son cuatro años más recientes.

Las seis herramientas de aquí hacen clasificación y etiquetado de secuencias. Más allá de eso, estos son los esquemas de texto de Potato:

EsquemaQué hace
spanResaltado, con selección discontinua y enlace de entidades a una base de conocimiento
span_linkRelaciones tipadas entre spans, que también sirven para árboles de dependencias y de constituyentes
coreferenceAgrupar menciones en cadenas
event_annotationEventos n-arios con un disparador y argumentos tipados
error_spanSeveridad tipada al estilo MQM, para evaluar traducción y generación
multi_document_eventRanuras de plantilla rellenadas con evidencia tomada de varios documentos
text_editPosedición con seguimiento de diferencias
tree_annotationÁrboles de conversación con selección de ruta

Concordancia sobre spans

La tabla de visión de más abajo tiene una fila para la concordancia corregida por azar sobre geometría. El texto tiene el mismo problema y una bibliografía más antigua al respecto: dos anotadores que marcan la misma entidad rara vez coinciden en el límite exacto, y una métrica que compara etiquetas token a token les cobra un desacuerdo que no tuvieron.

Los esquemas de spans obtienen κ a nivel de token sobre etiquetas BIO, F1 de spans con coincidencia exacta y parcial, el α de Krippendorff en su forma de unitización y la γ de Mathet et al. (2015). Las dos últimas puntúan dónde empieza y termina un span, no solo cómo se llamó. Consulta medir la concordancia en spans.

Las otras herramientas de texto

INCEpTION es la comparación más cercana para el trabajo lingüístico, y en bases de conocimiento va por delante. Las capas de relaciones, las capas de cadenas para correferencia, los spans de varios tokens, los rasgos de concepto que enlazan una anotación con una clase o instancia de una base de conocimiento y un recomendador de enlace de entidades nombradas son funciones de primer nivel, y su página de concordancia informa de las medidas habituales. Es más pesada de desplegar que el resto de esta lista.

Prodigy tiene una interfaz de relaciones para enlaces dirigidos y no dirigidos anclados a palabras o frases, y una receta coref.manual con valores predeterminados para correferencia. Es de pago y centrada en el código, y se integra con spaCy más estrechamente que cualquier otra de aquí.

Doccano es la más rápida de poner en marcha para texto. Sus tipos de proyecto son clasificación de documentos, etiquetado de secuencias, secuencia a secuencia, detección de intención y relleno de ranuras, y voz a texto, además de cuatro tipos de imagen. Los proyectos de etiquetado de secuencias tienen opciones para spans solapados y para relaciones. No tiene anotación de correferencia ni de eventos, ni métricas de concordancia.

Label Studio tiene una etiqueta Relations que enlaza regiones etiquetadas, y trabaja con audio, imágenes, HTML, párrafos, series temporales y vídeo, no solo con texto. Las métricas de concordancia son limitadas en el plan Starter y completas en Enterprise.

brat es donde se construyeron muchos corpus de PLN. Su formato standoff cubre entidades ligadas al texto, eventos n-arios con disparadores y argumentos, relaciones binarias, conjuntos de equivalencia, atributos, normalizaciones contra un recurso externo y notas. También está sin mantenimiento. La última versión es la v1.3 "Crunchy Frog" de noviembre de 2012, el último commit en master es de octubre de 2021 y hay 493 issues abiertas. Su página de inicio aún la describe como fácil de instalar. No hay paquete que instalar, install.sh es de 2012 y el servidor independiente importa el módulo cgi de Python, que quedó obsoleto en 3.11 y se eliminó en 3.13, así que un Python actual no lo arranca sin un shim. Leer un corpus de brat existente es algo muy distinto de montar brat para recoger uno nuevo.

Desde la versión 2.9, Potato importa standoff de brat, JSONL de doccano, archivos db-out de Prodigy y CoNLL, así que un corpus empezado en cualquiera de ellos puede continuar en Potato. Las etiquetas existentes llegan como preanotaciones. Las relaciones y los eventos de brat no se importan: se enumeran en los avisos de la importación. Consulta Importar un proyecto.

Comprobado en agosto de 2026 frente a la documentación y el repositorio de cada proyecto.

Visión, 3D y evaluación de modelos

Las superficies de visión por computador, espaciales y de evaluación de Potato son más nuevas que las de texto. Esta tabla registra dónde es fuerte cada herramienta en lugar de ordenarlas.

CapacidadPotatoCVATLabel StudioRoboflowV7SuperviselySegments.ai
Autoalojado gratuitoSí (MIT)Ed. comunitaria--Ed. comunitaria-
Cajas, polígonos, máscaras
Segmentación interactivaEn el navegador, sin GPUMediante NuclioMediante backend de ML
Segmentación por indicación de textoSí (en el navegador)-Mediante backend de MLSí (SAM 3)Sí (SAM 3)Mediante aplicaciones-
Puntos clave / esqueletos
Polilíneas, elipses, cuboides 2DParcialParcial
Atributos por objeto-
Seguimiento en vídeo con interpolaciónParcialParcial
Propagación de máscaras basada en modeloSí (SAM 2, en el servidor)Mediante agentes de IAMediante backend de ML
Zoom profundo / gigapíxelSí (DZI + IIIF)Parcial---
Nubes de puntos 3D y cuboides---
Secuencias de nubes de puntos----
Fusión de sensores (2D↔3D)Parcial---
Mapas de profundidad con ventaneo---Parcial--
DICOM / NIfTI / WSI-----
Entrenamiento de modelos en el mismo producto-Parcial--
Importación de formatos de CV15 formatosAmpliaParcialAmpliaParcialAmpliaParcial
Concordancia corregida por azar sobre la geometría------
Episodios de robots (LeRobot, RLDS, HDF5)------
Evaluación de vídeo generativo y modelos del mundo------
Evaluación de anclaje y señalado de VLM------

En la mayoría de las filas, las plataformas de CV maduras igualan o superan a Potato. Dos merecen leerse con detenimiento en lugar de como una simple marca: la segmentación por indicación de texto de Potato se ejecuta en el navegador con un modelo Apache-2.0, mientras que los equivalentes comerciales se ejecutan en el servidor bajo los términos no comerciales de SAM 3, y su propagación de máscaras se ejecuta en el servidor, así que la versión gratuita obtiene la capacidad pero no dentro del navegador. En las cuatro últimas filas, Potato hace algo que las demás herramientas no ofrecen.

Visión por computador a gran volumen

CVAT es la referencia entre las herramientas de CV de código abierto y sigue siendo la mejor opción para pipelines de gran volumen dedicados solo a CV: gestión de tareas y trabajos más detallada, atributos por objeto, un ecosistema de formatos mayor gracias a Datumaro y una comunidad muy grande. Elige Potato cuando el trabajo de CV conviva con tareas de texto, audio o evaluación, o cuando necesites concordancia entre anotadores en lugar de exactitud frente a un trabajo de referencia.

Roboflow es excelente si tu objetivo es un modelo entrenado: Smart Polygon, autoetiquetado por lotes, Label Assist a partir de tu propio modelo, y entrenamiento y despliegue alojados en un mismo ciclo. Potato no entrena detectores. Elige Potato cuando las etiquetas en sí sean el resultado de la investigación y su fiabilidad tenga que ser defendible.

Labelbox, SuperAnnotate, Encord, Kili y V7 son plataformas comerciales maduras con gestión de fuerza de trabajo, gobernanza empresarial y un sólido etiquetado asistido por modelos. Si necesitas una fuerza de trabajo gestionada, certificaciones de cumplimiento o curación a escala de petabytes, son la respuesta correcta.

X-AnyLabeling reúne Grounding DINO, Grounded-SAM 2, SAM 2.1 y YOLO en una aplicación de escritorio, y para una sola persona etiquetando en local con una gama amplia de modelos es difícil de superar. Potato trae un conjunto de modelos más reducido y funciona en el navegador, así que no se instala nada en la máquina del anotador; su ventaja empieza cuando hay más de un anotador.

Gigapíxel y patología digital

Potato construye una pirámide de teselas que sirve tanto como DZI como por la IIIF Image API 3.0, y las máscaras de pincel funcionan a la resolución completa del original porque el búfer de máscara indexa píxeles de la imagen y no una textura de GPU.

Para patología digital en concreto, QuPath (de escritorio, código abierto, el estándar del campo) y Cytomine (web, código abierto, multiusuario con anotación ciega) están hechos a medida, y Potato no lee SVS, DICOM ni NIfTI. Usa Potato aquí cuando tus imágenes sean grandes pero no de formato clínico, o cuando necesites encima sus capas de concordancia y de flujo de trabajo.

3D y fusión de sensores

Segments.ai, Kognic, Deepen AI, Supervisely y Xtreme1/BasicAI son especialistas, y en pipelines de conducción autónoma en producción van por delante: flujos de secuencias y episodios con propagación de trayectorias, soporte de radar y de varios LiDAR, modelos de ajuste automático de cuboides, ontologías de atributos por objeto y, en el caso de Deepen, un producto completo de calibración sin objetivo. Supervisely y Xtreme1 se pueden autoalojar, y Supervisely maneja nubes mucho mayores.

Elige Potato para 3D cuando quieras estadísticas de fiabilidad sobre etiquetas espaciales, o cuando el 3D sea una parte de un estudio multimodal.

Robótica, modelos del mundo y anclaje

Para episodios de robots, ATLAS (TU Wien) es una herramienta de escritorio centrada en la segmentación de acciones de largo horizonte, con soporte nativo de ROS bag y RLDS, y está hecha para la precisión de límites con un solo anotador. ELAN y BORIS siguen siendo los estándares para la codificación conductual, y Rerun y Foxglove son las mejores herramientas de visualización en robótica.

Para vídeo generativo, el ecosistema son sobre todo benchmarks (VBench, WorldModelBench, Physics-IQ) más paneles de multitudes para recoger preferencias a gran escala. Esos aportan las métricas y los protocolos de referencia; Potato aporta un instrumento para ejecutar la parte humana de forma repetida y con la fiabilidad medida, lo que resulta complementario y no competidor.

Para el anclaje de VLM, el área la definen los conjuntos de datos y los arneses de evaluación (RefCOCO, PixMo-Points, PointBench, lmms-eval, VLMEvalKit) más que los productos de anotación. El papel de Potato es recoger y medir la verdad de referencia humana sobre la que se construyen esos benchmarks.

Lo que Potato no hace

Para que una evaluación no lo descubra tarde:

  • No entrena modelos. Potato ordena los elementos, preetiqueta con modelos existentes y critica anotaciones con un VLM. No entrena ni sirve detectores. Roboflow, V7, Supervisely y Labelbox sí.
  • Todavía no tiene atributos por objeto. La geometría lleva una etiqueta; los niveles de oclusión, los indicadores de truncamiento y los atributos de subtipo necesitan un esquema aparte.
  • No tiene modo de secuencia para nubes de puntos. La anotación 3D es por fotograma; la propagación de trayectorias a lo largo de un barrido no está implementada.
  • No admite DICOM, NIfTI ni WSI. El zoom profundo y el ventaneo de 16 bits cubren imágenes científicas grandes, no las clínicas.
  • No hay fuerza de trabajo gestionada, ni SAML/SCIM, ni certificaciones de cumplimiento. Potato es software que tú ejecutas. Admite RBAC y OAuth; la gobernanza empresarial, no.

Recuento de funciones

CategoríaPotato
Esquemas de anotación61
Tipos de visualización24
Formatos de exportación31
Formatos de importación20
Tipos de endpoint de IA/LLM13
Tipos de fuente de datos8
Estrategias de asignación12
Instrumentos de encuesta55
Integraciones de crowdsourcing9
Fases del flujo de trabajo8

Los recuentos se generan a partir de los propios registros de Potato. No hay columna de "mejor alternativa", porque las herramientas de arriba organizan sus capacidades de forma lo bastante distinta como para que un solo número invite a una comparación engañosa.

¿Cómo elijo una herramienta de anotación?

  • ¿Qué vas a anotar? Para NER solo de texto, Doccano es la que menos cuesta poner en marcha. Para texto/imagen/audio/vídeo mezclados, Potato y Label Studio cubren todo el espectro.
  • ¿Necesitas evaluación de agentes o LLM? Aquí es donde Potato resulta inusual: lee trazas de agentes en muchos formatos y tiene herramientas diseñadas específicamente para la evaluación de trayectorias, recompensa de proceso, agentes web, agentes de programación, equipos multiagente y uso del ordenador/multimodal. La mayoría de las herramientas generales no lo hacen.
  • Presupuesto. Potato, Label Studio (núcleo), Doccano y Argilla son gratis y de código abierto; Prodigy y algunos niveles de Label Studio son de pago.
  • Esfuerzo de configuración. Potato se configura con un archivo YAML y no necesita código; Prodigy es de código primero; las demás quedan en un punto intermedio.
  • Ecosistema. Prodigy se combina con spaCy; Argilla con Hugging Face; Potato exporta a muchos formatos de ML, incluidos CoNLL, Hugging Face y COCO/YOLO.

¿Cuándo es Potato la herramienta de anotación adecuada?

Potato surgió del PLN académico. El sistema original se presentó en EMNLP 2022 y Potato 2.0 en ACL 2026, y está hecho para el flujo de trabajo completo de investigación: muchos tipos de tarea, control de calidad y métricas de concordancia listas para usar, integraciones de crowdsourcing y un amplio conjunto de herramientas de evaluación de agentes de IA. Si tu trabajo abarca varias modalidades o incluye la evaluación de LLM y agentes, vale la pena considerarla.

Si lo que necesitas es sobre todo una sola tarea de texto con un producto comercial alojado, o vives por completo dentro de spaCy o Hugging Face, alguna de las otras puede irte mejor.

Preguntas frecuentes

¿Cuál es la mejor herramienta de anotación gratuita?

Depende de la modalidad. Para clasificación y NER solo de texto, Doccano es el que menos cuesta poner en marcha. Para texto, imagen, audio y vídeo en un mismo proyecto, tanto Potato como la edición comunitaria de Label Studio cubren el rango, y la diferencia aparece en el control de calidad: Potato incluye métricas de concordancia y paneles de calidad sin coste, mientras que Label Studio los sitúa en un plan de pago. Para visión por computador a gran volumen, CVAT es gratuito y maduro.

¿Es Potato una alternativa gratuita a Label Studio?

Sí. Potato es gratis y de código abierto, y cubre texto, imagen, audio, vídeo y evaluación de agentes/LLM desde una única configuración YAML sin código. Label Studio es más amplio en algunas integraciones, pero empuja a los equipos hacia niveles de pago; Potato sigue siendo gratis y autoalojado, lo que encaja con el trabajo académico y de investigación reproducible.

¿Es Potato una alternativa gratuita y de código abierto a Prodigy?

Sí. Prodigy es una excelente herramienta de pago, basada en código y estrechamente ligada a spaCy; Potato es gratis, se configura en YAML sin código y exporta a formatos CoNLL y Hugging Face; spaCy lee la salida CoNLL con spacy convert. Si quieres aprendizaje activo sin una licencia comercial, Potato es la opción de código abierto.

¿Cómo se compara Potato con INCEpTION para la anotación lingüística?

INCEpTION es potente para la anotación lingüística profunda y el enlace con bases de conocimiento, pero es más pesado de desplegar. Potato es más sencillo de poner en marcha, un archivo YAML y un solo comando, y suele ser más rápido para tareas de span, relaciones y clasificación que no necesitan toda la maquinaria lingüística de INCEpTION.

¿Por qué usar Potato en lugar de una plataforma comercial como Labelbox o Scale AI?

Labelbox y Scale venden una plataforma gestionada y una fuerza de trabajo de etiquetado, lo que encaja con empresas que compran ambas cosas. Para equipos de investigación que aportan sus propios anotadores y necesitan que los datos permanezcan en sus servidores, Potato es la alternativa gratuita y autoalojada, con métricas de concordancia entre anotadores integradas.

¿Cuál es la mejor herramienta de código abierto para anotar trayectorias de agentes de IA?

Aquí es donde Potato resulta inusual entre las herramientas de anotación generales: lee trazas de agentes en 15 formatos y tiene vistas diseñadas específicamente para la evaluación de trayectorias, a nivel de paso, agentes web y agentes de programación. También anota equipos multiagente en un grafo de interacción clicable y agentes multimodales como los agentes de uso del ordenador y de voz. La mayoría de las herramientas, de código abierto o comerciales, no anotan ejecuciones de agentes en absoluto.

¿Qué puede evaluar Potato que las herramientas de observabilidad y las plataformas de etiquetado no pueden?

Dos categorías de superficie de anotación de agentes, ninguna de las cuales aparece como una función configurable y autoalojada en las herramientas que suelen compararse con Potato (LangSmith, Langfuse, Labelbox, Scale AI, Label Studio, Argilla, Braintrust), verificadas con su documentación a fecha de junio de 2026:

  • Estructura de equipos multiagente. Un grafo de interacción editable por el anotador (marcar la ruta crítica, señalar un traspaso defectuoso), atribución de fallos entre agentes como una terna de agente responsable / paso decisivo / motivo, revisión de traspasos como objeto de primera clase, cuadros de mando por agente y por equipo, una línea temporal de contención de herramientas y etiquetado de comportamiento emergente. Lo más parecido que existe en otras partes es "Agent Graphs" de Langfuse, que es una vista de depuración de solo lectura más que una superficie de anotación.
  • Agentes multimodales. Trayectorias de uso del ordenador con un marcador de anclaje de clics, líneas temporales de voz full-duplex con puntuación de interrupciones (barge-in) y anclaje temporal de vídeo con un IoU en vivo frente al intervalo predicho por el modelo. Scale AI ofrece anclaje en interfaces gráficas y evaluación de voz, pero como contratos de conjuntos de datos gestionados, y su arena de voz funciona por turnos en lugar de en full-duplex.

Las herramientas de observabilidad (LangSmith, Langfuse, Braintrust) adjuntan puntuaciones y comentarios a nivel de span, lo que es una anotación real por paso pero no estas superficies de estructura de agentes. Las plataformas de etiquetado (Labelbox, Scale) ofrecen productos de datos de evaluación de agentes, pero como servicios en la nube de pago o gestionados, no como una herramienta que autoalojas y configuras en YAML. Las capacidades evolucionan con rapidez, así que esto refleja una instantánea de junio de 2026; la entrada de comparación completa enumera las versiones verificadas.

Lecturas adicionales