Skip to content

Herramientas de anotación con IA, comparadas: código abierto y de pago

Comparación de 14 herramientas y plataformas de anotación en texto, visión, 3D y evaluación de agentes: cuáles usan IA para preetiquetar y qué incluye realmente cada versión gratuita.

Una herramienta de anotación es software para adjuntar etiquetas a texto, imágenes, audio, vídeo o salidas de un modelo, de modo que el resultado sirva para entrenar o evaluar un sistema. Esta guía compara 14 herramientas de código abierto y comerciales según su cobertura de modalidades, la anotación asistida por IA, las métricas de concordancia y lo que incluye realmente cada versión gratuita.

No hay una única mejor herramienta. La elección correcta depende de qué anotes, de tu presupuesto, de si necesitas evaluar agentes o LLM y de cuánta configuración estés dispuesto a asumir.

¿Qué herramientas de anotación debería comparar?

HerramientaLicenciaPuntos fuertesMejor cuando
PotatoGratis, código abierto (investigación)61 tipos de tarea en texto, imagen, audio, vídeo, 3D y robótica, evaluación de agentes y LLM, YAML sin código, métricas de concordancia integradasInvestigación, evaluación de agentes/LLM, configuración rápida sin código
Label StudioCódigo abierto + niveles de pagoAmplio soporte de modalidades, interfaz cuidada, gran ecosistemaEquipos que quieren una plataforma con respaldo comercial
ProdigyDe pago (comercial)Programable, orientada al aprendizaje activo, integración estrecha con spaCyUsuarios de spaCy cómodos con una herramienta de pago basada en código
DoccanoCódigo abiertoSencilla, limpia, fácil de autoalojarClasificación de texto y NER directos
bratCódigo abiertoAnotación madura de texto y relacionesAnotación lingüística de entidades y relaciones
INCEpTIONCódigo abiertoAnotación lingüística rica, enlace con bases de conocimientoProyectos lingüísticos profundos que puedan invertir en la configuración
ArgillaCódigo abiertoEnfoque en datos para LLM, integración con Hugging FaceRecolección de datos de feedback/RLHF en el stack de HF
CVATCódigo abiertoAnotación de visión por computador en imagen/vídeoCajas delimitadoras, máscaras y etiquetado de visión en vídeo
Labelbox / ScaleComercial (de pago)Plataforma gestionada, servicios con gran fuerza de trabajoEmpresas que compran las herramientas más una fuerza de trabajo de etiquetado

(Los detalles cambian con el tiempo; consulta cada proyecto para conocer su licencia y funciones actuales.)

Hay algo que la columna de licencia esconde: qué incluye de verdad un plan gratuito. La edición comunitaria de Label Studio no trae ninguna métrica de acuerdo entre anotadores, y la marcación de verdad de referencia y los paneles de calidad arrancan en 99 $ por usuario y mes. Prodigy no tiene plan gratuito. CVAT indica que su interfaz de control de calidad es de pago. Si eliges por control de calidad y no por cobertura de modalidades, compara las ediciones gratuitas, no las páginas de marketing. Mantenemos una matriz de capacidades de once herramientas, contrastada con su propia documentación.

¿Qué herramientas de anotación usan IA para preetiquetar?

"Herramienta de anotación con IA" abarca tres capacidades que suelen venderse como una sola, y una herramienta que tiene una a menudo carece de las otras.

  • Geometría asistida por modelo. Haz clic o dibuja de forma aproximada y un modelo de segmentación ajusta el contorno. Potato lo ejecuta en el navegador sin GPU; CVAT llega a ello mediante Nuclio o su vía de agentes de IA; Label Studio, mediante un backend de ML; Roboflow, V7, Supervisely y Segments.ai lo incorporan en el producto.
  • Etiquetado guiado por prompts. Escribe el nombre de un objeto y recibe una máscara o una caja, en lugar de elegir de una lista fija. Potato, Roboflow y V7 lo admiten. Véase cómo etiquetar objetos escribiendo su nombre.
  • Preanotación con LLM y VLM. Un modelo propone etiquetas para un lote y los anotadores las revisan. Potato dispone de 13 tipos de endpoint para esto y también puede hacer que un modelo de visión y lenguaje critique anotaciones ya terminadas.

La preetiquetación cambia lo que el control de calidad tiene que detectar. Los anotadores que aceptan las sugerencias sin leerlas elevan todas las cifras de concordancia mientras bajan la exactitud, y el tiempo es la única señal que separa la revisión del sello automático. Véase cómo detectar preetiquetas aceptadas sin revisar.

Potato no entrena ni sirve modelos. Ordena los elementos, llama a los modelos que le indiques y registra qué hizo el anotador con el resultado.

Visión, 3D y evaluación de modelos

Las superficies de visión por computador, espaciales y de evaluación de Potato son más nuevas que las de texto. Esta tabla registra dónde es fuerte cada herramienta en lugar de ordenarlas.

CapacidadPotatoCVATLabel StudioRoboflowV7SuperviselySegments.ai
Autoalojado gratuitoSí (MIT)Ed. comunitaria--Ed. comunitaria-
Cajas, polígonos, máscaras
Segmentación interactivaEn el navegador, sin GPUMediante NuclioMediante backend de ML
Segmentación por indicación de textoSí (en el navegador)-Mediante backend de MLSí (SAM 3)Sí (SAM 3)Mediante aplicaciones-
Puntos clave / esqueletos
Polilíneas, elipses, cuboides 2DParcialParcial
Atributos por objeto-
Seguimiento en vídeo con interpolaciónParcialParcial
Propagación de máscaras basada en modeloSí (SAM 2, en el servidor)Mediante agentes de IAMediante backend de ML
Zoom profundo / gigapíxelSí (DZI + IIIF)Parcial---
Nubes de puntos 3D y cuboides---
Secuencias de nubes de puntos----
Fusión de sensores (2D↔3D)Parcial---
Mapas de profundidad con ventaneo---Parcial--
DICOM / NIfTI / WSI-----
Entrenamiento de modelos en el mismo producto-Parcial--
Importación de formatos de CV15 formatosAmpliaParcialAmpliaParcialAmpliaParcial
Concordancia corregida por azar sobre la geometría------
Episodios de robots (LeRobot, RLDS, HDF5)------
Evaluación de vídeo generativo y modelos del mundo------
Evaluación de anclaje y señalado de VLM------

En la mayoría de las filas, las plataformas de CV maduras igualan o superan a Potato. Dos merecen leerse con detenimiento en lugar de como una simple marca: la segmentación por indicación de texto de Potato se ejecuta en el navegador con un modelo Apache-2.0, mientras que los equivalentes comerciales se ejecutan en el servidor bajo los términos no comerciales de SAM 3, y su propagación de máscaras se ejecuta en el servidor, así que la versión gratuita obtiene la capacidad pero no dentro del navegador. En las cuatro últimas filas, Potato hace algo que las demás herramientas no ofrecen.

Visión por computador a gran volumen

CVAT es la referencia entre las herramientas de CV de código abierto y sigue siendo la mejor opción para pipelines de gran volumen dedicados solo a CV: gestión de tareas y trabajos más detallada, atributos por objeto, un ecosistema de formatos mayor gracias a Datumaro y una comunidad muy grande. Elige Potato cuando el trabajo de CV conviva con tareas de texto, audio o evaluación, o cuando necesites concordancia entre anotadores en lugar de exactitud frente a un trabajo de referencia.

Roboflow es excelente si tu objetivo es un modelo entrenado: Smart Polygon, autoetiquetado por lotes, Label Assist a partir de tu propio modelo, y entrenamiento y despliegue alojados en un mismo ciclo. Potato no entrena detectores. Elige Potato cuando las etiquetas en sí sean el resultado de la investigación y su fiabilidad tenga que ser defendible.

Labelbox, SuperAnnotate, Encord, Kili y V7 son plataformas comerciales maduras con gestión de fuerza de trabajo, gobernanza empresarial y un sólido etiquetado asistido por modelos. Si necesitas una fuerza de trabajo gestionada, certificaciones de cumplimiento o curación a escala de petabytes, son la respuesta correcta.

X-AnyLabeling reúne Grounding DINO, Grounded-SAM 2, SAM 2.1 y YOLO en una aplicación de escritorio, y para una sola persona etiquetando en local con una gama amplia de modelos es difícil de superar. Potato trae un conjunto de modelos más reducido y funciona en el navegador, así que no se instala nada en la máquina del anotador; su ventaja empieza cuando hay más de un anotador.

Gigapíxel y patología digital

Potato construye una pirámide de teselas que sirve tanto como DZI como por la IIIF Image API 3.0, y las máscaras de pincel funcionan a la resolución completa del original porque el búfer de máscara indexa píxeles de la imagen y no una textura de GPU.

Para patología digital en concreto, QuPath (de escritorio, código abierto, el estándar del campo) y Cytomine (web, código abierto, multiusuario con anotación ciega) están hechos a medida, y Potato no lee SVS, DICOM ni NIfTI. Usa Potato aquí cuando tus imágenes sean grandes pero no de formato clínico, o cuando necesites encima sus capas de concordancia y de flujo de trabajo.

3D y fusión de sensores

Segments.ai, Kognic, Deepen AI, Supervisely y Xtreme1/BasicAI son especialistas, y en pipelines de conducción autónoma en producción van por delante: flujos de secuencias y episodios con propagación de trayectorias, soporte de radar y de varios LiDAR, modelos de ajuste automático de cuboides, ontologías de atributos por objeto y, en el caso de Deepen, un producto completo de calibración sin objetivo. Supervisely y Xtreme1 se pueden autoalojar, y Supervisely maneja nubes mucho mayores.

Elige Potato para 3D cuando quieras estadísticas de fiabilidad sobre etiquetas espaciales, o cuando el 3D sea una parte de un estudio multimodal.

Robótica, modelos del mundo y anclaje

Para episodios de robots, ATLAS (TU Wien) es una herramienta de escritorio centrada en la segmentación de acciones de largo horizonte, con soporte nativo de ROS bag y RLDS, y está hecha para la precisión de límites con un solo anotador. ELAN y BORIS siguen siendo los estándares para la codificación conductual, y Rerun y Foxglove son las mejores herramientas de visualización en robótica.

Para vídeo generativo, el ecosistema son sobre todo benchmarks (VBench, WorldModelBench, Physics-IQ) más paneles de multitudes para recoger preferencias a gran escala. Esos aportan las métricas y los protocolos de referencia; Potato aporta un instrumento para ejecutar la parte humana de forma repetida y con la fiabilidad medida, lo que resulta complementario y no competidor.

Para el anclaje de VLM, el área la definen los conjuntos de datos y los arneses de evaluación (RefCOCO, PixMo-Points, PointBench, lmms-eval, VLMEvalKit) más que los productos de anotación. El papel de Potato es recoger y medir la verdad de referencia humana sobre la que se construyen esos benchmarks.

Lo que Potato no hace

Para que una evaluación no lo descubra tarde:

  • No entrena modelos. Potato ordena los elementos, preetiqueta con modelos existentes y critica anotaciones con un VLM. No entrena ni sirve detectores. Roboflow, V7, Supervisely y Labelbox sí.
  • Todavía no tiene atributos por objeto. La geometría lleva una etiqueta; los niveles de oclusión, los indicadores de truncamiento y los atributos de subtipo necesitan un esquema aparte.
  • No tiene modo de secuencia para nubes de puntos. La anotación 3D es por fotograma; la propagación de trayectorias a lo largo de un barrido no está implementada.
  • No admite DICOM, NIfTI ni WSI. El zoom profundo y el ventaneo de 16 bits cubren imágenes científicas grandes, no las clínicas.
  • No hay fuerza de trabajo gestionada, ni SAML/SCIM, ni certificaciones de cumplimiento. Potato es software que tú ejecutas. Admite RBAC y OAuth; la gobernanza empresarial, no.

Recuento de funciones

CategoríaPotato
Esquemas de anotación61
Tipos de visualización24
Formatos de exportación29
Formatos de importación15
Tipos de endpoint de IA/LLM13
Tipos de fuente de datos8
Estrategias de asignación11
Instrumentos de encuesta55
Integraciones de crowdsourcing9
Fases del flujo de trabajo8

Los recuentos se generan a partir de los propios registros de Potato. No hay columna de "mejor alternativa", porque las herramientas de arriba organizan sus capacidades de forma lo bastante distinta como para que un solo número invite a una comparación engañosa.

¿Cómo elijo una herramienta de anotación?

  • ¿Qué vas a anotar? Para NER solo de texto, Doccano o brat son sencillas. Para texto/imagen/audio/vídeo mezclados, Potato y Label Studio cubren todo el espectro.
  • ¿Necesitas evaluación de agentes o LLM? Aquí es donde Potato resulta inusual: lee trazas de agentes en muchos formatos y tiene herramientas diseñadas específicamente para la evaluación de trayectorias, recompensa de proceso, agentes web, agentes de programación, equipos multiagente y uso del ordenador/multimodal. La mayoría de las herramientas generales no lo hacen.
  • Presupuesto. Potato, Label Studio (núcleo), Doccano, brat y Argilla son gratis y de código abierto; Prodigy y algunos niveles de Label Studio son de pago.
  • Esfuerzo de configuración. Potato se configura con un archivo YAML y no necesita código; Prodigy es de código primero; las demás quedan en un punto intermedio.
  • Ecosistema. Prodigy se combina con spaCy; Argilla con Hugging Face; Potato exporta a muchos formatos de ML, incluidos CoNLL, spaCy, Hugging Face y COCO/YOLO.

¿Cuándo es Potato la herramienta de anotación adecuada?

Potato surgió del PLN académico. El sistema original se presentó en EMNLP 2022 y Potato 2.0 en ACL 2026, y está hecho para el flujo de trabajo completo de investigación: muchos tipos de tarea, control de calidad y métricas de concordancia listas para usar, integraciones de crowdsourcing y un amplio conjunto de herramientas de evaluación de agentes de IA. Si tu trabajo abarca varias modalidades o incluye la evaluación de LLM y agentes, vale la pena considerarla.

Si lo que necesitas es sobre todo una sola tarea de texto con un producto comercial alojado, o vives por completo dentro de spaCy o Hugging Face, alguna de las otras puede irte mejor.

Preguntas frecuentes

¿Cuál es la mejor herramienta de anotación gratuita?

Depende de la modalidad. Para clasificación y NER solo de texto, Doccano y brat son los que menos cuesta poner en marcha. Para texto, imagen, audio y vídeo en un mismo proyecto, tanto Potato como la edición comunitaria de Label Studio cubren el rango, y la diferencia aparece en el control de calidad: Potato incluye métricas de concordancia y paneles de calidad sin coste, mientras que Label Studio los sitúa en un plan de pago. Para visión por computador a gran volumen, CVAT es gratuito y maduro.

¿Es Potato una alternativa gratuita a Label Studio?

Sí. Potato es gratis y de código abierto, y cubre texto, imagen, audio, vídeo y evaluación de agentes/LLM desde una única configuración YAML sin código. Label Studio es más amplio en algunas integraciones, pero empuja a los equipos hacia niveles de pago; Potato sigue siendo gratis y autoalojado, lo que encaja con el trabajo académico y de investigación reproducible.

¿Es Potato una alternativa gratuita y de código abierto a Prodigy?

Sí. Prodigy es una excelente herramienta de pago, basada en código y estrechamente ligada a spaCy; Potato es gratis, se configura en YAML sin código y exporta a formatos de spaCy, CoNLL y Hugging Face. Si quieres aprendizaje activo sin una licencia comercial, Potato es la opción de código abierto.

¿Cómo se compara Potato con INCEpTION para la anotación lingüística?

INCEpTION es potente para la anotación lingüística profunda y el enlace con bases de conocimiento, pero es más pesado de desplegar. Potato es más sencillo de poner en marcha, un archivo YAML y un solo comando, y suele ser más rápido para tareas de span, relaciones y clasificación que no necesitan toda la maquinaria lingüística de INCEpTION.

¿Por qué usar Potato en lugar de una plataforma comercial como Labelbox o Scale AI?

Labelbox y Scale venden una plataforma gestionada y una fuerza de trabajo de etiquetado, lo que encaja con empresas que compran ambas cosas. Para equipos de investigación que aportan sus propios anotadores y necesitan que los datos permanezcan en sus servidores, Potato es la alternativa gratuita y autoalojada, con métricas de concordancia entre anotadores integradas.

¿Cuál es la mejor herramienta de código abierto para anotar trayectorias de agentes de IA?

Aquí es donde Potato resulta inusual entre las herramientas de anotación generales: lee trazas de agentes en 15 formatos y tiene vistas diseñadas específicamente para la evaluación de trayectorias, a nivel de paso, agentes web y agentes de programación. También anota equipos multiagente en un grafo de interacción clicable y agentes multimodales como los agentes de uso del ordenador y de voz. La mayoría de las herramientas, de código abierto o comerciales, no anotan ejecuciones de agentes en absoluto.

¿Qué puede evaluar Potato que las herramientas de observabilidad y las plataformas de etiquetado no pueden?

Dos categorías de superficie de anotación de agentes, ninguna de las cuales aparece como una función configurable y autoalojada en las herramientas que suelen compararse con Potato (LangSmith, Langfuse, Labelbox, Scale AI, Label Studio, Argilla, Braintrust), verificadas con su documentación a fecha de junio de 2026:

  • Estructura de equipos multiagente. Un grafo de interacción editable por el anotador (marcar la ruta crítica, señalar un traspaso defectuoso), atribución de fallos entre agentes como una terna de agente responsable / paso decisivo / motivo, revisión de traspasos como objeto de primera clase, cuadros de mando por agente y por equipo, una línea temporal de contención de herramientas y etiquetado de comportamiento emergente. Lo más parecido que existe en otras partes es "Agent Graphs" de Langfuse, que es una vista de depuración de solo lectura más que una superficie de anotación.
  • Agentes multimodales. Trayectorias de uso del ordenador con un marcador de anclaje de clics, líneas temporales de voz full-duplex con puntuación de interrupciones (barge-in) y anclaje temporal de vídeo con un IoU en vivo frente al intervalo predicho por el modelo. Scale AI ofrece anclaje en interfaces gráficas y evaluación de voz, pero como contratos de conjuntos de datos gestionados, y su arena de voz funciona por turnos en lugar de en full-duplex.

Las herramientas de observabilidad (LangSmith, Langfuse, Braintrust) adjuntan puntuaciones y comentarios a nivel de span, lo que es una anotación real por paso pero no estas superficies de estructura de agentes. Las plataformas de etiquetado (Labelbox, Scale) ofrecen productos de datos de evaluación de agentes, pero como servicios en la nube de pago o gestionados, no como una herramienta que autoalojas y configuras en YAML. Las capacidades evolucionan con rapidez, así que esto refleja una instantánea de junio de 2026; la entrada de comparación completa enumera las versiones verificadas.

Lecturas adicionales