Herramientas de anotación de imágenes comparadas: CVAT, Label Studio, Roboflow, V7 y Potato
Compara CVAT, Label Studio, Roboflow, V7, Supervisely, Segments.ai, X-AnyLabeling, VIA y Potato para cajas, segmentación, puntos clave, imágenes gigapíxel y nubes de puntos 3D.
Para etiquetar visión por computador a gran escala, CVAT es la herramienta de código abierto de referencia, y Roboflow, V7 y Supervisely añaden entrenamiento de modelos o flujos de trabajo gestionados como productos comerciales. Potato encaja cuando las etiquetas de imagen son datos de investigación: varios anotadores etiquetan las mismas imágenes y el estudio tiene que informar de cuánto coinciden. También encaja cuando las imágenes comparten estudio con texto, audio o salidas de modelos.
Una caja delimitadora es el rectángulo que rodea un objeto. La segmentación de imágenes asigna píxeles a objetos, como polígonos o como máscaras. Los puntos clave marcan referencias como las articulaciones, y un esqueleto los une. La intersección sobre unión (IoU) mide cuánto se solapan dos formas, y la mayoría de las herramientas la usan para comparar anotadores.
Esta página trata las imágenes, las láminas gigapíxel y las nubes de puntos 3D. Herramientas de anotación con IA, comparadas cubre todos los tipos de datos en una sola página.
¿Qué herramientas de anotación de imágenes vale la pena comparar?
| Herramienta | Funciona como | Coste | Adecuada para |
|---|---|---|---|
| Potato | Autoalojada (GPL-3.0) | Gratis | Estudios con varios anotadores que informan del acuerdo |
| CVAT | Autoalojada (MIT) o alojada | Gratis; alojada, 33 $ por usuario al mes | Cajas, máscaras y seguimiento en vídeo a gran volumen |
| Label Studio | Autoalojada o alojada | Community Edition gratuita; planes de pago desde 99 $ al mes | Imágenes en proyectos que también etiquetan texto, audio o vídeo |
| Roboflow | Alojada | Comercial | Pasar de las etiquetas a un detector entrenado y desplegado |
| V7 | Alojada | Comercial | Flujos gestionados, formatos de imagen médica, etiquetado asistido por modelos |
| Supervisely | Autoalojada o alojada | Community Edition; niveles comerciales | Imágenes grandes, 3D y entrenamiento de modelos en el mismo producto |
| Segments.ai | Alojada | Comercial | Nubes de puntos 3D y fusión de sensores |
| X-AnyLabeling | Aplicación de escritorio | Gratis | Una persona que etiqueta en local con muchos modelos |
| VIA | Un único archivo HTML, sin conexión en el navegador | Gratis (BSD-2-Clause) | Proyectos pequeños sin instalar nada |
Cajas, polígonos y puntos clave
Todas estas herramientas dibujan cajas y polígonos. CVAT, Label Studio, Roboflow, V7, Supervisely, Segments.ai y Potato también hacen puntos clave con esqueletos. Potato añade polilíneas, elipses, cuboides 2D y máscaras de pincel por instancia.
Las plataformas maduras de visión por computador añaden atributos a cada objeto, como un nivel de oclusión, una marca de truncamiento o un subtipo. Potato todavía no. Ahí la geometría lleva una etiqueta, y los atributos adicionales necesitan un esquema complementario.
Segmentación con ayuda de un modelo
La segmentación interactiva convierte un clic o un contorno aproximado en una máscara ajustada. Potato la ejecuta en el navegador, sin GPU que aprovisionar. CVAT llega a ella mediante funciones de Nuclio o su vía de agentes de IA, y Label Studio mediante un backend de ML. Roboflow, V7, Supervisely y Segments.ai la integran en el producto.
La segmentación por texto devuelve una máscara para el objeto que nombras. Potato la ejecuta en el navegador con un modelo bajo licencia Apache-2.0. Roboflow y V7 usan SAM 3 en sus servidores, Supervisely la ofrece mediante apps y Label Studio mediante un backend de ML. X-AnyLabeling reúne Grounding DINO, Grounded-SAM 2, SAM 2.1 y YOLO en una aplicación de escritorio, y para una persona que etiqueta en local con muchos modelos es difícil de superar. La ventaja de Potato empieza cuando hay más de un anotador.
Consulta Cómo anotar máscaras de segmentación de imágenes y etiquetar objetos escribiendo su nombre.
Imágenes gigapíxel y láminas de patología
Potato construye una pirámide de teselas servida como DZI y como IIIF Image API 3.0. Las máscaras de pincel funcionan a la resolución completa de la fuente, porque el búfer de la máscara indexa píxeles de la imagen y no una textura de GPU, así que no hay techo de tamaño de textura. Los TIFF científicos de 16 bits reciben una ventana por percentiles para que las estructuras tenues sigan visibles. V7 y Supervisely también manejan imágenes muy grandes, y CVAT en parte. Consulta Anotación de imágenes gigapíxel con zoom profundo.
Para patología digital, QuPath (aplicación de escritorio de código abierto, el estándar del campo) y Cytomine (aplicación web de código abierto con anotación ciega multiusuario) están hechas a medida. Potato no lee SVS, DICOM ni NIfTI.
Nubes de puntos 3D
Potato anota nubes PCD, PLY, LAS, KITTI .bin y .xyz con cuboides 3D, puntos, polilíneas y segmentos por punto. Guarda la rotación de los cuboides como un cuaternión, de modo que el cabeceo y el alabeo sobreviven a una conversión de ida y vuelta, y compara cuboides con IoU 3D rotada exacta. La anotación es por fotograma.
Segments.ai, Kognic, Deepen AI, Supervisely y Xtreme1/BasicAI son especialistas, y en canalizaciones de producción para conducción autónoma van por delante: flujos de trabajo sobre secuencias con propagación de pistas, soporte de radar y de varios LiDAR, y cuboides ajustados automáticamente. CVAT, Supervisely y Segments.ai manejan secuencias de nubes de puntos, cosa que Potato no hace. Consulta Cómo anotar nubes de puntos 3D.
Medir el acuerdo en etiquetas de imagen
La mayoría de las herramientas de visión por computador comparan anotadores por solapamiento. El motor de consenso de CVAT y la etapa de consenso de V7 comparan anotadores con IoU bruta frente a un umbral por clase, y Label Studio Enterprise lista coincidencia exacta, diferencia numérica, IoU y solapamiento de tramos. Ninguna de estas medidas corrige el azar, y la IoU de dos cajas sobre un objeto grande es alta aunque ambas se dibujen sin cuidado.
Potato informa del acuerdo sobre geometría con una línea base empírica de azar. No hemos encontrado otra plataforma de anotación que informe de acuerdo corregido por azar sobre etiquetas espaciales. Cómo medir el acuerdo entre anotadores en cajas delimitadoras explica el método.
El preetiquetado añade un segundo problema. Los anotadores que aceptan sugerencias del modelo sin revisarlas suben todas las cifras de acuerdo y bajan la exactitud. Potato registra los tiempos del dibujo, que distinguen una sugerencia revisada de una aceptada sin mirar. Consulta Detectar preetiquetas aceptadas sin revisar.
Formatos
Potato importa 15 formatos de visión por computador, 11 de ellos de ida y vuelta. Exporta COCO, YOLO, Pascal VOC, CVAT, LabelMe, Cityscapes, KITTI, V7 Darwin, máscaras PNG, MOT y DAVIS. Consulta Formatos de visión por computador.
Una tarea de cajas delimitadoras con dos anotadores por imagen
agreement_metrics:
enabled: true
annotation_schemes:
- annotation_type: image_annotation
name: objects
description: "Draw a tight box around every vehicle."
source_field: image
tools: [bbox]
labels:
- {name: car, color: "#FF6B6B"}
- {name: truck, color: "#4ECDC4"}
num_annotators_per_item:
default: 2Cada imagen va a dos anotadores, y el panel de administración informa de su acuerdo sobre las cajas.
Lo que Potato no hace con imágenes
- No entrena modelos. Potato preetiqueta con modelos existentes, pero no entrena detectores. Roboflow, V7, Supervisely y Labelbox sí.
- Todavía no tiene atributos por objeto.
- No tiene secuencias de nubes de puntos. La anotación 3D es por fotograma.
- No lee DICOM, NIfTI ni formatos de lámina completa.
- No ofrece anotadores gestionados. Trae los tuyos o recútalos en Prolific.
Comprobado en la documentación y la página de precios de cada proyecto en agosto y septiembre de 2026.
Preguntas frecuentes
¿Cuál es la mejor herramienta gratuita de anotación de imágenes?
Para trabajo de gran volumen que solo es visión por computador, CVAT es gratuita, madura y autoalojada. Para imágenes en un proyecto que también etiqueta texto o audio, la Community Edition de Label Studio y Potato cubren ambas el abanico. Para estudios en los que varios anotadores etiquetan las mismas imágenes y hay que informar del acuerdo, Potato lo incluye sin coste. Para un puñado de imágenes sin instalar nada, VIA funciona desde un único archivo HTML.
¿Hay una alternativa de código abierto a Labelbox?
CVAT, la Community Edition de Label Studio y Potato son de código abierto y autoalojadas. Labelbox vende una plataforma gestionada y una plantilla de etiquetadores. Las herramientas de código abierto aportan software, no anotadores, así que traes tu propio equipo o reclutas mediante una plataforma como Prolific.
¿Puedo usar segmentación asistida por modelos sin un servidor con GPU?
Sí. Potato ejecuta la segmentación interactiva y por texto en el navegador mediante ONNX Runtime Web, y funciona sin red una vez que los pesos del modelo están en la máquina. Su propagación de máscaras en vídeo con SAM 2 se ejecuta en el servidor. X-AnyLabeling ejecuta los modelos en local, en el escritorio. CVAT y Label Studio llaman a un servidor de modelos.
¿Cómo mido el acuerdo entre anotadores en cajas delimitadoras?
Asigna cada imagen al menos a dos anotadores, empareja sus cajas e informa de un acuerdo que tenga en cuenta el azar, porque la IoU bruta es alta en objetos grandes hagan lo que hagan los anotadores. La guía de acuerdo en cajas delimitadoras cubre el emparejamiento, la línea base de azar y qué informar.
¿Qué herramienta de anotación debo usar para nubes de puntos 3D?
Para datos de conducción en producción con secuencias y propagación de pistas, usa un especialista como Segments.ai, Kognic o Supervisely, o CVAT si tiene que ser de código abierto. Para cuboides por fotograma en los que necesitas estadísticas de acuerdo, o cuando el 3D es una parte de un estudio multimodal, Potato encaja.
Lecturas adicionales
- Herramientas de anotación con IA, comparadas, todos los tipos de datos en una página
- Herramientas de anotación de texto comparadas
- Herramientas de anotación de audio comparadas
- Herramientas de anotación de vídeo comparadas
- Herramientas de evaluación de agentes de IA comparadas
- Herramientas de evaluación de modelos del mundo y episodios de robots comparadas
- Anotación de imágenes