Skip to content

Ferramentas de anotação de imagens comparadas: CVAT, Label Studio, Roboflow, V7 e Potato

Compara CVAT, Label Studio, Roboflow, V7, Supervisely, Segments.ai, X-AnyLabeling, VIA e Potato para caixas, segmentação, pontos-chave, imagens gigapixel e nuvens de pontos 3D.

Para rotulagem de visão computacional em grande volume, o CVAT é a ferramenta de código aberto de referência, e o Roboflow, o V7 e o Supervisely acrescentam, como produtos comerciais, treino de modelos ou fluxos de trabalho geridos. O Potato serve quando os rótulos de imagem são dados de investigação: vários anotadores rotulam as mesmas imagens e o estudo tem de reportar o quanto concordam. Também serve quando as imagens partilham um estudo com texto, áudio ou saídas de modelos.

Uma caixa delimitadora é o retângulo à volta de um objeto. A segmentação de imagens atribui píxeis a objetos, como polígonos ou como máscaras. Os pontos-chave marcam referências como as articulações, e um esqueleto liga-os. A interseção sobre união (IoU) mede o quanto duas formas se sobrepõem, e a maioria das ferramentas usa-a para comparar anotadores.

Esta página trata de imagens, lâminas gigapixel e nuvens de pontos 3D. Ferramentas de anotação com IA, comparadas cobre todos os tipos de dados numa só página.

Que ferramentas de anotação de imagens vale a pena comparar?

FerramentaCorre comoCustoIndicada para
PotatoAlojada localmente (GPL-3.0)GratuitaEstudos com vários anotadores que reportam a concordância
CVATAlojada localmente (MIT) ou alojadaGratuita; alojada, 33 $ por utilizador por mêsCaixas, máscaras e seguimento em vídeo em grande volume
Label StudioAlojada localmente ou alojadaCommunity Edition gratuita; planos pagos a partir de 99 $ por mêsImagens em projetos que também rotulam texto, áudio ou vídeo
RoboflowAlojadaComercialPassar dos rótulos a um detetor treinado e implementado
V7AlojadaComercialFluxos geridos, formatos de imagem médica, rotulagem assistida por modelos
SuperviselyAlojada localmente ou alojadaCommunity Edition; níveis comerciaisImagens grandes, 3D e treino de modelos no mesmo produto
Segments.aiAlojadaComercialNuvens de pontos 3D e fusão de sensores
X-AnyLabelingAplicação de secretáriaGratuitaUma pessoa a rotular localmente com muitos modelos
VIAUm único ficheiro HTML, offline no navegadorGratuita (BSD-2-Clause)Projetos pequenos sem instalar nada

Caixas, polígonos e pontos-chave

Todas estas ferramentas desenham caixas e polígonos. O CVAT, o Label Studio, o Roboflow, o V7, o Supervisely, o Segments.ai e o Potato também fazem pontos-chave com esqueletos. O Potato acrescenta polilinhas, elipses, cuboides 2D e máscaras de pincel por instância.

As plataformas maduras de visão computacional associam atributos a cada objeto, como um nível de oclusão, uma marca de truncagem ou um subtipo. O Potato ainda não o faz. Aí a geometria leva um rótulo, e os atributos adicionais precisam de um esquema complementar.

Segmentação com a ajuda de um modelo

A segmentação interativa transforma um clique ou um contorno aproximado numa máscara ajustada. O Potato executa-a no navegador, sem GPU para aprovisionar. O CVAT chega lá através de funções Nuclio ou da sua via de agentes de IA, e o Label Studio através de um backend de ML. O Roboflow, o V7, o Supervisely e o Segments.ai integram-na no produto.

A segmentação por texto devolve uma máscara para o objeto que nomeia. O Potato executa-a no navegador com um modelo sob licença Apache-2.0. O Roboflow e o V7 usam o SAM 3 nos seus servidores, o Supervisely oferece-a através de aplicações e o Label Studio através de um backend de ML. O X-AnyLabeling reúne Grounding DINO, Grounded-SAM 2, SAM 2.1 e YOLO numa aplicação de secretária, e para uma pessoa a rotular localmente com muitos modelos é difícil de bater. A vantagem do Potato começa quando há mais do que um anotador.

Veja Como anotar máscaras de segmentação de imagens e rotular objetos escrevendo o seu nome.

Imagens gigapixel e lâminas de patologia

O Potato constrói uma pirâmide de mosaicos servida tanto em DZI como em IIIF Image API 3.0. As máscaras de pincel funcionam à resolução total da fonte, porque o buffer da máscara indexa píxeis da imagem e não uma textura de GPU, por isso não há teto para o tamanho da textura. Os TIFF científicos de 16 bits recebem uma janela por percentis, para que estruturas ténues continuem visíveis. O V7 e o Supervisely também tratam imagens muito grandes, e o CVAT em parte. Veja Anotação de imagens gigapixel com zoom profundo.

Para patologia digital, o QuPath (aplicação de secretária de código aberto, a referência da área) e o Cytomine (aplicação web de código aberto com anotação cega multiutilizador) são feitos à medida. O Potato não lê SVS, DICOM nem NIfTI.

Nuvens de pontos 3D

O Potato anota nuvens PCD, PLY, LAS, KITTI .bin e .xyz com cuboides 3D, pontos, polilinhas e segmentos por ponto. Guarda a rotação dos cuboides como um quaternião, pelo que a arfagem e o rolamento sobrevivem a uma conversão de ida e volta, e compara cuboides com IoU 3D rodada exata. A anotação é feita fotograma a fotograma.

O Segments.ai, o Kognic, o Deepen AI, o Supervisely e o Xtreme1/BasicAI são especialistas e, para pipelines de produção de condução autónoma, estão à frente: fluxos sobre sequências com propagação de trajetórias, suporte para radar e vários LiDAR, e cuboides ajustados automaticamente. O CVAT, o Supervisely e o Segments.ai tratam sequências de nuvens de pontos, o que o Potato não faz. Veja Como anotar nuvens de pontos 3D.

Medir a concordância em rótulos de imagem

A maioria das ferramentas de visão computacional compara anotadores pela sobreposição. O motor de consenso do CVAT e a etapa de consenso do V7 comparam anotadores com IoU bruta face a um limiar por classe, e o Label Studio Enterprise lista correspondência exata, diferença numérica, IoU e sobreposição de trechos. Nenhuma destas medidas corrige o acaso, e a IoU de duas caixas num objeto grande é alta mesmo quando ambas são desenhadas sem cuidado.

O Potato reporta a concordância sobre a geometria com uma linha de base empírica de acaso. Não encontrámos outra plataforma de anotação que reporte concordância corrigida para o acaso sobre rótulos espaciais. Como medir a concordância entre anotadores em caixas delimitadoras explica o método.

A pré-rotulagem traz um segundo problema. Os anotadores que aceitam sugestões do modelo sem as verificar fazem subir todos os valores de concordância e descer a exatidão. O Potato regista os tempos de desenho, que distinguem uma sugestão revista de uma aceite sem olhar. Veja Detetar pré-rótulos aceites sem revisão.

Formatos

O Potato importa 15 formatos de visão computacional, 11 dos quais de ida e volta. Exporta COCO, YOLO, Pascal VOC, CVAT, LabelMe, Cityscapes, KITTI, V7 Darwin, máscaras PNG, MOT e DAVIS. Veja Formatos de visão computacional.

Uma tarefa de caixas delimitadoras com dois anotadores por imagem

yaml
agreement_metrics:
  enabled: true
 
annotation_schemes:
  - annotation_type: image_annotation
    name: objects
    description: "Draw a tight box around every vehicle."
    source_field: image
    tools: [bbox]
    labels:
      - {name: car, color: "#FF6B6B"}
      - {name: truck, color: "#4ECDC4"}
 
num_annotators_per_item:
  default: 2

Cada imagem vai para dois anotadores, e o painel de administração reporta a sua concordância sobre as caixas.

O que o Potato não faz com imagens

  • Sem treino de modelos. O Potato pré-rotula com modelos existentes, mas não treina detetores. O Roboflow, o V7, o Supervisely e o Labelbox fazem-no.
  • Ainda sem atributos por objeto.
  • Sem sequências de nuvens de pontos. A anotação 3D é feita fotograma a fotograma.
  • Sem DICOM, NIfTI nem formatos de lâmina completa.
  • Sem anotadores geridos. Traga os seus ou recrute-os no Prolific.

Verificado na documentação e na página de preços de cada projeto em agosto e setembro de 2026.

Perguntas frequentes

Qual é a melhor ferramenta gratuita de anotação de imagens?

Para trabalho de grande volume só de visão computacional, o CVAT é gratuito, maduro e alojado localmente. Para imagens num projeto que também rotula texto ou áudio, a Community Edition do Label Studio e o Potato cobrem ambos toda a gama. Para estudos em que vários anotadores rotulam as mesmas imagens e a concordância tem de ser reportada, o Potato inclui isso sem custo. Para um punhado de imagens sem instalar nada, o VIA funciona a partir de um único ficheiro HTML.

Existe uma alternativa de código aberto ao Labelbox?

O CVAT, a Community Edition do Label Studio e o Potato são de código aberto e alojados localmente. O Labelbox vende uma plataforma gerida e uma força de trabalho de rotulagem. As ferramentas de código aberto fornecem o software, não os anotadores, por isso traz a sua própria equipa ou recruta através de uma plataforma como o Prolific.

Posso usar segmentação assistida por modelos sem um servidor com GPU?

Sim. O Potato executa a segmentação interativa e por texto no navegador através do ONNX Runtime Web, e funciona sem rede assim que os pesos do modelo estão na máquina. A sua propagação de máscaras em vídeo com o SAM 2 corre no servidor. O X-AnyLabeling executa os modelos localmente, na secretária. O CVAT e o Label Studio chamam um servidor de modelos.

Como meço a concordância entre anotadores em caixas delimitadoras?

Atribua cada imagem a pelo menos dois anotadores, emparelhe as suas caixas e reporte uma concordância que tenha em conta o acaso, porque a IoU bruta é alta em objetos grandes, façam os anotadores o que fizerem. O guia de concordância em caixas delimitadoras cobre o emparelhamento, a linha de base de acaso e o que reportar.

Que ferramenta de anotação devo usar para nuvens de pontos 3D?

Para dados de condução em produção com sequências e propagação de trajetórias, use um especialista como o Segments.ai, o Kognic ou o Supervisely, ou o CVAT se tiver de ser de código aberto. Para cuboides por fotograma em que precisa de estatísticas de concordância, ou quando o 3D é uma parte de um estudo multimodal, o Potato serve.

Leituras adicionais