Ferramentas de anotação de imagens comparadas: CVAT, Label Studio, Roboflow, V7 e Potato
Compara CVAT, Label Studio, Roboflow, V7, Supervisely, Segments.ai, X-AnyLabeling, VIA e Potato para caixas, segmentação, pontos-chave, imagens gigapixel e nuvens de pontos 3D.
Para rotulagem de visão computacional em grande volume, o CVAT é a ferramenta de código aberto de referência, e o Roboflow, o V7 e o Supervisely acrescentam, como produtos comerciais, treino de modelos ou fluxos de trabalho geridos. O Potato serve quando os rótulos de imagem são dados de investigação: vários anotadores rotulam as mesmas imagens e o estudo tem de reportar o quanto concordam. Também serve quando as imagens partilham um estudo com texto, áudio ou saídas de modelos.
Uma caixa delimitadora é o retângulo à volta de um objeto. A segmentação de imagens atribui píxeis a objetos, como polígonos ou como máscaras. Os pontos-chave marcam referências como as articulações, e um esqueleto liga-os. A interseção sobre união (IoU) mede o quanto duas formas se sobrepõem, e a maioria das ferramentas usa-a para comparar anotadores.
Esta página trata de imagens, lâminas gigapixel e nuvens de pontos 3D. Ferramentas de anotação com IA, comparadas cobre todos os tipos de dados numa só página.
Que ferramentas de anotação de imagens vale a pena comparar?
| Ferramenta | Corre como | Custo | Indicada para |
|---|---|---|---|
| Potato | Alojada localmente (GPL-3.0) | Gratuita | Estudos com vários anotadores que reportam a concordância |
| CVAT | Alojada localmente (MIT) ou alojada | Gratuita; alojada, 33 $ por utilizador por mês | Caixas, máscaras e seguimento em vídeo em grande volume |
| Label Studio | Alojada localmente ou alojada | Community Edition gratuita; planos pagos a partir de 99 $ por mês | Imagens em projetos que também rotulam texto, áudio ou vídeo |
| Roboflow | Alojada | Comercial | Passar dos rótulos a um detetor treinado e implementado |
| V7 | Alojada | Comercial | Fluxos geridos, formatos de imagem médica, rotulagem assistida por modelos |
| Supervisely | Alojada localmente ou alojada | Community Edition; níveis comerciais | Imagens grandes, 3D e treino de modelos no mesmo produto |
| Segments.ai | Alojada | Comercial | Nuvens de pontos 3D e fusão de sensores |
| X-AnyLabeling | Aplicação de secretária | Gratuita | Uma pessoa a rotular localmente com muitos modelos |
| VIA | Um único ficheiro HTML, offline no navegador | Gratuita (BSD-2-Clause) | Projetos pequenos sem instalar nada |
Caixas, polígonos e pontos-chave
Todas estas ferramentas desenham caixas e polígonos. O CVAT, o Label Studio, o Roboflow, o V7, o Supervisely, o Segments.ai e o Potato também fazem pontos-chave com esqueletos. O Potato acrescenta polilinhas, elipses, cuboides 2D e máscaras de pincel por instância.
As plataformas maduras de visão computacional associam atributos a cada objeto, como um nível de oclusão, uma marca de truncagem ou um subtipo. O Potato ainda não o faz. Aí a geometria leva um rótulo, e os atributos adicionais precisam de um esquema complementar.
Segmentação com a ajuda de um modelo
A segmentação interativa transforma um clique ou um contorno aproximado numa máscara ajustada. O Potato executa-a no navegador, sem GPU para aprovisionar. O CVAT chega lá através de funções Nuclio ou da sua via de agentes de IA, e o Label Studio através de um backend de ML. O Roboflow, o V7, o Supervisely e o Segments.ai integram-na no produto.
A segmentação por texto devolve uma máscara para o objeto que nomeia. O Potato executa-a no navegador com um modelo sob licença Apache-2.0. O Roboflow e o V7 usam o SAM 3 nos seus servidores, o Supervisely oferece-a através de aplicações e o Label Studio através de um backend de ML. O X-AnyLabeling reúne Grounding DINO, Grounded-SAM 2, SAM 2.1 e YOLO numa aplicação de secretária, e para uma pessoa a rotular localmente com muitos modelos é difícil de bater. A vantagem do Potato começa quando há mais do que um anotador.
Veja Como anotar máscaras de segmentação de imagens e rotular objetos escrevendo o seu nome.
Imagens gigapixel e lâminas de patologia
O Potato constrói uma pirâmide de mosaicos servida tanto em DZI como em IIIF Image API 3.0. As máscaras de pincel funcionam à resolução total da fonte, porque o buffer da máscara indexa píxeis da imagem e não uma textura de GPU, por isso não há teto para o tamanho da textura. Os TIFF científicos de 16 bits recebem uma janela por percentis, para que estruturas ténues continuem visíveis. O V7 e o Supervisely também tratam imagens muito grandes, e o CVAT em parte. Veja Anotação de imagens gigapixel com zoom profundo.
Para patologia digital, o QuPath (aplicação de secretária de código aberto, a referência da área) e o Cytomine (aplicação web de código aberto com anotação cega multiutilizador) são feitos à medida. O Potato não lê SVS, DICOM nem NIfTI.
Nuvens de pontos 3D
O Potato anota nuvens PCD, PLY, LAS, KITTI .bin e .xyz com cuboides 3D, pontos, polilinhas e segmentos por ponto. Guarda a rotação dos cuboides como um quaternião, pelo que a arfagem e o rolamento sobrevivem a uma conversão de ida e volta, e compara cuboides com IoU 3D rodada exata. A anotação é feita fotograma a fotograma.
O Segments.ai, o Kognic, o Deepen AI, o Supervisely e o Xtreme1/BasicAI são especialistas e, para pipelines de produção de condução autónoma, estão à frente: fluxos sobre sequências com propagação de trajetórias, suporte para radar e vários LiDAR, e cuboides ajustados automaticamente. O CVAT, o Supervisely e o Segments.ai tratam sequências de nuvens de pontos, o que o Potato não faz. Veja Como anotar nuvens de pontos 3D.
Medir a concordância em rótulos de imagem
A maioria das ferramentas de visão computacional compara anotadores pela sobreposição. O motor de consenso do CVAT e a etapa de consenso do V7 comparam anotadores com IoU bruta face a um limiar por classe, e o Label Studio Enterprise lista correspondência exata, diferença numérica, IoU e sobreposição de trechos. Nenhuma destas medidas corrige o acaso, e a IoU de duas caixas num objeto grande é alta mesmo quando ambas são desenhadas sem cuidado.
O Potato reporta a concordância sobre a geometria com uma linha de base empírica de acaso. Não encontrámos outra plataforma de anotação que reporte concordância corrigida para o acaso sobre rótulos espaciais. Como medir a concordância entre anotadores em caixas delimitadoras explica o método.
A pré-rotulagem traz um segundo problema. Os anotadores que aceitam sugestões do modelo sem as verificar fazem subir todos os valores de concordância e descer a exatidão. O Potato regista os tempos de desenho, que distinguem uma sugestão revista de uma aceite sem olhar. Veja Detetar pré-rótulos aceites sem revisão.
Formatos
O Potato importa 15 formatos de visão computacional, 11 dos quais de ida e volta. Exporta COCO, YOLO, Pascal VOC, CVAT, LabelMe, Cityscapes, KITTI, V7 Darwin, máscaras PNG, MOT e DAVIS. Veja Formatos de visão computacional.
Uma tarefa de caixas delimitadoras com dois anotadores por imagem
agreement_metrics:
enabled: true
annotation_schemes:
- annotation_type: image_annotation
name: objects
description: "Draw a tight box around every vehicle."
source_field: image
tools: [bbox]
labels:
- {name: car, color: "#FF6B6B"}
- {name: truck, color: "#4ECDC4"}
num_annotators_per_item:
default: 2Cada imagem vai para dois anotadores, e o painel de administração reporta a sua concordância sobre as caixas.
O que o Potato não faz com imagens
- Sem treino de modelos. O Potato pré-rotula com modelos existentes, mas não treina detetores. O Roboflow, o V7, o Supervisely e o Labelbox fazem-no.
- Ainda sem atributos por objeto.
- Sem sequências de nuvens de pontos. A anotação 3D é feita fotograma a fotograma.
- Sem DICOM, NIfTI nem formatos de lâmina completa.
- Sem anotadores geridos. Traga os seus ou recrute-os no Prolific.
Verificado na documentação e na página de preços de cada projeto em agosto e setembro de 2026.
Perguntas frequentes
Qual é a melhor ferramenta gratuita de anotação de imagens?
Para trabalho de grande volume só de visão computacional, o CVAT é gratuito, maduro e alojado localmente. Para imagens num projeto que também rotula texto ou áudio, a Community Edition do Label Studio e o Potato cobrem ambos toda a gama. Para estudos em que vários anotadores rotulam as mesmas imagens e a concordância tem de ser reportada, o Potato inclui isso sem custo. Para um punhado de imagens sem instalar nada, o VIA funciona a partir de um único ficheiro HTML.
Existe uma alternativa de código aberto ao Labelbox?
O CVAT, a Community Edition do Label Studio e o Potato são de código aberto e alojados localmente. O Labelbox vende uma plataforma gerida e uma força de trabalho de rotulagem. As ferramentas de código aberto fornecem o software, não os anotadores, por isso traz a sua própria equipa ou recruta através de uma plataforma como o Prolific.
Posso usar segmentação assistida por modelos sem um servidor com GPU?
Sim. O Potato executa a segmentação interativa e por texto no navegador através do ONNX Runtime Web, e funciona sem rede assim que os pesos do modelo estão na máquina. A sua propagação de máscaras em vídeo com o SAM 2 corre no servidor. O X-AnyLabeling executa os modelos localmente, na secretária. O CVAT e o Label Studio chamam um servidor de modelos.
Como meço a concordância entre anotadores em caixas delimitadoras?
Atribua cada imagem a pelo menos dois anotadores, emparelhe as suas caixas e reporte uma concordância que tenha em conta o acaso, porque a IoU bruta é alta em objetos grandes, façam os anotadores o que fizerem. O guia de concordância em caixas delimitadoras cobre o emparelhamento, a linha de base de acaso e o que reportar.
Que ferramenta de anotação devo usar para nuvens de pontos 3D?
Para dados de condução em produção com sequências e propagação de trajetórias, use um especialista como o Segments.ai, o Kognic ou o Supervisely, ou o CVAT se tiver de ser de código aberto. Para cuboides por fotograma em que precisa de estatísticas de concordância, ou quando o 3D é uma parte de um estudo multimodal, o Potato serve.
Leituras adicionais
- Ferramentas de anotação com IA, comparadas, todos os tipos de dados numa página
- Ferramentas de anotação de texto comparadas
- Ferramentas de anotação de áudio comparadas
- Ferramentas de anotação de vídeo comparadas
- Ferramentas de avaliação de agentes de IA comparadas
- Ferramentas de avaliação de modelos de mundo e episódios de robôs comparadas
- Anotação de imagens