Ferramentas de anotação com IA, comparadas: código aberto e pagas
Comparação de 14 ferramentas e plataformas de anotação em texto, visão, 3D e avaliação de agentes: quais usam IA para pré-rotular e o que cada versão gratuita realmente inclui.
Uma ferramenta de anotação é um software que atribui rótulos a texto, imagens, áudio, vídeo ou saídas de um modelo, para que o resultado sirva para treinar ou avaliar um sistema. Este guia compara 14 ferramentas de código aberto e comerciais quanto à cobertura de modalidades, anotação assistida por IA, métricas de concordância e o que cada versão gratuita realmente inclui.
Não existe uma única melhor ferramenta. A escolha certa depende do que você anota, do orçamento, de precisar ou não avaliar agentes ou LLMs, e de quanta configuração você tolera.
Quais ferramentas de anotação devo comparar?
| Ferramenta | Licença | Pontos fortes | Melhor quando |
|---|---|---|---|
| Potato | Gratuito, código aberto (pesquisa) | 61 tipos de tarefa em texto, imagem, áudio, vídeo, 3D e robótica, avaliação de agentes e LLM, YAML sem código, métricas de concordância integradas | Pesquisa, avaliação de agentes/LLM, configuração rápida sem código |
| Label Studio | Código aberto + planos pagos | Amplo suporte a modalidades, interface polida, ecossistema grande | Equipes que querem uma plataforma com respaldo comercial |
| Prodigy | Pago (comercial) | Programável, focado em aprendizado ativo, integração estreita com o spaCy | Usuários do spaCy à vontade com uma ferramenta paga e orientada a código |
| Doccano | Código aberto | Simples, limpo, fácil de hospedar por conta própria | Classificação de texto e NER diretos |
| brat | Código aberto | Anotação madura e rica de texto/relações | Anotação linguística de entidades e relações |
| INCEpTION | Código aberto | Anotação linguística rica, vínculo com bases de conhecimento | Projetos linguísticos profundos que podem investir na configuração |
| Argilla | Código aberto | Foco em dados de LLM, integração com o Hugging Face | Coleta de dados de feedback/RLHF na pilha do HF |
| CVAT | Código aberto | Anotação de visão computacional em imagem/vídeo | Caixas delimitadoras, máscaras e rotulagem de visão em vídeo |
| Labelbox / Scale | Comercial (pago) | Plataforma gerenciada, serviços com grande força de trabalho | Empresas que compram as ferramentas mais uma força de trabalho de rotulagem |
(Os detalhes mudam com o tempo, verifique cada projeto para conhecer o licenciamento e os recursos atuais.)
Uma coisa que a coluna de licença esconde: o que um plano gratuito de fato inclui. A edição comunitária do Label Studio não traz nenhuma métrica de concordância entre anotadores, e a marcação de ground truth e os painéis de qualidade começam em US$ 99 por usuário por mês. A Prodigy não tem plano gratuito. A CVAT lista sua interface de controle de qualidade como paga. Se você escolhe por controle de qualidade e não por cobertura de modalidades, compare as edições gratuitas, não as páginas de marketing. Mantemos uma matriz de capacidades de onze ferramentas, conferida na documentação de cada uma.
Quais ferramentas de anotação usam IA para pré-rotular?
"Ferramenta de anotação com IA" abrange três capacidades que costumam ser vendidas como uma só, e uma ferramenta que tem uma delas muitas vezes não tem as outras.
- Geometria assistida por modelo. Clique ou desenhe de forma aproximada e um modelo de segmentação aperta o contorno. O Potato executa isso no navegador sem GPU; o CVAT chega lá via Nuclio ou pelo seu caminho de agentes de IA; o Label Studio, por um backend de ML; Roboflow, V7, Supervisely e Segments.ai entregam isso no próprio produto.
- Rotulagem guiada por prompt. Digite o nome de um objeto e receba uma máscara ou caixa, em vez de escolher de uma lista fixa. Potato, Roboflow e V7 dão suporte a isso. Veja rotular objetos digitando o nome deles.
- Pré-anotação com LLM e VLM. Um modelo propõe rótulos para um lote inteiro e os anotadores os revisam. O Potato alcança 13 tipos de endpoint para isso e também pode pedir que um modelo de visão e linguagem critique anotações já concluídas.
A pré-rotulagem muda o que o controle de qualidade precisa capturar. Anotadores que aceitam sugestões sem lê-las elevam todos os números de concordância enquanto derrubam a acurácia, e o tempo gasto é o único sinal que separa revisão de carimbo automático. Veja como detectar pré-rótulos aceitos sem revisão.
O Potato não treina nem serve modelos. Ele ordena os itens, chama os modelos que você indicar e registra o que o anotador fez com o resultado.
Visão, 3D e avaliação de modelos
As áreas de visão computacional, espacial e de avaliação do Potato são mais novas que as de texto. Esta tabela registra onde cada ferramenta é forte, em vez de classificá-las.
| Capacidade | Potato | CVAT | Label Studio | Roboflow | V7 | Supervisely | Segments.ai |
|---|---|---|---|---|---|---|---|
| Auto-hospedagem gratuita | Sim | Sim (MIT) | Ed. comunitária | - | - | Ed. comunitária | - |
| Caixas, polígonos, máscaras | Sim | Sim | Sim | Sim | Sim | Sim | Sim |
| Segmentação interativa | No navegador, sem GPU | Via Nuclio | Via backend de ML | Sim | Sim | Sim | Sim |
| Segmentação por prompt de texto | Sim (no navegador) | - | Via backend de ML | Sim (SAM 3) | Sim (SAM 3) | Via aplicativos | - |
| Pontos-chave / esqueletos | Sim | Sim | Sim | Sim | Sim | Sim | Sim |
| Polilinhas, elipses, cuboides 2D | Sim | Sim | Parcial | Parcial | Sim | Sim | Sim |
| Atributos por objeto | - | Sim | Sim | Sim | Sim | Sim | Sim |
| Rastreamento em vídeo com interpolação | Sim | Sim | Parcial | Parcial | Sim | Sim | Sim |
| Propagação de máscaras por modelo | Sim (SAM 2, no servidor) | Via agentes de IA | Via backend de ML | Sim | Sim | Sim | Sim |
| Deep zoom / gigapixel | Sim (DZI + IIIF) | Parcial | - | - | Sim | Sim | - |
| Nuvens de pontos 3D e cuboides | Sim | Sim | - | - | - | Sim | Sim |
| Sequências de nuvens de pontos | - | Sim | - | - | - | Sim | Sim |
| Fusão de sensores (2D↔3D) | Sim | Parcial | - | - | - | Sim | Sim |
| Mapas de profundidade com janelamento | Sim | - | - | - | Parcial | - | - |
| DICOM / NIfTI / WSI | - | - | - | - | Sim | Sim | - |
| Treinamento de modelos no mesmo produto | - | Parcial | - | Sim | Sim | Sim | - |
| Importação de formatos de visão | 15 formatos | Ampla | Parcial | Ampla | Parcial | Ampla | Parcial |
| Concordância corrigida por acaso sobre a geometria | Sim | - | - | - | - | - | - |
| Episódios de robôs (LeRobot, RLDS, HDF5) | Sim | - | - | - | - | - | - |
| Avaliação de vídeo generativo e modelos de mundo | Sim | - | - | - | - | - | - |
| Avaliação de ancoragem e apontamento de VLM | Sim | - | - | - | - | - | - |
Na maioria das linhas, as plataformas de visão maduras empatam com o Potato ou o superam. Duas merecem uma leitura atenta em vez de um simples visto: a segmentação por prompt de texto do Potato roda no navegador sob um modelo Apache-2.0, enquanto os equivalentes comerciais rodam no servidor sob os termos não comerciais do SAM 3, e sua propagação de máscaras roda no servidor, de modo que a versão gratuita ganha o recurso, mas não dentro do navegador. Nas quatro últimas linhas, o Potato faz algo que as outras ferramentas não oferecem.
Visão computacional em grande volume
CVAT é a referência entre as ferramentas de visão de código aberto e continua sendo a melhor escolha para pipelines de grande volume dedicados só a visão: gestão mais detalhada de tarefas e trabalhos, atributos por objeto, um ecossistema de formatos maior via Datumaro e uma comunidade muito grande. Escolha o Potato quando o trabalho de visão estiver ao lado de tarefas de texto, áudio ou avaliação, ou quando você precisar de concordância entre anotadores em vez de acurácia contra um trabalho de referência.
Roboflow é excelente se o seu objetivo é um modelo treinado: Smart Polygon, autorrotulagem em lote, Label Assist a partir do seu próprio modelo e treinamento e implantação hospedados em um único ciclo. O Potato não treina detectores. Escolha o Potato quando os rótulos em si forem o resultado da pesquisa e a confiabilidade deles precisar ser defensável.
Labelbox, SuperAnnotate, Encord, Kili e V7 são plataformas comerciais maduras, com gestão de força de trabalho, governança corporativa e forte rotulagem assistida por modelos. Se você precisa de uma força de trabalho gerenciada, de certificações de conformidade ou de curadoria em escala de petabytes, elas são a resposta certa.
X-AnyLabeling reúne Grounding DINO, Grounded-SAM 2, SAM 2.1 e YOLO em um aplicativo de desktop e, para uma única pessoa rotulando localmente com uma ampla gama de modelos, é difícil de superar. O Potato traz um conjunto de modelos mais estreito e roda no navegador, então nada é instalado na máquina do anotador; sua vantagem começa quando há mais de um anotador.
Gigapixel e patologia digital
O Potato constrói uma pirâmide de tiles servida tanto como DZI quanto pela IIIF Image API 3.0, e as máscaras de pincel funcionam na resolução completa da origem porque o buffer da máscara indexa pixels da imagem em vez de uma textura de GPU.
Para patologia digital especificamente, QuPath (desktop, código aberto, o padrão da área) e Cytomine (web, código aberto, multiusuário com anotação cega) foram feitos para isso, e o Potato não lê SVS, DICOM nem NIfTI. Use o Potato aqui quando suas imagens forem grandes mas não de formato clínico, ou quando você precisar por cima das suas camadas de concordância e de fluxo de trabalho.
3D e fusão de sensores
Segments.ai, Kognic, Deepen AI, Supervisely e Xtreme1/BasicAI são especialistas e, para pipelines de direção autônoma em produção, estão à frente: fluxos de sequências e episódios com propagação de trilhas, suporte a radar e a múltiplos LiDAR, modelos de ajuste automático de cuboides, ontologias de atributos por objeto e, no caso da Deepen, um produto completo de calibração sem alvo. Supervisely e Xtreme1 podem ser auto-hospedados, e o Supervisely lida com nuvens bem maiores.
Escolha o Potato para 3D quando quiser estatísticas de confiabilidade sobre rótulos espaciais, ou quando o 3D for uma parte de um estudo multimodal.
Robótica, modelos de mundo e ancoragem
Para episódios de robôs, ATLAS (TU Wien) é uma ferramenta de desktop focada em segmentação de ações de longo horizonte, com suporte nativo a ROS bag e RLDS, e foi feita para a precisão de fronteiras com um único anotador. ELAN e BORIS seguem sendo os padrões para codificação comportamental, e Rerun e Foxglove são as melhores ferramentas de visualização em robótica.
Para vídeo generativo, o ecossistema é composto sobretudo por benchmarks (VBench, WorldModelBench, Physics-IQ) mais painéis de multidão para coleta de preferências em larga escala. Esses fornecem as métricas e os protocolos de referência; o Potato fornece um instrumento para conduzir o lado humano repetidamente com confiabilidade medida, o que é complementar em vez de concorrente.
Para ancoragem de VLM, a área é definida por conjuntos de dados e arcabouços de avaliação (RefCOCO, PixMo-Points, PointBench, lmms-eval, VLMEvalKit) e não por produtos de anotação. O papel do Potato é coletar e medir o ground truth humano sobre o qual esses benchmarks são construídos.
O que o Potato não faz
Para que uma avaliação não descubra isso tarde demais:
- Não treina modelos. O Potato ordena itens, pré-rotula com modelos existentes e critica anotações com um VLM. Ele não treina nem serve detectores. Roboflow, V7, Supervisely e Labelbox fazem isso.
- Ainda não tem atributos por objeto. A geometria carrega um rótulo; níveis de oclusão, sinalizadores de truncamento e atributos de subtipo exigem um esquema à parte.
- Não tem modo de sequência para nuvens de pontos. A anotação 3D é por quadro; a propagação de trilhas ao longo de uma varredura não está implementada.
- Não suporta DICOM, NIfTI nem WSI. O deep zoom e o janelamento de 16 bits cobrem imagens científicas grandes, não as clínicas.
- Não há força de trabalho gerenciada, SAML/SCIM nem certificações de conformidade. O Potato é software que você mesmo executa. RBAC e OAuth são suportados; governança corporativa não.
Contagem de recursos
| Categoria | Potato |
|---|---|
| Esquemas de anotação | 61 |
| Tipos de exibição | 24 |
| Formatos de exportação | 29 |
| Formatos de importação | 15 |
| Tipos de endpoint de IA/LLM | 13 |
| Tipos de fonte de dados | 8 |
| Estratégias de atribuição | 11 |
| Instrumentos de questionário | 55 |
| Integrações de crowdsourcing | 9 |
| Fases de fluxo de trabalho | 8 |
As contagens são geradas a partir dos próprios registros do Potato. Não há coluna de "melhor alternativa", porque as ferramentas acima organizam suas capacidades de forma bastante diferente, o que faz de um número único um convite a comparações enganosas.
Como escolho uma ferramenta de anotação?
- O que você está anotando? Para NER apenas de texto, Doccano ou brat são simples. Para texto/imagem/áudio/vídeo combinados, Potato e Label Studio cobrem toda a faixa.
- Você precisa de avaliação de agentes ou LLM? É aqui que o Potato se destaca: ele lê traços de agentes em muitos formatos e tem ferramentas dedicadas para avaliação de trajetória, recompensa de processo, agentes web, agentes de codificação, equipes multiagentes e uso de computador/multimodais. A maioria das ferramentas gerais não tem isso.
- Orçamento. Potato, Label Studio (núcleo), Doccano, brat e Argilla são gratuitos e de código aberto; Prodigy e alguns planos do Label Studio são pagos.
- Esforço de configuração. O Potato é configurado com um arquivo YAML e não precisa de código; o Prodigy é orientado a código; os demais ficam no meio-termo.
- Ecossistema. O Prodigy combina com o spaCy; o Argilla com o Hugging Face; o Potato exporta para muitos formatos de ML, incluindo CoNLL, spaCy, Hugging Face e COCO/YOLO.
Quando o Potato é a ferramenta de anotação certa?
O Potato surgiu do PLN acadêmico. O sistema original foi apresentado na EMNLP 2022 e o Potato 2.0 na ACL 2026, e ele foi construído para o fluxo de trabalho completo de pesquisa: muitos tipos de tarefa, controle de qualidade e métricas de concordância prontos para uso, integrações de crowdsourcing e um amplo conjunto de ferramentas de avaliação de agentes de IA. Se o seu trabalho abrange várias modalidades ou inclui a avaliação de LLMs e agentes, vale a pena dar uma olhada.
Se você precisa principalmente de uma única tarefa de texto com um produto comercial hospedado, ou se vive inteiramente dentro do spaCy ou do Hugging Face, uma das outras pode lhe servir melhor.
Perguntas frequentes
Qual é a melhor ferramenta de anotação gratuita?
Depende da modalidade. Para classificação e NER só de texto, Doccano e brat são os mais rápidos de colocar no ar. Para texto, imagem, áudio e vídeo em um mesmo projeto, tanto o Potato quanto a edição comunitária do Label Studio cobrem a faixa, e a diferença aparece no controle de qualidade: o Potato inclui métricas de concordância e painéis de qualidade sem custo, enquanto o Label Studio os coloca em um plano pago. Para visão computacional em grande volume, o CVAT é gratuito e maduro.
O Potato é uma alternativa gratuita ao Label Studio?
Sim. O Potato é gratuito e de código aberto, e cobre texto, imagem, áudio, vídeo e avaliação de agentes/LLM a partir de uma única configuração YAML, sem código. O Label Studio é mais amplo em algumas integrações, mas empurra as equipes para planos pagos; o Potato continua gratuito e auto-hospedado, o que combina com o trabalho acadêmico e de pesquisa reprodutível.
O Potato é uma alternativa gratuita e de código aberto ao Prodigy?
Sim. O Prodigy é uma excelente ferramenta paga, orientada a código e estreitamente ligada ao spaCy; o Potato é gratuito, configurado em YAML sem código e exporta para os formatos do spaCy, CoNLL e Hugging Face. Se você quer aprendizado ativo sem uma licença comercial, o Potato é a opção de código aberto.
Como o Potato se compara ao INCEpTION para anotação linguística?
O INCEpTION é poderoso para anotação linguística profunda e vínculo com bases de conhecimento, mas é mais pesado de implantar. O Potato é mais simples de colocar no ar, um arquivo YAML e um único comando, e costuma ser mais rápido para tarefas de span, relações e classificação que não precisam de toda a maquinaria linguística do INCEpTION.
Por que usar o Potato em vez de uma plataforma comercial como Labelbox ou Scale AI?
Labelbox e Scale vendem uma plataforma gerenciada e uma força de trabalho de rotulagem, o que combina com empresas que compram ambas as coisas. Para equipes de pesquisa que trazem seus próprios anotadores e precisam que os dados permaneçam em seus servidores, o Potato é a alternativa gratuita e auto-hospedada, com métricas de concordância entre anotadores integradas.
Qual é a melhor ferramenta de código aberto para anotar trajetórias de agentes de IA?
É aqui que o Potato se destaca entre as ferramentas de anotação gerais: ele lê traços de agentes em 15 formatos e tem telas dedicadas para avaliação de trajetória, em nível de passo, agentes web e agentes de codificação. Ele também anota equipes multiagentes em um grafo de interação clicável e agentes multimodais como agentes de uso de computador e de voz. A maioria das ferramentas, de código aberto ou comerciais, não anota execuções de agentes de forma alguma.
O que o Potato consegue avaliar que ferramentas de observabilidade e plataformas de rotulagem não conseguem?
Duas categorias de superfície de anotação de agentes, nenhuma das quais aparece como um recurso configurável e auto-hospedado nas ferramentas comumente comparadas ao Potato (LangSmith, Langfuse, Labelbox, Scale AI, Label Studio, Argilla, Braintrust), verificadas em suas documentações em junho de 2026:
- Estrutura de equipes multiagentes. Um grafo de interação editável pelo anotador (marcar o caminho crítico, sinalizar um handoff ruim), atribuição de falhas entre agentes como uma tripla de agente responsável / passo decisivo / motivo, revisão de handoff como um objeto de primeira classe, scorecards por agente e por equipe, uma linha do tempo de contenção de ferramentas e marcação de comportamento emergente. O mais próximo disso em outros lugares são os "Agent Graphs" do Langfuse, que é uma visualização de depuração somente leitura em vez de uma superfície de anotação.
- Agentes multimodais. Trajetórias de uso de computador com um marcador de ancoragem de cliques, linhas do tempo de voz full-duplex com pontuação de barge-in e ancoragem temporal de vídeo com um IoU ao vivo contra o intervalo previsto pelo modelo. A Scale AI faz ancoragem de GUI e avaliação de voz, mas como engajamentos de conjuntos de dados gerenciados, e sua arena de voz é baseada em turnos em vez de full-duplex.
As ferramentas de observabilidade (LangSmith, Langfuse, Braintrust) anexam pontuações e comentários em nível de span, o que é anotação real por passo, mas não essas superfícies de estrutura de agentes. As plataformas de rotulagem (Labelbox, Scale) oferecem produtos de dados de avaliação de agentes, mas como serviços pagos em nuvem ou gerenciados, não uma ferramenta que você auto-hospeda e configura em YAML. As capacidades evoluem rapidamente, então isto reflete um instantâneo de junho de 2026; o post de comparação completo lista as versões verificadas.