Agreement Cannot Catch Rubber-Stamping
When annotators accept model pre-labels without reading them, inter-annotator agreement goes up. Every quality measure computed from the annotations improves. Timing is the only signal left.
Notícias, tutoriais e novidades da equipe do Potato.
When annotators accept model pre-labels without reading them, inter-annotator agreement goes up. Every quality measure computed from the annotations improves. Timing is the only signal left.

O Potato agora consegue registrar como os anotadores produzem respostas de texto livre, sem registrar o que eles digitam, e transformar as pausas, revisões e colagens em sinalizações auditáveis para respostas que foram coladas em vez de escritas.
Um passo a passo completo, de uma pasta de saída do Whisper até turnos de fala rotulados: escolher a unidade de anotação, lidar com a diarização, escrever a configuração, rodar a tarefa e exportar com o alinhamento temporal intacto.



Get notified about new tutorials, releases, and community highlights.
O voto majoritário joga fora quase tudo o que seus anotadores te disseram. A teoria de resposta ao item dá a cada rótulo uma probabilidade posterior e um intervalo de confiança, estima a habilidade do anotador e a dificuldade do item e encontra entradas quebradas do livro de códigos, sem rótulos-ouro e sem LLM.
O Potato 2.7 traz rótulos com barras de erro, salas de norming ao vivo, sondagens contrafactuais de fronteira, pontuação por predição de pares, justificativas por voz processadas localmente, relatórios de conjunto de dados em um comando e anotação pelo celular, nada disso precisando de LLM. Mais avaliação de agentes multiagentes e multimodais.

Um passo a passo da avaliação humana para agentes de uso de computador e de GUI no Potato: julgando cada ação, verificando a ancoragem do clique na captura de tela e revisando chamadas de ferramentas uma de cada vez.
Como descobrir por que um sistema multiagente de LLM falhou usando o Potato: o grafo de interação, a atribuição de falhas, a revisão de transferências, os boletins por agente, a linha do tempo de contenção de ferramentas e a marcação de comportamento emergente.

O tempo de revisão humana é o recurso mais escasso na avaliação de agentes. O Potato 2.6 combina uma fila de triagem baseada em sinais com o alinhamento juiz-humano, para que os piores rastros cheguem primeiro às pessoas e seu juiz LLM continue melhorando.
Annotator identity shapes labels on subjective tasks, so demographics are worth collecting, but only with consent and a reason. What to ask, what to leave alone, and how to run the flow in Potato.



A practical guide to deciding when an LLM can annotate your data, where model annotators fail, and how to combine automation with human verification in Potato.
Uma análise honesta de como escolher uma ferramenta de anotação de dados de código aberto, quais perguntas realmente reduzem as opções e onde o Potato se encaixa entre Label Studio, Prodigy, Doccano, brat e Argilla.



O Potato agora suporta anotação de agentes de programação com renderização de diffs, exibição de saída de terminal e schemas de recompensa por processo. Importe traces do Claude Code, Aider e SWE-Agent.
Guia passo a passo para coletar sinais de recompensa por etapa para treinamento de PRM usando o Potato. Cobre o modo primeiro-erro, anotação por etapa e exportação para pipelines de treinamento.




Compare o Potato com o LangSmith, o Langfuse, o Labelbox e a Scale AI para avaliação de agentes: renderização de traces, anotação por etapa e multiagentes, revisão de agentes multimodais, agentes de codificação, observação ao vivo, preços e auto-hospedagem.
Configure avaliação por rubrica de múltiplos critérios com critérios personalizados, escalas de avaliação configuráveis e pesos por dimensão para avaliação sistemática de agentes de IA usando o rubric_eval do Potato.


Como usar a exibição de traços de agentes web do Potato para avaliar agentes autônomos de navegação, com capturas de tela passo a passo, sobreposições SVG e esquemas de anotação por etapa.
O Potato 2.2.0 adiciona 9 novos esquemas de anotação, um sistema de exportação plugável, estimativa de competência MACE, 55 instrumentos de pesquisa validados e fontes de dados remotas.


Anote documentos jurídicos no Potato, contratos, peças processuais e textos regulatórios, com rotulagem de spans, extração de entidades e implantação auto-hospedada com privacidade em primeiro lugar.
Boas práticas para anotar imagens médicas no Potato, exibição de DICOM, rotulagem de laudos radiológicos, extração de eventos adversos e implantação auto-hospedada em conformidade com o CEP.




Crie tarefas de comparação de imagens lado a lado no Potato para classificação de preferência, teste A/B e avaliação de qualidade visual, com ordem aleatória e pontuação par a par.
O Potato 2.0 traz pré-anotação com IA usando OpenAI e Claude, suporte a multimídia para áudio e vídeo, aprendizado ativo, anotação por caixas delimitadoras e uma interface redesenhada.



Crie interfaces de anotação personalizadas no Potato usando templates HTML, estilização CSS e JavaScript, layouts lado a lado, widgets personalizados e exibições de mídia incorporadas.
Crie uma tarefa de anotação de qualidade de pronúncia no Potato com reprodução de áudio, visualização de forma de onda, escalas de avaliação Likert e campos de texto livre por gravação.




Calcule e interprete o Kappa de Cohen, o Kappa de Fleiss e o Alpha de Krippendorff para projetos de anotação no Potato, com exemplos de código em Python e diretrizes de interpretação.
Boas práticas para garantir a qualidade da anotação em projetos de anotação, incluindo estratégias práticas que você pode implementar com o Potato e além dele.




Uma visão geral dos conceitos de anotação de rastreamento de múltiplos objetos e de como os recursos de anotação de vídeo do Potato podem dar suporte a fluxos de rastreamento básicos.
Crie uma tarefa de classificação de emoções em áudio no Potato com exibição interativa de forma de onda, controles de velocidade de reprodução, escalas Likert e conjuntos de rótulos de emoção configuráveis.