Skip to content
Announcements7 min read

Potato 2.7: medir como os rótulos nascem

O Potato 2.7 traz rótulos com barras de erro, salas de norming ao vivo, sondagens contrafactuais de fronteira, pontuação por predição de pares, justificativas por voz processadas localmente, relatórios de conjunto de dados em um comando e anotação pelo celular, nada disso precisando de LLM. Mais avaliação de agentes multiagentes e multimodais.

Potato Team

Uma ferramenta de anotação coleta rótulos. Esse é o trabalho, e o Potato faz isso desde 2022. Mas um rótulo é o resultado de uma decisão, e durante quase toda a última década a decisão em si ficou invisível: você recebe a resposta, não o raciocínio, a confiança ou a discordância que a produziu.

O Potato 2.7 nasceu de uma ideia. Uma ferramenta de anotação deveria medir como os julgamentos são feitos, e não apenas registrar quais foram. Isso vale para os dois tipos de juiz: as pessoas que anotam e os modelos de IA que estão sendo avaliados.

Potato 2.7: meça como os rótulos são feitos, seja o juiz uma pessoa ou um modeloPotato 2.7

Rótulos com barras de erro

O motor psicométrico ajusta um modelo de teoria de resposta ao item conforme as anotações chegam, estimando a habilidade de cada anotador e a dificuldade de cada item apenas pelo padrão de concordância. Sem rótulos-ouro e sem LLM.

Em vez de sarcastic (2 of 3 votes), sua exportação diz sarcastic, p = 0.94 [0.88 – 0.97]. A probabilidade pesa quem votou, não só quantos votaram.

yaml
assignment_strategy: psychometric
psychometrics:
  enabled: true
  confidence_threshold: 0.95   # items above this stop consuming budget

Duas coisas caem do modelo. Itens cuja posterior já está confiante deixam de ser servidos, então a redundância vai para onde ela é de fato necessária. E quando a discriminação de um item fica negativa, ou seja, quando são os seus melhores anotadores que discordam da multidão, isso costuma ser uma diretriz quebrada e não um anotador ruim. O painel sinaliza o caso como provável bug de livro de códigos.

A reunião de calibração, dentro da ferramenta

Toda equipe de anotação faz sessões de norming, e elas quase sempre acontecem por compartilhamento de tela, com o resultado morando nas anotações de alguém. As Salas multijogador trazem essa sessão para dentro do Potato e a instrumentam.

Todo mundo vota às cegas. O anfitrião revela. O grupo discute. Qualquer um pode mudar seu voto, e toda mudança posterior à revelação é registrada com qual era a maioria naquele momento, o que dá um registro de conformidade por membro. Um medidor ao vivo do α de Krippendorff roda ao mesmo tempo sobre os votos às cegas e os votos atuais, então a diferença entre os dois mostra o quanto a discussão realmente valeu, enquanto ela acontece.

As salas huddle se abastecem sozinhas com os itens em que sua equipe discorda no momento. As salas shadow deixam quem está em treinamento assistir a um anotador sênior trabalhando, destaques e tudo.

Controle de qualidade sem rótulos-ouro

Dois recursos atacam o mesmo problema por direções diferentes, e nenhum dos dois planta um item falso.

O Truth Serum faz uma pergunta a mais depois de cada rótulo: que porcentagem dos outros anotadores vai escolher o que você escolheu? Essas previsões alimentam o estimador surpreendentemente popular (Prelec, Seung & McCoy 2017, Nature), que supera o voto majoritário exatamente onde a anotação é difícil: quando uma multidão confiante está errada e uma minoria informada está certa. Até onde sabemos, o Potato é a primeira ferramenta de anotação a trazer pontuação por predição de pares.

O Laboratório de fronteiras de decisão (Boundary Lab) mostra uma edição contrafactual mínima logo depois que um rótulo é dado e pergunta se o rótulo sobrevive a ela. Responder custa um clique, e a anotação comum passa a produzir conjuntos de contraste (Gardner et al. 2020) como subproduto. Algumas sondagens são paráfrases que preservam o significado, e um anotador que muda de rótulo diante delas está dizendo alguma coisa, sem um único item-ouro plantado.

Raciocínio humano, capturado na íntegra

O Modo Think-Aloud deixa os anotadores falarem enquanto trabalham. A conversão de fala em texto roda localmente pelo faster-whisper, então nada sai da máquina e não há custo por token. A transcrição é guardada literalmente e deliberadamente sem resumo, porque parafrasear um protocolo de pensar em voz alta destrói o artefato que você estava tentando coletar.

A questão não são apenas as justificativas. Isso é um registro de como uma pessoa raciocina até um rótulo, a contraparte humana do ferramental de recompensa de processo, que segmenta como um modelo raciocina. Mesmo item, duas cadeias de raciocínio.

Mais dois, e então os agentes

O Modo artigo transforma um projeto em um relatório de conjunto de dados em LaTeX compilável com um comando: distribuições de rótulos, uma tabela de anotadores, estatísticas de concordância com as citações certas, tempos e um parágrafo honesto de limitações com números reais dentro.

bash
python -m potato.paper config.yaml -o paper_export

O Modo bolso coloca a anotação pelo celular em primeiro plano: dispositivos de toque recebem uma pilha de cartões deslizáveis com botões na zona do polegar e sincronização offline. Tarefas que realmente precisam de um desktop (spans, caixas delimitadoras, vídeo) nunca são degradadas para o celular. Elas recebem um aviso.

Avaliando agentes de IA

A outra metade da 2.7 aponta a mesma filosofia para os modelos. A suíte de avaliação de agentes agora anota uma execução multiagente como uma equipe, e não como um rastro plano: um grafo de interação clicável, atribuição de falhas entre agentes, revisão de repasses, placares por agente e por equipe, uma linha do tempo de contenção de ferramentas e marcação de comportamento emergente entre agentes.

Os agentes multimodais ganham superfícies próprias: trajetórias de GUI e de uso de computador com ancoragem de cliques, linhas do tempo de voz full-duplex com detecção de interrupção, ancoragem temporal em vídeo com IoU ao vivo e estrutura de tabelas em documentos.

Se você prefere o passo a passo à lista, escrevemos um sobre depurar falhas multiagente.

Onde as duas metades se encontram

São a mesma ideia apontada para dois juízes diferentes, e a 2.7 conecta as duas.

O Think-Aloud registra como uma pessoa raciocina até um rótulo. A anotação de recompensa de processo captura como um modelo raciocina, passo a passo. Coloque as duas lado a lado no mesmo item e dá para ver onde o julgamento humano e o da máquina divergem.

E um juiz LLM só é confiável na medida em que os rótulos humanos contra os quais você o validou forem confiáveis. O painel de alinhamento juiz ↔ humano diz o quanto o seu juiz concorda com as pessoas; a psicometria e o Truth Serum dão intervalos de confiança aos rótulos dessas pessoas. “O juiz concorda com humanos” deixa de ser impressão e vira uma afirmação com intervalo anexado.

Todo o resto

Anotação de eventos entre documentos, anotação por turno sobre conversas e rastros, um livro de códigos vivo com editor de página inteira, vinculação entre páginas de PDF com OCR opcional, papéis RBAC com esquemas por coorte e painéis de administrador e de anotador em dez idiomas.

A instalação também ficou mais leve. Os SDKs de IA agora carregam sob demanda, então um pip install potato-annotation simples não puxa nenhum SDK de IA e o tempo de inicialização cai de cerca de 2,0 segundos para 0,7.

Como obter

bash
pip install --upgrade potato-annotation

O Potato é gratuito, de código aberto sob a GPL-3.0-or-later e pode ser hospedado por você mesmo. Os sete recursos acima são opcionais, independem da tarefa e nenhum deles exige um LLM. Isso importa se os seus dados não podem sair da sua instituição, ou se o seu orçamento não aguenta uma conta por token.

O Potato 2.0 foi publicado na ACL 2026 (System Demonstrations). Se o Potato for útil na sua pesquisa, esse é o artigo a citar.

Comece pelo início rápido, veja as novidades ou leia os aprofundamentos sobre rótulos com barras de erro e controle de qualidade sem rótulos-ouro.