Agreement Cannot Catch Rubber-Stamping
When annotators accept model pre-labels without reading them, inter-annotator agreement goes up. Every quality measure computed from the annotations improves. Timing is the only signal left.
Notizie, tutorial e aggiornamenti dal team di Potato.
When annotators accept model pre-labels without reading them, inter-annotator agreement goes up. Every quality measure computed from the annotations improves. Timing is the only signal left.

Potato può ora registrare come gli annotatori producono le risposte a testo libero, senza registrare che cosa scrivono, e trasformare pause, revisioni e incollaggi in segnalazioni verificabili per le risposte incollate anziché composte.
Un percorso completo da una cartella di output di Whisper a turni di parlante etichettati: scegliere l'unità di annotazione, gestire la diarizzazione, scrivere la configurazione, far girare il task ed esportare con l'allineamento temporale intatto.



Get notified about new tutorials, releases, and community highlights.
Il voto di maggioranza butta via quasi tutto quello che i tuoi annotatori ti hanno detto. L'item response theory dà a ogni etichetta una probabilità a posteriori e un intervallo di confidenza, stima l'abilità degli annotatori e la difficoltà degli elementi e trova le voci rotte del codebook, senza etichette gold e senza alcun LLM.
Potato 2.7 aggiunge etichette con barre di errore, stanze di norming dal vivo, sonde controfattuali sui confini, punteggi per peer prediction, motivazioni vocali in locale, report di dataset con un comando e annotazione da mobile, e nulla di tutto questo richiede un LLM. In più, la valutazione di agenti multi-agente e multimodali.

Una guida pratica alla valutazione umana per agenti per uso del computer e GUI in Potato: giudicare ogni azione, verificare il grounding del click sullo screenshot e rivedere le chiamate agli strumenti una alla volta.
Come trovare il motivo per cui un sistema LLM multi-agente è fallito usando Potato: il grafo di interazione, l'attribuzione del fallimento, la revisione degli handoff, le scorecard per agente, la timeline di contesa degli strumenti e il tagging dei comportamenti emergenti.

Il tempo di revisione umana è la risorsa più scarsa nella valutazione degli agenti. Potato 2.6 unisce una coda di triage basata su segnali all'allineamento giudice-umano, così le tracce peggiori arrivano prima alle persone e il tuo giudice LLM continua a migliorare.
Annotator identity shapes labels on subjective tasks, so demographics are worth collecting, but only with consent and a reason. What to ask, what to leave alone, and how to run the flow in Potato.



A practical guide to deciding when an LLM can annotate your data, where model annotators fail, and how to combine automation with human verification in Potato.
Uno sguardo onesto su come scegliere uno strumento open-source per l'annotazione dei dati, quali domande restringono davvero la scelta e dove si colloca Potato tra Label Studio, Prodigy, Doccano, brat e Argilla.



Potato ora supporta l'annotazione dei coding agent con rendering dei diff, visualizzazione dell'output del terminale e schemi di process reward. Importa le tracce da Claude Code, Aider e SWE-Agent.
Guida passo passo alla raccolta di segnali di reward per singolo passo per l'addestramento di PRM con Potato. Copre la modalità primo errore, l'annotazione passo per passo e l'esportazione verso le pipeline di addestramento.




Confronta Potato con LangSmith, Langfuse, Labelbox e Scale AI per la valutazione degli agenti: rendering delle tracce, annotazione per singolo passo e multi-agente, revisione degli agenti multimodali, coding agent, osservazione dal vivo, prezzi e self-hosting.
Configura la valutazione multicriterio per rubrica con criteri personalizzati, scale di valutazione configurabili e pesi per dimensione, per valutare in modo sistematico gli agenti AI con rubric_eval di Potato.


Come utilizzare il display delle tracce degli agenti web di Potato per valutare agenti di navigazione web autonomi, con screenshot passo per passo, overlay SVG e schemi di annotazione per passo.
Potato 2.2.0 aggiunge 9 nuovi schemi di annotazione, un sistema di esportazione estensibile con plugin, la stima della competenza con MACE, 55 strumenti di survey validati e sorgenti di dati remote.


Come annotare documenti legali in Potato, tra contratti, atti giudiziari e testi normativi: etichettatura di span, estrazione di entità e deployment self-hosted attento alla privacy.
Buone pratiche per annotare immagini mediche in Potato: visualizzazione DICOM, etichettatura di referti radiologici, estrazione di eventi avversi e deployment self-hosted conforme all'IRB.




Come costruire in Potato task di confronto tra immagini affiancate per il ranking di preferenza, i test A/B e la valutazione della qualità visiva, con ordine casuale e punteggio a coppie.
Potato 2.0 porta la pre-annotazione assistita dall'AI con OpenAI e Claude, il supporto multimediale per audio e video, l'active learning, l'annotazione con bounding box e un'interfaccia ridisegnata.



Come costruire interfacce di annotazione su misura in Potato con template HTML, CSS e JavaScript: layout affiancati, widget personalizzati e contenuti multimediali incorporati.
Come costruire in Potato un task di annotazione sulla qualità della pronuncia, con riproduzione audio, forma d'onda, scale Likert e campi di testo libero per il riscontro su ogni registrazione.




Come calcolare e interpretare il kappa di Cohen, il kappa di Fleiss e l'alpha di Krippendorff nei progetti di annotazione con Potato, con esempi di codice Python e criteri di lettura.
Buone pratiche per tenere alta la qualità nei progetti di annotazione, con strategie concrete da mettere in pratica dentro e fuori Potato.




Una panoramica dei concetti dell'annotazione per il tracciamento multi-oggetto e di come le funzionalità video di Potato possono reggere un flusso di tracciamento di base.
Come costruire in Potato un task di classificazione delle emozioni audio, con forma d'onda interattiva, controlli sulla velocità di riproduzione, scale Likert e insiemi di etichette emotive configurabili.