Potato 2.7: misurare come nascono le etichette
Potato 2.7 aggiunge etichette con barre di errore, stanze di norming dal vivo, sonde controfattuali sui confini, punteggi per peer prediction, motivazioni vocali in locale, report di dataset con un comando e annotazione da mobile, e nulla di tutto questo richiede un LLM. In più, la valutazione di agenti multi-agente e multimodali.
Uno strumento di annotazione raccoglie etichette. È il suo lavoro, e Potato lo fa dal 2022. Ma un'etichetta è il risultato di una decisione, e per gran parte dell'ultimo decennio la decisione in sé è rimasta invisibile: ottieni la risposta, non il ragionamento, la confidenza o il disaccordo che l'hanno prodotta.
Potato 2.7 poggia su una sola idea. Uno strumento di annotazione dovrebbe misurare come si formano i giudizi, non limitarsi a registrare quali sono stati. Vale per entrambi i tipi di giudice: le persone che annotano e i modelli di AI che vengono valutati.
Potato 2.7
Etichette con barre di errore
Il motore psicometrico adatta un modello di item response theory man mano che le annotazioni arrivano, stimando l'abilità di ogni annotatore e la difficoltà di ogni elemento dal solo schema dell'accordo. Niente etichette gold, e niente LLM.
Invece di sarcastic (2 of 3 votes), la tua esportazione dice sarcastic, p = 0.94 [0.88 – 0.97]. La probabilità pesa chi ha votato, non solo quanti.
assignment_strategy: psychometric
psychometrics:
enabled: true
confidence_threshold: 0.95 # items above this stop consuming budgetDal modello discendono due cose. Gli elementi la cui distribuzione a posteriori è già sicura smettono di essere serviti, così la ridondanza va dove serve davvero. E quando la discriminazione di un elemento diventa negativa, cioè quando sono i tuoi annotatori migliori a discostarsi dalla folla, di solito la colpa è di una linea guida rotta e non di un cattivo annotatore. La dashboard lo segnala come probabile errore di codebook.
La riunione di calibrazione, dentro lo strumento
Ogni team di annotazione fa sessioni di norming, che quasi sempre avvengono in condivisione schermo e il cui esito finisce negli appunti di qualcuno. Le stanze multiplayer portano quella sessione dentro Potato e la strumentano.
Tutti votano alla cieca. L'host rivela. Il gruppo discute. Chiunque può cambiare il proprio voto, e ogni cambiamento successivo alla rivelazione viene registrato rispetto a quale fosse la maggioranza in quel momento, il che dà un registro di conformità per ciascun membro. Un indicatore dal vivo dell'α di Krippendorff gira contemporaneamente sui voti alla cieca e su quelli attuali, così la distanza tra i due ti dice quanto è valsa davvero la discussione, mentre è in corso.
Le stanze huddle si riempiono da sole con gli elementi su cui il tuo team è attualmente in disaccordo. Le stanze shadow permettono a chi è in formazione di guardare al lavoro un annotatore esperto, evidenziazioni comprese.
Controllo qualità senza etichette gold
Due funzionalità attaccano lo stesso problema da direzioni diverse, e nessuna delle due piazza un elemento fittizio.
Truth Serum fa una domanda in più dopo ogni etichetta: quale percentuale degli altri annotatori sceglierà quello che hai scelto tu? Quelle previsioni alimentano lo stimatore della risposta sorprendentemente popolare (Prelec, Seung & McCoy 2017, Nature), che batte il voto di maggioranza proprio dove l'annotazione è difficile: quando una folla sicura di sé sbaglia e una minoranza informata ha ragione. Per quanto ne sappiamo, Potato è il primo strumento di annotazione a offrire punteggi per peer prediction.
Laboratorio dei confini di decisione (Boundary Lab) mostra una modifica controfattuale minima subito dopo che un'etichetta è stata assegnata e chiede se l'etichetta regge. Rispondere costa un clic, e l'annotazione ordinaria comincia a produrre insiemi di contrasto (Gardner et al. 2020) come sottoprodotto. Alcune sonde sono parafrasi che preservano il significato, e un annotatore che su quelle cambia idea ti sta dicendo qualcosa, senza che sia stato piazzato un solo elemento gold fittizio.
Il ragionamento umano, catturato verbatim
La modalità Think-Aloud lascia che gli annotatori parlino mentre lavorano. Il riconoscimento vocale gira in locale con faster-whisper, quindi nulla lascia la macchina e non c'è alcun costo per token. La trascrizione viene conservata verbatim e deliberatamente non riassunta, perché parafrasare un protocollo think-aloud distrugge proprio l'artefatto che stavi cercando di raccogliere.
Il punto non sono soltanto le motivazioni. Questa è una registrazione di come una persona ragiona fino a un'etichetta, la controparte umana degli strumenti di process reward che segmentano come ragiona un modello. Stesso elemento, due catene di pensiero.
Altre due, e poi gli agenti
La modalità articolo trasforma un progetto in un report di dataset in LaTeX compilabile con un solo comando: distribuzioni delle etichette, una tabella degli annotatori, statistiche di accordo con le citazioni corrette, tempi e un paragrafo di limitazioni onesto, con dentro numeri reali.
python -m potato.paper config.yaml -o paper_exportLa modalità Pocket rende l'annotazione da mobile di prima classe: i dispositivi touch ricevono una pila di schede scorrevoli con pulsanti nella zona del pollice e sincronizzazione offline. I task che hanno davvero bisogno di un desktop (span, bounding box, video) non vengono mai degradati su un telefono. Ricevono invece un avviso.
Valutare gli agenti AI
L'altra metà della 2.7 punta la stessa filosofia sui modelli. La suite di valutazione degli agenti ora annota un'esecuzione multi-agente come un team invece che come una trascrizione piatta: un grafo di interazione cliccabile, l'attribuzione delle failure tra agenti, la revisione degli handoff, scorecard per singolo agente e per team, una timeline di contesa degli strumenti e il tagging dei comportamenti emergenti.
Gli agenti multimodali hanno le loro superfici dedicate: traiettorie GUI e di uso del computer con grounding dei click, timeline vocali full-duplex con rilevamento dei barge-in, grounding temporale video con IoU dal vivo e struttura delle tabelle nei documenti.
Se preferisci la spiegazione passo passo all'elenco, ne abbiamo scritta una sul debug dei fallimenti multi-agente.
Dove le due metà si incontrano
Sono la stessa idea rivolta a due giudici diversi, e la 2.7 le collega tra loro.
Think-Aloud registra come una persona ragiona fino a un'etichetta. L'annotazione della process reward cattura come ragiona un modello, passo per passo. Mettile una accanto all'altra sullo stesso elemento e vedrai dove il giudizio umano e quello della macchina divergono.
E un giudice LLM è affidabile solo nella misura in cui lo sono le etichette umane con cui l'hai validato. La dashboard di allineamento giudice-umano ti dice quanto il tuo giudice è d'accordo con le persone; la psicometria e Truth Serum danno alle etichette di quelle persone degli intervalli di confidenza. «Il giudice è d'accordo con gli umani» smette di essere una sensazione e diventa un'affermazione con un intervallo attaccato.
Tutto il resto
Annotazione di eventi tra documenti, annotazione a livello di turno su conversazioni e tracce, un codebook come documento vivo con un editor a tutta pagina, collegamenti tra pagine nei PDF con OCR opzionale, ruoli RBAC con schemi per coorte e dashboard di amministrazione e di annotazione in dieci lingue.
Anche l'installazione è diventata più leggera. Gli SDK di AI ora vengono caricati in modo lazy, quindi un semplice pip install potato-annotation non tira dentro alcun SDK di AI e il tempo di avvio scende da circa 2,0 secondi a 0,7.
Come ottenerlo
pip install --upgrade potato-annotationPotato è gratuito, open source con licenza GPL-3.0-or-later e installabile su server propri. Le sette funzionalità qui sopra sono opzionali, indipendenti dal task e nessuna di esse richiede un LLM. È un dettaglio che conta se i tuoi dati non possono uscire dalla tua istituzione, o se il tuo budget non può assorbire una bolletta per token.
Potato 2.0 è stato pubblicato ad ACL 2026 (System Demonstrations). Se Potato ti è utile nella ricerca, è quello l'articolo da citare.
Parti dalla guida rapida, sfoglia le novità, oppure leggi gli approfondimenti su etichette con barre di errore e controllo qualità senza etichette gold.