Misurazione e integrità
Potato riporta l'accordo corretto per il caso su geometria, tempo, cuboidi 3D, didascalie e punti di rottura dei world model, e registra come le annotazioni sono state prodotte. Panoramica della misurazione.
Ogni tipo di annotazione in Potato arriva con un modo di misurare se gli annotatori sono d'accordo, corretto per il caso, con i suoi limiti dichiarati. Questo vale anche per i tipi spaziali e temporali, dove lo standard di settore è l'IoU grezzo o la percentuale di corrispondenza, e nessuno dei due è corretto per il caso.
Questa sezione copre entrambi i lati della domanda: se le etichette concordano, e come sono state prodotte.
Il filo conduttore
| Domanda | Misura |
|---|---|
| Gli annotatori hanno trovato gli stessi oggetti? | α di rilevamento |
| Li hanno chiamati allo stesso modo? | α di classificazione |
| Li hanno messi nello stesso punto? | σ e KS rispetto a una baseline empirica del caso |
| Di quale maschera ci fidiamo? | STAPLE |
| Concordano su quando inizia un evento? | IoU temporale e α di confine |
| Concordano su un box 3D? | IoU 3D ruotato esatto |
| Descrivono una regione allo stesso modo? | α con una distanza semantica sul testo |
| Concordano su quando il mondo si è rotto? | accordo sul punto di rottura con sweep di tolleranza |
| L'annotatore è competente? | MACE, per le parti genuinamente categoriali |
Perché la correzione per il caso
L'accordo grezzo è gonfiato ogni volta che una risposta domina, e quasi sempre una risposta domina.
Il caso più chiaro è quello spaziale. Un corpus in cui ogni immagine contiene un solo oggetto grande e centrato mostrerà un IoU medio intorno a 0,95 indipendentemente da chi lo annota, inclusi annotatori che non hanno mai guardato l'immagine e hanno disegnato un box al centro. La correzione per il caso è ciò che separa "questi annotatori concordano" da "questo compito è troppo facile perché ci sia disaccordo".
La maggior parte delle piattaforme di annotazione riporta l'accordo come IoU grezzo, corrispondenza esatta o percentuale rispetto a un job di verità. Sono numeri utili che rispondono a una domanda diversa. Non abbiamo trovato nessun'altra piattaforma di annotazione che riporti un coefficiente corretto per il caso sulle etichette spaziali.
Due scelte di progetto
I valori indefiniti si spiegano da soli. α è genuinamente indefinito su un corpus unanime. Un NaN nudo si legge come un calcolo rotto e un 1.0 sarebbe una bugia, quindi il report dice a parole di quale dei due si tratta.
Niente viene troncato in silenzio. Un report che raggiunge il proprio limite di confronti a coppie lo dichiara e indica quanti elementi ha incluso. Un numero calcolato su un campione che si presenta come calcolato su tutto è peggio di nessun numero.
Il bug per cui questo livello esiste
L'adjudication confrontava le chiavi di un'annotazione, e uno schema immagine memorizza tutto sotto un'unica chiave chiamata _data. Ogni coppia di immagini otteneva quindi accordo 1.0: due annotatori che non concordavano su nulla apparivano unanimi, e nessuna immagine veniva mai instradata alla revisione.
È stato corretto, ed è il motivo per cui il livello di accordo è integrato in ciascun tipo di annotazione anziché aggiunto sopra.
Come sono stati prodotti i dati
L'accordo non può cogliere due annotatori che concordano con sicurezza sulla cosa sbagliata, né una pre-etichetta accettata senza essere letta. Due strumenti affrontano il problema:
- La telemetria di disegno registra il tempo per forma, la dinamica del tratto, il numero di revisioni e la latenza di accettazione dei suggerimenti dell'IA.
- Il logging dei tasti è il gemello lato testo, per come è stata prodotta una risposta libera.
Entrambi sono opt-in, e gli annotatori vedono un avviso di registrazione.
Fiducia e deployment
- Deployment air-gapped — ogni asset è servito dalla tua installazione, verificato a zero richieste esterne.
- Specifiche leggibili dalle macchine — uno JSON Schema e un documento OpenAPI, entrambi generati dal codice e controllati in CI.