Skip to content

Active learning per l'annotazione

Cos'è l'active learning, quando conviene e quali strategie di query supporta Potato, incertezza, diversità, BADGE, BALD, per etichettare meno elementi a parità di qualità del modello.

L'active learning sceglie quali elementi annotare per primi, così il modello raggiunge la stessa accuratezza con molte meno etichette. Invece di etichettare a caso, etichetti gli elementi che il modello trova più informativi. Quando è l'etichettatura a fare da collo di bottiglia, è una delle tecniche che rendono di più.

Per il contesto, vedi active learning. Per il riferimento della funzionalità, vedi Apprendimento Attivo.

Il ciclo

  1. Etichetta un piccolo insieme iniziale.
  2. Addestra un modello veloce su quello che hai.
  3. Assegna un punteggio al pool non etichettato e scegli gli elementi più informativi.
  4. Annotali, aggiungili, riaddestra. E ripeti.

Il guadagno è in efficienza dei dati: il modello spende il tuo budget di annotazione dove impara di più.

Strategie di query supportate da Potato

  • Campionamento per incertezza: prende gli elementi su cui il modello è meno sicuro (vicini al confine di decisione). Il default più semplice, e spesso funziona.
  • Campionamento per diversità: prende elementi diversi tra loro, così non sprechi budget su quasi-duplicati.
  • BADGE: combina incertezza e diversità usando i gradient embedding.
  • BALD: strategia bayesiana che seleziona gli elementi da cui ci si aspetta la maggiore riduzione dell'incertezza del modello.
  • Ibrida: mescola più strategie.
yaml
active_learning:
  enabled: true
  schema_names: [sentiment]
  query_strategy: uncertainty   # or diversity, badge, bald, hybrid
  min_instances_for_training: 20

Quando l'active learning aiuta, e quando no

Aiuta quando le etichette costano, il pool è grande e un modello utile si può addestrare su un seed piccolo. Aiuta meno quando:

  • Il task è così facile che l'etichettatura casuale satura già in fretta.
  • Ti serve un test set held-out non distorto, tieni i dati di valutazione campionati a caso, perché i dati selezionati dall'active learning sono sbilanciati di proposito.
  • Le etichette costano poco rispetto al lavoro di ingegneria richiesto.

Approfondimenti