Skip to content

Modelli di reward di processo

Come raccogliere dati di reward di processo (PRM) etichettando come corretti o sbagliati i passi di un agente, con le modalità primo errore e passo per passo, in Potato.

Un modello di reward di processo (PRM) valuta i passi di ragionamento di un agente, non solo la sua risposta finale. Per addestrarne uno servono etichette a livello di passo: per ogni passo di una traiettoria, era corretto? Sono i dati che permettono a un modello di imparare a ragionare bene, invece di azzeccare la risposta per fortuna.

I PRM si contrappongono ai modelli di reward di esito, che valutano solo il risultato finale. Etichettare a livello di passo intercetta il caso in cui il modello arriva alla risposta giusta con un ragionamento sbagliato. Per il riferimento della funzionalità vedi Annotazione del reward di processo.

Due modalità di etichettatura

Il tipo process_reward di Potato supporta i due schemi standard:

  • Modalità primo errore: l'annotatore segna il primo passo che va storto; tutti i passi successivi vengono trattati automaticamente come compromessi. È rapida e si accorda bene con il modo in cui i fallimenti di ragionamento si propagano.
  • Modalità passo per passo: l'annotatore giudica ogni passo in modo indipendente, corretto o sbagliato. Più fine, ma più faticosa.
yaml
annotation_schemes:
  - annotation_type: process_reward
    name: step_rewards
    description: "Mark the first incorrect step. Steps after it are flagged automatically."
    steps_key: structured_turns
    mode: first_error
    mode: first_error

I colori rendono visibile la propagazione: i passi verdi vanno bene, quello rosso è il primo errore e l'arancione segnala i passi a valle ormai sospetti.

Quale modalità scegliere

  • Primo errore per matematica, programmazione e ragionamenti concatenati, dove un solo sbaglio invalida tutto il resto. Costa meno e di solito basta.
  • Passo per passo quando i passi sono indipendenti, o quando ti serve un segnale di reward denso su ogni passo.

Aspetti di qualità

  • Definisci con precisione cosa sia un «passo corretto»: corretto e utile, oppure semplicemente non sbagliato? Un passo ridondante ma innocuo ha bisogno di una regola.
  • Ai margini il ragionamento è soggettivo: raccogli sovrapposizione su un campione e controlla l'accordo.
  • Abbinalo a un'etichetta di esito sull'intera traiettoria, così puoi studiare dove i buoni esiti nascondono ragionamenti sbagliati. Vedi Annotare le traiettorie degli agenti.

Approfondimenti