Riconoscimento di entità nominate
Che cos'è il riconoscimento di entità nominate (NER), quali sono gli insiemi di etichette più diffusi e come costruire un task NER in Potato con etichette di span colorate e tooltip.
Il riconoscimento di entità nominate (NER) consiste nel trovare e classificare le cose con un nome dentro un testo: persone, organizzazioni, luoghi, date e altro. È un task di annotazione di span con un insieme di etichette per tipo di entità. Il NER è un mattone di base per la ricerca, i grafi di conoscenza, l'anonimizzazione e l'estrazione di informazioni.
Per un inquadramento, vedi named-entity recognition.
Scegliere l'insieme di etichette
Parti da uno schema standard e riducilo al tuo dominio:
- CoNLL-2003:
PER,ORG,LOC,MISC. Un buon punto di partenza minimo. - OntoNotes: 18 tipi, tra cui date, importi e percentuali, per esigenze più ricche.
- Specifico di dominio: biomedico (geni, malattie), giuridico (norme, parti) o finanziario.
Meno tipi, e ben definiti, portano a un accordo più alto. Aggiungi un tipo solo quando serve davvero a valle.
Costruire il task in Potato
annotation_schemes:
- annotation_type: span
name: entities
description: "Highlight each named entity and select its type."
labels: [PERSON, ORGANIZATION, LOCATION, DATE, MISC]
allow_discontinuous: false
sequential_key_binding: trueLa vetrina sul riconoscimento di entità nominate esegue questa configurazione con dati di esempio. Per varianti su benchmark e domini specifici, vedi CoNLL-2003 con un passo di triage e NER clinico sulle note i2b2.
Regole sui confini che evitano il disaccordo
Nel NER quasi tutto il disaccordo riguarda dove comincia e finisce un'entità, non che cosa sia. Decidi e metti per iscritto:
- I titoli contano? («Dott.ssa Jane Smith» oppure «Dott.ssa Jane Smith».)
- L'articolo va incluso, come in «le Nazioni Unite»?
- Come etichetti le entità annidate, tipo «Bank of England»? Se ti servono, imposta
allow_overlapping: true.
Dalle etichette al modello
Esporta in formato CoNLL o spaCy, che rappresentano le entità con tag BIO/IOB. Vedi Esportare le annotazioni per il machine learning.
Approfondimenti
- Annotazione di span
- Entity linking, per collegare le entità a una base di conoscenza
- Estrazione di relazioni ed eventi