Skip to content
Guides3 min read

Evidenziazione automatica delle parole chiave

Come configurare in Potato l'evidenziazione delle parole chiave assistita dall'AI per attirare l'attenzione degli annotatori sui termini importanti. Copre OpenAI, Claude e le liste di parole chiave personalizzate.

Potato Team

L'evidenziazione delle parole chiave assistita dall'AI porta l'occhio dell'annotatore sui termini, le entità o i pattern che contano in un testo. Questa guida illustra il supporto AI integrato in Potato e come configurarlo perché le parole chiave rilevanti vengano evidenziate da sole.

Perché usare l'evidenziazione delle parole chiave?

Indirizza gli annotatori verso la parte di testo che conta davvero, quindi trovano prima le informazioni chiave ed è meno probabile che passino sopra a un termine importante. Siccome l'evidenziazione arriva da un LLM, può adattarsi al contesto di ogni elemento invece di dipendere da una lista fissa di parole.

Per capire come funziona sotto il cofano l'evidenziazione di opzioni e parole chiave in Potato, vedi la documentazione sorgente.

Evidenziazione di base assistita dall'AI

Potato si appoggia al proprio sistema di supporto AI per individuare ed evidenziare le parole chiave importanti. Ecco una configurazione minima:

yaml
annotation_task_name: "Keyword Highlighted Annotation"
 
data_files:
  - path: "data/reviews.json"
    format: json
 
item_properties:
  id_key: id
  text_key: text
 
annotation_schemes:
  - annotation_type: radio
    name: sentiment
    description: "What is the overall sentiment?"
    labels:
      - Positive
      - Negative
      - Neutral
 
ai_support:
  enabled: true
  endpoint_type: openai
 
  ai_config:
 
  features:

Quando l'evidenziazione AI delle parole chiave è attiva, i termini rilevanti vengono evidenziati automaticamente nel testo da annotare:

Evidenziazione delle parole chiave assistita dall'AI nell'interfaccia di annotazioneParole chiave ed entità importanti vengono evidenziate automaticamente per guidare l'attenzione dell'annotatore

Usare provider AI diversi

OpenAI

yaml
ai_support:
  enabled: true
  endpoint_type: openai
 
  ai_config:
    model: gpt-4o
    api_key: ${OPENAI_API_KEY}
    temperature: 0.3
    max_tokens: 500
 
  features:
    keyword_highlighting:
      enabled: true
 

Anthropic Claude

yaml
ai_support:
  enabled: true
  endpoint_type: anthropic
 
  ai_config:
    model: claude-3-sonnet-20240229
    api_key: ${ANTHROPIC_API_KEY}
    temperature: 0.3
    max_tokens: 500
 
  features:
    keyword_highlighting:
      enabled: true
      # Highlights are rendered as box overlays on the text

Ollama in locale (senza costi di API)

yaml
ai_support:
  enabled: true
  endpoint_type: ollama
 
  ai_config:
    model: llama2
    base_url: http://localhost:11434
 
  features:
    keyword_highlighting:
      enabled: true
      # Highlights are rendered as box overlays on the text

Combinare le funzionalità

Le funzionalità AI si sommano, e di solito rendono di più insieme che da sole:

yaml
ai_support:
  enabled: true
  endpoint_type: openai
 
  ai_config:
    model: gpt-4
    api_key: ${OPENAI_API_KEY}
    temperature: 0.3
    max_tokens: 500
 
  features:
    # Highlight important keywords
    keyword_highlighting:
      enabled: true
      # Highlights are rendered as box overlays on the text
 
    # Show contextual hints
    hints:
      enabled: true
 
    # Suggest labels for consideration
    label_suggestions:
      enabled: true
      show_confidence: true

Esempio di configurazione completa

Ecco una configurazione intera per l'annotazione con entità e evidenziazione AI:

yaml
annotation_task_name: "Entity-Aware Annotation"
 
data_files:
  - path: "data/documents.json"
    format: json
 
item_properties:
  id_key: id
  text_key: text
 
annotation_schemes:
  - annotation_type: span
    name: entities
    labels:
      - name: PERSON
        color: "#FECACA"
      - name: ORG
        color: "#BBF7D0"
      - name: LOCATION
        color: "#BFDBFE"
 
ai_support:
  enabled: true
  endpoint_type: openai
 
  ai_config:
 
  features:
 
  cache_config:
 
output_annotation_dir: "output/"
export_annotation_format: json
allow_all_users: true

Caching per le prestazioni

Attiva il caching per ridurre le chiamate API e velocizzare le risposte:

yaml
ai_support:
  enabled: true
  endpoint_type: openai
 
  ai_config:
    model: gpt-4
    api_key: ${OPENAI_API_KEY}
 
  features:
    keyword_highlighting:
      enabled: true
 
  cache_config:
    disk_cache:
      enabled: true
      path: "ai_cache/cache.json"
 
    # Pre-generate highlights on startup and prefetch upcoming
    prefetch:
      warm_up_page_count: 100
      on_next: 5
      on_prev: 2

Consigli

Scegli colori di evidenziazione che stiano bene accanto al tuo schema di annotazione, invece di entrarci in conflitto. Tieni acceso il caching, così non paghi due volte lo stesso contenuto. Se annoti grandi volumi, Ollama gira in locale ed elimina del tutto la spesa per le API. E ricorda che le funzionalità si sommano: l'evidenziazione delle parole chiave sta bene insieme ai suggerimenti contestuali e alle proposte di etichetta.


Documentazione completa su Supporto AI.