Skip to content

Paarweiser Modellvergleich

Wie du zwei Modelle oder zwei Antworten mit menschlichen Annotierenden direkt gegeneinander vergleichst, mit mehrdimensionalem Vergleich und Kontrolle von Verzerrungen, in Potato.

Um zu entscheiden, welches von zwei Modellen besser ist, zeigst du Annotierenden einen Prompt und beide Antworten und fragst, welche gewinnt. Über viele Prompts hinweg zusammengefasst ordnen diese Direktvergleiche Modelle verlässlicher ein als absolute Werte. Auf dieser Methode beruhen die öffentlichen Modell-Ranglisten, die aus menschlichen Stimmen gebildet werden.

Das ist paarweiser Vergleich, angewandt auf Modellausgaben; viele Vergleiche lassen sich mit einem Elo- oder Bradley–Terry-Modell zu einer einzigen Rangfolge verrechnen.

Einfacher Direktvergleich

yaml
annotation_schemes:
  - annotation_type: pairwise
    name: which_better
    description: "Which response is better overall?"
    mode: binary
    allow_tie: true

Mehrdimensionaler Vergleich

Ein einzelnes „besser“ verdeckt Zielkonflikte: Modell A ist genauer, Modell B dafür klarer. Vergleiche auf mehreren Dimensionen gleichzeitig:

yaml
annotation_schemes:
  - annotation_type: pairwise
    name: comparison
    description: "Compare the two responses on each dimension."
    mode: multi_dimension

Eine verpflichtende Begründung macht die Daten nachprüfbar und bringt die Fälle ans Licht, in denen Annotierende das Falsche belohnt haben.

Verzerrungen kontrollieren

Direktvergleichsdaten sind nur so gut wie die Kontrollen gegen Verzerrungen:

  • Positionsverzerrung: Lose zufällig aus, welches Modell als „A“ erscheint; sonst bevorzugen Annotierende eine Seite.
  • Längen- und Stilverzerrung: Annotierende ziehen längeren oder selbstsicherer klingenden Text oft vor, unabhängig von der Qualität. Benenne das in den Richtlinien.
  • Wortfülle ≠ Qualität: Erfasse am besten die Länge mit, damit du prüfen kannst, ob sie die Siege treibt.
  • Übereinstimmung: Erhebe Überlappung und verfolge die Inter-Annotator-Übereinstimmung.

Vergleich oder Rubrik

Nimm den paarweisen Vergleich, wenn du eine Rangfolge brauchst und hohe Übereinstimmung willst. Nimm eine Rubrik, wenn du von jedem Modell ein absolutes Profil je Dimension brauchst. Viele Evaluationen fahren beides.

Weiterführende Lektüre