Paarweiser Modellvergleich
Wie du zwei Modelle oder zwei Antworten mit menschlichen Annotierenden direkt gegeneinander vergleichst, mit mehrdimensionalem Vergleich und Kontrolle von Verzerrungen, in Potato.
Um zu entscheiden, welches von zwei Modellen besser ist, zeigst du Annotierenden einen Prompt und beide Antworten und fragst, welche gewinnt. Über viele Prompts hinweg zusammengefasst ordnen diese Direktvergleiche Modelle verlässlicher ein als absolute Werte. Auf dieser Methode beruhen die öffentlichen Modell-Ranglisten, die aus menschlichen Stimmen gebildet werden.
Das ist paarweiser Vergleich, angewandt auf Modellausgaben; viele Vergleiche lassen sich mit einem Elo- oder Bradley–Terry-Modell zu einer einzigen Rangfolge verrechnen.
Einfacher Direktvergleich
annotation_schemes:
- annotation_type: pairwise
name: which_better
description: "Which response is better overall?"
mode: binary
allow_tie: trueMehrdimensionaler Vergleich
Ein einzelnes „besser“ verdeckt Zielkonflikte: Modell A ist genauer, Modell B dafür klarer. Vergleiche auf mehreren Dimensionen gleichzeitig:
annotation_schemes:
- annotation_type: pairwise
name: comparison
description: "Compare the two responses on each dimension."
mode: multi_dimensionEine verpflichtende Begründung macht die Daten nachprüfbar und bringt die Fälle ans Licht, in denen Annotierende das Falsche belohnt haben.
Verzerrungen kontrollieren
Direktvergleichsdaten sind nur so gut wie die Kontrollen gegen Verzerrungen:
- Positionsverzerrung: Lose zufällig aus, welches Modell als „A“ erscheint; sonst bevorzugen Annotierende eine Seite.
- Längen- und Stilverzerrung: Annotierende ziehen längeren oder selbstsicherer klingenden Text oft vor, unabhängig von der Qualität. Benenne das in den Richtlinien.
- Wortfülle ≠ Qualität: Erfasse am besten die Länge mit, damit du prüfen kannst, ob sie die Siege treibt.
- Übereinstimmung: Erhebe Überlappung und verfolge die Inter-Annotator-Übereinstimmung.
Vergleich oder Rubrik
Nimm den paarweisen Vergleich, wenn du eine Rangfolge brauchst und hohe Übereinstimmung willst. Nimm eine Rubrik, wenn du von jedem Modell ein absolutes Profil je Dimension brauchst. Viele Evaluationen fahren beides.