Skip to content

Video-Annotation

Wie du Video in Potato annotierst: Navigation Bild für Bild, zeitliche Segmente labeln, Klassifikation je Frame und Objekte über Frames hinweg verfolgen.

Video-Annotation ergänzt die Arbeit am Bild um eine Zeitachse. Derselbe Clip lässt sich als Ganzes labeln, in Zeitintervalle zerlegen (das Tor fällt zwischen 0:12 und 0:15) oder Frame für Frame annotieren. Potato bietet dafür eine Frame-Navigation und zeitliche Bedienelemente, mit denen sich Annotierende genau durch einen Clip bewegen.

Videoaufgaben stehen im Zentrum der Aktivitätserkennung und der Objektverfolgung.

Klassifikation auf Clip-Ebene

Die einfachste Aufgabe: ein Label für den ganzen Clip.

yaml
annotation_schemes:
  - annotation_type: radio
    name: action
    description: "What is the main action in this clip?"
    labels: [Walking, Running, Sitting, Jumping, Other]

Zeitliche Segmente, wann etwas passiert

Um Intervalle auf der Zeitleiste zu markieren, nimm einen Span über die Zeitachse des Videos, genau wie es die Erkennung von Klangereignissen für Audio tut.

yaml
annotation_schemes:
  - annotation_type: span
    name: events
    description: "Mark the start and end of each event and label it."
    labels: [Goal, Foul, Substitution, Replay]

Annotation je Frame und Objektverfolgung

Für die Arbeit auf Frame-Ebene, also einzelne Frames klassifizieren oder ein Objekt über Frames hinweg verfolgen, gehen die Annotierenden das Video schrittweise durch und annotieren bei jedem Frame. Leg eine Abtastrate fest (jeder Frame, jeder N-te Frame oder nur Keyframes); jeden einzelnen Frame zu labeln ist teuer, deshalb nehmen die meisten Projekte nur eine Auswahl.

Video-Annotation konsistent halten

  • Genauigkeit der Grenzen. Einigt euch, wie exakt Anfang und Ende eines Segments sitzen müssen; Genauigkeit auf Frame-Ebene kostet.
  • Verdeckung und Verlassen des Bilds. Schreib Regeln dafür, was gilt, wenn ein verfolgtes Objekt verdeckt wird oder aus dem Bild läuft.
  • Aufwand. Video ist die zeitaufwendigste Modalität. Mach einen Pilotlauf, um die Kosten abzuschätzen, bevor du hochskalierst, und zieh Vorannotation mit LLMs und Vision-Modellen in Betracht, um erste Labels zu setzen.

Weiterführende Lektüre