Skip to content

वीडियो एनोटेशन

Potato में वीडियो कैसे एनोटेट करें, फ़्रेम-दर-फ़्रेम नेविगेशन, समय-खंडों की लेबलिंग, प्रति-फ़्रेम वर्गीकरण, और फ़्रेम-दर-फ़्रेम वस्तु ट्रैकिंग।

वीडियो एनोटेशन छवि के काम में समय का एक अक्ष जोड़ देता है। एक ही क्लिप को पूरा मानकर लेबल किया जा सकता है, समय के अंतरालों में बाँटा जा सकता है (“गोल 0:12 से 0:15 के बीच होता है”), या फ़्रेम-दर-फ़्रेम एनोटेट किया जा सकता है। Potato फ़्रेम नेविगेशन और समय के नियंत्रण देता है, जिनसे एनोटेटर क्लिप में ठीक-ठीक जगह पर पहुँच सकते हैं।

वीडियो के कार्य activity recognition और object tracking के केंद्र में हैं।

क्लिप-स्तर का वर्गीकरण

सबसे सीधा कार्य: पूरी क्लिप के लिए एक लेबल।

yaml
annotation_schemes:
  - annotation_type: radio
    name: action
    description: "What is the main action in this clip?"
    labels: [Walking, Running, Sitting, Jumping, Other]

समय-खंड, यानी कुछ घटता कब है

टाइमलाइन पर अंतराल चिह्नित करने के लिए वीडियो के समय-अक्ष पर span इस्तेमाल कीजिए, ठीक वैसे ही जैसे ऑडियो में sound event detection करता है।

yaml
annotation_schemes:
  - annotation_type: span
    name: events
    description: "Mark the start and end of each event and label it."
    labels: [Goal, Foul, Substitution, Replay]

प्रति-फ़्रेम एनोटेशन और ट्रैकिंग

फ़्रेम-स्तर के काम में, चाहे अलग-अलग फ़्रेम का वर्गीकरण हो या किसी वस्तु को फ़्रेमों में पीछा करना, एनोटेटर वीडियो में एक-एक फ़्रेम आगे बढ़ते हैं और हर फ़्रेम पर एनोटेट करते हैं। सैंपलिंग दर तय कीजिए (हर फ़्रेम, हर N-वाँ फ़्रेम, या सिर्फ़ keyframe); हर फ़्रेम को लेबल करना महँगा पड़ता है, इसलिए ज़्यादातर परियोजनाएँ नमूना घटा लेती हैं।

वीडियो एनोटेशन में एकरूपता बनाए रखना

  • सीमा की सटीकता। पहले से तय कीजिए कि खंड का आरंभ/अंत कितना सटीक होना चाहिए; फ़्रेम-स्तर की सटीकता महँगी पड़ती है।
  • Occlusion और फ़्रेम से बाहर जाना। ट्रैक की जा रही वस्तु के छिप जाने या फ़्रेम से निकल जाने के लिए नियम लिखिए।
  • काम का बोझ। वीडियो सबसे ज़्यादा समय खाने वाला माध्यम है, बड़े पैमाने पर जाने से पहले एक pilot चलाकर लागत का अंदाज़ा लगाइए, और लेबल की शुरुआती परत के लिए LLM/vision से पूर्व-एनोटेशन पर विचार कीजिए।

आगे पढ़ें