वीडियो एनोटेशन
Potato में वीडियो कैसे एनोटेट करें, फ़्रेम-दर-फ़्रेम नेविगेशन, समय-खंडों की लेबलिंग, प्रति-फ़्रेम वर्गीकरण, और फ़्रेम-दर-फ़्रेम वस्तु ट्रैकिंग।
वीडियो एनोटेशन छवि के काम में समय का एक अक्ष जोड़ देता है। एक ही क्लिप को पूरा मानकर लेबल किया जा सकता है, समय के अंतरालों में बाँटा जा सकता है (“गोल 0:12 से 0:15 के बीच होता है”), या फ़्रेम-दर-फ़्रेम एनोटेट किया जा सकता है। Potato फ़्रेम नेविगेशन और समय के नियंत्रण देता है, जिनसे एनोटेटर क्लिप में ठीक-ठीक जगह पर पहुँच सकते हैं।
वीडियो के कार्य activity recognition और object tracking के केंद्र में हैं।
क्लिप-स्तर का वर्गीकरण
सबसे सीधा कार्य: पूरी क्लिप के लिए एक लेबल।
annotation_schemes:
- annotation_type: radio
name: action
description: "What is the main action in this clip?"
labels: [Walking, Running, Sitting, Jumping, Other]समय-खंड, यानी कुछ घटता कब है
टाइमलाइन पर अंतराल चिह्नित करने के लिए वीडियो के समय-अक्ष पर span इस्तेमाल कीजिए, ठीक वैसे ही जैसे ऑडियो में sound event detection करता है।
annotation_schemes:
- annotation_type: span
name: events
description: "Mark the start and end of each event and label it."
labels: [Goal, Foul, Substitution, Replay]प्रति-फ़्रेम एनोटेशन और ट्रैकिंग
फ़्रेम-स्तर के काम में, चाहे अलग-अलग फ़्रेम का वर्गीकरण हो या किसी वस्तु को फ़्रेमों में पीछा करना, एनोटेटर वीडियो में एक-एक फ़्रेम आगे बढ़ते हैं और हर फ़्रेम पर एनोटेट करते हैं। सैंपलिंग दर तय कीजिए (हर फ़्रेम, हर N-वाँ फ़्रेम, या सिर्फ़ keyframe); हर फ़्रेम को लेबल करना महँगा पड़ता है, इसलिए ज़्यादातर परियोजनाएँ नमूना घटा लेती हैं।
वीडियो एनोटेशन में एकरूपता बनाए रखना
- सीमा की सटीकता। पहले से तय कीजिए कि खंड का आरंभ/अंत कितना सटीक होना चाहिए; फ़्रेम-स्तर की सटीकता महँगी पड़ती है।
- Occlusion और फ़्रेम से बाहर जाना। ट्रैक की जा रही वस्तु के छिप जाने या फ़्रेम से निकल जाने के लिए नियम लिखिए।
- काम का बोझ। वीडियो सबसे ज़्यादा समय खाने वाला माध्यम है, बड़े पैमाने पर जाने से पहले एक pilot चलाकर लागत का अंदाज़ा लगाइए, और लेबल की शुरुआती परत के लिए LLM/vision से पूर्व-एनोटेशन पर विचार कीजिए।
आगे पढ़ें
- ऑडियो एनोटेशन, वही समय-span वाले विचार
- छवि एनोटेशन
- Span एनोटेशन