मशीन लर्निंग के लिए एनोटेशन एक्सपोर्ट करना
Potato के एनोटेशन को ML के लिए तैयार फ़ॉर्मैट में कैसे एक्सपोर्ट करें, JSON/JSONL, CoNLL, Hugging Face Datasets, spaCy, COCO और YOLO, और हर फ़ॉर्मैट किस काम आता है।
एनोटेशन का मक़सद आम तौर पर किसी मॉडल को प्रशिक्षित करना या उसका मूल्यांकन करना होता है, इसलिए एक्सपोर्ट फ़ॉर्मैट मायने रखता है। Potato सादा JSON/JSONL/CSV लिखता है, और वे ML-मूल फ़ॉर्मैट भी जिन्हें ट्रेनिंग पाइपलाइन सीधे पढ़ लेती हैं, बीच में कोई जोड़-तोड़ वाला कोड लिखे बिना। लेबल लगाने से पहले लक्ष्य फ़ॉर्मैट चुन लेने से यह साफ़ हो जाता है कि डेटा और ID कैसे बनाने हैं।
संदर्भ के लिए निर्यात प्रारूप देखें।
काम के हिसाब से फ़ॉर्मैट चुनें
| फ़ॉर्मैट | किस काम के लिए |
|---|---|
| JSON / JSONL | सामान्य इस्तेमाल; हर आइटम के लिए एक रिकॉर्ड। सुरक्षित डिफ़ॉल्ट। |
| CSV | स्प्रेडशीट और वर्गीकरण लेबल का जल्दी विश्लेषण। |
| CoNLL | BIO tag के साथ टोकन-स्तर की sequence labeling (NER, chunking)। |
| Hugging Face Datasets | सीधे transformers की ट्रेनिंग में लोड करने के लिए। |
| spaCy | spaCy के NER और टेक्स्ट-वर्गीकरण मॉडल प्रशिक्षित करने के लिए। |
| COCO / YOLO | इमेज एनोटेशन से object detection और segmentation। |
| Parquet | बड़े पैमाने पर columnar भंडारण और विश्लेषण। देखें Parquet एक्सपोर्ट। |
आउटपुट फ़ॉर्मैट तय करना
output_annotation_dir: "annotation_output/"
output_annotation_format: "jsonl" # json, csv, conll, ...एक्सपोर्ट में क्या-क्या आता है
एक सामान्य रिकॉर्ड में आइटम ID, मूल सामग्री, हर एनोटेटर के लेबल, और मेटाडेटा (किसने, कब) होता है। सिर्फ़ एक जोड़-मिलाकर बना लेबल रखने के बजाय सभी एनोटेटर के लेबल रखने से आप सहमति निकाल सकते हैं और बाद में किसी दूसरे तरीक़े से दोबारा जोड़ सकते हैं।
लेबल लगाने से पहले एक्सपोर्ट की योजना बनाएँ
एक्सपोर्ट फ़ॉर्मैट आपके इनपुट डिज़ाइन पर बंदिश लगाता है। Sequence-labeling एक्सपोर्ट के लिए टोकनीकरण एक जैसा चाहिए; COCO/YOLO के लिए इमेज के आयाम चाहिए; Hugging Face के लिए एक स्थिर लेबल सेट चाहिए। मंज़िल पहले तय कर लें, ताकि पूरा अध्ययन दोबारा न चलाना पड़े। देखें एनोटेशन के लिए डेटा फ़ॉर्मैट डिज़ाइन करना।