Skip to content

मशीन लर्निंग के लिए एनोटेशन एक्सपोर्ट करना

Potato के एनोटेशन को ML के लिए तैयार फ़ॉर्मैट में कैसे एक्सपोर्ट करें, JSON/JSONL, CoNLL, Hugging Face Datasets, spaCy, COCO और YOLO, और हर फ़ॉर्मैट किस काम आता है।

एनोटेशन का मक़सद आम तौर पर किसी मॉडल को प्रशिक्षित करना या उसका मूल्यांकन करना होता है, इसलिए एक्सपोर्ट फ़ॉर्मैट मायने रखता है। Potato सादा JSON/JSONL/CSV लिखता है, और वे ML-मूल फ़ॉर्मैट भी जिन्हें ट्रेनिंग पाइपलाइन सीधे पढ़ लेती हैं, बीच में कोई जोड़-तोड़ वाला कोड लिखे बिना। लेबल लगाने से पहले लक्ष्य फ़ॉर्मैट चुन लेने से यह साफ़ हो जाता है कि डेटा और ID कैसे बनाने हैं।

संदर्भ के लिए निर्यात प्रारूप देखें।

काम के हिसाब से फ़ॉर्मैट चुनें

फ़ॉर्मैटकिस काम के लिए
JSON / JSONLसामान्य इस्तेमाल; हर आइटम के लिए एक रिकॉर्ड। सुरक्षित डिफ़ॉल्ट।
CSVस्प्रेडशीट और वर्गीकरण लेबल का जल्दी विश्लेषण।
CoNLLBIO tag के साथ टोकन-स्तर की sequence labeling (NER, chunking)।
Hugging Face Datasetsसीधे transformers की ट्रेनिंग में लोड करने के लिए।
spaCyspaCy के NER और टेक्स्ट-वर्गीकरण मॉडल प्रशिक्षित करने के लिए।
COCO / YOLOइमेज एनोटेशन से object detection और segmentation।
Parquetबड़े पैमाने पर columnar भंडारण और विश्लेषण। देखें Parquet एक्सपोर्ट

आउटपुट फ़ॉर्मैट तय करना

yaml
output_annotation_dir: "annotation_output/"
output_annotation_format: "jsonl"   # json, csv, conll, ...

एक्सपोर्ट में क्या-क्या आता है

एक सामान्य रिकॉर्ड में आइटम ID, मूल सामग्री, हर एनोटेटर के लेबल, और मेटाडेटा (किसने, कब) होता है। सिर्फ़ एक जोड़-मिलाकर बना लेबल रखने के बजाय सभी एनोटेटर के लेबल रखने से आप सहमति निकाल सकते हैं और बाद में किसी दूसरे तरीक़े से दोबारा जोड़ सकते हैं।

लेबल लगाने से पहले एक्सपोर्ट की योजना बनाएँ

एक्सपोर्ट फ़ॉर्मैट आपके इनपुट डिज़ाइन पर बंदिश लगाता है। Sequence-labeling एक्सपोर्ट के लिए टोकनीकरण एक जैसा चाहिए; COCO/YOLO के लिए इमेज के आयाम चाहिए; Hugging Face के लिए एक स्थिर लेबल सेट चाहिए। मंज़िल पहले तय कर लें, ताकि पूरा अध्ययन दोबारा न चलाना पड़े। देखें एनोटेशन के लिए डेटा फ़ॉर्मैट डिज़ाइन करना

आगे पढ़ें