पॉइंट क्लाउड एनोटेशन टूल की तुलना: ओपन-सोर्स और सशुल्क LiDAR टूल
3D LiDAR एनोटेशन के लिए Potato, CVAT, Supervisely, Segments.ai, Scale, Xtreme1 और SUSTechPOINTS की तुलना, जिसमें फ़ॉर्मैट, क्यूबॉइड, ट्रैकिंग, सेंसर फ़्यूज़न और सहमति शामिल हैं।
ज़्यादातर 3D एनोटेशन टूल क्यूबॉइड बनाते हैं और उन्हें फ़्रेम-दर-फ़्रेम ट्रैक करते हैं, और उनमें फ़र्क़ मुख्य रूप से इस बात का है कि वे कौन-से पॉइंट क्लाउड फ़ॉर्मैट पढ़ते हैं और सेंसर फ़्यूज़न का अलग से पैसा लगता है या नहीं। ज़्यादा तीखा विभाजन मापन का है। यहाँ तुलना किए गए बाक़ी टूल में, जिन्हें 2026-09-24 को जाँचा गया, उनके दस्तावेज़ जिस भी सहमति आँकड़े का वर्णन करते हैं वह 2D प्रकारों तक सीमित है, इसलिए जिस परियोजना को 3D बॉक्स पर संयोग-संशोधित सहमति चाहिए, उसके पास विकल्प कम हैं।
पॉइंट क्लाउड एनोटेशन का अर्थ है विरल और असमान रूप से सैंपल किए गए 3D डेटा पर लेबल लगाना, जो आमतौर पर LiDAR से आता है। 3D पॉइंट क्लाउड कैसे एनोटेट करें एनोटेशन की समस्या को ही देखता है, जिसमें घूर्णन का निरूपण और यह भी शामिल है कि अक्ष-संरेखित सहमति सन्निकटन क्यों भ्रमित करता है। यह पृष्ठ टूल की तुलना करता है।
यह पृष्ठ केवल 3D को कवर करता है। एनोटेशन टूल की तुलना हर डेटा प्रकार को एक ही पृष्ठ पर कवर करता है।
क्षमताएँ आमने-सामने
हर प्रविष्टि 2026-09-24 को उस टूल के अपने दस्तावेज़ों से पढ़ी गई थी। डैश का अर्थ है कि दस्तावेज़ों ने उस क्षमता का वर्णन नहीं किया, जो टूल के उसे अस्वीकार करने के समान नहीं है।
| टूल | पढ़े जाने वाले फ़ॉर्मैट | पॉइंट सेगमेंटेशन | अनुक्रम ट्रैकिंग | सेंसर फ़्यूज़न | लाइसेंस |
|---|---|---|---|---|---|
| Potato | PCD, PLY, KITTI .bin, LAS, XYZ, PTS | हाँ, segment_3d | हाँ | कैमरा कैलिब्रेशन | ओपन सोर्स |
| Segments.ai | PCD, PLY, असंपीड़ित LAS 1.4, KITTI, nuScenes | हाँ | हाँ, प्रक्षेप के साथ | हाँ, 3D से 2D प्रक्षेपण | सशुल्क, Fusion स्तर |
| Supervisely | PCD, PLY, LAS, LAZ | हाँ | हाँ, एपिसोड | फ़ोटो संदर्भ का प्रक्षेपण | Enterprise |
| Scale | API के ज़रिए JSON या protobuf | हाँ, प्रति-पॉइंट श्रेणियाँ | हाँ, फ़्रेम शृंखला | हाँ, पुनःप्रक्षेपण | व्यावसायिक |
| CVAT | Velodyne .bin, PCD | - | हाँ, प्रक्षेपित ट्रैक | प्रासंगिक छवियाँ दिखाई जाती हैं | ओपन सोर्स |
| Xtreme1 | PCD | दावा किया गया, कार्यप्रवाह प्रलेखित नहीं | हाँ, फ़्रेम शृंखला | हाँ, 2D और 3D फ़्यूज़न | Apache 2.0 |
| SUSTechPOINTS | .bin, PCD | - | - | कई कैमरा छवियाँ | GPL-3.0 |
| labelCloud | PCD, PLY, PTS, XYZ, BIN | केवल बॉक्स-आधारित | - | - | GPL-3.0 |
| point_labeler | KITTI .bin | हाँ, बिंदुवार | बहु-स्कैन टाइल | संदर्भ छवियाँ | MIT |
| Label Studio | ओपन-सोर्स टैग संदर्भ में कोई पॉइंट-क्लाउड ऑब्जेक्ट टैग नहीं | - | - | - | Enterprise इंटरफ़ेस |
| Labelbox | दस्तावेज़ों में कोई पॉइंट-क्लाउड संपादक नहीं | - | - | - | - |
| V7 | कोई पॉइंट-क्लाउड फ़ॉर्मैट सूचीबद्ध नहीं | - | - | - | - |
LAZ वह फ़ॉर्मैट है जो सबसे अधिक बार रूपांतरण का एक अतिरिक्त चरण थोप देता है। Supervisely इसे सीधे पढ़ता है। Segments.ai के दस्तावेज़ केवल असंपीड़ित LAS 1.4 सूचीबद्ध करते हैं, और Potato कहता है कि LAZ फ़ाइल को पहले laszip से खोलें या laspy[laszip] संस्थापित करें।
3D लेबल पर सहमति
यहाँ तीन टूल कोई सहमति आँकड़ा देते हैं, और तीनों उसे 2D तक सीमित रखते हैं। CVAT के दस्तावेज़ स्पष्ट हैं, जिनमें कहा गया है कि "गुणवत्ता आकलन केवल 2d कार्यों का समर्थन करता है" ("quality estimation only supports 2d tasks") और यह कि वह "2d क्यूबॉइड को छोड़कर सभी एनोटेशन प्रकारों का समर्थन करता है" ("supports all the annotation types except 2d cuboids")। Supervisely की लेबलिंग सर्वसम्मति बाउंडिंग बॉक्स, मास्क, बहुभुज तथा छवि या ऑब्जेक्ट टैग के साथ काम करती है, और उसका स्कोर संयोग-संशोधित गुणांक के बजाय 0 से 100 प्रतिशत की युग्मवार समानता है। Labelbox की सर्वसम्मति समर्थन तालिका में छवि, वीडियो, पाठ, चैट, ऑडियो, भू-स्थानिक, दस्तावेज़ और HTML प्रकार सूचीबद्ध हैं, कोई 3D प्रविष्टि नहीं।
बाक़ी टूल के दस्तावेज़ 3D लेबल पर एनोटेटर-सहमति का उल्लेख नहीं करते। इसे दस्तावेज़ों की अनुपस्थिति मानें, कोड के बारे में कोई कथन नहीं।
यह अंतर इसलिए मायने रखता है क्योंकि ज्यामिति पर सहमति वही समस्या नहीं है जो लेबल पर सहमति है। दो एनोटेटर जो दोनों एक कार को चिह्नित करते हैं, वे श्रेणीगत रूप से नहीं बल्कि मात्रा में असहमत होते हैं, इसलिए माप को पहले बॉक्स एक-दूसरे से मिलाने होंगे और फिर पूछना होगा कि बची हुई भिन्नता संयोग से अधिक है या नहीं। Potato यह गणना सटीक घूर्णित 3D IoU का उपयोग करके 3D बॉक्स पर करता है। पॉइंट क्लाउड मार्गदर्शिका इसी कारण अक्ष-संरेखित सन्निकटन के विरुद्ध चेतावनी देती है, क्योंकि सन्निकटन ऐसी असहमति बताता है जो माप की ही उपज है।
सेंसर फ़्यूज़न और उसकी क़ीमत
पॉइंट क्लाउड और कैमरा छवियों के बीच लेबल प्रक्षेपित करना वह तरीक़ा है जिससे एनोटेटर ऐसे काम की जाँच करता है जो पक्षी-दृष्टि में सही दिखता है और दृष्टि-अक्ष के साथ कई मीटर हटा हुआ होता है। यह क्षमता आम है और उससे जुड़ी क़ीमत में बहुत अंतर है।
Segments.ai 3D क्यूबॉइड को कैमरा फ़्रेम पर स्वतः प्रक्षेपित करता है और सेंसरों के बीच ट्रैक ID बनाए रखता है, जबकि सेंसर फ़्यूज़न उसके Fusion स्तर तक सीमित है। Supervisely एक एपिसोड के हर फ़्रेम में फ़ोटो-संदर्भ के रंग 3D बिंदुओं पर प्रक्षेपित करता है, जहाँ 3D LiDAR और सेंसर फ़्यूज़न Enterprise के अंतर्गत सूचीबद्ध हैं और कई सहायक टूल Cloud Max ऐड-ऑन के पीछे हैं। Scale क्यूबॉइड को 2D कैमरा दृश्यों में पुनःप्रक्षेपित करता है और उन प्रक्षेपणों को ठीक करने के लिए Lidar Linking नामक कार्य-प्रकार देता है। CVAT क्लाउड के साथ प्रासंगिक छवियाँ दिखाता है, और उसके दस्तावेज़ दोनों के बीच लेबल प्रक्षेपित करने का वर्णन नहीं करते।
Potato प्रति आइटम कैमरा कैलिब्रेशन लेता है, ताकि हर 3D बॉक्स छवियों में प्रक्षेपित हो और 2D में जाँचा जा सके, यानी वही सत्यापन चरण, बिना किसी स्तर के।
ओपन-सोर्स विकल्प
यहाँ के कई टूल ओपन सोर्स हैं और मुफ़्त में स्वयं-होस्ट किए जा सकते हैं, और वे अलग-अलग कामों के लिए उपयुक्त हैं। CVAT सबसे पूर्ण सामान्य प्लेटफ़ॉर्म है, जिसमें क्यूबॉइड और प्रक्षेपित ट्रैक हैं। Xtreme1 Apache 2.0 है, इसमें 2D और 3D फ़्यूज़न तथा फ़्रेम-शृंखला टूल है, और यह केवल .pcd पढ़ता है। SUSTechPOINTS GPL-3.0 है और स्वचालित कैमरा-परिवर्तन के साथ 9 स्वातंत्र्य-कोटियों वाले बॉक्स संपादन पर केंद्रित है। point_labeler MIT है और वही टूल है जिससे SemanticKITTI को लेबल किया गया था; यह बॉक्स के बजाय KITTI अनुक्रमों पर बिंदुवार सिमेंटिक और इंस्टेंस लेबलिंग करता है।
Label Studio की स्थिति को सावधानी से कहना ज़रूरी है। उसके ओपन-सोर्स टैग संदर्भ में कोई पॉइंट-क्लाउड ऑब्जेक्ट टैग सूचीबद्ध नहीं है, और LiDAR एक Enterprise इंटरफ़ेस के रूप में दिया जाता है जिसका वर्णन संदर्भ दस्तावेज़ों के बजाय HumanSignal के ब्लॉग और प्रेस सामग्री में है।
Potato में एक 3D कार्य
Potato के 3D टूल cuboid_3d, point_3d, polyline_3d और segment_3d हैं, जिनमें से अंतिम लेबल को सीधे बिंदुओं पर पोतता है।
annotation_schemes:
- annotation_type: spatial_annotation
name: traffic_objects
description: "Draw a 3D box around each vehicle and pedestrian"
tools:
- cuboid_3d
labels:
- car
- pedestrian
- cyclisttools यह चुनता है कि एनोटेटर को कौन-से ड्रॉइंग मोड मिलेंगे, इसलिए जिस कार्य में केवल बॉक्स चाहिए, वहाँ बिंदु पोतने का विकल्प नहीं आता। विस्तार-स्तर आधारित रेंडरिंग डिफ़ॉल्ट रूप से चालू है, और यही चीज़ कई लाख बिंदुओं वाले क्लाउड को ब्राउज़र में चलने योग्य रखती है।
अक्सर पूछे जाने वाले प्रश्न
नीचे दिए प्रश्न उन खोजों से मेल खाते हैं जो साइट को पॉइंट क्लाउड एनोटेशन के लिए पहले से मिल रही हैं।
पॉइंट क्लाउड एनोटेशन के लिए कौन-सा टूल चुनें?
ड्रॉइंग टूल के बजाय फ़ॉर्मैट और मापन के आधार पर चुनें, क्योंकि यहाँ हर टूल क्यूबॉइड बनाता है। अगर आपका डेटा LAZ है, तो Supervisely उसे बिना रूपांतरण के पढ़ लेता है। अगर आपको बिना अतिरिक्त स्तर के सेंसर फ़्यूज़न चाहिए, तो CVAT प्रासंगिक छवियाँ दिखाता है और Potato बॉक्स को कैलिब्रेटेड कैमरा दृश्यों में प्रक्षेपित करता है। अगर आपको 3D बॉक्स पर एनोटेटरों के बीच सहमति बतानी है, तो जाँचें कि टूल लेबल के बजाय ज्यामिति मापता है या नहीं, क्योंकि इस तुलना में प्रलेखित सहमति सुविधाएँ 2D तक सीमित हैं।
क्या 3D पॉइंट क्लाउड एनोटेशन के लिए कोई ओपन-सोर्स टूल है?
हाँ, और अलग-अलग ख़ूबियों वाले कई टूल हैं। CVAT, Xtreme1 (Apache 2.0), SUSTechPOINTS (GPL-3.0), labelCloud (GPL-3.0), point_labeler (MIT) और Potato, ये सभी मुफ़्त में स्वयं-होस्ट किए जा सकते हैं। point_labeler बॉक्स-आधारित के बजाय बिंदुवार है और इसी से SemanticKITTI को लेबल किया गया था, जबकि बाक़ी क्यूबॉइड पर केंद्रित हैं।
आगे पढ़ें
- 3D पॉइंट क्लाउड कैसे एनोटेट करें फ़ॉर्मैट, कैलिब्रेशन और घूर्णित 3D IoU को देखता है।
- बाउंडिंग बॉक्स पर सहमति मापना 2D स्थिति को देखता है।
- एनोटेशन टूल की तुलना हर डेटा प्रकार को एक ही पृष्ठ पर कवर करता है।
प्रत्येक परियोजना के दस्तावेज़ों, मूल्य पृष्ठ और रिपॉज़िटरी के विरुद्ध 2026-09-24 को जाँचा गया। अगर तालिका का कोई ख़ाना ग़लत है, तो हमें बताएँ।