वर्ल्ड मॉडल और रोबोट एपिसोड मूल्यांकन टूल की तुलना
जनरेट किए गए वीडियो, वर्ल्ड मॉडल और रोबोट एपिसोड के मूल्यांकन में इस्तेमाल होने वाले बेंचमार्क, विज़ुअलाइज़र और एनोटेशन टूल: VBench, WorldModelBench, Physics-IQ, ATLAS, Rerun और Potato।
वर्ल्ड मॉडल और वीडियो जनरेटर का मूल्यांकन VBench, WorldModelBench और Physics-IQ जैसे बेंचमार्क से होता है, जो तय करते हैं कि क्या मापना है और अपने-आप स्कोर करने वाले मूल्यांकक देते हैं। इन मूल्यांककों को मानव निर्णयों से जाँचा जाता है। ऐसे मानव निर्णय जुटाना जिनका बचाव किया जा सके, जिनमें रेटर को मॉडल का पता न हो और उनकी सहमति रिपोर्ट हो, एनोटेशन का काम है। Potato में जनरेट किए गए रोलआउट का आकलन करने और रोबोट एपिसोड को सेगमेंट करने की स्कीमें हैं।
वर्ल्ड मॉडल अनुमान लगाता है कि कोई दृश्य कैसे बदलेगा, अक्सर किसी क्रिया के आधार पर, और वीडियो जनरेशन मॉडल का मूल्यांकन वर्ल्ड मॉडल की तरह यह पूछकर किया जा सकता है कि उसका आउटपुट भौतिकी का पालन करता है या नहीं और उसे दिए गए निर्देश को मानता है या नहीं। रोलआउट एक जनरेट की गई निरंतरता है। रोबोट एपिसोड किसी कार्य को पूरा करने की एक कोशिश की रिकॉर्डिंग है, आम तौर पर कई कैमरा स्ट्रीम के साथ जोड़ों की स्थिति, ग्रिपर की अवस्था और दूसरे संकेत।
यह पेज वर्ल्ड मॉडल, जनरेट किए गए वीडियो और रोबोटिक्स के बारे में है। सभी डेटा प्रकारों की एक पेज पर तुलना AI एनोटेशन टूल की तुलना में है।
हर टूल क्या करता है
| टूल | यह क्या है | इंसान कहाँ शामिल होते हैं |
|---|---|---|
| VBench | वीडियो जनरेशन के लिए बेंचमार्क सूट, Apache-2.0 | हर आयाम के लिए मानव पसंद के एनोटेशन, यह जाँचने के लिए कि अपने-आप मिले स्कोर इंसानों से मेल खाते हैं |
| WorldModelBench | वर्ल्ड मॉडल के रूप में वीडियो जनरेटर का बेंचमार्क | क्राउडसोर्सिंग से जुटाए गए 67,000 मानव लेबल, जिनसे एक स्वचालित जज भी ट्रेन किया गया |
| Physics-IQ | जनरेटिव वीडियो में भौतिक समझ का बेंचमार्क, Google DeepMind से | एक स्कोर और एक लीडरबोर्ड |
| ATLAS | लंबी अवधि की क्रियाओं के सेगमेंटेशन का डेस्कटॉप टूल, ROS bag और RLDS सपोर्ट के साथ | हर एपिसोड पर एक एनोटेटर |
| Rerun, Foxglove | रोबोटिक्स विज़ुअलाइज़ेशन | देखने के लिए, लेबलिंग अध्ययनों के लिए नहीं |
| ELAN, BORIS | वीडियो में व्यवहार कोडिंग | ELAN इंटर-एनोटेटर विश्वसनीयता रिपोर्ट करता है |
| CVAT, Label Studio | सामान्य वीडियो एनोटेशन | ट्रैक और टाइमलाइन लेबल, वर्ल्ड मॉडल के लिए कोई स्कीम नहीं |
| Potato | rollout_evaluation और episode_annotation स्कीम वाला एनोटेशन टूल | हर आइटम पर कई एनोटेटर, ब्लाइंड पैनल, रिपोर्ट की गई सहमति |
बेंचमार्क प्रोटोकॉल तय करते हैं
VBench टेक्स्ट-से-वीडियो मॉडलों को 16 आयामों पर स्कोर करता है, जिनमें विषय की निरंतरता, गति की सहजता और स्थानिक संबंध शामिल हैं। VBench-2.0 सामान्य समझ, भौतिकी, मानव गति और संरचना पर 18 आयाम जोड़ता है। हर आयाम के लिए लेखकों ने मानव पसंद के एनोटेशन जुटाए और दिखाया कि अपने-आप मिले स्कोर उनके साथ चलते हैं।
WorldModelBench वीडियो जनरेटर का मूल्यांकन निर्देश-पालन और भौतिकी के पालन पर करता है, और ऐसे उल्लंघन पकड़ता है जैसे किसी वस्तु का द्रव्यमान संरक्षण के ख़िलाफ़ आकार बदल लेना। लेखकों ने 14 अग्रणी मॉडलों के मूल्यांकन के लिए क्राउडसोर्सिंग से 67,000 मानव लेबल जुटाए, फिर 2 अरब पैरामीटर वाले एक जज को फ़ाइन-ट्यून किया जो वर्ल्ड-मॉडलिंग उल्लंघनों का अनुमान GPT-4o से 8.6% ज़्यादा सटीकता से लगाता है (arXiv 2502.20694)।
Physics-IQ ठोस यांत्रिकी, द्रव गतिकी, प्रकाशिकी, ऊष्मागतिकी और चुंबकत्व को कवर करता है। Sora, Runway, Pika, Lumiere, Stable Video Diffusion और VideoPoet को परखने पर इसके लेखकों ने पाया कि भौतिक समझ बहुत सीमित है और दृश्य यथार्थ से इसका कोई संबंध नहीं (arXiv 2501.09038)।
मेट्रिक और संदर्भ प्रोटोकॉल के लिए इन्हीं का इस्तेमाल करें। किसी भी नतीजे की तुलना इन्हीं से होगी।
मानव निर्णय कहाँ आता है
VBench अपने आयामों को सत्यापित करने के लिए मानव निर्णयों का इस्तेमाल करता है, और WorldModelBench अपने जज को ट्रेन करने के लिए। जब आप अपने मॉडल का मूल्यांकन करते हैं, तो हर नए चेकपॉइंट के लिए मानव वाला हिस्सा दोहराना पड़ता है। और तब उसमें किसी भी एनोटेशन अध्ययन की समस्याएँ होती हैं: रेटर जिन्हें पता है कि कौन-सा वीडियो किस मॉडल ने बनाया, रेटर जो इस पर असहमत हैं कि उल्लंघन किसे माना जाए, और सहमति का कोई आँकड़ा नहीं जो दिखाए कि लेबल भरोसे लायक़ हैं।
Potato में जनरेट किए गए रोलआउट का आकलन
rollout_evaluation स्कीम एक साझा घड़ी पर दो या ज़्यादा रोलआउट दिखाती है। एनोटेटर उस फ़्रेम को चिह्नित करता है जहाँ दुनिया का तर्क टूट जाता है, बताता है कि कौन-सा भौतिक या कारण-संबंधी गुण टूटा, रूब्रिक के आधार पर अपनी पसंद बताता है, और रेट करता है कि हस्तक्षेप को देखते हुए कोई प्रतितथ्यात्मक विचलन संभव है या नहीं। पैनल ब्लाइंड किए जा सकते हैं और हर एनोटेटर के लिए स्थिर क्रम में फेंटे जा सकते हैं, ताकि पेज दोबारा लोड करने से यह पता न चले कि कौन-सा मॉडल कौन-सा है।
टूटने के बिंदु पर सहमति तीन तरह से रिपोर्ट होती है: क्या एनोटेटरों ने कोई टूटन पहचानी, उन्होंने उसे कहाँ रखा, और उसे कौन-सी श्रेणी दी। मिलान की सहनशीलता एक अकेली सीमा के बजाय कई मानों पर स्वीप के रूप में दिखाई जाती है।
annotation_schemes:
- annotation_type: rollout_evaluation
name: rollout_review
description: "Where does each rollout stop making sense?"
streams:
- {field: real, name: "Recording", role: real}
- {field: gen_a, name: "Model A"}
- {field: gen_b, name: "Model B"}
fps: 25
layers: [violations, preference, counterfactual]
blind: true
shuffle: true
require_clean: truerequire_clean "कोई टूटन नहीं" को एक स्पष्ट उत्तर बनाता है, ताकि जिस रोलआउट को किसी ने चिह्नित नहीं किया उसे उस रोलआउट से अलग किया जा सके जिसे किसी ने पूरा देखा ही नहीं। देखें जनरेट किए गए वीडियो और वर्ल्ड मॉडल का मूल्यांकन कैसे करें।
रोबोट एपिसोड एनोटेट करना
episode_annotation स्कीम कई सिंक किए गए वीडियो स्ट्रीम और रोबोट की टाइम-सीरीज़ लेन (जोड़ों की स्थिति, ग्रिपर की अवस्था, बल-बलाघूर्ण, रिवॉर्ड) को एक टाइमलाइन पर रखती है। एनोटेटर चरणों को सेगमेंट करते हैं, हर चरण का नतीजा चिह्नित करते हैं, एक सघन प्रगति रिवॉर्ड बनाते हैं, और निर्देश को बाद में दोबारा लिखते हैं। Potato LeRobot v2, HDF5 (RoboMimic और ALOHA) और RLDS/TFDS इम्पोर्ट करता है, और हर फ़्रेम के लिए एक JSONL सहायक फ़ाइल लिखता है, ताकि केवल-पढ़ने वाले सार्वजनिक डेटासेट को दोबारा न लिखना पड़े।
सहमति चरण-सीमाओं के लिए टेम्पोरल IoU, नतीजे के लेबल के लिए α, और रिवॉर्ड कर्व के लिए Pearson सहसंबंध के साथ ICC के रूप में रिपोर्ट होती है, कवरेज बताते हुए, क्योंकि किसी टाइमलाइन के 5% पर निकाला गया सहसंबंध बाक़ी हिस्से के बारे में कुछ नहीं बताता।
TU Wien का ATLAS लंबी अवधि की क्रियाओं के सेगमेंटेशन का डेस्कटॉप टूल है जो ROS bag और RLDS सीधे पढ़ता है। सीमाएँ सटीकता से रखने वाले अकेले एनोटेटर के लिए यह ख़ास इसी काम के लिए बना है। इसका प्रकाशित नतीजा, कि वीडियो के साथ प्रोप्रियोसेप्टिव टाइम-सीरीज़ दिखाने से केवल वीडियो की तुलना में सीमा की त्रुटि घटती है, वही कारण है जिससे Potato ये लेन दिखाता है। Rerun और Foxglove रोबोटिक्स के सबसे अच्छे विज़ुअलाइज़ेशन टूल हैं, और व्यवहार कोडिंग के लिए ELAN और BORIS अब भी मानक हैं। देखें रोबोट एपिसोड कैसे एनोटेट करें।
विज़न-लैंग्वेज मॉडल के ग्राउंडिंग और पॉइंटिंग मूल्यांकन के लिए देखें VLM ग्राउंडिंग का मूल्यांकन।
यहाँ Potato क्या नहीं करता
- कोई स्वचालित भौतिकी मूल्यांकक नहीं। उसके लिए किसी बेंचमार्क का मूल्यांकक इस्तेमाल करें, और उसे सत्यापित करने वाले मानव लेबल के लिए Potato।
- कोई मॉडल ट्रेनिंग या इन्फ़रेंस नहीं। Potato वे रोलआउट दिखाता है जो आपने जनरेट किए।
- पॉइंट-क्लाउड सीक्वेंस नहीं। 3D एनोटेशन फ़्रेम-दर-फ़्रेम होता है।
हर प्रोजेक्ट की रिपॉज़िटरी और पेपर से अगस्त और सितंबर 2026 में जाँचा गया।
अक्सर पूछे जाने वाले प्रश्न
वर्ल्ड मॉडल का मूल्यांकन कैसे होता है?
ऐसे बेंचमार्क से जो जनरेट किए गए वीडियो को भौतिकी के पालन, निर्देश-पालन और दृश्य गुणवत्ता पर स्कोर करते हैं, जैसे VBench, WorldModelBench और Physics-IQ, और ऐसे मानव निर्णयों से जो इन मूल्यांककों को सत्यापित या ट्रेन करते हैं। किसी नए मॉडल के लिए मानव वाला हिस्सा यह है कि लोग रोलआउट देखें, चिह्नित करें कि वे कहाँ भौतिक रूप से बेतुके हो जाते हैं, और उनकी तुलना करें, बिना यह जाने कि उन्हें किस मॉडल ने बनाया।
कौन-से वर्ल्ड-मॉडल बेंचमार्क मानव निर्णयों का इस्तेमाल करते हैं?
VBench ने अपने हर आयाम के लिए मानव पसंद के एनोटेशन जुटाए, यह दिखाने के लिए कि उसके स्वचालित स्कोर इंसानों से मेल खाते हैं। WorldModelBench ने 14 मॉडलों पर क्राउडसोर्सिंग से 67,000 मानव लेबल जुटाए और उनसे एक स्वचालित जज को फ़ाइन-ट्यून किया।
रोबोट एपिसोड एनोटेट करने के लिए कौन-सा टूल इस्तेमाल करूँ?
ATLAS एक डेस्कटॉप टूल है जिससे एक एनोटेटर ROS bag या RLDS से लंबे एपिसोड सेगमेंट करता है। Potato कई एनोटेटरों के लिए ब्राउज़र में एपिसोड एनोटेट करता है, LeRobot v2, HDF5 और RLDS/TFDS इम्पोर्ट करता है, और चरण-सीमाओं, नतीजों और रिवॉर्ड कर्व पर सहमति रिपोर्ट करता है।
जनरेट किए गए वीडियो का आकलन करने वाले लोगों के बीच सहमति कैसे मापूँ?
हर रोलआउट का आकलन कम से कम दो ऐसे रेटरों से करवाएँ जिन्हें यह न पता हो कि उसे किस मॉडल ने बनाया। रिपोर्ट करें कि वे इस पर सहमत हैं या नहीं कि वह टूटता है, कई सहनशीलताओं पर उनके टूटन-बिंदु कितने पास हैं, और क्या वे एक ही श्रेणी देते हैं। Potato का rollout_evaluation इन तीनों को अलग-अलग रिपोर्ट करता है।