Skip to content

वर्ल्ड मॉडल और रोबोट एपिसोड मूल्यांकन टूल की तुलना

जनरेट किए गए वीडियो, वर्ल्ड मॉडल और रोबोट एपिसोड के मूल्यांकन में इस्तेमाल होने वाले बेंचमार्क, विज़ुअलाइज़र और एनोटेशन टूल: VBench, WorldModelBench, Physics-IQ, ATLAS, Rerun और Potato।

वर्ल्ड मॉडल और वीडियो जनरेटर का मूल्यांकन VBench, WorldModelBench और Physics-IQ जैसे बेंचमार्क से होता है, जो तय करते हैं कि क्या मापना है और अपने-आप स्कोर करने वाले मूल्यांकक देते हैं। इन मूल्यांककों को मानव निर्णयों से जाँचा जाता है। ऐसे मानव निर्णय जुटाना जिनका बचाव किया जा सके, जिनमें रेटर को मॉडल का पता न हो और उनकी सहमति रिपोर्ट हो, एनोटेशन का काम है। Potato में जनरेट किए गए रोलआउट का आकलन करने और रोबोट एपिसोड को सेगमेंट करने की स्कीमें हैं।

वर्ल्ड मॉडल अनुमान लगाता है कि कोई दृश्य कैसे बदलेगा, अक्सर किसी क्रिया के आधार पर, और वीडियो जनरेशन मॉडल का मूल्यांकन वर्ल्ड मॉडल की तरह यह पूछकर किया जा सकता है कि उसका आउटपुट भौतिकी का पालन करता है या नहीं और उसे दिए गए निर्देश को मानता है या नहीं। रोलआउट एक जनरेट की गई निरंतरता है। रोबोट एपिसोड किसी कार्य को पूरा करने की एक कोशिश की रिकॉर्डिंग है, आम तौर पर कई कैमरा स्ट्रीम के साथ जोड़ों की स्थिति, ग्रिपर की अवस्था और दूसरे संकेत।

यह पेज वर्ल्ड मॉडल, जनरेट किए गए वीडियो और रोबोटिक्स के बारे में है। सभी डेटा प्रकारों की एक पेज पर तुलना AI एनोटेशन टूल की तुलना में है।

हर टूल क्या करता है

टूलयह क्या हैइंसान कहाँ शामिल होते हैं
VBenchवीडियो जनरेशन के लिए बेंचमार्क सूट, Apache-2.0हर आयाम के लिए मानव पसंद के एनोटेशन, यह जाँचने के लिए कि अपने-आप मिले स्कोर इंसानों से मेल खाते हैं
WorldModelBenchवर्ल्ड मॉडल के रूप में वीडियो जनरेटर का बेंचमार्कक्राउडसोर्सिंग से जुटाए गए 67,000 मानव लेबल, जिनसे एक स्वचालित जज भी ट्रेन किया गया
Physics-IQजनरेटिव वीडियो में भौतिक समझ का बेंचमार्क, Google DeepMind सेएक स्कोर और एक लीडरबोर्ड
ATLASलंबी अवधि की क्रियाओं के सेगमेंटेशन का डेस्कटॉप टूल, ROS bag और RLDS सपोर्ट के साथहर एपिसोड पर एक एनोटेटर
Rerun, Foxgloveरोबोटिक्स विज़ुअलाइज़ेशनदेखने के लिए, लेबलिंग अध्ययनों के लिए नहीं
ELAN, BORISवीडियो में व्यवहार कोडिंगELAN इंटर-एनोटेटर विश्वसनीयता रिपोर्ट करता है
CVAT, Label Studioसामान्य वीडियो एनोटेशनट्रैक और टाइमलाइन लेबल, वर्ल्ड मॉडल के लिए कोई स्कीम नहीं
Potatorollout_evaluation और episode_annotation स्कीम वाला एनोटेशन टूलहर आइटम पर कई एनोटेटर, ब्लाइंड पैनल, रिपोर्ट की गई सहमति

बेंचमार्क प्रोटोकॉल तय करते हैं

VBench टेक्स्ट-से-वीडियो मॉडलों को 16 आयामों पर स्कोर करता है, जिनमें विषय की निरंतरता, गति की सहजता और स्थानिक संबंध शामिल हैं। VBench-2.0 सामान्य समझ, भौतिकी, मानव गति और संरचना पर 18 आयाम जोड़ता है। हर आयाम के लिए लेखकों ने मानव पसंद के एनोटेशन जुटाए और दिखाया कि अपने-आप मिले स्कोर उनके साथ चलते हैं।

WorldModelBench वीडियो जनरेटर का मूल्यांकन निर्देश-पालन और भौतिकी के पालन पर करता है, और ऐसे उल्लंघन पकड़ता है जैसे किसी वस्तु का द्रव्यमान संरक्षण के ख़िलाफ़ आकार बदल लेना। लेखकों ने 14 अग्रणी मॉडलों के मूल्यांकन के लिए क्राउडसोर्सिंग से 67,000 मानव लेबल जुटाए, फिर 2 अरब पैरामीटर वाले एक जज को फ़ाइन-ट्यून किया जो वर्ल्ड-मॉडलिंग उल्लंघनों का अनुमान GPT-4o से 8.6% ज़्यादा सटीकता से लगाता है (arXiv 2502.20694)।

Physics-IQ ठोस यांत्रिकी, द्रव गतिकी, प्रकाशिकी, ऊष्मागतिकी और चुंबकत्व को कवर करता है। Sora, Runway, Pika, Lumiere, Stable Video Diffusion और VideoPoet को परखने पर इसके लेखकों ने पाया कि भौतिक समझ बहुत सीमित है और दृश्य यथार्थ से इसका कोई संबंध नहीं (arXiv 2501.09038)।

मेट्रिक और संदर्भ प्रोटोकॉल के लिए इन्हीं का इस्तेमाल करें। किसी भी नतीजे की तुलना इन्हीं से होगी।

मानव निर्णय कहाँ आता है

VBench अपने आयामों को सत्यापित करने के लिए मानव निर्णयों का इस्तेमाल करता है, और WorldModelBench अपने जज को ट्रेन करने के लिए। जब आप अपने मॉडल का मूल्यांकन करते हैं, तो हर नए चेकपॉइंट के लिए मानव वाला हिस्सा दोहराना पड़ता है। और तब उसमें किसी भी एनोटेशन अध्ययन की समस्याएँ होती हैं: रेटर जिन्हें पता है कि कौन-सा वीडियो किस मॉडल ने बनाया, रेटर जो इस पर असहमत हैं कि उल्लंघन किसे माना जाए, और सहमति का कोई आँकड़ा नहीं जो दिखाए कि लेबल भरोसे लायक़ हैं।

Potato में जनरेट किए गए रोलआउट का आकलन

rollout_evaluation स्कीम एक साझा घड़ी पर दो या ज़्यादा रोलआउट दिखाती है। एनोटेटर उस फ़्रेम को चिह्नित करता है जहाँ दुनिया का तर्क टूट जाता है, बताता है कि कौन-सा भौतिक या कारण-संबंधी गुण टूटा, रूब्रिक के आधार पर अपनी पसंद बताता है, और रेट करता है कि हस्तक्षेप को देखते हुए कोई प्रतितथ्यात्मक विचलन संभव है या नहीं। पैनल ब्लाइंड किए जा सकते हैं और हर एनोटेटर के लिए स्थिर क्रम में फेंटे जा सकते हैं, ताकि पेज दोबारा लोड करने से यह पता न चले कि कौन-सा मॉडल कौन-सा है।

टूटने के बिंदु पर सहमति तीन तरह से रिपोर्ट होती है: क्या एनोटेटरों ने कोई टूटन पहचानी, उन्होंने उसे कहाँ रखा, और उसे कौन-सी श्रेणी दी। मिलान की सहनशीलता एक अकेली सीमा के बजाय कई मानों पर स्वीप के रूप में दिखाई जाती है।

yaml
annotation_schemes:
  - annotation_type: rollout_evaluation
    name: rollout_review
    description: "Where does each rollout stop making sense?"
    streams:
      - {field: real,  name: "Recording", role: real}
      - {field: gen_a, name: "Model A"}
      - {field: gen_b, name: "Model B"}
    fps: 25
    layers: [violations, preference, counterfactual]
    blind: true
    shuffle: true
    require_clean: true

require_clean "कोई टूटन नहीं" को एक स्पष्ट उत्तर बनाता है, ताकि जिस रोलआउट को किसी ने चिह्नित नहीं किया उसे उस रोलआउट से अलग किया जा सके जिसे किसी ने पूरा देखा ही नहीं। देखें जनरेट किए गए वीडियो और वर्ल्ड मॉडल का मूल्यांकन कैसे करें

रोबोट एपिसोड एनोटेट करना

episode_annotation स्कीम कई सिंक किए गए वीडियो स्ट्रीम और रोबोट की टाइम-सीरीज़ लेन (जोड़ों की स्थिति, ग्रिपर की अवस्था, बल-बलाघूर्ण, रिवॉर्ड) को एक टाइमलाइन पर रखती है। एनोटेटर चरणों को सेगमेंट करते हैं, हर चरण का नतीजा चिह्नित करते हैं, एक सघन प्रगति रिवॉर्ड बनाते हैं, और निर्देश को बाद में दोबारा लिखते हैं। Potato LeRobot v2, HDF5 (RoboMimic और ALOHA) और RLDS/TFDS इम्पोर्ट करता है, और हर फ़्रेम के लिए एक JSONL सहायक फ़ाइल लिखता है, ताकि केवल-पढ़ने वाले सार्वजनिक डेटासेट को दोबारा न लिखना पड़े।

सहमति चरण-सीमाओं के लिए टेम्पोरल IoU, नतीजे के लेबल के लिए α, और रिवॉर्ड कर्व के लिए Pearson सहसंबंध के साथ ICC के रूप में रिपोर्ट होती है, कवरेज बताते हुए, क्योंकि किसी टाइमलाइन के 5% पर निकाला गया सहसंबंध बाक़ी हिस्से के बारे में कुछ नहीं बताता।

TU Wien का ATLAS लंबी अवधि की क्रियाओं के सेगमेंटेशन का डेस्कटॉप टूल है जो ROS bag और RLDS सीधे पढ़ता है। सीमाएँ सटीकता से रखने वाले अकेले एनोटेटर के लिए यह ख़ास इसी काम के लिए बना है। इसका प्रकाशित नतीजा, कि वीडियो के साथ प्रोप्रियोसेप्टिव टाइम-सीरीज़ दिखाने से केवल वीडियो की तुलना में सीमा की त्रुटि घटती है, वही कारण है जिससे Potato ये लेन दिखाता है। Rerun और Foxglove रोबोटिक्स के सबसे अच्छे विज़ुअलाइज़ेशन टूल हैं, और व्यवहार कोडिंग के लिए ELAN और BORIS अब भी मानक हैं। देखें रोबोट एपिसोड कैसे एनोटेट करें

विज़न-लैंग्वेज मॉडल के ग्राउंडिंग और पॉइंटिंग मूल्यांकन के लिए देखें VLM ग्राउंडिंग का मूल्यांकन

यहाँ Potato क्या नहीं करता

  • कोई स्वचालित भौतिकी मूल्यांकक नहीं। उसके लिए किसी बेंचमार्क का मूल्यांकक इस्तेमाल करें, और उसे सत्यापित करने वाले मानव लेबल के लिए Potato।
  • कोई मॉडल ट्रेनिंग या इन्फ़रेंस नहीं। Potato वे रोलआउट दिखाता है जो आपने जनरेट किए।
  • पॉइंट-क्लाउड सीक्वेंस नहीं। 3D एनोटेशन फ़्रेम-दर-फ़्रेम होता है।

हर प्रोजेक्ट की रिपॉज़िटरी और पेपर से अगस्त और सितंबर 2026 में जाँचा गया।

अक्सर पूछे जाने वाले प्रश्न

वर्ल्ड मॉडल का मूल्यांकन कैसे होता है?

ऐसे बेंचमार्क से जो जनरेट किए गए वीडियो को भौतिकी के पालन, निर्देश-पालन और दृश्य गुणवत्ता पर स्कोर करते हैं, जैसे VBench, WorldModelBench और Physics-IQ, और ऐसे मानव निर्णयों से जो इन मूल्यांककों को सत्यापित या ट्रेन करते हैं। किसी नए मॉडल के लिए मानव वाला हिस्सा यह है कि लोग रोलआउट देखें, चिह्नित करें कि वे कहाँ भौतिक रूप से बेतुके हो जाते हैं, और उनकी तुलना करें, बिना यह जाने कि उन्हें किस मॉडल ने बनाया।

कौन-से वर्ल्ड-मॉडल बेंचमार्क मानव निर्णयों का इस्तेमाल करते हैं?

VBench ने अपने हर आयाम के लिए मानव पसंद के एनोटेशन जुटाए, यह दिखाने के लिए कि उसके स्वचालित स्कोर इंसानों से मेल खाते हैं। WorldModelBench ने 14 मॉडलों पर क्राउडसोर्सिंग से 67,000 मानव लेबल जुटाए और उनसे एक स्वचालित जज को फ़ाइन-ट्यून किया।

रोबोट एपिसोड एनोटेट करने के लिए कौन-सा टूल इस्तेमाल करूँ?

ATLAS एक डेस्कटॉप टूल है जिससे एक एनोटेटर ROS bag या RLDS से लंबे एपिसोड सेगमेंट करता है। Potato कई एनोटेटरों के लिए ब्राउज़र में एपिसोड एनोटेट करता है, LeRobot v2, HDF5 और RLDS/TFDS इम्पोर्ट करता है, और चरण-सीमाओं, नतीजों और रिवॉर्ड कर्व पर सहमति रिपोर्ट करता है।

जनरेट किए गए वीडियो का आकलन करने वाले लोगों के बीच सहमति कैसे मापूँ?

हर रोलआउट का आकलन कम से कम दो ऐसे रेटरों से करवाएँ जिन्हें यह न पता हो कि उसे किस मॉडल ने बनाया। रिपोर्ट करें कि वे इस पर सहमत हैं या नहीं कि वह टूटता है, कई सहनशीलताओं पर उनके टूटन-बिंदु कितने पास हैं, और क्या वे एक ही श्रेणी देते हैं। Potato का rollout_evaluation इन तीनों को अलग-अलग रिपोर्ट करता है।

आगे पढ़ें