पेपर मोड
एक ही कमांड से किसी एनोटेशन परियोजना को कंपाइल होने लायक LaTeX डेटासेट रिपोर्ट में बदलें। लेबल वितरण, सही उद्धरणों के साथ सहमति आँकड़े, एनोटेटर तालिकाएँ, समय और सीमाएँ।
v2.7.0 में नया
हर डेटासेट पेपर का अंत एक जैसा होता है: बिखरी हुई आउटपुट फ़ाइलों से एनोटेटरों की गिनती, सहमति आँकड़े, लेबल वितरण और समय दोबारा जोड़ना, फिर उन्हें हाथ से LaTeX में ढालना। पेपर मोड यह सब एक कमांड में कर देता है।
bash
python -m potato.paper config.yaml -o paper_export
आउटपुट पूरी तरह ऑफ़लाइन है। न LLM, न सर्वर, न नेटवर्क।
text
paper_export/
├── paper.tex # compilable standalone; every section cut-paste-able
├── paper.bib # citations for every metric used (+ Potato)
├── tables/*.csv # each table as CSV, for your own styling
└── summary.json # every computed number, machine-readable
paper.tex जैसा है वैसा ही कंपाइल हो जाता है, और हर अनुच्छेद तथा तालिका मार्करों के बीच रहती है ताकि आप सेक्शन सीधे अपने पांडुलिपि में उठाकर रख सकें:
latex
%% === BLOCK: paragraph-annotation-methods ===
Annotators spent a median of 42 seconds per item (12.3 person-hours in total).
Inter-annotator agreement for \emph{politeness}, measured by Krippendorff's
$\alpha$ (nominal) \citep{krippendorff2004content} over the 214
multiply-annotated units, was $\alpha = 0.712$ (tentative agreement). ...
%% === END BLOCK: paragraph-annotation-methods ===यह क्या बनाता है
| ब्लॉक | सामग्री |
|---|---|
paragraph-dataset-description | आइटम गिनती, योजनाएँ, लेबल, एनोटेटर और लेबल के कुल योग, डेटा सेक्शन के लिए तैयार |
paragraph-annotation-methods | समय, प्रति योजना Krippendorff's α, औसत जोड़ीवार Cohen's κ, सब उद्धरण सहित |
table-distribution-<scheme> | प्रति योजना एक booktabs लेबल-वितरण तालिका, योग सहित |
table-annotators | हर एनोटेटर के लिए आइटम, लेबल, और प्रति आइटम माध्यिका सेकंड |
table-agreement | प्रति योजना α, औसत κ, और Krippendorff की 0.667 तथा 0.8 सीमाओं के सापेक्ष व्याख्या |
paragraph-limitations | असली संख्याओं के साथ चेतावनियाँ: एकल-एनोटेटेड इकाइयाँ, कम α वाली योजनाएँ, छोटे एनोटेटर समूह |
CLI विकल्प
| फ़्लैग | डिफ़ॉल्ट | विवरण |
|---|---|---|
-o, --output-dir | paper_export | रिपोर्ट कहाँ लिखी जाए |
--no-anonymize | बंद | असली उपयोगकर्ता नाम रखें; डिफ़ॉल्ट रूप से एनोटेटर A1..An बन जाते हैं |
पद्धति संबंधी टिप्पणियाँ
- पेपर मोड
{output_annotation_dir}/<user>/user_state.jsonको सीधे पढ़ता है, जिसे कॉन्फ़िग फ़ाइल के सापेक्ष हल किया जाता है, इसलिए यह सर्वर शुरू किए बिना संग्रहित परियोजनाओं पर भी काम करता है। - Krippendorff's α (nominal) की गणना
simpledorffसे होती है, वही कार्यान्वयन जो एडमिन डैशबोर्ड इस्तेमाल करता है, और वह दो या अधिक एनोटेशन वाली इकाइयों पर की जाती है। जोड़ीवार Cohen's κ की गणना हर उस एनोटेटर जोड़ी के लिए होती है जिसके पास दो या अधिक साझा आइटम हों। - श्रेणीगत योजनाओं (
radio,likert,multiselect,select,bws) के लिए वितरण और सहमति दोनों निकलते हैं। Multiselect सहमति में हर (आइटम, लेबल) चेकबॉक्स को द्विआधारी-कोडित इकाई माना जाता है। Span और textbox योजनाएँ असमर्थित के रूप में सूचीबद्ध होती हैं। - समय व्यवहार ट्रैकिंग से आता है, जो
total_time_msका उपयोग करता है और न मिलने पर इंटरैक्शन टाइमस्टैम्प के अंतराल पर लौट आता है, एक घंटे से बड़े अंतरालों को छोड़ते हुए।
आगे पढ़ें
- एनोटेशन डेटासेट का दस्तावेज़ीकरण
- अंतर-एनोटेटर सहमति
- एडमिन डैशबोर्ड — इन्हीं संख्याओं के लाइव समकक्ष
- स्रोत दस्तावेज़