Agreement Cannot Catch Rubber-Stamping
When annotators accept model pre-labels without reading them, inter-annotator agreement goes up. Every quality measure computed from the annotations improves. Timing is the only signal left.
Potato टीम से समाचार, ट्यूटोरियल और अपडेट।
When annotators accept model pre-labels without reading them, inter-annotator agreement goes up. Every quality measure computed from the annotations improves. Timing is the only signal left.

Potato अब यह रिकॉर्ड कर सकता है कि एनोटेटर फ़्री-टेक्स्ट उत्तर कैसे तैयार करते हैं, बिना यह रिकॉर्ड किए कि वे क्या टाइप करते हैं, और ठहरावों, संशोधनों तथा पेस्ट को ऐसे उत्तरों के लिए जाँचने-योग्य फ़्लैग में बदल सकता है जो लिखे नहीं, पेस्ट किए गए थे।
Whisper आउटपुट के एक फ़ोल्डर से लेबल किए हुए वक्ता टर्न तक का पूरा सफ़र: एनोटेशन इकाई चुनना, डायराइज़ेशन सँभालना, कॉन्फ़िग लिखना, टास्क चलाना, और समय-संरेखण बचाए रखते हुए निर्यात करना।



Get notified about new tutorials, releases, and community highlights.
आपके एनोटेटरों ने जो बताया, बहुमत उसका ज़्यादातर हिस्सा फेंक देता है। आइटम रिस्पॉन्स थ्योरी हर लेबल को एक पोस्टीरियर प्रायिकता और एक विश्वास अंतराल देती है, एनोटेटर की क्षमता और आइटम की कठिनाई का अनुमान लगाती है, और टूटी हुई कोडबुक प्रविष्टियाँ पकड़ लेती है, वह भी बिना गोल्ड लेबल और बिना किसी LLM के।
Potato 2.7 में जुड़े हैं एरर बार वाले लेबल, लाइव नॉर्मिंग रूम, काउंटरफैक्चुअल बाउंड्री प्रोब, पीयर-प्रेडिक्शन स्कोरिंग, लोकल चलने वाले बोले हुए तर्क, एक कमांड में डेटासेट रिपोर्ट, और मोबाइल एनोटेशन, और इनमें से किसी को भी LLM की ज़रूरत नहीं। साथ में मल्टी-एजेंट और मल्टीमॉडल एजेंट मूल्यांकन।

Potato में कंप्यूटर-उपयोग और GUI एजेंटों के लिए ह्यूमन मूल्यांकन का एक वॉकथ्रू: प्रत्येक क्रिया को आँकना, स्क्रीनशॉट पर क्लिक ग्राउंडिंग की जाँच करना, और टूल कॉल की एक-एक करके समीक्षा करना।
Potato का उपयोग करके यह पता लगाना कि एक मल्टी-एजेंट LLM सिस्टम क्यों विफल हुआ: इंटरैक्शन ग्राफ़, विफलता एट्रिब्यूशन, हैंडऑफ़ समीक्षा, प्रति-एजेंट स्कोरकार्ड, टूल-कंटेंशन टाइमलाइन, और उभरते-व्यवहार टैगिंग।

एजेंट मूल्यांकन में मानवीय समीक्षा का समय सबसे दुर्लभ संसाधन है। Potato 2.6 एक सिग्नल-आधारित ट्राएज कतार को जज-मानव संरेखण के साथ जोड़ता है, ताकि सबसे खराब ट्रेस पहले लोगों तक पहुँचें और आपका LLM जज लगातार बेहतर होता रहे।
Annotator identity shapes labels on subjective tasks, so demographics are worth collecting, but only with consent and a reason. What to ask, what to leave alone, and how to run the flow in Potato.



A practical guide to deciding when an LLM can annotate your data, where model annotators fail, and how to combine automation with human verification in Potato.
एक ओपन-सोर्स डेटा एनोटेशन टूल कैसे चुनें इस पर एक ईमानदार नज़र, कौन से सवाल वास्तव में विकल्प को सीमित करते हैं, और Label Studio, Prodigy, Doccano, brat और Argilla के बीच Potato कहाँ फ़िट होता है।



Potato अब कोडिंग एजेंट एनोटेशन समर्थित करता है, diff रेंडरिंग, टर्मिनल आउटपुट प्रदर्शन और प्रोसेस रिवॉर्ड योजनाओं के साथ। Claude Code, Aider और SWE-Agent से ट्रेस आयात करें।
Potato से PRM प्रशिक्षण के लिए प्रति-चरण रिवॉर्ड संकेत जुटाने की चरण-दर-चरण गाइड। इसमें first-error मोड, प्रति-चरण एनोटेशन और प्रशिक्षण पाइपलाइन में निर्यात शामिल है।




एजेंट मूल्यांकन के लिए Potato की तुलना LangSmith, Langfuse, Labelbox और Scale AI से करें: ट्रेस रेंडरिंग, प्रति-चरण और बहु-एजेंट एनोटेशन, मल्टीमोडल-एजेंट समीक्षा, कोडिंग एजेंट, लाइव अवलोकन, क़ीमत, और सेल्फ़-होस्टिंग।
Potato के rubric_eval से व्यवस्थित AI agent मूल्यांकन के लिए custom criteria, configurable rating scales, और dimension weights के साथ multi-criteria rubric मूल्यांकन सेट करें।


Potato के web agent trace display का उपयोग करके स्वायत्त web browsing agents का मूल्यांकन कैसे करें — चरण-दर-चरण screenshots, SVG overlays, और per-step annotation schemas के साथ।
Potato 2.2.0 में 9 नए एनोटेशन स्कीमा, एक pluggable निर्यात व्यवस्था, MACE से दक्षता का अनुमान, 55 जाँचे-परखे सर्वे उपकरण, और दूर रखे डेटा स्रोत जुड़े हैं।


Potato में क़ानूनी दस्तावेज़ एनोटेट कीजिए, अनुबंध, अदालती दस्तावेज़ और नियामक पाठ, span लेबलिंग, entity निकालने और निजता को पहले रखने वाली self-hosted तैनाती के साथ।
Potato में चिकित्सा छवियों को एनोटेट करने के बेहतर तरीक़े, DICOM प्रदर्शन, रेडियोलॉजी रिपोर्ट की लेबलिंग, प्रतिकूल घटनाओं का निष्कर्षण और IRB के अनुरूप self-hosted तैनाती।




Potato में साथ-साथ रखकर इमेज की तुलना करने वाले कार्य बनाइए, प्राथमिकता की रैंकिंग, A/B परीक्षण और दृश्य गुणवत्ता के आकलन के लिए, बेतरतीब क्रम और pairwise स्कोरिंग के साथ।
Potato 2.0 में OpenAI और Claude के साथ AI-आधारित पूर्व-एनोटेशन, ऑडियो और वीडियो के लिए मल्टीमीडिया समर्थन, active learning, bounding box एनोटेशन, और नए सिरे से बना UI आया है।



HTML टेम्पलेट, CSS और JavaScript से Potato में अपने एनोटेशन इंटरफ़ेस बनाइए: साथ-साथ रखे गए लेआउट, अपने विजेट, और मीडिया दिखाने वाले हिस्से।
Potato में उच्चारण की गुणवत्ता आँकने का कार्य बनाइए: ऑडियो प्लेबैक, waveform, Likert पैमाने, और हर रिकॉर्डिंग पर खुली टिप्पणी के फ़ील्ड।




Potato एनोटेशन प्रोजेक्ट के लिए Cohen का kappa, Fleiss का kappa और Krippendorff का alpha निकालिए और उनका मतलब समझिए, Python कोड उदाहरणों और व्याख्या के दिशानिर्देशों के साथ।
एनोटेशन परियोजनाओं में गुणवत्ता बनाए रखने के व्यावहारिक तरीक़े, जिनमें Potato के भीतर और उसके बाहर, दोनों जगह अपनाई जा सकने वाली रणनीतियाँ शामिल हैं।




कई वस्तुओं की ट्रैकिंग वाले एनोटेशन की बुनियादी बातें, और Potato की वीडियो एनोटेशन सुविधाएँ सादे ट्रैकिंग कार्यप्रवाह में कहाँ तक साथ देती हैं।
Potato में ऑडियो भाव वर्गीकरण का कार्य बनाइए: इंटरैक्टिव waveform, प्लेबैक गति के नियंत्रण, Likert स्केल, और अपनी ज़रूरत के हिसाब से भाव लेबल सेट।