AI एजेंट मूल्यांकन टूल की तुलना: LangSmith, Langfuse, Phoenix और Potato
एजेंट ट्रेस की मानव समीक्षा के लिए LangSmith, Langfuse, Arize Phoenix, Braintrust, Opik, W&B Weave और Potato की तुलना: एनोटेशन कतारें, हर चरण के लेबल, सहमति और ख़ुद होस्ट करना।
AI एजेंटों के मूल्यांकन के टूल दो तरह के होते हैं। ऑब्ज़र्वेबिलिटी प्लेटफ़ॉर्म, जैसे LangSmith, Langfuse, Arize Phoenix, Braintrust और Opik, प्रोडक्शन में किसी एजेंट को ट्रेस करते हैं और समीक्षकों को रन और स्पैन पर स्कोर लगाने देते हैं। Potato जैसे एनोटेशन टूल मानव अध्ययन से शुरू करते हैं: हर ट्रेस पर कई समीक्षक, हर चरण पर लेबल, और यह माप कि समीक्षक कितने सहमत हैं। दोनों साथ काम करते हैं। जहाँ पहले से ट्रेस करते हैं वहीं ट्रेस करते रहें, जिन रन का आकलन करना है उन्हें एक्सपोर्ट करें, और अध्ययन एनोटेशन टूल में चलाएँ।
एजेंट ट्रेस, या ट्रैजेक्टरी, एजेंट के हर चरण को दर्ज करता है: उसका तर्क, उसके बुलाए गए टूल और उनसे लौटा नतीजा। मानव मूल्यांकन पूरे रन को स्कोर कर सकता है, हर चरण पर लेबल लगा सकता है, या दो रन की तुलना आमने-सामने कर सकता है। LLM-as-a-judge ट्रेस को अपने-आप स्कोर करता है, और उसे जाँचने के लिए मानव लेबल चाहिए। देखें AI एजेंटों का मूल्यांकन कैसे करें।
यह पेज एजेंट और LLM मूल्यांकन के बारे में है। सभी डेटा प्रकारों की एक पेज पर तुलना AI एनोटेशन टूल की तुलना में है।
किन एजेंट मूल्यांकन टूल की तुलना करनी चाहिए?
| टूल | किसके लिए बना | मानव समीक्षा |
|---|---|---|
| LangSmith | LangChain और LangGraph ऐप्लिकेशन को ट्रेस और मूल्यांकन करना | रूब्रिक फ़ीडबैक वाली एनोटेशन कतारें, हर रन पर कई समीक्षक, जोड़ी वाली कतारें |
| Langfuse | ओपन-सोर्स ट्रेसिंग, प्रॉम्प्ट प्रबंधन और मूल्यांकन | एनोटेशन कतारें और श्रेणीगत या संख्यात्मक स्कोर के लिए स्कोर कॉन्फ़िग |
| Arize Phoenix | ट्रेसिंग और मूल्यांकन | इंसानों, LLM या कोड से श्रेणीगत, सतत और मुक्त फ़ीडबैक के लिए एनोटेशन कॉन्फ़िग |
| Braintrust | मूल्यांकन और लॉगिंग | मानव समीक्षा स्कोर: श्रेणीगत, सतत और मुक्त-पाठ |
| Comet Opik | ओपन-सोर्स ट्रेसिंग और मूल्यांकन | लिंक से विषय-विशेषज्ञों के साथ साझा की जाने वाली एनोटेशन कतारें |
| W&B Weave | ट्रेसिंग और मूल्यांकन | UI या API में बनाए जाने वाले मानव एनोटेशन स्कोरर |
| Label Studio | सामान्य एनोटेशन | चरण-दर-चरण समीक्षा के लिए LangGraph, CrewAI और AutoGen के ट्रेस इम्पोर्ट करता है |
| Potato | मानव एनोटेशन अध्ययन | त्रुटि वर्गीकरण के साथ हर चरण के लेबल, मल्टी-एजेंट ग्राफ़, जोड़ी में तुलना, समीक्षकों के बीच सहमति |
हमारी क्षमता तालिका के टूल के लिए ख़ुद होस्ट करना और कीमत:
| ख़ुद होस्ट करना | कीमत | |
|---|---|---|
| LangSmith | सिर्फ़ Enterprise प्लान में | $39 प्रति सीट प्रति माह |
| Langfuse | मुफ़्त (MIT) | ख़ुद होस्ट करने पर मुफ़्त |
| Comet Opik | मुफ़्त (Apache-2.0) | ख़ुद होस्ट करने पर मुफ़्त |
| Galileo | Enterprise अनुबंध | $100 प्रति माह |
| Potato | मुफ़्त (GPL-3.0) | मुफ़्त |
हर प्लेटफ़ॉर्म मानव स्कोर के साथ क्या करता है
LangSmith की एनोटेशन कतारें रूब्रिक फ़ीडबैक कुंजियाँ, हर रन पर समीक्षकों की समायोज्य संख्या, जोड़ी वाली कतारें, और ऐसे समीक्षक सपोर्ट करती हैं जो एक-दूसरे का फ़ीडबैक नहीं देख सकते।
Langfuse स्कोर को स्कोर कॉन्फ़िग से परिभाषित करता है और ट्रेस, ऑब्ज़र्वेशन और सेशन को एनोटेशन कतारों के ज़रिए समीक्षकों तक भेजता है। इसके कम्युनिटी फ़ोरम में उपयोगकर्ताओं ने नवंबर 2025 में बताया कि दो लोग अब भी किसी कतार में एक ही ट्रेस को स्वतंत्र रूप से एनोटेट नहीं कर सकते, और वहाँ चर्चा में आया उपाय हर एनोटेटर के लिए अलग स्कोर कॉन्फ़िग है (चर्चा #4348)। Langfuse एक मानव स्कोर और LLM जज के स्कोर के बीच Cohen का κ निकाल सकता है, एक बार में दो शृंखलाओं के लिए।
Arize Phoenix इंसानों, LLM और कोड के एनोटेशन को एक ही ढाँचा देता है, जिसमें एनोटेशन कॉन्फ़िग समीक्षाओं के बीच लेबल को एक-जैसा रखते हैं। एनोटेट किए गए स्पैन को प्रयोगों के लिए या मानव निर्णय से मेल खाने वाला मूल्यांकक बनाने के लिए डेटासेट में एक्सपोर्ट किया जा सकता है।
Braintrust लॉग और प्रयोगों पर मानव समीक्षा स्कोर लगाता है। इसके दस्तावेज़ीकरण में बताया गया है कि कुछ समीक्षकों से कोई स्कोर छिपाना समीक्षा स्क्रीन को सुथरा रखने के लिए है, एक्सेस नियंत्रण नहीं, क्योंकि कोई भी समीक्षक सभी स्कोर दिखा सकता है।
Comet Opik ट्रेस और थ्रेड को एनोटेशन कतारों में रखता है जिन्हें लिंक से विषय-विशेषज्ञों के साथ साझा किया जा सकता है, और इसकी समीक्षा स्क्रीन ग़ैर-तकनीकी समीक्षकों के लिए बनी है।
W&B Weave मानव फ़ीडबैक को मानव एनोटेशन स्कोरर के ज़रिए दर्ज करता है, जो UI में या API से बनाए जाते हैं।
अगस्त और सितंबर 2026 में जाँच के दौरान हमें LangSmith, Langfuse, Phoenix, Braintrust या Opik के एनोटेशन दस्तावेज़ीकरण में मानव समीक्षकों के बीच सहमति का कोई आँकड़ा नहीं मिला। हर एक मानव निर्णयों को स्कोर के रूप में जुटाता है। Labelbox और Scale AI एजेंट-मूल्यांकन डेटा को प्रबंधित सेवा के रूप में बेचते हैं, जो अलग तरह की ख़रीद है: वे समीक्षक भी देते हैं।
Potato कहाँ अलग है
- कई फ़्रेमवर्क के ट्रेस। कन्वर्टर 15 फ़ॉर्मैट पढ़ते हैं: ReAct, OpenAI, Anthropic, LangChain (जिसमें LangSmith के एक्सपोर्ट आते हैं), Langfuse, CrewAI, AutoGen और LangGraph के मल्टी-एजेंट लॉग, SWE-bench, SWE-Agent, Claude Code, Aider, WebArena, Mind2Web और दूसरी ब्राउज़र रिकॉर्डिंग, MCP, OpenTelemetry और ATIF।
- हर चरण पर लेबल।
trajectory_evalस्कीम दर्ज करती है कि हर चरण सही था या नहीं, पदानुक्रमित वर्गीकरण से एक त्रुटि प्रकार, एक गंभीरता, और एक चलता हुआ स्कोर। यही लेबल प्रोसेस रिवॉर्ड मॉडल के लिए ट्रेनिंग डेटा हैं। - मल्टी-एजेंट संरचना। समीक्षक एक इंटरैक्शन ग्राफ़ संपादित करते हैं, क्रिटिकल पाथ चिह्नित करते हैं, किसी विफलता को एक एजेंट और एक चरण से जोड़ते हैं, और हैंडऑफ़ की समीक्षा करते हैं। Langfuse का Agent Graphs व्यू डिबगिंग के लिए मल्टी-एजेंट रन को ग्राफ़ के रूप में दिखाता है, पर समीक्षक उस पर एनोटेशन नहीं कर सकते। देखें मल्टी-एजेंट सिस्टम का मूल्यांकन कैसे करें।
- समीक्षकों के बीच सहमति। हर ट्रेस कई ऐसे समीक्षकों को जा सकता है जो एक-दूसरे के लेबल नहीं देखते, और इंटर-एनोटेटर सहमति रिपोर्ट होती है। जज कैलिब्रेशन किसी LLM जज की तुलना ब्लाइंड मानव लेबल से करता है। देखें LLM जज और मानव एनोटेटरों के बीच सहमति कैसे मापें।
- कोडिंग और कंप्यूटर-उपयोग एजेंट। सिंटैक्स हाइलाइटिंग वाले यूनिफ़ाइड डिफ़, टर्मिनल आउटपुट, और पंक्तियों से जुड़ी समीक्षा टिप्पणियाँ। कंप्यूटर-उपयोग रन क्लिक की जगह के साथ स्क्रीनशॉट दिखाते हैं। देखें कोडिंग-एजेंट मूल्यांकन और कंप्यूटर-उपयोग एजेंटों का मूल्यांकन।
ट्रेस को Potato में लाना
अपने ऑब्ज़र्वेबिलिटी टूल से वे रन एक्सपोर्ट करें जिनकी समीक्षा करनी है, फिर उन्हें कन्वर्ट करें:
python -m potato.trace_converter \
--input langfuse_traces.json \
--output data/traces.jsonl \
--input-format langfuseLangSmith के रन एक्सपोर्ट --input-format langchain इस्तेमाल करते हैं। अगर कोई फ़्रेमवर्क सूची में नहीं है, तो --auto-detect फ़ील्ड के नामों से कन्वर्टर चुनता है।
Potato में चरण-दर-चरण समीक्षा का कार्य
annotation_schemes:
- annotation_type: trajectory_eval
name: step_evaluation
description: "Evaluate each step for correctness and mark any errors."
steps_key: steps
error_types:
- {name: reasoning, subtypes: [logical_error, factual_error, planning_error]}
- {name: execution, subtypes: [wrong_tool, wrong_args, api_error]}
severities:
- {name: minor, weight: -1}
- {name: major, weight: -5}
show_score: trueत्रुटि वर्गीकरण कैसे बनाएँ, इसके लिए देखें एजेंट ट्रैजेक्टरी एनोटेट करना।
एजेंटों के लिए Potato क्या नहीं करता
- यह प्रोडक्शन मॉनिटरिंग सेवा नहीं है। इसमें OpenTelemetry एक्सपोर्ट वाला ट्रेसिंग SDK है, पर कोई होस्टेड क्लाउड नहीं और प्रोडक्शन ट्रैफ़िक की लेटेंसी और लागत के लिए बने डैशबोर्ड नहीं। यह सिर्फ़ ख़ुद होस्ट होता है।
- यह समीक्षक नहीं देता। अपने लाएँ, या उन्हें Prolific पर भर्ती करें।
अक्सर पूछे जाने वाले प्रश्न
मानव समीक्षा के लिए LangSmith और Langfuse में क्या फ़र्क़ है?
दोनों एनोटेशन कतारों के ज़रिए ट्रेस और स्पैन पर मानव स्कोर लगाते हैं। LangSmith प्रोप्राइटरी है, इसके Enterprise प्लान में ख़ुद होस्ट किया जा सकता है, और यह हर रन पर कई समीक्षक और जोड़ी वाली कतारें सपोर्ट करता है। Langfuse MIT लाइसेंस वाला है और मुफ़्त में ख़ुद होस्ट होता है, और इसके फ़ोरम में उपयोगकर्ता बताते हैं कि दो लोग अभी किसी कतार में एक ही ट्रेस को स्वतंत्र रूप से स्कोर नहीं कर सकते। दोनों में से कोई भी मानव समीक्षकों के बीच सहमति का आँकड़ा दस्तावेज़ित नहीं करता।
क्या एजेंट मूल्यांकन के लिए LangSmith का कोई ओपन-सोर्स विकल्प है?
ट्रेसिंग और स्कोरिंग के लिए Langfuse (MIT) और Comet Opik (Apache-2.0) ओपन-सोर्स हैं और मुफ़्त में ख़ुद होस्ट होते हैं। मानव मूल्यांकन अध्ययनों के लिए, जिनमें हर ट्रेस पर कई समीक्षक, हर चरण के लेबल और सहमति हो, Potato ओपन-सोर्स और मुफ़्त है। Potato LangSmith और Langfuse के एक्सपोर्ट पढ़ता है, इसलिए यह दोनों में से किसी के भी साथ चल सकता है।
एजेंट ट्रेस के मानव समीक्षकों के बीच सहमति कैसे मापूँ?
हर ट्रेस कम से कम दो ऐसे समीक्षकों को दें जो एक-दूसरे के लेबल न देख सकें, फिर हर प्रश्न के लिए दो समीक्षकों पर Cohen का κ या ज़्यादा पर Krippendorff का α निकालें। हर चरण के लेबल के लिए पहले चरणों का मिलान करना होता है। इंटर-एनोटेटर सहमति की व्याख्या गुणांक के चुनाव के बारे में बताती है।
क्या मैं LangSmith या Langfuse के ट्रेस के साथ Potato इस्तेमाल कर सकता हूँ?
हाँ। python -m potato.trace_converter LangSmith के रन एक्सपोर्ट को --input-format langchain से और Langfuse के एक्सपोर्ट को --input-format langfuse से कन्वर्ट करता है। प्रोडक्शन ट्रेसिंग जहाँ है वहीं रखें, और जिन ट्रेस का आकलन करना है उन्हें Potato में लाएँ।