Skip to content

AI एजेंट मूल्यांकन टूल की तुलना: LangSmith, Langfuse, Phoenix और Potato

एजेंट ट्रेस की मानव समीक्षा के लिए LangSmith, Langfuse, Arize Phoenix, Braintrust, Opik, W&B Weave और Potato की तुलना: एनोटेशन कतारें, हर चरण के लेबल, सहमति और ख़ुद होस्ट करना।

AI एजेंटों के मूल्यांकन के टूल दो तरह के होते हैं। ऑब्ज़र्वेबिलिटी प्लेटफ़ॉर्म, जैसे LangSmith, Langfuse, Arize Phoenix, Braintrust और Opik, प्रोडक्शन में किसी एजेंट को ट्रेस करते हैं और समीक्षकों को रन और स्पैन पर स्कोर लगाने देते हैं। Potato जैसे एनोटेशन टूल मानव अध्ययन से शुरू करते हैं: हर ट्रेस पर कई समीक्षक, हर चरण पर लेबल, और यह माप कि समीक्षक कितने सहमत हैं। दोनों साथ काम करते हैं। जहाँ पहले से ट्रेस करते हैं वहीं ट्रेस करते रहें, जिन रन का आकलन करना है उन्हें एक्सपोर्ट करें, और अध्ययन एनोटेशन टूल में चलाएँ।

एजेंट ट्रेस, या ट्रैजेक्टरी, एजेंट के हर चरण को दर्ज करता है: उसका तर्क, उसके बुलाए गए टूल और उनसे लौटा नतीजा। मानव मूल्यांकन पूरे रन को स्कोर कर सकता है, हर चरण पर लेबल लगा सकता है, या दो रन की तुलना आमने-सामने कर सकता है। LLM-as-a-judge ट्रेस को अपने-आप स्कोर करता है, और उसे जाँचने के लिए मानव लेबल चाहिए। देखें AI एजेंटों का मूल्यांकन कैसे करें

यह पेज एजेंट और LLM मूल्यांकन के बारे में है। सभी डेटा प्रकारों की एक पेज पर तुलना AI एनोटेशन टूल की तुलना में है।

किन एजेंट मूल्यांकन टूल की तुलना करनी चाहिए?

टूलकिसके लिए बनामानव समीक्षा
LangSmithLangChain और LangGraph ऐप्लिकेशन को ट्रेस और मूल्यांकन करनारूब्रिक फ़ीडबैक वाली एनोटेशन कतारें, हर रन पर कई समीक्षक, जोड़ी वाली कतारें
Langfuseओपन-सोर्स ट्रेसिंग, प्रॉम्प्ट प्रबंधन और मूल्यांकनएनोटेशन कतारें और श्रेणीगत या संख्यात्मक स्कोर के लिए स्कोर कॉन्फ़िग
Arize Phoenixट्रेसिंग और मूल्यांकनइंसानों, LLM या कोड से श्रेणीगत, सतत और मुक्त फ़ीडबैक के लिए एनोटेशन कॉन्फ़िग
Braintrustमूल्यांकन और लॉगिंगमानव समीक्षा स्कोर: श्रेणीगत, सतत और मुक्त-पाठ
Comet Opikओपन-सोर्स ट्रेसिंग और मूल्यांकनलिंक से विषय-विशेषज्ञों के साथ साझा की जाने वाली एनोटेशन कतारें
W&B Weaveट्रेसिंग और मूल्यांकनUI या API में बनाए जाने वाले मानव एनोटेशन स्कोरर
Label Studioसामान्य एनोटेशनचरण-दर-चरण समीक्षा के लिए LangGraph, CrewAI और AutoGen के ट्रेस इम्पोर्ट करता है
Potatoमानव एनोटेशन अध्ययनत्रुटि वर्गीकरण के साथ हर चरण के लेबल, मल्टी-एजेंट ग्राफ़, जोड़ी में तुलना, समीक्षकों के बीच सहमति

हमारी क्षमता तालिका के टूल के लिए ख़ुद होस्ट करना और कीमत:

ख़ुद होस्ट करनाकीमत
LangSmithसिर्फ़ Enterprise प्लान में$39 प्रति सीट प्रति माह
Langfuseमुफ़्त (MIT)ख़ुद होस्ट करने पर मुफ़्त
Comet Opikमुफ़्त (Apache-2.0)ख़ुद होस्ट करने पर मुफ़्त
GalileoEnterprise अनुबंध$100 प्रति माह
Potatoमुफ़्त (GPL-3.0)मुफ़्त

हर प्लेटफ़ॉर्म मानव स्कोर के साथ क्या करता है

LangSmith की एनोटेशन कतारें रूब्रिक फ़ीडबैक कुंजियाँ, हर रन पर समीक्षकों की समायोज्य संख्या, जोड़ी वाली कतारें, और ऐसे समीक्षक सपोर्ट करती हैं जो एक-दूसरे का फ़ीडबैक नहीं देख सकते।

Langfuse स्कोर को स्कोर कॉन्फ़िग से परिभाषित करता है और ट्रेस, ऑब्ज़र्वेशन और सेशन को एनोटेशन कतारों के ज़रिए समीक्षकों तक भेजता है। इसके कम्युनिटी फ़ोरम में उपयोगकर्ताओं ने नवंबर 2025 में बताया कि दो लोग अब भी किसी कतार में एक ही ट्रेस को स्वतंत्र रूप से एनोटेट नहीं कर सकते, और वहाँ चर्चा में आया उपाय हर एनोटेटर के लिए अलग स्कोर कॉन्फ़िग है (चर्चा #4348)। Langfuse एक मानव स्कोर और LLM जज के स्कोर के बीच Cohen का κ निकाल सकता है, एक बार में दो शृंखलाओं के लिए।

Arize Phoenix इंसानों, LLM और कोड के एनोटेशन को एक ही ढाँचा देता है, जिसमें एनोटेशन कॉन्फ़िग समीक्षाओं के बीच लेबल को एक-जैसा रखते हैं। एनोटेट किए गए स्पैन को प्रयोगों के लिए या मानव निर्णय से मेल खाने वाला मूल्यांकक बनाने के लिए डेटासेट में एक्सपोर्ट किया जा सकता है।

Braintrust लॉग और प्रयोगों पर मानव समीक्षा स्कोर लगाता है। इसके दस्तावेज़ीकरण में बताया गया है कि कुछ समीक्षकों से कोई स्कोर छिपाना समीक्षा स्क्रीन को सुथरा रखने के लिए है, एक्सेस नियंत्रण नहीं, क्योंकि कोई भी समीक्षक सभी स्कोर दिखा सकता है।

Comet Opik ट्रेस और थ्रेड को एनोटेशन कतारों में रखता है जिन्हें लिंक से विषय-विशेषज्ञों के साथ साझा किया जा सकता है, और इसकी समीक्षा स्क्रीन ग़ैर-तकनीकी समीक्षकों के लिए बनी है।

W&B Weave मानव फ़ीडबैक को मानव एनोटेशन स्कोरर के ज़रिए दर्ज करता है, जो UI में या API से बनाए जाते हैं।

अगस्त और सितंबर 2026 में जाँच के दौरान हमें LangSmith, Langfuse, Phoenix, Braintrust या Opik के एनोटेशन दस्तावेज़ीकरण में मानव समीक्षकों के बीच सहमति का कोई आँकड़ा नहीं मिला। हर एक मानव निर्णयों को स्कोर के रूप में जुटाता है। Labelbox और Scale AI एजेंट-मूल्यांकन डेटा को प्रबंधित सेवा के रूप में बेचते हैं, जो अलग तरह की ख़रीद है: वे समीक्षक भी देते हैं।

Potato कहाँ अलग है

  • कई फ़्रेमवर्क के ट्रेस। कन्वर्टर 15 फ़ॉर्मैट पढ़ते हैं: ReAct, OpenAI, Anthropic, LangChain (जिसमें LangSmith के एक्सपोर्ट आते हैं), Langfuse, CrewAI, AutoGen और LangGraph के मल्टी-एजेंट लॉग, SWE-bench, SWE-Agent, Claude Code, Aider, WebArena, Mind2Web और दूसरी ब्राउज़र रिकॉर्डिंग, MCP, OpenTelemetry और ATIF।
  • हर चरण पर लेबल। trajectory_eval स्कीम दर्ज करती है कि हर चरण सही था या नहीं, पदानुक्रमित वर्गीकरण से एक त्रुटि प्रकार, एक गंभीरता, और एक चलता हुआ स्कोर। यही लेबल प्रोसेस रिवॉर्ड मॉडल के लिए ट्रेनिंग डेटा हैं।
  • मल्टी-एजेंट संरचना। समीक्षक एक इंटरैक्शन ग्राफ़ संपादित करते हैं, क्रिटिकल पाथ चिह्नित करते हैं, किसी विफलता को एक एजेंट और एक चरण से जोड़ते हैं, और हैंडऑफ़ की समीक्षा करते हैं। Langfuse का Agent Graphs व्यू डिबगिंग के लिए मल्टी-एजेंट रन को ग्राफ़ के रूप में दिखाता है, पर समीक्षक उस पर एनोटेशन नहीं कर सकते। देखें मल्टी-एजेंट सिस्टम का मूल्यांकन कैसे करें
  • समीक्षकों के बीच सहमति। हर ट्रेस कई ऐसे समीक्षकों को जा सकता है जो एक-दूसरे के लेबल नहीं देखते, और इंटर-एनोटेटर सहमति रिपोर्ट होती है। जज कैलिब्रेशन किसी LLM जज की तुलना ब्लाइंड मानव लेबल से करता है। देखें LLM जज और मानव एनोटेटरों के बीच सहमति कैसे मापें
  • कोडिंग और कंप्यूटर-उपयोग एजेंट। सिंटैक्स हाइलाइटिंग वाले यूनिफ़ाइड डिफ़, टर्मिनल आउटपुट, और पंक्तियों से जुड़ी समीक्षा टिप्पणियाँ। कंप्यूटर-उपयोग रन क्लिक की जगह के साथ स्क्रीनशॉट दिखाते हैं। देखें कोडिंग-एजेंट मूल्यांकन और कंप्यूटर-उपयोग एजेंटों का मूल्यांकन

ट्रेस को Potato में लाना

अपने ऑब्ज़र्वेबिलिटी टूल से वे रन एक्सपोर्ट करें जिनकी समीक्षा करनी है, फिर उन्हें कन्वर्ट करें:

bash
python -m potato.trace_converter \
  --input langfuse_traces.json \
  --output data/traces.jsonl \
  --input-format langfuse

LangSmith के रन एक्सपोर्ट --input-format langchain इस्तेमाल करते हैं। अगर कोई फ़्रेमवर्क सूची में नहीं है, तो --auto-detect फ़ील्ड के नामों से कन्वर्टर चुनता है।

Potato में चरण-दर-चरण समीक्षा का कार्य

yaml
annotation_schemes:
  - annotation_type: trajectory_eval
    name: step_evaluation
    description: "Evaluate each step for correctness and mark any errors."
    steps_key: steps
    error_types:
      - {name: reasoning, subtypes: [logical_error, factual_error, planning_error]}
      - {name: execution, subtypes: [wrong_tool, wrong_args, api_error]}
    severities:
      - {name: minor, weight: -1}
      - {name: major, weight: -5}
    show_score: true

त्रुटि वर्गीकरण कैसे बनाएँ, इसके लिए देखें एजेंट ट्रैजेक्टरी एनोटेट करना

एजेंटों के लिए Potato क्या नहीं करता

  • यह प्रोडक्शन मॉनिटरिंग सेवा नहीं है। इसमें OpenTelemetry एक्सपोर्ट वाला ट्रेसिंग SDK है, पर कोई होस्टेड क्लाउड नहीं और प्रोडक्शन ट्रैफ़िक की लेटेंसी और लागत के लिए बने डैशबोर्ड नहीं। यह सिर्फ़ ख़ुद होस्ट होता है।
  • यह समीक्षक नहीं देता। अपने लाएँ, या उन्हें Prolific पर भर्ती करें।

अक्सर पूछे जाने वाले प्रश्न

मानव समीक्षा के लिए LangSmith और Langfuse में क्या फ़र्क़ है?

दोनों एनोटेशन कतारों के ज़रिए ट्रेस और स्पैन पर मानव स्कोर लगाते हैं। LangSmith प्रोप्राइटरी है, इसके Enterprise प्लान में ख़ुद होस्ट किया जा सकता है, और यह हर रन पर कई समीक्षक और जोड़ी वाली कतारें सपोर्ट करता है। Langfuse MIT लाइसेंस वाला है और मुफ़्त में ख़ुद होस्ट होता है, और इसके फ़ोरम में उपयोगकर्ता बताते हैं कि दो लोग अभी किसी कतार में एक ही ट्रेस को स्वतंत्र रूप से स्कोर नहीं कर सकते। दोनों में से कोई भी मानव समीक्षकों के बीच सहमति का आँकड़ा दस्तावेज़ित नहीं करता।

क्या एजेंट मूल्यांकन के लिए LangSmith का कोई ओपन-सोर्स विकल्प है?

ट्रेसिंग और स्कोरिंग के लिए Langfuse (MIT) और Comet Opik (Apache-2.0) ओपन-सोर्स हैं और मुफ़्त में ख़ुद होस्ट होते हैं। मानव मूल्यांकन अध्ययनों के लिए, जिनमें हर ट्रेस पर कई समीक्षक, हर चरण के लेबल और सहमति हो, Potato ओपन-सोर्स और मुफ़्त है। Potato LangSmith और Langfuse के एक्सपोर्ट पढ़ता है, इसलिए यह दोनों में से किसी के भी साथ चल सकता है।

एजेंट ट्रेस के मानव समीक्षकों के बीच सहमति कैसे मापूँ?

हर ट्रेस कम से कम दो ऐसे समीक्षकों को दें जो एक-दूसरे के लेबल न देख सकें, फिर हर प्रश्न के लिए दो समीक्षकों पर Cohen का κ या ज़्यादा पर Krippendorff का α निकालें। हर चरण के लेबल के लिए पहले चरणों का मिलान करना होता है। इंटर-एनोटेटर सहमति की व्याख्या गुणांक के चुनाव के बारे में बताती है।

क्या मैं LangSmith या Langfuse के ट्रेस के साथ Potato इस्तेमाल कर सकता हूँ?

हाँ। python -m potato.trace_converter LangSmith के रन एक्सपोर्ट को --input-format langchain से और Langfuse के एक्सपोर्ट को --input-format langfuse से कन्वर्ट करता है। प्रोडक्शन ट्रेसिंग जहाँ है वहीं रखें, और जिन ट्रेस का आकलन करना है उन्हें Potato में लाएँ।

आगे पढ़ें