Skip to content

AI 에이전트 평가 도구 비교: LangSmith, Langfuse, Phoenix, Potato

LangSmith, Langfuse, Arize Phoenix, Braintrust, Opik, W&B Weave, Potato를 에이전트 트레이스의 사람 검토 기준으로 비교합니다. 어노테이션 큐, 단계별 레이블, 일치도, 자체 호스팅을 정리했습니다.

AI 에이전트 평가 도구는 두 종류로 나뉩니다. LangSmith, Langfuse, Arize Phoenix, Braintrust, Opik 같은 관측(observability) 플랫폼은 프로덕션에서 에이전트를 추적하고, 검토자가 실행과 스팬에 점수를 붙일 수 있게 합니다. Potato 같은 어노테이션 도구는 사람이 참여하는 연구에서 출발합니다. 트레이스마다 여러 검토자가 붙고, 단계마다 레이블을 달고, 검토자 간 일치도를 측정합니다. 두 가지는 함께 쓸 수 있습니다. 추적은 지금 하던 곳에서 계속하고, 판정할 실행만 내보낸 뒤, 연구는 어노테이션 도구에서 진행하면 됩니다.

에이전트 트레이스(궤적)는 에이전트가 거친 모든 단계를 기록합니다. 추론 내용, 호출한 도구, 그 도구가 돌려준 결과입니다. 사람의 평가는 실행 전체에 점수를 매길 수도 있고, 단계마다 레이블을 붙일 수도 있고, 두 실행을 나란히 비교할 수도 있습니다. LLM-as-a-Judge는 트레이스를 자동으로 채점하며, 이를 검증하려면 사람의 레이블이 필요합니다. AI 에이전트 평가 방법을 참고하세요.

이 페이지는 에이전트와 LLM 평가를 다룹니다. 모든 데이터 유형을 한 페이지에서 비교한 내용은 AI 주석 도구 비교에 있습니다.

비교해 볼 만한 에이전트 평가 도구는?

도구용도사람 검토
LangSmithLangChain과 LangGraph 애플리케이션의 추적과 평가루브릭 피드백이 있는 어노테이션 큐, 실행당 여러 검토자, 쌍 비교 큐
Langfuse오픈소스 추적, 프롬프트 관리, 평가어노테이션 큐와 범주형·수치형 점수 설정
Arize Phoenix추적과 평가사람, LLM, 코드가 남기는 범주형·연속형·자유 형식 피드백을 위한 어노테이션 설정
Braintrust평가와 로깅사람 검토 점수: 범주형, 연속형, 자유 형식
Comet Opik오픈소스 추적과 평가도메인 전문가와 링크로 공유하는 어노테이션 큐
W&B Weave추적과 평가UI나 API로 정의하는 사람 어노테이션 스코어러
Label Studio범용 어노테이션단계별 검토를 위해 LangGraph, CrewAI, AutoGen 트레이스를 가져옴
Potato사람 어노테이션 연구오류 분류 체계를 갖춘 단계별 레이블, 다중 에이전트 그래프, 쌍 비교, 검토자 간 일치도

저희 기능 비교표에 있는 도구의 자체 호스팅과 가격:

자체 호스팅가격
LangSmithEnterprise 플랜만좌석당 월 39달러
Langfuse무료 (MIT)자체 호스팅 시 무료
Comet Opik무료 (Apache-2.0)자체 호스팅 시 무료
GalileoEnterprise 계약월 100달러
Potato무료 (GPL-3.0)무료

각 플랫폼이 사람의 점수로 하는 일

LangSmith의 어노테이션 큐는 루브릭 피드백 키, 실행당 검토자 수 설정, 쌍 비교 큐, 서로의 피드백을 볼 수 없는 검토자를 지원합니다.

Langfuse는 점수 설정으로 점수를 정의하고, 어노테이션 큐를 통해 트레이스, 관측, 세션을 검토자에게 보냅니다. 커뮤니티 포럼에서는 2025년 11월에, 한 큐 안에서 두 사람이 같은 트레이스를 여전히 독립적으로 어노테이션할 수 없다는 보고가 있었습니다. 그곳에서 논의된 우회 방법은 어노테이터마다 별도의 점수 설정을 두는 것입니다(토론 #4348). Langfuse는 사람 점수와 LLM 심판 점수 사이의 Cohen κ를 한 번에 두 계열씩 계산할 수 있습니다.

Arize Phoenix는 사람, LLM, 코드의 어노테이션에 하나의 구조를 주고, 어노테이션 설정으로 검토마다 레이블이 일관되게 유지되도록 합니다. 어노테이션한 스팬은 데이터셋으로 내보내 실험에 쓰거나, 사람의 판단에 맞춘 평가기를 만드는 데 쓸 수 있습니다.

Braintrust는 로그와 실험에 사람 검토 점수를 붙입니다. 문서에 따르면 일부 검토자에게 점수를 숨기는 기능은 검토 화면을 정리하기 위한 것이지 접근 제어가 아닙니다. 어떤 검토자든 모든 점수를 표시할 수 있기 때문입니다.

Comet Opik은 트레이스와 스레드를 어노테이션 큐에 넣고, 도메인 전문가와 링크로 공유할 수 있게 합니다. 검토 화면은 비기술직 검토자를 위해 만들어졌습니다.

W&B Weave는 UI나 API로 만드는 사람 어노테이션 스코어러로 사람의 피드백을 기록합니다.

2026년 8월과 9월에 확인한 범위에서, LangSmith, Langfuse, Phoenix, Braintrust, Opik의 어노테이션 문서에는 사람 검토자 간 일치도 통계가 없었습니다. 모두 사람의 판단을 점수로 수집합니다. Labelbox와 Scale AI는 에이전트 평가 데이터를 관리형 서비스로 판매하는데, 검토자까지 함께 제공하므로 성격이 다른 구매입니다.

Potato가 다른 점

  • 여러 프레임워크의 트레이스. 변환기가 15가지 형식을 읽습니다. ReAct, OpenAI, Anthropic, LangChain(LangSmith 내보내기 포함), Langfuse, CrewAI·AutoGen·LangGraph의 다중 에이전트 로그, SWE-bench, SWE-Agent, Claude Code, Aider, WebArena, Mind2Web 등 브라우저 녹화, MCP, OpenTelemetry, ATIF입니다.
  • 단계마다 붙는 레이블. trajectory_eval 스키마는 각 단계가 맞았는지, 계층적 분류 체계의 오류 유형, 심각도, 누적 점수를 기록합니다. 같은 레이블이 프로세스 보상 모델의 학습 데이터가 됩니다.
  • 다중 에이전트 구조. 검토자는 상호작용 그래프를 편집하고, 임계 경로를 표시하고, 실패를 특정 에이전트와 단계에 귀속시키고, 인계를 검토합니다. Langfuse의 Agent Graphs 화면은 다중 에이전트 실행을 디버깅용 그래프로 보여 주지만, 검토자가 거기에 어노테이션할 수는 없습니다. 다중 에이전트 시스템 평가 방법을 참고하세요.
  • 검토자 간 일치도. 각 트레이스를 서로의 레이블을 볼 수 없는 여러 검토자에게 배정하고, 어노테이터 간 일치도를 보고합니다. 심판 캘리브레이션은 LLM 심판을 블라인드 사람 레이블과 비교합니다. LLM 심판과 사람 어노테이터의 일치도를 측정하는 방법을 참고하세요.
  • 코딩 에이전트와 컴퓨터 사용 에이전트. 구문 강조가 된 유니파이드 diff, 터미널 출력, 줄에 고정된 검토 코멘트를 보여 줍니다. 컴퓨터 사용 실행에서는 클릭 위치가 표시된 스크린숏을 보여 줍니다. 코딩 에이전트 평가컴퓨터 사용 에이전트 평가를 참고하세요.

트레이스를 Potato로 가져오기

관측 도구에서 검토할 실행을 내보낸 뒤 변환합니다.

bash
python -m potato.trace_converter \
  --input langfuse_traces.json \
  --output data/traces.jsonl \
  --input-format langfuse

LangSmith 실행 내보내기에는 --input-format langchain을 씁니다. 목록에 없는 프레임워크라면 --auto-detect가 필드 이름을 보고 변환기를 고릅니다.

Potato의 단계별 검토 작업

yaml
annotation_schemes:
  - annotation_type: trajectory_eval
    name: step_evaluation
    description: "Evaluate each step for correctness and mark any errors."
    steps_key: steps
    error_types:
      - {name: reasoning, subtypes: [logical_error, factual_error, planning_error]}
      - {name: execution, subtypes: [wrong_tool, wrong_args, api_error]}
    severities:
      - {name: minor, weight: -1}
      - {name: major, weight: -5}
    show_score: true

오류 분류 체계 설계는 에이전트 궤적 어노테이션을 참고하세요.

에이전트에서 Potato가 하지 않는 것

  • 프로덕션 모니터링 서비스가 아닙니다. OpenTelemetry로 내보내는 추적 SDK는 있지만, 호스팅 클라우드나 프로덕션 트래픽의 지연 시간과 비용을 위한 대시보드는 없습니다. 자체 호스팅만 가능합니다.
  • 검토자를 제공하지 않습니다. 직접 구하거나 Prolific에서 모집하세요.

자주 묻는 질문

사람 검토 측면에서 LangSmith와 Langfuse의 차이는 무엇인가요?

둘 다 어노테이션 큐를 통해 트레이스와 스팬에 사람의 점수를 붙입니다. LangSmith는 독점 소프트웨어로, Enterprise 플랜에서 자체 호스팅할 수 있으며 실행당 여러 검토자와 쌍 비교 큐를 지원합니다. Langfuse는 MIT 라이선스로 무료로 자체 호스팅할 수 있지만, 포럼에서는 한 큐 안에서 두 사람이 같은 트레이스를 아직 독립적으로 채점할 수 없다고 보고됩니다. 둘 다 사람 검토자 간 일치도 통계는 문서에 없습니다.

에이전트 평가용 LangSmith의 오픈소스 대안이 있나요?

추적과 채점에는 Langfuse(MIT)와 Comet Opik(Apache-2.0)이 오픈소스이며 무료로 자체 호스팅할 수 있습니다. 트레이스마다 여러 검토자, 단계별 레이블, 일치도가 필요한 사람 평가 연구에는 Potato가 오픈소스이며 무료입니다. Potato는 LangSmith와 Langfuse 내보내기를 읽으므로 둘 중 어느 것과도 함께 쓸 수 있습니다.

에이전트 트레이스를 검토하는 사람들 간의 일치도는 어떻게 측정하나요?

각 트레이스를 서로의 레이블을 볼 수 없는 두 명 이상의 검토자에게 배정하고, 질문마다 두 명이면 Cohen κ를, 그보다 많으면 Krippendorff α를 계산하세요. 단계별 레이블은 먼저 단계를 짝지어야 합니다. 계수 선택은 어노테이터 간 일치도 설명에서 다룹니다.

LangSmith나 Langfuse의 트레이스를 Potato에서 쓸 수 있나요?

네. python -m potato.trace_converter는 LangSmith 실행 내보내기를 --input-format langchain으로, Langfuse 내보내기를 --input-format langfuse로 변환합니다. 프로덕션 추적은 그대로 두고, 판정할 트레이스만 Potato로 가져오면 됩니다.

더 읽어보기