Skip to content
Обновлено в v2.8

Оценивайте ИИ-агентов на любом уровне

Размечайте трассы агентов из любого фреймворка. Оценивайте траекторию целиком, отдельные шаги или конкретные ошибки рассуждения. Наблюдайте за работой агентов в реальном времени. Сравнивайте подходы бок о бок.

5Типов отображения
13Форматов трасс
14Примеров проектов
3Бэкендов для живой работы

Пять специализированных типов отображения

Каждый тип отображения заточен под свою модальность агента — работу с инструментами, веб-сёрфинг, написание кода, чат или наблюдение вживую.

🔄

Отображение трассы агента

Карточки шагов с цветовой маркировкой для агентов, использующих инструменты. Шаги «мысль», «действие», «наблюдение» и «ошибка» со сворачиваемыми блоками и форматированием JSON.

🌐

Просмотр трасс веб-агента

Скриншоты с SVG-оверлеями, показывающими места кликов, ограничивающие рамки и траектории прокрутки. Лента миниатюр для быстрой навигации.

💬

Интерактивный чат

Живой диалог с ИИ-агентами или разбор записанных диалогов. Оценки по каждой реплике появляются прямо под сообщением.

📡

Просмотр агента вживую

Наблюдение в реальном времени с паузой, продолжением, отправкой инструкций и перехватом управления. Действия агента передаются через SSE по мере работы.

💻

Отображение трассы кодового агента

Сделано специально для кодовых агентов. Единый вид диффа, тёмные терминальные блоки, чтение файлов с номерами строк и боковое дерево файлов.

Схемы разметки для агентов

Специализированные схемы для структурной оценки агентов на уровне трассы, шага и сравнения.

trajectory_eval

Оценка траектории

Локализация ошибок по шагам с иерархическими таксономиями ошибок, оценкой серьёзности и текущим счётом, который уменьшается в зависимости от серьёзности.

rubric_eval

Оценка по рубрике

Многокритериальная сетка в стиле MT-Bench. Задайте свои критерии и шкалы оценок. Разметчики оценивают каждое измерение независимо.

pairwise

Попарное сравнение

Сравнение двух трасс агентов бок о бок. Три режима: бинарное предпочтение, непрерывная шкала и многокритериальная оценка по измерениям.

per_turn_rating

Оценки по репликам

Привязывайте схемы оценивания прямо к репликам диалога. Настройте, реплики каких участников оцениваются. Оценки появляются прямо под репликой.

process_reward

Процессное вознаграждение

Отметьте первый ошибочный шаг — все последующие пометятся автоматически. Или оценивайте каждый шаг отдельно. Экспорт сразу в формат для обучения PRM.

code_review

Ревью кода

Разметка в стиле пул-реквестов GitHub: комментарии прямо в диффе, оценки качества по файлам и вердикты «принять/отклонить» для вывода кодового агента.

Импорт трасс из любого фреймворка

Potato приводит трассы из 13 агентных фреймворков к универсальному формату. Используйте конвертер в CLI или приём через вебхук в реальном времени.

КонвертерИсточникКлючевые возможности
LangChain / LangSmithЭкосистема LangChainИерархия запусков, вызовы инструментов
LangfuseНаблюдаемость LangfuseСпаны наблюдений, оценки
OpenAIAPI OpenAIВызов функций, ассистенты
Anthropic ClaudeAPI AnthropicРабота с инструментами, блоки рассуждений
MCPModel Context ProtocolВызовы инструментов и ресурсов
OpenTelemetryРаспределённые системыИерархия спанов, атрибуты
ATIFАкадемический форматСтандартный обмен
WebArenaВеб-бенчмаркиСкриншоты, указание на элементы
Сырые данные браузераЗаписи из браузераHAR и скриншоты
Claude CodeAnthropic Messages APIБлоки работы с инструментами, диффы кода
AiderСессии чата AiderБлоки правок в Markdown
SWE-AgentБенчмарки по кодуМысль / действие / наблюдение
ReActУниверсальные агентыМысль / действие / наблюдение

Оценка кодовых агентов

Специализированная отрисовка для Claude Code, Aider, SWE-Agent и других ИИ-ассистентов по коду с отображением диффов, терминала и файлов.

Единый вид диффа с красно-зелёной подсветкой
Тёмные терминальные блоки для вывода bash
Боковое дерево со всеми затронутыми файлами
Разметка процессных вознаграждений для обучения PRM
Ревью кода прямо в диффе, как в пул-реквестах GitHub
Конвертеры для Claude Code, Aider, SWE-Agent
# Quick start
pip install potato-annotation
potato start examples/agent-traces/coding-agent-eval/config.yaml -p 8000

Наблюдайте за работой агентов в реальном времени

Смотрите, как кодовые агенты читают файлы, правят код и запускают тесты. Вмешивайтесь, когда они ошибаются.

Ollama

Полностью локально, ключ API не нужен. Любая совместимая с Ollama модель.

API Anthropic

Claude с работой через инструменты для сессий кодового агента.

Claude Agent SDK

Все возможности Claude Code с работой через инструменты и операциями над файлами.

Пауза / продолжить
Отправить инструкции
Откат к контрольной точке
Ветвление и повтор

Как Potato выглядит на фоне других

Единственный бесплатный инструмент с размещением у себя, где есть отрисовка диффов кодовых агентов, разметка PRM, наблюдение вживую и конвертация трасс из 13 форматов.

ВозможностьPotatoLangSmithLangfuseLabel StudioArgillaScale AI
Поддержка форматов трасс13 форматовТолько LangChainТолько LangfuseУниверсальныйУниверсальныйСвой формат
Разметка по шагамtrajectory_eval и PRMОграниченноОграниченноДаНетДа
Наблюдение за агентом в реальном времениДаНетНетНетНетНет
Пауза, продолжение и перехват управленияДаНетНетНетНетНет
Отрисовка диффов кодаДаНетНетНетНетНет
Отрисовка вывода терминалаДаНетНетНетНетНет
Сбор данных для PRMДаНетНетНетНетНет
Ревью кода с комментариями в строкахДаНетНетНетНетНет
Попарное сравнение агентов3 режимаНетНетНетНетДа
Многокритериальная рубрикаДаНетНетНетНетДа
Размещение у себяДаНетДаДаДаНет
БесплатноДаНетЧастичноЧастичноДаНет

14 готовых к запуску примеров проектов

К каждому примеру идут конфигурация, тестовые данные и документация. Любой пример запускается меньше чем за минуту.

Оценка трассы агента

Успешность задачи, таксономия ошибок MAST, оценки по репликам и разметка спанов

Разбор веб-агента

Трассы веб-сёрфинга со скриншотами, SVG-оверлеями и лентой кадров

Создание трасс веб-агента

Разметчики сами ходят по сайтам, и их действия становятся данными трассы

Оценка агента вживую

Смотрите, как ИИ-агент ходит по сайтам, с паузой и отправкой инструкций

Интерактивная оценка VLM

Наблюдение за визуально-языковой моделью с оцениванием через trajectory_eval

Оценка на SWE-bench

Оценка патчей кодового агента с отрисовкой диффов и разметкой PRM

Оценка Anthropic

Оценка трасс работы Claude с инструментами и корректности каждого шага

Оценка OpenAI

Оценка трасс вызова функций OpenAI и таксономия ошибок

Интеграция с LangChain

Приём трасс из LangSmith в реальном времени через вебхук

Оценка мультиагентных систем

Трассы координации агентов в CrewAI, AutoGen и LangGraph

Сравнение агентов

A/B-сравнение агентов бок о бок с бинарным предпочтением

Сравнение по нескольким измерениям

Попарная оценка по каждому измерению с обязательным обоснованием

Оценка RAG

Конвейер RAG: релевантность поиска, достоверность ответа и цитирование

Оценка визуальных агентов

Точность привязки к элементам GUI и оценка навигации

Начните оценивать агентов уже сегодня

Установите Potato и проведите первую оценку агента меньше чем за пять минут. Бесплатно, с открытым кодом и размещением у себя.