Оценивайте ИИ-агентов на любом уровне
Размечайте трассы агентов из любого фреймворка. Оценивайте траекторию целиком, отдельные шаги или конкретные ошибки рассуждения. Наблюдайте за работой агентов в реальном времени. Сравнивайте подходы бок о бок.
Пять специализированных типов отображения
Каждый тип отображения заточен под свою модальность агента — работу с инструментами, веб-сёрфинг, написание кода, чат или наблюдение вживую.
Отображение трассы агента
Карточки шагов с цветовой маркировкой для агентов, использующих инструменты. Шаги «мысль», «действие», «наблюдение» и «ошибка» со сворачиваемыми блоками и форматированием JSON.
Просмотр трасс веб-агента
Скриншоты с SVG-оверлеями, показывающими места кликов, ограничивающие рамки и траектории прокрутки. Лента миниатюр для быстрой навигации.
Интерактивный чат
Живой диалог с ИИ-агентами или разбор записанных диалогов. Оценки по каждой реплике появляются прямо под сообщением.
Просмотр агента вживую
Наблюдение в реальном времени с паузой, продолжением, отправкой инструкций и перехватом управления. Действия агента передаются через SSE по мере работы.
Отображение трассы кодового агента
Сделано специально для кодовых агентов. Единый вид диффа, тёмные терминальные блоки, чтение файлов с номерами строк и боковое дерево файлов.
Схемы разметки для агентов
Специализированные схемы для структурной оценки агентов на уровне трассы, шага и сравнения.
Оценка траектории
Локализация ошибок по шагам с иерархическими таксономиями ошибок, оценкой серьёзности и текущим счётом, который уменьшается в зависимости от серьёзности.
Оценка по рубрике
Многокритериальная сетка в стиле MT-Bench. Задайте свои критерии и шкалы оценок. Разметчики оценивают каждое измерение независимо.
Попарное сравнение
Сравнение двух трасс агентов бок о бок. Три режима: бинарное предпочтение, непрерывная шкала и многокритериальная оценка по измерениям.
Оценки по репликам
Привязывайте схемы оценивания прямо к репликам диалога. Настройте, реплики каких участников оцениваются. Оценки появляются прямо под репликой.
Процессное вознаграждение
Отметьте первый ошибочный шаг — все последующие пометятся автоматически. Или оценивайте каждый шаг отдельно. Экспорт сразу в формат для обучения PRM.
Ревью кода
Разметка в стиле пул-реквестов GitHub: комментарии прямо в диффе, оценки качества по файлам и вердикты «принять/отклонить» для вывода кодового агента.
Импорт трасс из любого фреймворка
Potato приводит трассы из 13 агентных фреймворков к универсальному формату. Используйте конвертер в CLI или приём через вебхук в реальном времени.
| Конвертер | Источник | Ключевые возможности |
|---|---|---|
| LangChain / LangSmith | Экосистема LangChain | Иерархия запусков, вызовы инструментов |
| Langfuse | Наблюдаемость Langfuse | Спаны наблюдений, оценки |
| OpenAI | API OpenAI | Вызов функций, ассистенты |
| Anthropic Claude | API Anthropic | Работа с инструментами, блоки рассуждений |
| MCP | Model Context Protocol | Вызовы инструментов и ресурсов |
| OpenTelemetry | Распределённые системы | Иерархия спанов, атрибуты |
| ATIF | Академический формат | Стандартный обмен |
| WebArena | Веб-бенчмарки | Скриншоты, указание на элементы |
| Сырые данные браузера | Записи из браузера | HAR и скриншоты |
| Claude Code | Anthropic Messages API | Блоки работы с инструментами, диффы кода |
| Aider | Сессии чата Aider | Блоки правок в Markdown |
| SWE-Agent | Бенчмарки по коду | Мысль / действие / наблюдение |
| ReAct | Универсальные агенты | Мысль / действие / наблюдение |
Оценка кодовых агентов
Специализированная отрисовка для Claude Code, Aider, SWE-Agent и других ИИ-ассистентов по коду с отображением диффов, терминала и файлов.
Наблюдайте за работой агентов в реальном времени
Смотрите, как кодовые агенты читают файлы, правят код и запускают тесты. Вмешивайтесь, когда они ошибаются.
Ollama
Полностью локально, ключ API не нужен. Любая совместимая с Ollama модель.
API Anthropic
Claude с работой через инструменты для сессий кодового агента.
Claude Agent SDK
Все возможности Claude Code с работой через инструменты и операциями над файлами.
Как Potato выглядит на фоне других
Единственный бесплатный инструмент с размещением у себя, где есть отрисовка диффов кодовых агентов, разметка PRM, наблюдение вживую и конвертация трасс из 13 форматов.
| Возможность | Potato | LangSmith | Langfuse | Label Studio | Argilla | Scale AI |
|---|---|---|---|---|---|---|
| Поддержка форматов трасс | 13 форматов | Только LangChain | Только Langfuse | Универсальный | Универсальный | Свой формат |
| Разметка по шагам | trajectory_eval и PRM | Ограниченно | Ограниченно | Да | Нет | Да |
| Наблюдение за агентом в реальном времени | Да | Нет | Нет | Нет | Нет | Нет |
| Пауза, продолжение и перехват управления | Да | Нет | Нет | Нет | Нет | Нет |
| Отрисовка диффов кода | Да | Нет | Нет | Нет | Нет | Нет |
| Отрисовка вывода терминала | Да | Нет | Нет | Нет | Нет | Нет |
| Сбор данных для PRM | Да | Нет | Нет | Нет | Нет | Нет |
| Ревью кода с комментариями в строках | Да | Нет | Нет | Нет | Нет | Нет |
| Попарное сравнение агентов | 3 режима | Нет | Нет | Нет | Нет | Да |
| Многокритериальная рубрика | Да | Нет | Нет | Нет | Нет | Да |
| Размещение у себя | Да | Нет | Да | Да | Да | Нет |
| Бесплатно | Да | Нет | Частично | Частично | Да | Нет |
14 готовых к запуску примеров проектов
К каждому примеру идут конфигурация, тестовые данные и документация. Любой пример запускается меньше чем за минуту.
Оценка трассы агента
Успешность задачи, таксономия ошибок MAST, оценки по репликам и разметка спанов
Разбор веб-агента
Трассы веб-сёрфинга со скриншотами, SVG-оверлеями и лентой кадров
Создание трасс веб-агента
Разметчики сами ходят по сайтам, и их действия становятся данными трассы
Оценка агента вживую
Смотрите, как ИИ-агент ходит по сайтам, с паузой и отправкой инструкций
Интерактивная оценка VLM
Наблюдение за визуально-языковой моделью с оцениванием через trajectory_eval
Оценка на SWE-bench
Оценка патчей кодового агента с отрисовкой диффов и разметкой PRM
Оценка Anthropic
Оценка трасс работы Claude с инструментами и корректности каждого шага
Оценка OpenAI
Оценка трасс вызова функций OpenAI и таксономия ошибок
Интеграция с LangChain
Приём трасс из LangSmith в реальном времени через вебхук
Оценка мультиагентных систем
Трассы координации агентов в CrewAI, AutoGen и LangGraph
Сравнение агентов
A/B-сравнение агентов бок о бок с бинарным предпочтением
Сравнение по нескольким измерениям
Попарная оценка по каждому измерению с обязательным обоснованием
Оценка RAG
Конвейер RAG: релевантность поиска, достоверность ответа и цитирование
Оценка визуальных агентов
Точность привязки к элементам GUI и оценка навигации
Начните оценивать агентов уже сегодня
Установите Potato и проведите первую оценку агента меньше чем за пять минут. Бесплатно, с открытым кодом и размещением у себя.