Skip to content

Оценка агентов

Ответы на распространённые вопросы о Potato. Не нашли нужного? Заходите в наш Discord или загляните в документацию.

Оценка агентов

Да. В Potato есть встроенные конвертеры трасс для Claude Code, OpenCode, Cursor, Aider и SWE-Agent. Вызовы инструментов отрисовываются специализированным интерфейсом: красно-зелёный единый дифф для Edit/Write, тёмные моноширинные терминальные блоки для Bash, код с номерами строк для Read/Grep и боковое дерево, группирующее все затронутые файлы по операциям. Длинный вывод сворачивается автоматически.

Да. В Potato есть отображение веб-агента с SVG-оверлеями для маркеров кликов, ограничивающих рамок, траекторий мыши и индикаторов прокрутки. Два режима: режим разбора с навигацией по ленте заранее записанных скриншотов и режим создания с живым сёрфингом в iframe и автоматической записью действий. Конвертеры трасс идут для форматов WebArena, Mind2Web и Anthropic Computer Use.

Да. Potato рисует запуск мультиагентной системы как кликабельный граф агентов и передач управления и добавляет схемы, чтобы отнести сбой к конкретному агенту и шагу, проверить каждую передачу на рассогласование между агентами, оценить и отдельных агентов, и команду целиком, а также отметить конкуренцию за инструменты и эмерджентное поведение. Подробности — в документации по оценке мультиагентных команд.

Да. В Potato есть специализированные схемы для мультимодальных агентов: траектории работы с GUI и компьютером со скриншотами по шагам и привязкой кликов, полнодуплексные голосовые таймлайны с детекцией перебивания, временная привязка в видео с живым IoU относительно предсказания модели, разметка ошибок по выровненной расшифровке речи, чередующиеся мультимодальные рассуждения и структура табличной сетки в документах. Подробности — в документации по оценке мультимодальных агентов.

Да. Режим живого агента подключает визуальную LLM (Anthropic Claude через Playwright) к headless-браузеру. Агент делает скриншоты, LLM планирует действия, а Potato транслирует сессию разметчику через Server-Sent Events. Разметчик может поставить на паузу, отправить инструкции или перехватить управление посреди сессии. Настраивается типом отображения `live_agent`.

Да. Режим кодового агента поддерживает контрольные точки и откат на любом шаге, а также ветвление и повтор для разбора альтернативных траекторий. Это полезно для контрфактической оценки, A/B-сравнения решений агента и сбора качественных обучающих данных, когда разметчик пошагово улучшает запуск агента.

Да. Схема trajectory_eval (на основе TRAIL и AgentRewardBench) показывает каждый шаг карточкой. Разметчики отмечают корректность, относят ошибку к типу из настраиваемой таксономии с подтипами (рассуждение, исполнение, безопасность и т. д.), проставляют серьёзность со взвешенными баллами и пишут обоснование к каждому шагу. Итоговый показатель качества считается автоматически, суммируя штрафы за серьёзность по всей траектории.

Да. В Potato есть схемы процессного вознаграждения и ревью кода для пошаговой оценки кодовых агентов. Оба типа разметки выгружаются сразу в форматы PRM и DPO для последующего обучения по RLHF. Смотрите пример проекта coding-agent-evaluation.

Да. Боковая панель чата с LLM — это сворачиваемый ИИ-помощник с многоходовым диалогом. Он получает в контекст описание задачи, набор меток и текст текущего объекта. Многоходовой режим изначально поддерживается для OpenAI, Anthropic и Ollama. Все диалоги записываются как поведенческие данные для последующего анализа взаимодействия разметчика с LLM.

Да. Potato конвертирует трассы LangChain/LangSmith автоматически. Можно также настроить приём трасс в реальном времени через вебхук — новые трассы будут появляться в очереди разметчика по мере поступления.

Да. Установите `pip install potato-annotation[langchain]` и подключите `PotatoCallbackHandler` к своей цепочке. Он отслеживает вложенные запуски цепочек, LLM и инструментов и по завершении корневого запуска отправляет в Potato данные в формате LangSmith. Вместе с приёмником вебхуков это позволяет заводить живые трассы агента в очереди разметки без ручного экспорта.

Тринадцать форматов в трёх категориях. **Фреймворки**: LangChain, LangFuse, OpenAI, Anthropic, MCP (Model Context Protocol), OpenTelemetry, ATIF. **Веб-агенты**: WebArena, сырые веб-трассы. **Кодовые агенты**: Claude Code, Aider, SWE-Agent. Плюс универсальный приём JSONL со схемой `structured_turns` для любого своего формата. Полный список — на /integrations.

Да. В проекте по кодовому агенту на одну и ту же трассу можно наложить trajectory_eval (ошибки по шагам), разметку спанов (выделение галлюцинаций в рассуждениях агента), попарное сравнение (какой агент справился лучше) и шкалы Лайкерта (общее качество). Многосхемная архитектура Potato означает, что разметчик видит все схемы в одном интерфейсе для одной трассы.

Нет. Живой агент поддерживает Ollama для полностью локального инференса без ключа API. Подойдёт любая совместимая с Ollama модель с поддержкой зрения. Для кодовых агентов годится любая модель Ollama.

Да. Potato поддерживает форматы трасс CrewAI, AutoGen и LangGraph. Пример оценки мультиагентной системы показывает, как разбирать координацию агентов, дублирование работы и качество коммуникации.

Используйте универсальный конвертер ReAct (формат «мысль/действие/наблюдение») или API вебхука, чтобы присылать трассы в любом формате JSON. Potato распознаёт распространённые структуры автоматически. Можно также написать свой конвертер на Python.

Да. В режиме живого агента разметчик может поставить агента на паузу, отправить текстовые инструкции или перехватить управление вручную. Для кодовых агентов можно откатиться к любой контрольной точке и продолжить с другими инструкциями.

Используйте экспортёр agent_eval: `python -m potato.export -f agent_eval -o results/`. Для данных PRM возьмите `-f prm`. Для пар предпочтений DPO/RLHF — `-f dpo`. Экспорт выдаёт формат JSON/CSV.

Остались вопросы?

Наше сообщество готово помочь. Заходите в Discord за живой поддержкой или изучите подробные руководства в документации.