Сравнение инструментов разметки с ИИ: открытые и платные
Сравнение 14 инструментов и платформ разметки для текста, изображений, 3D и оценки агентов: кто использует ИИ для предразметки и что на самом деле входит в бесплатный тариф.
Инструмент разметки — это программа, которая присваивает метки тексту, изображениям, аудио, видео или выводу модели, чтобы результат можно было использовать для обучения или оценки системы. В этом руководстве 14 открытых и коммерческих инструментов сравниваются по охвату модальностей, помощи ИИ при разметке, метрикам согласованности и тому, что реально входит в бесплатный тариф каждого.
Единственного лучшего инструмента нет. Выбор зависит от того, что вы размечаете, от бюджета, от того, нужна ли вам оценка агентов или LLM, и от того, сколько возни с настройкой вы готовы стерпеть.
Какие инструменты разметки стоит сравнивать?
| Инструмент | Лицензия | Сильные стороны | Когда подходит |
|---|---|---|---|
| Potato | Бесплатно, открытый код (исследования) | 61 тип задач по тексту, изображениям, аудио, видео, 3D и робототехнике, оценка агентов и LLM, YAML без кода, встроенные метрики согласованности | Исследования, оценка агентов и LLM, быстрая настройка без кода |
| Label Studio | Открытый код + платные тарифы | Широкий охват модальностей, вылизанный интерфейс, большая экосистема | Командам, которым нужна платформа с коммерческой поддержкой |
| Prodigy | Платный (коммерческий) | Скриптуемость, упор на активное обучение, тесная связка со spaCy | Пользователям spaCy, которых устраивает платный инструмент с упором на код |
| Doccano | Открытый код | Простой, аккуратный, легко развернуть у себя | Прямолинейная классификация текста и NER |
| brat | Открытый код (не поддерживается) | Спаны, отношения, n-арные события, кореференция | Чтение или расширение корпуса, уже размеченного в brat |
| INCEpTION | Открытый код | Богатая лингвистическая разметка, связывание с базами знаний | Глубоким лингвистическим проектам, готовым вложиться в настройку |
| Argilla | Открытый код | Упор на данные для LLM, интеграция с Hugging Face | Сбор данных для обратной связи и RLHF внутри стека HF |
| CVAT | Открытый код | Разметка изображений и видео для компьютерного зрения | Ограничивающие рамки, маски и разметка видео в CV |
| Labelbox / Scale | Коммерческие (платные) | Управляемая платформа, услуги большой команды разметчиков | Компаниям, которые покупают и инструмент, и рабочую силу |
(Со временем всё меняется; актуальные лицензии и возможности проверяйте на сайте каждого проекта.)
Колонка с лицензией скрывает одну вещь: что на самом деле входит в бесплатный тариф. В community-редакции Label Studio нет вообще никаких метрик согласованности разметчиков. Тариф Starter за $99 в месяц плюс $49 за каждого дополнительного пользователя добавляет ограниченный набор метрик согласованности и панели эффективности разметчиков, а полный набор есть только в Enterprise. У Prodigy бесплатного тарифа нет. CVAT относит свой интерфейс контроля качества к платным. Если вы выбираете по контролю качества, а не по охвату модальностей, сравнивайте бесплатные редакции, а не маркетинговые страницы. Мы ведём матрицу возможностей по одиннадцати инструментам, сверенную с их собственной документацией.
Сравнения по типу данных
Каждая из этих страниц подробнее разбирает один тип данных: больше инструментов и детали, важные именно для него.
- Инструменты разметки текста и NLP: INCEpTION, Prodigy, doccano, brat и Argilla
- Инструменты разметки аудио и речи: ELAN, Praat, Label Studio и Prodigy
- Инструменты разметки изображений: CVAT, Roboflow, V7, Supervisely и X-AnyLabeling
- Инструменты разметки видео: CVAT, Label Studio, ELAN и BORIS
- Инструменты оценки ИИ-агентов: LangSmith, Langfuse, Arize Phoenix, Braintrust и Opik
- Оценка моделей мира и эпизодов роботов: VBench, WorldModelBench, Physics-IQ и ATLAS
Какие инструменты разметки используют ИИ для предразметки?
За словами «инструмент разметки с ИИ» скрываются три разные возможности, которые обычно продают как одну, и наличие одной часто означает отсутствие остальных.
- Геометрия с помощью модели. Кликаете или обводите примерно, а модель сегментации уточняет границу. Potato делает это в браузере без GPU; CVAT — через Nuclio или свой путь с ИИ-агентами; Label Studio — через ML-бэкенд; у Roboflow, V7, Supervisely и Segments.ai это встроено в продукт.
- Разметка по промпту. Вы вводите название объекта и получаете маску или рамку вместо выбора из фиксированного списка. Это умеют Potato, Roboflow и V7. Смотрите разметку объектов по названию.
- Предразметка через LLM и VLM. Модель предлагает метки для пачки объектов, а разметчики их проверяют. Potato обращается для этого к 13 типам эндпоинтов и умеет также давать визуально-языковой модели раскритиковать готовую разметку.
Предразметка меняет то, что должен ловить контроль качества. Разметчики, которые принимают подсказки не читая, поднимают любые показатели согласованности и одновременно снижают точность, а тайминги — единственный сигнал, отличающий проверку от бездумного подтверждения. Смотрите обнаружение бездумно принятой предразметки.
Potato не обучает модели и не обслуживает их. Он упорядочивает объекты, обращается к моделям, на которые вы его направили, и записывает, что разметчик сделал с результатом.
Текст и NLP
Potato начинался как инструмент для текста. Система, представленная на EMNLP 2022, размечала текст и ничего больше, и все возможности по зрению из следующего раздела моложе на четыре года.
Все шесть инструментов отсюда умеют классификацию и разметку последовательностей. Текстовые схемы Potato сверх этого:
| Схема | Что делает |
|---|---|
span | Выделение, с разрывными фрагментами и связыванием сущностей с базой знаний |
span_link | Типизированные отношения между спанами, через которые задаются и деревья зависимостей, и деревья составляющих |
coreference | Объединение упоминаний в цепочки |
event_annotation | N-арные события с триггером и типизированными аргументами |
error_span | Типизированная серьёзность в стиле MQM, для оценки перевода и генерации |
multi_document_event | Слоты шаблона, заполняемые свидетельствами из нескольких документов |
text_edit | Постредактирование с отслеживанием изменений |
tree_annotation | Деревья диалогов с выбором пути |
Согласованность по спанам
В таблице по зрению ниже есть строка про согласованность по геометрии с поправкой на случайность. У текста та же проблема и более старая литература по ней: два разметчика, отмечающие одну и ту же сущность, редко сходятся в точных границах, а метрика, сравнивающая метки токен за токеном, штрафует их за разногласие, которого не было.
Для схем спанов считаются κ на уровне токенов по BIO-тегам, F1 по спанам при точном и частичном совпадении, альфа Криппендорфа в юнитизирующей форме и γ из Mathet et al. (2015). Последние две оценивают, где спан начинается и кончается, а не только то, как он назван. Смотрите измерение согласованности по спанам.
Остальные текстовые инструменты
INCEpTION — ближайший аналог для лингвистической работы, и по базам знаний он впереди. Слои отношений, слои цепочек для кореференции, многотокенные спаны, признаки-концепты, связывающие разметку с классом или экземпляром в базе знаний, и рекомендатель для связывания именованных сущностей — всё это первоклассно, а на странице согласованности сообщаются общепринятые меры. Разворачивать его тяжелее, чем остальные из списка.
Prodigy имеет интерфейс отношений для направленных и ненаправленных связей, привязанных к словам или фразам, и рецепт coref.manual с настройками для кореференции. Он платный, ориентирован на код и сцеплен со spaCy теснее, чем что-либо ещё здесь.
Doccano быстрее всех поднимается для текста. Типы его проектов — классификация документов, разметка последовательностей, seq2seq, определение интента и заполнение слотов, распознавание речи плюс четыре типа для изображений. У проектов по разметке последовательностей есть флаги для перекрывающихся спанов и для отношений. Кореференции и разметки событий нет, метрик согласованности тоже.
Label Studio имеет тег Relations, связывающий размеченные области, и работает с аудио, изображениями, HTML, абзацами, текстом, временными рядами и видео, а не только с текстом. Метрики согласованности в тарифе Starter ограничены, полный набор есть в Enterprise.
brat — то, в чём построена изрядная часть корпусов NLP. Его standoff-формат покрывает привязанные к тексту сущности, n-арные события с триггерами и аргументами, бинарные отношения, множества эквивалентности, атрибуты, нормализации по внешнему ресурсу и заметки. Он же не поддерживается. Последний релиз — v1.3 «Crunchy Frog» от ноября 2012 года, последний коммит в master — октябрь 2021, открытых issue 493. На домашней странице он до сих пор описан как простой в установке. Пакета для установки нет, install.sh датирован 2012 годом, а автономный сервер импортирует модуль cgi, объявленный устаревшим в Python 3.11 и удалённый в 3.13, так что на современном Python он без прослойки не запустится. Прочитать существующий корпус brat — совсем не то же самое, что поднять brat для сбора нового.
Начиная с версии 2.9, Potato импортирует standoff-формат brat, JSONL из doccano, файлы db-out из Prodigy и CoNLL, так что корпус, начатый в любом из этих инструментов, можно продолжить в Potato. Существующие метки приходят как предразметка. Отношения и события brat не импортируются, а перечисляются в предупреждениях импорта. См. Импорт проекта.
Сверено с документацией и репозиторием каждого проекта в августе 2026 года.
Зрение, 3D и оценка моделей
Возможности Potato по компьютерному зрению, пространственным данным и оценке моложе текстовых. Эта таблица фиксирует, кто в чём силён, а не расставляет места.
| Возможность | Potato | CVAT | Label Studio | Roboflow | V7 | Supervisely | Segments.ai |
|---|---|---|---|---|---|---|---|
| Бесплатное размещение у себя | Да | Да (MIT) | Community-ред. | - | - | Community-ред. | - |
| Рамки, полигоны, маски | Да | Да | Да | Да | Да | Да | Да |
| Интерактивная сегментация | В браузере, без GPU | Через Nuclio | Через ML-бэкенд | Да | Да | Да | Да |
| Сегментация по текстовому промпту | Да (в браузере) | - | Через ML-бэкенд | Да (SAM 3) | Да (SAM 3) | Через приложения | - |
| Ключевые точки и скелеты | Да | Да | Да | Да | Да | Да | Да |
| Полилинии, эллипсы, 2D-кубоиды | Да | Да | Частично | Частично | Да | Да | Да |
| Атрибуты у каждого объекта | - | Да | Да | Да | Да | Да | Да |
| Трекинг на видео с интерполяцией | Да | Да | Частично | Частично | Да | Да | Да |
| Перенос масок моделью | Да (SAM 2, на сервере) | Через ИИ-агентов | Через ML-бэкенд | Да | Да | Да | Да |
| Глубокий зум / гигапиксели | Да (DZI + IIIF) | Частично | - | - | Да | Да | - |
| Трёхмерные облака точек и кубоиды | Да | Да | - | - | - | Да | Да |
| Последовательности облаков точек | - | Да | - | - | - | Да | Да |
| Слияние сенсоров (2D↔3D) | Да | Частично | - | - | - | Да | Да |
| Карты глубины с оконным преобразованием | Да | - | - | - | Частично | - | - |
| DICOM / NIfTI / WSI | - | - | - | - | Да | Да | - |
| Обучение модели в том же продукте | - | Частично | - | Да | Да | Да | - |
| Импорт CV-форматов | 15 форматов | Обширный | Частично | Обширный | Частично | Обширный | Частично |
| Согласованность по геометрии с поправкой на случайность | Да | - | - | - | - | - | - |
| Эпизоды роботов (LeRobot, RLDS, HDF5) | Да | - | - | - | - | - | - |
| Оценка генеративного видео и world-моделей | Да | - | - | - | - | - | - |
| Оценка привязки и указания у VLM | Да | - | - | - | - | - | - |
По большинству строк зрелые CV-платформы не уступают Potato или превосходят его. Две строки стоит прочитать внимательно, а не как галочку: сегментация по текстовому промпту у Potato работает в браузере на модели под Apache-2.0, тогда как коммерческие аналоги работают на сервере на некоммерческих условиях SAM 3, а перенос масок у Potato выполняется на сервере, так что бесплатный тариф получает саму возможность, но не в браузере. В последних четырёх строках Potato делает то, чего остальные инструменты не предлагают.
Компьютерное зрение на объёмах
CVAT — эталонный открытый инструмент для CV и остаётся лучшим выбором для больших конвейеров исключительно по зрению: более развитое управление задачами и заданиями, атрибуты у каждого объекта, более широкая экосистема форматов через Datumaro и очень большое сообщество. Берите Potato, когда работа по зрению соседствует с текстом, аудио или задачами оценки, либо когда нужна согласованность между разметчиками, а не точность относительно эталонного задания.
Roboflow отлично подходит, если цель — обученная модель: Smart Polygon, пакетная авторазметка, Label Assist по вашей собственной модели, а также обучение и развёртывание в облаке в одном цикле. Potato детекторы не обучает. Берите Potato, когда результатом исследования являются сами метки и их надёжность нужно уметь обосновать.
Labelbox, SuperAnnotate, Encord, Kili и V7 — зрелые коммерческие платформы с управлением рабочей силой, корпоративным контролем и сильной разметкой с помощью моделей. Если вам нужна управляемая команда разметчиков, сертификация соответствия или курирование петабайтных объёмов, они и есть правильный ответ.
X-AnyLabeling собирает Grounding DINO, Grounded-SAM 2, SAM 2.1 и YOLO в настольном приложении, и для одного человека, размечающего локально широким набором моделей, его трудно превзойти. У Potato набор моделей уже, и работает он в браузере, так что на машину разметчика ничего не ставится; его преимущество начинается там, где разметчик не один.
Гигапиксели и цифровая патология
Potato строит пирамиду тайлов, отдаваемую и как DZI, и по IIIF Image API 3.0, а маски кистью работают в полном разрешении исходника, потому что буфер маски индексирует пиксели изображения, а не текстуру GPU.
Конкретно для цифровой патологии специально созданы QuPath (десктоп, открытый код, стандарт в области) и Cytomine (веб, открытый код, многопользовательский со слепой разметкой), а Potato не читает SVS, DICOM и NIfTI. Берите Potato здесь, когда изображения большие, но не в клинических форматах, или когда поверх нужны его слои согласованности и рабочих процессов.
3D и слияние сенсоров
Segments.ai, Kognic, Deepen AI, Supervisely и Xtreme1/BasicAI — специалисты, и для промышленных конвейеров беспилотного вождения они впереди: сценарии для последовательностей и эпизодов с переносом треков, поддержка радара и нескольких лидаров, модели автоподгонки кубоидов, онтологии атрибутов у объектов, а у Deepen — ещё и полноценный продукт для бесцелевой калибровки. Supervisely и Xtreme1 разворачиваются у себя, причём Supervisely справляется с гораздо более крупными облаками.
Берите Potato для 3D, когда нужна статистика надёжности по пространственным меткам или когда 3D — лишь часть мультимодального исследования.
Робототехника, world-модели и привязка
Для эпизодов роботов ATLAS (TU Wien) — узконаправленный настольный инструмент для сегментации действий на длинных горизонтах с родной поддержкой ROS bag и RLDS, и для точности границ у одного разметчика он сделан именно под это. ELAN и BORIS остаются стандартами поведенческого кодирования, а Rerun и Foxglove — лучшие инструменты визуализации в робототехнике.
Для генеративного видео экосистема состоит в основном из бенчмарков — VBench, WorldModelBench, Physics-IQ — плюс краудсорсинговых панелей для сбора предпочтений на больших объёмах. Они дают метрики и эталонные протоколы; Potato даёт инструмент, чтобы повторяемо проводить человеческую часть с измеренной надёжностью, и это скорее дополняет их, чем конкурирует.
Для привязки у VLM область определяется датасетами и обвязками (RefCOCO, PixMo-Points, PointBench, lmms-eval, VLMEvalKit), а не продуктами для разметки. Роль Potato — собирать и измерять тот человеческий эталон, на котором эти бенчмарки построены.
Чего Potato не делает
Чтобы это не выяснилось при оценке слишком поздно:
- Не обучает модели. Potato упорядочивает объекты, предразмечает существующими моделями и критикует разметку визуально-языковой моделью. Он не обучает и не обслуживает детекторы. Roboflow, V7, Supervisely и Labelbox — обучают.
- Пока нет атрибутов у отдельных объектов. Геометрия несёт метку; степень перекрытия, флаги обрезки и атрибуты подтипа требуют отдельной схемы-компаньона.
- Нет режима последовательностей облаков точек. Разметка в 3D покадровая; перенос треков по проходу не реализован.
- Нет DICOM, NIfTI и WSI. Глубокий зум и 16-битное оконное преобразование покрывают большие научные изображения, но не клинические.
- Нет управляемой команды разметчиков, SAML/SCIM и сертификаций соответствия. Potato — это программа, которую вы запускаете. RBAC и OAuth поддерживаются; корпоративного контроля нет.
Количественные показатели
| Категория | Potato |
|---|---|
| Схем разметки | 61 |
| Типов отображения | 24 |
| Форматов экспорта | 31 |
| Форматов импорта | 20 |
| Типов эндпоинтов ИИ и LLM | 13 |
| Типов источников данных | 8 |
| Стратегий назначения | 12 |
| Опросных методик | 55 |
| Интеграций с краудсорсингом | 9 |
| Фаз рабочего процесса | 8 |
Числа порождаются из собственных реестров Potato. Колонки «лучшая альтернатива» здесь нет, потому что инструменты выше организуют свои возможности достаточно по-разному, чтобы одно число приглашало к обманчивому сравнению.
Как выбрать инструмент разметки?
- Что вы размечаете? Для NER только по тексту меньше всего возни с Doccano. Для смеси текста, изображений, аудио и видео весь диапазон покрывают Potato и Label Studio.
- Нужна ли вам оценка агентов или LLM? Здесь Potato необычен: он читает трассы агентов во многих форматах и имеет специализированные инструменты для оценки траекторий, процессных вознаграждений, веб-агентов, кодовых агентов, мультиагентных команд и агентов, управляющих компьютером, и мультимодальных. У большинства универсальных инструментов этого нет.
- Бюджет. Potato, Label Studio (ядро), Doccano и Argilla бесплатны и открыты; Prodigy и часть тарифов Label Studio платные.
- Трудозатраты на настройку. Potato настраивается файлом YAML и не требует кода; Prodigy ориентирован на код; остальные где-то посередине.
- Экосистема. Prodigy сцеплен со spaCy; Argilla — с Hugging Face; Potato экспортирует во многие ML-форматы, включая CoNLL, Hugging Face и COCO/YOLO.
Когда Potato — подходящий инструмент разметки?
Potato вырос из академического NLP. Исходная система была представлена на EMNLP 2022, а Potato 2.0 — на ACL 2026, и он сделан под полный исследовательский цикл: множество типов задач, контроль качества и метрики согласованности из коробки, интеграции с краудсорсингом и большой набор инструментов для оценки ИИ-агентов. Если ваша работа охватывает несколько модальностей или включает оценку LLM и агентов, к нему стоит присмотреться.
Если же вам нужна в основном одна текстовая задача на готовом коммерческом продукте или вы целиком живёте внутри spaCy или Hugging Face, кто-то другой подойдёт вам лучше.
Частые вопросы
Какой бесплатный инструмент разметки лучший?
Это зависит от модальности. Для классификации и NER только по тексту меньше всего возни с Doccano. Для смеси текста, изображений, аудио и видео в одном проекте весь диапазон покрывают и Potato, и community-редакция Label Studio, а разница проявляется в контроле качества: у Potato метрики согласованности и панели качества бесплатны, тогда как Label Studio выносит их на платный тариф. Для компьютерного зрения на объёмах CVAT бесплатен и зрел.
Можно ли считать Potato бесплатной альтернативой Label Studio?
Да. Potato бесплатен и открыт и покрывает текст, изображения, аудио, видео и оценку агентов и LLM из одной конфигурации в YAML без кода. Label Studio шире по части некоторых интеграций, но подталкивает команды к платным тарифам; Potato остаётся бесплатным и разворачивается у вас, что подходит для академической и воспроизводимой исследовательской работы.
Можно ли считать Potato бесплатной альтернативой Prodigy с открытым кодом?
Да. Prodigy — превосходный платный инструмент с упором на код, тесно связанный со spaCy; Potato бесплатен, настраивается в YAML без кода и экспортирует в форматы CoNLL и Hugging Face; spaCy читает CoNLL-вывод через spacy convert. Если вам нужно активное обучение без коммерческой лицензии, Potato — открытый вариант.
Чем Potato отличается от INCEpTION для лингвистической разметки?
INCEpTION силён для глубокой лингвистической разметки и связывания с базами знаний, но разворачивать его тяжелее. Potato проще поднять — файл YAML и одна команда — и обычно он быстрее для задач по спанам, отношениям и классификации, которым не нужна вся лингвистическая машинерия INCEpTION.
Зачем брать Potato вместо коммерческой платформы вроде Labelbox или Scale AI?
Labelbox и Scale продают управляемую платформу и команду разметчиков, что подходит компаниям, покупающим и то и другое. Для исследовательских групп, которые приводят своих разметчиков и которым данные нужно держать на своих серверах, Potato — бесплатная альтернатива с размещением у себя и встроенными метриками согласованности разметчиков.
Какой открытый инструмент лучше всего подходит для разметки траекторий ИИ-агентов?
Здесь Potato необычен среди универсальных инструментов разметки: он читает трассы агентов в 15 форматах и имеет специализированные отображения для оценки траекторий, отдельных шагов, веб-агентов и кодовых агентов. Он также размечает мультиагентные команды на кликабельном графе взаимодействий и мультимодальных агентов — например, управляющих компьютером и голосовых. Большинство инструментов, открытых и коммерческих, запуски агентов не размечает вовсе.
Что Potato умеет оценивать такого, чего не могут инструменты наблюдаемости и платформы разметки?
Две категории поверхностей для разметки агентов, и ни одна из них не встречается как настраиваемая возможность с размещением у себя в инструментах, с которыми Potato обычно сравнивают (LangSmith, Langfuse, Labelbox, Scale AI, Label Studio, Argilla, Braintrust) — сверено с их документацией по состоянию на июнь 2026 года:
- Структура мультиагентной команды. Редактируемый разметчиком граф взаимодействий (отметить критический путь, пометить неудачную передачу управления), атрибуция сбоев между агентами в виде тройки «ответственный агент / решающий шаг / причина», разбор передач управления как полноценный объект, оценочные карточки по каждому агенту и по команде, таймлайн конкуренции за инструменты и разметка эмерджентного поведения. Ближайшее, что есть в других местах, — «Agent Graphs» у Langfuse, а это отладочный вид только для чтения, а не поверхность для разметки.
- Мультимодальные агенты. Траектории работы с компьютером с маркером привязки кликов, полнодуплексные голосовые таймлайны с оценкой перебиваний и временная привязка в видео с живым IoU относительно интервала, предсказанного моделью. Scale AI делает привязку в GUI и оценку голоса, но как управляемые проекты по сбору датасетов, а его голосовая арена работает по репликам, а не полнодуплексно.
Инструменты наблюдаемости (LangSmith, Langfuse, Braintrust) прикрепляют оценки и комментарии к спанам, и это настоящая пошаговая разметка, но не эти поверхности по структуре агентов. Платформы разметки (Labelbox, Scale) предлагают продукты данных для оценки агентов, но как платные облачные или управляемые услуги, а не инструмент, который вы разворачиваете у себя и настраиваете в YAML. Возможности меняются быстро, так что это снимок на июнь 2026 года; версии, которые проверялись, перечислены в полном сравнительном разборе.