Skip to content

Понятия разметки данных

Ответы на распространённые вопросы о Potato. Не нашли нужного? Заходите в наш Discord или загляните в документацию.

Понятия разметки данных

Разметка данных — это добавление меток к сырым данным: тексту, изображениям, аудио, видео или выводам моделей, — чтобы эти данные можно было использовать для обучения или оценки моделей машинного обучения. Меткой может быть категория, выделенный фрагмент, оценка или результат сравнения. В Potato любую из таких задач можно настроить короткой конфигурацией в YAML.

Согласованность разметчиков показывает, насколько часто независимые разметчики дают одному и тому же объекту одинаковую метку. Это стандартное свидетельство того, что задача сформулирована чётко, а метки надёжны. Обычно считают каппу Коэна, каппу Фляйса и альфу Криппендорфа — они вводят поправку на совпадения, которые случились бы и случайно. Potato показывает альфу Криппендорфа в админ-панели.

Это зависит от ваших данных и целей, так что единого ответа нет. Для работы, охватывающей текст, изображения, аудио и оценку ИИ-агентов, Potato — сильный бесплатный вариант с открытым кодом: более 60 типов задач и настройка в YAML без кода. Label Studio, Doccano, brat и Argilla — другие открытые варианты со своими сильными сторонами.

Начните с определения задачи и набора меток, затем напишите понятные инструкции и дайте нескольким разметчикам разметить пересекающиеся объекты. Измерьте согласованность, разберите разногласия и выгрузите результат в формате, который читает ваш обучающий конвейер. Potato покрывает весь этот цикл и экспортирует в JSON, CoNLL, Hugging Face и COCO/YOLO.

Для чётких объективных задач часто хватает одного разметчика плюс небольшая пересекающаяся выборка для проверки качества. Умеренно субъективные задачи обычно берут трёх разметчиков с разрешением по большинству. Для сильно субъективных задач берут пять и больше, а иногда сохраняют весь разброс мнений, не сводя его к одному ответу. После трёх выигрыш быстро сходит на нет.

Активное обучение выбирает, какие объекты размечать следующими, чтобы модель вышла на нужную точность с меньшим числом меток, чем при случайной выборке. Модель указывает на объекты, которые считает самыми информативными, — часто те, в которых она меньше всего уверена, — и человек размечает именно их. Potato поддерживает стратегии по неопределённости, по разнообразию, BADGE и BALD.

Классификация присваивает одну или несколько меток объекту целиком — например, помечает отзыв как положительный или отрицательный. Разметка спанов отмечает участок внутри объекта: скажем, выделяет имя в предложении или событие на осциллограмме. Распознавание именованных сущностей и отметка ошибок — это задачи на спаны. Potato поддерживает и то и другое, и их можно совместить на одном экране.

Пусть их оценивают люди: по шкале, сравнением двух вариантов рядом, по рубрике или отметкой конкретных ошибок спанами. Для агентов, работающих в несколько шагов, можно оценивать ещё и каждый шаг траектории. Potato даёт всё перечисленное и умеет читать трассы агентов в форматах вроде OpenAI, Anthropic и ReAct.

Остались вопросы?

Наше сообщество готово помочь. Заходите в Discord за живой поддержкой или изучите подробные руководства в документации.