Качество разметки данных напрямую определяет верхний порог точности модели: даже идеальная архитектура нейросети выдаст ошибочный результат, если аннотации содержат системный шум. В обучении с учителем (supervised learning) выбор метода аннотирования — это баланс между стоимостью разметки одного кадра и детализацией признаков, которые должна извлечь модель.
Классификация и Bounding Boxes
Самый простой метод — Image Classification (присвоение одного тега всему изображению) и Bounding Boxes (выделение объекта прямоугольником). В задачах детектирования объектов Bounding Box определяет координаты верхнего левого и нижнего правого углов. Это быстро, но создает проблему «шума фона»: в прямоугольник неизбежно попадают пиксели, не относящиеся к объекту.
Кейс: при обучении модели распознаванию дефектов на деталях с помощью Bounding Boxes нейросеть может начать ассоциировать дефект с цветом конвейерной ленты, если она всегда попадает в рамку. Это приводит к ложноположительным срабатываниям при смене фона.
Вывод: используйте Bounding Boxes только для простых объектов с четкими границами и когда высокая точность локализации не критична для бизнеса.
Семантическая и экземплярная сегментация
Семантическая сегментация (Semantic Segmentation) требует закрашивания каждого пикселя определенным классом. В отличие от нее, экземплярная сегментация (Instance Segmentation) разделяет разные объекты одного класса: две собаки на фото будут иметь разные маски. Это самый трудозатратный вид разметки, требующий высокой точности обводки границ.
Пример: в медицинских снимках МРТ семантическая сегментация позволяет определить общую площадь поражения ткани, а экземплярная — посчитать количество отдельных новообразований и измерить объем каждого из них.
Вывод: сегментация необходима там, где важна точная геометрия объекта и его площадь, но будьте готовы к кратному увеличению стоимости подготовки датасета.
Полигоны и ключевые точки
Полигоны позволяют обводить объекты произвольной формы, что эффективнее прямоугольников для объектов с диагональным или сложным расположением. Keypoint Annotation (разметка ключевых точек) используется для определения скелета объекта или мимики лица. Здесь критически важна консистентность: точка «правый локоть» должна быть поставлена в одном и том же анатомическом месте на всех изображениях.
Кейс: при разметке жестов рук ошибка в 5-10 пикселей при расстановке ключевых точек может привести к тому, что модель перепутает разные буквы жестового языка.
Вывод: для анализа поз и жестов используйте Keypoints, но внедрите строгий регламент (гайдлайн) для разметчиков, чтобы избежать субъективности в определении точек.
Проблемы качества и верификация
Основной риск при аннотировании — человеческий фактор. Ошибки включают пропуски объектов (False Negative) или неточный охват границ. Для борьбы с этим применяется перекрестная проверка (Cross-validation), когда один и тот же кадр размечают несколько человек, а итоговый вариант определяется по консенсусу или решению старшего эксперта.
Практика показывает, что использование полуавтоматической разметки (когда модель предлагает маску, а человек ее правит) ускоряет процесс, но может привести к «подтверждению предвзятости»: разметчик склонен доверять модели и пропускать ее системные ошибки.
Вывод: всегда выделяйте контрольную выборку для ручной проверки экспертом, даже если используете автоматизированные инструменты разметки.
Вывод
Выбор метода разметки должен диктоваться конечной задачей: для простого обнаружения объектов достаточно Bounding Boxes, для анализа формы — полигонов, а для точных измерений — сегментации. Мой совет: начинайте с максимально простого метода, который решает бизнес-задачу. Избегайте избыточной детализации (например, сегментации там, где достаточно прямоугольника), так как это неоправданно раздувает бюджет и время подготовки изображений для нейросетей как основа обучения визуального интеллекта без реального прироста точности метрик.
