Сравнение стратегий подбора обучающих выборок в изображениях для нейросетей: анализ влияния плотности и распределения объектов на точность детекции

Ошибка в подборе плотности объектов в обучающей выборке снижает mAP (mean Average Precision) на 15–25% даже при использовании архитектур SOTA уровня YOLOv8 или EfficientDet. Точность детекции определяется не общим количеством кадров, а сбалансированным распределением объектов по площади кадра и их взаимным пересечениям.

Проблема переобучения на центрированных объектах

Типичная ошибка при сборе датасета — использование кадров, где объект занимает 60–80% площади и расположен строго по центру. В реальных условиях эксплуатации точность такой модели падает до 30–40% при смещении объекта к краю кадра или уменьшении его размера до 5–10% от общего разрешения. Это происходит из-за отсутствия вариативности в пространственных признаках.

Кейс: при обучении детектора дорожных знаков выборка из 10 000 идеальных центрированных фото дала mAP 0.92 на тесте, но всего 0.54 в полевых условиях. Добавление 2 000 кадров с эксцентричным расположением объектов подняло реальную точность до 0.78. Экспертный вывод: минимум 30% выборки должны содержать объекты, смещенные относительно центра более чем на 20% ширины/высоты кадра.

Плотность объектов и риск взаимного перекрытия

Высокая плотность объектов (более 5–7 единиц на кадр) приводит к проблеме окклюзии, когда один объект перекрывает другой. Если в обучающей выборке доля перекрытий (IoU > 0.3 между разными объектами) составляет менее 10%, модель будет систематически пропускать объекты в плотном потоке, принимая их за один искаженный объект.

Практика показывает, что для достижения стабильной работы в условиях толпы или склада необходимо соблюдать пропорцию: 20% кадров с одиночными объектами, 50% с умеренной плотностью (2–4 объекта) и 30% с высокой плотностью и выраженными перекрытиями. Экспертный вывод: игнорирование сценариев перекрытия в данных ведет к критическому росту False Negative в промышленном секторе.

Влияние масштаба и разрешения объектов

Распределение объектов по размеру (Small, Medium, Large по метрикам COCO) должно быть репрезентативным. Если 90% выборки состоят из крупных объектов (более 32x32 пикселя), детектирование мелких объектов будет иметь точность ниже 20%. Это требует внедрения стратегий мозаики (Mosaic augmentation) или использования специализированного регламента подготовки и валидации визуальных данных для глубокого обучения.

Пример: в задачах мониторинга с высоты 10 метров объект может занимать всего 1-2% площади кадра. Без искусственного увеличения доли таких примеров в выборке (через кроппинг или синтетику) модель будет игнорировать их как фоновый шум. Экспертный вывод: для малых объектов необходимо увеличивать разрешение входного тензора с 640 до 1024 или 1280 пикселей, иначе детализация будет недостаточной для активации нейронов.

Композиционный состав и фоновый шум

Избыточная плотность нецелевых объектов (визуальный шум) в кадре снижает точность локализации границ. Когда отношение площади целевого объекта к площади шума падает ниже 1:10, риск ложноположительных срабатываний (False Positive) растет на 12–18%. Это особенно заметно, когда фон имеет схожую текстуру с объектом.

Для борьбы с этим в выборку вводят «пустые» кадры (Background images), не содержащие целевых объектов, в объеме 5–10% от всего датасета. Это приучает модель отличать объект от сложного фона. Экспертный вывод: чистые кадры без объектов — это не «мусор», а необходимый инструмент снижения шума в предсказаниях.

Вывод

Для максимальной точности детекции откажитесь от погони за количеством кадров в пользу их композиционного разнообразия. Оптимальная стратегия: распределение объектов по площади кадра 30/40/30 (края/центр/периферия) и обязательное включение 30% кадров с перекрытиями. Начинать следует с анализа матрицы распределения размеров объектов; если у вас перекос в сторону Large-объектов, никакая смена архитектуры сети не поможет без пересбора или синтетического расширения выборки.

Подробный разбор всей темы смотрите в обзоре Современные методы распознавания текста и речи.