Дисбаланс классов в датасете приводит к тому, что нейросеть просто «запоминает» мажоритарный класс, выдавая высокую точность (accuracy) при полной бесполезности модели на редких объектах. В задачах компьютерного зрения это критично: пропуск одного редкого дефекта на производстве опаснее, чем десять ложных срабатываний.
Оверсэмплинг и риск переобучения
Простой дубляж изображений редкого класса (Random Oversampling) — самый быстрый, но опасный метод. Модель начинает заучивать конкретные пиксели и шумы дубликатов, что ведет к переобучению: на валидации метрики растут, а в реальном продакшене модель пасует перед новыми данными.
Мини-кейс: при обучении детектора редких болезней растенийе простое копирование 10 фото одного вида привело к тому, что сеть реагировала на фон (конкретную ветку), а не на признаки болезни. Решение — переход к синтетике или аугментации.
Вывод: дублирование допустимо только на этапе прототипирования для проверки гипотезы, но недопустимо в финальном датасете.
Умная аугментация против перекоса
Вместо копирования используют геометрические и цветовые трансформации: повороты, отражения, изменение яркости и Crop. Важно применять аугментацию селективно — только к миноритарным классам, чтобы выровнять их количество с доминирующими. Это расширяет вариативность признаков, не создавая идентичных копий.
Пример: если у вас 1000 фото кошек и 100 фото рысей, для рысей применяют агрессивный набор трансформаций (Rotation, Flip, Zoom), создавая из одного кадра 10 вариаций. Это позволяет модели выучить инвариантность объекта к ракурсу.
Вывод: селективная аугментация — золотой стандарт, так как она увеличивает обобщающую способность модели.
Андерсэмплинг и потеря ценных данных
Удаление лишних примеров из мажоритарного класса кажется логичным, но ведет к потере важных краевых случаев (edge cases). Если удалить слишком много, модель перестанет видеть разнообразие доминирующего класса и начнет ошибаться в простых ситуациях.
Условный пример: в датасете 10 000 фото «пустой дороги» и 100 фото «ДТП». Срезав «пустую дорогу» до 100 кадров, вы лишаете сеть знаний о том, как дорога выглядит в дождь, снег или ночью, что приведет к шквалу ложных срабатываний.
Вывод: андерсэмплинг эффективен только при избыточном объеме данных (миллионы примеров), где удаление части выборки не влияет на репрезентативность.
Взвешивание классов в функции потерь
Математический способ борьбы с перекосом без изменения состава данных. В Loss-функцию (например, Cross-Entropy) вводится коэффициент веса: ошибка на редком классе «стоит» дороже, чем на частом. Это заставляет градиентный спуск сильнее корректировать веса при ошибке в миноритарном классе.
Практика: использование Focal Loss вместо стандартной кросс-энтропии позволяет сети игнорировать «легкие» примеры (часто встречающиеся) и фокусироваться на «сложных» (редких), что критически важно для сегментации объектов с малой площадью.
Вывод: изменение весов эффективнее физического изменения датасета, так как сохраняет всю исходную информацию.
Генерация синтетики через GAN и диффузию
Современный подход — создание новых, уникальных изображений редкого класса с помощью нейросетей (GAN или Diffusion models). Это позволяет заполнить пробелы в данных там, где реальный сбор фото невозможен или слишком дорог. Однако синтетика должна быть верифицирована экспертом, чтобы в нее не попали артефакты, которые модель примет за реальный признак.
Кейс: для обучения системы распознавания редких видов металлического лома создаются синтетические рендеры с разным освещением, что позволяет довести выборку до баланса без выезда на свалку.
Вывод: синтетика — мощный инструмент, но требует строгого контроля качества, чтобы не «отравить» модель ложными паттернами.
Вывод
Для достижения максимального качества модели я рекомендую комбинированный подход: сначала селективная аугментация для базового выравнивания, затем применение Focal Loss для смещения акцентов при обучении. Избегайте простого дублирования картинок и радикального андерсэмплинга — это путь к переобучению или потере точности. Если бюджет позволяет, дополняйте выборку синтетикой, но только после проверки ее на соответствие реальным физическим признакам объекта.
