Снижение качества сжатия JPEG до уровня 60-70% приводит к падению точности (mAP) моделей детекции объектов на 3-7% из-за возникновения высокочастотного шума на границах объектов. В индустрии подготовки датасетов критическим порогом считается уровень потерь, при котором артефакты сжатия начинают имитировать текстурные признаки, вводя нейросеть в заблуждение.
Механика искажений: JPEG против WebP
JPEG использует дискретное косинусное преобразование (DCT), которое при высоком сжатии (Quality < 75) создает характерную «блочность» размером 8x8 пикселей. Для CNN (сверточных нейросетей) эти блоки становятся ложными признаками: фильтры первого и второго слоев реагируют на искусственные вертикальные и горизонтальные линии, что смещает веса активации. WebP, используя внутрикадровое предсказание, дает более «размытую» картинку без жесткой сетки, что менее критично для семантической сегментации, но губительно для задач микро-детекции.
Пример: при сжатии JPEG с Q=90 до Q=50 размер файла падает в 4 раза, но уровень шума в высокочастотных областях возрастает на 15-20%, что приводит к ложноположительным срабатываниям в зонах с мелким детализированным паттерном (например, текстура ткани или листва).
Экспертный вывод: Для задач распознавания мелких объектов JPEG опаснее WebP из-за структурированного характера шума (блочности), который нейросеть ошибочно принимает за геометрию объекта.
Расчет порога допустимых потерь
Практический порог, за которым точность инференса начинает деградировать экспоненциально, находится в диапазоне Quality 80-85 для JPEG и 75-80 для WebP. До этого значения падение точности составляет менее 1% и часто нивелируется за счет эффекта регуляризации. Однако при падении ниже Q=70 в JPEG возникает эффект «звона» (ringing artifacts) вокруг контрастных границ, что искажает расчет градиентов при определении контуров.
Кейс: в проекте по детекции дефектов на печатных платах переход с PNG на JPEG Q=80 сохранил точность на уровне 98.2%, тогда как переход на Q=60 снизил её до 91.5% из-за слияния мелких трещин с артефактами сжатия. Это подтверждает, что для технических данных порог потерь значительно жестче, чем для бытовых фото.
Экспертный вывод: Оптимальный баланс между объемом хранилища и точностью — JPEG Q=85. Спускаться ниже этого значения можно только при условии применения сильной аугментации размытием (Blur) на этапе обучения.
Влияние на веса и активации нейросети
Цифровой шум сжатия работает как нежелательный фильтр верхних частот. В архитектурах типа ResNet или EfficientNet это приводит к тому, что карты признаков (feature maps) перегружаются шумом в областях с высокой контрастностью. Если изображения для нейросетей были собраны в разном качестве, модель начинает переобучаться на артефакты конкретного кодека, а не на признаки объекта, что снижает обобщающую способность модели на реальных данных.
Статистически, использование датасета с неоднородным сжатием (смесь Q=60 и Q=90) увеличивает дисперсию ошибки на 2-4% по сравнению с однородным датасетом среднего качества. Это происходит из-за того, что сеть пытается найти инварианты там, где присутствуют случайные искажения квантования.
Экспертный вывод: Неоднородность качества сжатия в выборке опаснее, чем общее низкое качество; унификация формата и степени сжатия обязательна для стабильного инференса.
Стратегии минимизации потерь при хранении
Чтобы избежать деградации точности без раздувания объема хранилища, следует использовать стратегию селективного сжатия. Для объектов с высоким динамическим диапазоном и сложной геометрией критически важны критерии оценки контрастности и динамического диапазона в изображениях для нейросетей, так как именно в этих зонах сжатие вызывает наибольшие потери. Рекомендуется использовать формат WebP в режиме Lossless для малых икон/логотипов и Lossy с Q=80 для больших сцен.
Сравнение: хранение 1 млн изображений в PNG (ср. 2МБ/файл) требует 2ТБ, JPEG Q=85 (ср. 400КБ/файл) — 400ГБ при потере точности < 0.5%. Переход на JPEG Q=60 сокращает объем до 200ГБ, но риск падения mAP на 5-10% делает такую экономию неоправданной в промышленном ML.
Экспертный вывод: Экономия места за счет сжатия ниже Q=80 в JPEG — это технический долг, который будет оплачен временем на пересборку датасета и переобучение модели при падении метрик.
Вывод
Мой вердикт: для промышленного использования в CV-задачах единственным допустимым стандартом сжатия с потерями является JPEG с качеством 85% или WebP 80%. Всё, что ниже, создает риск появления структурных артефактов, которые нейросеть воспринимает как значимые признаки. Начинайте с анализа гистограмм градиентов: если после сжатия появляются пики в области высоких частот, которых нет в оригинале — вы перешли порог допустимых потерь. Избегайте автоматического сжатия «для веба» при подготовке датасетов; используйте только контролируемый экспорт с фиксированным коэффициентом квантования.
Связанный обзор по теме — распознать текст на изображениях.
