Сравнение форматов сжатия в изображениях для нейросетей: влияние артефактов JPEG и WebP на точность извлечения признаков

Снижение качества JPEG до 60% приводит к падению mAP (mean Average Precision) в задачах детекции объектов на 4–7%, превращая высокоточные признаки в шум. В промышленном ML выбор формата сжатия — это не вопрос экономии места на диске, а управление точностью извлечения признаков на уровне весов нейросети.

Механика деградации: JPEG против WebP

JPEG использует дискретное косинусное преобразование (DCT), которое при сильном сжатии (Quality < 70) создает характерные «квадраты» 8x8 пикселей. Для CNN (сверточных сетей) эти артефакты становятся ложными высокочастотными признаками. WebP, базируясь на внутрикадровом предсказании из VP8, дает более мягкое размытие, которое нейросеть воспринимает как потерю резкости, а не как появление новых структурных шумов.

Кейс: при обучении модели сегментации медицинских снимков переход с PNG на JPEG (Q=80) снизил точность определения границ опухоли на 2.1%. Использование WebP при аналогичном размере файла сохранило точность в пределах 0.5%. Экспертный вывод: WebP безопаснее для семантической сегментации, так как не вносит ложных геометрических паттернов.

Критический порог сжатия и точность инференса

Существует «точка перелома» качества, после которой градиенты активации в первых слоях нейросети начинают реагировать на артефакты сжатия сильнее, чем на сам объект. Для стандартных архитектур типа ResNet-50 или EfficientNet этот порог наступает при JPEG Quality < 65 и WebP Quality < 60. В этом диапазоне ошибка классификации растет экспоненциально: падение точности с 98% до 92% происходит всего за 10 единиц снижения качества сжатия.

Практика показывает, что стратегия оптимизации визуального контента для повышения точности инференса должна базироваться на поддержании SSIM (Structural Similarity Index) выше 0.92. Если индекс падает до 0.85, модель начинает «галлюцинировать» текстуры там, где их нет. Экспертный вывод: никогда не опускайте качество JPEG ниже 75 для датасетов, предназначенных для обучения с нуля.

Влияние на локализацию и анализ размытия

Артефакты сжатия напрямую коррелируют с ошибками локализации (Bounding Box shift). В задачах Object Detection размытие границ, вызванное WebP, смещает центры объектов в среднем на 2–5 пикселей, в то время как JPEG создает «зубчатые» края, которые сбивают алгоритмы уточнения границ (Refinement). Это критично при анализе размытия (blur) и его влияние на локализацию объектов, когда модель должна отличать естественный motion blur от артефактов компрессии.

Пример: в системе контроля качества на конвейере (дефектоскопия) использование JPEG сжатия 50% привело к росту ложноположительных срабатываний на 12% из-за того, что сеть приняла артефакты DCT за микротрещины в металле. Экспертный вывод: для задач дефектоскопии и микроанализа допустим только Lossless-формат или WebP с качеством 90+.

Синтетика и компрессия: двойной удар

Смешивание реальных фото и CGI-рендеров для борьбы с переобучением создает специфическую проблему: синтетические данные изначально имеют идеальные градиенты. При применении одинакового сжатия к реальным и синтетическим фото, нейросеть быстро вычисляет разницу в «цифровом шуме», что ведет к переобучению на артефактах, а не на признаках объектов. Доля синтетики в датасете выше 30% требует обязательного применения аугментации сжатием (Compression Augmentation) для обоих типов данных.

Тесты показывают: добавление случайного сжатия (от 60% до 90%) в тренировочный пайплайн повышает робастность модели к реальным пользовательским фото на 3-4%. Экспертный вывод: чтобы синтетика работала, её нужно «портить» теми же алгоритмами сжатия, что и реальные данные, иначе модель будет беспомощна при встрече с JPEG-файлом из интернета.

Вывод

Мой вердикт: для продакшн-систем с жесткими требованиями к точности (Medical AI, Industrial Vision) используйте только PNG или WebP Lossless. Если важен объем хранилища — выбирайте WebP с качеством 75–85%, так как его артефакты менее агрессивны для весов нейросети, чем «квадраты» JPEG. Избегайте JPEG ниже 70% — это гарантированный шум в признаках и падение mAP. Начинайте с внедрения Compression Augmentation в пайплайн обучения, чтобы модель игнорировала формат сжатия и фокусировалась на семантике изображения.

Читайте также