Сравнение форматов сжатия и контейнеров в изображениях для нейросетей: влияние потерь при компрессии на точность весов

Использование JPEG с коэффициентом сжатия выше 70% приводит к появлению артефактов дискретизации, которые нейросеть ошибочно интерпретирует как высокочастотные признаки, снижая точность mAP на 2-5% в задачах детекции мелких объектов. В индустрии CV выбор контейнера — это не вопрос экономии места, а борьба за чистоту градиентов.

JPEG: деградация признаков и эффект «звона»

JPEG использует дискретное косинусное преобразование (DCT), которое при агрессивном сжатии (качество < 60) создает блоки 8x8 пикселей. Для человека это легкий шум, но для сверточной сети (CNN) это искусственные границы. В кейсе по распознаванию микротрещин на бетоне переход с JPEG (quality 75) на PNG-24 увеличил точность классификации дефектов с 82% до 89%, так как сеть перестала «цепляться» за артефакты сжатия по краям трещин.

Экспертный вывод: JPEG допустим только для общих сцен (Landscapes) с низким требованием к детализации. Для медицинских снимков или техконтроля он неприемлем из-за потери данных в высокочастотном спектре.

PNG и TIFF: эталон для обучения весов

PNG (lossless) и TIFF сохраняют каждый бит информации, что критично при расчете иерархической матрицы требований к визуальным данным для различных архитектур CV. В задачах сегментации, где маска должна точно совпадать с границей объекта, использование TIFF (без сжатия) сокращает ошибку IoU (Intersection over Union) на 1.5-3% по сравнению с любым форматом с потерями. Вес одного файла растет в 5-10 раз (с 200 КБ до 2 МБ), но это цена за отсутствие синтетических шумов в обучающей выборке.

Экспертный вывод: Если бюджет на хранилище позволяет (S3-хранилища сейчас стоят около $0.023 за ГБ), всегда используйте PNG или TIFF для эталонных датасетов.

WebP и HEIF: компромисс или риск?

WebP обеспечивает сжатие на 25-34% эффективнее JPEG при сопоставимом визуальном качестве, но его алгоритмы сглаживания могут «замыливать» текстурные особенности. В тестах на распознавание лиц при низком разрешении WebP (lossy) приводил к размытию мелких пор и морщин, что снижало точность идентификации на 1.2% относительно PNG. Это происходит из-за специфики предиктивного кодирования, которое усредняет соседние пиксели.

Экспертный вывод: WebP идеален для инференса на стороне клиента (мобильные приложения), чтобы ускорить загрузку картинки в модель, но категорически не рекомендуется для фазы обучения (Training phase).

Влияние компрессии на цветовые пространства

Сжатие часто сопровождается субдискретизацией хроминнанса (например, 4:2:0), что напрямую бьет по критерии оценки цветовой точности и цветовых пространств в изображениях для нейросетей: влияние RGB, HSV и LAB на сегментацию. При переходе из RGB в LAB в сжатом JPEG теряется до 15% точности определения границ в каналах насыщенности, что критично для задач выделения объектов по цвету (например, поиск спелых плодов в агротехе).

Экспертный вывод: Для задач, где цвет является основным признаком (Color-based segmentation), используйте только форматы с полной цветовой выборкой (4:4:4), такие как PNG или TIFF.

Динамический диапазон и битовая глубина

Стандартный 8-битный JPEG ограничивает количество оттенков до 256 на канал, что вызывает «бандинг» (ступенчатые переходы) в тенях. Это создает сложности при анализе влияния освещенности и динамического диапазона в изображениях для нейросетей: методы компенсации пересветов и глубоких теней, так как информация в темных участках просто стирается. Переход на 16-битные TIFF позволяет восстановить детали в тенях, увеличивая Recall модели в ночных сценах на 4-7%.

Экспертный вывод: Для HDR-данных и ночной съемки 8-битные контейнеры — это «бутылочное горлышко», которое обнуляет пользу от продвинутых методов аугментации.

Вывод

Мой вердикт: для обучения (Training) используйте исключительно PNG или TIFF — потеря точности весов из-за артефактов сжатия не окупается экономией места. Для деплоя и инференса (Inference) оптимален WebP с качеством 85-90%, так как он дает баланс между скоростью передачи данных и сохранением признаков. Избегайте JPEG в любых задачах, где размер объекта меньше 5% от площади кадра — там компрессионный шум становится неотличим от самого объекта.