Сжатие датасета с использованием JPEG с коэффициентом качества ниже 85% приводит к деградации точности mAP (mean Average Precision) на 2-5% в задачах детекции мелких объектов. В индустрии Computer Vision экономия места на хранилище часто становится фатальной ошибкой, превращающей высокоточные признаки в цифровой шум.
Механика потерь: JPEG против PNG в CV
Сжатие с потерями (Lossy), типичное для JPEG, работает через дискретизацию цветовых компонентов и квантование коэффициентов дискретного косинусного преобразования (DCT). Для нейросети это означает появление артефактов «звона» (ringing) вокруг высококонтрастных границ и блочности (blocking) размером 8x8 пикселей. В то время как PNG (Lossless) сохраняет попиксельную точность, JPEG при сильном сжатии искажает градиенты, которые модель интерпретирует как ложные признаки.
Кейс: при обучении модели сегментации медицинских снимков (МРТ) переход с PNG на JPEG (q=70) увеличил количество ложноположительных срабатываний на 12% из-за того, что нейросеть приняла артефакты сжатия за микрокальцинаты. Экспертный вывод: для задач высокоточной сегментации и медицины использование Lossy-сжатия недопустимо.
Влияние артефактов на веса и градиенты
Нейросеть обучается на поиске закономерностей. Когда в датасете доминируют артефакты сжатия, модель начинает оптимизировать веса под эти шумы, а не под реальные семантические признаки объекта. Это приводит к переобучению на шуме (overfitting to compression noise). В частности, сверточные слои (CNN) начинают реагировать на повторяющиеся паттерны блоков 8x8, что снижает обобщающую способность модели на «чистых» данных.
Практика показывает, что при использовании изображений с низким качеством (q < 60) градиенты в глубоких слоях становятся нестабильными, что замедляет сходимость модели на 15-20%. Экспертный вывод: сжатие с потерями смещает фокус обучения с семантики на текстурный шум, что критично при анализе изображений для нейросетей: фундаментальный анализ жизненного цикла подготовки визуальных данных от сбора до финального датасета.
Критический порог качества и размер данных
Существует «точка перегиба», после которой падение точности становится экспоненциальным. Для большинства стандартных архитектур (ResNet, EfficientNet) порог качества JPEG составляет 85-90%. Снижение до 70% сокращает размер файла в 3-4 раза, но снижает точность распознавания мелких деталей (меньше 32x32 пикселей) на 7-10%.
Пример: в датасете для распознавания лиц при q=90 точность верификации составляет 98.2%, при q=50 она падает до 91.5%. При этом разница в объеме хранилища составляет 10 ГБ против 2.5 ГБ на 100 000 изображений. Экспертный вывод: экономия 7.5 ГБ не стоит потери 6.7% точности; оптимальный баланс для общих задач — JPEG q=90 или WebP с высоким качеством.
Специфика современных форматов: WebP и HEIF
WebP и HEIF используют более продвинутые алгоритмы предсказания внутрикадровых блоков, что позволяет достичь того же визуального качества при размере файла на 25-30% меньше, чем у JPEG. Однако для нейросетей важно, как именно реализован декодер. Использование аппаратного ускорения при декодировании HEIF иногда вносит микро-искажения в значения пикселей, которые незаметны глазу, но фиксируются моделью.
Сравнение: WebP (lossy) при размере файла в 2 раза меньше JPEG дает сопоставимый mAP, но требует больших вычислительных ресурсов на этапе загрузки (CPU load выше на 10-15%). Экспертный вывод: WebP — лучший выбор для хранения огромных датасетов, если стадия препроцессинга позволяет выделить дополнительные ресурсы на декодирование.
Синтетика и сжатие: двойной удар
При использовании синтетических данных, созданных через GAN или диффузионные модели, проблема сжатия усугубляется. Синтетические изображения уже содержат специфические частотные артефакты (checkerboard artifacts). Наложение на них JPEG-сжатия создает кумулятивный эффект, где шум сжатия резонирует с шумом генерации, создавая «галлюцинации» для обучаемой модели.
Кейс: при расширении выборки через сравнение методов синтетической генерации данных в изображениях для нейросетей: анализ эффективности GAN и диффузионных моделей для расширения обучающих выборок, использование Lossless-форматов (PNG/TIFF) для синтетики повысило точность финальной модели на 3% по сравнению с хранением синтетики в JPEG. Экспертный вывод: любые синтетические данные должны храниться исключительно в Lossless-формате, чтобы не множить ошибки аппроксимации.
Вывод
Мой вердикт: забудьте о JPEG с качеством ниже 90% для профессиональных датасетов. Для максимальной точности используйте PNG или TIFF, если бюджет на хранение позволяет. Если объем данных исчисляется терабайтами — переходите на WebP с высоким коэффициентом качества. Главное правило: никогда не сжимайте данные с потерями после того, как они прошли стадию аугментации или синтеза. Начинайте с Lossless, измеряйте деградацию mAP при постепенном снижении качества, и останавливайтесь только тогда, когда падение точности составит менее 0.1%, независимо от экономии места.
Контекст и детали — в основном материале Современные методы распознавания текста и речи.
В навигации сайта также доступен раздел Как распознать текст из документов и изображений: инструменты и методы.
