Использование JPEG с коэффициентом сжатия выше 70% в обучающих выборках приводит к деградации весов модели на 3-5% в задачах точного сегментирования, создавая ложные градиенты на границах объектов. Для нейросетей формат файла — это не вопрос экономии места, а вопрос чистоты входного сигнала, где каждый артефакт компрессии интерпретируется моделью как реальная текстура объекта.
Lossy vs Lossless: математика искажений
Форматы с потерями (JPEG, WebP в режиме lossy) используют дискретное косинусное преобразование (DCT), которое группирует пиксели в блоки по 8x8. При агрессивном сжатии возникают «квадраты» и «звон» (ringing artifacts) вокруг контрастных линий. Для человека это шум, для сверточной нейросети (CNN) — это систематический паттерн. Если 40% датасета сжато с качеством < 60, модель начинает переобучаться на артефакты сжатия, принимая их за микротекстуру кожи или ткани.
В Lossless форматах (PNG, TIFF, WebP lossless) сохраняется побитовое соответствие оригиналу. Разница в объеме данных может достигать 10-20 раз (PNG 15 МБ против JPEG 800 КБ), но это исключает внесение синтетического шума в веса. Микро-вывод: Lossless обязателен для медицинских снимков и промышленного контроля качества, где точность до пикселя критична.
Влияние JPEG-артефактов на градиенты и веса
При обучении моделей типа Stable Diffusion или специализированных классификаторов, артефакты сжатия искажают значения производных при обратном распространении ошибки. В зонах высокого контраста JPEG создает ложные ореолы, что заставляет модель завышать веса для определенных частот. Практика показывает: при использовании JPEG с качеством 50-60% точность определения границ (edge detection) падает на 1.5-2.2% по сравнению с PNG-датасетом.
Кейс: при создании LoRA для детализации лиц, использование JPEG-изображений с артефактами вокруг глаз привело к появлению «грязных» пикселей в генерациях даже при высоком CFG scale. Переход на PNG-исходники полностью устранил проблему «песка» на коже. Микро-вывод: любое сжатие с потерями вносит шум, который модель пытается «выучить» как часть реальности.
WebP и HEIF: компромисс между весом и качеством
Современные форматы WebP и HEIF используют более совершенные алгоритмы предсказания блоков, чем JPEG, что позволяет снизить размер файла на 30-50% при визуально идентичном качестве. Однако в режиме lossy они все равно вносят искажения, хотя и менее заметные. Для большинства генеративных задач WebP с качеством 90%+ является приемлемым, но для задач апскейлинга или восстановления деталей (Super-Resolution) он недопустим.
Сравнение: JPEG (q=90) дает заметный шум на градиентах неба; WebP (q=90) сохраняет плавность переходов, но может «замыливать» тонкие текстуры (например, волосы). Это напрямую влияет на то, как модель интерпретирует освещенность и динамический диапазон в изображениях для нейросетей. Микро-вывод: WebP идеален для хранения огромных массивов данных (100к+ фото), если цель — общая семантика, а не микродетализация.
Технический пайплайн подготовки датасета
Оптимальный рабочий процесс исключает многократное пересохранение в lossy-форматах (generation loss). Каждый цикл «JPEG -> редактор -> JPEG» усиливает шум. Рекомендуемый стек: RAW → TIFF/PNG (для обработки) → WebP Lossless или PNG (для обучения). Если бюджет на хранилище ограничен, допустимо использование WebP с качеством 95, что дает снижение веса на 40% при потере точности весов менее 0.1%.
Ошибка новичка: скачивание картинок из интернета в JPEG, их апскейл нейросетью и сохранение снова в JPEG. Это создает «кашу» из артефактов, которую модель воспринимает как стиль. Правильный подход требует использования комплексного гида по техническому обеспечению и подготовке визуальных датасетов для минимизации потерь. Микро-вывод: чем меньше этапов перекодирования, тем выше итоговое качество генерации.
Вывод
Мой вердикт: для профессионального обучения моделей забудьте о JPEG. Если ресурсы позволяют — только PNG или TIFF. Если объем данных исчисляется терабайтами — используйте WebP в режиме Lossless или с качеством не ниже 95%. Любое сжатие ниже 80% в lossy-режиме — это сознательное внесение мусора в веса нейросети, что приведет к «грязным» результатам и снижению детализации. Начинайте с очистки датасета от низкокачественных JPEG, так как 1000 чистых PNG-изображений дадут лучший результат, чем 10 000 сжатых JPEG-копий.
