Использование JPEG с качеством ниже 90% в датасетах приводит к появлению высокочастотного шума, который нейросеть ошибочно интерпретирует как текстуру объекта, снижая точность генерации мелких деталей на 15-20%. В обучении LoRA и Checkpoint выбор формата сжатия определяет, будет ли модель рисовать чистый градиент или «грязные» пиксели в тенях.
Механика JPEG и проблема дискретизации
JPEG использует дискретное косинусное преобразование (DCT), которое группирует пиксели в блоки 8x8. При сжатии выше 30-40% возникают артефакты «звона» (ringing) вокруг контрастных границ. Для нейросети этот шум становится частью паттерна: если в 500 изображениях датасета есть одинаковые квадраты сжатия, модель заучит их как структурный элемент поверхности.
Кейс: при обучении модели на портретах в JPEG (quality 70) кожа в финальных генерациях часто приобретает сеточный микрорельеф, который невозможно убрать промптами. Это происходит из-за того, что веса нейросети фиксируют повторяющиеся ошибки квантования как истинные признаки текстуры кожи.
Экспертный вывод: JPEG допустим только при качестве 95-100%, иначе вы обучаете модель рисовать артефакты сжатия.
PNG и WebP: lossless против lossy
PNG обеспечивает полное сохранение данных, что критично для обучения высокоточных моделей. Однако объем датасета в PNG может быть в 5-10 раз больше, чем в JPEG, что замедляет стадию загрузки данных (I/O) при обучении на медленных HDD. WebP в режиме lossless дает сжатие на 20-30% лучше PNG без потери качества, что делает его оптимальным стандартом для современных пайплайнов.
Сравнение: датасет из 1000 изображений 1024x1024 в PNG весит ~3-5 ГБ, в JPEG (q90) — ~800 МБ, в WebP (lossless) — ~2 ГБ. Потеря детализации в JPEG при этом может составить до 5-7% по метрике SSIM (Structural Similarity Index), что критично для микротекстур.
Экспертный вывод: Для максимального качества используйте PNG или WebP lossless; экономия места в JPEG не стоит потери детализации в весах модели.
Влияние сжатия на градиенты и тени
Алгоритмы сжатия с потерями сильнее всего бьют по темным участкам и плавным переходам (градиентам), создавая эффект «ступеньки» или бандинга. Поскольку влияние освещения и световых схем в изображениях для нейросетей напрямую зависит от чистоты переходов, артефакты сжатия в тенях приводят к тому, что модель генерирует «грязный» черный цвет с цветными пятнами.
Пример: при обучении на JPEG-изображениях с глубокими тенями, модель часто выдает серые или фиолетовые ореолы вокруг темных объектов. В PNG-датасетах такие переходы остаются чистыми, так как нет потери информации в низких значениях яркости.
Экспертный вывод: Если в ваших изображениях много глубокого черного или мягкого света, любой формат с потерями (lossy) исключен — только lossless.
Связь формата файла и точности разметки
Качество файла напрямую влияет на работу авто-теггеров (например, WD14 или BLIP). Артефакты сжатия вокруг мелких объектов могут привести к тому, что разметка и аннотирование изображений для нейросетей сработают некорректно: нейросеть-аннотатор может принять шум за отдельный объект или пропустить мелкую деталь из-за размытия границ.
Статистика: при использовании JPEG с низким качеством (q60) точность автоматического определения мелких аксессуаров (серьги, пуговицы) падает на 12-18% по сравнению с PNG. Это создает разрыв между реальным содержанием картинки и её текстовым описанием, что «размывает» фокус обучения.
Экспертный вывод: Плохой формат файла портит не только визуал, но и семантическую связь «картинка-тег».
Оптимизация архитектуры датасета
Правильная архитектура идеального датасета для обучения LoRA и Checkpoint предполагает единообразие форматов. Смешивание PNG и JPEG в одном наборе создает дисбаланс в частотном спектре данных: модель получает часть идеальных данных и часть зашумленных, что может привести к нестабильности градиентов при обучении и увеличению количества эпох для сходимости на 10-15%.
Рекомендация по пайплайну: Сбор (любые форматы) → Конвертация в WebP Lossless (для экономии места) → Ресайз без интерполяции, создающей шум → Обучение. Это сокращает время итерации и гарантирует чистоту весов.
Экспертный вывод: Единообразие формата важнее, чем выбор конкретного lossless-стандарта.
Вывод
Мой вердикт: полностью откажитесь от JPEG в профессиональных датасетах. Для обучения используйте исключительно WebP (lossless) или PNG. Если бюджет на хранение ограничен, WebP — золотая середина, дающая чистоту PNG при меньшем весе. Избегайте пересохранения файлов (ре-сжатия), так как каждый цикл JPEG → JPEG умножает количество артефактов в геометрической прогрессии, превращая детализацию в «мыло», которое нейросеть заучит как норму.
