Игнорирование Domain Shift при подготовке датасета ведет к падению точности модели (mAP) на 15–40% сразу после деплоя, даже если на валидации зафиксировано 98%. Проблема заключается в разрыве между стерильными изображениями из стоков и «грязными» данными реальной среды эксплуатации.
Анатомия Domain Shift в визуальных данных
Domain Shift возникает, когда распределение признаков в обучающей выборке (Source Domain) не совпадает с распределением в целевой среде (Target Domain). В промышленном Computer Vision это проявляется через три фактора: освещение (разница в люксах от 100 до 10 000), ракурсы съемки и сенсорный шум. Например, модель, обученная на идеальных рендерах с разрешением 4K, теряет до 25% точности при переходе на поток с камер наблюдения 720p с артефактами сжатия H.264.
Кейс: Система дефектоскопии приборных панелей. Обучение шло на фото из студии (белый фон, мягкий свет). В цеху при дневном свете из окон возникли блики, которые нейросеть интерпретировала как трещины. Результат: рост False Positive на 12%. Решение — внедрение синтетических бликов в выборку и переход на изображения для нейросетей: комплексный гайд по формированию сбалансированного датасета для промышленного CV.
Вывод: Валидация на случайном сплите из одного датасета бесполезна. Необходим отдельный тестовый сет, собранный строго в условиях эксплуатации.
Количественные метрики анализа разрыва доменов
Для оценки репрезентативности недостаточно смотреть на количество классов. Мы используем расчет расстояния Вассерштейна (Earth Mover's Distance) или анализ Maximum Mean Discrepancy (MMD) между эмбеддингами из обучающего и тестового сетов. Если значение MMD превышает порог в 0.15–0.2 (в зависимости от архитектуры бэкенда), модель гарантированно будет нестабильна в продакшене.
Практика показывает, что разрыв в цветовых гистограммах (RGB/HSV) более 10% по среднему значению канала приводит к деградации сегментации границ объектов. Если ваши данные для обучения — это дневные фото, а эксплуатация планируется в сумерках (освещенность < 10 лк), разрыв будет критическим, даже если геометрия объектов идентична.
Вывод: Анализ распределения признаков в латентном пространстве — единственный способ количественно предсказать провал модели до начала дорогостоящего обучения.
Методы борьбы с нерепрезентативностью данных
Когда выявлен Domain Shift, есть два пути: добор реальных данных (дорого, долго) или адаптация домена (Domain Adaptation). Стоимость ручной разметки 10 000 специфических кадров в узкой нише (например, медицина или микроэлектроника) варьируется от $5 000 до $20 000 в зависимости от квалификации разметчика. Альтернатива — использование CycleGAN для переноса стиля из Target в Source домен.
Важно учитывать влияние стратегий сэмплирования в изображениях для нейросетей: анализ зависимости между методами отбора кадров и временем сходимости модели позволяет отсечь избыточные дубликаты, которые создают иллюзию точности. Оптимальный коэффициент разнообразия кадров (diversity ratio) должен быть не менее 0.7 для предотвращения переобучения под конкретный ракурс камеры.
Вывод: Синтетическая генерация данных через GAN или Diffusion-модели сокращает затраты на сбор сета на 60-70%, но требует жесткого контроля артефактов генерации.
Риски дисбаланса в контексте домена
Частая ошибка — смешивание проблем Domain Shift и Class Imbalance. Если редкий класс (например, критический дефект детали) представлен только в «идеальных» условиях, модель никогда не научится распознавать его в шуме. Это приводит к катастрофическому падению F1-score именно на самых важных категориях. Сравнение методов балансировки классов в изображениях для нейросетей: влияние недопредставленных категорий на точность F1-score подтверждает, что простой оверсэмплинг без учета домена только усиливает переобучение.
Пример: Датасет по распознаванию лиц. 90% фото — фронтальные, 10% — профиль. Если профильные фото сделаны при плохом свете, модель свяжет «профиль» с «темным фоном», а не с геометрией лица. Итог: точность на профиле при хорошем свете упадет до 40-50%.
Вывод: Балансировка должна происходить внутри каждого под-домена (света, ракурса, качества), а не глобально по всему датасету.
Вывод
Для исключения Domain Shift необходимо внедрить этап анализа MMD между обучающим сетом и репрезентативной выборкой из среды эксплуатации. Избегайте использования чисто стоковых или синтетических данных без последующего Fine-tuning на реальных «грязных» кадрах (минимум 10-15% от общего объема). Начинать следует с построения матрицы освещенности и ракурсов, чтобы закрыть дыры в репрезентативности до того, как будет потрачен бюджет на разметку и GPU-часы.
