Аугментация данных

Аугментация данных — это генерация синтетических, реалистичных вариаций существующих данных — изображений, текста, аудио или структурированных табличных записей — для расширения, диверсификации и перебалансировки датасета, используемого для обучения или оценки модели машинного обучения, что позволяет обойти стоимость, задержки и значительные логистические трудности сбора или ручной разметки совершенно новых реальных примеров с нуля. Для многих областей — редкие производственные дефекты, необычные медицинские проявления, низкочастотные схемы мошенничества — такие данные могут быть практически недостижимы в достаточном объёме через обычные каналы сбора данных, сколько бы бюджета ни было выделено на эту задачу. Классическая аугментация использовала простые механические преобразования (поворот, отражение или обрезка изображений; замена отдельных слов синонимами в предложении), тогда как современная аугментация на основе генеративного ИИ вместо этого использует модели генерации изображений, генерации текста и img2img для создания действительно новых, статистически реалистичных синтетических примеров, выходящих далеко за рамки простых геометрических преобразований — например, генерация дополнительных обучающих изображений редкого типа дефекта для модели контроля качества на производстве, или генерация синтетических диалогов службы поддержки для обучения и оценки чат-бота на пограничных случаях, которые действительно недопредставлены в доступных реальных исторических данных разговоров. Почему это важно для SaaS-разработчиков: любой SaaS-продукт, который обучает или дообучает собственные модели (а не только вызывает API базовой модели), сталкивается с классической проблемой «недостаточно размеченных данных, особенно для редких/пограничных случаев», и генеративная аугментация теперь является стандартным способом её смягчения — особенно ценным для продуктов компьютерного зрения в областях, где реальные примеры целевого класса по своей природе редки (промышленные дефекты, редкие медицинские состояния, необычные схемы мошенничества) или где ограничения конфиденциальности ограничивают использование реальных пользовательских данных. Она также используется для стресс-тестирования и red-team-атак на существующие модели путём генерации состязательных или пограничных примеров, на которых модель изначально не обучалась. Конкретный пример — производственный SaaS для контроля качества улучшает обнаружение дефектов: (1) классификационная модель дефектов команды показывает низкую эффективность именно на дефектах типа «волосяная трещина», потому что во всём обучающем наборе есть всего 40 реальных размеченных примеров против многих тысяч легкодоступных примеров «без дефекта» из обычных производственных циклов; (2) команда использует конвейер генерации изображений и инпейнтинга, чтобы синтетически добавить правдоподобные узоры волосяных трещин на сотни в остальном чистых фотографий продукции, тщательно обусловленные визуальными характеристиками (ширина, длина, паттерн ветвления) тех 40 действительно реальных примеров, что у них есть; (3) расширенный датасет, теперь состоящий из 40 реальных и примерно 2000 синтетических примеров трещин, используется для переобучения классификатора с предыдущей контрольной точки; (4) валидация по-прежнему проводится исключительно на реальных, отложенных примерах, никогда не виденных во время обучения, поскольку синтетические данные должны дополнять — но никогда полностью не заменять — валидацию на реальных данных, чтобы избежать риска того, что модель незаметно выучит артефакты, специфичные для генератора, а не подлинные, физически реальные характеристики дефектов.

Похожие термины

Ещё термины: Вывод и медиа