# Аналитическая статья: StarGAN

StarGAN (Унифицированные генеративные состязательные сети для перевода изображений с нескольких доменов)

Source: https://www.iplexlaw.co.kr/ru/blog/878875

ГЛАВНАЯ / Новости и аналитика Новости и аналитика Аналитическая статья: StarGAN StarGAN (Унифицированные генеративные состязательные сети для перевода изображений с нескольких доменов) ИИ и программное обеспечение Опубликовано: 2023.07.04 IPLEX Время чтения: 15 мин. StarGAN (Унифицированные генеративные состязательные сети для перевода изображений с нескольких доменов) В этой статье предлагается сеть StarGAN, которая обеспечивает перевод в ситуациях с несколькими доменами. Если вы нажмете на изображение, вы сможете увидеть полный текст. [Резюме содержания] Для сетей, не относящихся к StarGAN, таких как CycleGAN и IcGAN, для выполнения перевода домена из одного домена в другой необходимо вставить несколько сетей. Как видно из приведенного ниже примера, мастерство не очень хорошее. Но... StarGAN может переводить несколько атрибутов одновременно, используя только одну сеть. Вводные изображения (класс 1) старше, 2) имеют каштановые волосы, а 3) классифицируются как женские (для перевода на другие изображения домена, поэтому вы можете видеть, что они выполняют перевод домена лучше, чем другие сети). Проще говоря, StarGAN — это молодой образ блондинки. (ВХОДНЫЕ ДАННЫЕ) Вы можете увидеть, как он превращается в старого черноволосого человека. (H+G+A) Примеры StarGAN [Объясняется базовая технология] Моделирование (генеративные модели) Модель создания относится к модели, которая не существует, но создает образ, который может существовать. Данные, которые может создать модель создания, — это не только изображения, но и различные данные. Это могут быть данные из Техаса. Тем не менее, исследования модели генерации, которая генерирует данные изображения, являются наиболее активными, чем другие данные. Дискриминационные и генеративные модели выглядят следующим образом. Генеративная модель и дискриминационная модель Дискриминационная модель изучает границу принятия решений между существующими данными и классифицирует, в каком классе находятся данные, когда вводятся одни данные. Я делаю это. Тем временем, Генеративные модели усваивают распределение из существующих данных и следуют за усвоенным распределением, т.е. реальным распределением данных. (Действительно данные) Модель, которая печатает. Общая модель может быть использована для изучения совместного распределения вероятностей. Например, предположим, что есть признаки, связанные с размером носа и особенности, связанные с размером глаз. Если вы узнаете образ человека, размер нормального носа и размер нормального глаза будут определены. Предполагая типичный размер носа 10 см, вероятностное значение для размера носа 10 см будет самым высоким. Предполагая нормальный размер глаза 3 см, вероятностное значение для размера глаза 3 см будет самым высоким. Таким образом, создание изображения с использованием наиболее вероятных значений признаков (10 см размером носа и 3 см размером глаз) в каждой особенности может привести к тому, что изображение будет выглядеть как реальный человек. В результате, Модель генерации изучает реальное распределение существующих данных обучения, то есть уникальные распределения. Наиболее часто используемой архитектурой для обучения модели создания являются генеративные состязательные сети (GAN). GAN: генеративные состязательные сети В своем предыдущем посте я писал о GAN, но на этот раз я объясню их более подробно. [Ган Пост] GAN использует две сети: генератор и дискриминатор. Так и есть. Если обучение генератора завершено через GAN, возможно создать изображение, которое может присутствовать, введя один шум в генератор. В частности, генератор позволяет создавать один экземпляр данных (поддельные данные) при вводе одного скрытого вектора. Дискриминатор печатает вероятность, указывающую, следует ли эта информация за реальным распределением (реальным или поддельным), когда приходит один экземпляр данных. Все, что угодно. В процессе обучения генератор выполняет обучение таким образом, что экземпляр данных (фальшивое изображение), генерируемый генератором, может быть определен как реальное изображение в дискриминаторе. С другой стороны, в процессе обучения дискриминатору учат определять, что 1) экземпляр данных (фальшивое изображение), генерируемый генератором, не следует реальному распределению, а 2) реальное изображение (реальное изображение) учат определять реальное изображение. Здесь важно то, Пример данных, который выдает генератор, заставляет его следовать реальному распределению. Условный GAN (cGAN) Обычно, когда вы создаете GAN, вы можете изменить скрытый вектор, чтобы создать новое изображение. Тем не менее, может быть трудно создать предполагаемое изображение с помощью GAN, изменив только скрытый вектор. Таким образом, cGAN позволяет вводить отдельную информацию о состоянии в GAN. Другими словами, CGAN – это условный GAN. Если посмотреть на объектную функцию модели cGAN, то можно увидеть, что значение y вошло в новую условную форму в той же самой объектной функции, что и GAN. ***** Проверьте картинку ниже. z (латентный вектор) ЦЕННОСТЬ c (условный вектор) Вы можете видеть, что значение вводится в генератор (G). Вот. Значение c - это информация метки, для какого класса генерировать данные. Может быть. Генератор введет z и c вместе, чтобы создать соответствующие данные для этого класса (c). ***** Создан компанией Generator. Фальшивые данные (G(z)) Введите дискриминатора (D) С величиной с соответствующей маркировкой c. Реальные данные(x) Давайте сложим это вместе. При изучении сети с этой структурой cGAN обучаются создавать данные, подходящие для конкретного класса. Pix2pix Перевод изображения в изображение - это выполнение задачи выбора конкретного аспекта из заданного изображения и замены его другими функциями, когда данное изображение присутствует. Я серьезно. И... Архитектура перевода изображений Вот так. Pix2pix - это тип cGAN, который вводит изображения в качестве условий в процессе обучения. cGAN имеет значение метки, но pix2pix имеет изображение. Другими словами, когда вы создаете поддельное изображение, вы создаете изображение, которое следует определенным условиям. Например, если у вас есть нарисованная от руки картинка (x), которая имеет только контур, и вы хотите, чтобы она была изменена на фактическое изображение (G(x)), то нарисованная от руки картина (x), у которой есть только контур, является условием здесь. Здесь pix2pix - это форма обучения, которая заполняет внутреннюю часть контуров, когда вставлена рисованная фигура (x). Для Pix2pix узнайте, спаривая данные из двух разных доменов X и Y. Я знаю. В этом случае пара цветных изображений (существующих изображений) и изображений, созданных путем вычитания цветов из этого изображения, создают обучающий набор данных. И вы можете использовать его для тренировок. Но... Создание пары обучающих данных часто затруднено. Например, предположим, что вы готовите обучающий набор данных для задач, которые создают ландшафты, вводя изображения, которые принимаются непосредственно. Трудно найти изображение, которое вы взяли, и соответствующие пейзажи, и их нелегко совместить. Также сложно создать пейзаж, используя полученное изображение. Это часто затрудняет создание обучающих наборов данных (которые на самом деле могут быть сделаны, но являются трудоемкими и дорогостоящими). Другими словами, В этом отношении существует ограничение на Pix2pix. Ограничения cGAN Вы можете просто использовать cGAN для создания изображения зебры, используя конкретное изображение во время задачи по преобразованию лошади в зебру. Но... Если cGAN научится выполнять вышеуказанную задачу, то у cGAN могут возникнуть проблемы с выводом только ранее созданного изображения зебры, даже если вводятся другие речевые изображения. Для Дискриминатора ранее созданное изображение зебры может фактически присутствовать и классифицироваться в конкретный класс, поэтому оно будет только выводиться. То есть генератор может работать, создавая изображение, соответствующее определенному домену, без следования идентичности входного изображения. Циклган CycleGAN является моделью для решения ограничений CGAN. Так и есть. CycleGAN может реконструировать поддельное изображение, созданное генератором, обратно к исходному изображению. Если у вас есть вводное изображение (x), создайте поддельное изображение (G(x)), а затем создайте обратную функцию в поддельном изображении, а затем вернитесь к исходному изображению. Другими словами, одно обратное отображение создается для того, чтобы напоминать исходное входное изображение, а ложное изображение возвращается к исходному изображению в виде потери для изучения. Это позволяет узнать информацию о содержании исходного изображения и изменить только характеристики, связанные с доменом (стилем). Это называется потерей цикличности. Для выполнения этих задач используются два переводчика. Одним из них является генератор, который выполняет преобразование из X в Y. (G: X → Y) Другая функция выполняет обратное отображение, которое снова преобразует Y в X. (F:Y → X) В результате цикл GAN обучается тому, чтобы F(G(X)) выглядел как X, а G(F(Y) выглядел как Y. WGAN-GP WGAN гарантирует, что функция соответствует состоянию 1-липшихца, что приводит к стабильному обучению. Тем не менее, WGAN использует обрезку веса для удовлетворения ограничений. Следовательно, это может вызвать другие проблемы. WGAN-GP характеризуется добавлением градиентного штрафа к WGAN для улучшения производительности WGAN. Старган При использовании архитектур, описанных фоновой технологией, для преобразования домена в изображение для каждого из нескольких доменов требуется несколько сетей. Но... Старган Одна модель Используйте его для преобразования изображений для нескольких доменов .. В этом случае он считается пространственно эффективным с точки зрения параметров, потому что он не использует несколько сетей, и поскольку он может использоваться вместе с наборами данных, используемыми во многих различных областях, он может лучше изучать общие функции, тем самым улучшая производительность. Эту идею использовал Старган. ***** Во-первых, генератор может ввести векторное значение входного изображения и целевого домена для создания поддельного изображения, входное изображение которого было изменено на целевой домен. ***** Затем поддельное изображение ограничивается исходным доменом и вводится в генератор, чтобы изображение могло появиться в той же форме, что и исходное изображение. Это позволяет создать реконструированное изображение. Таким образом, путем конфигурирования сети с циклом может поддерживаться идентичность входного изображения и изменяться только информация, связанная с доменом. ***** С другой стороны, Дискриминатор приводит к тому, что реальный образ делится на реальный, а поддельный образ делится на поддельный. Кроме того, Disciminator позволяет выводить информацию о классе домена при вводе реального изображения. Для генератора можно сделать дискриминатор с поддельным изображением, чтобы генератор мог создать подходящее изображение. Именно StarGAN добавляет потерю согласованности цикла к cGAN и увеличивает производительность генератора, чтобы он мог работать на нескольких доменах. Значение ROS в StarGAN является плюсом потерь от состязательности, потерь от классификации доменов и потерь от реконструкции. ***** Проигрыш соперников одинаков. Противоположная потеря добавляет концепцию изменения потери GAN по умолчанию к определенному домену (c). В случае состязательной потери идея WGAN-GP может быть использована для построения значения убытка в форме, указанной штрафом. ***** Потеря классификации доменов выглядит следующим образом. Для генератора используется потеря классификации домена поддельного изображения, и обучение осуществляется таким образом, что изображение, измененное на конкретный домен, может быть классифицировано как целевой домен. Потеря классификации домена реального изображения используется для дискриминатора, и обучение проводится для классификации реального изображения как значения домена (c') для реального изображения при его вводе. ***** Убыток от реконструкции следующий. Потеря реконструкции использует потерю консистенции цикла, так что изображение, созданное генератором, может сохранять содержимое исходного изображения во время процесса перевода. Затем при восстановлении исходного изображения настройте потерю реконструкции так, чтобы фактические исходные данные и окончательные преобразованные данные могли быть похожими. ***** Конечная цель заключается в следующем. Объективная функция дискриминатора состоит в том, чтобы свести к минимуму потери противника путем добавления минуса, что означает максимизацию самой потери противника. Это делается путем добавления потери классификации домена для реального изображения. Если вы посмотрите на объектную функцию генератора, вы научитесь сводить к минимуму значение потерь, чтобы каждое изображение можно было классифицировать как реальное изображение. Добавьте потерю классификации доменов и потерю реконструкции для поддельных изображений. ***** Ганнибал Используйте вектор маски для продвижения вашего обучения в нескольких наборах данных Я знаю. Вектор маски — это маска для метки. Если имеется набор данных с меткой, связанной с цветом волос (многие положительные) и набор данных с меткой, относящейся к эмоции (менее положительные), он используется таким образом, что сцепляет метку, связанную с цветом волос, метку, связанную с эмоцией, и вектор маски. Если используется только набор данных (SNG) с ярлыком, связанным с эмоциями, количество набора данных невелико, поэтому обучение не выполняется должным образом и производительность снижается. (StarGAN (SNG)) Однако при использовании нескольких наборов данных (JNT) для определения того, какую ярлык использовать в качестве вектора маски, он может успешно выполнять обучение, потому что он использует наборы данных с ярлыками, связанными с эмоциями, а также наборы данных с цветом волос (используя больше информации об эмоциях, содержащейся в лицах большего количества людей для обучения). (StarGAN (JNT)) Это приводит к увеличению количества данных, используемых для обучения, что приводит к увеличению производительности. Давайте перечислим некоторые более конкретные вещи. ***** Весь набор данных. Дискриминатор узнает, о чем ярлык, когда вводится реальное изображение. С другой стороны, когда дискриминатор вводит поддельное изображение, он печатает подделку для поддельного изображения и учится не использовать значение метки. ***** Генератор конкатенирует значение метки celebA (1 0 0 1 1), значение метки RaFD (0 0 0 0 0 ) и значение вектора маски ( 1 0 ) с входным изображением. Здесь значение вектора маски (1 0) означает, что используется только первая метка, метка celebA. Интерпретация метки celebA (1 0 0 1 1) может означать «черные волосы, мужские, женские».Таким образом, выход левого генератора показывает выход молодого мужского изображения черной головы с похожим внешним видом на входное изображение. ***** Затем, после создания поддельного изображения, информация об исходном изображении, т.е. значение метки celebA (0 0 1 0 1), значение метки RaFD (0 0 0 0 0) и значение вектора маски ( 1 0 ), конкатенируются в правильный генератор с поддельным изображением. Интерпретация метки celebA (0 0 1 0 1) может означать «коричневые волосы, женщина, ребенок». Таким образом, выход правильного генератора позволяет снова появиться изображению реконструкции, похожему на исходное изображение. ***** Наконец, поддельное изображение, генерируемое генератором, делится на реальное, когда оно вводится в дискриминатор, чтобы его можно было классифицировать как предполагаемый целевой домен. Таким образом, содержание лица, т.е. идентичность, может поддерживаться при создании вывода, который был переведен в целевой домен. Прочитать корейский оригинал Материал отражает ситуацию на дату публикации. Обратитесь в IPLEX, чтобы обсудить обстоятельства вашего дела. Обсудить этот вопрос ↗ Все статьи ОБРАТИТЕСЬ В IPLEX Обсудите с нами вопросы интеллектуальной собственности Мы рассматриваем ваши технологические и бизнес-потребности вместе. ↗ Связаться с нами Новее Дело о восстановлении учетной записи Amazon: Underdog ↗ Ранее Анализ исследовательской работы: ResNet — глубокое остаточное обучение для распознавания изображений ↗ Материалы по теме ИИ и программное обеспечение 2026.10.01 FiX: избирательное забывание признаков в softmax-внимании Патентный поверенный Ким Ёндок рассматривает векторные затворы FiX, устойчивость вычислений и страничный кэш, отделяя результаты экспериментов от открытых вопросов. ↗ Читать статью ИИ и программное обеспечение 2026.09.30 MHAR: выбор информации из предыдущих слоёв по подпространствам признаков Корейский патентный поверенный Ким Ёндок разбирает Multi-Head Attention Residuals: маршрутизацию по глубине, результаты экспериментов, затраты реализации и технические эффекты. ↗ Читать статью ИИ и программное обеспечение 2026.09.28 Колонка в AI Times: как ИИ учится работать с компьютером — анализ патента на обучение агентов В новой колонке для AI Times управляющий партнёр IPLEX Ким Ёндок рассматривает Claude Computer Use и обучение ИИ-агентов на примере патента США № 12 585 862. ↗ Читать статью

- https://www.iplexlaw.co.kr/ru
- https://www.iplexlaw.co.kr/ru/blog/category/ai
- https://drive.google.com/file/d/1bmVfOit-DVY-UwDgItyt95lgL7B7g-Jt/view
- https://www.iplexlaw.co.kr/ru/blog/862036
- https://www.iplexlaw.co.kr/forum/view/878875
- https://www.iplexlaw.co.kr/ru/contact
- https://www.iplexlaw.co.kr/ru/blog
- https://www.iplexlaw.co.kr/ru/contact
- https://www.iplexlaw.co.kr/ru/blog/879382
- https://www.iplexlaw.co.kr/ru/blog/876621
- https://www.iplexlaw.co.kr/ru/blog/fix-fine-grained-forgetting-attention
- https://www.iplexlaw.co.kr/ru/blog/fix-fine-grained-forgetting-attention
- https://www.iplexlaw.co.kr/ru/blog/mhar-multi-head-attention-residuals
- https://www.iplexlaw.co.kr/ru/blog/mhar-multi-head-attention-residuals
- https://www.iplexlaw.co.kr/ru/blog/claude-computer-use-agent-patent
- https://www.iplexlaw.co.kr/ru/blog/claude-computer-use-agent-patent
