前の投稿では、魚人達の人工知能であるディープフォークに応用したガンモデルを紹介しました。 GANモデルの作業原理は、GANモデルで何かを作ることができることを示唆しています。 しかし、GANモデルはまだ解決する問題があります。 GANモデルが店舗にあるものを見てみましょう。
画像をクリックすると、ガンポストが表示されます。
[発電機の問題]
上記のように、ガンモデルは発電機と分岐器に分けられます。

ジェネレータは、Minmaxゲームを通して学びます。 最小限のゲームは、損失の最大損失の状況を最小限にするゲームです。 ここでは、最大の損失状況は、差別化要因が完全に実際のデータと偽物のデータを識別するために学んだことを意味します。
詳しくはこちら そして、矛盾がここに起こります。 あなたが学習を終える前に、あなたが誰であるかの完璧な感覚を得ることができません。 言い換えれば、ガンズを学習するときは、最初の場所でミンマックスゲームが確立されていないという前提が必要です。
ディスクリミネーターが最適なソリューションに確実に収まると問題はありませんが、そうでなければ、コンストラクタは最適なソリューションにも関与しません。
つまり、コンストラクタがイメージを作成するために、差別化者は良い能力を持っている必要がありますが、差別化者の能力が低下すると、コンストラクタの能力も減少します。
[モデルの振動]
GANモデルを学習する過程で、差別化器とコンストラクタは、問題が発生した場合、互いに学習するための敵対的な学習を交互に実行します。
学習を繰り返す過程では、学習者の学習と学習者の学習が互いに取り消すことができるときに問題が生じる。 言い換えれば、差別化者とコンストラクタが互いに不正行為をし、その場にある学習を実行すると、両者は世界一年を争うことができない問題があります。 これは、発振と呼ばれます。
[Mode 連携]
問題の最も一般的なタイプは、モードの折り返しです。 多くの場所で学習データの分布が広がると、これは良いことです。 実際には、学習データがマルチモーダルであるため、複数のモードがあるマルチモーダル手段であるガンモデルを学習するときにこの問題が発生します。
例えば、論文に1枚の手書き画像、論文に2枚の手書き画像、紙論文に3枚の手書き画像など、論文に3枚の手書きの画像が1枚あります。 これらの画像をGANモデルを学習するために使うと、4つのモードがあることがわかります。
これらの画像がガンモデルを学習するために使用される場合、コンストラクタは与えられた入力の4つのモードの1つだけにそれ自身を偏すことによって学習を実行することができます。 これは、モードの折り返しと呼ばれます。
実際に4つのモードでのデータセットを使ってGANを学習することで、同じ数だけ(例: 論文に2枚の手書き画像が生成されます。 コンストラクタの場合、使用した画像の数は、ディスクリミネーターによってのみ受けられます。
これは、モデルが振動し、両方の問題が同時に起こるとき、差別化器が不完全であるとき、ひどく起こります。 その結果、コンストラクタは学習データ全体の分布を学習できず、学習の一部だけを実行することができます。
[決裁]
コンストラクタと差別化者が適切にバランスをとり、安定したグローバル・ソリューションに収斂していることを確認してください。GANモデルは解決します。 多くのモデルは、この問題を解決するために提案されています。
この記事は公表時点の情報に基づいています。個別の事情については、当事務所にご相談ください。

