画像生成AIのVAEとは?仕組みや欠点を初心者向けにわかりやすく解説

画像生成AIの一部に、VAE(変分オートエンコーダ)という仕組みが取り入れられていることをご存知でしょうか?

AIを学ぶうえでは欠かせない要素だと知っていますが、内容が専門的すぎて理解できないんですよね…。
AIの時代が来ているからという意気込みで学びはじめようと思っても、なかなか理解できない方も多いのではないでしょうか。
そこでこの記事では、VAEの仕組みや強みを初心者でもわかるように解説しながら、実際にVAEが使用されているサービスを紹介していきます。
この記事で学べること
- VAE(変分オートエンコーダ)は深層学習を用いた生成モデルの1つ
- データ生成能力が高い、汎用性が高いなどのメリットがある
- VAEを用いた画像生成サービスもある
- 目次
VAE(変分オートエンコーダ)とは
VAE(変分オートエンコーダ)は、深層学習(ディープラーニング)を用いた生成モデルの1つです。
2013年に論文上で理論が紹介されており、現代では画像生成AIの土台となっているほど重要な仕組みとなっています。
初めてAIについて学ぶ方は、VAEはAIの中でも画像生成や異常検知などに役立つものだと認識しておきましょう。
VAEの仕組み
VAEは、大きく分けてエンコーダとデコーダという2つのニューラルネットワークで構成されています。

VAEの仕組みについて、初心者向けに関連するワードごとに解説していきます!
ニューラルネットワークとは
ニューラルネットワークは、人間の脳の神経細胞の仕組みをヒントに作られたAIです。そもそも人間の脳は、ニューロンと呼ばれる神経細胞で構成されています。
ニューロンは、他のニューロンとシナプスと呼ばれる接合部でつながっており、情報を伝達し合っています。
そこでAIに学習させる際も同様の仕組みを用いて、高い精度の学習・データの予測をさせようとしました。
実際にニューラルネットワークは、人工ニューロンと呼ばれる計算ユニットを層状に並べた構造になっており、人間の脳の学習方法に非常に近くなっているのです。
エンコーダとは
エンコーダは、人間の頭の中のイメージをAIが理解できるコードに変換する役割を果たすものと考えましょう。
人間がAIに指示を出す(プロンプト)ときは、参考となる画像を読み込ませたり、テキストでまとめたりします。
しかしAIではそのままの情報を記録するのではなく、「この単語ならこの画像(被写体)」と概念やルールを見つけ出すように学習していきます。
このときにAIが認識できる状態に置き換えていく過程を「エンコーダ」が担っているのです。
またこのコードは、情報量を減らした“簡潔なデータ”となっています。
画像にはピクセル数や色空間などの多くの属性が含まれているため、学習には関与しないものを削除しています。
簡単にいえば、ファイルデータが軽量化されていて、扱いやすくなっている状態です。
余分な要素を抜き取り軽量化する「Zipファイルへの圧縮」と似ていると考えるとわかりやすいでしょう。
潜在空間とは
前述のエンコーダによって軽量化されたコードは、潜在空間という目に見えない仮想空間に保管されています。
専門的には「データ属性を減らした低次元な空間」と表現されているものです。
この潜在空間の中に収集されるコードは「潜在変数」と呼ばれ、画像データの特徴を簡潔に表しています。
潜在空間と潜在変数の関係性
顔画像データの潜在空間では、顔の表情、年齢、性別などの特徴が2次元や3次元などの低次元で表現される。潜在変数はこれらの特徴を数値で表している。
- 潜在変数1:顔の表情
- 潜在変数2:年齢
- 潜在変数3:性別
このようにデータを取得することで統計も取れるようになるため、生成する画像の精度も高くなるのです。
また、この潜在空間のデータ処理には「拡散モデル」という仕組みが導入されることが多いです。
デコーダとは
デコーダとは、ユーザーが入力したエンコーダをもとに、潜在空間の中から最適な画像を生成する過程のことです。
潜在空間の中では統計が取られていると話しましたが、数学的にいえば正規分布をとってデータの連続性を評価しています。
だからこそ「この画像を生成してほしい」という指示(潜在変数)が出されたら、その指定に最も似ているデータをもとに生成できるようになっています。
VAEの3つの強み

VAEにはどんなメリットがありますか?

大きく分けると3つあります。1つずつ見ていきましょう!
MERIT 1
データの生成能力が高い
前項の仕組みで紹介した通り、VAEは潜在変数から新しいデータ生成が可能である点が大きな強みです。
オートエンコーダには「積層オートエンコーダ」などもありますが、複雑化しすぎていて現在はあまり使われていません。
それぞれの仕組みに特徴はあるものの、学習したデータをもとに質の高い画像を作成するという最も重視するべき機能をみれば、VAEが適しています。
MERIT 2
潜在変数を扱いやすい
VAEの2つめの強みは、潜在変数がデータの特徴を解釈しやすいという点です。
潜在空間は目に見えないものでありながらも、それぞれの情報を分布で示せるため、統計を取りやすいという特徴があります。
また、VAEでは潜在変数がデータの特徴と直接的に関連しているため、その潜在変数を分析することでデータの理解が深まります。
このことから漠然とした情報・学習データという表現に留まらず、利用しやすい形で蓄積されていることが独自のメリットです。
MERIT 3
汎用性が高い
VAEは画像の生成において非常に役立つモデルですが、実際には画像の編集やシステムの異常を検知する分析ツールとしても取り入れられています。
ここまでお伝えしたとおり、VAEは単なる学習というわけではなく、それぞれの統計や関係性を保ちながらデータを蓄積していきます。
だからこそ画像を生成するためだけに留まらず、多くの情報分析の場に取り入れられているのです。
VAEが導入されている代表的なサービス

実際にVAEを使ったサービスってあるのでしょうか?

あります!代表的な5つを紹介します。
SERVICE 1
Stable Diffusion

画像引用:Stability AI
「Stable Diffusion」は高品質なAIが容量無制限かつ無料で利用できることで話題になったサービスです。
2022年8月から提供されており、現在では最も注目されている画像生成AIといえます。
プログラムを組まなくても、「Stable Diffusion オンライン」にアクセスすれば誰でも簡単に使用可能です。
高品質な仕上がりで、生成する画像のモデル(アニメ系・実写系など)を設定しておけば、さらに狙った画像を出力しやすくなります。
また、下記で紹介している4つのサービスは、いずれもStable Diffusionをインストールしておかないと使えません。そのぶん本サービスは初心者向けの基本的な画像生成AIといえるでしょう。
SERVICE 2
ClearVAE

画像引用:Civitai
「ClearVAE」は、鮮やかさや透明感を重視したイラストを生成したいときに適している生成AIです。
はっきりとした印象を持たせたいときにおすすめです。
ClearVAEの導入手順
- ClearVAEのページにアクセス
- ページ右側の「Download」ボタンをクリック
- ダウンロードした ClearVAE ファイルを「Stable Diffusion Web UI」を配置したディレクトリの「models/VAE」フォルダに配置
- Stable Diffusion Web UIを起動し「Settings」タブを開く
- 「SD VAE」のドロップダウンリストボックスをクリック
- ドロップダウンリストに「Clear VAE]の項目が表示されればインストール完了
SERVICE 3
kl-f8-anime2

画像引用:Civitai|kl-f8-anime2
「kl-f8-anime2」は彩度・明度ともに高めに出力される、イラスト向けのモデルです。
出力の度合いによってはやや白飛びしてしまうこともありますが、そのぶんコントラストが強調されているといえます。
強弱・明暗が強い分、印象に残りやすい画像を生成したいときに適しているでしょう。

導入手順は前述の「ClearVAE」と同様です!
SERVICE 4
Counterfeit-V2.5

画像引用:Counterfeit-V2.5|Hugging Face
「Counterfeit-V2.5」は、背景にこだわったアニメ風イラストを生成できるモデルです。
ファンタジーな画像を生み出したいときにおすすめです。
Counterfeit-V2.5の導入手順
- Stable Diffusionをインストール
- Counterfeit-V2.5のckptファイルをStable Diffusionのmodelsフォルダにコピー
- Counterfeit-V2.5のVAEファイルをStable DiffusionのVAEフォルダにコピー
- Stable Diffusionを起動
- VQGAN+CLIPタブでModelドロップダウンメニューからCounterfeit-V2.5を選択
SERVICE 5
Anything-v4.0

画像引用:Anything-v4.0|Hugging Face
「Anything-v4.0」は柔らかい印象を与える、フィルターをかけたような淡い雰囲気の画像を生成したいときに向いています。
温かさや光の印象を強めたいときに使用したいモデルです。導入方法は前述の「Counterfeit-V2.5」と同様です。
VAEの主な課題

VAEは活躍の場が多そうですね!欠点はないのでしょうか?

使い勝手はいいものの、課題もあります。具体的にどのような課題があるのか、3つ解説していきます。
PROBLEM 1
品質はGANに劣る
VAEは多くのモデルが提供されているため、用途に応じて使い分けていけば高品質な画像を生成できます。
しかし、品質の面だけで評価するのであれば、もう1つの生成AIである「GAN」には劣ることが多いです。
これはそもそもの学習の仕方の違いにあり、GANは生成した画像と実際の画像を比較しながら精度を高めているからです。より質の高い画像を生み出したい方は、GANに触れてみることをおすすめします。
PROBLEM 2
学習の難しさ
VAEは学習する際に属性を減らして低次元化するため、情報量の多い画像を学習するときは効率が下がってしまいます。
加えて鍵となる属性を減らしてしまうこともあるため、生産する画像の質が下がるケースも考えられるのです。
この課題に対しては拡張機能の追加などで対応が進んでいるものの、未だ完全には解決できていないのが現状です。
PROBLEM 3
局所解に陥る可能性がある
VAEは多くのデータをもとに正規分布をとって関連性を調査していきますが、そもそも学習するデータに偏りがあればその結果が生成画像にも反映されてしまいます。
つまり人間が思うような一般論ではなく、生成AIがこれまで学習してきた内容が一般論として認識されてしまう可能性があるというわけです。
VAEが必ずしも最適な解に導くとは限らないため、局所解に陥ってしまうと生成されるデータの品質が低下しかねません。
これはAIの深層学習全般にいえることですが、VAEにも当てはまるものだと認識しておきましょう。

まだまだ進化の途中ってことですね!

現在進行形で多くの研究が進んでいるので、今後の動向も要チェックです!
よくある質問
Q. VAEとオートエンコーダの違いはなんですか?
A. 一番の違いは、データを圧縮・復元する過程の中で推測をもとにした出力ができるかどうかです。
オートエンコーダでは単に圧縮と復元をするだけでしたが、VAEでは情報の傾向や関連性を紐づけながら分析していきます。
これによって過去のデータ群をもとに、最適な画像を予測しながら出力できるのです。
Q.VAEは画像生成以外にも使える場面はありますか?
A. 主に画像生成に使われてはいますが、音声やテキストの生成にも活用されています。
また制限はかかるものの、画像生成と同様な仕組みで動画を生成できるAIも誕生しており、活用の幅は広がっています。
まとめ
VAEは画像生成AIの中核を担うような、非常に重要なモデルとなっています。AI技術の進歩も著しく、短期間で多くのバリエーションが誕生している状況です。
そのため、VAEについて詳しく学習していきたい方は常に最新情報を追っていく必要があります。しかし、初めて触れる方はまずは無料で使えるツールで操作感を試してみることから始めましょう。
この記事を参考に、ぜひVAEについて学んでみてください。
また、SEOタイムズでは他にも画像生成AI関連の記事を多く掲載しています。画像生成AIに関して知識を深めたい方は、以下の記事もぜひチェックしてみてください!













