VAE
Variational Autoencoder
VAE(変分オートエンコーダ)とは
ひとことで
入力データを、特徴を表す「潜在空間」上の確率分布として圧縮(エンコード)し、そこから元のデータを復元(デコード)するよう学習する生成モデル。潜在空間の点を変えることで、新しいデータを生成できる。
たとえると
似顔絵を描くときに、顔を「目の大きさ」「輪郭の丸さ」「髪の長さ」といった少数のダイヤルに置き換えて覚えておくようなものです。ダイヤルを少し回して描き直せば、実在しない新しい顔を描くことができます。
現場ではこう使う
研修でさまざまな画像生成の仕組みを学んだ企画担当者は、VAEが「特徴を圧縮した空間」を使って生成することを知りました。商品デザインの案出しでは、既存デザインの特徴を少しずつ変えたバリエーションを作れる点が役立ちそうだと考えました。また、現在広く使われている画像生成AIの一部でも、画像を圧縮・復元する部品としてVAEの考え方が使われていることも学びました。
試験のポイント
EXAM POINT「エンコーダとデコーダ」「潜在空間(潜在変数)」「データを圧縮して復元する」と出てきたらVAEです。潜在変数を確率分布として扱う点が、通常のオートエンコーダとの違いです。2つのネットワークを競わせるGAN、ノイズを除去していく拡散モデルとは生成の仕組みが違います。代表的な生成モデルとして、この3つをセットで区別できるようにしておきましょう。
混同しやすい用語との違い
- GAN生成器と識別器を競わせて学習する。VAEは圧縮と復元で学習する
- Diffusion Modelノイズを加える過程の逆をたどり、ノイズから画像を生成する
- Embedding言葉などを数値のベクトルで表したもの。VAEの潜在空間と同様に「意味や特徴を数値で表す」考え方