00 · まず3分で

答えは、3つの要点でわかる

  1. 1学習では画像へ段階的にノイズを加え、追加されたノイズを推定させます。
  2. 2生成では新しいノイズから始め、予測に従って少しずつノイズを除きます。
  3. 3文章による指示は生成の向きを調整しますが、一枚の学習画像を検索して貼る操作ではありません。

01 · 壊す過程から学ぶ

壊す過程から学ぶ

既知の画像へ決められた強さのランダムノイズを加え、ネットワークにノイズ量などを推定させます。時刻情報によって、どの段階の壊れ方かも伝えます。

02 · 生成は逆向きに進む

生成は逆向きに進む

生成時には復元すべき原画がありません。新しいノイズから出発し、学んだ推定を何度も適用すると、輪郭・領域・質感が次第に現れます。

FIG. 02仕組みを段階で追う
仕組みの関係を示す概念図です。特記のない形状・縮尺・時間は実測値ではありません。

03 · 文章が経路を導く

文章が経路を導く

プロンプトはテキスト表現へ変換され、変化が指示へ合うようノイズ除去を導きます。初期ノイズが違えば、同じ文章からも別の画像になります。

04 · 潜在空間で軽くする

潜在空間で軽くする

現代の多くの方式は全ピクセルではなく圧縮表現を処理し、最後にデコーダーで画像へ戻します。これが計算量を抑えます。

05 · 写実性は証拠ではない

写実性は証拠ではない

出力は統計パターンと指示と乱数の産物です。偏りや物理的な矛盾を含み得るため、写真らしくても記録写真にはなりません。

06 · 出典と証拠

出典と証拠

主張を、基礎論文・標準文書、または更新記事の一次研究までたどれます。

  1. 01
    Denoising Diffusion Probabilistic Models

    この記事の仕組み・測定事実・確度の境界を支える資料です。

    一次研究
  2. 02
    High-Resolution Image Synthesis with Latent Diffusion Models

    この記事の仕組み・測定事実・確度の境界を支える資料です。

    一次研究
更新履歴2026年8月29日 · 初回5言語版。仕組み・限界・図解・出典を確認。