3 ポイント 投稿者 GN⁺ 2025-03-04 | 1件のコメント | WhatsAppで共有
  • MIT 6.S184 2026版は、画像・動画などさまざまなデータ型に使われる拡散モデルとフローモデルを、理論と実践の両面から学ぶ入門課程である
  • 講義は確率微分方程式、Fokker-Planck方程式、フローマッチング、スコアマッチング、classifier-free guidance、潜在空間、離散拡散モデルへと続く
  • 各講義には実習が付いており、受講者はフローマッチングと拡散モデルを段階的にゼロから実装してみることができる
  • 課程後半では潜在拡散モデル(latent diffusion model) を自ら作成し、確率的解析ツールを他分野にも応用できるよう構成されている
  • 確率論とディープラーニングの経験が推奨され、線形代数、多変数微積分、基礎確率論、Python、PyTorch の経験が前提知識として必要である

課程の構成と学習目標

  • Flow Matching and Diffusion Models — 2026 Version は、学生や研究者が拡散・フローモデルをより深く理解できるよう設計された課程である
  • 扱うモデルは、画像、動画、そのほか多様なデータ型のための生成AI手法である
  • 数学的基盤から実装までつながる流れで構成されている
    • 確率微分方程式
    • Fokker-Planck方程式
    • 各モデル構成要素の段階的な説明
    • 各講義の実習によるガイド付き実装
  • 最後には潜在拡散モデルをゼロから構築する
  • 推奨される背景は確率論とディープラーニングの経験であり、前提知識は線形代数、多変数微積分、基礎確率論、Python、PyTorch の経験である

講義ノートと講義資料

  • 講義ノートは課程の中核資料であり、授業のすべての内容を自己完結的に説明している
  • 講義ノートの引用情報
    • Introduction to Flow Matching and Diffusion Models
    • Peter Holderrieth, Ezra Erives
    • 2026
    • arXiv eprint: 2506.02070
  • 講義一覧

    • 第1講: Flow and Diffusion Models
      • 生成モデル入門、常微分方程式・確率微分方程式、フロー・拡散モデルのサンプリングを扱う
      • slides 1, Video 13
    • 第2講: Flow Matching
      • 条件付き・周辺確率経路、条件付き・周辺ベクトル場、フローマッチングの学習目的を扱う
      • slides 2, Video 14
    • 第3-A講: Score Functions and Score Matching
      • スコア関数、denoising score matching、SDE サンプリングを扱う
      • slides 3, Video 15
    • 第3-B講: Classifier-free Guidance
      • guided generation、classifier guidance、classifier-free guidance を扱う
      • slides 3, Video 16
    • 第4講: Latent Spaces and Neural Network Architectures
      • VAE と潜在空間、Diffusion Transformer と U-Nets、大規模モデルの事例を扱う
      • slides 4, Video 17
    • 第5講: Discrete Diffusion Models
      • 連続時間 Markov chains(CTMCs)、CTMC モデルのサンプリング、CTMC モデルの学習を扱う
      • slides 5, Video 18

実習の進め方

  • 課程には合計3つの実習(labs) があり、授業とあわせて提供される演習を通じて実装経験を得られる
  • 実習はフローマッチングと拡散モデルを段階的にゼロから作る形式である
  • 進行手順
    • 実習リンクで指示事項を確認
    • GitHub から .ipynb ノートブックをダウンロード
    • Jupyter ノートブック環境で実行し、Google Colab も選択肢として利用可能
    • すべての設問を完了後、ノートブックを PDF に書き出して Canvas の Gradescope に提出
    • 採点が難しくなるため、セル出力は消さないこと
  • 行き詰まった場合は ソリューション を参照できる

1件のコメント

 
GN⁺ 2025-03-04
Hacker News のコメント
  • MIT の授業「6.S184: Introduction to Flow Matching and Diffusion Models」が YouTube で公開された
    画像、動画、タンパク質などのための最新の生成 AI アルゴリズムと、それを理解するための数学的ツールをあわせて扱う
    フローマッチングと拡散モデルは数学的に難しく、多くの講義は直感的な説明にとどまるが、この講義は AI 初学者を対象にしながらも、数学的に厳密で自己完結した入門を目指している
    出典: https://x.com/peholderrieth

    • MIT Optics [1] の講義を見ようとしたが、音声/映像の品質があまりに悪い。誰かが直してくれるといいし、もしかすると拡散モデルで可能かもしれない
      [1] https://ocw.mit.edu/courses/2-71-optics-spring-2009/resource...
    • YouTube プレイリストのリンク: https://www.youtube.com/watch?v=GCoP2w-Cqtg&list=PL57nT7tSGA...
    • 学習資料や講義について、それが「高レベルの直感」なのか、それとも前提知識全体を避けない深い応用重視の資料なのかが、はっきり区別される慣習ができるといい
      どちらにも価値はあるが、直感だけを与える入門資料の海の中から後者を見つけるのは難しい
  • 条件付き正規化フローは、学習用データさえあれば、逆設計問題に対して自分が見た中でも最も美しい解法の一つだ
    基底分布の確率質量を全単射関数で押し引きし、望む位置まで慎重に変形するという発想は本当に優雅で、その全単射関数自体の構成も非常に巧妙だ
    目標値の一部が連続値で一部がカテゴリ値の場合には適用が難しかったが、それでもとても見事な方法で、名前も実にうまく付けられていると思う

  • 素晴らしい講義なので早く聴いてみたい。この講義は連続空間に厳密に焦点を当てているようだが、離散拡散の方面でも興味深いことが多い
    後続の講義計画があるのか気になる。講師の Peter が離散拡散の論文も出したばかりだという点が目に留まった
    https://x.com/peholderrieth/status/1891846309952282661
    https://github.com/kuleshov-group/awesome-discrete-diffusion...

  • 最新の AI 手法を扱う公開講義のまとめがあるのか気になる

  • MIT OCW のような公開講義資料には本当に感謝している。専攻科目の補助資料として使ってきたし、同じテーマを二つの方法で学べることは、特に理解しにくい内容で大きな助けになる

  • ここでこの講義を見かけてうれしい。LLM が、このものすごく有用な手法から多くの関心を奪ってしまったように思う

  • このテーマに詳しい人が、主な用途と全体的な所感を数言で説明してくれるとありがたい

    • Stable Diffusion、Dalle をはじめとする最新の画像生成モデル、動画・音声生成モデルの基礎原理だ。最近ではロボット制御の分野でも急速に使われ始めている [1]
      これらのモデルは、純粋なノイズサンプルを学習データ分布のほうへ少しずつ押し込むように学習される。学習セットにノイズを混ぜたバージョンで訓練されるため、ノイズ除去の過程で実データ分布の周辺領域をよりうまく探索し、活用できる
      GAN の大きな問題の一つはモード崩壊という現象だ [2]
      [1] https://www.physicalintelligence.company/blog/pi0
      [2] https://en.wikipedia.org/wiki/Mode_collapse
  • この10年はディープラーニング教育の黄金期だった。誰がより高品質な学習コンテンツを無料で公開するかを競い合っているようで良い

  • MIT がこれほど時宜にかない関連性の高いコンテンツを無料で公開するのは素晴らしい

  • 最新 AI を扱う他のOCW 講義にはほかに何があるのか気になる