1 ポイント 投稿者 GN⁺ 2024-05-26 | 1件のコメント | WhatsAppで共有
  • TNGDは**自然勾配降下法(NGD)**をアナログ熱力学コンピュータとGPUのハイブリッドループで実行し、2次最適化の計算負荷を下げようとするニューラルネットワークの学習手法
  • 2次の学習手法は損失地形の曲率情報を活用するため収束特性に優れるが、デジタルハードウェアではフィッシャー情報行列の計算と線形システムの求解コストのため、大規模学習には使いにくい
  • 平衡状態にあるアナログシステムの熱力学的性質と物理的なOrnstein–Uhlenbeck processを利用して、NGDのパラメータ更新規則を実装する
  • ユーザーはモデルアーキテクチャを維持し、アナログコンピュータは学習だけを高速化するため、モデルをハードウェアに固定する一部のアナログ推論アクセラレーション方式とは異なる
  • 数値実験では、分類と言語モデルのファインチューニングにおいて最新のデジタルな1次・2次学習手法を上回る結果を示し、十分に並列化すればAdam・SGDに近い反復あたり実行時間が可能

TNGDが狙う学習コストの問題

  • 高度化したAIモデルの学習コストが増大し、世界をリードするモデルでは学習に数億ドルかかる水準になっている
  • デジタルハードウェアでは、Moore’s LawとDennard’s Lawの終焉が実行時間とエネルギー効率に影響を与えている
  • こうした制約により、AIモデルの学習効率を高めるための特殊目的の非伝統的ハードウェアの必要性が高まっている
  • デジタルハードウェアは、ユーザーが選択できる学習アルゴリズムの幅も狭めている
    • SGD、Adamおよびその派生手法が、DNNと大規模AIモデルの学習で広く使われている
    • より精巧なオプティマイザは計算オーバーヘッドが大きく、デジタルハードウェアではまれにしか使われない

2次最適化の利点とボトルネック

  • 2次手法は損失地形の曲率情報を捉えるため、理論的にはより強い収束特性を持つ
  • 自然勾配降下法(NGD)は、フィッシャー情報行列のような2次量を推定し、各エポックでコストの高い線形システムの求解を行う必要がある
  • K-FACのようなNGD近似手法は可能性を示し、Adamより優れた性能も示したが、任意のニューラルネットワークアーキテクチャに適用するのは依然として難しい

ハイブリッドなデジタル・アナログ学習ループ

  • TNGDは、GPUがアナログ熱力学コンピュータと通信するハイブリッドなデジタル・アナログループとして動作する
  • 学習中、一定の時間間隔で勾配とフィッシャー情報行列、または他の正の半定値曲率行列を計算し、その間はアナログのダイナミクスが進行する
  • アナログシステムの平衡状態で現れる熱力学的性質が計算資源として使われる
  • ユーザーはモデルアーキテクチャを提供し、アナログコンピュータは学習過程だけを高速化する
    • モデルをハードウェアに固定し、ユーザーがアーキテクチャを自由に変えにくい一部のアナログAI推論アクセラレーション提案とは対照的

計算複雑性と実験結果

  • TNGDは特定のパラメータ領域でNGDと同等だが、コストが過度に大きい線形システムの求解を避ける
  • 物理的なOrnstein–Uhlenbeck processを活用して、NGDのパラメータ更新規則を実装する
  • 反復あたりの実行時間はパラメータ数に対して線形にスケールする
  • 適切に並列化すれば、AdamやSGDのような1次オプティマイザに近い実行時間が可能
  • 数値実験では、分類タスクと抽出型質問応答を含む言語モデルのファインチューニングで、TNGDが最新のデジタルな1次・2次学習手法を上回る結果を出した

1件のコメント

 
GN⁺ 2024-05-26
Hacker News のコメント
  • 要点は、自然勾配降下法が二次法だという点にある。主要な更新式は ∇̃L(θ) = F⁻¹∇L(θ) で、これは線形システムを解く必要がある。
    ここには著者の以前の論文 Thermodynamic Linear Algebra の手法を使える。完全なニューラルネットワークを熱力学コンピュータ上に実装するのは難しいため、論文では通常の GPU と並列に実行する方式を提案している。GPU が F∇L(θ) を計算し、線形システムはデジタルシステムと並列に動く熱力学コンピュータへ渡す構成だ(図1)。ただし図3の「Runtime vs Accuracy」グラフは、必要なコンピュータがまだ存在しないため、TNGD アルゴリズムの時間モデルを使っている点が重要。
  • かっこよくて興味深い。著者らは損失地形の曲率、つまり二次導関数を反映するハイブリッドなデジタル・アナログ学習ループを提案し、数値シミュレーションにより、この方式が物理システムとして実装されれば、学習ループの各反復計算コストがパラメータ数に対して線形に増えることを示している。
    熱力学の法則に AI モデル学習の仕事を肩代わりさせ、既存のデジタルハードウェアと学習方法のスケーリング限界や難題を超えられるなら、そうした方向を探ることには賛成だ。
  • 論文は主にディープラーニング/ニューラルネットワークの学習と最適化結果を扱っているが、同じ最適化フレームワークを別種の難しい、あるいは大規模な最適化問題にどれほど容易に適用できるのか気になる。Extropic(https://www.extropic.ai/) 関連の記事を初めて見たときも同じことを考えた。
    ニューラルネットワーク以外の最適化問題をモデル化できるのか見ようと、ウェブサイトで API やソフトウェアスタックの公開情報を探したが、まだ公開されていないようだ。依然として解く価値の大きい NP 困難な組合せ最適化や大規模な解析的最適化問題は多く、個人的には EDA と半導体設計の問題に関心がある。断熱量子コンピューティングも最適化問題の解決を約束していた技術であり、量子コンピューティングはまだ小規模な解法中心で進んでいる。こうした新しい「熱力学コンピューティング」スタートアップにも、この種の問題を探索するための魅力的な技術を提供してくれることを期待している。
  • 熱力学を活用して二次更新をより効率的に計算するのは確かに見事で、探求する価値があるが、ディープラーニングの文脈で実際に有用かについてはなお懐疑的だ。
    古典的ハードウェア上で非常に効率よく動く二次法[1]はすでにあるが、実務ではほとんど使われず、ADAM のような一次法に押されている。ディープラーニングモデルのように非常に非線形な損失関数を最適化するには、一次であれ二次であれ、結局は非常に低い学習率が必要になるためだ。そのため二次法は、1ステップあたり少し良いパラメータ更新を与えられるとしても、コストの増加がそれを上回ることが多く、たいてい価値は低い。
    [1] https://andrew.gibiansky.com/blog/machine-learning/hessian-f...
    • すごいという点には同意するし、二次法を価値あるものにするのが難しいという点にも同意する。データセットが大きすぎて、ミニバッチの勾配すらまともに推定するのが難しい場合がある。
      データセット全体に対する二次情報を有用に推定するのはさらに難しく、そもそもミニバッチを使う理由が計算可能性にあることを考えると特にそうだ。
  • 論文を詳しく読んだわけではないが、何が魅力なのか教えてもらえるだろうか。表1を見ると、標本サイズの観点では SGD と同じ漸近複雑度を持つように見える。
    今日の大きく過剰指定されたモデルには互いに似た極値が多数あることを考えると、これが本当に必要なのかも分からない。準線形でもなくサブリニアでもないなら、あえて関心を持つ理由はなさそうだ。
  • 約10年前の AI の授業で学んだ焼きなまし法を思い出す。
    https://en.wikipedia.org/wiki/Simulated_annealing
  • 動物のニューロンがどのように学習するかについて、現時点での最良の推定は何だろうか。
  • Geoffrey Hinton が1年ほど前にこういう話をしていなかっただろうか。
  • 理解できない。勾配降下の計算は非常に頻繁に発生し、状態/入力は絶えず変わるのだから、熱地形をかなり頻繁に初期化しなければならないはずだが、それに何の意味があるのか。ここに高速化の余地があるとは思えない。
    むしろ電磁場やその干渉、あるいは 3D 構造で何かできる可能性はありそうだ。
  • 「アナログ熱力学コンピュータが必要だ」というところまではよさそうに見えたが、ちょっと待って、何だって? 物理をきちんと学んだ人に説明してもらえるとうれしい。
    • 論文の付録 C がかなりうまく説明している。複数の演算増幅器、RC 時定数(おそらくデジタルポテンショメータを使用)、PC と接続される多チャネル ADC/DAC インターフェースで積分器行列を構成する。本質的には専用の微分方程式ソルバーだ。
      つまり、昔ながらのアナログ計算と現代の GPU ベースのコードの組み合わせだ。実際にはハードウェアインターフェースのオーバーヘッドや積分器が安定するまで待つ時間のためにより長くかかるが、最適化された実装なら収束を速め、純粋なデジタル解法より優れる可能性がある、という主張だと理解している。核心となるアイデアは、従来の勾配降下が本質的には線形演算である一方、実際にたどる勾配は曲面なので、デジタル領域だけで処理すると不要な複数ステップを経て近似しなければならない、というものだ。問題は、Seymour Cray 以降、多くの人が苦労して学んだように、結局は CMOS が常に勝つという点だ。産業全体の資金力が CMOS の最適化に投入されるからだ。
    • 私の理解では、https://extropic.ai がまさにこれをやっており、この論文の著者たちの会社である https://normalcomputing.ai/ もその可能性が高そうだ。
    • 自然法則を活用して AI モデルを学習させ、デジタルハードウェアと既存の学習方法の限界やスケーリング問題を超えよう、というのが核心だ。
    • 一例として量子アニーラがあり得る。ここでの「プログラミング」は、適切な初期条件を設定し、熱力学的緩和によって最適点に到達させることに近い。
    • こうした製品を作れるなら魅力的かもしれない。世界全体で毎年数百億ドル、場合によってはそれ以上が数値最適化に使われており、それを大幅に加速できるなら非常に収益性が高くなり得る。