1 ポイント 投稿者 GN⁺ 2024-11-03 | 1件のコメント | WhatsAppで共有
  • リアルタイム生成ビデオがゲームのように入力に反応するには、フレーム生成速度が鍵となるが、Oasisは20fpsのインタラクティブAIワールドを目標に公開された
  • DecartとEtchedは、物理・ルール・グラフィックスを別個のエンジンではなくファウンデーションモデルの出力として生成するオープンワールド体験を示した
  • 公開物は、ライブデモ、コード、ローカル実行可能な5億パラメータのモデル重み、より大きなチェックポイントベースのデモで構成される
  • アーキテクチャはTransformerベースの空間オートエンコーダーと潜在拡散バックボーンで、ユーザー入力に合わせてフレームを自己回帰的に生成する
  • 遠距離のぼやけ、オブジェクトの時間的一貫性、ドメイン汎化、インベントリ制御、長いコンテキスト処理は依然として限界として残っており、モデル・データセットの拡張と推論改善が必要である

入力に反応するAIワールド

  • Oasisは、DecartとEtchedが発表したリアルタイムのオープンワールドAIモデルである
  • ユーザーのキーボード入力を受け取り、移動、ジャンプ、アイテム取得、ブロック破壊のようなインタラクティブ体験を生成する
  • 物理・ルール・グラフィックスまでモデル出力に含まれ、別個の物理エンジンなしにファウンデーションモデルだけで体験を構成する
  • 公開されたリソースは次のとおり
  • 結果例には、建築、照明物理、インベントリ管理、オブジェクト理解、動物との相互作用、食べ物を食べた際の体力回復、シャベルが手より速く動作することなどが含まれる
  • 生成可能な環境には、暗い宇宙のような場所、夜のシーン、多様な物体配置、インベントリチェストを開くこと、動物やキャラクターが含まれる
  • テキスト、音声、他のモダリティで体験を制御する拡張の方向性も可能である

Transformerアーキテクチャとリアルタイム推論

  • モデルは空間オートエンコーダー潜在拡散バックボーンで構成される
    • 2つの構成要素はいずれもTransformerベースである
    • オートエンコーダーはViTベース、バックボーンはDiTベースである
    • GameNGen、DIAMONDのようなアクション条件付きワールドモデルと異なりTransformerを選んだ理由は、安定的で予測可能なスケーリングと、EtchedのTransformer ASIC Sohu上での高速推論である
  • Soraのような双方向モデルと異なり、Oasisはフレームを自己回帰的に生成する
    • 各フレームをユーザー入力に条件付けて生成できるため、リアルタイムの相互作用が可能である
    • 学習には、トークンごとに独立したノイズ水準でデノイズするDiffusion Forcingが使われる
  • 長時間にわたり出力を自然に保つ時間的安定性が主要課題だった
    • 自己回帰モデルではエラーが蓄積し、小さな欠陥がグリッチフレームへと拡大しうる
    • これを減らすため、推論時にノイズをスケジュールに従って調整するdynamic noisingを用いる
    • 初期の拡散forward passではノイズを注入してエラー蓄積を減らし、その後のpassではノイズを徐々に除去して前フレームの高周波ディテールを維持する

20fps性能とハードウェアのボトルネック

  • Oasisは20fpsでリアルタイム出力を生成する
    • 類似のDiTアーキテクチャを持つテキストから動画へのモデルであるSora、Mochi-1、Runwayは、複数GPUでも1秒の映像を作るのに10〜20秒かかることがある
    • リアルタイムの相互作用には0.04秒ごとに新しいフレームを生成する必要があり、これは100倍以上高速である
    • Decartの推論スタックにより、ライブフレームレートでの実行が可能である
  • より高速で大規模かつコスト効率の高い実行には、新しいハードウェアが必要である
    • OasisはEtchedのTransformer ASIC Sohuに最適化されている
    • Sohuは4K解像度の100B+次世代モデルまで拡張できる
    • OasisのエンドツーエンドTransformerアーキテクチャはSohu上で効率的であり、100B+パラメータのモデルでも10倍以上多くのユーザーを処理できる

依然として残る限界

  • 遠距離映像のぼやけ、不確かなオブジェクトの時間的一貫性、ドメイン汎化、インベントリの精密制御、オブジェクトの精密制御、長時間範囲に対する限られたメモリが限界として残っている
  • アーキテクチャ構成、データ、モデルサイズに対する感度分析の後、多くの問題はモデルとデータセットの拡張で解決できるという仮説を立てている
  • より大きなモデルを開発しても、レイテンシとコストのバランスを維持するには新しい推論技術が必要である

1件のコメント

 
GN⁺ 2024-11-03
Hacker Newsのコメント
  • Minecraftの中で夢を見ているとしたら、こんな感じだと思う
    オブジェクトの永続性が足りないので、本当に夢のように感じる。ライティングのレベルも興味深くて、暗い場所を長く見たり、「水中」に入って画面が黒くなったりすると、黒い画面以外の状態に戻るのが難しい。1回試したプレイでは成功しなかった。かなり奇妙な感覚だ

  • こういう形でゲームを設計して公開する方法はよく分からない。モデルの重みを直接設定してゲームを設計することはできない
    いつかはオブジェクトの永続性や長期状態のような欠けている要素なしでゲームを複製できるようになるかもしれないが、推論エンジンを回すコストは、それが模倣するゲームエンジンより高くつく可能性が大きい。この技術がどこで役に立つのか、長年AIをやってきた立場として本当に気になる

    • その通り。だから次のモデルの中心目標は、プロンプトで新しい世界を「コーディング」できる状態に到達することなんだ
      クリエイターがこのシステム上で新しい世界やゲームを「開発」し、ユーザーがその世界と相互作用できる良い方法が生まれれば、これらのツールは非常に有用になるという点に同意する。結局はゲームエンジンのような「API」を提供する必要がある。クリエイターは世界を作り、ユーザーはその世界と相互作用する。AIがこの役割を本当に果たせるなら、1) 「ここに空飛ぶピンクの象を追加して」のように言うだけで世界やゲームを作るのがはるかに簡単になり、2) 各プレイセッションに合わせて変化する世界とユーザーが相互作用できるので、本当の
      無限の世界
      が可能になる。そこまで到達したかといえば、もちろんまだだ。Oasis v1は最初の概念実証で、v2をもう少し待てばいい ;)
    • もちろんこのツールが今すぐリリース可能なゲームを作ってくれるわけではない。AIはまだまだ先だ
      ただし「設計」の面では、GPUを大量に使うとしてもゲームを素早くプロトタイプ化できることがどれほど有用かは想像に難くない。こうした論文はその方向へ進むための足がかりにすぎない
    • 視覚的アーティファクトが気になった。誰かがメッシュ/マテリアル、カメラ、あるいは生のOpenGL呼び出しのようなラスタライズ前のゲームエンジン出力を学習させたことがあるのか気になる
      実際のレンダラーやエンジンへの入力を生成するAIなら、視覚的忠実度の問題を解決できそうだ
    • 簡単だと思う。AI画像でやったのと同じ方法をビデオゲーム世界モデルに適用すればいい
      複数のモデルを組み合わせ、それぞれのゲーム「世界モデル」の断片を持ってきて合成すれば、ほぼ完全に新しいゲームを作るのと同じになる。オブジェクトの永続性や長期状態のような欠けた要素は、はるかに小さな変数集合として追加できる。すでに前フレーム全体とユーザー入力を重みに入れているのだから、単純化したゲーム状態も一緒に入れられない理由はないように思える
    • Avatarのような映画を持ってきて、ある程度インタラクティブな体験にすることはできそうだ
  • 「完全にAIが生成したビデオゲーム」と言っているが、WebページでCtrl-FしてみるとMinecraftは0件だった。なぜなのか分からない
    これはビデオゲームではなく、実在するビデオゲームの粗悪なコピーであり、名前を出したりクレジットを与えたりする努力すらしていない

    • 法的問題を避けようとする興味深い試みに見える
      「Minecraft」と言えないのはMicrosoftの商標だからだが、Minecraftの画像を学習データに使うことは可能だと見ているようだ。Microsoftを含め、みんな独占的なデータを使って拡散モデルを学習させているのだから。出力が明らかにMinecraftに似ているという問題はあるが、MicrosoftもBingとDALL-Eがガードレールにもかかわらず商標のあるものに明らかに似た画像を生成してしまう問題を抱えている
    • Architectureセクションの第2段落にはMinecraftが1回出てくる。"...We train on a subset of open-source Minecraft video data collected by OpenAI[9]."と書かれている
      これが元のコメントの後に追加されたものかどうかは分からない
    • 変だ。Counter Strikeを明示的に言及している https://diamond-wm.github.io/ と比べるとなおさらだ
      科学的な仕事が何らかの作品を使いながらクレジットを与えないのは学術的不誠実だ。他のデータセットで学習することもできたかもしれないが、どのソースを使ったにせよ引用すべきだ
    • モデルがどんな環境でも生成できるかのように語っておきながら、デモではデータが最も多いゲームしか見せていないのは妙だ
  • 本当にすごいし、こういうモデルが引き続き急速に進歩しているのを見るのも良い。ただ、長期状態がどう機能するのか気になる
    例えば拠点を建てて後で戻ること、従来のコードで強制されるゲームルール、マルチプレイヤー、セーブデータの読み込みのような誘導された状態がどう扱われるのか分からない。根本的に、外部状態とメモリ/シミュレーションは別物なので、コンテキストウィンドウを広げたりモデルを大きくしたりするだけではない可能性が高い。もちろん助けにはなるだろうが。いずれにせよ、こうしたモデルはまもなく目標指向の作業の想像に使われるように思う。たとえば、コンピュータ上で特定の画像を探さなければならないエージェントが、現在見ている状態と望ましい状態のあいだの経路を継続的に想像するような形だ。このモデルはユーザー入力を受け取るが、そうしたエージェントはその入力まで想像することになる。理解している限りでは、一部のロボット制御ネットワークではピクセルなしで既に似たことが起きている

    • このデモには状態の痕跡すらほとんどない。「左を向く」を1周分ずっと押し続けても出発点には戻らない
      何周か回ると細部が消え、何もない海のど真ん中に取り残される。この技術ではMinecraftどころか、Marioのプレイ可能版すら絶対に作れそうにない
  • これはビデオゲームではなく、各フレームの間でプロンプトが入力状態と前フレームになっている高速Minecraftスクリーンショットシミュレーターに近い
    ある程度の一貫性らしきものはある

  • 要するにMinecraftでモデルを学習させたということだ。まったく汎用的ではない
    ゲームがプロンプトから出てきたのではなく、Minecraftのプレイから得た大量のデータセットとファインチューニングから生まれた可能性が高い。プロンプトから世界やゲームが出てくるこういう仕事を見てみたい

    • もうすぐ出るOasis v2を待てばいい :)
      ちなみにOasisチームの一員です
  • プレイ中にユーザーがフレームバッファに直接描けるようにして、それを再び入力に戻せば、かなり面白いものが出てきそうだ

    • 手でMinecraftを描くのは本当に難しいから、たぶんひどく壊れると思う
  • 待機列が長すぎて諦めた。ピクセル自体をモデルが生成しているのか、それとも環境だけを生成して「従来型」の方法でレンダリングしているのか気になる

    • 従来型にレンダリングされる環境を生成しているのなら、ちらっと視線をそらしたあとで新しい何かを再生成するのではなく、オブジェクトの永続性がある可能性が高い: https://oasis-model.github.io/3_second_memory.webp
    • すべてのピクセルが生成されている。ユーザー行動が入り、ピクセルが出てきて、その間にはTransformerしかない :)
      なぜ興味深いのかといえば、今日の時点ではそれほど面白くないかもしれない。Oasis v1は概念実証にすぎないからだ。でも未来、文字通り数か月後に出るOasisの後続バージョンを考えると、今このメッセージを読みながら見ているピクセルまで含め、見えるすべてのピクセルが生成される状況を想像できる。これは人間と機械のあいだの新しいコミュニケーション・インターフェースだ。LLMがチャットで面白いのは、人間にとってなじみのある会話という形で人間と機械が相互作用できるからだとすれば、ここではコンピュータが私たちが見るように世界を見て、私たちになじみのある形でそれを再び見せられるようになる。要するに、コンピュータに「ピンクの象を作って」と言えば、それが今プレイしているゲームにすぐ現れる姿を想像すればいい
    • ピクセルを生成している。下のぼやけたUIも含めてだ
  • Marioゲームでモデルを学習させて、Nintendoが「正当な理由」のために戦うようにすべきかもしれない