1 ポイント 投稿者 GN⁺ 2 시간 전 | 1件のコメント | WhatsAppで共有
  • 画像・動画・音声を単一のアーキテクチャで共同学習し、生成・理解・行動予測の統合を目指すマルチモーダル基盤モデルで、FLUX 3 VideoからEarly Accessとして提供される
  • 画像の空間構造、動画の時間・物理ダイナミクス、音声の出来事・音の関係を相互制約として学習し、Self-Flowを基盤にデータと計算資源を拡張する
  • ネイティブ音声付き動画を一度に最大20秒まで生成し、初期評価ではGrok Imagine Videoより最大69%、Runway Gen-4.5より77%、Luma Ray 3.2より93%の比較で好まれた
  • 画像合成・編集と多言語テキストレンダリングをサポートし、事前学習済みの動画バックボーンを限られたタスク別データで微調整してロボット行動モデルとして活用できる
  • Video・Image・ActionとオープンウェイトベースのFLUX 3 Devを順次リリースし、長期的には知覚・行動・言語予測を1つのモデルに統合することが目標

現実を共同学習するマルチモーダルモデル

  • FLUX 3は画像・動画・音声を分離された要素ではなく、同じ現実を異なるセンサーで観測した結果として扱う
    • 画像は特定時点の空間構造と関係を捉える
    • 動画は時間次元を復元し、動き、時間的ダイナミクス、物理法則を明らかにする
    • 音声は視覚だけでは感知しにくい機械的現象と音響の因果関係を示す
    • 言語はこうした知覚を目標・抽象化・指示と結び付ける
  • 複数のモダリティを共同学習すると、音は衝突と一致し、動きは質量に従い、未来は過去から連続していなければならないという相互制約を活用できる
  • FLUX 3はこれらの原則だけで構築した最初のモデルであり、物理・デジタル環境で知覚し、予測し、行動する現実世界の視覚知能を目指す
  • コンテンツ制作とフィジカルAIで得られた初期結果は、このアプローチの可能性を示している

Self-Flowベースの統合アーキテクチャ

  • Self-Flowは、1つの基盤アーキテクチャでマルチモーダル生成と理解を効率的に整合させるアプローチ
  • FLUX 3はSelf-Flowを基に計算量とデータ資源を大きく拡張し、動画・画像・音声を同時に学習する
  • 公開比較では、モダリティ別の生成誤差をFlow Matching基準100に正規化したFréchet distanceと、微調整後の4つのタスク群における操作成功率が使われた

動画とネイティブ音声の生成

  • FLUX 3は1回の生成で最大20秒の多様な動画と音声を作成できる
  • 対応範囲は次のとおり
    • テキストから動画を生成
    • 開始フレームを継続したり、画像を視覚参照として使ったりする画像から動画の生成
    • 元のキャラクターのような主要要素を新しいシーンや文脈へ移す動画から動画の生成
    • 入力動画と音声を継続して作る生成型の動画・音声連続生成
    • 指定したシーン間の遷移を制御するキーフレームから動画の生成
    • 多言語対話
    • 従来の映画フォーマットを超える多様な視覚スタイルとアスペクト比
    • 個別のクリップをより長いマルチショットシーケンスへつなげるエージェント型チェイニング
    • カムコーダー映像からアニメーション・映画映像までを網羅する幅広いスタイル
    • タイポグラフィ生成とアニメーションデザイン
  • すべての動画出力にはネイティブ音声生成が含まれる

初期動画評価

  • 予備評価は音声付きの720p 10秒テキストから動画クリップで実施した
  • 比較評価でFLUX 3が好まれた割合は次のとおり
    • Grok Imagine Video比で最大69%
    • Kling v3 Pro比で60%
    • Happy Horse v1比で59%、Happy Horse 1.1比で57%
    • Seedance 2.0およびGemini Omni Flash比でそれぞれ52%
    • Runway Gen-4.5比で77%
    • Luma Ray 3.2比で93%
  • モデルと周辺のハーネスはまだ開発中のため、結果は予備段階であり、Early Access期間中にさらに改善される予定
  • 現時点で特に強い領域は、人の表情の把握、物理的な出来事と音の結び付き、多言語処理
  • 視覚参照によってシーン全体のキャラクター一貫性を保ちながら、複数のクリップを組み合わせて数分規模のシーケンスを作成できる
  • FLUX 3 VideoはEarly Accessとして提供される

画像合成と編集

  • FLUX 3は多様なスタイル・アスペクト比・解像度で画像を合成・編集できる
  • 中間学習段階の予備評価では、以前のFLUXバージョンより複雑なプロンプト処理とテキスト生成能力が大きく向上した
  • 多様な出力スタイルを生成し、複数言語のテキストを高精度にレンダリングできる
  • 評価結果はまだ予備段階であり、正式リリースまでに追加改善する予定
  • FLUX 3 Image Early Accessは今後数週間以内に開始する計画

行動予測とロボット学習

  • 現実理解を行動予測へ拡張するため、2つの経路を使う
    • Self-Flowの初期研究を拡張し、FLUX 3自体にネイティブ行動予測を統合する
    • 事前学習済みの動画バックボーンをダイナミクスを理解する基盤とし、限られたタスク別データで専門的な行動モデルを微調整する
  • 初期アクセスパートナーであるmimic roboticsとともにFLUX-mimicを開発した

機能別の順次リリース

  • 各機能は、円滑なリリースとフィードバック収集、厳格な安全性テストのためのEarly Accessを経て、今後数週間から数か月にわたって提供される
  • いずれも同じマルチモーダルFlow Matching基盤モデルから派生している
    • FLUX 3 Video: APIと非公開ウェイトアクセスを通じた動画・音声の生成および編集
    • FLUX-mimic・FLUX 3 Action: mimic roboticsを皮切りに、選定された研究・商用パートナーへ行動予測を提供
    • FLUX 3 Image: APIと非公開ウェイトアクセスを通じた画像合成および編集
    • FLUX 3 Dev: 動画・音声・画像コンテンツ生成と行動予測のためのマルチモーダルバックボーンのオープンウェイトを提供
  • 基盤アプローチの追加技術詳細も公開予定で、Early Accessに申し込むことができる

知覚・行動・言語の統合

  • 今後の適用対象として、対話型の画像・動画編集、シミュレーション、コンピューター利用、フィジカルAIを掲げる
  • 現在の機能を段階的にリリースしながら、次世代モデルの開発も進めている
  • 最終目標は、知覚・行動・言語予測を1つの統合モデルに結合すること

1件のコメント

 
GN⁺ 2 시간 전
Hacker Newsの反応
  • 公開ウェイト版が最高性能(SOTA)になることを期待している
    今後数週間から数か月の間に、コンテンツ制作と行動予測のためのマルチモーダル基盤モデル
    FLUX 3 Dev
    を公開ウェイトで提供し、基盤アプローチの技術的詳細も公開する予定とのこと

    • 公開ウェイトの約束は歓迎だが、過去にも似た約束が実現しなかったという話があった
      基盤モデルがDev版として出るなら、何が省かれるのかも投稿だけでは把握しづらい
  • 人を見せる例はほとんどなく、ワールドモデルという用語を軽々しく使っており、20秒の動画をうたいながら実際にはジャンプカットしか見せていない
    結局のところ、肝心な部分はすべて「近日公開」ということになる

    • /r/stablediffusion には動画の作例がたくさん上がっている
    • モデルベース強化学習で使われていたワールドモデルという言葉が、今では線形回帰のような単純なものまで指せるようになったようだ
      強化学習の分野も行動科学からこの言葉を借りてきた可能性があるので、もう受け入れるしかないのかもしれない。哲学者や視覚芸術家がオブジェクト指向をそれぞれ勝手に誤用したのと似ている
    • 公開のされ方がかなり奇妙で、動画をどこで見ればいいのか不思議だった
  • ここの反応は驚くほど否定的で皮肉っぽいが、自分にはこのモデルの性能がかなり印象的に見える
    否定的な人たちはいつも真っ先に悪口を書き込むものだという話もあるので、もう少し様子を見るつもりだ

    • HNの空気感を時系列分析したら面白そうだ
      最近のHNは以前よりネガティブな雰囲気が強くなった気がするが、気のせいであってほしい
    • 実際に良いモデルである可能性は高いが、Qwen-Image-3がLaTeXでレンダリングしたような画像や、複数要素を並列または奥行き付きで構成する能力を見せた後では、視覚品質だけに集中する方向性が完全に正しいのかは疑問だ
    • 最新の高性能LLMをコーディングや自動化ツール作成に積極活用し、異なるオープンソースをつないで新しいプロジェクトを作る骨の折れる作業を任せている
      適切な実行環境を整え、モデルが誤った推論に陥ったり微妙に間違った結果を出したりしていないかを見抜ける程度に分野を理解していれば、かなり楽観的でいられる。一方で、ソーシャルメディアがひどいAI生成画像や動画であふれているのを見ると、完全合成の画像・動画生成器が現実世界で有益に使われる可能性についてはずっと悲観的だ。数百万人の手に渡ったとき、社会に利益をもたらすより害を与える形で使われているように見える
    • Star Trekのホロデッキと比べると、この程度ではあまり興味をそそられない
    • Martin Scorseseがいまやアドバイザーとして加わっているので、BFLは今後も自らを映画制作者のための研究所として位置づけていくのだろう
      この動画モデルがSeedance 2.0に近いレベルなら、コストが高すぎて低品質コンテンツ生成には向かず、プロジェクトのVFXパイプラインに入る可能性が高い
  • モデルに触覚データを学習させているところがあるのか気になる
    ロボットに一番やってほしいのは物体に触ることなのに、与えられているのは音声・動画・画像ばかりで、一度も触れたことのないモデルが接触方法を学ばなければならない。ロボットが物体に触れるときにためらっているように見えるのも、そのせいかもしれない

    • 実際の触覚データを与えるより、接触をシミュレーションするほうが速く、そのほうがはるかに早く学習する
  • Flux 2 Dev Kleinは、一般的な商用ハードウェアで使えるモデルの中では事実上最高だった
    Flux 3にもそれに相当する最新の公開ウェイトモデルが含まれていてほしいし、そうでなければ多くのホビーユーザーにとって大きな損失になるだろう

  • ヨーロッパ発のAIプロジェクトで、初めて大きな期待を抱かせてくれる

  • Freiburg im Breisgauで採用しているらしいが、現地で人材確保がうまくいくのか気になる

    • Freiburgはとても美しい場所だ
      そこに住む友人の一人は周囲の山でロードバイクを楽しみ、別の友人は冬になると昼休みにクロスカントリースキーをしている
    • 近くに住んでいるが、ドイツでも有数の日照に恵まれた地域で、景観も素晴らしい
      人材プールについては分からないが、大学はある
    • University of Freiburgはかなり有名だ
      SF外のスタートアップが大学都市で採用するのはよくあるやり方だ
    • 人々がそこをFlyburg im Nicegauと呼ぶのには理由がある
    • 最近では、米国にないという点が多くの潜在的応募者にとってむしろ利点かもしれない
  • 水浸しの部屋で踊り始めるまでは実写映像だと思っていた

  • 2.3バージョンは素晴らしく、事前アクセス権を得た人たちが公開した動画と評価を見る限り、今回のモデルは家庭用途では新たな最高性能になりそうでとても楽しみだ

  • モデルが世界や出来事の音を表現する方法を学ぶ必要があるなら、冗談半分で、学習過程に不自然なくらい大量のWilhelm screamを入れてほしい

    • ゴム製シーラントをあまり乱暴にはめ込むと悲鳴を上げるかもしれないので、丁寧に扱わないといけない