1 ポイント 投稿者 GN⁺ 3 시간 전 | 1件のコメント | WhatsAppで共有
  • Black Forest Labsとmimic roboticsは、画像・動画・音声を共同学習したFLUX 3バックボーンにロボットの行動予測を組み合わせ、Audiの生産現場で試験・展開したFLUX-mimicを開発
  • 学習計算全体の95%以上を占める動画予測によって、接触・運動・重さ・因果関係を学び、低次元のロボット行動も同じ物理的現実を表す追加モダリティとして扱う
  • 行動予測を追加した直後は動画生成品質が最大10%低下したが、3,500ステップ後に従来水準を回復し、1つのバックボーンで生成と行動予測を同時に実行できることを確認
  • Self-Flowで生成学習と表現学習を統合し、軽量な行動デコーダを接続して、単一のNVIDIA RTX 5090でバックボーン処理80ms未満、ロボット全体の応答時間101msを達成
  • 汎用動画と操作タスクを大規模に学習したワールドモデルは、少ないデモだけで新しいタスクに適応し、失敗後に再試行できるため、柔軟な部品や精密操作のような従来自動化コストが高かった生産作業に活用される

1つのバックボーンでコンテンツ生成とロボット制御

  • FLUX 1・FLUX 2が画像生成に集中していたのに続き、FLUX 3は画像・動画・音声を最初から同時に学習し、視聴覚コンテンツを共同生成する
  • Black Forest Labsはmimic roboticsにFLUX 3の初期バージョンを提供し、両社のロボット学習・展開と基盤モデルの専門性を組み合わせてFLUX-mimicを開発
    • mimicは自社ロボットとロボット学習、高度な操作、生産環境への展開を担当
    • Black Forest Labsは視覚ベースモデルとマルチモーダル学習・モデリング能力を提供
  • FLUX-mimicはFLUX 3バックボーンに基づく汎用操作向けのビデオアクションモデルであり、mimicのフルスタック展開システムに統合されている
  • 同じバックボーンが画像・動画・音声コンテンツを生成すると同時に、Physical AIでは行動を実行する

動画予測で学習する物理世界

  • FLUX 3の学習計算の95%以上は動画予測に使われる
    • リアルな動画を作るには、接触、運動、重さ、原因と結果を学習する必要があり、これを誤って扱うと生成映像も不自然になる
    • 世界を正確にレンダリングする過程は、世界がどう動作するかを学ぶ過程と結びついている
  • 音声は720pの音声付き動画においてトークンの0.5%未満を占める低次元モダリティである
    • 動画を理解したモデルは、口の動きと同期した音声や、物理的な出来事に対応する効果音の因果関係を学習できる
  • ロボット行動もまた、視覚観測と密接に結びついた低次元の状態表現である
    • 行動・音声・動画フレームは、1つの物理的現実を部分的に表している
    • 行動予測は別個の基盤モデルを作る代わりに、既存のワールドモデルにもう1つの観測方式を接続するものだ

行動学習後に回復した生成品質

  • 大規模学習に行動予測を追加すると、テキスト-to-動画と画像-to-動画生成の人間評価スコアは当初最大10%低下した
  • モデルが行動空間の構造を学び、内部の世界表現を整列させることで品質が回復し、3,500ステップ後には従来の動画生成水準に到達しつつ行動も予測できるようになった
  • 行動を入出力に統合する過程では一時的な混乱があったが、既存能力の容量を恒久的に犠牲にしたわけではなかった
  • 動画生成と行動予測のために別々の基盤モデルは不要で、同一の単一バックボーンが2つのタスクを担う

世界表現から行動を復号する構造

  • FLUX-mimicは、FLUX 3が動画生成のために学習した内部の世界表現からロボット行動を復号する
  • mimic-videoで先に用いられた手法に従い、FLUXの動画予測経路から中間特徴を抽出し、その上に軽量な行動デコーダを学習する
  • 性能は相互に結びついた2つの要素に左右される
    • ワールドモデルの品質:世界がどう動くかを理解できなければ正確なシミュレーションも難しく、生成品質と直接結びつく
    • 表現の品質:モダリティ間の因果関係が特徴空間で非線形に絡み合っていると、行動デコーダはそれを生の入力と同じくらい難しく解釈しなければならない
  • 生成モデルは高品質なシミュレーションと、計算量の増加に応じた予測可能なスケーリング則を提供するが、専用の表現学習手法よりも分離の弱い表現を生み、世界理解が必要な下流タスクでの有用性を制限する可能性がある

Self-Flowで統合した生成学習・表現学習

  • Self-Flowは生成学習と表現学習を1つのフレームワークに統合する
  • 適用後はワールドモデルと表現の品質がともに向上する
    • 動画・画像・音声生成品質で測定したワールドモデル性能が向上
    • シミュレーションロボット制御タスクの成功率で測定した表現品質も改善
  • FLUX 3はSelf-Flowを拡張し、最初から幅広い世界ダイナミクスと操作能力を学習する
    • 一般動画コンテンツ数千万時間
    • 人間およびロボット操作に焦点を当てた動画コンテンツ数十万時間
  • この大規模学習により、研究室でのSelf-Flowの成果を実際の生産・物流環境へと拡張した

工場作業とベンチマーク性能

  • mimicはFLUX-mimicを実際の工場業務に展開している
    • 部品を構造化トレイに入れるキッティング
    • 電子制御ユニットをクリアランスの小さい治具に挿入する作業
    • 部品組み立て
    • 糸・ケーブルのような柔らかく柔軟な材料の取り扱い
  • FLUXバックボーンを完全に固定しても、行動デコーダは従来の視覚・言語・行動モデルより高い性能を示し、従来モデルはこの設定でタスクを成功させられなかった
  • バックボーンと行動デコーダを一緒に微調整すると、FLUX-mimicは最高水準のタスク成功率を記録した
  • 大規模学習はバックボーンに世界と行動に関する知識を与え、Self-Flowはその知識を特徴表現から容易に復号できるようにする

少ないデモで学び、失敗から復旧

  • 物理法則がすでにアクセスしやすい表現に含まれていれば、新しいタスクへの適応は世界の動作原理を学び直すのではなく、特定タスクを既存知識に結び付けるプロセスになる
  • Self-Flowの実験では、同じ成功率に到達するのに必要な行動予測学習ステップが、Self-Flowを使わない動画モデルの半分に減少した
  • mimic-video論文では、ビデオアクションモデルは視覚・言語・行動モデルより最大10倍高いサンプル効率を示しており、FLUX-mimicはその2つの効果を組み合わせている
  • ロボットが物体の把持に失敗すると、姿勢を修正して再度つかみ、作業を完了する自然な失敗復旧が可能である
    • すべての失敗タイプをデモデータに含めることはできないため、実演されていない復旧行動は、世界の動作をすでに学習したモデルから生まれる

101msで応答するロボットシステム

  • 実環境では、モデルは環境変化の速度に合わせて行動しなければならず、FLUX-mimicの計算コストの大半は最大の構成要素であるバックボーンで発生する
  • よく構造化された世界表現は、同じ性能をより少ないパラメータで達成できるようにし、より小さく高速なバックボーンを使えるようにする
  • 最適化されたバックボーンは、単一のNVIDIA RTX 5090上で入力から世界表現生成まで80ms未満で実行され、人間の視覚反応時間と同程度である
  • mimicは展開スタック全体で追加遅延を減らすため、次の要素を最適化した
    • 行動デコーダ
    • センサー・モデル・アクチュエータ間のプロセス間遅延
    • 予測と実行を重ねてロボットの途切れを防ぐリアルタイムチャンク処理
  • すべての最適化を適用したスタンドアロンロボットシステムの最終応答時間は101msである

Audi生産現場への適用

  • Audiは高い自動化水準にもかかわらず、柔軟な部品や精密操作作業を引き続き手作業で処理してきた
  • プレミアム製品の生産はバリエーションの種類が多く、従来方式でプログラムしたロボットセルをケースごとに再設計するコストが高い
    • 学習ベースのシステムはこのコスト構造を変える
  • Audi Production Labはmimicと協力し、FLUX-mimicを試験・展開した
    • 従来のロボットでは不可能だった複雑な柔軟物体の操作を実行
    • 従業員支援、効率改善、生産・物流の柔軟な自動化拡大に活用できる
  • FLUX-mimicのサンプル効率と堅牢性は、タスクごとのエンジニアリングではなく、FLUX 3バックボーンと復号可能な表現から生まれており、タスク・業界・ハードウェア間の移転を支援する
  • 1つの視覚知能ベースモデルが画像・動画・音声を生成すると同時に、生産ラインのロボットを駆動する

1件のコメント

 
GN⁺ 3 시간 전
Hacker Newsのコメント
  • 十分に訓練されたマルチモーダル動画生成モデルの内部には世界表象モデルが形成されており、それを抽出してロボットに適用してもうまく機能するように見える。
    動画モデルが物質や光、世界を理解するという発想自体は新しくないが、動画研究所がロボット研究所へ転換した例は珍しかった。動画生成でスケールを拡大し、その能力でロボットを訓練するという事業ルートになり得る。
    手袋の中に複数の装置を隠しているようなBFLの手も興味深い。XiamiのRobotics-1は一般的なグリッパーとグリッパー型手袋で訓練映像を作るが、BFLモデルにはそうした装備が不要に見える。ハードウェアが難しい分野だけに、今後どんなアプローチを取るのか気になる

  • 3分30秒ごろ、ロボットアームが3回試した末に窓のモールディングをはめ直す場面はかなり驚かされた。こういう失敗後の問題解決は初めて見たが、新しい技術なのだろうか

  • 「世界理解が必要な作業では、より分離されていない表象は役に立ちにくい」という説明で、「より絡み合った」という概念をわざわざ分離されていない表象と表現している文が面白い。現実世界を説明しながら、概念自体もさらに絡み合わせてしまうのは、いかにもLLMらしい言い回しに見える

    • もう根拠もなく文ごとにLLMの痕跡を探す段階になっている。あらゆる文章はある程度LLMの助けを借りているものと考えて、成果物の品質だけを評価する時期だ
    • 人間も不自然な文をよく書く。むしろそういう表現は訓練データでは珍しいので、LLMが作る可能性は人間より低いかもしれない
    • 冗談だった
    • 元のダッシュも、このコメントをLLMが書いた明白な証拠だ /s
  • 技術はここまで進歩したのに、映画はかつてないほど悪くなったようで悲しい。まともな作品を探そうとして何十年も前の映画を見ることがあるが、滑稽な人形を使っていても物語構成は1,000倍優れていた

    • 誰にも記憶されていないひどい昔の映画を見ないから生じる生存者バイアスかもしれない
    • Robin Rombachが映画制作を知らないという理由でBFLへの投資を断るだろうか。Soraは終わっており、Bill Peeblesが映画制作を知らないと公に言う勇気のある人を見つけるのも難しい。
      これはベンチャーキャピタルだけの問題ではなく、いわゆるHollywood Noにもつながっている。逆にHollywood Noそのものが問題なのかもしれず、ゲーム業界ではこれを有害なポジティブ思考と呼んできた
  • ヨーロッパのスタートアップ同士の協力を見るのはうれしい

    • FluxはMetaに買収されたのでは?
  • これは未来であると同時に、すでに現在でもある。ソフトウェア開発・エンジニアリングの外にいる知人にもこの内容を共有してほしい

  • 生産手段を所有しない人間の価値がさらに下がっていく危機へと、真正面から突き進んでいる。暗い時代が近づいているように見える