1 ポイント 投稿者 GN⁺ 2 시간 전 | 1件のコメント | WhatsAppで共有
  • Google DeepMindが、視覚・言語入力を動作に変換してヒューマノイドの足元から指先まで制御し、精密な操作とロボット間の協調を支援する Gemini Robotics 2モデル群を公開
  • モデル群は、全身制御向けVLAである Gemini Robotics 2、長期タスクを計画・監督するGemini Robotics ER 2、ロボット上でローカル実行されるGemini Robotics On-Device 2で構成
  • ヒューマノイドは歩行・かがむ動作・物体運搬を連携させ、22自由度の5本指ハンドで結び目を作ったりジッパーバッグを密封したりでき、複数のロボットが単独では処理しにくい作業で協調可能
  • On-Device 2はネットワーク接続なしで実行され、通常は 200件未満の事例と数時間の適応プロセスだけで、形状・センサー・自由度が大きく異なる新しい双腕ロボットに適用可能
  • ER 2はGoogle AI StudioとGemini Enterprise Agent Platformの非公開プレビューで提供され、VLAおよびOn-Deviceモデルは早期アクセスパートナーに開放されているが、移動速度と精度は依然として改善が必要

役割の異なる3つのロボットモデル

  • 従来のロボットは主に、狭く反復的な作業手順を事前にプログラムするか遠隔操作する方式だったため、予測しにくい環境に自力で適応したり、あるロボットの技能を別の形態へ移したりすることが難しい
  • Gemini Robotics 2は、視覚・言語入力をモーター制御に変換する ビジョン・言語・行動モデル(VLA)
    • ヒューマノイド全体と双腕ロボットを制御
    • 両手とグリッパーを使った精密な操作を支援
  • Gemini Robotics ER 2は、ロボットのエージェントの役割を担う 身体化推論(ER)モデル
    • 人とコミュニケーションし、物理環境を理解
    • 数分間続く多段階タスクを計画
    • 複数ロボットによるチーム作業を支援
  • Gemini Robotics On-Device 2は、ロボットデバイス上でローカル実行できるよう最適化された効率的なVLA
    • 数時間分のデータで、まったく新しいロボット形態に適応可能
  • モデルごとに提供範囲は異なる

上半身を超えたヒューマノイドの全身制御

  • 以前のモデルが卓上作業向けのヒューマノイド上半身制御に集中していたのに対し、Gemini Robotics 2は 全身動作まで制御範囲を拡大
  • Apptronik Apollo 2は「じょうろを下の棚の緑色の箱に入れて」という指示を処理できる
    • テーブルまで歩いてじょうろをつかむ
    • 棚へ移動した後、指定位置に正確に置く
  • 歩行・かがむ動作・バランス維持・物体操作をつなげて、狭く散らかった空間での作業を実行するが、移動速度はさらに改善が必要

ハンドとグリッパーを活用した精密操作

  • Apollo 2に搭載された SharpaWaveハンドの5本指と22自由度を制御
    • 結び目を作る繊細な動作を実行
    • ジッパーバッグを密封できる
  • Franka Duoの標準的な2指平行グリッパーで、物をぎっしり梱包するなど複雑な作業も処理
  • 人間レベルの器用さに到達するには、精度と速度を継続的に高める必要がある

長期タスク推論とマルチロボット協調

  • Gemini Robotics ER 2は、ロボットの高水準の頭脳としてユーザー指示を処理し、人とコミュニケーションする
    • 空間を観察して必要な手順を推論
    • VLAと連携して実際の動作を実行
    • 完了まで進捗を追跡
  • 複雑な多段階タスクを実行中にステップが失敗すると 自己修正し、新しい状況や目標にも一般化できる
  • 1つの作業で数百回判断し、数分間続く作業手順を以前より安定して処理
  • 作業の開始と終了を理解し、重要な出来事が発生した時点を特定して 進捗状態を追跡
  • 異なる種類のロボットがコミュニケーションし協力することで、単一ロボットだけでは実行しにくい複雑なワークフローを処理できる

新しいロボット形態への迅速な適応

  • Gemini Robotics On-Device 2は、ネットワーク遅延やインターネット接続なしで動作する必要がある環境向けに、ロボットデバイス上で ローカル実行される
  • 複数のロボット形態を標準でサポートし、Gemini Robotics 1.5の動作転移技術を継承
  • 通常は 200件未満の事例と数時間の適応プロセスだけで、新しい双腕ロボットに適用できる
  • 外形・センサー・自由度が大きく異なるロボットにも適応し、Dexmate・SO101・Trossenプラットフォームでさまざまな作業を実行

不確実性まで扱うロボット安全性

  • ロボットの物理的能力が高まるほど、従来の物理安全対策とAI安全フレームワークを組み合わせた 多層的な安全アプローチを適用
  • ASIMOV-Agenticは、エージェントの安全調整と不確実性処理を評価する新しいベンチマーク
    • VLAが要求した安全でないツール呼び出しを、身体化推論エージェントが拒否できるかを測定
    • タスク実行可能性を予測し、不確実な場合に人の介入を先回りして求めるかを評価
  • Gemini Robotics ER 2は、安全制約の順守および人への近接ベンチマークにおいて、Google DeepMindの既存ロボットモデルの中で最も安全な性能を示す
    • 周囲の人をよりよく検知
    • 人が近づきすぎると安全ツールを呼び出し、ロボットを安全に停止
    • 人と一緒に作業するための協働安全規格で求められる機能
  • 詳細な評価は Gemini Robotics 2: Safety Technical Reportで確認できる
  • 単一作業の自動化を超え、人とともに複雑な問題を解決する 汎用物理AIの中核知能構築を目指す

1件のコメント

 
GN⁺ 2 시간 전
Hacker Newsのコメント
  • このモデル開発に参加したDeepMindの研究者として言うと、DeepMindは働きやすい場所。Gemini・Gemma、ロボティクス、天気・生物学のような科学など、知能に関わるほぼあらゆる分野を行き来できる数少ないユニークな研究所であり、優れた同僚も多いので、参加を検討する価値はある

    • フロンティアモデル開発と公開モデル開発は具体的に何が違うのか気になる。公開モデルは普通より小さく、安全性検査もより多いが、本質的には似ていて、一般的なAI研究の大半は両方に適用されるのではないかと思う
    • 政府・企業・軍隊による悪用をどう防いでいるのか、真剣に気になる。この技術が一般の人々の生活を改善するためにどれほど使われ、監視と統制を強化するためにどれほど使われるのかも知りたい
    • 「唯一の研究所」という表現は大げさ。Allen Institute for AI(AI2) もフロンティア水準ではやや劣るが、大半の領域を扱っており、NSFの1億5,200万ドル支援とNvidiaとの協力にも期待できる。ロボティクス分野にはMolmoBot、MolmoSpaces、MolmoActなどがある: https://allenai.org/embodied-ai
    • 2007年から AGI Conference を運営してきたAGI Societyの専務理事として、来年のイベントで研究を発表してほしいと招待したい。今年はAlexander Lerchnerの発表が素晴らしく、希望するメールアドレスを教えてくれれば連絡する
  • AnthropicとOpenAIが注目の80%を占めているが、Googleがフロンティア級・高速・公開ウェイトモデルから画像・動画・音楽生成、ロボティクスまで手がけている範囲は印象的

    • Googleは多くの新技術の最前線で黙々と有能な企業として動いている一方、OpenAIとAnthropicの最新チャットボットは「制御不能AI」「危険すぎるので禁止すべき」といった誇張された報道を受けている。こうした誇大宣伝のサイクルが新興競合の途方もない企業価値を支えている
    • Google DeepMindはAI最前線で新しい概念を開発している一方、他のところはベンチマークスコア数パーセントを追いかけている
    • タンパク質折りたたみ研究とノーベル賞も忘れてはならない
  • ロボットの動きは遅く滑らかではないが、初期のChatGPTも非常に鈍く見えた。LLMと同じくらい速く進歩するなら、数年以内に活用範囲が大きく広がる可能性がある

    • 家事作業は人がやるより時間がかかっても構わない。退勤前に掃除を終えてくれれば十分
    • GPT-2からGPT-3までとGemini Robotics 1から2まではどちらも15か月かかったが、前者は非常に大きな飛躍だった一方、後者はほとんど変わっていない: https://blog.google/products-and-platforms/products/gemini/h...
      遅く静的なロボット動作と、速く柔軟な動作では難易度がまったく違う。速く動かすと、複数の関節や質量の回転慣性、バランス変化を毎秒数百〜数千回計算しなければならない。Tシャツを静止状態で90%の確率で畳むのは簡単でも、99%の成功率や高速な折り畳みは信じがたいほど複雑
    • リアルタイム速度でもそれなりに見える初めての宣伝動画。ただし、別資料の**成功率50〜75%**が初回試行ベースなのか最終成功ベースなのかは不明
    • Googleがモラベックのパラドックスに真正面から挑んでいるのはかなり大胆: https://en.wikipedia.org/wiki/Moravec%27s_paradox
    • 動きは滑らかだが遅く、おそらく安全のためである可能性が高い。強力なモーターを積んだロボットは実際に人を傷つける可能性があるので、産業用ロボットも安全フェンス内で動作する
      デジタル人形のように逆運動学の動きをそのまま真似ると期待すべきではない。最適化目標がエネルギー消費の削減なら、多関節電動アームの動きがやや奇妙に見えることはあり得る
  • ヒューマノイドロボットにはアクチュエータの限界のため期待を捨てた。Honda ASIMO以降ほとんど革新がなく、80kgのぐらつく金属の塊を家や職場に置きたい人はいないと思う
    最終的なロボット革命は、脳を置き換えた遺伝子改変された人間・動物の身体を使うかもしれない。意識がないように作られたクマをNeuralinkとLLMで制御すれば建設労働者により適しており、素早い動物は配送に、キリンは倉庫に活用できると思う

    • キリンは背が高いだけでほとんど重いものを持てないので、倉庫での有用性は疑問。アクチュエータに革新がなかったという主張も信じがたく、MIT Cheetahのアクチュエータは逆駆動性や可変剛性の面でASIMOとまったく異なり、弾性要素を組み合わせる研究も活発
    • Cortical Labsがこの分野を研究しており、かつてDoomのデモも公開していた。生体型は汎用性があるが、多くの作業では金属型のほうが頑丈で、脳は帯域幅が低く遅延も大きいため、推論にはシリコンチップが有利
      3Dプリンティング分野の興味深い研究を見て、アクチュエータも大きく進歩していると思っていたので、遅れているという主張についてもっと知りたい
    • アクチュエータが進歩していないという点にはまったく同意できない。Ben KatzのMIT Mini Cheetah研究以降、トルク密度と価格は大きく改善され、それを基にしたUnitree G1アクチュエータは小さいが強力で、準直結駆動に近い。BD E-Atlasモーターも完全受動冷却式でありながらトルク密度が高そうで、今ほど速く進歩したことはない
    • そうした未来は恐ろしいが、技術的難易度と実験許可の障壁のため、かなり遠い先にあるはず。ただし、ヒューマノイド形態は行き止まりという点には同意する
      食洗機のように入力を処理して結果を出す巨大な箱を作ればよい。人の手を真似るより、洗濯機・乾燥機に対応する衣類折り畳み装置や統合型ロボットキッチンを作るほうがはるかに効率的
    • 生体を改造することは、ヒューマノイドロボットを作るより何桁も難しそうに見える。まだ牛なしで市場性のある価格のハンバーガーすら作れていない
  • この技術の実際の水準を率直に評価してくれる人が必要。必要な計測装置、相互作用の品質、ドアノブを回すことや転倒からの復帰、衝突回避のような 非定型な日常作業の性能 が気になる

    • この分野で働きつつ、ヒューマノイドではない 視覚・言語・行動モデル(VLA)、つまり ChatGPT をロボットアームにつないだテーマで学士論文を書いた。まだ実用段階ではなく、組立部品には正確な名称がない場合もあるため、人間なら理解できる曖昧な指示をロボットは処理できないことがある。
      信頼できる精度データも不足しており、LIBERO のようなベンチマークはほぼすべて 95% を記録して飽和していて、企業や研究者ごとに独自評価を使っている。デモをごまかしたり、人の近くで危険に動作させたりする企業も多い。
      ドアノブや転倒復帰そのものよりも、製造工程でレンガや部品を正確に位置合わせすることのほうが難しい。管理すべき関節が多く複雑なヒューマノイドより、Mobile ALOHA のような 車輪付きロボットアーム のほうが、ホテル客室の片付けや作業内容が一定な飲食店の調理には適しているように見える
    • まだ GPT-1 レベル だが、GPT-2 に相当する瞬間が間近に迫っている感じ
    • 本当の検証基準は、家庭向けサービスロボットを販売するスタートアップが実際にリピート利用者を獲得するかどうか。複数のロボット試作機を専門的に作ってきたが、進歩は確かにあるものの、一般消費者が雑用に安定して使うにはまだ非常に遠い。
      https://rodneybrooks.com/why-todays-humanoids-wont-learn-dex... の主張どおり、器用さはハードウェアの問題 でもあり、グリッパーは手ではない。多指ハンドの操作でさえ依然として難しく、センサーも十分ではない
    • ロボット業界には、特定のデモだけのために精巧に作り込んだ映像や、自律動作だと言いながら実際には遠隔操縦していた詐欺まで、ごまかしが非常に多い。ロボット犬や無人地上車両も、誇大宣伝とは違って実用性が低い。
      ロボティクスは協働ロボット分野を除けばニッチ産業であり、例外は滞空時間の問題さえ解決すれば大きな可能性があるドローンだ。ヒューマノイドが実環境で役に立つようになるにはまだ遠く、ほとんどの無人地上車両は階段で後退すらできない
  • AIロボティクスこそ本当の革命。今は資本保有者がさらに多くの資本を得るには人間労働が必要だが、ロボットの推論コストが人件費より低くなれば、もはや人間労働は必要なくなる。AI は非肉体労働にも影響するが、世界人口のかなりの部分は肉体労働に従事している

    • 推論以外のコストを無視し、その最終状態を受け入れるなら、資本が民主化 される場合はとても良いが、少数階層に集中し続けるなら終末に近い結果になる
    • 推論コストだけの問題ではない。現実で物や生き物を誤って扱ったときの被害は、非物質的な応用とはまったく異なるため、フェイルセーフと独立したリミッター が必要かもしれない
    • その変化が本当に良いものなのか疑問
  • 子どものいない 47 歳の男性として、老後に 介護ロボット の助けを受けられる可能性に期待している

    • 生きているうちに Star Wars のようなドロイド を見られる可能性が高まったという事実に驚くが、みんなあまりに当たり前のことのように受け止めているようだ
    • 50 代として、80 代の親を持つ今この瞬間でも非常に有用なはず。周囲の友人の多くも似た状況だ
  • 多くの家事作業はヒューマノイドなしでも自動化できる。Roomba が床を掃除し、住宅に自動ごみ処理や食料品の搬入・分類・保管システムを入れられる。
    ヒューマノイドは不気味で信頼しにくい。製作者の政治的見解に反対する状況でも、そんなロボットが家の中にいて安心して眠れるのか疑問だ

    • 既存のアパート、テラスハウス、セミデタッチドハウスにはそうした設備を導入するのは事実上不可能で、新築の戸建てでも高価な解決策だ。既存の人間向け環境がヒューマノイドに合っている ので、ヒューマノイド形態が有用だ
    • Roomba は床の 80〜90% しか掃除せず、実際の掃除機ほどきれいにもならない。犬のおもちゃを片付けることやダストボックスを空にすることまで考えると、実際には 60% 程度なので、100% をこなすには人型全体 が必要になる
    • ロボットを信頼しなければならない状況自体がないほうがいい。Roomba や食洗機は誤作動しても指を切断できないし、盗み聞きや監視もできないが、こういうものこそ 良いロボット
  • 有限の地球で増え続ける人間に加えて、なぜさらにロボットの身体まで追加しようとするのか疑問だ。データセンターの AI は少なくとも物理的に私と肩を並べて競争はしないのに、人間がいるのに 精巧なロボット を欲しがる理由がわからない

    • 人間の無限の膨張には止まる兆しが多い。精巧なロボットが必要な明白な理由は、腰が壊れるほどきつい、汚い、危険、あるいは退屈で、人間がやりたくない仕事 を任せるためだ
  • ロボットの駆動に完全な LLM を使うと重すぎて、強力な GPU でも最小遅延が 1〜2 秒になる可能性が高く、実用ロボットには向かない。
    マシンビジョンは機械学習に担当させつつ、動作の駆動は従来の PID ベースの線形・非線形制御 に任せるべきで、完全な LLM をコントローラとして使うとハードウェアの限界に突き当たりそうだ

    • 現在の遅延の問題はその通りだが、推論最適化の余地が大きいので近い将来には変わる可能性が高い。PID のような解析・最適化ベースの制御は数十年にわたり停滞してきた一方、エンドツーエンド制御 は歩行のエネルギー効率や、落ち葉の山を踏んでも転ばない頑健性で優れた性能を示しており、新しいロボットへの適用もはるかに容易だ。
      Physical Intelligence のような企業は、知能と遅延時間を同時に解決するため、高速層と低速層を組み合わせた 階層型アーキテクチャ でも良い結果を出している
    • Nvidia は自社チップ上で 20 億パラメータの VLA を 10Hz で動かしており、公開した 5 億パラメータのモデルも 10Hz で動作すると認識している