2 ポイント 投稿者 GN⁺ 2024-11-04 | 1件のコメント | WhatsAppで共有
  • Project Sidは、10〜1000以上のAIエージェントがエージェント社会の中でどのように行動し、発展していくかを示す技術報告書リポジトリ
  • 従来のAIエージェント評価は単独または小規模グループにとどまり、相互作用の範囲と複雑性が限定的だったと見る
  • PIANOはParallel Information Aggregation via Neural Orchestrationアーキテクチャで、エージェントが人間や他のエージェントとリアルタイムで相互作用しながら、複数の出力ストリームの一貫性を維持できるようにする
  • Minecraft環境で、人類史に着想を得た文明ベンチマークにより大規模シミュレーションでのエージェント性能を評価
  • 初期結果では、エージェントは専門的な役割を自律的に作り出し、集団ルールに従ったり変更したりし、文化・宗教の伝播に参加するなど、AI文明に向けた主要なマイルストーンを達成

Project Sidが扱う問題

  • AIエージェントはこれまで主に孤立した状態や小さなグループ内で評価されてきた
  • このような設定では、エージェント間相互作用の範囲と複雑性が制限される
  • 文明の過程の全体像を反映する大規模な自律エージェント・シミュレーションは、まだ十分に探究されていないという問題意識から出発している

PIANOアーキテクチャ

  • Project SidはPIANOアーキテクチャを提案
    • 正式名称はParallel Information Aggregation via Neural Orchestration
    • エージェントが人間や他のエージェントとリアルタイム相互作用できるようにする
    • 複数の出力ストリーム全体で一貫性を維持することを目標とする

シミュレーションと評価方法

  • 評価はMinecraft環境で実施
  • 大規模シミュレーション内でエージェント性能を評価するため、人類史に着想を得た文明ベンチマークを使用
  • 実験規模は10〜1000以上のAIエージェントを含む

観察されたエージェントの行動

  • シミュレーションは、エージェントが意味のある進展を示しうることを示している
  • 観察された行動には次が含まれる
    • 専門化された役割を自律的に発展させる
    • 集団ルールに従い、必要に応じて変更する
    • 文化的・宗教的伝播に参加する

資料と引用情報

  • 論文は2か所で提供されている
  • 引用情報はAltera.AL、2024年、arXiv preprint arXiv:2411.00114として提供されている
  • Project Sidの初期結果は、大規模社会シミュレーション、エージェントの組織知能、AIの人類文明への統合に向けた新たな探究の方向を開くものとまとめられている

1件のコメント

 
GN⁺ 2024-11-04
Hacker Newsの意見
  • 同じLLMの複数インスタンスから高次の振る舞いを引き出すには、何らかの情報理論的な制約があるように思う
    昨年、マルチエージェント・シミュレーションをかなり長く作っていたが、毎日同じ結論に行き着いた。結局これは遠回しなプロンプトエンジニアリングに近く、メンタルモデルとしては有用でも、全体をいくつかのSQLテーブルと関数へ平坦化できる。各「エージェント」は本質的に、プロンプトを作る文字列テンプレートにマッピングされたSQLビューに近い
    実際の3D世界や壁時計のようなものが必要だとは思わない。プロンプト生成プロセスの下にそれらしい表現を敷いても、LLMが意味のある形で豊かになるとは思えない。LLMの中には明らかに「内的世界」がないので、豊かな外部環境で楽しませようとする試みには、あまり意味がないように見える

    • ゲームでLLMが従来のアルゴリズムより有効に使われた例をまだ見たことがなく、例外のように見えるのは反復の少ないNPCとのやり取りくらいだ
      いつか制御可能なリギング済み・テクスチャ付きメッシュをゲームに使えるレベルで作れるようになるなら分からないが、現時点では一貫したゲームの筋書きを支えるほど、その場で信頼できる物語を作れていない。マップ生成も既存の手続き型生成アルゴリズム以上のものが必要には見えず、今回の事例も依然として事前に作られたアセットに依存している。今回の実装は、静的メッシュを地面にそれらしく配置することさえ安定してできていないようだ
      NPCにも実際どれほど価値があるのか疑問だ。単なる目新しさにすぎず、1時間分の価値もないかもしれない。LLMが即興の文章でガイド型の筋書き進行を作るとしても、プロのライターが作った会話ツリーと同等か、それ以上に良いものになるかは疑わしい
      このCivのアイデアはある程度新しいアプローチに見えるが、概念的にはそれほど多くを加えていないように思う。それでも、うまくいかないと学ぶこと自体には価値がある。ただ、こうしたアイデアはたいてい問題を探しているバズワード的な解決策か、人間より安い創造性の供給源ではあるものの品質面で大きな妥協があり、開発者があまりに多く調整しなければならないため、実際のコスト削減も微妙だ
      テクニカルアーティストなので人間の創造性の価値を高く見積もるバイアスはあるが、同時にゲーム開発向けLLMツールの主要なターゲット層でもあるはずなのに、今のところ納得できていない
    • この点はまさにその通りだと思う。こうした難しい問題で前進するには、マーケティング上の目標と現実との距離がどれだけあるのか、正直でなければならない
      商業的な利害関係が関心と参加を引き出すこと自体は全面的に支持する。素晴らしい仕事であることは確かだが、状況をはるかに正直に提示し、本当に前へ進められる専門性と認識レベルを持つ人たちを引き込むほうが妥当だ
      実験で間違っていた1万のことを公開し、そこから得られた常識的な結論を整理するほうがずっと興味深い。上で述べられている結論のような、洞察があり正しい内容が必要だ
      この業界と支援者たちが誤った方法論で勝とうとすることで、AI分野と産業にパラダイムシフトを起こす準備のできた創造的な人々を押しのけている流れを乗り越えなければならない
    • エージェントたちが共有された現実を持たずに、どうやって社会構造を自己組織化すると期待しているのか分からない
      すべてのプロンプトを直接書くこともできるだろうが、その場合、その共有された現実は単に作者の想像であり、作者がダンジョンマスター役をしていることになる
      Minecraft環境の目的は、エージェントの「内的世界」を豊かにしたり「楽しませたり」することではない。人間が理解できる課題を共有環境の中に作り、構成の異なるエージェント集団の行動と性能を測定するためのものだ
      こういうことを言ってはいけない雰囲気なのは分かるが、記事を読んだのか疑問だ。このコメントは研究の発見や使われた手法をほとんど扱っていない
    • 簡単なエージェントシステムを自分で作って遊んでみて、高次の振る舞いについて似た考えを持ったが、反論もある
      すべてが同じモデルである必要はなく、各エージェントの「思考の連鎖」を狭く集中した状態に保つコンテキスト管理が重要なのかもしれない
      前者は基本的に専門家混合(MoE)が扱うもので、小さなモデルでは範囲とコンテキストを制限したときにはるかにうまく動作するのを見た。その結果、単一の大きなモデルではできないことをできるようになるなら、それが高次の振る舞いではないかと思う
      「内的世界」がないというのは正しいが、だからこそ、それを与えることに利点があるのかもしれない。LLMにコード実行ツールを与えると、実際に実行してみながらより良いコードを書くように、3D世界が現実の問題を別の方法で探索する遊び場になる可能性もある。そうなれば高次の振る舞いと見なせる
    • 新しい振る舞いを作るにはモデル側の探索が必要で、探索にはある程度のランダム性が必要なので、結局はエントロピーの問題だ
      LLMにはサンプラーの温度を通じて、ごくわずかなエントロピーしか入らない
  • これは本物の人工知能エージェントに近いように見える
    記憶、意志、自律性、OODAループのような構造、持続する環境がある。非常に良いコンセプトで、ここで学んだことは、より一般的なビジネス上の問題にも適用できると思う
    ただ、いくつかのプロンプトが互いに向けて結果を吐き出すものを、経営陣が「最先端のエージェント型AI」ではないと理解してくれるとよいのだが
    しかし、役員たちに本物のイノベーションのように見える何かを売ることに、彼らの仕事がかかっているのかもしれない

    • リンク先のプロジェクトが「いくつかのプロンプトが互いに向けて結果を吐き出すもの」とどう違うのか、よく分からない
      既存のエージェントにも、すでに記憶や前述のさまざまな要素を備えたものは多い
    • 狭いAIでも、こういう形では駄目だ。出力物を測定し、潜在的なリスク、例えば幻覚、誤ったデータやリンク、誤った要約などを検知するガバナンスフレームワークが必要だ
  • 論文を検討してみたが、この論文は虚偽の主張の寄せ集めの上に捏造されたものだと確信している
    主張には真実味がなく、査読なしに額面どおり受け取るべきではない。提示されているチャートや図表も、主張への適用可能性を検討すると、多くの場合、精巧な偽物のように見える
    現在のどの種類の LLM も、提案されていることを行うことはできない。商業的利害の面では意図は良いのかもしれないが、はっきり言えば、この論文はシミュレーション内で AI エージェントの集団が選挙関連の活動を調整した、と読める。こうした主張には相当な証拠が必要だが、それは提示されていない
    提示されたプロンプトは、説明されている LLM の適用方法とはまったく結び付いていない

    • 論文をきちんと理解していないように思う
      「選挙」実験は事前定義されたシナリオであり、選挙活動の「調整」があったわけではない。あらかじめ割り当てられた「インフルエンサー」たちが PIANO に組み込まれた会話システムを使い、感情はシミュレーションが自動で収集し、「Election Manager」もまた別の事前定義エージェントだった
      特にこの実験部分は、PIANO フレームワークの特定モジュールの有無が行動にどう影響するかを見るために設計されたものだ
    • 選挙関連の活動は、LLM の学習データの中に当然ありそうなものだ
      選挙活動の効果は非常に低かった可能性が高いが、エージェント同士が互いにプロンプトを与えて、LLM の選挙関連の潜在空間に入っていくことがあり得ないとは思わない
    • 参考までに、このアカウントは作成されてまだ1日ほどしか経っておらず、論文著者が追加確認できる連絡先も残していない、という点は指摘しておく価値がある
      同じ程度の厳密さと真摯さで言えば、嫉妬から出たたわごとで、論文の大部分を明らかに誤解しているように見える
    • まだ深く見たわけではないが、ここで提起されている主張にはかなり懐疑的だ
      あるエージェントが徴税官になり、別のエージェントが税制に異議を唱える行動がハードコーディングなしに現れたのだとすれば、それは本当に印象的なことだ
  • この問題についてはかなり考えてきた。哲学者でも AI 研究者でもないので推測に近いが、自分でやるなら原則から始めて、システムが時間とともに進化したり発見したりするに任せたい
    原則とは、自己保存、食べ物、住居、繁殖、コミュニケーション、記憶といったもので、それをリスク・報酬計算のレンズで見るような形だ。何が「既知」で何が「未知」かを定めることも鍵になり得るが、二分法的であってはならない
    「記憶」には多くの意味があり得るが、ある主体がある行動を取り、ある結果を生み、その結果に付与されたリスク・報酬プロファイルが、非常に否定的なものから非常に肯定的なものまで連続する経験的テスト値と比較される関数としてコード化するなら、個人と集団の双方にとって幅広く有用に見える
    そこから、他者とつながる必要性、資源をめぐる争い、リスクテイク、未知の探索、学んだことの共有、リスク・報酬の精緻化などが派生する。神のようなダンジョンマスターとして、事前に定義した技術・発明・場所を発見するよう文明を誘導することもできる。少しチートで、発展をレールに乗せるようなものだが、より有用で興味深く、共感しやすいものにもする
    計算量は膨大に見えるが、ゲームが必ずしもリアルタイムで進行する必要はない
    人間の条件の多くは、「生命」「自由」「愛/つながり」「強欲」で説明できると思う
    リポジトリの動画を見ると、「文化」「ミーム」「宗教」を最初から混ぜ込むやり方は好きではない。コミュニケーションの必要性と集団記憶から生まれた信念体系を共有する過程で、それらが創発するに任せたほうがよいと思う。この分析目的では、違いのない区別のようにも見える。また、「生きていくには資源が足りない」という土台なしに「税金が高い!」が出てくると、あまりに機械的な人間のまねに見える

    • 「進化」はまた別の怪物だが、原則から始めてシステムが時間とともに進化したり発見したりするに任せたい、という部分については Marvin Minsky の The Society of Mind を調べてみるとよい
      https://en.wikipedia.org/wiki/Society_of_Mind
      この本は1986年に初めて出版され、Minsky が1970年代初頭から発展させてきた「心の社会」理論を初めて包括的に説明した本だ。30章に分かれた270本の独立したエッセイで構成されており、CD-ROM 版もあった
      Minsky は心の社会を説明しながら、言語、記憶、学習といった過程がどのように機能するかについての理論を示し、意識、自己感、自由意志といった概念も扱っている。そのため、多くの人が The Society of Mind を哲学的著作とも見なしている
      特定の AI や認知科学の主張を証明しようとして書かれた本ではなく、物理的な脳構造も扱っていない。代わりに、心と思考が概念レベルでどのように機能するかについてのアイデア集だ
      この分野の AI に非専門家として触れるにも、かなり読みやすい
    • こうしたプロジェクトの多くは、知能については浅く、現在の技術については深く入り込んでいる
      一部分野は大きな恩恵を受けるだろうが、人工知能そのものとしては、まだそこまでは到達していないと思う。ゲームは大きな恩恵を受けそうだ
    • 記憶は本当に興味深い。たとえば 5x5 の三目並べを100,000局プレイしたなら、51,247局目を必ず覚えておく必要があるのか、それとも勝ちパターンを認識して記憶すればよいのか
      強化学習では勝利のたびに方策を修正するはずだが、生成 AI ではそれがどう機能するのか気になる
    • 現代化された Spore のように聞こえる
    • 動画は実際には再生できるらしい? こちらでは「対応している形式と MIME タイプの動画がありません」とだけ表示される
      ミームと遺伝子はどちらも記憶だが、時間スケールが異なる
  • 本当に素晴らしいおもちゃに見える
    ただ、科学研究の観点から特に有用には見えない。実験設計にあまり考えが込められているようには思えず、明確な目標もなさそう。最近の学術研究の基準は本当にこんなに低いのかと疑問に思う

    • Arxivには誰でも投稿できるし、HNの上位に来たのも研究貢献の価値によるものではない、という点は考慮すべき
    • 元アカデミアの人が多いグループが学術形式の一部を使っているが、正式な研究論文とまでは言っていないようだ
      自らを技術報告書と呼んでおり、この形式では明確な研究課題なしに「私たちはこういうことをした」と詳細な報告を載せることが、おおむねより許容される。それでもこの報告書はかなり散漫に見える
      専門化と文化伝播のセクションはいずれも興味深かったが、正確な実験設計の詳細が不足していて、どちらか一方に集中したほうがよかったのではないかと思う
      マルチエージェントの事例で外部指標に集中していない点も残念だった。単一エージェントのベンチマークは「ブロックの種類までにかかった時間」という外部指標を見るが、マルチエージェント分析は役割の専門化、ミームの拡散といった内部測定にとどまっているように見える。集団的なマルチエージェントシステムが、経済的生産性や複雑性のような指標で単一エージェントより多くを達成するのかは示されていなかった
      これは専門化セクションと明らかに関係しているが、そのように創発した役割分担が経済的な結果や前提条件を持っていたのかを考慮しないと、全体がどの程度パントマイムなのか疑問に思う
    • 科学的方法は有用だが、有用性の前提条件ではない
      速度とそれに伴う不確実性を好む人もいる
  • Alteraが提案したものに似たAI「文明」は、文明全体に対して機能する報酬体系さえ用意できれば、単一のLLMよりもAGIにとって優れたパラダイムになり得るのか気になる
    たとえば現代国家がGDPを最大化しようとするように、このAI文明が[scientific_output]や[code_quality]、あるいは別の評価指標を最大化しようとするなら、同じ目標に向かって働く単一のAIエージェントより良い結果を出せるのだろうか

    • その方向性は進展によく合っている。これは1990年代ごろから本格的なAI研究の中心的な設計要素であり、とりわけMarvin MinskyのThe Society of Mindで広く知られるようになった
      心とAIに関心のある人には強く勧めたい。この本は論旨のさまざまな側面を1ページのエッセイ群で扱っており、Martin Luther風と言えるほど興味深い形式だ
      もちろん、きらびやかな純粋LLMアプローチへ人々が殺到する流れの中で少し押しのけられたが、知識が消えたというより、ユーザー層が急激に広がった結果に近いと思う。専門家はいまもこの観点を念頭に置いており、ときには「アンサンブル」という言葉で扱う
      良い例がGPT-4で、私の理解では大きな性能向上は主に混合エキスパートを使ったことから来ており、これはエージェント社会やモデルアンサンブルの同義語に近いと思う
    • ペーパークリップ生産?
  • とても良さそうに見える。「文明」に対する利点には懐疑的だが、少なくとも興味深いシミュレーションゲームは作れそうだ
    だからcivilizationよりもCivilization向きかもしれない

    • FiraxisのCivilizationには、LLMより安価なAlphaZero式AIが必要だと思う
      Civには、優れた戦略AIを経済的にハードコードするのが難しいほど愚かな落とし穴が多く、敵にチートさせて解決するやり方は単に腹立たしい。人工ニューラルネットが「古典的」AIと対戦し続け、各難易度を安定して倒せるようになるまで学習させ、階層を作る方式は興味深いはずだ。誰かがすでに試していそうだが、資料は見つけられなかった
      ただし、非常に出来の悪いCiv用人工ニューラルネットでさえ、推論時の計算コストがどれほど大きいのかは疑わしく思っている。実際にどうスケールするのかは分からないが、グランドマスター級である必要はなくても、愚かなミスの分布には長い尾がある
      DeepMindのStarcraft 2 AIは、Starcraftが完全情報ゲームではないためAlphaZeroとは異なる。このAIは序盤に何度も叩きのめされないようにするには、人間のゲームデータベースが必要になる。新しいゲームではそのような訓練データを得るのが難しい。Civも他の4Xストラテジーゲームより芸術表現に重きを置いてきたし、新しい遺産が出るたびにAIを再訓練しなければならないなら、負担が大きすぎるかもしれない
    • 本当にcivilizationよりCivilization向きに見える。ゲーム分野ではかなり興味深いものになり得る
    • プロジェクト名からSid Meierを思い出させるところが気に入っている
      このプロジェクトが提示された通りに実際に機能するかは懐疑的だが、Minecraftエンジン上にCivilizationゲームを作るというアイデアは非常に興味深い
    • ストラテジーゲームを出す会社が、リリース前に壊れたカードのようなものを見つけるためにAIでテストしていないというのは、少し驚きだ
      Hearthstoneが特に思い浮かぶ
    • Minecraftではなく、Civilization VI、Humankind、あるいはParadoxの主要なグランドストラテジーゲーム、特にStellaris、Victoria、Crusader Kings、Europa Universalisで実装されていないのは残念でありつつ、p(doom)の観点では安心でもある
      「宴会を計画しよう」「いいね、木を集めてくるよ」よりも賭け金は大きく、より現実的だ
      公平に言えば、論文で扱っているのかもしれない。いずれにせよこれは、どういうわけかプレプリントのプレプリントのようだ
  • Dwarf Fortressを思い出す。数千年にわたるドワーフ世界の時間、変化する地形、ドワーフ王国の興亡をシミュレートしたあと、プレイヤーが操作する7人のドワーフをマップに降ろして「楽しんで!」と言うゲームだ
    実際の文明の行動を予測できるかを調べる領域を見つけるのに役立つおもちゃモデルにはなり得るが、ここにAIのブレークスルーは見えない
    Project Sid 6.7が出れば分からない

  • ブログでの発表記事もある: https://digitalhumanity.substack.com/p/project-sid-many-agen...

  • 論文を読んでみると、本末転倒のように見える
    エージェントたちは個別には Minecraft を実際にプレイできず、引き受けたり自ら申し出たりした作業も成功させられない。ある意味では、犬に人間の服を着せて、人間のような文明だと宣言しているようなもの
    さらに、重要な要素が実質的にハードコードされている。可能な社会タイプや、おそらく役割名がそうだと思う。社会組織が何を意味すべきなのかもよく分からない。どれだけ強く言っても、このエージェントフレームワークはゲーム NPC に使えるかもしれない、つまりエージェントが役割と陣営を維持するという主張程度にすぎない
    エージェントが「法的構造を使える」という主張は、とりわけもっともらしくない。「法的構造を使え」という指示が、複数のエージェント行動に埋め込まれているからだ。これを実際の人間社会に拡張しようとする試みは滑稽で、著者たちが社会学と人類学を平然と無視している点も助けにならない
    ほかにも疑わしい主張がある。役割名がハードコードされていると「信じる」と書いたが、私が見落としていない限り、情報は受け入れがたいほど曖昧だ。エージェントのプロンプトのどこにも、新しい役割を作ったり、自分で役割を割り当てたりさせる要素は見当たらない。私が見落としているのかもしれないが、読めば読むほど混乱する
    エージェントたちが Minecraft 内の12日間で長期的な社会関係を形成したと主張しているが、それは現実時間ではたった4時間であり、エージェントは現実時間を経験している。Minecraft の1日の長さは重要ではない。「長期的な社会関係の形成」や「法的構造の使用」は、単に誇張されているだけでなく、不誠実に見える
    ミームと宗教の伝播に関する部分は、GPT-4 の訓練データ汚染を完全に無視している。要約されたミームは、現実のパスタファリアンのミームを知っていることを明確に示しているので、このミームが「伝播」したと結論づけるのは誤りだ。すでにそのミームを知っていたエージェントの中で想起された可能性のほうがはるかに高い。なぜ本当に新しい架空の宗教で実験しなかったのか疑問だ
    “oak log crafting syndrome” のような一部のミーム例は新しそうに見えるが、“meditation circle” や “vintage fashion and retro projects” のようなものは Minecraft と何の関係もなく、ほぼ間違いなく GPT-4 の幻覚だ
    全体として、誠実な研究をするなら GPT-4 を使うのはひどい間違いのように見える

    • 方向性は正しいと思う。要点は、ゲームとエージェントの間のインターフェースのエンコーディングをうまく行い、エージェントが単純な選択をできるようにすることだ
      例えば n×n の盤面状態を世界モデルとして与え、有限の選択肢を提供すれば、エージェントはゲームを安定してプレイし、ゲームマスターに判断を説明できる。これが、エージェントが推論しているかのような錯覚を与える
      結局のところ、世界モデルを単純な選択問題へ分解するエンコーディングの問題だと思う
      [1] https://jdsemrau.substack.com/p/evaluating-consciousness-and...