1 ポイント 投稿者 GN⁺ 2 시간 전 | 1件のコメント | WhatsAppで共有
  • 少なくとも10年間は中核的な進展がなかった公開問題10件について、OpenAIの次期主要モデル Astraの内部版 が新たな結果を生み出し、高次元幾何から量子複雑性、格子暗号まで幅広く扱っている
  • 解法探索には Sol API の料金換算で約 2,000ドル 相当のトークンが使われ、人間が同じモデルで論文を準備した後、モデルが各論証を Lean 証明書として形式化した
  • 主な成果として、non-sofic群の存在証明、Connes剛性予想の反証、永久行列計算の算術公式下界 n⁴/log n、一般的な2人量子ゲームの指数的並列反復定理が含まれる
  • 球充填と二進・球面コードの境界を改善し、最近接ベクトル問題の多項式倍近似困難性と Ehrhart 体積予想を解決し、Erdős 問題 146・180・183 にも答えた
  • OpenAIは、論文準備と Lean 形式化、正確性には人間が責任を負う一方、数学的論証はAIが生成したものである以上、これを人間の著作と表示せず、AIの貢献を誠実に帰属すべきだと述べている

Astraが生み出した10の結果

  • OpenAIは、科学者や数学者の発見を加速するため、ChatGPT for Academic Researchers を通じて10万人に同社最高性能の ChatGPT モデルを無償提供しており、開発過程でも公開研究問題でモデルを継続的に評価している
  • 5月には未公開モデルの評価中に見つかった Erdős の単位距離予想に対するAI生成の反証 を公開し、その後、数学と理論計算機科学の後続研究へとつながった
  • 選ばれた問題は、中核的な結果の面で少なくとも10年、ほとんどはそれよりはるかに長く進展がなく、各分野の数学コミュニティで大きな関心を集めてきた
  • Astraの内部版 が解法を見つけ、探索全体のコストは Sol API の料金換算で約 2,000ドルだった
    • 人間が同じモデルを用いて論証を論文として準備した
    • モデルが各論証を Lean 証明書 として形式化した
    • 各解法に対するモデルの推論過程の解説も公開した
  • 10の結果は次のとおり
    1. 高次元球充填: 球充填密度の新たな上界を Cohn–Elkies 臨界点まで引き下げた
    2. 二進・球面コード: 指定した最小距離における二進コードの最大サイズ境界を指数的に改善し、高次元球面コードでも同様の結果を得た
    3. non-sofic群: non-sofic群の存在を確立する構成を示し、群論の中心的な公開問題を解決した
    4. Connes剛性予想: 特定の群が von Neumann 代数によって一意に決定されるという長年の予想を反証した
    5. 算術回路複雑性: 算術回路と公式で永久行列を計算する際の新たな下界を得て、算術公式の下界は n⁴/log n オーダーとなった
    6. 量子並列反復: 一般的な2人量子ゲームに対する指数的並列反復定理を証明し、古典的複雑性理論の基本原理を拡張した
    7. 最近接ベクトル問題: ポスト量子暗号に関わる中核的な格子問題で、多項式倍の近似困難性を確立した
    8. Ehrhart体積予想: 重心のみを内部格子点として持つ凸体の取りうる最大体積を、すべての次元で決定した
    9. 多色 Ramsey 数: 多色三角形 Ramsey 数の超指数的下界を得て、Erdős 問題 183 を解決した
    10. 極値グラフ理論予想: コンパクト性および退化予想に関する結果により、Erdős 問題 146・180 を解決した
  • 先の単位距離予想の反証以降に出た研究には、実数上の和積予想への反例分解素数と Elekes–Rónyai 問題SETH の下で超定数次元における最遠点対に二次時間が必要であること実数上の点と直線の交差に関する通信複雑性Minkowski 格子の反復距離 が含まれる

研究の帰属と数学コミュニティの役割

  • 数学研究に貢献しうるAIシステムの登場は、一つの技術企業だけでは答えにくい問題を生み出しており、OpenAI は AIと数学に関するライデン宣言 の署名者を含め、AIの影響を懸念する立場を尊重するとしている
  • 結果がどのように生み出されたかを 著者表示と貢献の帰属 に誠実に反映すべきだ
    • AIが全面的に生成した証明を人間の著作と表示すると、システムの貢献と人間の実際の知的作業の両方を歪める
    • 人間は論文準備と Lean 形式化を支援し、正確性に責任を負うが、数学的論証そのものはAIシステムが生成した
  • 数学コミュニティが結果を検討し、文脈を与えたうえで、アイデアを新たな研究と発見へ発展させていくことを期待している
  • AIがより洗練された研究協力者へと進化するなか、科学者と数学者が各分野の未来を探求し定義するためには、幅広いアクセス性 が不可欠だ

1件のコメント

 
GN⁺ 2 시간 전
Hacker Newsのコメント
  • 最大の不満は、実験全体と構成に関する透明性の欠如。この10問だけをモデルに1回ずつ解かせたとは考えにくいため、実験設計全体を公開しないまま提示された2,000ドルという数字は、P値ハッキングのように誤解を招きかねない
    モデルに与えた問題の総数、諦めるまでに解けなかった割合と費用、問題ごとの試行回数、作業クラスターへのアクセス有無を含む実行環境コストが知りたい

    • AIブーム以前から、数学教育では問題と解答そのものだけでなく、それを見つけるのを助ける**周辺的な足場かけ(scaffolding)**が重要だという議論があったと記憶している
    • 費用はむしろこの批判には適していないように見える。10問に100万ドルを使ったとしても、数学研究者10〜20人の1年分の費用程度であり、同じ金額を人間に支払って同じ結果が得られるかは疑問
    • OpenAIや他のLLM開発企業と無関係な研究者が、似た成果を出したことがあるのかも気になる
      OpenAIが有能な組合せ論研究者を雇って問題を解かせ、モデルは副次的にしか使っていなかった可能性も確認する必要がある
    • あらゆる事案を義務的な**ランダム化比較試験(RCT)**なしには受け入れられないという態度も行き過ぎ。皮肉ではなく、RCTを演出しなくても適切な自己懐疑は可能であるべき
    • 実行全体の費用を公開していないことをP値ハッキングと比べるのは不当。価格報告の欠落は、科学的不正や結果の操作とはまったく違う
  • さらに驚くべきなのは、この記事がHNのトップページ最上位にも上がらなかったこと。以前より進歩した結果だとしても、AIが数学とコンピュータサイエンスで重大な進展を生むという発想に、もはやあまり驚かなくなっていることを示している

    • AIの進歩を心理的に受け入れられない人たちが積極的に通報して順位が下がった。Hacker Newsはもはやエリートのサイトではない
    • 想定読者である学界の数学者の友人たち何人かは、タイトルが新しい成果10件ではなく先月の成果をまとめた記事のように見えて、そのまま通り過ぎたと言っていた
    • 企業ごとの利害関係やオープンソースかどうかなどで、陣営が非常に激しく分かれている
    • それならAI研究そのものはどうなのか気になる。OpenAIが人間の社員を自動化して雇用をなくす段階に近いのかも問うべき
    • 正直、この種の記事には少し疲れている
  • AIの影響力はもはや否定しがたく、ゴールポストを動かす余地もほとんど残っていない。次は競技場の外へ動かさなければならないほど
    人々が早く否定から抜け出し、これを真剣に扱い始めるほどよい

    • ゴールポストを動かすという批判は理解しにくい。科学は進歩し、学びながら期待値を再調整する過程であり、ゴールをまったく変えなければ同じ成果を繰り返すだけになる
    • 問題は否定ではなく無関心。大多数は関心がないが、Kim Kardashianについてなら何でも語れる
  • OpenAIが進展を遂げたとする分野の専門家ではないので、成果を軽率に貶めたくはないが、ブログの表現がマーケティング目的で誇張されているのではないかと懸念している
    以前はこれらの問題を安定して解く計算的アプローチがなかったのは事実だが、今回の証明が数学に新しい発想を加えたのか、それとも既存文献から適切な道具の組み合わせを大規模探索したものなのかが核心
    そもそも答えは直感的で証明も可能に見えたが、専門家が時間を費やすほど価値が高くなかった問題なのか、それとも本質的に難しく、AIが巨大な解法器に投入する以上の仕事をしたのかを知りたい

    • 引用記録では、ブレークスルー研究は多く引用されると同時に、それまで一緒に現れなかった引用系譜をつなぐ研究として定義できる。一方、平凡な漸進的研究は、すでに近くにあった既存の引用を組み合わせる
      つまりイノベーションは、以前は結び付いていなかった思考や分野をつなぐ度合いとして、かなり具体的に測定可能。Puja Ohlhaverがこれについて発表しており、私も支援した実験を行った: https://www.youtube.com/watch?v=guLDNMAOn24
    • コンピュータサイエンスのCVPと回路計算量の問題は、トップ研究者たちが30〜40年研究してきた非常に重要な課題で、その中にはTuring Award受賞者もいる。解決したなら、複数の最高権威の学会で最優秀論文賞を受けるに値する
    • 単にadvancedという単語を使ったという理由でマーケティング上の誇張を心配するのは理解しにくい。博士号レベルの研究者たちがキャリアの相当部分をこれらの問題に費やしてきたのだから、表現は適切
  • 初期のAI急加速予測の一つは、高度な数学の未解決問題を解くシステムが、数学とコンピュータサイエンスの新発見を通じてソフトウェア性能も飛躍的に高めるというものだった
    現在の成果は、人間なら世界上位100〜1,000人、約**上位0.00001%に相当する最前線の数学レベルであり、OpenAIがGPUカーネル問題を修正して約15%の性能改善をしたように、ソフトウェアでも大きな進歩が現れている。巨大モデルが小規模では不可能な数学・ソフトウェア工学能力を同時に獲得するという点で、両者はスケーリング則と知能の一般化でつながっている
    しかし、数学・科学の発見がソフトウェア性能向上を直接切り開く可能性は以前より低く見ている。テック企業も数学博士に純粋数学ではなくソフトウェア工学を任せており、彼らが優秀な理由は最新の学術的発見より一般知能による場合が多い
    したがって、モデルが良くなっている証拠ではあるが、最前線数学の革命が引き起こす
    爆発的急加速(foom)**の直前とは考えにくい

    • そう見るには、モデルが学術数学にだけ明示的に過適合しており、その能力が実用的なソフトウェア工学にはまったく転移しないと仮定する必要がある。そちらには賭けない
    • 新しい数学の進展を世界上位100〜1,000人レベルと同一視するのは、数学者が実際に何をしているのかを誤解しているように見える
  • 名前も公開されていない内部AIの能力は印象的だが、人間の貢献者の名前はどこにも一つもない。少なくとも誰かがこのモデルにコーヒーくらい淹れたはず

    • 結果は次期主要モデルであるAstraの内部バージョンで達成されたと明記されている
  • 数学者とエンジニアの給与まで含めると、この研究の総費用はいくらだったのか気になる

    • 人がずっと付きっきりで世話していたのでなければ、給与全体を含める理由はない。実行環境とプロンプト設定、結果検証に使った時間だけを計算すればよく、モデルの訓練費は他の用途にも分散される
    • OpenAIは社員に株式で報酬を与えるので数字はすさまじいだろうが、基盤インフラと訓練済みモデルがすでにある現在では、それほど意味のある数値ではない。AIはこれ以上進歩しなくても、すでに甚大な破壊力を持っている
    • 10件のブレークスルーの証明を生成した費用は、Sol API価格基準で2,000ドル未満だという
      https://x.com/polynoamial/status/2083470822258467194
  • OpenAIのような企業がこうした結果を公開せず、単に訓練データに含めるようになったらどうなるのか気になる

    • 純粋数学を秘密にしておいても産業的価値はほとんどなく、企業にとってはモデル能力を誇示する用途だけ。現実的には研究費支援を打ち切る可能性のほうが高い
      非公開でモデル改善に使うという意味だとしても、正しい証明が数本もたらす追加利益はわずかで、結局モデルから抽出されて外部に知られる可能性も大きい
    • まだ解かれていなかった問題なので、既存の解答そのものがなく、訓練に入れるという表現が何を意味するのか不明確
  • OpenAIのようなところは、専門家に実質的に数百万ドル相当のトークンを使わせることができるはず。1日24時間すべての計算資源を販売しているわけではないので、内部費用はおおむね電気代に近い
    それでも計算資源が完全には使われていないなら、今後建設する多数のデータセンターが本当に必要なのか疑問が生じる

    • OpenAIにとっては研究こそがマーケティングなので、十分な予算を割り当てたはず
    • 総出力量に比べれば丸め誤差程度である可能性が高い。公開モデルの利用量を制限しつつ研究用の計算資源を確保しているのであり、データセンターが増えるほど制限も減らせる
    • 強化学習の訓練は計算資源をすべて使えるので、何を基準に不要だと言っているのかわからない
    • 数学を進歩させる余剰計算資源があったという事実からデータセンターが不要だと結論づけるのは無理がある。むしろこのニュースから合理的に導ける結論は、もっと多くのデータセンターが必要だということだけ