1 ポイント 投稿者 GN⁺ 2 시간 전 | 1件のコメント | WhatsAppで共有
  • 評価対象の170モデルのうち、Claude Opus 5 Adaptive Reasoning・Max EffortがIntelligence Index 61点で1位となり、Xhigh EffortとClaude Fable 5がそれぞれ60点で続く
  • Intelligence Index v4.1は、エージェント作業・コーディング・科学的推論・知識の信頼性・長文コンテキスト推論を扱う9つの評価を組み合わせ、推論モデルの拡張思考時間も性能測定に反映する
  • 出力速度はMercury 2が901.6 tokens/sで最速、初回トークン遅延はGemini 2.5 Flash-Liteが0.34秒で最短、Llama 4 Scoutは最大10Mトークンのコンテキストウィンドウを提供する
  • 価格はトークン単価だけでなく、入力・キャッシュヒット・キャッシュ書き込み・推論・回答トークンを重み付けしたタスクあたりコストで比較し、キャッシュ書き込みと保存コストは提供事業者によって異なる
  • 公開重みモデルの中では**GLM-5.2 (max)**が51点で最も高いが、全体1位より10点低く、モデル選択では知能に加えてコスト・速度・遅延・コンテキストウィンドウを考慮する必要がある

Claude Opus 5の知能順位

  • **Claude Opus 5 (Adaptive Reasoning, Max Effort)**はIntelligence Index 61点で、評価対象の170モデルの中で1位
  • 上位5モデルは以下のとおり
    • Claude Opus 5 (Adaptive Reasoning, Max Effort): 61点
    • Claude Opus 5 (Adaptive Reasoning, Xhigh Effort): 60点
    • Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback): 60点
    • GPT-5.6 Sol (max): 59点
    • Claude Opus 5 (Adaptive Reasoning, High Effort): 59点
  • Max Effort構成は126の推論モデルの中でも1位であり、推論モデルは回答前に複雑な問題を処理するための拡張思考を行う

Intelligence Index v4.1の評価構成

  • Intelligence Index v4.1は以下の9つの評価を組み合わせる
    • GDPval-AA v2: エージェントベースの実務
    • 𝜏³-Banking: エージェントのツール利用
    • Terminal-Bench v2.1: エージェントのコーディングおよびターミナル利用
    • SciCode: コーディング
    • Humanity's Last Exam: 推論および知識
    • GPQA Diamond: 科学的推論
    • CritPt: 物理学推論
    • AA-Omniscience: 知識の正確性と非ハルシネーション率
    • AA-LCR: 長文コンテキスト推論
  • 用途によっては、総合的な知能スコアよりも特定の評価結果のほうが重要になる場合がある
  • 別の評価項目には以下のベンチマークも含まれる
    • AA-Briefcase: エージェントによる知識業務
    • AutomationBench-AA: エージェントSaaSワークフロー
    • Harvey LAB-AA: 法務エージェント業務
    • EnterpriseOps-Gym-AA: エージェントのビジネス運用
    • IFBench: 指示遵守
    • APEX-Agents-AA: 長期エージェントタスク
    • ITBench-AA: Kubernetes障害の根本原因分析
    • MMMU-Pro: 視覚的推論

知識業務・信頼性・オープン性指標

  • AA-Briefcase Eloは、分析品質Elo、プレゼンテーションElo、評価基準の通過率を組み合わせる
    • 通過率は合成された一対一の対戦を通じてEloに変換する
    • Eloと95%信頼区間の境界は0未満にならないよう制限する
  • AA-Omniscience Indexは、知識の信頼性とハルシネーションを-100〜100点で測定する
    • 正答には報酬を与え、ハルシネーションにはペナルティを課すが、回答拒否にはペナルティがない
    • 0点は正答数と誤答数が同じで、負の値は誤答が正答より多いことを意味する
  • Openness Indexはモデルのオープン性を0〜100の正規化スコアで評価し、高いほどよりオープンである
  • 重み公開の有無を区別し、重みは公開されているが商用利用に有料ライセンスなどが必要なモデルはCommercial Use Restrictedと表示する

公開重みモデルの順位

  • 評価対象の170モデルのうち94モデルが公開重みモデル
  • 公開重みモデルのIntelligence Index上位は以下のとおり
    • GLM-5.2 (max): 51点
    • MiniMax-M3: 44点
    • DeepSeek V4 Pro (Reasoning, Max Effort): 44点
  • GLM-5.2 (max)が公開重みモデルの中で最高点を記録した

出力速度とタスク処理時間

  • Mercury 2は901.6 tokens/sで出力速度が最も速い
    • Gemini 3.5 Flash-Lite: 435.1 tokens/s
    • HyperNova 60B 2605: 427.6 tokens/s
    • Granite 4.0 H Smallも上位に含まれる
  • 出力速度はストリーミングモデルで最初のチャンクを受け取った後、モデルがトークンを生成している間に受信した1秒あたりのトークン数
  • Intelligence Indexのタスクあたり時間は、タスクあたりの出力トークン数を出力速度で割り、各ベンチマークの相対的な重みを適用して計算する
    • 初回トークン到着時間(TTFT)とその他のオーバーヘッドは除外する
  • 独自APIがある場合はそのAPI性能を使い、Meta Llamaのように独自APIがない場合は複数提供事業者の中央値を使う

遅延とエンドツーエンド応答時間

  • 初回回答トークン到着時間が最も短いモデルは**Gemini 2.5 Flash-Lite (Non-reasoning)**で0.34秒
    • Command A+: 0.42秒
    • North Mini Code: 0.49秒
    • Gemini 2.5 Flashも遅延が短いモデルに含まれる
  • 初回トークン遅延は、APIリクエスト後に最初の回答トークンを受け取るまでにかかる時間
    • 推論モデルでは回答前の思考時間も含まれる
    • ストリーミングをサポートしないモデルには、応答全体を受け取る時間が適用される
  • 500トークンのエンドツーエンド応答時間は以下の要素を合算する
    • 最初の応答トークンを受け取るまでの入力時間
    • 推論モデルが回答前に使う思考時間
    • 出力速度に基づいて500個の回答トークンを生成する時間
  • 思考トークン数は、異なる60個のプロンプトで測定した平均を使う

価格とタスクあたりコスト

  • 価格比較には、キャッシュヒット・入力・出力トークンの100万トークンあたりのドル単価を使う
  • 一覧でDevstral 2とNorth Mini Codeは100万トークンあたり$0.00と表示され、Gemma 3 4BとGemma 3 27Bが続く
  • 混合単価基準で最も安いモデルは以下のとおり
    • Nova Micro: $0.03/1M tokens
    • Sarvam 30B (high): $0.03/1M tokens
    • Gemma 4 E4B (Non-reasoning): $0.03/1M tokens
  • Intelligence Indexのタスクあたりコストは、各評価の入力・キャッシュヒット・キャッシュ書き込み・推論・回答トークン価格をタスク数で割り、Index内の評価重みを適用する
  • Index全体の実行コストは、繰り返し実行を除いた評価別トークン使用量と各トークン種別の価格で計算する
  • 表示されるキャッシュ混合価格はキャッシュヒット費用のみを使い、他のキャッシュ費用は提供事業者によって異なる
    • Anthropicはキャッシュ書き込み費用を別途課金し、5分と1時間TTLで料金が異なり、1時間のほうが高い
    • Google Vertex/Geminiはキャッシュヒット価格に加えて、時間あたりの保存費用を課金する
    • 一部の提供事業者は200Kトークンを超えるプロンプトに段階別価格を適用する
    • OpenAIやDeepSeekなどは通常、書き込み・保存費用なしでキャッシュヒット価格のみを課金する

トークン使用量とコンテキストウィンドウ

  • タスクあたりの出力トークン数は、各評価の出力トークンにIntelligence Index内の相対的な重みを掛けたうえで、繰り返しを除いたタスク数で割って計算する
  • コンテキストウィンドウ上位モデルは以下のとおり
    • Llama 4 Scout: 10Mトークン
    • Grok 4.20 0309: 2Mトークン
    • Gemini 1.5 Pro (May)
    • Grok 4.1 Fast
  • コンテキストウィンドウは入力と出力トークンを合わせた最大上限であり、出力トークン上限は一般にこれよりはるかに小さく、モデルごとに異なる
  • 大きなコンテキストウィンドウは、大量データから情報を検索して推論するRAGワークフローに関連する

公開重みモデルのサイズ

  • モデルサイズは、学習可能な重みとバイアスを合計した総パラメータと、実際の推論で実行されるアクティブパラメータに分けられる
  • Mixture of Expertsモデルは、ルーティング機構がトークンごとに一部のエキスパートだけを選ぶため、アクティブパラメータが総数より少ない
  • Denseモデルはすべてのパラメータを使うため、アクティブパラメータと総パラメータが同じ

比較範囲と活用法

  • モデルは知能、価格、出力速度、初回トークン遅延、エンドツーエンド応答時間、コンテキストウィンドウサイズなど複数の次元で比較される
  • 性能指標は586モデルを対象に、標準化されたプロンプトを使って直接測定する
  • 各モデルの詳細ページで詳細指標と類似モデル間の直接比較を確認でき、モデルセレクターでチャートに表示するモデルを調整できる

1件のコメント

 
GN⁺ 2 시간 전
Hacker Newsでの意見
  • このランキング表は、エンドユーザーがどのモデルをいつ使うべきか判断するうえでは、実質的に無意味になっている
    モデルごとに特定の分野やタスクで強みと弱みが異なるため、単一指標の順位は役に立たず、もはや「最高のモデル」も1つではなく、タスクの複雑さによっては最高モデルが必要ない場合もある
    例えばUIデザインにはFable、バックエンドシステム設計にはSol、脆弱性開発にはKimi K3を使うことができ、こうした指標は結局、モデル企業の見せびらかし用の数字に近い

    • 1年前、新しい「最高モデル」が出たので期待して、ファイル3つを少し修正するだけの簡単なプログラミング作業をやらせたところ、うまくこなした
      ところが、同じ系統のより古く小さいモデルも同じようにうまく処理し、しかも3倍速く、コストは9分の1だった。その瞬間に気づきを得た
    • 技術スタック別のベンチマークがあるとよい
      2026年にElixir/Phoenixプロジェクトを最も慣用的なやり方でうまく扱えるモデルは何か、というように多少主観的でも、すべてのモデルを自分で継続的に比較するのは難しく、性能差も大きい状況では有用かもしれない
    • 「完全に無意味だ」とか「唯一の目的」といった表現は誇張だ
      どんな統計にも歪みはあるが、何も知らないよりはましで、ベンチマークが複数タスクの平均を示すというのは、統計が本来要約のためのものだという意味でもある
    • リンクを開いてみると、単一指標だけがあるわけではなく、判断に必要なすべての指標が実際に提供されている
    • Artificial Analysisのタスクあたりのコストや幻覚の発生頻度のようなチャートには価値がある
      ただし、それを1つの結果にまとめると、微妙な差異がすべて消え、見せびらかし用のランキングだけが残る
  • Googleの経営陣なら、仕事が多いからだけでなく、人前に出るのが恥ずかしくてオフィスで寝るべきなのではないかと思う

    • 補助金を燃やしながら損をしていない唯一の事業者なので、むしろ安心して眠れる
    • Googleは最も知的なAIよりも、すべての製品で収益化できるスピードを重視しているように見える
      ずっと以前から、質問に正確な答えを最速で提供することを最優先だと明言してきた
    • GoogleがOpenAIやAnthropicのように、知能を最大化したモデルで競争しようとしているのかも疑問だ
      3社の中で、AGIを崇拝して苦行していない唯一の会社のように見える
    • GPQA Diamondベンチマークでは同率1位: https://artificialanalysis.ai/evaluations/gpqa-diamond
      もしかすると、これだけが目標なのかもしれない
    • Geminiモデルも複数の部門で首位または上位にいるため、恥ずかしいほど遅れているという結論は正しくなさそうだ
  • 知能指数の上位は、Claude Opus 5 Maxが61点、Opus 5 Xhighが60点、Claude Fable 5 MaxとOpus 4.8代替モデルの組み合わせが60点、GPT-5.6 Sol Maxが59点、Opus 5 Highが59点
    したがってOpus 5 XhighはSol Maxより高く、Opus 5 HighはSol Maxと同じなので、両モデルの価格と速度の差が気になる

    • Artificial Analysisのタスクあたりの知能対コスト・時間グラフでは、Opus 5 HighとSol Maxのコスト・時間はおおむね似ている
      DeepSweではOpus 5がFableに勝つがSolには劣り、FrontierCodeではすべてを圧倒するものの、推論努力をMediumより高くするとSonnet水準まで急落する
    • Opus 5はSol Maxほど知的ではなく、一部の作業ではOpus 4.8にも劣るように見える
      特に表面的にアプローチして、アプリやフレームワーク全体を教える必要があり、すでに別の形でサポートされている機能をまた追加するような愚かな作業から始める
  • 構成要素の中ではAA-Omniscience Indexが興味深い
    知識の信頼性と幻覚を測定し、正答には報酬を与え、幻覚には減点するが、回答拒否には減点しない。パラメータ規模や密度をおおまかに示す指標のように見える
    順位はClaude Fable 5代替モデルの組み合わせ、Gemini 3.1 Pro Preview、Claude Opus 5 Max、Grok 4.6 High、Gemini 3.6 Flash、GPT-5.6 Sol Maxの順で、Gemini 3.xには以前から大型モデル特有の雰囲気があった

    • Gemini 3.1 Proは知識タスクに非常に優れており、Googleはこの部分をうまくやっている
      Gemini 3.6 Flashの画像分析もしっかりしているが、コーディングやエージェント作業では物足りない
    • 3.6 Flashが24点でSolの22点より高いのを見ると、パラメータ規模の代理指標なのかは確信しにくい
      3.x Flashは単一のTPU 8iに収まるとされ、処理速度も234.7トークン/秒で、Solの64.4、Opusの56.3を圧倒しており、3.1 Proも113.9トークン/秒ではるかに速い
      AA-Omniscience Accuracyは超大型のFableが61%で首位、Sol、GPT-5.5、Opusのような大型フロンティアモデルが続き、予想により合っている
      Geminiはコーディングの最高点よりも一般知識と運用コスト効率に集中したようで、正規化された分野別スコアではソフトウェアだけ競争力が低い
    • 回答拒否に減点しないなら、あまり有用ではない
    • モデル規模よりも**根拠付け(grounding)**の影響が同等かそれ以上に大きい可能性があり、Googleは明らかな理由でこの部分が非常に得意だ
  • 期待する前に知能対コストのマトリクスを見るべきだ: https://artificialanalysis.ai/models?intelligence-index-toke...

    • 結果の品質まで考慮すると、GPT-5.6 Sol Maxが他のすべてより安いという点は驚きだ
    • Maxは追加の推論量が非常に多いので、Highでは解けるタスクがどれだけ減るのか気になる
      コストはかなり低くなりそうだ
  • Meta Muse Sparkを見直した
    どれか1つで最高というわけではないが、ランキング表のあちこちで適切な位置におり、コストと性能のバランスがよい
    リストにないPoolside Laguna Sの位置も気になるし、個人的にはよく動きつつコスト効率の高いモデルに大きな関心がある

  • 僅差の1位だとしても、検閲を意味する「安全装置」が回答を拒否したり、別のモデルへ格下げしないよう気をつけなければならないなら、有用性は大きく下がる
    そのため既存のワークフローの一部を除き、Claudeの使用はほぼやめており、61点と57点の差よりも信頼性のほうが重要
    検閲に加え、自分が直接経験したわけではない本人確認まで考慮すると、Claudeは最も損なわれ不安定なモデルであり、最新版のわずかなベンチマーク最適化にはそれだけの価値はない

    • どんな質問をしていると、そんなに頻繁に検閲に引っかかるのか気になる
    • 実際に使ってみた限りでは、ベンチマークだけを狙ったモデルではまったくない
      すべてのモデルにゲーム制作テストを適用しているが、Opus 5は世代が変わったレベルの飛躍のように感じられ、ベンチマークは正確な姿を示せないので、自分で試すべき
    • オンラインで制限やモデルが改善されたという話を見て、Anthropicには絶対に金を払わないという原則を見直すたびに、モデルカードを確認してむしろ確信が強まる
      Anthropicがなぜ自動・無音の格下げ切り替えにあれほど執着するのか分からないし、回答拒否の代わりに自動で性能を下げてほしいユーザーが一人でもいるのか疑問
    • Claude Opus 5.0に、テスト環境のPaaSでグローバルAPIキーを使ってWebアプリをデプロイし、データを取得するよう依頼したところ、権限が広すぎるというセキュリティ上の問題を理由に拒否された
      同じ作業はOpus 4.5〜4.8とFable、Codex 5.4・5.5、Sol 5.6では問題なく処理できた
      Opus 5は慎重すぎて生産的に使いにくく、追加調整が必要
    • もしかすると意味のあることをしていないからかもしれないし、Terence Taoは「目覚めたAIモデル」のせいで不満を言ってはいない
  • Opus 5は4.8のように何もかも説明し直さないのがよい
    GPT-5.6 Solは些細なことにも過度に深く推論する一方、Opus 5は素晴らしいモデルで、Anthropicはよくやった

    • Solに実装仕様を渡したときは非常にうまく処理したので、この違いに気づかなかった
      仕様なしで任せたところ、2時間30分で週間使用量の30%を使ったが、仕様を渡すと30分で2%しか使わず、結果も構造・長さ・検証・範囲・コストのすべてでより良かった
      Solを放っておくと制御不能になるので、今はSolが仕様を書き、Terraが実装するようにしており、この方法はうまく機能し、総使用量も減った
  • より興味深い結果は、Opus 5がFable 5に次いで圧倒的に高価なモデルだという事実
    GPT-5.6とKimi K3は半分のコストで、1〜2%差の似たスコアを出している

    • チャートは、価格に敏感でない企業ユーザーが主に使うMax推論努力を基準にしている
      MediumではコストがK3のほぼ半分まで下がり、コーディング作業の95%には十分である可能性が高い
  • どちらの肩を持つわけでもないが、この結果ではGPT-5.6 Sol Maxのほうが良く見える
    ほぼ同じ性能を半分ほどのコストで提供しており、Opus 5もGPT-5.6よりこれだけ高いのを見ると、Fableの価格がどれほど高いかが分かる

    • きちんと比較するなら、Opus HighとSol Maxを比較すべき