4 ポイント 投稿者 GN⁺ 2024-12-08 | 1件のコメント | WhatsAppで共有
  • Countless.devは、複数プロバイダーのAIモデルの価格・機能を一つの表で比較するためのWebサイトで、モデル選定に必要なトークン上限と単価を素早く確認できる
  • 一覧はOpenAI、Anthropic、Google、Qwen、DeepSeek、Mistralなど、プロバイダー別にモデルを並べ、コンテキスト長や出力上限のように見える数値もあわせて表示する
  • GPT-5.x、Claude Opus/Sonnet/Haiku、Gemini 2.5/3.x、Qwen3.x、DeepSeek V3/R1、Mistral、Llama、Nemotronなど、商用・オープンモデル系列が一つの画面に混在している
  • 一部の項目は(free)と表示され、価格欄が空になっており、Auto Router、Free Models Router、Pareto Code Router、Switchpoint Routerのようなルーターも別項目として扱われている
  • プロバイダー別に最新・旧バージョン・プレビュー・画像・音声・コーディング・リサーチモデルを比較できるが、提供された本文だけでは表のカラム定義や価格計算方法までは確認できない

AIモデルの価格・機能比較表

  • Countless.devはタイトルでLLMの価格と機能の比較を掲げている
  • Hacker Newsのタイトルでは、LLMだけでなくTTSSTTまで比較するWebサイトとして紹介されている
  • 提供された本文は長いモデル一覧の形式で、各行にはおおむね次の情報が含まれている
    • プロバイダーまたはルーター名
    • モデル名
    • T表記とともに示されるトークン数値
    • 2つのドル建て価格値、または価格の空欄
    • (free)表示が付いた無料モデルかどうか

プロバイダー別に混在するモデル群

  • OpenAIの項目にはGPT-5.5、GPT-5.4、GPT-5.3、GPT-5.2、GPT-5.1、GPT-5、GPT-4.1、GPT-4o、GPT-4 Turbo、GPT-3.5 Turboなどが含まれる
    • GPT-5 Pro、GPT-5.4 Pro、GPT-5.5 Proのような高価格のProモデルも別項目として並んでいる
    • GPT Audio、GPT Audio Mini、GPT-5 Image、GPT-5 Image Miniのような音声・画像モデルも確認できる
    • o1、o3、o4 Mini、Deep Research系列もあわせて含まれる
  • Anthropicの項目はClaude Opus、Sonnet、Haiku、Fable系列で構成されている
    • Claude Opus 4.8、Claude Opus 4.7、Claude Opus 4.6、Claude Opus 4.5、Claude Opus 4.1、Claude Opus 4が並んでいる
    • Claude Sonnet 5、Sonnet 4.6、Sonnet 4.5、Sonnet 4、Claude Haiku Latest、Claude Haiku 4.5も含まれる
  • Googleの項目にはGemini、Gemma、Nano Banana、Lyria系列が入っている
    • Gemini 3 Flash Preview、Gemini 3.5 Flash、Gemini 3.1 Pro Preview、Gemini 2.5 Pro、Gemini 2.5 Flashなどが並んでいる
    • Nano Banana Pro、Nano Banana 2、Nano Banana Liteのような画像モデル項目も含まれる
  • QwenDeepSeekMistralMetaNVIDIAMoonshotAIMiniMaxZ.aiなど、他のプロバイダーのモデルも同じ一覧で比較できる

価格表記と無料モデル

  • 価格がある項目は2つのドル建て単価をあわせて表示する
    • Anthropic Claude Opus 4.8: $5, $25
    • OpenAI GPT-5.5: $5, $30
    • Google Gemini 2.5 Pro: $1.25, $10
    • OpenAI o1-pro: $150, $600
  • (free)が付いた項目は価格欄がで空になっている
    • NVIDIA Nemotron 3 Ultra (free)
    • Poolside Laguna M.1 (free)
    • Cohere North Mini Code (free)
    • Google Gemma 4 26B A4B (free)
    • OpenAI gpt-oss-120b (free)
    • Meta Llama 3.3 70B Instruct (free)
  • 一部のモデルは無料版と有料版が別行として存在する
    • Poolside Laguna XS.2
    • Poolside Laguna M.1
    • NVIDIA Nemotron 3 Super
    • Google Gemma 4 26B A4B
    • OpenAI gpt-oss-120b
    • OpenAI gpt-oss-20b

トークン数値から見るモデル上限

  • 複数のモデルは100万トークン前後の大きな数値を表示している
    • OpenAI GPT-5.5、GPT-5.4、GPT Latest: 1,050,000
    • Anthropic Claude Opus 4.8、Claude Opus 4.7、Claude Sonnet 5: 1,000,000
    • Google Gemini 3 Flash Preview、Gemini 3.1 Flash Lite、Gemini 2.5 Pro: 1,048,576
    • DeepSeek V4 Pro、DeepSeek V4 Flash: 1,048,576または1,048,575
  • 出力上限のように見える2つ目のトークン数値もモデルごとに異なる
    • OpenAI GPT-5.5: 128,000
    • Anthropic Claude Opus 4.8: 128,000
    • MoonshotAI Kimi K2.6: 262,144
    • MiniMax MiniMax-01: 1,000,192
  • 一部の行は2つ目の数値や価格がで空になっており、すべてのモデルが同じ粒度の情報を提供しているわけではない

ルーターと特殊用途モデル

  • 一般モデル以外にもRouter項目が別モデルのように含まれている
    • OpenRouter Fusion
    • Pareto Code Router
    • Free Models Router
    • Switchpoint Router
    • Auto Router
  • 安全性、リサーチ、検索、コード適用のように特定目的を持つモデルも一覧に入っている
    • NVIDIA Nemotron 3.5 Content Safety
    • Meta Llama Guard 4 12B
    • OpenAI o3 Deep Research
    • Perplexity Sonar Deep Research
    • Relace Search
    • Relace Apply 3
  • 提供された本文だけでは、各ルーターや特殊モデルの選択方式、ベンチマーク、対応API、更新周期のような詳細な基準は確認しにくい

1件のコメント

 
GN⁺ 2024-12-08
Hacker News の意見
  • OP、もしかしてこの LLM 比較ツールに触発されたのですか?
    https://whatllm.vercel.app
    表はかなり似ていますが、ここに直接計算機を追加したのは良いポイントですね
    Versus Comparison には、チェックボックスを押したときに各 LLM の最高値の項目を一目で強調表示してくれる機能があるとよさそうです

    • このツールのデータは、2024年10月13日時点の https://artificialanalysis.ai/ から取得したものなので、少し古くなっています
      すべてのモデルとプロバイダーの最新情報はこのページにあります: https://artificialanalysis.ai/leaderboards/providers
      他のページでは、音声認識、音声合成、画像生成、動画生成も扱っています
      ちなみに私は Artificial Analysis の制作者の一人です
  • モデル比較が増えていく方向性は良いと思います。これらのモデルに対する独立した分析も追加する予定なのか、それとも入力上限のような情報を集約するだけなのか気になります
    以下のような他の分析と比べて、どのような差別化要素や付加価値があると考えていますか?
    https://artificialanalysis.ai
    https://huggingface.co/spaces/TTS-AGI/TTS-Arena
    https://huggingface.co/spaces/hf-audio/open_asr_leaderboard
    https://huggingface.co/spaces/TIGER-Lab/GenAI-Arena
    集約作業は素晴らしく、Webサイトも見て回りやすいです

    • 複数のプロンプトとカテゴリについて LLM の出力結果を比較し、横並びで見られるようにするために https://aimodelreview.com/ を作りました
      各プロンプトを異なる temperature 値で4回ずつ実行し、トグルで見られるようにしています
      各モデルのレビューも追加しようとしましたが、気力が尽きました。それでも、同じプロンプトに対してモデルがどのように異なる回答をするのか、temperature が同じモデルの出力にどんな影響を与えるのかを把握するうえで、この比較は今でも役に立つというメッセージをもらったことがあります
    • Gradio UI は個人的に見た目が良くないと感じたので、Webサイトを見栄えよくするために shadcn と Next.js を使いました
      できるだけユーザーフレンドリーにしようとしています。ほとんどのWebサイトは見た目が悪いか、技術寄りすぎます
    • さらに一歩進めて、すべての AI モデルに同じプロンプトを実際に実行し、最も良い回答とその回答を作ったモデルを表示すると想像してみてください
  • いいですね!価格対性能の値を見られるとよさそうです
    非構造化テキストから構造化データを安定して作るときに使える、最も安いモデルを知る方法が必要です
    今は安価な gpt4o-mini を使っていますが、もっと安いモデルでも同じことができるのかは分かりません

    • Gemini Flash 1.5 を一度見てみてください。動画を構造化されたノートに変換する必要があったのですが、結果には満足しており、不思議なことに Gemini 1.5 Pro よりも良かったです
      https://jampauchoa.substack.com/i/151329856/ai-studio
      このWebサイト基準では、コストは gpt4-o mini の半分です。100万トークンあたり 0.15 対 0.07 です
    • GPT-4o mini の価格帯で、それほど有能なモデルはまだ見つけられていません。Llama 3.3 70B への期待を見ると、そのモデルかもしれません
      Deepinfra では入力トークンはより高いものの、出力トークンはより安いので、価格はほぼ同じだと見ています
      ただし、最高の価格対性能はかなり主観的です。ある人は1つのユースケースだけうまくいけばよく、別の人はより広い範囲でうまくいくことを望むかもしれないからです
    • 複数のモデルを比較するときは、いつも openrouter.ai を勧めています。雑多な作業に普段使っているところです
      関係者ではなく、ただのユーザーです
  • AI に対する個人的な見方であり愚痴でもあるものを共有したいです。多くの人と同じように、私も現在の AI の流れにとても興奮しています
    今はイノベーションの最前線なので、この分野に飛び込んで貢献したいという衝動は自然なものです
    しかし、この瞬間は過熱した金融市場に似ていると思います。市場の変動が激しいときによく聞く助言の一つが、待って様子を見ることです
    AI でも、優秀な人材や組織が画期的なイノベーションを生み出そうと走っています。自分が次の大きなプロジェクトとして思い描くものは、すでにどこかで進行中か、まもなく出てくる可能性が高いです
    だから、待って様子を見る戦略は意外と効果的かもしれません。急ぐのではなく、ほとぼりが冷めるのを待ち、流れを観察したうえで、新しく登場するものを活用するのです
    ある意味では、AI エコシステム全体が、私の次の大きなアイデアの土台を作ってくれています
    だからといって、最新技術をすでに動いている製品やサービスに統合するなという意味ではありません

    • その提案はかなり妥当です。すでに多くの企業が最先端モデルを自社製品に統合しているはずです
      ただし、ただ飯はありません。こうすると先回りではなく、反応的に動くことになります
      リスクは減らせますが、生き残って非常に価値を持つようになる数少ない場所に持ち分を持つ機会も失います
      こういうやり方を長く続けると、最終的にはその分野の人たちが何を話しているのか分からなくなります。私の言いたいことをつかみたいなら、最新の Dwarkesh Patel のエピソードを見てください
      ここでの持ち分とは、会社の株式や AI 研究者としての知識のようなものを広く意味しています
  • 少し話がそれますが、デスクトップで ChatGPT の標準クライアントより良いものはありますか?
    チャットの整理機能があまりに単純だと感じているのですが、アプリが十数個ほどあって評価が難しいです。多くはどこかの会社の API サービスへ誘導するためのラッパーのように見えます
    おすすめはありますか? macOS/Linux 対応だとうれしいです

    • Telosnex があります。すべてのプラットフォームでネイティブに動作し、Web 版もあります
      Anthropic、OpenAI、Mistral、Groq、Gemini、そして実質的にあらゆるプラットフォームのローカル LLM をサポートしています
      自分の API キーを持ち込めて、検索も最も優れています。使った分だけ支払う方式で、月額 10 ドルを払うとすべて原価で提供されます。そうでなければ無料です
      すべてのデータは単純な JSON として保存されます
    • https://www.typingmind.com/ があります。ローカル専用でサーバーはなく、インディー開発者が作りました
    • Machato をなかなか良く使えました: https://untimelyunicorn.gumroad.com/l/machato
  • 音声文字起こしモデルが 2 つしかないんですね。普通、本当にこんなものなのでしょうか?
    文字起こし用の Llama のような オープンソースモデルはないのか、それともこのサイトのデータセットが小さいのか気になります

    • このサイトは Hugging Face や civit.ai などにあるすべてのモデルではなく、主要プロバイダーの ホスティングモデルだけを列挙しているようです
      画像生成とチャットのリストを見ても、Hugging Face にはここに載っていないモデルがはるかに多くあります
      https://huggingface.co/models?pipeline_tag=automatic-speech-... を見てください
      ちなみに、音声合成と音声文字起こし/自動音声認識モデルは同じデータで学習できます。ただし現在はモデル構造が異なるため、別々に学習する必要があります
      難しい点の一つは学習時間です。データが数百時間分の音声にまで増えることがあります
    • モデルは本当に多く、さまざまなユースケースをカバーしています。たとえば オンデバイス、ストリーミング/低遅延、特定言語向けモデルなどがあります
      人々は OpenAI が 2022 年に Whisper で音声文字起こしを発明したかのように考えていますが、他のモデルはすでに数十年にわたって存在し、実運用環境で使われてきました
      その Web サイトには Whisper だけが載っています
  • UI と表のレイアウトが良いです。モデルごとの VRAM 要件を表示することも考えましたか?

  • 性能とコストを比較できるように lmarena ランキング情報も一緒に出るとよさそうです

  • 良い資料です。下位バージョン名を全部知らない人にとっては、ほとんど過剰なほど網羅的ですね
    lmarena ランキング表のスコア列があるとよさそうです。一部の価格が 0.00 と表示されていますが、理由はありますか?
    各行から、より詳しいページへリンクするものもあるとよさそうです

    • ありがとうございます! 一部のモデルは N/A や 0.00 と表示されますが、無料モデルか利用できないモデルでそうなっているようです
      llmarena は必ず追加します。他の方々からも多く推薦されました
      時間が経つにつれて、Web サイトをより説明的で詳細なものにしていきます
    • モデルを利用したり購読したりできる 会社ページへのリンクもあるとよさそうです