4 ポイント 投稿者 GN⁺ 1 일 전 | まだコメントはありません。 | WhatsAppで共有
  • AIの利用量を表すトークンのように、モデルの能力を改善するデータ作業単位である**タスク(task)**が、AI投資を測る大規模な市場を形成すると見込まれている
  • インターネット上の学習データと単純・汎用的な能力が飽和するにつれ、実環境で専門家の暗黙知を教える高品質データがモデル発展のボトルネックとして浮上している
  • タスクは初期状態と作業環境を提供し、結果を報酬信号や検証器で評価することで、公開インターネットだけでは再現しにくい専門家の業務手順をモデルに学習させる
  • OpenAIとAnthropicのデータ支出は毎年10倍ずつ増加しており、Mercorは2月にARR 10億ドルを記録した後、4か月で20億ドルに到達した
  • 法務・医療・金融・ソフトウェア・科学の各分野で、個別のデータセット、評価体系、強化学習環境が必要となり、AI研究所・アプリケーション企業・一般企業によるデータインフラ競争が拡大すると見込まれる

AIの成長を測るトークン経済

  • 推論トークンは、AIエコシステムの成長を追跡する代表的な指標として定着している
    • 上場企業はAIの成長を示すために月間処理トークンを公開している
    • アナリストはOpenRouterランキングのように、モデル別のトークン使用量を比較している
    • 経営陣は時間の経過に伴うトークン使用量で、AI投資と導入水準を測定している
  • トークンは複雑な推論プロセスを1つの測定単位に抽象化し、技術的背景がなくてもAIの拡大を理解できる共通言語として機能する
    • AIユーザーの増加、非推論モデルから推論モデルへの移行、クエリからエージェントへの移行はいずれもトークン増加につながる
    • バックグラウンドエージェントや長時間作業エージェントもトークン使用量を増やす
  • 採用拡大とモデルあたりのトークン集約度が重なり、全体の使用量が急速に増え、推論市場へ投資と企業参入が集中している
  • 推論市場の高い可視性は、同程度の規模に成長し得るものの理解しにくい別の潮流を覆い隠す効果もある

タスク経済の登場

  • この3年間でLLMは、基本的な質疑応答から複雑な推論を経て、長期間にわたり実務を遂行するエージェントへと進化した
  • 初期のモデル改善はインターネットデータとより多くの計算資源に依存していたが、次の2つの変化により追加の高品質データがボトルネックになった
    • インターネットから新たに学習できるデータが枯渇した
    • 単純で汎用的な能力が徐々に飽和した
  • タスク経済とは、モデルのさらなる改善に必要なデータを生成・供給する市場を指す

モデル改善単位としてのタスク

  • 強化学習においてタスクは、モデルが練習する単位である
    • モデルに初期状態と行動する環境を提供する
    • モデルの行動を報酬信号や検証器で採点する
    • 複数のタスクのスコアを学習信号として統合し、高いスコアを得た行動の方向へモデルを調整する
  • 厳密には強化学習の後処理学習の基盤を指すが、ここではデータを用いたモデル改善全般を包括する単位として用いる
  • 業界がモデル改善のための新しいデータ形式を作り続けるにつれ、タスクの範囲も拡張している
  • 従来のデータラベリングは、バウンディングボックスやLLM応答へのいいね・よくないね評価を想起させるが、現在の市場はより複雑で価値の高い作業へと発展している

法務業務での仕組み

  • 公開インターネットで学習したAIは、法律の基本概念や公開判例を理解できるが、有能な弁護士の実務を再現するのに必要なデータはインターネット上に十分存在しない
  • 高品質な法務業務を学習させるには、次の要素を組み合わせる必要がある
  • こうしたタスクは、モデルに何をすべきかだけでなくどのように実行すべきかまで教え、高品質なタスクが増えるほどモデル能力も向上する

トークンとタスクに共通する成長構造

  • トークンが推論とモデル利用の基本単位だとすれば、タスクはモデル改善の基本単位と見なせる
  • AI採用の拡大と最先端モデルのデータ需要増加が重なり、タスク需要が増えている
    • 単純な嗜好ラベルから、熟練専門家による評価表ベースの作業へ移行している
    • 専門家レベルの分野別エージェントが登場している
    • エージェントがより長い時間範囲の作業を実行している
    • 企業が評価体系を大規模に導入している
  • これらの要因が推論トークン市場と同様に重なり、タスク経済の急成長を促している

データ支出と市場成長のシグナル

  • OpenAIとAnthropicは、専門家を動員してデータとエージェント学習資料を作成しながら、データ支出を毎年10倍ずつ拡大している
  • 一部の主要AIアプリケーション企業と一般企業は、データが競争優位だと判断し、個別タスク関連の支出を短期間で1億ドル以上に増やしている
    • 差別化されたデータ戦略を持つ応用AIが、汎用の既製モデルより良い結果を出せるという判断である
  • タスク経済プラットフォームMercorは、2月にARR 10億ドルへ到達した後、4か月でARR 20億ドルを記録した
  • 高度な分野の業務を再現するエージェントはまだ初期段階にあり、企業によるデータ支出の拡大も始まったばかりである
  • AIが今後扱うべき人間の知識の99%は人の頭の中にあるという前提のもと、AI研究所・アプリケーション企業・一般企業が暗黙知をモデルやエージェントへ移すことで、参加者と購入者の範囲が拡大すると見込まれる

タスク市場が見えにくい理由

  • オンラインでタスクがトークンほど議論されない第一の理由は、支出が秘密主義の強い最先端AI研究所に集中してきたためである
    • 研究所はモデル改善戦略やデータ・タスク支出をほとんど公開しない
    • AIアプリケーション企業と一般企業が既製モデルとの差別化のためにタスク経済へ参加することで、状況は変わりつつある
    • これらの企業は自社のデータ活動をマーケティングする可能性が高く、タスク市場の可視性を高める可能性がある
  • 第二の理由は、推論市場におけるトークンのように、価値を簡単に抽象化する共通単位がなかったためである
  • タスクを標準的な価値単位として使えば、技術知識のない人でも、業界がAI能力向上にどれだけ投資しているかを把握できる
  • 現在はタスク規模と成長をリアルタイムで示す「タスク版OpenRouter」のようなサービスはない
    • Mercorの四半期ごとの専門家作業時間データが、市場成長を間接的に示す指標として活用されている

経済活動全般のためのデータ構築

  • ノートPCで行うあらゆる業務をエージェントで自動化するには、経済全体のアプリケーション、環境、タスク分布をすべて扱う必要がある
  • そのためには、専門職や学問分野、消費者ユースケース全般で大規模なデータ構築が必要である
    • 法務・医療・金融・ソフトウェア・科学は、それぞれ専門家が作成したデータセットを必要とする
    • 分野別の評価体系と強化学習環境も個別に整備する必要がある
  • AI研究所、アプリケーション企業、一般企業は、経済的に有用な業務全般でデータインフラを拡大しながら競争することになる
  • データインフラ構築に成功した組織は、最先端能力を継続的に改善し、市場シェアを獲得できる
  • タスク経済が広く普及し可視化されれば、AI産業はトークンとともにタスク規模も主要な成長指標として追跡するようになると見込まれる

アルゴリズム改善と議論の範囲

  • 一般的なAI能力は、データだけでなくモデルのアルゴリズム改善によっても向上し得る
  • アルゴリズム改善を除外したのは、将来の可能性を否定するためではなく、データとタスク経済に議論を集中するための範囲設定である

まだコメントはありません。

まだコメントはありません。