1 ポイント 投稿者 GN⁺ 1 시간 전 | 1件のコメント | WhatsAppで共有

1件のコメント

 
GN⁺ 1 시간 전
Hacker News の意見
  • モデル重みが公開されたばかり: https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731

    • DwarfStar量子化版に期待。128GB MacBook ProでDeepSeek V4 Flashプレビューを数か月にわたり主力コーディングエージェントとして使ってきたが、ほぼすべての指標で GLM 5.2 より優れているように見える
    • 128×128行列積プリミティブを備えたハードウェアアクセラレータを狙っているが、H100の Warp Group Matrix Multiply Accumulate を意味しているのか気になる
    • 165GB未満のUnsloth GGUF なら、256GB RAMを備えたCPU専用システムの大半で実行可能。llama-serverで32GB・48GB・96GB GPUに可能な限り載せ、残りをシステムDRAMに置く混成構成もできる
      https://huggingface.co/unsloth/DeepSeek-V4-Flash-0731-GGUF
  • 新しいDeepSeekモデルはクリスマスプレゼントのようなもの。低価格APIモデルはDeepSeekが最も得意で、VRAMの価格がローカル実行できる水準まで下がるまでは、このやり方が最善だ
    補助金頼みのサブスクリプションモデルは長続きしにくく、API課金のほうが持続可能な事業モデルに近く見える

    • あるプロジェクトでDeepSeekを使っているが、数千万トークンを数セントで使えるのは驚異的。すべての作業に向くわけではないが、特定の作業は実質無料に近いコストで見事にこなす
    • 中国がメモリと演算ハードウェアで追いつき、米国企業を 価格と性能の両方で 圧倒する日が楽しみだ
    • 同僚の開発者たちはClaudeのトークンを1時間で使い切ると不満を言うが、私は DS Flash を一日中使っている。たまに外したら、そのときだけ難しい作業向けにClaudeのようなモデルを出せばいい
    • トークン単価で見ても DeepSeek API はサブスクよりコスト効率が高い可能性が大きい。実際に試したところ、Flashは指示追従能力が大きく改善し、より能動的になっていて、現時点でコスト効率の面で並ぶモデルはほとんどない
    • 実際の価格を見ると、GPT 5.6 Lunaと同じ結果を出すにはトークンが 5倍 必要で、秒間トークン数もかなり低い。それでもDeepSeekの圧力のおかげで既存各社が最適化を続けるという効果は確かにある
  • 既存のアドレスは404で、正しいURLは次のようだ: https://artificialanalysis.ai/models/deepseek-v4-flash

  • 昨日公開されたOpenAIのチャートに DeepSeek V4 Flash 0731 のデータポイントを追加したところ、価格性能フロンティア上に位置していた
    https://files.parasmittal.com/openai_aa_luna_dsflash.svg
    原文: https://openai.com/index/advancing-the-price-performance-fro...

  • 公開ベンチマークのコードエージェント作業に、まだリリースされていない DeepSeek Harness 最小モード を使ったとのことだが、最適化されたコーディングエージェント用ハーネスも発表する予定なのか気になる
    DSv4 Flashをreasonixやpiと組み合わせれば、トークンを気にせず一日中数セントでコーディングできる。一方、同じモデルをFireworksやOpenRouterでZDRと一緒に使うと、理由もなく費用がどんどん上がる。利用データ収集のために価格を補助しているように見え、ローカル実行できる日を待っている

    • OpenRouterを通さないなら、どのプロバイダから購入しているのか気になる。OpenRouter掲載のプロバイダなら、直接購入しても価格は同じだと理解していた
    • 技術レポートで DeepSeek Harness はすでに予告されていた。コードエージェント作業は最小モード、最大推論努力、temperature = 1.0top_p = 0.95 で評価されており、ハーネスは後日公開予定とのこと
  • RTX PRO 6000 96GBを1枚使う人やDGX Spark 128GBユーザーには、あまり知られていない vllm-moet が非常に良いエンジン。推論用の対称2ビットプレーンを自動生成し、精度回復のために4ビットデルタキャッシュも作り、RAMより大きい重みのSSDストリーミングもサポートする
    各領域に割り当てるVRAMを決めて速度と精度のバランスを調整でき、DS V4 Flashでは 毎秒170トークン が実演されている。別途変換モデルなしで元のモデルをそのまま使う
    DGX Sparkでは sm120sm121 の違いを無視する小さな回避策が必要だが、sm121 でも動くので数時間かけて試す価値はある

  • 出力100万トークンあたり0.28ドル でGLM 5.2・Gemini 3.6級の知能を提供し、更新版Proモデルもまもなく出る予定
    Unsloth無損失Q8は162GBで、実際に家庭でも動かせそうなサイズだ

    • そんなものを家庭で回すなんて、どんな家なのか見てみたい
    • Q8のサイズは約 151GB
  • DeepSeek V4 FlashがV4 Proを上回るなら、数週間以内に Opus 5級のV4 Pro も期待できるのか気になる。Opusを超えるならなお良い

    • 作っているアプリでV4 Flashを使っているが、GPT・Opus・Sonnetだけ使っていたところから乗り換えると、コスト効率と性能に驚く。コストがあまりに低いので、収益目的でないアプリにも余裕のある無料枠を提供できる
      https://trysojourn.app
    • V4 Proの価格でOpus 5の性能 なら信じがたいほど素晴らしいが、たぶん夢に近い
    • 更新版 V4 Pro最終版 がまもなく公開されると明かされている
  • 本当に興味深いのは、アーキテクチャ変更なしで追加の 微調整 だけにより大きな性能向上を達成した点だ。より多くのデータと計算資源、時間を投入した結果だ
    DS V4 Flashは競合モデル群と比べれば比較的小さいので、高品質なデータと学習パイプラインをほかの小型モデルに適用しても、似たような向上が得られる可能性が高そうだ

  • タスクあたりの価格では、すでにLunaを約 2倍差 で上回っている: https://artificialanalysis.ai/models/deepseek-v4-flash?intel...

    • Lunaと、特定の作業タイプごとにどう比較されるのかも見てみたい
    • コストがX軸なので、正確にはDeepSeek V4 Flash 0731の最大推論はタスクあたり約0.03ドル、指数50。OpenAI Lunaは高推論が0.03ドル・指数46、超高推論が0.04ドル・指数49、最大推論が0.07ドル・指数51
      したがってLunaはDeepSeek Flashより 2〜3倍高いが、推論速度は2〜5倍速い と見るのが公平だ。DeepSeekを上回る最も安いOpenAIモデルはLuna最大推論で、近い性能に対し四捨五入前の基準では約3倍高いが、速度もほぼ3倍速い
      Artificial AnalysisがDeepSeekとOpenAIの両方に濃い青を使っているのは、特に今日のような日には非常に不適切な色の選び方だ