1 ポイント 投稿者 GN⁺ 1 시간 전 | 1件のコメント | WhatsAppで共有
  • Kimi Linear は、KDA と MLA を 3:1 で配置したハイブリッド構造で、同一の学習条件において、全面的な MLA よりも短期・長期コンテキストおよび強化学習評価全般で高い性能を記録
  • 中核モジュールの Kimi Delta Attention(KDA) は、Gated DeltaNet のヘッド単位の忘却ゲートをチャネル単位へ細分化し、有限な RNN メモリの各特徴次元が独立した忘却率を持つようにした
  • 特殊な Diagonal-Plus-Low-Rank(DPLR) 遷移行列とチャンク単位の並列アルゴリズムにより、一般的な DPLR より計算量を削減し、オペレータ効率は約 100% 向上
  • アクティブパラメータ 3B・総パラメータ 48B のモデルを 1.4T トークンで学習し、MMLU-Pro 4K で 51.0 点、RULER 128K で 84.3 点と 3.98 倍の高速化を達成。1M トークンでは、MLA より 出力トークンあたりの時間が 6.3 倍高速
  • 長文生成時に KV キャッシュを最大 75% 削減しつつ、既存の全面アテンションパイプラインのキャッシュ・スケジューリングインターフェースを変更せずに適用でき、KDA カーネル、vLLM 実装、モデルチェックポイントも公開

長期推論において全面アテンションが生むボトルネック

  • エージェント型 LLM と強化学習ベースのテスト時拡張では、長い軌跡、ツール使用の相互作用、複雑な意思決定空間を推論中に処理する必要がある
  • 標準的な softmax attention は 時間計算量が二乗で増加し、KV キャッシュはコンテキスト長に比例して増大するため、スループット、コンテキスト拡張、リアルタイム相互作用を制限する
  • 線形アテンションは計算複雑度を下げられるが、表現力が制限されており、短いシーケンスの言語モデリングでも softmax attention より性能が低かった
  • 近年のゲーティング・減衰メカニズムと デルタ則(delta rule) により、中程度の長さのシーケンスでは品質差が縮まったが、純粋な線形構造は有限状態容量のため、長期シーケンスモデリングやコンテキスト内検索に制約がある
  • 一部のグローバルアテンション層と多数の線形層を組み合わせたハイブリッド構造が、品質と効率の折衷案として登場したが、既存モデルは規模が限られていたり、多様なベンチマーク評価が不足していた

線形アテンションから Gated DeltaNet まで

  • 基本的な線形アテンションは、行列形式の再帰状態にキー・バリューの関連を継続的に蓄積し、これを一時的な連想メモリである fast weight として利用する
    • どの記憶を消去するかを決める基準がないため、状態が無制限に蓄積し、長いコンテキストで干渉が発生する
  • DeltaNet は、状態がキーをバリューへ復元するよう再構成損失に対するオンライン勾配降下を行う
    • 既存状態を継続的に補正する古典的なデルタ則を使用する
    • ランク 1 更新は一般化された Householder 変換と等価であり、チャンク単位で並列化できる
  • Gated DeltaNet(GDN) は、スカラー忘却ゲート αt を追加して古い関連を減衰させる
    • ゲートは fast weight に対する weight decay のように動作し、データ依存の L2 正則化に似た忘却メカニズムを実装する
    • メモリ寿命を制御し、干渉を減らしつつ、DeltaNet の並列化構造を維持する
  • GDN は、遷移行列がデータ依存かつ学習可能である点で、RoPE の直交性制約を緩和した乗算型位置エンコーディングとして解釈できる

Kimi Delta Attention の精密なメモリ制御

  • KDA は、GDN の単一スカラー減衰を対角化されたチャネル単位ゲートに置き換え、各特徴次元のメモリ減衰と位置情報を独立して制御する
  • チャネルごとの忘却率は、制限された有限状態 RNN メモリをより精密に調整し、Gated Linear Attention(GLA) と同様の粒度を提供する
  • 遷移ダイナミクスは特殊な DPLR 行列 でパラメータ化され、古典的なデルタ則との整合性を維持する
  • 一連のランク 1 行列変換は密な表現へ圧縮され、対角ゲーティング下でも安定したチャンク単位の並列処理を支える

チャンク単位の並列アルゴリズム

  • シーケンスを固定長チャンクに分割し、各チャンクの初期状態として前チャンクの最終状態を使う
  • WY 表現により複数のランク 1 更新を 1 つの圧縮表現にまとめ、Comba の展開に従って後続計算で追加の行列反転が不要になるようにする
  • UT 変換 は、行列積ではない演算の FLOP を削減し、学習中のハードウェア利用率を高める
    • 下三角行列の逆行列は、ガウス消去法の前進代入を用いて行単位で計算する
  • 状態更新はチャンク単位の行列形式で実行し、出力段階ではチャンク間の再帰処理とチャンク内の並列処理を組み合わせる
  • チャンク内計算を行列積中心で構成し、Tensor Core のスループットを活用する

一般的な DPLR より削減された計算量

  • KDA と一般化 DPLR はどちらも精密な減衰をサポートし、表現容量の面で対応する
  • 精密な減衰は、チャンク内部の除算で数値精度の問題を引き起こすことがある
    • GLA は対数領域計算と完全精度の二次チャンク化を使うが、半精度行列積の活用が制限され、オペレータ速度が低くなる
  • KDA は、DPLR 遷移の 2 つの変数をどちらもキー k に結び付ける
    • 二次チャンク行列計算を 4 個から 2 個へ削減
    • 追加の行列積 3 個を削除
  • 入力長ごとのカーネル測定では、KDA の オペレータ効率は一般的な DPLR より約 100% 向上

Kimi Linear モデル構成

  • モデルのバックボーンは Moonlight に従い、トークン混合層の後に MoE チャネル混合層を配置する
  • 各 KDA ヘッドのクエリ・キー・バリューは ShortConv と Swish を経て計算される
    • クエリとキーには、固有値安定性のための L2 正規化 が追加される
    • キーとバリューのヘッド次元は、すべての実験で 128 に設定される
  • チャネルごとの減衰ゲートは、ヘッド次元と同じランクの低ランク射影でパラメータ化され、GDN・Mamba と類似した減衰関数を使う
  • 出力射影の前には、ヘッドごとの RMSNorm とデータ依存の出力ゲートを適用する
    • 出力ゲートも低ランクで構成し、フルランクゲートと同程度の性能を保ちつつ、公平なパラメータ比較を可能にする
    • このゲートは Attention Sink を緩和する

KDA と MLA の 3:1 ハイブリッド

  • 純粋な線形アテンションの長期コンテキスト検索の限界を補うため、KDA 層の間に全面的なグローバルアテンションである Full MLA 層を配置する
  • 1 つの層の中でヘッドを混在させるのではなく、層全体を交互に配置する
    • 層単位の構成はインフラが単純で、学習安定性が高い
  • 実験では、KDA 3 層の後に MLA 1 層を繰り返す 3:1 比率 が、品質とスループットの間で最良のバランスを提供した
  • 長文生成では、全面アテンション層のみが KV キャッシュを保持するため、メモリと KV キャッシュ使用量を最大 75% 削減しつつ、グローバルな情報フローを保てる

NoPE の適用と評価結果

  • すべての MLA 層には、位置エンコーディングを使わない NoPE を適用し、位置情報と新しさバイアスは KDA が担う
  • KDA は、短い畳み込みやスライディングウィンドウアテンションのような補助的な位置認識コンポーネントと同等、またはそれ以上に強い役割を果たす
  • NoPE を使うことで、MLA を推論時に効率的な純粋 Multi-Query Attention(MQA) へ変換できる
  • RoPE の周波数ベース調整や YaRN のような手法が不要になり、長期コンテキスト学習が単純化される
  • 同じ方法で 1.4T トークンを学習した比較では、Kimi Linear は次の結果を記録した
    • MMLU-Pro 4K で 51.0 点 を記録し、MLA の 47.2 点と GDN-H の 47.9 点を上回る
    • RULER 128K で 84.3 点と 3.98 倍の高速化を達成し、MLA の 81.3 点と GDN-H の 80.5 点を上回る
    • 1M トークンでの出力トークンあたり時間(TPOT)は 1.84ms で、MLA の 11.48ms より 6.3 倍高速
    • 長いシーケンスでも低い TPOT を維持し、より大きなバッチを使える
  • 事前学習モデルはアクティブパラメータ 3B、総パラメータ 48B で、短期コンテキスト、長期コンテキスト、強化学習型の事後学習課題で全面的な MLA を一貫して上回る
  • KDA カーネル、vLLM 統合、Kimi-Linear-48B-A3B-Instruct チェックポイント が公開
    • 既存の全面アテンションパイプラインのキャッシュまたはスケジューリングインターフェースを修正せずに置き換えられる

1件のコメント

 
GN⁺ 1 시간 전
Hacker Newsのコメント
  • 最近公開された Kimi K3論文 を見ると、ここで扱われている Kimi Linear を大規模に拡張し、ネイティブなビジョンや強化学習の改善などを追加した構造になっている
    https://arxiv.org/abs/2607.24653

  • 最先端モデルで見られる知能が、本当にアーキテクチャを拡張したときにだけ現れる 創発現象 なのか気になる
    同じ構造の100万パラメータモデルは基本的なパズルも解けないのに、1兆パラメータモデルはヤコビアン予想の反例まで作り出すというのは直感に反して見える。単純なソートアルゴリズムに計算を多く与えてもクイックソートには勝てないのに、現代のLLM研究は同じアルゴリズムと構造を延々と大きくしながら答えが出ることを期待する競争のように見える

    • これは機械学習では The Bitter Lesson としてよく知られた現象だ。計算量が大きく増えても拡張し続けられる汎用的手法の力を学ぶべきで、その手法とは探索と学習だ
      短い原文も読む価値がある: http://www.incompleteideas.net/IncIdeas/BitterLesson.html
    • 最近はこの分野を離れていて、専門もLLMより強化学習に近いが、結局 意味と知能は内部表現に宿る のだと思う。小さいモデルは、入力を意味や出力に結びつける内部マッピングを最初から学習するだけの容量が足りないか、単純なソートのように理論上は可能でも現実的には耐えがたい時間が必要なのかもしれない
      大きいモデルはその内部表現空間に足場を築きやすく、最適化が進んだ後は重みの大半が特に何もしていない可能性もある。この空間を学習するのに必要な表現力がどれほどかはまだ明確ではないが、今のところ数十億パラメータが必要そうだ
      さらに興味深い問いは、モデルがどれだけデータに対して不変であるべきかという点だ。数学的推論とプログラミングが全体的な性能を大きく高めた理由は、幅広い作業群で再利用できる スキル だからだと思う。言語やタスクに依存しないプログラミングの論理を集中的に学習させることが、より小さなモデルへの道かもしれない
    • モデルのスケール拡大 は、知能を高める最も一貫していて信頼できる方法の1つだ。AI学習は、別のアルゴリズムを計算的に見つけて磨き上げるアルゴリズムであり、スケールを大きくすれば目標に合ったより良いアルゴリズムを探索するための資源が増える
      たとえるなら、小さいモデルは容量と学習信号の制約のため内部的にはバブルソート程度にとどまるが、大きいモデルはより深く探索してクイックソートに近い方法を見つけられる
      知能は二分法ではなく、10億パラメータモデルも10兆パラメータモデルもある程度の知能を持つ。前者は統計的規則性に過度に依存していて見過ごされやすく、後者は未解決予想の新しい反例を見つけられるほど発達したにすぎない。両者の間も突然の跳躍というより、小さな改善が積み重なって雪崩になる形に近い
      数学能力のような具体的成果は急激に伸びたように見えても、その下ではミスを減らし、ミスから回復する 汎用能力 が徐々に蓄積している。こうした能力が十分に良くなると、まったく新しいタイプの論理問題まで解けるようになる
    • ディープラーニング理論の観点から見ると、知能は主に スケール拡大 から来るもので、よく設計されたモデルと最適化器の組み合わせが単純性へ向かう強い暗黙的バイアスを持つとき、モデルサイズに応じて性能が向上し続けうる
      Marcus Hutter の研究室はこれをソロモノフ帰納法として表現し、このバイアスが普遍的に有効であることを示した。効果的なバイアスは次元の呪いを逆手に取り、データが多いほどより良い答えを得られるのと同じように、大きなモデルで性能を伸ばし続けられる
      ただし、こうした特性を示すモデルのクラスは極めて狭く、運よくその地点に到達したに近い。一般的な統計原則が今でもこうした振る舞いを基本的には期待するなと教えるのはそのためだ
    • 人間が基本的な問題と非常に難しい問題として区別しているものも、絶対的な尺度では 互いに非常に近い可能性がある。違いは主にその問題を解ける人間の割合であり、人間能力の下限ですらかなり高い。大多数の人間にとって基本的な問題を解ける動物はまれだが、複雑な行動や学習は可能で、ニューロン規模も人間と途方もなく違うわけではない
      100万から1兆パラメータへの増加は 100万倍のスケール拡大 だ。人間の脳を各方向で1%の大きさ、つまり数mm程度まで縮小するのに近い
  • Kimi Linear で内部モデルを作り始めたが、その後に出た Gated Deltanet 2 が表現力の面で発展形に見え、自前のテストでも実際により良かった
    https://arxiv.org/abs/2605.22791

    • 読んでみると LSTMを再実装したもの のように感じる
  • 研究のために KDAカーネルと vLLM 実装 をオープンソースで公開し、事前学習および指示チューニングモデルのチェックポイントまで配布している点は素晴らしい

  • Kimi の成功を 蒸留攻撃 だけで説明したいなら、この研究は無視すればいい

    • もうこれを 蒸留攻撃 と呼ぶのはやめてほしい
    • 中国の研究所が印象的なイノベーションを起こしていることと、蒸留で利益を得た可能性は両立する。どちらがどれだけ寄与したかは分からないが、どちらか一方だけが真でなければならないというのは 偽の二分法
    • 蒸留を非難するのは、カジノが カードカウンティング を非難するようなものに聞こえる
    • 米国がAI競争で勝ってほしいとは思うが、今日の発明の大半も過去の知識の 蒸留 ではないのか理解しがたい。Anthropic は自分たちが取り込んだデータを営業秘密だと主張しているのだろうか
    • 最先端モデルは1つの要素だけでは作れない。これはあくまで漸進的改善の1つであり、モデル成功のすべてを説明するものではないし、蒸留への立場に関係なく 学習データセット が極めて重要だ
  • 同じサイズの完全アテンションモデルと比べたとき、長文コンテキスト検索、特に needle-in-a-haystack や RULER の性能がどうなのか気になる。効率向上は素晴らしいが、線形アテンション混合モデルはたいていこの点で崩れる

  • こうした 非標準 Transformer が広く使われ始めたら、Etched のような会社は厳しくなるのか気になる

  • この論文は 2025年の資料 で、すでに9か月が経っており、その間に主要モデルが新たにリリースされた

    • K3 については、この論文を読むほうがよい: https://arxiv.org/abs/2607.24653
      K3論文の中核的な貢献は Stable LatentMoE だ。他の一部モデルのように層の間で受け渡されるデータを圧縮するため、ルーターに特定の条件が求められるが、K3 はよりバランスの取れたエキスパート選択戦略で性能を高めている
    • 当時は十分に議論されなかった: https://news.ycombinator.com/item?id=45766937
    • 新しい Kimi K3 には KDA 層が69個、Gated MLA 層が24個入っていて、再投稿されたようだ。以前の大型 Kimi モデルは MLA 層だけを使っていたと記憶している