• 本番モデルの複雑さを解消: Netflixの既存レコメンデーションシステムは、数千の手作業特徴量と複雑なアーキテクチャに依存しており、新しいユースケース追加のコストが高かったため、大規模言語モデル(LLM)ベースのGenRecがこれを置き換える目的で開発されました。
• GenRecの中核パイプライン: GenRecは、ユーザー履歴、アイテムのメタデータ、コンテキストを自然言語プロンプトへ変換(Verbalization)し、Netflix専用データでファインチューニングされた基盤LLMと、カタログ認識型スコアリングヘッド(Scoring Head)を組み合わせてレコメンド順位を生成します。
• 2段階学習フレームワーク: Phase 1では、オープンソースLLMをNetflixコーパスに適応させてコンテンツと行動パターンを学習し、Phase 2ではランキングデータと報酬目標に基づいてポストトレーニングを行います。
• コンテキストエンジニアリングの導入: トークン予算の制約を解決するため、高シグナルな相互作用は維持しつつ、低シグナルなイベントを省略したり、反復行動を圧縮したりするコンテキストエンジニアリングを適用し、品質低下なしにトークン数とコストを大幅に削減しました。
• 報酬加重ランキング目的関数: 長期的な会員満足度のプロキシと、ビジネス目標(コンテンツ種別および公開段階ごとの再調整)を反映した報酬加重損失関数を用いることで、単純なクリックを超えた最適化を達成しました。
• vLLMベースのプリフィル専用推論: vLLMを活用した内部LLMサービングスタックで、自己回帰デコーディングの代わりにプリフィル専用(prefill-only)モードで実行し、候補群全体のスコアを単一のフォワードパスで計算することで、サービングコストを最適化しました。
• オンラインA/Bテストの成果: 約10%のトラフィックを対象に4週間実施した大規模A/Bテストで、GenRecは既存の本番ランキングモデルと比べ、はるかに少ないPhase-2ラベル付きデータと入力シグナルだけを用いながら、短期および長期のオンライン指標で統計的に有意な改善を記録しました。
まだコメントはありません。