研究

研究ノートは短く保つ。再現でき、検証できるものだけを残す。

効率的な推論

大規模モデルの推論におけるボトルネックは、生の演算性能ではなくメモリ帯域幅です。私が注力しているのは:

  • 投機的デコーディングのシステム側最適化
  • KVキャッシュの圧縮とページング
  • 小規模マルチGPUマシンでのパイプライン並列化

典型的なトレードオフの一つ:バッチサイズを倍にすればスループットは向上しますが、KVキャッシュのコストは急速に増大します。O(BLd)O(B \cdot L \cdot d) のメモリフットプリントは、無視してよい些細な問題ではありません。

再現可能な評価

汚染されたベンチマークは慢性的な問題です。私は生きた評価パイプラインを構築しています:

問題

  • 静的ベンチマークは訓練コーパスに漏洩する
  • 単一実行のばらつきが結論として報告されることが多い

アプローチ

  • ローリングスケジュールで新鮮な問題を生成する
  • 点推定ではなく分布を報告する

代表的な成果

huggingface/transformersすべての人のための最先端 NLP —— 論文を再現するためのインフラaudiodeep-learningdeepseekgemmaglmhacktoberfestPython164.7k34.4k3 分前に更新

このサンプルサイトでは、このカードは私が日々頼りにしているインフラを表しています。あなた自身のプロジェクトに置き換えてください。

友達になろう

スキャンして機械学習とシステムについて語り合いましょう