研究
研究ノートは短く保つ。再現でき、検証できるものだけを残す。
効率的な推論
大規模モデルの推論におけるボトルネックは、生の演算性能ではなくメモリ帯域幅です。私が注力しているのは:
- 投機的デコーディングのシステム側最適化
- KVキャッシュの圧縮とページング
- 小規模マルチGPUマシンでのパイプライン並列化
典型的なトレードオフの一つ:バッチサイズを倍にすればスループットは向上しますが、KVキャッシュのコストは急速に増大します。 のメモリフットプリントは、無視してよい些細な問題ではありません。
再現可能な評価
汚染されたベンチマークは慢性的な問題です。私は生きた評価パイプラインを構築しています:
問題
- 静的ベンチマークは訓練コーパスに漏洩する
- 単一実行のばらつきが結論として報告されることが多い
アプローチ
- ローリングスケジュールで新鮮な問題を生成する
- 点推定ではなく分布を報告する
代表的な成果
huggingface/transformersすべての人のための最先端 NLP —— 論文を再現するためのインフラaudiodeep-learningdeepseekgemmaglmhacktoberfest
このサンプルサイトでは、このカードは私が日々頼りにしているインフラを表しています。あなた自身のプロジェクトに置き換えてください。
