GPU上の推論サーバーのパフォーマンスチューニング方法

概要
- GPUを利用した推論サーバーのパフォーマンスチューニングについての記事。
- 目新しい手法をとっているわけではないが、丁寧に実験が進められていて参考になる。
- スループットとレスポンスタイムのトレードオフが分かりやすく説明されていてよかった。
- やったことは大きく3つ
- 半精度計算
- リクエストの並列処理
- インスタンスを増やす
- 動的バッチング
- パイプライン最適化
- 利用ツール
- 推論サーバーにはTriton Inference Serverを利用
- 類似画像検索にNGTやValdを利用
- TensorRTってのよく知らなかった。