GPUインスタンス

GPU Instance

GPUインスタンスとは

GPUインスタンス(GPU Instance)とは、NVIDIA やAMDなどのGPUを搭載したクラウド上の仮想マシンです。AI/MLの学習・推論、高性能計算(HPC)、動画処理などGPUアクセラレーションが必要なワークロードに特化しており、通常のCPUインスタンスでは得られない圧倒的な並列計算性能を提供します。

表:GPUインスタンスの要点まとめ
ひとことで言うとGPUを搭載したクラウド上の仮想サーバー。
選び方扱うモデルのサイズからVRAM容量を決め、次に価格と可用性で選ぶ。
注意点人気機種は在庫切れで起動できないことがある。代替案も準備する。

GPUインスタンスの種類

GPUインスタンスは搭載GPU の種類と数によって多くのバリエーションがあります。推論用途にはNVIDIA T4やL4を搭載したコスト効率の高いインスタンス、中規模の学習にはA10Gを搭載したインスタンス、大規模学習にはA100やH100を8基搭載したインスタンスが選ばれます。

図:GPUインスタンスの選び方
1モデルサイズを確認必要VRAMを計算
▶
2インスタンスを選ぶVRAMが足りるもの
▶
3料金を比較オンデマンドかスポットか
▶
4起動・実行環境構築して使う
▶
5停止・削除使い終わったら止める

選択のポイント

GPUインスタンスの選択では、GPUメモリ容量、GPU間・ノード間の通信帯域、コストパフォーマンスが重要です。大規模言語モデルの学習ではGPUメモリが特に重要で、A100の80GBやH100の80GBが求められます。また、マルチGPUでの学習にはNVLinkやNVSwitchによるGPU間通信速度も考慮する必要があります。

スポットインスタンスの活用

AWSのスポットインスタンスやGCPのプリエンプティブルVMを使えば、オンデマンド価格の60〜90%割引でGPUを利用できます。中断される可能性がありますが、チェックポイント機能を活用すれば学習の中断・再開が可能で、コスト効率を大幅に向上させられます。