NVLink

NVLink

NVLink(エヌブイリンク)とは、NVIDIAが開発したGPU間・GPU-CPU間の高速インターコネクト技術です。PCIeを大幅に上回る帯域幅を提供し、マルチGPU環境でのデータ転送ボトルネックを解消することで、大規模なAI学習の効率を飛躍的に向上させます。

NVLinkの帯域幅

NVLink 4.0(Hopper世代)は双方向で900GB/sの帯域幅を提供し、PCIe 5.0 x16(約64GB/s)の約14倍に達します。NVLink 5.0(Blackwell世代)ではさらに帯域幅が拡大しています。この大容量の帯域幅により、GPU間のパラメータ同期やテンソル分割がボトルネックなく実行できます。

表:NVLinkの要点まとめ
ひとことで言うとNVIDIAが開発した、GPU同士を高速につなぐ専用の接続規格。
何がうれしいかPCIeより桁違いに速く、マルチGPU学習の通信の詰まりを解消できる。
注意点対応機種が限られ、価格も高い。小規模なら不要な場合も多い。

NVSwitch

NVSwitchは、複数のGPUをNVLinkで全対全接続するためのスイッチチップです。NVIDIA DGX H100では8台のH100 GPUがNVSwitchで接続され、各GPU間が均等な帯域幅で通信できます。DGX B200では次世代NVSwitchによりさらに大規模な接続が可能です。

図:NVLinkが効く場面
1GPU間で勾配を共有毎ステップ発生
▶
2PCIe経由は遅いここが詰まる
▶
3NVLinkで直結数倍〜十数倍の帯域
▶
4学習が高速化GPU増設の効果が出る

大規模学習への影響

テンソル並列やパイプライン並列では、GPU間で頻繁にデータを交換するため、インターコネクトの帯域幅が学習効率に直結します。NVLinkの高帯域幅は、数百〜数千GPU規模の大規模モデル学習において不可欠なインフラです。NVLink/NVSwitchのネットワークがNVIDIAのAIインフラの差別化要因となっています。