Qu'est-ce que NVLink ? Comment ça fonctionne, bande passante et utilisations des GPU
2026-07-31 460

Les systèmes multi-GPU modernes dépendent de plus que de la performance brute des GPU. La rapidité avec laquelle les processeurs échangent des données, accèdent à la mémoire et travaillent ensemble peut avoir un impact majeur sur la vitesse globale. Cet article explique la bande passante NVLink et les générations, compare NVLink avec PCIe et NVSwitch, couvre l'accès à la mémoire GPU et NVLink-C2C, et montre comment NVLink est utilisé dans les charges de travail IA et HPC. Il vous aide également à décider quand NVLink peut améliorer les performances et quand PCIe peut déjà suffire.

Catalogue

Figure 1. NVIDIA NVLink High-Speed Interconnect

Figure 1. Interconnexion à haute vitesse NVLink de NVIDIA

Qu'est-ce que NVLink ?

NVLink est la technologie d'interconnexion à haute vitesse de NVIDIA pour le transfert de données entre les GPU et d'autres processeurs dans des systèmes de calcul accéléré. Son objectif principal est de réduire les goulets d'étranglement de communication lorsque plusieurs processeurs doivent échanger de grandes quantités de données tout en travaillant ensemble.

Dans les systèmes multiprocesseurs, la performance peut être limitée par la rapidité avec laquelle les données se déplacent entre les appareils. NVLink fournit un chemin de communication à large bande passante et à faible latence qui réduit les retards de transfert et aide les processeurs connectés à échanger des données plus efficacement.

Comment fonctionne NVLink ?

Figure 2. NVLink GPU-to-GPU Communication Path

Figure 2. Chemin de communication GPU à GPU NVLink

NVLink crée un chemin de communication à haute vitesse entre les GPU compatibles et d'autres processeurs. Lorsque deux GPU doivent échanger des données, l'accès pair à pair peut permettre aux données de se déplacer directement entre leurs espaces mémoire au lieu d'envoyer chaque transfert à travers la mémoire CPU.

NVLink prend en charge la communication bidirectionnelle, de sorte que les données peuvent se déplacer dans les deux directions entre les processeurs connectés. Plusieurs connexions NVLink peuvent également fonctionner ensemble, fournissant un chemin plus large pour les transferts de données entre processeurs.

NVLink fournit le chemin physique pour cette communication, tandis que le logiciel décide comment et quand le chemin est utilisé. CUDA, les pilotes de périphérique, NCCL et l'application gèrent les transferts. Lorsque l'accès pair est pris en charge et activé, un GPU peut lire, écrire ou copier des données dans la mémoire d'un autre GPU via la connexion NVLink disponible.

Générations et bande passante NVLink

La bande passante NVLink a augmenté avec chaque architecture GPU majeure de NVIDIA. Le NVLink de première génération est apparu avec le Tesla P100 basé sur Pascal, qui prenait en charge quatre connexions NVLink et jusqu'à 160 Go/s de bande passante bidirectionnelle totale par GPU. Le Volta V100 a porté cela à six liens et 300 Go/s par GPU.

Le NVLink de troisième génération est arrivé avec l'Ampere A100. L'A100 prend en charge 12 connexions NVLink et jusqu'à 600 Go/s de bande passante bidirectionnelle totale par GPU. Le Hopper H100 a augmenté le nombre de liens à 18, portant la bande passante NVLink de quatrième génération à 900 Go/s par GPU.

Le NVLink de cinquième génération est arrivé avec Blackwell, augmentant la bande passante bidirectionnelle totale à 1,8 To/s par GPU. Le NVLink de sixième génération, associé à la plateforme Rubin, augmente le maximum à 36 liens et jusqu'à 3,6 To/s par GPU.

NVLink Génération
Architecture NVIDIA
Exemple GPU ou Plateforme
Maximum Liens par GPU
Maximum Bande passante bidirectionnelle par GPU
NVLink 1
Pascal
P100
4
160 Go/s
NVLink 2
Volta
V100
6
300 Go/s
NVLink 3
Ampere
A100
12
600 Go/s
NVLink 4
Hopper
H100
18
900 Go/s
NVLink 5
Blackwell
GPU Blackwell
18
1.8 To/s
NVLink 6
Rubin
Plateforme Rubin
36
3.6 To/s

Bande passante par lien vs Bande passante totale NVLink

La bande passante par lien et la bande passante totale par GPU décrivent des valeurs différentes. Un GPU peut contenir plusieurs connexions NVLink, donc la bande passante totale par GPU combine la bande passante disponible de tous les liens pris en charge.

Par exemple, le H100 a 18 connexions NVLink 4. Chaque lien fournit 50 Go/s de bande passante bidirectionnelle, donnant un total maximum de 900 Go/s par GPU. Blackwell utilise 18 connexions NVLink 5 à 100 Go/s de bande passante bidirectionnelle par lien, produisant jusqu'à 1.8 To/s par GPU.

Ces chiffres représentent la bande passante maximale de l'interface. La bande passante réelle entre deux GPU peut être inférieure en fonction du nombre de liens actifs entre eux, de la topologie du système et de la configuration matérielle. Lors de la lecture des spécifications NVLink, vérifiez toujours si la valeur fait référence à un lien, un GPU ou à l'ensemble du tissu NVLink.

NVLink vs PCIe vs NVSwitch

Figure 3. Comparaison NVLink vs PCIe vs NVSwitch

NVLink, PCIe et NVSwitch déplacent tous des données au sein des systèmes GPU, mais ils remplissent des rôles différents. PCIe est une interface à usage général qui connecte les GPU et d'autres dispositifs au système hôte. NVLink fournit une communication haute vitesse entre les processeurs NVIDIA pris en charge, tandis que NVSwitch fonctionne avec NVLink pour connecter des groupes plus larges de GPU via un tissu de commutation partagé.

Caractéristique
NVLink
PCIe
NVSwitch
Ce que c'est
Interconnexion de processeurs haute vitesse
Interface système à usage général
Tissu de commutation utilisé avec NVLink
Principal objectif
Communication rapide entre GPU et processeurs pris en charge
Connecter les GPU, les SSD, les NIC et d'autres dispositifs au système
Connecter de nombreux GPU compatibles NVLink via un tissu
Communication GPU à GPU
Fournit une communication entre pairs à large bande
Prend en charge les transferts GPU à GPU, mais les performances dépendent de la topologie PCIe
Achemine le trafic NVLink entre plusieurs GPU
Chemin des données
Liens de processeur directs ou connexions via NVSwitch
Le trafic passe par des complexes racines PCIe et des commutateurs
Fournit des chemins commutés entre les GPU connectés par NVLink
Latence
Conçu pour une communication processeur à faible latence
Adapté aux E/S générales, mais les chemins GPU à GPU peuvent nécessiter plus d'infrastructure système
Ajoute de la commutation tout en gardant les GPU connectés via des chemins NVLink haute vitesse
Topologie
Liens directs point à point ou liens vers NVSwitch
Complexes racines CPU et commutateurs PCIe
Tissu GPU commuté et hautement connecté
Compatibilité
Nécessite du matériel NVIDIA pris en charge
Large soutien aux standards de l'industrie
Nécessite des plateformes NVIDIA NVLink supportées
Mieux adaptés pour
Systèmes multi-GPU à forte communication
Systèmes à GPU unique ou charges de travail avec peu de trafic GPU à GPU
Grands systèmes où de nombreux GPU nécessitent une communication fréquente
Principale limitation
Limité aux matériels et plateformes NVIDIA compatibles
Peut devenir un goulot d'étranglement dans des charges de travail inter-GPU élevées
Augmente le coût matériel et la complexité du système

En termes simples, PCIe connecte des dispositifs au système, NVLink fournit une communication haute vitesse entre processeurs, et NVSwitch élargit NVLink à travers de plus grandes configurations de GPU. NVSwitch n'est pas un remplacement pour NVLink car il dépend des connexions NVLink pour transporter le trafic GPU.

PCIe peut suffire lorsque la communication GPU à GPU est limitée. NVLink devient plus utile lorsque les GPU échangent fréquemment des données, tandis que NVSwitch est principalement utilisé lorsque de nombreux GPU compatibles NVLink ont besoin d'une communication évolutive au sein du même système.

NVLink combine-t-il la mémoire GPU ?

NVLink ne combine pas automatiquement la VRAM de plusieurs GPU en un seul pool de mémoire physique plus grand. Deux GPU avec 80 Go de mémoire chacun ont toujours des espaces mémoire séparés de 80 Go au lieu de devenir un seul GPU avec 160 Go de VRAM locale.

Lorsque le matériel et la topologie le permettent, l'accès mémoire peer-to-peer de CUDA permet à un GPU d'accéder à la mémoire d'un autre GPU. Un GPU peut lire, écrire ou copier des données dans la mémoire peer sans d'abord déplacer les données à travers la mémoire du CPU. NVLink fournit un chemin à large bande pour ces transferts lorsque les GPU y sont connectés.

Cependant, la mémoire GPU distante reste physiquement attachée à un autre GPU. Le logiciel décide toujours où les données sont stockées, quel GPU y accède et si les données doivent être copiées ou accessibles à distance. La mémoire unifiée CUDA peut simplifier l'accès à la mémoire entre les dispositifs, mais elle ne supprime pas la séparation physique entre la mémoire GPU.

Pour cette raison, le placement de la mémoire reste important dans les systèmes multi-GPU. Un accès fréquent à la mémoire GPU distante peut affecter les performances même lorsque NVLink fournit une connexion plus rapide.

Comment NVLink-C2C étend NVLink aux connexions chip-à-chip

Figure 4. NVLink-C2C Connection Between CPU and GPU

Figure 4. Connexion NVLink-C2C entre le CPU et le GPU

NVLink-C2C étend le NVLink de NVIDIA des connexions de processeurs au niveau de la carte aux liens courts chip-à-chip à l'intérieur d'un package ou d'un superchip. Il peut connecter des CPU, des GPU et d'autres dies de processeur compatibles, leur permettant d'échanger des données via une connexion étroitement intégrée.

Sur les plateformes NVLink-C2C cohérentes prises en charge, les processeurs connectés peuvent également maintenir une vue cohérente de la mémoire. Par exemple, Grace Hopper utilise NVLink-C2C entre le CPU Grace et le GPU Hopper, permettant aux deux processeurs d'accéder à la mémoire à travers la connexion tout en maintenant leur mémoire physique séparée.

La principale différence réside dans l'endroit où chaque technologie est utilisée. Le NVLink standard connecte couramment des GPU séparés ou connecte des GPU à NVSwitch au niveau de la carte ou du système. NVLink-C2C rapproche le même concept d'interconnexion à grande vitesse plus près des processeurs eux-mêmes, le rendant adapté aux connexions CPU-à-GPU, CPU-à-CPU, et autres connexions chip-à-chip étroitement intégrées.

NVLink pour l'IA et les charges de travail multi-GPU

NVLink est le plus utile lorsque plusieurs GPU travaillent sur la même charge de travail et doivent échanger des données souvent. Dans ces systèmes, la performance dépend non seulement de la vitesse de calcul du GPU mais aussi de la rapidité avec laquelle les données se déplacent entre les accélérateurs.

Lors de l'entraînement IA, les GPU peuvent échanger des gradients, des paramètres, des activations et des résultats intermédiaires. NVIDIA NCCL gère nombreux de ces transferts à travers des opérations telles que AllReduce, AllGather, ReduceScatter, Broadcast, et communication point à point.

Le parallélisme tensoriel crée une communication fréquente car des parties du même calcul s'exécutent sur différents GPU et les résultats partiels doivent être échangés avant que le traitement puisse continuer. Le parallélisme de modèle déplace également des données entre les GPU à mesure que différentes parties du modèle sont traitées.

L'inférence LLM multi-GPU a des exigences similaires lorsqu'un grand modèle est divisé entre plusieurs GPU. Si un GPU doit attendre des données d'un autre, des délais de communication peuvent réduire le débit global.

Les charges de travail HPC telles que la simulation scientifique, la dynamique des fluides computationnelle et la modélisation moléculaire échangent également des données de frontières, des résultats partiels et des informations de synchronisation entre les GPU. Des transferts GPU-à-GPU plus rapides peuvent réduire ce temps d'attente et aider la charge de travail à s'exécuter plus efficacement.

Pour les charges de travail fortement communicationnelles, NVLink peut réduire le temps que les GPU passent à échanger des données et aider les systèmes multi-GPU à s'échelonner plus efficacement.

Quand avez-vous besoin de NVLink ?

NVLink est un bon choix lorsque plusieurs GPU travaillent sur la même tâche et échangent souvent des données. Il peut aider lorsque la communication GPU-à-GPU ralentit la charge de travail et que le système prend en charge NVLink.

NVLink est un meilleur choix lorsque :

• Plusieurs GPU travaillent ensemble sur une charge de travail

• De grandes quantités de données se déplacent entre les GPU

• La communication GPU limite les performances

• Les GPU et la plateforme prennent en charge NVLink

• Le logiciel peut utiliser la communication multi-GPU

PCIe peut suffire lorsque :

• Le système n'utilise qu'un seul GPU

• Plusieurs GPU gèrent des tâches distinctes

• Le trafic GPU-à-GPU est faible

• PCIe répond déjà aux performances requises

• Un coût plus bas et un support matériel plus large sont plus importants

Le coût et la conception du système comptent également. Les systèmes compatibles NVLink peuvent nécessiter des GPU pris en charge, la bonne topologie de système, des commutateurs supplémentaires et plus de puissance et de refroidissement dans des configurations plus grandes.

En général, NVLink est le plus utile lorsque la communication entre les GPU est une limite de performance claire. Si les GPU échangent rarement des données ou si PCIe fournit déjà suffisamment de bande passante, NVLink peut ajouter du coût et de la complexité sans un gain de performance clair.

À PROPOS DE NOUS Satisfaction client à chaque fois. Confiance mutuelle et intérêts communs. ARIAT TECH a établi des relations de coopération stables et à long terme avec de nombreux fabricants et agents." Traiter les clients avec des matériaux authentiques et faire du service le cœur", toute la qualité sera vérifiée sans problème et passera des tests professionnels.
Les produits au meilleur rapport qualité-prix et le meilleur service sont notre engagement éternel.

Questions fréquemment posées [FAQ]

1. NVLink peut-il améliorer les performances si les GPU ne partagent pas souvent des données ?

En général, pas beaucoup. NVLink fournit le plus de valeur lorsque les GPU échangent des données fréquemment. Si chaque GPU gère principalement un travail séparé, l'interconnexion peut ne pas être la principale limite de performance.

2. Pourquoi la topologie NVLink affecte-t-elle les performances GPU à GPU ?

La topologie détermine comment les GPU sont connectés et combien de chemins NVLink sont disponibles entre eux. Les GPU ayant des liens plus directs peuvent échanger des données plus rapidement, tandis que le trafic qui passe par moins de liens ou des commutations supplémentaires peut avoir une bande passante et une latence

différentes. 3. Une bande passante NVLink plus élevée signifie-t-elle toujours des performances d'application plus rapides ?

Non. Une bande passante plus élevée n'aide que lorsque le transfert de données entre les GPU limite la charge de travail. Si la vitesse de calcul, la mémoire GPU, le stockage ou l'efficacité logicielle est le principal goulet d'étranglement, une bande passante NVLink supplémentaire peut avoir peu d'effet.

4. CUDA peut-elle utiliser NVLink automatiquement entre les GPU pris en charge ?

CUDA peut utiliser l'accès pair à pair lorsque les GPU, la topologie, les pilotes, et la configuration logicielle le permettent. Cependant, l'application ou la bibliothèque de communication détermine toujours comment les données sont déplacées, donc avoir du matériel NVLink à lui seul ne garantit pas que chaque transfert l'utilisera.

5. Quelle est la différence entre la mémoire GPU locale et distante via NVLink ?

La mémoire locale est physiquement attachée au GPU qui l'utilise, tandis que la mémoire distante est attachée à un autre GPU. NVLink peut fournir un chemin plus rapide vers la mémoire distante, mais l'accès distant diffère toujours de l'accès à la VRAM locale, donc le placement de la mémoire peut affecter les performances.

E-mail : Info@ariat-tech.comTÉL HK : +852 30501966ADR : Rm 2703 27F Ho King Comm Center 2-16,
Fa Yuen St MongKok Kowloon, Hong Kong.