
NVLink est la technologie d'interconnexion à haute vitesse de NVIDIA pour le transfert de données entre les GPU et d'autres processeurs dans des systèmes de calcul accéléré. Son objectif principal est de réduire les goulets d'étranglement de communication lorsque plusieurs processeurs doivent échanger de grandes quantités de données tout en travaillant ensemble.
Dans les systèmes multiprocesseurs, la performance peut être limitée par la rapidité avec laquelle les données se déplacent entre les appareils. NVLink fournit un chemin de communication à large bande passante et à faible latence qui réduit les retards de transfert et aide les processeurs connectés à échanger des données plus efficacement.

Figure 2. Chemin de communication GPU à GPU NVLink
NVLink crée un chemin de communication à haute vitesse entre les GPU compatibles et d'autres processeurs. Lorsque deux GPU doivent échanger des données, l'accès pair à pair peut permettre aux données de se déplacer directement entre leurs espaces mémoire au lieu d'envoyer chaque transfert à travers la mémoire CPU.
NVLink prend en charge la communication bidirectionnelle, de sorte que les données peuvent se déplacer dans les deux directions entre les processeurs connectés. Plusieurs connexions NVLink peuvent également fonctionner ensemble, fournissant un chemin plus large pour les transferts de données entre processeurs.
NVLink fournit le chemin physique pour cette communication, tandis que le logiciel décide comment et quand le chemin est utilisé. CUDA, les pilotes de périphérique, NCCL et l'application gèrent les transferts. Lorsque l'accès pair est pris en charge et activé, un GPU peut lire, écrire ou copier des données dans la mémoire d'un autre GPU via la connexion NVLink disponible.
La bande passante NVLink a augmenté avec chaque architecture GPU majeure de NVIDIA. Le NVLink de première génération est apparu avec le Tesla P100 basé sur Pascal, qui prenait en charge quatre connexions NVLink et jusqu'à 160 Go/s de bande passante bidirectionnelle totale par GPU. Le Volta V100 a porté cela à six liens et 300 Go/s par GPU.
Le NVLink de troisième génération est arrivé avec l'Ampere A100. L'A100 prend en charge 12 connexions NVLink et jusqu'à 600 Go/s de bande passante bidirectionnelle totale par GPU. Le Hopper H100 a augmenté le nombre de liens à 18, portant la bande passante NVLink de quatrième génération à 900 Go/s par GPU.
Le NVLink de cinquième génération est arrivé avec Blackwell, augmentant la bande passante bidirectionnelle totale à 1,8 To/s par GPU. Le NVLink de sixième génération, associé à la plateforme Rubin, augmente le maximum à 36 liens et jusqu'à 3,6 To/s par GPU.
| NVLink Génération |
Architecture NVIDIA |
Exemple GPU ou Plateforme |
Maximum Liens par GPU |
Maximum Bande passante bidirectionnelle par GPU |
| NVLink 1 |
Pascal |
P100 |
4 |
160 Go/s |
| NVLink 2 |
Volta |
V100 |
6 |
300 Go/s |
| NVLink 3 |
Ampere |
A100 |
12 |
600 Go/s |
| NVLink 4 |
Hopper |
H100 |
18 |
900 Go/s |
| NVLink 5 |
Blackwell |
GPU Blackwell |
18 |
1.8 To/s |
| NVLink 6 |
Rubin |
Plateforme Rubin |
36 |
3.6 To/s |
La bande passante par lien et la bande passante totale par GPU décrivent des valeurs différentes. Un GPU peut contenir plusieurs connexions NVLink, donc la bande passante totale par GPU combine la bande passante disponible de tous les liens pris en charge.
Par exemple, le H100 a 18 connexions NVLink 4. Chaque lien fournit 50 Go/s de bande passante bidirectionnelle, donnant un total maximum de 900 Go/s par GPU. Blackwell utilise 18 connexions NVLink 5 à 100 Go/s de bande passante bidirectionnelle par lien, produisant jusqu'à 1.8 To/s par GPU.
Ces chiffres représentent la bande passante maximale de l'interface. La bande passante réelle entre deux GPU peut être inférieure en fonction du nombre de liens actifs entre eux, de la topologie du système et de la configuration matérielle. Lors de la lecture des spécifications NVLink, vérifiez toujours si la valeur fait référence à un lien, un GPU ou à l'ensemble du tissu NVLink.

Figure 3. Comparaison NVLink vs PCIe vs NVSwitch
NVLink, PCIe et NVSwitch déplacent tous des données au sein des systèmes GPU, mais ils remplissent des rôles différents. PCIe est une interface à usage général qui connecte les GPU et d'autres dispositifs au système hôte. NVLink fournit une communication haute vitesse entre les processeurs NVIDIA pris en charge, tandis que NVSwitch fonctionne avec NVLink pour connecter des groupes plus larges de GPU via un tissu de commutation partagé.
| Caractéristique |
NVLink |
PCIe |
NVSwitch |
| Ce que c'est |
Interconnexion de processeurs haute vitesse |
Interface système à usage général |
Tissu de commutation utilisé avec NVLink |
| Principal objectif |
Communication rapide entre GPU et processeurs pris en charge |
Connecter les GPU, les SSD, les NIC et d'autres dispositifs au système |
Connecter de nombreux GPU compatibles NVLink via un tissu |
| Communication GPU à GPU |
Fournit une communication entre pairs à large bande |
Prend en charge les transferts GPU à GPU, mais les performances dépendent de la topologie PCIe |
Achemine le trafic NVLink entre plusieurs GPU |
| Chemin des données |
Liens de processeur directs ou connexions via NVSwitch |
Le trafic passe par des complexes racines PCIe et des commutateurs |
Fournit des chemins commutés entre les GPU connectés par NVLink |
| Latence |
Conçu pour une communication processeur à faible latence |
Adapté aux E/S générales, mais les chemins GPU à GPU peuvent nécessiter plus d'infrastructure système |
Ajoute de la commutation tout en gardant les GPU connectés via des chemins NVLink haute vitesse |
| Topologie |
Liens directs point à point ou liens vers NVSwitch |
Complexes racines CPU et commutateurs PCIe |
Tissu GPU commuté et hautement connecté |
| Compatibilité |
Nécessite du matériel NVIDIA pris en charge |
Large soutien aux standards de l'industrie |
Nécessite des plateformes NVIDIA NVLink supportées |
| Mieux adaptés pour |
Systèmes multi-GPU à forte communication |
Systèmes à GPU unique ou charges de travail avec peu de trafic GPU à GPU |
Grands systèmes où de nombreux GPU nécessitent une communication fréquente |
| Principale limitation |
Limité aux matériels et plateformes NVIDIA compatibles |
Peut devenir un goulot d'étranglement dans des charges de travail inter-GPU élevées |
Augmente le coût matériel et la complexité du système |
En termes simples, PCIe connecte des dispositifs au système, NVLink fournit une communication haute vitesse entre processeurs, et NVSwitch élargit NVLink à travers de plus grandes configurations de GPU. NVSwitch n'est pas un remplacement pour NVLink car il dépend des connexions NVLink pour transporter le trafic GPU.
PCIe peut suffire lorsque la communication GPU à GPU est limitée. NVLink devient plus utile lorsque les GPU échangent fréquemment des données, tandis que NVSwitch est principalement utilisé lorsque de nombreux GPU compatibles NVLink ont besoin d'une communication évolutive au sein du même système.
NVLink ne combine pas automatiquement la VRAM de plusieurs GPU en un seul pool de mémoire physique plus grand. Deux GPU avec 80 Go de mémoire chacun ont toujours des espaces mémoire séparés de 80 Go au lieu de devenir un seul GPU avec 160 Go de VRAM locale.
Lorsque le matériel et la topologie le permettent, l'accès mémoire peer-to-peer de CUDA permet à un GPU d'accéder à la mémoire d'un autre GPU. Un GPU peut lire, écrire ou copier des données dans la mémoire peer sans d'abord déplacer les données à travers la mémoire du CPU. NVLink fournit un chemin à large bande pour ces transferts lorsque les GPU y sont connectés.
Cependant, la mémoire GPU distante reste physiquement attachée à un autre GPU. Le logiciel décide toujours où les données sont stockées, quel GPU y accède et si les données doivent être copiées ou accessibles à distance. La mémoire unifiée CUDA peut simplifier l'accès à la mémoire entre les dispositifs, mais elle ne supprime pas la séparation physique entre la mémoire GPU.
Pour cette raison, le placement de la mémoire reste important dans les systèmes multi-GPU. Un accès fréquent à la mémoire GPU distante peut affecter les performances même lorsque NVLink fournit une connexion plus rapide.

Figure 4. Connexion NVLink-C2C entre le CPU et le GPU
NVLink-C2C étend le NVLink de NVIDIA des connexions de processeurs au niveau de la carte aux liens courts chip-à-chip à l'intérieur d'un package ou d'un superchip. Il peut connecter des CPU, des GPU et d'autres dies de processeur compatibles, leur permettant d'échanger des données via une connexion étroitement intégrée.
Sur les plateformes NVLink-C2C cohérentes prises en charge, les processeurs connectés peuvent également maintenir une vue cohérente de la mémoire. Par exemple, Grace Hopper utilise NVLink-C2C entre le CPU Grace et le GPU Hopper, permettant aux deux processeurs d'accéder à la mémoire à travers la connexion tout en maintenant leur mémoire physique séparée.
La principale différence réside dans l'endroit où chaque technologie est utilisée. Le NVLink standard connecte couramment des GPU séparés ou connecte des GPU à NVSwitch au niveau de la carte ou du système. NVLink-C2C rapproche le même concept d'interconnexion à grande vitesse plus près des processeurs eux-mêmes, le rendant adapté aux connexions CPU-à-GPU, CPU-à-CPU, et autres connexions chip-à-chip étroitement intégrées.
NVLink est le plus utile lorsque plusieurs GPU travaillent sur la même charge de travail et doivent échanger des données souvent. Dans ces systèmes, la performance dépend non seulement de la vitesse de calcul du GPU mais aussi de la rapidité avec laquelle les données se déplacent entre les accélérateurs.
Lors de l'entraînement IA, les GPU peuvent échanger des gradients, des paramètres, des activations et des résultats intermédiaires. NVIDIA NCCL gère nombreux de ces transferts à travers des opérations telles que AllReduce, AllGather, ReduceScatter, Broadcast, et communication point à point.
Le parallélisme tensoriel crée une communication fréquente car des parties du même calcul s'exécutent sur différents GPU et les résultats partiels doivent être échangés avant que le traitement puisse continuer. Le parallélisme de modèle déplace également des données entre les GPU à mesure que différentes parties du modèle sont traitées.
L'inférence LLM multi-GPU a des exigences similaires lorsqu'un grand modèle est divisé entre plusieurs GPU. Si un GPU doit attendre des données d'un autre, des délais de communication peuvent réduire le débit global.
Les charges de travail HPC telles que la simulation scientifique, la dynamique des fluides computationnelle et la modélisation moléculaire échangent également des données de frontières, des résultats partiels et des informations de synchronisation entre les GPU. Des transferts GPU-à-GPU plus rapides peuvent réduire ce temps d'attente et aider la charge de travail à s'exécuter plus efficacement.
Pour les charges de travail fortement communicationnelles, NVLink peut réduire le temps que les GPU passent à échanger des données et aider les systèmes multi-GPU à s'échelonner plus efficacement.
NVLink est un bon choix lorsque plusieurs GPU travaillent sur la même tâche et échangent souvent des données. Il peut aider lorsque la communication GPU-à-GPU ralentit la charge de travail et que le système prend en charge NVLink.
• Plusieurs GPU travaillent ensemble sur une charge de travail
• De grandes quantités de données se déplacent entre les GPU
• La communication GPU limite les performances
• Les GPU et la plateforme prennent en charge NVLink
• Le logiciel peut utiliser la communication multi-GPU
• Le système n'utilise qu'un seul GPU
• Plusieurs GPU gèrent des tâches distinctes
• Le trafic GPU-à-GPU est faible
• PCIe répond déjà aux performances requises
• Un coût plus bas et un support matériel plus large sont plus importants
Le coût et la conception du système comptent également. Les systèmes compatibles NVLink peuvent nécessiter des GPU pris en charge, la bonne topologie de système, des commutateurs supplémentaires et plus de puissance et de refroidissement dans des configurations plus grandes.
En général, NVLink est le plus utile lorsque la communication entre les GPU est une limite de performance claire. Si les GPU échangent rarement des données ou si PCIe fournit déjà suffisamment de bande passante, NVLink peut ajouter du coût et de la complexité sans un gain de performance clair.
À PROPOS DE NOUS
Satisfaction client à chaque fois. Confiance mutuelle et intérêts communs.
Guide SerDes (Sérialiseur/Désérialiseur) : Comment ça fonctionne, conception, applications et tests
2026-07-31
Filtre ferrite vs perles ferrite : comment choisir le bon composant
2026-07-30
En général, pas beaucoup. NVLink fournit le plus de valeur lorsque les GPU échangent des données fréquemment. Si chaque GPU gère principalement un travail séparé, l'interconnexion peut ne pas être la principale limite de performance.
La topologie détermine comment les GPU sont connectés et combien de chemins NVLink sont disponibles entre eux. Les GPU ayant des liens plus directs peuvent échanger des données plus rapidement, tandis que le trafic qui passe par moins de liens ou des commutations supplémentaires peut avoir une bande passante et une latence
Non. Une bande passante plus élevée n'aide que lorsque le transfert de données entre les GPU limite la charge de travail. Si la vitesse de calcul, la mémoire GPU, le stockage ou l'efficacité logicielle est le principal goulet d'étranglement, une bande passante NVLink supplémentaire peut avoir peu d'effet.
CUDA peut utiliser l'accès pair à pair lorsque les GPU, la topologie, les pilotes, et la configuration logicielle le permettent. Cependant, l'application ou la bibliothèque de communication détermine toujours comment les données sont déplacées, donc avoir du matériel NVLink à lui seul ne garantit pas que chaque transfert l'utilisera.
La mémoire locale est physiquement attachée au GPU qui l'utilise, tandis que la mémoire distante est attachée à un autre GPU. NVLink peut fournir un chemin plus rapide vers la mémoire distante, mais l'accès distant diffère toujours de l'accès à la VRAM locale, donc le placement de la mémoire peut affecter les performances.
E-mail : Info@ariat-tech.comTÉL HK : +852 30501966ADR : Rm 2703 27F Ho King Comm Center 2-16,
Fa Yuen St MongKok Kowloon, Hong Kong.