Processeurs modulaires à chiplets : pourquoi les futurs CPU et accélérateurs d’IA abandonnent la puce monolithique

Conception de processeur multi-die

Pendant des décennies, les progrès des processeurs ont été étroitement associés à la possibilité d’intégrer toujours plus de transistors sur une seule pièce de silicium de plus en plus complexe. Cette approche a permis de créer des CPU, des GPU et des circuits spécialisés toujours plus rapides, mais elle devient de plus en plus difficile à maintenir à mesure que les puces grandissent, que les procédés de fabrication deviennent plus coûteux et que les charges de travail modernes exigent des ressources de calcul très différentes. En 2026, certains des processeurs haute performance les plus importants ne reposent déjà plus sur un seul grand die. Les fabricants divisent désormais les conceptions complexes en composants plus petits appelés chiplets et les relient dans un même boîtier afin qu’ils fonctionnent comme un processeur coordonné. AMD a déjà fait de cette approche un élément central de ses CPU pour serveurs et de ses accélérateurs d’IA, tandis que NVIDIA a adopté une conception multi-die pour ses plus grands GPU Blackwell. Les chiplets ne constituent donc plus une réponse expérimentale à un problème de fabrication. Ils deviennent l’un des principaux moyens permettant aux concepteurs de processeurs d’augmenter les performances, la capacité mémoire et les fonctionnalités sans simplement agrandir une seule pièce de silicium.

Pourquoi les puces monolithiques atteignent leurs limites pratiques

Un processeur monolithique regroupe ses cœurs CPU, sa mémoire cache, ses contrôleurs mémoire, ses interfaces et d’autres fonctions importantes sur un seul die continu en silicium. Cette conception présente des avantages évidents. La communication entre les différentes parties du processeur peut être rapide, l’organisation physique reste relativement directe et les ingénieurs n’ont pas besoin de mettre en place des liaisons extrêmement sophistiquées entre plusieurs dies. Pendant de nombreuses années, les progrès de la fabrication des semi-conducteurs ont permis aux entreprises d’agrandir et d’améliorer ces puces tout en augmentant le nombre de transistors dans des dimensions encore maîtrisables. Le problème est qu’un processeur haut de gamme moderne peut désormais avoir besoin d’énormes ressources de calcul, de cache et de connectivité. Continuer à ajouter tous ces éléments sur le même die finit par créer des difficultés liées à la taille physique, au coût de fabrication, à l’alimentation électrique et à la dissipation thermique. Il existe également une limite pratique à la taille d’un die unique pouvant être fabriqué avec les équipements de lithographie utilisés dans la production des semi-conducteurs. L’industrie ne peut donc pas simplement continuer à produire indéfiniment des pièces de silicium toujours plus grandes.

Le rendement de fabrication constitue une autre raison importante de diviser les processeurs en dies plus petits. Les wafers de semi-conducteurs ne sont jamais totalement exempts de défauts microscopiques. Lorsqu’un die est très grand, un défaut touchant une petite zone peut rendre inutilisable une quantité beaucoup plus importante de silicium coûteux. Des dies plus petits donnent davantage de flexibilité aux fabricants, car chaque élément peut être testé avant d’être intégré au processeur final. Les dies fonctionnels peuvent être sélectionnés et assemblés, tandis que les éléments défectueux sont écartés sans nécessairement perdre l’intégralité d’un grand processeur. Cet avantage économique devient particulièrement important avec les procédés de fabrication de pointe, pour lesquels la production des wafers et le développement des puces sont extrêmement coûteux. Les chiplets n’éliminent pas les défauts de fabrication et leur assemblage final ajoute des étapes supplémentaires, mais ils permettent d’éviter de placer chaque fonction sur le procédé de gravure le plus récent et le plus coûteux uniquement parce que les cœurs CPU ou GPU en ont besoin.

Cette capacité à séparer les différentes fonctions est aussi importante que l’amélioration potentielle du rendement. Les cœurs CPU bénéficient fortement des nouveaux procédés de fabrication, car des transistors plus petits et plus efficaces peuvent améliorer les performances et la consommation énergétique. En revanche, de nombreux circuits d’entrée-sortie tirent beaucoup moins d’avantages du passage au procédé le plus récent. Une conception à chiplets peut donc placer les cœurs haute performance sur un silicium de pointe tout en conservant les contrôleurs mémoire et les interfaces externes sur un autre die fabriqué avec un procédé différent. AMD applique largement ce principe dans sa famille EPYC. Les processeurs EPYC 9005 de cinquième génération combinent des ressources de calcul Zen 5 ou Zen 5c dans une conception multi-puces, avec des modèles pouvant atteindre 192 cœurs CPU. La génération suivante pousse cette logique encore plus loin : en mai 2026, AMD a annoncé le lancement progressif de la production de son processeur EPYC de sixième génération, connu sous le nom de code Venice, utilisant le procédé 2 nm de TSMC. Une conception modulaire permet à chaque génération d’évoluer sans obliger les ingénieurs à reconstruire de la même manière l’ensemble des composants du processeur.

Un chiplet est bien plus qu’un simple morceau de silicium plus petit

La définition la plus simple d’un chiplet est celle d’un die relativement petit conçu pour assurer une partie du travail qui aurait autrefois été regroupé sur une seule grande puce. Cette définition est utile, mais elle ne suffit pas à expliquer pourquoi les processeurs modernes à chiplets sont devenus viables. Les différents dies doivent communiquer suffisamment vite pour que le produit final puisse fonctionner presque comme un processeur intégré unique. Un CPU peut contenir plusieurs dies de calcul accompagnés d’un die d’entrée-sortie distinct, tandis qu’un accélérateur d’IA peut réunir plusieurs dies de calcul, de la mémoire cache, des connexions vers une mémoire à très haut débit et des circuits spécialisés pour la communication. L’essentiel n’est donc pas seulement que le processeur soit divisé en plusieurs éléments, mais que ces éléments aient été conçus dès le départ pour fonctionner ensemble. Le boîtier devient ainsi une partie intégrante de l’architecture du processeur plutôt qu’une simple enveloppe protectrice autour d’une puce terminée.

Les techniques modernes de mise en boîtier fournissent les connexions électriques très denses nécessaires à cette organisation. Les dies peuvent être placés côte à côte sur un interposeur ou reliés par de petits ponts de silicium, tandis que certaines conceptions empilent directement un die au-dessus d’un autre. Ces méthodes sont généralement décrites comme de l’intégration 2,5D ou 3D. Il n’est toutefois pas nécessaire de maîtriser toute cette terminologie pour comprendre le principe : les différents éléments sont placés extrêmement près les uns des autres et reliés par un nombre de connexions bien supérieur à ce qu’il serait normalement possible d’obtenir entre des puces distinctes installées sur une carte électronique. La technologie SoIC de TSMC, par exemple, est conçue pour empiler différents dies au moyen de connexions die-to-die très denses, tandis qu’Intel utilise des technologies telles que Foveros et EMIB pour réunir des dies spécialisés. Ces techniques réduisent la distance physique parcourue par les données et permettent de créer des processeurs logiquement plus grands à partir de plusieurs pièces de silicium.

C’est également pour cette raison qu’un processeur moderne à chiplets ne doit pas être confondu avec les anciens ordinateurs qui utilisaient simplement plusieurs puces indépendantes. Dans un CPU ou un accélérateur multi-die correctement conçu, le matériel et les logiciels peuvent souvent considérer l’ensemble assemblé comme une seule ressource de calcul cohérente. Les données du cache, les requêtes mémoire et les instructions peuvent circuler entre les dies grâce à des connexions dédiées à très haut débit, tandis que le système d’exploitation ou l’application n’a pas nécessairement besoin de gérer chaque chiplet comme un processeur séparé. Obtenir ce comportement reste difficile. Les ingénieurs doivent maîtriser la latence, maintenir la cohérence entre les caches et empêcher les communications entre dies de devenir un goulot d’étranglement. Un die monolithique conserve un avantage naturel lorsque deux circuits voisins doivent échanger des informations sur une distance extrêmement courte. L’ingénierie des chiplets consiste donc largement à faire en sorte que la flexibilité offerte par plusieurs dies compense les avantages de communication obtenus lorsque tout reste sur une seule pièce de silicium.

Pourquoi les accélérateurs d’IA rendent cette évolution encore plus difficile à éviter

L’intelligence artificielle a renforcé l’intérêt des processeurs multi-die, car les grands modèles d’IA exigent simultanément plusieurs types de ressources. Ils ont besoin d’immenses capacités de calcul parallèle, mais la puissance arithmétique brute ne suffit pas. L’accélérateur doit également fournir rapidement des données à ses unités de calcul, offrir une grande quantité de mémoire très rapide et communiquer efficacement avec d’autres accélérateurs lorsqu’un modèle est réparti entre plusieurs appareils. Un seul die finit par devenir trop contraignant pour regrouper toutes ces exigences. Diviser la conception donne davantage de liberté aux ingénieurs pour augmenter les ressources de calcul tout en plaçant les interfaces mémoire, le cache et les circuits de communication là où ils sont les plus efficaces. Cette organisation est particulièrement importante pour la mémoire à large bande passante, ou HBM, placée près du processeur et capable d’offrir des débits de transfert nettement supérieurs à ceux de la mémoire système classique. Les techniques avancées de mise en boîtier permettent de réunir plusieurs dies de calcul et plusieurs piles de HBM dans un ensemble très étroitement connecté.

La famille Instinct d’AMD montre jusqu’où cette approche avait progressé en 2026. Les accélérateurs MI300 précédents combinaient déjà plusieurs Accelerator Complex Dies avec des dies d’entrée-sortie distincts et plusieurs piles de HBM. Le plus récent Instinct MI455X, présenté en juillet 2026 dans le cadre de la série MI400, pousse encore plus loin la conception modulaire. AMD indique l’utilisation de huit chiplets de calcul CDNA 5, de deux dies d’entrée-sortie et de deux dies dédiés au fabric et au cache. Ces composants sont associés à douze piles de HBM4 offrant 432 Go de mémoire et jusqu’à 23,3 To/s de bande passante mémoire théorique. Ces valeurs sont importantes, car les grands systèmes d’IA rencontrent de plus en plus un problème de mémoire autant qu’un problème de puissance de calcul. Les modèles, les données temporaires et les informations conservées pendant de longues interactions avec l’IA consomment de la capacité mémoire et de la bande passante. La séparation des fonctions du processeur permet à AMD d’augmenter ces ressources d’une manière qui serait extrêmement difficile à reproduire sur un seul immense die conventionnel.

La famille Blackwell de NVIDIA montre que cette architecture ne se limite pas à un seul fabricant. Blackwell Ultra repose sur deux très grands dies reliés par la High-Bandwidth Interface de NVIDIA, qui fournit une bande passante die-to-die de 10 To/s. NVIDIA décrit cette paire comme un seul GPU cohérent du point de vue des logiciels CUDA. Blackwell Ultra peut ainsi répartir ses ressources de calcul entre les deux dies tout en conservant pour les développeurs un modèle de programmation familier. Selon la configuration du produit, il peut également prendre en charge jusqu’à 288 Go de mémoire HBM3E avec une bande passante atteignant 8 To/s. Le point essentiel n’est pas de déterminer quel fabricant affiche la valeur la plus élevée dans une caractéristique donnée. Les deux approches illustrent la même évolution structurelle : lorsqu’un accélérateur devient trop grand et trop exigeant pour tenir sur une seule pièce de silicium réaliste, les connexions à très haut débit et les techniques avancées de mise en boîtier permettent à plusieurs dies importants de fonctionner comme un seul appareil.

La mise en boîtier compte désormais presque autant que la conception des transistors

Pendant une grande partie de l’histoire des semi-conducteurs, la mise en boîtier attirait moins l’attention du public que la finesse de gravure ou l’architecture des processeurs. Un boîtier était souvent évoqué principalement en fonction du socket dans lequel un CPU devait être installé. Les chiplets modifient cette relation. Les connexions électriques entre les dies peuvent déterminer la vitesse de circulation des données, la quantité d’énergie consommée pendant les communications et l’efficacité avec laquelle les différentes parties du processeur partagent la mémoire. L’organisation physique influence également le refroidissement, car plusieurs dies puissants et des piles de mémoire peuvent être concentrés dans une zone relativement réduite. Les ingénieurs doivent donc concevoir le silicium et le boîtier simultanément. Un die de calcul plus rapide apporte peu d’avantages si sa connexion à la mémoire ne fournit pas suffisamment de données, tandis que l’ajout de nouveaux chiplets devient peu utile si les liaisons entre eux sont saturées dès que les charges de travail sont réparties dans le processeur.

Le déplacement des données constitue l’un des principaux défis, car le transfert d’informations consomme à la fois du temps et de l’énergie. Une communication à l’intérieur d’un seul die est généralement moins coûteuse que le déplacement des mêmes informations sur une liaison électrique plus longue. Une conception à chiplets réussie nécessite donc des connexions courtes, larges et efficaces entre ses différents composants. Les concepteurs doivent également déterminer quelles informations doivent rester proches de chaque die de calcul et quelles ressources peuvent être partagées à l’échelle du processeur entier. L’emplacement du cache est particulièrement important, car les données fréquemment utilisées ne devraient pas circuler inutilement entre les chiplets. Les accélérateurs d’IA rendent ce problème encore plus complexe en ajoutant plusieurs piles de HBM et, de plus en plus, des liaisons très rapides vers les accélérateurs voisins. La conception finale doit donc équilibrer puissance de calcul, mémoire locale, mémoire partagée et trafic entre dies plutôt que de se concentrer uniquement sur la vitesse des unités arithmétiques.

Les techniques avancées de mise en boîtier introduisent également leurs propres difficultés de fabrication. Un processeur composé de plusieurs dies préalablement testés peut éviter certains risques associés à un unique die gigantesque, mais le produit final dépend désormais de la précision du positionnement, du collage, des connexions électriques et du comportement thermique d’un assemblage plus complexe. Les tests deviennent plus importants, car les fabricants doivent identifier les dies fonctionnels avant d’investir dans un boîtier coûteux réunissant plusieurs composants. Réparer un processeur une fois assemblé n’est généralement pas réaliste. Une défaillance au cours des dernières étapes de fabrication peut donc toujours entraîner la perte de silicium et de mémoire de grande valeur. Ces coûts expliquent pourquoi les chiplets ne constituent pas automatiquement la solution la moins chère pour tous les appareils. Leur intérêt devient particulièrement important lorsque le processeur est suffisamment grand, coûteux ou spécialisé pour que la possibilité de combiner plusieurs dies optimisés apporte davantage d’avantages que la complexité supplémentaire liée à leur assemblage.

Conception de processeur multi-die

Ce que les processeurs à chiplets vont changer pour les ordinateurs et les centres de données

L’importance à long terme des chiplets vient du fait que la conception des processeurs peut devenir plus modulaire. Un fabricant peut créer plusieurs types de dies de calcul et les associer à différentes quantités de cache, de connectivité mémoire ou d’entrées-sorties afin de produire des processeurs adaptés à des tâches différentes. Les processeurs pour serveurs illustrent déjà cette approche avec des gammes proposant des nombres de cœurs très différents, tandis que les accélérateurs d’IA réunissent de plus en plus de dies spécialisés dans le calcul, le cache et les communications. Les futures conceptions pourront aller plus loin en combinant dans un même boîtier des cœurs CPU, des ressources GPU, des unités de traitement neuronal et des accélérateurs spécialisés lorsqu’une telle association est pertinente. Cela ne signifie pas que les composants peuvent être mélangés aussi simplement que des blocs de construction. Chaque conception nécessite toujours un travail précis dans les domaines électrique, thermique et logiciel. En revanche, cela signifie que la création d’un nouveau processeur n’a plus nécessairement besoin de partir du principe que chaque transistor important doit appartenir à un seul immense die.

Une autre évolution importante est que les différentes parties d’un processeur peuvent progresser à des rythmes différents. Le procédé de fabrication le plus récent peut être réservé aux composants qui profitent le plus de transistors plus petits, tandis que les fonctions qui se prêtent moins bien à cette réduction peuvent rester sur un autre procédé. Ce choix peut réduire la pression sur les capacités limitées de fabrication de pointe et éviter aux concepteurs de payer le coût maximal de production pour des circuits qui tirent peu d’avantages d’une gravure plus fine. Il permet aussi de réutiliser des composants déjà éprouvés. Un die d’entrée-sortie, un die de cache ou une architecture de communication peut rester utile pendant plusieurs générations de processeurs, même lorsque les chiplets de calcul évoluent fortement. Cette approche ne supprime pas le coût considérable du développement des processeurs modernes, mais elle offre aux fabricants davantage de possibilités pour répartir cet investissement entre plusieurs produits et plusieurs générations.

Les utilisateurs remarqueront probablement moins cette transformation architecturale que l’industrie des semi-conducteurs elle-même. Un propriétaire d’ordinateur de bureau choisira rarement son processeur simplement parce qu’un contrôleur de cache interne se trouve sur un die distinct. De même, une organisation qui achète des serveurs destinés à l’IA s’intéressera davantage aux performances, à la mémoire, à la consommation énergétique, à la fiabilité et à la prise en charge logicielle qu’au nombre exact de pièces de silicium présentes dans chaque accélérateur. Les chiplets sont importants parce qu’ils modifient ce que les fabricants peuvent construire dans des limites acceptables de coût et de consommation. Des nombres de cœurs plus élevés, des caches plus volumineux et une bande passante mémoire beaucoup plus importante deviennent plus accessibles lorsque les concepteurs ne sont plus limités par la taille d’un seul die. Dans le même temps, la qualité des interconnexions et de la mise en boîtier devient une composante des performances réelles. Les comparaisons futures dépendront donc de plus en plus de l’efficacité de l’ensemble multi-die, et non seulement des caractéristiques d’un seul die de calcul.

L’avenir est modulaire, mais les puces monolithiques ne vont pas disparaître

L’évolution vers les chiplets ne doit pas être interprétée comme la disparition immédiate des processeurs monolithiques. Les puces de petite et moyenne taille peuvent rester moins coûteuses, plus simples et plus efficaces sur le plan énergétique lorsque toutes les fonctions nécessaires tiennent facilement sur un seul die. De nombreux processeurs embarqués, contrôleurs et appareils grand public n’ont pas besoin des nombres de cœurs considérables ou de la bande passante mémoire caractéristique d’un CPU de centre de données ou d’un accélérateur d’IA. Diviser une telle conception pourrait ajouter des coûts d’assemblage et de communication sans apporter de bénéfice réel. Même dans le calcul haute performance, les ingénieurs peuvent choisir de conserver certaines fonctions ensemble lorsqu’une latence extrêmement faible est plus importante que la modularité. Le choix entre un seul die et plusieurs dies reste donc une décision d’ingénierie plutôt qu’une règle imposant que tous les futurs semi-conducteurs adoptent la même architecture.

L’intérêt des chiplets est le plus évident dans le haut de gamme informatique, où le nombre de transistors, les besoins en mémoire et les coûts de fabrication augmentent le plus rapidement. En 2026, cette transition est déjà visible dans du matériel commercial et ne se limite plus à des projets de recherche. Les processeurs pour serveurs EPYC d’AMD utilisent une construction multi-puces pour atteindre des nombres de cœurs CPU très élevés. Les accélérateurs AMD Instinct répartissent le calcul, les entrées-sorties, le cache et les fonctions liées à la mémoire entre plusieurs dies spécialisés. Les plus grands produits Blackwell de NVIDIA associent deux principaux dies GPU et les font fonctionner de manière cohérente. Intel continue de développer des techniques de mise en boîtier spécialement destinées à relier plusieurs dies et à dépasser les limites pratiques de taille d’une seule puce. Ces entreprises n’utilisent pas des conceptions identiques, mais leur orientation montre que les technologies avancées d’assemblage et les communications die-to-die sont devenues des outils fondamentaux pour faire évoluer les processeurs modernes.

Le résultat est une évolution de ce que le mot processeur représente de plus en plus. Autrefois, il désignait naturellement une seule pièce principale de silicium. Dans les systèmes les plus performants, il devient progressivement un ensemble étroitement intégré de composants en silicium conçus pour fonctionner comme un seul appareil de calcul. Cette organisation donne davantage de liberté aux ingénieurs pour choisir le procédé de fabrication adapté à chaque fonction, augmenter la puissance de calcul au-delà de la limite physique d’un seul die, placer de grandes quantités de mémoire à très haut débit près des unités de calcul et réutiliser des composants éprouvés dans plusieurs produits. En contrepartie, la conception des interconnexions, la mise en boîtier, les tests, le comportement logiciel et le refroidissement deviennent tous plus importants. Les puces monolithiques continueront d’exister partout où elles restent adaptées, mais les plus grands CPU et accélérateurs d’IA indiquent déjà la direction prise par l’industrie : la progression des performances reposera de plus en plus sur la conception du boîtier entier comme un seul processeur, plutôt que sur la tentative de faire accomplir toutes les tâches à une seule pièce de silicium.