Per decenni, il progresso dei processori è stato strettamente associato alla capacità di inserire un numero sempre maggiore di transistor su un unico pezzo di silicio, via via più sofisticato. Questo approccio ha permesso di realizzare CPU, GPU e dispositivi di calcolo specializzati sempre più veloci, ma diventa progressivamente più difficile da sostenere man mano che i chip aumentano di dimensioni, i processi produttivi diventano più costosi e i carichi di lavoro moderni richiedono risorse di calcolo molto diverse tra loro. Nel 2026, alcuni dei processori ad alte prestazioni più importanti non dipendono più da un singolo die di grandi dimensioni. I produttori suddividono invece i progetti complessi in componenti più piccoli, chiamati chiplet, collegandoli all’interno dello stesso package in modo che possano funzionare come un processore coordinato. AMD ha già reso questo approccio centrale nelle proprie CPU server e negli acceleratori AI, mentre NVIDIA ha adottato un design multi-die per le GPU Blackwell di fascia più alta. I chiplet, quindi, non sono più una soluzione sperimentale a un problema produttivo: stanno diventando uno dei principali strumenti con cui i progettisti possono aumentare prestazioni, capacità di memoria e funzionalità senza limitarsi a rendere più grande un unico pezzo di silicio.
Perché i chip monolitici stanno raggiungendo limiti pratici
Un processore monolitico riunisce core CPU, cache, controller di memoria, interfacce e altri elementi importanti su un unico die continuo di silicio. Questo offre vantaggi evidenti. La comunicazione tra le diverse parti del processore può essere molto rapida, il progetto fisico è relativamente diretto e gli ingegneri non devono realizzare collegamenti estremamente sofisticati tra die separati. Per molti anni, i progressi nella produzione dei semiconduttori hanno permesso alle aziende di continuare ad ampliare e perfezionare questi chip, aumentando il numero di transistor in un’area ancora gestibile. Il problema è che un moderno processore di fascia alta può richiedere enormi quantità di potenza di calcolo, cache e connettività. Continuare ad aggiungere tutti questi elementi sullo stesso die finisce per creare difficoltà legate alle dimensioni fisiche, ai costi produttivi, all’alimentazione e alla dissipazione del calore. Esiste inoltre un limite pratico alla grandezza di un singolo die ottenibile con le apparecchiature di esposizione utilizzate nella produzione dei semiconduttori, quindi l’industria non può semplicemente continuare a creare pezzi di silicio sempre più grandi.
La resa produttiva è un altro motivo importante per suddividere i processori in die più piccoli. I wafer di semiconduttore non sono mai completamente privi di difetti microscopici. Quando un die è molto grande, un difetto che interessa una piccola regione può rendere inutilizzabile una quantità molto maggiore di costoso silicio. I die più piccoli offrono ai produttori una maggiore flessibilità, perché ogni componente può essere testato prima di essere assemblato nel processore finale. I die funzionanti possono essere selezionati e combinati, mentre quelli difettosi possono essere esclusi senza dover necessariamente scartare un intero processore di grandi dimensioni. Il vantaggio economico diventa particolarmente rilevante nei processi produttivi più avanzati, dove sia la fabbricazione dei wafer sia lo sviluppo dei chip hanno costi estremamente elevati. I chiplet non eliminano i difetti di produzione e l’assemblaggio finale introduce ulteriori complessità, ma consentono di evitare che ogni funzione debba essere realizzata con il processo più avanzato e costoso soltanto perché i core CPU o GPU ne hanno bisogno.
La possibilità di separare funzioni diverse è importante quanto il potenziale miglioramento della resa. I core CPU beneficiano notevolmente dei processi produttivi più recenti, perché transistor più piccoli ed efficienti possono migliorare sia le prestazioni sia il consumo energetico. Molti circuiti di I/O, invece, traggono vantaggi molto più limitati dal passaggio al nodo produttivo più avanzato. Un design a chiplet può quindi collocare i core ad alte prestazioni su silicio di ultima generazione, mantenendo controller di memoria e interfacce esterne su un altro die realizzato con un processo differente. AMD utilizza ampiamente questo principio nella famiglia EPYC. I processori EPYC 9005 di quinta generazione combinano risorse di calcolo Zen 5 o Zen 5c attraverso un’architettura multi-chip, con modelli che arrivano fino a 192 core CPU. La generazione successiva spinge ulteriormente questo approccio: nel maggio 2026 AMD ha annunciato l’avvio dell’incremento produttivo del processore EPYC di sesta generazione, nome in codice Venice, realizzato con il processo a 2 nm di TSMC. Il design modulare consente a ogni generazione di evolvere senza imporre la riprogettazione di ogni parte del processore nello stesso modo.
Un chiplet è molto più di una semplice porzione di silicio
La definizione più semplice di chiplet è quella di un die relativamente piccolo progettato per svolgere una parte del lavoro che in precedenza avrebbe potuto essere integrato in un unico chip di grandi dimensioni. È una definizione utile, ma non spiega ciò che rende realmente pratici i moderni processori a chiplet. I singoli die devono comunicare con una velocità tale da permettere al prodotto completo di funzionare quasi come un unico processore integrato. Una CPU può contenere diversi die di calcolo insieme a un die I/O separato, mentre un acceleratore AI può combinare più die di calcolo, cache, collegamenti alla memoria ad alta larghezza di banda e circuiti dedicati alla comunicazione. L’aspetto decisivo non è semplicemente che il processore sia stato suddiviso in più parti, ma che queste siano state progettate fin dall’inizio per lavorare insieme. Il package diventa quindi parte integrante dell’architettura del processore, anziché essere soltanto l’involucro protettivo di un chip già completo.
Le moderne tecniche di packaging forniscono le connessioni elettriche ad alta densità necessarie per rendere possibile questa configurazione. I die possono essere collocati uno accanto all’altro su un interposer o collegati tramite piccoli ponti di silicio, mentre alcuni progetti prevedono il posizionamento diretto di un die sopra l’altro. Questi metodi vengono comunemente descritti come integrazione 2.5D e 3D. Per comprenderne il principio di base non è però necessario conoscere tutti i dettagli produttivi: i singoli componenti vengono mantenuti estremamente vicini e collegati attraverso un numero di connessioni molto superiore a quello normalmente praticabile tra chip separati montati su una scheda. La tecnologia SoIC di TSMC, ad esempio, è progettata per sovrapporre die differenti mediante connessioni die-to-die ad alta densità, mentre Intel utilizza tecnologie come Foveros ed EMIB per combinare die specializzati. Queste soluzioni riducono la distanza fisica percorsa dai dati e consentono di costruire processori logici più grandi a partire da più componenti di silicio.
È anche per questo motivo che un moderno processore a chiplet non deve essere confuso con i computer del passato che utilizzavano semplicemente diversi chip indipendenti. In una CPU o in un acceleratore multi-die ben progettato, hardware e software possono spesso trattare l’insieme come un’unica risorsa di calcolo coerente. Dati della cache, richieste di memoria e istruzioni possono spostarsi tra i die tramite collegamenti dedicati ad alta velocità, mentre il sistema operativo o l’applicazione non devono necessariamente gestire ogni chiplet come un processore separato. Ottenere questo comportamento è complesso. Gli ingegneri devono controllare la latenza, mantenere la coerenza tra le cache ed evitare che la comunicazione tra i die diventi un collo di bottiglia. Un die monolitico conserva ancora un vantaggio intrinseco quando due circuiti vicini devono scambiarsi informazioni su una distanza estremamente breve. Gran parte dell’ingegneria dei chiplet consiste quindi nel fare in modo che la flessibilità offerta da più die superi i vantaggi comunicativi derivanti dall’integrazione di tutto su un unico pezzo di silicio.
Perché gli acceleratori AI rendono il passaggio ancora più difficile da evitare
L’intelligenza artificiale ha rafforzato ulteriormente le ragioni a favore dei processori multi-die, perché i grandi modelli AI richiedono più risorse contemporaneamente. Servono enormi capacità di calcolo parallelo, ma la sola potenza aritmetica non è sufficiente. L’acceleratore deve anche fornire rapidamente i dati alle unità di calcolo, mettere a disposizione grandi quantità di memoria molto veloce e comunicare in modo efficiente con altri acceleratori quando un modello viene distribuito su più dispositivi. Un singolo die finisce per diventare uno spazio troppo restrittivo per integrare tutte queste esigenze. La suddivisione del progetto offre agli ingegneri più margine per aumentare le risorse di calcolo e collocare interfacce di memoria, cache e circuiti di comunicazione nei punti più adatti. Questo aspetto è particolarmente importante per la High Bandwidth Memory, o HBM, che viene posizionata vicino al processore e garantisce velocità di trasferimento nettamente superiori rispetto alla normale memoria di sistema. Il packaging avanzato consente di riunire più die di calcolo e diversi stack HBM all’interno di un unico insieme strettamente interconnesso.
La famiglia Instinct di AMD mostra fino a che punto questo concetto si sia evoluto entro il 2026. I precedenti acceleratori MI300 combinavano già diversi Accelerator Complex Die con die I/O separati e stack di memoria HBM. Il più recente Instinct MI455X, introdotto nel luglio 2026 come parte della serie MI400, porta il design modulare ancora più avanti. AMD specifica otto chiplet di calcolo CDNA 5, due die I/O e due die dedicati a fabric e cache. Questi componenti vengono affiancati da dodici stack HBM4, per un totale di 432 GB di memoria e fino a 23,3 TB/s di larghezza di banda teorica. Questi valori sono importanti perché i grandi sistemi AI devono affrontare sempre più spesso un problema di memoria oltre che di capacità di calcolo. I modelli, i dati temporanei e le informazioni conservate durante interazioni AI prolungate consumano capacità e larghezza di banda. Separare le funzioni del processore permette ad AMD di aumentare queste risorse in modi che sarebbero estremamente difficili da riprodurre su un unico enorme die convenzionale.
La famiglia Blackwell di NVIDIA dimostra che questa architettura non è utilizzata da un solo produttore. Blackwell Ultra è costruito a partire da due die di grandi dimensioni collegati tramite la High-Bandwidth Interface di NVIDIA, che offre 10 TB/s di larghezza di banda die-to-die. NVIDIA descrive la coppia come una singola GPU coerente dal punto di vista del software CUDA. Blackwell Ultra può quindi distribuire le risorse di calcolo su entrambi i die mantenendo per gli sviluppatori un modello di programmazione familiare. Supporta inoltre fino a 288 GB di memoria HBM3E con una larghezza di banda fino a 8 TB/s, a seconda della configurazione del prodotto. Il punto essenziale non è stabilire quale produttore presenti il valore più elevato in una singola specifica. Entrambi gli approcci mostrano lo stesso cambiamento strutturale: quando un acceleratore diventa troppo grande e complesso per essere realizzato in modo pratico su un unico pezzo di silicio, collegamenti ad alta velocità e packaging avanzato permettono a più die di grandi dimensioni di operare come un singolo dispositivo.
Il packaging conta ormai quasi quanto il progetto dei transistor
Per gran parte della storia dei semiconduttori, il packaging ha ricevuto meno attenzione pubblica rispetto alla dimensione dei transistor o all’architettura del processore. Spesso si parlava del package principalmente in relazione al socket nel quale veniva installata la CPU. I chiplet cambiano questo rapporto. Le connessioni elettriche tra i die possono determinare la velocità con cui si spostano i dati, l’energia consumata durante la comunicazione e l’efficienza con cui le diverse parti del processore condividono la memoria. Anche la disposizione fisica influisce sul raffreddamento, perché diversi die ad alta potenza e stack di memoria possono essere concentrati in un’area relativamente ridotta. Gli ingegneri devono quindi progettare insieme silicio e package. Un die di calcolo più veloce serve a poco se il collegamento alla memoria non è in grado di fornire dati a sufficienza, mentre aggiungere altri chiplet offre benefici limitati se le connessioni tra essi si congestionano ogni volta che il carico di lavoro viene distribuito sull’intero processore.
Lo spostamento dei dati è una delle principali difficoltà, perché trasferire informazioni richiede sia tempo sia energia. La comunicazione all’interno di un singolo die è generalmente meno costosa rispetto al trasferimento delle stesse informazioni attraverso una connessione elettrica più lunga. Un design a chiplet efficace necessita quindi di collegamenti corti, ampi ed efficienti tra i diversi componenti. I progettisti devono inoltre decidere quali informazioni debbano rimanere vicino a ogni die di calcolo e quali risorse vadano condivise sull’intero processore. La posizione della cache è particolarmente importante, perché i dati utilizzati di frequente non dovrebbero attraversare inutilmente diversi chiplet. Gli acceleratori AI rendono il problema ancora più impegnativo aggiungendo diversi stack di HBM e, sempre più spesso, collegamenti ad altissima velocità verso gli acceleratori vicini. Il progetto finale deve quindi bilanciare potenza di calcolo, memoria locale, memoria condivisa e traffico tra i die, anziché concentrarsi esclusivamente sulla velocità delle unità aritmetiche.
Il packaging avanzato introduce anche nuove difficoltà produttive. Un processore composto da diversi die già testati può ridurre alcuni dei rischi associati a un singolo die enorme, ma il prodotto finale dipende ora dalla precisione del posizionamento, del bonding, delle connessioni elettriche e della gestione termica di un insieme molto più complesso. I test diventano ancora più importanti, perché i produttori devono individuare i die funzionanti prima di investirli in un package costoso contenente più componenti. Riparare un processore già assemblato non è generalmente praticabile, quindi un difetto nelle fasi produttive successive può comunque rendere inutilizzabili silicio e memoria di elevato valore. Questi costi spiegano perché i chiplet non siano automaticamente la soluzione più economica per qualsiasi dispositivo. Il loro vantaggio diventa maggiore quando il processore è sufficientemente grande, costoso o specializzato da rendere la combinazione di die più piccoli e ottimizzati più conveniente rispetto alla complessità aggiuntiva del packaging.

Cosa cambieranno i processori a chiplet nei computer e nei data centre
L’importanza a lungo termine dei chiplet deriva dal fatto che il progetto dei processori può diventare più modulare. Un produttore può realizzare diversi tipi di die di calcolo e combinarli con quantità differenti di cache, connettività di memoria o I/O per creare prodotti destinati a compiti differenti. I processori server mostrano già questo approccio attraverso gamme caratterizzate da numeri di core molto diversi, mentre gli acceleratori AI combinano sempre più spesso die specializzati per calcolo, cache e comunicazione. I futuri progetti potranno spingersi oltre, integrando nello stesso package core CPU, risorse GPU, hardware per l’elaborazione neurale e acceleratori specializzati quando tale combinazione risulti utile. Questo non significa che i componenti possano essere mescolati liberamente come semplici elementi intercambiabili. Ogni progetto richiede comunque un’attenta ingegnerizzazione elettrica, termica e software. Significa però che la creazione di un nuovo processore non deve più partire dall’idea che ogni transistor importante debba necessariamente appartenere a un unico gigantesco die.
Un altro cambiamento importante è che le diverse parti di un processore possono evolvere a ritmi differenti. Il processo produttivo più recente può essere riservato ai componenti che beneficiano maggiormente di transistor più piccoli, mentre le funzioni che scalano poco possono rimanere su un nodo differente. Questa scelta può ridurre la pressione sulla capacità produttiva più avanzata e impedire ai progettisti di sostenere i costi massimi di fabbricazione per circuiti che ne ricaverebbero vantaggi minimi. Consente inoltre di riutilizzare componenti già collaudati. Un die I/O, un die di cache o un progetto dedicato alla comunicazione può rimanere valido per più di una generazione di processori anche quando i chiplet di calcolo cambiano in modo sostanziale. Questo approccio non elimina gli enormi costi di sviluppo dei processori moderni, ma offre ai produttori più possibilità per distribuire l’investimento tra prodotti e generazioni differenti.
Gli utenti potrebbero percepire questo cambiamento architetturale molto meno rispetto all’industria dei semiconduttori. Chi acquista un PC desktop difficilmente sceglierà un processore perché un determinato controller della cache si trova su un die separato, così come un’organizzazione che acquista server AI sarà più interessata a prestazioni, memoria, consumo energetico, affidabilità e supporto software che al numero esatto di pezzi di silicio contenuti in ogni acceleratore. I chiplet sono importanti perché modificano ciò che i produttori possono realizzare mantenendo costi e consumi entro limiti accettabili. Numeri di core più elevati, cache più grandi e una larghezza di banda della memoria molto superiore diventano obiettivi più accessibili quando i progettisti non sono vincolati alle dimensioni di un unico die. Allo stesso tempo, la qualità delle interconnessioni e del packaging diventa parte integrante delle prestazioni reali, quindi i futuri confronti dipenderanno sempre più da quanto bene funziona l’intero insieme multi-die e non soltanto dalle caratteristiche di un singolo die di calcolo.
Il futuro sarà modulare, ma i chip monolitici non scompariranno
Il passaggio ai chiplet non deve essere interpretato come la fine immediata dei processori monolitici. I chip piccoli e di dimensioni intermedie possono continuare a essere più economici, semplici ed efficienti dal punto di vista energetico quando tutte le funzioni necessarie possono essere integrate comodamente su un solo die. Molti processori embedded, controller e dispositivi consumer non richiedono l’enorme numero di core o la larghezza di banda della memoria tipici di una CPU per data centre o di un acceleratore AI. Suddividere un progetto di questo tipo potrebbe aumentare i costi di packaging e comunicazione senza offrire vantaggi significativi. Anche nel calcolo ad alte prestazioni, gli ingegneri possono scegliere di mantenere determinate funzioni sullo stesso die quando una latenza estremamente bassa è più importante della modularità. La scelta tra uno o più die rimane quindi una decisione ingegneristica, non una regola secondo cui ogni futuro semiconduttore dovrà necessariamente essere suddiviso.
Il caso più convincente per i chiplet si trova nella fascia più alta del calcolo, dove il numero di transistor, le esigenze di memoria e i costi produttivi crescono più rapidamente. Nel 2026 questa transizione è già evidente nell’hardware commerciale e non soltanto nei progetti di ricerca. I processori server EPYC di AMD utilizzano strutture multi-chip per raggiungere numeri di core CPU molto elevati. Gli acceleratori AMD Instinct distribuiscono funzioni di calcolo, I/O, cache e gestione della memoria tra die specializzati. I prodotti Blackwell più grandi di NVIDIA combinano due importanti die GPU facendoli funzionare in modo coerente. Intel continua a sviluppare tecnologie di packaging progettate appositamente per collegare più die e superare i limiti pratici di dimensione di un singolo chip. Queste aziende non utilizzano progetti identici, ma la direzione comune mostra che il packaging avanzato e la comunicazione die-to-die sono ormai strumenti fondamentali per aumentare la scala dei processori moderni.
Il risultato è un cambiamento nel significato stesso del termine processore. In passato indicava naturalmente un singolo pezzo principale di silicio. Nei sistemi più potenti sta invece diventando un insieme strettamente integrato di componenti in silicio progettati per comportarsi come un unico dispositivo di calcolo. Questo offre agli ingegneri maggiore libertà nel selezionare il processo produttivo più adatto a ogni funzione, aumentare la capacità di calcolo oltre i limiti dimensionali di un singolo die, collocare grandi quantità di memoria ad alta larghezza di banda vicino alle unità di calcolo e riutilizzare componenti già collaudati in più prodotti. Il compromesso è che interconnessioni, packaging, test, comportamento software e raffreddamento assumono un’importanza ancora maggiore. I chip monolitici continueranno a essere utilizzati dove rimangono la soluzione più pratica, ma le CPU e gli acceleratori AI più grandi indicano già chiaramente la direzione futura: la crescita delle prestazioni dipenderà sempre più dalla progettazione dell’intero package come un unico processore, anziché dal tentativo di far svolgere ogni funzione a un solo pezzo di silicio.