Progettazione di cluster di intelligenza artificiale con storage e calcolo di rete allineati

Progettazione di cluster di intelligenza artificiale con storage e calcolo di rete allineati

Allineamento delle decisioni relative all'infrastruttura di intelligenza artificiale

Allineamento delle decisioni relative all'infrastruttura di intelligenza artificiale
  • Con l'aumentare delle dimensioni dei cluster GPU, che raggiungono centinaia o migliaia di acceleratori, il disallineamento tra infrastruttura di rete, throughput di archiviazione e densità di calcolo diventa il principale ostacolo a prestazioni di intelligenza artificiale utilizzabili. I colli di bottiglia nel traffico est-ovest, una progettazione leaf-spine non ottimale o nodi di archiviazione sottodimensionati erodono rapidamente l'utilizzo delle GPU e fanno lievitare i costi di addestramento, anche in presenza di switch, componenti ottici e hardware di archiviazione di alta qualità.

    Questa sezione illustra come approcciarsi alla progettazione end-to-end di un cluster AI: come dimensionare e posizionare gli switch del data center per le architetture GPU leaf-spine, come allineare i nodi di storage scalabili con i carichi di lavoro di training e inferenza e come scegliere le ottiche e i cavi a 400G per i collegamenti intra-cluster. Le seguenti linee guida aiutano a tradurre gli obiettivi di prestazioni, scalabilità e TCO in scelte concrete di topologia, nodi e interconnessioni.

Allineamento di rete, storage e GPU su larga scala

Mappare GPU, fabric spine-leaf e nodi di storage in un unico cluster AI bilanciato è difficile quando entrano in gioco vincoli di larghezza di banda, latenza, costi e crescita.

Allineamento di rete, storage e GPU su larga scala
  • Bilanciamento del traffico est-ovest e della velocità di trasmissione della GPU

    La discrepanza tra il numero di GPU, la struttura leaf-spine e i collegamenti 400G causa punti critici, GPU sottoutilizzate e tempi di addestramento imprevedibili.

  • Dimensionamento ottimale di IOPS di storage e livelli di capacità

    La scelta del numero di nodi di archiviazione, del mix di supporti e della connessione di rete per l'addestramento di grandi quantità di dati è complessa e può facilmente portare a colli di bottiglia I/O.

  • Progettare per l'evoluzione, non per creazioni uniche.

    Vincolarsi a scelte fisse in termini di switch, moduli ottici e soluzioni di storage comporta il rischio di aggiornamenti problematici, porte inutilizzate e un'espansione del cluster che può causare disagi.

Allineamento di rete, archiviazione e GPU

Comprendere come progettare congiuntamente infrastruttura, storage e risorse di calcolo in modo che i cluster di intelligenza artificiale scalino in modo prevedibile ed efficiente.

Struttura di intelligenza artificiale deterministica

Progettare fabric GPU leaf-spine con switching 100/400G predisposto per NDR e percorsi a bassa latenza.

L'archiviazione alimenta le GPU

Scalabilità orizzontale dello storage per garantire che le GPU non rimangano mai a corto di risorse, dai data lake di training ai checkpoint.

Ottica per la crescita del ciclo di vita

Utilizzare ottiche 400G e DAC/AOC per bilanciare portata, potenza e percorsi di aggiornamento tra le fasi.

Confronto delle opzioni di progettazione di cluster AI Fabric

Confronta RoCE su Ethernet con Ethernet senza perdita di dati in stile InfiniBand durante l'allineamento di GPU, storage e architettura spine-leaf.

Caratteristica Ethernet standard RoCE Leaf-Spine
Rete Ethernet senza perdite ottimizzata dall'IA (hot)
Risultato per te
Adattamento per l'impiego Infrastruttura di data center per uso generico che utilizza switch come N9K-C9336C-FX2-B2 o DCS-7050SX3-48YC12-F, carichi di lavoro misti, nodi GPU parziali. Struttura cluster AI appositamente progettata, che utilizza CE8851-32CQ8DQ-KB0, 7260CX3-64-F e ottiche 400G DR4/FR4 per pod GPU + storage ad alta densità. Decidi se il tuo cluster sarà innanzitutto un data center multi-tenant o una piattaforma per l'addestramento e l'inferenza dell'intelligenza artificiale.
Flusso di traffico est-ovest e sovrasottoscrizione Rapporti di sovrasottoscrizione più elevati; collegamenti 100/200G, utilizzo selettivo di 400G, adatti per formazione su scala moderata e traffico generale. Architettura spine-leaf aggressiva da 400G con QDD-400G-DR4-S/FR4-S e QSFP-DD-400G-DR4; bassa sovrascrittura allineata alle dimensioni dei job GPU. È possibile dimensionare correttamente la larghezza di banda: RoCE standard per contenere i costi; Ethernet lossless ottimizzata dall'IA per un utilizzo costante della GPU.
Controllo della latenza e della congestione Ottimizzazione ECN/PFC standard; sufficiente per carichi di lavoro misti, ma più sensibile ai microburst e alla latenza di coda sotto carico. Ethernet senza perdite, progettata con precisione (PFC, ECN e configurazioni del buffer ottimizzate), per mantenere prevedibile la latenza tra GPU e storage e tra GPU. Una migliore latenza della coda migliora direttamente il tempo di esecuzione del passo di addestramento e il jitter di inferenza per i modelli sensibili alla latenza.
Allineamento di archiviazione Compatibile con nodi scale-out come 90004U-C-AC e N8500-ENT-N2M96G-G8-AC-1, ma potrebbe condividere la larghezza di banda con applicazioni non basate sull'intelligenza artificiale. Percorsi di archiviazione dimensionati specificamente per l'IA (ad esempio, uplink dedicati da 100/200/400G per 90002U-I-M96G-AC e N8500-EHS-N2M384G-DC-1). La scelta di un cablaggio di archiviazione compatibile con l'IA riduce i blocchi di I/O, migliorando la pipeline end-to-end dall'acquisizione dei dati alla memoria GPU.
Scalabilità e ciclo di vita Crescita incrementale più agevole; combinazione flessibile di modelli ToR (CE6863-48S6CQ-B, 6865-48S8CQ-SI-B) man mano che i cluster si evolvono. Progettazione del fabric per pod/rack e pianificazione del ciclo di vita in base alle generazioni di GPU e ottiche (AOC, DR4, FR4, CU2M5). La progettazione ottimizzata dall'intelligenza artificiale si adatta in modo prevedibile a rack e moduli, semplificando la pianificazione di future espansioni di GPU e storage.
Profilo dei costi e del costo totale di proprietà (TCO) Minori costi iniziali; possibilità di riutilizzare Ethernet, ottiche 100G e una maggiore varietà di switch; rischio più elevato di costi nascosti dovuti all'inattività della GPU. Investimenti più elevati (ottiche 400G, spine di alta qualità), ma ottimizzati per massimizzare l'utilizzo della GPU e l'efficienza energetica nel tempo. Valutare il risparmio in termini di hardware rispetto all'efficienza oraria della GPU; per cluster di dimensioni considerevoli, Ethernet senza perdita di dati, focalizzata sull'intelligenza artificiale, risulta generalmente più vantaggiosa in termini di costo totale di proprietà (TCO).
Complessità operativa Operazioni semplificate per il secondo giorno; monitoraggio e QoS standard; più facile da gestire per i team che già utilizzano reti di data center generiche. Richiede modelli rigorosi per QoS, PFC e routing; maggiore coordinamento tra i team di rete, storage e piattaforme di intelligenza artificiale. Se si ha la possibilità di investire nella progettazione e nell'automazione, i tessuti ottimizzati dall'intelligenza artificiale offrono prestazioni migliori senza compromettere l'affidabilità.
I migliori casi d'uso Progetti pilota di intelligenza artificiale di piccole e medie dimensioni, soluzioni miste di virtualizzazione e intelligenza artificiale, data center periferici o succursali che consolidano diversi carichi di lavoro. Cluster dedicati all'addestramento dell'IA, piattaforme di IA aziendali condivise, farm di GPU in cui la produttività e il rispetto degli SLA sono gli obiettivi primari. Scegli questa soluzione quando l'IA è strategica: allinea nodi di calcolo, di archiviazione e ottiche 400G in un'infrastruttura di cluster coerente e ad alto rendimento.

Hai bisogno di aiuto? Esperti tecnici disponibili subito.

  • +1-626-655-0998 (Stati Uniti)
    UTC 15:00-00:00
  • +852-2592-5389 (Hong Kong)
    UTC 00:00-09:00
  • +852-2592-5411 (Hong Kong)
    UTC 06:00-15:00
Hai bisogno di aiuto? Esperti tecnici disponibili subito.

Applicazioni ideali per cluster di intelligenza artificiale

Dove la perfetta integrazione di architetture di calcolo, rete e archiviazione consente di realizzare cluster di intelligenza artificiale scalabili ed efficienti, adatti a diversi settori e dimensioni di implementazione.

Cluster GPU su scala iperscalabile per i modelli Foundation

Cluster GPU su scala iperscalabile per i modelli Foundation

  • Progettare strutture a foglie e spine con capacità di carico di 100/400G per interconnettere migliaia di GPU per l'addestramento di modelli LLM e multimodali.
  • Implementare nodi di storage scalabili in prossimità dei rack delle GPU per sostenere un elevato throughput di checkpoint, acquisizione dati e snapshot dei modelli senza sovraccaricare le GPU.
  • Standardizzare i collegamenti ottici 400G e AOC tra gli switch dei data center AI e i server GPU per ridurre al minimo la complessità del cablaggio e la contesa dei processi di addestramento.
Piattaforme di intelligenza artificiale aziendali per analisi e copiloti

Piattaforme di intelligenza artificiale aziendali per analisi e copiloti

  • Realizza cluster GPU di medie dimensioni con fabric leaf non bloccanti, in modo che i carichi di lavoro di BI, ricerca e copilota possano condividere la stessa infrastruttura AI senza interferenze da parte di altri sistemi.
  • Integrare nodi di archiviazione unificati che espongano interfacce NFS, SMB e a oggetti per archivi di funzionalità centralizzati, librerie di prompt e set di dati analitici.
  • Utilizza uplink a 400G su switch core o di aggregazione per instradare il traffico AI verso le reti aziendali esistenti, evitando così la creazione di hotspot dovuti al sovraccarico.
Laboratori di ricerca e HPC che gestiscono processi misti di IA/HPC

Laboratori di ricerca e HPC che gestiscono processi misti di IA/HPC

  • Crea infrastrutture GPU flessibili con switch programmabili per supportare sia il traffico di addestramento AI basato su RDMA sia i carichi di lavoro HPC tradizionali basati su MPI.
  • Collegare nodi di archiviazione ad alta capacità di memoria come file system paralleli per l'output delle simulazioni, la post-elaborazione AI e la preparazione dei set di dati nello stesso cluster di ricerca.
  • Adottare soluzioni ottiche 400G LR/FR tra edifici o laboratori per estendere una dorsale AI/HPC unificata in tutte le strutture di ricerca del campus.
Inferenza sensibile alla latenza e aggregazione dei bordi

Inferenza sensibile alla latenza e aggregazione dei bordi

  • Implementa switch compatti per cluster di intelligenza artificiale presso siti metropolitani o periferici per aggregare nodi di inferenza GPU che forniscono servizi di raccomandazione e valutazione in tempo reale.
  • Allineare i nodi di archiviazione per il caricamento a bassa latenza dei modelli, le versioni A/B dei modelli e la memorizzazione nella cache delle funzionalità in periferia, al fine di evitare ritardi di backhaul verso i data center centrali.
  • Utilizzare AOC 400G a corto raggio all'interno dei rack periferici e collegamenti DR4 400G a monte verso i data center regionali per una latenza di inferenza end-to-end prevedibile.
Servizi di cluster AI condivisi per cloud e MSP

Servizi di cluster AI condivisi per cloud e MSP

  • Progetta cluster GPU multi-tenant con architetture leaf-spine in grado di segmentare i clienti utilizzando VXLAN/EVPN, condividendo al contempo lo stesso pool hardware a 100/400G.
  • Raggruppa i nodi di storage scalabili in livelli di prestazioni separati, in modo che i clienti del cloud possano adattare gli SLA per l'addestramento, la messa a punto o l'inferenza dell'IA alla QoS dello storage.
  • Adottare la standardizzazione su 400G DR4 e breakout DAC per la connettività ToR-spine e ToR-storage al fine di semplificare la gestione del ciclo di vita nelle sale dati.

Domande frequenti

Come posso scegliere tra diversi switch 100G/400G per la mia infrastruttura di rete del cluster AI?

  • La selezione di solito inizia dal numero di GPU, dalla velocità di elaborazione target per l'addestramento e dai rapporti di sovrascrittura leaf-spine. Modelli come Cisco N9K-C9336C-FX2-B2, HPE Q9E63A, Huawei CE6863/6865 e Arista 7050SX3/7260CX3 differiscono principalmente per densità di porte, profilo del buffer e funzionalità di telemetria.
  • Quando si consolidano soluzioni di fornitori diversi, si consiglia di allinearsi sui seguenti punti: 1) una strategia di breakout 100G/400G comune (ad esempio, 4 porte 100G su porte 400G), 2) funzionalità richieste come RoCEv2 ECN/PFC, VXLAN e tabelle ECMP di grandi dimensioni e 3) lo stack operativo (CLI/automazione) che il team è in grado di gestire.
  • Se condividi il numero di nodi GPU pianificati, la velocità della NIC per nodo e l'orizzonte di crescita, il nostro team di soluzioni può aiutarti a restringere un elenco ristretto e a convalidarlo rispetto al tuo progetto fabric. Puoi anche richiedere una revisione dell'architettura tramite il nostro Supporto CCIE gratuito pagina. Nota: i termini di garanzia specifici e i servizi di assistenza possono variare a seconda del prodotto e della regione. Per informazioni precise, si prega di consultare le informazioni ufficiali. Per ulteriori richieste, si prega di contattare: router-switch.com.

Questi switch cluster AI e le ottiche 400G sono interoperabili tra i diversi fornitori?

  • I moduli ottici e i cavi 400G elencati (come CIS:QDD-400G-LR4-S, QDD-400G-DR4-S, QDD-400G-FR4-S, HW:QSFP-DD-400G-DR4 e QSFP-DD-400G-CU2M5) sono progettati per rispettare le specifiche IEEE/MSA, ma l'interoperabilità effettiva dipende comunque dalle versioni del sistema operativo del dispositivo e dalle politiche di codifica del fornitore.
  • Nelle reti multivendor (Cisco/Huawei/Arista/HPE), raccomandiamo vivamente di pre-verificare: 1) quali transceiver di terze parti o con codice OEM sono ufficialmente supportati, 2) se entrambe le estremità concordano sul tipo di FEC e sulla configurazione delle corsie e 3) il numero massimo di modalità breakout supportate su ciascun modello di switch.
  • Prima dell'acquisto, puoi comunicarci il codice SKU esatto dello switch, la versione del sistema operativo e i tipi di cavo/ottica che intendi utilizzare, in modo che i nostri ingegneri possano eseguire un controllo di compatibilità e di rischio, riducendo la possibilità di problemi di collegamento o di moduli non supportati in produzione.

Come devo dimensionare i nodi di archiviazione rispetto al mio cluster di GPU per evitare colli di bottiglia?

  • Per i carichi di lavoro di addestramento AI/feature store, i nodi di storage come le serie 90002U/90004U e i modelli Huawei N8500 dovrebbero essere dimensionati in base alla larghezza di banda di lettura, alle prestazioni dei metadati e alla capacità per i checkpoint, piuttosto che solo in base ai terabyte grezzi.
  • Un flusso decisionale pratico è il seguente: 1) definire la velocità di trasmissione aggregata richiesta per rack o per pod GPU, 2) mapparla alle porte front-end 10/25/100G su nodi come le varianti 9000-P12-10GE-2T o N8500-ENT e 3) allineare il layout di scalabilità del back-end (numero di nodi, dimensione della cache come N2M96G/N2M384G e impostazioni RAID/codifica di cancellazione).
  • Se non sei sicuro se scalare verso l'alto (nodi più grandi) o verso l'esterno (più nodi) per il tuo set di dati e la strategia di checkpoint, puoi inviare il tuo profilo di carico di lavoro attuale e il piano di crescita per una revisione della progettazione tramite il nostro Supporto CCIE gratuitoNota bene: i termini di garanzia e i servizi di assistenza specifici possono variare a seconda del prodotto e della regione. Per informazioni precise, si prega di consultare le informazioni ufficiali. Per ulteriori domande, si prega di contattare: router-switch.com.

Quali rischi di implementazione devo tenere in considerazione durante il cablaggio di collegamenti 400G in una configurazione leaf-spine basata sull'intelligenza artificiale?

  • Nei cluster AI densi, i problemi comuni sul campo includono il superamento della lunghezza DAC supportata (ad esempio, quando si estende il QSFP-DD-400G-CU2M5 oltre la topologia raccomandata), la combinazione errata di ottiche DR4/FR4/LR4 con il tipo di fibra sbagliato o la mancata osservanza della polarità e della pulizia dell'MPO, che possono aumentare drasticamente il BER.
  • Come checklist di implementazione, suggeriamo di: 1) verificare porta per porta se ogni switch supporta l'ottica 400G o l'AOC scelto (ad esempio, CIS:QDD-400-AOC2M/5M/10M) e la modalità breakout, 2) verificare la lunghezza massima del collegamento e il tipo di fibra tra leaf e spine e 3) predisporre le nuove ottiche in un laboratorio o in un piccolo pod prima dell'implementazione completa per verificare i contatori FEC, il tasso di errore e il comportamento della latenza.
  • Se prevedi frequenti ricablaggi o spostamenti/aggiunte/modifiche nella sala GPU, valuta la possibilità di standardizzare un piccolo set di SKU di ottiche e cavi approvati, oltre a un piano di cablaggio strutturato per ridurre gli errori umani durante le espansioni.

Quali informazioni devo conoscere in merito al ciclo di vita, alla fine del ciclo di vita (EOL/EOSL) e alla garanzia quando creo un cluster AI con questi prodotti?

  • Le infrastrutture dei cluster AI e i backend di storage spesso sopravvivono a una singola generazione di GPU, quindi è importante verificare che gli switch e le piattaforme di storage (ad esempio, la serie N8500 o specifici modelli leaf-spine Nexus/Arista) non siano prossimi alla fine del ciclo di vita/fine del supporto al momento dell'implementazione.
  • Prima di finalizzare la distinta base, consigliamo di controllare ogni SKU candidato con il nostro Verificatore EOL/EOSL e chiarendo la strategia relativa ai pezzi di ricambio (pezzi di ricambio a freddo in loco rispetto alla sostituzione anticipata) in base ai requisiti di tempo di attività.
  • È possibile consultare le nostre regole generali di copertura su politica di garanzia Consulta la pagina e poi verifica i termini esatti per fornitore e regione con il tuo consulente commerciale, soprattutto per installazioni ricondizionate o di generazione mista. Nota: i termini di garanzia specifici e i servizi di supporto possono variare in base al prodotto e alla regione. Per informazioni precise, consulta le informazioni ufficiali. Per ulteriori richieste, contatta: router-switch.com.

Come vengono gestite le spedizioni, le tasse e i resi per gli ordini di switch, sistemi di archiviazione e componenti ottici per cluster AI?

  • I tempi di consegna e le opzioni di spedizione per switch ad alta densità, nodi di archiviazione e ottiche 400G sono influenzati dalla disponibilità a magazzino e dalla destinazione. Per gli articoli disponibili a magazzino, a seconda della disponibilità del prodotto e della destinazione, possiamo in genere proporre diverse opzioni di corriere descritte nella nostra metodi di spedizione .
  • Le tasse di importazione e i dazi doganali dipendono dalle normative locali e dalle condizioni commerciali; è possibile consultare la nostra guida consolidata all'indirizzo tasse e dazi doganali e poi conferma i dettagli con il tuo team logistico o finanziario prima di effettuare un ordine di un cluster AI di grandi dimensioni.
  • Se un componente arriva difettoso o si guasta all'inizio del burn-in, è necessario seguire la procedura passo passo descritta nel nostro istruzioni per il reso in modo che la gestione RMA non ritardi la finestra di implementazione complessiva del cluster. Nota: i termini di garanzia specifici e i servizi di supporto possono variare in base al prodotto e alla regione. Per informazioni precise, fare riferimento alle informazioni ufficiali. Per ulteriori richieste, si prega di contattare: router-switch.com.

Altre soluzioni

GPU Cluster Networking Solutions for AI Scale-Out

Soluzioni di rete per cluster GPU per la scalabilità dell'IA

Progettare reti Ethernet ad alte prestazioni per cluster GPU AI con guida topologica scalabile, commutazione a bassa latenza e architettura pronta per l'implementazione.

Rete di cluster GPU per intelligenza artificiale
Lossless Ethernet for AI & HPC Networks

Ethernet senza perdita di dati per reti AI e HPC

Realizza infrastrutture Ethernet senza perdite per IA e HPC con progettazione compatibile con RoCE, indicazioni per il controllo della congestione e pianificazione di rete scalabile a bassa latenza.

Ethernet senza perdita di dati
Copper vs Fiber vs DAC/AOC Interconnects Guide

Guida alle interconnessioni in rame, fibra e DAC/AOC

Un confronto completo tra rame, fibra, DAC e AOC: latenza, portata, costo e idoneità all'implementazione 10G/25G/100G/400G.

Cablaggio e ricetrasmettitori