Cerebras ha presentato il suo nuovo supercomputer AI Andromeda all’SC22. Con 13,5 milioni di core in 16 sistemi Cerebras CS-2, Andromeda vanta un exaflop di calcolo AI e 120 petaflop di calcolo denso. Il suo cavallo di battaglia informatico è il processore manycore su scala wafer di Cerebras, WSE-2.

Ogni wafer WSE-2 ha tre piani fisici, che gestiscono l’aritmetica, la memoria e le comunicazioni. Di per sé, i 40 GB di SRAM integrata del piano di memoria possono contenere un intero BERTLARGE. Ma il piano aritmetico ha anche circa 850.000 core indipendenti e 3,4 milioni di FPU. Questi core hanno una larghezza di banda interna complessiva di circa 20 PB/s, attraverso la maglia cartesiana del piano di comunicazione.

Ciascuno dei processori in scala di wafer di Andromeda ha le dimensioni di un piatto da insalata, 8,5 pollici di lato. Immagine: Cerebras

Cerebras sta enfatizzando quello che chiama”ridimensionamento lineare quasi perfetto”, il che significa che per un dato lavoro, due CS-2 lo faranno due volte più velocemente di uno, tre impiegheranno un terzo di il tempo, e così via. Come? I sistemi SC-2 di Andromeda si basano sulla parallelizzazione, ha detto Cerebras, dai core su ciascun wafer al tessuto SwarmX che li coordina tutti. Ma i talenti del supercomputer si estendono oltre i suoi già impressionanti 16 nodi. parallelizzazione dei dati, i ricercatori possono unire fino a 192 sistemi CS-2 per un singolo lavoro.

Andromeda cresce con Epyc vince

Andromeda ottiene i suoi dati da una banca di 64 core Processori AMD EPYC 3. Questi processori, ha affermato AMD via e-mail, lavorano in tandem con i wafer CS-2, eseguendo”un’ampia gamma di pre e post-elaborazione dei dati”.

“AMD EPYC è il la scelta migliore per questo tipo di cluster ehm”, ci ha detto il fondatore e CEO di Cerebras Andrew Feldman,”perché offre densità di core, capacità di memoria e IO senza pari. Ciò ha reso la scelta più ovvia per fornire dati al supercomputer Andromeda.”

Tra i suoi sedici motori su scala wafer di seconda generazione, Andromeda funziona con 18.164 core Epyc 3. Tuttavia, tale throughput ha un prezzo. Tutto sommato, il sistema consuma circa 500 kilowatt quando funziona al massimo.

Go Big or Go Home

Andromeda non è il supercomputer più veloce sulla terra. Frontier, un supercomputer a l’Oak Ridge National Lab, in grado di eseguire simulazioni di armi nucleari, ha superato il limite dell’exaflop all’inizio di quest’anno. Frontier funziona anche con una precisione maggiore, da 64 bit alla mezza precisione di Andromeda a 16 bit. Ma non tutte le operazioni richiedono una precisione di livello nucleare. Andromeda non sta cercando di essere Frontier.

“Sono una macchina più grande. Non li stiamo battendo. La loro costruzione è costata 600 milioni di dollari. Questo è meno di 35 milioni di dollari”, ha affermato Feldman.

Né Andromeda sta cercando di usurpare Polaris, un cluster di oltre duemila GPU Nvidia A100 presso l’Argonne National Lab. In effetti, come Andromeda, la stessa Polaris utilizza i core AMD EPYC per eseguire pre e post-elaborazione. Invece, ogni supercomputer eccelle in un tipo di lavoro leggermente diverso.

In generale, le CPU sono generaliste mentre gli ASIC (comprese le GPU) e gli FPGA sono più specializzati. Ecco perché i minatori di criptovalute adorano le GPU. La blockchain comporta un sacco di matematica ripetitiva. Ma Andromeda è ancora più specializzata. Eccelle nella gestione di matrici sparse di grandi dimensioni, array multidimensionali di dati tensoriali che sono per lo più zero.

L’intelligenza artificiale richiede un’elevata intensità di dati, sia nella pipeline che nell’effettivo calcolo dell’IA. Quindi, ha detto Feldman, Andromeda utilizza i processori Epyc per semplificare il processo.”Le macchine basate su AMD Epyc si trovano in server al di fuori dei Cerebras CS-2″, ha affermato Feldman, per coordinare e preparare i dati. Quindi, subentrano i fabric SwarmX e MemoryX di Andromeda.

Andromeda, a casa nel suo data center di Santa Clara. Immagine: Cerebras

Un cluster GPU deve coordinarsi tra ogni core, scheda e rack del server. Ciò comporta un ritardo inevitabile. C’è anche un sovraccarico di memoria esponenziale man mano che le reti diventano più grandi e complesse. Al contrario, WSE-2 gestisce gran parte della sua pipeline di informazioni all’interno dello stesso componente hardware. Allo stesso tempo, i processori manycore su scala wafer di Cerebras possono fare di più su un singolo (gigantesco) pezzo di silicio rispetto a una CPU o GPU consumer. Ciò consente ad Andromeda di gestire compiti.

Modelli di linguaggio di grandi dimensioni

Così come un’auto da corsa di Formula 1 viene sprecata sulle strade di superficie, Andromeda trova il suo passo a s cale. Da nessuna parte questo è più evidente del suo successo travolgente con i grandi modelli linguistici (LLM).

Immagina un foglio di calcolo Excel con una riga e una colonna per ogni singola parola dell’intera lingua inglese. I modelli di elaborazione del linguaggio naturale utilizzano matrici, griglie speciali simili a un foglio di calcolo, per tracciare le relazioni tra le parole. Questi modelli possono avere miliardi, anche decine di miliardi, di parametri. Le loro sequenze possono essere lunghe 50.000 token. Penseresti che con la crescita del set di allenamento, quel sovraccarico esponenziale colpirebbe di nuovo. Ma gli LLM spesso funzionano utilizzando i tensori sparsi che Andromeda ama.

Tutti i sedici nodi CS-2 di Andromeda. Immagine: Cerebras

I clienti di Andromeda, tra cui AstraZeneca e GlaxoSmithKline, segnalano il successo nell’utilizzo di LLM su Andromeda per la ricerca di”omici”, tra cui il genoma e l’epigenoma COVID. Durante un esperimento presso il National Energy Technology Lab, gli scienziati descrivono di fare”GPU impossibile”lavoro con Andromeda che Polaris semplicemente non è riuscito a completare. E potrebbe non produrre numeri per le bombe nucleari, ma Andromeda è anche al lavoro sulla ricerca sulla fusione.

“Abbinando la potenza dell’IA del CS-2 con la simulazione di precisione di Lassen crea un computer CogSim che apre nuove porte per gli esperimenti di fusione a confinamento inerziale (ICF) presso la National Ignition Facility”, ha affermato Brian Spears del Lawrence Livermore National Lab.

Andromeda incontra il mondo accademico

Andromeda attualmente vive a Colovore, un data center HPC a Santa Clara. Ma Cerebras ha dedicato del tempo anche ad accademici e studenti laureati di usare Andromeda gratuitamente.

E c’è un’altra cosa che gli studenti laureati, nell’apprendimento automatico e altrove, potrebbero voler notare: Andromeda funziona bene con Python. Nell’apprendimento automatico, questa è la posta in gioco, ma intendiamo Puoi inviare un lavoro di intelligenza artificiale ad Andromeda, afferma Cerebras,”in modo rapido e indolore da un notebook Jupyter e gli utenti possono passare da passare da un modello all’altro con pochi tasti.”

“È straordinario che Cerebras abbia fornito agli studenti laureati l’accesso gratuito a un cluster così grande”, ha affermato Mateo Espinosa, dottorando presso l’Università di Cambridge nel Regno Unito. Espinosa, che in precedenza ha lavorato presso Cerebras, sta lavorando con Andromeda per la sua tesi sull’intelligenza artificiale spiegabile. “Andromeda offre 13,5 milioni di core AI e un ridimensionamento lineare quasi perfetto attraverso i più grandi modelli di linguaggio, senza il dolore del calcolo distribuito e della programmazione parallela. Questo è il sogno di ogni studente laureato in ML.”

L’apprendimento automatico deve nuotare controcorrente in un fiume di dati in continua crescita. Fino a un certo punto, possiamo semplicemente aggiungere più hardware di elaborazione al compito. Ma all’interno e tra reti, la latenza inizia ad accumularsi rapidamente. Per ottenere la stessa quantità di dati in un dato momento, devi dedicare più energia al problema. L’enorme volume di dati rende il throughput il proprio collo di bottiglia. Questo”punto triplo”è dove Cerebras cerca per lasciare il segno.

Tutte le immagini di Andromeda per gentile concessione di Cerebras.

Ora leggi:

Categories: IT Info