Cerebras onthulde op SC22 zijn nieuwe AI-supercomputer Andromeda. Met 13,5 miljoen kernen verdeeld over 16 Cerebras CS-2-systemen, beschikt Andromeda over een exaflop aan AI-computing en 120 petaflops aan compacte compute. Het computerwerkpaard is Cerebras’WSE-2-processor op waferschaal en veel kernen.
Elke WSE-2-wafer heeft drie fysieke vlakken, die rekenen, geheugen en communicatie afhandelen. Op zichzelf kan de 40 GB ingebouwde SRAM van het geheugenvlak een hele BERTLARGE bevatten. Maar het rekenvlak heeft ook zo’n 850.000 onafhankelijke kernen en 3,4 miljoen FPU’s. Die kernen hebben een gezamenlijke interne bandbreedte van ongeveer 20 PB/s, over de cartesiaanse mesh van het communicatievlak.

Elk van Andromeda’s processors op waferschaal is zo groot als een saladebord, 8,5″ aan een kant. Afbeelding: Cerebras

Andromeda schaalt op met Epyc wint
Andromeda haalt zijn gegevens uit een bank van 64-core AMD EPYC 3-processors. Deze processors, zei AMD via e-mail, werken samen met de CS-2-wafels en doen”een breed scala aan gegevens voor-en naverwerking”.
“AMD EPYC is de beste keuze voor dit type cluster eh,”vertelde Andrew Feldman, oprichter en CEO van Cerebras,”omdat het een ongeëvenaarde kerndichtheid, geheugencapaciteit en IO biedt. Dit maakte het de voor de hand liggende keuze om gegevens naar de Andromeda-supercomputer te sturen.”
Tussen zijn zestien tweede generatie wafer-scale engines draait Andromeda op 18.164 Epyc 3-kernen. Die doorvoer heeft echter een prijs. Alles bij elkaar verbruikt het systeem zo’n 500 kilowatt wanneer het op zijn hoogtepunt draait.
Go Big or Go Home
Andromeda is niet de snelste supercomputer ter wereld. het Oak Ridge National Lab dat in staat is om kernwapensimulaties uit te voeren, passeerde eerder dit jaar de exaflop-grens. Frontier werkt ook met een hogere precisie, 64-bit tot Andromeda’s 16-bit halfprecisie. Maar niet elke operatie heeft precisie van kernwapenkwaliteit nodig. Andromeda probeert niet Frontier te zijn.
“Ze zijn een grotere machine. We verslaan ze niet. Ze hebben 600 miljoen dollar gekost om te bouwen. Dit is minder dan 35 miljoen dollar,” zei Feldman.
Noch probeert Andromeda zich Polaris toe te eigenen, een cluster van meer dan tweeduizend Nvidia A100 GPU’s in Argonne National Lab. Net als Andromeda gebruikt Polaris zelf AMD EPYC-kernen om voor-en nabewerking uit te voeren. In plaats daarvan blinkt elke supercomputer uit in een iets ander soort werk.
Over het algemeen zijn CPU’s generalisten, terwijl ASIC’s (inclusief GPU’s) en FPGA’s meer gespecialiseerd zijn. Daarom houden cryptominers van GPU’s. De blockchain omvat een heleboel repetitieve wiskunde. Maar Andromeda is nog meer gespecialiseerd. Het blinkt uit in het omgaan met grote schaarse matrices-multidimensionale arrays van tensorgegevens die meestal uit nullen bestaan.
AI is zeer gegevensintensief, zowel in de pijplijn als in de daadwerkelijke AI-computing. Dus, zei Feldman, gebruikt Andromeda Epyc-processors om het proces te stroomlijnen.”De op AMD Epyc gebaseerde machines bevinden zich op servers buiten de Cerebras CS-2’s”, zei Feldman om de gegevens te coördineren en voor te bereiden. Vervolgens nemen Andromeda’s SwarmX-en MemoryX-fabrics het over.

Andromeda, thuis in zijn datacenter in Santa Clara. Afbeelding: Cerebras
Een GPU-cluster moet coördineren tussen elke core, kaart en serverrack. Dit zorgt voor een onvermijdelijke vertraging. Er is ook een exponentiële geheugenoverhead naarmate netwerken groter en complexer worden. WSE-2 handelt daarentegen af een groot deel van zijn informatiepijplijn binnen hetzelfde stuk hardware. Tegelijkertijd kunnen Cerebras’manycore-processors op waferschaal meer doen op een enkel (gigantisch) stuk silicium dan een consumenten-CPU of GPU. Hierdoor kan Andromeda diepgaand parallel werken taken.
Grote taalmodellen
Op dezelfde manier waarop een Formule 1-raceauto verspild wordt aan de oppervlakte, vindt Andromeda zijn pas bij kale. Nergens is dit zo duidelijk als het enorme succes met grote taalmodellen (LLM’s).
Stel je een Excel-spreadsheet voor met een rij en kolom voor elk woord in de hele Engelse taal. Modellen voor natuurlijke taalverwerking gebruiken matrices, speciale rasters die lijken op een spreadsheet, om de relaties tussen woorden bij te houden. Deze modellen kunnen miljarden, zelfs tientallen miljarden parameters hebben. Hun reeksen kunnen 50.000 tokens lang zijn. Je zou denken dat naarmate de trainingsset groeide, die exponentiële overhead weer zou toeslaan. Maar LLM’s werken vaak met de schaarse tensoren waar Andromeda dol op is.

Alle zestien CS-2-knooppunten van Andromeda. Afbeelding: Cerebras
Andromeda-klanten, waaronder AstraZeneca en GlaxoSmithKline, rapporteren succes met het gebruik van LLM’s op Andromeda om”omics”te onderzoeken, waaronder het COVID-genoom en epigenoom. Tijdens een experiment in het National Energy Technology Lab beschrijven wetenschappers het doen van”GPU onmogelijk”werk met Andromeda dat Polaris simpelweg niet kon voltooien. En het is misschien geen rekenwerk voor atoombommen, maar Andromeda werkt ook aan fusieonderzoek.
“De AI-kracht van de CS-2 koppelen aan de precisiesimulatie van Lassen maakt een CogSim-computer die nieuwe deuren opent voor inertiële opsluitingsfusie (ICF)-experimenten bij de National Ignition Facility,”zei Brian Spears van het Lawrence Livermore National Lab.
Andromeda ontmoet Academia
Andromeda woont momenteel in Colovore, een HPC-datacenter in Santa Clara. Maar Cerebras heeft ook tijd vrijgemaakt voor academici en graduaatstudenten kunnen Andromeda gratis gebruiken.
En er is nog iets dat graduaatstudenten, in machine learning en elders, misschien willen opmerken: Andromeda speelt goed met Python. In machine learning is dat tafelbelang, maar we bedoelen Je kunt een AI-taak naar Andromeda sturen, zegt Cerebras,”snel en pijnloos vanuit een Jupyter-notebook, en gebruikers kunnen overschakelen van het ene model naar het andere met een paar toetsaanslagen.”
“Het is buitengewoon dat Cerebras afgestudeerde studenten gratis toegang heeft gegeven tot zo’n groot cluster”, zegt Mateo Espinosa, een promovendus aan de Universiteit van Cambridge in de Verenigd Koninkrijk. Espinosa, die voorheen bij Cerebras werkte, werkt samen met Andromeda aan zijn proefschrift over verklaarbare kunstmatige intelligentie. “Andromeda levert 13,5 miljoen AI-cores en bijna perfecte lineaire schaling over de grootste taalmodellen, zonder de pijn van gedistribueerde rekenkracht en parallel programmeren. Dit is de droom van elke afgestudeerde ML-student.”
Machine learning moet stroomopwaarts zwemmen in een steeds groter wordende rivier van gegevens. Tot op zekere hoogte kunnen we gewoon meer computerhardware inzetten. Maar binnen en tussen netwerken, begint de latentie zich snel op te stapelen. Om dezelfde hoeveelheid gedaan te krijgen in een bepaalde tijd, moet je meer energie in het probleem steken. De enorme hoeveelheid gegevens maakt de doorvoer zijn eigen knelpunt. Dat”drievoudige punt”is waar Cerebras naar op zoek is om zijn stempel te drukken.
Alle afbeeldingen van Andromeda met dank aan Cerebras.
Lees nu: