TL;DR

Nowy produkt: Nvidia wprowadziła na rynek GTC 2026 Groq 3 LPX, swoją pierwszą szafę serwerową zbudowaną w oparciu o układ inferencyjny inny niż GPU. Wydajność: system oparty na pamięci SRAM zapewnia 35 razy wyższą przepustowość niż Blackwell NVL72 w przypadku modeli o bilionach parametrów. Architektura: Nvidia dzieli obciążenia wnioskowania pomiędzy procesory graficzne Rubin do wstępnego wypełniania i jednostki LPU Groq do dekodowania tokenów w zdezagregowanym projekcie. Tło transakcji: LPX opiera się na technologii wynikającej z umowy licencyjnej o wartości 20 miliardów dolarów, którą Nvidia zawarła ze start-upem Groq pod koniec 2025 roku.

Nvidia po raz pierwszy wbudowała w swoje szafy serwerowe układ wnioskowania inny niż GPU, wypuszczając Groq 3 LPX na targach GTC 2026. Oparty na technologii od startupu Groq, producenta chipów AI, system zapewnia 35 razy większą przepustowość niż poprzedni Blackwell NVL72 w przypadku dużych modeli AI. Integrując LPU firmy Groq oparte na SRAM z własnymi procesorami graficznymi Rubin, Nvidia przyznaje, że same procesory graficzne nie są w stanie optymalnie obsłużyć szybko rosnącego rynku wnioskowania AI, który według projektów Jensen Huang osiągnie 1 bilion dolarów.

W rezultacie Nvidia łączy oba typy chipów w zdezagregowaną architekturę, ukierunkowaną na kodowanie AI i obciążenia agenta w długim kontekście.

Groq 3 LPX: dane techniczne i wydajność

Umieszczony w chłodzonej cieczą obudowie stojak Groq 3 LPX mieści 256 jednostek LPU Groq 3 i zapewnia 128 GB pamięci SRAM z przepustowością 40 petabajtów na sekundę w całym stojaku.

Co więcej, każdy LPU zawiera 500 MB pamięci SRAM przy przepustowości 150 TB/s – w porównaniu do 288 GB HBM4 i 22 TB/s na karcie graficznej Rubin firmy Nvidia. Pojemność pamięci SRAM jest znacznie mniejsza, ale przepustowość jest w przybliżeniu siedmiokrotnie większa na bajt pamięci, co ma znaczenie dla fazy dekodowania wrażliwej na opóźnienia.

Na poziomie zbiorczej szafy Nvidia twierdzi, że LPX zapewnia 35 razy większą przepustowość niż Blackwell NVL72 w przypadku modeli bilionowych parametrów, przy 300 tokenach na sekundę na megawat i 45 dolarów na milion tokenów.

Opierając się na tych informacjach, liczb, Jensen Huang oświadczył na konferencji GTC 2026, że „nadszedł punkt zwrotny wnioskowania”, oznaczając, jak to określił, przejście w stronę produktywnych obciążeń AI.

Architektura wnioskowania zdezagregowanego

Zamiast zastępować systemy GPU Nvidii, szafa LPX współpracuje z nimi. W architekturze zdezagregowanego wnioskowania, stojaki GPU Rubin CPX obsługują fazę wstępnego napełniania, podczas gdy LPX przejmuje dekodowanie i generuje tokeny sekwencyjnie.

W praktyce wstępne wypełnianie wymaga dużej mocy obliczeniowej i jest odpowiednie dla procesorów graficznych; dekodowanie wymaga dużej przepustowości pamięci i jest odpowiednie dla chipów opartych na SRAM.

W ramach tego podziału warstwy FFN działają na LPU, podczas gdy GPU zachowuje warstwy uwagi. Mark Heaps, dyrektor ds. marketingu deweloperów w firmie Nvidia, a wcześniej dyrektor ds. technologii w firmie Groq, opisał, jak SRAM upraszcza przepływ danych:

„Dane w rzeczywistości przepływają bezpośrednio przez pamięć SRAM. Kiedy patrzysz na wielordzeniową kartę graficzną, wiele poleceń instrukcji musi zostać wysłanych z chipa, aby dostać się do pamięci i wrócić z powrotem. U nas tego nie ma. Wszystko przechodzi w porządku liniowym.”

Mark Heaps, Dyrektor ds. marketingu programistów w firmie Nvidia (za pośrednictwem IEEE Spectrum)

Umowa licencyjna Groq

Za wprowadzeniem produktu na rynek kryje się ważna umowa licencyjna. Według The Information Nvidia osiągnęła pod koniec 2025 roku umowę licencyjną z Groq o wartości 20 miliardów dolarów – niewyłączną umowę, która sprowadziła do Nvidii także inżynierów założycieli Groq.

W rezultacie udzielenie licencji na własność intelektualną zamiast przejęcia firmy pozwoliło Nvidii ominąć kontrolę antymonopolową, jednocześnie zabezpieczając technologię.

Jednak poza samą umową wprowadzenie LPX zmienia się. Wewnętrzny plan działania Nvidii. Ogłoszony wcześniej we wrześniu 2025 r. układ Rubin CPX – wyspecjalizowany procesor graficzny do wnioskowania w długim kontekście – został pozbawiony priorytetu na rzecz podejścia opartego na Groq.

Ponadto według ujawnień finansowych spółki Nvidia odnotowała rekordowe przychody w wysokości 215,9 miliarda dolarów w roku finansowym 2026, zapewniając elastyczność w zakresie pokrycia kosztów licencji.

Z kolei Sid Sheth, dyrektor generalny d-Matrix – firmy konkurent w wnioskowaniu opartym na SRAM – poinformowano IEEE Spectrum Nvidia „potwierdza znaczenie architektur opartych na SRAM dla wnioskowania na dużą skalę”, dodając, że d-Matrix zwiększył gęstość SRAM bardziej niż ktokolwiek inny.

Dostępność i ekosystem

Dostawa za pośrednictwem dostawców usług w chmurze i producentów OEM zaplanowana jest na drugą połowę 2026 r.. LPX znajduje się obok platformy Vera Rubin NVL72 – platformy zaprezentowanej na targach GTC 2025 – szafy na procesory Vera i szafy pamięci masowej BlueField-4 STX. Konfiguracje można skalować do ponad 1000 jednostek LPU w celu uzyskania hiperskalowych klastrów wnioskowania.

W międzyczasie Sheth zauważył, że „zwycięskie systemy będą łączyć różne typy krzemu” i instalować się w istniejących centrach danych obok procesorów graficznych. Koncentrując się na obciążeniach związanych z kodowaniem AI i zadaniach agenta o długim kontekście, LPX wkracza na rynek, na którym AWS i Cerebras osobno wprowadziły równoległe podejście do wnioskowania zdezagregowanego na kilka dni przed GTC 2026, co sugeruje, że ten wzorzec architektury staje się konsensusem branżowym.

Categories: IT Info