TL;DR

Wnioskowanie na dużą skalę: platforma Dynamo firmy NVIDIA dezagreguje fazy wstępnego wypełniania i dekodowania w klastrach GPU, aby wyeliminować wąskie gardła związane z opóźnieniami i osiągnąć teoretyczne limity sprzętowe. Dostęp dla programistów: Platforma Brev zapewnia programistom bezpośredni dostęp SSH do infrastruktury GPU i wprowadziła lokalne zdalne zarządzanie DGX Spark na targach CES 2026. Obciążenia agentowe: Zarówno Dynamo, jak i Brev obierają za cel autonomicznych agentów AI, którzy działają przez dziesiątki minut i generują znacznie więcej tokenów niż wymiany konwersacyjne. Efektywność kosztowa: obsługa dużych modeli AI na sprzęcie GB200 NVL72 kosztuje około 35 razy mniej na token niż w przypadku poprzedniej generacji Hopperów.

W noc poprzedzającą prezentację firmy NVIDIA na GTC 2025 współzałożyciel Brev.dev, Nader Khalil, o 1 w nocy wciąż naklejał naklejki na deski surfingowe na sprzęcie, co było tego rodzaju drobnym szczegółem, który oddaje energię startową, którą NVIDIA wchłonęła po przejęciu Brev.

To przejęcie znajduje się obecnie w centrum zainteresowania firmy szersza historia inżynierii: zarówno platforma wnioskowania Dynamo, jak i platforma programistyczna Brev skupiają się na problemie, który inżynierowie firmy NVIDIA nazywają „SOL”, co jest skrótem od prędkości światła. Koncepcja ukuta przez Jensena Huanga oznacza wyeliminowanie wszystkiego, co uniemożliwia systemowi osiągnięcie teoretycznego maksimum. Khalil i Kyle Kranen, kierownicy inżynierii w Dynamo, wyjaśniają pełny obraz w nowym wywiadzie dla podcastu Latent Space.

„SOL to termin, którego Jensen używa do zainicjowania ważnego wydarzenia. Mówisz, że właśnie w tym miejscu musimy się znaleźć. Jak się tam dostaniemy? Jakie jest minimum — tyle, ile to konieczne, jak najmniej — co jest potrzebne, abyśmy dotarli dokładnie tutaj.”

Kyle Kranen, kierownik ds. inżynierii i architekt, NVIDIA Dynamo (przez Przestrzeń ukryta)

Khalil ujmuje tę samą koncepcję w kategoriach fizyki, zauważając, że „prędkość światła porusza się z określoną prędkością. Jeśli więc coś porusza się wolniej, wiesz, że coś stoi na przeszkodzie”.

Implikacja jest precyzyjna: każda luka między wydajnością teoretyczną a obserwowaną stanowi ograniczenie, które należy zidentyfikować i usunąć, niezależnie od tego, czy występuje w połączeniach sprzętowych, logice planowania czy programisty narzędzi.

Fizyka skali

To ograniczenie staje się konkretne w momencie, gdy obciążenie przekracza pojedynczy węzeł GPU. Domeny H100 NVLink obsługują maksymalnie osiem procesorów graficznych. Poza tą granicą komunikacja między procesorami graficznymi musi przebiegać przez InfiniBand, który zapewnia przepustowość jednokierunkową około 50 GB/s, co stanowi 10-krotny spadek w porównaniu z szybkością około 500 GB/s NVLink, która staje się droższa przy każdym żądaniu przekraczającym granice szafy. Ten fizyczny pułap nie jest problemem z oprogramowaniem; dlatego też każde poważne obciążenie związane z wnioskowaniem na dużą skalę wymaga przemyślanej orkiestracji uwzględniającej sprzęt na wielu węzłach.

W przypadku nowszego sprzętu ekonomika znacznie się zmienia. Obsługa dużych modeli sztucznej inteligencji, takich jak DeepSeek R1, w systemie NVL72 GB200 kosztuje około 35 razy mniej za token w porównaniu ze sprzętem generacji Hopper, lukę wynikającą z optymalizacji szerokiej równoległości eksperckiej, która GB200 umożliwia. Funkcja Multi-head Latent Attention firmy DeepSeek kompresuje okno kontekstowe zawierające 128 000 tokenów do około 8 GB pamięci w porównaniu z 40–80 GB w przypadku modelu Lamy porównywalnej wielkości z tą samą precyzją. Ten wzrost kompresji znacząco zmienia ekonomikę wnioskowania w długim kontekście na dużą skalę.

Dynamo: warstwa operacyjna wnioskowania firmy NVIDIA

Dokładnie do tego stworzono Dynamo, aby zamknąć tę lukę w skali centrum danych. Kranen, który wcześniej zarządzał platformą AI Foundation Models firmy NVIDIA, powiedział firmie Latent Space, że Dynamo to „silnik wnioskowania na skalę centrum danych”, zaprojektowany tak, aby „sprawiać, że wszystko działa szybciej, ponieważ można wykorzystać efekt skali”. Struktura działa w oparciu o silniki wnioskowania, takie jak vLLM i TensorRT-LLM, dodając rozproszoną orkiestrację na skalę centrum danych, której same te struktury nie są w stanie zapewnić.

Wstępne wypełnienie Dynamo a dezagregacja dekodowania rozdziela każdą fazę pomiędzy oddzielne procesy robocze procesora graficznego, dzięki czemu mogą one być skalowane niezależnie w klastrze. Architektonicznym uzasadnieniem jest asymetria: wstępne wypełnienie jest powiązane z obliczeniami, podczas gdy dekodowanie wykonuje pełne przejście przez wszystkie wagi modelu i całą sekwencję na każdym kroku, co powoduje, że jest on powiązany z pamięcią.

Ta dezagregacja w połączeniu z orkiestracją opartą na Kubernetesie tworzy optymalizacje łączenia na dużą skalę. Zasada ta dotyczy także dedykowanego krzemu, takiego jak akcelerator wstępnego napełniania Rubin CPX firmy NVIDIA, ogłoszony we wrześniu 2025 r. dla tej fazy związanej z obliczeniami. Według dyrektora produktu AI w firmie Gcore, dostawca infrastruktury chmurowej, firma Gcore, zintegrowała Dynamo jako usługę zarządzaną i odkrył, że nawet niewielkie nieefektywności w harmonogramie przekładają się bezpośrednio na opóźnienia w ogonie i kary za przepustowość na dużą skalę. Seva Vayner.

Grove i biblioteka transferowa KV

Dwa dodatkowe komponenty pogłębiają stos wnioskowania dodatku Dynamo. Grove to rozszerzenie Kubernetes, które obsługuje dynamiczne skalowanie puli procesów roboczych, zastępując starszy standard Leader Worker Set i umożliwiając dostosowanie stosunku procesów roboczych zajmujących się wstępnym wypełnianiem do dekodowania w miarę zmiany charakterystyki obciążenia w ciągu dnia.

Biblioteka transferu wnioskowania NVIDIA (NITL) obsługuje transfery pamięci podręcznej KV pomiędzy zdezagregowanymi węzłami wstępnego wypełniania i dekodowania, zmniejszając obciążenie przepustowości, które w przeciwnym razie czyniłoby dezagregację niepraktyczną przy długich kontekstach. Długotrwali agenci sztucznej inteligencji, których według Anthropic Claude Code działa autonomicznie przez 20 do 45 minut w środowisku produkcyjnym, dokładnie odzwierciedlają obciążenia, do obsługi których te komponenty zostały stworzone.

Brev: Developer Gateway to the Cluster

Podczas gdy Dynamo optymalizuje wnioskowanie po stronie klastra, Brev abstrahuje od zapewniania GPU dla programistów, którzy potrzebują dostępu do sprzętu bez jego obsługi.

Khalil opisuje swój klucz założeniem jako bezpośredni dostęp do GPU SSH dla programistów. „Łączymy kilka różnych źródeł GPU” – powiedział Laten Space, a Launchables umożliwia wdrażanie jednym kliknięciem dowolnego stosu oprogramowania działającego na procesorach graficznych.

Dwa dodatki na targach CES 2026 rozszerzyły Brev na sprzęt osobisty. Użytkownicy mogą teraz zarejestrować lokalny procesor graficzny DGX Spark i zarządzać nim zdalnie z dowolnej lokalizacji, traktując domową stację roboczą jako węzeł w chmurze. NVIDIA Sync otacza połączenie SSH w interfejsie CLI dla programistów niezaznajomionych z infrastrukturą GPU.

Router modelu Brev, również zaprezentowany na targach CES, dynamicznie kieruje zapytania między modelem lokalnym na urządzeniu a podstawowym modelem w chmurze, wybierając lepszą opcję na zapytanie i zacierając granicę między wnioskowaniem brzegowym a chmurą na poziomie indywidualnego żądania.

Tworzenie na miarę ery agentyczności

Oba narzędzia są ze sobą zbieżne pojedynczy wyłaniający się wzorzec obciążenia: autonomiczni agenci, którzy działają przez dziesiątki minut i generują o rząd wielkości więcej tokenów niż wymiana konwersacyjna. Khalil zauważył, że symboliczny popyt jest nienasycony; każda poprawa wydajności powoduje jedynie wzrost ogólnego zużycia w miarę upływu czasu. Sama NVIDIA wdraża Kodeks OpenAI na dużą skalę wśród dziesiątek tysięcy pracowników, a Jensen Huang kieruje jego wdrażaniem w całej firmie poprzez kulturę otwartej poczty e-mail, choć ostatnio zostało to ograniczone.

Pytanie bezpieczeństwa towarzyszące tej skali to jedna klatka Khalila z trzyczęściową taksonomią.

„Agenci mogą zrobić trzy rzeczy. Mogą uzyskać dostęp do Twoich plików, uzyskać dostęp do Internetu, a następnie mogą napisać niestandardowy kod i go wykonać. Dosłownie pozwól agentowi robić tylko dwie z tych trzech rzeczy.”

Nader Khalil, dyrektor ds. relacji z programistami, NVIDIA Brev (za pośrednictwem Latent Space)

Wdrożenia firmy NVIDIA odzwierciedlają to ograniczenie. Wewnętrzni agenci połączeni z klastrami obliczeniowymi wykonują automatyczną konfigurację Dynamo, uzyskując obliczenia, kolejkując testy obciążenia i zwracając optymalną konfigurację wnioskowania za jednym razem. To zadanie wymagało wcześniej zaangażowania zaangażowanych inżynierów w infrastrukturę materiałową.

Co dalej

Wykorzystując ten impet, konferencja Nivida GTC San Jose 2026 obejmie około 20 sesji związanych z Dynamo, podczas których Kranen zaprezentuje ogólny samouczek wraz z głównym premierem Harrym i dedykowanym sesja poświęcona przyspieszaniu agentów w wnioskowaniu produkcyjnym.

Skala tego programu pokazuje, jak szybko ekosystem rozrósł się od czasu prezentacji Dynamo na konferencji GTC 2025. Według Kranena w podcaście Latent Space okna kontekstowe mogą przekroczyć 10, 20 milionów, a nawet sto milionów tokeny poprzez coś, co nazywa „nieskrępowanym”, co stanowi skok techniczny, który opisuje po prostu jako „po prostu naukę”.

Wcześniejsze informacje i kontekst

Jak poinformował WinBuzzer na konferencji GTC 2025, NVIDIA po raz pierwszy wprowadziła Dynamo wraz z platformą fabryczną Blackwell Ultra AI. Procesor graficzny RTX Pro 6000 Blackwell do stacji roboczych, wprowadzony na rynek w sierpniu 2025 r. w cenie 8000 USD z 96 GB pamięci VRAM, reprezentuje najwyższej klasy stację roboczą, na której opiera się lokalna strategia wnioskowania Brev. Oczekuje się, że akcelerator Rubin CPX do wstępnego napełniania, ogłoszony we wrześniu 2025 r. jako dedykowany krzem do dezagregacji oprogramowania Dynamo, pojawi się w drugiej połowie 2026 r.

Kranen charakteryzuje rok 2026 jako rok „systemu jako modelu”, w którym skoordynowany zestaw wyspecjalizowanych modeli i komponentów routingu zastępuje pojedynczy model monolityczny. For enterprises building agentic systems, that architectural shift determines which operators can afford agentic workloads at production scale before the traffic surge fully materializes.

Categories: IT Info