TL;DR

Ny metode: Google publiserte TurboQuant, en KV-bufferkomprimeringsalgoritme som reduserer LLM-minnebruken med 6x uten tap av nøyaktighet. Slik fungerer det: Den dataglemte algoritmen krever ingen kalibrering eller finjustering, og leverer opptil 8 ganger oppmerksomhetshastighet på H100 GPUer. Fellesskapsadopsjon: Uavhengige utviklere har allerede bygget fungerende implementeringer i Triton, MLX og llama.cpp til tross for ingen offisiell kodeutgivelse fra Google. Konkurranse: Nvidias rivaliserende KVTC-metode oppnår 20x komprimering, men krever kalibrering per modell, og begge debuterer på ICLR 2026.

Å kjøre en 70 milliarder parameter stor språkmodell for 512 samtidige brukere kan forbruke 512 GB hurtigbufferminne alene, nesten fire ganger så mye minne som nødvendig. Google publiserte 25. mars TurboQuant, en KV-bufferkomprimeringsalgoritme som krymper det fotavtrykket med 6x uten tap av nøyaktighet. Uavhengige utviklere bygger allerede fungerende implementeringer fra avisen alene, selv om Google ennå ikke har gitt ut noen offisielle kode-eller integrasjonsbiblioteker.

KV-bufferminneavtrykk skaleres lineært med kontekstlengde, og skaper en av de største flaskehalsene i LLM. Googles TurboQuant-komprimeringsmetode løser dette ved å komprimere hurtigbufferen til 3 biter per kanal ved hjelp av en data-uvitende algoritme som ikke krever kalibrering på GPU opp til 10x. Det 8x-tallet gjelder spesifikt for oppmerksomhetslogit-beregning mot en JAX-grunnlinje, ikke for ende-til-ende inferensgjennomstrømning.

Slik fungerer TurboQuant

TurboQuant kombinerer to følgeteknikker: PolarQuant og Quantized Johnsons (Q.Lstraus Johnsons-Lind) PolarQuant konverterer vektorer fra kartesiske til polare-koordinater, og eliminerer denne normaliseringskonstanten per hode i polare-koordinater, og eliminerer denne normaliseringskonstanten per hode over 1. href=”https://en.wikipedia.org/wiki/Vector_quantization”target=”_blank”>tradisjonell vektorkvantisering. QJL legger til et 1-bits feilkorrigeringstrinn som reduserer hver gjenværende vektor til en enkelt fortegnsbit, og korrigerer skjevheter i indre produktestimater.

En strategi for avvikende behandling allokerer høyere presisjon (3 biter) til avvikende kanaler og lavere presisjon (2 biter) til ikke-avvikende verdier, noe som muliggjør effektive bithastigheter på <3.55 biter eller

25p.

. tilfeldig rotasjon til input-vektorer, TurboQuant induserer en konsentrert Beta-fordeling på hver koordinat uavhengig av de originale dataene. Algoritmen fungerer på en data-oblivious måte, og krever ingen opplæring, finjustering eller kalibrering på spesifikke datasett. Googles forskere beviste at den opererer nær kjente teoretiske nedre grenser for kvantiseringsforvrengning, og kommer innenfor en faktor på omtrent 2,7 av den informasjonsteoretiske grensen.

Ved 1-bits bredde er TurboQuants forvrengning bare en faktor på omtrent 1,45 fra optimal. Ved 3,5 bits per kanal forblir kvaliteten nøytral; ved 2,5 biter er degraderingen marginal.

Operatører som kjører ulike modellporteføljer drar direkte nytte av denne kalibreringsfrie designen, siden standard kvantiseringsmetoder krever justering per modell som multipliserer ingeniøroverhead når organisasjoner distribuerer dusinvis av spesialiserte modeller. TurboQuant eliminerer denne overheaden, og posisjonerer den som en drop-in-optimalisering som fungerer på tvers av arkitekturer uten investering per modell.

Google referanseindekserte TurboQuant mot KIVI, standard grunnlinjen for kvantisering av KV-buffer published at 2_4IC asymmetrisk 2-bits kvantisering med 2,6x minnereduksjon. På Needle-In-A-Haystack-benchmark matchet TurboQuant fullpresisjonsytelse opp til 104 000 tokens under 4x komprimering. Google evaluerte på tvers av LongBench, ZeroSCROLLS, RULER og L-Eval ved bruk av Gemma-, Mistral-og Llama-3.1-8B-Instruct-modeller.

TurboQuant demonstrerer robust KV-cache-komprimeringsytelse på tvers av LongBench-referansen i forhold til ulike komprimeringsmetoder på Llama-3.1-modellene er indikerte instruks (8B-width-modeller). (Kilde: Google)

Å hoppe fra KIVIs 2,6x komprimering til TurboQuants 6x representerer en generasjonsforbedring, men benchmark-omfanget introduserer usikkerhet. I følge papirets evalueringstabeller topper alle testede modeller med omtrent 8 milliarder parametere, og etterlater et åpent spørsmål om hvorvidt garantiene holder på 70B eller 405B skala der KV-bufferstørrelser blir virkelig uoverkommelige og kompresjonsbesparelser vil ha størst betydning for produksjonsoperatører.

TurboQuant illustrerer en betydelig ytelsesøkning i dataoppmerksomhetslogitter i nøkkelverdibufferen på tvers av forskjellige bitbreddenivåer, målt i forhold til den svært optimaliserte JAX-grunnlinjen. (Kilde: Google)

Googles avis dukket først opp på arXiv i april 2025 og vises i forkant av ICLR 2026-presentasjonen i slutten av april. Dens QJL-kompanjong ble publisert på AAAI 2025, mens PolarQuant er satt til presentasjon på AISTATS 2026. Forsker Amir Zandieh og Vahab Mirrokni, en VP og Google Fellow, ledet arbeidet, med samarbeidspartnere fra KAIST og NYU.

Utviklere bygger det

Utviklere bygger det med

Des 3

. fravær av offisiell kode har uavhengige utviklere allerede produsert fungerende implementeringer som validerer papirets påstander. Én utvikler bygde en tilpasset Triton-kjerne i PyTorch, testet på Gemma 3 4B på en RTX 4090 og rapporterte karakteridentisk utgang til den ukomprimerte grunnlinjen med 2-bits presisjon. Med bare 2 bits per verdi, produserte den kvantiserte modellen byte-for-byte identiske svar på fullpresisjonsversjonen, noe som tyder på at TurboQuants teoretiske garantier holder i praksis for mindre modeller.

En egen utvikler fikk TurboQuant kjører på Apple Silicon via MLX med en 35B-modell, og scorer 6 av 6 på nål-i-høystakk-tester på hvert kvantiseringsnivå. I llama.cpp-fellesskapet jobber tre utviklere med C-og CUDA-implementeringer, med en som rapporterer at 18 av 18 tester bestått og komprimeringsforhold som samsvarer med papirets påstander.

Aptering i dette tempoet, før noen offisiell utgivelse, er uvanlig for en forskningsartikkel. Implementeringer som spenner over Triton, MLX og llama.cpp gjenspeiler både klarheten i TurboQuants matematiske formulering og nødvendigheten av KV-bufferoptimalisering som en utrullingsflaskehals.

Å reprodusere algoritmen er ikke enkelt. En tidlig implementer syntes at QJL feilrettingskomponenten var vanskelig å få til, og la merke til at en naiv tilnærming ga søppelutgang. Uten riktig implementering av QJLs skjevhetskorreksjon for indre produktestimater, blir kvantiseringsfeil sammensatt og utdata blir ubrukelige. Google har ikke gitt ut offisiell TurboQuant-kode, og den forblir fraværende fra vLLM, llama.cpp, Ollama og alle større serveringsrammeverk.

Utover LLM-inferens, retter TurboQuant seg også mot vektorsøkeapplikasjoner, der høydimensjonale vektorer som brukes til gjenfinningsutvidet generering og likhetssøk, møter det samme minnetrykket. Indekseringstiden synker til praktisk talt null (0,0013 sekunder for 1536-dimensjonale vektorer mot 239,75 sekunder for produktkvantisering), mens tilbakekallingstall på GloVe overgår produktkvantisering og RabbiQ-grunnlinjer. Google rammer inn TurboQuant som en enhetlig komprimeringsmetode for både KV-buffer-og vektorsøk, selv om mangelen på kodeutgivelse begrenser bruken i begge domenene.

Nvidias KVTC tilbyr en annen avveining

TurboQuant er ikke den eneste KV-cache-komprimeringsmetoden NVIDIA’s NVIDIA’s KVTC2R2. oppnår 20x komprimering med mindre enn 1 prosentpoengs nøyaktighetsstraff, testet på modeller fra 1,5B til 70B parametere, et bredere spekter enn TurboQuants benchmarks på modeller opp til ca.

“Effektiv KV-bufferadministrasjon blir kritisk, ettersom inaktive cacher raskt må avlastes fra GPU-minnet for å imøtekomme andre brukere, og raskt gjenopprettes for gjenopptatte samtaler. Disse infrastrukturkostnadene gjenspeiles nå i kommersiell prissetting (f.eks. som’spørre hurtigbufring’) med tilleggskostnader for hurtigbufring.”

(Adrian Lanvidia, n. href=”https://venturebeat.com/orchestration/nvidia-shrinks-llm-memory-20x-without-changing-model-weights”target=”_blank”>VentureBeat)

KVTC bruker en fundamentalt annerledes tilnærming, ved å bruke PCA-basert dekorrelasjon og entropi-konseptkoding som låner JPEGs. I motsetning til TurboQuants data-uvitende design, krever KVTC et engangs kalibreringstrinn per modell for å beregne en PCA-justeringsmatrise offline. Til gjengjeld reduserer den tiden til første token med opptil 8x på en 8000-token prompt, og faller fra omtrent 3 sekunder til 380 millisekunder på H100-maskinvare.

Tidligere grunnlinjer som KIVI og GEAR led kraftig forringelse av nøyaktigheten ved både 5-x posisjons-og posisjonskompresjon på både 5-x posisjonsoppgave. KVTC som meningsfulle fremskritt i forhold til tidligere metoder.

Å ha to konkurrerende komprimeringsstandarder debuterer på samme konferanse, signaliserer at KV-bufferoptimalisering er i ferd med å modnes fra en forskningsnysgjerrighet til et produksjonsinfrastrukturlag. KIVI, som ble levert med HuggingFace Transformers-integrasjon, hadde vært standardtilnærmingen siden ICML 2024, men dets 2,6x komprimeringstak faller godt under det begge nyere metodene oppnår.

Lancucki spådde”fremveksten av et dedikert, standardisert komprimeringslag er sannsynlige likheter på tvers av modellarkitekturer.”For skyleverandører og LLM-operatører avhenger valget av distribusjonsbegrensninger: TurboQuant tilbyr enkelhet uten kalibrering og en matematisk bevist forvrengningsgrense, mens KVTC leverer vesentlig større råkomprimering på 20x versus 6x, validert over et bredere modellstørrelsesområde. Nvidia lanserte Dynamo som en inferensmotor i datasenterskala i mars 2026, og KVTC integrerer seg med Nvidias Dynamo-inferensmotor med vLLM-kompatibilitet, mens TurboQuants vei til produksjon går gjennom koden for fellesskapet.

Categories: IT Info