TL;DR
Ny metode: Google publiserte TurboQuant, en KV-bufferkomprimeringsalgoritme som reduserer LLM-minnebruken med 6x uten tap av nøyaktighet. Slik fungerer det: Den dataglemte algoritmen krever ingen kalibrering eller finjustering, og leverer opptil 8 ganger oppmerksomhetshastighet på H100 GPUer. Fellesskapsadopsjon: Uavhengige utviklere har allerede bygget fungerende implementeringer i Triton, MLX og llama.cpp til tross for ingen offisiell kodeutgivelse fra Google. Konkurranse: Nvidias rivaliserende KVTC-metode oppnår 20x komprimering, men krever kalibrering per modell, og begge debuterer på ICLR 2026.
Å kjøre en 70 milliarder parameter stor språkmodell for 512 samtidige brukere kan forbruke 512 GB hurtigbufferminne alene, nesten fire ganger så mye minne som nødvendig. Google publiserte 25. mars TurboQuant, en KV-bufferkomprimeringsalgoritme som krymper det fotavtrykket med 6x uten tap av nøyaktighet. Uavhengige utviklere bygger allerede fungerende implementeringer fra avisen alene, selv om Google ennå ikke har gitt ut noen offisielle kode-eller integrasjonsbiblioteker.
KV-bufferminneavtrykk skaleres lineært med kontekstlengde, og skaper en av de største flaskehalsene i LLM. Googles TurboQuant-komprimeringsmetode løser dette ved å komprimere hurtigbufferen til 3 biter per kanal ved hjelp av en data-uvitende algoritme som ikke krever kalibrering på GPU opp til 10x. Det 8x-tallet gjelder spesifikt for oppmerksomhetslogit-beregning mot en JAX-grunnlinje, ikke for ende-til-ende inferensgjennomstrømning.
Slik fungerer TurboQuant
TurboQuant kombinerer to følgeteknikker: PolarQuant og Quantized Johnsons (Q.Lstraus Johnsons-Lind) PolarQuant konverterer vektorer fra kartesiske til polare-koordinater, og eliminerer denne normaliseringskonstanten per hode i polare-koordinater, og eliminerer denne normaliseringskonstanten per hode over 1. href=”https://en.wikipedia.org/wiki/Vector_quantization”target=”_blank”>tradisjonell vektorkvantisering. QJL legger til et 1-bits feilkorrigeringstrinn som reduserer hver gjenværende vektor til en enkelt fortegnsbit, og korrigerer skjevheter i indre produktestimater.
En strategi for avvikende behandling allokerer høyere presisjon (3 biter) til avvikende kanaler og lavere presisjon (2 biter) til ikke-avvikende verdier, noe som muliggjør effektive bithastigheter på <3.55 biter eller
25p.
. tilfeldig rotasjon til input-vektorer, TurboQuant induserer en konsentrert Beta-fordeling på hver koordinat uavhengig av de originale dataene. Algoritmen fungerer på en data-oblivious måte, og krever ingen opplæring, finjustering eller kalibrering på spesifikke datasett. Googles forskere beviste at den opererer nær kjente teoretiske nedre grenser for kvantiseringsforvrengning, og kommer innenfor en faktor på omtrent 2,7 av den informasjonsteoretiske grensen.
Ved 1-bits bredde er TurboQuants forvrengning bare en faktor på omtrent 1,45 fra optimal. Ved 3,5 bits per kanal forblir kvaliteten nøytral; ved 2,5 biter er degraderingen marginal.
Operatører som kjører ulike modellporteføljer drar direkte nytte av denne kalibreringsfrie designen, siden standard kvantiseringsmetoder krever justering per modell som multipliserer ingeniøroverhead når organisasjoner distribuerer dusinvis av spesialiserte modeller. TurboQuant eliminerer denne overheaden, og posisjonerer den som en drop-in-optimalisering som fungerer på tvers av arkitekturer uten investering per modell.
Google referanseindekserte TurboQuant mot KIVI, standard grunnlinjen for kvantisering av KV-buffer published at 2_4IC asymmetrisk 2-bits kvantisering med 2,6x minnereduksjon. På Needle-In-A-Haystack-benchmark matchet TurboQuant fullpresisjonsytelse opp til 104 000 tokens under 4x komprimering. Google evaluerte på tvers av LongBench, ZeroSCROLLS, RULER og L-Eval ved bruk av Gemma-, Mistral-og Llama-3.1-8B-Instruct-modeller.
TurboQuant demonstrerer robust KV-cache-komprimeringsytelse på tvers av LongBench-referansen i forhold til ulike komprimeringsmetoder på Llama-3.1-modellene er indikerte instruks (8B-width-modeller). (Kilde: Google)
Å hoppe fra KIVIs 2,6x komprimering til TurboQuants 6x representerer en generasjonsforbedring, men benchmark-omfanget introduserer usikkerhet. I følge papirets evalueringstabeller topper alle testede modeller med omtrent 8 milliarder parametere, og etterlater et åpent spørsmål om hvorvidt garantiene holder på 70B eller 405B skala der KV-bufferstørrelser blir virkelig uoverkommelige og kompresjonsbesparelser vil ha størst betydning for produksjonsoperatører.
TurboQuant illustrerer en betydelig ytelsesøkning i dataoppmerksomhetslogitter i nøkkelverdibufferen på tvers av forskjellige bitbreddenivåer, målt i forhold til den svært optimaliserte JAX-grunnlinjen. (Kilde: Google)
Googles avis dukket først opp på arXiv i april 2025 og vises i forkant av ICLR 2026-presentasjonen i slutten av april. Dens QJL-kompanjong ble publisert på AAAI 2025, mens PolarQuant er satt til presentasjon på AISTATS 2026. Forsker Amir Zandieh og Vahab Mirrokni, en VP og Google Fellow, ledet arbeidet, med samarbeidspartnere fra KAIST og NYU.