TL;DR
Ny utgivelse: Google ga ut Gemma 4, en familie av fire åpne AI-modeller bygget på Gemini 3-teknologi, alt fra avanserte enheter til arbeidsstasjons-GPUer. Lisensendring: Google byttet fra sin restriktive tilpassede lisens til Apache 2.0, og fjernet kommersielle begrensninger og ga utviklere full kontroll over dataene og modellene deres. Ytelsessprang: 31B-modellen oppnådde 89,2 % på AIME 2026 og 86,4 % på agent tau2-benk, opp fra 20,8 % og 6,6 % i forrige Gemma 3-generasjon. Edge-evne: E2B-og E4B-kantmodellene kjører helt offline på smarttelefoner og Raspberry Pi-kort, og fungerer opptil 4 ganger raskere enn tidligere Gemma-versjoner. Tilgjengelighet: Gemma 4-vekter kan lastes ned fra Hugging Face, Kaggle og Ollama, med distribusjonsalternativer inkludert Google Cloud, NVIDIA RTX GPUer og AI Edge Gallery.
Google slipper Gemma 4, en familie på fire åpenvekts AI-modeller bygget på Gemini 3-teknologien, tilgjengelig under den tillatelige Apache 2.0-lisensen for første gang. Modellene spenner fra kantvarianter med 2 milliarder parametre som kjører på smarttelefoner til en modell med 31 milliarder parametre som målretter arbeidsstasjons-GPUer.
Utgivelsen markerer et strategisk skifte for Googles åpne modellprogram. Utover å destillere sin proprietære Gemini 3-forskning på nedlastbare vekter, forlater Google sin restriktive tilpassede Gemma-lisens til fordel for Apache 2.0, og fjerner kommersielle restriksjoner som tidligere krevde at utviklere skulle videreføre Googles vilkår og forbød visse applikasjoner. Ifølge Google har Gemma-familien blitt lastet ned over 400 millioner ganger med mer enn 100 000 fellesskapsskapte varianter, noe som gir Google et stort utviklerøkosystem som nå opererer med færre juridiske begrensninger.
Gemma 4 modellfamilie og teknisk arkitektur
Gemma 4 kommer i fire størrelser: E2B og E4B for kantenheter, en 26B blanding av arbeidsmodeller 1, Dense a 3) modell, Dense a E3-modellen. Edgemodellene er designet for å kjøre på telefoner, Raspberry Pi-kort og Jetson Nano-enheter helt offline med nesten null ventetid. De større 26B-og 31B-variantene er optimalisert for forbruker-GPU-er, rettet mot studenter, forskere og utviklere som bygger lokale AI-servere. Google bemerket at Pixel-teamet jobbet tett med Qualcomm og MediaTek for å optimalisere kantmodellene for mobile brikkesett.
26B MoE-modellen bruker en arkitektur med 128 små eksperter, og aktiverer 8 per token pluss én delt vedvarende ekspert. Denne designen betyr at modellen bare har 3,8 milliarder aktive parametere under inferens til tross for dens totale 26 milliarder parametere, og leverer høyere tokens per sekund enn tette modeller av lignende størrelse. Begge arbeidsstasjonsmodellene støtter tekst-og bildeinndata med 256K-token kontekstvinduer, ved hjelp av en hybrid oppmerksomhetsmekanisme som interleaver lokal skyvevindu oppmerksomhet med full global oppmerksomhet.
Arbeidsstasjonsmodellene kjører ukvantisert i bfloat16-format på en enkelt 80 GB NVIDIA H100 GPU. Google sender Quantization-Aware Training (QAT) sjekkpunkter for lavere presisjonsimplementering på forbrukermaskinvare. Edge-modeller mottar kontekstvinduer på 128 000 token, og Google rapporterte at E2B-og E4B-modellene er opptil 4 ganger raskere enn tidligere Gemma-versjoner mens de bruker opptil 60 % mindre batteri.
Alle fire modellene støtter multimodal resonnering på tvers av tekst, bilder og video, noe som gjør dem egnet for optisk tegngjenkjenning og dokumentanalyse. Kantvariantene legger til innfødt talegjenkjenning og lydbehandling. Gemma 4 inkluderer native funksjonskall og strukturert JSON-utdata for agentiske arbeidsflyter, med støtte for 140 språk og muligheten til å generere kode offline. Google DeepMind-sjef Demis Hassabis kalte dem”de beste åpne modellene i verden for deres respektive størrelser.”
Referansegevinster over Gemma 3
Ytelsesforbedringer i forhold til Gemma 3 er betydelige i alle målte kategorier. Google sier at 31B-modellen vil debutere som nummer tre på Arena-listen over topp åpne AI-modeller, og slå modellene 20 ganger størrelsen. 31B scoret 1452 mot Gemma 3 27Bs 1365, og Googles data viser at 31B-modellen nådde 84,3 % på GPQA Diamond vitenskapelig kunnskap, og doblet Gemma 3s 42,4 % poengsum på den samme referansen.
Fordelene er mest dramatiske oppgaven med agenter. I følge Googles benchmarks oppnådde 31B-modellen 89,2 % på AIME 2026 sammenlignet med Gemma 3s 20,8 %, og LiveCodeBench-konkurransekoding hoppet fra 29,1 % til 80,0 %. Agentisk tau2-benk-ytelse sprang fra 6,6 % til 86,4 %, en mer enn 13 ganger forbedring som indikerer at modellene kan håndtere kompleks, flertrinns verktøybruk som forgjengere ikke kunne utføre med produksjonskvalitet.
26B MoE-modellen følger like etter med 88,3 % på AIME 2026 og 77,1 % på LiveCodeBench. Til og med E4B-kantmodellen oppnådde 42,5 % på AIME 2026 og 57,5 % på tau2-benk, ytelsesnivåer som ville vært konkurransedyktige med mye større modeller for bare én generasjon siden. For utviklere som bygger AI-agenter på lokal maskinvare i stedet for sky-API-er, tetter disse resultatene et kapasitetsgap som tidligere gjorde skyvertsbaserte modeller til det eneste praktiske alternativet for agentarbeidsflyter.
Apache 2.0-lisens og konkurransedyktig kontekst
Lisensendringen kan vise seg å være like følgelig som ytelsesgevinsten. Googles tidligere bruksvilkår for Gemma inkluderte en streng policy for forbudt bruk som selskapet kunne oppdatere ensidig, krevde at utviklere skulle håndheve Googles regler på tvers av alle Gemma-baserte prosjekter, og inneholdt klausuler som kunne utvide lisensen til modeller trent med Gemma-genererte syntetiske data. Den forrige lisensen inneholdt også tilpassede”skadelig bruk”-utskjæringer som krever juridisk tolkning før bedriftsadopsjon. Apache 2.0 fjerner disse begrensningene fullstendig, og tilpasser Gemma med de samme tillatende vilkårene som styrer bredt vedtatte åpen kildekode-prosjekter som TensorFlow og Kubernetes.
Google utformet bryteren som å gi utviklere full kontroll over dataene deres, infrastrukturen og modellene deres, og beskrev det som muliggjør «
] [embedd> digitalt innhold]
Holger Mueller fra Constellation Research tilbød en bredere kontekst for Googles strategiske posisjonering.
“Google bygger sin ledelse innen AI, ikke bare ved å åpne Gemma-modellen med en viktig familie med 4-familien. økosystem av AI-utviklere, og vil hjelpe selskapet med å utnytte funksjonelle og vertikale brukstilfeller på forskjellige enhetsformfaktorer Google satte en høy standard med sin forrige Gemma 3-utgivelse, og derfor er det store forventninger med denne utgivelsen. Lamamodeller for utvikleradopsjon i bedrifts-og forskningsmiljøer. Som et resultat kan Meta forlate sin åpen kildekode Llama-strategi redusere det konkurransepresset over tid. Google opprettholder samtidig proprietære Gemini-modeller for API-inntekter, og posisjonerer seg på begge sider av det åpne versus-lukkede skillet i AI-industrien.
Gemma 4-modeller er tilgjengelige i AI Studio (31B og 26B MoE) og AI Edge Gallery (E4B og E2B), med vekter kan lastes ned fra Hugging Face, Kaggle og Ollama. Utviklere kan også distribuere gjennom Google Cloud, inkludert serverløse Cloud Run-forekomster som skaleres til null når de er inaktive. NVIDIA tilbyr optimalisert distribusjon for RTX GPUer gjennom sitt AI Garage-program, og utvider lokal slutningsstøtte til maskinvare av forbrukerkvalitet.
Google vil også inkludere Gemini 4-og 4-varianter basert på Na2-noB. på Gemma 4s edge-modeller, og markerer den første offisielle bekreftelsen av Nano 4. Den nåværende Gemini Nano 3 som kjører på Pixel-telefoner er basert på Googles tidligere generasjon Gemma 3n, en multimodal AI-modell på enheten som etablerte Googles tilnærming til edge-distribusjon. Hugging Face-medgründer Clement Delangue beskrev Apache 2.0-svitsjen som”en stor milepæl.”