TL;DR
Ny benchmark: ARC Prize Foundation lanserte ARC-AGI-3, en interaktiv benchmark som tilbyr over $2 millioner til enhver AI som matcher menneskelig resonnement. Near-Zero Scores: Every frontier model scored below 1%, with Google’s Gemini 3.1 Pro leading at just 0.37% while humans achieve 100%. Designskifte: Benchmark erstatter statiske oppgaver med interaktive miljøer som krever at agenter lærer fra bunnen av uten instruksjoner eller treningsdata. AGI Debate: The results directly challenge recent industry claims that artificial general intelligence has already been achieved.
25. mars ga ARC Prize Foundation ut ARC-AGI-3, en ny interaktiv benchmark som tilbyr over $2 millioner i premier til enhver AI som kan matche utrente mennesker på nye resonneringsoppgaver. I følge stiftelsens første ledertavle har ingen frontiermodell skåret over 0,37 %.
ARC-AGI-3 ble lansert ved Y Combinators San Francisco-hovedkvarter og markerer et skifte fra det statiske puslespillformatet til forgjengerne. I henhold til stiftelsens benchmarkside, scorer mennesker 100 % på sine interaktive miljøer, mens den toppytende frontier AI klarer bare 0,37 %.
Det gapet avslører et skille mellom memorering og genuin resonnement som AI-bransjen ennå ikke har lukket. En høy poengsum på ARC-AGI-3 kan tjene som bevis på kunstig generell intelligens (AGI), som krever at agenter resonnerer gjennom ukjente situasjoner og generaliserer til problemer de ikke eksplisitt er opplært til å løse, en terskel som dagens systemer fortsatt er langt unna å nå.
Hvordan Benchmark Works
er den første interaktive referansen i GI-A. serie, som erstatter de rutenettbaserte visuelle gåtene fra tidligere versjoner med hundrevis av interaktive miljøer og mer enn tusen videospilllignende scenarier. A team of human game designers handcrafted each environment, which contains no instructions, no rules, and no stated goals. AI-agenter må utforske hver verden uavhengig, finne ut hvordan den fungerer, oppdage vinnerforhold og føre læringen videre på tvers av stadig vanskeligere nivåer.
I stedet for å måle om en AI kan produsere et riktig endelig svar, evaluerer ARC-AGI-3 hvor effektivt agenter lærer nye ferdigheter fra bunnen av. Agenter må lære av erfaring i hvert miljø, oppfatte hva som betyr noe, velge handlinger og tilpasse strategien sin uten å stole på instruksjoner på naturlige språk.
I tillegg utnytter hvert miljø kun kjernekunnskapsmodeller, og sikrer at ingen ekstern kunnskapsmodeller kan læres og forutsettes utenat. data. Ved å teste intelligens over tid i stedet for bare endelige svar, fanger ARC-AGI-3 opp planleggingshorisonter, tilstandssporing og evnen til å oppdatere overbevisninger etter hvert som nye bevis dukker opp.
Medgründer François Chollet ser på dette designet som målrettet mot et kjerneskille mellom intelligens og ren beregning.
kan alltid
oppnå en effektiv memorl“. oppslagstabell over alt du trenger å gjøre. Intelligence er effektiviteten som du kommer til å forstå nye ting med, nye oppgaver som du aldri har sett før.”
François Chollet, AI-forsker og medstifter av ARC Prize Foundation (via Bedrift)
Bygger på dette rammeverket, et effektivitetsbasert scoringsrammeverk kalt RHAE bruker menneskelig handlingsbaselines som standard: agenter som når mål ved å bruke færre, mer effektive trinn tjener høyere poengsum, med skapere som er kvalifisert for hele eller deler av en premie på $1 million. ARC Prize Foundations tekniske papir beskriver hvordan RHAE fordeler straffen for ineffektivitet, noe som betyr at en AI som tar 10 ganger så mange handlinger som et menneske scorer bare 1%.
Et internt spillstudio skapte 135 originale interaktive miljøer, med 110 holdt private for å forhindre spilling og 25 utgitt offentlig for praksis. Nyhet i hvert miljø forhindrer memorering med brute force, og sikrer at bare ekte læringsevne gir meningsfulle poengsummer.
Uten forhåndslastet kunnskap eller skjulte forespørsler tilgjengelig for AI-agenter, måler benchmark effektiviteten av ferdighetstilegnelse over tid, langhorisontplanlegging med sparsom tilbakemelding, og sanntidstilpasning til nye regelsystemer.
Fronthiersystemer. Ytelse
På ARC-AGI-3s ledertavle, ifølge ARC Prize Foundation, ledet Googles Gemini 3.1 Pro med 0,37 %, etterfulgt av OpenAI’s GPT-02’s og Claude’s GPT-02’s. 4.6 at 0.25%.
Meanwhile, xAI’s Grok 4.20 scored 0%, failing to complete any environment as efficiently as a human tester. I tidligere ARC-benchmarks navigerte mennesker relativt enkelt i oppgaver mens mange AI-systemer slet, men ARC-AGI-3 utvidet skillet til sin største margin til nå.
I følge ARC Prize Foundation er alle miljøer Fast Company)
ARC-AGI-3s resultater kommer dager etter Nvidia-sjef Jensen Huang fortalte Lex Fridmans podcast at AGI er oppnådd, en påstand som referanseindeksens nesten null resultater direkte utfordrer. Frontier-modeller som utmerker seg med språk-og kodeoppgaver mislykkes når de blir strippet for treningsdatamønstre og tvunget til å resonnere fra bunnen av.
Som et resultat kompliserer denne frakoblingen bransjekrav, inkludert fra selskaper som har knyttet AGI til et profittmål. For utviklere og forskere er implikasjonen at dagens skaleringstilnærminger kan være utilstrekkelige til å produsere systemer som virkelig kan tilpasse seg nye situasjoner slik mennesker kan.
Fra statiske gåter til interaktive verdener
François Chollet og Zapier medgrunnlegger av Mike ARC Prize Foundation. Chollet slapp den første ARC-testen i 2019, da transformatorarkitekturen som driver dagens ledende AI-modeller var knapt ett år gammel.
Da ARC-1 ble lansert, løste AI-modeller nesten ingen av gåtene fordi de var helt nye, og krevde genuin resonnement i stedet for mønstertilpasning. Etter hvert som AI-funksjonene ble avansert, forutså og sporet tidligere ARC-AGI-referanser store gjennombrudd, fra resonneringsmodeller til kodingsagenter.
Referansemetning drev hoppet til ARC-AGI-3. I følge ARC Prize Foundations bekreftede resultater, på ARC-AGI-2, nådde Googles Gemini 3 Deep Think 84,6 %.
Men Gemini 3.1 Pro scoret 77,1 % på den samme referansen. I henhold til ARC Prize Foundations ledertavledata, med ARC-AGI-3, falt alle disse modellene til under 1 %, noe som viser at tidligere høye poengsum reflekterte optimalisering for et spesifikt testformat i stedet for ekte adaptiv resonnement. Hver nye versjon tilbakestiller resultattavlen, og tvinger laboratorier til å demonstrere reell fremgang i stedet for gradvise finjusteringsgevinster.
I 2024 tiltrakk ARC Prize-konkurransen 1430 lag. Fjorårets utgave trakk over 1 700 lag, noe som gjenspeiler økende interesse for AGI-måling fra både akademiske forskere og bransjeutøvere.
ARC Prize 2026 går over tre konkurransespor-deltakere fra 26. mars til og med 2. november 2. spill ARC-AGI-3-spill. En ARC-AGI-2 Grand Prize er garantert i 2026, som skal deles ut for den beste åpen kildekode-løsningen.
I tillegg donerte Andy Konwinskis Laude Institute 000 $ Slingshot-programmet, som legger til den kombinerte premiepotten som spenner over både ARC-AGI-2 Grand Prize og de nye ARC-AGI-3-konkurransebanene.
På lanseringsarrangementet holdt Chollet og OpenAI-sjef Sam Altman en brannkantsamtale om måling av intelligens på veien til AGI. Chollet bemerket at ARC-AGI-3 ikke kan spilles gjennom memorering, ettersom agenter må utforske hvert miljø uavhengig, og avsløre AIs fortsatte avhengighet av treningsdatamaler der mennesker tilpasser seg naturlig.
ARC-AGI-3 kan
Når vi ser fremover, jobber ARC Prize Foundation allerede med ARC-GIA-4 og ARC-A-4-versjon og5-a-A-4.>