TL;DR
Ytelsesnedgang: AMDs AI-direktør dokumenterte at Claude Code leser kode tre ganger mindre, omskriver filer dobbelt så ofte og forlater oppgaver med tidligere usett hastighet. Grunnårsak: Anthropics redaksjon av tankeinnhold fra mars 2026 reduserte synlig resonnement fra 100 % til null i løpet av bare åtte dager, og utløste atferdskollapsen. Team Churned: AMDs ingeniørteam har allerede byttet til en konkurrerende AI-kodingsleverandør, med henvisning til Claude Codes manglende evne til å håndtere komplekse oppgaver pålitelig. Foreslåtte rettelser: Laurenzo ba Anthropic om å gjenopprette tenkningssynlighet og introdusere et premiumnivå for garantert dyp resonnement. Bredere mønster: Anthropic sendte 14 utgivelser sammen med 5 avbrudd i mars 2026, noe som tyder på at kvalitetssikring ikke har holdt tritt med den raske veksten.
Stella Laurenzo, AMDs direktør for AI, sendte inn et detaljert GitHub-problem 2. april som dokumenterte at Claude Code leser kode tre ganger mindre før han redigerer den, omskriver hele filer dobbelt så ofte, og forlater oppgaver midtveis med hastigheter som tidligere var null. Analysen hennes av nesten 7000 økter setter nøyaktige tall på hvordan Anthropics kodeverktøy har blitt dårligere siden begynnelsen av mars.
Laurenzo, direktør for AI-gruppen hos AMD, analyserte 6852 Claude Code-økter som omfattet 234 760 verktøyanrop og 17 871 tenkeblokker. Analysen hennes gir uvanlig detaljerte kvantitative bevis for at Claude Codes resonnementdybde har avtatt målbart siden Anthropic implementerte tenkeredigering av innhold.
No complex kan ikke betro oppgaven. skrev. Teamet hennes har allerede byttet til en annen leverandør, med henvisning til en NDA for ikke å navngi erstatningen. Anthropic svarte ikke på spørsmål fra The Register om funnene.
The Data Behind the Decline
Laurenzos data avslører en progressiv atferdsdegradering som begynner med progressiv nedbrytning før Utrulling av Anthropics redaksjon. I følge Laurenzos analyse hadde tenkedybden allerede falt med omtrent 67 % i slutten av februar, mens tankeinnholdet fortsatt var fullt synlig for brukerne. Hun karakteriserte dette som et bekymrende tidlig signal om at noe hadde endret seg i hvordan Claude allokerte resonnementressurser.
Anthropic iscenesatte deretter en redaksjonsutrulling i løpet av en enkelt uke. I følge GitHub-arkivet gikk tankeinnholdet fra 100 % synlig 4. mars til 98,5 % 5. mars, og falt deretter til 75,3 % 7. mars.
Men den bratteste kollapsen kom dager senere. I følge Laurenzos øktdata var bare 41,6 % av tenkeinnhold synlig innen 8. mars. Fra 10. til 11. mars var mindre enn 1 % synlige.
Fra 12. mars og utover kunne brukerne ikke se noe av modellens resonneringsprosess. I løpet av dager etter at redaksjonen nådde full distribusjon, kollapset atferdsberegninger over hele linja.
Stopp-hook-brudd steg fra null før 8. mars til 173 på bare 17 dager, som The Register rapporterte. Stopp-hook-brudd oppstår når Claude Code avslutter en oppgave før den fullføres, en atferd som Laurenzos team ikke tidligere hadde observert i flere måneder med sporing.
I mellomtiden hoppet redigeringer som ble utført uten å først lese målfilen fra 6,2 % til 33,7 %, en femdobling som betyr at Claude Code rutinemessig endret koden som den ikke hadde undersøkt parallelt med deCo.
Før degraderingsperioden leste Claude Code gjennom koden i gjennomsnitt 6,6 ganger før han gjorde endringer. Ved utgangen av mars hadde dette tallet sunket til bare 2.
I henhold til problemarkivet doblet omskrivninger av fulle filer seg fra 4,9 % til 11,1 % av alle mutasjoner, noe som indikerer at Claude Code erstattet hele filer i stedet for å gjøre målrettede redigeringer. Alle disse beregningene kommer fra et team som kjører 50+ samtidige agentøkter som driver med systemprogrammering, en arbeidsbelastning som krever vedvarende dype resonnementer på tvers av lange oppgavekjeder.
Laurenzo understreket at teamet hennes opererte i et konsistent miljø med høy kompleksitet, noe som gjør før-og-etter-sammenligningen uvanlig kontrollert for bruksdata fra den virkelige verden. En femdobling av blinde redigeringer kombinert med en tredobling i kodelesedybden betyr at bedriftsteam ikke lenger kan behandle Claude Codes utdata som et pålitelig utgangspunkt for komplekst arbeid.
Som et resultat, for agentiske arbeidsflyter der hvert trinn bygger på det forrige, vil en enkelt grunn resonneringsbeslutning tidlig i en oppgavekjede forverre feil til langt dyrere kaskader enn den opprinnelige oppgaven.
“Når tenkningen er overfladisk, bruker modellen som standard den billigste handlingen som er tilgjengelig: rediger uten å lese, stopp uten å fullføre, unngå ansvar for feil, ta den enkleste løsningen i stedet for den riktige. Dette er nøyaktig symptomene som er observert.”
Stella Laurenzo, direktør for AI Group hos AMD (via GitHub-utgave #42796)
Et mønster av Claude Code-problemer
Laurenzos klage kommer midt i større turbulens for Anthropics kodeverktøy. I slutten av mars erkjente Anthropic problemer med bruksgrense, med selskapet som uttalte at”folk treffer bruksgrensene raskere enn forventet”for bruksgrenser enn forventet på Claude-koden. team.”
Utover etterspørselspresset ser det ut til at problemer med bruksgrenser har dypere tekniske røtter. En utvikler som reverserte Claude Code-binæren, rapporterte at han fant prompte cache-feil som i det stille økte kostnadene med 10-20 ganger. Separat brukte en Claude Max 5-abonnent på $100/måned opp kvoten sin på en enkelt time.
Dessuten er kvalitetsklager før denne hendelsen. Utviklerrapporter om redusert ytelse strekker seg tilbake til september 2025, da brukere flagget Claude Code som utfører destruktive skallkommandoer uten autorisasjon. I januar 2026 beskrev fellesskapsrapporter nedgradering av stille modeller og reduserte grenser for tokenbruk.
I tillegg påvirket en egen feil i februar 2026 versjon 2.1.20, som avkorter forklaringer på hva verktøyet leste. Disse tilbakevendende kvalitetsregresjonene etablerer et mønster som Laurenzos data nå kvantifiserer med presisjon på øktnivå.
Anthropics frakthastighet ser ut til å forsterke pålitelighetsproblemet. Bare i mars sendte selskapet 14 produktutgivelser sammen med 5 strømbrudd, et forhold som sterkt antyder at utgivelseshastigheten har overgått kvalitetssikringskapasiteten. Omsetningen steg 5,5 ganger i samme periode, blant 300 % bruksvekst siden Claude 4 ble lansert.
I motsetning til dette, krysset Claude Code en milliard dollar i årlig inntekt innen seks måneder etter lansering. Denne vekstbanen gjør gapet mellom adopsjonshastighet og modenhet av infrastrukturen til en økende risiko: hver nye bruker forsterker virkningen av hver pålitelighetsregresjon.
Reddits r/ClaudeCode-fellesskap har gjentatt lignende opplevelser på tvers av Laurens bredere opplevelser, og reflekterer synbare opplevelser av prestasjonsforringelse. en bred brukerbase i stedet for et enkelt isolert tilfelle.
Hva kommer deretter
Til tross for at hun byttet bort fra Claude Code, framstilte Laurenzo arkivet som konstruktivt. Hun foreslo to konkrete løsninger: å avsløre antall tanketokener per forespørsel slik at brukere kan overvåke resonneringsdybden, og introdusere et premiumnivå for garantert dyp resonnement der ingeniører som kjører komplekse arbeidsflyter ville betale mer for vedvarende ytelse.
Men hun argumenterte for at en flat abonnementsmodell ikke klarer å betjene brukere som krever mye mer enn tankemengden krever brukere som krever mye mer enn caken. Med tanke-token-budsjetter som varierer etter størrelsesordener mellom enkle spørringer og komplekse ingeniørøkter, må prisstrukturen gjenspeile de faktiske kostnadene ved vedvarende dype resonnementer.
Med utgangspunkt i dette ba Laurenzo også at Anthropic skulle reversere tankeredaksjonen helt, og argumenterte for at innsyn i resonneringsprosesser hjelper til med å finne ut om ingeniørteamet utfører tilstrekkelige oppgavene i sanntid. Uten denne synligheten har teamene ingen mulighet til å skille mellom en modell som resonnerer dypt og en som tar beregningssnarveier, og etterlater ingeniørarbeidsflyter med høy kompleksitet utsatt for stille forringelse.
“Vi har byttet til en annen leverandør som gjør arbeid av overlegen kvalitet, men Claude har vært gode for oss, og Claude har håpet at dette kan løses. produkt.”
Stella Laurenzo, direktør for AI Group hos AMD (via GitHub-utgave #42796)
Laurenzo advarte om at konkurrenter ikke lenger har tettet gapet til Claude som ikke lenger har tettet gapet til Claudes tidligere ledere. resonnementnivå som Opus tidligere okkuperte. Bare dager før innleveringen hennes identifiserte OpenAI Claude Code som den største konkurransetrusselen innen AI-kodeverktøy-området, noe som gjorde denne offentlige kritikken spesielt kommersielt bemerkelsesverdig.
I mellomtiden advarer bransjeobservatører at når utviklere bygger reservemønstre rundt alternative verktøy og omstrukturerer arbeidsflytene deres deretter, har disse bryterne en tendens til å bli permanente snarere enn midlertidige løsninger og et team som allerede er i gang
. data som nå er offentlige, har andre bedriftsingeniørteam som evaluerer deres Claude Code-distribusjoner en kvantitativ målestokk som de kan måle sin egen erfaring mot. Om Anthropic svarer med gjennomsiktighetsrettinger eller lar dataene snakke ubesvart, kan avgjøre hvor raskt mer verdifulle kunder følger AMDs ledelse.