TL;DR
Ny modell: Cohere lanserte Transcribe, en åpen kildekode-talegjenkjenningsmodell med to milliarder parametre som topper Hugging Face Open ASR-poengoversikten. Nøkkeldetaljer: Modellen støtter 14 språk, kjører på GPU-er av forbrukerkvalitet og er tilgjengelig under en Apache 2.0-lisens. Enterprise Play: Cohere planlegger å integrere Transcribe med sin North enterprise-plattform når den nærmer seg en potensiell børsnotering på $240 millioner i årlig gjentakende inntekt.
Fem talegjenkjenningsmodeller sitter nå innenfor et halvt prosentpoeng fra hverandre på Hugging Face Open ASR leaderboard, og torsdag tok en ny deltaker toppplassen. Cohere ga ut Transcribe, en åpen kildekodemodell på 2 milliarder parametre som bedriftens AI-selskap sier oppnår den laveste ordfeilfrekvensen av noen modell i referanseindeksen. Utviklere som bygger callsenterverktøy, apper for notater og taleagenter får et gratis alternativ til kommersielle transkripsjonstjenester.
Med en gjennomsnittlig ordfeilrate på 5,42, ligger Transkriberer foran Zoom Scribe v1, IBM Granite 4.0 1B Speech, ElevenLabs Scribe v2 og OpenAI Whisper Large v3. Selv om Cohere tidligere har fokusert på tekstbaserte språkmodeller, markerer utgivelsen sin første inntreden i stemme-AI.
Bemerkelsesverdig er vekter tilgjengelige under lisens for Apeache, og Face-modellen 0-utviklere kan også lastes ned på Hugging the Face. Coheres API uten kostnad.
Transkriberens tekniske profil og benchmark-ytelse
Transcribe er bygget på en konformer-basert koder-dekoder-arkitektur, og har 2 milliarder parametere og er designet for å kjøre på GPU-er av forbrukerkvalitet. Det kompakte fotavtrykket betyr at organisasjoner som trenger talegjenkjenning på stedet, kan være vert for modellen selv, noe som reduserer distribusjonsbarrierer sammenlignet med kommersielle alternativer som bare er skybaserte. Fjorten språk støttes, inkludert engelsk, fransk, tysk, italiensk, spansk, portugisisk, gresk, nederlandsk, polsk, kinesisk, japansk, koreansk, vietnamesisk og arabisk.
I tillegg sier Cohere at modellen behandler 525 minutter med lyd per minutt, beskriver selskapets parametere høye lyd per minutt. Gjennomstrømningskrav avhenger av maskinvare-og batchinnstillinger og har ikke blitt uavhengig validert.
I følge Coheres egne menneskelige evalueringer som vurderer nøyaktighet, sammenheng og brukervennlighet, oppnådde Transcribe en gjennomsnittlig gevinstrate på 61 % mot konkurrerende modeller. Spesielt på engelsk ga den en 78 % gevinstrate over IBM Granite 4.0 1B Speech og 64 % over OpenAI Whisper Large v3.
Men dens smaleste engelske margin var 51 % mot Scrib v2. IBM lanserte sin Granite 4.0 1B Speech-modell bare ti dager tidligere 16. mars, noe som understreker hvor raskt ASR-feltet med åpen kildekode går fremover. Nvidias Parakeet-modell hadde tidligere hatt den øverste ASR-ledertavlen før transkribering kom. Som et resultat kan det hende at ubehandlede ordfeilfrekvens alene ikke lenger tjener som en avgjørende differensiator for bedrifter som evaluerer talegjenkjenning. Utvalgskriteriene skifter i økende grad mot distribusjonsfleksibilitet, priser og flerspråklig dekning. I tillegg tegner Coheres flerspråklige evalueringsdata et mer blandet bilde. I følge selskapets benchmarks oppnådde Transcribe en vinnerrate på 44 % på tysk og 48 % på både spansk og portugisisk, og falt bak rivalene på tre av de fjorten støttede språkene. I kontrast viser Coheres evalueringsdata at japansk nådde 70 % og italiensk 60 %, noe som peker på ujevne styrker på tvers av språkfamiliene. Standard leaderboard benchmarks, som sjelden fanger opp domenespesifikke vokabular eller støyende feltopptak, gjenspeiler kanskje ikke fullt ut ytelsesforskjeller i den virkelige verden. På grunnlag av disse testdataene, bemerket Paige Dickie, visepresident i Radical Ventures, en Cohere-investor, at Transcribe leverte høy transkripsjonshastighet i testbehandling. Hun beskrev modellen som åpningsmuligheter for sanntidsprodukter og arbeidsflyter. Transkribering er tilgjengelig via Coheres API gratis, selv om produksjonsdistribusjoner uten satsgrenser krever en dedikert forekomst på Model Vault, Coheres administrerte slutningsplattform med volum, pr. Cohere jobber også mot en dypere integrasjon av Transcribe med North, bedrifts-AI-plattformen for regulerte bransjer som ble avduket i januar 2025. Denne integrasjonen vil legge til talefunksjoner til automatiserte arbeidsflyter som for øyeblikket kun håndterer tekstbaserte inndata. verdien er ca. href=”https://www.rainmakersecurities.com/company-profiles/cohere-pre-ipo”target=”_blank”>7 milliarder USD etter en pengeinnsamling på USD 600 millioner i 2025, med omtrent 85 % av inntektene fra private sky-implementeringer. Ved å utvide til tale, posisjonerer Cohere sin potensielle arbeidsplattform for tekst-og talekunder en enkeltstående arbeidsplattform for en enkelt arbeidsplattform. foran en offentlig notering. For et bedriftsmarked som i økende grad krever multimodal AI fra én enkelt leverandør, kan denne bredden vise seg å være en mer varig konkurransefordel enn noen referanseledende potensielle kunder. I mellomtiden kommer Coheres stemmeinngang på en travel dag for åpen kildekode tale AI. Mistral lanserte sin Voxtral åpen kildekode-stemmemodell på samme dato, en tekst-til-tale-modell rettet mot et annet segment av talerørledningen. Enterprise-kunder vil kunne evaluere om Transcribe kan håndtere produksjonsarbeidsbelastninger utover benchmarkbetingelser når Cohere leverer North Voice-integrasjonen senere i 2026.Enterprise Strategy and Outlook