TL;DR

Nowe modele: 2 kwietnia 2026 r. firma Microsoft wprowadziła na rynek trzy wewnętrzne modele sztucznej inteligencji obejmujące transkrypcję mowy, syntezę głosu i generowanie obrazów. Konkurencyjne ceny: ceny wszystkich trzech modeli są niższe od stawek pobieranych przez Amazon i Google za porównywalne usługi, co jest celowym dążeniem do zdobycia obciążeń w chmurze dla przedsiębiorstw. Zmiana strategiczna: Premiery są następstwem renegocjacji umowy Microsoftu dotyczącej OpenAI we wrześniu 2025 r., która umożliwiła firmie niezależne realizowanie własnych, pionierskich modeli sztucznej inteligencji. Małe zespoły: Model audio został zbudowany przez zaledwie 10 osób, co odzwierciedla filozofię dyrektora generalnego Mustafy Suleymana zakładającą mniejsze, silniejsze zespoły inżynieryjne zatrudniające dużą liczbę pracowników. Kontekst dla inwestorów: Akcje Microsoftu spadły o około 17% od początku roku poprzedzającego ogłoszenie, co wywarło presję na firmę, aby wykazała zwrot z wydatków na sztuczną inteligencję.

Po raz pierwszy od rozpoczęcia partnerstwa założycielskiego z OpenAI firma Microsoft udostępnia modele sztucznej inteligencji, które zbudowała całkowicie samodzielnie. Trzy nowe systemy obsługujące transkrypcję mowy, syntezę głosu i generowanie obrazu zostały udostępnione 2 kwietnia 2026 r., a każdy z nich wyceniony na niższą konkurencję z OpenAI, Google i ElevenLabs.

Modele o nazwach MAI-Transcribe-1, MAI-Voice-1 i MAI-Image-2 są już dostępne za pośrednictwem Microsoft Foundry i nowy plac zabaw MAI. Sześć miesięcy po renegocjacji partnerstwa z OpenAI zespół superwywiadu Microsoftu dostarcza modele produkcyjne, które podcinają konkurencję pod względem ceny, jednocześnie utrzymując najwyższe standardy referencyjne, a wszystko to w obliczu 17-procentowego spadku zapasów i presji inwestorów na zwrot z wydatków na sztuczną inteligencję. Wszystkie twierdzenia dotyczące testów porównawczych są zgłaszane samodzielnie przez firmę Microsoft i nie zostały niezależnie zweryfikowane.

Co robią modele i ile kosztują

MAI-Transcribe-1, model zamiany mowy na tekst, osiąga najniższy średni współczynnik błędów słów FLEURS w 25 językach, średnio 3,8% WER. Według własnych testów Microsoftu pokonuje Whisper-large-v3 OpenAI we wszystkich 25 językach, Gemini 3.1 Flash firmy Google w 22 z 25 oraz Scribe v2 firmy ElevenLabs i GPT-Transcribe OpenAI w 15 z 25. Zbudowany na dekoderze tekstu opartym na transformatorze z dwukierunkowym koderem audio, model akceptuje pliki MP3, WAV i FLAC o rozmiarze do 200 MB i uruchamia transkrypcję wsadową 2,5 razy szybciej niż istniejąca oferta Microsoft Azure Fast. Ceny zaczynają się od 0,36 dolara za godzinę.

Mustafa Suleyman, dyrektor generalny Microsoft AI, powiedział, że model transkrypcji zapewnia wiodącą na świecie dokładność przy jednoczesnym zużyciu połowy procesorów graficznych konkurencyjnych systemów, twierdzenie, które, jeśli jest trafne, znacząco poprawiłoby strukturę kosztów Microsoftu w zakresie usług AI. Suleyman powiedział, że ceny wszystkich trzech modeli są celowo ustalone tak, aby podcinać ceny Amazona i Google, nazywając to świadomą decyzją strategiczną mającą na celu odciągnięcie obciążeń korporacyjnych od konkurencyjnych hiperskalerów.

MAI-Voice-1, model zamiany tekstu na mowę, może generować dźwięk z szybkością 60x w czasie rzeczywistym i obsługuje tworzenie niestandardowego głosu na podstawie kilku sekund próbki dźwięku. Wyceniony na 22 dolarów za 1 milion znaków, konkuruje z ElevenLabs i Resemble AI na rynku, na którym start-upy zajmujące się syntezą głosu zbudowały duże ekosystemy programistyczne. ElevenLabs zyskało popularność wśród mniejszych firm dzięki swoim narzędziom do klonowania głosu, ale stoi przed pytaniami dotyczącymi skalowania dla dużych organizacji, co stanowi początek, na który Microsoft celuje w zakresie tworzenia niestandardowego głosu na potrzeby obsługi klienta związanej z marką i komunikacji wewnętrznej.

MAI-Image-2 zadebiutował w pierwszej trójce Arena.ai i zapewnia 2x lub szybszy czas generowania niż jego poprzednik, przy cenie 5 USD za 1 milion tokenów przy wprowadzaniu tekstu i 33 USD przy wyświetlaniu obrazu. WPP, jeden z największych holdingów reklamowych na świecie, jest jednym z pierwszych partnerów biznesowych, którzy budują z nim rozwiązania na dużą skalę, co wskazuje na duży popyt ze strony branż kreatywnych. MAI-Transcribe-1 jest już testowany w trybie głosowym Copilot i Microsoft Teams pod kątem transkrypcji rozmów, natomiast MAI-Image-2 jest wdrażany w Bing i PowerPoint.

Obrazy stworzony przez WPP przy użyciu MAI-Image-2 (źródło: Microsoft)

Microsoft może teraz zaspokajać potrzeby przedsiębiorstw w zakresie sztucznej inteligencji w zakresie obciążeń związanych z mową, głosem i obrazami, bez konieczności polegania na zewnętrznych dostawcach modeli. W praktyce oznacza to kierowanie własnych produktów przez własne modele, zmniejszając zarówno ekspozycję na koszty, jak i strategiczną zależność od OpenAI w miarę ewolucji relacji obu firm.

W przypadku nabywców korporacyjnych oceniających te modele ceny są niższe od stawek pobieranych przez Amazon i Google za porównywalne usługi na odpowiednich platformach chmurowych. Microsoft pozycjonuje Foundry jako pojedynczy punkt dostępu dla wszystkich trzech modeli, obok opcji innych firm, takich jak Claude firmy Anthropic, tworząc siebie jako platformę platform, która pozwala uniknąć blokowania klientów w jednym dostawcy modelu.

Od zależności od OpenAI do samowystarczalności

Do października 2025 r. firmie Microsoft na podstawie umowy zakazano niezależnego rozwijania sztucznej inteligencji ogólnej (AGI) w ramach pierwotnej umowy z 2019 r. OpenAI. Zmieniona umowa, renegocjowana we wrześniu 2025 r., umożliwiła Microsoft budowanie własnych modeli granicznych przy jednoczesnym zachowaniu praw licencyjnych do wszystkiego, co OpenAI zbuduje do 2032 r. Usuwając klauzulę umowną, która zabraniała Microsoftowi niezależnego ścigania AGI, renegocjacja otworzyła drogę dla wysiłków superwywiadu, którym obecnie przewodzi Suleyman.

„We wrześniu ubiegłego roku renegocjowaliśmy umowę z OpenAI i co umożliwiło nam niezależne rozwijanie własnej superinteligencji. Od tego czasu zwołujemy obliczenia i zespół oraz kupujemy potrzebne dane”.

Mustafa Suleyman, dyrektor generalny Microsoft AI (za pośrednictwem VentureBeat)

Zespół superwywiadu Microsoftu został formalnie powołany w październiku 2025 r. pod przewodnictwem Sulejmana. W lutym potwierdził, że Microsoft dąży do „samowystarczalności” sztucznej inteligencji, stwierdzając, że firma musi opracować własne zaawansowane modele podstawowe o mocy obliczeniowej w skali gigawatów. W wewnętrznej notatce udostępnionej w marcu ujawnił, że jego celem jest skupienie całej swojej energii na wysiłkach superwywiadu i dostarczanie światowej klasy modeli w ciągu najbliższych pięciu lat. Były dyrektor Snap Jacob Andreou przejął stanowisko wiceprezesa Copilot, uwalniając Suleymana od codziennych obowiązków związanych z produktem.

Microsoft po raz pierwszy zaprezentował wewnętrzne MAI-1 i Modele sztucznej inteligencji MAI-Voice-1 w sierpniu 2025 r. W marcu 2026 r. Suleyman zatrudnił byłego dyrektora generalnego AI2 Alego Farhadiego i opisał misję grupy jako budowanie „humanistycznej superinteligencji”, definiowanej jako bezpieczniejsze i lepiej kontrolowane systemy sztucznej inteligencji służące ludzkości. Dzisiejsza potrójna premiera przenosi się z modeli poglądowych na systemy produkcyjne z cenami dla przedsiębiorstw i integracją Foundry.

Od renegocjacji umowy we wrześniu 2025 r. do uruchomienia produkcji w kwietniu 2026 r. Microsoft gromadził talenty obliczeniowe, danych i inżynieryjne na długo przed publicznym zasygnalizowaniem swoich ambicji samowystarczalności. Renegocjowana umowa OpenAI była w mniejszym stopniu kluczowa niż publiczne potwierdzenie trwającej już strategii.

W przeciwieństwie do setek badaczy zatrudnionych przez konkurencję zespoły Suleymana są wyjątkowo małe.

„Model audio został zbudowany przez 10 osób, a zdecydowana większość przyrostu szybkości, wydajności i dokładności wynika z architektury modelu i danych, z których korzystaliśmy. Moją filozofią zawsze było to, że potrzebujemy mniej ludzi, którzy są mamy większe możliwości. Dzięki temu mamy niezwykle płaską strukturę”.

Mustafa Suleyman, dyrektor generalny Microsoft AI (za pośrednictwem VentureBeat)

Zespołem zajmującym się obrazami również jest mniej niż 10 osób, Microsoft obstawia, że innowacje architektoniczne i jakość danych mają większe znaczenie niż liczba pracowników. Pomimo dążenia do samowystarczalności Suleyman upierał się, że relacje z OpenAI pozostaną nienaruszone, mówiąc, że partnerstwo będzie kontynuowane do 2032 r., a „miejmy nadzieję, że znacznie dłużej”.

Rynek konkurencyjny i perspektywy

Akcje Microsoftu spadły od początku roku o około 17%, zamykając najsłabszy kwartał od kryzysu finansowego w 2008 roku. Twierdzenia dotyczące efektywności kosztowej nowych modeli mogą pomóc rozwiać obawy inwestorów dotyczące zwrotu z wydatków na sztuczną inteligencję, szczególnie jeśli obietnica wykorzystania połowy GPU przełoży się na znacząco niższe koszty operacyjne w rozwiązaniach Copilot i Azure. Ponieważ wydatki kapitałowe gwałtownie rosną z kwartału na kwartał, znalezienie sposobów na dostarczanie wnioskowania AI przy niższych kosztach sprzętu stało się pilnym priorytetem operacyjnym.

Opierając się na tym fundamencie, sama firma Foundry szybko się rozwinęła w ostatnich miesiącach. Firma Microsoft udostępniła platformę ogólnie w marcu 2026 r. wraz z integracjami dla dostawców zabezpieczeń, takich jak Palo Alto Networks, dzięki czemu stała się centralnym węzłem wdrażania modeli od wielu dostawców. Dodanie trzech zastrzeżonych modeli do tego zestawu daje Microsoft silniejszą pozycję w negocjacjach z klientami korporacyjnymi, którzy w przeciwnym razie mogliby domyślnie korzystać z AWS lub Google Cloud dla obciążeń AI.

Microsoft łączy także konkurencyjne modele sztucznej inteligencji w swoim produkcie Copilot, ostatnio łącząc wersje robocze GPT z krytykami Claude’a, co stanowi podejście obejmujące wiele modeli, które odzwierciedla szerszą strategię firmy polegającą na unikaniu zależności od jednego dostawcy. Jednak MAI-Transcribe-1 stoi przed bezpośrednią presją konkurencyjną ze strony firmy Cohere, która tydzień wcześniej uruchomiła własny model transkrypcji i znalazła się na szczycie otwartej tabeli liderów ASR, co oznacza, że ​​twierdzenia Microsoft o supremacji w testach porównawczych zostaną poddane analizie z wielu stron już pierwszego dnia.

Suleyman powiedział, że zespół MAI planuje dostarczyć pionierskie modele we wszystkich modalnościach, zapewniając Microsoftowi możliwość działania niezależnie od pojedynczego partnera w zakresie sztucznej inteligencji, jeśli zajdzie taka potrzeba. Wraz z nadchodzącymi funkcjami diaryzacji i przesyłania strumieniowego dla MAI-Transcribe-1, premiera 2 kwietnia jest raczej pierwszym krokiem niż gotową linią produktów. Kluczowe brakujące funkcje na tej liście będą musiały zostać dostarczone, zanim klienci korporacyjni będą mogli w pełni zastąpić istniejące potoki transkrypcji. To, czy innowacje architektoniczne przekraczające liczbę pracowników mogą utrzymać to tempo w porównaniu z rywalami ze znacznie większymi organizacjami badawczymi, pozostaje głównym pytaniem w przypadku stawiania firmy Microsoft na samowystarczalność.

Categories: IT Info