Microsoft AI, zespół Microsoftu budujący własne modele MAI, udostępnił 1 października 2026 roku trzy modele do budowy agentów głosowych. MAI-Transcribe-2-Streaming zamienia mowę na tekst na bieżąco, a MAI-Voice-2.1 i szybszy MAI-Voice-2.1-Flash czytają tekst naturalnym głosem w 23 językach, w tym po polsku. Modele działają w Microsoft Foundry w wersji testowej. Godzina transkrypcji kosztuje do końca roku 0,54 USD, czyli ok. 2,10 zł.
Co udostępnił Microsoft AI
Premiera obejmuje jeden model rozpoznawania mowy i dwa modele syntezy mowy. MAI-Transcribe-2-Streaming to strumieniowa odmiana MAI-Transcribe-2, czyli wersja przetwarzająca dźwięk w trakcie wypowiedzi, a nie dopiero gotowe nagranie. MAI-Voice-2.1 odpowiada za jakość głosu w dłuższych nagraniach, a MAI-Voice-2.1-Flash za szybkie odpowiedzi w rozmowie.
Microsoft przedstawia te modele jako komplet do budowy agentów głosowych. Agent musi usłyszeć rozmówcę, zrozumieć polecenie, wykonać zadanie i odpowiedzieć, zanim cisza po stronie użytkownika stanie się niezręczna. Każda zaoszczędzona dziesiąta część sekundy w transkrypcji i syntezie zostaje dla modelu językowego, który podejmuje decyzję.
Jak działa transkrypcja na żywo MAI-Transcribe-2-Streaming
Model nie czeka na koniec zdania. Po nieco ponad 100 ms od otrzymania dźwięku zwraca wstępne hipotezy, nazywane fragmentami częściowymi (partials), i poprawia je, gdy dociera dalszy kontekst. Dzięki temu agent może zacząć szukać danych klienta albo wywoływać narzędzia jeszcze w trakcie wypowiedzi. Model automatycznie i na bieżąco rozpoznaje język rozmowy.
Microsoft podaje, że model zajmuje pierwsze miejsce pod względem dokładności w rankingu Artificial Analysis, a w napisach na żywo słowa pojawiają się dwa razy szybciej niż u najbliższego konkurenta. Pierwsza informacja dotyczy zewnętrznego zestawienia, druga pochodzi z wewnętrznych testów producenta i nie została niezależnie sprawdzona. Dokumentacja MAI-Transcribe-2, z którego wywodzi się wersja strumieniowa, wymienia język polski wśród 60 obsługiwanych języków.
MAI-Voice-2.1 i wersja Flash po polsku
Oba modele syntezy mowy obsługują 23 języki. Ten sam głos może mówić w każdym z nich z naturalnym akcentem danego języka, więc firma może używać jednego głosu marki w kilku krajach. Lista gotowych głosów w dokumentacji Azure zawiera dwa polskie: żeński pl-PL-Harper z kilkoma stylami (między innymi agent, narrator, obsługa klienta) i męski pl-PL-Grant w stylu neutralnym.
Wersja Flash według Microsoftu osiąga opóźnienie 150 ms od wysłania tekstu do początku odtwarzania i jest przeznaczona do infolinii, asystentów i systemów IVR (automatycznych menu telefonicznych). Pełny MAI-Voice-2.1 lepiej utrzymuje spójny głos w długich nagraniach, takich jak audiobooki, podcasty i materiały szkoleniowe. Oba modele pozwalają sterować emocjami i stylem wypowiedzi przez znaczniki SSML.
Ile kosztują modele głosowe MAI
Ceny w zestawieniu poniżej pochodzą z komunikatu Microsoft AI i nie obejmują VAT. Przeliczyliśmy je według średniego kursu NBP z 2 października 2026 roku (1 USD = 3,8881 zł). Szczegółowy cennik dla klientów Azure znajduje się na stronie Azure Speech, a rozliczenie może zależeć od regionu i umowy.
Przykład: infolinia, która miesięcznie obsługuje 500 godzin rozmów, zapłaci za samą transkrypcję ok. 270 USD, czyli ok. 1050 zł. Jeśli agent wypowie w tym czasie 5 mln znaków głosem Flash, synteza kosztuje dodatkowo 75 USD, czyli ok. 292 zł. Do tego dochodzi koszt modelu językowego, który prowadzi rozmowę.
- MAI-Transcribe-2-Streaming: 0,54 USD za godzinę nagrania (ok. 2,10 zł, czyli ok. 0,035 zł za minutę), cena wprowadzająca do końca 2026 roku.
- MAI-Voice-2.1: 22 USD za 1 mln znaków (ok. 85,54 zł).
- MAI-Voice-2.1-Flash: 15 USD za 1 mln znaków (ok. 58,32 zł).
- Dla porównania: Gemini 3.5 Transcribe na żywo kosztuje szacunkowo 0,009 USD za minutę, czyli tyle samo co MAI, a Eleven v4 od ElevenLabs 80 USD za 1 mln znaków w cenie regularnej (22 USD w promocji do 12 października).
Gdzie są dostępne i co z regionami w UE
Wszystkie trzy modele działają w Microsoft Foundry, w MAI Playground oraz w Azure Voice Live, usłudze do budowy agentów głosowych. Modele syntezy mowy są też dostępne przez OpenRouter, a w przygotowaniu jest integracja z LiveKit. Microsoft udostępnił również demonstracyjnego agenta Chatter w MAI Playground.
Dokumentacja MAI-Voice podaje, że modele są dostępne globalnie, a Azure kieruje zapytania do jednego z 14 regionów. Cztery z nich leżą w Europie: West Europe, North Europe, France Central i Sweden Central. Opis nie mówi jednak wprost, że zapytanie z europejskiego zasobu zawsze zostanie obsłużone w UE. Firmy z wymogami dotyczącymi lokalizacji danych powinny to potwierdzić przed wdrożeniem.
Ograniczenia i ryzyka
Wszystkie modele mają status publicznej wersji testowej. Microsoft nie daje dla nich gwarancji dostępności i nie zaleca ich do zastosowań produkcyjnych. Cena transkrypcji obowiązuje do końca 2026 roku, a stawka od stycznia 2027 roku nie jest znana. Wyniki dokładności i szybkości to w dużej części deklaracje producenta.
Osobnym ryzykiem jest klonowanie głosu. Model odtwarza głos z próbki od 5 do 60 sekund, dlatego Microsoft udostępnia tę funkcję tylko po akceptacji wniosku i wymaga zgody osoby, której głos jest kopiowany. Realistyczny głos syntetyczny ułatwia też oszustwa telefoniczne, więc firmy wdrażające agentów powinny jasno informować rozmówców, że rozmawiają z systemem AI.
Co to oznacza dla polskich firm
Dla polskich zespołów obsługi klienta to kolejna opcja obok Gemini i OpenAI, z polskimi głosami dostępnymi od razu i ceną transkrypcji porównywalną z Google. Największą zaletą jest integracja z Azure, z którego korzysta wiele polskich firm. Modele można uruchomić w ramach istniejącej subskrypcji, bez wprowadzania kolejnego dostawcy.
W naszej ocenie warto teraz przetestować oba polskie głosy w Foundry na własnych skryptach rozmów, sprawdzić dokładność transkrypcji przy nazwach produktów i polskich nazwiskach oraz zmierzyć opóźnienie z wybranego regionu. Decyzję o wdrożeniu produkcyjnym lepiej odłożyć do wyjścia modeli z wersji testowej i publikacji cen na 2027 rok.
Źródła i data sprawdzenia
- Our first streaming transcription model debuts at no. 1 on Artificial AnalysisMicrosoft AI, publikacja: 2026-10-01, sprawdzono: 2026-10-02
- MAI-Voice in Azure SpeechMicrosoft Learn, publikacja: 2026-10-01, sprawdzono: 2026-10-02
- MAI-Transcribe in Azure SpeechMicrosoft Learn, publikacja: 2026-09-24, sprawdzono: 2026-10-02
- Microsoft AI releases new transcription and text-to-speech models for voice agentsTHE DECODER, publikacja: 2026-10-02, sprawdzono: 2026-10-02
- Kursy średnie walut obcych - tabela A nr 192/A/NBP/2026Narodowy Bank Polski, publikacja: 2026-10-02, sprawdzono: 2026-10-02
Artykuł ma charakter informacyjny. Przy decyzjach prawnych, finansowych lub organizacyjnych warto zweryfikować wnioski w odniesieniu do konkretnej sytuacji.



