Gemini 3.8 Flash TTS i Gemini 3.8 Flash-Lite TTS to modele syntezy mowy Google, dostępne w Gemini API od 22 września 2026 roku. Pozwalają zaprojektować nowy głos na podstawie opisu tekstowego, sterować tempem i emocjami wypowiedzi oraz generować rozmowę dwóch osób. Dokumentacja wymienia język polski wśród obsługiwanych. Do końca 2026 roku wygenerowanie miliona tokenów audio kosztuje 9 USD w wersji Flash i 6 USD w wersji Flash-Lite.
Dwa modele syntezy mowy z rodziny Gemini 3.8
Google podzielił nową syntezę mowy na dwa modele o różnych zadaniach. Gemini 3.8 Flash TTS służy do pracy twórczej: projektowania postaci, reżyserowania wypowiedzi i nagrań, w których liczy się aktorska interpretacja. Gemini 3.8 Flash-Lite TTS jest tańszy i szybszy, przeznaczony do generowania mowy na dużą skalę, na przykład w komunikatach, aplikacjach i materiałach szkoleniowych.
Oba modele przyjmują wyłącznie tekst i zwracają wyłącznie dźwięk. W API mają identyfikatory gemini-3.8-flash-tts oraz gemini-3.8-flash-lite-tts. Google opublikował komunikat 23 września, a wpis w dzienniku zmian Gemini API nosi datę 22 września 2026 roku.
Projektowanie głosu opisem i reżyseria wypowiedzi
Najważniejsza zmiana dotyczy sposobu tworzenia głosu. Zamiast wybierać z listy gotowych lektorów, można opisać słowami barwę, wiek, akcent i sposób mówienia, a model przygotuje nowy głos. Według Google biblioteka obejmuje ponad 2000 gotowych głosów, a własne głosy można zapisać i używać ich ponownie. Do zarządzania nimi służy nowy punkt końcowy API /v1beta/voices.
Wypowiedź można reżyserować linijka po linijce, podając w tekście wskazówki dotyczące tempa, emocji czy zmiany dialektu. Model obsługuje też śmiech, westchnienia i krótkie wtrącenia, które sprawiają, że rozmowa brzmi naturalniej. Tryb konwersacyjny pozwala wygenerować dialog maksymalnie dwóch osób z gotowych głosów. Przy głosach zaprojektowanych lub sklonowanych każdą kwestię trzeba generować osobno.
- Projektowanie głosu z opisu tekstowego w ponad 100 językach i dialektach.
- Klonowanie głosu z 30-sekundowej próbki po nagraniu zgody właściciela głosu.
- Dialog dwóch mówców w jednym zapytaniu przy gotowych głosach.
- Dźwięk WAV 24 kHz mono albo strumień PCM, z opcją 16 kHz i 8 kHz dla telefonii.
- Zapowiedziane na później: remiks głosu, czyli korekta barwy, wysokości i tempa.
Ile kosztuje Gemini 3.8 Flash TTS
Google rozlicza syntezę mowy w tokenach: osobno tekst wejściowy i dźwięk wyjściowy. Ceny obowiązują do 31 grudnia 2026 roku, a od 1 stycznia 2027 roku wzrosną dwukrotnie. Przeliczenia opierają się na średnim kursie NBP z 25 września 2026 roku, wynoszącym 3,8404 zł za 1 USD. Stawki są podawane bez VAT i dotyczą miliona tokenów.
W bezpłatnym poziomie Gemini API oba modele są dostępne bez opłat, z limitami zapytań. Do testów jakości polskiej wymowy to wystarczy. Tryb wsadowy obniża ceny o połowę, co ma znaczenie przy dużych projektach, takich jak nagranie całego kursu e-learningowego.
- Flash TTS: tekst 0,50 USD (ok. 1,92 zł), dźwięk 9 USD (ok. 34,56 zł). Od 2027 roku 1 USD i 18 USD (ok. 69,13 zł).
- Flash-Lite TTS: tekst 0,50 USD (ok. 1,92 zł), dźwięk 6 USD (ok. 23,04 zł). Od 2027 roku 1 USD i 12 USD (ok. 46,08 zł).
- Tryb wsadowy: dźwięk 4,50 USD (ok. 17,28 zł) w Flash TTS i 3 USD (ok. 11,52 zł) w Flash-Lite TTS do końca 2026 roku.
- Cennik nie podaje osobnych opłat za projektowanie ani klonowanie głosu.
Gdzie działają nowe modele
Deweloperzy mają dostęp przez Gemini API i Google AI Studio bez listy oczekujących. Wersja dla firm w Gemini Enterprise API jest zapowiedziana na później. Użytkownicy usług Google spotkają Flash TTS w Gemini Notebook, a Flash-Lite TTS w edytorze wideo Google Vids.
Google wymienia też partnerów, którzy wbudowują modele w swoje narzędzia, w tym LiveKit, Pipecat, Vercel, Figma i HeyGen. Dla zespołów budujących agentów głosowych ważne jest połączenie z modelem Gemini 3.8 Live, który prowadzi rozmowę w czasie zbliżonym do rzeczywistego, podczas gdy modele TTS odpowiadają za nagrania przygotowywane z wyprzedzeniem.
Ograniczenia w Europie i bezpieczeństwo głosu
Najważniejsze ograniczenie dla polskich użytkowników dotyczy klonowania głosu. Według komunikatu Google ta funkcja nie jest dostępna w Google AI Studio w Europejskim Obszarze Gospodarczym, Wielkiej Brytanii, Szwajcarii, Indiach oraz w stanach Illinois i Teksas. Projektowanie głosu z opisu i gotowe głosy nie są objęte tym wyłączeniem w komunikacie.
Każde nagranie z modeli audio Gemini otrzymuje niewidoczny znak wodny SynthID, który pozwala rozpoznać mowę wygenerowaną przez AI. Klonowanie wymaga nagrania ustnej zgody osoby, której głos ma zostać odtworzony, i zgodności tego nagrania z próbką. Google deklaruje też obsługę poświadczeń C2PA, czyli standardu opisującego pochodzenie treści.
Wyniki porównań jakości, w tym pierwsze miejsce w teście projektowania głosu Hume AI z wynikiem 71,4, pochodzą z komunikatu producenta. Google nie wymienia polskiego wśród języków, w których prowadził porównania z konkurencją. Jakość polskiej wymowy, odmiany nazw własnych i akcentowania trzeba więc sprawdzić samodzielnie.
Dla kogo w Polsce są nowe modele
Najwięcej mogą zyskać wydawcy podcastów i audiobooków, twórcy kursów online, działy komunikacji wewnętrznej oraz firmy przygotowujące komunikaty głosowe dla infolinii. Tańszy Flash-Lite TTS wystarczy do powtarzalnych nagrań, a Flash TTS przyda się tam, gdzie liczy się interpretacja tekstu.
Przed wdrożeniem warto przygotować 10-20 próbek typowych polskich tekstów z nazwami własnymi, liczbami i skrótami. Nagrania powinny ocenić osoby, które znają odbiorców. Jeśli głos ma przypominać konkretną osobę, trzeba mieć jej pisemną zgodę i pamiętać, że funkcja klonowania w AI Studio nie działa w UE. W materiałach publicznych warto też informować odbiorców, że słyszą głos wygenerowany przez AI.
Źródła i data sprawdzenia
- Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTSGoogle, publikacja: 2026-09-23, sprawdzono: 2026-09-26
- Gemini API changelogGoogle AI for Developers, publikacja: 2026-09-22, sprawdzono: 2026-09-26
- Speech generation (text-to-speech)Google AI for Developers, publikacja: 2026-09-22, sprawdzono: 2026-09-26
- Gemini Developer API pricingGoogle AI for Developers, publikacja: 2026-09-22, sprawdzono: 2026-09-26
- Kurs średni USD, tabela 187/A/NBP/2026Narodowy Bank Polski, publikacja: 2026-09-25, sprawdzono: 2026-09-26
Artykuł ma charakter informacyjny. Przy decyzjach prawnych, finansowych lub organizacyjnych warto zweryfikować wnioski w odniesieniu do konkretnej sytuacji.



