Aktualności, narzędzia i prawo AIPolska · codziennie
Narzędzia

Gemini 3.8 Flash TTS. Projektowanie głosu, język polski i ceny syntezy mowy Google

Google udostępnił dwa modele syntezy mowy z rodziny Gemini 3.8. Pozwalają projektować głos opisem, reżyserować wypowiedź i generować dialogi, także po polsku.

Mikrofon pojemnościowy z filtrem pop i słuchawki na drewnianym blacie w przyciemnionym studiu nagraniowym
Ilustracja redakcyjna dailyAI

Gemini 3.8 Flash TTS i Gemini 3.8 Flash-Lite TTS to modele syntezy mowy Google, dostępne w Gemini API od 22 września 2026 roku. Pozwalają zaprojektować nowy głos na podstawie opisu tekstowego, sterować tempem i emocjami wypowiedzi oraz generować rozmowę dwóch osób. Dokumentacja wymienia język polski wśród obsługiwanych. Do końca 2026 roku wygenerowanie miliona tokenów audio kosztuje 9 USD w wersji Flash i 6 USD w wersji Flash-Lite.

Dwa modele syntezy mowy z rodziny Gemini 3.8

Google podzielił nową syntezę mowy na dwa modele o różnych zadaniach. Gemini 3.8 Flash TTS służy do pracy twórczej: projektowania postaci, reżyserowania wypowiedzi i nagrań, w których liczy się aktorska interpretacja. Gemini 3.8 Flash-Lite TTS jest tańszy i szybszy, przeznaczony do generowania mowy na dużą skalę, na przykład w komunikatach, aplikacjach i materiałach szkoleniowych.

Oba modele przyjmują wyłącznie tekst i zwracają wyłącznie dźwięk. W API mają identyfikatory gemini-3.8-flash-tts oraz gemini-3.8-flash-lite-tts. Google opublikował komunikat 23 września, a wpis w dzienniku zmian Gemini API nosi datę 22 września 2026 roku.

Projektowanie głosu opisem i reżyseria wypowiedzi

Najważniejsza zmiana dotyczy sposobu tworzenia głosu. Zamiast wybierać z listy gotowych lektorów, można opisać słowami barwę, wiek, akcent i sposób mówienia, a model przygotuje nowy głos. Według Google biblioteka obejmuje ponad 2000 gotowych głosów, a własne głosy można zapisać i używać ich ponownie. Do zarządzania nimi służy nowy punkt końcowy API /v1beta/voices.

Wypowiedź można reżyserować linijka po linijce, podając w tekście wskazówki dotyczące tempa, emocji czy zmiany dialektu. Model obsługuje też śmiech, westchnienia i krótkie wtrącenia, które sprawiają, że rozmowa brzmi naturalniej. Tryb konwersacyjny pozwala wygenerować dialog maksymalnie dwóch osób z gotowych głosów. Przy głosach zaprojektowanych lub sklonowanych każdą kwestię trzeba generować osobno.

  • Projektowanie głosu z opisu tekstowego w ponad 100 językach i dialektach.
  • Klonowanie głosu z 30-sekundowej próbki po nagraniu zgody właściciela głosu.
  • Dialog dwóch mówców w jednym zapytaniu przy gotowych głosach.
  • Dźwięk WAV 24 kHz mono albo strumień PCM, z opcją 16 kHz i 8 kHz dla telefonii.
  • Zapowiedziane na później: remiks głosu, czyli korekta barwy, wysokości i tempa.

Ile kosztuje Gemini 3.8 Flash TTS

Google rozlicza syntezę mowy w tokenach: osobno tekst wejściowy i dźwięk wyjściowy. Ceny obowiązują do 31 grudnia 2026 roku, a od 1 stycznia 2027 roku wzrosną dwukrotnie. Przeliczenia opierają się na średnim kursie NBP z 25 września 2026 roku, wynoszącym 3,8404 zł za 1 USD. Stawki są podawane bez VAT i dotyczą miliona tokenów.

W bezpłatnym poziomie Gemini API oba modele są dostępne bez opłat, z limitami zapytań. Do testów jakości polskiej wymowy to wystarczy. Tryb wsadowy obniża ceny o połowę, co ma znaczenie przy dużych projektach, takich jak nagranie całego kursu e-learningowego.

  • Flash TTS: tekst 0,50 USD (ok. 1,92 zł), dźwięk 9 USD (ok. 34,56 zł). Od 2027 roku 1 USD i 18 USD (ok. 69,13 zł).
  • Flash-Lite TTS: tekst 0,50 USD (ok. 1,92 zł), dźwięk 6 USD (ok. 23,04 zł). Od 2027 roku 1 USD i 12 USD (ok. 46,08 zł).
  • Tryb wsadowy: dźwięk 4,50 USD (ok. 17,28 zł) w Flash TTS i 3 USD (ok. 11,52 zł) w Flash-Lite TTS do końca 2026 roku.
  • Cennik nie podaje osobnych opłat za projektowanie ani klonowanie głosu.

Gdzie działają nowe modele

Deweloperzy mają dostęp przez Gemini API i Google AI Studio bez listy oczekujących. Wersja dla firm w Gemini Enterprise API jest zapowiedziana na później. Użytkownicy usług Google spotkają Flash TTS w Gemini Notebook, a Flash-Lite TTS w edytorze wideo Google Vids.

Google wymienia też partnerów, którzy wbudowują modele w swoje narzędzia, w tym LiveKit, Pipecat, Vercel, Figma i HeyGen. Dla zespołów budujących agentów głosowych ważne jest połączenie z modelem Gemini 3.8 Live, który prowadzi rozmowę w czasie zbliżonym do rzeczywistego, podczas gdy modele TTS odpowiadają za nagrania przygotowywane z wyprzedzeniem.

Ograniczenia w Europie i bezpieczeństwo głosu

Najważniejsze ograniczenie dla polskich użytkowników dotyczy klonowania głosu. Według komunikatu Google ta funkcja nie jest dostępna w Google AI Studio w Europejskim Obszarze Gospodarczym, Wielkiej Brytanii, Szwajcarii, Indiach oraz w stanach Illinois i Teksas. Projektowanie głosu z opisu i gotowe głosy nie są objęte tym wyłączeniem w komunikacie.

Każde nagranie z modeli audio Gemini otrzymuje niewidoczny znak wodny SynthID, który pozwala rozpoznać mowę wygenerowaną przez AI. Klonowanie wymaga nagrania ustnej zgody osoby, której głos ma zostać odtworzony, i zgodności tego nagrania z próbką. Google deklaruje też obsługę poświadczeń C2PA, czyli standardu opisującego pochodzenie treści.

Wyniki porównań jakości, w tym pierwsze miejsce w teście projektowania głosu Hume AI z wynikiem 71,4, pochodzą z komunikatu producenta. Google nie wymienia polskiego wśród języków, w których prowadził porównania z konkurencją. Jakość polskiej wymowy, odmiany nazw własnych i akcentowania trzeba więc sprawdzić samodzielnie.

Dla kogo w Polsce są nowe modele

Najwięcej mogą zyskać wydawcy podcastów i audiobooków, twórcy kursów online, działy komunikacji wewnętrznej oraz firmy przygotowujące komunikaty głosowe dla infolinii. Tańszy Flash-Lite TTS wystarczy do powtarzalnych nagrań, a Flash TTS przyda się tam, gdzie liczy się interpretacja tekstu.

Przed wdrożeniem warto przygotować 10-20 próbek typowych polskich tekstów z nazwami własnymi, liczbami i skrótami. Nagrania powinny ocenić osoby, które znają odbiorców. Jeśli głos ma przypominać konkretną osobę, trzeba mieć jej pisemną zgodę i pamiętać, że funkcja klonowania w AI Studio nie działa w UE. W materiałach publicznych warto też informować odbiorców, że słyszą głos wygenerowany przez AI.

Źródła i data sprawdzenia

  1. Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTSGoogle, publikacja: 2026-09-23, sprawdzono: 2026-09-26
  2. Gemini API changelogGoogle AI for Developers, publikacja: 2026-09-22, sprawdzono: 2026-09-26
  3. Speech generation (text-to-speech)Google AI for Developers, publikacja: 2026-09-22, sprawdzono: 2026-09-26
  4. Gemini Developer API pricingGoogle AI for Developers, publikacja: 2026-09-22, sprawdzono: 2026-09-26
  5. Kurs średni USD, tabela 187/A/NBP/2026Narodowy Bank Polski, publikacja: 2026-09-25, sprawdzono: 2026-09-26
Nota redakcyjna

Artykuł ma charakter informacyjny. Przy decyzjach prawnych, finansowych lub organizacyjnych warto zweryfikować wnioski w odniesieniu do konkretnej sytuacji.