Aktualności, narzędzia i prawo AIPolska · codziennie
Narzędzia

Gemini 3.8 Live zmienia rozmowę w proces. Co potrafią nowe modele głosowe Google

Google udostępnia Gemini 3.8 Live i wariant Extended Thinking. Modele mogą prowadzić rozmowę, analizować obraz oraz wykonywać wywołania narzędzi bez przerywania dialogu.

Europejska projektantka korzystająca z asystenta głosowego w jasnym kopenhaskim studiu
Ilustracja redakcyjna dailyAI

Gemini 3.8 Live i Gemini 3.8 Live Extended Thinking to modele do rozmów głosowych, które mogą równolegle analizować obraz, używać narzędzi i wykonywać zadania w tle. Wariant podstawowy jest przeznaczony do skalowania obsługi, a Extended Thinking do procesów wymagających dłuższego rozumowania. Oba modele są dostępne w Gemini API i Google AI Studio.

Dwa modele do różnych rozmów

Gemini 3.8 Live ma zapewniać płynną rozmowę przy koszcie odpowiednim dla dużej skali. Model łączy obsługę dialogu z analizą obrazu i może korzystać z narzędzi. Google kieruje go do aplikacji, które potrzebują szybkiej reakcji, takich jak obsługa klienta, transkrypcja, tłumaczenie i interfejsy głosowe.

Gemini 3.8 Live Extended Thinking dodaje głębsze rozumowanie do bardziej złożonych procesów. Model może potwierdzić przyjęcie polecenia, wykonywać kolejne kroki w tle i informować głosowo o postępie. Taki sposób działania pasuje do rezerwacji, analizy dokumentów albo przygotowania materiału na podstawie kilku źródeł.

Różnica nie sprowadza się do jakości głosu. W praktyce chodzi o to, czy aplikacja potrzebuje szybkiego dialogu, czy dłuższego procesu z narzędziami i wieloma decyzjami. Wybór powinien wynikać z czasu odpowiedzi, kosztu oraz tolerancji na błąd.

Głos, obraz i narzędzia w jednym połączeniu

Live API działa przez stanowe połączenie WebSocket i przyjmuje ciągły strumień dźwięku, obrazów oraz tekstu. Dokumentacja przewiduje surowe audio wejściowe 16 kHz, obrazy JPEG z częstotliwością do jednej klatki na sekundę i dźwięk wyjściowy 24 kHz. Model może także zwracać transkrypcje wejścia i odpowiedzi.

Funkcja barge-in pozwala użytkownikowi przerwać model w trakcie wypowiedzi. To ważna różnica wobec systemów, które wymagają czekania na koniec odpowiedzi. Model może też wywoływać funkcje i korzystać z wyszukiwarki, dzięki czemu rozmowa staje się interfejsem do wykonywania działania.

Według karty modelu warianty Live przyjmują głos, obrazy, wideo i tekst w kontekście do 128 tys. tokenów. Zwracają audio i tekst, a maksymalny wynik tekstowy może mieć do 64 tys. tokenów. Rzeczywisty limit i koszt zależą od kanału udostępnienia i konfiguracji.

  • obsługa przerwania wypowiedzi modelu przez użytkownika
  • wywołania funkcji i narzędzi podczas rozmowy
  • transkrypcja głosu użytkownika i odpowiedzi modelu
  • analiza obrazu oraz kontekstu wizualnego
  • rozpoznawanie języka i tłumaczenie w czasie rzeczywistym

Ile języków obsługuje Gemini Live

Komunikat premierowy Google podaje automatyczne przełączanie między 97 obsługiwanymi językami. Ogólna dokumentacja Live API, zaktualizowana 15 września 2026 roku, wskazuje 70 języków dla rozmowy i ponad 70 dla tłumaczenia. Oba dokumenty pochodzą od Google, ale opisują wsparcie inaczej.

Rozbieżność może wynikać z różnic między konkretnymi modelami, funkcjami i etapami wdrożenia. Firma planująca polskojęzycznego asystenta nie powinna opierać decyzji na samej liczbie z komunikatu. Potrzebny jest test polskiej mowy, nazw własnych, przerywania wypowiedzi, akcentów i działania w hałaśliwym otoczeniu.

W zastosowaniu produkcyjnym warto też mierzyć poprawność transkrypcji oddzielnie od jakości końcowej odpowiedzi. Model może dobrze rozumieć intencję w spokojnej rozmowie, a słabiej radzić sobie z numerami, adresami lub terminologią branżową.

Gdzie modele są dostępne

Oba modele są udostępniane deweloperom przez Gemini API i Google AI Studio. Gemini 3.8 Live trafia również do Search Live. W przedsiębiorstwach jest dostępny w prywatnym podglądzie na Gemini Enterprise Agent Platform.

Extended Thinking pojawia się w Gemini Live oraz w usługach Workspace zależnie od planu. Google wskazuje Docs dla subskrybentów Google AI Pro i Ultra oraz Gmail i Keep dla wszystkich subskrybentów Google AI. Dostęp może być wdrażany etapami i różnić się między regionami.

Deweloper może połączyć się z API przez własny serwer albo bezpośrednio z aplikacji użytkownika. Google rekomenduje tokeny tymczasowe przy połączeniu klient-serwer, ponieważ umieszczenie zwykłego klucza API w aplikacji frontowej zwiększa ryzyko jego przejęcia.

Ograniczenia przed wdrożeniem w firmie

Karta modelu wskazuje typowe ograniczenia modeli bazowych, w tym halucynacje. Google wymienia też sporadyczne spowolnienia i przekroczenia czasu odpowiedzi. Wariant Live Avatar może utrzymywać ciągłą interakcję przez kilka minut, a nie przez wiele godzin.

Data odcięcia wiedzy została określona na styczeń 2025 roku. Aktualne informacje powinny więc pochodzić z kontrolowanego źródła lub narzędzia wyszukiwania, a odpowiedź musi wskazywać, na czym się opiera. Sam głos brzmiący naturalnie nie jest dowodem poprawności.

Audio generowane przez produkty Google AI jest oznaczane niewidocznym watermarkiem SynthID. Mechanizm ma ułatwiać wykrywanie treści syntetycznej, ale nie zwalnia firmy z obowiązku poinformowania użytkownika, że rozmawia z systemem AI, jeśli wymagają tego przepisy lub charakter usługi.

Jak ocenić model na własnym procesie

Pierwszy pilotaż powinien obejmować ograniczony scenariusz z jednoznacznym wynikiem. Dla obsługi klienta może to być rozpoznanie sprawy, odczytanie danych z bazy wiedzy i przekazanie rozmowy człowiekowi po wykryciu braku informacji.

Warto mierzyć opóźnienie, poprawność transkrypcji, liczbę przerwanych wypowiedzi, trafność wywołań narzędzi i odsetek spraw wymagających korekty. Osobnym kryterium powinno być zachowanie modelu po niezrozumieniu użytkownika. Bezpieczna odpowiedź powinna ujawniać niepewność, zamiast uzupełniać brakujące dane.

Gemini 3.8 Live rozszerza możliwości interfejsów głosowych, lecz wymaga takiej samej dyscypliny jak każdy system wykonujący działania. Uprawnienia narzędzi, logi i możliwość przejęcia rozmowy przez człowieka pozostają ważniejsze niż płynność głosu.

Źródła i data sprawdzenia

  1. Introducing Gemini 3.8 Live and 3.8 Live Extended ThinkingGoogle, publikacja: 2026-09-15, sprawdzono: 2026-09-26
  2. Gemini Live API overviewGoogle AI for Developers, publikacja: 2026-09-15, sprawdzono: 2026-09-26
  3. Gemini 3.8 Audio model cardGoogle DeepMind, publikacja: 2026-09-15, sprawdzono: 2026-09-26
Nota redakcyjna

Artykuł ma charakter informacyjny. Przy decyzjach prawnych, finansowych lub organizacyjnych warto zweryfikować wnioski w odniesieniu do konkretnej sytuacji.