GPT-Live 1 to model głosowy OpenAI, który od 10 września 2026 roku jest ogólnie dostępny w API. Prowadzi rozmowę w trybie full-duplex, czyli słucha i mówi jednocześnie, a trudniejsze zadania przekazuje modelowi w tle. Sesja głosowa kosztuje 0,05 USD za minutę, około 0,19 zł, rozliczane co sekundę. Użycie modelu zaplecza i narzędzi jest płatne osobno.
Czym jest GPT-Live 1
GPT-Live 1 to model przeznaczony do rozmów głosowych w czasie rzeczywistym. Według dokumentacji OpenAI potrafi jednocześnie słuchać i mówić, dzięki czemu naturalniej reaguje na wtrącenia rozmówcy. Taki tryb nazywa się full-duplex, w odróżnieniu od klasycznego modelu, w którym strony mówią na zmianę.
Model przyjmuje dźwięk i tekst, a odpowiada dźwiękiem i tekstem. Nie obsługuje obrazów ani wideo. Według mediów branżowych, m.in. serwisu Unite.AI, ten sam system od 8 lipca 2026 roku napędza ChatGPT Voice, a wrześniowa premiera udostępnia go zewnętrznym aplikacjom.
Jak działa podział na głos i zaplecze
Najważniejsza zmiana dotyczy architektury. GPT-Live zajmuje się rozmową: słucha, mówi i decyduje, kiedy przekazać zadanie dalej. Wyszukiwanie informacji, rozumowanie i wywołania narzędzi wykonuje osobny model zaplecza, a OpenAI nazywa to przekazywanie delegacją.
Dokumentacja opisuje dwa tryby delegacji. W pierwszym, opartym na Responses API, OpenAI uruchamia model zaplecza i przekazuje mu kontekst rozmowy. W drugim, delegacji po stronie klienta, firma sama kontroluje kontekst, wykonanie i wyniki we własnej infrastrukturze. Tryb wybiera się przy tworzeniu sesji, a jego zmiana wymaga nowej sesji.
- WebRTC - do aplikacji głosowych w przeglądarce.
- WebSocket - do integracji dźwięku po stronie serwera.
- SIP - do obsługi połączeń telefonicznych.
- Kanał sideband - dodatkowy WebSocket do monitorowania i sterowania sesją z backendu.
Ile kosztuje GPT-Live 1 w złotych
Cena GPT-Live 1 wynosi 0,05 USD za minutę sesji głosowej. OpenAI rozlicza czas co sekundę, bez zaokrąglania do pełnej minuty. Do tej kwoty trzeba doliczyć koszt modelu zaplecza i narzędzi, który zależy od wybranego modelu i liczby tokenów.
Poniższe przeliczenia oparto na średnim kursie NBP z 25 września 2026 roku (1 USD = 3,8404 zł). Ceny API nie zawierają VAT.
- 1 minuta rozmowy: 0,05 USD, około 0,19 zł.
- 1 godzina rozmowy: 3 USD, około 11,52 zł.
- 1000 minut miesięcznie, np. mała infolinia: 50 USD, około 192,02 zł plus koszt zaplecza.
- Model zaplecza i narzędzia: według cennika wybranego modelu, rozliczane osobno.
Czym GPT-Live różni się od Realtime API
W Realtime API jeden model prowadzi rozmowę i jednocześnie wybiera funkcje. GPT-Live rozdziela te role, więc prompt trzeba podzielić między warstwę głosową i zaplecze. OpenAI zaleca migrację firmom, które chcą oddzielić rozmowę od logiki biznesowej albo wykorzystać istniejącego agenta.
Zmieniają się też zdarzenia w API, na przykład przesyłanie dźwięku i transkrypcje. Według przewodnika migracji GPT-Live nie ma odpowiednika zdarzenia sygnalizującego koniec każdej wypowiedzi. Starsze modele z rodziny gpt-realtime nadal są dostępne w katalogu OpenAI.
Ograniczenia i niewiadome
GPT-Live 1 ma kilka ograniczeń, które trzeba uwzględnić przed wdrożeniem. Część z nich wynika z dokumentacji, a część z braku informacji.
W ocenie redakcji dailyAI największym ryzykiem jest kontrola treści. Skoro model mówi w trakcie słuchania, filtr bezpieczeństwa musi działać równolegle z odtwarzaniem, a nie przed nim.
- Brak obsługi structured outputs, fine-tuningu i predicted outputs.
- Model działa tylko przez endpoint Live, nie przez Chat Completions, Responses ani Batch.
- Wiedza modelu kończy się na 31 lipca 2025 roku, więc aktualne dane musi dostarczać zaplecze.
- Dokumentacja nie podaje listy języków, głosów ani maksymalnej długości sesji.
- Delegacja nie przekazuje automatycznie dźwięku do zaplecza, co utrudnia decyzje zależne od tonu głosu.
Znaczenie dla firm w Polsce
Dla polskich firm GPT-Live 1 jest kandydatem do infolinii, rejestracji wizyt i asystentów sprzedaży. Dokumentacja, którą sprawdziliśmy, nie potwierdza jednak listy obsługiwanych języków, dlatego jakość rozmowy po polsku trzeba przetestować samodzielnie. Źródła nie podają też informacji o przetwarzaniu danych w UE dla sesji Live.
Przykład: przychodnia z 3000 minut rozmów miesięcznie zapłaci za warstwę głosową około 150 USD, czyli około 576 zł netto. Do tego dochodzi model zaplecza, np. GPT-6 Luna do prostych pytań. Rozmowy głosowe zawierają dane osobowe, więc przed wdrożeniem trzeba ocenić podstawę przetwarzania i umowę powierzenia danych.
Firma, która już korzysta z Gemini, może porównać oba rozwiązania na tych samych scenariuszach rozmów. Liczy się rozpoznawanie polskich nazw, numerów i adresów, a nie sama cena minuty.
Źródła i data sprawdzenia
- Changelog | OpenAI APIOpenAI, publikacja: 2026-09-10, sprawdzono: 2026-09-26
- GPT-Live 1 Model | OpenAI APIOpenAI, publikacja: 2026-09-10, sprawdzono: 2026-09-26
- GPT-Live overviewOpenAI, publikacja: 2026-09-10, sprawdzono: 2026-09-26
- Migrate to GPT-LiveOpenAI, publikacja: 2026-09-10, sprawdzono: 2026-09-26
- Pricing | OpenAI APIOpenAI, publikacja: 2026-09-10, sprawdzono: 2026-09-26
- OpenAI's GPT-Live-1 Arrives in the API at $0.05 Per MinuteUnite.AI, publikacja: 2026-09-10, sprawdzono: 2026-09-26
- Kurs średni USD, tabela 187/A/NBP/2026Narodowy Bank Polski, publikacja: 2026-09-25, sprawdzono: 2026-09-26
Artykuł ma charakter informacyjny. Przy decyzjach prawnych, finansowych lub organizacyjnych warto zweryfikować wnioski w odniesieniu do konkretnej sytuacji.



