Aktualności, narzędzia i prawo AIPolska · codziennie
Narzędzia

GPT-Live 1 w API. Cena, działanie i ograniczenia głosowego modelu OpenAI

OpenAI udostępnił w API model GPT-Live 1, który słucha i mówi jednocześnie. Minuta rozmowy kosztuje 0,05 USD, a rozumowanie i narzędzia są rozliczane osobno.

Konsultantka w zestawie słuchawkowym rozmawia z klientem w jasnym centrum obsługi w Porto
Ilustracja redakcyjna dailyAI

GPT-Live 1 to model głosowy OpenAI, który od 10 września 2026 roku jest ogólnie dostępny w API. Prowadzi rozmowę w trybie full-duplex, czyli słucha i mówi jednocześnie, a trudniejsze zadania przekazuje modelowi w tle. Sesja głosowa kosztuje 0,05 USD za minutę, około 0,19 zł, rozliczane co sekundę. Użycie modelu zaplecza i narzędzi jest płatne osobno.

Czym jest GPT-Live 1

GPT-Live 1 to model przeznaczony do rozmów głosowych w czasie rzeczywistym. Według dokumentacji OpenAI potrafi jednocześnie słuchać i mówić, dzięki czemu naturalniej reaguje na wtrącenia rozmówcy. Taki tryb nazywa się full-duplex, w odróżnieniu od klasycznego modelu, w którym strony mówią na zmianę.

Model przyjmuje dźwięk i tekst, a odpowiada dźwiękiem i tekstem. Nie obsługuje obrazów ani wideo. Według mediów branżowych, m.in. serwisu Unite.AI, ten sam system od 8 lipca 2026 roku napędza ChatGPT Voice, a wrześniowa premiera udostępnia go zewnętrznym aplikacjom.

Jak działa podział na głos i zaplecze

Najważniejsza zmiana dotyczy architektury. GPT-Live zajmuje się rozmową: słucha, mówi i decyduje, kiedy przekazać zadanie dalej. Wyszukiwanie informacji, rozumowanie i wywołania narzędzi wykonuje osobny model zaplecza, a OpenAI nazywa to przekazywanie delegacją.

Dokumentacja opisuje dwa tryby delegacji. W pierwszym, opartym na Responses API, OpenAI uruchamia model zaplecza i przekazuje mu kontekst rozmowy. W drugim, delegacji po stronie klienta, firma sama kontroluje kontekst, wykonanie i wyniki we własnej infrastrukturze. Tryb wybiera się przy tworzeniu sesji, a jego zmiana wymaga nowej sesji.

  • WebRTC - do aplikacji głosowych w przeglądarce.
  • WebSocket - do integracji dźwięku po stronie serwera.
  • SIP - do obsługi połączeń telefonicznych.
  • Kanał sideband - dodatkowy WebSocket do monitorowania i sterowania sesją z backendu.

Ile kosztuje GPT-Live 1 w złotych

Cena GPT-Live 1 wynosi 0,05 USD za minutę sesji głosowej. OpenAI rozlicza czas co sekundę, bez zaokrąglania do pełnej minuty. Do tej kwoty trzeba doliczyć koszt modelu zaplecza i narzędzi, który zależy od wybranego modelu i liczby tokenów.

Poniższe przeliczenia oparto na średnim kursie NBP z 25 września 2026 roku (1 USD = 3,8404 zł). Ceny API nie zawierają VAT.

  • 1 minuta rozmowy: 0,05 USD, około 0,19 zł.
  • 1 godzina rozmowy: 3 USD, około 11,52 zł.
  • 1000 minut miesięcznie, np. mała infolinia: 50 USD, około 192,02 zł plus koszt zaplecza.
  • Model zaplecza i narzędzia: według cennika wybranego modelu, rozliczane osobno.

Czym GPT-Live różni się od Realtime API

W Realtime API jeden model prowadzi rozmowę i jednocześnie wybiera funkcje. GPT-Live rozdziela te role, więc prompt trzeba podzielić między warstwę głosową i zaplecze. OpenAI zaleca migrację firmom, które chcą oddzielić rozmowę od logiki biznesowej albo wykorzystać istniejącego agenta.

Zmieniają się też zdarzenia w API, na przykład przesyłanie dźwięku i transkrypcje. Według przewodnika migracji GPT-Live nie ma odpowiednika zdarzenia sygnalizującego koniec każdej wypowiedzi. Starsze modele z rodziny gpt-realtime nadal są dostępne w katalogu OpenAI.

Ograniczenia i niewiadome

GPT-Live 1 ma kilka ograniczeń, które trzeba uwzględnić przed wdrożeniem. Część z nich wynika z dokumentacji, a część z braku informacji.

W ocenie redakcji dailyAI największym ryzykiem jest kontrola treści. Skoro model mówi w trakcie słuchania, filtr bezpieczeństwa musi działać równolegle z odtwarzaniem, a nie przed nim.

  • Brak obsługi structured outputs, fine-tuningu i predicted outputs.
  • Model działa tylko przez endpoint Live, nie przez Chat Completions, Responses ani Batch.
  • Wiedza modelu kończy się na 31 lipca 2025 roku, więc aktualne dane musi dostarczać zaplecze.
  • Dokumentacja nie podaje listy języków, głosów ani maksymalnej długości sesji.
  • Delegacja nie przekazuje automatycznie dźwięku do zaplecza, co utrudnia decyzje zależne od tonu głosu.

Znaczenie dla firm w Polsce

Dla polskich firm GPT-Live 1 jest kandydatem do infolinii, rejestracji wizyt i asystentów sprzedaży. Dokumentacja, którą sprawdziliśmy, nie potwierdza jednak listy obsługiwanych języków, dlatego jakość rozmowy po polsku trzeba przetestować samodzielnie. Źródła nie podają też informacji o przetwarzaniu danych w UE dla sesji Live.

Przykład: przychodnia z 3000 minut rozmów miesięcznie zapłaci za warstwę głosową około 150 USD, czyli około 576 zł netto. Do tego dochodzi model zaplecza, np. GPT-6 Luna do prostych pytań. Rozmowy głosowe zawierają dane osobowe, więc przed wdrożeniem trzeba ocenić podstawę przetwarzania i umowę powierzenia danych.

Firma, która już korzysta z Gemini, może porównać oba rozwiązania na tych samych scenariuszach rozmów. Liczy się rozpoznawanie polskich nazw, numerów i adresów, a nie sama cena minuty.

Źródła i data sprawdzenia

  1. Changelog | OpenAI APIOpenAI, publikacja: 2026-09-10, sprawdzono: 2026-09-26
  2. GPT-Live 1 Model | OpenAI APIOpenAI, publikacja: 2026-09-10, sprawdzono: 2026-09-26
  3. GPT-Live overviewOpenAI, publikacja: 2026-09-10, sprawdzono: 2026-09-26
  4. Migrate to GPT-LiveOpenAI, publikacja: 2026-09-10, sprawdzono: 2026-09-26
  5. Pricing | OpenAI APIOpenAI, publikacja: 2026-09-10, sprawdzono: 2026-09-26
  6. OpenAI's GPT-Live-1 Arrives in the API at $0.05 Per MinuteUnite.AI, publikacja: 2026-09-10, sprawdzono: 2026-09-26
  7. Kurs średni USD, tabela 187/A/NBP/2026Narodowy Bank Polski, publikacja: 2026-09-25, sprawdzono: 2026-09-26
Nota redakcyjna

Artykuł ma charakter informacyjny. Przy decyzjach prawnych, finansowych lub organizacyjnych warto zweryfikować wnioski w odniesieniu do konkretnej sytuacji.