Aktualności, narzędzia i prawo AIPolska · codziennie
Narzędzia

Suno Speech w becie. Narracja AI z muzyką w jednym nagraniu

Suno udostępnia w becie Speech - model, który z wpisanego tekstu tworzy mówione nagranie z dopasowanym podkładem muzycznym. Cen i listy języków brak.

Kobieta w słuchawkach siedzi przy drewnianym biurku w mieszkaniu w starej kamienicy i patrzy na laptopa z dwiema ścieżkami dźwięku obok mikrofonu
Ilustracja redakcyjna dailyAI

Suno, znany z generatora piosenek, udostępnia całej społeczności w wersji beta funkcję Speech. Użytkownik wpisuje tekst, opisuje głos i styl muzyki, a model tworzy jedno nagranie, w którym narracja i podkład powstają razem. Firma nie podała cen, limitów ani listy obsługiwanych języków. Premiera zbiega się z niekorzystnym dla Suno wyrokiem sądu w Monachium w sporze z GEMA.

Czym jest Suno Speech

Speech to nowy tryb w serwisie Suno, przeznaczony do tworzenia nagrań mówionych z podkładem muzycznym. Użytkownik wkleja pomysł, wiersz albo własny tekst, a następnie opisuje słowami, jakiego głosu i jakiej muzyki oczekuje. Model zwraca jedno nagranie, w którym tempo narracji, pauzy i muzyka są do siebie dopasowane.

Suno wymienia jako przykładowe zastosowania wiersze, medytacje i bajki na dobranoc. THE DECODER, który opisał premierę 2 października 2026 roku, zwraca uwagę, że to pierwsze wyjście firmy poza generowanie piosenek w stronę klasycznej syntezy mowy (TTS, text-to-speech).

Czym różni się od syntezy mowy z podkładem

Typowy proces wygląda dziś tak: najpierw powstaje lektor w narzędziu TTS, potem muzyka w osobnym generatorze, a na końcu oba pliki łączy się w edytorze audio. Suno twierdzi, że Speech generuje obie warstwy naraz, więc muzyka może reagować na rytm wypowiedzi. To deklaracja producenta. Firma nie opublikowała opisu technicznego ani porównań z innymi modelami.

Dla twórców podcastów, materiałów szkoleniowych czy treści relaksacyjnych może to skrócić pracę. Wspólna ścieżka ma jednak wadę: jeśli trzeba poprawić jedno słowo lub ściszyć muzykę, komunikat nie wyjaśnia, czy da się pobrać warstwy osobno.

  • Dostępność: beta dla całej społeczności Suno, wymagane konto.
  • Wejście: tekst oraz opis głosu i stylu muzyki w języku naturalnym.
  • Wynik: jedno nagranie z mową i muzyką.
  • Nieujawnione: ceny i kredyty, limity długości, języki, prawa do komercyjnego użycia, dane treningowe.
  • Znane błędy według Suno: akcent brytyjski potrafi brzmieć jak australijski, a dramatyczne pauzy bywają przesadnie długie.

Wyrok GEMA przeciwko Suno

Premiera przypada dwa miesiące po wyroku, który dotyczy całej działalności Suno w Europie. 31 lipca 2026 roku 42. Izba Cywilna Sądu Okręgowego Monachium I w dużej mierze uwzględniła pozew niemieckiej organizacji zbiorowego zarządzania GEMA. Sprawa dotyczyła sześciu utworów, m.in. kompozycji Franka Fariana i Mariana Golda.

Sąd uznał, że model Suno zapamiętał chronione utwory i odtwarzał je w wynikach, co stanowi zwielokrotnienie bez zgody uprawnionych. Odrzucił też zastosowanie wyjątku eksploracji tekstów i danych (TDM, text and data mining) do takiego zapamiętywania. Suno ma zaprzestać wykorzystywania tych utworów do trenowania i ich odtwarzania, ujawnić informacje o przychodach i zapłacić odszkodowanie w kwocie do ustalenia. Według JUVE Patent wyrok nie jest prawomocny, a Suno rozważa apelację.

Znaczenie dla użytkowników w Polsce

Wyrok niemieckiego sądu nie wiąże polskich sądów, ale pokazuje, jak w UE może być oceniane trenowanie modeli muzycznych na chronionym repertuarze. Dla firm, które chcą użyć nagrań ze Speech w reklamie, kursie online czy aplikacji, oznacza to konieczność sprawdzenia aktualnego regulaminu Suno pod kątem praw do komercyjnego wykorzystania, zanim nagranie trafi do publikacji.

Druga sprawa to przejrzystość. AI Act w art. 50 nakłada obowiązki oznaczania treści syntetycznych, w tym dźwięku, który może zostać wzięty za autentyczny. Narracja wygenerowana przez AI, publikowana jako głos lektora, powinna być opisana jako materiał syntetyczny, szczególnie gdy brzmi jak konkretna osoba.

Czego nie wiadomo

Suno nie podał, czy Speech obsługuje język polski i jak brzmią polskie nagrania. Nie wiadomo też, ile kredytów zużywa jedno nagranie, czy funkcja jest dostępna w darmowym planie ani czy nagrania z bety można wykorzystywać komercyjnie. Firma nie opisała zabezpieczeń przed podszywaniem się pod głos realnych osób.

W naszej ocenie Speech warto na razie traktować jako narzędzie do prób i szkiców. Przy materiałach publikowanych pod marką firmy rozsądniej poczekać na dokumentację cen, języków i licencji albo skorzystać z usług TTS, które takie informacje już publikują.

Źródła i data sprawdzenia

  1. Introducing Speech (beta)Suno, publikacja: 2026-10-01, sprawdzono: 2026-10-02
  2. Suno can now create spoken audio with matching background musicTHE DECODER, publikacja: 2026-10-02, sprawdzono: 2026-10-02
  3. Munich Regional Court stops Suno using GEMA-protected musicJUVE Patent, publikacja: 2026-07-31, sprawdzono: 2026-10-02
  4. GEMA also wins against SunoKPW Rechtsanwälte, publikacja: 2026-08-03, sprawdzono: 2026-10-02
Nota redakcyjna

Artykuł ma charakter informacyjny. Przy decyzjach prawnych, finansowych lub organizacyjnych warto zweryfikować wnioski w odniesieniu do konkretnej sytuacji.