Firma Reka zaprezentowała 5 października 2026 roku model Rho-1, który w jednej sieci neuronowej łączy tekst, obrazy, generowanie wideo i sterowanie robotem. Model ma 19 mld parametrów, generuje wideo strumieniowo i przyjmuje nowe polecenia w trakcie nagrania. Szybsza wersja Rho-1 Flash tworzy 5,3-sekundowy klip w około sekundę. Reka udostępnia Rho-1 wyłącznie jako wersję badawczą dla partnerów i sama nazywa go dowodem koncepcji, a nie gotowym produktem.
Czym jest Reka Rho-1
Rho-1 to tak zwany model omni, czyli system, który przyjmuje i generuje różne rodzaje danych. Typowe rozwiązania łączą kilka wyspecjalizowanych modeli: jeden rozumie polecenie, drugi generuje wideo, trzeci steruje robotem. Reka twierdzi, że Rho-1 robi to wszystko w jednym kontekście, więc może wygenerować scenę, zmienić ją na żądanie, a potem wyjaśnić, co się zmieniło.
W opisie firmy architektura opiera się na dwóch rodzajach tokenów. Dyskretne obsługują tekst, rozumowanie i polecenia. Ciągłe przenoszą obraz, klatki wideo, ruchy robota i dane o położeniu jego członów. Na pokazie model zaznacza latarnię na skalistym wybrzeżu, animuje zbliżający się dron, zmienia pogodę na śnieżycę i opisuje wprowadzone zmiany.
Generowanie wideo w czasie rzeczywistym
Podstawowa wersja generuje wideo z medianą prędkości 0,79 czasu rzeczywistego, a pierwsza klatka pojawia się po około 6 sekundach. Destylowana wersja Rho-1 Flash ogranicza odszumianie, czyli stopniowe dopracowywanie obrazu, z 99 do 8 przebiegów. Według Reka pozwala to wygenerować 5,3-sekundowy klip w około sekundę.
Firma podaje też, że w jej testach Rho-1 najszybciej ze sprawdzonych modeli zaczynał odpowiadać tekstem. To deklaracja producenta, której nie zweryfikowały niezależne testy.
Sterowanie robotem z jednego modelu
Ruchy robota Rho-1 traktuje jako ciągłe tokeny w tej samej przestrzeni co klatki wideo. Reka pokazuje model przy chwytaniu i przenoszeniu przedmiotów chwytakiem i twierdzi, że dobrze radzi sobie z kontaktem fizycznym i ruchem ciał sztywnych. Dane z robotów są drogie i nieliczne, dlatego firma łączy Rho-1 z modelem dynamiki odwrotnej, który odtwarza sterowanie ze zwykłych nagrań wideo z internetu.
Podobny kierunek obierają inne firmy budujące modele świata i modele akcji dla robotyki. Rho-1 wyróżnia się skalą treningu: 320 kart H100 przez trzy miesiące to według Reka niewielki ułamek mocy używanej do trenowania czołowych modeli językowych i wideo.
Ograniczenia wersji badawczej
Reka sama wskazuje kilka słabych punktów. Większość z nich przypisuje skromnej skali danych i mocy obliczeniowej użytej do treningu.
- Dryf przy długich sekwencjach: po około 30 sekundach struktura sceny zaczyna się rozpadać.
- Słabe śledzenie obiektów w czasie, czyli utrata spójności przy wskazywaniu elementów w kolejnych klatkach.
- Niestabilna edycja wideo, którą firma określa jako kruchą.
- Niska natywna rozdzielczość 672 na 384 piksele.
- Brak informacji o obsługiwanych językach, w tym o języku polskim.
Dostępność i znaczenie dla polskich firm
Rho-1 nie jest dostępny publicznie. Reka zaprasza do współpracy partnerów przez kontakt mailowy i wskazuje swoją platformę Reka Cloud. Firma nie podała cennika, terminu szerszej premiery ani licencji, a wagi modelu nie zostały opublikowane. Nie wiadomo też, czy dane mogą być przetwarzane w Unii Europejskiej.
W naszej ocenie Rho-1 to dziś sygnał kierunku, a nie narzędzie do wdrożenia. Dla polskich firm z branży automatyki, logistyki i produkcji wideo ważne jest jedno: łączenie rozumienia sceny, generowania obrazu i sterowania maszyną w jednym modelu może obniżyć koszt budowy systemów robotycznych, ale przy obecnej rozdzielczości i stabilności nie zastąpi sprawdzonych rozwiązań.
Źródła i data sprawdzenia
- Rho-1: Collapsing the Multimodal StackReka, publikacja: 2026-10-05, sprawdzono: 2026-10-06
- Reka's Rho-1 Merges Reasoning, Video, and Robot Control Into One ModelAlphaSignal, publikacja: 2026-10-05, sprawdzono: 2026-10-06
Artykuł ma charakter informacyjny. Przy decyzjach prawnych, finansowych lub organizacyjnych warto zweryfikować wnioski w odniesieniu do konkretnej sytuacji.



