Aktualności, narzędzia i prawo AIPolska · codziennie
Narzędzia

Reka Rho-1 łączy tekst, wideo i sterowanie robotem w jednym modelu

Rho-1 przyjmuje polecenia w trakcie generowania wideo i tymi samymi wagami przewiduje ruchy robota. Na razie to wersja badawcza bez publicznego API.

Białe ramię robota z chwytakiem podnosi drewniany klocek w laboratorium uczelni, obok monitor z nagraniem latarni na skalistym wybrzeżu, dwoje badaczy obserwuje i robi notatki
Ilustracja redakcyjna dailyAI

Firma Reka zaprezentowała 5 października 2026 roku model Rho-1, który w jednej sieci neuronowej łączy tekst, obrazy, generowanie wideo i sterowanie robotem. Model ma 19 mld parametrów, generuje wideo strumieniowo i przyjmuje nowe polecenia w trakcie nagrania. Szybsza wersja Rho-1 Flash tworzy 5,3-sekundowy klip w około sekundę. Reka udostępnia Rho-1 wyłącznie jako wersję badawczą dla partnerów i sama nazywa go dowodem koncepcji, a nie gotowym produktem.

Czym jest Reka Rho-1

Rho-1 to tak zwany model omni, czyli system, który przyjmuje i generuje różne rodzaje danych. Typowe rozwiązania łączą kilka wyspecjalizowanych modeli: jeden rozumie polecenie, drugi generuje wideo, trzeci steruje robotem. Reka twierdzi, że Rho-1 robi to wszystko w jednym kontekście, więc może wygenerować scenę, zmienić ją na żądanie, a potem wyjaśnić, co się zmieniło.

W opisie firmy architektura opiera się na dwóch rodzajach tokenów. Dyskretne obsługują tekst, rozumowanie i polecenia. Ciągłe przenoszą obraz, klatki wideo, ruchy robota i dane o położeniu jego członów. Na pokazie model zaznacza latarnię na skalistym wybrzeżu, animuje zbliżający się dron, zmienia pogodę na śnieżycę i opisuje wprowadzone zmiany.

Generowanie wideo w czasie rzeczywistym

Podstawowa wersja generuje wideo z medianą prędkości 0,79 czasu rzeczywistego, a pierwsza klatka pojawia się po około 6 sekundach. Destylowana wersja Rho-1 Flash ogranicza odszumianie, czyli stopniowe dopracowywanie obrazu, z 99 do 8 przebiegów. Według Reka pozwala to wygenerować 5,3-sekundowy klip w około sekundę.

Firma podaje też, że w jej testach Rho-1 najszybciej ze sprawdzonych modeli zaczynał odpowiadać tekstem. To deklaracja producenta, której nie zweryfikowały niezależne testy.

Sterowanie robotem z jednego modelu

Ruchy robota Rho-1 traktuje jako ciągłe tokeny w tej samej przestrzeni co klatki wideo. Reka pokazuje model przy chwytaniu i przenoszeniu przedmiotów chwytakiem i twierdzi, że dobrze radzi sobie z kontaktem fizycznym i ruchem ciał sztywnych. Dane z robotów są drogie i nieliczne, dlatego firma łączy Rho-1 z modelem dynamiki odwrotnej, który odtwarza sterowanie ze zwykłych nagrań wideo z internetu.

Podobny kierunek obierają inne firmy budujące modele świata i modele akcji dla robotyki. Rho-1 wyróżnia się skalą treningu: 320 kart H100 przez trzy miesiące to według Reka niewielki ułamek mocy używanej do trenowania czołowych modeli językowych i wideo.

Ograniczenia wersji badawczej

Reka sama wskazuje kilka słabych punktów. Większość z nich przypisuje skromnej skali danych i mocy obliczeniowej użytej do treningu.

  • Dryf przy długich sekwencjach: po około 30 sekundach struktura sceny zaczyna się rozpadać.
  • Słabe śledzenie obiektów w czasie, czyli utrata spójności przy wskazywaniu elementów w kolejnych klatkach.
  • Niestabilna edycja wideo, którą firma określa jako kruchą.
  • Niska natywna rozdzielczość 672 na 384 piksele.
  • Brak informacji o obsługiwanych językach, w tym o języku polskim.

Dostępność i znaczenie dla polskich firm

Rho-1 nie jest dostępny publicznie. Reka zaprasza do współpracy partnerów przez kontakt mailowy i wskazuje swoją platformę Reka Cloud. Firma nie podała cennika, terminu szerszej premiery ani licencji, a wagi modelu nie zostały opublikowane. Nie wiadomo też, czy dane mogą być przetwarzane w Unii Europejskiej.

W naszej ocenie Rho-1 to dziś sygnał kierunku, a nie narzędzie do wdrożenia. Dla polskich firm z branży automatyki, logistyki i produkcji wideo ważne jest jedno: łączenie rozumienia sceny, generowania obrazu i sterowania maszyną w jednym modelu może obniżyć koszt budowy systemów robotycznych, ale przy obecnej rozdzielczości i stabilności nie zastąpi sprawdzonych rozwiązań.

Źródła i data sprawdzenia

  1. Rho-1: Collapsing the Multimodal StackReka, publikacja: 2026-10-05, sprawdzono: 2026-10-06
  2. Reka's Rho-1 Merges Reasoning, Video, and Robot Control Into One ModelAlphaSignal, publikacja: 2026-10-05, sprawdzono: 2026-10-06
Nota redakcyjna

Artykuł ma charakter informacyjny. Przy decyzjach prawnych, finansowych lub organizacyjnych warto zweryfikować wnioski w odniesieniu do konkretnej sytuacji.