Agentowe rozumienie wideo to tryb Gemini API udostępniony 1 września 2026 roku, w którym model sam decyduje, które fragmenty nagrania obejrzeć i w jakiej formie. Działa w modelach Gemini 3.8, 3.7 i 3.6 Flash oraz 3.5 Flash-Lite. Według Google przy długich filmach zużywa do 88 proc. mniej tokenów, a nie wymaga dodatkowej opłaty poza standardowym cennikiem.
Czym jest agentowe rozumienie wideo
Dotąd Gemini analizował film ze stałą częstotliwością klatek, niezależnie od pytania. Przy godzinnym nagraniu oznaczało to setki tysięcy tokenów, nawet gdy odpowiedź kryła się w kilku sekundach. W trybie agentowym model sam wybiera, co obejrzeć, z jaką szybkością i przez który kanał: klatki obrazu, ścieżkę dźwiękową albo transkrypcję.
Google opisał tę funkcję 1 września 2026 roku na blogu, a autorami wpisu są Rohan Doshi i Mario Lučić z Google DeepMind. W praktyce model korzysta z wewnętrznego narzędzia do przeglądania osi czasu i dociąga tylko potrzebne fragmenty.
Wyniki deklarowane przez Google
Według Google tryb agentowy zmniejsza zużycie tokenów do 88 proc., obniża koszt analizy do 66 proc. i poprawia jakość odpowiedzi do 7 proc. Największe zyski dotyczą nagrań od 10 minut do kilku godzin. Są to wartości maksymalne podane przez producenta, a nie średnie dla każdego nagrania.
Google wymienia cztery typowe zastosowania, w których tryb ma przewagę nad analizą każdej klatki.
- Wyszukiwanie momentu z dokładnością poniżej sekundy, przydatne przy montażu.
- Odnajdywanie konkretnej informacji w wielogodzinnym materiale.
- Wykrywanie anomalii przez ponowne, gęstsze próbkowanie podejrzanych fragmentów.
- Liczenie powtarzanych ruchów i obiektów w czasie.
Jak włączyć agentowe rozumienie wideo w Gemini API
Wystarczy dodać do opisu wideo w zapytaniu pole processing z wartością agentic. Dokumentacja wymienia modele gemini-3.8-flash, gemini-3.7-flash, gemini-3.6-flash i gemini-3.5-flash-lite. Wpis na blogu z 1 września wymieniał tylko trzy ostatnie, a obecna dokumentacja dopisuje do listy także Gemini 3.8 Flash.
Nagranie można przekazać przez Files API (do 20 GB na płatnym poziomie, 2 GB na bezpłatnym), jako link do publicznego filmu YouTube w wersji preview albo bezpośrednio w zapytaniu, jeśli plik ma mniej niż 100 MB. Funkcja jest dostępna w Google AI Studio i w Gemini Enterprise Agent Platform.
Ile to kosztuje w złotych
Tryb agentowy nie ma osobnej opłaty, płaci się standardowo za tokeny. W trybie statycznym, przy domyślnej niskiej rozdzielczości, sekunda wideo to około 100 tokenów, więc godzina nagrania daje około 360 tys. tokenów. Gemini 3.7 Flash kosztuje 0,75 USD za milion tokenów wejściowych, co daje 0,27 USD, czyli ok. 1,04 zł za godzinę materiału na wejściu.
Scenariusz dla polskiej firmy: agencja medialna analizuje co miesiąc 100 godzin nagrań. W trybie statycznym samo wejście kosztuje około 27 USD, czyli ok. 103,69 zł. Przy maksymalnej deklarowanej oszczędności 88 proc. tokenów byłoby to około 3,24 USD, czyli ok. 12,44 zł. Realny wynik będzie zależał od pytań i rodzaju materiału, a Google podaje ostrożniejszą wartość do 66 proc. niższego kosztu. Kurs NBP z 25 września 2026 roku: 1 USD = 3,8404 zł, ceny bez VAT.
Kiedy lepszy jest tryb statyczny
Dokumentacja nie traktuje trybu agentowego jako domyślnego. Zaleca go przy długich nagraniach i pytaniach o konkretne momenty. Tryb statyczny pozostaje lepszy przy krótkich klipach poniżej 5 minut, gdy liczy się szybkość odpowiedzi, oraz wtedy, gdy potrzebna jest precyzja na poziomie każdej klatki w całym nagraniu.
Tryb agentowy może też trwać dłużej. Przy długich filmach i złożonych poleceniach Google zaleca strumieniowanie odpowiedzi albo wykonanie w tle. Modele z oknem 1 mln tokenów obsługują nagrania do około 3 godzin w niskiej rozdzielczości.
Ograniczenia i znaczenie dla firm w Polsce
Wszystkie liczby dotyczące oszczędności i jakości pochodzą od Google i nie zostały opublikowane z pełną metodologią dla różnych typów nagrań. Model może pominąć fragment, którego nie uzna za istotny, dlatego przy kontroli jakości lub dokumentacji zdarzeń wyniki trzeba weryfikować. W ocenie redakcji dailyAI najlepiej porównać oba tryby na kilku własnych nagraniach przed zmianą procesu.
Gemini API działa w Polsce, a warunki usługi wymagają płatnego poziomu dla aplikacji udostępnianych użytkownikom w Europejskim Obszarze Gospodarczym. Nagrania, na których widać ludzi, na przykład z monitoringu lub spotkań, zawierają dane osobowe, więc przed wysłaniem ich do API trzeba to uwzględnić w procedurach ochrony danych. Źródła Google nie odnoszą się do RODO w kontekście tej funkcji. Wdrożenie w aplikacji Gemini ma objąć wszystkich użytkowników wkrótce, a Ask YouTube pojawi się w ciągu kilku miesięcy, bez dat dla Polski.
Źródła i data sprawdzenia
- Introducing agentic video understanding with GeminiGoogle, publikacja: 2026-09-01, sprawdzono: 2026-09-26
- Video understandingGoogle AI for Developers, publikacja: 2026-09-01, sprawdzono: 2026-09-26
- Gemini API release notes - Agentic video understandingGoogle AI for Developers, publikacja: 2026-09-01, sprawdzono: 2026-09-26
- Gemini Developer API pricingGoogle AI for Developers, publikacja: 2026-09-01, sprawdzono: 2026-09-26
- Gemini API Additional Terms of ServiceGoogle AI for Developers, publikacja: 2026-03-23, sprawdzono: 2026-09-26
- Kurs średni USD, tabela 187/A/NBP/2026Narodowy Bank Polski, publikacja: 2026-09-25, sprawdzono: 2026-09-26
Artykuł ma charakter informacyjny. Przy decyzjach prawnych, finansowych lub organizacyjnych warto zweryfikować wnioski w odniesieniu do konkretnej sytuacji.



