Mantis to otwarty zestaw narzędzi Google, w którym agenci AI przeglądają repozytorium, szukają podatności, odrzucają fałszywe alarmy, odtwarzają błąd w sandboxie i przygotowują poprawkę do oceny człowieka. Google udostępnił go 3 września 2026 roku na licencji Apache 2.0. Narzędzie działa z Gemini CLI, Antigravity CLI, Google ADK i innymi agentami programistycznymi, ale według autorów nie jest gotowym produktem do użycia produkcyjnego.
Czym jest Google Mantis
Mantis to zestaw umiejętności (skills) dla agentów AI oraz przykładowy harness, czyli program sterujący pracą wielu agentów, zbudowany w Google Agent Development Kit (ADK). Google opisał go 3 września 2026 roku na blogu Google Cloud. Autorami wpisu są inżynierowie bezpieczeństwa Nick Galloway i Yulong Zhang.
Projekt odpowiada na znany problem automatycznego skanowania kodu przez modele językowe: zbyt wiele fałszywych alarmów. Google podaje, że w typowych narzędziach tego typu odsetek trafnych zgłoszeń bywa niższy niż 7 proc. Mantis ma go podnieść dzięki agentom-krytykom, które podważają każde znalezisko, oraz próbie odtworzenia błędu w izolowanym środowisku.
Jak działa przegląd kodu w Mantis
Mantis składa się z kilkunastu modułów, które mogą działać po kolei albo równolegle. Według dokumentacji w repozytorium proces wygląda następująco:
- Analiza historii repozytorium, aby wychwycić wcześniejsze poprawki bezpieczeństwa i nie powtarzać tych samych błędów.
- Zbudowanie hierarchicznego streszczenia kodu oraz modelu zagrożeń, także wtedy, gdy zespół nie ma takiej dokumentacji.
- Przygotowanie hipotez dla poszczególnych agentów, na przykład poszukiwania błędów kontroli dostępu, i ich sprawdzenie.
- Usunięcie duplikatów oraz krytyczna ocena znalezisk przez osobne agenty, które mają ograniczać halucynacje.
- Odtworzenie podatności w sandboxie, od testu jednostkowego po makietę serwera, a następnie przygotowanie poprawki i ponowny atak na poprawiony kod.
- Ocena powagi błędu według stałej skali, żeby do ludzi trafiały najpoważniejsze problemy, a nie tysiące zgłoszeń oznaczonych jako krytyczne.
Wyniki deklarowane przez Google
Liczby pochodzą od Google i nie zostały niezależnie sprawdzone. Firma podaje, że hierarchiczne streszczanie kodu obniżyło zużycie tokenów o ponad 85 proc., co ma znaczenie przy kosztach skanowania dużych repozytoriów. W osobnym wpisie z 19 września 2026 roku Google opisał, jak podobne agenty chronią jego własną infrastrukturę.
Według tego wpisu agenty sprawdzają każdą zmianę w kodzie jeszcze przed jej zatwierdzeniem i co miesiąc zatrzymują setki podatności. Agent weryfikujący zgłoszenia ma precyzję powyżej 92 proc. i kończy analizę w mniej niż minutę. Odsetek fałszywych alarmów spada w części przypadków do 3 proc., gdy agenty korzystają z modelu zagrożeń przygotowanego dla konkretnego systemu. Google nie ujawnia, ilu podatności agenty nie wykryły.
Wymagania i ograniczenia
Mantis nie jest usługą w chmurze, tylko kodem do samodzielnego wdrożenia. Instalacja wymaga Pythona, a do odtwarzania podatności Dockera i najlepiej gVisora, czyli dodatkowej warstwy izolacji kontenerów z wyłączonym dostępem do sieci. Harness współpracuje z modelami Gemini przez Vertex AI, ale repozytorium opisuje też użycie z innymi agentami programistycznymi. Koszt zależy od wybranego modelu i wielkości repozytorium, a Google nie podaje przykładowej kwoty za przegląd.
Autorzy wprost ostrzegają, że narzędzie generuje i uruchamia kod, który może zachowywać się nieprzewidywalnie. Zalecają uruchamianie go tylko w odizolowanym środowisku bez dostępu do systemów produkcyjnych, danych wrażliwych i sieci wewnętrznej. Projekt nie jest oficjalnie wspieranym produktem Google i nie jest objęty programem nagród za błędy. Model może też przeoczyć lukę albo zaproponować błędną poprawkę, dlatego każde znalezisko wymaga oceny specjalisty.
Co Mantis oznacza dla zespołów w Polsce
Dla software house'ów i działów IT Mantis jest przede wszystkim darmowym wzorcem, jak zorganizować przegląd bezpieczeństwa z udziałem agentów AI. Pokazuje, że sam model nie wystarcza. Potrzebne są model zagrożeń, weryfikacja przez drugiego agenta, odtworzenie błędu i ocena człowieka. Z tego samego powodu testy Anthropic i NIST dotyczące otwartego modelu GLM-5.3 skłaniają do szybszego łatania: atakujący też korzystają z AI.
Przed pierwszym uruchomieniem na kodzie firmowym warto ustalić, gdzie trafia kod źródłowy. Harness wysyła fragmenty repozytorium do wybranego dostawcy modelu, więc przy kodzie klientów trzeba sprawdzić umowy i region przetwarzania danych. W naszej ocenie rozsądny pierwszy krok to test na wewnętrznym lub otwartym projekcie:
- Uruchom Mantis na osobnej maszynie lub w chmurze, bez dostępu do sieci firmowej i danych produkcyjnych.
- Wybierz repozytorium, dla którego znasz już wyniki audytu lub testów penetracyjnych, i porównaj znaleziska.
- Dodaj własną dokumentację architektury i zasady kodowania. Google podkreśla, że wiedza przygotowana przez ludzi wyraźnie poprawia wyniki.
- Ustal limit wydatków na API przed dłuższym przebiegiem i zanotuj rzeczywisty koszt przeglądu.
- Nie zgłaszaj automatycznie niezweryfikowanych błędów opiekunom projektów open source.
Źródła i data sprawdzenia
- Getting started with the Mantis harness to find and fix bugsGoogle Cloud Blog, publikacja: 2026-09-03, sprawdzono: 2026-09-30
- google/mantis - repozytorium i dokumentacjaGitHub / Google, publikacja: 2026-09-03, sprawdzono: 2026-09-30
- Changing the game: Using agentic AI to secure infrastructure codeGoogle Cloud Blog, publikacja: 2026-09-19, sprawdzono: 2026-09-30
- Google Mantis: an Agentic Vulnerability Scanning Harness for Reducing False PositivesInfoQ, publikacja: 2026-09-06, sprawdzono: 2026-09-30
Artykuł ma charakter informacyjny. Przy decyzjach prawnych, finansowych lub organizacyjnych warto zweryfikować wnioski w odniesieniu do konkretnej sytuacji.



