GLM-5.3, otwarty model chińskiej firmy Z.ai, w testach Anthropic zbudował działające exploity w przeglądarkowym silniku V8 prawie tak często jak Claude Mythos Preview. Amerykański CAISI nazywa go najsilniejszym w cyberbezpieczeństwie modelem o otwartych wagach. Dla firm oznacza to, że czas między publikacją łatki a próbą ataku może się dalej skracać, więc aktualizacje trzeba wdrażać szybciej.
Co ustalił Anthropic w raporcie o GLM-5.3
Zespół Frontier Red Team firmy Anthropic opublikował 29 września 2026 roku analizę zdolności cybernetycznych modelu GLM-5.3. Model udostępniła 14 sierpnia 2026 roku firma Z.ai (wcześniej Zhipu AI). Jego wagi można pobrać z serwisu Hugging Face bez dodatkowej weryfikacji, więc każdy może uruchomić go na własnym sprzęcie.
Główny wniosek raportu brzmi tak: GLM-5.3 zbliżył się w tworzeniu exploitów do Claude Mythos Preview, najmocniejszego modelu Anthropic w tej dziedzinie. Exploit to kod, który wykorzystuje błąd w oprogramowaniu, na przykład do przejęcia kontroli nad programem. Anthropic udostępnia swój model tylko wybranym organizacjom, a GLM-5.3 jest dostępny publicznie i według autorów raportu nie ma skutecznych zabezpieczeń.
Wyniki testów w liczbach
Anthropic zestawił GLM-5.3 z własnymi modelami w kilku testach. Poniższe liczby pochodzą z raportu firmy i nie zostały niezależnie powtórzone przez redakcję.
- ExploitBench (błędy w silniku V8 z Chrome): GLM-5.3 - 50 udanych exploitów na 410 prób, Claude Mythos Preview - 56 na 410.
- Wewnętrzny test na projektach z Google OSS-Fuzz (100 prób): pełne przejęcie przebiegu programu w 4 proc. przypadków dla GLM-5.3 i 6 proc. dla Mythos Preview. Starsze modele, Claude Opus 4.6 i GLM-5.2, uzyskały 0 proc.
- Zabezpieczenia: na wprost szkodliwe polecenie model nie odpowiadał wcale, ale po podaniu fałszywego uzasadnienia (rzekome ćwiczenie zespołu testującego) współpracował w 64 proc. przypadków, a przy innej prostej manipulacji w 92 proc.
- Abliteracja: po modyfikacji wag odsetek odmów w benchmarkach JailbreakBench i HarmBench spadł z 95 proc. do 3 i 2 proc., a w StrongREJECT do 12 proc. Za pierwszym podejściem zajęło to ok. 2200 godzin pracy GPU (ok. 4,4 tys. USD, czyli ok. 16,9 tys. zł), doświadczony zespół według szacunku zmieściłby się w ok. 600 godzinach (ok. 1,2 tys. USD, ok. 4,6 tys. zł).
- Znana luka w Chrome: mniejszy wariant GLM-5.3-Flash przygotował działający exploit dla CVE-2026-11645 w połączeniu z inną znaną luką. Wymagało to 20 minut pracy człowieka, 8 godzin pracy modelu i 20,40 USD (ok. 78 zł) kosztów API.
Nowe luki i ocena NIST CAISI
Najpoważniejszą część raportu stanowią testy na prawdziwym oprogramowaniu. Badacz Anthropic w ciągu jednego dnia znalazł z pomocą GLM-5.3 kilka nieznanych wcześniej podatności (tzw. zero-day) w silniku JavaScript popularnej przeglądarki. Połączył je w exploit, który pozwalał stronie internetowej odczytać dowolny plik na komputerze ofiary, w tym prywatny klucz SSH. Luki zgłoszono producentowi przeglądarki, ale raport nie podaje jej nazwy ani stanu poprawek. Anthropic wymienia też podatności w sterownikach sieci bezprzewodowych, sterownikach graficznych i oprogramowaniu urządzeń sieciowych, które są w trakcie zgłaszania.
Niezależnie od Anthropic model ocenił CAISI, czyli ośrodek standardów AI przy amerykańskim NIST. W komunikacie z 17 września 2026 roku CAISI nazywa GLM-5.3 najbardziej zaawansowanym w cyberbezpieczeństwie modelem o otwartych wagach. Jednocześnie wskazuje, że model zostaje za czołowymi systemami z USA o około cztery miesiące. W teście SEC-Bench Pro GLM-5.3 osiągnął 40,4 proc. wobec 90,2 proc., a w ExploitGym 9,4 proc. wobec 44,4 proc. dla najlepszego modelu amerykańskiego.
Ograniczenia i niewiadome
Autorem głównego raportu jest bezpośredni konkurent Z.ai, który w tych samych materiałach promuje udostępnianie własnych modeli obrońcom w ramach programu Project Glasswing. Część wyników pokrywa się z oceną rządowego CAISI, ale szczegółowych danych z testów i opisu nowych luk nie opublikowano, więc nie da się ich niezależnie sprawdzić. W materiałach źródłowych nie znaleźliśmy stanowiska Z.ai.
Anthropic sam zaznacza, że testy odmów prowadzono w symulowanym środowisku z atrapami narzędzi, które nie wykonywały kodu. Taki test nie odwzorowuje w pełni warunków rzeczywistych. Wyniki benchmarków mierzą też odsetek udanych prób, a nie liczbę realnych ataków. Raport nie dowodzi, że ktoś już wykorzystał GLM-5.3 do włamania.
Co raport oznacza dla firm w Polsce
Wniosek praktyczny dotyczy tempa aktualizacji. Jeśli przygotowanie exploita dla znanej luki kosztuje kilkadziesiąt dolarów i kilka godzin pracy modelu, okres między publikacją łatki a pierwszymi próbami ataku może się skracać. Przeglądarki, sterowniki i oprogramowanie urządzeń sieciowych, czyli kategorie wskazane w raporcie, powinny trafić na początek kolejki aktualizacji.
Raport nie jest argumentem przeciw używaniu modeli otwartych do zwykłej pracy. Ryzyko dotyczy tego, że ta sama zdolność jest dostępna dla atakujących bez kontroli dostępu. W naszej ocenie działy IT i bezpieczeństwa powinny teraz zrobić trzy rzeczy:
- Skrócić czas wdrażania poprawek dla przeglądarek i urządzeń brzegowych sieci, a wersje sprawdzać centralnie, a nie na zgłoszenie użytkownika.
- Śledzić ostrzeżenia CERT Polska i producentów oraz od razu sprawdzać, czy nowe podatności dotyczą używanego sprzętu.
- Rozważyć użycie modeli AI po stronie obrony, na przykład do przeglądu kodu i priorytetyzacji łatek, z zachowaniem zasad ochrony danych.
Źródła i data sprawdzenia
- GLM-5.3 and the spread of advanced cyber capabilitiesAnthropic, publikacja: 2026-09-29, sprawdzono: 2026-09-30
- CAISI's Assessment of Z.ai's GLM-5.3 Cyber CapabilitiesNIST, publikacja: 2026-09-17, sprawdzono: 2026-09-30
- CVE-2026-11645NIST National Vulnerability Database, publikacja: 2026-06-09, sprawdzono: 2026-09-30
- zai-org/GLM-5.3Hugging Face, publikacja: 2026-08-14, sprawdzono: 2026-09-30
- Anthropic says Zhipu's open-weight GLM-5.3 nearly matches Claude Mythos Preview at building exploitsTHE DECODER, publikacja: 2026-09-30, sprawdzono: 2026-09-30
- Kurs średni USD, tabela A nr 190/A/NBP/2026 (3,8449 zł)Narodowy Bank Polski, publikacja: 2026-09-30, sprawdzono: 2026-09-30
Artykuł ma charakter informacyjny. Przy decyzjach prawnych, finansowych lub organizacyjnych warto zweryfikować wnioski w odniesieniu do konkretnej sytuacji.



