Aktualności, narzędzia i prawo AIPolska · codziennie
Prawo

Chińskie modele AI rzadko mają publiczne testy bezpieczeństwa

Według raportu SemiAnalysis tylko 31 z 857 modeli dziewięciu czołowych chińskich firm AI miało opublikowany wynik testu bezpieczeństwa, a przed premierą 9.

Badaczka i młodszy badacz przy biurku w europejskim biurze nad kanałem przeglądają wydrukowane raporty z wykresami i tabelę wyników na laptopie
Ilustracja redakcyjna dailyAI

Dziewięć czołowych chińskich firm AI opublikowało wyniki testów bezpieczeństwa tylko dla 31 z 857 swoich modeli, czyli dla 3,6 proc. premier. Tak wynika z raportu amerykańskiej firmy analitycznej SemiAnalysis z 8 października 2026 roku, który dzień później opisał Reuters. Wynik dostępny w dniu premiery lub wcześniej miało zaledwie 9 modeli. Dla firm w Polsce, które korzystają z modeli Qwen, DeepSeek czy Kimi, oznacza to, że ocenę ryzyka często trzeba wykonać samodzielnie. Aktualizacja z 9 października 2026 roku dotyczy testów chińskich modeli prowadzonych przez ENISA i Komisję Europejską.

Co sprawdził raport SemiAnalysis

Autorzy raportu, Mark Chen, Doug i Dylan Patel, zebrali wszystkie możliwe do zidentyfikowania premiery modeli dziewięciu chińskich firm. Cztery z nich to wielkie koncerny technologiczne, czyli ByteDance, Alibaba, Tencent i Baidu, a pięć to startupy: DeepSeek, Moonshot, Zhipu (Z.ai), MiniMax i StepFun. Baza obejmuje 741 modeli produktowych i 116 badawczych.

Każdą premierę porównano z kartą modelu, notatkami wydania i raportem technicznym. Kryterium było ostre. Liczył się wyłącznie konkretny wynik dotyczący szkodliwych odpowiedzi, odporności na obchodzenie zabezpieczeń (jailbreak), toksyczności, prywatności, odmów lub niebezpiecznych zdolności, przypisany do nazwanego modelu. Ogólne zapewnienie, że model przeszedł trening bezpieczeństwa, nie wystarczało.

Najważniejsze liczby z raportu

Z 857 premier tylko 31 miało kiedykolwiek opublikowany wynik testu. Szesnaście z nich udokumentowano dopiero po premierze, a najdłużej, bo 349 dni, czekano na dane o DeepSeek-R1. W 10 przypadkach firma deklarowała ewaluację bez podania wyników, a o 3 wiadomo tylko z relacji prasowych lub materiałów dla inwestorów. Szczegóły przedstawia zestawienie poniżej.

  • Alibaba - wynik dla 7 z 238 modeli, w tym 3 w dniu premiery.
  • ByteDance - 2 z 120 modeli.
  • Tencent - 1 ze 133 modeli.
  • Baidu - 1 z 49 modeli.
  • Zhipu (Z.ai) - jedyna firma, która publikowała jakiś wynik w każdym roku od 2022 roku.
  • DeepSeek - wyniki dla V3 w dniu premiery, brak danych dla R1, V3.1 i rodziny V4.
  • Modele rozumujące - 93 proc. bez żadnych opublikowanych wyników.

Niebezpieczne zdolności prawie bez dokumentacji

Najsłabiej wypada obszar, który budzi dziś najwięcej obaw, czyli zdolności ofensywne w cyberbezpieczeństwie i ryzyko biologiczne. Według SemiAnalysis dotyczyły ich tylko trzy dokumenty: dwie notatki Zhipu o modelach GLM-5.2 i GLM-5.3 oraz raport techniczny Kimi K2 od Moonshot. Żaden nie pochodził od czterech wielkich koncernów.

Reuters zwraca uwagę, że żaden czołowy chiński twórca nie wydał modelu tekstowego z publicznymi testami niebezpiecznych zdolności obejmującymi cyberataki, zagrożenia biologiczne i utratę kontroli nad systemem. Dla porównania OpenAI, Anthropic i Google DeepMind publikowały raporty bezpieczeństwa lub karty systemowe przy części dużych premier. Raport nie podaje jednak porównywalnych statystyk dla firm amerykańskich.

Dlaczego chińskie przepisy tego nie wymuszają

Autorzy raportu wskazują, że wiążące chińskie regulacje dotyczą głównie aplikacji i ich wpływu na użytkowników, na przykład oznaczania treści, ochrony małoletnich i usług towarzyszących. Nie nakładają na twórców najsilniejszych modeli obowiązku przeprowadzania ani publikowania ocen ryzyka zależnych od zdolności modelu.

Opublikowane 14 września 2026 roku Ramy zarządzania bezpieczeństwem AI w wersji 3.0 dodają nowe kategorie ryzyka, w tym zachowania odbiegające od oczekiwań oraz agentów. Jako pierwszy priorytet wskazują jednak rozwój i innowacje. SemiAnalysis zestawia to z Unią Europejską, gdzie obowiązki dla modeli o ryzyku systemowym zaczynają się od progu 10^25 operacji zmiennoprzecinkowych użytych w treningu, oraz z kalifornijską ustawą SB 53.

ENISA i JRC testują chińskie modele na własną rękę

Unia Europejska nie czeka na dokumentację od chińskich producentów. Według Politico, którego ustalenia 9 października 2026 roku opisał The Next Web, unijna agencja cyberbezpieczeństwa ENISA i Wspólne Centrum Badawcze Komisji Europejskiej (JRC) testują chińskie modele z otwartymi wagami. Pracę potwierdziło trzech urzędników UE, a obie instytucje mówią o niej publicznie po raz pierwszy.

Dyrektor wykonawczy ENISA Juhan Lepassaar powiedział Politico, że agencja sprawdza kilka chińskich modeli. Rzecznik Komisji Maciej Berestecki wyjaśnił, że badanie JRC obejmuje też czołowe systemy amerykańskie i europejskie, a jego celem jest ocena możliwości, słabych punktów i ryzyka. JRC uruchamia modele na własnych zabezpieczonych komputerach, nie prosiło twórców o specjalny dostęp i nie zamierza używać tych modeli w codziennej pracy Komisji.

Instytucje nie ujawniły, które modele sprawdzają ani jakie są dotychczasowe wyniki. Jeden z urzędników zaznaczył w rozmowie z Politico, że bezpieczeństwo nie jest głównym celem testów JRC. ENISA i JRC budują jednocześnie wspólną platformę do testowania AI, przewidzianą w lipcowym planie Komisji dotyczącym AI i cyberbezpieczeństwa. Ma być gotowa do końca 2026 roku i ma pozwolić m.in. sektorom energii, finansów i zdrowia sprawdzać narzędzia AI w symulowanych sieciach.

Co to oznacza dla firm w Polsce

Chińskie modele z otwartymi wagami, takie jak Qwen, DeepSeek czy GLM, są popularne w Europie, bo można je uruchomić na własnym serwerze i nie wysyłać danych do zewnętrznego dostawcy. Raport pokazuje, że wybierając taki model, firma zwykle nie dostaje publicznych danych o jego zachowaniu w trudnych scenariuszach.

AI Act od 2 sierpnia 2025 roku wymaga od dostawców modeli ogólnego przeznaczenia wprowadzanych na rynek UE dokumentacji technicznej, a od dostawców modeli o ryzyku systemowym także ewaluacji, testów adwersaryjnych i zgłaszania poważnych incydentów. Komisja Europejska może egzekwować te obowiązki karami od 2 sierpnia 2026 roku. Rozporządzenie nie zdejmuje jednak z firmy wdrażającej model odpowiedzialności za to, jak działa jej własna aplikacja. W naszej ocenie przed wdrożeniem warto wykonać kilka kroków.

  1. Sprawdź kartę modelu i raport techniczny konkretnej wersji, a nie całej rodziny modeli.
  2. Przetestuj model na własnych danych i scenariuszach nadużyć, także w języku polskim, zanim trafi do klientów.
  3. Ogranicz uprawnienia modelu w systemach agentowych, szczególnie dostęp do sieci, plików i poleceń systemowych.
  4. Zapisuj wersję modelu i wyniki testów, aby móc wykazać należytą staranność wobec klientów i audytorów.

Ograniczenia raportu

Brak publikacji nie oznacza braku testów. Reuters podkreśla, że firmy mogły badać modele wewnętrznie, a żadna z nich nie skomentowała raportu. Opublikowany wynik nie jest też gwarancją bezpieczeństwa, bo jego zakres i metodę wybiera sam producent.

SemiAnalysis to komercyjna firma analityczna, a pełna treść raportu jest płatna. Zestawienie dla poszczególnych firm autorzy określają jako orientacyjne, nie ranking. Opieramy się na publicznie dostępnej części raportu i relacji Reutersa.

Źródła i data sprawdzenia

  1. Beijing Will Not Pace the Frontier: China's Speed-First AI Safety RegimeSemiAnalysis, publikacja: 2026-10-08, sprawdzono: 2026-10-09
  2. China AI developers publish safety tests for just 3.6% of model releases, report findsReuters (przedruk Investing.com), publikacja: 2026-10-09, sprawdzono: 2026-10-09
  3. EU's cyber agency and research centre are testing Chinese AI modelsThe Next Web (za Politico), publikacja: 2026-10-09, sprawdzono: 2026-10-09
  4. Rozporządzenie (UE) 2024/1689 w sprawie sztucznej inteligencji (AI Act)EUR-Lex, publikacja: 2024-07-12, sprawdzono: 2026-10-09
Nota redakcyjna

Artykuł ma charakter informacyjny. Przy decyzjach prawnych, finansowych lub organizacyjnych warto zweryfikować wnioski w odniesieniu do konkretnej sytuacji.