Baszta-1 to polski model od firmy Billennium, który sprawdza teksty pod kątem pięciu kategorii ryzyka: mowy nienawiści, wulgaryzmów, treści seksualnych, treści związanych z przestępstwami i samookaleczeń. Ma około 124 mln parametrów, działa wyłącznie po polsku i jest oparty na modelu HerBERT. Firma udostępniła demo i preprint w serwisie arXiv z opisem wyników i ograniczeń.
Czym jest Baszta-1
Baszta-1 to klasyfikator bezpieczeństwa, a nie model do rozmowy. Jego zadaniem jest ocena, czy tekst wpisany przez użytkownika lub wygenerowany przez chatbota należy do jednej z kategorii ryzyka. Taki filtr, nazywany też guardrailem, działa obok głównego modelu językowego.
Model przygotowali Adam Górski, Mateusz Jąkalak i Rafał Jakubowski z Billennium S.A. Jest częścią pakietu AI Governance Suite, który ma pomagać firmom kontrolować, jakich modeli używają, kto ma do nich dostęp i jakie zasady bezpieczeństwa obowiązują w poszczególnych aplikacjach. Firma zapowiada, że Baszta-1 to pierwszy z serii wyspecjalizowanych modeli.
Jakie treści rozpoznaje model
Baszta-1 przypisuje tekstowi etykiety w pięciu kategoriach. Jeden tekst może otrzymać kilka etykiet jednocześnie, dlatego autorzy opisują model jako klasyfikator wieloetykietowy.
- mowa nienawiści (hate),
- wulgaryzmy (vulgar),
- treści seksualne (sex),
- prośby i treści związane z przestępstwami (crime),
- samookaleczenia (self-harm).
Wyniki Baszty-1 na tle Sójki
Główne porównanie dotyczy modelu Sójka, czyli polskiego klasyfikatora z rodziny Bielik Guard. Wyniki pochodzą z preprintu autorów i nie zostały jeszcze zrecenzowane. Micro-F1 mierzy skuteczność liczoną łącznie dla wszystkich etykiet, a macro-F1 uśrednia wyniki kategorii, więc mocniej karze słabość w rzadkich klasach.
- Gadzi Język (520 podchwytliwych poleceń spoza danych treningowych): Baszta 0,927 micro-F1 i 0,699 macro-F1, Sójka 0.1B 0,582 micro-F1 i 0,619 macro-F1.
- Test parowany po dostrojeniu obu modeli na tym samym zbiorze: przewaga Baszty w micro-F1 wynosi 0,026 (p=0,011), a różnica w macro-F1 znika.
- Kalibracja na Gadzim Języku: błąd ECE 0,092 i wynik Briera 0,075 wobec 0,136 i 0,114 dla Sójki.
- Testy zewnętrzne po usunięciu duplikatów: KLEJ CBD 0,671, BAN-PL 0,667, HateCheck-PL 0,644, PolyGuard-PL 0,562.
- Fałszywe alarmy na bezpiecznych tekstach: 5,5 proc. w ustawieniu zbalansowanym, ale 10,2 proc. na KLEJ CBD i 33,4 proc. na HateCheck-PL.
Ograniczenia, które opisują sami autorzy
Preprint otwarcie wskazuje słabe strony testów. Zbiór Gadzi Język zawiera prawie wyłącznie treści ryzykowne, a 97,1 proc. przykładów ma etykietę przestępstwa. Utrudnia to ustawienie progu, który ograniczy fałszywe alarmy. Kategoria wulgaryzmów liczy w nim tylko 4 przykłady, więc wynik macro-F1 jest mało stabilny.
Autorzy przyznają też, że wybierali wariant modelu na podstawie wyników na tym samym teście, co może zawyżać ocenę. Jeden z popularnych zbiorów, PL-Guard, odrzucili jako test niezależny, bo 899 z 900 jego przykładów trafiło wcześniej do danych treningowych. Wysoki odsetek fałszywych alarmów na BAN-PL, wynoszący 85,5 proc., tłumaczą innym zakresem zadania w tym zbiorze.
W ocenie redakcji dailyAI największą wartością publikacji jest przejrzystość metod. Nagłówkowe porównanie 0,927 do 0,582 warto jednak czytać razem z testem parowanym, który pokazuje znacznie mniejszą różnicę.
Znaczenie dla polskich firm i AI Act
Większość gotowych filtrów bezpieczeństwa trenowano głównie na tekstach angielskich. W języku polskim gorzej radzą sobie z odmianą, slangiem i wulgaryzmami. Lokalny klasyfikator o 124 mln parametrów można uruchomić na własnej infrastrukturze, bez wysyłania treści do zewnętrznego dostawcy.
Billennium łączy Basztę z obsługą wymogów AI Act, NIS2 i DORA w swoim pakiecie. Sam klasyfikator nie zapewnia jednak zgodności z przepisami. Może być jednym z elementów kontroli treści, obok rejestru systemów AI, dokumentacji i nadzoru człowieka.
Jak przetestować Basztę-1
Na stronie baszta.billennium.com dostępne jest interaktywne demo dla polskich tekstów o długości od 3 do 1500 znaków. Strona zawiera też 35-stronicowy dokument techniczny i odnośnik do preprintu. Warunki licencji na wdrożenie produkcyjne nie są opisane publicznie, dlatego przed użyciem modelu w firmie trzeba je ustalić z Billennium.
Przed wdrożeniem warto sprawdzić model na własnych danych, na przykład na próbce zgłoszeń z czatu obsługi klienta. Wyniki z benchmarków nie pokażą, jak często filtr zablokuje zwykłe pytania klientów w konkretnej branży.
Źródła i data sprawdzenia
- Baszta: Data-Centric Fine-Tuning of a Polish Multi-Label Safety ClassifierarXiv (Billennium S.A.), publikacja: 2026-09-24, sprawdzono: 2026-09-28
- Baszta-1 Governance LLMBillennium, publikacja: 2026-09-23, sprawdzono: 2026-09-28
- AI Governance SuiteBillennium, publikacja: 2026-09-23, sprawdzono: 2026-09-28
- Billennium prezentuje Basztę-1. Polski model ma wykrywać ryzykowne treści w systemach AIComputerworld.pl, publikacja: 2026-09-23, sprawdzono: 2026-09-28
Artykuł ma charakter informacyjny. Przy decyzjach prawnych, finansowych lub organizacyjnych warto zweryfikować wnioski w odniesieniu do konkretnej sytuacji.



