Aktualności, narzędzia i prawo AIPolska · codziennie
Narzędzia

Baszta-1 od Billennium. Polski model wykrywa ryzykowne treści w AI

Baszta-1 to klasyfikator o 124 mln parametrów, który rozpoznaje pięć kategorii ryzykownych treści po polsku. Model ma publiczne demo i opisaną metodologię.

Inżynierka danych i starszy badacz analizują wykresy klasyfikacji w biurze w starej kamienicy z widokiem na wieże kościoła
Ilustracja redakcyjna dailyAI

Baszta-1 to polski model od firmy Billennium, który sprawdza teksty pod kątem pięciu kategorii ryzyka: mowy nienawiści, wulgaryzmów, treści seksualnych, treści związanych z przestępstwami i samookaleczeń. Ma około 124 mln parametrów, działa wyłącznie po polsku i jest oparty na modelu HerBERT. Firma udostępniła demo i preprint w serwisie arXiv z opisem wyników i ograniczeń.

Czym jest Baszta-1

Baszta-1 to klasyfikator bezpieczeństwa, a nie model do rozmowy. Jego zadaniem jest ocena, czy tekst wpisany przez użytkownika lub wygenerowany przez chatbota należy do jednej z kategorii ryzyka. Taki filtr, nazywany też guardrailem, działa obok głównego modelu językowego.

Model przygotowali Adam Górski, Mateusz Jąkalak i Rafał Jakubowski z Billennium S.A. Jest częścią pakietu AI Governance Suite, który ma pomagać firmom kontrolować, jakich modeli używają, kto ma do nich dostęp i jakie zasady bezpieczeństwa obowiązują w poszczególnych aplikacjach. Firma zapowiada, że Baszta-1 to pierwszy z serii wyspecjalizowanych modeli.

Jakie treści rozpoznaje model

Baszta-1 przypisuje tekstowi etykiety w pięciu kategoriach. Jeden tekst może otrzymać kilka etykiet jednocześnie, dlatego autorzy opisują model jako klasyfikator wieloetykietowy.

  • mowa nienawiści (hate),
  • wulgaryzmy (vulgar),
  • treści seksualne (sex),
  • prośby i treści związane z przestępstwami (crime),
  • samookaleczenia (self-harm).

Wyniki Baszty-1 na tle Sójki

Główne porównanie dotyczy modelu Sójka, czyli polskiego klasyfikatora z rodziny Bielik Guard. Wyniki pochodzą z preprintu autorów i nie zostały jeszcze zrecenzowane. Micro-F1 mierzy skuteczność liczoną łącznie dla wszystkich etykiet, a macro-F1 uśrednia wyniki kategorii, więc mocniej karze słabość w rzadkich klasach.

  • Gadzi Język (520 podchwytliwych poleceń spoza danych treningowych): Baszta 0,927 micro-F1 i 0,699 macro-F1, Sójka 0.1B 0,582 micro-F1 i 0,619 macro-F1.
  • Test parowany po dostrojeniu obu modeli na tym samym zbiorze: przewaga Baszty w micro-F1 wynosi 0,026 (p=0,011), a różnica w macro-F1 znika.
  • Kalibracja na Gadzim Języku: błąd ECE 0,092 i wynik Briera 0,075 wobec 0,136 i 0,114 dla Sójki.
  • Testy zewnętrzne po usunięciu duplikatów: KLEJ CBD 0,671, BAN-PL 0,667, HateCheck-PL 0,644, PolyGuard-PL 0,562.
  • Fałszywe alarmy na bezpiecznych tekstach: 5,5 proc. w ustawieniu zbalansowanym, ale 10,2 proc. na KLEJ CBD i 33,4 proc. na HateCheck-PL.

Ograniczenia, które opisują sami autorzy

Preprint otwarcie wskazuje słabe strony testów. Zbiór Gadzi Język zawiera prawie wyłącznie treści ryzykowne, a 97,1 proc. przykładów ma etykietę przestępstwa. Utrudnia to ustawienie progu, który ograniczy fałszywe alarmy. Kategoria wulgaryzmów liczy w nim tylko 4 przykłady, więc wynik macro-F1 jest mało stabilny.

Autorzy przyznają też, że wybierali wariant modelu na podstawie wyników na tym samym teście, co może zawyżać ocenę. Jeden z popularnych zbiorów, PL-Guard, odrzucili jako test niezależny, bo 899 z 900 jego przykładów trafiło wcześniej do danych treningowych. Wysoki odsetek fałszywych alarmów na BAN-PL, wynoszący 85,5 proc., tłumaczą innym zakresem zadania w tym zbiorze.

W ocenie redakcji dailyAI największą wartością publikacji jest przejrzystość metod. Nagłówkowe porównanie 0,927 do 0,582 warto jednak czytać razem z testem parowanym, który pokazuje znacznie mniejszą różnicę.

Znaczenie dla polskich firm i AI Act

Większość gotowych filtrów bezpieczeństwa trenowano głównie na tekstach angielskich. W języku polskim gorzej radzą sobie z odmianą, slangiem i wulgaryzmami. Lokalny klasyfikator o 124 mln parametrów można uruchomić na własnej infrastrukturze, bez wysyłania treści do zewnętrznego dostawcy.

Billennium łączy Basztę z obsługą wymogów AI Act, NIS2 i DORA w swoim pakiecie. Sam klasyfikator nie zapewnia jednak zgodności z przepisami. Może być jednym z elementów kontroli treści, obok rejestru systemów AI, dokumentacji i nadzoru człowieka.

Jak przetestować Basztę-1

Na stronie baszta.billennium.com dostępne jest interaktywne demo dla polskich tekstów o długości od 3 do 1500 znaków. Strona zawiera też 35-stronicowy dokument techniczny i odnośnik do preprintu. Warunki licencji na wdrożenie produkcyjne nie są opisane publicznie, dlatego przed użyciem modelu w firmie trzeba je ustalić z Billennium.

Przed wdrożeniem warto sprawdzić model na własnych danych, na przykład na próbce zgłoszeń z czatu obsługi klienta. Wyniki z benchmarków nie pokażą, jak często filtr zablokuje zwykłe pytania klientów w konkretnej branży.

Źródła i data sprawdzenia

  1. Baszta: Data-Centric Fine-Tuning of a Polish Multi-Label Safety ClassifierarXiv (Billennium S.A.), publikacja: 2026-09-24, sprawdzono: 2026-09-28
  2. Baszta-1 Governance LLMBillennium, publikacja: 2026-09-23, sprawdzono: 2026-09-28
  3. AI Governance SuiteBillennium, publikacja: 2026-09-23, sprawdzono: 2026-09-28
  4. Billennium prezentuje Basztę-1. Polski model ma wykrywać ryzykowne treści w systemach AIComputerworld.pl, publikacja: 2026-09-23, sprawdzono: 2026-09-28
Nota redakcyjna

Artykuł ma charakter informacyjny. Przy decyzjach prawnych, finansowych lub organizacyjnych warto zweryfikować wnioski w odniesieniu do konkretnej sytuacji.