Ataraxos to system AI do gry Stratego, który w 20-partyjnym meczu pokonał Pima Niemeijera, czterokrotnego mistrza świata, wynikiem 15 zwycięstw, 1 porażki i 4 remisów. Opisująca go praca ukazała się w recenzowanym czasopiśmie Nature 30 września 2026 roku. Autorzy z Carnegie Mellon University, MIT, NYU i Stanfordu wytrenowali model za kilka tysięcy dolarów na 16 kartach NVIDIA H100 i udostępnili kod.
Co osiągnął Ataraxos w meczu z mistrzem świata
Stratego to planszowa gra wojenna, w której każdy gracz ustawia swoje pionki w ukryciu. Przeciwnik widzi tylko tył figur i musi zgadywać, gdzie stoi flaga, marszałek czy bomby. Liczba możliwych ustawień początkowych przekracza 10 do potęgi 33, dlatego gra od lat służy jako trudny test dla AI.
Mecz z Pimem Niemeijerem rozłożono na trzy tygodnie, aby ograniczyć zmęczenie i dać graczowi czas na przygotowanie. Holender ma na koncie cztery tytuły mistrza świata, 15 tytułów mistrza Holandii i ponad 600 tygodni na pierwszym miejscu rankingu. Za udział otrzymał 1000 USD oraz premię za każdą wygraną i remis, co miało zachęcić go do gry na pełnych obrotach.
Ataraxos grał stałą strategią i nie dostosowywał się do rywala, o czym Niemeijer wiedział. Mistrz mógł więc szukać słabych punktów programu przez 20 partii. Według cytowanego w pracy trzykrotnego mistrza świata Vincenta de Boera był to dla AI duży handicap.
Jak działa metoda autorów
Ataraxos uczy się od zera, grając sam ze sobą. Nie korzysta z partii rozegranych przez ludzi ani z gotowych zbiorów danych. System składa się z trzech elementów, które autorzy przedstawiają jako ogólny wzorzec dla gier z ukrytą informacją.
- Sieć strategii i oceny pozycji - proponuje ruchy i przewiduje wynik partii. Uczy się przez uczenie ze wzmocnieniem (reinforcement learning), czyli przesuwanie prawdopodobieństwa w stronę decyzji prowadzących do wygranej.
- Sieć przekonań - zgaduje, jakie figury przeciwnika kryją się pod zakrytymi pionkami. W trakcie treningu zna prawdziwe rozstawienie, więc może uczyć się na faktach.
- Przeszukiwanie w czasie gry - przed wyborem ruchu system losuje możliwe ukryte rozstawienia i sprawdza kilka wariantów, zanim podejmie decyzję.
Ataraxos i DeepNash w liczbach
Najważniejszą różnicą względem wcześniejszych prób jest koszt. DeepNash od DeepMind, opisany w Science w 2022 roku, powstał według autorów nowej pracy w wieloletnim projekcie kilkudziesięciu badaczy, a obliczenia kosztowały miliony dolarów. Poniższe zestawienie opiera się na danych z artykułu w Nature.
DeepNash wygrał w kwietniu 2022 roku 42 z 50 liczonych partii na platformie Gravon, ale nie zajął pierwszego miejsca w jej rankingu. Podczas pokazu na mistrzostwach świata w 2023 roku zanotował 19 zwycięstw i 9 porażek, przegrywając z większością czołowych graczy. Ataraxos wygrał z kolei od 97 do 99 na 100 partii z każdym z pięciu botów z benchmarku Stratego Evaluator, co autorzy uznają już tylko za test kontrolny.
- Przeciwnik: DeepNash - anonimowi gracze online i uczestnicy mistrzostw, Ataraxos - najbardziej utytułowany zawodnik w historii gry.
- Wynik: DeepNash - 42 z 50 partii online, 19-9 w pokazie na mistrzostwach, Ataraxos - 15-1-4 z mistrzem świata.
- Sprzęt i koszt: DeepNash - obliczenia warte miliony dolarów, Ataraxos - tydzień na 16 GPU H100 i kilka tysięcy dolarów łącznie.
- Dostępność: Ataraxos ma otwarty kod na licencji MIT i publiczny zapis partii.
Dlaczego wynik ma znaczenie poza grami
Większość prawdziwych decyzji zapada przy niepełnej wiedzy o drugiej stronie. Tak wyglądają negocjacje, aukcje, planowanie logistyki czy obrona sieci przed atakiem. Dotychczasowe metody, które pokonały ludzi w pokerze, działały tylko przy niewielkiej liczbie ukrytych stanów, na przykład 1326 możliwych rąk w Texas hold'em.
Autorzy twierdzą, że ich wzorzec przenosi się na gry rywalizacyjne, kooperacyjne i drużynowe, i pokazują to na Hanabi oraz dou dizhu. W ocenie redakcji dailyAI równie ważny jest niski koszt. Eksperyment za kilka tysięcy dolarów mieści się w budżecie zespołu uczelnianego, również w Polsce, a otwarty kod pozwala sprawdzić wyniki bez dostępu do infrastruktury dużych laboratoriów.
Ograniczenia i czego nie wiadomo
Praca przeszła recenzję naukową w Nature, ale główny wynik opiera się na jednym meczu z jednym zawodnikiem. Dwadzieścia partii to dużo jak na Stratego, lecz za mało, aby mówić o pełnej mierze przewagi nad całą czołówką. Autorzy uzupełniają go zwycięstwami nad trzema wielokrotnymi mistrzami świata w odmianie Barrage Stratego.
Gra planszowa ma jasne reguły i natychmiastową informację o wyniku. Przeniesienie metody na zadania biznesowe, w których nie da się rozegrać milionów symulacji, nie zostało w pracy pokazane. Koszt kilku tysięcy dolarów dotyczy treningu gotowego systemu, a nie całego procesu badawczego z wcześniejszymi eksperymentami.
Źródła i data sprawdzenia
- Scalable decision-making for games of imperfect informationNature, publikacja: 2026-09-30, sprawdzono: 2026-10-01
- Ataraxos - zapis partii z Pimem NiemeijeremAtaraxosAI, publikacja: 2026-09-30, sprawdzono: 2026-10-01
- AtaraxosAI/stratego - repozytorium koduGitHub, publikacja: 2026-09-30, sprawdzono: 2026-10-01
- AI beats Stratego's greatest player, ending one of the last human strongholds in board gamesTHE DECODER, publikacja: 2026-10-01, sprawdzono: 2026-10-01
Artykuł ma charakter informacyjny. Przy decyzjach prawnych, finansowych lub organizacyjnych warto zweryfikować wnioski w odniesieniu do konkretnej sytuacji.



