Aktualności, narzędzia i prawo AIPolska · codziennie
Narzędzia

Ataraxos pokonał mistrza Stratego. AI wygrywa w grze z ukrytą informacją

Ataraxos, AI naukowców z CMU, MIT, NYU i Stanfordu, wygrał 15 z 20 partii Stratego z rekordzistą świata. Trening kosztował kilka tysięcy dolarów, a kod jest otwarty.

Mężczyzna w okularach analizuje drewnianą planszę z czerwonymi i niebieskimi pionkami odwróconymi od przeciwnika, obok laptop z mapami prawdopodobieństwa w sali uczelnianej
Ilustracja redakcyjna dailyAI

Ataraxos to system AI do gry Stratego, który w 20-partyjnym meczu pokonał Pima Niemeijera, czterokrotnego mistrza świata, wynikiem 15 zwycięstw, 1 porażki i 4 remisów. Opisująca go praca ukazała się w recenzowanym czasopiśmie Nature 30 września 2026 roku. Autorzy z Carnegie Mellon University, MIT, NYU i Stanfordu wytrenowali model za kilka tysięcy dolarów na 16 kartach NVIDIA H100 i udostępnili kod.

Co osiągnął Ataraxos w meczu z mistrzem świata

Stratego to planszowa gra wojenna, w której każdy gracz ustawia swoje pionki w ukryciu. Przeciwnik widzi tylko tył figur i musi zgadywać, gdzie stoi flaga, marszałek czy bomby. Liczba możliwych ustawień początkowych przekracza 10 do potęgi 33, dlatego gra od lat służy jako trudny test dla AI.

Mecz z Pimem Niemeijerem rozłożono na trzy tygodnie, aby ograniczyć zmęczenie i dać graczowi czas na przygotowanie. Holender ma na koncie cztery tytuły mistrza świata, 15 tytułów mistrza Holandii i ponad 600 tygodni na pierwszym miejscu rankingu. Za udział otrzymał 1000 USD oraz premię za każdą wygraną i remis, co miało zachęcić go do gry na pełnych obrotach.

Ataraxos grał stałą strategią i nie dostosowywał się do rywala, o czym Niemeijer wiedział. Mistrz mógł więc szukać słabych punktów programu przez 20 partii. Według cytowanego w pracy trzykrotnego mistrza świata Vincenta de Boera był to dla AI duży handicap.

Jak działa metoda autorów

Ataraxos uczy się od zera, grając sam ze sobą. Nie korzysta z partii rozegranych przez ludzi ani z gotowych zbiorów danych. System składa się z trzech elementów, które autorzy przedstawiają jako ogólny wzorzec dla gier z ukrytą informacją.

  • Sieć strategii i oceny pozycji - proponuje ruchy i przewiduje wynik partii. Uczy się przez uczenie ze wzmocnieniem (reinforcement learning), czyli przesuwanie prawdopodobieństwa w stronę decyzji prowadzących do wygranej.
  • Sieć przekonań - zgaduje, jakie figury przeciwnika kryją się pod zakrytymi pionkami. W trakcie treningu zna prawdziwe rozstawienie, więc może uczyć się na faktach.
  • Przeszukiwanie w czasie gry - przed wyborem ruchu system losuje możliwe ukryte rozstawienia i sprawdza kilka wariantów, zanim podejmie decyzję.

Ataraxos i DeepNash w liczbach

Najważniejszą różnicą względem wcześniejszych prób jest koszt. DeepNash od DeepMind, opisany w Science w 2022 roku, powstał według autorów nowej pracy w wieloletnim projekcie kilkudziesięciu badaczy, a obliczenia kosztowały miliony dolarów. Poniższe zestawienie opiera się na danych z artykułu w Nature.

DeepNash wygrał w kwietniu 2022 roku 42 z 50 liczonych partii na platformie Gravon, ale nie zajął pierwszego miejsca w jej rankingu. Podczas pokazu na mistrzostwach świata w 2023 roku zanotował 19 zwycięstw i 9 porażek, przegrywając z większością czołowych graczy. Ataraxos wygrał z kolei od 97 do 99 na 100 partii z każdym z pięciu botów z benchmarku Stratego Evaluator, co autorzy uznają już tylko za test kontrolny.

  • Przeciwnik: DeepNash - anonimowi gracze online i uczestnicy mistrzostw, Ataraxos - najbardziej utytułowany zawodnik w historii gry.
  • Wynik: DeepNash - 42 z 50 partii online, 19-9 w pokazie na mistrzostwach, Ataraxos - 15-1-4 z mistrzem świata.
  • Sprzęt i koszt: DeepNash - obliczenia warte miliony dolarów, Ataraxos - tydzień na 16 GPU H100 i kilka tysięcy dolarów łącznie.
  • Dostępność: Ataraxos ma otwarty kod na licencji MIT i publiczny zapis partii.

Dlaczego wynik ma znaczenie poza grami

Większość prawdziwych decyzji zapada przy niepełnej wiedzy o drugiej stronie. Tak wyglądają negocjacje, aukcje, planowanie logistyki czy obrona sieci przed atakiem. Dotychczasowe metody, które pokonały ludzi w pokerze, działały tylko przy niewielkiej liczbie ukrytych stanów, na przykład 1326 możliwych rąk w Texas hold'em.

Autorzy twierdzą, że ich wzorzec przenosi się na gry rywalizacyjne, kooperacyjne i drużynowe, i pokazują to na Hanabi oraz dou dizhu. W ocenie redakcji dailyAI równie ważny jest niski koszt. Eksperyment za kilka tysięcy dolarów mieści się w budżecie zespołu uczelnianego, również w Polsce, a otwarty kod pozwala sprawdzić wyniki bez dostępu do infrastruktury dużych laboratoriów.

Ograniczenia i czego nie wiadomo

Praca przeszła recenzję naukową w Nature, ale główny wynik opiera się na jednym meczu z jednym zawodnikiem. Dwadzieścia partii to dużo jak na Stratego, lecz za mało, aby mówić o pełnej mierze przewagi nad całą czołówką. Autorzy uzupełniają go zwycięstwami nad trzema wielokrotnymi mistrzami świata w odmianie Barrage Stratego.

Gra planszowa ma jasne reguły i natychmiastową informację o wyniku. Przeniesienie metody na zadania biznesowe, w których nie da się rozegrać milionów symulacji, nie zostało w pracy pokazane. Koszt kilku tysięcy dolarów dotyczy treningu gotowego systemu, a nie całego procesu badawczego z wcześniejszymi eksperymentami.

Źródła i data sprawdzenia

  1. Scalable decision-making for games of imperfect informationNature, publikacja: 2026-09-30, sprawdzono: 2026-10-01
  2. Ataraxos - zapis partii z Pimem NiemeijeremAtaraxosAI, publikacja: 2026-09-30, sprawdzono: 2026-10-01
  3. AtaraxosAI/stratego - repozytorium koduGitHub, publikacja: 2026-09-30, sprawdzono: 2026-10-01
  4. AI beats Stratego's greatest player, ending one of the last human strongholds in board gamesTHE DECODER, publikacja: 2026-10-01, sprawdzono: 2026-10-01
Nota redakcyjna

Artykuł ma charakter informacyjny. Przy decyzjach prawnych, finansowych lub organizacyjnych warto zweryfikować wnioski w odniesieniu do konkretnej sytuacji.