BootLoops to otwarty zestaw narzędzi, w którym model językowy wykonuje dokładne obliczenia naukowe pod kontrolą badacza. Opisał go 1 października 2026 roku na blogu Anthropic fizyk z Harvardu Matthew Schwartz. W trzy miesiące z Claude i 19 współautorami przygotował 36 manuskryptów w 18 dziedzinach, od fizyki cząstek po ekologię. Kod jest na GitHubie na licencji MIT i działa z dowolnym modelem.
Czym jest BootLoops
BootLoops to oprogramowanie i zestaw protokołów pracy, które Matthew Schwartz zbudował razem z Claude. Pełni rolę podobną do Claude Code czy Codex: daje modelowi narzędzia, reguły i sposób sprawdzania wyników. Różnica polega na specjalizacji. BootLoops służy do dokładnych obliczeń w naukach ścisłych, na przykład całek, które w fizyce mogą zajmować zespoły badaczy przez lata.
Punktem wyjścia była metoda zwana semi-numerycznym bootstrapem. Zamiast liczyć całkę wprost, nakłada się na wynik kolejne ograniczenia fizyczne, a pozostałe niewiadome ustala się z obliczeń numerycznych o bardzo dużej precyzji. Taki wynik każdy może zweryfikować, uruchamiając skrypty porównujące obie metody. Schwartz uznał, że to zadanie dobrze pasuje do możliwości modeli: wymaga dużo kodu, wiedzy z kilku dziedzin i daje się automatycznie sprawdzić.
Repozytorium BootLoops-ai/bootloops na GitHubie jest napisane w Pythonie. Kod ma licencję MIT, a dokumentacja licencję CC BY 4.0. Autor zaznacza, że narzędzie działa z dowolnym modelem językowym, także spoza rodziny Claude.
Co udało się policzyć z BootLoops
Pierwszy etap dotyczył amplitud rozpraszania, czyli obliczeń, dzięki którym fizycy interpretują dane z Wielkiego Zderzacza Hadronów. Według Schwartza Claude z modelem Fable 5 przeniósł metody z kilku publikacji do wspólnego środowiska i odtworzył wynik jego artykułu w około 20 minut. Samemu autorowi napisanie tego kodu zajęło tygodnie. W kilka tygodni powstało 30 obliczonych od początku do końca całek, w tym 15 nowych.
Później model zaczął wskazywać, że te same techniki matematyczne pasują do problemów z innych dziedzin. Autor opisuje we wpisie m.in. następujące projekty:
- Ekologia: rozwiązanie równania Etienne'a z 2005 roku dla neutralnej teorii bioróżnorodności. Dane z wyspy Barro Colorado w Panamie pokazały, że skład gatunkowy drzew zmienia się 4,5 razy szybciej, niż dopuszcza ta teoria.
- Genetyka populacyjna: analiza 5,7 mld par sąsiednich mutacji z projektu 1000 Genomes, która dała ślady mechanizmu konwersji genów.
- Ekonomia: automatyczny redaktor danych, który przeniósł pakiety replikacyjne 4452 artykułów z pięciu czołowych czasopism na otwarte oprogramowanie i porównał wyniki z tabelami. Wyniki opisano w working paper NBER.
- Językoznawstwo: baza AccStack z informacjami o akcencie wyrazowym w 6072 językach i bibliografią 160 tys. prac z fonologii.
- Fizyka matematyczna: rozwiązanie tzw. ostatniego problemu Watsona, czyli prawdopodobieństwa powrotu błądzenia losowego w trzech wymiarach przy trzech różnych szybkościach skoków.
Jak wyglądała praca z Claude
Schwartz prowadził sesje Claude Code w terminalach na maszynach wirtualnych Google Cloud. Każdy projekt miał osobną sesję, a sesja nadrzędna przydzielała moc obliczeniową i sprawdzała wyniki. Obliczenia wykonywały w tle subagenci, czyli pomocnicze instancje modelu, a wyniki pośrednie trafiały do plików markdown.
Taki podział miał też praktyczny powód. Autor pisze, że regularnie trafiał na klasyfikatory bezpieczeństwa Fable 5. Gdy blokada zatrzymywała pojedynczego subagenta, reszta sesji działała dalej. Osobne sesje odpowiadały za pisanie tekstów, dokumentację narzędzi i weryfikację wyników w roli krytycznego recenzenta.
Ważniejsza od infrastruktury okazała się współpraca z ekspertami. Ekolog James O'Dwyer ocenił pierwszy wynik jako sprawny technicznie, ale mało ciekawy dla ekologów. Dopiero jego pomysł, aby odjąć przewidywania teorii neutralnej i badać resztę, doprowadził do nowego modelu. Podobnie było w genetyce, gdzie kierunek wskazał biolog Michael Desai.
Jakie błędy popełnia model według autora
Wpis zawiera listę problemów, które Schwartz napotykał regularnie. Ma ona wartość dla każdego, kto używa agentów AI do dłuższej pracy analitycznej, także poza nauką.
- Model zbyt wcześnie ogłasza sukces. Dowód gotowy z wyjątkiem jednego lematu okazał się w praktyce niegotowy, bo ten lemat był całym dowodem.
- Automatyczne testy nie wystarczają. Autor zawsze prosi o wykresy i nie ufa ogólnikom w rodzaju dobrej zgodności z danymi.
- Obliczenia bywają poprawne, a wnioski z nich błędne. Model trzeba dopytywać, aż wyjaśnienie będzie przekonujące.
- Claude źle szacuje czas pracy i woli wielodniowe mozolne liczenie niż zbudowanie narzędzia, które skróci zadanie do minut.
- Przy długich projektach kompresja kontekstu powoduje utratę ważnych informacji, dlatego model musi regularnie porządkować pliki z planem.
Ograniczenia i niewiadome
Wpis jest relacją jednego badacza opublikowaną na blogu firmy, w której jest on badaczem wizytującym. Anthropic zaznacza, że BootLoops nie jest jej projektem. Większość opisanych wyników nie przeszła recenzji naukowej, a część projektów, jak zaznacza sam autor, jest nadal sprawdzana i rozwijana.
Nie wiadomo, ile kosztowały obliczenia. Schwartz pisze tylko, że projekty zużyły dużo mocy obliczeniowej i tokenów. Nie podano też, jaka część z około 400 kandydujących problemów zakończyła się niepowodzeniem ani ile czasu ekspertów pochłonęła weryfikacja.
W naszej ocenie najważniejszy wniosek z tekstu jest ostrożny. Model sprawdził się przy zadaniach, w których wynik da się policzyć i zweryfikować. Wybór pytania wartego zbadania i ocena znaczenia wyniku nadal należały do ludzi.
Co to oznacza dla polskich naukowców
BootLoops jest bezpłatny i otwarty, więc polskie zespoły mogą go przetestować z dowolnym modelem, do którego mają dostęp. Najbliżej mają fizycy teoretyczni, genetycy populacyjni, ekolodzy i ekonomiści pracujący na danych replikacyjnych. Koszty generuje przede wszystkim korzystanie z modelu przez API i moc obliczeniowa.
Schwartz zwraca też uwagę na planowanie badań. Pyta, czy ma sens wniosek o trzyletni grant na obliczenie, które model może wykonać w jedną noc. Przyznaje, że nie wie już, jak kształcić doktorantów, a kurs Pythona dla inżynierów uważa dziś za zbędny. To głos jednej osoby, ale dotyczy także polskich uczelni, które planują programy studiów i wieloletnie projekty badawcze.
Zespoły, które chcą zacząć, mogą wybrać jeden dobrze zdefiniowany problem obliczeniowy ze sprawdzalnym wynikiem. Warto od początku zaprosić eksperta z dziedziny, której dotyczy problem, i ustalić twarde kryteria sukcesu przed uruchomieniem agenta.
Źródła i data sprawdzenia
- Claude-shaped scienceAnthropic, publikacja: 2026-10-01, sprawdzono: 2026-10-03
- BootLoops-ai/bootloopsGitHub, publikacja: 2026-10-01, sprawdzono: 2026-10-03
- BootLoopsBootLoops, publikacja: 2026-10-01, sprawdzono: 2026-10-03
- Open-source BootLoops harness supports AI models in performing precise scientific calculationsTHE DECODER, publikacja: 2026-10-03, sprawdzono: 2026-10-03
Artykuł ma charakter informacyjny. Przy decyzjach prawnych, finansowych lub organizacyjnych warto zweryfikować wnioski w odniesieniu do konkretnej sytuacji.



