Aktualności, narzędzia i prawo AIPolska · codziennie
Biznes

ThinkingBox. Microsoft sprawdza niezawodność agentów AI

Benchmark ThinkingBox sprawdza 18 modeli w 507 procesach biznesowych. Claude Opus 5.5 prowadzi, ale tylko 241 zadań wykonał poprawnie 20 razy na 20.

Dwoje pracowników w biurze z ceglanymi ścianami porównuje na monitorach rozmowę z asystentem AI i tabelę bazy danych z zaznaczonymi na czerwono wierszami
Ilustracja redakcyjna dailyAI

ThinkingBox to otwarty benchmark zespołu Microsoft Copilot Studio, który ocenia agentów AI po tym, co faktycznie zmienili w bazie danych, a nie po treści ich odpowiedzi. Od 3 października 2026 roku można go uruchomić przez Hugging Face. Najwyższy wynik pojedynczej próby osiągnął Claude Opus 5.5 (67,16 proc.), ale po 20 powtórzeniach bezbłędnie wykonał tylko 241 z 507 zadań.

Czym jest ThinkingBox i co udostępniono

ThinkingBox to sandbox, czyli odizolowane środowisko testowe, w którym agent AI rozmawia z symulowanym klientem i korzysta z narzędzi zgodnych z protokołem MCP (Model Context Protocol). Na tej bazie powstał zbiór testów ThinkingBox-Bench. Przygotował go zespół Microsoft Copilot Studio we współpracy z firmą Toloka i stażystami z kilku amerykańskich uczelni.

Praca naukowa opisująca benchmark trafiła do serwisu arXiv 20 sierpnia 2026 roku. Nowością z 3 października jest wspólny wpis Microsoftu i Hugging Face oraz udostępnienie testu przez interfejs OpenEnv. Każdy zespół może teraz odtworzyć wybrane zadanie z własnym modelem i otrzymać prosty wynik: zaliczone albo niezaliczone.

Najważniejsza różnica wobec popularnych rankingów dotyczy sposobu oceniania. Agent nie dostaje punktów za poprawnie wyglądającą odpowiedź ani za prawidłowe wywołanie narzędzia. Sprawdzany jest końcowy stan bazy danych: czy właściwe pole ma właściwą wartość, czy nie zabrakło wymaganej zmiany i czy agent nie zrobił czegoś dodatkowo.

Dlaczego poprawna rozmowa nie oznacza wykonanego zadania

Autorzy pokazują problem na przykładzie z obsługi klienta. Agent wykonał dziewięć poprawnych wywołań narzędzi, prawidłowo odczytał regulamin i założył zgłoszenie. Na końcu zamknął je jednak jako rozwiązane, choć przesyłka nadal była zatrzymana u przewoźnika i zgłoszenie powinno pozostać wstrzymane. Ocena oparta na samych wywołaniach narzędzi uznałaby to za sukces.

Skala zjawiska jest duża. W analizie obejmującej 121 680 prób 12 modeli 79 853 próby nie przeszły kontroli. Spośród nich 67,24 proc. zakończyło się bez błędu narzędzia, z wykonaną zmianą w systemie i bez sygnału, że coś poszło nie tak. Kontrola stanu bazy wykazała w nich między innymi:

  • błędne wartości pól w 77,61 proc. nieudanych prób,
  • niezamierzone dodatkowe zmiany w 43,30 proc.,
  • brak wymaganej zmiany w 25,36 proc.

Wyniki modeli w pojedynczej próbie

Wskaźnik pass@1 oznacza odsetek wszystkich prób zakończonych sukcesem. Tak wygląda większość publikowanych rankingów i w tym ujęciu modele zamknięte wyraźnie wyprzedzają otwarte. Wyniki dla całego zbioru 507 zadań:

  • Claude Opus 5.5 - 67,16 proc.
  • Claude Opus 5 - 66,50 proc.
  • GPT-5.4 - 65,36 proc.
  • GPT-5.6 Sol - 61,91 proc.
  • GPT-6 Astra - 58,31 proc.
  • Kimi-K3, najlepszy model otwarty - 57,37 proc.
  • Qwen3.8-27B - 51,70 proc.
  • DeepSeek-V4-Pro - 43,26 proc.
  • Mistral-Large-3 - 4,66 proc.

Powtarzalność zmienia ranking

Każde zadanie uruchomiono 20 razy, za każdym razem od czystej bazy danych. Autorzy podają liczbę zadań zaliczonych we wszystkich 20 próbach, bez wygładzania statystycznego. W tym ujęciu na czele są Claude Opus 5.5 i Claude Opus 5 z 241 zadaniami (47,53 proc.), a tuż za nimi GPT-6 Astra z 231 zadaniami (45,56 proc.).

Kimi-K3 pokazuje, jak mylący może być pojedynczy wynik. Model przynajmniej raz rozwiązał 476 z 507 zadań, czyli najwięcej ze wszystkich. Bezbłędnie, 20 razy na 20, wykonał jednak tylko 68 zadań. GLM-5.1, Kimi-K2.6 i DeepSeek-V4-Pro zachowały po powtórzeniach około 8 proc. swojego wyniku z pojedynczej próby.

Nowszy model nie musi też być bardziej przewidywalny. Claude Opus 5.5 ma nieco wyższy wynik średni niż Claude Opus 5, ale dokładnie tę samą liczbę zadań wykonanych bezbłędnie we wszystkich próbach.

Ile kosztuje poprawne wykonanie zadania

Autorzy wycenili zużycie tokenów według cen katalogowych z OpenRouter z 20 września 2026 roku, a dla Claude Opus 5.5 według cennika Anthropic. To indeks porównawczy, a nie rachunek za wdrożenie. Kwoty są w dolarach netto, przeliczyliśmy je po średnim kursie NBP z 2 października 2026 roku (1 USD = 3,8881 zł).

Za pojedynczy sukces najmniej płaci się przy GPT-5.6 Sol: 0,127 USD, czyli około 0,49 zł. GPT-5.4 kosztuje 0,131 USD (około 0,51 zł), a Claude Opus 5.5 0,276 USD (około 1,07 zł). Inaczej wygląda koszt zadania wykonanego poprawnie we wszystkich 20 próbach:

  • GPT-5.4 - 6,80 USD (ok. 26,44 zł), ale tylko 128 takich zadań,
  • GPT-6 Astra - 7,45 USD (ok. 28,97 zł), 231 zadań,
  • Claude Opus 5.5 - 7,80 USD (ok. 30,33 zł), 241 zadań,
  • GPT-5.6 Sol - 9,76 USD (ok. 37,95 zł), 82 zadania,
  • Claude Opus 5 - 13,30 USD (ok. 51,71 zł), 241 zadań.

Gdzie agenci popełniają błędy

Według autorów około czterech na pięć porażek dotyczy obsługi narzędzi (79,9 proc.). Agent dochodzi do etapu wykonania procesu, ale nie radzi sobie z błędem narzędzia, niespełnionym warunkiem wstępnym albo pustym wynikiem wyszukiwania. Błędne zmiany stanu odpowiadają za 10,3 proc. porażek, niedokończona obsługa klienta za 7,0 proc., a brak jakiejkolwiek zmiany w systemie za 2,9 proc.

Trudność zależy też od branży. Średni wynik pojedynczej próby w handlu detalicznym wyniósł 59,52 proc., a w ubezpieczeniach komunikacyjnych 33,83 proc. Claude Opus 4.6 osiągnął w handlu 68,62 proc., a w ubezpieczeniach 8,30 proc.

Ograniczenia badania

Praca na arXiv jest preprintem i nie przeszła recenzji naukowej. Benchmark przygotował zespół produktu Microsoft Copilot Studio, który sam buduje narzędzia dla agentów. Wszystkie zadania są syntetycznymi rekonstrukcjami procesów firmowych, a klienci w nich nie istnieją.

Zadania prowadzone są po angielsku, więc wyniki nie mówią nic o pracy agentów w języku polskim. Koszty pochodzą z jednego dnia i z cen katalogowych bez rabatów. Same wyniki dotyczą konkretnej konfiguracji: modelu, symulowanego klienta i modelu oceniającego 30 zadań z kryteriami opisowymi. W innym środowisku narzędzi ranking może wyglądać inaczej.

Co z tego wynika dla firm wdrażających agentów

Dla polskich firm, które testują agentów w obsłudze klienta, bankowości czy helpdesku IT, najważniejszy wniosek dotyczy metody oceny, a nie zwycięzcy rankingu. W naszej ocenie wynik pojedynczej próby nie powinien być podstawą decyzji o wdrożeniu agenta, który zmienia dane klientów. Autorzy sugerują kilka praktyk, których skuteczności sami jeszcze nie zmierzyli:

  1. sprawdzaj końcowy stan systemu przed zatwierdzeniem zmiany, a nie podsumowanie przygotowane przez model,
  2. klasyfikuj błędy narzędzi, aby ponawiać tylko te operacje, które da się bezpiecznie powtórzyć,
  3. ogranicz zestaw narzędzi dostępnych dla agenta do tych, których wymaga dany proces,
  4. wymagaj akceptacji człowieka przy zmianach trudnych do cofnięcia,
  5. testuj każde zadanie wielokrotnie i podawaj, czy wynik oznacza sukces w jednej próbie, czy we wszystkich.

Jak uruchomić ThinkingBox

Kod ThinkingBox jest dostępny na GitHubie na licencji MIT, dane benchmarku na licencji CDLA-Permissive-2.0, a środowisko OpenEnv na licencji BSD-3-Clause. Według dokumentacji test działa na Linuksie i w WSL, wymaga Pythona 3.11 lub nowszego, narzędzia uv i Dockera. Potrzebne są też punkty dostępu do trzech modeli: testowanego agenta, symulowanego klienta i modelu oceniającego, co oznacza koszty API przy każdym uruchomieniu.

Microsoft zapowiada publikację materiałów do trenowania agentów metodą uczenia ze wzmocnieniem na tych samych środowiskach. Termin nie został podany.

Źródła i data sprawdzenia

  1. The Agent Said It Was Done. The Database Disagreed.Hugging Face / Microsoft, publikacja: 2026-10-03, sprawdzono: 2026-10-04
  2. One Success Isn't Reliability: Thinkingbox, a Sandbox and Benchmark for Agents in Stateful Business WorkflowsarXiv, publikacja: 2026-08-20, sprawdzono: 2026-10-04
  3. microsoft/thinkingboxGitHub, publikacja: 2026-04-22, sprawdzono: 2026-10-04
  4. microsoft/ThinkingBox-BenchHugging Face, publikacja: 2026-08-27, sprawdzono: 2026-10-04
  5. ThinkingBox environmentOpenEnv / Hugging Face, publikacja: 2026-10-03, sprawdzono: 2026-10-04
  6. Kurs średni USD, tabela 192/A/NBP/2026Narodowy Bank Polski, publikacja: 2026-10-02, sprawdzono: 2026-10-04
Nota redakcyjna

Artykuł ma charakter informacyjny. Przy decyzjach prawnych, finansowych lub organizacyjnych warto zweryfikować wnioski w odniesieniu do konkretnej sytuacji.