Aktualności, narzędzia i prawo AIPolska · codziennie
Praca

Czy AI zastąpi księgowych? Badanie Mercor z udziałem 12 CPA

Mercor porównał 12 licencjonowanych księgowych z modelem Claude Opus 5 na zadaniach zamknięcia miesiąca. Model uzyskał pełną punktację, ludzie średnio ok. 37 proc.

Księgowa w okularach porównuje wydruk zestawienia z arkuszem na monitorze, a kolega wskazuje liczbę na ekranie, za oknem kamienice i wieża kościoła
Ilustracja redakcyjna dailyAI

Firma Mercor opublikowała 1 października 2026 roku badanie, w którym 12 księgowych z amerykańską licencją CPA rozwiązywało te same zadania zamknięcia miesiąca co model Claude Opus 5. Model działający samodzielnie uzyskał pełną punktację, a księgowi bez wsparcia AI średnio ok. 37 proc. Autor badania zastrzega jednak, że testy sprawdzały wąski wycinek pracy księgowego, i nie twierdzi, że ten zawód można zastąpić.

Co sprawdzało badanie Mercor

Mercor to amerykańska firma, która zatrudnia ekspertów do tworzenia danych i testów dla laboratoriów AI. Prowadzi też własne benchmarki z serii APEX, czyli zestawy zadań odwzorowujących pracę zawodową. Na potrzeby badania firma uprościła cztery zadania z benchmarku APEX-Accounting i dała je do rozwiązania ludziom oraz modelom.

Wszystkie zadania dotyczyły zamknięcia miesiąca, czyli prac, które dział księgowy wykonuje przed sporządzeniem zestawień za dany okres. Uczestnik dostawał pliki symulowanej firmy, musiał znaleźć właściwe dane, wybrać metodę obliczeń zgodną z zasadami firmy i oddać gotową tabelę wyników. Oceniano ją według listy od 13 do 22 kryteriów przygotowanej przez księgowych.

  • organizacja non-profit: rozliczenie wspólnych kosztów, takich jak składki od wynagrodzeń, na cztery programy i porównanie wydatków z budżetem,
  • hotel: uzgodnienie przychodów z systemu rezerwacji z księgami i korekta prowizji dla serwisów rezerwacyjnych, na przykład 4000 USD przychodu z parkingu zaksięgowane jako przychód z pokoi,
  • obiekt eventowy: analiza odchyleń przychodów od budżetu według liczby i rodzaju wydarzeń,
  • grupa trzech spółek: miesięczne przeliczenie harmonogramów leasingu według amerykańskich zasad rachunkowości.

Wyniki: model kontra księgowi

Claude Opus 5 działał jako agent z dostępem do narzędzi i limitem 250 kroków. We wszystkich 20 podejściach spełnił komplet kryteriów. Księgowi bez wsparcia AI oddali 23 rozwiązania ze średnim wynikiem ok. 37 proc. Według autora model był szybszy i dokładniejszy także od najlepszego uczestnika badania.

Mercor zestawił też starsze modele z tymi samymi zadaniami. Jeszcze półtora roku wcześniej najlepsze modele nie dorównywały średniej księgowych, w 2025 roku ją przekroczyły, a obecne uzyskują wynik równy lub bliski 100 proc. Część tańszych modeli z otwartymi wagami, na przykład Qwen3.5 122B, nadal wypada poniżej wyniku ludzi.

Rozwiązania oceniał model językowy pełniący rolę sędziego. Aby sprawdzić jego trafność, autorzy zadań ręcznie ocenili 8 prac i uzyskali 98 proc. zgodności z oceną automatyczną. To rozsądna kontrola, ale obejmuje niewielką próbkę.

Księgowy z AI wolniejszy niż sam model

Badanie miało początkowo zmierzyć, ile zyskuje księgowy pracujący z asystentem AI. Uczestnicy rozwiązywali dwa z czterech zadań w Claude Cowork z modelem Opus 5. Ponieważ sam model zdobywał pełną punktację, nie było miejsca na poprawę wyniku, a każda minuta poświęcona przez człowieka na sprawdzanie wydłużała pracę.

Księgowi z Claude potrzebowali ok. 15 razy więcej czasu niż sam model i osiągali nieco niższą dokładność. W trzech z czterech sesji ze wsparciem AI, które nie zakończyły się kompletem punktów, poprawna liczba w pewnym momencie się pojawiła. Dwukrotnie Claude sam zmienił ją na błędną, a uczestnik przyjął nową wersję. Raz człowiek odrzucił poprawną pierwszą podpowiedź modelu.

Dlaczego wynik nie oznacza końca zawodu

Autor badania, Aden Barton, wprost zastrzega, że zadania sprawdzały głównie to, w czym modele są najmocniejsze: drobiazgowość, przeszukiwanie wielu plików i dokładne trzymanie się instrukcji. Zadania powstały pierwotnie po to, aby sprawiać trudność modelom, więc zawierały wiele ukrytych, choć realistycznych pułapek. Jeden przeoczony błąd mógł obniżyć wynik całego zadania.

Warunki również odbiegały od codziennej pracy. Uczestnicy nie znali firmy, nie mogli zadać pytań klientowi ani skonsultować się ze współpracownikami. Pięciu z 12 księgowych uznało zadania za nierealistyczne, głównie z powodu braku kontaktu z innymi osobami. Sam Mercor przyznaje, że rozważał niepublikowanie wyników z obawy przed błędną interpretacją.

Kontekst daje też pełny ranking APEX-Accounting. Na 160 nieuproszczonych zadaniach w 10 symulowanych firmach najlepszy wynik, 61,8 proc., ma Claude Opus 5.5 w trybie Max. Kolejne miejsca zajmują Claude Fable 5.1 (61,0 proc.) i GPT-6 Astra (57,9 proc.). Przy pełnej złożoności zadań modele nadal popełniają wiele błędów.

Koszt i szybkość pracy

Mercor porównał koszt jednego spełnionego kryterium oceny. Dla modelu przyjął cenniki tokenów bez rabatów za cache, a dla ludzi medianę wynagrodzenia księgowego w USA według danych BLS. Według tego wyliczenia model jest o ponad rząd wielkości tańszy, a w części zadań, które ludzie zwykle rozwiązują poprawnie, ok. 34 razy szybszy.

Te liczby dotyczą amerykańskich stawek i nie przenoszą się wprost na Polskę. Wynagrodzenia księgowych są u nas niższe, więc różnica kosztów będzie mniejsza. O opłacalności wdrożenia decyduje też koszt weryfikacji wyników, której nie da się pominąć w pracy z księgami.

Co to oznacza dla księgowych i biur rachunkowych w Polsce

Zadania opierały się na amerykańskich zasadach rachunkowości. Polskie firmy prowadzą księgi według ustawy o rachunkowości albo Międzynarodowych Standardów Sprawozdawczości Finansowej, a do tego dochodzą krajowe przepisy podatkowe. Wyniku nie można więc przenieść jeden do jednego na polskie biuro rachunkowe, choć same czynności, takie jak uzgadnianie przychodów czy rozliczanie kosztów wspólnych, są uniwersalne.

W naszej ocenie badanie pokazuje kierunek zmian, a nie gotowy scenariusz zwolnień. Autor przewiduje, że praca księgowych przesunie się w stronę kontaktu z klientem, zadawania właściwych pytań i decyzji w sytuacjach niejasnych. Odpowiedzialność za poprawność ksiąg nadal spoczywa na ludziach i firmie, a nie na modelu AI.

  1. Wybierz jeden powtarzalny proces, na przykład uzgodnienie przychodów lub rozliczenie kosztów wspólnych, i przetestuj na nim model na danych historycznych z zamkniętego okresu.
  2. Porównaj wynik z gotowym zestawieniem i zapisz, gdzie model się pomylił. Badanie pokazało, że błędy pojawiają się także przy zmianie wcześniejszej, poprawnej odpowiedzi.
  3. Nie przesyłaj danych klientów do narzędzi, które nie mają umowy powierzenia przetwarzania danych i jasnych zasad ich przechowywania.
  4. Ustal regułę kontroli: każda liczba trafiająca do ksiąg wymaga weryfikacji przez osobę, która zna klienta i jego zasady.

Ograniczenia badania

Próba jest mała: 12 osób, wszystkie z USA, i cztery uproszczone zadania. Publikacja nie przeszła recenzji naukowej, a jej autorem jest firma, która sprzedaje usługi tworzenia danych i ocen dla laboratoriów AI. Badanie wykorzystało model Claude Opus 5, ponieważ Anthropic prowadził w rankingu APEX-Accounting w chwili rozpoczęcia prac, więc nie wiadomo, jak w tym samym układzie wypadłyby inne obecne modele.

Wynik dotyczy dobrze zdefiniowanych zadań o średniej długości. Nie mówi nic o pracy z niepełnymi dokumentami, kontakcie z urzędem skarbowym ani o odpowiedzialności zawodowej. Te części pracy księgowego pozostają poza zakresem testu.

Źródła i data sprawdzenia

  1. Human Baselines for Benchmarks: AI Now Outperforms Junior AccountantsMercor, publikacja: 2026-10-01, sprawdzono: 2026-10-02
  2. Human Baselines for Benchmarks: AI Now Outperforms Junior Accountants (pełny raport, PDF)Mercor, publikacja: 2026-10-01, sprawdzono: 2026-10-02
  3. APEX-Accounting LeaderboardMercor, publikacja: 2026-10-02, sprawdzono: 2026-10-02
  4. AI beats licensed accountants on speed and accuracy, but still can't close the books without supervisionTHE DECODER, publikacja: 2026-10-02, sprawdzono: 2026-10-02
Nota redakcyjna

Artykuł ma charakter informacyjny. Przy decyzjach prawnych, finansowych lub organizacyjnych warto zweryfikować wnioski w odniesieniu do konkretnej sytuacji.