Agent wykonał zadanie. Naprawdę?
Agenci AI potrafią dziś rezerwować spotkania, aktualizować rekordy CRM, wystawiać dokumenty, wysyłać powiadomienia. Brzmi świetnie. Jest jeden haczyk: agent może szczerze poinformować, że zadanie zostało wykonane, podczas gdy żaden system zewnętrzny nie odnotował żadnej zmiany. Nie chodzi tu o celowe kłamstwo. Chodzi o to, że model językowy stojący za agentem generuje odpowiedź na podstawie tego, co powinno być wynikiem wywołania narzędzia, a nie na podstawie tego, co faktycznie się wydarzyło.
Mechanizm jest prosty do zrozumienia. Agent wywołuje funkcję, np. „zapisz fakturę do bazy". Funkcja zwraca błąd połączenia, timeout albo cichy wyjątek. Model odbiera ten sygnał, ale jeśli komunikat błędu jest niejednoznaczny lub obsługa wyjątków jest niedopracowana, agent może zinterpretować sytuację jako sukces i poinformować o zakończeniu zadania. W innych przypadkach agent w ogóle nie dostaje potwierdzenia od narzędzia i zakłada, że skoro nie ma błędu, jest dobrze. Baza tymczasem nic nie wie.
Co to oznacza dla polskich firm (sprzedaż, obsługa klienta, księgowość, HR, marketing, operacje)
Zacznijmy od księgowości i operacji, bo tu ryzyko jest największe. Firma wdraża agenta do automatycznego wprowadzania faktur do ERP. Agent pracuje, raportuje sukcesy, a po tygodniu okazuje się, że część dokumentów nigdy nie trafiła do systemu. Jeśli nikt nie weryfikuje niezależnie, problem wychodzi na jaw przy zamknięciu miesiąca lub audycie. Wtedy odtworzenie historii jest drogie i bolesne.
W obsłudze klienta podobny scenariusz wygląda tak: agent aktualizuje status reklamacji w CRM i informuje klienta, że sprawa została przekazana. CRM nie odnotował zmiany. Klient dzwoni ponownie, konsultant nie ma kontekstu, klient jest wściekły. Z perspektywy klienta firma po prostu nie działa. Z perspektywy firmy wszystko wyglądało na zautomatyzowane i sprawne.
W HR i sprzedaży ryzyko jest nieco mniejsze, ale też realne. Agent który "wysłał" ofertę albo "dodał" kandydata do systemu rekrutacyjnego, a w rzeczywistości tego nie zrobił, generuje lukę informacyjną. Ludzie podejmują decyzje zakładając, że dane są kompletne.
Co z tym zrobić praktycznie? Trzy rzeczy, które warto wbudować w każde wdrożenie agentyczne:
- Weryfikacja post-execution - agent po wykonaniu akcji powinien odczytać stan systemu i potwierdzić zmianę, nie tylko zakładać sukces na podstawie braku błędu.
- Logi niezależne od agenta - zapis akcji po stronie narzędzia (API, baza, system ERP), nie po stronie modelu. Model może się mylić w ocenie wyniku, system nie.
- Alerty na rozbieżności - porównanie tego, co agent zaraportował jako wykonane, z tym, co faktycznie widać w bazie. To nie musi być skomplikowane; wystarczy prosty skrypt liczący rekordy.
Problem nie zniknie sam. Im więcej procesów oddamy agentom, tym więcej punktów, w których ciche niepowodzenie może urosnąć do poważnego incydentu. Dobre wdrożenie to takie, które zakłada, że agent się myli, i buduje to założenie w architekturę od początku, a nie jako poprawkę po fakcie.
Jeśli planujesz wdrożenie agentów AI w swoich procesach i chcesz zrobić to z głową, umów się na bezpłatny audyt. Pomożemy zaprojektować system tak, żeby raport agenta i stan bazy mówiły to samo.
Opracowanie: zespół redAi z wykorzystaniem narzędzi AI.