Zagadnienie tego, w jaki sposób agent AI podejmuje kolejne decyzje, sięga samego serca jego architektury. U podstaw leży tak zwana pętla percepcja–planowanie–działanie, w której program najpierw rejestruje informacje z otoczenia, następnie analizuje dostępne możliwości, a wreszcie realizuje wybraną akcję. Cały ten obieg odtwarza się wielokrotnie, aż do osiągnięcia zamierzonego efektu.
Trzonem tego procesu jest model językowy, który pełni rolę własnego głosu konsultacyjnego agenta. To on interpretuje instrukcje użytkownika, dzieli złożone zadanie na drobniejsze podzadania i proponuje kolejność ich wykonania. Otoczenie modelu stanowią dodatkowe narzędzia – wyszukiwarki, kalkulatory, interfejsy API – które agent wywołuje wtedy, gdy potrzebuje konkretnych danych spoza swojej pamięci treningowej.
Ciekawym elementem architektury jest tak zwana pamięć operacyjna, w której agent trzyma kontekst bieżącego zadania. Dzięki niej nie gubi nici nawet wtedy, gdy procedura rozkłada się na kilka etapów i wymaga przełączania między różnymi źródłami informacji. To dokładnie ta umiejętność wyróżnia agenta od prostego skryptu, który wykonuje jedynie z góry ustaloną listę poleceń.
Osobną kwestią pozostaje mechanizm oceny własnych działań. Odpowiednio zbudowany agent jest w stanie zidentyfikować, że otrzymany wynik odbiega od zamierzonego, i cofnąć się do poprzedniego etapu, by podjąć próbę innej ścieżki. Taka autokorekta przybliża działanie maszyny do ludzkiego zwyczaju sprawdzania własnej pracy przed jej oddaniem.