Kwestia tego, w jaki sposób agent AI podejmuje kolejne decyzje, dotyczy samego serca jego architektury. U fundamentu leży tak zwana pętla percepcja–planowanie–działanie, w której program najpierw odbiera informacje z otoczenia, następnie rozkłada na czynniki dostępne możliwości, a wreszcie wykonuje wybraną akcję. Cały ten cykl odtwarza się wielokrotnie, aż do osiągnięcia zamierzonego efektu.
Sercem tego procesu jest model językowy, który pełni rolę wewnętrznego głosu doradczego agenta. To on odczytuje instrukcje użytkownika, rozbija złożone zadanie na mniejsze podzadania i sugeruje kolejność ich wykonania. Otoczenie modelu stanowią dodatkowe narzędzia – wyszukiwarki, kalkulatory, interfejsy API – które agent wywołuje wtedy, gdy potrzebuje konkretnych danych spoza swojej pamięci treningowej.
Ciekawym składnikiem architektury jest tak zwana pamięć operacyjna, w której agent przechowuje tło bieżącego zadania. Dzięki niej nie traci nici nawet wtedy, gdy procedura rozciąga się na wiele etapów i wymaga przeskakiwania między różnymi źródłami informacji. To właśnie ta zdolność wyróżnia agenta od podstawowego skryptu, który odtwarza jedynie z góry ustaloną listę poleceń.
Osobną sprawą pozostaje mechanizm ewaluacji własnych działań. Dobrze zbudowany agent jest w stanie zidentyfikować, że otrzymany wynik nie zgadza się od oczekiwanego, i wrócić do poprzedniego etapu, by spróbować alternatywnej ścieżki. Taka samokorekta zbliża działanie maszyny do ludzkiego zwyczaju weryfikowania własnej pracy przed jej oddaniem.