automation
Reflexion: jak agent AI uczy się na błędach
Aktualizacja: 21.09.2026
Krótka odpowiedź
Reflexion to wzorzec, w którym agent AI po nieudanej próbie analizuje informację zwrotną i zapisuje krótką lekcję do wykorzystania w kolejnym podejściu. Nie zmienia wag modelu. Poprawa dzieje się w kontekście zadania, przez pamięć epizodyczną oraz sprawdzalny feedback z testu, użytkownika lub narzędzia. Dla eksperta budującego automatyzację jest to sposób na iteracyjne poprawianie procesu bez ukrywania błędów pod kolejnym promptem.
Reflexion jest wzorcem dla agentów językowych, który wykorzystuje tekstową informację zwrotną zamiast trenowania modelu od nowa. Po wykonaniu zadania agent otrzymuje sygnał, że wynik przeszedł lub nie przeszedł testu, a następnie tworzy krótką refleksję: co poszło nie tak, jaką zasadę należy zapamiętać i co zmienić w następnej próbie. Ta lekcja trafia do pamięci epizodycznej i staje się dodatkowym kontekstem. To nie znaczy, że model „nauczył się” trwale. Poprawa dotyczy kolejnego przebiegu, dopóki pamięć jest dostępna.
Wzorzec ma trzy oddzielne role. Aktor wykonuje zadanie, ewaluator dostarcza sygnał jakości, a reflektor zamienia sygnał w konkretną wskazówkę. Te role nie muszą być trzema modelami. Mogą być trzema etapami workflowu. Kluczowe jest jednak rozdzielenie ich odpowiedzialności. Aktor nie powinien sam uznawać, że jego tekst jest świetny. Ewaluator potrzebuje mierzalnego kryterium, na przykład poprawnego JSON-a, przejścia testu, obecności źródeł albo akceptacji redaktora. Reflektor nie może tworzyć ogólnej wymówki, tylko zasadę możliwą do zastosowania.
Dla eksperta i soloprzedsiębiorcy Reflexion ma sens w zadaniach powtarzalnych, które mają jasny wynik jakościowy. Przykładem jest generator briefów sprzedażowych. Jeżeli brief nie zawiera źródła danych, określonej grupy odbiorców i jednego kolejnego kroku, walidator odrzuca wynik. Agent dostaje informację o brakujących polach, zapisuje krótką zasadę „przed oddaniem sprawdź trzy wymagane pola” i poprawia wyłącznie ten brief. Nie potrzebujesz do tego narracji o samodoskonalącym się AI. Potrzebujesz testu, pamięci oraz limitu prób.
Praktyczny przykład: agent tworzy opis narzędzia AI do katalogu. Najpierw pobiera oficjalną dokumentację, pisze szkic i przekazuje go do walidacji. Walidator sprawdza minimum długości, dwa źródła, FAQ oraz brak niepotwierdzonych cen. Gdy brakuje źródła pierwotnego, feedback brzmi konkretnie: „odrzucono, bo nie ma drugiego źródła od autora produktu”. Refleksja może brzmieć: „przed tekstem zbierz dwa podpisane źródła i przypisz każdą tezę do jednego z nich”. Agent robi kolejną próbę, lecz nie publikuje automatycznie bez przejścia bramki.
Największa pułapka to mylenie refleksji z prawdą. Model może przekonująco opisać zły powód błędu, a potem utrwalić tę błędną zasadę w pamięci. Jeśli ewaluatorem jest drugi model, oba mogą powielać ten sam błąd. Dlatego wysokiego ryzyka nie oceniaj wyłącznie językowo. Używaj deterministycznych testów, danych referencyjnych, reguł biznesowych oraz człowieka tam, gdzie stawką jest klient, publikacja lub pieniądze. Refleksja powinna odwoływać się do konkretnego sygnału, nie do deklaracji „następnym razem będę dokładniejszy”.
Reflexion zwiększa koszt i może wprowadzić dryf pamięci. Długie listy dawnych lekcji zaśmiecają kontekst, spowalniają działanie i mogą prowadzić agenta do stosowania starej reguły w złej sytuacji. Ustal więc limit liczby prób, czas życia refleksji i zakres, w którym wolno jej użyć. Lekcja z opisu produktu nie powinna sterować agentem analizującym dane klienta. Warto też przechowywać identyfikator zadania, wersję promptu, wynik ewaluacji oraz decyzję o zatrzymaniu. Bez tego nie odróżnisz realnej poprawy od przypadku.
Nie zastępuj Reflexion ewaluacji systemu AI ani testów regresji. Ewalucja mówi, czy system spełnia kryteria na zestawie przypadków. Test regresji sprawdza, czy zmiana nie zepsuła wcześniej działających scenariuszy. Reflexion używa ich wyników jako wejścia do poprawy pojedynczego przebiegu. Zacznij od procesu z jedną bramką jakości i maksymalnie dwiema poprawkami. Zapisuj tylko krótkie, sprawdzalne lekcje. Jeśli agent nadal nie przechodzi testu, zatrzymaj workflow, pokaż log człowiekowi i popraw kontrakt zadania, zamiast pozwalać mu eksperymentować bez końca.
FAQ
Czy Reflexion oznacza, że agent AI uczy się trwale po każdym błędzie?
Nie. W tym wzorcu model zwykle nie jest dostrajany ani trenowany od nowa. Agent zapisuje tekstową refleksję i wykorzystuje ją jako kontekst w kolejnej próbie lub kolejnym podobnym zadaniu. Gdy pamięć zostanie usunięta, wygaszona albo nie zostanie dołączona do promptu, efekt znika. To zaleta, bo zasady można audytować i wycofać, ale nie jest to gwarancja trwałej poprawy modelu.
Jaki feedback nadaje się do Reflexion w automatyzacji biznesowej?
Najlepszy jest konkretny i możliwy do sprawdzenia: niepoprawny format danych, brak wymaganej sekcji, błąd API, nieprzejście testu lub uwaga redaktora przypisana do fragmentu tekstu. Słabe są ogólne sygnały typu „napisz lepiej”, bo agent nie wie, co zmienić. Dla ważnych procesów połącz feedback z walidatorem po stronie aplikacji i z jasnym limitem kolejnych prób.
Czy można pozwolić agentowi samemu poprawiać publikowany content bez kontroli?
Nie w procesie, w którym pomyłka może trafić do klienta albo na stronę. Reflexion może przygotować kolejną wersję po feedbacku, ale publikacja powinna być osobną akcją z walidacją i, zależnie od ryzyka, akceptacją człowieka. Oddziel szkic od wysyłki, zmiany danych i publikacji. Pamięć refleksji nie jest mechanizmem uprawnień ani substytutem kontroli jakości.
Źródła
Powiązane wpisy
Newsletter
Chcesz więcej takich konkretów?
Co niedzielę wysyłam jeden praktyczny mail o AI, sprzedaży wiedzy i budowaniu systemów, które realnie pomagają w pracy.
Bez spamu. Wypisujesz się w każdej chwili.