← Encyklopedia AI

ai-basics

Degradacja jakości przy długim kontekście AI (context rot)

Aktualizacja: 17.08.2026

Krótka odpowiedź

Degradacja jakości przy długim kontekście AI, nazywana context rot, to spadek trafności modelu, gdy do jednego zapytania trafia coraz więcej tokenów. Duże okno kontekstowe nie oznacza, że model jednakowo dobrze wykorzysta każdą notatkę, wynik narzędzia i fragment historii. Dla eksperta budującego agenta oznacza to potrzebę selekcji kontekstu, testów na realnych zadaniach i przechowywania faktów w źródle prawdy zamiast bezrefleksyjnego dokładania całego archiwum.

Degradacja jakości przy długim kontekście AI, znana jako context rot, opisuje sytuację, w której model językowy formalnie mieści dużo tekstu w oknie kontekstowym, ale coraz gorzej odnajduje, waży lub wykorzystuje ważną informację. Nie chodzi wyłącznie o twardy limit tokenów. Agent może nadal odpowiedzieć, a mimo to pominąć aktualną ofertę, wybrać stary status leada albo oprzeć rekomendację na przypadkowym wyniku narzędzia. Długie okno daje pojemność, nie gwarancję uwagi. W praktyce kontekst to wszystkie tokeny dostępne przy generowaniu odpowiedzi: instrukcje systemowe, historia rozmowy, pliki, wyniki wyszukiwania, definicje narzędzi i bieżące dane.

To ważne dla solopreneura, bo typowy system rośnie szybciej niż jego porządek. Do agenta trafiają kolejne wersje oferty, notatki z konsultacji, transkrypcje, zrzuty z CRM i wyniki automatyzacji. Pomysł „wrzućmy wszystko, żeby AI miało pełny obraz” brzmi bezpiecznie, lecz tworzy szum. Model może widzieć dwa sprzeczne cenniki lub pięć dawnych opisów persony bez sygnału, który z nich jest aktualny. Efekt wygląda jak halucynacja, choć źródło błędu leży w źle dobranym kontekście. Najpierw sprawdzaj, jakie dane agent dostał, dopiero potem zmieniaj prompt albo model.

Badanie Lost in the Middle pokazało, że w zadaniach wymagających znalezienia informacji w długim wejściu wydajność modeli może wyraźnie spadać, gdy potrzebny fakt znajduje się w środku kontekstu. Autorzy zaobserwowali lepsze wyniki, gdy istotna informacja była blisko początku albo końca. To nie jest uniwersalna liczba ani wyrok dla każdego modelu, zadania i dokumentu. Jest to jednak praktyczne ostrzeżenie: nie zakładaj, że model odczyta wszystkie 100 stron z taką samą dokładnością. Sprawdzaj własny workflow na przykładach, w których kluczowa reguła jest w różnych miejscach oraz ma konkurencyjne, nieaktualne odpowiedniki.

Pierwszym zabezpieczeniem jest rozdzielenie źródła prawdy od kontekstu roboczego. Źródło prawdy przechowuje aktualne fakty, na przykład ofertę, ceny, zasady kwalifikacji i wersję procesu. Kontekst roboczy powinien zawierać tylko informacje potrzebne do bieżącego kroku. Zamiast przekazywać agentowi cały CRM, pobierz rekord konkretnego leada i kilka pól potrzebnych do decyzji. Zamiast pełnej historii materiałów, wyszukaj kilka sprawdzonych fragmentów wraz z datą i źródłem. Dołączaj identyfikator wersji, aby model i człowiek mogli rozpoznać, co obowiązuje. RAG, selektywne narzędzia i krótkie streszczenia są sposobami ograniczania szumu, ale wymagają kontroli jakości danych.

Praktyczny przykład: agent przygotowuje follow-up po konsultacji. Nie powinien dostawać wszystkich rozmów, całej bazy ofert i setek e-maili. Workflow może najpierw pobrać aktualny rekord kontaktu, zatwierdzony opis oferty, ostatnie ustalenia z konsultacji oraz jawne zasady tonu. Następnie tworzy szkic, który człowiek sprawdza przed wysyłką. Jeśli agent potrzebuje dodatkowego faktu, używa narzędzia wyszukiwania i zwraca cytowany wynik, zamiast zgadywać. Taki układ jest krótszy, tańszy i łatwiejszy do debugowania. Gdy follow-up zawiera złą cenę, możesz sprawdzić dokładny zestaw danych użyty w tej jednej decyzji.

Kompaktowanie historii pomaga, gdy rozmowa lub pętla agenta rośnie, ale nie jest magiczną gumką. Streszczenie może pominąć wyjątek, zmienić sens decyzji albo utrwalić błąd. Dlatego zostaw odwołanie do oryginalnego dokumentu, zapisuj decyzje w ustrukturyzowanym stanie i testuj streszczenie na pytaniach kontrolnych. Usuwanie starych wyników narzędzi również ma sens, jeśli nie są już potrzebne, lecz nie wolno usuwać jedynej informacji wymaganej do bezpieczeństwa lub rozliczalności. W działaniach dotyczących klienta, pieniędzy albo publikacji model powinien móc wskazać aktualne źródło, a człowiek powinien móc je sprawdzić.

Najprostszy test na context rot nie wymaga rozbudowanej platformy. Ułóż zestaw realnych zadań z oczekiwanym wynikiem, potem uruchom je z krótkim i długim kontekstem. Zmieniaj pozycję kluczowego faktu, dodawaj podobne stare informacje i mierz, czy agent wybiera właściwe źródło, narzędzie oraz następną akcję. Obserwuj także koszt i czas odpowiedzi. Jeżeli jakość spada, nie doklejaj kolejnych instrukcji. Najpierw usuń duplikaty, doprecyzuj priorytet aktualnych danych, ogranicz odpowiedzi narzędzi i podziel zadanie na etapy. Celem nie jest najmniejszy możliwy prompt, tylko najmniejszy zestaw informacji, który pozwala bezpiecznie osiągnąć wynik.

FAQ

Czy większe okno kontekstowe eliminuje problem context rot?

Nie. Większe okno pozwala przekazać więcej danych i rozwiązać zadania, które wcześniej przekraczały limit, ale nie zapewnia jednakowej trafności dla każdego fragmentu. Oficjalna dokumentacja Anthropic wprost wskazuje, że wraz ze wzrostem liczby tokenów mogą pogarszać się dokładność i recall. Traktuj większe okno jako większy budżet, a nie powód do przekazywania pełnego archiwum bez selekcji. Testuj konkretny model, dane i zadanie, które naprawdę automatyzujesz.

Jak rozpoznać, że agent ma zbyt dużo kontekstu?

Sygnały to odpowiedzi oparte na starej wersji oferty, ignorowanie ważnej reguły mimo jej obecności w danych, mylenie podobnych klientów, niepotrzebne wywołania narzędzi oraz rosnący koszt bez poprawy jakości. Nie diagnozuj tego wyłącznie po wrażeniu z jednej rozmowy. Zapisz zestaw testowych przypadków, umieść krytyczny fakt w różnych miejscach kontekstu i porównaj wyniki. Dobrze jest logować, jakie dokumenty, wyniki narzędzi i wersje danych dostał agent.

Czy streszczanie historii rozmowy zawsze jest dobrym rozwiązaniem?

Nie zawsze. Streszczenie obniża liczbę tokenów, ale może zgubić wyjątek, warunek ceny lub decyzję, która jest istotna później. Używaj go do stanu roboczego, a fakty biznesowe utrzymuj w osobnym, aktualnym źródle prawdy z możliwością powrotu do oryginału. Przed wdrożeniem przetestuj, czy po kompaktowaniu agent nadal poprawnie odpowiada na pytania o kluczowe ustalenia. Dla ryzykownych działań wymagaj źródła i zatwierdzenia człowieka.

Newsletter

Chcesz więcej takich konkretów?

Co niedzielę wysyłam jeden praktyczny mail o AI, sprzedaży wiedzy i budowaniu systemów, które realnie pomagają w pracy.

Bez spamu. Wypisujesz się w każdej chwili.