Okno kontekstowe to informacje, które model może uwzględnić podczas pojedynczego generowania. Obejmuje instrukcje, historię rozmowy, pobrane dokumenty, opisy narzędzi, wyniki narzędzi, obrazy reprezentowane jako tokeny oraz miejsce zarezerwowane na odpowiedź. Jest bliższe pamięci roboczej niż wyuczonej wiedzy modelu.

To rozróżnienie pozwala uniknąć częstego błędu. Model może znać z treningu ogólne pojęcie, ale nie znać prywatnego faktu potrzebnego do zadania. Może też zdarzyć się odwrotnie: fakt jest obecny w kontekście, lecz model go nie zauważa albo nie stosuje, gdy zapytanie jest przepełnione nieistotnym materiałem.

Każdy token walczy o uwagę. Duże okno pozwala aplikacji przesłać więcej materiału, ale nie gwarantuje równomiernego przypominania ani rozumowania na całym tym materiale. Ważne dowody mogą być trudne do znalezienia, powtarzające się fragmenty mogą wypaczyć odpowiedź, a długie wyniki narzędzi mogą wyprzeć instrukcje określające sukces.

Planuj budżet od wyniku wstecz. Zarezerwuj dość miejsca na odpowiedź oraz ewentualne rozumowanie lub działania narzędziowe, które model może wygenerować. Następnie przydziel miejsce stałym instrukcjom, bieżącemu pytaniu, ostatniemu stanowi rozmowy i dowodom pomocniczym. Nie wypełniaj pozostałej pojemności tylko dlatego, że istnieje.

Wybieraj kontekst o wysokiej wartości informacyjnej. W pytaniu o dokument umieść odpowiednie fragmenty z tytułami, datami i identyfikatorami źródeł. W zadaniu programistycznym podaj interfejsy, testy, wyniki błędów i pobliską implementację, a nie całe repozytorium. Agentowi udostępnij lekkie odwołania, które może otworzyć w razie potrzeby, zamiast ładować z góry każdy możliwy zasób.

Długie rozmowy potrzebują jawnej strategii stanu. Kompresja podsumowuje wcześniejszą pracę w mniejszym artefakcie. Ustrukturyzowane notatki zachowują decyzje, ograniczenia, otwarte pytania i wykonane kroki poza bezpośrednim transkryptem. Wyszukiwanie przywraca tylko to, czego wymaga kolejne działanie. Takie podejścia zamieniają dosłowną historię na dalszą spójność.

Kompresja może zgubić szczegóły, dlatego podsumowanie powinno odróżniać trwałe fakty od tymczasowych obserwacji. Zapisuj dokładne identyfikatory, ścieżki, decyzje, linki do dowodów i nierozwiązane ryzyka. Ważne artefakty — testy, specyfikacje, dane i końcowe wyniki — zachowuj w ich natywnej postaci, zamiast polegać na tym, że podsumowanie rozmowy je odtworzy.

Buforowanie promptów może obniżyć koszt lub opóźnienie dla powtarzanych prefiksów, ale tokeny z pamięci podręcznej nadal zajmują miejsce w oknie kontekstowym. Buforowanie zmienia sposób przetwarzania lub rozliczania powtarzalnego wejścia; nie zmienia okna w nieograniczoną pamięć.

Użycie narzędzi dokłada kolejną presję. Schematy, wyniki, zrzuty ekranu i pośrednie rozumowanie zużywają pojemność. Usuwaj przestarzałe wyniki narzędzi, gdy platforma na to pozwala, streszczaj duże wyjścia i zachowuj wskaźniki do surowych dowodów. Użyteczny agent powinien móc ponownie otworzyć źródło, zamiast nosić ze sobą na zawsze każdy bajt.

Oceniaj projekt kontekstu na realistycznych długich danych wejściowych. Umieszczaj ważne fakty w różnych pozycjach, dodawaj wiarygodne rozpraszacze i testuj pytania uzupełniające po kilku wywołaniach narzędzi. Mierz nie tylko to, czy model umie zacytować fakt, lecz także czy stosuje właściwą wersję i wskazuje właściwe źródło.

Najlepszy kontekst nie jest największym kontekstem. To najmniejszy bieżący zestaw roboczy, który zachowuje cel, ograniczenia, dowody i następną decyzję. Większe okna rozszerzają możliwości; staranne projektowanie kontekstu decyduje o tym, co pozostaje niezawodne.

Jak pracuje redakcja

Łączymy źródła pierwotne, dokumentację produktów i rzeczywiste scenariusze użycia, aby ułatwić Ci ocenę, czy dane narzędzie pasuje do Twojego sposobu pracy.

Źródła

Przeglądaj katalog narzędzi