Premiera / Narzędzie
Ręczny bufor promptu w GPT-5.6: kiedy naprawdę tnie rachunek?
GPT-5.6 trafił do ogólnej dostępności na Amazon Bedrock, a AWS dołożył ręczne sterowanie buforem promptu: sam wyznaczasz koniec powtarzalnego prefiksu, który potem czytasz z pamięci o 90% taniej przez 30 minut. Nowość ma drugą stronę, bo zapis do bufora, dotąd darmowy na GPT-5.5 i 5.4, kosztuje teraz 1,25 raza więcej niż zwykły token wejściowy, więc realnie oszczędzasz dopiero, gdy odczyty stanowią około 20% ruchu. To wygrana dla pętli agenta, gdzie ten sam prompt systemowy wraca dziesiątki razy, a przy pojedynczych zapytaniach najwięcej zyskujesz, zostając przy trybie automatycznym.
Napisała AI, żeby oszczędzić Ci czytania setek źródeł. · Jak to działa
Premiera / Narzędzie · 4 min ·
Buforowanie promptu na Amazon Bedrock działało do tej pory samo z siebie i nic nie kosztowało. Wraz z premierą modeli OpenAI GPT-5.6 (Sol, Terra i Luna), które trafiły właśnie do ogólnej dostępności na Bedrocku, AWS dołożył do tego mechanizmu ręczne sterowanie i przy okazji zmienił rachunek. To dobra wiadomość dla jednego konkretnego wzorca pracy i właściwie obojętna dla całej reszty.
Zacznę od tego, co buforowanie w ogóle daje. Przy każdym wywołaniu model przetwarza cały prompt od nowa, a ty płacisz za każdy token, nawet jeśli połowa z nich to te same instrukcje systemowe i definicje narzędzi wysyłane w kółko przy każdym zapytaniu. Bufor zapamiętuje raz policzony fragment i przy kolejnym wywołaniu czyta go z pamięci, zamiast liczyć drugi raz. Na GPT-5.6 token odczytany z bufora kosztuje 90% mniej niż zwykły token wejściowy (stawki są na stronie z cennikiem Bedrocka), a zapamiętany fragment zostaje dostępny przez 30 minut.
Nowość polega na tym, że teraz sam wskazujesz, gdzie kończy się powtarzalna część promptu. Służy do tego parametr prompt_cache_breakpoint: wszystko przed tą granicą i razem z nią ląduje w buforze, a wszystko po niej może zmieniać się przy każdym zapytaniu. Drugi parametr, prompt_cache_key, to stały identyfikator, który kieruje kolejne zapytania do tego samego bufora. Prefiks musi mieć co najmniej 1024 tokeny i w jednym zapytaniu możesz postawić do czterech takich granic.
Czytaj dalej za darmo
Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.