SmartDigest Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Premiera / Narzędzie

Ręczny bufor promptu w GPT-5.6: kiedy naprawdę tnie rachunek?

GPT-5.6 trafił do ogólnej dostępności na Amazon Bedrock, a AWS dołożył ręczne sterowanie buforem promptu: sam wyznaczasz koniec powtarzalnego prefiksu, który potem czytasz z pamięci o 90% taniej przez 30 minut. Nowość ma drugą stronę, bo zapis do bufora, dotąd darmowy na GPT-5.5 i 5.4, kosztuje teraz 1,25 raza więcej niż zwykły token wejściowy, więc realnie oszczędzasz dopiero, gdy odczyty stanowią około 20% ruchu. To wygrana dla pętli agenta, gdzie ten sam prompt systemowy wraca dziesiątki razy, a przy pojedynczych zapytaniach najwięcej zyskujesz, zostając przy trybie automatycznym.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Premiera / Narzędzie  ·  4 min  · 

Ręczny bufor promptu w GPT-5.6: kiedy naprawdę tnie rachunek?
Ilustrację przygotowała AI.

Buforowanie promptu na Amazon Bedrock działało do tej pory samo z siebie i nic nie kosztowało. Wraz z premierą modeli OpenAI GPT-5.6 (Sol, Terra i Luna), które trafiły właśnie do ogólnej dostępności na Bedrocku, AWS dołożył do tego mechanizmu ręczne sterowanie i przy okazji zmienił rachunek. To dobra wiadomość dla jednego konkretnego wzorca pracy i właściwie obojętna dla całej reszty.

Zacznę od tego, co buforowanie w ogóle daje. Przy każdym wywołaniu model przetwarza cały prompt od nowa, a ty płacisz za każdy token, nawet jeśli połowa z nich to te same instrukcje systemowe i definicje narzędzi wysyłane w kółko przy każdym zapytaniu. Bufor zapamiętuje raz policzony fragment i przy kolejnym wywołaniu czyta go z pamięci, zamiast liczyć drugi raz. Na GPT-5.6 token odczytany z bufora kosztuje 90% mniej niż zwykły token wejściowy (stawki są na stronie z cennikiem Bedrocka), a zapamiętany fragment zostaje dostępny przez 30 minut.

Nowość polega na tym, że teraz sam wskazujesz, gdzie kończy się powtarzalna część promptu. Służy do tego parametr prompt_cache_breakpoint: wszystko przed tą granicą i razem z nią ląduje w buforze, a wszystko po niej może zmieniać się przy każdym zapytaniu. Drugi parametr, prompt_cache_key, to stały identyfikator, który kieruje kolejne zapytania do tego samego bufora. Prefiks musi mieć co najmniej 1024 tokeny i w jednym zapytaniu możesz postawić do czterech takich granic.

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Przegląd kodu każdego commita znów wchodzi w budżet Model / Badania

Przegląd kodu każdego commita znów wchodzi w budżet

4 min

DeepSeek V4-Pro z 24 kwietnia kosztuje 1,74 dolara za milion tokenów wejścia i 3,48 za wyjście, wobec 5 i 30 dolarów w GPT-5.5. Na LiveCodeBench bije konkurencję z 93,5% Pass@1, ale w trybie myślącym wciąż odstaje od Opus 4.7 na dłuższych zadaniach agentowych. Rabat 92% obowiązuje tylko przy trafieniu w cache, a to wymaga statycznego prefiksu co do bajta. Scenariusze typu przegląd kodu każdego commita wracają do gry, jeśli zdyscyplinujesz prompt.

Trzy frameworki, które każą maszynie pisać własne prompty i skille Premiera / Narzędzie

Trzy frameworki, które każą maszynie pisać własne prompty i skille

5 min

Trzy czerwcowe projekty open-source, GEPA, EvoSkill i Self-Harness, oddają maszynie to, co dotąd pisał inżynier: prompt, umiejętności agenta i reguły jego działania. Pętla ewolucyjna sama generuje warianty, ocenia je i zachowuje najlepsze, obiecując kilkudziesięcioprocentowy skok skuteczności bez dotykania wag modelu; GEPA podbił GPT-4.1 Mini na zadaniach AIME z 46,6% do 56,6% przy 100 do 500 prób zamiast tysięcy. Działa to jednak tylko tam, gdzie wynik da się tanio i jednoznacznie zmierzyć, więc nowa rola człowieka to napisać dobrą miarę, a nie cyzelować pojedyncze zdanie.

Anthropic każe wyciąć z promptów to, co kiedyś wymuszało dokładność Poradnik / Praktyka

Anthropic każe wyciąć z promptów to, co kiedyś wymuszało dokładność

4 min

Anthropic odświeżył firmowy przewodnik po promptowaniu i większość pracy przy przenoszeniu starych promptów polega teraz na wycinaniu, nie dopisywaniu. Kategoryczne "KRYTYCZNE: MUSISZ" i pisanie wielkimi literami w najnowszych modelach, od Fable 5 po Opus 4.8, zaczynają szkodzić, bo model bierze je zbyt dosłownie. Prefill na końcu rozmowy i parametr budget_tokens zwracają już twardy błąd 400 na Opus 4.7 i nowszych, więc głębokością namysłu steruje się teraz parametrem effort. Przy długich zadaniach rada jest prosta: stan trzymaj poza kontekstem, na dysku, w plikach i w gicie.