SmartDigest.ai Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Premiera / Narzędzie

Model przeczytał cały log dwa razy, żeby wyłuskać trzy linijki

Tejas Chopra prosił Claude'a o wskazanie awarii w logach, a jedno pytanie zjadło dwa okna kontekstowe i 287 dolarów miesięcznie, bo model raz za razem czytał całe logi, by wyłuskać trzy istotne linijki. Tak powstał Headroom, otwarta warstwa przycinająca kontekst, zanim ten doleci do modelu: wycina zbędne znaki z JSON-a (około 30% oszczędności), a oryginał chowa lokalnie na wypadek, gdyby model potrzebował pełnych danych. Chopra reklamuje 700 tysięcy dolarów oszczędności w pięć miesięcy, ale mocniejsza jest sama diagnoza: większość tego, czym karmimy modele, jest zbędna, a płacimy za wszystko.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Premiera / Narzędzie  ·  4 min  · 

Model przeczytał cały log dwa razy, żeby wyłuskać trzy linijki
Ilustrację przygotowała AI.

Tejas Chopra debugował awarię karty graficznej. Rutyna dla starszego inżyniera: ściągasz logi, prosisz Claude'a o wskazanie problemu i wracasz do swoich rzeczy. Odpowiedź wróciła poprawna, ale coś się nie zgadzało. To jedno pytanie zjadło dwa pełne okna kontekstowe modelu. Model wczytał plik z logami wielokrotnie, przemielił wszystko i dopiero z tego wyłuskał trzy linijki, które naprawdę coś znaczyły. Kiedy Chopra podliczył miesiąc, za sam prywatny projekt zobaczył na rachunku 287 dolarów.

Poprawka była prosta: przepisał prompt tak, żeby model pomijał linie INFO i patrzył tylko na ostrzeżenia. Koszt spadł, odpowiedź przyśpieszyła. Jedno nie dawało mu jednak spokoju. "Nie można oczekiwać, że każdy programista otworzy okno kontekstowe i wyczyści prompt dokładnie pod to, czego akurat szuka", mówi w rozmowie z LeadDev, serwisem dla inżynierów. "Ludzie, albo modele, na ślepo powiedzą: muszę zajrzeć do logów, więc łapię całe logi." Skoro człowiek tego nie dopilnuje, może dopilnuje maszyna.

Tak powstał Headroom, otwarta warstwa, która siada między twoim narzędziem a modelem i przycina kontekst, zanim ten do modelu doleci. Nawyk, na który odpowiada, bywa nazywany zrzucaniem kontekstu: wrzucaniem w okno kontekstowe całych baz kodu, schematów bazy i długich logów, bo model to udźwignie, a tak jest wygodniej niż zastanawiać się, co jest naprawdę potrzebne. Płacisz przy tym za każdy token, także za te, które model przeczyta i zignoruje. Odwrotny nawyk to higiena tokenów (Chopra mówi o "byciu tokenwise"): pilnowanie, ile kontekstu zadanie faktycznie wymaga, a nie ile pochłania.

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Cognition dostawia tani model do drogiego i ścina koszty o 35% Premiera / Narzędzie

Cognition dostawia tani model do drogiego i ścina koszty o 35%

3 min

Cognition, twórca agenta Devin, wypuściło w podglądzie Devin Fusion, warstwę, która do drogiego topowego modelu dokłada drugi, znacznie tańszy, i każe im pracować równolegle: główny model planuje i robi przegląd, a pomocnik czyta pliki i wprowadza drobne zmiany. Cały zysk bierze się z cache, bo oba modele trzymają własny kontekst, a przełączanie między nimi wypada wtedy, gdy sesja i tak streszcza kontekst, więc wychodzi za darmo. Obiecane 35% oszczędności przy jakości Opusa 4.8 brzmi mocno, tylko że benchmark FrontierCode, na którym Fusion wypada tak dobrze, Cognition zbudowało samo.

Pliki wyszukuje model, którego nie ma nawet na liście wyboru Premiera / Narzędzie

Pliki wyszukuje model, którego nie ma nawet na liście wyboru

4 min

Freebuff od CodebuffAI rozbija agenta w terminalu na role: pliki w repozytorium wyszukuje tani Gemini 3.1 Flash Lite, którego nie ma nawet na liście wyboru, a dopiero to, co znajdzie, trafia do modelu piszącego zmiany. Pakiet pięciu narzędzi nie kosztuje nic, bo za dostęp do modeli płacą reklamy, a README wprost przyznaje, że służy do tego treść promptów, i nie podaje ani jednej liczby o jakości. Poza wybranymi regionami zostają dwa modele i trzy sesje na dobę, za to całą orkiestrację napędza otwarty Codebuff, więc ten sam podział ról da się złożyć u siebie, bez reklam.

Twoja wiadomość nie budzi tego agenta, bo on nie spał Premiera / Narzędzie

Twoja wiadomość nie budzi tego agenta, bo on nie spał

4 min

Headlong, otwarty harness Laude Institute na licencji Apache 2.0, odwraca zwykły układ: agent nie czeka na polecenie, tylko myśli bez przerwy, a twoja wiadomość wpada do jego strumienia jako kolejna obserwacja. Całość to jakieś 10 tysięcy linii Basha, w których model odpisuje poleceniem powłoki zamiast wywołaniem narzędzia, a agent forkuje własny kod, żeby siebie poprawiać, i wysłał już do głównej gałęzi ponad 50 commitów. Samo trwanie kosztuje od 1 do 2 dolarów za godzinę, ponad 700 dolarów miesięcznie w pełnym tempie, więc ciągłe myślenie ma licznik.