SmartDigest Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Premiera / Narzędzie

Droższy model prowadzący ścina rachunek za całą sesję o 9%

Cognition posadziło na czele Fusion droższy model, Fable 5, i sesje wyszły średnio o 9% taniej, bo prowadzący rzadziej przerabiał zadania po tańszym pomocniku. Na DeepSWE 1.1 para oddaje 1,2 punktu z 64,3 i ścina rachunek o 46%, ale przy migracji kodu traci 6,4 punktu i oszczędza tylko 20%. Wniosek Cognition brzmi prosto: modele i otaczające je harnessy wycenia się po cenie za zadanie, a nie po cenie za token. Tyle że SWE-2 nie ma ani otwartych wag, ani API, więc sprawdzisz to wyłącznie wewnątrz Devina.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Premiera / Narzędzie  ·  5 min  · 

Droższy model prowadzący ścina rachunek za całą sesję o 9%
Ilustrację przygotowała AI.

Cognition wymieniło w Fusion model prowadzący: zamiast Opusa 4.8 posadziło tam Fable 5, który według cennika kosztuje dwa razy więcej za token. Sesje zrobiły się przez to średnio o 9% tańsze i wypadały lepiej na FrontierCode, benchmarku, którym Cognition mierzy agenty do kodu. Powód jest banalnie ludzki: Opus pilnował tańszego pomocnika zbyt drobiazgowo i przerabiał po nim sporą część zadań, a Fable oddawał je wcześniej i pisał lepsze zlecenia.

To jest dla mnie najważniejsza rzecz w całej serii premier, które Cognition wypuściło przez ostatnie dwa tygodnie, i akurat ta, o której mówi się najmniej. Firma zapisała ją wprost: modele i otaczające je harnessy trzeba wyceniać po cenie za zadanie, a nie po cenie za token. Brzmi jak truizm, dopóki nie zobaczysz, że droższy model potrafi ściąć rachunek za całą sesję.

Dwa agenty zamiast jednego przełącznika

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Ta sama para modeli, trzy różne rachunki za jedno zadanie Model / Badania

Ta sama para modeli, trzy różne rachunki za jedno zadanie

5 min

Artificial Analysis wylicza, że średnie zadanie agentowe kosztuje 3,26 dolara na GPT-6 Astra i 7,63 na Claude Fable 5.1 przy identycznej skuteczności, ale OpenAI i Cognition zmierzyły tę samą różnicę na 63% i 42%, a Zvi Mowshowitz wskazuje, że Fable puszczono w trybie Max, co te 57% zawyża. Cognition odpowiada układem Fusion w Devinie, w którym droższy model prowadzi, a tańszy grzebie w kodzie: na DeepSWE 1.1 ścina to koszt zadania o 46% bez straty jakości, tyle że z Astrą na Terminal-Bench 4.0 wynik leci w dół o ponad pięć punktów. Cenę za zadanie widać dopiero na własnym repozytorium.

Agent Cognition zabiera się do kodu po 18 krokach zamiast 48 Model / Badania

Agent Cognition zabiera się do kodu po 18 krokach zamiast 48

4 min

SWE-2, nowy model Cognition napędzający Devina, zabiera się do edycji kodu po 18 krokach zamiast 48, a całą drogę przez zadanie skrócił ze 127 kroków do 53, bo koszt wpisano wprost do funkcji nagrody podczas uczenia. Na własnym benchmarku firmy wypada niemal jak Fable 5.1, 50,0% wobec 50,9%, i to o 64% taniej, ale na trudniejszym Terminal-Bench 4 zostaje daleko w tyle z wynikiem 27,3%. Cennika ani osobnego API nie ma, model dostajesz wyłącznie razem z Devinem, więc przewagi kosztowej nikt z zewnątrz na razie nie sprawdzi u siebie.

Cognition dostawia tani model do drogiego i ścina koszty o 35% Premiera / Narzędzie

Cognition dostawia tani model do drogiego i ścina koszty o 35%

3 min

Cognition, twórca agenta Devin, wypuściło w podglądzie Devin Fusion, warstwę, która do drogiego topowego modelu dokłada drugi, znacznie tańszy, i każe im pracować równolegle: główny model planuje i robi przegląd, a pomocnik czyta pliki i wprowadza drobne zmiany. Cały zysk bierze się z cache, bo oba modele trzymają własny kontekst, a przełączanie między nimi wypada wtedy, gdy sesja i tak streszcza kontekst, więc wychodzi za darmo. Obiecane 35% oszczędności przy jakości Opusa 4.8 brzmi mocno, tylko że benchmark FrontierCode, na którym Fusion wypada tak dobrze, Cognition zbudowało samo.