SmartDigest.ai Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Premiera / Narzędzie

Cognition dostawia tani model do drogiego i ścina koszty o 35%

Cognition, twórca agenta Devin, wypuściło w podglądzie Devin Fusion, warstwę, która do drogiego topowego modelu dokłada drugi, znacznie tańszy, i każe im pracować równolegle: główny model planuje i robi przegląd, a pomocnik czyta pliki i wprowadza drobne zmiany. Cały zysk bierze się z cache, bo oba modele trzymają własny kontekst, a przełączanie między nimi wypada wtedy, gdy sesja i tak streszcza kontekst, więc wychodzi za darmo. Obiecane 35% oszczędności przy jakości Opusa 4.8 brzmi mocno, tylko że benchmark FrontierCode, na którym Fusion wypada tak dobrze, Cognition zbudowało samo.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Premiera / Narzędzie  ·  3 min  · 

Cognition dostawia tani model do drogiego i ścina koszty o 35%
Ilustrację przygotowała AI.

Najdroższe modele zjadają budżet, a puszczanie ich do każdego drobiazgu dawno przestało mieć sens. Cognition, firma stojąca za agentem kodującym Devin, wypuściła właśnie w podglądzie Devin Fusion, harness nowego typu. Harness otacza model i decyduje, co model widzi, jakich narzędzi może użyć i jak długo pracuje nad zadaniem. Fusion do drogiego, topowego modelu dokłada drugi, znacznie tańszy, i każe im pracować równolegle. Obietnica jest konkretna: ta sama jakość kodu co przy samym topowym modelu, przy koszcie niższym o 35%.

Cognition nie owija tego w bawełnę. Jak tłumaczą na swoim blogu, istniejące narzędzia do mieszania modeli są kiepskie: ładnie wyglądają na benchmarkach, ale nie piszą kodu, który naprawdę chciałbyś zmergeować. Samą diagnozę trudno podważyć, bo koszt topowych modeli i w małych, i w dużych zespołach dobił do poziomów, przy których liczy się już każdy token. Jak ujmuje to Cognition: nie jeździ się Lamborghini po zakupy, więc po co puszczać model zdolny znaleźć lukę zero-day do zaokrąglania rogu przycisku.

Jeden model planuje, drugi robi czarną robotę

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Droższy model prowadzący ścina rachunek za całą sesję o 9% Premiera / Narzędzie

Droższy model prowadzący ścina rachunek za całą sesję o 9%

5 min

Cognition posadziło na czele Fusion droższy model, Fable 5, i sesje wyszły średnio o 9% taniej, bo prowadzący rzadziej przerabiał zadania po tańszym pomocniku. Na DeepSWE 1.1 para oddaje 1,2 punktu z 64,3 i ścina rachunek o 46%, ale przy migracji kodu traci 6,4 punktu i oszczędza tylko 20%. Wniosek Cognition brzmi prosto: modele i otaczające je harnessy wycenia się po cenie za zadanie, a nie po cenie za token. Tyle że SWE-2 nie ma ani otwartych wag, ani API, więc sprawdzisz to wyłącznie wewnątrz Devina.

SWE-1.7 dobija do czołówki modeli do kodu za ułamek jej ceny Model / Badania

SWE-1.7 dobija do czołówki modeli do kodu za ułamek jej ceny

3 min

Cognition wypuściło 8 lipca SWE-1.7, model napędzający agenta Devin, i reklamuje go ostrożnie: dobił do czołówki za ułamek jej ceny. Na własnym teście FrontierCode osiąga 42,3%, tuż pod GPT-5.5 i cztery punkty pod Opus 4.8, choć poprzednia wersja miała tu ledwie 9,4%. Model grzebie w kodzie dłużej i chętniej dopisuje testy, ale rusza więcej plików, niż trzeba. Haczyk w tym, że najtrudniejszy z benchmarków napisał sam Cognition, a konkretnej ceny w całym wpisie nie pada ani razu.

Agent Cognition zabiera się do kodu po 18 krokach zamiast 48 Model / Badania

Agent Cognition zabiera się do kodu po 18 krokach zamiast 48

4 min

SWE-2, nowy model Cognition napędzający Devina, zabiera się do edycji kodu po 18 krokach zamiast 48, a całą drogę przez zadanie skrócił ze 127 kroków do 53, bo koszt wpisano wprost do funkcji nagrody podczas uczenia. Na własnym benchmarku firmy wypada niemal jak Fable 5.1, 50,0% wobec 50,9%, i to o 64% taniej, ale na trudniejszym Terminal-Bench 4 zostaje daleko w tyle z wynikiem 27,3%. Cennika ani osobnego API nie ma, model dostajesz wyłącznie razem z Devinem, więc przewagi kosztowej nikt z zewnątrz na razie nie sprawdzi u siebie.