SmartDigest Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Model / Badania

DeepSeek wygasza własnego flagowca, bo tańszy model wypada lepiej

DeepSeek od zeszłego poniedziałku przekierowuje ruch z flagowego V4-Pro na tańszy V4.1-Flash i rozlicza go po niższych stawkach, więc w konfiguracji masz jeden model, a odpowiada inny. Firma tłumaczy to wynikami: 90,6 punktu na Terminal-Bench 2.1, prawie dwa oczka przed GPT-5.6 Sol i trzy przed własnym V4-Pro, przy pamięci ściętej z 3514 do 890 bajtów na token. Przy agencie, który pracuje godzinami nad jednym zadaniem, to właśnie pamięć bywa największą pozycją rachunku, więc czterokrotna oszczędność waży więcej niż miejsce w rankingu. Tyle że tabelkę mierzył sprzedawca, a wyboru już nie ma.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Model / Badania  ·  3 min  · 

DeepSeek wygasza własnego flagowca, bo tańszy model wypada lepiej
Ilustrację przygotowała AI.

W zeszły poniedziałek o czwartej nad ranem czasu UTC zapytanie wysłane do deepseek-v4-pro przestało trafiać do V4-Pro. DeepSeek przekierował ruch swojego flagowego modelu na mniejszy i tańszy V4.1-Flash, a rozlicza ten ruch według stawek tego tańszego. Nic się przy tym nie psuje, żadnego błędu nie zobaczysz, po prostu od tego dnia odpowiada ci inny model, niż masz wpisany w konfiguracji.

Żeby zrozumieć, dlaczego to dziwne, trzeba wiedzieć, jak DeepSeek dzielił dotąd ofertę. V4-Pro był tym drogim i mocnym, po który sięgało się przy trudnych zadaniach, a linia Flash tą szybką i tanią, dobrą na całą resztę. W czwartek 10 września firma pokazała V4.1-Flash, ogłosiła, że tańsza linia wyprzedziła droższą we wszystkich mierzonych kategoriach, i na tej podstawie wygasza droższą, przynajmniej do premiery V4.1-Pro. Z tego ogłoszenia kupuję jedno: arytmetykę pamięci. Tabelkę z wynikami mierzył sprzedawca.

Najwięcej zmieniło się jednak w pamięci. Agent, który godzinę dłubie przy jednym zadaniu, przegląda pliki, odpala testy i czyta ich wyniki, musi to wszystko pamiętać, więc każdy przeczytany token zostaje w pamięci podręcznej modelu, nazywanej w branży cache KV. Ta pamięć rośnie razem z sesją i zajmuje najdroższe miejsce, jakie ma serwer, czyli RAM karty graficznej. V4.1-Flash potrzebuje na token 890 bajtów zamiast 3514 w poprzednim Flashu, co ścina zapotrzebowanie na pamięć karty do ćwiartki.

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

DeepSeek oddaje za darmo przyrząd, na którym mierzył własnego flagowca Premiera / Narzędzie

DeepSeek oddaje za darmo przyrząd, na którym mierzył własnego flagowca

4 min

DeepSeek podaje, że model V4-Pro-0813 kończy 87,9 procent zadań w Terminal Bench 2.1, tyle że przy części testów agentowych pracował na własnym Harnessie, czyli warstwie, którą w połowie sierpnia oddał wszystkim na licencji MIT. Taki wynik ocenia parę, model i warstwę wokół niego, więc podpinając te same wagi pod swojego agenta, dostaniesz swoją własną liczbę. Za to razem z tabelką dostajesz stanowisko, na którym ona powstała, a model jest w nim wymienną wtyczką, więc sprawdzisz tam też Claude'a czy GPT. Ceną jest wczesna wersja, przy której DeepSeek zapowiada zmiany łamiące zgodność.

Laguna S 2.1 bije modele kilkanaście razy większe i pokazuje zapisy Model / Badania

Laguna S 2.1 bije modele kilkanaście razy większe i pokazuje zapisy

3 min

Laguna S 2.1 od Poolside dostała 40,4% na benchmarku DeepSWE, cztery razy więcej niż kilkanaście razy większy DeepSeek V4 Pro Max, a firma opublikowała pełne zapisy każdej próby, żeby liczbę dało się sprawdzić samodzielnie. Model ma 118 miliardów parametrów, ale na każdy token uruchamia tylko około 8 miliardów, więc wywołanie przez API kosztuje 0,10 dolara za milion tokenów na wejściu, jakieś 50 razy mniej niż Claude Opus 5. To wąski specjalista wyłącznie od kodu, bez niezależnego wskaźnika ogólnej inteligencji, a wynik trzyma się tylko z włączonym trybem myślenia, bo bez niego spada do 16,5%.

DeepSeek wypuszcza R1: rozumowanie, które pobierasz i uruchamiasz u siebie Model / Badania

DeepSeek wypuszcza R1: rozumowanie, które pobierasz i uruchamiasz u siebie

4 min

DeepSeek wypuścił na Hugging Face model rozumujący R1 na licencji MIT, razem z sześcioma mniejszymi wariantami destylowanymi, które można pobrać i uruchomić na własnym sprzęcie. Według liczb podanych przez samego DeepSeeka R1 dorównuje o1 od OpenAI: 65,9% na LiveCodeBench i 49,2% na SWE Verified, choć niezależne testy dopiero to zweryfikują. Flagowy R1 ma 671 miliardów parametrów i nie zmieści się w domowej serwerowni, ale wersja 32B odpali na jednej stacji roboczej. Rozumowanie na poziomie o1 przestało istnieć wyłącznie za czyimś API.