SmartDigest.ai Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Premiera / Narzędzie

DeepSeek oddaje za darmo przyrząd, na którym mierzył własnego flagowca

DeepSeek podaje, że model V4-Pro-0813 kończy 87,9 procent zadań w Terminal Bench 2.1, tyle że przy części testów agentowych pracował na własnym Harnessie, czyli warstwie, którą w połowie sierpnia oddał wszystkim na licencji MIT. Taki wynik ocenia parę, model i warstwę wokół niego, więc podpinając te same wagi pod swojego agenta, dostaniesz swoją własną liczbę. Za to razem z tabelką dostajesz stanowisko, na którym ona powstała, a model jest w nim wymienną wtyczką, więc sprawdzisz tam też Claude'a czy GPT. Ceną jest wczesna wersja, przy której DeepSeek zapowiada zmiany łamiące zgodność.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Premiera / Narzędzie  ·  4 min  · 

DeepSeek oddaje za darmo przyrząd, na którym mierzył własnego flagowca
Ilustrację przygotowała AI.

DeepSeek podaje, że jego nowy flagowy model V4-Pro-0813 kończy 87,9 procent zadań w teście Terminal Bench 2.1, który nie sprawdza, jak gładko model pisze zdania, tylko jak często agent dowozi do końca robotę w terminalu: wejść do repozytorium, pozmieniać pliki, uruchomić polecenia i nie utknąć w połowie. Mniej więcej co ósme zadanie agent i tak zawala.

Do tej liczby jest zresztą przypis. Przy części publicznych testów agentowych model pracował w Harnessie ustawionym na minimum: dostawał obraną do kości wersję tej warstwy, przy czym DeepSeek nie podaje, co dokładnie w takim trybie zostaje. Im mniej podpórek, tym więcej wynik mówi o samym modelu, tyle że nawet tak okrojona warstwa wciąż podaje modelowi to, co ten zobaczy w kolejnym ruchu. A jest to ta sama warstwa, którą firma w połowie sierpnia oddała wszystkim za darmo.

Tydzień temu pisałem o tym, jak DeepSeek rozdaje swój Harness i tego samego dnia podnosi ceny API. Przypis do benchmarków dokłada do tej historii drugie dno. Harness nie jest projektem pobocznym, wrzuconym na GitHuba przy okazji premiery modelu, tylko kawałkiem maszynerii, na której firma sprawdzała, ile jej model potrafi jako agent.

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

DeepSeek wygasza własnego flagowca, bo tańszy model wypada lepiej Model / Badania

DeepSeek wygasza własnego flagowca, bo tańszy model wypada lepiej

3 min

DeepSeek od zeszłego poniedziałku przekierowuje ruch z flagowego V4-Pro na tańszy V4.1-Flash i rozlicza go po niższych stawkach, więc w konfiguracji masz jeden model, a odpowiada inny. Firma tłumaczy to wynikami: 90,6 punktu na Terminal-Bench 2.1, prawie dwa oczka przed GPT-5.6 Sol i trzy przed własnym V4-Pro, przy pamięci ściętej z 3514 do 890 bajtów na token. Przy agencie, który pracuje godzinami nad jednym zadaniem, to właśnie pamięć bywa największą pozycją rachunku, więc czterokrotna oszczędność waży więcej niż miejsce w rankingu. Tyle że tabelkę mierzył sprzedawca, a wyboru już nie ma.

DeepSeek wypuszcza R1: rozumowanie, które pobierasz i uruchamiasz u siebie Model / Badania

DeepSeek wypuszcza R1: rozumowanie, które pobierasz i uruchamiasz u siebie

4 min

DeepSeek wypuścił na Hugging Face model rozumujący R1 na licencji MIT, razem z sześcioma mniejszymi wariantami destylowanymi, które można pobrać i uruchomić na własnym sprzęcie. Według liczb podanych przez samego DeepSeeka R1 dorównuje o1 od OpenAI: 65,9% na LiveCodeBench i 49,2% na SWE Verified, choć niezależne testy dopiero to zweryfikują. Flagowy R1 ma 671 miliardów parametrów i nie zmieści się w domowej serwerowni, ale wersja 32B odpali na jednej stacji roboczej. Rozumowanie na poziomie o1 przestało istnieć wyłącznie za czyimś API.

DeepSeek otwiera harness i tego samego dnia podnosi ceny API Premiera / Narzędzie

DeepSeek otwiera harness i tego samego dnia podnosi ceny API

4 min

W zeszły czwartek DeepSeek wypuścił DeepSeek Harness (dsh): darmową, otwartą na licencji MIT warstwę, która stoi między programistą a modelem i konkuruje z Claude Code oraz Codexem. Motto brzmi "wszystko jest wtyczką", więc pod harness podłączysz dowolny model, nie tylko DeepSeeka. Tego samego dnia firma podniosła ceny swojego API, według Reutersa miejscami o ponad 1000%. Moim zdaniem to wyrachowany ruch: DeepSeek rozdaje najtrudniejszą do wymiany warstwę za darmo, żeby podważyć przewagę rywali, a pieniądze zamierza brać na droższym API.