SmartDigest Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Model / Badania

Laguna S 2.1 bije modele kilkanaście razy większe i pokazuje zapisy

Laguna S 2.1 od Poolside dostała 40,4% na benchmarku DeepSWE, cztery razy więcej niż kilkanaście razy większy DeepSeek V4 Pro Max, a firma opublikowała pełne zapisy każdej próby, żeby liczbę dało się sprawdzić samodzielnie. Model ma 118 miliardów parametrów, ale na każdy token uruchamia tylko około 8 miliardów, więc wywołanie przez API kosztuje 0,10 dolara za milion tokenów na wejściu, jakieś 50 razy mniej niż Claude Opus 5. To wąski specjalista wyłącznie od kodu, bez niezależnego wskaźnika ogólnej inteligencji, a wynik trzyma się tylko z włączonym trybem myślenia, bo bez niego spada do 16,5%.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Model / Badania  ·  3 min  · 

Laguna S 2.1 bije modele kilkanaście razy większe i pokazuje zapisy
Ilustrację przygotowała AI.

Poolside podaje, że Laguna S 2.1 dostała 40,4% na DeepSWE, teście sprawdzającym, czy model potrafi samodzielnie doprowadzić do końca długie zadanie programistyczne rozbite na wiele kroków w terminalu. DeepSeek V4 Pro Max, model o około 1,6 biliona parametrów (jakieś 13 razy większy), dostał na tym samym teście 9,0%. Cztery razy wyższy wynik przy ułamku rozmiaru to zwykle rezultat, który znaczy tyle, że ktoś zepsuł pomiar. Pisałem o tej premierze tydzień temu, a przez te siedem dni Laguna zdążyła stać się modelem, do którego wszyscy zaczęli porównywać swoje: powstały osobne zestawienia z DeepSeekiem, z Qwenem 3.7 Max i z modelem Hy3 od Tencenta, bo Poolside sprzedaje ją wprost jako "odpowiedź Zachodu na DeepSeek i Qwen".

To, co odróżnia taki wynik od zwykłej autoreklamy, Poolside zrobił świadomie: opublikował pełne zapisy każdej próby z końcowego zestawu testowego, krok po kroku. Dzięki temu każdy może prześledzić, co model faktycznie robił, i sprawdzić liczbę u siebie, zamiast wierzyć firmie na słowo. W świecie, w którym spora część benchmarków to wartości podane przez producenta bez pokazania metodologii, samo wyłożenie surowych przebiegów buduje zaufanie mocniej niż sam wynik.

Dlaczego 118 miliardów parametrów kosztuje jak 8

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Poolside wypuszcza model do kodu, który mieści się na jednej maszynie Model / Badania

Poolside wypuszcza model do kodu, który mieści się na jednej maszynie

4 min

Poolside wypuściło Lagunę S 2.1, model do kodu z otwartymi wagami, który mimo 118 miliardów parametrów uruchamia na token tylko 8 miliardów i mieści się na jednej maszynie, a skwantyzowany schodzi do jakichś 40 GB. Na Terminal-Bench 2.1 dostał 70,2%, tyle co modele wielokrotnie od niego większe, ale na trudniejszym DeepSWE ma już 40,4%, daleko za Claude Fable 5 z 70%, i pod presją zaczyna zmyślać. Nie chodzi o to, że mały bije dużego, tylko że "dość dobry, żeby mieć go na własność" to już realna półka w agentowym kodowaniu.

Po co model ponad trzy razy większy, skoro mniejszy programuje lepiej? Model / Badania

Po co model ponad trzy razy większy, skoro mniejszy programuje lepiej?

3 min

Thinking Machines Lab wypuściło Inkling-Small, model z otwartymi wagami, który przy każdym tokenie uruchamia tylko 12 miliardów z 276 miliardów parametrów, a mimo to dorównuje ponad trzy razy większemu Inklingowi i wyprzedza go na kodzie, 80,2% wobec 77,6% na SWEBench Verified. Przewagę dało nie skalowanie, tylko dwa dodatkowe tygodnie treningu pod agentowe programowanie. Cena jest jedna: na wiedzy o świecie mniejszy model wyraźnie odstaje, 20,6% do 43,9% na SimpleQA. Mniej aktywnych parametrów oznacza też niższy rachunek za każdą odpowiedź.

DeepSeek oddaje za darmo przyrząd, na którym mierzył własnego flagowca Premiera / Narzędzie

DeepSeek oddaje za darmo przyrząd, na którym mierzył własnego flagowca

4 min

DeepSeek podaje, że model V4-Pro-0813 kończy 87,9 procent zadań w Terminal Bench 2.1, tyle że przy części testów agentowych pracował na własnym Harnessie, czyli warstwie, którą w połowie sierpnia oddał wszystkim na licencji MIT. Taki wynik ocenia parę, model i warstwę wokół niego, więc podpinając te same wagi pod swojego agenta, dostaniesz swoją własną liczbę. Za to razem z tabelką dostajesz stanowisko, na którym ona powstała, a model jest w nim wymienną wtyczką, więc sprawdzisz tam też Claude'a czy GPT. Ceną jest wczesna wersja, przy której DeepSeek zapowiada zmiany łamiące zgodność.