SmartDigest Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Model / Badania

Po co model ponad trzy razy większy, skoro mniejszy programuje lepiej?

Thinking Machines Lab wypuściło Inkling-Small, model z otwartymi wagami, który przy każdym tokenie uruchamia tylko 12 miliardów z 276 miliardów parametrów, a mimo to dorównuje ponad trzy razy większemu Inklingowi i wyprzedza go na kodzie, 80,2% wobec 77,6% na SWEBench Verified. Przewagę dało nie skalowanie, tylko dwa dodatkowe tygodnie treningu pod agentowe programowanie. Cena jest jedna: na wiedzy o świecie mniejszy model wyraźnie odstaje, 20,6% do 43,9% na SimpleQA. Mniej aktywnych parametrów oznacza też niższy rachunek za każdą odpowiedź.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Model / Badania  ·  3 min  · 

Po co model ponad trzy razy większy, skoro mniejszy programuje lepiej?
Ilustrację przygotowała AI.

Thinking Machines Lab wypuściło Inkling-Small, model z otwartymi wagami, który przy generowaniu każdego tokena uruchamia 12 miliardów parametrów i mimo to dorównuje większemu Inklingowi, a na zadaniach z kodem go wyprzedza. Dwa tygodnie temu opisywałem właśnie większego Inklinga, pierwszy model tego laboratorium: na token uruchamia 41 miliardów parametrów, czyli ponad trzy razy tyle, i to on jest tu naturalnym punktem odniesienia. Nowy model jest tańszy w działaniu, a na programowaniu lepszy. To rzadka sytuacja, w której odchudzenie nie kosztuje jakości.

Dwie liczby, które podaje firma, znaczą co innego i dopiero razem układają się w sens. Inkling-Small to model typu mixture of experts: w środku ma 276 miliardów parametrów, ale przy każdym tokenie zapala się tylko ich ułamek, właśnie owe 12 miliardów. Pierwsza liczba to rozmiar, który trzymasz na dysku i w pamięci. Druga, aktywne parametry, to rachunek, który płacisz za każde słowo odpowiedzi, bo od niej zależy, ile obliczeń idzie na wygenerowanie jednego tokena. Większy Inkling pracuje na 41 miliardach aktywnych parametrów, więc każda jego odpowiedź kosztuje znacznie więcej pracy sprzętu.

Na SWEBench Verified, teście, w którym model dostaje prawdziwe zgłoszenie błędu z repozytorium i ma je naprawić, Inkling-Small wchodzi na 80,2%, wobec 77,6% większego Inklinga. Na Humanity's Last Exam, zestawie trudnych pytań z wielu dziedzin, jest 31,6% do 29,7%, znowu na korzyść mniejszego. Podobnie wypada Terminal-Bench, gdzie model pracuje w prawdziwym terminalu i musi doprowadzić zadanie do końca. Różnice nie są duże, ale za każdym razem idą w tę samą stronę.

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Laguna S 2.1 bije modele kilkanaście razy większe i pokazuje zapisy Model / Badania

Laguna S 2.1 bije modele kilkanaście razy większe i pokazuje zapisy

3 min

Laguna S 2.1 od Poolside dostała 40,4% na benchmarku DeepSWE, cztery razy więcej niż kilkanaście razy większy DeepSeek V4 Pro Max, a firma opublikowała pełne zapisy każdej próby, żeby liczbę dało się sprawdzić samodzielnie. Model ma 118 miliardów parametrów, ale na każdy token uruchamia tylko około 8 miliardów, więc wywołanie przez API kosztuje 0,10 dolara za milion tokenów na wejściu, jakieś 50 razy mniej niż Claude Opus 5. To wąski specjalista wyłącznie od kodu, bez niezależnego wskaźnika ogólnej inteligencji, a wynik trzyma się tylko z włączonym trybem myślenia, bo bez niego spada do 16,5%.

Poolside wypuszcza model do kodu, który mieści się na jednej maszynie Model / Badania

Poolside wypuszcza model do kodu, który mieści się na jednej maszynie

4 min

Poolside wypuściło Lagunę S 2.1, model do kodu z otwartymi wagami, który mimo 118 miliardów parametrów uruchamia na token tylko 8 miliardów i mieści się na jednej maszynie, a skwantyzowany schodzi do jakichś 40 GB. Na Terminal-Bench 2.1 dostał 70,2%, tyle co modele wielokrotnie od niego większe, ale na trudniejszym DeepSWE ma już 40,4%, daleko za Claude Fable 5 z 70%, i pod presją zaczyna zmyślać. Nie chodzi o to, że mały bije dużego, tylko że "dość dobry, żeby mieć go na własność" to już realna półka w agentowym kodowaniu.

Zamiast pompować parametry, wydłużyli horyzont treningu agenta Model / Badania

Zamiast pompować parametry, wydłużyli horyzont treningu agenta

3 min

InternScience pokazuje Agents-A1 — otwarty model o 35 miliardach parametrów, który na kilku benchmarkach dorównuje gigantom z bilionem parametrów, jak Kimi-K2.6 czy DeepSeek-V4-pro. Zamiast powiększać model, autorzy wydłużyli horyzont treningu, ucząc go na bardzo długich przebiegach i przelewając wiedzę sześciu wyspecjalizowanych nauczycieli do jednego ucznia. Przewaga leży jednak głównie w zadaniach naukowych, a nie w kodowaniu, a wszystkie liczby pochodzą od samych autorów i czekają na niezależne powtórzenie.