Model / Badania
Po co model ponad trzy razy większy, skoro mniejszy programuje lepiej?
Thinking Machines Lab wypuściło Inkling-Small, model z otwartymi wagami, który przy każdym tokenie uruchamia tylko 12 miliardów z 276 miliardów parametrów, a mimo to dorównuje ponad trzy razy większemu Inklingowi i wyprzedza go na kodzie, 80,2% wobec 77,6% na SWEBench Verified. Przewagę dało nie skalowanie, tylko dwa dodatkowe tygodnie treningu pod agentowe programowanie. Cena jest jedna: na wiedzy o świecie mniejszy model wyraźnie odstaje, 20,6% do 43,9% na SimpleQA. Mniej aktywnych parametrów oznacza też niższy rachunek za każdą odpowiedź.
Napisała AI, żeby oszczędzić Ci czytania setek źródeł. · Jak to działa
Model / Badania · 3 min ·
Thinking Machines Lab wypuściło Inkling-Small, model z otwartymi wagami, który przy generowaniu każdego tokena uruchamia 12 miliardów parametrów i mimo to dorównuje większemu Inklingowi, a na zadaniach z kodem go wyprzedza. Dwa tygodnie temu opisywałem właśnie większego Inklinga, pierwszy model tego laboratorium: na token uruchamia 41 miliardów parametrów, czyli ponad trzy razy tyle, i to on jest tu naturalnym punktem odniesienia. Nowy model jest tańszy w działaniu, a na programowaniu lepszy. To rzadka sytuacja, w której odchudzenie nie kosztuje jakości.
Dwie liczby, które podaje firma, znaczą co innego i dopiero razem układają się w sens. Inkling-Small to model typu mixture of experts: w środku ma 276 miliardów parametrów, ale przy każdym tokenie zapala się tylko ich ułamek, właśnie owe 12 miliardów. Pierwsza liczba to rozmiar, który trzymasz na dysku i w pamięci. Druga, aktywne parametry, to rachunek, który płacisz za każde słowo odpowiedzi, bo od niej zależy, ile obliczeń idzie na wygenerowanie jednego tokena. Większy Inkling pracuje na 41 miliardach aktywnych parametrów, więc każda jego odpowiedź kosztuje znacznie więcej pracy sprzętu.
Na SWEBench Verified, teście, w którym model dostaje prawdziwe zgłoszenie błędu z repozytorium i ma je naprawić, Inkling-Small wchodzi na 80,2%, wobec 77,6% większego Inklinga. Na Humanity's Last Exam, zestawie trudnych pytań z wielu dziedzin, jest 31,6% do 29,7%, znowu na korzyść mniejszego. Podobnie wypada Terminal-Bench, gdzie model pracuje w prawdziwym terminalu i musi doprowadzić zadanie do końca. Różnice nie są duże, ale za każdym razem idą w tę samą stronę.
Czytaj dalej za darmo
Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.