SmartDigest.ai Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Model / Badania

Ile programowania zostaje w modelu po wycięciu połowy ekspertów?

Zespół DASLab z ISTA wyciął z modelu Qwen3.8-Flash-Next od Alibaby 256 z 512 ekspertów w każdej warstwie, a resztę wag zapisał z dokładnością 3,5 bita, dzięki czemu wersja do programowania mieści się na jednej karcie z 32 GB zamiast 354 GB. Metoda RCO zachowuje tylko to, co było w próbce kalibracyjnej, przez co pierwsza wersja straciła widzenie, a testy kodu tego nie zauważyły. Na LiveCodeBench zostaje 98,7% wyniku, ale na SWE-bench Verified spadek z 82,8% do 75,6% pokazuje, że w pracy agenta cięcie kosztuje więcej.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Model / Badania  ·  4 min  · 

Ile programowania zostaje w modelu po wycięciu połowy ekspertów?
Ilustrację przygotowała AI.

Qwen3.8-Flash-Next to model z rodziny Qwen od Alibaby, uniwersalny, bo oprócz tekstu rozumie też obrazy. Zapisany bez zaokrąglania liczb, z których się składa, waży 354 GB, więc kto chciałby go uruchomić u siebie, potrzebowałby kilku serwerowych kart graficznych. Zespół DASLab z Institute of Science and Technology Austria wrzucił na Hugging Face wersję tego modelu nastawioną na programowanie, która według autorów mieści się na jednym akceleratorze z 32 GB pamięci. Badacze nie osiągnęli tego samym ściskaniem liczb. Wycięli połowę modelu, tę, której ich zdaniem programista nie potrzebuje.

Ceną za zmieszczenie się na jednej karcie jest więc połowa modelu, a autorzy opisali tę wymianę wyjątkowo uczciwie, dlatego warto ją zrozumieć przed pobraniem. Dostajesz model, który zachował to, co kazano mu zachować, i nic więcej.

Pół modelu mniej

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Lokalny agent do kodu, który celowo mniej myśli Model / Badania

Lokalny agent do kodu, który celowo mniej myśli

3 min

Jackrong wypuścił Qwopus-3.6-35B-A3B-Coder, model do kodu oparty na Qwen3.6, w którym rozumowanie jest domyślnie wyłączone. To mieszanka ekspertów z 35 miliardami wag, z których przy każdym tokenie pracuje tylko około 3 miliardów, więc działa lokalnie i zebrał 45 tysięcy pobrań miesięcznie. Autorzy chwalą się wynikiem 62,4% na SWE-bench, ale to przebieg policzony przez sam zespół na 300 zadaniach, bez potwierdzenia. Bez rozumowania model pewniej trzyma się poleceń i stabilniej ciągnie stan przez tury, za to w kompetencji inżynierskiej przegrywa z rywalem tej samej wielkości, 81 do 94.

Po co model ponad trzy razy większy, skoro mniejszy programuje lepiej? Model / Badania

Po co model ponad trzy razy większy, skoro mniejszy programuje lepiej?

3 min

Thinking Machines Lab wypuściło Inkling-Small, model z otwartymi wagami, który przy każdym tokenie uruchamia tylko 12 miliardów z 276 miliardów parametrów, a mimo to dorównuje ponad trzy razy większemu Inklingowi i wyprzedza go na kodzie, 80,2% wobec 77,6% na SWEBench Verified. Przewagę dało nie skalowanie, tylko dwa dodatkowe tygodnie treningu pod agentowe programowanie. Cena jest jedna: na wiedzy o świecie mniejszy model wyraźnie odstaje, 20,6% do 43,9% na SimpleQA. Mniej aktywnych parametrów oznacza też niższy rachunek za każdą odpowiedź.

Qwen3.6-27B osiąga to, na co poprzednia generacja potrzebowała 397 miliardów parametrów Model / Badania

Qwen3.6-27B osiąga to, na co poprzednia generacja potrzebowała 397 miliardów parametrów

3 min

Alibaba wypuściła 23 kwietnia Qwen3.6-27B: gęsty model open-source, który na SWE-Bench Verified osiąga 77,2%, ustępując tylko Claude 4.5 Opus (80,9%), a na Terminal-Bench 2.0 remisuje z nim na 59,3%. Przy 15 razy mniejszej liczbie wag niż poprzedni flagowiec Alibaby mieści się w FP8 na karcie z 32 GB, a w kwantyzacji 4-bitowej schodzi na sprzęt konsumencki. Architektura z proporcją 3:1 na korzyść uwagi liniowej daje natywne okno 262 144 tokenów, a opcja preserve_thinking pozwala agentowi nieść ślad rozumowania przez kolejne tury.