SmartDigest.ai Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Model / Badania

Lokalny agent do kodu, który celowo mniej myśli

Jackrong wypuścił Qwopus-3.6-35B-A3B-Coder, model do kodu oparty na Qwen3.6, w którym rozumowanie jest domyślnie wyłączone. To mieszanka ekspertów z 35 miliardami wag, z których przy każdym tokenie pracuje tylko około 3 miliardów, więc działa lokalnie i zebrał 45 tysięcy pobrań miesięcznie. Autorzy chwalą się wynikiem 62,4% na SWE-bench, ale to przebieg policzony przez sam zespół na 300 zadaniach, bez potwierdzenia. Bez rozumowania model pewniej trzyma się poleceń i stabilniej ciągnie stan przez tury, za to w kompetencji inżynierskiej przegrywa z rywalem tej samej wielkości, 81 do 94.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Model / Badania  ·  3 min  · 

Lokalny agent do kodu, który celowo mniej myśli
Ilustrację przygotowała AI.

W prawdziwej pętli agenta programistycznego większość kroków to nie filozofia, tylko robota. Przeczytaj plik, zerknij w ślad błędu, wybierz narzędzie, popraw kod, odpal testy, sprawdź, co się wysypało, jedź dalej. Modele rozumujące, czyli te, które przed właściwą odpowiedzią wypisują długi, widoczny ciąg rozumowania krok po kroku, zbudowały swoją pozycję właśnie na tym śladzie: to on zwykle podbija wyniki na trudnych zadaniach. Problem w tym, że jeśli model przed każdym takim ruchem rozpisuje osobny wywód, płaci za to tokenami, czasem odpowiedzi i rosnącym ryzykiem, że po kilkunastu turach zgubi wątek.

Jackrong wychodzi z założenia, że to marnotrawstwo, i publikuje Qwopus-3.6-35B-A3B-Coder, model do kodu, w którym rozumowanie jest domyślnie wyłączone.

Pod spodem to fine-tune rodziny Qwen, konkretnie Qwen3.6-35B-A3B. To rzadki model typu MoE, mieszanki ekspertów: ma 35 miliardów wag, ale przy każdym tokenie uruchamia tylko około 3 miliardów z nich, reszta śpi. Dzięki temu mieści się i działa sensownie na lokalnej maszynie, a nie tylko w chmurze dostawcy. Wagi wyszły w formacie GGUF, w kwantyzacjach od 2 do 8 bitów, więc każdy ściąga wariant pod swoją kartę graficzną. I ludzie ściągają: prawie 45 tysięcy pobrań w miesiąc.

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Qwen3.6-27B osiąga to, na co poprzednia generacja potrzebowała 397 miliardów parametrów Model / Badania

Qwen3.6-27B osiąga to, na co poprzednia generacja potrzebowała 397 miliardów parametrów

3 min

Alibaba wypuściła 23 kwietnia Qwen3.6-27B: gęsty model open-source, który na SWE-Bench Verified osiąga 77,2%, ustępując tylko Claude 4.5 Opus (80,9%), a na Terminal-Bench 2.0 remisuje z nim na 59,3%. Przy 15 razy mniejszej liczbie wag niż poprzedni flagowiec Alibaby mieści się w FP8 na karcie z 32 GB, a w kwantyzacji 4-bitowej schodzi na sprzęt konsumencki. Architektura z proporcją 3:1 na korzyść uwagi liniowej daje natywne okno 262 144 tokenów, a opcja preserve_thinking pozwala agentowi nieść ślad rozumowania przez kolejne tury.

JetSpec przyspiesza Qwen3 nawet 9,64 raza, ale tylko jeśli sam hostujesz model Analiza / Opinia

JetSpec przyspiesza Qwen3 nawet 9,64 raza, ale tylko jeśli sam hostujesz model

4 min

JetSpec, praca z końca czerwca, przyspiesza spekulatywne dekodowanie na modelach Qwen3 nawet 9,64 raza, ale ta liczba pochodzi z zadań matematycznych z zestawu MATH-500, czyli najbardziej przewidywalnego przypadku. Na swobodnych rozmowach przyspieszenie spada do 4,58 raza, przy wyniku modelu identycznym co do bitu. Cały zysk trafia jednak tylko do tych, którzy sami hostują Qwen3 na własnych GPU, bo przez API w rodzaju Claude czy GPT nie ma gdzie go podpiąć. Autorzy udostępnili kod i gotowe głowice na GitHubie, więc każdy chętny może sprawdzić te liczby u siebie.

Splash dwa razy przyspiesza Qwena na Macu, bo obsługuje tylko dwa modele Premiera / Narzędzie

Splash dwa razy przyspiesza Qwena na Macu, bo obsługuje tylko dwa modele

5 min

Inco AI wydało Splash, silnik do lokalnego uruchamiania modeli na Macu, który obsługuje tylko Qwen3.8-27B i Qwen3.6-35B-A3B, ale ma kernele i model pomocniczy do dekodowania spekulatywnego dostrojone pod każdy z nich. Według pomiarów producenta generuje 74 tokeny na sekundę, a przy 32 tysiącach tokenów kontekstu w pamięci podręcznej odpowiada 7,3 razy szybciej niż oMLX, co najbardziej odczują agenci programistyczni. Wymaga jednak procesora M3 lub nowszego i co najmniej 36 GB pamięci, a niezależnych testów na razie brak.