SmartDigest.ai Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Analiza / Opinia

JetSpec przyspiesza Qwen3 nawet 9,64 raza, ale tylko jeśli sam hostujesz model

JetSpec, praca z końca czerwca, przyspiesza spekulatywne dekodowanie na modelach Qwen3 nawet 9,64 raza, ale ta liczba pochodzi z zadań matematycznych z zestawu MATH-500, czyli najbardziej przewidywalnego przypadku. Na swobodnych rozmowach przyspieszenie spada do 4,58 raza, przy wyniku modelu identycznym co do bitu. Cały zysk trafia jednak tylko do tych, którzy sami hostują Qwen3 na własnych GPU, bo przez API w rodzaju Claude czy GPT nie ma gdzie go podpiąć. Autorzy udostępnili kod i gotowe głowice na GitHubie, więc każdy chętny może sprawdzić te liczby u siebie.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Analiza / Opinia  ·  4 min  · 

JetSpec przyspiesza Qwen3 nawet 9,64 raza, ale tylko jeśli sam hostujesz model
Ilustrację przygotowała AI.

Duży model językowy pisze tekst token po tokenie, a każdy kolejny wyraz wymaga przepuszczenia całych wag od nowa. To właśnie tu leży wąskie gardło inferencji: nie w tym, jak mądry jest model, tylko w tym, że przy każdym słowie musi zaczynać od zera. Spekulatywne dekodowanie obchodzi ten problem prostą sztuczką. Mały, szybki model zgaduje kilka tokenów naprzód, a duży sprawdza całą tę wiązkę w jednym przebiegu. Kiedy zgadza się z domysłem, dostajesz kilka tokenów w cenie jednego przejścia przez model, a wynik jest co do bitu taki sam, jaki wyplułby sam duży model. Przyspieszenie bez żadnej utraty jakości.

JetSpec, praca opublikowana pod koniec czerwca, podbija to przyspieszenie do 9,64x na modelach Qwen3, otwartej rodzinie dużych modeli językowych od Alibaby. Liczba robi wrażenie, ale zanim ktokolwiek zacznie ją cytować na slajdzie: to najlepszy przypadek z możliwych, zmierzony na zadaniach matematycznych. Na rozmowach, czyli tym, co większość aplikacji faktycznie robi, jest to 4,58x. Różnica między tymi dwiema liczbami to właściwie cała historia tej pracy.

Dwie szkoły zgadywania, każda z inną wadą

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Rozmiar modelu przestał przewidywać jego prędkość Poradnik / Praktyka

Rozmiar modelu przestał przewidywać jego prędkość

4 min

Model Laguna S 2.1 ma 118 miliardów parametrów, ale generuje tekst szybciej niż czterokrotnie mniejszy Qwen3.6-27B, bo o prędkości decyduje nie całkowity rozmiar, tylko liczba aktywnych parametrów w architekturze MoE. Mori Shige z Classmethod przez pół roku mierzył lokalne modele na DGX Spark i zostały mu z tego dwa odruchy: czytać liczbę aktywnych parametrów zamiast łącznej wagi, a ściągając wersję 4-bitową, sprawdzić dwóch wydawców, bo ta sama kwantyzacja potrafi dać nawet 55% różnicy w prędkości. Dekodowanie spekulatywne podbiło Qwen3.6-35B-A3B o jakieś 40%.

Lokalny agent do kodu, który celowo mniej myśli Model / Badania

Lokalny agent do kodu, który celowo mniej myśli

3 min

Jackrong wypuścił Qwopus-3.6-35B-A3B-Coder, model do kodu oparty na Qwen3.6, w którym rozumowanie jest domyślnie wyłączone. To mieszanka ekspertów z 35 miliardami wag, z których przy każdym tokenie pracuje tylko około 3 miliardów, więc działa lokalnie i zebrał 45 tysięcy pobrań miesięcznie. Autorzy chwalą się wynikiem 62,4% na SWE-bench, ale to przebieg policzony przez sam zespół na 300 zadaniach, bez potwierdzenia. Bez rozumowania model pewniej trzyma się poleceń i stabilniej ciągnie stan przez tury, za to w kompetencji inżynierskiej przegrywa z rywalem tej samej wielkości, 81 do 94.

Splash dwa razy przyspiesza Qwena na Macu, bo obsługuje tylko dwa modele Premiera / Narzędzie

Splash dwa razy przyspiesza Qwena na Macu, bo obsługuje tylko dwa modele

5 min

Inco AI wydało Splash, silnik do lokalnego uruchamiania modeli na Macu, który obsługuje tylko Qwen3.8-27B i Qwen3.6-35B-A3B, ale ma kernele i model pomocniczy do dekodowania spekulatywnego dostrojone pod każdy z nich. Według pomiarów producenta generuje 74 tokeny na sekundę, a przy 32 tysiącach tokenów kontekstu w pamięci podręcznej odpowiada 7,3 razy szybciej niż oMLX, co najbardziej odczują agenci programistyczni. Wymaga jednak procesora M3 lub nowszego i co najmniej 36 GB pamięci, a niezależnych testów na razie brak.