SmartDigest Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Premiera / Narzędzie

Splash dwa razy przyspiesza Qwena na Macu, bo obsługuje tylko dwa modele

Inco AI wydało Splash, silnik do lokalnego uruchamiania modeli na Macu, który obsługuje tylko Qwen3.8-27B i Qwen3.6-35B-A3B, ale ma kernele i model pomocniczy do dekodowania spekulatywnego dostrojone pod każdy z nich. Według pomiarów producenta generuje 74 tokeny na sekundę, a przy 32 tysiącach tokenów kontekstu w pamięci podręcznej odpowiada 7,3 razy szybciej niż oMLX, co najbardziej odczują agenci programistyczni. Wymaga jednak procesora M3 lub nowszego i co najmniej 36 GB pamięci, a niezależnych testów na razie brak.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Premiera / Narzędzie  ·  5 min  · 

Splash dwa razy przyspiesza Qwena na Macu, bo obsługuje tylko dwa modele
Ilustrację przygotowała AI.

Jeśli uruchamiacie modele językowe lokalnie na Macu, to najpewniej robicie to przez llama.cpp, Ollamę albo MLX. Wskazujecie takiemu silnikowi inferencji plik z wagami modelu i dostajecie odpowiedzi. Te narzędzia od lat chwalą się tym, ile różnych modeli potrafią załadować. Inco AI, firma znana dotąd z przyspieszania modeli w centrach danych, opisała 17 września na swoim blogu silnik Splash, który idzie w przeciwną stronę. Obsługuje dokładnie dwa modele, Qwen3.8-27B i Qwen3.6-35B-A3B, i nie ma pliku konfiguracyjnego. Według pomiarów samego Inco Splash generuje 74 tokeny na sekundę, mniej więcej dwa razy więcej niż następny w kolejce silnik na tym samym komputerze (Inco AI).

Moim zdaniem te 74 tokeny na sekundę to najmniej ciekawa liczba w tej historii. Mierzą krótką rozmowę, a lokalne modele coraz częściej obsługują agentów programistycznych, którzy pracują z modelem godzinami. Ważniejsze jest więc to, co dzieje się po półgodzinie pracy takiego agenta, i to, że specjalizacja w ogóle zaczęła się komuś opłacać.

Co zyskuje silnik, który wie, co uruchamia

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Qwen3.6-27B osiąga to, na co poprzednia generacja potrzebowała 397 miliardów parametrów Model / Badania

Qwen3.6-27B osiąga to, na co poprzednia generacja potrzebowała 397 miliardów parametrów

3 min

Alibaba wypuściła 23 kwietnia Qwen3.6-27B: gęsty model open-source, który na SWE-Bench Verified osiąga 77,2%, ustępując tylko Claude 4.5 Opus (80,9%), a na Terminal-Bench 2.0 remisuje z nim na 59,3%. Przy 15 razy mniejszej liczbie wag niż poprzedni flagowiec Alibaby mieści się w FP8 na karcie z 32 GB, a w kwantyzacji 4-bitowej schodzi na sprzęt konsumencki. Architektura z proporcją 3:1 na korzyść uwagi liniowej daje natywne okno 262 144 tokenów, a opcja preserve_thinking pozwala agentowi nieść ślad rozumowania przez kolejne tury.

JetSpec przyspiesza Qwen3 nawet 9,64 raza, ale tylko jeśli sam hostujesz model Analiza / Opinia

JetSpec przyspiesza Qwen3 nawet 9,64 raza, ale tylko jeśli sam hostujesz model

4 min

JetSpec, praca z końca czerwca, przyspiesza spekulatywne dekodowanie na modelach Qwen3 nawet 9,64 raza, ale ta liczba pochodzi z zadań matematycznych z zestawu MATH-500, czyli najbardziej przewidywalnego przypadku. Na swobodnych rozmowach przyspieszenie spada do 4,58 raza, przy wyniku modelu identycznym co do bitu. Cały zysk trafia jednak tylko do tych, którzy sami hostują Qwen3 na własnych GPU, bo przez API w rodzaju Claude czy GPT nie ma gdzie go podpiąć. Autorzy udostępnili kod i gotowe głowice na GitHubie, więc każdy chętny może sprawdzić te liczby u siebie.

Qwen3.8 27B mieści się w 17 GB i nie traci na jakości Model / Badania

Qwen3.8 27B mieści się w 17 GB i nie traci na jakości

5 min

Quesma wydała około 3000 dolarów na wynajem kart, żeby zmierzyć, ile pamięci naprawdę potrzebuje Qwen3.8 27B: pełny model w BF16 waży 55 GB, a skompresowany do czterech bitów schodzi do 17 GB i powtarza wynik oryginału na Terminal-Bench 2.1, więc mieści się na RTX 4090 razem z 64 tysiącami tokenów kontekstu. Klif zaczyna się dopiero przy jednym bicie, ale większym problemem jest domyślne ustawienie reasoning_effort na xhigh, przez które Simon Willison czekał 21 minut na prosty rysunek w SVG, a lekarstwem jest jedna linijka z poziomem low.