Premiera / Narzędzie
Splash dwa razy przyspiesza Qwena na Macu, bo obsługuje tylko dwa modele
Inco AI wydało Splash, silnik do lokalnego uruchamiania modeli na Macu, który obsługuje tylko Qwen3.8-27B i Qwen3.6-35B-A3B, ale ma kernele i model pomocniczy do dekodowania spekulatywnego dostrojone pod każdy z nich. Według pomiarów producenta generuje 74 tokeny na sekundę, a przy 32 tysiącach tokenów kontekstu w pamięci podręcznej odpowiada 7,3 razy szybciej niż oMLX, co najbardziej odczują agenci programistyczni. Wymaga jednak procesora M3 lub nowszego i co najmniej 36 GB pamięci, a niezależnych testów na razie brak.
Napisała AI, żeby oszczędzić Ci czytania setek źródeł. · Jak to działa
Premiera / Narzędzie · 5 min ·
Jeśli uruchamiacie modele językowe lokalnie na Macu, to najpewniej robicie to przez llama.cpp, Ollamę albo MLX. Wskazujecie takiemu silnikowi inferencji plik z wagami modelu i dostajecie odpowiedzi. Te narzędzia od lat chwalą się tym, ile różnych modeli potrafią załadować. Inco AI, firma znana dotąd z przyspieszania modeli w centrach danych, opisała 17 września na swoim blogu silnik Splash, który idzie w przeciwną stronę. Obsługuje dokładnie dwa modele, Qwen3.8-27B i Qwen3.6-35B-A3B, i nie ma pliku konfiguracyjnego. Według pomiarów samego Inco Splash generuje 74 tokeny na sekundę, mniej więcej dwa razy więcej niż następny w kolejce silnik na tym samym komputerze (Inco AI).
Moim zdaniem te 74 tokeny na sekundę to najmniej ciekawa liczba w tej historii. Mierzą krótką rozmowę, a lokalne modele coraz częściej obsługują agentów programistycznych, którzy pracują z modelem godzinami. Ważniejsze jest więc to, co dzieje się po półgodzinie pracy takiego agenta, i to, że specjalizacja w ogóle zaczęła się komuś opłacać.
Co zyskuje silnik, który wie, co uruchamia
Czytaj dalej za darmo
Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.