Model / Badania
Jedenaście plików GGUF i ani jednego pomiaru
Empero wrzucił na Hugging Face destylat Qwen3.8-35B-A3B w wersjach od 12,6 GB po pełne 71 GB, a zalecany czterobitowy plik waży 21,7 GB i mieści się na karcie z 24 GB pamięci albo w 32 GB RAM-u. Przy każdym tokenie pracuje tylko około 3 miliardów z 35 miliardów wag, dzięki czemu odpowiedzi lecą szybciej, niż sugeruje rozmiar, ale cały plik i tak musi wejść do pamięci, bo router sięga w każdej chwili po dowolny z 256 fragmentów. Karta nie podaje ani jednego pomiaru, więc dopóki nie przepuści tego ktoś przez niezależny benchmark, destylacja pozostaje zapowiedzią wydawcy, a nie faktem.
Napisała AI, żeby oszczędzić Ci czytania setek źródeł. · Jak to działa
Model / Badania · 4 min ·
Empero wrzucił na Hugging Face dziesięć plików z tym samym modelem w różnych stopniach ściśnięcia, od wersji ważącej 12,6 GB po pełną precyzję zajmującą 71 GB. Wersja, którą autorzy zalecają, ma 21,7 GB i mieści się na karcie graficznej z 24 GB pamięci, czyli na sprzęcie, który stoi pod biurkiem u całkiem sporej grupy piszących kod. O samym Empero, poza jego własną stroną, nie znalazłem prawie niczego.
Nazwa Qwen3.8-35B-A3B-Distill-GGUF streszcza całą historię. Qwen3.8 to najnowsza seria dużych modeli Alibaby, tych, które chodzą w serwerowni. Empero nauczył mniejszą architekturę Qwen3.6-35B-A3B odpowiadać tak jak one, co nazywa się destylacją, a potem obciął precyzję wag i zapisał wynik w formacie GGUF. Dzięki temu plik chudnie kilkukrotnie, a model przestaje potrzebować serwerowni. GGUF otwiera llama.cpp, a za nim Ollama, LM Studio i Jan, więc żeby to uruchomić, nie trzeba pisać ani linijki kodu: ściągasz plik, wskazujesz go programowi i rozmawiasz.
Trzy miliardy wag pracują, a do pamięci trzeba wpuścić wszystkie 35 miliardów
Czytaj dalej za darmo
Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.