SmartDigest Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Model / Badania

Jedenaście plików GGUF i ani jednego pomiaru

Empero wrzucił na Hugging Face destylat Qwen3.8-35B-A3B w wersjach od 12,6 GB po pełne 71 GB, a zalecany czterobitowy plik waży 21,7 GB i mieści się na karcie z 24 GB pamięci albo w 32 GB RAM-u. Przy każdym tokenie pracuje tylko około 3 miliardów z 35 miliardów wag, dzięki czemu odpowiedzi lecą szybciej, niż sugeruje rozmiar, ale cały plik i tak musi wejść do pamięci, bo router sięga w każdej chwili po dowolny z 256 fragmentów. Karta nie podaje ani jednego pomiaru, więc dopóki nie przepuści tego ktoś przez niezależny benchmark, destylacja pozostaje zapowiedzią wydawcy, a nie faktem.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Model / Badania  ·  4 min  · 

Jedenaście plików GGUF i ani jednego pomiaru
Ilustrację przygotowała AI.

Empero wrzucił na Hugging Face dziesięć plików z tym samym modelem w różnych stopniach ściśnięcia, od wersji ważącej 12,6 GB po pełną precyzję zajmującą 71 GB. Wersja, którą autorzy zalecają, ma 21,7 GB i mieści się na karcie graficznej z 24 GB pamięci, czyli na sprzęcie, który stoi pod biurkiem u całkiem sporej grupy piszących kod. O samym Empero, poza jego własną stroną, nie znalazłem prawie niczego.

Nazwa Qwen3.8-35B-A3B-Distill-GGUF streszcza całą historię. Qwen3.8 to najnowsza seria dużych modeli Alibaby, tych, które chodzą w serwerowni. Empero nauczył mniejszą architekturę Qwen3.6-35B-A3B odpowiadać tak jak one, co nazywa się destylacją, a potem obciął precyzję wag i zapisał wynik w formacie GGUF. Dzięki temu plik chudnie kilkukrotnie, a model przestaje potrzebować serwerowni. GGUF otwiera llama.cpp, a za nim Ollama, LM Studio i Jan, więc żeby to uruchomić, nie trzeba pisać ani linijki kodu: ściągasz plik, wskazujesz go programowi i rozmawiasz.

Trzy miliardy wag pracują, a do pamięci trzeba wpuścić wszystkie 35 miliardów

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Qwen3.8 27B mieści się w 17 GB i nie traci na jakości Model / Badania

Qwen3.8 27B mieści się w 17 GB i nie traci na jakości

5 min

Quesma wydała około 3000 dolarów na wynajem kart, żeby zmierzyć, ile pamięci naprawdę potrzebuje Qwen3.8 27B: pełny model w BF16 waży 55 GB, a skompresowany do czterech bitów schodzi do 17 GB i powtarza wynik oryginału na Terminal-Bench 2.1, więc mieści się na RTX 4090 razem z 64 tysiącami tokenów kontekstu. Klif zaczyna się dopiero przy jednym bicie, ale większym problemem jest domyślne ustawienie reasoning_effort na xhigh, przez które Simon Willison czekał 21 minut na prosty rysunek w SVG, a lekarstwem jest jedna linijka z poziomem low.

Alibaba pokazała szkielet Qwen4, ale wyniki policzyła sobie sama Model / Badania

Alibaba pokazała szkielet Qwen4, ale wyniki policzyła sobie sama

4 min

Alibaba wypuściła na Hugging Face Qwen3.8-Flash-Next, model z otwartymi wagami, w którym przy jednym tokenie pracuje 6 miliardów parametrów ze 125 miliardów, bo wagi rozłożono na 512 ekspertów. Na SWE-bench Pro dostaje 62,5 punktu i wygrywa o 0,8 punktu z gęstym Qwen3.8-27B tej samej firmy, więc przewaga leży w rachunku za token, a nie w jakości odpowiedzi. Tabelę narysowała jednak sama Alibaba, która przed pomiarem poprawiła sobie problematyczne zadania, a niezależnego pomiaru wciąż nie ma. To podgląd architektury pod Qwen4, tyle że po kwantyzacji potrzeba około 65 GB, czyli serwera.

Qwen3.6-27B osiąga to, na co poprzednia generacja potrzebowała 397 miliardów parametrów Model / Badania

Qwen3.6-27B osiąga to, na co poprzednia generacja potrzebowała 397 miliardów parametrów

3 min

Alibaba wypuściła 23 kwietnia Qwen3.6-27B: gęsty model open-source, który na SWE-Bench Verified osiąga 77,2%, ustępując tylko Claude 4.5 Opus (80,9%), a na Terminal-Bench 2.0 remisuje z nim na 59,3%. Przy 15 razy mniejszej liczbie wag niż poprzedni flagowiec Alibaby mieści się w FP8 na karcie z 32 GB, a w kwantyzacji 4-bitowej schodzi na sprzęt konsumencki. Architektura z proporcją 3:1 na korzyść uwagi liniowej daje natywne okno 262 144 tokenów, a opcja preserve_thinking pozwala agentowi nieść ślad rozumowania przez kolejne tury.