SmartDigest Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Model / Badania

Google uczy Gemmę pisać całymi blokami i wyciąga z jednej karty 1500 tokenów na sekundę

Google DeepMind opisał 31 lipca DiffusionGemmę, eksperymentalny model, który zamiast pisać token po tokenie bierze cały blok 256 tokenów jako szum i w kilku przejściach wygładza go w tekst. Na jednej karcie H100 daje to około 1500 tokenów na sekundę, bo odsłania średnio 20 tokenów na przejście zamiast jednego. To dostrojona Gemma 4 w wariancie mixture-of-experts, przerobiona na model dyfuzyjny za mniej niż 10% pierwotnego budżetu tokenów i wypuszczona z otwartymi wagami. Tyle że raport chwali się prędkością, a nie podaje ani jednej liczby, ile jakości kosztuje szybki tryb dyfuzyjny.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Model / Badania  ·  4 min  · 

Google uczy Gemmę pisać całymi blokami i wyciąga z jednej karty 1500 tokenów na sekundę
Ilustrację przygotowała AI.

Autoregresyjny model językowy pisze zdanie po kolei, token po tokenie, i każdy następny stawia dopiero wtedy, gdy poprzedni jest już gotowy. Tego porządku nie da się obejść zrównolegleniem, bo setnego tokenu nie policzysz, zanim nie znasz dziewięćdziesiątego dziewiątego. DiffusionGemma, eksperymentalny model opisany 31 lipca w raporcie zespołu Google DeepMind na arXiv, łamie tę zasadę. Zamiast dokładać po jednym słowie, bierze cały blok 256 tokenów naraz jako losowy szum i w kilku przejściach wygładza go w gotowy tekst. To ta sama sztuczka, która stoi za generatorami obrazów: zaczynasz od szumu i krok po kroku go odszumiasz, tyle że na wyjściu jest zdanie, a nie zdjęcie.

Nagrodą jest prędkość, której autoregresja nie dogoni. Model odsłania średnio około 20 tokenów na jedno przejście przez sieć, podczas gdy klasyczny wypluwa dokładnie jeden, więc tych kosztownych przejść potrzeba dwudziestokrotnie mniej. Na pojedynczej karcie H100 przekłada się to na mniej więcej 1500 tokenów wygenerowanych w sekundę. Google zapewnia, że to szybciej niż model autoregresyjny nawet ze speculative decoding, najlepszą dziś sztuczką na przyspieszanie generacji, w której mniejszy model zgaduje kilka tokenów do przodu, a duży tylko sprawdza jego propozycje. Jeśli ta liczba obroni się w niezależnych testach, będzie to pierwszy raz, gdy dyfuzja realnie bije autoregresję na jej własnym boisku, a nie tylko na papierze.

Dla kogoś, kto pisze kod z pomocą modelu, prędkość generacji to nie kosmetyka. Agent, który sam planuje i wykonuje zadanie, odpytuje model dziesiątki razy w jednej pętli, a każda sekunda oczekiwania mnoży się przez liczbę kroków. Podpowiedzi w edytorze muszą zdążyć, zanim zdejmiesz palce z klawiatury, bo inaczej i tak dopiszesz linijkę sam. Tańsza i szybsza generacja przesuwa granicę tego, co opłaca się odpalać lokalnie albo puszczać w tle bez patrzenia na rachunek za tokeny. Dlatego wynik, który realnie obniża koszt generowania tokenu przy znośnej jakości, waży więcej niż kolejny punkt na benchmarku rozumowania.

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Google przerabia Gemmę 4 na model dyfuzyjny, a o cenie za jakość milczy Model / Badania

Google przerabia Gemmę 4 na model dyfuzyjny, a o cenie za jakość milczy

3 min

Google DeepMind przerobił Gemmę 4 na model dyfuzyjny o nazwie DiffusionGemma, który zamiast pisać słowo po słowie odsłania średnio 20 tokenów na przejście i osiąga około 1500 tokenów na sekundę na jednej karcie H100, wyprzedzając nawet modele ze spekulatywnym dekodowaniem. Pod spodem siedzi wariant mixture-of-experts z 25,2 miliarda parametrów, z których na token aktywuje się tylko 3,8 miliarda. Kłopot w tym, że raport chwali się wyłącznie prędkością i nie podaje żadnej twardej liczby o jakości, zwłaszcza na kodzie.

Gemma 4 26B sprawdza się w lokalnych agentach. Google trzyma najszybszą wersję dla siebie. Poradnik / Praktyka

Gemma 4 26B sprawdza się w lokalnych agentach. Google trzyma najszybszą wersję dla siebie.

4 min

Gemma 4 26B-A4B aktywuje tylko 3,8 miliarda parametrów na token, więc generuje z prędkością modelu 4B, a na AIME 2026 wyciąga 88,3%, punkt poniżej dużo cięższego 31B dense. Sześć specjalnych tokenów do narzędzi wbitych prosto w architekturę robi z niej pierwszy otwarty model, z którym lokalny agent realnie wie, kiedy zawołać funkcję. Tyle że głowice Multi-Token Prediction, dające niemal dwukrotne przyspieszenie, Google zostawił sobie w LiteRT. Wagi na Hugging Face są na Apache 2.0, ale najszybsza wersja zostaje w prywatnym stosie.

Kolejny model roboczy Google w miejscu obiecanego flagowca Model / Badania

Kolejny model roboczy Google w miejscu obiecanego flagowca

3 min

Google wypuścił Gemini 3.7 Flash zaledwie trzy tygodnie po wersji 3.6, znów model roboczy w miejscu obiecywanego flagowego Pro. Skok w benchmarkach jest realny, ale niewielki: na DeepSWE v1.1 wynik rośnie z 49,0% do 65,3%, a w rozumieniu dokumentów model bije Claude Sonnet 5 i GPT-5.6. Prawdziwa zmiana jest w cenie, 0,75 dolara za milion tokenów wejściowych, tyle że OpenAI zbiło stawkę swojej Luny do 0,20 dolara. Ryan Whitwam z Ars Technica pyta wprost, czy to szybszy rozwój, czy tylko szybsze wypuszczanie.