SmartDigest Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Model / Badania

Google przerabia Gemmę 4 na model dyfuzyjny, a o cenie za jakość milczy

Google DeepMind przerobił Gemmę 4 na model dyfuzyjny o nazwie DiffusionGemma, który zamiast pisać słowo po słowie odsłania średnio 20 tokenów na przejście i osiąga około 1500 tokenów na sekundę na jednej karcie H100, wyprzedzając nawet modele ze spekulatywnym dekodowaniem. Pod spodem siedzi wariant mixture-of-experts z 25,2 miliarda parametrów, z których na token aktywuje się tylko 3,8 miliarda. Kłopot w tym, że raport chwali się wyłącznie prędkością i nie podaje żadnej twardej liczby o jakości, zwłaszcza na kodzie.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Model / Badania  ·  3 min  · 

Google przerabia Gemmę 4 na model dyfuzyjny, a o cenie za jakość milczy
Ilustrację przygotowała AI.

Google DeepMind wziął Gemmę 4 i przerobił ją tak, żeby przestała pisać tekst słowo po słowie. Efekt nazywa się DiffusionGemma i na jednej karcie H100 wypluwa około 1500 tokenów na sekundę, czyli znacznie więcej, niż daje klasyczny model nawet z najlepszymi sztuczkami przyspieszającymi. Tyle że to model oznaczony jako eksperymentalny, a raport techniczny chwali się przede wszystkim prędkością. Dla kogoś, kto myśli o wpięciu tego w realną pracę, pytanie brzmi, co ta prędkość robi z jakością.

Zwykły duży model językowy generuje jeden token na raz: dokłada słowo, patrzy na to, co już napisał, dokłada kolejne i tak w kółko. Ta sekwencyjność jest wąskim gardłem, bo każdy token wymaga osobnego przejścia przez sieć. DiffusionGemma działa inaczej. Bierze cały blok 256 tokenów naraz jako szum i w kilku przejściach stopniowo go doprecyzowuje, mniej więcej tak, jak model do obrazów zaczyna od ziarna i odszumia je do zdjęcia. Dzięki temu odsłania średnio 20 tokenów na jedno przejście zamiast jednego i stąd bierze się cała przewaga w prędkości.

Ten wynik nie jest przy tym ustawiony pod słabego przeciwnika. Autorzy porównują się z modelami autoregresyjnymi wspartymi spekulatywnym dekodowaniem, techniką, w której mniejszy model zgaduje kilka tokenów do przodu, a duży tylko je zatwierdza. To dziś najszybszy znany sposób na przyspieszenie zwykłego modelu, a DiffusionGemma ma być od niego i tak wyraźnie szybsza. W praktyce 1500 tokenów na sekundę oznacza, że dłuższa odpowiedź pojawia się właściwie od razu, zamiast doczłapywać do końca na oczach użytkownika.

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Google uczy Gemmę pisać całymi blokami i wyciąga z jednej karty 1500 tokenów na sekundę Model / Badania

Google uczy Gemmę pisać całymi blokami i wyciąga z jednej karty 1500 tokenów na sekundę

4 min

Google DeepMind opisał 31 lipca DiffusionGemmę, eksperymentalny model, który zamiast pisać token po tokenie bierze cały blok 256 tokenów jako szum i w kilku przejściach wygładza go w tekst. Na jednej karcie H100 daje to około 1500 tokenów na sekundę, bo odsłania średnio 20 tokenów na przejście zamiast jednego. To dostrojona Gemma 4 w wariancie mixture-of-experts, przerobiona na model dyfuzyjny za mniej niż 10% pierwotnego budżetu tokenów i wypuszczona z otwartymi wagami. Tyle że raport chwali się prędkością, a nie podaje ani jednej liczby, ile jakości kosztuje szybki tryb dyfuzyjny.

Gemma 4 26B sprawdza się w lokalnych agentach. Google trzyma najszybszą wersję dla siebie. Poradnik / Praktyka

Gemma 4 26B sprawdza się w lokalnych agentach. Google trzyma najszybszą wersję dla siebie.

4 min

Gemma 4 26B-A4B aktywuje tylko 3,8 miliarda parametrów na token, więc generuje z prędkością modelu 4B, a na AIME 2026 wyciąga 88,3%, punkt poniżej dużo cięższego 31B dense. Sześć specjalnych tokenów do narzędzi wbitych prosto w architekturę robi z niej pierwszy otwarty model, z którym lokalny agent realnie wie, kiedy zawołać funkcję. Tyle że głowice Multi-Token Prediction, dające niemal dwukrotne przyspieszenie, Google zostawił sobie w LiteRT. Wagi na Hugging Face są na Apache 2.0, ale najszybsza wersja zostaje w prywatnym stosie.

Gemma 4 obiecuje rozumowanie w małym modelu z otwartymi wagami. Wag i liczb wciąż brak. Model / Badania

Gemma 4 obiecuje rozumowanie w małym modelu z otwartymi wagami. Wag i liczb wciąż brak.

3 min

2 lipca Google wrzucił na arXiv 17-stronicowy raport zapowiadający Gemmę 4, nową rodzinę modeli z otwartymi wagami od 2,3 do 31 miliardów parametrów, w wariancie gęstym i Mixture-of-Experts. Ciekawie brzmi tryb myślenia w małym modelu, który postawisz u siebie, ale streszczenie nie podaje ani jednej liczby z benchmarku i ani słowem nie wspomina o kodowaniu, więc SWE-bench czy HumanEval tu nie znajdziesz. Wag do pobrania ani API na razie brak, więc to zapowiedź, a nie model, którego odpalisz w edytorze.