Model / Badania
Google przerabia Gemmę 4 na model dyfuzyjny, a o cenie za jakość milczy
Google DeepMind przerobił Gemmę 4 na model dyfuzyjny o nazwie DiffusionGemma, który zamiast pisać słowo po słowie odsłania średnio 20 tokenów na przejście i osiąga około 1500 tokenów na sekundę na jednej karcie H100, wyprzedzając nawet modele ze spekulatywnym dekodowaniem. Pod spodem siedzi wariant mixture-of-experts z 25,2 miliarda parametrów, z których na token aktywuje się tylko 3,8 miliarda. Kłopot w tym, że raport chwali się wyłącznie prędkością i nie podaje żadnej twardej liczby o jakości, zwłaszcza na kodzie.
Napisała AI, żeby oszczędzić Ci czytania setek źródeł. · Jak to działa
Model / Badania · 3 min ·
Google DeepMind wziął Gemmę 4 i przerobił ją tak, żeby przestała pisać tekst słowo po słowie. Efekt nazywa się DiffusionGemma i na jednej karcie H100 wypluwa około 1500 tokenów na sekundę, czyli znacznie więcej, niż daje klasyczny model nawet z najlepszymi sztuczkami przyspieszającymi. Tyle że to model oznaczony jako eksperymentalny, a raport techniczny chwali się przede wszystkim prędkością. Dla kogoś, kto myśli o wpięciu tego w realną pracę, pytanie brzmi, co ta prędkość robi z jakością.
Zwykły duży model językowy generuje jeden token na raz: dokłada słowo, patrzy na to, co już napisał, dokłada kolejne i tak w kółko. Ta sekwencyjność jest wąskim gardłem, bo każdy token wymaga osobnego przejścia przez sieć. DiffusionGemma działa inaczej. Bierze cały blok 256 tokenów naraz jako szum i w kilku przejściach stopniowo go doprecyzowuje, mniej więcej tak, jak model do obrazów zaczyna od ziarna i odszumia je do zdjęcia. Dzięki temu odsłania średnio 20 tokenów na jedno przejście zamiast jednego i stąd bierze się cała przewaga w prędkości.
Ten wynik nie jest przy tym ustawiony pod słabego przeciwnika. Autorzy porównują się z modelami autoregresyjnymi wspartymi spekulatywnym dekodowaniem, techniką, w której mniejszy model zgaduje kilka tokenów do przodu, a duży tylko je zatwierdza. To dziś najszybszy znany sposób na przyspieszenie zwykłego modelu, a DiffusionGemma ma być od niego i tak wyraźnie szybsza. W praktyce 1500 tokenów na sekundę oznacza, że dłuższa odpowiedź pojawia się właściwie od razu, zamiast doczłapywać do końca na oczach użytkownika.
Czytaj dalej za darmo
Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.