SmartDigest Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Model / Badania

DiffusionGemma zamiast płatnego API do szybkich decyzji agenta

W zeszłym tygodniu do vLLM trafił tryb, w którym DiffusionGemma, czyli Gemma 4 od Google przerobiona na model dyfuzyjny, nie pisze odpowiedzi, tylko odczytuje ją z pustych pól szablonu i od razu podaje prawdopodobieństwo każdej opcji, zgodnie z API płatnego Jeva. Jedyny niezależny test, opublikowany przez LargitData 20 września, pokazał jednak, że djev-spark zaliczył 32,2% tur wobec 61,4% Jeva, a zwykła Gemma 4 31B osiągnęła 77%. Przy kierowaniu zgłoszeń radzę więc na razie tylko porównywać wyniki, a progi pewności kalibrować na własnych danych.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Model / Badania  ·  4 min  · 

DiffusionGemma zamiast płatnego API do szybkich decyzji agenta
Ilustrację przygotowała AI.

Kiedy agent ma zdecydować, do którego zespołu trafi zgłoszenie albo czy wolno mu sięgnąć do sieci, zwykle prosimy duży model językowy o JSON i liczymy, że nie dopisze do niego akapitu wyjaśnień. Firma TypeSafe AI zbudowała pod takie decyzje osobny model o nazwie Jev, który w ogóle nie pisze tekstu: dostaje stan programu i zamknięte pytanie, a oddaje wybór z listy, ocenę na skali albo prawdopodobieństwo, że odpowiedź brzmi "tak" (LargitData). Jev działa jednak wyłącznie jako płatne API, a jego wagi zostały u producenta. W zeszłym tygodniu ten rodzaj decyzji trafił do vLLM, popularnego silnika do serwowania modeli, w wersji opartej na otwartych wagach DiffusionGemmy od Google, i moim zdaniem to ciekawszy los dla tego modelu niż pisanie długich tekstów.

DiffusionGemma to Gemma 4, otwarty model Google, przerobiona na model dyfuzyjny. W sierpniu pisałem, że Google chwali się przy niej głównie prędkością, bez liczb o jakości. Teraz pojawiły się pierwsze liczby, tylko że dotyczą zupełnie innego zastosowania.

Model nie pisze odpowiedzi, tylko ją odczytuje

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Gemma 4 26B sprawdza się w lokalnych agentach. Google trzyma najszybszą wersję dla siebie. Poradnik / Praktyka

Gemma 4 26B sprawdza się w lokalnych agentach. Google trzyma najszybszą wersję dla siebie.

4 min

Gemma 4 26B-A4B aktywuje tylko 3,8 miliarda parametrów na token, więc generuje z prędkością modelu 4B, a na AIME 2026 wyciąga 88,3%, punkt poniżej dużo cięższego 31B dense. Sześć specjalnych tokenów do narzędzi wbitych prosto w architekturę robi z niej pierwszy otwarty model, z którym lokalny agent realnie wie, kiedy zawołać funkcję. Tyle że głowice Multi-Token Prediction, dające niemal dwukrotne przyspieszenie, Google zostawił sobie w LiteRT. Wagi na Hugging Face są na Apache 2.0, ale najszybsza wersja zostaje w prywatnym stosie.

Google przerabia Gemmę 4 na model dyfuzyjny, a o cenie za jakość milczy Model / Badania

Google przerabia Gemmę 4 na model dyfuzyjny, a o cenie za jakość milczy

3 min

Google DeepMind przerobił Gemmę 4 na model dyfuzyjny o nazwie DiffusionGemma, który zamiast pisać słowo po słowie odsłania średnio 20 tokenów na przejście i osiąga około 1500 tokenów na sekundę na jednej karcie H100, wyprzedzając nawet modele ze spekulatywnym dekodowaniem. Pod spodem siedzi wariant mixture-of-experts z 25,2 miliarda parametrów, z których na token aktywuje się tylko 3,8 miliarda. Kłopot w tym, że raport chwali się wyłącznie prędkością i nie podaje żadnej twardej liczby o jakości, zwłaszcza na kodzie.

Google uczy Gemmę pisać całymi blokami i wyciąga z jednej karty 1500 tokenów na sekundę Model / Badania

Google uczy Gemmę pisać całymi blokami i wyciąga z jednej karty 1500 tokenów na sekundę

4 min

Google DeepMind opisał 31 lipca DiffusionGemmę, eksperymentalny model, który zamiast pisać token po tokenie bierze cały blok 256 tokenów jako szum i w kilku przejściach wygładza go w tekst. Na jednej karcie H100 daje to około 1500 tokenów na sekundę, bo odsłania średnio 20 tokenów na przejście zamiast jednego. To dostrojona Gemma 4 w wariancie mixture-of-experts, przerobiona na model dyfuzyjny za mniej niż 10% pierwotnego budżetu tokenów i wypuszczona z otwartymi wagami. Tyle że raport chwali się prędkością, a nie podaje ani jednej liczby, ile jakości kosztuje szybki tryb dyfuzyjny.