SmartDigest.ai Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Model / Badania

NVIDIA rozbija model na dwie części, żeby pisał tekst 2,42 raza szybciej

NVIDIA pokazała Nemotron-Labs-TwoTower, model, który generuje tekst całymi blokami po 16 słów naraz zamiast token po tokenie, dzięki czemu pisze 2,42 raza szybciej przy zachowaniu 98,7% jakości modelu bazowego. Sztuczka polega na rozbiciu sieci na dwie wieże: zamrożoną kontekstową i odszumiającą, która równolegle wypełnia puste miejsca. Płaci się za to drugą kartą GPU i spadkiem jakości tam, gdzie liczy się precyzja, bo na HumanEval wynik spada z 79,27 do 75,58. Prawdziwa wartość to nie sam model, ale recepta na przyspieszenie gotowych modeli autoregresyjnych bez trenowania od zera.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Model / Badania  ·  4 min  · 

NVIDIA rozbija model na dwie części, żeby pisał tekst 2,42 raza szybciej
Ilustrację przygotowała AI.

Każdy model językowy, którego dziś używasz, pisze tekst tak samo: token po tokenie, jeden po drugim, zawsze w jedną stronę. Model przewiduje kolejne słowo, dokleja je do zdania, patrzy na całość jeszcze raz i przewiduje następne. Nazywa się to generowaniem autoregresyjnym i ma jedną wbudowaną granicę: skoro każdy token zależy od poprzedniego, nie sposób policzyć ich naraz. Dłuższa odpowiedź to po prostu dłuższe czekanie.

NVIDIA pokazała właśnie model, który tę zasadę obchodzi. Nemotron-Labs-TwoTower generuje tekst całymi blokami naraz: zamiast dokładać po jednym słowie, wypełnia równolegle 16 pustych miejsc i dopiero potem je dopracowuje. Reszta jego nazwy, 30B-A3B-Base-BF16, to specyfikacja: 30 miliardów parametrów, z których przy każdym słowie pracuje tylko około 3 miliardów, w wersji bazowej i w 16-bitowej precyzji bf16. Firma podaje, że przy zachowaniu 98,7% jakości modelu bazowego pisze 2,42 raza szybciej. Brzmi jak coś za darmo. Za darmo nie jest i zaraz pokażę, gdzie leży koszt, ale sam mechanizm jest ciekawszy niż ta jedna liczba.

Dwie wieże zamiast jednej

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Po co trzymać dwa modele naraz, skoro jeden potrafi podpowiadać sam sobie? Model / Badania

Po co trzymać dwa modele naraz, skoro jeden potrafi podpowiadać sam sobie?

4 min

NVIDIA pokazała Nemotron-Labs-Diffusion, model, w którym jeden zestaw wag pełni obie role znane z dekodowania spekulacyjnego: sam sobie podpowiada blok tokenów i sam je weryfikuje, dzięki czemu nie trzeba trzymać w pamięci drugiego, pomocniczego modelu. W teście SPEED-Bench przyjmował średnio 6,82 tokenu na krok wobec 2,75 u Eagle3, a wariant 8B dawał czterokrotnie wyższą przepustowość niż Qwen3-8B przy niemal niezmienionej jakości, 62,81% wobec 63,61%. To na razie preprint samej NVIDIA, bez recenzji, ale wagi w wersjach 3B, 8B i 14B leżą już na Hugging Face na licencji komercyjnej.

Co naprawdę poprawia rozumowanie modelu, gdy nie możesz sięgnąć po większy? Poradnik / Praktyka

Co naprawdę poprawia rozumowanie modelu, gdy nie możesz sięgnąć po większy?

3 min

NVIDIA rozegrała na Kaggle konkurs, w którym ponad 5000 uczestników dostało ten sam model Nemotron-3-Nano-30B, mogło doszkalać tylko adapter LoRA i musiało zmieścić rozumowanie w sztywnym budżecie tokenów bez internetu. Z pięciu wniosków wraca jeden: model uczy się tak dobrze, jak dobrze da się sprawdzić każdy krok jego rozumowania, bo prawidłowa odpowiedź potrafi ukrywać zepsutą drogę, a jedna uśredniona liczba zamiata pod dywan słabości w konkretnych zadaniach. To podsumowanie NVIDIA, promujące jej model i karty Blackwell, ale kto dostraja własny model, dostaje gotową listę do sprawdzenia.

NVIDIA wypuściła model, który sam przyznaje, że nie poprowadzi twojego agenta Model / Badania

NVIDIA wypuściła model, który sam przyznaje, że nie poprowadzi twojego agenta

4 min

NVIDIA wypuściła 11 sierpnia Nemotron 3.5 Lightning, otwarty model MoE o 30 miliardach parametrów, z których przy każdym tokenie pracują tylko 3 miliardy, co daje do czterech razy szybsze generowanie tokenów. Świetnie radzi sobie z wąskimi zadaniami (85 punktów na PinchBench), ale w pracy agenta się rozsypuje: na Terminal-Bench 2.1 dostaje 24,58, podczas gdy Meta Muse Glimmer robi 51,7. Dlatego NVIDIA sprzedaje go nie jako agenta, lecz taniego wykonawcę, a z biblioteką NeMo Switchyard, kierującą kroki agenta do najlepszego modelu, LangChain zbił koszt o 74%.