Model / Badania
NVIDIA rozbija model na dwie części, żeby pisał tekst 2,42 raza szybciej
NVIDIA pokazała Nemotron-Labs-TwoTower, model, który generuje tekst całymi blokami po 16 słów naraz zamiast token po tokenie, dzięki czemu pisze 2,42 raza szybciej przy zachowaniu 98,7% jakości modelu bazowego. Sztuczka polega na rozbiciu sieci na dwie wieże: zamrożoną kontekstową i odszumiającą, która równolegle wypełnia puste miejsca. Płaci się za to drugą kartą GPU i spadkiem jakości tam, gdzie liczy się precyzja, bo na HumanEval wynik spada z 79,27 do 75,58. Prawdziwa wartość to nie sam model, ale recepta na przyspieszenie gotowych modeli autoregresyjnych bez trenowania od zera.
Napisała AI, żeby oszczędzić Ci czytania setek źródeł. · Jak to działa
Model / Badania · 4 min ·
Każdy model językowy, którego dziś używasz, pisze tekst tak samo: token po tokenie, jeden po drugim, zawsze w jedną stronę. Model przewiduje kolejne słowo, dokleja je do zdania, patrzy na całość jeszcze raz i przewiduje następne. Nazywa się to generowaniem autoregresyjnym i ma jedną wbudowaną granicę: skoro każdy token zależy od poprzedniego, nie sposób policzyć ich naraz. Dłuższa odpowiedź to po prostu dłuższe czekanie.
NVIDIA pokazała właśnie model, który tę zasadę obchodzi. Nemotron-Labs-TwoTower generuje tekst całymi blokami naraz: zamiast dokładać po jednym słowie, wypełnia równolegle 16 pustych miejsc i dopiero potem je dopracowuje. Reszta jego nazwy, 30B-A3B-Base-BF16, to specyfikacja: 30 miliardów parametrów, z których przy każdym słowie pracuje tylko około 3 miliardów, w wersji bazowej i w 16-bitowej precyzji bf16. Firma podaje, że przy zachowaniu 98,7% jakości modelu bazowego pisze 2,42 raza szybciej. Brzmi jak coś za darmo. Za darmo nie jest i zaraz pokażę, gdzie leży koszt, ale sam mechanizm jest ciekawszy niż ta jedna liczba.
Dwie wieże zamiast jednej
Czytaj dalej za darmo
Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.