SmartDigest Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Model / Badania

Transformer, który przestaje wyrzucać własne obliczenia

Preprint "Full-bandwidth transformer" z arXiv, zgłoszony 9 sierpnia 2026, proponuje latent feedback: zamiast wyrzucać stan ukryty, który transformer liczy na każdym kroku, wyuczona bramka zawraca go na dół stosu, bez zmiany architektury i niemal bez narzutu. Na modelach o miliardzie parametrów dorównuje zwykłemu transformerowi uczonemu na około 1,5 raza więcej tokenów i daje krótsze ślady rozumowania, czyli mniej tokenów na odpowiedź. To jednak sam abstrakt bez niezależnej weryfikacji na małym modelu, więc nie wiadomo, czy przewaga utrzyma się przy czołowych.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Model / Badania  ·  3 min  · 

Transformer, który przestaje wyrzucać własne obliczenia
Ilustrację przygotowała AI.

Autoregresyjny transformer, czyli ten sam typ modelu, który stoi za dzisiejszymi asystentami do kodu, przy każdym kroku generowania wykonuje mnóstwo pracy, a potem większość jej wyrzuca. Kontekst przechodzi przez kilkadziesiąt warstw, a na samej górze model wypracowuje bogatą reprezentację tego, co właśnie "przemyślał", po czym wybiera z niej jeden token, jedno słowo albo kawałek słowa, i tylko ten token wraca na dół stosu jako wejście do następnego kroku. Cała reszta, ten górny stan ukryty, ląduje w koszu. Świeży preprint z arXiv "Full-bandwidth transformer", zgłoszony 9 sierpnia 2026, proponuje, żeby przestać go marnować.

Pomysł autorzy nazywają latent feedback, sprzężeniem zwrotnym, które zawraca warstwę ukrytą do modelu. Mechanizm jest prosty. Przed kolejnym krokiem dekodowania biorą poprzedni górny stan ukryty i zszywają go z właśnie wybranym tokenem zapisanym w postaci liczb, na których pracuje model. Robi to niewielka wyuczona bramka, która decyduje, ile z każdego sygnału przepuścić dalej. Tak zszyte wejście trafia z powrotem na dół i jeszcze raz przechodzi przez wszystkie warstwy. Model dostaje więc to, co autorzy nazywają odnowionym budżetem głębokości: obliczenia, których nie zdążył zamienić w konkretny token, mogą wrócić do stosu i popracować dłużej, zamiast zniknąć bez śladu.

Dla kogokolwiek, kto myśli o wdrożeniu, ważne jest to, że zmiana nie burzy architektury. Zostaje standardowy transformer, zostaje KV cache, zostaje ten sam cel uczenia języka, a narzut na pojedynczy token przy dekodowaniu autorzy opisują jako pomijalny. Trudniejsze okazało się samo trenowanie. Normalnie model uczy się wszystkich pozycji w tekście naraz, równolegle, bo z góry zna poprawną kontynuację, a sprzężenie zwrotne tę równoległość psuje, bo każdy krok zależy od poprzedniego. Obejściem jest wprowadzenie latent feedback dopiero pod koniec trenowania wstępnego i tylko na niewielkiej części kroków, tych, w których model przepuszcza wejście przez warstwy po raz drugi, żeby całość się nie rozjechała.

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Nanbeige twierdzi, że jego model 3B ogrywa w agentowych testach rywali cztery razy większych Model / Badania

Nanbeige twierdzi, że jego model 3B ogrywa w agentowych testach rywali cztery razy większych

4 min

Nanbeige Lab twierdzi w pracy na arXiv z 24 lipca, że jego Nanbeige4.2-3B z 3 miliardami parametrów bije w zadaniach agentowych trzy i cztery razy większych rywali, Qwen3.5-9B i Gemma4-12B. Sztuczka to Looped Transformer: te same warstwy przepuszczane kilka razy z rzędu dają głębię rozumowania bez wzrostu liczby parametrów, a zysk jest w pamięci, nie w szybkości. Mały w użyciu, ale nie tani w budowie, bo trenowano go od zera na 28 bilionach tokenów. Liczby podaje samo laboratorium, bez konkretnych wartości w abstrakcie, więc do hasła o pobiciu większych dokładam spory znak zapytania.

Po co trzymać dwa modele naraz, skoro jeden potrafi podpowiadać sam sobie? Model / Badania

Po co trzymać dwa modele naraz, skoro jeden potrafi podpowiadać sam sobie?

4 min

NVIDIA pokazała Nemotron-Labs-Diffusion, model, w którym jeden zestaw wag pełni obie role znane z dekodowania spekulacyjnego: sam sobie podpowiada blok tokenów i sam je weryfikuje, dzięki czemu nie trzeba trzymać w pamięci drugiego, pomocniczego modelu. W teście SPEED-Bench przyjmował średnio 6,82 tokenu na krok wobec 2,75 u Eagle3, a wariant 8B dawał czterokrotnie wyższą przepustowość niż Qwen3-8B przy niemal niezmienionej jakości, 62,81% wobec 63,61%. To na razie preprint samej NVIDIA, bez recenzji, ale wagi w wersjach 3B, 8B i 14B leżą już na Hugging Face na licencji komercyjnej.

Model, którego nikt nie nauczył oszczędzać własnego myślenia Model / Badania

Model, którego nikt nie nauczył oszczędzać własnego myślenia

4 min

Ring-Zero, praca zespołu InclusionAI z chińskiego Ant Group z 14 lipca, to pierwszy udokumentowany przypadek dociągnięcia trenowania zero RL, które pomija etap uczenia na ludzkich przykładach, aż do biliona parametrów bez rozsypania procesu. Model wykształcił przy tym pięć zachowań, których nikt nie zaprogramował i które ujawniają się dopiero w tej skali, w tym "context anxiety": sam zerka na resztki okna kontekstowego i skraca własne rozumowanie. Ring-2.5-1T-Zero notuje 84,2% na AIME 2026, ale wszystkie wyniki pochodzą od samego twórcy i nikt niezależny ich nie potwierdził.