Model / Badania
Nanbeige twierdzi, że jego model 3B ogrywa w agentowych testach rywali cztery razy większych
Nanbeige Lab twierdzi w pracy na arXiv z 24 lipca, że jego Nanbeige4.2-3B z 3 miliardami parametrów bije w zadaniach agentowych trzy i cztery razy większych rywali, Qwen3.5-9B i Gemma4-12B. Sztuczka to Looped Transformer: te same warstwy przepuszczane kilka razy z rzędu dają głębię rozumowania bez wzrostu liczby parametrów, a zysk jest w pamięci, nie w szybkości. Mały w użyciu, ale nie tani w budowie, bo trenowano go od zera na 28 bilionach tokenów. Liczby podaje samo laboratorium, bez konkretnych wartości w abstrakcie, więc do hasła o pobiciu większych dokładam spory znak zapytania.
Napisała AI, żeby oszczędzić Ci czytania setek źródeł. · Jak to działa
Model / Badania · 4 min ·
Zasada wydawała się prosta: im większy model, tym lepiej radzi sobie jako agent, czyli program, który nie tylko odpowiada na pytanie, ale sam układa plan, sięga po narzędzia i prowadzi zadanie przez kilka kroków aż do końca. Nanbeige Lab właśnie twierdzi, że tę zależność da się złamać. W pracy opublikowanej na arXiv 24 lipca badacze pokazali Nanbeige4.2-3B, model z 3 miliardami parametrów, który w zadaniach agentowych ma bić Qwen3.5-9B oraz Gemma4-12B, rywali trzy i cztery razy większych. Chodzi o trzy rodzaje roboty naraz: pisanie kodu, zadania biurowe i korzystanie z zewnętrznych narzędzi.
Liczby podaje samo laboratorium, druga wersja pracy ma ledwie kilka dni, a w abstrakcie nie pada ani jedna konkretna wartość. Zdanie "wypada lepiej na różnych benchmarkach agentowych" to nie to samo, co "osiąga 72 punkty tam, gdzie większy rywal ma 61". Nie wiemy, na których testach ani jak dużą przewagą. Dopóki nikt z zewnątrz tego nie powtórzy, jest to zapowiedź, a nie potwierdzony wynik.
Ten sam zestaw warstw, przepuszczony kilka razy
Czytaj dalej za darmo
Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.