SmartDigest Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Model / Badania

Nanbeige twierdzi, że jego model 3B ogrywa w agentowych testach rywali cztery razy większych

Nanbeige Lab twierdzi w pracy na arXiv z 24 lipca, że jego Nanbeige4.2-3B z 3 miliardami parametrów bije w zadaniach agentowych trzy i cztery razy większych rywali, Qwen3.5-9B i Gemma4-12B. Sztuczka to Looped Transformer: te same warstwy przepuszczane kilka razy z rzędu dają głębię rozumowania bez wzrostu liczby parametrów, a zysk jest w pamięci, nie w szybkości. Mały w użyciu, ale nie tani w budowie, bo trenowano go od zera na 28 bilionach tokenów. Liczby podaje samo laboratorium, bez konkretnych wartości w abstrakcie, więc do hasła o pobiciu większych dokładam spory znak zapytania.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Model / Badania  ·  4 min  · 

Nanbeige twierdzi, że jego model 3B ogrywa w agentowych testach rywali cztery razy większych
Ilustrację przygotowała AI.

Zasada wydawała się prosta: im większy model, tym lepiej radzi sobie jako agent, czyli program, który nie tylko odpowiada na pytanie, ale sam układa plan, sięga po narzędzia i prowadzi zadanie przez kilka kroków aż do końca. Nanbeige Lab właśnie twierdzi, że tę zależność da się złamać. W pracy opublikowanej na arXiv 24 lipca badacze pokazali Nanbeige4.2-3B, model z 3 miliardami parametrów, który w zadaniach agentowych ma bić Qwen3.5-9B oraz Gemma4-12B, rywali trzy i cztery razy większych. Chodzi o trzy rodzaje roboty naraz: pisanie kodu, zadania biurowe i korzystanie z zewnętrznych narzędzi.

Liczby podaje samo laboratorium, druga wersja pracy ma ledwie kilka dni, a w abstrakcie nie pada ani jedna konkretna wartość. Zdanie "wypada lepiej na różnych benchmarkach agentowych" to nie to samo, co "osiąga 72 punkty tam, gdzie większy rywal ma 61". Nie wiemy, na których testach ani jak dużą przewagą. Dopóki nikt z zewnątrz tego nie powtórzy, jest to zapowiedź, a nie potwierdzony wynik.

Ten sam zestaw warstw, przepuszczony kilka razy

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Po co trzymać dwa modele naraz, skoro jeden potrafi podpowiadać sam sobie? Model / Badania

Po co trzymać dwa modele naraz, skoro jeden potrafi podpowiadać sam sobie?

4 min

NVIDIA pokazała Nemotron-Labs-Diffusion, model, w którym jeden zestaw wag pełni obie role znane z dekodowania spekulacyjnego: sam sobie podpowiada blok tokenów i sam je weryfikuje, dzięki czemu nie trzeba trzymać w pamięci drugiego, pomocniczego modelu. W teście SPEED-Bench przyjmował średnio 6,82 tokenu na krok wobec 2,75 u Eagle3, a wariant 8B dawał czterokrotnie wyższą przepustowość niż Qwen3-8B przy niemal niezmienionej jakości, 62,81% wobec 63,61%. To na razie preprint samej NVIDIA, bez recenzji, ale wagi w wersjach 3B, 8B i 14B leżą już na Hugging Face na licencji komercyjnej.

Rozmiar modelu przestał przewidywać jego prędkość Poradnik / Praktyka

Rozmiar modelu przestał przewidywać jego prędkość

4 min

Model Laguna S 2.1 ma 118 miliardów parametrów, ale generuje tekst szybciej niż czterokrotnie mniejszy Qwen3.6-27B, bo o prędkości decyduje nie całkowity rozmiar, tylko liczba aktywnych parametrów w architekturze MoE. Mori Shige z Classmethod przez pół roku mierzył lokalne modele na DGX Spark i zostały mu z tego dwa odruchy: czytać liczbę aktywnych parametrów zamiast łącznej wagi, a ściągając wersję 4-bitową, sprawdzić dwóch wydawców, bo ta sama kwantyzacja potrafi dać nawet 55% różnicy w prędkości. Dekodowanie spekulatywne podbiło Qwen3.6-35B-A3B o jakieś 40%.

Lokalny agent do kodu, który celowo mniej myśli Model / Badania

Lokalny agent do kodu, który celowo mniej myśli

3 min

Jackrong wypuścił Qwopus-3.6-35B-A3B-Coder, model do kodu oparty na Qwen3.6, w którym rozumowanie jest domyślnie wyłączone. To mieszanka ekspertów z 35 miliardami wag, z których przy każdym tokenie pracuje tylko około 3 miliardów, więc działa lokalnie i zebrał 45 tysięcy pobrań miesięcznie. Autorzy chwalą się wynikiem 62,4% na SWE-bench, ale to przebieg policzony przez sam zespół na 300 zadaniach, bez potwierdzenia. Bez rozumowania model pewniej trzyma się poleceń i stabilniej ciągnie stan przez tury, za to w kompetencji inżynierskiej przegrywa z rywalem tej samej wielkości, 81 do 94.