SmartDigest.ai Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Model / Badania

NVIDIA wypuściła model, który sam przyznaje, że nie poprowadzi twojego agenta

NVIDIA wypuściła 11 sierpnia Nemotron 3.5 Lightning, otwarty model MoE o 30 miliardach parametrów, z których przy każdym tokenie pracują tylko 3 miliardy, co daje do czterech razy szybsze generowanie tokenów. Świetnie radzi sobie z wąskimi zadaniami (85 punktów na PinchBench), ale w pracy agenta się rozsypuje: na Terminal-Bench 2.1 dostaje 24,58, podczas gdy Meta Muse Glimmer robi 51,7. Dlatego NVIDIA sprzedaje go nie jako agenta, lecz taniego wykonawcę, a z biblioteką NeMo Switchyard, kierującą kroki agenta do najlepszego modelu, LangChain zbił koszt o 74%.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Model / Badania  ·  4 min  · 

NVIDIA wypuściła model, który sam przyznaje, że nie poprowadzi twojego agenta
Ilustrację przygotowała AI.

Nowy model NVIDIA nie udaje, że jest mądry, i to jest w nim najciekawsze. 11 sierpnia firma wypuściła Nemotron 3.5 Lightning, otwarty model o 30 miliardach parametrów, z których przy każdym tokenie pracują tylko 3 miliardy. To konstrukcja mixture-of-experts, w skrócie MoE: przy każdym słowie wewnętrzny router modelu wybiera garstkę spośród wielu wyspecjalizowanych podsieci, więc za cały model płacisz pamięcią, a mocą obliczeniową tylko za jego drobny wycinek. Stąd bierze się prędkość. NVIDIA obiecuje do czterech razy szybsze generowanie tokenów niż w innych modelach tej wielkości, a całość mieści się na jednej karcie H100 albo na desktopowym DGX Spark.

Wystarczy jednak spojrzeć na tabelę wyników, żeby zobaczyć, do czego ten model się nie nadaje. Na PinchBench, który mierzy krótkie, dobrze określone zadania, Lightning osiąga 85 punktów. Na Terminal-Bench 2.1, gdzie agent musi samodzielnie prowadzić długą pracę w terminalu, spada do 24,58. Dzień wcześniej Meta pokazała Muse Glimmer, model tej samej wielkości, który na tym samym teście robi 51,7. Ta różnica nie jest przypadkiem. Lightning niezawodnie wykonuje pojedyncze, wąsko zakrojone kroki i rozsypuje się tam, gdzie trzeba samemu doprowadzić długie zadanie do końca. Mówiąc wprost, to nie jest model, któremu oddasz swojego agenta.

Byłoby jednak nieuczciwe nazwać go po prostu głupim. Na testach wiedzy i pojedynczego rozumowania, jak MMLU Pro, Lightning wyciąga wynik, jakiego nikt nie spodziewałby się po zaledwie 3 aktywnych miliardach parametrów. Artificial Analysis stawia go blisko modelu gpt-oss-120b, czterokrotnie większego. On nie jest tępy, tylko wąski: świetnie radzi sobie z zadaniem, które ktoś inny dokładnie mu zdefiniował, i gubi się, kiedy sam ma trzymać wątek przez godziny.

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Po co trzymać dwa modele naraz, skoro jeden potrafi podpowiadać sam sobie? Model / Badania

Po co trzymać dwa modele naraz, skoro jeden potrafi podpowiadać sam sobie?

4 min

NVIDIA pokazała Nemotron-Labs-Diffusion, model, w którym jeden zestaw wag pełni obie role znane z dekodowania spekulacyjnego: sam sobie podpowiada blok tokenów i sam je weryfikuje, dzięki czemu nie trzeba trzymać w pamięci drugiego, pomocniczego modelu. W teście SPEED-Bench przyjmował średnio 6,82 tokenu na krok wobec 2,75 u Eagle3, a wariant 8B dawał czterokrotnie wyższą przepustowość niż Qwen3-8B przy niemal niezmienionej jakości, 62,81% wobec 63,61%. To na razie preprint samej NVIDIA, bez recenzji, ale wagi w wersjach 3B, 8B i 14B leżą już na Hugging Face na licencji komercyjnej.

Meta oddaje 30-miliardowego agenta za darmo, jeśli masz na czym go uruchomić Model / Badania

Meta oddaje 30-miliardowego agenta za darmo, jeśli masz na czym go uruchomić

5 min

Meta wypuściła 10 sierpnia Muse Glimmer, agentowy model o 30 miliardach parametrów, i oddała jego wagi za darmo na licencji Apache 2.0, dzięki czemu autonomiczny agent może planować zadania, wywoływać narzędzia i pisać kod lokalnie, bez opłat za API. Darmowy jest jednak tylko model, bo po kwantyzacji do 4 bitów potrzebuje maszyny z 24 do 32 GB pamięci, na przykład RTX 4090 albo MacBooka Pro z M4 Max. Na testach agentowych prowadzi, 51,2 na SWE-Bench Pro wobec 36,9 Gemmy i 50,2 Qwena, ale w terminalu przegrywa z Qwenem, a wszystkie liczby pochodzą od samej Mety.

Co naprawdę dostaje deweloper od NVIDIA Agent Toolkit, gdy odłożyć marketing zaufania na bok Premiera / Narzędzie

Co naprawdę dostaje deweloper od NVIDIA Agent Toolkit, gdy odłożyć marketing zaufania na bok

4 min

NVIDIA ogłosiła 23 czerwca Agent Toolkit, ale jedyną rzeczą, którą deweloper może dziś naprawdę dotknąć, jest instrukcja postawienia agenta badawczego AI-Q 2.0 na Oracle Cloud Infrastructure. Dostajesz trzy warstwy w jednym pudełku: modele Nemotron jako rozumowanie, gotowe reguły bezpieczeństwa i piaskownicę odcinającą kod agenta od reszty. Terraform stawia infrastrukturę, Helm wgrywa backend, interfejs i bazę, a całość rusza w jakieś pół godziny. Cena za wygodę to przywiązanie do chmury, modeli i klucza NVIDIA, a reszta komunikatów to na razie deklaracje producenta, nie zweryfikowane wyniki.