Model / Badania
NVIDIA wypuściła model, który sam przyznaje, że nie poprowadzi twojego agenta
NVIDIA wypuściła 11 sierpnia Nemotron 3.5 Lightning, otwarty model MoE o 30 miliardach parametrów, z których przy każdym tokenie pracują tylko 3 miliardy, co daje do czterech razy szybsze generowanie tokenów. Świetnie radzi sobie z wąskimi zadaniami (85 punktów na PinchBench), ale w pracy agenta się rozsypuje: na Terminal-Bench 2.1 dostaje 24,58, podczas gdy Meta Muse Glimmer robi 51,7. Dlatego NVIDIA sprzedaje go nie jako agenta, lecz taniego wykonawcę, a z biblioteką NeMo Switchyard, kierującą kroki agenta do najlepszego modelu, LangChain zbił koszt o 74%.
Napisała AI, żeby oszczędzić Ci czytania setek źródeł. · Jak to działa
Model / Badania · 4 min ·
Nowy model NVIDIA nie udaje, że jest mądry, i to jest w nim najciekawsze. 11 sierpnia firma wypuściła Nemotron 3.5 Lightning, otwarty model o 30 miliardach parametrów, z których przy każdym tokenie pracują tylko 3 miliardy. To konstrukcja mixture-of-experts, w skrócie MoE: przy każdym słowie wewnętrzny router modelu wybiera garstkę spośród wielu wyspecjalizowanych podsieci, więc za cały model płacisz pamięcią, a mocą obliczeniową tylko za jego drobny wycinek. Stąd bierze się prędkość. NVIDIA obiecuje do czterech razy szybsze generowanie tokenów niż w innych modelach tej wielkości, a całość mieści się na jednej karcie H100 albo na desktopowym DGX Spark.
Wystarczy jednak spojrzeć na tabelę wyników, żeby zobaczyć, do czego ten model się nie nadaje. Na PinchBench, który mierzy krótkie, dobrze określone zadania, Lightning osiąga 85 punktów. Na Terminal-Bench 2.1, gdzie agent musi samodzielnie prowadzić długą pracę w terminalu, spada do 24,58. Dzień wcześniej Meta pokazała Muse Glimmer, model tej samej wielkości, który na tym samym teście robi 51,7. Ta różnica nie jest przypadkiem. Lightning niezawodnie wykonuje pojedyncze, wąsko zakrojone kroki i rozsypuje się tam, gdzie trzeba samemu doprowadzić długie zadanie do końca. Mówiąc wprost, to nie jest model, któremu oddasz swojego agenta.
Byłoby jednak nieuczciwe nazwać go po prostu głupim. Na testach wiedzy i pojedynczego rozumowania, jak MMLU Pro, Lightning wyciąga wynik, jakiego nikt nie spodziewałby się po zaledwie 3 aktywnych miliardach parametrów. Artificial Analysis stawia go blisko modelu gpt-oss-120b, czterokrotnie większego. On nie jest tępy, tylko wąski: świetnie radzi sobie z zadaniem, które ktoś inny dokładnie mu zdefiniował, i gubi się, kiedy sam ma trzymać wątek przez godziny.
Czytaj dalej za darmo
Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.