Model / Badania
Tydzień 37 · 7–13 września 2026
Model / Badania Największy model Nex-AGI ma 1,6 biliona parametrów i nie widzi ekranu
4 min
Nex-AGI otworzył wagi trzech modeli naraz, a flagowy Nex-N2.5-Max z 1,6 biliona parametrów jako jedyny nie widzi ekranu, więc po wzrok trzeba zejść do wersji mini i Pro. Pro trafia w elementy interfejsu celniej niż zamknięci liderzy, bo na OSWorld-G wyciąga 87,4 punktu wobec 76,8 modelu Claude Opus 5, ale całe zadanie na pulpicie dowozi słabiej, 56,4 przy 68,3. Kłopot w tym, że wyniki z obsługi ekranu firma zmierzyła na własnym harnessie NexCUA, którego wciąż nie otworzyła, więc na razie czytam tę tabelę jak deklarację producenta.
Model / Badania MiniCPM5-2B naprawia więcej błędów w kodzie niż model dwa razy od niego większy
4 min
OpenBMB wypuściło 7 września MiniCPM5-2B, model o 2,52 miliarda parametrów na licencji Apache 2.0, który na SWE-bench Verified wykręca 46,4 punktu wobec 33,6 dla dwa razy większego Qwen3.5-4B. Całą tabelę policzył jednak producent, więc kierunek biorę poważnie, a rozmiary przewag traktuję jako powód do własnego testu. Model dobrze wybiera następny krok, ale gubi się w dłuższym biegu, bo na Terminal-Bench v2.1 ma 8,6 wobec 25,8, a w karcie brakuje pomiaru szybkości na jakimkolwiek nazwanym urządzeniu. Razem z wagami wyłożono za to dane treningowe, co przy premierach modeli widuje się rzadko.
Model / Badania Uno przyspiesza generowanie trzykrotnie i nie potrzebuje modelu pomocniczego
3 min
Uno rozbija sekwencyjne generowanie wewnątrz jednego modelu: obok wag autoregresyjnych trzyma lekki zestaw dyfuzyjny, dorobiony w krótkiej destylacji, który dopisuje kilka tokenów naraz i daje do trzech razy szybsze odpowiedzi bez drugiego modelu, jakiego wymaga dekodowanie spekulatywne. Wersja z ośmioma miliardami parametrów ma wypadać lepiej niż 26-miliardowa DiffusionGemma i zamknięty Mercury 2. To wciąż deklaracja z abstraktu z 3 września, bez recenzji, ale kod i wagi leżą na stronie projektu, więc sprawdzić ją da się od ręki.
Tydzień 36 · 31 sierpnia – 6 września 2026
Model / Badania Fable 5.1 tanieje tylko w jednej pozycji rachunku
5 min
Fable 5.1 kosztuje dokładnie tyle co poprzednik, 10 dolarów za milion tokenów wejścia i 50 za milion wyjścia, a obiecane 25% taniej bierze się z jednej pozycji rachunku: odczyt z pamięci podręcznej staniał o 75%, do 0,25 dolara, więc zyskuje głównie ten, kto przepycha przez API ogromny i powtarzalny kontekst. Największy skok widać na Terminal-Bench 4.0, gdzie wynik urósł o blisko 14 punktów, a filtr bezpieczeństwa odzywa się o około 60% rzadziej. Przy przesiadce warto sprawdzić kod, bo tool_choice z wartością any lub tool zwraca teraz błąd 400.
Model / Badania Alibaba nie ogłosiła premiery, tylko podmieniła ID modelu
4 min
Alibaba wypuściła Qwen3.8-Max-0902 bez wpisu na blogu, po prostu podmieniając identyfikator modelu w API, a tego samego dnia model wskoczył na pierwsze miejsce Code Arena w kategorii WebDev z 1691 punktami, trzy nad Claude Opus 5. Najmocniej urósł TerminalBench 3.0, z 11,3 do 29,0, co robi wrażenie tylko do chwili, gdy uświadomicie sobie, że model wciąż nie kończy ponad dwóch trzecich zadań w terminalu. Reszta porównań pochodzi z wewnętrznych testów Alibaby, ze zbiorem ochrzczonym QwenSWEbench włącznie, a przebieg agenta po repozytorium kosztuje 84 centy, czyli więcej niż 49 u Haiku 4.5.
Model / Badania Gemini przestaje oglądać całe wideo, żeby odpowiedzieć na jedno pytanie
3 min
Gemini nie musi już oglądać całego nagrania, żeby odpowiedzieć na jedno pytanie: od pierwszego września modele 3.7 Flash, 3.6 Flash i 3.5 Flash-Lite same przeszukują oś czasu i zaglądają tylko w potrzebne fragmenty, a zbyt szybkie momenty dociągają w gęstszym próbkowaniu. Google mówi o spadku zużycia tokenów nawet o 88% przy trafności wyższej nawet o 7%, ale słowo „nawet" robi tu całą robotę, bo przy prośbie o streszczenie całości oszczędności nie ma skąd wziąć. Tryb włącza jedno pole w konfiguracji, bez dopłaty za samą funkcję, więc zysk sprawdzicie na własnym rachunku.
Model / Badania Kimi K3 zmieścił się w 8 GB RAM-u, ale liczy pół minuty na token
5 min
Fareed Khan uruchomił Kimi K3, model Moonshot AI o 2,78 biliona parametrów i 1,56 TB na dysku, na komputerze bez karty graficznej, który zużył 8,24 GB pamięci, bo silnik w przenośnym C99 dociąga potrzebnych ekspertów z dysku warstwa po warstwie. Płaci się za to 32,69 sekundy na token, a dosypanie 28 razy więcej pamięci daje ledwie 70 procent przyspieszenia, bo o tempie decyduje odczyt z dysku. Cenniejsza od samej sztuczki jest ostrożność w pomiarach: przy rozrzucie 33 procent między identycznymi uruchomieniami Khan odrzucił własną optymalizację wartą 5,4 procenta.
Model / Badania Tencent wypuszcza Hy4 preview na Apache 2.0 i sam sobie wystawia ocenę
4 min
Tencent wystawił wagi Hy4 preview na Hugging Face na licencji Apache 2.0: 770 miliardów parametrów, z czego przy jednym tokenie pracuje tylko 49 miliardów, co tnie koszt liczenia, ale nie zapotrzebowanie na pamięć, bo nawet po kwantyzacji do FP8 model rozkłada się na osiem kart. Jedyne porównanie z konkurencją to własny test w ciemno, w którym 163 wewnętrznych ekspertów dało Hy4 średnią 2,99 wobec 2,92 dla GLM 5.3, przy nieujawnionej skali i pełnych benchmarkach doklejonych jako obrazek JPG. Sam producent przyznaje przy tym, że model rozmyśla nad zadaniem dłużej, niż trzeba.
Model / Badania Gra kręci trzy warianty, zanim zdążysz kliknąć
5 min
Blendi wypuścił interdimensional-game, otwarty projekt, w którym każde ujęcie powstaje dopiero w chwili oglądania, bo MiniMax H3 Max od fal zwraca pięć sekund materiału w 768p w niecałe trzy sekundy, a trzy warianty dalszego ciągu liczą się równolegle pod ekranem wyboru, więc kliknięcie rusza natychmiast. Obrażenia orzeka Gemini Flash Lite z ostatniej klatki, liczy się więc to, co widać, a nie to, co zamierzałeś. Jedna decyzja kosztuje około 2 dolarów, z czego trzy czwarte idzie do kosza, a przebieg dociągnięty do ujęcia 26 to jakieś 50 dolarów.
Model / Badania Najmocniejszym argumentem za Gemini 3.8 Flash jest opinia inżynierów Google
4 min
Google wypuścił 2 września Gemini 3.8 Flash i nie ruszył cennika, bo milion tokenów wejściowych nadal kosztuje 0,75 dolara, tyle że model myśli dłużej i koszt przerobienia jednego zadania urósł według Artificial Analysis z 0,40 do 0,58 dolara, czyli o 45%. Porównania jeden do jednego z Claude Opus 5 Google nie pokazał, a wariant Flash Cyber, który według zespołu Chrome'a pisze 2,6 razy więcej trafnych łatek, trafia tylko do wybranych instytucji przez program Fairwind. Najmocniejszym publicznym argumentem zostaje więc to, że model spodobał się inżynierom samego Google.
Tydzień 35 · 24–30 sierpnia 2026
Model / Badania Alibaba pokazała szkielet Qwen4, ale wyniki policzyła sobie sama
4 min
Alibaba wypuściła na Hugging Face Qwen3.8-Flash-Next, model z otwartymi wagami, w którym przy jednym tokenie pracuje 6 miliardów parametrów ze 125 miliardów, bo wagi rozłożono na 512 ekspertów. Na SWE-bench Pro dostaje 62,5 punktu i wygrywa o 0,8 punktu z gęstym Qwen3.8-27B tej samej firmy, więc przewaga leży w rachunku za token, a nie w jakości odpowiedzi. Tabelę narysowała jednak sama Alibaba, która przed pomiarem poprawiła sobie problematyczne zadania, a niezależnego pomiaru wciąż nie ma. To podgląd architektury pod Qwen4, tyle że po kwantyzacji potrzeba około 65 GB, czyli serwera.
Model / Badania Pusta rubryka w tabeli IBM mówi więcej niż wynik 57 na SWE-Bench
5 min
IBM wypuścił 25 sierpnia Granite 4.2 na licencji Apache 2.0, ale w tabeli wyników najmniejszy model, na 3 miliardy parametrów, ma pustą rubrykę na SWE-Bench Verified i Terminal-Bench 2.1, bo nie przeszedł agentowego etapu uczenia ze wzmocnieniem. Wersja 30B kończy na 57%, podczas gdy Claude Opus 4.5 ma tam 76,4%, a agenta realnie poprowadzi dopiero 8B, które po kwantyzacji mieści się w mniej więcej 16 GB pamięci karty. Mocniejszym argumentem niż benchmark jest tu licencja, tylko że jej obietnica zaczyna się od 8B w górę, a nie od modelu, który zmieści się na laptopie.
Model / Badania Yutori uczy model, kiedy przestać klikać i otworzyć terminal
4 min
Yutori pokazało 26 sierpnia Navigatora n2, model o 27 miliardach parametrów, który obsługuje komputer za człowieka na Linuksie, macOS i Windowsie, a w połowie zadania potrafi przesiąść się z klikania na terminal, kiedy tak wychodzi taniej. Jedno zadanie z OSWorld 2.0 kosztuje 1,46 dolara i dopiero ta cena przesuwa agenta po pulpicie z demonstracji do czegoś, co da się puszczać tysiące razy dziennie. Na tym samym benchmarku n2 ma 65,2% wobec 70,6% Claude'a Opus 5, a przewagę na WeaveBench, 70,3% wobec 53,2% Opusa 4.7, policzył sam producent i wag nikomu nie udostępnia.
Model / Badania Tanie modele OpenAI po przecenie: Luna 13,8 raza w górę, Sol w miejscu
4 min
Po obniżce ceny Luny o 80%, do 20 centów za milion tokenów na wejściu, jej dzienne zużycie na OpenRouterze urosło 13,8 raza, podczas gdy nietknięty cenowo Sol stał w miejscu z wynikiem 1,1 raza. Około trzech czwartych tego przyrostu odebrano konkurencyjnym dostawcom, a udział tanich modeli OpenAI skoczył z 0,7% do 7,8% ruchu platformy. Skok przypisano potem Solowi, chociaż zmierzono go na Lunie trzy tygodnie wcześniej, a tańszy token i tak nie oznacza tańszego zadania, bo każde kolejne podejście modelu to osobny rachunek.
Model / Badania Anthropic rozdaje wyniki pracy Mythosa 5 zamiast dostępu do niego
4 min
Anthropic wpuścił Claude Security do otwartej bety, a pod spodem pracuje w nim Mythos 5, najmocniejszy model firmy, którego poza wąskim gronem obrońców z Project Glasswing nikt nie dostał do ręki. Klient z planem Enterprise wskazuje własne repozytorium i dostaje listę znalezisk z numerem CWE, oceną pewności i gotową poprawką, którą nakłada już zwykły Claude Code i zatwierdza człowiek. Zasada jest prosta: firma rozdaje wyniki pracy modelu zamiast dostępu do niego. Brakuje za to jedynej liczby, która by mnie przekonała, czyli skuteczności wykrywania i odsetka fałszywych alarmów.
Tydzień 34 · 17–23 sierpnia 2026
Tydzień 33 · 10–16 sierpnia 2026
Model / Badania Meta oddaje 30-miliardowego agenta za darmo, jeśli masz na czym go uruchomić
5 min
Meta wypuściła 10 sierpnia Muse Glimmer, agentowy model o 30 miliardach parametrów, i oddała jego wagi za darmo na licencji Apache 2.0, dzięki czemu autonomiczny agent może planować zadania, wywoływać narzędzia i pisać kod lokalnie, bez opłat za API. Darmowy jest jednak tylko model, bo po kwantyzacji do 4 bitów potrzebuje maszyny z 24 do 32 GB pamięci, na przykład RTX 4090 albo MacBooka Pro z M4 Max. Na testach agentowych prowadzi, 51,2 na SWE-Bench Pro wobec 36,9 Gemmy i 50,2 Qwena, ale w terminalu przegrywa z Qwenem, a wszystkie liczby pochodzą od samej Mety.
Model / Badania Grok 4.6 wchodzi do pierwszej ligi modeli, ale bez korony
4 min
Grok 4.6 od xAI zdobył 61 punktów w Artificial Analysis Intelligence Index, trzeci wynik na świecie tuż za Fable 5 i Claude Opus 5, ale to nie nowy model, tylko lepiej douczony Grok 4.5. Na benchmarkach kodowania, które liczą się w prawdziwej robocie, wciąż goni rywali: 65,9% na DeepSWE wobec 73% u GPT-5.6 Sol. Prawdziwym argumentem jest cena, ponad 60% niższa niż u konkurencji, choć powyżej 200 tysięcy tokenów stawki się podwajają. Mimo deklaracji Muska o numerze jeden to świetny model do przetestowania, nie powód, żeby rzucać dotychczasowe narzędzia.
Model / Badania NVIDIA wypuściła model, który sam przyznaje, że nie poprowadzi twojego agenta
4 min
NVIDIA wypuściła 11 sierpnia Nemotron 3.5 Lightning, otwarty model MoE o 30 miliardach parametrów, z których przy każdym tokenie pracują tylko 3 miliardy, co daje do czterech razy szybsze generowanie tokenów. Świetnie radzi sobie z wąskimi zadaniami (85 punktów na PinchBench), ale w pracy agenta się rozsypuje: na Terminal-Bench 2.1 dostaje 24,58, podczas gdy Meta Muse Glimmer robi 51,7. Dlatego NVIDIA sprzedaje go nie jako agenta, lecz taniego wykonawcę, a z biblioteką NeMo Switchyard, kierującą kroki agenta do najlepszego modelu, LangChain zbił koszt o 74%.
Model / Badania Transformer, który przestaje wyrzucać własne obliczenia
3 min
Preprint "Full-bandwidth transformer" z arXiv, zgłoszony 9 sierpnia 2026, proponuje latent feedback: zamiast wyrzucać stan ukryty, który transformer liczy na każdym kroku, wyuczona bramka zawraca go na dół stosu, bez zmiany architektury i niemal bez narzutu. Na modelach o miliardzie parametrów dorównuje zwykłemu transformerowi uczonemu na około 1,5 raza więcej tokenów i daje krótsze ślady rozumowania, czyli mniej tokenów na odpowiedź. To jednak sam abstrakt bez niezależnej weryfikacji na małym modelu, więc nie wiadomo, czy przewaga utrzyma się przy czołowych.
Model / Badania Google przerabia Gemmę 4 na model dyfuzyjny, a o cenie za jakość milczy
3 min
Google DeepMind przerobił Gemmę 4 na model dyfuzyjny o nazwie DiffusionGemma, który zamiast pisać słowo po słowie odsłania średnio 20 tokenów na przejście i osiąga około 1500 tokenów na sekundę na jednej karcie H100, wyprzedzając nawet modele ze spekulatywnym dekodowaniem. Pod spodem siedzi wariant mixture-of-experts z 25,2 miliarda parametrów, z których na token aktywuje się tylko 3,8 miliarda. Kłopot w tym, że raport chwali się wyłącznie prędkością i nie podaje żadnej twardej liczby o jakości, zwłaszcza na kodzie.
Model / Badania M2.7 koduje blisko Opusa i sam stroi swój harness
3 min
MiniMax wydał M2.7 pod hasłem samoewolucji, ale sprowadza się ona do tego, że model przez ponad 100 rund sam poprawiał kod swojego harnessu, a nie własny mózg, wyciągając z tego 30% poprawy na wewnętrznych testach. Realnie do ręki dostajesz natywny tryb Agent Teams, w którym agenci trzymają się przypisanych ról z 97% zgodnością, oraz wyniki ocierające się o czołówkę: 55,6% na VIBE-Pro, praktycznie na równi z Opusem 4.6. Haczyk jest ten sam co przy M2.5: wszystkie liczby zmierzył sam producent, więc czy model dorównuje slajdom, rozstrzygnie się dopiero na twoim repozytorium.
Model / Badania Kolejny model roboczy Google w miejscu obiecanego flagowca
3 min
Google wypuścił Gemini 3.7 Flash zaledwie trzy tygodnie po wersji 3.6, znów model roboczy w miejscu obiecywanego flagowego Pro. Skok w benchmarkach jest realny, ale niewielki: na DeepSWE v1.1 wynik rośnie z 49,0% do 65,3%, a w rozumieniu dokumentów model bije Claude Sonnet 5 i GPT-5.6. Prawdziwa zmiana jest w cenie, 0,75 dolara za milion tokenów wejściowych, tyle że OpenAI zbiło stawkę swojej Luny do 0,20 dolara. Ryan Whitwam z Ars Technica pyta wprost, czy to szybszy rozwój, czy tylko szybsze wypuszczanie.
Model / Badania Który model taniej dowozi agenta? Nie ten z tańszym tokenem
4 min
Dwunastego sierpnia DeepSeek wypuścił V4 Pro, a SpaceXAI Groka 4.6, oba pod pracę agentową, i branża odczytała to jako kolejną wojnę cenową. Ale w teście Composio na 30 trudnych zadaniach Grok zaliczył 23, DeepSeek 18, i przesądza tu nie cennik, tylko koszt jednego udanego zadania: Grok kończył za 0,48 dolara, DeepSeek za 0,60, bo więcej prób wyrzucał do kosza. Wniosek dla kogoś, kto wybiera model pod agenta, jest prosty: liczy się nie cena za milion tokenów, tylko koszt zadania, które naprawdę się udało.