SmartDigest Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Model / Badania

Kimi K3 prowadzi w kodowaniu i przedstawia się jako Claude

Kimi K3 od chińskiego Moonshot AI wskoczył na pierwsze miejsce w kodowaniu frontendu, 1679 punktów wobec 1631 dla Claude Fable 5. Liczy 2,8 biliona parametrów, ale dzięki rzadkiej mieszance ekspertów przy każdym tokenie pracuje tylko 16 z 896 podsieci, więc rachunek za inferencję jest bliższy modelowi stumiliardowemu. Ciągnie się za nim zarzut destylacji, bo świeży K3 przedstawiał się jako Claude, a Anthropic oskarża Moonshot o przepuszczenie przez Claude'a 3,4 miliona wymian, choć dla kogoś, kto chce tanio generować dobry kod, otwarte wagi ważą więcej niż pochodzenie trenowania.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Model / Badania  ·  5 min  · 

Kimi K3 prowadzi w kodowaniu i przedstawia się jako Claude
Ilustrację przygotowała AI.

Miesiąc temu pisałem o Kimi K3 w dniu premiery, gdy chiński Moonshot AI wrzucił na szczyt rankingu kodowania model z 2,8 biliona parametrów, a same wagi i raport techniczny dopiero obiecywał. Teraz wagi leżą już w sieci, wyniki się trzymają, a razem z nimi przyszły dwie rzeczy, które dla programisty ważą więcej niż samo miejsce w tabeli: opis architektury, dzięki której tak wielki model w ogóle daje się uruchomić, oraz coraz mocniejsze oskarżenia, że K3 nauczył się swojego fachu, podglądając cudzy model.

Liczby robią wrażenie. W rankingu, gdzie anonimowe pojedynki modeli oceniają sami programiści, K3 skoczył o 17 miejsc na pierwszą pozycję w kodowaniu frontendu, 1679 punktów wobec 1631 dla Claude Fable 5 od Anthropic, i jest pierwszym chińskim modelem na szczycie tej tabeli. Na zbiorczym Artificial Analysis Intelligence Index zadebiutował czwarty, za Fable 5 i GPT-5.6 Sol od OpenAI. Trzeba to jednak czytać z ostrożnością, bo sam Moonshot przyznaje, że w ogólnej ocenie ustępuje Fable 5 i Sol, a każdą z tych liczb podał jako własną deklarację, mierzoną własnym narzędziem.

16 z 896 ekspertów, reszta śpi

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Nowy Kimi K2: podwojone okno kontekstu i skok na SWE-Bench Model / Badania

Nowy Kimi K2: podwojone okno kontekstu i skok na SWE-Bench

3 min

Moonshot AI wypuścił Kimi K2-Instruct-0905, aktualizację modelu z otwartymi wagami, który na SWE-Bench Verified podskoczył z 65,8% na 69,2%, praktycznie zrównując się z Qwen3-Coder i tracąc tylko trzy i pół punktu do Claude Sonnet 4. Ciekawszy jest Terminal-Bench, gdzie 44,5% Kimi wyprzedza zarówno Sonnet 4, jak i mocniejszego Opus 4, więc model z otwartymi wagami bije zamkniętą czołówkę na jej boisku. Okno kontekstowe podwojono ze 128 do 256 tysięcy tokenów. Lokalnie tego nie postawisz, więc realną drogą zostaje API zgodne z interfejsem OpenAI i Anthropica.

Chiński model wygrał ranking kodowania. Co pokazały pierwsze niezależne testy? Model / Badania

Chiński model wygrał ranking kodowania. Co pokazały pierwsze niezależne testy?

5 min

Kimi K3, chiński model z otwartymi wagami, wygrał frontendowy ranking Areny o 48 punktów przed Claude Fable 5, ale pierwsze niezależne testy prostują ten obraz. Jessica Wachtel z The New Stack dała obu to samo zadanie na narzędziu fd: diffy wyszły co do bajta identyczne, tylko K3 kosztował jedną trzecią ceny i był kilka razy wolniejszy, całość zajęła mu 28 minut zamiast siedmiu. Jego wskaźnik halucynacji skoczył za to do 51 procent, a uruchomienie go u siebie wymaga 64 kart graficznych, więc realną alternatywą na dziś zostają GLM 5.2 i DeepSeek V4 Pro.

Kimi K3 zmieścił się w 8 GB RAM-u, ale liczy pół minuty na token Model / Badania

Kimi K3 zmieścił się w 8 GB RAM-u, ale liczy pół minuty na token

5 min

Fareed Khan uruchomił Kimi K3, model Moonshot AI o 2,78 biliona parametrów i 1,56 TB na dysku, na komputerze bez karty graficznej, który zużył 8,24 GB pamięci, bo silnik w przenośnym C99 dociąga potrzebnych ekspertów z dysku warstwa po warstwie. Płaci się za to 32,69 sekundy na token, a dosypanie 28 razy więcej pamięci daje ledwie 70 procent przyspieszenia, bo o tempie decyduje odczyt z dysku. Cenniejsza od samej sztuczki jest ostrożność w pomiarach: przy rozrzucie 33 procent między identycznymi uruchomieniami Khan odrzucił własną optymalizację wartą 5,4 procenta.