SmartDigest Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Analiza / Opinia

Który model do kodu? Tabela kosztów pokazuje cenę, nie odpowiedź

Netlify puściło jeden prompt, prostą wizytówkę kawiarni, przez 11 modeli i policzyło zużyte kredyty: od 2,4 przy DeepSeek V4 Flash do 519 przy Claude Opus 5, z jednym przebiegiem Opusa za 1055. Kusi, żeby odczytać z tabeli ranking i wziąć najtańszy model, ale test mierzył wyłącznie wygląd jednej strony, nie działający kod, a ocena była subiektywna. Kimi K3 wypada blado, bo jest zbudowany pod złożone zadania agentowe, nie pod rysowanie wizytówki. Wybór modelu jest empiryczny i zależy od zadania, więc tej tabeli nie da się przepisać jako gotowego rankingu.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Analiza / Opinia  ·  4 min  · 

Który model do kodu? Tabela kosztów pokazuje cenę, nie odpowiedź
Ilustrację przygotowała AI.

Ten sam prompt, jedno zdanie: zbuduj jednostronicową wizytówkę osiedlowej kawiarni z godzinami otwarcia, adresem, krótkim menu i zdjęciem. Netlify przepuściło go przez 11 modeli i policzyło, ile każdy z nich spalił kredytów, wewnętrznej waluty, którą na tej platformie płaci się za pracę modelu. Rozrzut wyszedł ogromny: od 2,4 kredytu średnio przy DeepSeek V4 Flash do 519 przy Claude Opus 5. Do tego jeden z trzech przebiegów Opusa pochłonął aż 1055 kredytów, jakieś cztery razy więcej niż którykolwiek inny wynik w tabeli.

Ta tabela naprawdę coś mówi, tylko nie to, co się na pierwszy rzut oka wydaje. Kusi, żeby odczytać z niej ranking i wziąć najtańszy model, ale to pułapka. Wyboru modelu do własnej roboty nie da się zrzucić na jeden benchmark, zwłaszcza taki, który mierzy jedno wąskie zadanie. Pisałem o tym miesiąc temu przy okazji Pareto Code, funkcji OpenRoutera, która sama dobiera najtańszy model powyżej zadanego progu jakości: jej słabością było dokładnie to, że uśredniony ranking nie mówi, czy model trzyma się akurat na twoim kodzie. Tu jest ten sam problem, tyle że widać go czarno na białym.

Benchmark wyszedł przy okazji partnerstwa z OpenRouterem, pośrednikiem, który przez jedno API daje dostęp do setek modeli naraz. Dzięki tej umowie w Agent Runners, okienku czatu wbudowanym w Netlify, w którym stawiasz projekt od zera albo go rozwijasz, pojawiły się świeże modele z otwartymi wagami: Kimi K3, GLM 5.2 i DeepSeek V4.

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Najdroższy model potrzebny tylko do planu, resztę zrobi tańszy Premiera / Narzędzie

Najdroższy model potrzebny tylko do planu, resztę zrobi tańszy

3 min

Cursor dał rojowi agentów 835 stron dokumentacji SQLite i kazał odtworzyć bazę w Rust bez kodu źródłowego, a efekt przeszedł 100% ukrytych testów. Prawdziwy wniosek leży jednak w rachunku: przy niemal identycznej jakości koszt rozjechał się od 1339 dolarów, gdy planował Opus 4.8, a wykonywał tani Composer 2.5, po 10 565 dolarów za GPT-5.5 grający obie role naraz. Sztuczka polega na tym, że najdroższy model tylko rozbija cel na jednoznaczne instrukcje, a tańszy je wykonuje, bo naprawdę mało momentów w dużym zadaniu wymaga najkosztowniejszej inteligencji.

Chiński model wygrał ranking kodowania. Co pokazały pierwsze niezależne testy? Model / Badania

Chiński model wygrał ranking kodowania. Co pokazały pierwsze niezależne testy?

5 min

Kimi K3, chiński model z otwartymi wagami, wygrał frontendowy ranking Areny o 48 punktów przed Claude Fable 5, ale pierwsze niezależne testy prostują ten obraz. Jessica Wachtel z The New Stack dała obu to samo zadanie na narzędziu fd: diffy wyszły co do bajta identyczne, tylko K3 kosztował jedną trzecią ceny i był kilka razy wolniejszy, całość zajęła mu 28 minut zamiast siedmiu. Jego wskaźnik halucynacji skoczył za to do 51 procent, a uruchomienie go u siebie wymaga 64 kart graficznych, więc realną alternatywą na dziś zostają GLM 5.2 i DeepSeek V4 Pro.

Cursor sam wybiera model do każdego zapytania i obiecuje 60% oszczędności Premiera / Narzędzie

Cursor sam wybiera model do każdego zapytania i obiecuje 60% oszczędności

4 min

Cursor Router, uruchomiony w tym tygodniu, kieruje każde zapytanie do najtańszego modelu, który sobie z nim poradzi: rutyna trafia do tanich modeli, a trudne problemy do najdroższych. Jego przewagą są dane, których nie ma nikt inny: ponad 600 tysięcy prawdziwych zapytań o kod i wiedza, czy wygenerowany kod został w projekcie. Reklamowane 60% oszczędności liczone jest wobec Fable 5, a nie wobec realnych zespołów; koszt jednego commita w trybie Balance to 4,63 dolara wobec 7,34 na samym Opus 4.8. Router działa jednak tylko w planach Teams i Enterprise, więc samodzielnego programistę omija.