Analiza / Opinia
Który model do kodu? Tabela kosztów pokazuje cenę, nie odpowiedź
Netlify puściło jeden prompt, prostą wizytówkę kawiarni, przez 11 modeli i policzyło zużyte kredyty: od 2,4 przy DeepSeek V4 Flash do 519 przy Claude Opus 5, z jednym przebiegiem Opusa za 1055. Kusi, żeby odczytać z tabeli ranking i wziąć najtańszy model, ale test mierzył wyłącznie wygląd jednej strony, nie działający kod, a ocena była subiektywna. Kimi K3 wypada blado, bo jest zbudowany pod złożone zadania agentowe, nie pod rysowanie wizytówki. Wybór modelu jest empiryczny i zależy od zadania, więc tej tabeli nie da się przepisać jako gotowego rankingu.
Napisała AI, żeby oszczędzić Ci czytania setek źródeł. · Jak to działa
Analiza / Opinia · 4 min ·
Ten sam prompt, jedno zdanie: zbuduj jednostronicową wizytówkę osiedlowej kawiarni z godzinami otwarcia, adresem, krótkim menu i zdjęciem. Netlify przepuściło go przez 11 modeli i policzyło, ile każdy z nich spalił kredytów, wewnętrznej waluty, którą na tej platformie płaci się za pracę modelu. Rozrzut wyszedł ogromny: od 2,4 kredytu średnio przy DeepSeek V4 Flash do 519 przy Claude Opus 5. Do tego jeden z trzech przebiegów Opusa pochłonął aż 1055 kredytów, jakieś cztery razy więcej niż którykolwiek inny wynik w tabeli.
Ta tabela naprawdę coś mówi, tylko nie to, co się na pierwszy rzut oka wydaje. Kusi, żeby odczytać z niej ranking i wziąć najtańszy model, ale to pułapka. Wyboru modelu do własnej roboty nie da się zrzucić na jeden benchmark, zwłaszcza taki, który mierzy jedno wąskie zadanie. Pisałem o tym miesiąc temu przy okazji Pareto Code, funkcji OpenRoutera, która sama dobiera najtańszy model powyżej zadanego progu jakości: jej słabością było dokładnie to, że uśredniony ranking nie mówi, czy model trzyma się akurat na twoim kodzie. Tu jest ten sam problem, tyle że widać go czarno na białym.
Benchmark wyszedł przy okazji partnerstwa z OpenRouterem, pośrednikiem, który przez jedno API daje dostęp do setek modeli naraz. Dzięki tej umowie w Agent Runners, okienku czatu wbudowanym w Netlify, w którym stawiasz projekt od zera albo go rozwijasz, pojawiły się świeże modele z otwartymi wagami: Kimi K3, GLM 5.2 i DeepSeek V4.
Czytaj dalej za darmo
Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.