Model / Badania
MiniMax dorównuje Opusowi w kodzie za jedną dziesiątą ceny
MiniMax wypuścił model M2.5, który na SWE-Bench Verified osiąga 80,2%, minimalnie przed Claude Opus 4.6, ale za jedną dziesiątą jego ceny. Liczy się też szybkość: serwowany ze stu tokenami na sekundę kończy zadanie w 22,8 minuty, tyle samo co Opus, więc pierwszy raz tani model nie jest jednocześnie wolny. To otwiera drogę agentom działającym w tle bez przerwy. Większość benchmarków MiniMax zmierzył jednak sam, więc M2.5 to dziś gotowy kandydat do podmiany Opusa, ale obietnicę samodoskonalącego się M2.7 lepiej traktować ostrożnie.
Napisała AI, żeby oszczędzić Ci czytania setek źródeł. · Jak to działa
Model / Badania · 3 min ·
MiniMax wypuścił 12 lutego model M2.5, który na SWE-Bench Verified wykręca 80,2% i robi to za jedną dziesiątą tego, co kosztuje Claude Opus 4.6. SWE-Bench Verified to zestaw prawdziwych zgłoszeń błędów z GitHuba, na których sprawdza się, czy model potrafi sam naprawić kod w cudzym projekcie. Dotąd taki wynik oznaczał rachunek jak za Opusa, a tu nie oznacza, i to jest cała historia.
Pisałem o tym modelu, gdy pojawił się w lutym, ale dopiero teraz widać, do czego ta cena prowadzi. MiniMax podaje, że godzina ciągłej pracy M2.5 kosztuje dolara, jeśli model generuje sto tokenów na sekundę, i trzydzieści centów, jeśli zwolnić go do pięćdziesięciu. Wersja M2.5-Lightning, identyczna pod względem zdolności, tylko szybsza, kosztuje 2,40 dolara za milion tokenów wyjścia. To otwiera klasę zastosowań, których dotąd nikt nie liczył jako opłacalne: agenty, które działają bez przerwy w tle, przeczesują logi, pilnują testów, próbują naprawić coś dziesiątki razy z rzędu. Przy cenie Opusa taki agent zjadał budżet w jeden dzień. Przy cenie M2.5 cztery instancje chodzące cały rok to dziesięć tysięcy dolarów.
Druga rzecz, która naprawdę zmienia rachunek, to szybkość. M2.5 jest serwowany natywnie ze stu tokenami na sekundę, czyli prawie dwa razy szybciej niż inne modele tej klasy. Cały przebieg SWE-Bench Verified skrócił się z 31,3 do 22,8 minuty na zadanie, czyli tyle samo, ile zajmuje Opus 4.6 ze swoimi 22,9 minuty. Dla agenta, który musi zdążyć przed deadlinem albo zareagować na alert, czas zakończenia zadania liczy się tak samo jak sama poprawność. Tu pierwszy raz tani model nie jest jednocześnie wolny.
Czytaj dalej za darmo
Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.