SmartDigest Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Model / Badania

MiniMax dorównuje Opusowi w kodzie za jedną dziesiątą ceny

MiniMax wypuścił model M2.5, który na SWE-Bench Verified osiąga 80,2%, minimalnie przed Claude Opus 4.6, ale za jedną dziesiątą jego ceny. Liczy się też szybkość: serwowany ze stu tokenami na sekundę kończy zadanie w 22,8 minuty, tyle samo co Opus, więc pierwszy raz tani model nie jest jednocześnie wolny. To otwiera drogę agentom działającym w tle bez przerwy. Większość benchmarków MiniMax zmierzył jednak sam, więc M2.5 to dziś gotowy kandydat do podmiany Opusa, ale obietnicę samodoskonalącego się M2.7 lepiej traktować ostrożnie.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Model / Badania  ·  3 min  · 

MiniMax dorównuje Opusowi w kodzie za jedną dziesiątą ceny
Ilustrację przygotowała AI.

MiniMax wypuścił 12 lutego model M2.5, który na SWE-Bench Verified wykręca 80,2% i robi to za jedną dziesiątą tego, co kosztuje Claude Opus 4.6. SWE-Bench Verified to zestaw prawdziwych zgłoszeń błędów z GitHuba, na których sprawdza się, czy model potrafi sam naprawić kod w cudzym projekcie. Dotąd taki wynik oznaczał rachunek jak za Opusa, a tu nie oznacza, i to jest cała historia.

Pisałem o tym modelu, gdy pojawił się w lutym, ale dopiero teraz widać, do czego ta cena prowadzi. MiniMax podaje, że godzina ciągłej pracy M2.5 kosztuje dolara, jeśli model generuje sto tokenów na sekundę, i trzydzieści centów, jeśli zwolnić go do pięćdziesięciu. Wersja M2.5-Lightning, identyczna pod względem zdolności, tylko szybsza, kosztuje 2,40 dolara za milion tokenów wyjścia. To otwiera klasę zastosowań, których dotąd nikt nie liczył jako opłacalne: agenty, które działają bez przerwy w tle, przeczesują logi, pilnują testów, próbują naprawić coś dziesiątki razy z rzędu. Przy cenie Opusa taki agent zjadał budżet w jeden dzień. Przy cenie M2.5 cztery instancje chodzące cały rok to dziesięć tysięcy dolarów.

Druga rzecz, która naprawdę zmienia rachunek, to szybkość. M2.5 jest serwowany natywnie ze stu tokenami na sekundę, czyli prawie dwa razy szybciej niż inne modele tej klasy. Cały przebieg SWE-Bench Verified skrócił się z 31,3 do 22,8 minuty na zadanie, czyli tyle samo, ile zajmuje Opus 4.6 ze swoimi 22,9 minuty. Dla agenta, który musi zdążyć przed deadlinem albo zareagować na alert, czas zakończenia zadania liczy się tak samo jak sama poprawność. Tu pierwszy raz tani model nie jest jednocześnie wolny.

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

MiniMax M2.5 dorównuje Opusowi 4.6 za jedną dziesiątą jego ceny Model / Badania

MiniMax M2.5 dorównuje Opusowi 4.6 za jedną dziesiątą jego ceny

4 min

MiniMax M2.5 z 12 lutego dorównuje Opusowi 4.6 na SWE-Bench Verified (80,2% w 22,8 minuty na zadanie) przy 10% kosztu i licencji MIT bez zastrzeżeń. Kwietniowy M2.7 z 229 miliardami parametrów MoE dobija do 56,22% na SWE-Pro, ale tydzień po publikacji wag MiniMax po cichu zmienił licencję — komercja wymaga teraz pisemnej zgody. Dla zespołów płacących tysiąc dolarów miesięcznie za Opusa M2.5 to gotowy kandydat do podmiany w tańszych przepływach.

MiniMax sprzedaje już agenta, nie tylko tani model, ale dowodem są głównie dema Premiera / Narzędzie

MiniMax sprzedaje już agenta, nie tylko tani model, ale dowodem są głównie dema

3 min

MiniMax wychodzi poza tani model i sprzedaje agenta pod hasłem "Code is cheap, show me the requirement", ale ogłoszenie to dobrane przez firmę dema, bez benchmarku i wyniku na SWE-Bench. Dla programisty konkretem jest natywna integracja z MCP, dzięki której agent sam sięga do GitHuba, GitLaba, Slacka czy Figmy zamiast ręcznego wklejania. Sam żongluje kilkoma modelami naraz, co, jak przyznaje firma, kosztuje i obniża wydajność, więc hasło o tanim kodzie na razie się nie broni. Jedyny twardy sygnał to fakt, że po niecałych 60 dniach stał się codziennym narzędziem ponad połowy zespołu MiniMaxa.

M2.7 koduje blisko Opusa i sam stroi swój harness Model / Badania

M2.7 koduje blisko Opusa i sam stroi swój harness

3 min

MiniMax wydał M2.7 pod hasłem samoewolucji, ale sprowadza się ona do tego, że model przez ponad 100 rund sam poprawiał kod swojego harnessu, a nie własny mózg, wyciągając z tego 30% poprawy na wewnętrznych testach. Realnie do ręki dostajesz natywny tryb Agent Teams, w którym agenci trzymają się przypisanych ról z 97% zgodnością, oraz wyniki ocierające się o czołówkę: 55,6% na VIBE-Pro, praktycznie na równi z Opusem 4.6. Haczyk jest ten sam co przy M2.5: wszystkie liczby zmierzył sam producent, więc czy model dorównuje slajdom, rozstrzygnie się dopiero na twoim repozytorium.