SmartDigest Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Model / Badania

M2.7 koduje blisko Opusa i sam stroi swój harness

MiniMax wydał M2.7 pod hasłem samoewolucji, ale sprowadza się ona do tego, że model przez ponad 100 rund sam poprawiał kod swojego harnessu, a nie własny mózg, wyciągając z tego 30% poprawy na wewnętrznych testach. Realnie do ręki dostajesz natywny tryb Agent Teams, w którym agenci trzymają się przypisanych ról z 97% zgodnością, oraz wyniki ocierające się o czołówkę: 55,6% na VIBE-Pro, praktycznie na równi z Opusem 4.6. Haczyk jest ten sam co przy M2.5: wszystkie liczby zmierzył sam producent, więc czy model dorównuje slajdom, rozstrzygnie się dopiero na twoim repozytorium.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Model / Badania  ·  3 min  · 

M2.7 koduje blisko Opusa i sam stroi swój harness
Ilustrację przygotowała AI.

MiniMax wypuścił M2.7 i całą premierę zbudował wokół jednego słowa: samoewolucji. Kiedy odsunąć marketing, zostaje coś namacalnego. Firma wskazała modelowi kod warstwy, która decyduje, co agent widzi i na co może zadziałać, czyli jego własnego harnessu, a potem puściła go w pętlę ponad 100 rund. W każdej rundzie M2.7 czytał zapisy nieudanych prób, planował zmianę, przepisywał kod harnessu, odpalał testy i decydował, czy poprawkę zostawić, czy ją cofnąć. Efekt po tych 100 rundach jest przyziemnie konkretny: lepiej dobrane parametry próbkowania, dołożone wykrywanie pętli, żeby agent nie kręcił się w kółko, i 30% poprawy na wewnętrznych zestawach testowych.

To ważne rozróżnienie, bo słowo "samoewolucja" brzmi, jakby model przepisywał własny mózg. Nie przepisuje. Poprawia kod, który go otacza, a to bliżej automatycznego strojenia narzędzi niż science fiction. Rzecz użyteczna. Pisałem o tej pętli dwa tygodnie temu, gdy była jeszcze zapowiedzią, a teraz model jest już w API, więc pytanie brzmi inaczej: co z tej całej maszynerii realnie trafia do rąk programisty.

Agent Teams: wielu agentów, którzy nie gubią swojej roli

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Samoewolucja M2.7? Pod spodem sto rund prób i błędów Model / Badania

Samoewolucja M2.7? Pod spodem sto rund prób i błędów

3 min

MiniMax wypuścił M2.7 i oparł całą premierę na jednym słowie: samodoskonaleniu. Pod spodem kryje się pętla ponad stu rund, w których model sam przepisywał kod swojego harnessu, odpalał testy i cofał nieudane zmiany, aż wyciągnął 30% poprawy na wewnętrznych zestawach. Na MLE Bench Lite od OpenAI zdobył średnio 66,6% medali, za Opusem 4.6 (75,7%) i GPT-5.4 (71,2%), a w samym kodowaniu ma 56,22% na SWE-Pro. Problem w tym, że wszystkie te liczby zmierzył sam MiniMax, bez niezależnej weryfikacji.

MiniMax sprzedaje już agenta, nie tylko tani model, ale dowodem są głównie dema Premiera / Narzędzie

MiniMax sprzedaje już agenta, nie tylko tani model, ale dowodem są głównie dema

3 min

MiniMax wychodzi poza tani model i sprzedaje agenta pod hasłem "Code is cheap, show me the requirement", ale ogłoszenie to dobrane przez firmę dema, bez benchmarku i wyniku na SWE-Bench. Dla programisty konkretem jest natywna integracja z MCP, dzięki której agent sam sięga do GitHuba, GitLaba, Slacka czy Figmy zamiast ręcznego wklejania. Sam żongluje kilkoma modelami naraz, co, jak przyznaje firma, kosztuje i obniża wydajność, więc hasło o tanim kodzie na razie się nie broni. Jedyny twardy sygnał to fakt, że po niecałych 60 dniach stał się codziennym narzędziem ponad połowy zespołu MiniMaxa.

MiniMax dorównuje Opusowi w kodzie za jedną dziesiątą ceny Model / Badania

MiniMax dorównuje Opusowi w kodzie za jedną dziesiątą ceny

3 min

MiniMax wypuścił model M2.5, który na SWE-Bench Verified osiąga 80,2%, minimalnie przed Claude Opus 4.6, ale za jedną dziesiątą jego ceny. Liczy się też szybkość: serwowany ze stu tokenami na sekundę kończy zadanie w 22,8 minuty, tyle samo co Opus, więc pierwszy raz tani model nie jest jednocześnie wolny. To otwiera drogę agentom działającym w tle bez przerwy. Większość benchmarków MiniMax zmierzył jednak sam, więc M2.5 to dziś gotowy kandydat do podmiany Opusa, ale obietnicę samodoskonalącego się M2.7 lepiej traktować ostrożnie.