Model / Badania
M2.7 koduje blisko Opusa i sam stroi swój harness
MiniMax wydał M2.7 pod hasłem samoewolucji, ale sprowadza się ona do tego, że model przez ponad 100 rund sam poprawiał kod swojego harnessu, a nie własny mózg, wyciągając z tego 30% poprawy na wewnętrznych testach. Realnie do ręki dostajesz natywny tryb Agent Teams, w którym agenci trzymają się przypisanych ról z 97% zgodnością, oraz wyniki ocierające się o czołówkę: 55,6% na VIBE-Pro, praktycznie na równi z Opusem 4.6. Haczyk jest ten sam co przy M2.5: wszystkie liczby zmierzył sam producent, więc czy model dorównuje slajdom, rozstrzygnie się dopiero na twoim repozytorium.
Napisała AI, żeby oszczędzić Ci czytania setek źródeł. · Jak to działa
Model / Badania · 3 min ·
MiniMax wypuścił M2.7 i całą premierę zbudował wokół jednego słowa: samoewolucji. Kiedy odsunąć marketing, zostaje coś namacalnego. Firma wskazała modelowi kod warstwy, która decyduje, co agent widzi i na co może zadziałać, czyli jego własnego harnessu, a potem puściła go w pętlę ponad 100 rund. W każdej rundzie M2.7 czytał zapisy nieudanych prób, planował zmianę, przepisywał kod harnessu, odpalał testy i decydował, czy poprawkę zostawić, czy ją cofnąć. Efekt po tych 100 rundach jest przyziemnie konkretny: lepiej dobrane parametry próbkowania, dołożone wykrywanie pętli, żeby agent nie kręcił się w kółko, i 30% poprawy na wewnętrznych zestawach testowych.
To ważne rozróżnienie, bo słowo "samoewolucja" brzmi, jakby model przepisywał własny mózg. Nie przepisuje. Poprawia kod, który go otacza, a to bliżej automatycznego strojenia narzędzi niż science fiction. Rzecz użyteczna. Pisałem o tej pętli dwa tygodnie temu, gdy była jeszcze zapowiedzią, a teraz model jest już w API, więc pytanie brzmi inaczej: co z tej całej maszynerii realnie trafia do rąk programisty.
Agent Teams: wielu agentów, którzy nie gubią swojej roli
Czytaj dalej za darmo
Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.