Premiera / Narzędzie
Microsoft ściął cenę swojego modelu do kodu o 73%
Microsoft obniżył cenę swojego modelu do kodu MAI-Code-1.1-Flash o 73% względem poprzednika, zaledwie 10 tygodni po jego premierze, i wpuścił go 11 sierpnia do GitHub Copilota za 0,20 dolara na wejściu i 1,20 na wyjściu. Kłopot w tym, że chiński DeepSeek-V4-Flash jest jednocześnie tańszy i lepszy w pracy w terminalu, bo na Terminal-Bench 2.1 ma 82,7% wobec 62,9% Microsoftu. Moim zdaniem nie chodzi więc o jakość, tylko o to, że to Microsoft ustawia domyślny model w Copilocie, którego większość użytkowników nigdy nie zmienia ręcznie.
Napisała AI, żeby oszczędzić Ci czytania setek źródeł. · Jak to działa
Premiera / Narzędzie · 3 min ·
Microsoft ściął cennik swojego modelu do kodu o 73% i zrobił to zaledwie 10 tygodni po premierze poprzednika. MAI-Code-1.1-Flash wszedł 11 sierpnia do GitHub Copilota i zastąpił MAI-Code-1-Flash, lekki, firmowy model do pisania kodu, który Microsoft pokazał dopiero w czerwcu na konferencji Build. Nowa wersja kosztuje 0,20 dolara za milion tokenów na wejściu i 1,20 dolara na wyjściu, mniej więcej jedną czwartą tego, co brał poprzednik. Firma tłumaczy obniżkę lepszym trenowaniem i tańszą obsługą modelu, a nie cięciem jakości.
Sama stawka za token to jednak nie cała historia i akurat tę część Microsoft rozegrał najlepiej. Nowy model potrzebuje o 25% mniej tokenów na to samo zadanie i wypuszcza je o 25% szybciej, co przy rozliczaniu za każdy token znaczy więcej niż goła cena z cennika. Pod spodem działa rzadki model typu Mixture of Experts: jak duża sieć, z której przy każdym zapytaniu włącza się tylko drobny wycinek, 5 z 138 miliardów parametrów, i to głównie stąd bierze się niski koszt.
Microsoft skupił poprawki na wierszu poleceń i platformie .NET i tam poprawa jest największa. Na Terminal-Bench 2.1, teście sprawdzającym, jak agent radzi sobie z komendami w terminalu, wynik urósł z 51,7% do 62,9%, czyli o jedną piątą względem poprzednika. Na SWE-Bench Verified, gdzie model naprawia prawdziwe błędy zgłoszone w projektach open-source, ma 72,6%. Doszła też obsługa obrazów, więc model potrafi teraz czytać zrzuty ekranu i diagramy wrzucone do rozmowy.
Czytaj dalej za darmo
Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.