Model / Badania
GLM-5.2 dorównuje Opusowi w kodowaniu za szóstą część ceny. Tylko jak go uruchomić?
GLM-5.2, model z otwartymi wagami chińskiej firmy Z.ai, dogonił czołówkę w kodowaniu: w Code Arena jest drugi, a odtworzenie pracy badawczej kosztowało go 6,21 dolara wobec 46,35 u Opusa 4.8. Parytet kończy się przy najtrudniejszym rozumowaniu, gdzie chińskie modele wciąż zostają w tyle. Haczyk jest praktyczny: lokalne uruchomienie wymaga około 1,5 terabajta pamięci GPU, a tanie API Z.ai oznacza, że kod wędruje przez serwery pod chińskim prawem wywiadowczym. Geopolityka staje się więc kosztem ukrytym w narzędziu, nie ciekawostką obok niego.
Napisała AI, żeby oszczędzić Ci czytania setek źródeł. · Jak to działa
Model / Badania · 6 min ·
Miesiąc temu pisałem o GLM-5.2, otwartym modelu językowym chińskiej firmy Z.ai, jako o czymś, co miesza w układzie sił, bo wskoczył na otwartą czołówkę benchmarków o włos za Opusem. Od tamtej pory Z.ai dorzuciła to, czego brakowało przy premierze: oficjalną tabelę wyników, pełne wagi na licencji MIT i kilka niezależnych prób, które te liczby potwierdzają. Obraz, jaki się z tego składa, jest dla programisty zaskakująco prosty w warstwie wydajności i zaskakująco trudny w warstwie praktycznej. Model naprawdę dogonił czołówkę w kodowaniu. Tyle że obie drogi, którymi można z niego skorzystać, mają realny koszt, którego żaden wynik z benchmarku nie pokazuje.
Zacznijmy od liczby, która robi największe wrażenie. alphaXiv, platforma badawcza nadbudowana nad arXivem, repozytorium prac naukowych z informatyki i fizyki, kazała obu modelom odtworzyć od zera wyniki jednego z takich artykułów, opisującego metodę treningu modeli o nazwie SDPO: postawić kapryśny framework treningowy, zdebugować go, puścić eksperymenty i sprawdzić, czy liczby z artykułu się zgadzają. To nie jest syntetyczny test, tylko kawałek prawdziwej roboty badawczej, z czytaniem cudzego kodu i grzebaniem w błędach środowiska. GLM-5.2 wykonał całe zadanie za 6,21 dolara. Claude Opus 4.8 to samo zadanie wykonał za 46,35 dolara, czyli około siedem i pół raza drożej. Co ciekawe, GLM-5.2 wcale nie poradził sobie sprawniej z samym środowiskiem: zanim cokolwiek ruszyło, zaliczył 14 nieudanych prób uruchomienia, a Opus tylko dziewięć. Różnicę zrobiła nie liczba prób, lecz to, że GLM-5.2 zużył mniej tokenów na drogę do celu, a jego tokeny są po prostu tańsze.
Ta różnica w cenie nie bierze się z magii, tylko z cennika. Przez API GLM-5.2 kosztuje 1,40 dolara za milion tokenów wejściowych i 4,40 za milion wyjściowych, razem około 5,80 dolara. Opus 4.8 to 30 dolarów, a wycofany dziś Fable 5 kosztował 60. Patrząc na to, trudno nie pomyśleć, że czołowe laboratoria zwyczajnie liczą sobie za markę: skoro wielki, otwarty model potrafi działać rentownie za ułamek tej stawki, to przepaść między 6 a 46 dolarami jest w dużej mierze marżą, nie kosztem. I niezależnie od tego, jak surowo to ocenić, kierunek jest jasny: jeśli odtworzenie wyniku badawczego na poziomie czołówki kosztuje sześć dolarów zamiast czterdziestu sześciu, zmienia się to, co w ogóle opłaca się robić.
Czytaj dalej za darmo
Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.