Model / Badania
Grok 4.6 wchodzi do pierwszej ligi modeli, ale bez korony
Grok 4.6 od xAI zdobył 61 punktów w Artificial Analysis Intelligence Index, trzeci wynik na świecie tuż za Fable 5 i Claude Opus 5, ale to nie nowy model, tylko lepiej douczony Grok 4.5. Na benchmarkach kodowania, które liczą się w prawdziwej robocie, wciąż goni rywali: 65,9% na DeepSWE wobec 73% u GPT-5.6 Sol. Prawdziwym argumentem jest cena, ponad 60% niższa niż u konkurencji, choć powyżej 200 tysięcy tokenów stawki się podwajają. Mimo deklaracji Muska o numerze jeden to świetny model do przetestowania, nie powód, żeby rzucać dotychczasowe narzędzia.
Napisała AI, żeby oszczędzić Ci czytania setek źródeł. · Jak to działa
Model / Badania · 4 min ·
Rok temu nazwanie Groka modelem z pierwszej ligi brzmiałoby jak żart. W środę SpaceXAI, firma znana wcześniej jako xAI, wypuściła Grok 4.6 i żart przestał śmieszyć. Model zdobył 61 punktów w Artificial Analysis Intelligence Index, złożonym rankingu z dziewięciu benchmarków, i zrównał się z GPT-5.6 Sol od OpenAI. To trzeci wynik na świecie, tuż za Fable 5 i Claude Opus 5 od Anthropica. Elon Musk od razu ogłosił, że Grok jest "obiektywnie numerem jeden, jeśli liczyć inteligencję, szybkość i koszt". Z tym numerem jeden bym jednak poczekał.
Grok 4.6 nie jest nowym, większym modelem. SpaceXAI zostawiło ten sam fundament co w Grok 4.5, o którym pisałem kilka tygodni temu, a cała poprawa poszła w dodatkowe trenowanie: dłuższą serię douczania na starannie dobranych danych i uczenie modelu na zadaniach, w których agent musi działać samodzielnie przez wiele kroków. Mówiąc wprost, to ten sam mózg, tylko lepiej wyszkolony w tym, żeby nie gubić wątku przez kilkanaście ruchów pod rząd.
Widać to w tym, do czego model jest strojony: długie zadania, w których agent bada nieznany temat, przekopuje się przez cudzy kod albo zamienia luźny pomysł w działającą pierwszą wersję aplikacji. SpaceXAI twierdzi, że przy dłuższych zadaniach Grok 4.6 częściej sam sprawdza swoją robotę, zanim pójdzie dalej. To obserwacja producenta z własnych testów, nie niezależny pomiar, więc traktuję ją jak zapowiedź, nie dowód. Doszedł też nowy poziom wysiłku rozumowania, xhigh, o stopień wyżej niż dotychczasowy high, czyli pokrętło "myśl dłużej" wkręcone jeszcze wyżej niż w 4.5.
Czytaj dalej za darmo
Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.