SmartDigest.ai Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Model / Badania

Grok 4.6 wchodzi do pierwszej ligi modeli, ale bez korony

Grok 4.6 od xAI zdobył 61 punktów w Artificial Analysis Intelligence Index, trzeci wynik na świecie tuż za Fable 5 i Claude Opus 5, ale to nie nowy model, tylko lepiej douczony Grok 4.5. Na benchmarkach kodowania, które liczą się w prawdziwej robocie, wciąż goni rywali: 65,9% na DeepSWE wobec 73% u GPT-5.6 Sol. Prawdziwym argumentem jest cena, ponad 60% niższa niż u konkurencji, choć powyżej 200 tysięcy tokenów stawki się podwajają. Mimo deklaracji Muska o numerze jeden to świetny model do przetestowania, nie powód, żeby rzucać dotychczasowe narzędzia.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Model / Badania  ·  4 min  · 

Grok 4.6 wchodzi do pierwszej ligi modeli, ale bez korony
Ilustrację przygotowała AI.

Rok temu nazwanie Groka modelem z pierwszej ligi brzmiałoby jak żart. W środę SpaceXAI, firma znana wcześniej jako xAI, wypuściła Grok 4.6 i żart przestał śmieszyć. Model zdobył 61 punktów w Artificial Analysis Intelligence Index, złożonym rankingu z dziewięciu benchmarków, i zrównał się z GPT-5.6 Sol od OpenAI. To trzeci wynik na świecie, tuż za Fable 5 i Claude Opus 5 od Anthropica. Elon Musk od razu ogłosił, że Grok jest "obiektywnie numerem jeden, jeśli liczyć inteligencję, szybkość i koszt". Z tym numerem jeden bym jednak poczekał.

Grok 4.6 nie jest nowym, większym modelem. SpaceXAI zostawiło ten sam fundament co w Grok 4.5, o którym pisałem kilka tygodni temu, a cała poprawa poszła w dodatkowe trenowanie: dłuższą serię douczania na starannie dobranych danych i uczenie modelu na zadaniach, w których agent musi działać samodzielnie przez wiele kroków. Mówiąc wprost, to ten sam mózg, tylko lepiej wyszkolony w tym, żeby nie gubić wątku przez kilkanaście ruchów pod rząd.

Widać to w tym, do czego model jest strojony: długie zadania, w których agent bada nieznany temat, przekopuje się przez cudzy kod albo zamienia luźny pomysł w działającą pierwszą wersję aplikacji. SpaceXAI twierdzi, że przy dłuższych zadaniach Grok 4.6 częściej sam sprawdza swoją robotę, zanim pójdzie dalej. To obserwacja producenta z własnych testów, nie niezależny pomiar, więc traktuję ją jak zapowiedź, nie dowód. Doszedł też nowy poziom wysiłku rozumowania, xhigh, o stopień wyżej niż dotychczasowy high, czyli pokrętło "myśl dłużej" wkręcone jeszcze wyżej niż w 4.5.

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Grok 4.7 kosztuje tyle samo za token, ale na zadanie zużywa dwa razy więcej Model / Badania

Grok 4.7 kosztuje tyle samo za token, ale na zadanie zużywa dwa razy więcej

4 min

xAI wypuściło 21 września Groka 4.7 w tej samej cenie co poprzednik, czyli 2 dolary za milion tokenów wejściowych i 6 za milion wyjściowych, ale na najwyższym poziomie rozumowania model zużywa średnio około 81 tysięcy tokenów na zadanie, a Grok 4.6 potrzebował 36 tysięcy. Nowa wersja rzadziej zmyśla i zajmuje czwarte miejsce w rankingu agentów programistycznych Artificial Analysis, choć w Terminal-Bench 4.0 wciąż traci prawie 20 punktów do Fable 5.1. Zanim ustawisz najwyższy poziom na stałe, zmierz na własnych zadaniach, ile tokenów trafi na fakturę.

Najnowszy Grok wchodzi tam, gdzie firmy już mają fakturę Model / Badania

Najnowszy Grok wchodzi tam, gdzie firmy już mają fakturę

4 min

Grok 4.6 trafił 21 sierpnia do Model Garden na Vertex AI, więc zespoły na Google Cloud dopisują go do rachunku, który i tak płacą, zamiast przepychać umowę z nowym dostawcą. Reklamowana stawka 2 dolarów za milion tokenów wejściowych obowiązuje jednak tylko do 200 tysięcy tokenów w zapytaniu, a powyżej progu podwaja się dla całego zapytania. Artificial Analysis wycenia jedno domknięte zadanie na 0,84 dolara przy średnio 53 turach, o połowę krócej niż Claude Opus 5 Max. W tle toczą się trzy postępowania wobec X i SpaceXAI: Ofcomu, brytyjskiego urzędu ochrony danych i Komisji Europejskiej.

2,49 dolara za zadanie: nowy model SpaceXAI uderza w koszt agentów Model / Badania

2,49 dolara za zadanie: nowy model SpaceXAI uderza w koszt agentów

4 min

SpaceXAI wypuściło Grok 4.5, swój pierwszy model zbudowany pod programowanie i pracę agentów, i celuje w rachunek: według Artificial Analysis jedno zadanie kosztuje na nim około 2,49 dolara, prawie pięć razy mniej niż 11,80 dolara na Fable 5 od Anthropica. Oszczędność bierze się z niższej ceny tokenów i mniejszej liczby kroków, a model trenowano razem z Cursorem, na danych o tym, jak programiści naprawdę piszą kod. Haczyk jest realny: tani token nie znaczy tani efekt, bo Grok 4.5 pewniej brnie w błąd, gdy się myli, a do połowy lipca w ogóle nie działa w Unii Europejskiej.