SmartDigest.ai Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Model / Badania

Gemini 4 Argon prowadzi w jednym teście kodu z trzech

Gemini 4 Argon od Google'a zdobył 77,9% w DeepSWE v1.1 i wyprzedził GPT-6 Astrę oraz Claude Opusa 5.5, ale w tym samym zestawieniu przegrywa z Astrą o ponad 10 punktów we FrontierSWE v2, a z Opusem o dziewięć w Terminal-Bench 4.0. Według Bloomberga część pracowników Google'a podejrzewa, że model szlifowano pod testy bardziej niż pod prawdziwą pracę. Na razie Argona dostały tylko zespoły bezpieczeństwa z programu Fairwind, a stawki 2 i 10 dolarów za milion tokenów podwoją się po promocji, więc przed przesiadką lepiej sprawdzić go na własnym repozytorium.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Model / Badania  ·  4 min  · 

Gemini 4 Argon prowadzi w jednym teście kodu z trzech
Ilustrację przygotowała AI.

Google pokazał w środę, 30 września, Gemini 4 Argon, długo wyczekiwany flagowy model, i podparł premierę wynikiem, który świetnie wygląda w nagłówku: 77,9% na DeepSWE v1.1, więcej niż GPT-6 Astra od OpenAI i Claude Opus 5.5 od Anthropica. Większość deweloperów nie może jednak na razie nigdzie tego modelu uruchomić, a w dniu premiery Bloomberg napisał, że część pracowników Google'a wątpi, czy Argon programuje tak dobrze, jak sugerują tabelki. Moim zdaniem jedno i drugie prowadzi do tego samego wniosku: o przydatności Argona w codziennej pracy z kodem rozstrzygną testy na cudzych repozytoriach, nie benchmarki dobrane przez Google.

Przewaga w jednym teście z trzech

DeepSWE v1.1 sprawdza, czy agent potrafi wprowadzić w prawdziwym repozytorium zmianę rozpisaną na wiele kroków i oddać działającą łatkę za pierwszym podejściem. Argon wygrywa tu o niecałe cztery punkty z Opusem i Astrą, jak wynika z porównania Google'a, które rozpisał Winbuzzer. To realna przewaga, ale zmierzona w warunkach wybranych przez Google. Argon rozwiązywał zadania w mini-swe, prostym, standardowym programie, który prowadzi model krok po kroku przez kolejne czynności. Wynik Astry wzięto z tablicy wyników benchmarku, a wynik Opusa z dokumentacji Anthropica, więc każdy model miał wokół siebie inne narzędzia.

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Wyspecjalizowany Gemini znajduje więcej luk niż Opus 4.6 Model / Badania

Wyspecjalizowany Gemini znajduje więcej luk niż Opus 4.6

4 min

Google DeepMind pokazał w zeszły wtorek Gemini 3.5 Flash Cyber, mały model wyostrzony pod jedno zadanie: szuka luk w cudzym kodzie, sam buduje działający exploit w piaskownicy, żeby odsiać fałszywe alarmy, i dopiero potem pisze łatkę. Na silniku JavaScriptu V8 wskazał 55 potwierdzonych błędów, wobec 47 od zwykłego 3.5 Flash i 36 od Claude Opus 4.6, bo nowszym rywalom w szukaniu luk przeszkadzają ich własne zabezpieczenia. Google wypuszcza go jednak wyłącznie dla rządów i zaufanych partnerów, więc najlepsze narzędzie tygodnia jest zarazem tym, do którego dostęp ma garstka.

Ten sam model, dwie warstwy, 36 punktów różnicy Model / Badania

Ten sam model, dwie warstwy, 36 punktów różnicy

5 min

ARC Prize przepuścił GPT-6 Astrę przez ten sam zestaw zadań dwa razy, przy identycznym poziomie rozumowania zmieniając tylko warstwę obsługującą model między ruchami, i dostał raz 62,71%, a raz 98,55%. Ta druga liczba poszła w świat jako dowód na AGI, choć opisuje całą konfigurację, a nie model, który kupujesz. Milion tokenów wyjściowych kosztuje 50 dolarów, dwa i pół raza więcej niż u Sola, a mimo to przebieg na średnim poziomie rozumowania zamknął implementację w 80 żądaniach zamiast 238 i wyszedł taniej. Zanim policzysz, ile kosztuje cię Astra, sprawdź, co masz wokół niej.

Kolejny model roboczy Google w miejscu obiecanego flagowca Model / Badania

Kolejny model roboczy Google w miejscu obiecanego flagowca

3 min

Google wypuścił Gemini 3.7 Flash zaledwie trzy tygodnie po wersji 3.6, znów model roboczy w miejscu obiecywanego flagowego Pro. Skok w benchmarkach jest realny, ale niewielki: na DeepSWE v1.1 wynik rośnie z 49,0% do 65,3%, a w rozumieniu dokumentów model bije Claude Sonnet 5 i GPT-5.6. Prawdziwa zmiana jest w cenie, 0,75 dolara za milion tokenów wejściowych, tyle że OpenAI zbiło stawkę swojej Luny do 0,20 dolara. Ryan Whitwam z Ars Technica pyta wprost, czy to szybszy rozwój, czy tylko szybsze wypuszczanie.