SmartDigest Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Model / Badania

Kolejny model roboczy Google w miejscu obiecanego flagowca

Google wypuścił Gemini 3.7 Flash zaledwie trzy tygodnie po wersji 3.6, znów model roboczy w miejscu obiecywanego flagowego Pro. Skok w benchmarkach jest realny, ale niewielki: na DeepSWE v1.1 wynik rośnie z 49,0% do 65,3%, a w rozumieniu dokumentów model bije Claude Sonnet 5 i GPT-5.6. Prawdziwa zmiana jest w cenie, 0,75 dolara za milion tokenów wejściowych, tyle że OpenAI zbiło stawkę swojej Luny do 0,20 dolara. Ryan Whitwam z Ars Technica pyta wprost, czy to szybszy rozwój, czy tylko szybsze wypuszczanie.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Model / Badania  ·  3 min  · 

Kolejny model roboczy Google w miejscu obiecanego flagowca
Ilustrację przygotowała AI.

Trzy tygodnie. Tyle minęło od premiery Gemini 3.6 Flash, a 13 sierpnia Google ogłosił kolejny model z tej samej linii, Gemini 3.7 Flash. Flash od początku jest u Google linią do czarnej roboty: tani, szybki model, który odpala się masowo w agentach i na produkcji, podczas gdy najmocniejsze rozumowanie miał dawać flagowy Gemini Pro. Kłopot w tym, że flagowca wciąż nie ma. Pisałem o tym w lipcu, gdy według doniesień Google przegrywa w kodowaniu i zamiast zapowiadanego na czerwiec 3.5 Pro wypuścił tańsze Flashe. Miesiąc później zmienił się głównie numerek na kolejnym modelu roboczym.

Skok w benchmarkach jest realny, choć niewielki. Na DeepSWE v1.1, teście długich zadań inżynierskich, 3.7 Flash dochodzi do 65,3% z 49,0%, czyli rusza dokładnie stamtąd, gdzie zatrzymała się poprzednia wersja. Na FrontierCode 1.1 Main, zestawie 100 zadań programistycznych, w których kod musi przejść testy i trzymać się reguł stylu projektu, wynik rośnie z 34,4% do 43,6%. Google twierdzi, że na dziewięciu benchmarkach nowy model bije porównywalne modele Anthropic i OpenAI. Liczby są wyższe niż u poprzednika, ale trudno w nich dojrzeć powód, dla którego następca musi wyjść akurat trzy tygodnie po starym modelu.

Poza kodem 3.7 Flash lepiej radzi sobie z dokumentami. W teście GDP.pdf, który sprawdza rozumienie złożonych pism biznesowych, odpowiada poprawnie na 34% pytań, o 6 punktów lepiej niż Claude Sonnet 5 i o 9,3 punktu lepiej niż GPT-5.6 Terra. Ta sama umiejętność liczy się, gdy agent musi przekopać się przez długą specyfikację albo dokumentację techniczną, więc akurat tutaj przewaga nad konkurencją jest konkretna, a nie tylko deklarowana.

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Najmocniejszym argumentem za Gemini 3.8 Flash jest opinia inżynierów Google Model / Badania

Najmocniejszym argumentem za Gemini 3.8 Flash jest opinia inżynierów Google

4 min

Google wypuścił 2 września Gemini 3.8 Flash i nie ruszył cennika, bo milion tokenów wejściowych nadal kosztuje 0,75 dolara, tyle że model myśli dłużej i koszt przerobienia jednego zadania urósł według Artificial Analysis z 0,40 do 0,58 dolara, czyli o 45%. Porównania jeden do jednego z Claude Opus 5 Google nie pokazał, a wariant Flash Cyber, który według zespołu Chrome'a pisze 2,6 razy więcej trafnych łatek, trafia tylko do wybranych instytucji przez program Fairwind. Najmocniejszym publicznym argumentem zostaje więc to, że model spodobał się inżynierom samego Google.

Google przyznaje, że przegrywa w kodowaniu, a zamiast flagowca wypuszcza tańszy model Model / Badania

Google przyznaje, że przegrywa w kodowaniu, a zamiast flagowca wypuszcza tańszy model

4 min

Sundar Pichai na telekonferencji wynikowej przyznał, że Google wypada słabiej w kodowaniu i kodowaniu agentowym. Flagowy Gemini 3.5 Pro, planowany na czerwiec, wciąż się nie pojawił, bo jego wyniki w programowaniu rozczarowały. Zamiast niego Google wypuściło tańsze modele Flash, z Gemini 3.6 Flash na czele, który na benchmarku DeepSWE zużywa do 65% mniej tokenów i podniósł wynik z 37% do 49%. Prawdziwy problem to jednak nie harmonogram premier, tylko brak własnego narzędzia do kodu zbierającego dane o tym, jak ludzie realnie programują z modelem.

Wyspecjalizowany Gemini znajduje więcej luk niż Opus 4.6 Model / Badania

Wyspecjalizowany Gemini znajduje więcej luk niż Opus 4.6

4 min

Google DeepMind pokazał w zeszły wtorek Gemini 3.5 Flash Cyber, mały model wyostrzony pod jedno zadanie: szuka luk w cudzym kodzie, sam buduje działający exploit w piaskownicy, żeby odsiać fałszywe alarmy, i dopiero potem pisze łatkę. Na silniku JavaScriptu V8 wskazał 55 potwierdzonych błędów, wobec 47 od zwykłego 3.5 Flash i 36 od Claude Opus 4.6, bo nowszym rywalom w szukaniu luk przeszkadzają ich własne zabezpieczenia. Google wypuszcza go jednak wyłącznie dla rządów i zaufanych partnerów, więc najlepsze narzędzie tygodnia jest zarazem tym, do którego dostęp ma garstka.