Model / Badania
Kolejny model roboczy Google w miejscu obiecanego flagowca
Google wypuścił Gemini 3.7 Flash zaledwie trzy tygodnie po wersji 3.6, znów model roboczy w miejscu obiecywanego flagowego Pro. Skok w benchmarkach jest realny, ale niewielki: na DeepSWE v1.1 wynik rośnie z 49,0% do 65,3%, a w rozumieniu dokumentów model bije Claude Sonnet 5 i GPT-5.6. Prawdziwa zmiana jest w cenie, 0,75 dolara za milion tokenów wejściowych, tyle że OpenAI zbiło stawkę swojej Luny do 0,20 dolara. Ryan Whitwam z Ars Technica pyta wprost, czy to szybszy rozwój, czy tylko szybsze wypuszczanie.
Napisała AI, żeby oszczędzić Ci czytania setek źródeł. · Jak to działa
Model / Badania · 3 min ·
Trzy tygodnie. Tyle minęło od premiery Gemini 3.6 Flash, a 13 sierpnia Google ogłosił kolejny model z tej samej linii, Gemini 3.7 Flash. Flash od początku jest u Google linią do czarnej roboty: tani, szybki model, który odpala się masowo w agentach i na produkcji, podczas gdy najmocniejsze rozumowanie miał dawać flagowy Gemini Pro. Kłopot w tym, że flagowca wciąż nie ma. Pisałem o tym w lipcu, gdy według doniesień Google przegrywa w kodowaniu i zamiast zapowiadanego na czerwiec 3.5 Pro wypuścił tańsze Flashe. Miesiąc później zmienił się głównie numerek na kolejnym modelu roboczym.
Skok w benchmarkach jest realny, choć niewielki. Na DeepSWE v1.1, teście długich zadań inżynierskich, 3.7 Flash dochodzi do 65,3% z 49,0%, czyli rusza dokładnie stamtąd, gdzie zatrzymała się poprzednia wersja. Na FrontierCode 1.1 Main, zestawie 100 zadań programistycznych, w których kod musi przejść testy i trzymać się reguł stylu projektu, wynik rośnie z 34,4% do 43,6%. Google twierdzi, że na dziewięciu benchmarkach nowy model bije porównywalne modele Anthropic i OpenAI. Liczby są wyższe niż u poprzednika, ale trudno w nich dojrzeć powód, dla którego następca musi wyjść akurat trzy tygodnie po starym modelu.
Poza kodem 3.7 Flash lepiej radzi sobie z dokumentami. W teście GDP.pdf, który sprawdza rozumienie złożonych pism biznesowych, odpowiada poprawnie na 34% pytań, o 6 punktów lepiej niż Claude Sonnet 5 i o 9,3 punktu lepiej niż GPT-5.6 Terra. Ta sama umiejętność liczy się, gdy agent musi przekopać się przez długą specyfikację albo dokumentację techniczną, więc akurat tutaj przewaga nad konkurencją jest konkretna, a nie tylko deklarowana.
Czytaj dalej za darmo
Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.