SmartDigest Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Premiera / Narzędzie

Google wbudował sterowanie komputerem w model, który i tak już odpalasz

Google przeniósł sterowanie komputerem do Gemini 3.5 Flash, czyli szybkiego i taniego modelu, który deweloperzy i tak już mają podpięty pod aplikacje. Zamiast osobnego modelu jeden agent widzi ekran i klika jak człowiek, dzięki czemu wchodzi tam, gdzie nie ma API, choćby w stary firmowy system. Google podaje wynik 78,4% na OSWorld-Verified, ale to deklaracja producenta, nie dowód. Kluczowe zabezpieczenia, czyli potwierdzanie wrażliwych działań i blokada wstrzykniętych instrukcji, są opcjonalne, więc ryzyko spada na deweloperów.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Premiera / Narzędzie  ·  5 min  · 

Google wbudował sterowanie komputerem w model, który i tak już odpalasz
Ilustrację przygotowała AI.

Do tej pory, jeśli chciałeś, żeby model Google sam klikał po cudzej aplikacji, zaglądał w jej okna i przepisywał dane między ekranami, sięgałeś po osobny model: Gemini 2.5 Computer Use. Był wyspecjalizowany, nastawiony głównie na przeglądarkę i trzymany z boku od głównego nurtu. 24 czerwca Google złożył to w jedno: sterowanie komputerem stało się wbudowanym narzędziem w Gemini 3.5 Flash, w tym szybkim i tanim modelu, który deweloperzy i tak już mają podpięty pod swoje aplikacje.

To jest cała zmiana, którą warto zrozumieć. Nie chodzi o nową, oddzielną zabawkę, tylko o to, że zdolność "zobacz ekran, pomyśl, zrób" przestała być wyborem między modelami. Wcześniej, żeby agent mógł poruszać się po obcym interfejsie, trzeba było przełączyć się na dedykowany model i zrezygnować z reszty. Teraz to samo wywołanie, które uruchamia funkcje albo korzysta z wbudowanego wyszukiwania, może też przejąć przeglądarkę, telefon albo pulpit. Mateo Quiros, menedżer produktu w Google DeepMind, ujmuje to wprost: deweloper buduje jednego agenta, który widzi, rozumuje i działa w przeglądarce, na telefonie i na pulpicie, bez schodzenia z modelu, na którym i tak pracuje.

Co to znaczy, że model "używa komputera"

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Google przyznaje, że przegrywa w kodowaniu, a zamiast flagowca wypuszcza tańszy model Model / Badania

Google przyznaje, że przegrywa w kodowaniu, a zamiast flagowca wypuszcza tańszy model

4 min

Sundar Pichai na telekonferencji wynikowej przyznał, że Google wypada słabiej w kodowaniu i kodowaniu agentowym. Flagowy Gemini 3.5 Pro, planowany na czerwiec, wciąż się nie pojawił, bo jego wyniki w programowaniu rozczarowały. Zamiast niego Google wypuściło tańsze modele Flash, z Gemini 3.6 Flash na czele, który na benchmarku DeepSWE zużywa do 65% mniej tokenów i podniósł wynik z 37% do 49%. Prawdziwy problem to jednak nie harmonogram premier, tylko brak własnego narzędzia do kodu zbierającego dane o tym, jak ludzie realnie programują z modelem.

Najmocniejszym argumentem za Gemini 3.8 Flash jest opinia inżynierów Google Model / Badania

Najmocniejszym argumentem za Gemini 3.8 Flash jest opinia inżynierów Google

4 min

Google wypuścił 2 września Gemini 3.8 Flash i nie ruszył cennika, bo milion tokenów wejściowych nadal kosztuje 0,75 dolara, tyle że model myśli dłużej i koszt przerobienia jednego zadania urósł według Artificial Analysis z 0,40 do 0,58 dolara, czyli o 45%. Porównania jeden do jednego z Claude Opus 5 Google nie pokazał, a wariant Flash Cyber, który według zespołu Chrome'a pisze 2,6 razy więcej trafnych łatek, trafia tylko do wybranych instytucji przez program Fairwind. Najmocniejszym publicznym argumentem zostaje więc to, że model spodobał się inżynierom samego Google.

Wyspecjalizowany Gemini znajduje więcej luk niż Opus 4.6 Model / Badania

Wyspecjalizowany Gemini znajduje więcej luk niż Opus 4.6

4 min

Google DeepMind pokazał w zeszły wtorek Gemini 3.5 Flash Cyber, mały model wyostrzony pod jedno zadanie: szuka luk w cudzym kodzie, sam buduje działający exploit w piaskownicy, żeby odsiać fałszywe alarmy, i dopiero potem pisze łatkę. Na silniku JavaScriptu V8 wskazał 55 potwierdzonych błędów, wobec 47 od zwykłego 3.5 Flash i 36 od Claude Opus 4.6, bo nowszym rywalom w szukaniu luk przeszkadzają ich własne zabezpieczenia. Google wypuszcza go jednak wyłącznie dla rządów i zaufanych partnerów, więc najlepsze narzędzie tygodnia jest zarazem tym, do którego dostęp ma garstka.