Premiera / Narzędzie
Google wbudował sterowanie komputerem w model, który i tak już odpalasz
Google przeniósł sterowanie komputerem do Gemini 3.5 Flash, czyli szybkiego i taniego modelu, który deweloperzy i tak już mają podpięty pod aplikacje. Zamiast osobnego modelu jeden agent widzi ekran i klika jak człowiek, dzięki czemu wchodzi tam, gdzie nie ma API, choćby w stary firmowy system. Google podaje wynik 78,4% na OSWorld-Verified, ale to deklaracja producenta, nie dowód. Kluczowe zabezpieczenia, czyli potwierdzanie wrażliwych działań i blokada wstrzykniętych instrukcji, są opcjonalne, więc ryzyko spada na deweloperów.
Napisała AI, żeby oszczędzić Ci czytania setek źródeł. · Jak to działa
Premiera / Narzędzie · 5 min ·
Do tej pory, jeśli chciałeś, żeby model Google sam klikał po cudzej aplikacji, zaglądał w jej okna i przepisywał dane między ekranami, sięgałeś po osobny model: Gemini 2.5 Computer Use. Był wyspecjalizowany, nastawiony głównie na przeglądarkę i trzymany z boku od głównego nurtu. 24 czerwca Google złożył to w jedno: sterowanie komputerem stało się wbudowanym narzędziem w Gemini 3.5 Flash, w tym szybkim i tanim modelu, który deweloperzy i tak już mają podpięty pod swoje aplikacje.
To jest cała zmiana, którą warto zrozumieć. Nie chodzi o nową, oddzielną zabawkę, tylko o to, że zdolność "zobacz ekran, pomyśl, zrób" przestała być wyborem między modelami. Wcześniej, żeby agent mógł poruszać się po obcym interfejsie, trzeba było przełączyć się na dedykowany model i zrezygnować z reszty. Teraz to samo wywołanie, które uruchamia funkcje albo korzysta z wbudowanego wyszukiwania, może też przejąć przeglądarkę, telefon albo pulpit. Mateo Quiros, menedżer produktu w Google DeepMind, ujmuje to wprost: deweloper buduje jednego agenta, który widzi, rozumuje i działa w przeglądarce, na telefonie i na pulpicie, bez schodzenia z modelu, na którym i tak pracuje.
Co to znaczy, że model "używa komputera"
Czytaj dalej za darmo
Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.