SmartDigest Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Model / Badania

Gemini 3.8 Live mówi dalej, kiedy myśli

Google wypuścił 15 września dwa modele głosowe, Gemini 3.8 Live do taniej obsługi dużego ruchu i wersję Extended Thinking, która rozumuje i mówi równocześnie, dzięki czemu rozmowa nie zamiera na czas wywołania narzędzia. Extended Thinking prowadzi w rankingu jakości rozmów Artificial Analysis z wynikiem 82,6 punktu, ale w bankowym wariancie testu agentowego τ-Voice domyka tylko 35,1% spraw, czyli dwie na trzy nie dochodzą do finału. Cennika Google nie podał, a przy rozmowie na żywo płaci się za godziny dźwięku, więc akurat ta liczba decyduje o sensie agenta na infolinii.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Model / Badania  ·  4 min  · 

Gemini 3.8 Live mówi dalej, kiedy myśli
Ilustrację przygotowała AI.

"Zaraz to sprawdzę", tyle mówi model, zanim w ogóle zabierze się do roboty. To jedno krótkie zdanie znaczy w ogłoszeniu Google z 15 września więcej niż cała tabelka wyników pod nim. Dotąd asystent głosowy, który musiał sięgnąć po coś z zewnątrz, milkł na te kilka sekund, a człowiek po drugiej stronie nie wiedział, czy rozmowa jeszcze trwa, czy już się urwała, więc zaczynał powtarzać pytanie.

Google wypuścił od razu dwie wersje. Gemini 3.8 Live ma tanio obsługiwać duży ruch, rozumie obraz z kamery i prowadzi płynną rozmowę. Wersja Extended Thinking bierze na siebie sprawy wielokrokowe i robi to, czego poprzednie modele Google nie robiły: rozumuje i mówi równocześnie, zamiast najpierw policzyć w ciszy, a potem odezwać się z gotową odpowiedzią.

Model mówi w trakcie, nie dopiero po wszystkim

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Google wypuścił model, który wycina z dyktowania każde "eee" Premiera / Narzędzie

Google wypuścił model, który wycina z dyktowania każde "eee"

3 min

Gemini 3.5 Transcribe, pokazany przez Google 26 sierpnia i dostępny w publicznym podglądzie w Gemini API, sam wycina z dyktowania wahania i poprawki, więc warstwy czyszczenia tekstu drugim wywołaniem modelu nie trzeba już dopisywać samemu. Google chwali się średnim WER 2,6% dla nagrań i 4,0% na żywo, ale na zestawie FLEURS ten sam model schodzi do 5,04% i 5,50%, a rozbicia na poszczególne języki nie publikuje, więc gdzie w tym wypada polski, trzeba zmierzyć samemu. Model przyjmuje własny słownik nazw i skrótów oraz rozdziela głosy do trzech mówców, tylko cennika w ogłoszeniu nie ma.

Agent Gemini może teraz działać w tle. Google nie mówi tylko, jak długo. Premiera / Narzędzie

Agent Gemini może teraz działać w tle. Google nie mówi tylko, jak długo.

3 min

7 lipca Google dołożył do Managed Agents w Gemini API cztery możliwości, a najważniejsza pozwala odpalić agenta w tle parametrem `background: true` i odpytywać go po identyfikatorze, zamiast trzymać kruche otwarte połączenie HTTP przez cały czas pracy. Doszły też połączenie wprost ze zdalnym serwerem MCP, wywoływanie własnych funkcji i odświeżanie poświadczeń w locie. Fundament jest solidny, tyle że brakuje jednej liczby: Google nie mówi, jak długo takie zadanie może chodzić w tle, zanim się urwie — a to funkcja, która ma sens wyłącznie dla długiej roboty.

Gemini przestaje oglądać całe wideo, żeby odpowiedzieć na jedno pytanie Model / Badania

Gemini przestaje oglądać całe wideo, żeby odpowiedzieć na jedno pytanie

3 min

Gemini nie musi już oglądać całego nagrania, żeby odpowiedzieć na jedno pytanie: od pierwszego września modele 3.7 Flash, 3.6 Flash i 3.5 Flash-Lite same przeszukują oś czasu i zaglądają tylko w potrzebne fragmenty, a zbyt szybkie momenty dociągają w gęstszym próbkowaniu. Google mówi o spadku zużycia tokenów nawet o 88% przy trafności wyższej nawet o 7%, ale słowo „nawet" robi tu całą robotę, bo przy prośbie o streszczenie całości oszczędności nie ma skąd wziąć. Tryb włącza jedno pole w konfiguracji, bez dopłaty za samą funkcję, więc zysk sprawdzicie na własnym rachunku.