SmartDigest.ai Tworzone przez AI, żeby nadążyć za AI
Zapisz się

Zapisz się do newslettera

Co tydzień najważniejsze newsy AI prosto na Twój e-mail. Wybierz tematy, które Cię interesują.

Premiera / Narzędzie

Eleven v4 od ElevenLabs: głos, który słucha poleceń zapisanych w nawiasach

ElevenLabs wypuściło pod koniec września Eleven v4, model mowy z emocjami, oraz jego szybszą odmianę Turbo dla agentów głosowych rozmawiających na żywo. Sposób mówienia wpisuje się wprost w tekst poleceniami w nawiasach, takimi jak [laughs] czy [light rain], więc reżyserię może pisać ten sam model językowy, który układa odpowiedź agenta. Turbo potrzebuje około 150 ms do pierwszego słyszalnego dźwięku, ale to pomiar samego producenta bez łącza użytkownika, a wśród próbek w ogłoszeniu nie ma ani jednej po polsku.

Napisała AI, żeby oszczędzić Ci czytania setek źródeł.  ·  Jak to działa

Premiera / Narzędzie  ·  4 min  · 

Eleven v4 od ElevenLabs: głos, który słucha poleceń zapisanych w nawiasach
Ilustrację przygotowała AI.

Zdanie "Potrzebuję, żebyś zachował spokój" brzmi inaczej, gdy lekarz mówi je łagodnie do przestraszonego pacjenta, a inaczej, gdy dowódca w grze krzyczy je do oddziału tuż przed zrzutem na pole walki. Na przykładzie tego jednego zdania ElevenLabs, firma, która od kilku lat sprzedaje przez API syntezę mowy, pokazuje różnicę, o którą chodzi w jej nowych modelach. Pod koniec września wypuściła Eleven v4, który ma mówić z emocjami, i jego szybszą odmianę, Eleven v4 Turbo, która ma robić to samo w agentach głosowych odpowiadających na żywo w trakcie rozmowy. Nowy model ma sam wyczytać z kontekstu, o którą z tych dwóch sytuacji chodzi.

Dla kogoś, kto pisze aplikacje z głosem, liczy się tu przede wszystkim jedna zmiana: sposób mówienia staje się częścią tekstu, który wysyłasz do API. Reszta ogłoszenia to głównie liczby, które ElevenLabs zmierzyło samo, więc traktuję je jako deklaracje producenta, a nie niezależne pomiary.

Reżyseria wpisana w tekst

Czytaj dalej za darmo

Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.

Powiązane

Nowy głos ChatGPT brzmi jak rozmowa, ale API dopiero w planach Model / Badania

Nowy głos ChatGPT brzmi jak rozmowa, ale API dopiero w planach

3 min

OpenAI wymieniło silnik głosowy ChatGPT na nowy model GPT-Live, który od 8 lipca jest domyślnym trybem głosowym w konsumenckiej wersji, od darmowych kont po Pro. Nowość to full-duplex: model słucha i mówi jednocześnie, można mu przerwać w pół zdania, a ciężkie myślenie oddaje w tle mocniejszemu GPT-5.5, żeby rozmowa się nie zawieszała. Problem w tym, że cała architektura żyje wyłącznie w oknie czatu: API dopiero ma się pojawić, bez daty, cennika i limitów, więc programista nie postawi na niej na razie ani linijki.

Model głosowy, który wie, kiedy się nie odzywać Premiera / Narzędzie

Model głosowy, który wie, kiedy się nie odzywać

4 min

OpenAI wystawiło w API GPT-Live-1, model, który słucha i mówi jednocześnie, więc na wejście w słowo reaguje w trakcie, a nie po fakcie, i zdejmuje z dewelopera sklejanie rozpoznawania mowy, modelu od odpowiedzi i syntezy głosu. Cięższe myślenie oddaje modelowi zaplecza, dzięki czemu rozmowa toczy się dalej, kiedy w tle trwa robota. Aplikacja Speak policzyła na własnych uczniach, że nowy model wchodzi im w słowo o niemal 80% rzadziej, a warstwa głosowa kosztuje 0,05 dolara za minutę, czyli 3 dolary za godzinę rozmowy, przy czym model zaplecza rozlicza się osobno.

Jedno wywołanie MCP i Claude Code czyta ci wynik na głos Premiera / Narzędzie

Jedno wywołanie MCP i Claude Code czyta ci wynik na głos

3 min

Voicebox, otwarty projekt Jamiego Pine'a na licencji MIT, zbiera obie strony głosu lokalnie i podpina je do agentów kodujących przez MCP. Jedno wywołanie sprawia, że Claude Code czy Cursor mówią na głos, co skończyły, a dyktowanie na wejściu chodzi na Whisperze, przy czym modele i próbki głosu zostają na dysku i nic nie wychodzi do chmury. Najbardziej broni się powiadamianie głosem przy długich zadaniach oraz dyktowanie dłuższych myśli, bo klonowanie własnego głosu to raczej nowinka, a wpadanie transkrypcji prosto w pole tekstowe działa na razie tylko na macOS.