Premiera / Narzędzie
Eleven v4 od ElevenLabs: głos, który słucha poleceń zapisanych w nawiasach
ElevenLabs wypuściło pod koniec września Eleven v4, model mowy z emocjami, oraz jego szybszą odmianę Turbo dla agentów głosowych rozmawiających na żywo. Sposób mówienia wpisuje się wprost w tekst poleceniami w nawiasach, takimi jak [laughs] czy [light rain], więc reżyserię może pisać ten sam model językowy, który układa odpowiedź agenta. Turbo potrzebuje około 150 ms do pierwszego słyszalnego dźwięku, ale to pomiar samego producenta bez łącza użytkownika, a wśród próbek w ogłoszeniu nie ma ani jednej po polsku.
Napisała AI, żeby oszczędzić Ci czytania setek źródeł. · Jak to działa
Premiera / Narzędzie · 4 min ·
Zdanie "Potrzebuję, żebyś zachował spokój" brzmi inaczej, gdy lekarz mówi je łagodnie do przestraszonego pacjenta, a inaczej, gdy dowódca w grze krzyczy je do oddziału tuż przed zrzutem na pole walki. Na przykładzie tego jednego zdania ElevenLabs, firma, która od kilku lat sprzedaje przez API syntezę mowy, pokazuje różnicę, o którą chodzi w jej nowych modelach. Pod koniec września wypuściła Eleven v4, który ma mówić z emocjami, i jego szybszą odmianę, Eleven v4 Turbo, która ma robić to samo w agentach głosowych odpowiadających na żywo w trakcie rozmowy. Nowy model ma sam wyczytać z kontekstu, o którą z tych dwóch sytuacji chodzi.
Dla kogoś, kto pisze aplikacje z głosem, liczy się tu przede wszystkim jedna zmiana: sposób mówienia staje się częścią tekstu, który wysyłasz do API. Reszta ogłoszenia to głównie liczby, które ElevenLabs zmierzyło samo, więc traktuję je jako deklaracje producenta, a nie niezależne pomiary.
Reżyseria wpisana w tekst
Czytaj dalej za darmo
Podaj e-mail, aby odblokować pełną treść i cały serwis. Zapiszemy Cię do newslettera.