Neue TTS-Modelle von Google: Gestaltung von KI-Stimmen aus Textbeschreibungen
1 Min. Lesezeit
KI für Softwareentwicklung (Copilots, SDLC, Testing)
-/5
Kurz zusammengefasst
- Google hat mit den Modellen Gemini 3.8 Flash TTS und Flash-Lite TTS zwei neue Text-to-Speech-Technologien eingeführt, die über 100 Sprachen unterstützen.
- Besonders hervorzuheben ist die Fähigkeit von Flash TTS, neue Stimmen basierend auf Textbeschreibungen zu kreieren.
- Beide Modelle ermöglichen es Nutzern, Regieanweisungen für einzelne Textzeilen hinzuzufügen und sogar Dialoge mit zwei Stimmen aus einem einzigen Skript zu generieren.
Google hat mit den Modellen Gemini 3.8 Flash TTS und Flash-Lite TTS zwei neue Text-to-Speech-Technologien eingeführt, die über 100 Sprachen unterstützen. Besonders hervorzuheben ist die Fähigkeit von Flash TTS, neue Stimmen basierend auf Textbeschreibungen zu kreieren. Beide Modelle ermöglichen es Nutzern, Regieanweisungen für einzelne Textzeilen hinzuzufügen und sogar Dialoge mit zwei Stimmen aus einem einzigen Skript zu generieren. Zudem bietet eine Voice-Cloning-Funktion die Möglichkeit, ein Stimmprofil aus einer 30-sekündigen Sprachprobe zu erstellen. Diese Entwicklungen könnten die Art und Weise, wie Unternehmen KI-gestützte Sprachlösungen implementieren, erheblich verändern. Dennoch bleibt abzuwarten, wie sich diese Technologien im Wettbewerb behaupten und welche regulatorischen Rahmenbedingungen sich in Zukunft ergeben werden.
Quelle: