Jede Stimme.
Jede Länge.
Drei Ausprägungen von Sprachsynthese — klone eine Stimme in Sekunden aus einem kurzen Referenz-Clip, rendere hochwertige neutrale TTS schneller als Echtzeit oder produziere stundenlange Hörbücher und Multi-Sprecher-Podcasts. Alles auf dem Gerät.
Drei Geschmacksrichtungen der Synthese.
Zero-Shot-Klonung für personalisierte Stimmen, schnelle neutrale TTS für App-UI oder Langform für Narration und Dialog. Verschiedene Engines, derselbe On-Device-Stack.
Klone eine Stimme aus einem kurzen Referenzclip. IndexTTS2 für natives MLX-Cloning mit Emotions- und Tempokontrollen, CosyVoice 3 für transkriptkonditioniertes mehrsprachiges Zero-Shot, Chatterbox Flash für CoreML, Qwen3-TTS ICL für EN/ZH.
Hochwertige neutrale Sprache, schneller als Echtzeit. Kompakte Bundles für App-UI, Barrierefreiheit und In-App-Narration.
Hörbuchkapitel mit einer konsistenten Erzählerstimme oder Multi-Sprecher-Podcasts bis 90 min mit Inline-Sprecher-Tags.
