Qualquer voz.
Qualquer duração.
Três formas de geração de voz — clone uma voz em segundos a partir de um clipe curto, renderize TTS neutro de alta qualidade mais rápido que tempo real, ou produza audiolivros de uma hora e podcasts multi-locutor. Tudo no dispositivo.
Três sabores de síntese.
Clonagem zero-shot para vozes personalizadas, TTS neutro rápido para UI de app, ou longa duração para narração e diálogo. Motores diferentes, a mesma stack no dispositivo.
Clone uma voz a partir de um clipe curto. Use IndexTTS2 para clonagem MLX nativa com controles de emoção e tempo, CosyVoice 3 para zero-shot multilíngue condicionado por transcrição, Chatterbox Flash para CoreML ou Qwen3-TTS ICL para EN/ZH.
Voz neutra de alta qualidade, mais rápida que tempo real. Bundles compactos para UI de app, acessibilidade e narração in-app.
Capítulos de audiolivro com um narrador consistente, ou podcasts multi-locutor de até 90 min com tags inline de locutor.
