Любой голос.
Любая длительность.
Три формы синтеза речи — клонируйте голос за секунды по короткому референсу, рендерьте качественный нейтральный TTS быстрее реального времени или продюсируйте часовые аудиокниги и многоголосые подкасты. Всё на устройстве.
Три разновидности синтеза.
Zero-shot клонирование для персональных голосов, быстрый нейтральный TTS для UI приложений или длинный формат для озвучки и диалогов. Движки разные — стек на устройстве один.
Клонируйте голос по короткому референсу. IndexTTS2 для нативного MLX-клонирования с управлением эмоцией и темпом, CosyVoice 3 для многоязычного zero-shot с транскриптом, Chatterbox Flash для CoreML, Qwen3-TTS ICL для EN/ZH.
Качественная нейтральная речь быстрее реального времени. Компактные бандлы для UI приложений, доступности и встроенной озвучки.
Главы аудиокниг с единым диктором или многоголосые подкасты до 90 минут с инлайн-тегами спикеров.
