
我们把完整的离线语音代理装进 Android 的 1.2 GB
说出指令,Android 立即执行:从语音到真实设备操作再到语音回复的完整闭环,在一部手机上以 1.2 GB 内存运行 — Silero VAD、Parakeet STT、FunctionGemma 工具调用与 Pocket TTS。

说出指令,Android 立即执行:从语音到真实设备操作再到语音回复的完整闭环,在一部手机上以 1.2 GB 内存运行 — Silero VAD、Parakeet STT、FunctionGemma 工具调用与 Pocket TTS。

4 分钟开源库导览:Nemotron Streaming 实时转写、PersonaPlex 本地语音对话、VoxCPM2 48 kHz 声音克隆 — 全部在笔记本上运行。
手机与 Mac 上的 VAD → STT → LLM → TTS · iPhone 约 1.2 GB · S23 约 1.5 GB · 桌面 <4 GB
同一条 VAD → STT → LLM → TTS 语音代理管线跑在 iPhone、Galaxy S23 与 Mac 上,并给出各内存预算的实测值。
8 个引擎:余弦、WER、UTMOS、RTF、峰值 RSS · 新增行:F5-TTS、Higgs TTS 3、IndexTTS2 · 每种语言可对听参考与克隆音频
每种语言 10 组 FLEURS 参考/目标对:说话人相似度、WER/CER、UTMOS、速度与内存,并附可亲耳验证的音频。
每个分组都涵盖多个由 Soniqo 组件拼接而成的子场景。投入音频,即可在本地、实时获得对话、转录或合成语音。
上面的用例流水线全部由这些模型拼接而成。点击组件查看其架构、CLI、Swift API 与基准测试。全部支持 Apple Silicon,多数也支持 Android 与 Linux。
52 langs, RTF 0.06, 4-/8-bit
Native CoreML: 1.40% WER, 6 s model load
MLX INT5: 128K offline context, RTF 0.028
Small, medium, large-v3, and turbo exports
32× real-time on Neural Engine
120M, 25 langs, streaming partials + EOU, ~232 MB on-device
1,672 languages, 300M–7B
14 langs, INT5 default, RTF 0.015
8 langs, INT5 default, RTF 0.074
Word-level timestamps, 80 ms
Streaming with punctuation
9 langs, zero-shot cloning, bf16 / 8-bit
12 Hz codec LM, faster than real-time
48 kHz, 30 langs, voice design + cloning
Zero-shot cloning, emotion + tempo controls, RTF 1.0
99M, 31 langs, 44.1 kHz
CoreML voice cloning, TTFT 0.27s, RTF 0.59
600+ langs, NAR diffusion cloning
Hindi emotion TTS + raw reference cloning
Style markers + zero-shot cloning
Zero-shot cloning in 16 flow steps, RTF 0.57
4B conversational cloning, emotion tags, RTF 0.78
54 voices, iOS-ready, 10 langs
English, ~130 ms streaming TTFA
90-min podcasts / audiobooks
9 langs, 5 baked voices, streaming
IndexTTS2, CosyVoice, Chatterbox Flash, Qwen3-TTS ICL
Masked WeSpeaker + native PLDA/VBx, ~32 MB
Community-1 + Pyannote + Sortformer
WeSpeaker / CAM++ for ID
Silero v6.2.1, Pyannote, FireRedVAD
KWS Zipformer, 26× real-time
44.1 kHz stereo, variable-length music
Text → 30 s music, RTF 0.36
Open-Unmix + HTDemucs v4, 4 stems
DeepFilterNet3, 48 kHz real-time
Two-stream echo cancellation, 16 ms latency
Sidon denoise + dereverb → 48 kHz
48 kHz audio super-resolution