
완전 오프라인 음성 에이전트를 Android의 1.2 GB에 담았습니다
말하면 Android가 실행합니다: 음성에서 실제 기기 동작, 음성 응답까지의 전체 명령 루프가 폰 한 대, RAM 1.2 GB에서 동작 — Silero VAD, Parakeet STT, FunctionGemma 툴 콜, Pocket TTS.

말하면 Android가 실행합니다: 음성에서 실제 기기 동작, 음성 응답까지의 전체 명령 루프가 폰 한 대, RAM 1.2 GB에서 동작 — Silero VAD, Parakeet STT, FunctionGemma 툴 콜, Pocket TTS.

4분 오픈소스 라이브러리 투어: Nemotron Streaming 실시간 전사, PersonaPlex 로컬 음성 대화, VoxCPM2 48 kHz 클로닝 — 전부 노트북에서 실행.
폰과 Mac에서 VAD → STT → LLM → TTS · iPhone 약 1.2 GB · S23 약 1.5 GB · 데스크톱 <4 GB
동일한 VAD → STT → LLM → TTS 에이전트 파이프라인을 iPhone·Galaxy S23·Mac에서 실행하고 예산별 실측 메모리를 제시.
8개 엔진: 코사인·WER·UTMOS·RTF·피크 RSS · 신규 행: F5-TTS, Higgs TTS 3, IndexTTS2 · 언어별 참조·클론 오디오 비교 청취
언어당 10쌍의 FLEURS 참조/타깃: 화자 유사도, WER/CER, UTMOS, 속도, 메모리 — 귀로 확인할 오디오 포함.
각 그룹은 Soniqo 컴포넌트로 엮은 여러 하위 사용 사례를 다룹니다. 오디오를 넣으면 대화·전사·생성된 음성이 로컬에서 실시간으로 돌아옵니다.
위 유스케이스 파이프라인은 모두 이 모델들로 구성됩니다. 컴포넌트를 골라 아키텍처·CLI·Swift API·벤치마크를 확인하세요. 전부 Apple Silicon에서 동작하고 대부분 Android·Linux에서도 동작합니다.
52 langs, RTF 0.06, 4-/8-bit
Native CoreML: 1.40% WER, 6 s model load
MLX INT5: 128K offline context, RTF 0.028
Small, medium, large-v3, and turbo exports
32× real-time on Neural Engine
120M, 25 langs, streaming partials + EOU, ~232 MB on-device
1,672 languages, 300M–7B
14 langs, INT5 default, RTF 0.015
8 langs, INT5 default, RTF 0.074
Word-level timestamps, 80 ms
Streaming with punctuation
9 langs, zero-shot cloning, bf16 / 8-bit
12 Hz codec LM, faster than real-time
48 kHz, 30 langs, voice design + cloning
Zero-shot cloning, emotion + tempo controls, RTF 1.0
99M, 31 langs, 44.1 kHz
CoreML voice cloning, TTFT 0.27s, RTF 0.59
600+ langs, NAR diffusion cloning
Hindi emotion TTS + raw reference cloning
Style markers + zero-shot cloning
Zero-shot cloning in 16 flow steps, RTF 0.57
4B conversational cloning, emotion tags, RTF 0.78
54 voices, iOS-ready, 10 langs
English, ~130 ms streaming TTFA
90-min podcasts / audiobooks
9 langs, 5 baked voices, streaming
IndexTTS2, CosyVoice, Chatterbox Flash, Qwen3-TTS ICL
Masked WeSpeaker + native PLDA/VBx, ~32 MB
Community-1 + Pyannote + Sortformer
WeSpeaker / CAM++ for ID
Silero v6.2.1, Pyannote, FireRedVAD
KWS Zipformer, 26× real-time
44.1 kHz stereo, variable-length music
Text → 30 s music, RTF 0.36
Open-Unmix + HTDemucs v4, 4 stems
DeepFilterNet3, 48 kHz real-time
Two-stream echo cancellation, 16 ms latency
Sidon denoise + dereverb → 48 kHz
48 kHz audio super-resolution