โอเพนซอร์ส · Apache 2.0 · ทำงานออฟไลน์ทั้งหมด

เสียงพูดบนอุปกรณ์
สำหรับผลิตภัณฑ์จริง

การถอดเสียงพร้อมแยกผู้พูด การโคลนเสียงแบบ zero-shot และการสังเคราะห์เสียงพูดยาว — ทำงานบน Apple Silicon, Android, Windows และ Linux แบบฝังตัว ไม่ต้องใช้ API บนคลาวด์ ไม่มีการคิดเงินรายนาที และไม่มีข้อมูลออกจากอุปกรณ์

Apple · Homebrew
brew install speech
Android · Gradle
implementation("audio.soniqo:speech:0.0.9")
บทความและวิดีโอล่าสุด
บทความทั้งหมด
YouTube · 90 วินาที

เอเจนต์เสียงออฟไลน์เต็มรูปแบบใน 1.2 GB บน Android

พูดเลย — Android จัดการให้: ลูปคำสั่งครบวงจรจากเสียงพูดสู่การกระทำจริงบนอุปกรณ์และคำตอบด้วยเสียง บนโทรศัพท์เครื่องเดียวด้วย RAM 1.2 GB — Silero VAD, Parakeet STT, tool call ของ FunctionGemma และ Pocket TTS

รับชม
YouTube · 4 นาที

AI เสียงแบบโลคัลบน MacBook — ทัวร์ 4 นาที

ทัวร์ไลบรารีโอเพนซอร์ส 4 นาที: ถอดความเรียลไทม์ด้วย Nemotron Streaming, เสียงสู่เสียงแบบโลคัลด้วย PersonaPlex และโคลนเสียง 48 kHz ด้วย VoxCPM2 — ทุกอย่างรันบนแล็ปท็อป

รับชม
7 กรกฎาคม 2026 · บล็อก Soniqo

เอเจนต์เสียงบนอุปกรณ์: หนึ่งไปป์ไลน์ สามงบหน่วยความจำ

VAD → STT → LLM → TTS บนมือถือและ Mac · iPhone ~1.2 GB · S23 ~1.5 GB · เดสก์ท็อป <4 GB

ไปป์ไลน์เอเจนต์ VAD → STT → LLM → TTS ชุดเดียวกันบน iPhone, Galaxy S23 และ Mac พร้อมหน่วยความจำที่วัดจริงต่อระดับ

อ่าน
2 กรกฎาคม 2026 · บล็อก Soniqo

โมเดลการโคลนเสียง วัดผลข้ามห้าภาษา

8 เอนจิน: โคไซน์, WER, UTMOS, RTF, RSS สูงสุด · แถวใหม่: F5-TTS, Higgs TTS 3, IndexTTS2 · ฟังเทียบเสียงอ้างอิงกับเสียงโคลนทุกภาษา

คู่ FLEURS สิบคู่ต่อภาษา: ความคล้ายผู้พูด, WER/CER, UTMOS, ความเร็วและหน่วยความจำ พร้อมเสียงให้ฟังตรวจสอบเอง

อ่าน
สิ่งที่คุณสร้างได้

สามกลุ่มกรณีใช้งานบนอุปกรณ์

แต่ละกลุ่มครอบคลุมหลายกรณีย่อยที่ประกอบขึ้นจากคอมโพเนนต์ของ Soniqo ส่งเสียงเข้ามา แล้วได้บทสนทนา ข้อความถอด หรือเสียงที่สร้างขึ้น — แบบโลคัล เรียลไทม์

การสนทนา

เอเจนต์เสียง

สร้างอินเตอร์เฟซที่เน้นเสียงเป็นหลัก — ตั้งแต่ speech-to-speech แบบ full-duplex ไปจนถึงไปป์ไลน์ประกอบที่ปลุกด้วยคำสั่งปลุก ทั้งหมดทำงานในเครื่อง

Learn more
การเข้าใจเสียง

การถอดเสียงเป็นข้อความ

แปลงเสียงเป็นข้อความที่มีโครงสร้าง — สตรีมมิ่งเรียลไทม์สำหรับคำบรรยายสดและการบอกพิมพ์ การประมวลผลแบบแบตช์ความแม่นยำสูงสำหรับคลังเก็บ พร้อมการแยกผู้พูดเพื่อระบุชื่อแต่ละคน

Learn more
การสร้างเนื้อหา

การสังเคราะห์เสียงพูด

สังเคราะห์เสียงพูดด้วยเสียงใดก็ได้ — โคลนเสียงในไม่กี่วินาที อ่านหนังสือเสียงได้นับชั่วโมง หรือสร้างพอดแคสต์หลายผู้พูด ทำงานออฟไลน์ทั้งหมด

Learn more
คอมโพเนนต์ทั้งหมด

มากกว่าสามสิบโมเดล หนึ่งสแต็ก

ไปป์ไลน์กรณีใช้งานด้านบนสร้างจากโมเดลเหล่านี้ เลือกคอมโพเนนต์เพื่ออ่านสถาปัตยกรรม CLI Swift API และ benchmark ทั้งหมดทำงานบน Apple Silicon ส่วนใหญ่ทำงานบน Android และ Linux ด้วย

ข้อความเป็นเสียงพูด