OmniVoice โมเดล TTS 600+ ภาษา โคลนเสียงจากคลิป 3 วินาที เปิดซอร์สฟรี ทีม k2-fsa เปิดตัว OmniVoice โมเดลแปลงข้อความเป็นเสียงพูด (text-to-speech) แบบ zero-shot ที่รองรับมากกว่า 600 ภาษา ซึ่งเป็นความครอบคลุมภาษาที่กว้างที่สุดในบรรดาโมเดล TTS แบบ zero-shot ที่มีอยู่ในปัจจุบัน โดยใช้สถาปัตยกรรม diffusion language model แบบใหม่ และรองรับทั้งการโคลนเสียง (voice cloning) และการออกแบบเสียง (voice design) [1] สถาปัตยกรรมและจุดเด่น OmniVoice สร้างบนสถาปัตยกรรม diffusion language model ซึ่งต่างจากโมเดล TTS แบบ autoregressive ทั่วไป โดยให้คุณภาพเสียงสูงพร้อมความเร็วในการประมวลผลที่เหนือกว่า จุดเด่นหลักของโมเดลประกอบด้วย: 600+ ภาษา: ความครอบคลุมภาษาที่กว้างที่สุดในบรรดาโมเดล TTS แบบ zero-shot ครอบคลุมทั้งภาษาหลักและภาษาท้องถิ่นจำนวนมาก การโคลนเสียง: โคลนเสียงจากคลิปอ้างอิงสั้น ๆ เพียง 3-15 วินาที การออกแบบเสียง: สร้างเสียงตามคำสั่ง เช่น "เสียงผู้ชาย สำเนียงอังกฤษ" Zero-shot: ไม่ต้องเทรนเพิ่มต่อภาษา ใช้ได้ทันที วิธีใช้งาน OmniVoice ใช้งานได้ผ่าน Python API และ command-line tools โดยรองรับทั้ง CUDA, Apple Silicon (MPS) และ Intel Arc GPU (XPU) ตัวอย่างการโคลนเสียงด้วย Python: from omnivoice import OmniVoice import soundfile as sf import torch model = OmniVoice.from_pretrained( "k2-fsa/OmniVoice", device_map="cuda:0", dtype=torch.float16 ) audio = model.generate( text="Hello, this is a test of zero-shot voice cloning.", ref_audio="ref.wav", ref_text="Transcription of the reference audio.", ) sf.write("out.wav", audio[0], 24000) สำหรับการออกแบบเสียงโดยไม่ต้องมีคลิปอ้างอิง ใช้คำสั่ง instruct แทน: omnivoice-infer --model k2-fsa/OmniVoice \ --text "This is a test for text to speech." \ --instruct "male, British accent" \ --output hello.wav การเข้าถึงและระบบนิเวศ OmniVoice เผยแพร่เป็นโอเพนซอร์สบน GitHub และ Hugging Face [2] โดยมีงานวิจัยรองรับใน arXiv (arXiv:2604.00688) [3] ทีมผู้พัฒนาประกอบด้วยนักวิจัยจาก k2-fsa ซึ่งเป็นกลุ่มเดียวกับผู้พัฒนา k2 และ icefall ที่เป็นเครื่องมือรู้จำเสียงยอดนิยม นอกจาก Python API แล้ว ยังมีผู้พัฒนาชุมชนสร้างส่วนขยายให้ใช้งานในระบบนิเวศต่าง ๆ เช่น ComfyUI (ผ่าน ComfyUI-OmniVoice-TTS) และ Home Assistant สำหรับผู้ที่ต้องการรัน TTS บนเครื่องตัวเอง ผลกระทบต่อคนไทย สำหรับผู้ใช้และนักพัฒนาไทย OmniVoice มีความน่าสนใจหลายจุด ประการแรกคือการรองรับภาษาไทยในกลุ่ม 600+ ภาษา ซึ่งเปิดทางให้สร้างเสียงพูดภาษาไทยคุณภาพสูงบนเครื่องตัวเองโดยไม่ต้องพึ่งบริการคลาวด์ ประการที่สองคือการโคลนเสียงจากคลิปสั้น 3-15 วินาที ซึ่งต่ำพอสำหรับการสร้างเสียงพากย์หรือเสียงอ่านบทความโดยใช้เสียงอ้างอิงเพียงเล็กน้อย ประการที่สามคือการเป็นโอเพนซอร์ส ทำให้ผู้พัฒนาสามารถรันบนเครื่องตัวเองได้โดยไม่ต้องจ่ายค่า API และควบคุมข้อมูลได้เต็มที่ ซึ่งสอดคล้องกับแนวโน้ม local AI ที่กำลังเติบโต แต่ควรระลึกว่าการโคลนเสียงมีประเด็นด้านจริยธรรมและการยินยอม ผู้ใช้ควรตรวจสอบสิทธิ์ในการใช้เสียงอ้างอิงก่อนนำไปใช้จริง แหล่งอ้างอิง [1] k2-fsa/OmniVoice, GitHub (2026), https://github.com/k2-fsa/OmniVoice [2] k2-fsa/OmniVoice, Hugging Face (2026), https://huggingface.co/k2-fsa/OmniVoice [3] Zhu et al., "OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models" (arXiv:2604.00688, 2026), https://arxiv.org/abs/2604.00688