VoxCPM2: เปลี่ยนข้อความเป็นเสียงพูดได้สมจริง รองรับ 30 ภาษา พร้อมฟีเจอร์สุดล้ำ

เคยคิดไหมว่าการสร้างเสียงพูดสังเคราะห์ที่เหมือนจริง จะสามารถทำได้ง่ายและหลากหลายขนาดนี้? วันนี้เรามีเทคโนโลยีที่น่าสนใจมาแนะนำ นั่นคือ VoxCPM2 ระบบ Text-to-Speech (TTS) แบบใหม่ล่าสุด ที่ไม่ใช้ Tokenizer ทำให้การสร้างเสียงพูดเป็นธรรมชาติ สมจริง และมีความยืดหยุ่นสูง

VoxCPM2 เป็นโมเดลขนาดใหญ่ถึง 2 พันล้านพารามิเตอร์ ซึ่งถูกเทรนด้วยข้อมูลเสียงหลากหลายภาษามากกว่า 2 ล้านชั่วโมง ทำให้รองรับได้ถึง 30 ภาษา พร้อมความสามารถใหม่ๆ ที่น่าทึ่ง ไม่ว่าจะเป็นการออกแบบเสียง (Voice Design), การโคลนเสียงที่เหมือนจริง (Controllable Voice Cloning) และการสร้างเสียงคุณภาพระดับสตูดิโอที่ 48kHz

🌍 รองรับ 30 ภาษาทั่วโลก

VoxCPM2 สามารถประมวลผลและสังเคราะห์เสียงพูดได้โดยตรงใน 30 ภาษาที่รองรับ โดยไม่ต้องระบุแท็กภาษาให้ยุ่งยาก เพียงป้อนข้อความในภาษาที่ต้องการ ระบบก็จะสร้างเสียงพูดออกมาให้ทันที

ภาษาที่รองรับ: อาหรับ, พม่า, จีน, เดนมาร์ก, ดัตช์, อังกฤษ, ฟินแลนด์, ฝรั่งเศส, เยอรมัน, กรีก, ฮีบรู, ฮินดี, อินโดนีเซีย, อิตาลี, ญี่ปุ่น, เขมร, เกาหลี, ลาว, มาเลย์, นอร์เวย์, โปแลนด์, โปรตุเกส, รัสเซีย, สเปน, สวาฮีลี, สวีเดน, ตากาล็อก, ไทย, ตุรกี, เวียดนาม

สำเนียงจีน: เสฉวน, กวางตุ้ง, อู๋, ตงเป่ย, เหอหนาน, ฉ่านซี, ซานตง, เทียนจิน, หมิ่นหนาน

🎨 สร้างสรรค์เสียงใหม่ด้วย Voice Design

ไม่จำเป็นต้องมีเสียงอ้างอิงอีกต่อไป! ด้วยฟีเจอร์ Voice Design คุณสามารถสร้างเสียงพูดใหม่ที่ไม่เคยมีมาก่อนได้ เพียงแค่ป้อนคำอธิบายเสียงที่ต้องการ เช่น เพศ, อายุ, โทนเสียง, อารมณ์, ความเร็วในการพูด ระบบก็จะสร้างเสียงตามที่คุณจินตนาการ

🎛️ โคลนเสียงได้อย่างแม่นยำและควบคุมได้

ต้องการโคลนเสียงใครสักคน? VoxCPM2 สามารถทำได้จากการฟังคลิปเสียงอ้างอิงสั้นๆ และยังสามารถควบคุมสไตล์การพูด เช่น อารมณ์, ความเร็ว, หรือการแสดงออกต่างๆ ได้ โดยยังคงโทนเสียงต้นฉบับไว้ได้อย่างดี

🎙️ โคลนเสียงระดับ Ultimate

สำหรับความแม่นยำสูงสุดในการโคลนเสียง เพียงให้ข้อมูลทั้งไฟล์เสียงอ้างอิงและบทพูดที่ตรงกัน ระบบจะสามารถสังเคราะห์เสียงต่อเนื่องได้อย่างไร้ที่ติ โดยเก็บรายละเอียดทุกอย่าง ทั้งโทนเสียง จังหวะ อารมณ์ และสไตล์การพูด

🔊 เสียงคุณภาพสูงระดับ 48kHz

VoxCPM2 สามารถรับเสียงอ้างอิงที่ 16kHz และส่งออกเสียงคุณภาพระดับสตูดิโอที่ 48kHz ได้โดยตรง ด้วยการออกแบบเข้ารหัส/ถอดรหัสแบบไม่สมมาตรของ AudioVAE V2 ที่มาพร้อมกับระบบ Super-Resolution ในตัว ไม่จำเป็นต้องใช้ Upsampler ภายนอก

🧠 การสังเคราะห์เสียงที่เข้าใจบริบท

ระบบจะวิเคราะห์เนื้อหาของข้อความโดยอัตโนมัติ เพื่อสร้างการเน้นเสียง (Prosody) และการแสดงออกทางอารมณ์ที่เหมาะสม ทำให้เสียงพูดที่ได้มีความเป็นธรรมชาติและสื่อความหมายได้ดียิ่งขึ้น

⚡ รวดเร็วแบบ Real-Time

ด้วยความเร็วในการประมวลผล (RTF) ที่ต่ำถึงประมาณ 0.3 บน NVIDIA RTX 4090 และสามารถเร่งความเร็วได้ถึง 0.13 เมื่อใช้ Nano-vLLM หรือ vLLM-Omni ทำให้การสังเคราะห์เสียงทำได้รวดเร็วทันใจ

📜 เปิดให้ใช้งานฟรีและเชิงพาณิชย์

VoxCPM2 มาพร้อมกับโมเดลและโค้ดที่เปิดให้ใช้งานแบบ Open-Source ภายใต้ลิขสิทธิ์ Apache-2.0 ซึ่งสามารถนำไปใช้ในเชิงพาณิชย์ได้อย่างอิสระ


การติดตั้งและการใช้งานเบื้องต้น

VoxCPM2 สามารถติดตั้งและใช้งานได้หลายวิธี ทั้งผ่าน Python API, Command Line Interface (CLI), Web Demo, หรือแม้กระทั่งการ Deploy บน Production Server และ On-Device Inference

ตัวอย่างการใช้งาน:

  • สร้างเสียงจากคำอธิบาย:

(เพศหญิง, น้ำเสียงเป็นมิตร, พูดช้าๆ) นี่คือข้อความที่ต้องการให้สังเคราะห์เสียง

  • โคลนเสียง: อัปโหลดไฟล์เสียงอ้างอิง แล้วป้อนข้อความที่ต้องการให้พูด
  • โคลนเสียงระดับ Ultimate: อัปโหลดไฟล์เสียงอ้างอิงพร้อมบทพูดที่ตรงกัน

การ Deploy สำหรับ Production

สำหรับงานที่ต้องการความเร็วสูงและรองรับผู้ใช้งานจำนวนมาก สามารถเลือกใช้:

  • Nano-vLLM-VoxCPM: Engine สำหรับ Inference ที่สร้างขึ้นบน Nano-vLLM รองรับการประมวลผลคำขอพร้อมกัน (Concurrent Requests) และมี API แบบ Asynchronous ให้เลือกใช้งาน
  • vLLM-Omni: ส่วนขยาย Omni-modal อย่างเป็นทางการของโปรเจกต์ vLLM ที่รองรับ VoxCPM2 โดยตรง พร้อม PagedAttention KV cache, Continuous Batching และ Endpoint ที่เข้ากันได้กับ OpenAI API

การใช้งานบนอุปกรณ์ (On-Device Inference)

สำหรับผู้ที่ต้องการใช้งานบนอุปกรณ์โดยไม่ต้องพึ่งพา Python สามารถใช้ llama.cpp-omni ซึ่งเป็น Inference Engine ประสิทธิภาพสูงบน C++ ที่รองรับ GGUF weights ของ VoxCPM2 บน CPU, Metal, CUDA, หรือ Vulkan


ความเสี่ยงและข้อจำกัด

  • การนำไปใช้ในทางที่ผิด: เทคโนโลยีโคลนเสียงมีความสมจริงสูง ห้ามนำไปใช้ในการปลอมแปลงตัวตน, การฉ้อโกง, หรือการเผยแพร่ข้อมูลเท็จ ควรมีการระบุให้ชัดเจนว่าเนื้อหานั้นสร้างโดย AI
  • ความเสถียรของการสร้างสรรค์เสียง: ผลลัพธ์จาก Voice Design และ Controllable Voice Cloning อาจแตกต่างกันไปในแต่ละครั้ง ควรลองสร้างซ้ำหลายๆ ครั้งเพื่อให้ได้เสียงที่ต้องการ
  • การรองรับภาษา: แม้จะรองรับ 30 ภาษา แต่หากต้องการใช้งานภาษาอื่น สามารถทดลองหรือ Fine-tuning ด้วยข้อมูลของตนเองได้

VoxCPM2 ถือเป็นก้าวสำคัญในวงการ Text-to-Speech ที่มอบความสามารถอันหลากหลายและความสมจริงที่เหนือกว่าเดิม พร้อมเปิดให้ทุกคนสามารถเข้าถึงและนำไปใช้งานได้อย่างเต็มที่

#VoxCPM2 #TextToSpeech #TTS #AI #MachineLearning #OpenSource

ขอบคุณ แหล่งข้อมูล
https://github.com/OpenBMB/VoxCPM

VoxCPM2: เปลี่ยนข้อความเป็นเสียงพูดได้สมจริง รองรับ 30 ภาษา พร้อมฟีเจอร์สุดล้ำเคยคิดไหมว่าการสร้างเสียงพูดสังเคราะห์ที่เหมือนจริง จะสามารถทำได้ง่ายและหลากหลายขนาดนี้? วันนี้เรามีเทคโนโลยีที่น่าสนใจมาแนะนำ นั่นคือ VoxCPM2 ระบบ Text-to-Speech (TTS) แบบใหม่ล่าสุด ที่ไม่ใช้ Tokenizer ทำให้การสร้างเสียงพูดเป็นธรรมชาติ สมจริง และมีความยืดหยุ่นสูงVoxCPM2 เป็นโมเดลขนาดใหญ่ถึง 2 พันล้านพารามิเตอร์ ซึ่งถูกเทรนด้วยข้อมูลเสียงหลากหลายภาษามากกว่า 2 ล้านชั่วโมง ทำให้รองรับได้ถึง 30 ภาษา พร้อมความสามารถใหม่ๆ ที่น่าทึ่ง ไม่ว่าจะเป็นการออกแบบเสียง (Voice Design), การโคลนเสียงที่เหมือนจริง (Controllable Voice Cloning) และการสร้างเสียงคุณภาพระดับสตูดิโอที่ 48kHz🌍 รองรับ 30 ภาษาทั่วโลกVoxCPM2 สามารถประมวลผลและสังเคราะห์เสียงพูดได้โดยตรงใน 30 ภาษาที่รองรับ โดยไม่ต้องระบุแท็กภาษาให้ยุ่งยาก เพียงป้อนข้อความในภาษาที่ต้องการ ระบบก็จะสร้างเสียงพูดออกมาให้ทันทีภาษาที่รองรับ: อาหรับ, พม่า, จีน, เดนมาร์ก, ดัตช์, อังกฤษ, ฟินแลนด์, ฝรั่งเศส, เยอรมัน, กรีก, ฮีบรู, ฮินดี, อินโดนีเซีย, อิตาลี, ญี่ปุ่น, เขมร, เกาหลี, ลาว, มาเลย์, นอร์เวย์, โปแลนด์, โปรตุเกส, รัสเซีย, สเปน, สวาฮีลี, สวีเดน, ตากาล็อก, ไทย, ตุรกี, เวียดนามสำเนียงจีน: เสฉวน, กวางตุ้ง, อู๋, ตงเป่ย, เหอหนาน, ฉ่านซี, ซานตง, เทียนจิน, หมิ่นหนาน🎨 สร้างสรรค์เสียงใหม่ด้วย Voice Designไม่จำเป็นต้องมีเสียงอ้างอิงอีกต่อไป! ด้วยฟีเจอร์ Voice Design คุณสามารถสร้างเสียงพูดใหม่ที่ไม่เคยมีมาก่อนได้ เพียงแค่ป้อนคำอธิบายเสียงที่ต้องการ เช่น เพศ, อายุ, โทนเสียง, อารมณ์, ความเร็วในการพูด ระบบก็จะสร้างเสียงตามที่คุณจินตนาการ🎛️ โคลนเสียงได้อย่างแม่นยำและควบคุมได้ต้องการโคลนเสียงใครสักคน? VoxCPM2 สามารถทำได้จากการฟังคลิปเสียงอ้างอิงสั้นๆ และยังสามารถควบคุมสไตล์การพูด เช่น อารมณ์, ความเร็ว, หรือการแสดงออกต่างๆ ได้ โดยยังคงโทนเสียงต้นฉบับไว้ได้อย่างดี🎙️ โคลนเสียงระดับ Ultimateสำหรับความแม่นยำสูงสุดในการโคลนเสียง เพียงให้ข้อมูลทั้งไฟล์เสียงอ้างอิงและบทพูดที่ตรงกัน ระบบจะสามารถสังเคราะห์เสียงต่อเนื่องได้อย่างไร้ที่ติ โดยเก็บรายละเอียดทุกอย่าง ทั้งโทนเสียง จังหวะ อารมณ์ และสไตล์การพูด🔊 เสียงคุณภาพสูงระดับ 48kHzVoxCPM2 สามารถรับเสียงอ้างอิงที่ 16kHz และส่งออกเสียงคุณภาพระดับสตูดิโอที่ 48kHz ได้โดยตรง ด้วยการออกแบบเข้ารหัส/ถอดรหัสแบบไม่สมมาตรของ AudioVAE V2 ที่มาพร้อมกับระบบ Super-Resolution ในตัว ไม่จำเป็นต้องใช้ Upsampler ภายนอก🧠 การสังเคราะห์เสียงที่เข้าใจบริบทระบบจะวิเคราะห์เนื้อหาของข้อความโดยอัตโนมัติ เพื่อสร้างการเน้นเสียง (Prosody) และการแสดงออกทางอารมณ์ที่เหมาะสม ทำให้เสียงพูดที่ได้มีความเป็นธรรมชาติและสื่อความหมายได้ดียิ่งขึ้น⚡ รวดเร็วแบบ Real-Timeด้วยความเร็วในการประมวลผล (RTF) ที่ต่ำถึงประมาณ 0.3 บน NVIDIA RTX 4090 และสามารถเร่งความเร็วได้ถึง 0.13 เมื่อใช้ Nano-vLLM หรือ vLLM-Omni ทำให้การสังเคราะห์เสียงทำได้รวดเร็วทันใจ📜 เปิดให้ใช้งานฟรีและเชิงพาณิชย์VoxCPM2 มาพร้อมกับโมเดลและโค้ดที่เปิดให้ใช้งานแบบ Open-Source ภายใต้ลิขสิทธิ์ Apache-2.0 ซึ่งสามารถนำไปใช้ในเชิงพาณิชย์ได้อย่างอิสระการติดตั้งและการใช้งานเบื้องต้นVoxCPM2 สามารถติดตั้งและใช้งานได้หลายวิธี ทั้งผ่าน Python API, Command Line Interface (CLI), Web Demo, หรือแม้กระทั่งการ Deploy บน Production Server และ On-Device Inferenceตัวอย่างการใช้งาน:สร้างเสียงจากคำอธิบาย:(เพศหญิง, น้ำเสียงเป็นมิตร, พูดช้าๆ) นี่คือข้อความที่ต้องการให้สังเคราะห์เสียงโคลนเสียง: อัปโหลดไฟล์เสียงอ้างอิง แล้วป้อนข้อความที่ต้องการให้พูดโคลนเสียงระดับ Ultimate: อัปโหลดไฟล์เสียงอ้างอิงพร้อมบทพูดที่ตรงกันการ Deploy สำหรับ Productionสำหรับงานที่ต้องการความเร็วสูงและรองรับผู้ใช้งานจำนวนมาก สามารถเลือกใช้:Nano-vLLM-VoxCPM: Engine สำหรับ Inference ที่สร้างขึ้นบน Nano-vLLM รองรับการประมวลผลคำขอพร้อมกัน (Concurrent Requests) และมี API แบบ Asynchronous ให้เลือกใช้งานvLLM-Omni: ส่วนขยาย Omni-modal อย่างเป็นทางการของโปรเจกต์ vLLM ที่รองรับ VoxCPM2 โดยตรง พร้อม PagedAttention KV cache, Continuous Batching และ Endpoint ที่เข้ากันได้กับ OpenAI APIการใช้งานบนอุปกรณ์ (On-Device Inference)สำหรับผู้ที่ต้องการใช้งานบนอุปกรณ์โดยไม่ต้องพึ่งพา Python สามารถใช้ llama.cpp-omni ซึ่งเป็น Inference Engine ประสิทธิภาพสูงบน C++ ที่รองรับ GGUF weights ของ VoxCPM2 บน CPU, Metal, CUDA, หรือ Vulkanความเสี่ยงและข้อจำกัดการนำไปใช้ในทางที่ผิด: เทคโนโลยีโคลนเสียงมีความสมจริงสูง ห้ามนำไปใช้ในการปลอมแปลงตัวตน, การฉ้อโกง, หรือการเผยแพร่ข้อมูลเท็จ ควรมีการระบุให้ชัดเจนว่าเนื้อหานั้นสร้างโดย AIความเสถียรของการสร้างสรรค์เสียง: ผลลัพธ์จาก Voice Design และ Controllable Voice Cloning อาจแตกต่างกันไปในแต่ละครั้ง ควรลองสร้างซ้ำหลายๆ ครั้งเพื่อให้ได้เสียงที่ต้องการการรองรับภาษา: แม้จะรองรับ 30 ภาษา แต่หากต้องการใช้งานภาษาอื่น สามารถทดลองหรือ Fine-tuning ด้วยข้อมูลของตนเองได้VoxCPM2 ถือเป็นก้าวสำคัญในวงการ Text-to-Speech ที่มอบความสามารถอันหลากหลายและความสมจริงที่เหนือกว่าเดิม พร้อมเปิดให้ทุกคนสามารถเข้าถึงและนำไปใช้งานได้อย่างเต็มที่#VoxCPM2 #TextToSpeech #TTS #AI #MachineLearning #OpenSourcehttps://github.com/OpenBMB/VoxCPM
Shared content
GITHUB.COM
GitHub - OpenBMB/VoxCPM: VoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning
VoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning - OpenBMB/VoxCPM
7 Комментарии 0 Поделились 453 Просмотры 0 предпросмотр