NVIDIA Nemotron 3 Nano Omni: สุดยอดโมเดล AI อัจฉริยะรอบด้านสำหรับเอกสาร เสียง และวิดีโอ

ในยุคที่ข้อมูลหลั่งไหลเข้ามาอย่างมหาศาลในหลากหลายรูปแบบ การทำความเข้าใจและประมวลผลข้อมูลเหล่านั้นให้ได้อย่างมีประสิทธิภาพเป็นสิ่งสำคัญอย่างยิ่ง NVIDIA ได้เปิดตัว Nemotron 3 Nano Omni โมเดล AI แบบ omni-modal ที่ออกแบบมาเพื่อก้าวข้ามขีดจำกัดเดิมๆ ในการวิเคราะห์ข้อมูลที่ซับซ้อน ทั้งเอกสาร เสียง และวิดีโอ

Nemotron 3 Nano Omni คืออะไร?

Nemotron 3 Nano Omni คือโมเดล AI ที่ต่อยอดมาจาก Nemotron multimodal โดยมีความสามารถที่ครอบคลุมมากกว่าระบบ vision-language ที่แข็งแกร่งเดิม ให้สามารถเข้าใจและประมวลผลข้อมูลได้หลากหลายมิติมากขึ้น ไม่ว่าจะเป็น ข้อความ รูปภาพ วิดีโอ และเสียง ทำให้มันเป็นเครื่องมือที่ทรงพลังสำหรับงานที่ต้องการความเข้าใจเชิงลึกในข้อมูลที่ผสมผสานกัน

ความสามารถเด่นที่ทำให้ Nemotron 3 Nano Omni เหนือกว่า

โมเดลนี้ได้รับการพิสูจน์แล้วว่ามีความแม่นยำ ดีที่สุดในกลุ่ม (best-in-class) ในการทดสอบกับชุดข้อมูลที่ซับซ้อนในหลากหลายด้าน:

  • การวิเคราะห์เอกสาร (Document Intelligence): มีความโดดเด่นในรายการจัดอันดับอย่าง MMlongbench-Doc และ OCRBenchV2 ซึ่งวัดความสามารถในการอ่านและทำความเข้าใจเอกสารที่มีความยาวและซับซ้อน
  • การทำความเข้าใจวิดีโอและเสียง: เป็นผู้นำในด้านวิดีโอและเสียงบนรายการจัดอันดับ เช่น WorldSense และ DailyOmni และมีความแม่นยำสูงสุดบน VoiceBench สำหรับการทำความเข้าใจเสียง
  • ประสิทธิภาพด้านต้นทุน: เป็นโมเดลวิดีโอที่ คุ้มค่าที่สุด ในกลุ่ม open-source บน MediaPerf

สถาปัตยกรรมและนวัตกรรมเบื้องหลัง

Nemotron 3 Nano Omni ใช้สถาปัตยกรรมแบบ Mamba-Transformer Mixture-of-Experts (MoE) ที่ผสมผสานจุดเด่นของ Mamba และ Transformer เข้าด้วยกัน เพื่อให้สามารถประมวลผลบริบทที่ยาว (long-context) ได้อย่างมีประสิทธิภาพ โดยไม่สูญเสียรายละเอียดสำคัญ

  • การเข้ารหัสภาพ (Vision Encoder): ใช้ C-RADIOv4-H ที่ออกแบบมาเพื่อรักษา รายละเอียดภาพที่ละเอียดอ่อน
  • การเข้ารหัสเสียง (Audio Encoder): ใช้ Parakeet-TDT-0.6B-v2 ทำให้มีความสามารถในการ เข้าใจเสียงแบบ Native
  • การประมวลผลบริบทที่ยาว: สถาปัตยกรรมได้รับการออกแบบมาเพื่อรองรับเอกสาร รูปภาพ วิดีโอ และการให้เหตุผลแบบผสมผสานที่มีความยาวมากๆ

การใช้งานที่หลากหลายของ Nemotron 3 Nano Omni

โมเดลนี้ถูกออกแบบมาเพื่อตอบโจทย์การใช้งานใน 5 กลุ่มหลัก:

  1. การวิเคราะห์เอกสารในโลกจริง 📄: ไม่ใช่แค่การอ่านตัวอักษร (OCR) แต่รวมถึงการทำความเข้าใจ โครงสร้าง เลย์เอาต์ ตาราง รูปภาพ สูตร และการอ้างอิงข้ามหน้าในเอกสารที่ยาวและซับซ้อน เช่น สัญญา รายงานทางเทคนิค คู่มือ หรือเอกสารการปฏิบัติตามกฎระเบียบ สามารถจัดการเอกสารที่มี มากกว่า 100 หน้า
  2. การรู้จำเสียงพูดอัตโนมัติ (Automatic Speech Recognition) 🎤: มีความสามารถในการถอดเสียงพูดคุณภาพสูง แม้ในสภาวะเสียงที่หลากหลาย สามารถจัดการกับเสียงยาวๆ ที่มีผู้พูดหลายคน สำเนียงต่างกัน หรือมีเสียงรบกวน
  3. การทำความเข้าใจเสียงและวิดีโอแบบยาว (Long Audio-Video Understanding) 🎬: เหมาะสำหรับงานที่ต้องวิเคราะห์ข้อมูลผสมผสาน เช่น บันทึกหน้าจอพร้อมเสียงบรรยาย วิดีโอสอนการใช้งาน การประชุมที่มีสไลด์ หรือคลังวิดีโอขนาดยาว
  4. การใช้งานคอมพิวเตอร์แบบ Agentic (Agentic Computer Use) 🤖: สามารถช่วยทำงานในสภาพแวดล้อม GUI (Graphical User Interface) ได้ โดยการตีความภาพหน้าจอ ติดตามสถานะของ UI และช่วยในการเลือกการกระทำหรือทำให้เวิร์กโฟลว์เป็นไปโดยอัตโนมัติ
  5. การให้เหตุผลแบบ Multimodal ทั่วไป (General Multimodal Reasoning) 🧠: ไม่ใช่แค่การรับรู้ข้อมูล แต่ยังสามารถ สังเคราะห์ข้อมูล จากบริบทที่ยาวข้ามรูปแบบต่างๆ เพื่อหาคำตอบที่สมเหตุสมผลและมีหลักฐานสนับสนุน

นวัตกรรมสำคัญที่ทำให้ Nemotron 3 Nano Omni แตกต่าง

  • Dynamic Resolution: การประมวลผลภาพด้วยความละเอียดที่หลากหลาย ช่วยให้จัดการกับภาพที่มีรายละเอียดสูง เช่น เอกสารที่มี OCR จำนวนมาก ตารางการเงิน สไลด์ หรือหน้าจอ GUI ได้อย่างแม่นยำ
  • Conv3D Temporal Compression: เทคนิคการบีบอัดข้อมูลวิดีโอโดยการรวมเฟรมที่ติดกัน ช่วยลดจำนวนข้อมูลที่ต้องประมวลผลลง
  • Efficient Video Sampling (EVS): การดรอปโทเค็นวิดีโอที่ไม่จำเป็นระหว่างการอนุมาน (inference) ช่วยลดความหน่วงและเพิ่มความเร็วในการประมวลผล
  • Native Audio Input: การประมวลผลเสียงโดยตรง ไม่ใช่แค่การแปลงเป็นข้อความ ช่วยให้การวิเคราะห์ข้อมูลผสมผสานระหว่างเสียง ภาพ และข้อความมีความแม่นยำและลึกซึ้งยิ่งขึ้น
  • Lightweight Modality Projectors: การเชื่อมต่อตัวเข้ารหัสแต่ละส่วนเข้ากับ LLM ด้วยตัวฉายแสงขนาดเล็ก ทำให้ระบบมีความยืดหยุ่นและยังคงประสิทธิภาพการให้เหตุผลแบบข้ามรูปแบบ

ประสิทธิภาพที่เหนือกว่า

Nemotron 3 Nano Omni สามารถให้ Throughput สูงขึ้นถึง 9 เท่า และ ความเร็วในการให้เหตุผลแบบ Single-stream เร็วขึ้น 2.9 เท่า เมื่อเทียบกับโมเดลทางเลือกอื่นๆ ในการใช้งานแบบ multimodal

การฝึกฝนและข้อมูล

โมเดลนี้ได้รับการฝึกฝนบนชุดข้อมูลที่ปรับปรุงให้เน้นการให้เหตุผลคุณภาพสูงข้ามหลายรูปแบบ มีการครอบคลุมงานที่หลากหลายและใช้ข้อมูลสังเคราะห์สำหรับสถานการณ์ที่ซับซ้อน โดยใช้โครงสร้างพื้นฐานการฝึกฝนที่ทันสมัยของ NVIDIA

ตัวอย่างการใช้งานจริง

  • การวิเคราะห์เอกสารหลายหน้า: ดึงข้อมูลเมตริกทางการเงินจากรายงานกว่า 100 หน้า เพื่อคำนวณค่าอื่นๆ
  • การทำความเข้าใจวิดีโอ+เสียง: ตอบคำถามที่ต้องใช้การวิเคราะห์ร่วมกันระหว่างภาพและเสียง เช่น การระบุภาพที่ปรากฏขึ้นเมื่อมีการ

ขอบคุณ แหล่งข้อมูล
https://huggingface.co/blog/nvidia/nemotron-3-nano-omni-multimodal-intelligence

NVIDIA Nemotron 3 Nano Omni: สุดยอดโมเดล AI อัจฉริยะรอบด้านสำหรับเอกสาร เสียง และวิดีโอในยุคที่ข้อมูลหลั่งไหลเข้ามาอย่างมหาศาลในหลากหลายรูปแบบ การทำความเข้าใจและประมวลผลข้อมูลเหล่านั้นให้ได้อย่างมีประสิทธิภาพเป็นสิ่งสำคัญอย่างยิ่ง NVIDIA ได้เปิดตัว Nemotron 3 Nano Omni โมเดล AI แบบ omni-modal ที่ออกแบบมาเพื่อก้าวข้ามขีดจำกัดเดิมๆ ในการวิเคราะห์ข้อมูลที่ซับซ้อน ทั้งเอกสาร เสียง และวิดีโอNemotron 3 Nano Omni คืออะไร?Nemotron 3 Nano Omni คือโมเดล AI ที่ต่อยอดมาจาก Nemotron multimodal โดยมีความสามารถที่ครอบคลุมมากกว่าระบบ vision-language ที่แข็งแกร่งเดิม ให้สามารถเข้าใจและประมวลผลข้อมูลได้หลากหลายมิติมากขึ้น ไม่ว่าจะเป็น ข้อความ รูปภาพ วิดีโอ และเสียง ทำให้มันเป็นเครื่องมือที่ทรงพลังสำหรับงานที่ต้องการความเข้าใจเชิงลึกในข้อมูลที่ผสมผสานกันความสามารถเด่นที่ทำให้ Nemotron 3 Nano Omni เหนือกว่าโมเดลนี้ได้รับการพิสูจน์แล้วว่ามีความแม่นยำ ดีที่สุดในกลุ่ม (best-in-class) ในการทดสอบกับชุดข้อมูลที่ซับซ้อนในหลากหลายด้าน:การวิเคราะห์เอกสาร (Document Intelligence): มีความโดดเด่นในรายการจัดอันดับอย่าง MMlongbench-Doc และ OCRBenchV2 ซึ่งวัดความสามารถในการอ่านและทำความเข้าใจเอกสารที่มีความยาวและซับซ้อนการทำความเข้าใจวิดีโอและเสียง: เป็นผู้นำในด้านวิดีโอและเสียงบนรายการจัดอันดับ เช่น WorldSense และ DailyOmni และมีความแม่นยำสูงสุดบน VoiceBench สำหรับการทำความเข้าใจเสียงประสิทธิภาพด้านต้นทุน: เป็นโมเดลวิดีโอที่ คุ้มค่าที่สุด ในกลุ่ม open-source บน MediaPerfสถาปัตยกรรมและนวัตกรรมเบื้องหลังNemotron 3 Nano Omni ใช้สถาปัตยกรรมแบบ Mamba-Transformer Mixture-of-Experts (MoE) ที่ผสมผสานจุดเด่นของ Mamba และ Transformer เข้าด้วยกัน เพื่อให้สามารถประมวลผลบริบทที่ยาว (long-context) ได้อย่างมีประสิทธิภาพ โดยไม่สูญเสียรายละเอียดสำคัญการเข้ารหัสภาพ (Vision Encoder): ใช้ C-RADIOv4-H ที่ออกแบบมาเพื่อรักษา รายละเอียดภาพที่ละเอียดอ่อนการเข้ารหัสเสียง (Audio Encoder): ใช้ Parakeet-TDT-0.6B-v2 ทำให้มีความสามารถในการ เข้าใจเสียงแบบ Nativeการประมวลผลบริบทที่ยาว: สถาปัตยกรรมได้รับการออกแบบมาเพื่อรองรับเอกสาร รูปภาพ วิดีโอ และการให้เหตุผลแบบผสมผสานที่มีความยาวมากๆการใช้งานที่หลากหลายของ Nemotron 3 Nano Omniโมเดลนี้ถูกออกแบบมาเพื่อตอบโจทย์การใช้งานใน 5 กลุ่มหลัก:การวิเคราะห์เอกสารในโลกจริง 📄: ไม่ใช่แค่การอ่านตัวอักษร (OCR) แต่รวมถึงการทำความเข้าใจ โครงสร้าง เลย์เอาต์ ตาราง รูปภาพ สูตร และการอ้างอิงข้ามหน้าในเอกสารที่ยาวและซับซ้อน เช่น สัญญา รายงานทางเทคนิค คู่มือ หรือเอกสารการปฏิบัติตามกฎระเบียบ สามารถจัดการเอกสารที่มี มากกว่า 100 หน้าการรู้จำเสียงพูดอัตโนมัติ (Automatic Speech Recognition) 🎤: มีความสามารถในการถอดเสียงพูดคุณภาพสูง แม้ในสภาวะเสียงที่หลากหลาย สามารถจัดการกับเสียงยาวๆ ที่มีผู้พูดหลายคน สำเนียงต่างกัน หรือมีเสียงรบกวนการทำความเข้าใจเสียงและวิดีโอแบบยาว (Long Audio-Video Understanding) 🎬: เหมาะสำหรับงานที่ต้องวิเคราะห์ข้อมูลผสมผสาน เช่น บันทึกหน้าจอพร้อมเสียงบรรยาย วิดีโอสอนการใช้งาน การประชุมที่มีสไลด์ หรือคลังวิดีโอขนาดยาวการใช้งานคอมพิวเตอร์แบบ Agentic (Agentic Computer Use) 🤖: สามารถช่วยทำงานในสภาพแวดล้อม GUI (Graphical User Interface) ได้ โดยการตีความภาพหน้าจอ ติดตามสถานะของ UI และช่วยในการเลือกการกระทำหรือทำให้เวิร์กโฟลว์เป็นไปโดยอัตโนมัติการให้เหตุผลแบบ Multimodal ทั่วไป (General Multimodal Reasoning) 🧠: ไม่ใช่แค่การรับรู้ข้อมูล แต่ยังสามารถ สังเคราะห์ข้อมูล จากบริบทที่ยาวข้ามรูปแบบต่างๆ เพื่อหาคำตอบที่สมเหตุสมผลและมีหลักฐานสนับสนุนนวัตกรรมสำคัญที่ทำให้ Nemotron 3 Nano Omni แตกต่างDynamic Resolution: การประมวลผลภาพด้วยความละเอียดที่หลากหลาย ช่วยให้จัดการกับภาพที่มีรายละเอียดสูง เช่น เอกสารที่มี OCR จำนวนมาก ตารางการเงิน สไลด์ หรือหน้าจอ GUI ได้อย่างแม่นยำConv3D Temporal Compression: เทคนิคการบีบอัดข้อมูลวิดีโอโดยการรวมเฟรมที่ติดกัน ช่วยลดจำนวนข้อมูลที่ต้องประมวลผลลงEfficient Video Sampling (EVS): การดรอปโทเค็นวิดีโอที่ไม่จำเป็นระหว่างการอนุมาน (inference) ช่วยลดความหน่วงและเพิ่มความเร็วในการประมวลผลNative Audio Input: การประมวลผลเสียงโดยตรง ไม่ใช่แค่การแปลงเป็นข้อความ ช่วยให้การวิเคราะห์ข้อมูลผสมผสานระหว่างเสียง ภาพ และข้อความมีความแม่นยำและลึกซึ้งยิ่งขึ้นLightweight Modality Projectors: การเชื่อมต่อตัวเข้ารหัสแต่ละส่วนเข้ากับ LLM ด้วยตัวฉายแสงขนาดเล็ก ทำให้ระบบมีความยืดหยุ่นและยังคงประสิทธิภาพการให้เหตุผลแบบข้ามรูปแบบประสิทธิภาพที่เหนือกว่าNemotron 3 Nano Omni สามารถให้ Throughput สูงขึ้นถึง 9 เท่า และ ความเร็วในการให้เหตุผลแบบ Single-stream เร็วขึ้น 2.9 เท่า เมื่อเทียบกับโมเดลทางเลือกอื่นๆ ในการใช้งานแบบ multimodalการฝึกฝนและข้อมูลโมเดลนี้ได้รับการฝึกฝนบนชุดข้อมูลที่ปรับปรุงให้เน้นการให้เหตุผลคุณภาพสูงข้ามหลายรูปแบบ มีการครอบคลุมงานที่หลากหลายและใช้ข้อมูลสังเคราะห์สำหรับสถานการณ์ที่ซับซ้อน โดยใช้โครงสร้างพื้นฐานการฝึกฝนที่ทันสมัยของ NVIDIAตัวอย่างการใช้งานจริงการวิเคราะห์เอกสารหลายหน้า: ดึงข้อมูลเมตริกทางการเงินจากรายงานกว่า 100 หน้า เพื่อคำนวณค่าอื่นๆการทำความเข้าใจวิดีโอ+เสียง: ตอบคำถามที่ต้องใช้การวิเคราะห์ร่วมกันระหว่างภาพและเสียง เช่น การระบุภาพที่ปรากฏขึ้นเมื่อมีการhttps://huggingface.co/blog/nvidia/nemotron-3-nano-omni-multimodal-intelligence
2 Commentarii 0 Distribuiri 290 Views 0 previzualizare