สถิติโลกใหม่: การเทรนโมเดล MoE ด้วย NVIDIA GB300 NVL72 ที่เหนือกว่าทุกขีดจำกัด

วงการ AI กำลังก้าวเข้าสู่ยุคใหม่ของการเทรนโมเดลขนาดใหญ่ โดยเฉพาะอย่างยิ่งกับสถาปัตยกรรมแบบ Mixture of Experts (MoE) ที่กำลังเข้ามาพลิกโฉมข้อจำกัดเดิมๆ ของการฝึกฝน AI ให้มีประสิทธิภาพสูงขึ้นอย่างก้าวกระโดด NVIDIA GB300 NVL72 ได้สร้างสถิติโลกใหม่ในการเทรนโมเดล MoE ด้วยประสิทธิภาพสูงสุดถึง 1,648 TFLOPs ต่อ GPU ซึ่งเป็นผลลัพธ์ที่เกิดจากการผสานรวมโครงสร้างพื้นฐาน AI ระดับ Rack-scale ที่ออกแบบมาอย่างสมบูรณ์แบบ ทั้งเทคโนโลยี NVLink เจเนอเรชันที่ 5, แบนด์วิดท์ต่อ GPU สูงถึง 1.8 TB/s และแบนด์วิดท์แบบ non-blocking all-to-all ที่ 130 TB/s

ปลดล็อกศักยภาพ MoE ด้วยการสื่อสารที่เหนือชั้น

สถาปัตยกรรม MoE นั้นมีจุดเด่นอยู่ที่การจัดการทรัพยากรอย่างมีประสิทธิภาพ โดยโมเดล MoE จะเลือกใช้ "ผู้เชี่ยวชาญ" (experts) เพียงบางส่วนในการประมวลผลแต่ละ Token ทำให้สามารถสร้างโมเดลที่มีพารามิเตอร์มหาศาล แต่ใช้ทรัพยากรในการคำนวณต่อ Token เทียบเท่ากับโมเดลขนาดเล็กกว่ามาก

อย่างไรก็ตาม ข้อแลกเปลี่ยนที่สำคัญของ MoE คือปริมาณการสื่อสารข้อมูลที่เพิ่มขึ้นอย่างมาก เนื่องจากผู้เชี่ยวชาญแต่ละตัวอาจอยู่บน GPU ที่แตกต่างกัน การส่ง Token ไปยังผู้เชี่ยวชาญที่ถูกต้องและรวบรวมผลลัพธ์กลับมานั้น กลายเป็นการสื่อสารแบบ all-to-all ที่เกิดขึ้นในทุก Layer ของการเทรน หากการสื่อสารนี้ล่าช้าหรือไม่ราบรื่น ประสิทธิภาพโดยรวมจะลดลงอย่างรวดเร็ว

NVIDIA GB300 NVL72 ได้รับการออกแบบมาเพื่อแก้ปัญหานี้โดยเฉพาะ ด้วยการผสานรวมทุกองค์ประกอบสำคัญเข้าด้วยกัน ตั้งแต่ชิปประมวลผล, ระบบเชื่อมต่อภายใน Rack (Scale-up) ไปจนถึงเครือข่ายภายนอก Rack (Scale-out) เพื่อให้การสื่อสารเป็นไปอย่างราบรื่นและมีประสิทธิภาพสูงสุด

NVIDIA GB300 NVL72: หัวใจสำคัญของการเทรน AI แบบ Scale-up

หัวใจหลักของ NVIDIA GB300 NVL72 คือเทคโนโลยี NVIDIA NVLink ซึ่งเป็นระบบเชื่อมต่อภายใน Rack ที่ทำให้ GPU NVIDIA Blackwell Ultra ทั้ง 72 ตัว ทำงานร่วมกันได้อย่างไร้รอยต่อ NVLink เจเนอเรชันที่ 5 มอบแบนด์วิดท์สูงถึง 1.8 TB/s ต่อ GPU และแบนด์วิดท์แบบ non-blocking all-to-all ที่ 130 TB/s ภายใน Rack เดียว ทำให้ทุก GPU สามารถสื่อสารกันได้โดยตรงใน Hop เดียว

นอกจากความเร็วแล้ว NVLink ยังทำงานแบบ memory-semantic หมายความว่า GPU สามารถอ่านและเขียนหน่วยความจำ (HBM) ของ GPU อื่นได้โดยตรง เหมือนเป็นการดำเนินการกับหน่วยความจำของตัวเอง ทำให้ลด Latency ใน Data Path ได้อย่างมาก และสามารถประมวลผลการลดทอนสัญญาณ (reductions) ได้ภายใน Switch ในขณะที่ข้อมูลกำลังไหลผ่าน

สำหรับการขยายระบบออกนอก Rack (Scale-out) NVIDIA GB300 NVL72 ใช้ NVIDIA ConnectX-8 SuperNICs ที่ความเร็ว 800 Gbps ต่อ GPU ร่วมกับ NVIDIA Quantum-X800 InfiniBand หรือ NVIDIA Spectrum-X Ethernet เพื่อให้แน่ใจว่าการรับส่ง Gradient Traffic จะไม่กลายเป็นคอขวด และยังคงประสิทธิภาพที่คาดการณ์ได้เมื่อมีการเพิ่มจำนวน Rack

พลังของซอฟต์แวร์: เร่งประสิทธิภาพให้ถึงขีดสุด

นอกเหนือจากฮาร์ดแวร์ที่ทรงพลังแล้ว นวัตกรรมด้านซอฟต์แวร์ก็มีบทบาทสำคัญอย่างยิ่ง NVIDIA ได้พัฒนาและปรับปรุงซอฟต์แวร์ต่างๆ ให้ทำงานร่วมกับ GB300 NVL72 ได้อย่างเต็มประสิทธิภาพ

  • NVIDIA Megatron Core: เฟรมเวิร์กที่ปรับแต่งมาโดยเฉพาะสำหรับ GPU รุ่นใหม่นี้ สามารถทำประสิทธิภาพได้ถึง 1,648 TFLOPs ต่อ GPU บนโมเดล DeepSeek-V3 671B ซึ่งสูงกว่ารุ่นก่อนหน้า GB200 NVL72 ถึง 3 เท่า
  • TorchTitan และ JAX: NVIDIA ได้ร่วมมือกับชุมชนผู้พัฒนาโอเพนซอร์ส เพื่อเพิ่มประสิทธิภาพของ PyTorch และ JAX ให้ทำงานได้เร็วขึ้นบน GB300 NVL72 โดยมีการปรับปรุงอย่างต่อเนื่อง ทำให้ประสิทธิภาพเพิ่มขึ้นอย่างก้าวกระโดด โดยเฉพาะ JAX ที่มีการเพิ่มประสิทธิภาพเกือบ 10 เท่าในช่วง 6 เดือนที่ผ่านมา
  • การ Scale-up ที่ไร้ขีดจำกัด: เมื่อทดสอบการเทรนโมเดล DeepSeek-V3 671B จาก 256 เป็น 1,024 GPU ด้วย Megatron Core พบว่ายังคงรักษาประสิทธิภาพต่อ GPU ได้ถึง 98.5% ในขณะที่ TorchTitan และ JAX รักษาประสิทธิภาพได้ 97% แสดงให้เห็นว่าการเพิ่มจำนวน GPU ส่งผลโดยตรงต่อ throughput ของระบบโดยรวมได้อย่างมีประสิทธิภาพ

ก้าวสู่ยุคใหม่ของการเทรนโมเดล AI

การสร้างสถิติโลกใหม่ด้วย NVIDIA GB300 NVL72 ในการเทรนโมเดล DeepSeek-v3 671B ไม่เพียงแต่แสดงถึงประสิทธิภาพที่เหนือกว่า แต่ยังสะท้อนถึงความก้าวหน้าของการออกแบบแพลตฟอร์ม AI แบบครบวงจร ตั้งแต่ชิปประมวลผล, ระบบเชื่อมต่อ, เครือข่าย ไปจนถึงซอฟต์แวร์ ที่ทำงานร่วมกันอย่างลงตัว

นี่คือรากฐานสำคัญที่จะช่วยให้นักวิจัยและนักพัฒนาสามารถสร้างสรรค์โมเดล AI ที่ใหญ่ขึ้น, ทดลองได้มากขึ้น, และก้าวข้ามขีดจำกัดของ AI ไปได้เร็วยิ่งขึ้นบนโครงสร้างพื้นฐานของ NVIDIA ที่พร้อมสำหรับการพัฒนา AI ในระดับแนวหน้า

เริ่มต้นการเทรนโมเดล AI ระดับแนวหน้าบนโครงสร้างพื้นฐาน NVIDIA AI

  • สำรวจสถาปัตยกรรมระดับ Rack-scale: ค้นพบรายละเอียดของ GB300 NVL72
  • ขยายขีดความสามารถของ Workload: เริ่มต้นใช้งาน Megatron-Core สำหรับการเทรนโมเดลระดับแนวหน้า
  • เพิ่มประสิทธิภาพสูงสุด: อ่านบทความเกี่ยวกับ NVIDIA CuteDSL fusion kernel เพื่อเพิ่มประสิทธิภาพด้วย CUDA graphs

#NVIDIAGPU #AI #MoE #DeepLearning #Supercomputing

ขอบคุณ แหล่งข้อมูล
https://developer.nvidia.com/blog/setting-a-world-record-for-moe-pre-training-on-nvidia-gb300-nvl72/

สถิติโลกใหม่: การเทรนโมเดล MoE ด้วย NVIDIA GB300 NVL72 ที่เหนือกว่าทุกขีดจำกัดวงการ AI กำลังก้าวเข้าสู่ยุคใหม่ของการเทรนโมเดลขนาดใหญ่ โดยเฉพาะอย่างยิ่งกับสถาปัตยกรรมแบบ Mixture of Experts (MoE) ที่กำลังเข้ามาพลิกโฉมข้อจำกัดเดิมๆ ของการฝึกฝน AI ให้มีประสิทธิภาพสูงขึ้นอย่างก้าวกระโดด NVIDIA GB300 NVL72 ได้สร้างสถิติโลกใหม่ในการเทรนโมเดล MoE ด้วยประสิทธิภาพสูงสุดถึง 1,648 TFLOPs ต่อ GPU ซึ่งเป็นผลลัพธ์ที่เกิดจากการผสานรวมโครงสร้างพื้นฐาน AI ระดับ Rack-scale ที่ออกแบบมาอย่างสมบูรณ์แบบ ทั้งเทคโนโลยี NVLink เจเนอเรชันที่ 5, แบนด์วิดท์ต่อ GPU สูงถึง 1.8 TB/s และแบนด์วิดท์แบบ non-blocking all-to-all ที่ 130 TB/sปลดล็อกศักยภาพ MoE ด้วยการสื่อสารที่เหนือชั้นสถาปัตยกรรม MoE นั้นมีจุดเด่นอยู่ที่การจัดการทรัพยากรอย่างมีประสิทธิภาพ โดยโมเดล MoE จะเลือกใช้ "ผู้เชี่ยวชาญ" (experts) เพียงบางส่วนในการประมวลผลแต่ละ Token ทำให้สามารถสร้างโมเดลที่มีพารามิเตอร์มหาศาล แต่ใช้ทรัพยากรในการคำนวณต่อ Token เทียบเท่ากับโมเดลขนาดเล็กกว่ามากอย่างไรก็ตาม ข้อแลกเปลี่ยนที่สำคัญของ MoE คือปริมาณการสื่อสารข้อมูลที่เพิ่มขึ้นอย่างมาก เนื่องจากผู้เชี่ยวชาญแต่ละตัวอาจอยู่บน GPU ที่แตกต่างกัน การส่ง Token ไปยังผู้เชี่ยวชาญที่ถูกต้องและรวบรวมผลลัพธ์กลับมานั้น กลายเป็นการสื่อสารแบบ all-to-all ที่เกิดขึ้นในทุก Layer ของการเทรน หากการสื่อสารนี้ล่าช้าหรือไม่ราบรื่น ประสิทธิภาพโดยรวมจะลดลงอย่างรวดเร็วNVIDIA GB300 NVL72 ได้รับการออกแบบมาเพื่อแก้ปัญหานี้โดยเฉพาะ ด้วยการผสานรวมทุกองค์ประกอบสำคัญเข้าด้วยกัน ตั้งแต่ชิปประมวลผล, ระบบเชื่อมต่อภายใน Rack (Scale-up) ไปจนถึงเครือข่ายภายนอก Rack (Scale-out) เพื่อให้การสื่อสารเป็นไปอย่างราบรื่นและมีประสิทธิภาพสูงสุดNVIDIA GB300 NVL72: หัวใจสำคัญของการเทรน AI แบบ Scale-upหัวใจหลักของ NVIDIA GB300 NVL72 คือเทคโนโลยี NVIDIA NVLink ซึ่งเป็นระบบเชื่อมต่อภายใน Rack ที่ทำให้ GPU NVIDIA Blackwell Ultra ทั้ง 72 ตัว ทำงานร่วมกันได้อย่างไร้รอยต่อ NVLink เจเนอเรชันที่ 5 มอบแบนด์วิดท์สูงถึง 1.8 TB/s ต่อ GPU และแบนด์วิดท์แบบ non-blocking all-to-all ที่ 130 TB/s ภายใน Rack เดียว ทำให้ทุก GPU สามารถสื่อสารกันได้โดยตรงใน Hop เดียวนอกจากความเร็วแล้ว NVLink ยังทำงานแบบ memory-semantic หมายความว่า GPU สามารถอ่านและเขียนหน่วยความจำ (HBM) ของ GPU อื่นได้โดยตรง เหมือนเป็นการดำเนินการกับหน่วยความจำของตัวเอง ทำให้ลด Latency ใน Data Path ได้อย่างมาก และสามารถประมวลผลการลดทอนสัญญาณ (reductions) ได้ภายใน Switch ในขณะที่ข้อมูลกำลังไหลผ่านสำหรับการขยายระบบออกนอก Rack (Scale-out) NVIDIA GB300 NVL72 ใช้ NVIDIA ConnectX-8 SuperNICs ที่ความเร็ว 800 Gbps ต่อ GPU ร่วมกับ NVIDIA Quantum-X800 InfiniBand หรือ NVIDIA Spectrum-X Ethernet เพื่อให้แน่ใจว่าการรับส่ง Gradient Traffic จะไม่กลายเป็นคอขวด และยังคงประสิทธิภาพที่คาดการณ์ได้เมื่อมีการเพิ่มจำนวน Rackพลังของซอฟต์แวร์: เร่งประสิทธิภาพให้ถึงขีดสุดนอกเหนือจากฮาร์ดแวร์ที่ทรงพลังแล้ว นวัตกรรมด้านซอฟต์แวร์ก็มีบทบาทสำคัญอย่างยิ่ง NVIDIA ได้พัฒนาและปรับปรุงซอฟต์แวร์ต่างๆ ให้ทำงานร่วมกับ GB300 NVL72 ได้อย่างเต็มประสิทธิภาพNVIDIA Megatron Core: เฟรมเวิร์กที่ปรับแต่งมาโดยเฉพาะสำหรับ GPU รุ่นใหม่นี้ สามารถทำประสิทธิภาพได้ถึง 1,648 TFLOPs ต่อ GPU บนโมเดล DeepSeek-V3 671B ซึ่งสูงกว่ารุ่นก่อนหน้า GB200 NVL72 ถึง 3 เท่าTorchTitan และ JAX: NVIDIA ได้ร่วมมือกับชุมชนผู้พัฒนาโอเพนซอร์ส เพื่อเพิ่มประสิทธิภาพของ PyTorch และ JAX ให้ทำงานได้เร็วขึ้นบน GB300 NVL72 โดยมีการปรับปรุงอย่างต่อเนื่อง ทำให้ประสิทธิภาพเพิ่มขึ้นอย่างก้าวกระโดด โดยเฉพาะ JAX ที่มีการเพิ่มประสิทธิภาพเกือบ 10 เท่าในช่วง 6 เดือนที่ผ่านมาการ Scale-up ที่ไร้ขีดจำกัด: เมื่อทดสอบการเทรนโมเดล DeepSeek-V3 671B จาก 256 เป็น 1,024 GPU ด้วย Megatron Core พบว่ายังคงรักษาประสิทธิภาพต่อ GPU ได้ถึง 98.5% ในขณะที่ TorchTitan และ JAX รักษาประสิทธิภาพได้ 97% แสดงให้เห็นว่าการเพิ่มจำนวน GPU ส่งผลโดยตรงต่อ throughput ของระบบโดยรวมได้อย่างมีประสิทธิภาพก้าวสู่ยุคใหม่ของการเทรนโมเดล AIการสร้างสถิติโลกใหม่ด้วย NVIDIA GB300 NVL72 ในการเทรนโมเดล DeepSeek-v3 671B ไม่เพียงแต่แสดงถึงประสิทธิภาพที่เหนือกว่า แต่ยังสะท้อนถึงความก้าวหน้าของการออกแบบแพลตฟอร์ม AI แบบครบวงจร ตั้งแต่ชิปประมวลผล, ระบบเชื่อมต่อ, เครือข่าย ไปจนถึงซอฟต์แวร์ ที่ทำงานร่วมกันอย่างลงตัวนี่คือรากฐานสำคัญที่จะช่วยให้นักวิจัยและนักพัฒนาสามารถสร้างสรรค์โมเดล AI ที่ใหญ่ขึ้น, ทดลองได้มากขึ้น, และก้าวข้ามขีดจำกัดของ AI ไปได้เร็วยิ่งขึ้นบนโครงสร้างพื้นฐานของ NVIDIA ที่พร้อมสำหรับการพัฒนา AI ในระดับแนวหน้าเริ่มต้นการเทรนโมเดล AI ระดับแนวหน้าบนโครงสร้างพื้นฐาน NVIDIA AIสำรวจสถาปัตยกรรมระดับ Rack-scale: ค้นพบรายละเอียดของ GB300 NVL72ขยายขีดความสามารถของ Workload: เริ่มต้นใช้งาน Megatron-Core สำหรับการเทรนโมเดลระดับแนวหน้าเพิ่มประสิทธิภาพสูงสุด: อ่านบทความเกี่ยวกับ NVIDIA CuteDSL fusion kernel เพื่อเพิ่มประสิทธิภาพด้วย CUDA graphs#NVIDIAGPU #AI #MoE #DeepLearning #Supercomputinghttps://developer.nvidia.com/blog/setting-a-world-record-for-moe-pre-training-on-nvidia-gb300-nvl72/
Shared content
DEVELOPER.NVIDIA.COM
Setting a World Record for MoE Pre-Training on NVIDIA GB300 NVL72
Frontier model pre-training has converged on mixture of experts (MoE), which is fundamentally changing what limits large-scale AI training. As compute per token falls…
2 التعليقات 0 المشاركات 283 مشاهدة 0 معاينة