NVIDIA Rubin GPU: สถาปัตยกรรมใหม่ ขับเคลื่อนยุค AI Agentic
โลกของปัญญาประดิษฐ์ (AI) กำลังก้าวข้ามขีดจำกัดจากการฝึกโมเดลแบบแยกส่วนและแชทบอทที่ตอบโต้กับมนุษย์ ไปสู่ "โรงงาน AI" ที่ทำงานตลอดเวลาเพื่อสร้างสรรค์ความฉลาดในระดับมหาศาล โรงงานเหล่านี้กำลังถูกมอบหมายให้ขับเคลื่อนเวิร์กโฟลว์แบบ Agentic AI ซึ่งสามารถใช้เหตุผล วางแผน ใช้เครื่องมือ ตรวจสอบผลลัพธ์ระหว่างดำเนินการ และทำงานที่ซับซ้อนหลายขั้นตอนในบริบทที่กว้างขวาง
เวิร์กโฟลว์แบบ Agentic AI ไม่ได้ถูกจำกัดด้วยการตอบสนองต่อ Prompt เพียงครั้งเดียว แต่เป็นการอนุมานอย่างต่อเนื่องผ่านขั้นตอนการใช้เหตุผลจำนวนมาก ซึ่งต้องการความหน่วงแฝงต่อขั้นตอนที่ต่ำ, ทรูพุตการถอดรหัสที่สูง, การประมวลผล Long-Context Attention ที่มีประสิทธิภาพ, ความจุ KV Cache ขนาดใหญ่ และความสามารถในการปรับขนาดโมเดลข้ามโดเมน GPU ที่เชื่อมต่อกันอย่างแน่นหนา เพื่อให้วิสัยทัศน์นี้เป็นจริง ศูนย์ข้อมูลจึงต้องได้รับการออกแบบใหม่ให้เป็นหน่วยประมวลผลเดี่ยว ซึ่งเป็นสิ่งที่แพลตฟอร์ม NVIDIA Vera Rubin สามารถทำได้
หัวใจสำคัญ: NVIDIA Rubin GPU
NVIDIA Rubin GPU คือแกนหลักของแพลตฟอร์ม Vera Rubin ซึ่งถูกออกแบบมาเพื่อมอบ ทรูพุต Agentic ที่สูงขึ้นถึง 10 เท่าต่อหน่วยพลังงาน เมื่อเทียบกับ NVIDIA Blackwell โดยมีส่วนประกอบสำคัญคือ:
- 336 พันล้านทรานซิสเตอร์: ให้ความหนาแน่นในการประมวลผลที่สูง
- 224 Streaming Multiprocessors (SMs): หน่วยประมวลผลหลักที่ทำงานขนานกัน
- 896 Tensor Cores: ปรับปรุงประสิทธิภาพการคำนวณเมทริกซ์ พร้อมความยืดหยุ่นในการเลือกใช้ Precision ที่สูงขึ้น
- Transformer Engine รุ่นที่ 3: ช่วยเร่งการทำงานของโมเดล Transformer ให้มีประสิทธิภาพสูงสุด
- 288 GB HBM4 Memory: หน่วยความจำความเร็วสูงที่ให้แบนด์วิดท์สูงสุดถึง 22 TB/s
นวัตกรรมเหล่านี้ เช่น Tensor Memory Accelerator ที่ได้รับการปรับปรุง, การอัปเดต Descriptor แบบ Inline, การจัดการ Activation Sparsity, Adaptive Compression และการกระตุ้น Kernel แบบ Fine-grained ช่วยเพิ่มประสิทธิภาพการปรับขนาดโมเดลแบบ Mixture-of-Experts (MoE), การประมวลผล Long-Context Attention และลดความหน่วงแฝงในการเปลี่ยน Kernel ทำให้สามารถ เพิ่มจำนวน Tokens ต่อวินาที และ Tokens ต่อวัตต์ สำหรับเวิร์กโหลด Agentic Inference ได้อย่างมีนัยสำคัญ
สถาปัตยกรรม Rubin: รองรับ Agentic Workloads อย่างไร?
Rubin GPU ถูกสร้างขึ้นจากชิปประมวลผลที่จำกัดด้วย Reticle เพื่อให้ได้ความหนาแน่นและประสิทธิภาพสูง โดยชิปทั้งสองจะถูกรวมเข้าด้วยกันในแพ็คเกจเดียวผ่านลิงก์ความเร็วสูงที่เรียกว่า NVIDIA High-Bandwidth Interface (NV-HBI)
หัวใจสำคัญของสถาปัตยกรรมนี้คือการจัดการให้การประมวลผลจำนวนมหาศาลทำงานได้อย่างต่อเนื่อง แม้ว่า Agentic Workloads จะมีการสลับเปลี่ยนระหว่างการใช้เหตุผล, การสร้างข้อความ, การดึงข้อมูล หรือการใช้เครื่องมือก็ตาม ด้วยจำนวนทรานซิสเตอร์, SMs และ Tensor Cores ที่กล่าวมาข้างต้น พร้อม Transformer Engine รุ่นที่ 3 ที่สามารถมอบประสิทธิภาพ NVFP4 สูงถึง 50 Petaflops Rubin GPU จึงมีความยืดหยุ่นในการปรับ Precision ให้เหมาะสมกับรูปแบบตัวเลขต่างๆ โดยยังคงรักษาความแม่นยำไว้ได้
ประสิทธิภาพไม่ได้ขึ้นอยู่กับทรูพุตของ Tensor Core เพียงอย่างเดียว Rubin GPU จัดระเบียบทรัพยากรการประมวลผลเป็น Graphics Processor Clusters (GPCs) พร้อม L2 Cache ขนาดใหญ่ที่อยู่ตรงกลาง GigaThread Engine ทำหน้าที่ประสานงานการทำงาน, MIG Control แบ่งพาร์ติชัน GPU สำหรับเวิร์กโหลดหลายรายการ และ NV-DEC เร่งการถอดรหัส ความสามารถเหล่านี้ช่วยให้ Rubin GPU เปลี่ยนความหนาแน่นของการประมวลผลให้เป็นการใช้งานที่ต่อเนื่องสำหรับเวิร์กโหลดที่หลากหลายและเปลี่ยนแปลงตลอดเวลาของระบบ Agentic ขนาดใหญ่
การใช้งานที่ต่อเนื่องยังขึ้นอยู่กับความเร็วในการนำข้อมูลไปยังคอร์ประมวลผล Rubin ได้รวมเอา HBM4 Memory สูงสุด 288 GB ซึ่งขับเคลื่อนโดย HBM controllers และ 12-Hi stacks เพื่อมอบแบนด์วิดท์สูงสุดถึง 22 TB/s นอกจากนี้ Enhanced Tensor Memory Accelerator (TMA) ยังจัดการการเคลื่อนย้ายข้อมูลอย่างมีประสิทธิภาพสูงข้ามเลย์เอาต์ข้อมูลที่ซับซ้อน NVIDIA NVLink 6 ให้แบนด์วิดท์ Scale-up สูงถึง 3,600 GB/s สำหรับการสื่อสาร GPU-GPU แบบ All-to-all, NVLink-C2C ให้การสื่อสาร CPU-GPU ที่สอดคล้องกันที่ 1,800 GB/s และ PCIe Gen 6 x16 ให้การเชื่อมต่อ Host สูงสุดถึง 256 GB/s
สุดท้าย การปรับใช้ Agentic ขนาดใหญ่จำเป็นต้องปกป้องข้อมูลเสมอเมื่อมีการเคลื่อนย้ายผ่านโดเมนการประมวลผลนี้ Confidential Computing พร้อม TEE-I/O ได้รับการออกแบบมาเพื่อรักษาความปลอดภัยของข้อมูลทั้งในขณะจัดเก็บ, ขณะส่งผ่าน และขณะใช้งานทั่วทั้ง AI Factory ความสามารถเหล่านี้ทั้งด้านการประมวลผล, หน่วยความจำ, การเชื่อมต่อ และความปลอดภัย จึงเป็นรากฐานระดับ GPU สำหรับ Agentic Workloads ที่ต้องคงประสิทธิภาพการประมวลผลอย่างต่อเนื่องสำหรับโมเดลที่ใหญ่ขึ้นเรื่อยๆ และโดเมน Scale-up
Rubin GPU เร่งความเร็วเส้นทางการอนุมานที่สำคัญอย่างไร?
ทรูพุตการประมวลผลสูงสุดเพียงอย่างเดียวไม่เพียงพอสำหรับการเร่งความเร็ว Agentic Inference ประสิทธิภาพในโลกจริงยังขึ้นอยู่กับความมีประสิทธิภาพของ GPU ในการเคลื่อนย้ายข้อมูล, การดำเนินการคำนวณเมทริกซ์, การประมวลผล Long-Context Attention และการเปลี่ยนจาก Kernel หนึ่งไปยังอีก Kernel หนึ่ง ส่วนนี้จะสำรวจคุณสมบัติของ Rubin GPU ที่ออกแบบมาเพื่อลด Overhead ในเส้นทางการประมวลผลที่สำคัญเหล่านี้
🚀 เร่งการเคลื่อนย้ายน้ำหนัก (Weights) และโทเค็น (Tokens) สำหรับ MoE ในระดับ Rack
โมเดล Mixture-of-Experts (MoE) จะกำหนดเส้นทางของโทเค็นไปยังเครือข่ายผู้เชี่ยวชาญ (Expert Networks) หลายเครือข่ายแบบไดนามิก เมื่อจำนวนผู้เชี่ยวชาญเพิ่มขึ้น การค้นหาและเคลื่อนย้ายน้ำหนักของผู้เชี่ยวชาญอย่างมีประสิทธิภาพจะมีความสำคัญต่อประสิทธิภาพการอนุมานมากขึ้น
Rubin GPU ได้ปรับปรุง Tensor Memory Accelerator เพื่อลด Overhead การเคลื่อนย้ายข้อมูลสำหรับโมเดลที่มีผู้เชี่ยวชาญจำนวนมาก การจัดการ Descriptor ที่ดีขึ้นช่วยให้ซอฟต์แวร์ทำงานกับ Tensors ที่มีเลย์เอาต์เหมือนกันแต่เก็บอยู่ในตำแหน่งหน่วยความจำต่างกันได้อย่างมีประสิทธิภาพมากขึ้น
Rubin ปรับปรุงสิ่งนี้ด้วยการรองรับการอัปเดต Descriptor แบบ Inline (รูปที่ 3) แทนที่จะแก้ไข Descriptor ในหน่วยความจำ Kernel สามารถเก็บ Descriptor แบบรวมสำหรับ Tensors ที่มีเลย์เอาต์เดียวกัน และแทนที่ฟิลด์ต่างๆ เช่น ตัวชี้หน่วยความจำและ Stride ได้โดยตรงในคำสั่ง TMA ขณะรันไทม์
สิ่งนี้ช่วยให้โมเดล MoE สามารถปรับขนาดได้อย่างมีประสิทธิภาพมากขึ้นเมื่อจำนวนผู้เชี่ยวชาญเพิ่มขึ้น ด้วยการลด Overhead การจัดการ Metadata และการเคลื่อนย้ายข้อมูล Rubin ช่วยให้เวลา GPU ถูกนำไปใช้กับการประมวลผล Inference ที่มีประโยชน์มากขึ้น สนับสนุนทรูพุตที่สูงขึ้นสำหรับ Agentic Workloads ที่ต้องพึ่งพาโมเดล MoE ขนาดใหญ่
✌️ เพิ่มประสิทธิภาพการคำนวณเมทริกซ์เป็นสองเท่าในระดับ Rack
Rubin สองเท่าของทรูพุต Tensor Core ต่อ Clock โดยการเพิ่มปริมาณข้อมูลที่สามารถประมวลผลตามมิติ \(K\) เป็นสองเท่า การปรับปรุงนี้ไม่เพียงช่วย Kernel ที่มีข้อจำกัดด้านทรูพุต แต่ยัง
ขอบคุณ แหล่งข้อมูล
https://developer.nvidia.com/blog/inside-nvidia-rubin-gpu-architecture-powering-the-era-of-agentic-ai/