เพิ่มประสิทธิภาพ AI Factory ต่อวัตต์สูงสุด ด้วย NVIDIA DSX MaxLPS

ในยุคที่ AI กำลังขับเคลื่อนอุตสาหกรรม การสร้าง "AI Factory" ที่มีประสิทธิภาพสูงสุดกลายเป็นหัวใจสำคัญ ระบบ AI Factory ในปัจจุบันมักมีข้อจำกัดด้านพลังงาน คำถามสำคัญจึงไม่ได้อยู่ที่ว่าเราจะติดตั้ง GPU ได้กี่ตัวในศูนย์ข้อมูล แต่เป็นการวัดว่าพลังงาน 1 เมกะวัตต์ จะสามารถสร้างผลลัพธ์ AI ได้มากเท่าใด ซึ่งทำให้ "ประสิทธิภาพต่อวัตต์" (Performance per Watt) กลายเป็นตัวชี้วัดหลักของความมีประสิทธิภาพ

ทำไมการจัดสรรพลังงานแบบคงที่ (Static Rack Provisioning) จึงทำให้พลังงานสูญเปล่า

โดยทั่วไปแล้ว การวางแผนพลังงานของศูนย์ข้อมูลแบบดั้งเดิมมักจะสำรองพลังงานไว้มากพอสำหรับทุกแร็คที่อาจดึงพลังงานสูงสุดพร้อมกัน ซึ่งเป็นการป้องกันระบบจากความต้องการใช้พลังงานสูงสุด แต่ก็เปรียบเสมือนการมองแต่ละแร็คเป็นเกาะพลังงานที่แยกจากกัน แร็คที่ได้รับการจัดสรรพลังงานมากเกินไปและไม่ได้ใช้งาน ก็ไม่สามารถแบ่งปันพลังงานส่วนเกินนั้นให้กับแร็คข้างเคียงที่อาจนำไปใช้ให้เกิดประโยชน์ได้

นอกจากนี้ ในระดับ AI Factory การใช้พลังงานของส่วนอำนวยความสะดวก (Facility Overhead) การสูญเสียพลังงานที่แร็ค (Rack Losses) และความไร้ประสิทธิภาพในการดำเนินงานระหว่างการเกิดข้อผิดพลาด การรีสตาร์ท หรือการสำรองข้อมูล (Checkpointing) ล้วนส่งผลให้พลังงานที่พร้อมใช้งานสำหรับ AI ลดลง การจัดสรรพลังงานแบบคงที่ยังทำให้เกิด "Headroom" หรือพลังงานสำรองที่ไม่ได้ใช้ภายในแร็ค ซึ่งพลังงานที่สงวนไว้สำหรับความต้องการสูงสุดของแร็คหนึ่ง อาจไม่ได้ถูกใช้งาน ในขณะที่แร็คอื่นกลับต้องการพลังงานนั้น

จากการวิเคราะห์ของ NVIDIA พบว่าในโรงงาน AI ขนาด 100 เมกะวัตต์ พลังงานที่จ่ายจากกริด 100 MW จะถูกแบ่งเป็น:

  • 20 MW สำหรับส่วนอำนวยความสะดวก (Facility Overhead)
  • 10 MW สำหรับการสูญเสียพลังงานที่แร็ค (Rack Losses)
  • 10 MW ที่ไม่สามารถนำมาใช้สำหรับ AI ได้เนื่องจากความไร้ประสิทธิภาพในการดำเนินงาน
  • เหลือเพียง 60 MW สำหรับการประมวลผล AI

NVIDIA DSX MaxLPS: เพิ่มประสิทธิภาพสูงสุดภายใต้งบประมาณพลังงานที่จำกัด

NVIDIA DSX MaxLPS คือชุดเทคโนโลยีที่ผสานรวมทั้งชิป, ระบบระบายความร้อน, ระบบ และซอฟต์แวร์ เพื่อเพิ่มปริมาณผลลัพธ์ AI สูงสุดภายใต้งบประมาณพลังงานที่จำกัด MaxLPS ย่อมาจาก Maximum Land Power Shell ซึ่งหมายถึงข้อจำกัดระดับไซต์งานที่กำหนด AI Factory ได้แก่ ที่ดิน, พลังงานสาธารณูปโภค และโครงสร้างทางกายภาพที่รองรับระบบพลังงาน, ระบบระบายความร้อน, ระบบเครือข่าย และโครงสร้างพื้นฐานการประมวลผล

MaxLPS ออกแบบมาเพื่อเพิ่มประสิทธิภาพในสามส่วนหลัก:

1. การจัดสรรพลังงานแบบไดนามิก (Dynamic Power Allocation) ✅

เทคโนโลยีนี้ช่วยในการตรวจสอบและจัดสรรพลังงานส่วนเกินที่ไม่ได้ใช้งานให้กับ GPU อย่างต่อเนื่อง โดยใช้ Dynamic Power Software (DPS) ที่สามารถปรับเปลี่ยนการจัดสรรพลังงานได้แบบเรียลไทม์ทั่วทั้งแร็คและ GPU อาศัยการวัดค่า (Telemetry) และการควบคุมตามนโยบาย (Policy-driven controls) เพื่อรักษาระดับการใช้งานให้เหมาะสม ปรับตัวเข้ากับเหตุการณ์ที่เกิดขึ้นในไซต์งาน และหลีกเลี่ยงการกำหนดค่าใหม่ด้วยตนเอง ส่งผลให้มีความหนาแน่นของแร็คและประสิทธิภาพต่อวัตต์สูงขึ้นอย่างมีนัยสำคัญ

DPS ทำงานเป็นวงจรควบคุมอย่างต่อเนื่อง โดยรวบรวมข้อมูลการใช้พลังงานจากระดับ GPU, แร็ค และกลุ่ม จากนั้นจะระบุความจุพลังงานที่ไม่ได้ใช้ แล้วจัดสรรพลังงานใหม่ภายในขอบเขตของนโยบายที่กำหนดไว้ พร้อมทั้งตรวจสอบการปฏิบัติตามข้อกำหนดของงบประมาณพลังงานกลุ่ม และตอบสนองต่อเหตุการณ์ด้านพลังงานหรือนโยบายฉุกเฉิน

2. เทคนิคประสิทธิภาพต่อวัตต์ขั้นสูง (Advanced Performance per Watt Techniques) 💡

นอกเหนือจากการจัดการพลังงานระดับแร็คแล้ว MaxLPS ยังรวมคุณสมบัติซอฟต์แวร์ที่ช่วยเพิ่มประสิทธิภาพการใช้พลังงานของ GPU แต่ละตัวให้ดียิ่งขึ้น DSX MaxLPS มีโซลูชันการปรับโปรไฟล์การทำงานของปริมาณงาน (Workload Profile Power Solutions - WPPS) ที่ปรับให้เหมาะสมสำหรับโหมดการทำงานทั่วไปของศูนย์ข้อมูล เช่น การอนุมาน (Inference), การฝึก (Training), การทำงานที่เน้นหน่วยความจำ (Memory-bound) และการทำงานที่เน้นการประมวลผล (Compute-bound) แทนที่จะต้องปรับแต่งพลังงาน, หน่วยความจำ, ความถี่ และพฤติกรรมอื่นๆ ของโหนดสำหรับทุกงาน ผู้ปฏิบัติงานสามารถใช้โปรไฟล์ที่ผ่านการตรวจสอบแล้ว ซึ่งสอดคล้องกับพฤติกรรมการประมวลผลของปริมาณงานนั้นๆ

Application Performance and Power Manager (APPM) จะนำการกำหนดค่าที่เลือกไปใช้กับ GPU ที่เข้าร่วม ในขณะที่ซอฟต์แวร์อย่าง NVIDIA Dynamo สามารถปรับปรุงประสิทธิภาพและการใช้พลังงานระหว่างแร็คให้ดียิ่งขึ้นสำหรับบริการอนุมาน หลักการสำคัญคือการเพิ่มประสิทธิภาพ AI Factory โดยการปรับการกำหนดค่า GPU, พฤติกรรมแอปพลิเคชัน และโทโพโลยีการให้บริการ เพื่อเพิ่มประสิทธิภาพและผลลัพธ์ต่อวัตต์ทั่วทั้งระบบ

3. ประสิทธิภาพการระบายความร้อนด้วยของเหลวที่ 45° C (45° C Thermal Efficiency and Site Design) ❄️

MaxLPS ยังรวมถึงการออกแบบระบบระบายความร้อนด้วยของเหลวที่อุณหภูมิทางเข้า 45° C ซึ่งช่วยลดภาระการระบายความร้อน ทำให้ประสิทธิภาพการใช้พลังงาน (PUE) ดีขึ้น และแปลงเป็นพลังงานสำหรับการประมวลผลที่มากขึ้นภายในพื้นที่ที่จำกัดเท่าเดิม การใช้น้ำหล่อเย็นที่อุ่นขึ้นนี้ช่วยให้สามารถใช้ "Free Cooling" ซึ่งเป็นการใช้ลมหรือน้ำจากภายนอกเพื่อระบายความร้อน โดยใช้การทำความเย็นเชิงกลน้อยลง ซึ่งช่วยลดการใช้พลังงานของเครื่องทำความเย็น (Chillers) ที่ใช้พลังงานสูง

ผลลัพธ์ที่น่าประทับใจจากการใช้งาน MaxLPS 🚀

จากการทดสอบระบบ NVIDIA Vera Rubin NVL72 และ GB200 NVL72 ด้วย MaxLPS คาดว่าจะสามารถเพิ่มความจุ GPU ได้มากถึง 40% ภายในโรงงานเดียวกัน โดยมีการปรับปรุงประสิทธิภาพต่อวัตต์ประมาณ 1.3-1.5 เท่า ขึ้นอยู่กับการออกแบบโครงสร้างพื้นฐานที่เหมาะสม, การวิเคราะห์ปริมาณงาน และการมีส่วนร่วมตั้งแต่เนิ่นๆ ในการออกแบบระบบระบายความร้อนด้วยของเหลวที่ 45° C

ในการทดสอบกับปริมาณงานอนุมานจริง:

  • GB200 NVL72: MaxLPS ช่วยลดการจัดสรรพลังงานต่อแร็คจาก 125 kW เหลือ 90 kW ทำให้สามารถติดตั้งแร็คเพิ่มขึ้นได้ 39% ภายในงบประมาณพลังงานเท่าเดิม โดยประสิทธิภาพต่อวัตต์เพิ่มขึ้นประมาณ 1.5 เท่า
  • Vera Rubin NVL72: MaxLPS ช่วยลดการจัดสรรพลังงานต่อแร็คจาก 136 kW เหลือ 101 kW ทำให้สามารถติดตั้งแร็คเพิ่มขึ้นได้ 35% ภายในงบประมาณพลังงานเท่าเดิม โดยประสิทธิภาพต่อวัตต์เพิ่มขึ้นประมาณ 1.3-1.4 เท่า

การออกแบบไซต์ AI Factory สำหรับ MaxLPS 🏗️

การออกแบบโครงสร้างพื้นฐานสำหรับ MaxLPS เริ่มต้นด้วยงบประมาณพลังงานรวมของโรงงาน และคำนวณย้อนกลับเพื่อกำหนดจำนวนตำแหน่งแร็ค GPU สูงสุดที่ไซต์งานสามารถรองรับได้ภายใต้จุดทำงานของ MaxLPS นอกจากนี้ยังกำหนดเป้าหมายโครงสร้างพื้นฐานระยะยาวสำหรับกำลังไฟฟ้า, ระบบระบายความร้อน, พื้นที่ และความจุเครือข่าย

การติดตั้งในระยะแรกอาจมีจำนวนน้อยกว่าขีดจำกัดของโครงสร้างพื้นฐาน เนื่องจากปริมาณงานที่เน้นการฝึก (Training) หรือหลังการฝึก (Post-training) อาจมีการใช้พลังงานเฉลี่ยต่อแร็คสูงกว่าจุดทำงานเฉลี่ยของ MaxLPS แต่เมื่อส่วนผสมของปริมาณงานเปลี่ยนไปสู่การอนุมาน (Inference) มากขึ้นเมื่อเวลาผ่านไป การใช้พลังงานเฉลี่ยต่อแร็คจะลดลง ทำให้มีพื้นที่ว่างสำหรับติดตั้งแร็คเพิ่มเติมโดยไม่ต้องเพิ่มงบประมาณพลังงานของโรงงาน

คำถามที่พบบ่อย (FAQ)

MaxLPS ช่วยแก้ปัญหาพลังงานสูญเปล่าได้อย่างไร?

MaxLPS ใช้การจัดสรรพลังงานแบบไดนามิก (Dynamic Power Allocation) ผ่านซอฟต์แวร์ DPS เพื่อตรวจสอบและจัดสรรพลังงานส่วนเกินที่ไม่ได้ใช้งานให้กับ GPU ที่ต้องการ ทำให้ใช้พลังงานที่มีอยู่ได้อย่างคุ้มค่าสูงสุด

การระบายความร้อนด้วยของเหลวที่ 45° C มีประโยชน์อย่างไร?

ช่วยให้การระบายความร้อนมีประสิทธิภาพมากขึ้น ลดการพึ่งพาเครื่องทำความเย็นที่ใช้พลังงานสูง และเพิ่มพลังงานที่สามารถนำไปใช้สำหรับการประมวลผล AI ได้

MaxLPS เหมาะกับใคร?

เหมาะสำหรับองค์กรที่ต้องการเพิ่มประสิทธิภาพและความหนาแน่นของ AI Factory ภายใต้งบประมาณพลังงานที่จำกัด โดยเฉพาะอย่างยิ่งสำหรับปริมาณงาน AI ที่หลากหลาย เช่น การฝึก, การอนุมาน และการประมวลผลหลังการฝึก

การติดตั้ง MaxLPS ต้องทำอย่างไร?

เริ่มต้นด้วยการออกแบบไซต์งานตามหลักการของ MaxLPS กำหนดเป้าหมายโครงสร้างพื้นฐานระยะยาว และวางแผนการติดตั้งแร็คตามส่วนผสมของปริมาณงานที่คาดการณ์ไว้

ขอบคุณ แหล่งข้อมูล
https://developer.nvidia.com/blog/maximizing-ai-factory-performance-per-watt-with-nvidia-dsx-maxlps/

เพิ่มประสิทธิภาพ AI Factory ต่อวัตต์สูงสุด ด้วย NVIDIA DSX MaxLPSในยุคที่ AI กำลังขับเคลื่อนอุตสาหกรรม การสร้าง "AI Factory" ที่มีประสิทธิภาพสูงสุดกลายเป็นหัวใจสำคัญ ระบบ AI Factory ในปัจจุบันมักมีข้อจำกัดด้านพลังงาน คำถามสำคัญจึงไม่ได้อยู่ที่ว่าเราจะติดตั้ง GPU ได้กี่ตัวในศูนย์ข้อมูล แต่เป็นการวัดว่าพลังงาน 1 เมกะวัตต์ จะสามารถสร้างผลลัพธ์ AI ได้มากเท่าใด ซึ่งทำให้ "ประสิทธิภาพต่อวัตต์" (Performance per Watt) กลายเป็นตัวชี้วัดหลักของความมีประสิทธิภาพทำไมการจัดสรรพลังงานแบบคงที่ (Static Rack Provisioning) จึงทำให้พลังงานสูญเปล่าโดยทั่วไปแล้ว การวางแผนพลังงานของศูนย์ข้อมูลแบบดั้งเดิมมักจะสำรองพลังงานไว้มากพอสำหรับทุกแร็คที่อาจดึงพลังงานสูงสุดพร้อมกัน ซึ่งเป็นการป้องกันระบบจากความต้องการใช้พลังงานสูงสุด แต่ก็เปรียบเสมือนการมองแต่ละแร็คเป็นเกาะพลังงานที่แยกจากกัน แร็คที่ได้รับการจัดสรรพลังงานมากเกินไปและไม่ได้ใช้งาน ก็ไม่สามารถแบ่งปันพลังงานส่วนเกินนั้นให้กับแร็คข้างเคียงที่อาจนำไปใช้ให้เกิดประโยชน์ได้นอกจากนี้ ในระดับ AI Factory การใช้พลังงานของส่วนอำนวยความสะดวก (Facility Overhead) การสูญเสียพลังงานที่แร็ค (Rack Losses) และความไร้ประสิทธิภาพในการดำเนินงานระหว่างการเกิดข้อผิดพลาด การรีสตาร์ท หรือการสำรองข้อมูล (Checkpointing) ล้วนส่งผลให้พลังงานที่พร้อมใช้งานสำหรับ AI ลดลง การจัดสรรพลังงานแบบคงที่ยังทำให้เกิด "Headroom" หรือพลังงานสำรองที่ไม่ได้ใช้ภายในแร็ค ซึ่งพลังงานที่สงวนไว้สำหรับความต้องการสูงสุดของแร็คหนึ่ง อาจไม่ได้ถูกใช้งาน ในขณะที่แร็คอื่นกลับต้องการพลังงานนั้นจากการวิเคราะห์ของ NVIDIA พบว่าในโรงงาน AI ขนาด 100 เมกะวัตต์ พลังงานที่จ่ายจากกริด 100 MW จะถูกแบ่งเป็น:20 MW สำหรับส่วนอำนวยความสะดวก (Facility Overhead)10 MW สำหรับการสูญเสียพลังงานที่แร็ค (Rack Losses)10 MW ที่ไม่สามารถนำมาใช้สำหรับ AI ได้เนื่องจากความไร้ประสิทธิภาพในการดำเนินงานเหลือเพียง 60 MW สำหรับการประมวลผล AINVIDIA DSX MaxLPS: เพิ่มประสิทธิภาพสูงสุดภายใต้งบประมาณพลังงานที่จำกัดNVIDIA DSX MaxLPS คือชุดเทคโนโลยีที่ผสานรวมทั้งชิป, ระบบระบายความร้อน, ระบบ และซอฟต์แวร์ เพื่อเพิ่มปริมาณผลลัพธ์ AI สูงสุดภายใต้งบประมาณพลังงานที่จำกัด MaxLPS ย่อมาจาก Maximum Land Power Shell ซึ่งหมายถึงข้อจำกัดระดับไซต์งานที่กำหนด AI Factory ได้แก่ ที่ดิน, พลังงานสาธารณูปโภค และโครงสร้างทางกายภาพที่รองรับระบบพลังงาน, ระบบระบายความร้อน, ระบบเครือข่าย และโครงสร้างพื้นฐานการประมวลผลMaxLPS ออกแบบมาเพื่อเพิ่มประสิทธิภาพในสามส่วนหลัก:1. การจัดสรรพลังงานแบบไดนามิก (Dynamic Power Allocation) ✅เทคโนโลยีนี้ช่วยในการตรวจสอบและจัดสรรพลังงานส่วนเกินที่ไม่ได้ใช้งานให้กับ GPU อย่างต่อเนื่อง โดยใช้ Dynamic Power Software (DPS) ที่สามารถปรับเปลี่ยนการจัดสรรพลังงานได้แบบเรียลไทม์ทั่วทั้งแร็คและ GPU อาศัยการวัดค่า (Telemetry) และการควบคุมตามนโยบาย (Policy-driven controls) เพื่อรักษาระดับการใช้งานให้เหมาะสม ปรับตัวเข้ากับเหตุการณ์ที่เกิดขึ้นในไซต์งาน และหลีกเลี่ยงการกำหนดค่าใหม่ด้วยตนเอง ส่งผลให้มีความหนาแน่นของแร็คและประสิทธิภาพต่อวัตต์สูงขึ้นอย่างมีนัยสำคัญDPS ทำงานเป็นวงจรควบคุมอย่างต่อเนื่อง โดยรวบรวมข้อมูลการใช้พลังงานจากระดับ GPU, แร็ค และกลุ่ม จากนั้นจะระบุความจุพลังงานที่ไม่ได้ใช้ แล้วจัดสรรพลังงานใหม่ภายในขอบเขตของนโยบายที่กำหนดไว้ พร้อมทั้งตรวจสอบการปฏิบัติตามข้อกำหนดของงบประมาณพลังงานกลุ่ม และตอบสนองต่อเหตุการณ์ด้านพลังงานหรือนโยบายฉุกเฉิน2. เทคนิคประสิทธิภาพต่อวัตต์ขั้นสูง (Advanced Performance per Watt Techniques) 💡นอกเหนือจากการจัดการพลังงานระดับแร็คแล้ว MaxLPS ยังรวมคุณสมบัติซอฟต์แวร์ที่ช่วยเพิ่มประสิทธิภาพการใช้พลังงานของ GPU แต่ละตัวให้ดียิ่งขึ้น DSX MaxLPS มีโซลูชันการปรับโปรไฟล์การทำงานของปริมาณงาน (Workload Profile Power Solutions - WPPS) ที่ปรับให้เหมาะสมสำหรับโหมดการทำงานทั่วไปของศูนย์ข้อมูล เช่น การอนุมาน (Inference), การฝึก (Training), การทำงานที่เน้นหน่วยความจำ (Memory-bound) และการทำงานที่เน้นการประมวลผล (Compute-bound) แทนที่จะต้องปรับแต่งพลังงาน, หน่วยความจำ, ความถี่ และพฤติกรรมอื่นๆ ของโหนดสำหรับทุกงาน ผู้ปฏิบัติงานสามารถใช้โปรไฟล์ที่ผ่านการตรวจสอบแล้ว ซึ่งสอดคล้องกับพฤติกรรมการประมวลผลของปริมาณงานนั้นๆApplication Performance and Power Manager (APPM) จะนำการกำหนดค่าที่เลือกไปใช้กับ GPU ที่เข้าร่วม ในขณะที่ซอฟต์แวร์อย่าง NVIDIA Dynamo สามารถปรับปรุงประสิทธิภาพและการใช้พลังงานระหว่างแร็คให้ดียิ่งขึ้นสำหรับบริการอนุมาน หลักการสำคัญคือการเพิ่มประสิทธิภาพ AI Factory โดยการปรับการกำหนดค่า GPU, พฤติกรรมแอปพลิเคชัน และโทโพโลยีการให้บริการ เพื่อเพิ่มประสิทธิภาพและผลลัพธ์ต่อวัตต์ทั่วทั้งระบบ3. ประสิทธิภาพการระบายความร้อนด้วยของเหลวที่ 45° C (45° C Thermal Efficiency and Site Design) ❄️MaxLPS ยังรวมถึงการออกแบบระบบระบายความร้อนด้วยของเหลวที่อุณหภูมิทางเข้า 45° C ซึ่งช่วยลดภาระการระบายความร้อน ทำให้ประสิทธิภาพการใช้พลังงาน (PUE) ดีขึ้น และแปลงเป็นพลังงานสำหรับการประมวลผลที่มากขึ้นภายในพื้นที่ที่จำกัดเท่าเดิม การใช้น้ำหล่อเย็นที่อุ่นขึ้นนี้ช่วยให้สามารถใช้ "Free Cooling" ซึ่งเป็นการใช้ลมหรือน้ำจากภายนอกเพื่อระบายความร้อน โดยใช้การทำความเย็นเชิงกลน้อยลง ซึ่งช่วยลดการใช้พลังงานของเครื่องทำความเย็น (Chillers) ที่ใช้พลังงานสูงผลลัพธ์ที่น่าประทับใจจากการใช้งาน MaxLPS 🚀จากการทดสอบระบบ NVIDIA Vera Rubin NVL72 และ GB200 NVL72 ด้วย MaxLPS คาดว่าจะสามารถเพิ่มความจุ GPU ได้มากถึง 40% ภายในโรงงานเดียวกัน โดยมีการปรับปรุงประสิทธิภาพต่อวัตต์ประมาณ 1.3-1.5 เท่า ขึ้นอยู่กับการออกแบบโครงสร้างพื้นฐานที่เหมาะสม, การวิเคราะห์ปริมาณงาน และการมีส่วนร่วมตั้งแต่เนิ่นๆ ในการออกแบบระบบระบายความร้อนด้วยของเหลวที่ 45° Cในการทดสอบกับปริมาณงานอนุมานจริง:GB200 NVL72: MaxLPS ช่วยลดการจัดสรรพลังงานต่อแร็คจาก 125 kW เหลือ 90 kW ทำให้สามารถติดตั้งแร็คเพิ่มขึ้นได้ 39% ภายในงบประมาณพลังงานเท่าเดิม โดยประสิทธิภาพต่อวัตต์เพิ่มขึ้นประมาณ 1.5 เท่าVera Rubin NVL72: MaxLPS ช่วยลดการจัดสรรพลังงานต่อแร็คจาก 136 kW เหลือ 101 kW ทำให้สามารถติดตั้งแร็คเพิ่มขึ้นได้ 35% ภายในงบประมาณพลังงานเท่าเดิม โดยประสิทธิภาพต่อวัตต์เพิ่มขึ้นประมาณ 1.3-1.4 เท่าการออกแบบไซต์ AI Factory สำหรับ MaxLPS 🏗️การออกแบบโครงสร้างพื้นฐานสำหรับ MaxLPS เริ่มต้นด้วยงบประมาณพลังงานรวมของโรงงาน และคำนวณย้อนกลับเพื่อกำหนดจำนวนตำแหน่งแร็ค GPU สูงสุดที่ไซต์งานสามารถรองรับได้ภายใต้จุดทำงานของ MaxLPS นอกจากนี้ยังกำหนดเป้าหมายโครงสร้างพื้นฐานระยะยาวสำหรับกำลังไฟฟ้า, ระบบระบายความร้อน, พื้นที่ และความจุเครือข่ายการติดตั้งในระยะแรกอาจมีจำนวนน้อยกว่าขีดจำกัดของโครงสร้างพื้นฐาน เนื่องจากปริมาณงานที่เน้นการฝึก (Training) หรือหลังการฝึก (Post-training) อาจมีการใช้พลังงานเฉลี่ยต่อแร็คสูงกว่าจุดทำงานเฉลี่ยของ MaxLPS แต่เมื่อส่วนผสมของปริมาณงานเปลี่ยนไปสู่การอนุมาน (Inference) มากขึ้นเมื่อเวลาผ่านไป การใช้พลังงานเฉลี่ยต่อแร็คจะลดลง ทำให้มีพื้นที่ว่างสำหรับติดตั้งแร็คเพิ่มเติมโดยไม่ต้องเพิ่มงบประมาณพลังงานของโรงงานคำถามที่พบบ่อย (FAQ)MaxLPS ช่วยแก้ปัญหาพลังงานสูญเปล่าได้อย่างไร?MaxLPS ใช้การจัดสรรพลังงานแบบไดนามิก (Dynamic Power Allocation) ผ่านซอฟต์แวร์ DPS เพื่อตรวจสอบและจัดสรรพลังงานส่วนเกินที่ไม่ได้ใช้งานให้กับ GPU ที่ต้องการ ทำให้ใช้พลังงานที่มีอยู่ได้อย่างคุ้มค่าสูงสุดการระบายความร้อนด้วยของเหลวที่ 45° C มีประโยชน์อย่างไร?ช่วยให้การระบายความร้อนมีประสิทธิภาพมากขึ้น ลดการพึ่งพาเครื่องทำความเย็นที่ใช้พลังงานสูง และเพิ่มพลังงานที่สามารถนำไปใช้สำหรับการประมวลผล AI ได้MaxLPS เหมาะกับใคร?เหมาะสำหรับองค์กรที่ต้องการเพิ่มประสิทธิภาพและความหนาแน่นของ AI Factory ภายใต้งบประมาณพลังงานที่จำกัด โดยเฉพาะอย่างยิ่งสำหรับปริมาณงาน AI ที่หลากหลาย เช่น การฝึก, การอนุมาน และการประมวลผลหลังการฝึกการติดตั้ง MaxLPS ต้องทำอย่างไร?เริ่มต้นด้วยการออกแบบไซต์งานตามหลักการของ MaxLPS กำหนดเป้าหมายโครงสร้างพื้นฐานระยะยาว และวางแผนการติดตั้งแร็คตามส่วนผสมของปริมาณงานที่คาดการณ์ไว้https://developer.nvidia.com/blog/maximizing-ai-factory-performance-per-watt-with-nvidia-dsx-maxlps/
Shared content
DEVELOPER.NVIDIA.COM
Maximizing AI Factory Performance per Watt with NVIDIA DSX MaxLPS
AI factories are power-constrained industrial systems. The question is no longer how many GPUs fit in a data center, but how much AI output each available megawatt can deliver.
6 Σχόλια 0 Μοιράστηκε 702 Views 0 Προεπισκόπηση