Qwen3.8-2.4T-A95B: โมเดล AI ขนาด 2.4 ล้านล้านพารามิเตอร์ พร้อมการให้เหตุผลที่ปรับแต่งได้บน NVIDIA GB300 NVL72

Alibaba ได้เปิดตัวโมเดลภาษาขนาดใหญ่ (LLM) ชื่อ Qwen3.8-2.4T-A95B หรือที่รู้จักในชื่อ Qwen3.8-Max ซึ่งเป็นโมเดลโอเพนเวตที่ใหญ่ที่สุดจาก Alibaba โดยนำความสามารถระดับใกล้เคียงแนวหน้ามาสู่ระบบนิเวศแบบเปิด โมเดลนี้มีพารามิเตอร์รวมถึง 2.4 ล้านล้านพารามิเตอร์ โดยมีการใช้งาน 95 พันล้านพารามิเตอร์ต่อโทเค็น ถูกออกแบบมาสำหรับงานที่ต้องการการให้เหตุผลที่ซับซ้อนและเวิร์กโฟลว์แบบเอเจนต์ (Agentic Workloads) ด้วยสถาปัตยกรรมแบบ Mixture of Experts (MoE) ที่มีรายละเอียดสูง ผสานกับการใช้เทคนิค Attention แบบเต็มรูปแบบและแบบเชิงเส้น (Linear Attention) มีความสามารถในการจัดการ Context Window ได้สูงสุดถึงหนึ่งล้านโทเค็น และมีความยาว Output สูงสุด 128K

การนำโมเดลโอเพนเวตขนาด 2.4 ล้านล้านพารามิเตอร์มาใช้งานจริงนั้น ต้องการพลังประมวลผลระดับ Data Center ที่ได้รับการเร่งความเร็ว (Accelerated Compute) การอนุมาน (Inference) ในระดับนี้ขึ้นอยู่กับการออกแบบร่วมกันอย่างสุดขั้วระหว่างชิป สถาปัตยกรรมระบบ และซอฟต์แวร์ NVIDIA กำลังทำงานร่วมกับระบบนิเวศโอเพนซอร์ส เพื่อนำโมเดลนี้ไปสู่การใช้งานแบบ Multi-node ผ่าน Kernel ที่ปรับให้เหมาะสม, Inference Runtimes และสูตรการให้บริการแบบกระจาย (Distributed Serving Recipes)

นวัตกรรมสถาปัตยกรรมเพื่อการอนุมาน Context ยาว

Qwen3.8-2.4T-A95B ถูกสร้างขึ้นมาเพื่อรองรับเวิร์กโฟลว์แบบเอเจนต์ที่ท้าทายที่สุด เช่น การเขียนโค้ด, การวิเคราะห์เอกสารขนาดใหญ่ และเวิร์กโฟลว์แบบหลายขั้นตอนที่ทำงานต่อเนื่อง ต่างจากโมเดลแชททั่วไปที่ส่ง Prompt เพียงครั้งเดียวและรับ Reply เดียว แอปพลิเคชันแบบเอเจนต์จะสะสมคำสั่งระบบ, ผลลัพธ์จากเครื่องมือ, เอกสารที่ดึงมา, โค้ด, ล็อก และร่องรอยการให้เหตุผลหลายขั้นตอนตลอดเวิร์กโฟลว์ เมื่อ Context ยาวขึ้น Attention, Compute และหน่วยความจำ KV Cache จะกลายเป็นข้อจำกัดที่สำคัญ

สถาปัตยกรรมแบบผสมผสานระหว่าง Full-Attention และ Linear Attention ที่โมเดลใช้ จะช่วยแก้ไขปัญหานี้ โดยในชั้น Full-Attention แต่ละโทเค็นจะสามารถ Attend ไปยังโทเค็นอื่นๆ ได้ทั้งหมด ส่วนในชั้น Linear Attention นั้น KV Cache ที่กำลังเติบโตจะถูกแทนที่ด้วย Recurrent State ที่มีขอบเขตจำกัด ทำให้ Qwen3.8-2.4T-A95B สามารถควบคุมทั้ง Compute และ Memory ให้มีขอบเขตที่จำกัดได้ แม้ Context จะขยายไปถึงหนึ่งล้านโทเค็น

สถาปัตยกรรมแบบ Fine-grained MoE ทำให้การให้บริการโมเดลที่มี 2.4 ล้านล้านพารามิเตอร์มีความเป็นไปได้ แทนที่จะใช้ Expert จำนวนน้อยแต่มีขนาดใหญ่ ความสามารถจะถูกกระจายไปยัง Expert จำนวนมากที่มีขนาดเล็กกว่า ซึ่งช่วยปรับปรุงการเชี่ยวชาญและประสิทธิภาพการ Routing ต่อหน่วย Compute ที่ใช้งาน Router ที่ได้รับการเรียนรู้จะเปิดใช้งานเฉพาะ Expert ที่จำเป็นต่อโทเค็นเท่านั้น ทำให้ค่าใช้จ่ายในการให้บริการสอดคล้องกับพารามิเตอร์ที่ใช้งานจริง ไม่ใช่ทั้งหมด 2.4 ล้านล้านพารามิเตอร์ ส่งผลให้ได้ความสามารถระดับแนวหน้าในราคาที่ถูกกว่าโมเดลแบบ Dense ที่เทียบเคียงกัน

นอกจากนี้ Qwen3.8-2.4T-A95B ยังมีระบบควบคุมการให้เหตุผลในตัว (ระดับ Low/High/XHigh) ที่ช่วยให้นักพัฒนาสามารถปรับความลึกของการอนุมานต่อ Request ได้ โดยแลกเปลี่ยน Compute กับคุณภาพของการให้เหตุผล ขึ้นอยู่กับลักษณะงาน สามารถปรับระดับสูงสำหรับงานที่ต้องการการให้เหตุผลหลายขั้นตอนที่ซับซ้อน หรือปรับระดับต่ำสำหรับงานประมวลผลเอกสารที่ต้องการ Throughput สูง

ประสิทธิภาพที่ปรับให้เหมาะสมของ Qwen3.8-2.4T-A95B บน GB300 NVL72

NVIDIA GB300 NVL72 มาพร้อมสถาปัตยกรรมระดับ Rack ที่รวม GPU NVIDIA Blackwell Ultra จำนวน 72 ตัวไว้ในแพลตฟอร์มเดียว โดเมน NVIDIA NVLink ขนาดใหญ่ 72 GPU นี้ช่วยให้การสื่อสารแบบ All-to-All มีประสิทธิภาพสูงถึง 130 TB/s ขจัดคอขวดที่เกิดขึ้นเมื่อการรับส่งข้อมูลระหว่าง Expert ต้องวิ่งผ่านเครือข่ายแบบ Off-the-shelf ทั่วไป

เมื่อใช้งาน Qwen3.8 2.4T-A95B บน NVIDIA Blackwell GB300 NVL72 แบบ Out-of-the-box สามารถให้ Throughput ได้มากกว่า 4K โทเค็นต่อวินาทีต่อ GPU และมากกว่า 350 โทเค็นต่อวินาทีต่อผู้ใช้ ช่วยให้ AI Factory สามารถรันโมเดลขนาดใหญ่ในระดับ Production ด้วย Throughput สูงและ Latency ต่ำ

การ Post-train Qwen3.8-2.4T-A95B และเลือกเส้นทางการให้บริการ

NVIDIA รองรับ Inference Stack หลากหลายรูปแบบเพื่อตอบสนองความต้องการที่แตกต่างกันของนักพัฒนา SGLang, vLLM และ NVIDIA Dynamo เป็นสูตรการให้บริการแบบโอเพนซอร์สสำหรับนักพัฒนาที่ต้องการการควบคุมประสิทธิภาพที่มากขึ้นบนแพลตฟอร์มที่เร่งความเร็วด้วย NVIDIA

นอกจากนี้ยังสามารถ Deploy ผ่าน NVIDIA NIM ซึ่งเป็น Container การอนุมานแบบ Model-free ที่รองรับการให้บริการโมเดลได้หลากหลาย ดาวน์โหลด Model Weights และ Deploy บน Day-0 เพื่อให้บริการ Checkpoint ที่ผ่านการ Fine-tune และ Scale ไปสู่ระดับ Production ได้

นักพัฒนาสามารถทำการ Post-train โมเดลสำหรับ Use Case เฉพาะทางได้โดยใช้ NVIDIA NeMo AutoModel ซึ่งเป็น Library สำหรับ Fine-tuning แบบ PyTorch-native ที่รองรับ Hugging Face Checkpoint ตั้งแต่วันแรก สามารถ Train ได้โดยตรงบน Checkpoint ที่มีอยู่โดยไม่ต้องแปลงโมเดล พร้อมรองรับการ Fine-tuning แบบ Full SFT หรือแบบประหยัดหน่วยความจำอย่าง LoRA

เริ่มต้นใช้งาน Qwen3.8-2.4T-A95B

ดาวน์โหลด Qwen3.8-2.4T-A95B Model Weights ได้จาก Hugging Face หรือ ModelScope และ Deploy ด้วย NVIDIA NIM แบบ Model-free จาก NVIDIA NGC

#AI #LLM #NVIDIA #Qwen

ขอบคุณ แหล่งข้อมูล
https://developer.nvidia.com/blog/serve-qwen3-8-2-4t-a95b-a-2-4t-parameter-model-with-configurable-reasoning-on-nvidia-gb300-nvl72/

Qwen3.8-2.4T-A95B: โมเดล AI ขนาด 2.4 ล้านล้านพารามิเตอร์ พร้อมการให้เหตุผลที่ปรับแต่งได้บน NVIDIA GB300 NVL72Alibaba ได้เปิดตัวโมเดลภาษาขนาดใหญ่ (LLM) ชื่อ Qwen3.8-2.4T-A95B หรือที่รู้จักในชื่อ Qwen3.8-Max ซึ่งเป็นโมเดลโอเพนเวตที่ใหญ่ที่สุดจาก Alibaba โดยนำความสามารถระดับใกล้เคียงแนวหน้ามาสู่ระบบนิเวศแบบเปิด โมเดลนี้มีพารามิเตอร์รวมถึง 2.4 ล้านล้านพารามิเตอร์ โดยมีการใช้งาน 95 พันล้านพารามิเตอร์ต่อโทเค็น ถูกออกแบบมาสำหรับงานที่ต้องการการให้เหตุผลที่ซับซ้อนและเวิร์กโฟลว์แบบเอเจนต์ (Agentic Workloads) ด้วยสถาปัตยกรรมแบบ Mixture of Experts (MoE) ที่มีรายละเอียดสูง ผสานกับการใช้เทคนิค Attention แบบเต็มรูปแบบและแบบเชิงเส้น (Linear Attention) มีความสามารถในการจัดการ Context Window ได้สูงสุดถึงหนึ่งล้านโทเค็น และมีความยาว Output สูงสุด 128Kการนำโมเดลโอเพนเวตขนาด 2.4 ล้านล้านพารามิเตอร์มาใช้งานจริงนั้น ต้องการพลังประมวลผลระดับ Data Center ที่ได้รับการเร่งความเร็ว (Accelerated Compute) การอนุมาน (Inference) ในระดับนี้ขึ้นอยู่กับการออกแบบร่วมกันอย่างสุดขั้วระหว่างชิป สถาปัตยกรรมระบบ และซอฟต์แวร์ NVIDIA กำลังทำงานร่วมกับระบบนิเวศโอเพนซอร์ส เพื่อนำโมเดลนี้ไปสู่การใช้งานแบบ Multi-node ผ่าน Kernel ที่ปรับให้เหมาะสม, Inference Runtimes และสูตรการให้บริการแบบกระจาย (Distributed Serving Recipes)นวัตกรรมสถาปัตยกรรมเพื่อการอนุมาน Context ยาวQwen3.8-2.4T-A95B ถูกสร้างขึ้นมาเพื่อรองรับเวิร์กโฟลว์แบบเอเจนต์ที่ท้าทายที่สุด เช่น การเขียนโค้ด, การวิเคราะห์เอกสารขนาดใหญ่ และเวิร์กโฟลว์แบบหลายขั้นตอนที่ทำงานต่อเนื่อง ต่างจากโมเดลแชททั่วไปที่ส่ง Prompt เพียงครั้งเดียวและรับ Reply เดียว แอปพลิเคชันแบบเอเจนต์จะสะสมคำสั่งระบบ, ผลลัพธ์จากเครื่องมือ, เอกสารที่ดึงมา, โค้ด, ล็อก และร่องรอยการให้เหตุผลหลายขั้นตอนตลอดเวิร์กโฟลว์ เมื่อ Context ยาวขึ้น Attention, Compute และหน่วยความจำ KV Cache จะกลายเป็นข้อจำกัดที่สำคัญสถาปัตยกรรมแบบผสมผสานระหว่าง Full-Attention และ Linear Attention ที่โมเดลใช้ จะช่วยแก้ไขปัญหานี้ โดยในชั้น Full-Attention แต่ละโทเค็นจะสามารถ Attend ไปยังโทเค็นอื่นๆ ได้ทั้งหมด ส่วนในชั้น Linear Attention นั้น KV Cache ที่กำลังเติบโตจะถูกแทนที่ด้วย Recurrent State ที่มีขอบเขตจำกัด ทำให้ Qwen3.8-2.4T-A95B สามารถควบคุมทั้ง Compute และ Memory ให้มีขอบเขตที่จำกัดได้ แม้ Context จะขยายไปถึงหนึ่งล้านโทเค็นสถาปัตยกรรมแบบ Fine-grained MoE ทำให้การให้บริการโมเดลที่มี 2.4 ล้านล้านพารามิเตอร์มีความเป็นไปได้ แทนที่จะใช้ Expert จำนวนน้อยแต่มีขนาดใหญ่ ความสามารถจะถูกกระจายไปยัง Expert จำนวนมากที่มีขนาดเล็กกว่า ซึ่งช่วยปรับปรุงการเชี่ยวชาญและประสิทธิภาพการ Routing ต่อหน่วย Compute ที่ใช้งาน Router ที่ได้รับการเรียนรู้จะเปิดใช้งานเฉพาะ Expert ที่จำเป็นต่อโทเค็นเท่านั้น ทำให้ค่าใช้จ่ายในการให้บริการสอดคล้องกับพารามิเตอร์ที่ใช้งานจริง ไม่ใช่ทั้งหมด 2.4 ล้านล้านพารามิเตอร์ ส่งผลให้ได้ความสามารถระดับแนวหน้าในราคาที่ถูกกว่าโมเดลแบบ Dense ที่เทียบเคียงกันนอกจากนี้ Qwen3.8-2.4T-A95B ยังมีระบบควบคุมการให้เหตุผลในตัว (ระดับ Low/High/XHigh) ที่ช่วยให้นักพัฒนาสามารถปรับความลึกของการอนุมานต่อ Request ได้ โดยแลกเปลี่ยน Compute กับคุณภาพของการให้เหตุผล ขึ้นอยู่กับลักษณะงาน สามารถปรับระดับสูงสำหรับงานที่ต้องการการให้เหตุผลหลายขั้นตอนที่ซับซ้อน หรือปรับระดับต่ำสำหรับงานประมวลผลเอกสารที่ต้องการ Throughput สูงประสิทธิภาพที่ปรับให้เหมาะสมของ Qwen3.8-2.4T-A95B บน GB300 NVL72NVIDIA GB300 NVL72 มาพร้อมสถาปัตยกรรมระดับ Rack ที่รวม GPU NVIDIA Blackwell Ultra จำนวน 72 ตัวไว้ในแพลตฟอร์มเดียว โดเมน NVIDIA NVLink ขนาดใหญ่ 72 GPU นี้ช่วยให้การสื่อสารแบบ All-to-All มีประสิทธิภาพสูงถึง 130 TB/s ขจัดคอขวดที่เกิดขึ้นเมื่อการรับส่งข้อมูลระหว่าง Expert ต้องวิ่งผ่านเครือข่ายแบบ Off-the-shelf ทั่วไปเมื่อใช้งาน Qwen3.8 2.4T-A95B บน NVIDIA Blackwell GB300 NVL72 แบบ Out-of-the-box สามารถให้ Throughput ได้มากกว่า 4K โทเค็นต่อวินาทีต่อ GPU และมากกว่า 350 โทเค็นต่อวินาทีต่อผู้ใช้ ช่วยให้ AI Factory สามารถรันโมเดลขนาดใหญ่ในระดับ Production ด้วย Throughput สูงและ Latency ต่ำการ Post-train Qwen3.8-2.4T-A95B และเลือกเส้นทางการให้บริการNVIDIA รองรับ Inference Stack หลากหลายรูปแบบเพื่อตอบสนองความต้องการที่แตกต่างกันของนักพัฒนา SGLang, vLLM และ NVIDIA Dynamo เป็นสูตรการให้บริการแบบโอเพนซอร์สสำหรับนักพัฒนาที่ต้องการการควบคุมประสิทธิภาพที่มากขึ้นบนแพลตฟอร์มที่เร่งความเร็วด้วย NVIDIAนอกจากนี้ยังสามารถ Deploy ผ่าน NVIDIA NIM ซึ่งเป็น Container การอนุมานแบบ Model-free ที่รองรับการให้บริการโมเดลได้หลากหลาย ดาวน์โหลด Model Weights และ Deploy บน Day-0 เพื่อให้บริการ Checkpoint ที่ผ่านการ Fine-tune และ Scale ไปสู่ระดับ Production ได้นักพัฒนาสามารถทำการ Post-train โมเดลสำหรับ Use Case เฉพาะทางได้โดยใช้ NVIDIA NeMo AutoModel ซึ่งเป็น Library สำหรับ Fine-tuning แบบ PyTorch-native ที่รองรับ Hugging Face Checkpoint ตั้งแต่วันแรก สามารถ Train ได้โดยตรงบน Checkpoint ที่มีอยู่โดยไม่ต้องแปลงโมเดล พร้อมรองรับการ Fine-tuning แบบ Full SFT หรือแบบประหยัดหน่วยความจำอย่าง LoRAเริ่มต้นใช้งาน Qwen3.8-2.4T-A95Bดาวน์โหลด Qwen3.8-2.4T-A95B Model Weights ได้จาก Hugging Face หรือ ModelScope และ Deploy ด้วย NVIDIA NIM แบบ Model-free จาก NVIDIA NGC#AI #LLM #NVIDIA #Qwenhttps://developer.nvidia.com/blog/serve-qwen3-8-2-4t-a95b-a-2-4t-parameter-model-with-configurable-reasoning-on-nvidia-gb300-nvl72/
Shared content
DEVELOPER.NVIDIA.COM
Serve Qwen3.8-2.4T-A95B, a 2.4T-Parameter Model, with Configurable Reasoning on NVIDIA GB300 NVL72
Alibaba released the open weights for Qwen3.8-2.4T-A95B (Qwen3.8-Max), its largest open-weight model, bringing near-frontier capabilities to the open ecosystem. It has 2.4T total parameters with 95B…
6 Комментарии 0 Поделились 1Кб Просмотры 0 предпросмотр