ทดลองโมเดล Qwen3.8-Flash-Next 176B บน NVIDIA GB300 NVL72 สำหรับ Agentic Coding

นักพัฒนาที่สนใจด้าน AI กำลังจะได้สัมผัสกับนวัตกรรมใหม่จาก Alibaba ที่ได้ปล่อยโมเดล Qwen3.8-Flash-Next 176B ซึ่งเป็นส่วนหนึ่งของการทดลองก่อนเปิดตัวสถาปัตยกรรม Qwen4 ในอนาคต โมเดลนี้เป็นแบบ Multimodal Mixture-of-Experts (MoE) ที่มาพร้อมความสามารถอันน่าทึ่งในการประมวลผลบริบทขนาดยาว (Long Context) ด้วยสถาปัตยกรรมแบบผสมผสานระหว่าง Gated DeltaNet (GDN) และ Qwen Sparse Attention (QSA) ซึ่งออกแบบมาเพื่อแก้ไขปัญหาคอขวดในการอนุมาน (Inference) เมื่อต้องจัดการกับข้อมูลที่มีความยาวมากๆ

สถาปัตยกรรมที่ก้าวล้ำเพื่อการจัดการบริบทขนาดยาว 🚀

Qwen3.8-Flash-Next ถูกพัฒนาขึ้นเพื่อรองรับแอปพลิเคชันที่ต้องการปริมาณข้อมูลสูงและเน้นการประมวลผลบริบทที่ซับซ้อน เช่น Agentic Coding, การประมวลผลเอกสาร, และเวิร์กโฟลว์ที่ขับเคลื่อนด้วยเครื่องมือ (Tool-driven workflows) ปัญหาหลักที่พบเมื่อบริบทมีความยาวมากขึ้นคือการใช้ทรัพยากรในการคำนวณ Attention และหน่วยความจำ KV Cache ที่สูงมาก โมเดลนี้แก้ไขปัญหานี้ด้วยสถาปัตยกรรมแบบผสมผสาน:

  • Gated DeltaNet (GDN): ใน 3 ใน 4 ของเลเยอร์ จะใช้ GDN ในการบีบอัดบริบทในอดีตอย่างต่อเนื่องให้อยู่ในรูปแบบของสถานะที่วนซ้ำ (Recurrent State) ที่มีขนาดคงที่ ทำให้ไม่ต้องกังวลเรื่อง KV Cache ที่จะเพิ่มขึ้นตามความยาวของลำดับข้อมูล
  • Qwen Sparse Attention (QSA): เลเยอร์ที่เหลือจะใช้ QSA เพื่อการดึงข้อมูลที่แม่นยำจากบริบททั้งหมด โดย QSA จะรวมลำดับข้อมูลออกเป็น "ไมโครบล็อก" (Micro-blocks) เพื่อประเมินความสำคัญในระดับบล็อก และเลือกเฉพาะส่วนที่เกี่ยวข้องเท่านั้น วิธีนี้ช่วยลดภาระการคำนวณ Attention, การประมวลผล, และการทำดัชนี (Indexing) ในแต่ละเลเยอร์ ทำให้การออกแบบนี้เหมาะอย่างยิ่งสำหรับสถาปัตยกรรมที่สลับระหว่างเลเยอร์ GDN และ QSA

ประสิทธิภาพที่เหนือกว่าด้วย QSA ⚡

จากการทดสอบของ Alibaba พบว่า QSA สามารถเพิ่มประสิทธิภาพของเวิร์กโหลดที่มีบริบท 1 ล้านโทเค็นได้อย่างมาก เมื่อเทียบกับการคำนวณ Attention แบบเต็ม (Full Attention) Kernel ของ QSA สามารถเพิ่มความเร็วในการประมวลผลช่วง Prefill ได้สูงสุดถึง 7.6 เท่า และช่วง Decoding ได้สูงสุด 4.9 เท่า ยิ่งไปกว่านั้น ในการทดสอบการให้บริการแบบออนไลน์ที่ต้องใช้ Cache สูง (Online serving test) ด้วยบริบท 1 ล้านโทเค็น และอัตราการเข้าถึง Cache ในส่วน Prefix (Prefix-cache hit rate) ที่ 90% โมเดล Qwen3.8-Flash-Next สามารถทำ Throughput ในช่วง Prefill ได้สูงกว่า Qwen3.7-Plus ถึง 8.6 เท่า

ประสบการณ์การใช้งานบน NVIDIA GB300 NVL72 🖥️

การรันโมเดล Qwen3.8-Flash-Next บน NVIDIA GB300 NVL72 มอบประสบการณ์ที่เหนือชั้น ด้วยสถาปัตยกรรมแบบ Rack-scale ที่รวม GPU NVIDIA Blackwell Ultra จำนวน 72 ตัวไว้ในแพลตฟอร์มเดียว ทำให้สามารถสื่อสารแบบ All-to-all ได้อย่างมีประสิทธิภาพด้วยแบนด์วิดท์สูงถึง 130 TB/s ขจัดคอขวดที่มักเกิดขึ้นเมื่อข้อมูลของผู้เชี่ยวชาญ (Expert traffic) ต้องวิ่งผ่านเครือข่ายทั่วไป การใช้งานบน NVIDIA GB300 NVL72 สามารถทำความเร็วได้มากกว่า 16,000 โทเค็นต่อวินาทีต่อ GPU และมากกว่า 200 โทเค็นต่อวินาทีต่อผู้ใช้ ทำให้ทีมนักพัฒนาสามารถทดลอง Agentic Coding ได้อย่างเต็มที่ด้วย Throughput สูงและ Latency ต่ำ

นอกจากนี้ Qwen3.8-Flash-Next ยังสามารถทำงานบนฮาร์ดแวร์ NVIDIA ในระดับ Local ได้เช่นกัน ไม่ว่าจะเป็น NVIDIA DGX Station, คลัสเตอร์ NVIDIA DGX Spark, หรือเวิร์กสเตชันที่ติดตั้ง GPU NVIDIA RTX PRO 6000 Blackwell Workstation Edition จำนวน 4 ตัว นักพัฒนาสามารถสร้างต้นแบบและประเมิน Agentic Coding Workflows บนฮาร์ดแวร์ภายในองค์กร และปรับขนาดไปยัง GB300 NVL72 เพื่อการให้บริการจริง (Production serving) ได้

การปรับแต่งและให้บริการโมเดลด้วยเครื่องมือจาก NVIDIA 🛠️

นักพัฒนาสามารถปรับแต่งโมเดล Qwen3.8-Flash-Next ให้เหมาะกับการใช้งานเฉพาะทางได้ง่ายๆ ด้วย NVIDIA NeMo AutoModel ซึ่งเป็นไลบรารีสำหรับ Fine-tuning แบบ Native บน PyTorch ที่รองรับการโหลด Checkpoint จาก Hugging Face ได้ทันที (Day-0 Hugging Face checkpoint support) ทำให้สามารถฝึกฝนโมเดลได้โดยตรงจาก Checkpoint ที่มีอยู่ โดยไม่ต้องแปลงโมเดล และรองรับทั้งการ Fine-tuning แบบเต็ม (Full SFT) หรือแบบประหยัดหน่วยความจำ (LoRA) นอกจากนี้ ยังสามารถต่อยอดไปสู่การทำ Reinforcement Learning ได้ด้วย NVIDIA NeMo RL recipes

NVIDIA ยังรองรับ Inference Stack ที่หลากหลายเพื่อตอบสนองความต้องการของนักพัฒนา SGLang, vLLM, และ TokenSpeed นำเสนอสูตรสำเร็จ (Recipes) สำหรับ Inference แบบ Open-source สำหรับนักพัฒนาที่ต้องการควบคุมประสิทธิภาพบนแพลตฟอร์มที่เร่งความเร็วด้วย NVIDIA ได้อย่างเต็มที่

เริ่มต้นใช้งาน Qwen3.8-Flash-Next ได้แล้ววันนี้! ✅

  • ลองสัมผัสโมเดลได้ที่ QwenCloud
  • ดาวน์โหลด Model Weights ได้จาก Hugging Face หรือ ModelScope

ขอบคุณ แหล่งข้อมูล
https://developer.nvidia.com/blog/experiment-with-qwen3-8-flash-next-176b-model-on-nvidia-gb300-nvl72-for-agentic-coding/

ทดลองโมเดล Qwen3.8-Flash-Next 176B บน NVIDIA GB300 NVL72 สำหรับ Agentic Codingนักพัฒนาที่สนใจด้าน AI กำลังจะได้สัมผัสกับนวัตกรรมใหม่จาก Alibaba ที่ได้ปล่อยโมเดล Qwen3.8-Flash-Next 176B ซึ่งเป็นส่วนหนึ่งของการทดลองก่อนเปิดตัวสถาปัตยกรรม Qwen4 ในอนาคต โมเดลนี้เป็นแบบ Multimodal Mixture-of-Experts (MoE) ที่มาพร้อมความสามารถอันน่าทึ่งในการประมวลผลบริบทขนาดยาว (Long Context) ด้วยสถาปัตยกรรมแบบผสมผสานระหว่าง Gated DeltaNet (GDN) และ Qwen Sparse Attention (QSA) ซึ่งออกแบบมาเพื่อแก้ไขปัญหาคอขวดในการอนุมาน (Inference) เมื่อต้องจัดการกับข้อมูลที่มีความยาวมากๆสถาปัตยกรรมที่ก้าวล้ำเพื่อการจัดการบริบทขนาดยาว 🚀Qwen3.8-Flash-Next ถูกพัฒนาขึ้นเพื่อรองรับแอปพลิเคชันที่ต้องการปริมาณข้อมูลสูงและเน้นการประมวลผลบริบทที่ซับซ้อน เช่น Agentic Coding, การประมวลผลเอกสาร, และเวิร์กโฟลว์ที่ขับเคลื่อนด้วยเครื่องมือ (Tool-driven workflows) ปัญหาหลักที่พบเมื่อบริบทมีความยาวมากขึ้นคือการใช้ทรัพยากรในการคำนวณ Attention และหน่วยความจำ KV Cache ที่สูงมาก โมเดลนี้แก้ไขปัญหานี้ด้วยสถาปัตยกรรมแบบผสมผสาน:Gated DeltaNet (GDN): ใน 3 ใน 4 ของเลเยอร์ จะใช้ GDN ในการบีบอัดบริบทในอดีตอย่างต่อเนื่องให้อยู่ในรูปแบบของสถานะที่วนซ้ำ (Recurrent State) ที่มีขนาดคงที่ ทำให้ไม่ต้องกังวลเรื่อง KV Cache ที่จะเพิ่มขึ้นตามความยาวของลำดับข้อมูลQwen Sparse Attention (QSA): เลเยอร์ที่เหลือจะใช้ QSA เพื่อการดึงข้อมูลที่แม่นยำจากบริบททั้งหมด โดย QSA จะรวมลำดับข้อมูลออกเป็น "ไมโครบล็อก" (Micro-blocks) เพื่อประเมินความสำคัญในระดับบล็อก และเลือกเฉพาะส่วนที่เกี่ยวข้องเท่านั้น วิธีนี้ช่วยลดภาระการคำนวณ Attention, การประมวลผล, และการทำดัชนี (Indexing) ในแต่ละเลเยอร์ ทำให้การออกแบบนี้เหมาะอย่างยิ่งสำหรับสถาปัตยกรรมที่สลับระหว่างเลเยอร์ GDN และ QSAประสิทธิภาพที่เหนือกว่าด้วย QSA ⚡จากการทดสอบของ Alibaba พบว่า QSA สามารถเพิ่มประสิทธิภาพของเวิร์กโหลดที่มีบริบท 1 ล้านโทเค็นได้อย่างมาก เมื่อเทียบกับการคำนวณ Attention แบบเต็ม (Full Attention) Kernel ของ QSA สามารถเพิ่มความเร็วในการประมวลผลช่วง Prefill ได้สูงสุดถึง 7.6 เท่า และช่วง Decoding ได้สูงสุด 4.9 เท่า ยิ่งไปกว่านั้น ในการทดสอบการให้บริการแบบออนไลน์ที่ต้องใช้ Cache สูง (Online serving test) ด้วยบริบท 1 ล้านโทเค็น และอัตราการเข้าถึง Cache ในส่วน Prefix (Prefix-cache hit rate) ที่ 90% โมเดล Qwen3.8-Flash-Next สามารถทำ Throughput ในช่วง Prefill ได้สูงกว่า Qwen3.7-Plus ถึง 8.6 เท่าประสบการณ์การใช้งานบน NVIDIA GB300 NVL72 🖥️การรันโมเดล Qwen3.8-Flash-Next บน NVIDIA GB300 NVL72 มอบประสบการณ์ที่เหนือชั้น ด้วยสถาปัตยกรรมแบบ Rack-scale ที่รวม GPU NVIDIA Blackwell Ultra จำนวน 72 ตัวไว้ในแพลตฟอร์มเดียว ทำให้สามารถสื่อสารแบบ All-to-all ได้อย่างมีประสิทธิภาพด้วยแบนด์วิดท์สูงถึง 130 TB/s ขจัดคอขวดที่มักเกิดขึ้นเมื่อข้อมูลของผู้เชี่ยวชาญ (Expert traffic) ต้องวิ่งผ่านเครือข่ายทั่วไป การใช้งานบน NVIDIA GB300 NVL72 สามารถทำความเร็วได้มากกว่า 16,000 โทเค็นต่อวินาทีต่อ GPU และมากกว่า 200 โทเค็นต่อวินาทีต่อผู้ใช้ ทำให้ทีมนักพัฒนาสามารถทดลอง Agentic Coding ได้อย่างเต็มที่ด้วย Throughput สูงและ Latency ต่ำนอกจากนี้ Qwen3.8-Flash-Next ยังสามารถทำงานบนฮาร์ดแวร์ NVIDIA ในระดับ Local ได้เช่นกัน ไม่ว่าจะเป็น NVIDIA DGX Station, คลัสเตอร์ NVIDIA DGX Spark, หรือเวิร์กสเตชันที่ติดตั้ง GPU NVIDIA RTX PRO 6000 Blackwell Workstation Edition จำนวน 4 ตัว นักพัฒนาสามารถสร้างต้นแบบและประเมิน Agentic Coding Workflows บนฮาร์ดแวร์ภายในองค์กร และปรับขนาดไปยัง GB300 NVL72 เพื่อการให้บริการจริง (Production serving) ได้การปรับแต่งและให้บริการโมเดลด้วยเครื่องมือจาก NVIDIA 🛠️นักพัฒนาสามารถปรับแต่งโมเดล Qwen3.8-Flash-Next ให้เหมาะกับการใช้งานเฉพาะทางได้ง่ายๆ ด้วย NVIDIA NeMo AutoModel ซึ่งเป็นไลบรารีสำหรับ Fine-tuning แบบ Native บน PyTorch ที่รองรับการโหลด Checkpoint จาก Hugging Face ได้ทันที (Day-0 Hugging Face checkpoint support) ทำให้สามารถฝึกฝนโมเดลได้โดยตรงจาก Checkpoint ที่มีอยู่ โดยไม่ต้องแปลงโมเดล และรองรับทั้งการ Fine-tuning แบบเต็ม (Full SFT) หรือแบบประหยัดหน่วยความจำ (LoRA) นอกจากนี้ ยังสามารถต่อยอดไปสู่การทำ Reinforcement Learning ได้ด้วย NVIDIA NeMo RL recipesNVIDIA ยังรองรับ Inference Stack ที่หลากหลายเพื่อตอบสนองความต้องการของนักพัฒนา SGLang, vLLM, และ TokenSpeed นำเสนอสูตรสำเร็จ (Recipes) สำหรับ Inference แบบ Open-source สำหรับนักพัฒนาที่ต้องการควบคุมประสิทธิภาพบนแพลตฟอร์มที่เร่งความเร็วด้วย NVIDIA ได้อย่างเต็มที่เริ่มต้นใช้งาน Qwen3.8-Flash-Next ได้แล้ววันนี้! ✅ลองสัมผัสโมเดลได้ที่ QwenCloudดาวน์โหลด Model Weights ได้จาก Hugging Face หรือ ModelScopehttps://developer.nvidia.com/blog/experiment-with-qwen3-8-flash-next-176b-model-on-nvidia-gb300-nvl72-for-agentic-coding/
Shared content
DEVELOPER.NVIDIA.COM
Experiment with Qwen3.8-Flash-Next 176B Model on NVIDIA GB300 NVL72 for Agentic Coding
Alibaba released the model weights for Qwen3.8-Flash-Next as a preview of the upcoming Qwen4 architecture for developers to experiment with and evaluate. It’s a multimodal mixture-of-experts (MoE)…
7 Commentaires 0 Parts 535 Vue 0 Aperçu