ทดลองโมเดล Qwen3.8-Flash-Next 176B บน NVIDIA GB300 NVL72 สำหรับ Agentic Coding
นักพัฒนาที่สนใจด้าน AI กำลังจะได้สัมผัสกับนวัตกรรมใหม่จาก Alibaba ที่ได้ปล่อยโมเดล Qwen3.8-Flash-Next 176B ซึ่งเป็นส่วนหนึ่งของการทดลองก่อนเปิดตัวสถาปัตยกรรม Qwen4 ในอนาคต โมเดลนี้เป็นแบบ Multimodal Mixture-of-Experts (MoE) ที่มาพร้อมความสามารถอันน่าทึ่งในการประมวลผลบริบทขนาดยาว (Long Context) ด้วยสถาปัตยกรรมแบบผสมผสานระหว่าง Gated DeltaNet (GDN) และ Qwen Sparse Attention (QSA) ซึ่งออกแบบมาเพื่อแก้ไขปัญหาคอขวดในการอนุมาน (Inference) เมื่อต้องจัดการกับข้อมูลที่มีความยาวมากๆ
สถาปัตยกรรมที่ก้าวล้ำเพื่อการจัดการบริบทขนาดยาว 🚀
Qwen3.8-Flash-Next ถูกพัฒนาขึ้นเพื่อรองรับแอปพลิเคชันที่ต้องการปริมาณข้อมูลสูงและเน้นการประมวลผลบริบทที่ซับซ้อน เช่น Agentic Coding, การประมวลผลเอกสาร, และเวิร์กโฟลว์ที่ขับเคลื่อนด้วยเครื่องมือ (Tool-driven workflows) ปัญหาหลักที่พบเมื่อบริบทมีความยาวมากขึ้นคือการใช้ทรัพยากรในการคำนวณ Attention และหน่วยความจำ KV Cache ที่สูงมาก โมเดลนี้แก้ไขปัญหานี้ด้วยสถาปัตยกรรมแบบผสมผสาน:
- Gated DeltaNet (GDN): ใน 3 ใน 4 ของเลเยอร์ จะใช้ GDN ในการบีบอัดบริบทในอดีตอย่างต่อเนื่องให้อยู่ในรูปแบบของสถานะที่วนซ้ำ (Recurrent State) ที่มีขนาดคงที่ ทำให้ไม่ต้องกังวลเรื่อง KV Cache ที่จะเพิ่มขึ้นตามความยาวของลำดับข้อมูล
- Qwen Sparse Attention (QSA): เลเยอร์ที่เหลือจะใช้ QSA เพื่อการดึงข้อมูลที่แม่นยำจากบริบททั้งหมด โดย QSA จะรวมลำดับข้อมูลออกเป็น "ไมโครบล็อก" (Micro-blocks) เพื่อประเมินความสำคัญในระดับบล็อก และเลือกเฉพาะส่วนที่เกี่ยวข้องเท่านั้น วิธีนี้ช่วยลดภาระการคำนวณ Attention, การประมวลผล, และการทำดัชนี (Indexing) ในแต่ละเลเยอร์ ทำให้การออกแบบนี้เหมาะอย่างยิ่งสำหรับสถาปัตยกรรมที่สลับระหว่างเลเยอร์ GDN และ QSA
ประสิทธิภาพที่เหนือกว่าด้วย QSA ⚡
จากการทดสอบของ Alibaba พบว่า QSA สามารถเพิ่มประสิทธิภาพของเวิร์กโหลดที่มีบริบท 1 ล้านโทเค็นได้อย่างมาก เมื่อเทียบกับการคำนวณ Attention แบบเต็ม (Full Attention) Kernel ของ QSA สามารถเพิ่มความเร็วในการประมวลผลช่วง Prefill ได้สูงสุดถึง 7.6 เท่า และช่วง Decoding ได้สูงสุด 4.9 เท่า ยิ่งไปกว่านั้น ในการทดสอบการให้บริการแบบออนไลน์ที่ต้องใช้ Cache สูง (Online serving test) ด้วยบริบท 1 ล้านโทเค็น และอัตราการเข้าถึง Cache ในส่วน Prefix (Prefix-cache hit rate) ที่ 90% โมเดล Qwen3.8-Flash-Next สามารถทำ Throughput ในช่วง Prefill ได้สูงกว่า Qwen3.7-Plus ถึง 8.6 เท่า
ประสบการณ์การใช้งานบน NVIDIA GB300 NVL72 🖥️
การรันโมเดล Qwen3.8-Flash-Next บน NVIDIA GB300 NVL72 มอบประสบการณ์ที่เหนือชั้น ด้วยสถาปัตยกรรมแบบ Rack-scale ที่รวม GPU NVIDIA Blackwell Ultra จำนวน 72 ตัวไว้ในแพลตฟอร์มเดียว ทำให้สามารถสื่อสารแบบ All-to-all ได้อย่างมีประสิทธิภาพด้วยแบนด์วิดท์สูงถึง 130 TB/s ขจัดคอขวดที่มักเกิดขึ้นเมื่อข้อมูลของผู้เชี่ยวชาญ (Expert traffic) ต้องวิ่งผ่านเครือข่ายทั่วไป การใช้งานบน NVIDIA GB300 NVL72 สามารถทำความเร็วได้มากกว่า 16,000 โทเค็นต่อวินาทีต่อ GPU และมากกว่า 200 โทเค็นต่อวินาทีต่อผู้ใช้ ทำให้ทีมนักพัฒนาสามารถทดลอง Agentic Coding ได้อย่างเต็มที่ด้วย Throughput สูงและ Latency ต่ำ
นอกจากนี้ Qwen3.8-Flash-Next ยังสามารถทำงานบนฮาร์ดแวร์ NVIDIA ในระดับ Local ได้เช่นกัน ไม่ว่าจะเป็น NVIDIA DGX Station, คลัสเตอร์ NVIDIA DGX Spark, หรือเวิร์กสเตชันที่ติดตั้ง GPU NVIDIA RTX PRO 6000 Blackwell Workstation Edition จำนวน 4 ตัว นักพัฒนาสามารถสร้างต้นแบบและประเมิน Agentic Coding Workflows บนฮาร์ดแวร์ภายในองค์กร และปรับขนาดไปยัง GB300 NVL72 เพื่อการให้บริการจริง (Production serving) ได้
การปรับแต่งและให้บริการโมเดลด้วยเครื่องมือจาก NVIDIA 🛠️
นักพัฒนาสามารถปรับแต่งโมเดล Qwen3.8-Flash-Next ให้เหมาะกับการใช้งานเฉพาะทางได้ง่ายๆ ด้วย NVIDIA NeMo AutoModel ซึ่งเป็นไลบรารีสำหรับ Fine-tuning แบบ Native บน PyTorch ที่รองรับการโหลด Checkpoint จาก Hugging Face ได้ทันที (Day-0 Hugging Face checkpoint support) ทำให้สามารถฝึกฝนโมเดลได้โดยตรงจาก Checkpoint ที่มีอยู่ โดยไม่ต้องแปลงโมเดล และรองรับทั้งการ Fine-tuning แบบเต็ม (Full SFT) หรือแบบประหยัดหน่วยความจำ (LoRA) นอกจากนี้ ยังสามารถต่อยอดไปสู่การทำ Reinforcement Learning ได้ด้วย NVIDIA NeMo RL recipes
NVIDIA ยังรองรับ Inference Stack ที่หลากหลายเพื่อตอบสนองความต้องการของนักพัฒนา SGLang, vLLM, และ TokenSpeed นำเสนอสูตรสำเร็จ (Recipes) สำหรับ Inference แบบ Open-source สำหรับนักพัฒนาที่ต้องการควบคุมประสิทธิภาพบนแพลตฟอร์มที่เร่งความเร็วด้วย NVIDIA ได้อย่างเต็มที่
เริ่มต้นใช้งาน Qwen3.8-Flash-Next ได้แล้ววันนี้! ✅
- ลองสัมผัสโมเดลได้ที่ QwenCloud
- ดาวน์โหลด Model Weights ได้จาก Hugging Face หรือ ModelScope
ขอบคุณ แหล่งข้อมูล
https://developer.nvidia.com/blog/experiment-with-qwen3-8-flash-next-176b-model-on-nvidia-gb300-nvl72-for-agentic-coding/