ทดลอง Qwen3.8-Flash-Next บน NVIDIA GB300 NVL72 เพื่อการเขียนโค้ดแบบ Agentic

การพัฒนาปัญญาประดิษฐ์ (AI) ก้าวหน้าไปอย่างรวดเร็ว โดยเฉพาะในด้านโมเดลภาษาขนาดใหญ่ (LLMs) ที่มีความสามารถในการประมวลผลและสร้างสรรค์ข้อความที่ซับซ้อน ล่าสุด Alibaba ได้ปล่อยโมเดล Qwen3.8-Flash-Next ออกมาให้เหล่านักพัฒนาได้ทดลอง ซึ่งเป็นส่วนหนึ่งของการทดลองก่อนการเปิดตัวสถาปัตยกรรม Qwen4 ที่กำลังจะมาถึง โมเดลนี้มีความโดดเด่นด้วยสถาปัตยกรรมแบบ Multimodal Mixture-of-Experts (MoE) ที่เปิดโอกาสให้นักพัฒนาได้ทดลองและประเมินประสิทธิภาพ

ทำความรู้จัก Qwen3.8-Flash-Next: พลังของ MoE และ Long Context 🧐

Qwen3.8-Flash-Next เป็นโมเดล MoE ที่มีขนาดใหญ่ถึง 125 พันล้านพารามิเตอร์ โดยมีการเปิดใช้งาน 6 พันล้านพารามิเตอร์ต่อโทเค็น มีจุดเด่นที่สำคัญคือ Context Window แบบ Native ที่ยาวถึง 262,144 โทเค็น ซึ่งสามารถขยายได้สูงสุดถึง 1 ล้านโทเค็นด้วยเทคนิค YaRN สิ่งนี้ทำให้โมเดลสามารถประมวลผลข้อมูลที่มีความยาวมหาศาลได้อย่างมีประสิทธิภาพ เหมาะสำหรับงานที่ต้องการความเข้าใจบริบทที่ลึกซึ้ง

สถาปัตยกรรมของโมเดลนี้ผสมผสานระหว่าง Gated DeltaNet (GDN) และ Qwen Sparse Attention (QSA) โดย 3 ใน 4 เลเยอร์จะใช้ GDN ในการบีบอัดบริบทในอดีตให้กลายเป็นสถานะแบบวนซ้ำ (recurrent state) ที่มีขนาดคงที่ ส่วนเลเยอร์ที่เหลือจะใช้ QSA เพื่อการดึงข้อมูลที่แม่นยำจากบริบททั้งหมด

ประสิทธิภาพที่เหนือกว่า: QSA และการทำงานบน NVIDIA GB300 NVL72 🚀

จากการทดสอบของ Alibaba ชี้ให้เห็นว่า QSA สามารถเพิ่มประสิทธิภาพในการทำงานกับบริบท 1 ล้านโทเค็นได้อย่างน่าทึ่ง เมื่อเทียบกับการคำนวณแบบ Full Attention แล้ว QSA ให้ความเร็วในการ Pre-fill สูงสุดถึง 7.6 เท่า และความเร็วในการถอดรหัส (Decoding) สูงสุด 4.9 เท่า นอกจากนี้ ยังมี Throughput ในการ Pre-fill สูงกว่า Qwen3.7-Plus ถึง 8.6 เท่า ที่บริบท 1 ล้านโทเค็น โดยมีอัตราการ Hit Rate ของ Prefix-Cache สูงถึง 90%

เมื่อนำ Qwen3.8-Flash-Next มาทำงานบน NVIDIA GB300 NVL72 ซึ่งเป็นสถาปัตยกรรมแบบ Rack-Scale ที่รวม GPU NVIDIA Blackwell Ultra ถึง 72 ตัวเข้าด้วยกัน ทำให้เกิดการสื่อสารแบบ All-to-All ที่รวดเร็วถึง 130 TB/s ส่งผลให้ประสิทธิภาพสูงขึ้นอย่างมาก โดยสามารถประมวลผลได้ มากกว่า 16,000 โทเค็นต่อวินาทีต่อ GPU และ มากกว่า 200 โทเค็นต่อวินาทีต่อผู้ใช้ ซึ่งเหมาะอย่างยิ่งสำหรับการพัฒนาแอปพลิเคชัน Agentic Coding ที่ต้องการ Throughput สูงและ Latency ต่ำ

การปรับแต่งและใช้งาน: เครื่องมือจาก NVIDIA 🛠️

นักพัฒนาสามารถปรับแต่ง (Fine-tune) โมเดล Qwen3.8-Flash-Next ให้เหมาะกับงานเฉพาะทางได้ง่ายขึ้นด้วย NVIDIA NeMo AutoModel ซึ่งเป็นไลบรารี PyTorch-native ที่รองรับการ Fine-tune โดยตรงจาก Checkpoint ของ Hugging Face ไม่จำเป็นต้องแปลงโมเดล และรองรับทั้งการ Fine-tune แบบเต็มรูปแบบ (Full SFT) หรือแบบประหยัดหน่วยความจำ (LoRA) นอกจากนี้ยังสามารถทำการ Reinforcement Learning (RL) เพิ่มเติมได้ด้วย NVIDIA NeMo RL recipes

สำหรับการนำไปใช้งาน (Inference) NVIDIA มีการสนับสนุน Inference Engine หลากหลายรูปแบบ เช่น SGLang, vLLM, และ TokenSpeed ซึ่งมีสูตร (Recipes) แบบ Open-source สำหรับการ Deploy บนแพลตฟอร์มที่เร่งความเร็วด้วย NVIDIA

เริ่มต้นทดลอง Qwen3.8-Flash-Next ได้ทันที! ✨

  • ทดลองใช้งานโมเดล: สามารถลองเล่นโมเดลได้ผ่าน QwenCloud
  • ดาวน์โหลดโมเดล: ดาวน์โหลด Model Weights ได้จาก Hugging Face หรือ ModelScope
  • สำรวจการ Fine-tune: ศึกษา NVIDIA NeMo AutoModel เพื่อปรับแต่งโมเดลให้เข้ากับ Use Case เฉพาะของคุณ

การมาถึงของ Qwen3.8-Flash-Next พร้อมกับการสนับสนุนจาก NVIDIA GB300 NVL72 และเครื่องมือต่างๆ เป็นก้าวสำคัญที่ช่วยให้นักพัฒนาสามารถสร้างสรรค์แอปพลิเคชัน AI ที่ซับซ้อนและมีประสิทธิภาพสูงขึ้นได้อย่างที่ไม่เคยมีมาก่อน โดยเฉพาะในสายงาน Agentic Coding ที่ต้องการการประมวลผลบริบทที่ยาวนานและแม่นยำ

#Qwen3 #NVIDIA #AI #LLM #AgenticCoding

ขอบคุณ แหล่งข้อมูล
https://developer.nvidia.com/blog/experiment-with-qwen3-8-flash-next-on-nvidia-gb300-nvl72-for-agentic-coding/

ทดลอง Qwen3.8-Flash-Next บน NVIDIA GB300 NVL72 เพื่อการเขียนโค้ดแบบ Agenticการพัฒนาปัญญาประดิษฐ์ (AI) ก้าวหน้าไปอย่างรวดเร็ว โดยเฉพาะในด้านโมเดลภาษาขนาดใหญ่ (LLMs) ที่มีความสามารถในการประมวลผลและสร้างสรรค์ข้อความที่ซับซ้อน ล่าสุด Alibaba ได้ปล่อยโมเดล Qwen3.8-Flash-Next ออกมาให้เหล่านักพัฒนาได้ทดลอง ซึ่งเป็นส่วนหนึ่งของการทดลองก่อนการเปิดตัวสถาปัตยกรรม Qwen4 ที่กำลังจะมาถึง โมเดลนี้มีความโดดเด่นด้วยสถาปัตยกรรมแบบ Multimodal Mixture-of-Experts (MoE) ที่เปิดโอกาสให้นักพัฒนาได้ทดลองและประเมินประสิทธิภาพทำความรู้จัก Qwen3.8-Flash-Next: พลังของ MoE และ Long Context 🧐Qwen3.8-Flash-Next เป็นโมเดล MoE ที่มีขนาดใหญ่ถึง 125 พันล้านพารามิเตอร์ โดยมีการเปิดใช้งาน 6 พันล้านพารามิเตอร์ต่อโทเค็น มีจุดเด่นที่สำคัญคือ Context Window แบบ Native ที่ยาวถึง 262,144 โทเค็น ซึ่งสามารถขยายได้สูงสุดถึง 1 ล้านโทเค็นด้วยเทคนิค YaRN สิ่งนี้ทำให้โมเดลสามารถประมวลผลข้อมูลที่มีความยาวมหาศาลได้อย่างมีประสิทธิภาพ เหมาะสำหรับงานที่ต้องการความเข้าใจบริบทที่ลึกซึ้งสถาปัตยกรรมของโมเดลนี้ผสมผสานระหว่าง Gated DeltaNet (GDN) และ Qwen Sparse Attention (QSA) โดย 3 ใน 4 เลเยอร์จะใช้ GDN ในการบีบอัดบริบทในอดีตให้กลายเป็นสถานะแบบวนซ้ำ (recurrent state) ที่มีขนาดคงที่ ส่วนเลเยอร์ที่เหลือจะใช้ QSA เพื่อการดึงข้อมูลที่แม่นยำจากบริบททั้งหมดประสิทธิภาพที่เหนือกว่า: QSA และการทำงานบน NVIDIA GB300 NVL72 🚀จากการทดสอบของ Alibaba ชี้ให้เห็นว่า QSA สามารถเพิ่มประสิทธิภาพในการทำงานกับบริบท 1 ล้านโทเค็นได้อย่างน่าทึ่ง เมื่อเทียบกับการคำนวณแบบ Full Attention แล้ว QSA ให้ความเร็วในการ Pre-fill สูงสุดถึง 7.6 เท่า และความเร็วในการถอดรหัส (Decoding) สูงสุด 4.9 เท่า นอกจากนี้ ยังมี Throughput ในการ Pre-fill สูงกว่า Qwen3.7-Plus ถึง 8.6 เท่า ที่บริบท 1 ล้านโทเค็น โดยมีอัตราการ Hit Rate ของ Prefix-Cache สูงถึง 90%เมื่อนำ Qwen3.8-Flash-Next มาทำงานบน NVIDIA GB300 NVL72 ซึ่งเป็นสถาปัตยกรรมแบบ Rack-Scale ที่รวม GPU NVIDIA Blackwell Ultra ถึง 72 ตัวเข้าด้วยกัน ทำให้เกิดการสื่อสารแบบ All-to-All ที่รวดเร็วถึง 130 TB/s ส่งผลให้ประสิทธิภาพสูงขึ้นอย่างมาก โดยสามารถประมวลผลได้ มากกว่า 16,000 โทเค็นต่อวินาทีต่อ GPU และ มากกว่า 200 โทเค็นต่อวินาทีต่อผู้ใช้ ซึ่งเหมาะอย่างยิ่งสำหรับการพัฒนาแอปพลิเคชัน Agentic Coding ที่ต้องการ Throughput สูงและ Latency ต่ำการปรับแต่งและใช้งาน: เครื่องมือจาก NVIDIA 🛠️นักพัฒนาสามารถปรับแต่ง (Fine-tune) โมเดล Qwen3.8-Flash-Next ให้เหมาะกับงานเฉพาะทางได้ง่ายขึ้นด้วย NVIDIA NeMo AutoModel ซึ่งเป็นไลบรารี PyTorch-native ที่รองรับการ Fine-tune โดยตรงจาก Checkpoint ของ Hugging Face ไม่จำเป็นต้องแปลงโมเดล และรองรับทั้งการ Fine-tune แบบเต็มรูปแบบ (Full SFT) หรือแบบประหยัดหน่วยความจำ (LoRA) นอกจากนี้ยังสามารถทำการ Reinforcement Learning (RL) เพิ่มเติมได้ด้วย NVIDIA NeMo RL recipesสำหรับการนำไปใช้งาน (Inference) NVIDIA มีการสนับสนุน Inference Engine หลากหลายรูปแบบ เช่น SGLang, vLLM, และ TokenSpeed ซึ่งมีสูตร (Recipes) แบบ Open-source สำหรับการ Deploy บนแพลตฟอร์มที่เร่งความเร็วด้วย NVIDIAเริ่มต้นทดลอง Qwen3.8-Flash-Next ได้ทันที! ✨ทดลองใช้งานโมเดล: สามารถลองเล่นโมเดลได้ผ่าน QwenCloudดาวน์โหลดโมเดล: ดาวน์โหลด Model Weights ได้จาก Hugging Face หรือ ModelScopeสำรวจการ Fine-tune: ศึกษา NVIDIA NeMo AutoModel เพื่อปรับแต่งโมเดลให้เข้ากับ Use Case เฉพาะของคุณการมาถึงของ Qwen3.8-Flash-Next พร้อมกับการสนับสนุนจาก NVIDIA GB300 NVL72 และเครื่องมือต่างๆ เป็นก้าวสำคัญที่ช่วยให้นักพัฒนาสามารถสร้างสรรค์แอปพลิเคชัน AI ที่ซับซ้อนและมีประสิทธิภาพสูงขึ้นได้อย่างที่ไม่เคยมีมาก่อน โดยเฉพาะในสายงาน Agentic Coding ที่ต้องการการประมวลผลบริบทที่ยาวนานและแม่นยำ#Qwen3 #NVIDIA #AI #LLM #AgenticCodinghttps://developer.nvidia.com/blog/experiment-with-qwen3-8-flash-next-on-nvidia-gb300-nvl72-for-agentic-coding/
Shared content
DEVELOPER.NVIDIA.COM
Experiment with Qwen3.8-Flash-Next on NVIDIA GB300 NVL72 for Agentic Coding
Alibaba released the model weights for Qwen3.8-Flash-Next as a preview of the upcoming Qwen4 architecture for developers to experiment with and evaluate. It’s a multimodal mixture-of-experts (MoE)…
4 Yorumlar 0 hisse senetleri 978 Views 0 önizleme