Step 3.7 Flash: โมเดล AI อัจฉริยะที่พร้อมใช้งานระดับองค์กรบน NVIDIA GPU
ในยุคที่ AI ก้าวข้ามการสร้างข้อความธรรมดา ๆ ไปสู่ระบบที่สามารถรับรู้ ค้นหา และประมวลผลข้อมูลหลากหลายรูปแบบ ทั้งรูปภาพ เอกสาร วิดีโอ และภาษา ได้แบบเรียลไทม์ เทคโนโลยีนี้กำลังเปลี่ยนข้อมูลที่กระจัดกระจายให้กลายเป็นข้อมูลเชิงลึกที่นำไปปฏิบัติได้จริง ล่าสุด Step 3.7 Flash จาก StepFun ได้ยกระดับความสามารถเหล่านี้สู่ระดับการใช้งานจริงในระดับองค์กร โดยพร้อมใช้งานบนโครงสร้างพื้นฐานที่เร่งความเร็วด้วย NVIDIA GPU
Step 3.7 Flash คืออะไร? 💡
Step 3.7 Flash เป็นโมเดลภาษา-ภาพ (Vision-Language Model) แบบ Mixture-of-Experts (MoE) ที่มีพารามิเตอร์ถึง 198 พันล้านตัว แต่ใช้พารามิเตอร์ที่ทำงานจริงเพียงประมาณ 11 พันล้านตัวต่อการประมวลผลหนึ่งครั้ง ถูกปรับแต่งมาเพื่อเวิร์กโฟลว์แบบ Agentic ที่ผสมผสานการรับรู้ (Perception) การค้นหา (Search) และการให้เหตุผลหลายขั้นตอน (Multi-step Reasoning) ในระดับ Production Scale
จุดเด่นของโมเดลนี้คือ:
- รองรับการป้อนข้อมูลรูปภาพและวิดีโอโดยตรง: ทำให้เข้าใจบริบทได้กว้างขวางขึ้น
- ระดับการให้เหตุผลที่ปรับได้ 3 ระดับ: Low, Medium, และ High เพื่อความยืดหยุ่นในการใช้งาน
- Context Window ขนาดใหญ่ 256k: สามารถประมวลผลข้อมูลจำนวนมหาศาลในครั้งเดียว
- เหมาะสำหรับองค์กร: ออกแบบมาเพื่อการใช้งานในระดับองค์กร เช่น การวิเคราะห์ทางการเงิน, Agent สำหรับการเขียนโค้ดพร้อมกัน, และการใช้งาน Multimodal อื่น ๆ ที่ต้องการปริมาณงานสูง (High-throughput)
นอกจากนี้ ยังมี StepFun’s NVFP4-quantized checkpoint ที่พร้อมใช้งานผ่าน Hugging Face เพื่อเพิ่มประสิทธิภาพการ Inference ด้วยการลดความต้องการหน่วยความจำและพื้นที่จัดเก็บ
การใช้งานและพัฒนาบนโครงสร้างพื้นฐาน NVIDIA 🛠️
Step 3.7 Flash สามารถทำงานร่วมกับ Framework แบบ Open Source ได้หลากหลาย เช่น SGLang, NVIDIA TensorRT-LLM, และ vLLM โดยใช้ประโยชน์จาก Kernels ที่ปรับแต่งมาสำหรับฮาร์ดแวร์ NVIDIA โดยเฉพาะ
สำหรับนักพัฒนา:
- NVIDIA Endpoints: สามารถใช้ GPU-accelerated endpoints ที่มีให้บน build.nvidia.com สำหรับการสร้างต้นแบบและประเมินผล Step 3.7 Flash ได้ ลองใช้งานใน Demo Notebook ที่รวม Step 3.7 Flash และ NVIDIA Nemotron Parse เพื่อสกัดข้อมูลเชิงลึกจากเอกสารที่ซับซ้อน เช่น รายงานทางการเงิน, สไลด์นำเสนอ, และบทความทางวิทยาศาสตร์ (รวมถึง PDF) และจัดระเบียบผลลัพธ์
- การปรับแต่ง (Fine-tuning) ด้วย NVIDIA NeMo Framework: สามารถปรับแต่ง Step 3.7 Flash ให้เข้ากับข้อมูลเฉพาะทางขององค์กรได้ โดยใช้ไลบรารีแบบ Open Source จาก NVIDIA NeMo Framework โดยเฉพาะไลบรารี NVIDIA NeMo Automodel ที่รองรับการทำ Supervised Fine-Tuning (SFT) และ LoRA แบบประหยัดหน่วยความจำ ด้วยความเร็วสูงถึง 600 tokens/sec บน Hopper GPUs นอกจากนี้ ยังมี NeMo Megatron-Bridge สำหรับการฝึกโมเดลขนาดใหญ่ที่ต้องการประสิทธิภาพขั้นสูง
การนำไปใช้งานจริงในระดับ Production ด้วย NVIDIA NIM ✅
NVIDIA NIM (NVIDIA Inference Microservices) ช่วยให้การนำ Step 3.7 Flash จากการพัฒนาไปสู่ Production เป็นเรื่องง่าย ด้วยบริการ Inference ที่ปรับแต่งมาในรูปแบบ Container ที่มี API มาตรฐาน ทำให้มีความยืดหยุ่นในการปรับใช้ สามารถดาวน์โหลดและรันได้ทั้งแบบ On-premises, บน Cloud, หรือในสภาพแวดล้อมแบบ Hybrid NIM ยังรองรับ OpenAI inference มาตรฐานสำหรับการส่งคำขอไปยัง NIM Server
ขั้นตอนการใช้งาน NIM:
- ดาวน์โหลด NIM container จาก NVIDIA container registry (ต้องมี Enterprise License)
- เริ่ม Server ด้วย OpenAI client
- ส่ง Input ทั้งแบบข้อความหรือรูปภาพไปยัง Endpoint
ตัวเลือกการปรับใช้ที่หลากหลาย 🚀
NVIDIA มีตัวเลือกที่ครอบคลุมสำหรับการนำ Step 3.7 Flash ไปใช้ในทุกขั้นตอนของการพัฒนาและปรับใช้ ตั้งแต่การใช้งานใน Data Center ด้วย NVIDIA Blackwell, การใช้งานบนเครื่องของนักพัฒนาด้วย NVIDIA DGX Station, ไปจนถึงบริการ NIM microservices และเวิร์กโฟลว์การปรับแต่งแบบ Day 0
NVIDIA เป็นผู้สนับสนุนสำคัญของ Open Source Ecosystem และมุ่งมั่นที่จะสนับสนุนโมเดลแบบเปิดอย่าง Step 3.7 Flash เพื่อส่งเสริมความโปร่งใสของ AI และเปิดโอกาสให้ผู้ใช้ได้แบ่งปันผลงานด้านความปลอดภัยและความทนทานของ AI
เริ่มต้นใช้งาน:
- สำรวจ Step 3.7 Flash บน Hugging Face
- ทดสอบกับข้อมูลของคุณเองบน build.nvidia.com
- ทดลองใช้งานในเครื่องบน DGX Station โดยใช้ vLLM Playbook
#AI #MultimodalAI #NVIDIA #Step3.7Flash
ขอบคุณ แหล่งข้อมูล
https://developer.nvidia.com/blog/run-step-3-7-flash-on-nvidia-gpus-with-enterprise-ready-multimodal-ai/