Step 3.7 Flash: โมเดล AI อัจฉริยะที่พร้อมใช้งานระดับองค์กรบน NVIDIA GPU

ในยุคที่ AI ก้าวข้ามการสร้างข้อความธรรมดา ๆ ไปสู่ระบบที่สามารถรับรู้ ค้นหา และประมวลผลข้อมูลหลากหลายรูปแบบ ทั้งรูปภาพ เอกสาร วิดีโอ และภาษา ได้แบบเรียลไทม์ เทคโนโลยีนี้กำลังเปลี่ยนข้อมูลที่กระจัดกระจายให้กลายเป็นข้อมูลเชิงลึกที่นำไปปฏิบัติได้จริง ล่าสุด Step 3.7 Flash จาก StepFun ได้ยกระดับความสามารถเหล่านี้สู่ระดับการใช้งานจริงในระดับองค์กร โดยพร้อมใช้งานบนโครงสร้างพื้นฐานที่เร่งความเร็วด้วย NVIDIA GPU

Step 3.7 Flash คืออะไร? 💡

Step 3.7 Flash เป็นโมเดลภาษา-ภาพ (Vision-Language Model) แบบ Mixture-of-Experts (MoE) ที่มีพารามิเตอร์ถึง 198 พันล้านตัว แต่ใช้พารามิเตอร์ที่ทำงานจริงเพียงประมาณ 11 พันล้านตัวต่อการประมวลผลหนึ่งครั้ง ถูกปรับแต่งมาเพื่อเวิร์กโฟลว์แบบ Agentic ที่ผสมผสานการรับรู้ (Perception) การค้นหา (Search) และการให้เหตุผลหลายขั้นตอน (Multi-step Reasoning) ในระดับ Production Scale

จุดเด่นของโมเดลนี้คือ:

  • รองรับการป้อนข้อมูลรูปภาพและวิดีโอโดยตรง: ทำให้เข้าใจบริบทได้กว้างขวางขึ้น
  • ระดับการให้เหตุผลที่ปรับได้ 3 ระดับ: Low, Medium, และ High เพื่อความยืดหยุ่นในการใช้งาน
  • Context Window ขนาดใหญ่ 256k: สามารถประมวลผลข้อมูลจำนวนมหาศาลในครั้งเดียว
  • เหมาะสำหรับองค์กร: ออกแบบมาเพื่อการใช้งานในระดับองค์กร เช่น การวิเคราะห์ทางการเงิน, Agent สำหรับการเขียนโค้ดพร้อมกัน, และการใช้งาน Multimodal อื่น ๆ ที่ต้องการปริมาณงานสูง (High-throughput)

นอกจากนี้ ยังมี StepFun’s NVFP4-quantized checkpoint ที่พร้อมใช้งานผ่าน Hugging Face เพื่อเพิ่มประสิทธิภาพการ Inference ด้วยการลดความต้องการหน่วยความจำและพื้นที่จัดเก็บ

การใช้งานและพัฒนาบนโครงสร้างพื้นฐาน NVIDIA 🛠️

Step 3.7 Flash สามารถทำงานร่วมกับ Framework แบบ Open Source ได้หลากหลาย เช่น SGLang, NVIDIA TensorRT-LLM, และ vLLM โดยใช้ประโยชน์จาก Kernels ที่ปรับแต่งมาสำหรับฮาร์ดแวร์ NVIDIA โดยเฉพาะ

สำหรับนักพัฒนา:

  • NVIDIA Endpoints: สามารถใช้ GPU-accelerated endpoints ที่มีให้บน build.nvidia.com สำหรับการสร้างต้นแบบและประเมินผล Step 3.7 Flash ได้ ลองใช้งานใน Demo Notebook ที่รวม Step 3.7 Flash และ NVIDIA Nemotron Parse เพื่อสกัดข้อมูลเชิงลึกจากเอกสารที่ซับซ้อน เช่น รายงานทางการเงิน, สไลด์นำเสนอ, และบทความทางวิทยาศาสตร์ (รวมถึง PDF) และจัดระเบียบผลลัพธ์
  • การปรับแต่ง (Fine-tuning) ด้วย NVIDIA NeMo Framework: สามารถปรับแต่ง Step 3.7 Flash ให้เข้ากับข้อมูลเฉพาะทางขององค์กรได้ โดยใช้ไลบรารีแบบ Open Source จาก NVIDIA NeMo Framework โดยเฉพาะไลบรารี NVIDIA NeMo Automodel ที่รองรับการทำ Supervised Fine-Tuning (SFT) และ LoRA แบบประหยัดหน่วยความจำ ด้วยความเร็วสูงถึง 600 tokens/sec บน Hopper GPUs นอกจากนี้ ยังมี NeMo Megatron-Bridge สำหรับการฝึกโมเดลขนาดใหญ่ที่ต้องการประสิทธิภาพขั้นสูง

การนำไปใช้งานจริงในระดับ Production ด้วย NVIDIA NIM ✅

NVIDIA NIM (NVIDIA Inference Microservices) ช่วยให้การนำ Step 3.7 Flash จากการพัฒนาไปสู่ Production เป็นเรื่องง่าย ด้วยบริการ Inference ที่ปรับแต่งมาในรูปแบบ Container ที่มี API มาตรฐาน ทำให้มีความยืดหยุ่นในการปรับใช้ สามารถดาวน์โหลดและรันได้ทั้งแบบ On-premises, บน Cloud, หรือในสภาพแวดล้อมแบบ Hybrid NIM ยังรองรับ OpenAI inference มาตรฐานสำหรับการส่งคำขอไปยัง NIM Server

ขั้นตอนการใช้งาน NIM:

  1. ดาวน์โหลด NIM container จาก NVIDIA container registry (ต้องมี Enterprise License)
  2. เริ่ม Server ด้วย OpenAI client
  3. ส่ง Input ทั้งแบบข้อความหรือรูปภาพไปยัง Endpoint

ตัวเลือกการปรับใช้ที่หลากหลาย 🚀

NVIDIA มีตัวเลือกที่ครอบคลุมสำหรับการนำ Step 3.7 Flash ไปใช้ในทุกขั้นตอนของการพัฒนาและปรับใช้ ตั้งแต่การใช้งานใน Data Center ด้วย NVIDIA Blackwell, การใช้งานบนเครื่องของนักพัฒนาด้วย NVIDIA DGX Station, ไปจนถึงบริการ NIM microservices และเวิร์กโฟลว์การปรับแต่งแบบ Day 0

NVIDIA เป็นผู้สนับสนุนสำคัญของ Open Source Ecosystem และมุ่งมั่นที่จะสนับสนุนโมเดลแบบเปิดอย่าง Step 3.7 Flash เพื่อส่งเสริมความโปร่งใสของ AI และเปิดโอกาสให้ผู้ใช้ได้แบ่งปันผลงานด้านความปลอดภัยและความทนทานของ AI

เริ่มต้นใช้งาน:

  • สำรวจ Step 3.7 Flash บน Hugging Face
  • ทดสอบกับข้อมูลของคุณเองบน build.nvidia.com
  • ทดลองใช้งานในเครื่องบน DGX Station โดยใช้ vLLM Playbook

#AI #MultimodalAI #NVIDIA #Step3.7Flash

ขอบคุณ แหล่งข้อมูล
https://developer.nvidia.com/blog/run-step-3-7-flash-on-nvidia-gpus-with-enterprise-ready-multimodal-ai/

Step 3.7 Flash: โมเดล AI อัจฉริยะที่พร้อมใช้งานระดับองค์กรบน NVIDIA GPUในยุคที่ AI ก้าวข้ามการสร้างข้อความธรรมดา ๆ ไปสู่ระบบที่สามารถรับรู้ ค้นหา และประมวลผลข้อมูลหลากหลายรูปแบบ ทั้งรูปภาพ เอกสาร วิดีโอ และภาษา ได้แบบเรียลไทม์ เทคโนโลยีนี้กำลังเปลี่ยนข้อมูลที่กระจัดกระจายให้กลายเป็นข้อมูลเชิงลึกที่นำไปปฏิบัติได้จริง ล่าสุด Step 3.7 Flash จาก StepFun ได้ยกระดับความสามารถเหล่านี้สู่ระดับการใช้งานจริงในระดับองค์กร โดยพร้อมใช้งานบนโครงสร้างพื้นฐานที่เร่งความเร็วด้วย NVIDIA GPUStep 3.7 Flash คืออะไร? 💡Step 3.7 Flash เป็นโมเดลภาษา-ภาพ (Vision-Language Model) แบบ Mixture-of-Experts (MoE) ที่มีพารามิเตอร์ถึง 198 พันล้านตัว แต่ใช้พารามิเตอร์ที่ทำงานจริงเพียงประมาณ 11 พันล้านตัวต่อการประมวลผลหนึ่งครั้ง ถูกปรับแต่งมาเพื่อเวิร์กโฟลว์แบบ Agentic ที่ผสมผสานการรับรู้ (Perception) การค้นหา (Search) และการให้เหตุผลหลายขั้นตอน (Multi-step Reasoning) ในระดับ Production Scaleจุดเด่นของโมเดลนี้คือ:รองรับการป้อนข้อมูลรูปภาพและวิดีโอโดยตรง: ทำให้เข้าใจบริบทได้กว้างขวางขึ้นระดับการให้เหตุผลที่ปรับได้ 3 ระดับ: Low, Medium, และ High เพื่อความยืดหยุ่นในการใช้งานContext Window ขนาดใหญ่ 256k: สามารถประมวลผลข้อมูลจำนวนมหาศาลในครั้งเดียวเหมาะสำหรับองค์กร: ออกแบบมาเพื่อการใช้งานในระดับองค์กร เช่น การวิเคราะห์ทางการเงิน, Agent สำหรับการเขียนโค้ดพร้อมกัน, และการใช้งาน Multimodal อื่น ๆ ที่ต้องการปริมาณงานสูง (High-throughput)นอกจากนี้ ยังมี StepFun’s NVFP4-quantized checkpoint ที่พร้อมใช้งานผ่าน Hugging Face เพื่อเพิ่มประสิทธิภาพการ Inference ด้วยการลดความต้องการหน่วยความจำและพื้นที่จัดเก็บการใช้งานและพัฒนาบนโครงสร้างพื้นฐาน NVIDIA 🛠️Step 3.7 Flash สามารถทำงานร่วมกับ Framework แบบ Open Source ได้หลากหลาย เช่น SGLang, NVIDIA TensorRT-LLM, และ vLLM โดยใช้ประโยชน์จาก Kernels ที่ปรับแต่งมาสำหรับฮาร์ดแวร์ NVIDIA โดยเฉพาะสำหรับนักพัฒนา:NVIDIA Endpoints: สามารถใช้ GPU-accelerated endpoints ที่มีให้บน build.nvidia.com สำหรับการสร้างต้นแบบและประเมินผล Step 3.7 Flash ได้ ลองใช้งานใน Demo Notebook ที่รวม Step 3.7 Flash และ NVIDIA Nemotron Parse เพื่อสกัดข้อมูลเชิงลึกจากเอกสารที่ซับซ้อน เช่น รายงานทางการเงิน, สไลด์นำเสนอ, และบทความทางวิทยาศาสตร์ (รวมถึง PDF) และจัดระเบียบผลลัพธ์การปรับแต่ง (Fine-tuning) ด้วย NVIDIA NeMo Framework: สามารถปรับแต่ง Step 3.7 Flash ให้เข้ากับข้อมูลเฉพาะทางขององค์กรได้ โดยใช้ไลบรารีแบบ Open Source จาก NVIDIA NeMo Framework โดยเฉพาะไลบรารี NVIDIA NeMo Automodel ที่รองรับการทำ Supervised Fine-Tuning (SFT) และ LoRA แบบประหยัดหน่วยความจำ ด้วยความเร็วสูงถึง 600 tokens/sec บน Hopper GPUs นอกจากนี้ ยังมี NeMo Megatron-Bridge สำหรับการฝึกโมเดลขนาดใหญ่ที่ต้องการประสิทธิภาพขั้นสูงการนำไปใช้งานจริงในระดับ Production ด้วย NVIDIA NIM ✅NVIDIA NIM (NVIDIA Inference Microservices) ช่วยให้การนำ Step 3.7 Flash จากการพัฒนาไปสู่ Production เป็นเรื่องง่าย ด้วยบริการ Inference ที่ปรับแต่งมาในรูปแบบ Container ที่มี API มาตรฐาน ทำให้มีความยืดหยุ่นในการปรับใช้ สามารถดาวน์โหลดและรันได้ทั้งแบบ On-premises, บน Cloud, หรือในสภาพแวดล้อมแบบ Hybrid NIM ยังรองรับ OpenAI inference มาตรฐานสำหรับการส่งคำขอไปยัง NIM Serverขั้นตอนการใช้งาน NIM:ดาวน์โหลด NIM container จาก NVIDIA container registry (ต้องมี Enterprise License)เริ่ม Server ด้วย OpenAI clientส่ง Input ทั้งแบบข้อความหรือรูปภาพไปยัง Endpointตัวเลือกการปรับใช้ที่หลากหลาย 🚀NVIDIA มีตัวเลือกที่ครอบคลุมสำหรับการนำ Step 3.7 Flash ไปใช้ในทุกขั้นตอนของการพัฒนาและปรับใช้ ตั้งแต่การใช้งานใน Data Center ด้วย NVIDIA Blackwell, การใช้งานบนเครื่องของนักพัฒนาด้วย NVIDIA DGX Station, ไปจนถึงบริการ NIM microservices และเวิร์กโฟลว์การปรับแต่งแบบ Day 0NVIDIA เป็นผู้สนับสนุนสำคัญของ Open Source Ecosystem และมุ่งมั่นที่จะสนับสนุนโมเดลแบบเปิดอย่าง Step 3.7 Flash เพื่อส่งเสริมความโปร่งใสของ AI และเปิดโอกาสให้ผู้ใช้ได้แบ่งปันผลงานด้านความปลอดภัยและความทนทานของ AIเริ่มต้นใช้งาน:สำรวจ Step 3.7 Flash บน Hugging Faceทดสอบกับข้อมูลของคุณเองบน build.nvidia.comทดลองใช้งานในเครื่องบน DGX Station โดยใช้ vLLM Playbook#AI #MultimodalAI #NVIDIA #Step3.7Flashhttps://developer.nvidia.com/blog/run-step-3-7-flash-on-nvidia-gpus-with-enterprise-ready-multimodal-ai/
Shared content
DEVELOPER.NVIDIA.COM
Run Step 3.7 Flash on NVIDIA GPUs with Enterprise-Ready Multimodal AI
AI applications are moving beyond text generation to multimodal systems that can perceive, search, and reason across images, documents, video, and language in real time—turning fragmented information…
2 Kommentare 0 Geteilt 361 Ansichten 0 Bewertungen