LFM2.5-VL-3B: พัฒนาความสามารถด้าน Vision-Language ให้เร็วและฉลาดขึ้น สำหรับอุปกรณ์ Edge 🚀
ในโลกของปัญญาประดิษฐ์ที่ก้าวหน้าอย่างรวดเร็ว ความสามารถในการเข้าใจและประมวลผลข้อมูลภาพควบคู่ไปกับข้อความ (Vision-Language) กลายเป็นสิ่งสำคัญอย่างยิ่ง โดยเฉพาะอย่างยิ่งสำหรับการนำไปใช้งานบนอุปกรณ์ Edge ที่ต้องการความเร็ว ประสิทธิภาพ และการประมวลผลแบบออฟไลน์ วันนี้เรามีข่าวดีสำหรับนักพัฒนาและผู้ที่สนใจเทคโนโลยี AI กับการเปิดตัว LFM2.5-VL-3B โมเดล Vision-Language ที่ได้รับการพัฒนาขึ้นไปอีกขั้นจาก Liquid AI
LFM2.5-VL-3B ไม่ได้เป็นเพียงการอัปเกรดจากเวอร์ชันก่อนหน้า แต่มาพร้อมกับการปรับปรุงที่สำคัญถึง 4 ด้าน เพื่อยกระดับประสบการณ์การใช้งานให้ดียิ่งขึ้น:
- การเข้าใจหน้าจอ/UI (Screen/UI Understanding): สามารถทำความเข้าใจและตีความหน้าจอแสดงผลดิจิทัลบนอุปกรณ์หลากหลายรูปแบบได้อย่างแม่นยำ ไม่ว่าจะเป็นคอมพิวเตอร์ แท็บเล็ต หรือสมาร์ทโฟน
- การระบุตำแหน่งวัตถุ (Grounding): พัฒนาความสามารถในการระบุและค้นหาวัตถุในภาพได้อย่างแม่นยำยิ่งขึ้น โดยใช้คำสั่งที่เป็นภาษาธรรมชาติ (Natural Language Queries)
- การประมวลผลภาพหลายภาพ (Multi-image Input): สามารถวิเคราะห์และให้เหตุผลจากข้อมูลที่ได้จากภาพหลายภาพพร้อมกันได้อย่างมีประสิทธิภาพ
- การเรียกใช้ฟังก์ชัน (Function Calling): มีความสามารถในการเรียกใช้ฟังก์ชันต่าง ๆ ได้อย่างโดดเด่น ทั้งในสถานการณ์ที่เป็นข้อความล้วน (Text-only) หรือผสมผสานระหว่างภาพและข้อความ (Vision-Text)
เบื้องหลังการฝึกฝนโมเดล Vision-Language ที่ทรงพลังที่สุด 🛠️
LFM2.5-VL-3B เกิดจากการผสมผสานระหว่าง SigLIP2 400M NaFlex ซึ่งเป็น Vision Encoder ประสิทธิภาพสูง เข้ากับ Backbone ที่ผ่านการ Pre-train มาแล้วเช่นเดียวกับโมเดล LFM2.5-2.6B สำหรับประมวลผลข้อความ โมเดลนี้ได้รับการ Pre-train บนข้อมูลกว่า 34 ล้านล้าน Token โดยมีการเพิ่มข้อมูลภาพถึง 4 เท่าจากเวอร์ชันก่อนหน้า ข้อมูลเหล่านี้ได้มาจากการรวบรวมอย่างพิถีพิถัน ทั้งชุดข้อมูลภาพ-คำบรรยาย (Image-Caption) ที่คัดสรรมาอย่างดี, ข้อมูลสังเคราะห์ (Synthetic), การอ่านข้อความจากภาพ (OCR), การระบุตำแหน่งวัตถุ (Grounding) และชุดข้อมูลการทำตามคำสั่ง (Instruction-Following)
เพื่อรองรับภาษาที่ไม่ใช่ภาษาละติน (Non-Latin Scripts) เราได้ขยาย Vocabulary ให้ใหญ่ขึ้นเป็น 128,000 คำ โดยการต่อยอด Tokenizer ที่มีอยู่เดิม แทนที่จะต้องฝึกใหม่ทั้งหมด
กระบวนการ Post-training แบ่งออกเป็น 2 ระยะ:
- Supervised Fine-Tuning (SFT): ใช้เทคนิค Knowledge Distillation จาก Teacher Model ที่ใหญ่กว่า ควบคู่ไปกับการฝึกแบบ Antidoom
- Multi-Reward Reinforcement Learning (RL): การเรียนรู้แบบเสริมกำลังด้วยรางวัลหลายรูปแบบ
ประสิทธิภาพที่พิสูจน์ได้บนหลากหลาย Benchmark 📊
เราได้ทำการประเมิน LFM2.5-VL-3B ทั้งบน Benchmark ด้าน Vision และ Text
Vision Benchmarks: ครอบคลุมการทำความเข้าใจภาพหลายภาษา, การทำตามคำสั่งที่เกี่ยวกับภาพ, การให้เหตุผลเชิงคณิตศาสตร์และวิทยาศาสตร์จากภาพ, การอ่านเอกสาร, การตรวจจับวัตถุ, การเข้าใจภาพหลายภาพ และการเข้าใจหน้าจอ LFM2.5-VL-3B ได้แสดงให้เห็นถึงความเป็นผู้นำในกลุ่มโมเดลขนาดเดียวกันสำหรับงานภาพในโลกจริง (Real-world Image Tasks) รวมถึงความสามารถในการอ่านเนื้อหาดิจิทัลได้อย่างยอดเยี่ยม ไม่ว่าจะเป็นเอกสาร, กราฟ หรือองค์ประกอบต่างๆ บนหน้าจอ UI
(หมายเหตุ: ค่าทั้งหมดในตารางถูกปรับให้อยู่ในสเกล 0–100 การประเมินทำด้วย vLLM 0.26.0 และพารามิเตอร์การสร้างที่แนะนำของแต่ละโมเดล การทดสอบใช้โหมด Non-reasoning และสั่งให้โมเดลตอบโดยตรงโดยไม่มีการให้เหตุผล)
Text-only Benchmarks: เรายังได้ประเมิน LFM2.5-VL-3B บน Benchmark เฉพาะข้อความ สำหรับการทำตามคำสั่งและการใช้เครื่องมือ (Tool Use) พบว่าความสามารถในการทำตามคำสั่งเพิ่มขึ้นอย่างต่อเนื่อง และการใช้เครื่องมือก็พัฒนาขึ้นอย่างก้าวกระโดด โดย LFM2.5-VL-3B มีประสิทธิภาพในการใช้เครื่องมือทัดเทียมกับ Gemma-4-E2B และ Qwen3.5-2B
(หมายเหตุ: โมเดล InternVL 3.5 ไม่รองรับ Function-calling)
ผลลัพธ์เหล่านี้ยืนยันว่า LFM2.5-VL-3B เป็นโมเดล Vision-Language ที่มีความสามารถรอบด้านและแข็งแกร่ง สามารถจัดการกับงานทั่วไปในชีวิตประจำวัน (เช่น การสร้างคำบรรยายภาพ, การตอบคำถามจากภาพ, การอ่านเอกสาร) และมีความโดดเด่นเป็นพิเศษในด้านการระบุตำแหน่งวัตถุ, การอ่านหน้าจอและเอกสาร รวมถึงการเรียกใช้เครื่องมือต่างๆ
ความเร็วในการประมวลผลบน CPU และ GPU ⚡
LFM2.5-VL-3B รองรับการใช้งานผ่าน Ecosystem การประมวลผล Inference ที่หลากหลายทันที ตั้งแต่วันแรกที่เปิดตัว รวมถึง llama.cpp, MLX, vLLM, SGLang และ ONNX
On-device Inference: โมเดลนี้สามารถถอดรหัสได้ 228 Tokens/วินาที บน M5 Max และ 116 Tokens/วินาที บน Ryzen AI Max+ 395 โดยใช้หน่วยความจำเพียงประมาณ 3 GB เท่านั้น! ที่น่าทึ่งคือ สามารถทำความเร็วได้ถึง 20 Tokens/วินาที บน Galaxy S26 Ultra ทำให้สามารถรันโมเดลนี้ได้เต็มรูปแบบบนอุปกรณ์ของคุณโดยไม่ต้องพึ่งพาคลาวด์
GPU Inference: LFM2.5-VL-3B รักษา Latency ให้ต่ำอย่างสม่ำเสมอ และเป็นโมเดลที่เร็วที่สุดสำหรับการประมวลผลอินพุตแบบหลายเฟรม (Multi-frame Inputs)
นอกจากนี้ LFM2.5-VL-3B ยังเป็นโมเดลที่ เร็วที่สุดในด้าน Output Throughput จากทุกโมเดลที่เราทดสอบ โดยสามารถทำความเร็วได้ถึงประมาณ 11,000 Tokens ต่อวินาที ที่ระดับ Concurrency สูง ซึ่งเร็วกว่าโมเดลขนาด 4B ถึง 2 เท่า และเร็วกว่าโมเดลขนาด 2B ทำให้สามารถสร้าง Output ได้เกือบ 1 พันล้าน Token ต่อวัน บน GPU H100 เพียงเครื่องเดียว
วิธีการใช้งาน LFM2.5-VL-3B 💡
เลือกใช้ LFM2.5-VL-3B เมื่อคุณต้องการระบบอัจฉริยะที่ทำงานบนอุปกรณ์ (On-device Intelligence) สำหรับงานที่มีปริมาณมาก (High-volume Workloads)
การติดตั้ง:
ติดตั้ง transformers เวอร์ชันล่าสุด (เข้ากันได้กับ transformers>=5.0.0)
pip install transformersการโหลดและใช้งานโมเดล:
from transformers import AutoModelForCausalLM, AutoTokenizer
from PIL import Image
import torch
# โหลดโมเดลและ Tokenizer
model_id = "lfm2-vl-3b"
# หรือ ID ที่ถูกต้องของโมเดล
model = AutoModelForCausalLM.from_pretrained(model_id, torch_dtype=torch.bfloat16)
tokenizer = AutoTokenizer.from_pretrained(model_id)
# ตัวอย่างการประมวลผลภาพ (ปรับตามการใช้งานจริง)
# image = Image.open("your_image.jpg")
# prompt = "Describe this image."
# inputs = tokenizer(prompt, return_tensors="pt")
# outputs = model.generate(**inputs, ...)
# ดูตัวอย่างการใช้งานที่ซับซ้อนกว่านี้ในเอกสาร
print("โมเดล LFM2.5-VL-3B พร้อมใช้งานแล้ว!")คุณสามารถค้นหาตัวอย่างการใช้งานเพิ่มเติม เช่น การประมวลผลภาพหลายภาพ, การระบุตำแหน่งวัตถุ, OCR, การเรียกใช้เครื่องมือ และอื่นๆ อีกมากมาย ได้ใน เอกสารประกอบ ของเรา หรือชมวิดีโอสาธิตใน Release Blog
ลองสัมผัสประสบการณ์ใช้งานจริงได้ที่ WebGPU demo ที่ให้คุณสามารถอัปโหลดภาพหลายภาพและให้โมเดลโต้ตอบกับภาพเหล่านั้น รวมถึงการใช้งาน Grounding, OCR และ Tool Use ได้โดยตรงในเบราว์เซอร์ของคุณ โดยไม่ต้องติดตั้งอะไรเพิ่มเติม
LFM2.5-VL-3B พร้อมให้ใช้งานแล้วบน Hugging Face!
ด้วย LFM2.5 เรากำลังส่งมอบวิสัยทัศน์ของ AI ที่สามารถทำงานได้ทุกที่ (AI that runs anywhere) โมเดลเหล่านี้:
- ดาวน์โหลด: LFM2.5-VL-3B บน Hugging Face
- ทดลอง: ลองใช้ WebGPU demo ในเบราว์เซอร์ของคุณ
- Fine-tune: ปรับแต่ง LFM2.5-VL-3B ให้เหมาะกับงานของคุณด้วยบทช่วยสอน Fine-tuning
เราตื่นเต้นที่จะได้เห็นสิ่งที่คุณจะสร้างสรรค์ขึ้นมา!
#AI #VisionLanguage #EdgeAI #HuggingFace #LiquidAI
ขอบคุณ แหล่งข้อมูล
https://huggingface.co/blog/LiquidAI/lfm2-5-vl-3b