LFM2.5-VL-3B: พัฒนาความสามารถด้าน Vision-Language ให้เร็วและฉลาดขึ้น สำหรับอุปกรณ์ Edge 🚀

ในโลกของปัญญาประดิษฐ์ที่ก้าวหน้าอย่างรวดเร็ว ความสามารถในการเข้าใจและประมวลผลข้อมูลภาพควบคู่ไปกับข้อความ (Vision-Language) กลายเป็นสิ่งสำคัญอย่างยิ่ง โดยเฉพาะอย่างยิ่งสำหรับการนำไปใช้งานบนอุปกรณ์ Edge ที่ต้องการความเร็ว ประสิทธิภาพ และการประมวลผลแบบออฟไลน์ วันนี้เรามีข่าวดีสำหรับนักพัฒนาและผู้ที่สนใจเทคโนโลยี AI กับการเปิดตัว LFM2.5-VL-3B โมเดล Vision-Language ที่ได้รับการพัฒนาขึ้นไปอีกขั้นจาก Liquid AI

LFM2.5-VL-3B ไม่ได้เป็นเพียงการอัปเกรดจากเวอร์ชันก่อนหน้า แต่มาพร้อมกับการปรับปรุงที่สำคัญถึง 4 ด้าน เพื่อยกระดับประสบการณ์การใช้งานให้ดียิ่งขึ้น:

  • การเข้าใจหน้าจอ/UI (Screen/UI Understanding): สามารถทำความเข้าใจและตีความหน้าจอแสดงผลดิจิทัลบนอุปกรณ์หลากหลายรูปแบบได้อย่างแม่นยำ ไม่ว่าจะเป็นคอมพิวเตอร์ แท็บเล็ต หรือสมาร์ทโฟน
  • การระบุตำแหน่งวัตถุ (Grounding): พัฒนาความสามารถในการระบุและค้นหาวัตถุในภาพได้อย่างแม่นยำยิ่งขึ้น โดยใช้คำสั่งที่เป็นภาษาธรรมชาติ (Natural Language Queries)
  • การประมวลผลภาพหลายภาพ (Multi-image Input): สามารถวิเคราะห์และให้เหตุผลจากข้อมูลที่ได้จากภาพหลายภาพพร้อมกันได้อย่างมีประสิทธิภาพ
  • การเรียกใช้ฟังก์ชัน (Function Calling): มีความสามารถในการเรียกใช้ฟังก์ชันต่าง ๆ ได้อย่างโดดเด่น ทั้งในสถานการณ์ที่เป็นข้อความล้วน (Text-only) หรือผสมผสานระหว่างภาพและข้อความ (Vision-Text)

เบื้องหลังการฝึกฝนโมเดล Vision-Language ที่ทรงพลังที่สุด 🛠️

LFM2.5-VL-3B เกิดจากการผสมผสานระหว่าง SigLIP2 400M NaFlex ซึ่งเป็น Vision Encoder ประสิทธิภาพสูง เข้ากับ Backbone ที่ผ่านการ Pre-train มาแล้วเช่นเดียวกับโมเดล LFM2.5-2.6B สำหรับประมวลผลข้อความ โมเดลนี้ได้รับการ Pre-train บนข้อมูลกว่า 34 ล้านล้าน Token โดยมีการเพิ่มข้อมูลภาพถึง 4 เท่าจากเวอร์ชันก่อนหน้า ข้อมูลเหล่านี้ได้มาจากการรวบรวมอย่างพิถีพิถัน ทั้งชุดข้อมูลภาพ-คำบรรยาย (Image-Caption) ที่คัดสรรมาอย่างดี, ข้อมูลสังเคราะห์ (Synthetic), การอ่านข้อความจากภาพ (OCR), การระบุตำแหน่งวัตถุ (Grounding) และชุดข้อมูลการทำตามคำสั่ง (Instruction-Following)

เพื่อรองรับภาษาที่ไม่ใช่ภาษาละติน (Non-Latin Scripts) เราได้ขยาย Vocabulary ให้ใหญ่ขึ้นเป็น 128,000 คำ โดยการต่อยอด Tokenizer ที่มีอยู่เดิม แทนที่จะต้องฝึกใหม่ทั้งหมด

กระบวนการ Post-training แบ่งออกเป็น 2 ระยะ:

  1. Supervised Fine-Tuning (SFT): ใช้เทคนิค Knowledge Distillation จาก Teacher Model ที่ใหญ่กว่า ควบคู่ไปกับการฝึกแบบ Antidoom
  2. Multi-Reward Reinforcement Learning (RL): การเรียนรู้แบบเสริมกำลังด้วยรางวัลหลายรูปแบบ

ประสิทธิภาพที่พิสูจน์ได้บนหลากหลาย Benchmark 📊

เราได้ทำการประเมิน LFM2.5-VL-3B ทั้งบน Benchmark ด้าน Vision และ Text

Vision Benchmarks: ครอบคลุมการทำความเข้าใจภาพหลายภาษา, การทำตามคำสั่งที่เกี่ยวกับภาพ, การให้เหตุผลเชิงคณิตศาสตร์และวิทยาศาสตร์จากภาพ, การอ่านเอกสาร, การตรวจจับวัตถุ, การเข้าใจภาพหลายภาพ และการเข้าใจหน้าจอ LFM2.5-VL-3B ได้แสดงให้เห็นถึงความเป็นผู้นำในกลุ่มโมเดลขนาดเดียวกันสำหรับงานภาพในโลกจริง (Real-world Image Tasks) รวมถึงความสามารถในการอ่านเนื้อหาดิจิทัลได้อย่างยอดเยี่ยม ไม่ว่าจะเป็นเอกสาร, กราฟ หรือองค์ประกอบต่างๆ บนหน้าจอ UI

(หมายเหตุ: ค่าทั้งหมดในตารางถูกปรับให้อยู่ในสเกล 0–100 การประเมินทำด้วย vLLM 0.26.0 และพารามิเตอร์การสร้างที่แนะนำของแต่ละโมเดล การทดสอบใช้โหมด Non-reasoning และสั่งให้โมเดลตอบโดยตรงโดยไม่มีการให้เหตุผล)

Text-only Benchmarks: เรายังได้ประเมิน LFM2.5-VL-3B บน Benchmark เฉพาะข้อความ สำหรับการทำตามคำสั่งและการใช้เครื่องมือ (Tool Use) พบว่าความสามารถในการทำตามคำสั่งเพิ่มขึ้นอย่างต่อเนื่อง และการใช้เครื่องมือก็พัฒนาขึ้นอย่างก้าวกระโดด โดย LFM2.5-VL-3B มีประสิทธิภาพในการใช้เครื่องมือทัดเทียมกับ Gemma-4-E2B และ Qwen3.5-2B

(หมายเหตุ: โมเดล InternVL 3.5 ไม่รองรับ Function-calling)

ผลลัพธ์เหล่านี้ยืนยันว่า LFM2.5-VL-3B เป็นโมเดล Vision-Language ที่มีความสามารถรอบด้านและแข็งแกร่ง สามารถจัดการกับงานทั่วไปในชีวิตประจำวัน (เช่น การสร้างคำบรรยายภาพ, การตอบคำถามจากภาพ, การอ่านเอกสาร) และมีความโดดเด่นเป็นพิเศษในด้านการระบุตำแหน่งวัตถุ, การอ่านหน้าจอและเอกสาร รวมถึงการเรียกใช้เครื่องมือต่างๆ

ความเร็วในการประมวลผลบน CPU และ GPU ⚡

LFM2.5-VL-3B รองรับการใช้งานผ่าน Ecosystem การประมวลผล Inference ที่หลากหลายทันที ตั้งแต่วันแรกที่เปิดตัว รวมถึง llama.cpp, MLX, vLLM, SGLang และ ONNX

On-device Inference: โมเดลนี้สามารถถอดรหัสได้ 228 Tokens/วินาที บน M5 Max และ 116 Tokens/วินาที บน Ryzen AI Max+ 395 โดยใช้หน่วยความจำเพียงประมาณ 3 GB เท่านั้น! ที่น่าทึ่งคือ สามารถทำความเร็วได้ถึง 20 Tokens/วินาที บน Galaxy S26 Ultra ทำให้สามารถรันโมเดลนี้ได้เต็มรูปแบบบนอุปกรณ์ของคุณโดยไม่ต้องพึ่งพาคลาวด์

GPU Inference: LFM2.5-VL-3B รักษา Latency ให้ต่ำอย่างสม่ำเสมอ และเป็นโมเดลที่เร็วที่สุดสำหรับการประมวลผลอินพุตแบบหลายเฟรม (Multi-frame Inputs)

นอกจากนี้ LFM2.5-VL-3B ยังเป็นโมเดลที่ เร็วที่สุดในด้าน Output Throughput จากทุกโมเดลที่เราทดสอบ โดยสามารถทำความเร็วได้ถึงประมาณ 11,000 Tokens ต่อวินาที ที่ระดับ Concurrency สูง ซึ่งเร็วกว่าโมเดลขนาด 4B ถึง 2 เท่า และเร็วกว่าโมเดลขนาด 2B ทำให้สามารถสร้าง Output ได้เกือบ 1 พันล้าน Token ต่อวัน บน GPU H100 เพียงเครื่องเดียว

วิธีการใช้งาน LFM2.5-VL-3B 💡

เลือกใช้ LFM2.5-VL-3B เมื่อคุณต้องการระบบอัจฉริยะที่ทำงานบนอุปกรณ์ (On-device Intelligence) สำหรับงานที่มีปริมาณมาก (High-volume Workloads)

การติดตั้ง:
ติดตั้ง transformers เวอร์ชันล่าสุด (เข้ากันได้กับ transformers>=5.0.0)

pip install transformers

การโหลดและใช้งานโมเดล:

from transformers import AutoModelForCausalLM, AutoTokenizer
from PIL import Image
import torch

# โหลดโมเดลและ Tokenizer
model_id = "lfm2-vl-3b"
# หรือ ID ที่ถูกต้องของโมเดล
model = AutoModelForCausalLM.from_pretrained(model_id, torch_dtype=torch.bfloat16)
tokenizer = AutoTokenizer.from_pretrained(model_id)

# ตัวอย่างการประมวลผลภาพ (ปรับตามการใช้งานจริง)
# image = Image.open("your_image.jpg")
# prompt = "Describe this image."
# inputs = tokenizer(prompt, return_tensors="pt")

# outputs = model.generate(**inputs, ...)
# ดูตัวอย่างการใช้งานที่ซับซ้อนกว่านี้ในเอกสาร

print("โมเดล LFM2.5-VL-3B พร้อมใช้งานแล้ว!")

คุณสามารถค้นหาตัวอย่างการใช้งานเพิ่มเติม เช่น การประมวลผลภาพหลายภาพ, การระบุตำแหน่งวัตถุ, OCR, การเรียกใช้เครื่องมือ และอื่นๆ อีกมากมาย ได้ใน เอกสารประกอบ ของเรา หรือชมวิดีโอสาธิตใน Release Blog

ลองสัมผัสประสบการณ์ใช้งานจริงได้ที่ WebGPU demo ที่ให้คุณสามารถอัปโหลดภาพหลายภาพและให้โมเดลโต้ตอบกับภาพเหล่านั้น รวมถึงการใช้งาน Grounding, OCR และ Tool Use ได้โดยตรงในเบราว์เซอร์ของคุณ โดยไม่ต้องติดตั้งอะไรเพิ่มเติม

LFM2.5-VL-3B พร้อมให้ใช้งานแล้วบน Hugging Face!

ด้วย LFM2.5 เรากำลังส่งมอบวิสัยทัศน์ของ AI ที่สามารถทำงานได้ทุกที่ (AI that runs anywhere) โมเดลเหล่านี้:

  • ดาวน์โหลด: LFM2.5-VL-3B บน Hugging Face
  • ทดลอง: ลองใช้ WebGPU demo ในเบราว์เซอร์ของคุณ
  • Fine-tune: ปรับแต่ง LFM2.5-VL-3B ให้เหมาะกับงานของคุณด้วยบทช่วยสอน Fine-tuning

เราตื่นเต้นที่จะได้เห็นสิ่งที่คุณจะสร้างสรรค์ขึ้นมา!

#AI #VisionLanguage #EdgeAI #HuggingFace #LiquidAI

ขอบคุณ แหล่งข้อมูล
https://huggingface.co/blog/LiquidAI/lfm2-5-vl-3b

LFM2.5-VL-3B: พัฒนาความสามารถด้าน Vision-Language ให้เร็วและฉลาดขึ้น สำหรับอุปกรณ์ Edge 🚀ในโลกของปัญญาประดิษฐ์ที่ก้าวหน้าอย่างรวดเร็ว ความสามารถในการเข้าใจและประมวลผลข้อมูลภาพควบคู่ไปกับข้อความ (Vision-Language) กลายเป็นสิ่งสำคัญอย่างยิ่ง โดยเฉพาะอย่างยิ่งสำหรับการนำไปใช้งานบนอุปกรณ์ Edge ที่ต้องการความเร็ว ประสิทธิภาพ และการประมวลผลแบบออฟไลน์ วันนี้เรามีข่าวดีสำหรับนักพัฒนาและผู้ที่สนใจเทคโนโลยี AI กับการเปิดตัว LFM2.5-VL-3B โมเดล Vision-Language ที่ได้รับการพัฒนาขึ้นไปอีกขั้นจาก Liquid AILFM2.5-VL-3B ไม่ได้เป็นเพียงการอัปเกรดจากเวอร์ชันก่อนหน้า แต่มาพร้อมกับการปรับปรุงที่สำคัญถึง 4 ด้าน เพื่อยกระดับประสบการณ์การใช้งานให้ดียิ่งขึ้น:การเข้าใจหน้าจอ/UI (Screen/UI Understanding): สามารถทำความเข้าใจและตีความหน้าจอแสดงผลดิจิทัลบนอุปกรณ์หลากหลายรูปแบบได้อย่างแม่นยำ ไม่ว่าจะเป็นคอมพิวเตอร์ แท็บเล็ต หรือสมาร์ทโฟนการระบุตำแหน่งวัตถุ (Grounding): พัฒนาความสามารถในการระบุและค้นหาวัตถุในภาพได้อย่างแม่นยำยิ่งขึ้น โดยใช้คำสั่งที่เป็นภาษาธรรมชาติ (Natural Language Queries)การประมวลผลภาพหลายภาพ (Multi-image Input): สามารถวิเคราะห์และให้เหตุผลจากข้อมูลที่ได้จากภาพหลายภาพพร้อมกันได้อย่างมีประสิทธิภาพการเรียกใช้ฟังก์ชัน (Function Calling): มีความสามารถในการเรียกใช้ฟังก์ชันต่าง ๆ ได้อย่างโดดเด่น ทั้งในสถานการณ์ที่เป็นข้อความล้วน (Text-only) หรือผสมผสานระหว่างภาพและข้อความ (Vision-Text)เบื้องหลังการฝึกฝนโมเดล Vision-Language ที่ทรงพลังที่สุด 🛠️LFM2.5-VL-3B เกิดจากการผสมผสานระหว่าง SigLIP2 400M NaFlex ซึ่งเป็น Vision Encoder ประสิทธิภาพสูง เข้ากับ Backbone ที่ผ่านการ Pre-train มาแล้วเช่นเดียวกับโมเดล LFM2.5-2.6B สำหรับประมวลผลข้อความ โมเดลนี้ได้รับการ Pre-train บนข้อมูลกว่า 34 ล้านล้าน Token โดยมีการเพิ่มข้อมูลภาพถึง 4 เท่าจากเวอร์ชันก่อนหน้า ข้อมูลเหล่านี้ได้มาจากการรวบรวมอย่างพิถีพิถัน ทั้งชุดข้อมูลภาพ-คำบรรยาย (Image-Caption) ที่คัดสรรมาอย่างดี, ข้อมูลสังเคราะห์ (Synthetic), การอ่านข้อความจากภาพ (OCR), การระบุตำแหน่งวัตถุ (Grounding) และชุดข้อมูลการทำตามคำสั่ง (Instruction-Following)เพื่อรองรับภาษาที่ไม่ใช่ภาษาละติน (Non-Latin Scripts) เราได้ขยาย Vocabulary ให้ใหญ่ขึ้นเป็น 128,000 คำ โดยการต่อยอด Tokenizer ที่มีอยู่เดิม แทนที่จะต้องฝึกใหม่ทั้งหมดกระบวนการ Post-training แบ่งออกเป็น 2 ระยะ:Supervised Fine-Tuning (SFT): ใช้เทคนิค Knowledge Distillation จาก Teacher Model ที่ใหญ่กว่า ควบคู่ไปกับการฝึกแบบ AntidoomMulti-Reward Reinforcement Learning (RL): การเรียนรู้แบบเสริมกำลังด้วยรางวัลหลายรูปแบบประสิทธิภาพที่พิสูจน์ได้บนหลากหลาย Benchmark 📊เราได้ทำการประเมิน LFM2.5-VL-3B ทั้งบน Benchmark ด้าน Vision และ TextVision Benchmarks: ครอบคลุมการทำความเข้าใจภาพหลายภาษา, การทำตามคำสั่งที่เกี่ยวกับภาพ, การให้เหตุผลเชิงคณิตศาสตร์และวิทยาศาสตร์จากภาพ, การอ่านเอกสาร, การตรวจจับวัตถุ, การเข้าใจภาพหลายภาพ และการเข้าใจหน้าจอ LFM2.5-VL-3B ได้แสดงให้เห็นถึงความเป็นผู้นำในกลุ่มโมเดลขนาดเดียวกันสำหรับงานภาพในโลกจริง (Real-world Image Tasks) รวมถึงความสามารถในการอ่านเนื้อหาดิจิทัลได้อย่างยอดเยี่ยม ไม่ว่าจะเป็นเอกสาร, กราฟ หรือองค์ประกอบต่างๆ บนหน้าจอ UI(หมายเหตุ: ค่าทั้งหมดในตารางถูกปรับให้อยู่ในสเกล 0–100 การประเมินทำด้วย vLLM 0.26.0 และพารามิเตอร์การสร้างที่แนะนำของแต่ละโมเดล การทดสอบใช้โหมด Non-reasoning และสั่งให้โมเดลตอบโดยตรงโดยไม่มีการให้เหตุผล)Text-only Benchmarks: เรายังได้ประเมิน LFM2.5-VL-3B บน Benchmark เฉพาะข้อความ สำหรับการทำตามคำสั่งและการใช้เครื่องมือ (Tool Use) พบว่าความสามารถในการทำตามคำสั่งเพิ่มขึ้นอย่างต่อเนื่อง และการใช้เครื่องมือก็พัฒนาขึ้นอย่างก้าวกระโดด โดย LFM2.5-VL-3B มีประสิทธิภาพในการใช้เครื่องมือทัดเทียมกับ Gemma-4-E2B และ Qwen3.5-2B(หมายเหตุ: โมเดล InternVL 3.5 ไม่รองรับ Function-calling)ผลลัพธ์เหล่านี้ยืนยันว่า LFM2.5-VL-3B เป็นโมเดล Vision-Language ที่มีความสามารถรอบด้านและแข็งแกร่ง สามารถจัดการกับงานทั่วไปในชีวิตประจำวัน (เช่น การสร้างคำบรรยายภาพ, การตอบคำถามจากภาพ, การอ่านเอกสาร) และมีความโดดเด่นเป็นพิเศษในด้านการระบุตำแหน่งวัตถุ, การอ่านหน้าจอและเอกสาร รวมถึงการเรียกใช้เครื่องมือต่างๆความเร็วในการประมวลผลบน CPU และ GPU ⚡LFM2.5-VL-3B รองรับการใช้งานผ่าน Ecosystem การประมวลผล Inference ที่หลากหลายทันที ตั้งแต่วันแรกที่เปิดตัว รวมถึง llama.cpp, MLX, vLLM, SGLang และ ONNXOn-device Inference: โมเดลนี้สามารถถอดรหัสได้ 228 Tokens/วินาที บน M5 Max และ 116 Tokens/วินาที บน Ryzen AI Max+ 395 โดยใช้หน่วยความจำเพียงประมาณ 3 GB เท่านั้น! ที่น่าทึ่งคือ สามารถทำความเร็วได้ถึง 20 Tokens/วินาที บน Galaxy S26 Ultra ทำให้สามารถรันโมเดลนี้ได้เต็มรูปแบบบนอุปกรณ์ของคุณโดยไม่ต้องพึ่งพาคลาวด์GPU Inference: LFM2.5-VL-3B รักษา Latency ให้ต่ำอย่างสม่ำเสมอ และเป็นโมเดลที่เร็วที่สุดสำหรับการประมวลผลอินพุตแบบหลายเฟรม (Multi-frame Inputs)นอกจากนี้ LFM2.5-VL-3B ยังเป็นโมเดลที่ เร็วที่สุดในด้าน Output Throughput จากทุกโมเดลที่เราทดสอบ โดยสามารถทำความเร็วได้ถึงประมาณ 11,000 Tokens ต่อวินาที ที่ระดับ Concurrency สูง ซึ่งเร็วกว่าโมเดลขนาด 4B ถึง 2 เท่า และเร็วกว่าโมเดลขนาด 2B ทำให้สามารถสร้าง Output ได้เกือบ 1 พันล้าน Token ต่อวัน บน GPU H100 เพียงเครื่องเดียววิธีการใช้งาน LFM2.5-VL-3B 💡เลือกใช้ LFM2.5-VL-3B เมื่อคุณต้องการระบบอัจฉริยะที่ทำงานบนอุปกรณ์ (On-device Intelligence) สำหรับงานที่มีปริมาณมาก (High-volume Workloads)การติดตั้ง:ติดตั้ง transformers เวอร์ชันล่าสุด (เข้ากันได้กับ transformers>=5.0.0)pip install transformersการโหลดและใช้งานโมเดล:from transformers import AutoModelForCausalLM, AutoTokenizer from PIL import Image import torch # โหลดโมเดลและ Tokenizer model_id = "lfm2-vl-3b" # หรือ ID ที่ถูกต้องของโมเดล model = AutoModelForCausalLM.from_pretrained(model_id, torch_dtype=torch.bfloat16) tokenizer = AutoTokenizer.from_pretrained(model_id) # ตัวอย่างการประมวลผลภาพ (ปรับตามการใช้งานจริง) # image = Image.open("your_image.jpg") # prompt = "Describe this image." # inputs = tokenizer(prompt, return_tensors="pt") # outputs = model.generate(**inputs, ...) # ดูตัวอย่างการใช้งานที่ซับซ้อนกว่านี้ในเอกสาร print("โมเดล LFM2.5-VL-3B พร้อมใช้งานแล้ว!")คุณสามารถค้นหาตัวอย่างการใช้งานเพิ่มเติม เช่น การประมวลผลภาพหลายภาพ, การระบุตำแหน่งวัตถุ, OCR, การเรียกใช้เครื่องมือ และอื่นๆ อีกมากมาย ได้ใน เอกสารประกอบ ของเรา หรือชมวิดีโอสาธิตใน Release Blogลองสัมผัสประสบการณ์ใช้งานจริงได้ที่ WebGPU demo ที่ให้คุณสามารถอัปโหลดภาพหลายภาพและให้โมเดลโต้ตอบกับภาพเหล่านั้น รวมถึงการใช้งาน Grounding, OCR และ Tool Use ได้โดยตรงในเบราว์เซอร์ของคุณ โดยไม่ต้องติดตั้งอะไรเพิ่มเติมLFM2.5-VL-3B พร้อมให้ใช้งานแล้วบน Hugging Face!ด้วย LFM2.5 เรากำลังส่งมอบวิสัยทัศน์ของ AI ที่สามารถทำงานได้ทุกที่ (AI that runs anywhere) โมเดลเหล่านี้:ดาวน์โหลด: LFM2.5-VL-3B บน Hugging Faceทดลอง: ลองใช้ WebGPU demo ในเบราว์เซอร์ของคุณFine-tune: ปรับแต่ง LFM2.5-VL-3B ให้เหมาะกับงานของคุณด้วยบทช่วยสอน Fine-tuningเราตื่นเต้นที่จะได้เห็นสิ่งที่คุณจะสร้างสรรค์ขึ้นมา!#AI #VisionLanguage #EdgeAI #HuggingFace #LiquidAIhttps://huggingface.co/blog/LiquidAI/lfm2-5-vl-3b
5 Σχόλια 0 Μοιράστηκε 1χλμ. Views 0 Προεπισκόπηση