Muse Glimmer: โมเดล Multimodal แบบ Open-Source จาก Meta ที่ทำงานบนเครื่องของคุณได้ 🚀

Meta กลับมาอีกครั้งพร้อมกับ Muse Glimmer โมเดลปัญญาประดิษฐ์แบบ Multimodal ที่มีความสามารถรอบด้าน ทั้งการทำงานแบบ Local, Agentic, Multimodal และที่สำคัญคือเป็น Open-Source ทำให้ทุกคนเข้าถึงและใช้งานได้อย่างอิสระ เพื่อเฉลิมฉลองการเปิดตัวครั้งนี้ Hugging Face ได้ผนึกกำลังกับไลบรารีชั้นนำอย่าง transformers, llama.cpp, vLLM, Inference Endpoints และอื่น ๆ เพื่อมอบประสบการณ์ที่ดีที่สุดให้กับผู้ใช้งาน

Muse Glimmer คืออะไร?

Muse Glimmer เป็นโมเดลภาษาขนาดใหญ่ (Large Language Model - LLM) ที่มีพารามิเตอร์ถึง 30 พันล้านตัว โดยแบ่งสถาปัตยกรรมออกเป็น 2 ส่วนหลักคือ:

  • Perception Encoder: เป็นส่วนเข้ารหัสภาพ (Vision Encoder) แบบ ViT-style ขนาด 2 พันล้านพารามิเตอร์ ที่ทำหน้าที่รับข้อมูลภาพและวิดีโอ
  • Text Decoder: เป็นส่วนถอดรหัสข้อความขนาด 28 พันล้านพารามิเตอร์ ซึ่งทำงานร่วมกับ Perception Encoder เพื่อประมวลผลและสร้างผลลัพธ์

นอกจากนี้ Muse Glimmer ยังมาพร้อมกับ Speculative Decoding Drafter ที่พัฒนาบน DFlash ซึ่งช่วยเร่งความเร็วในการสร้างข้อความได้อย่างมาก โดยเฉพาะอย่างยิ่งเมื่อต้องสร้างเนื้อหาที่มีโครงสร้าง เช่น โค้ดโปรแกรม

สถาปัตยกรรมที่น่าสนใจของ Muse Glimmer

Muse Glimmer โดดเด่นด้วยสถาปัตยกรรมที่ออกแบบมาเพื่อประสิทธิภาพและความสามารถที่เหนือกว่า:

1. Hybrid Attention 🧠

ผสมผสานระหว่าง Sliding Window Attention (SWA) 3 ชั้น (ขนาด 2,048 โทเค็น) ที่ใช้ Rotary Position Embedding (RoPE) สลับกับ Full Attention 1 ชั้น ที่ใช้ No Positional Embedding (NoPE) รูปแบบ (SWA, SWA, SWA, Full) ถูกทำซ้ำ 13 ครั้ง รวมเป็น 52 ชั้น ช่วยให้โมเดลรักษาลำดับและความสัมพันธ์ของข้อมูลในระยะใกล้และไกลได้ดี

2. Gated Grouped-Query Attention ⚡

แต่ละ Key-Value Head ถูกแชร์โดย Query Head ถึง 16 หัว ช่วยลดการใช้หน่วยความจำของ KV-cache ลงถึง 16 เท่า ทำให้การสร้างข้อความรวดเร็วและประหยัดค่าใช้จ่ายมากขึ้น

3. Q-K Normalization with Extra Query Scaling 🎯

ก่อนการคำนวณ Attention โมเดลจะใช้ RMS Normalization กับ Query และ Key Head เพื่อรักษาเสถียรภาพของ Attention Logits จากนั้น Query จะถูกคูณด้วยสเกลแฟกเตอร์ เพื่อตั้งค่าเป้าหมายของ Logit Scale หลังจากการ Normalization ซึ่งมีผลคล้ายกับ Inverse Temperature ในระดับ Softmax

ความสามารถในการประมวลผลภาพและวิดีโอ

Muse Glimmer ใช้ Image Encoder ขนาดใหญ่ 2 พันล้านพารามิเตอร์ที่พัฒนาต่อยอดจากสถาปัตยกรรม Perception Encoder ของ Meta เพื่อรองรับทั้งภาพนิ่งและวิดีโอ:

  • การประมวลผลภาพ: ภาพจะถูกแบ่งเป็น Patch ขนาด 2 เฟรม x 3 ช่องสัญญาณ x 14 x 14 จากนั้นผ่าน Linear Layer เพื่อ Project เข้าสู่ Embedding Space และมีการใช้ Absolute Position Embedding ที่เรียนรู้จากตารางตำแหน่ง ก่อนส่งเข้า Vision Tower ที่มี 50 ชั้น และใช้ MLPs แบบ GELU สถาปัตยกรรม Attention ในส่วน Vision ก็ใช้รูปแบบ Hybrid Attention เช่นเดียวกับ Text Decoder
  • การประมวลผลวิดีโอ: วิดีโอจะถูกประมวลผลแบบเฟรมต่อเฟรม โดยมีการตั้งเป้าหมายที่ 2 เฟรมต่อวินาที และจำกัดความยาวคลิปสูงสุดที่ 96 เฟรม โมเดลจะสร้าง Timestamped Video Placeholders เพื่อแทรกข้อมูลวิดีโอเข้าไปในลำดับของข้อความ

การใช้งาน Muse Glimmer

1. การใช้งานผ่าน Hugging Face Transformers 📚

อัปเกรดไลบรารี transformers เป็นเวอร์ชันล่าสุด คุณสามารถโหลดโมเดลและ Processor ได้ง่าย ๆ ด้วยคลาส AutoModelForMultimodalLM และ AutoProcessor รองรับการทำงานบน GPU หลากหลายค่าย (NVIDIA, AMD, Intel) ด้วย device_map="auto"

ตัวอย่างการใช้งาน Text-Only Inference:

from transformers import AutoModelForMultimodalLM, AutoProcessor

model = AutoModelForMultimodalLM.from_pretrained("meta-llama/muse-glimmer-30b")
processor = AutoProcessor.from_pretrained("meta-llama/muse-glimmer-30b")

การ Prompt ด้วยภาพและข้อความ:

from PIL import Image
import requests

url = "..."
# URL ของรูปภาพ
image = Image.open(requests.get(url, stream=True).raw)
prompt = "What is in this image?"

inputs = processor(text=prompt, images=image, return_tensors="pt")
outputs = model.generate(**inputs)
print(processor.decode(outputs[0], skip_special_tokens=True))

การใช้งานกับวิดีโอ (แนะนำให้ติดตั้ง torchcodec):

# ตัวอย่างการทำ Video Inference
# (โค้ดตัวอย่างจะคล้ายกับการทำ Image Inference แต่ใช้ข้อมูลวิดีโอ)

2. การใช้งานผ่าน llama.cpp 🖥️

Muse Glimmer รองรับการทำงานแบบ Local ด้วย llama.cpp โดยมี Pre-calibrated Quants จาก Meta และ Unsloth รวมถึงรองรับ Speculative Decoding ด้วย DFlash

การติดตั้ง llama.cpp:

git clone ขอบคุณ แหล่งข้อมูล
https://github.com/ggerganov/llama.cpp.git
cd llama.cpp
make

การเริ่ม Server:

./server -m path/to/your/model.gguf --port 8080

จากนั้นสามารถเข้าใช้งานผ่าน WebUI ที่ localhost:8080 หรือ Query ผ่าน API ได้

3. Speculative Decoding (DFlash) ⚡

เทคนิคนี้ช่วยเร่งความเร็วในการสร้างข้อความได้อย่างมาก โดย DFlash Drafter จะช่วยเสนอ Token ล่วงหน้า Muse Glimmer รองรับ DFlash ทั้งใน transformers และ llama.cpp

การใช้งาน Speculative Decoding กับ transformers:

# โหลด Drafter และ Model พร้อมกัน
# ...
# ใช้ parameter เพิ่มเติมในการ generate

การใช้งาน Speculative Decoding กับ llama.cpp:

./server -m path/to/your/model.gguf --port 8080 --spec-draft-n-max 15

--spec-draft-n-max ควบคุมจำนวน Token ที่ DFlash เสนอ โดยค่าที่เหมาะสมคือ 15 (1 anchor token + 15 proposed tokens)

4. Hugging Face Inference Endpoints ☁️

สำหรับผู้ที่ต้องการใช้งานแบบ Managed และ Auto-scaling สามารถใช้ Muse Glimmer 30B บน Inference Endpoints ได้ โดยเลือกตั้งค่าตามต้องการ และใช้งานผ่าน OpenAI-compatible Chat Completions API

ความสามารถขั้นสูง: Multimodal Tool Calling และ Agentic Capabilities 🤖

Muse Glimmer ไม่ได้จำกัดอยู่แค่การตอบคำถามทั่วไป แต่ยังสามารถ:

  • Multimodal Tool Calling: เรียกใช้เครื่องมือต่าง ๆ โดยอิงจากข้อมูลภาพและข้อความ เช่น เรียกใช้ Weather Tool จากข้อมูลเมืองในภาพ
  • Open-ended Object Detection: ตรวจจับวัตถุในภาพได้อย่างอิสระ
  • Agentic Capabilities: ความสามารถในการทำงานอัตโนมัติ เช่น
  • Quantize itself: ค้นหาและโหลดเวอร์ชัน Quantized ของโมเดลเอง เพื่อประหยัดทรัพยากร
  • Deploy itself: Deploy ตัวเองไปยัง Hugging Face Inference Endpoints
  • Optimize itself: ปรับแต่ง Inference Engine ให้เหมาะสมกับ Hardware เฉพาะ (เช่น Nvidia H100)
  • Research the Hub: ทำหน้าที่เป็น Research Agent ค้นหาข้อมูลบน Hugging Face Hub (Models, Datasets, Spaces, Papers)

สรุป

Muse Glimmer คือก้าวสำคัญของ Meta ในวงการ AI แบบ Open-Source ที่มอบโมเดล Multimodal ทรงพลัง สามารถทำงานได้หลากหลายรูปแบบ ทั้งบนเครื่องของคุณเอง (Local) หรือผ่าน Cloud Services ด้วยความสามารถที่รอบด้าน ทั้งการประมวลผลภาพ วิดีโอ การเขียนโค้ด และการทำงานแบบ Agentic ทำให้ Muse Glimmer เป็นเครื่องมือที่น่าจับตามองสำหรับนักพัฒนาและผู้ที่สนใจ AI

#MuseGlimmer #MetaAI #OpenSource #Multimodal #LLM

ขอบคุณ แหล่งข้อมูล
https://huggingface.co/blog/muse-glimmer

Muse Glimmer: โมเดล Multimodal แบบ Open-Source จาก Meta ที่ทำงานบนเครื่องของคุณได้ 🚀Meta กลับมาอีกครั้งพร้อมกับ Muse Glimmer โมเดลปัญญาประดิษฐ์แบบ Multimodal ที่มีความสามารถรอบด้าน ทั้งการทำงานแบบ Local, Agentic, Multimodal และที่สำคัญคือเป็น Open-Source ทำให้ทุกคนเข้าถึงและใช้งานได้อย่างอิสระ เพื่อเฉลิมฉลองการเปิดตัวครั้งนี้ Hugging Face ได้ผนึกกำลังกับไลบรารีชั้นนำอย่าง transformers, llama.cpp, vLLM, Inference Endpoints และอื่น ๆ เพื่อมอบประสบการณ์ที่ดีที่สุดให้กับผู้ใช้งานMuse Glimmer คืออะไร?Muse Glimmer เป็นโมเดลภาษาขนาดใหญ่ (Large Language Model - LLM) ที่มีพารามิเตอร์ถึง 30 พันล้านตัว โดยแบ่งสถาปัตยกรรมออกเป็น 2 ส่วนหลักคือ:Perception Encoder: เป็นส่วนเข้ารหัสภาพ (Vision Encoder) แบบ ViT-style ขนาด 2 พันล้านพารามิเตอร์ ที่ทำหน้าที่รับข้อมูลภาพและวิดีโอText Decoder: เป็นส่วนถอดรหัสข้อความขนาด 28 พันล้านพารามิเตอร์ ซึ่งทำงานร่วมกับ Perception Encoder เพื่อประมวลผลและสร้างผลลัพธ์นอกจากนี้ Muse Glimmer ยังมาพร้อมกับ Speculative Decoding Drafter ที่พัฒนาบน DFlash ซึ่งช่วยเร่งความเร็วในการสร้างข้อความได้อย่างมาก โดยเฉพาะอย่างยิ่งเมื่อต้องสร้างเนื้อหาที่มีโครงสร้าง เช่น โค้ดโปรแกรมสถาปัตยกรรมที่น่าสนใจของ Muse GlimmerMuse Glimmer โดดเด่นด้วยสถาปัตยกรรมที่ออกแบบมาเพื่อประสิทธิภาพและความสามารถที่เหนือกว่า:1. Hybrid Attention 🧠ผสมผสานระหว่าง Sliding Window Attention (SWA) 3 ชั้น (ขนาด 2,048 โทเค็น) ที่ใช้ Rotary Position Embedding (RoPE) สลับกับ Full Attention 1 ชั้น ที่ใช้ No Positional Embedding (NoPE) รูปแบบ (SWA, SWA, SWA, Full) ถูกทำซ้ำ 13 ครั้ง รวมเป็น 52 ชั้น ช่วยให้โมเดลรักษาลำดับและความสัมพันธ์ของข้อมูลในระยะใกล้และไกลได้ดี2. Gated Grouped-Query Attention ⚡แต่ละ Key-Value Head ถูกแชร์โดย Query Head ถึง 16 หัว ช่วยลดการใช้หน่วยความจำของ KV-cache ลงถึง 16 เท่า ทำให้การสร้างข้อความรวดเร็วและประหยัดค่าใช้จ่ายมากขึ้น3. Q-K Normalization with Extra Query Scaling 🎯ก่อนการคำนวณ Attention โมเดลจะใช้ RMS Normalization กับ Query และ Key Head เพื่อรักษาเสถียรภาพของ Attention Logits จากนั้น Query จะถูกคูณด้วยสเกลแฟกเตอร์ เพื่อตั้งค่าเป้าหมายของ Logit Scale หลังจากการ Normalization ซึ่งมีผลคล้ายกับ Inverse Temperature ในระดับ SoftmaxความสามารถในการประมวลผลภาพและวิดีโอMuse Glimmer ใช้ Image Encoder ขนาดใหญ่ 2 พันล้านพารามิเตอร์ที่พัฒนาต่อยอดจากสถาปัตยกรรม Perception Encoder ของ Meta เพื่อรองรับทั้งภาพนิ่งและวิดีโอ:การประมวลผลภาพ: ภาพจะถูกแบ่งเป็น Patch ขนาด 2 เฟรม x 3 ช่องสัญญาณ x 14 x 14 จากนั้นผ่าน Linear Layer เพื่อ Project เข้าสู่ Embedding Space และมีการใช้ Absolute Position Embedding ที่เรียนรู้จากตารางตำแหน่ง ก่อนส่งเข้า Vision Tower ที่มี 50 ชั้น และใช้ MLPs แบบ GELU สถาปัตยกรรม Attention ในส่วน Vision ก็ใช้รูปแบบ Hybrid Attention เช่นเดียวกับ Text Decoderการประมวลผลวิดีโอ: วิดีโอจะถูกประมวลผลแบบเฟรมต่อเฟรม โดยมีการตั้งเป้าหมายที่ 2 เฟรมต่อวินาที และจำกัดความยาวคลิปสูงสุดที่ 96 เฟรม โมเดลจะสร้าง Timestamped Video Placeholders เพื่อแทรกข้อมูลวิดีโอเข้าไปในลำดับของข้อความการใช้งาน Muse Glimmer1. การใช้งานผ่าน Hugging Face Transformers 📚อัปเกรดไลบรารี transformers เป็นเวอร์ชันล่าสุด คุณสามารถโหลดโมเดลและ Processor ได้ง่าย ๆ ด้วยคลาส AutoModelForMultimodalLM และ AutoProcessor รองรับการทำงานบน GPU หลากหลายค่าย (NVIDIA, AMD, Intel) ด้วย device_map="auto"ตัวอย่างการใช้งาน Text-Only Inference:from transformers import AutoModelForMultimodalLM, AutoProcessor model = AutoModelForMultimodalLM.from_pretrained("meta-llama/muse-glimmer-30b") processor = AutoProcessor.from_pretrained("meta-llama/muse-glimmer-30b")การ Prompt ด้วยภาพและข้อความ:from PIL import Image import requests url = "..." # URL ของรูปภาพ image = Image.open(requests.get(url, stream=True).raw) prompt = "What is in this image?" inputs = processor(text=prompt, images=image, return_tensors="pt") outputs = model.generate(**inputs) print(processor.decode(outputs[0], skip_special_tokens=True))การใช้งานกับวิดีโอ (แนะนำให้ติดตั้ง torchcodec):# ตัวอย่างการทำ Video Inference # (โค้ดตัวอย่างจะคล้ายกับการทำ Image Inference แต่ใช้ข้อมูลวิดีโอ)2. การใช้งานผ่าน llama.cpp 🖥️Muse Glimmer รองรับการทำงานแบบ Local ด้วย llama.cpp โดยมี Pre-calibrated Quants จาก Meta และ Unsloth รวมถึงรองรับ Speculative Decoding ด้วย DFlashการติดตั้ง llama.cpp:git clone https://github.com/ggerganov/llama.cpp.git cd llama.cpp makeการเริ่ม Server:./server -m path/to/your/model.gguf --port 8080จากนั้นสามารถเข้าใช้งานผ่าน WebUI ที่ localhost:8080 หรือ Query ผ่าน API ได้3. Speculative Decoding (DFlash) ⚡เทคนิคนี้ช่วยเร่งความเร็วในการสร้างข้อความได้อย่างมาก โดย DFlash Drafter จะช่วยเสนอ Token ล่วงหน้า Muse Glimmer รองรับ DFlash ทั้งใน transformers และ llama.cppการใช้งาน Speculative Decoding กับ transformers:# โหลด Drafter และ Model พร้อมกัน # ... # ใช้ parameter เพิ่มเติมในการ generateการใช้งาน Speculative Decoding กับ llama.cpp:./server -m path/to/your/model.gguf --port 8080 --spec-draft-n-max 15--spec-draft-n-max ควบคุมจำนวน Token ที่ DFlash เสนอ โดยค่าที่เหมาะสมคือ 15 (1 anchor token + 15 proposed tokens)4. Hugging Face Inference Endpoints ☁️สำหรับผู้ที่ต้องการใช้งานแบบ Managed และ Auto-scaling สามารถใช้ Muse Glimmer 30B บน Inference Endpoints ได้ โดยเลือกตั้งค่าตามต้องการ และใช้งานผ่าน OpenAI-compatible Chat Completions APIความสามารถขั้นสูง: Multimodal Tool Calling และ Agentic Capabilities 🤖Muse Glimmer ไม่ได้จำกัดอยู่แค่การตอบคำถามทั่วไป แต่ยังสามารถ:Multimodal Tool Calling: เรียกใช้เครื่องมือต่าง ๆ โดยอิงจากข้อมูลภาพและข้อความ เช่น เรียกใช้ Weather Tool จากข้อมูลเมืองในภาพOpen-ended Object Detection: ตรวจจับวัตถุในภาพได้อย่างอิสระAgentic Capabilities: ความสามารถในการทำงานอัตโนมัติ เช่นQuantize itself: ค้นหาและโหลดเวอร์ชัน Quantized ของโมเดลเอง เพื่อประหยัดทรัพยากรDeploy itself: Deploy ตัวเองไปยัง Hugging Face Inference EndpointsOptimize itself: ปรับแต่ง Inference Engine ให้เหมาะสมกับ Hardware เฉพาะ (เช่น Nvidia H100)Research the Hub: ทำหน้าที่เป็น Research Agent ค้นหาข้อมูลบน Hugging Face Hub (Models, Datasets, Spaces, Papers)สรุปMuse Glimmer คือก้าวสำคัญของ Meta ในวงการ AI แบบ Open-Source ที่มอบโมเดล Multimodal ทรงพลัง สามารถทำงานได้หลากหลายรูปแบบ ทั้งบนเครื่องของคุณเอง (Local) หรือผ่าน Cloud Services ด้วยความสามารถที่รอบด้าน ทั้งการประมวลผลภาพ วิดีโอ การเขียนโค้ด และการทำงานแบบ Agentic ทำให้ Muse Glimmer เป็นเครื่องมือที่น่าจับตามองสำหรับนักพัฒนาและผู้ที่สนใจ AI#MuseGlimmer #MetaAI #OpenSource #Multimodal #LLMhttps://huggingface.co/blog/muse-glimmer
Shared content
HUGGINGFACE.CO
Meta is back with Muse Glimmer: local, agentic, multimodal, and open source
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
6 Σχόλια 0 Μοιράστηκε 263 Views 0 Προεπισκόπηση