NeoMME: ตัวเข้ารหัสหลายภาษาและหลายรูปแบบที่ทรงประสิทธิภาพ
ในยุคที่ข้อมูลมีหลากหลายรูปแบบ ทั้งข้อความ รูปภาพ หรือแม้แต่เอกสารที่ซับซ้อน การประมวลผลและทำความเข้าใจข้อมูลเหล่านี้ให้ได้อย่างมีประสิทธิภาพเป็นสิ่งสำคัญอย่างยิ่ง โดยเฉพาะอย่างยิ่งในงานที่ต้องการความแม่นยำสูง เช่น การค้นหาข้อมูลจากเอกสาร การวิเคราะห์เอกสาร หรือแม้แต่การสร้างระบบถาม-ตอบที่ซับซ้อน
H Company ได้เปิดตัว NeoMME ซึ่งเป็นตระกูลของตัวเข้ารหัส (Encoder) แบบหลายภาษาและหลายรูปแบบ (Multimodal) ที่ออกแบบมาเพื่อตอบโจทย์เหล่านี้โดยเฉพาะ ด้วยสถาปัตยกรรมที่แตกต่างและวิธีการฝึกฝนที่ทันสมัย NeoMME มุ่งมั่นที่จะมอบประสิทธิภาพและความยืดหยุ่นในการประมวลผลข้อมูลที่เหนือกว่า
NeoMME คืออะไร?
NeoMME (อ่านว่า "นี-โอ-มี") ไม่ใช่แค่ตัวเข้ารหัสทั่วไป แต่เป็น Multimodal-native and Multilingual Encoder ที่ถูกสร้างขึ้นมาใหม่ทั้งหมด โดยไม่ได้อาศัยโมเดลที่ฝึกฝนไว้ล่วงหน้า (Pretrained) แยกส่วนสำหรับส่วนการมองเห็น (Vision Tower) หรือโมเดลภาษาแบบถดถอย (Causal Language Model)
หัวใจสำคัญของ NeoMME คือการใช้ Transformer Encoder ตัวเดียว ในการประมวลผลทั้งโทเค็นข้อความและส่วนของภาพ (Image Patches) โดยตรง ทำให้โมเดลสามารถเรียนรู้ความสัมพันธ์ระหว่างข้อความและภาพได้อย่างลึกซึ้งและมีประสิทธิภาพมากกว่า
จุดเด่นที่ทำให้ NeoMME แตกต่าง
1. สถาปัตยกรรมแบบ Multimodal-native
- Transformer ตัวเดียวสำหรับทุกอย่าง: NeoMME ใช้ Transformer Encoder เพียงตัวเดียวในการประมวลผลทั้งข้อความและภาพ ทำให้การทำงานร่วมกันระหว่างสองรูปแบบข้อมูลเป็นไปอย่างราบรื่น ลดความซับซ้อนของสถาปัตยกรรม และเพิ่มประสิทธิภาพในการประมวลผล
- การประมวลผลอินพุตแบบ Native: ข้อความจะถูกแปลงเป็นโทเค็น ส่วนภาพจะถูกแบ่งออกเป็นกลุ่มพิกเซล (Patches) ขนาด 32x32 และประมวลผลด้วย MLP ขนาดเล็ก ก่อนจะเข้าสู่ Transformer Encoder เดียวกัน
- รองรับความละเอียดภาพแบบ Dynamic: โมเดลสามารถจัดการกับภาพที่มีขนาดและอัตราส่วนต่างกันได้อย่างยืดหยุ่น ช่วยให้สามารถจับรายละเอียดในเอกสารความละเอียดสูงได้อย่างเต็มที่
2. การฝึกฝนด้วย Masked Discrete-Diffusion Objective
NeoMME ถูกฝึกฝนตั้งแต่ต้น (From Scratch) ด้วยเทคนิค Masked Discrete-Diffusion ซึ่งแตกต่างจากการใช้โมเดลภาษาขนาดใหญ่ (LLMs) ทั่วไป โดยเฉพาะอย่างยิ่งในการประมวลผลเอกสาร
- การเรียนรู้จากภาพผ่านการปิดบังข้อความ: ในระหว่างการฝึก โมเดลจะถูกฝึกให้ "เติมคำ" ที่หายไป โดยอาศัยบริบทจากข้อความที่เหลือและข้อมูลภาพ การปิดบังข้อความในระดับสูงจะบังคับให้โมเดลต้องเรียนรู้ที่จะอธิบายภาพ โดยอาศัยสัญญาณจากภาพเป็นหลัก
- ข้อมูลการฝึกที่หลากหลาย: โมเดลได้รับการฝึกฝนด้วยข้อมูลทั้งข้อความหลายภาษา โค้ด คณิตศาสตร์ ภาพธรรมชาติ และภาพเอกสาร ทำให้มีความสามารถในการเข้าใจข้อมูลที่หลากหลาย
3. ประสิทธิภาพสูงในการดึงข้อมูลเอกสาร (Visual Document Retrieval)
NeoMME-Retriever ซึ่งเป็นเวอร์ชันที่ปรับแต่ง (Fine-tuned) สำหรับการดึงข้อมูลเอกสารโดยเฉพาะ มีจุดเด่นที่น่าสนใจดังนี้:
- การสร้าง Embeddings แบบคู่: NeoMME-Retriever สามารถสร้าง Dense Embeddings และ Late-Interaction Embeddings ได้พร้อมกันในขั้นตอนเดียว ให้ความยืดหยุ่นในการใช้งาน
- Dense Embeddings: เหมาะสำหรับการค้นหาแบบรวดเร็วด้วยเทคนิค Approximate Nearest Neighbor (ANN)
- Late-Interaction Embeddings: ให้ความแม่นยำสูงขึ้น โดยพิจารณาความสัมพันธ์ระหว่างส่วนย่อยๆ ของข้อความและภาพ
- ความเร็วในการประมวลผล: ที่ขนาดอินพุต 2048x2048 บน GPU NVIDIA L40S โมเดล NeoMME-Retriever ขนาด 260M สามารถประมวลผลได้ประมาณ 51 หน้าต่อวินาที ซึ่งเร็วกว่าโมเดลอื่น ๆ ที่มีขนาดใกล้เคียงกัน
- การลดขนาดพื้นที่จัดเก็บ Late-Interaction Embeddings: ด้วยเทคนิค Hierarchical Token Pooling และ Asymmetric Quantization ทำให้พื้นที่จัดเก็บสำหรับ Late-Interaction Embeddings ลดลงอย่างมหาศาล (จาก 1.5 MB เหลือเพียง 6 kB ต่อหน้า) โดยยังคงรักษาคุณภาพการค้นหาไว้ได้มากกว่า 95%
4. ความสามารถรอบด้าน
- รองรับหลายภาษา: NeoMME ถูกฝึกฝนด้วยชุดข้อมูลข้อความหลายภาษา ทำให้สามารถประมวลผลและสร้าง Embeddings สำหรับภาษาต่างๆ ได้
- ความยืดหยุ่นในการนำไปใช้: สามารถนำไปใช้ได้ทั้งในงาน Visual Document Retrieval, การสร้างระบบ Visual RAG (Retrieval-Augmented Generation) หรือแม้แต่งานอื่นๆ ที่ต้องการการประมวลผลข้อมูลหลายรูปแบบ
NeoMME เหมาะกับใคร?
NeoMME เหมาะสำหรับนักพัฒนา นักวิจัย หรือองค์กรที่ต้องการ:
- ระบบค้นหาข้อมูลจากเอกสารที่รวดเร็วและแม่นยำ
- การประมวลผลเอกสารที่ซับซ้อน โดยคำนึงถึง Layout, ตาราง, กราฟ และองค์ประกอบภาพ
- โมเดลที่สามารถเข้าใจและประมวลผลข้อมูลได้ทั้งข้อความและรูปภาพไปพร้อมกัน
- โซลูชันที่ลดภาระด้านการประมวลผลและพื้นที่จัดเก็บข้อมูล
- การสร้างระบบ AI ที่มีความสามารถในการอ่านและทำความเข้าใจเอกสาร
การเข้าถึงและใช้งาน
NeoMME พร้อมใช้งานบน Hugging Face Transformers และโมเดลทั้งหมดถูกปล่อยภายใต้ Apache 2.0 License ทำให้สามารถนำไปใช้งานและพัฒนาต่อยอดได้อย่างอิสระ
NeoMME เป็นก้าวสำคัญในการพัฒนาโมเดลประมวลผลข้อมูลหลายรูปแบบ ที่ไม่เพียงแต่มีประสิทธิภาพสูง แต่ยังมีความยืดหยุ่นและสามารถนำไปปรับใช้กับงานที่หลากหลายได้อย่างลงตัว
#NeoMME #MultimodalAI #NaturalLanguageProcessing #ComputerVision #DocumentRetrieval
ขอบคุณ แหล่งข้อมูล
https://huggingface.co/blog/Hcompany/neomme