NeoMME: ตัวเข้ารหัสหลายภาษาและหลายรูปแบบที่ทรงประสิทธิภาพ

ในยุคที่ข้อมูลมีหลากหลายรูปแบบ ทั้งข้อความ รูปภาพ หรือแม้แต่เอกสารที่ซับซ้อน การประมวลผลและทำความเข้าใจข้อมูลเหล่านี้ให้ได้อย่างมีประสิทธิภาพเป็นสิ่งสำคัญอย่างยิ่ง โดยเฉพาะอย่างยิ่งในงานที่ต้องการความแม่นยำสูง เช่น การค้นหาข้อมูลจากเอกสาร การวิเคราะห์เอกสาร หรือแม้แต่การสร้างระบบถาม-ตอบที่ซับซ้อน

H Company ได้เปิดตัว NeoMME ซึ่งเป็นตระกูลของตัวเข้ารหัส (Encoder) แบบหลายภาษาและหลายรูปแบบ (Multimodal) ที่ออกแบบมาเพื่อตอบโจทย์เหล่านี้โดยเฉพาะ ด้วยสถาปัตยกรรมที่แตกต่างและวิธีการฝึกฝนที่ทันสมัย NeoMME มุ่งมั่นที่จะมอบประสิทธิภาพและความยืดหยุ่นในการประมวลผลข้อมูลที่เหนือกว่า

NeoMME คืออะไร?

NeoMME (อ่านว่า "นี-โอ-มี") ไม่ใช่แค่ตัวเข้ารหัสทั่วไป แต่เป็น Multimodal-native and Multilingual Encoder ที่ถูกสร้างขึ้นมาใหม่ทั้งหมด โดยไม่ได้อาศัยโมเดลที่ฝึกฝนไว้ล่วงหน้า (Pretrained) แยกส่วนสำหรับส่วนการมองเห็น (Vision Tower) หรือโมเดลภาษาแบบถดถอย (Causal Language Model)

หัวใจสำคัญของ NeoMME คือการใช้ Transformer Encoder ตัวเดียว ในการประมวลผลทั้งโทเค็นข้อความและส่วนของภาพ (Image Patches) โดยตรง ทำให้โมเดลสามารถเรียนรู้ความสัมพันธ์ระหว่างข้อความและภาพได้อย่างลึกซึ้งและมีประสิทธิภาพมากกว่า

จุดเด่นที่ทำให้ NeoMME แตกต่าง

1. สถาปัตยกรรมแบบ Multimodal-native

  • Transformer ตัวเดียวสำหรับทุกอย่าง: NeoMME ใช้ Transformer Encoder เพียงตัวเดียวในการประมวลผลทั้งข้อความและภาพ ทำให้การทำงานร่วมกันระหว่างสองรูปแบบข้อมูลเป็นไปอย่างราบรื่น ลดความซับซ้อนของสถาปัตยกรรม และเพิ่มประสิทธิภาพในการประมวลผล
  • การประมวลผลอินพุตแบบ Native: ข้อความจะถูกแปลงเป็นโทเค็น ส่วนภาพจะถูกแบ่งออกเป็นกลุ่มพิกเซล (Patches) ขนาด 32x32 และประมวลผลด้วย MLP ขนาดเล็ก ก่อนจะเข้าสู่ Transformer Encoder เดียวกัน
  • รองรับความละเอียดภาพแบบ Dynamic: โมเดลสามารถจัดการกับภาพที่มีขนาดและอัตราส่วนต่างกันได้อย่างยืดหยุ่น ช่วยให้สามารถจับรายละเอียดในเอกสารความละเอียดสูงได้อย่างเต็มที่

2. การฝึกฝนด้วย Masked Discrete-Diffusion Objective

NeoMME ถูกฝึกฝนตั้งแต่ต้น (From Scratch) ด้วยเทคนิค Masked Discrete-Diffusion ซึ่งแตกต่างจากการใช้โมเดลภาษาขนาดใหญ่ (LLMs) ทั่วไป โดยเฉพาะอย่างยิ่งในการประมวลผลเอกสาร

  • การเรียนรู้จากภาพผ่านการปิดบังข้อความ: ในระหว่างการฝึก โมเดลจะถูกฝึกให้ "เติมคำ" ที่หายไป โดยอาศัยบริบทจากข้อความที่เหลือและข้อมูลภาพ การปิดบังข้อความในระดับสูงจะบังคับให้โมเดลต้องเรียนรู้ที่จะอธิบายภาพ โดยอาศัยสัญญาณจากภาพเป็นหลัก
  • ข้อมูลการฝึกที่หลากหลาย: โมเดลได้รับการฝึกฝนด้วยข้อมูลทั้งข้อความหลายภาษา โค้ด คณิตศาสตร์ ภาพธรรมชาติ และภาพเอกสาร ทำให้มีความสามารถในการเข้าใจข้อมูลที่หลากหลาย

3. ประสิทธิภาพสูงในการดึงข้อมูลเอกสาร (Visual Document Retrieval)

NeoMME-Retriever ซึ่งเป็นเวอร์ชันที่ปรับแต่ง (Fine-tuned) สำหรับการดึงข้อมูลเอกสารโดยเฉพาะ มีจุดเด่นที่น่าสนใจดังนี้:

  • การสร้าง Embeddings แบบคู่: NeoMME-Retriever สามารถสร้าง Dense Embeddings และ Late-Interaction Embeddings ได้พร้อมกันในขั้นตอนเดียว ให้ความยืดหยุ่นในการใช้งาน
  • Dense Embeddings: เหมาะสำหรับการค้นหาแบบรวดเร็วด้วยเทคนิค Approximate Nearest Neighbor (ANN)
  • Late-Interaction Embeddings: ให้ความแม่นยำสูงขึ้น โดยพิจารณาความสัมพันธ์ระหว่างส่วนย่อยๆ ของข้อความและภาพ
  • ความเร็วในการประมวลผล: ที่ขนาดอินพุต 2048x2048 บน GPU NVIDIA L40S โมเดล NeoMME-Retriever ขนาด 260M สามารถประมวลผลได้ประมาณ 51 หน้าต่อวินาที ซึ่งเร็วกว่าโมเดลอื่น ๆ ที่มีขนาดใกล้เคียงกัน
  • การลดขนาดพื้นที่จัดเก็บ Late-Interaction Embeddings: ด้วยเทคนิค Hierarchical Token Pooling และ Asymmetric Quantization ทำให้พื้นที่จัดเก็บสำหรับ Late-Interaction Embeddings ลดลงอย่างมหาศาล (จาก 1.5 MB เหลือเพียง 6 kB ต่อหน้า) โดยยังคงรักษาคุณภาพการค้นหาไว้ได้มากกว่า 95%

4. ความสามารถรอบด้าน

  • รองรับหลายภาษา: NeoMME ถูกฝึกฝนด้วยชุดข้อมูลข้อความหลายภาษา ทำให้สามารถประมวลผลและสร้าง Embeddings สำหรับภาษาต่างๆ ได้
  • ความยืดหยุ่นในการนำไปใช้: สามารถนำไปใช้ได้ทั้งในงาน Visual Document Retrieval, การสร้างระบบ Visual RAG (Retrieval-Augmented Generation) หรือแม้แต่งานอื่นๆ ที่ต้องการการประมวลผลข้อมูลหลายรูปแบบ

NeoMME เหมาะกับใคร?

NeoMME เหมาะสำหรับนักพัฒนา นักวิจัย หรือองค์กรที่ต้องการ:

  • ระบบค้นหาข้อมูลจากเอกสารที่รวดเร็วและแม่นยำ
  • การประมวลผลเอกสารที่ซับซ้อน โดยคำนึงถึง Layout, ตาราง, กราฟ และองค์ประกอบภาพ
  • โมเดลที่สามารถเข้าใจและประมวลผลข้อมูลได้ทั้งข้อความและรูปภาพไปพร้อมกัน
  • โซลูชันที่ลดภาระด้านการประมวลผลและพื้นที่จัดเก็บข้อมูล
  • การสร้างระบบ AI ที่มีความสามารถในการอ่านและทำความเข้าใจเอกสาร

การเข้าถึงและใช้งาน

NeoMME พร้อมใช้งานบน Hugging Face Transformers และโมเดลทั้งหมดถูกปล่อยภายใต้ Apache 2.0 License ทำให้สามารถนำไปใช้งานและพัฒนาต่อยอดได้อย่างอิสระ

NeoMME เป็นก้าวสำคัญในการพัฒนาโมเดลประมวลผลข้อมูลหลายรูปแบบ ที่ไม่เพียงแต่มีประสิทธิภาพสูง แต่ยังมีความยืดหยุ่นและสามารถนำไปปรับใช้กับงานที่หลากหลายได้อย่างลงตัว

#NeoMME #MultimodalAI #NaturalLanguageProcessing #ComputerVision #DocumentRetrieval

ขอบคุณ แหล่งข้อมูล
https://huggingface.co/blog/Hcompany/neomme

NeoMME: ตัวเข้ารหัสหลายภาษาและหลายรูปแบบที่ทรงประสิทธิภาพในยุคที่ข้อมูลมีหลากหลายรูปแบบ ทั้งข้อความ รูปภาพ หรือแม้แต่เอกสารที่ซับซ้อน การประมวลผลและทำความเข้าใจข้อมูลเหล่านี้ให้ได้อย่างมีประสิทธิภาพเป็นสิ่งสำคัญอย่างยิ่ง โดยเฉพาะอย่างยิ่งในงานที่ต้องการความแม่นยำสูง เช่น การค้นหาข้อมูลจากเอกสาร การวิเคราะห์เอกสาร หรือแม้แต่การสร้างระบบถาม-ตอบที่ซับซ้อนH Company ได้เปิดตัว NeoMME ซึ่งเป็นตระกูลของตัวเข้ารหัส (Encoder) แบบหลายภาษาและหลายรูปแบบ (Multimodal) ที่ออกแบบมาเพื่อตอบโจทย์เหล่านี้โดยเฉพาะ ด้วยสถาปัตยกรรมที่แตกต่างและวิธีการฝึกฝนที่ทันสมัย NeoMME มุ่งมั่นที่จะมอบประสิทธิภาพและความยืดหยุ่นในการประมวลผลข้อมูลที่เหนือกว่าNeoMME คืออะไร?NeoMME (อ่านว่า "นี-โอ-มี") ไม่ใช่แค่ตัวเข้ารหัสทั่วไป แต่เป็น Multimodal-native and Multilingual Encoder ที่ถูกสร้างขึ้นมาใหม่ทั้งหมด โดยไม่ได้อาศัยโมเดลที่ฝึกฝนไว้ล่วงหน้า (Pretrained) แยกส่วนสำหรับส่วนการมองเห็น (Vision Tower) หรือโมเดลภาษาแบบถดถอย (Causal Language Model)หัวใจสำคัญของ NeoMME คือการใช้ Transformer Encoder ตัวเดียว ในการประมวลผลทั้งโทเค็นข้อความและส่วนของภาพ (Image Patches) โดยตรง ทำให้โมเดลสามารถเรียนรู้ความสัมพันธ์ระหว่างข้อความและภาพได้อย่างลึกซึ้งและมีประสิทธิภาพมากกว่าจุดเด่นที่ทำให้ NeoMME แตกต่าง1. สถาปัตยกรรมแบบ Multimodal-nativeTransformer ตัวเดียวสำหรับทุกอย่าง: NeoMME ใช้ Transformer Encoder เพียงตัวเดียวในการประมวลผลทั้งข้อความและภาพ ทำให้การทำงานร่วมกันระหว่างสองรูปแบบข้อมูลเป็นไปอย่างราบรื่น ลดความซับซ้อนของสถาปัตยกรรม และเพิ่มประสิทธิภาพในการประมวลผลการประมวลผลอินพุตแบบ Native: ข้อความจะถูกแปลงเป็นโทเค็น ส่วนภาพจะถูกแบ่งออกเป็นกลุ่มพิกเซล (Patches) ขนาด 32x32 และประมวลผลด้วย MLP ขนาดเล็ก ก่อนจะเข้าสู่ Transformer Encoder เดียวกันรองรับความละเอียดภาพแบบ Dynamic: โมเดลสามารถจัดการกับภาพที่มีขนาดและอัตราส่วนต่างกันได้อย่างยืดหยุ่น ช่วยให้สามารถจับรายละเอียดในเอกสารความละเอียดสูงได้อย่างเต็มที่2. การฝึกฝนด้วย Masked Discrete-Diffusion ObjectiveNeoMME ถูกฝึกฝนตั้งแต่ต้น (From Scratch) ด้วยเทคนิค Masked Discrete-Diffusion ซึ่งแตกต่างจากการใช้โมเดลภาษาขนาดใหญ่ (LLMs) ทั่วไป โดยเฉพาะอย่างยิ่งในการประมวลผลเอกสารการเรียนรู้จากภาพผ่านการปิดบังข้อความ: ในระหว่างการฝึก โมเดลจะถูกฝึกให้ "เติมคำ" ที่หายไป โดยอาศัยบริบทจากข้อความที่เหลือและข้อมูลภาพ การปิดบังข้อความในระดับสูงจะบังคับให้โมเดลต้องเรียนรู้ที่จะอธิบายภาพ โดยอาศัยสัญญาณจากภาพเป็นหลักข้อมูลการฝึกที่หลากหลาย: โมเดลได้รับการฝึกฝนด้วยข้อมูลทั้งข้อความหลายภาษา โค้ด คณิตศาสตร์ ภาพธรรมชาติ และภาพเอกสาร ทำให้มีความสามารถในการเข้าใจข้อมูลที่หลากหลาย3. ประสิทธิภาพสูงในการดึงข้อมูลเอกสาร (Visual Document Retrieval)NeoMME-Retriever ซึ่งเป็นเวอร์ชันที่ปรับแต่ง (Fine-tuned) สำหรับการดึงข้อมูลเอกสารโดยเฉพาะ มีจุดเด่นที่น่าสนใจดังนี้:การสร้าง Embeddings แบบคู่: NeoMME-Retriever สามารถสร้าง Dense Embeddings และ Late-Interaction Embeddings ได้พร้อมกันในขั้นตอนเดียว ให้ความยืดหยุ่นในการใช้งานDense Embeddings: เหมาะสำหรับการค้นหาแบบรวดเร็วด้วยเทคนิค Approximate Nearest Neighbor (ANN)Late-Interaction Embeddings: ให้ความแม่นยำสูงขึ้น โดยพิจารณาความสัมพันธ์ระหว่างส่วนย่อยๆ ของข้อความและภาพความเร็วในการประมวลผล: ที่ขนาดอินพุต 2048x2048 บน GPU NVIDIA L40S โมเดล NeoMME-Retriever ขนาด 260M สามารถประมวลผลได้ประมาณ 51 หน้าต่อวินาที ซึ่งเร็วกว่าโมเดลอื่น ๆ ที่มีขนาดใกล้เคียงกันการลดขนาดพื้นที่จัดเก็บ Late-Interaction Embeddings: ด้วยเทคนิค Hierarchical Token Pooling และ Asymmetric Quantization ทำให้พื้นที่จัดเก็บสำหรับ Late-Interaction Embeddings ลดลงอย่างมหาศาล (จาก 1.5 MB เหลือเพียง 6 kB ต่อหน้า) โดยยังคงรักษาคุณภาพการค้นหาไว้ได้มากกว่า 95%4. ความสามารถรอบด้านรองรับหลายภาษา: NeoMME ถูกฝึกฝนด้วยชุดข้อมูลข้อความหลายภาษา ทำให้สามารถประมวลผลและสร้าง Embeddings สำหรับภาษาต่างๆ ได้ความยืดหยุ่นในการนำไปใช้: สามารถนำไปใช้ได้ทั้งในงาน Visual Document Retrieval, การสร้างระบบ Visual RAG (Retrieval-Augmented Generation) หรือแม้แต่งานอื่นๆ ที่ต้องการการประมวลผลข้อมูลหลายรูปแบบNeoMME เหมาะกับใคร?NeoMME เหมาะสำหรับนักพัฒนา นักวิจัย หรือองค์กรที่ต้องการ:ระบบค้นหาข้อมูลจากเอกสารที่รวดเร็วและแม่นยำการประมวลผลเอกสารที่ซับซ้อน โดยคำนึงถึง Layout, ตาราง, กราฟ และองค์ประกอบภาพโมเดลที่สามารถเข้าใจและประมวลผลข้อมูลได้ทั้งข้อความและรูปภาพไปพร้อมกันโซลูชันที่ลดภาระด้านการประมวลผลและพื้นที่จัดเก็บข้อมูลการสร้างระบบ AI ที่มีความสามารถในการอ่านและทำความเข้าใจเอกสารการเข้าถึงและใช้งานNeoMME พร้อมใช้งานบน Hugging Face Transformers และโมเดลทั้งหมดถูกปล่อยภายใต้ Apache 2.0 License ทำให้สามารถนำไปใช้งานและพัฒนาต่อยอดได้อย่างอิสระNeoMME เป็นก้าวสำคัญในการพัฒนาโมเดลประมวลผลข้อมูลหลายรูปแบบ ที่ไม่เพียงแต่มีประสิทธิภาพสูง แต่ยังมีความยืดหยุ่นและสามารถนำไปปรับใช้กับงานที่หลากหลายได้อย่างลงตัว#NeoMME #MultimodalAI #NaturalLanguageProcessing #ComputerVision #DocumentRetrievalhttps://huggingface.co/blog/Hcompany/neomme
2 Comentários 0 Compartilhamentos 920 Visualizações 0 Anterior