Falcon-H1-Arabic: ก้าวข้ามขีดจำกัด AI ภาษาอาหรับ ด้วยสถาปัตยกรรมไฮบริดสุดล้ำ 🚀

การพัฒนาโมเดลภาษาอาหรับระดับโลกเป็นกระบวนการที่เต็มไปด้วยการเรียนรู้และปรับปรุงอย่างต่อเนื่อง วันนี้ เรามีความยินดีที่จะประกาศเปิดตัว Falcon-H1-Arabic ตระกูลโมเดลภาษาอาหรับที่ทันสมัยที่สุดของเรา ซึ่งแสดงถึงความก้าวหน้าครั้งสำคัญทั้งในด้านสถาปัตยกรรมและความสามารถ การเปิดตัวครั้งนี้เกิดจากการวิจัยหลายเดือน การรับฟังความคิดเห็นจากชุมชน และนวัตกรรมทางเทคนิค เพื่อสร้างสรรค์โมเดลทรงพลัง 3 แบบ ที่จะมากำหนดมาตรฐานใหม่สำหรับการประมวลผลภาษาธรรมชาติของภาษาอาหรับ

จาก Falcon-Arabic สู่ Falcon-H1-Arabic: การต่อยอดความสำเร็จ

เมื่อไม่กี่เดือนที่ผ่านมา การเปิดตัว Falcon-Arabic ได้รับการตอบรับอย่างอบอุ่นและให้ข้อคิดที่มีคุณค่าจากชุมชน นักพัฒนา นักวิจัย และนักศึกษาทั่วโลกอาหรับต่างนำโมเดลไปใช้ในสถานการณ์จริง ทำให้เราได้เรียนรู้ว่าโมเดลใดทำได้ดี และที่สำคัญกว่านั้นคือ โมเดลยังมีจุดที่ต้องปรับปรุง โดยเฉพาะอย่างยิ่งในด้านความเข้าใจบริบทที่ยาวนาน ความหลากหลายของภาษาถิ่น การให้เหตุผลเชิงคณิตศาสตร์ และความรู้เฉพาะทาง

เราไม่ได้ต้องการเพียงแค่การปรับปรุงเล็กๆ น้อยๆ แต่เราต้องการคิดทบทวนแนวทางของเราใหม่ทั้งหมด ผลลัพธ์คือ Falcon-H1-Arabic ตระกูลโมเดลที่ตอบสนองทุกข้อเสนอแนะที่เราได้รับ พร้อมทั้งนำเสนอการปรับปรุงสถาปัตยกรรมที่ไม่เคยมีมาก่อนในโมเดลภาษาอาหรับ

Falcon-H1-Arabic 3B, 7B, 34B: ประสิทธิภาพเหนือกว่าโมเดล SOTA ที่ขนาดใกล้เคียงกัน

สถาปัตยกรรมไฮบริด Mamba-Transformer: นวัตกรรมครั้งแรกสำหรับ NLP ภาษาอาหรับ 🌟

Falcon-H1-Arabic สร้างขึ้นบนสถาปัตยกรรมไฮบริด Falcon-H1 ที่ผสานรวม State Space Models (Mamba) และ Transformer attention เข้าไว้ด้วยกันในทุกบล็อก ส่วนประกอบทั้งสองทำงานแบบขนาน และการแสดงผลจะถูกหลอมรวมก่อนส่งออก นี่คือการออกแบบที่ให้ความสามารถในการปรับขนาดเชิงเส้นของ Mamba สำหรับลำดับที่ยาวมาก ในขณะเดียวกันก็ยังคงความสามารถในการสร้างแบบจำลองระยะยาวที่แม่นยำของ attention

สำหรับภาษาอาหรับ ซึ่งมีโครงสร้างคำที่ซับซ้อนและโครงสร้างประโยคที่ยืดหยุ่น แนวทางนี้ช่วยเพิ่มความสอดคล้องและการให้เหตุผลตลอดข้อความที่ยาวได้อย่างมาก เราได้นำสถาปัตยกรรมนี้ไปใช้ในสามขนาด (3 พันล้าน, 7 พันล้าน, และ 34 พันล้านพารามิเตอร์) แต่ละขนาดจะมีความสมดุลระหว่างศักยภาพ ประสิทธิภาพ และความสามารถในการนำไปใช้งาน สำหรับกรณีการใช้งานที่หลากหลาย ตั้งแต่อุปกรณ์พกพาไปจนถึงแอปพลิเคชันระดับองค์กร

ทลายขีดจำกัดด้านบริบท: เข้าใจข้อความได้ยาวขึ้นกว่าเดิม 📚

เราได้เพิ่มขีดความสามารถด้านบริบทอย่างมหาศาล จากขีดจำกัด 32K ของ Falcon-Arabic เป็น 128K tokens สำหรับโมเดล 3B และ 256K tokens สำหรับโมเดล 7B และ 34B ด้วยจำนวน 256K tokens (ประมาณ 200,000 คำ) โมเดลเหล่านี้สามารถประมวลผลนวนิยายหลายเล่ม หรือเอกสารทางเทคนิคหลายร้อยหน้า ทำให้สามารถใช้งานในการวิเคราะห์ทางกฎหมาย บันทึกทางการแพทย์ งานวิจัยทางวิชาการ และการสนทนาที่ยาวนาน ซึ่งก่อนหน้านี้ไม่สามารถทำได้

การปรับแต่งหลังการฝึก (Post-training) ของเราได้แก้ไขปัญหา "หลงลืมกลางทาง" (lost in the middle) โดยเฉพาะ เพื่อให้แน่ใจว่าโมเดลสามารถใช้ประโยชน์จากช่วงบริบททั้งหมดได้อย่างมีประสิทธิภาพ ไม่ใช่เพียงแค่รับอินพุตที่ยาวเท่านั้น

คุณภาพและความหลากหลายของข้อมูล: รากฐานแห่งความเป็นเลิศ 💎

เราได้สร้างกระบวนการข้อมูลการฝึกเบื้องต้น (pre-training data pipeline) ใหม่ทั้งหมด เพื่อสะท้อนความซับซ้อนของภาษาอาหรับได้ดียิ่งขึ้น เริ่มต้นด้วยกระบวนการกรองคุณภาพหลายขั้นตอนที่ปรับแต่งมาเพื่อการสะกดคำ สัณฐานวิทยา การใส่เครื่องหมายสระ และรูปแบบประโยคของภาษาอาหรับ แทนที่จะใช้การกรองแบบฮิวริสติก เราใช้การวิเคราะห์เชิงลึกทางภาษาศาสตร์เพื่อแยกข้อความที่มีโครงสร้างดีและสอดคล้องกัน และกำจัดสัญญาณรบกวนที่มักพบในคลังข้อมูลบนเว็บแบบเปิด ผลลัพธ์คือชุดข้อมูลภาษาอาหรับที่สะอาดและมีสไตล์ที่สม่ำเสมอยิ่งขึ้น

การครอบคลุมภาษาถิ่นเป็นอีกหนึ่งสิ่งสำคัญ ภาษาอาหรับไม่ได้มีรูปแบบเดียว ภาษาอาหรับมาตรฐานสมัยใหม่ (MSA) อยู่ร่วมกับภาษาถิ่นต่างๆ เช่น อียิปต์, เลแวนต์, กัลฟ์, และ มัฆริบ ซึ่งแต่ละภาษามีคำศัพท์และโครงสร้างไวยากรณ์ที่แตกต่างกัน เราได้ขยายแหล่งข้อมูลภาษาถิ่นอย่างมาก เพื่อให้โมเดลสามารถเข้าใจและสร้างภาษาอาหรับในชีวิตจริงได้อย่างเต็มสเปกตรัม แทนที่จะเอนเอียงไปทาง MSA มากเกินไป

เพื่อให้คงไว้ซึ่งการให้เหตุผลทั่วโลกและความหลากหลายของโดเมน เรายังคงรักษาความสามารถหลายภาษาของ Falcon-H1 โดยการฝึกโมเดลภาษาอาหรับด้วยการผสมผสานระหว่างภาษาอาหรับ ภาษาอังกฤษ และเนื้อหาหลายภาษาในสัดส่วนที่เกือบเท่ากัน รวมทั้งหมดประมาณ 300 พันล้านโทเค็น สิ่งนี้ช่วยให้มั่นใจได้ถึงประสิทธิภาพที่แข็งแกร่งในด้านโค้ด STEM และการให้เหตุผลข้ามภาษา

การฝึกอบรมหลังการฝึก (Post-Training): ปรับปรุงความสามารถโดยไม่ลดทอนประสิทธิภาพ 🛠️

หลังจากการฝึกเบื้องต้น Falcon-H1-Arabic จะผ่านกระบวนการฝึกอบรมหลังการฝึก (post-training pipeline) ที่เน้นเฉพาะทาง ประกอบด้วยการปรับแต่งแบบมีผู้สอน (Supervised Fine-Tuning - SFT) ตามด้วยการปรับให้เหมาะสมตามความพึงพอใจโดยตรง (Direct Preference Optimization - DPO)

  • SFT: เรานำเสนอโมเดลด้วยคำสั่งภาษาอาหรับคุณภาพสูง ตัวอย่างบริบทที่ยาวนานที่คัดสรรมา และงานการให้เหตุผลที่มีโครงสร้าง เพื่อสอนให้โมเดลปฏิบัติตามคำสั่ง รักษาความสอดคล้องในลำดับที่ยาว และอ้างอิงคำตอบจากข้อมูลที่เกี่ยวข้อง ขั้นตอนนี้มีความสำคัญเพื่อให้แน่ใจว่าโมเดลสามารถใช้ประโยชน์จากหน้าต่างบริบทขนาดใหญ่ได้อย่างแท้จริง ซึ่งไม่ได้เกิดขึ้นโดยอัตโนมัติจากสถาปัตยกรรมเพียงอย่างเดียว
  • DPO: เราตามด้วยขั้นตอน DPO ที่ตรงเป้าหมายเพื่อปรับปรุงการจัดตำแหน่ง คุณภาพการสนทนา และความสอดคล้องของความพึงพอใจ DPO ช่วยให้โมเดลสร้างสมดุลระหว่างการให้เหตุผลในบริบทที่ยาวนานกับความสามารถทางภาษาทั่วไป ปรับปรุงความเป็นประโยชน์ และลดโหมดความล้มเหลวทั่วไป เช่น การหลงประเด็น การใช้บริบทมากเกินไป หรือการละเลยข้อมูลก่อนหน้า

ตลอดทั้งสองขั้นตอน เราจะคอยตรวจสอบการลืมที่อาจเกิดขึ้น (catastrophic forgetting) อย่างระมัดระวัง และรักษาหลักสูตรการเรียนรู้ที่มีการควบคุม เพื่อให้การปรับปรุงพฤติกรรมในบริบทที่ยาวนานไม่ส่งผลกระทบต่อการให้เหตุผลหลักหรือความถูกต้องของข้อเท็จจริง ผลลัพธ์คือตระกูลโมเดลที่สามารถจัดการกับเอกสารและการสนทนาที่ยาวนานได้อย่างง่ายดาย ในขณะเดียวกันก็รักษาประสิทธิภาพที่แข็งแกร่งในงานภาษาประจำวัน

กระบวนการฝึกอบรมหลังการฝึกของเรายังได้เสริมสร้างความแข็งแกร่งให้กับส่วนต่างๆ ที่การประเมินแบบดั้งเดิมไม่ได้วัดผลอย่างเต็มที่ เช่น ความน่าเชื่อถือในการสนทนา การจัดระเบียบวาทศิลป์ การติดตามผลที่มีโครงสร้าง และความสอดคล้องของวาทกรรม การปรับปรุงเหล่านี้ช่วยเพิ่มประโยชน์ใช้สอยจริงของโมเดล ทำให้ Falcon-H1-Arabic น่าเชื่อถือยิ่งขึ้นในการสนทนาหลายรอบในชีวิตจริง การดำเนินการตามคำสั่ง และการสนทนาในบริบทที่ยาวนาน

ประสิทธิภาพบน Benchmark: กำหนดมาตรฐานใหม่ 📊

ตัวเลขเป็นส่วนสำคัญของเรื่องราว บน Open Arabic LLM Leaderboard (OALL) ซึ่งเป็นการประเมินความเข้าใจภาษาอาหรับในหลากหลายงาน Falcon-H1-Arabic ได้ผลลัพธ์ที่เป็นมาตรฐานใหม่ (state-of-the-art) ในทุกขนาดที่เราทดสอบ

  • โมเดล 3B: มีประสิทธิภาพที่ยอดเยี่ยม ทำคะแนนได้ประมาณ 62% บน OALL ซึ่งเหนือกว่าโมเดลขนาดเล็กทั้งหมด รวมถึง Gemma-4B, Qwen3-4B, และ Phi-4-mini ประมาณ 10 จุด บน 3LM ซึ่งเป็น Benchmark STEM ภาษาอาหรับหลัก ทำคะแนนได้ประมาณ 82% (Native split) และ 73% (Synthetic split) นอกจากนี้ยังได้ประมาณ 62% บน ArabCulture และประมาณ 50% ในการประเมินภาษาถิ่น AraDice (อียิปต์, กัลฟ์, และ เลแวนต์) ทำให้ Falcon-H1-Arabic-3B เป็นโมเดลคุณภาพสูงและมีประสิทธิภาพสูง เหมาะสำหรับการใช้งานบนอุปกรณ์พกพา แอปพลิเคชันแบบเรียลไทม์ และระบบ Agentic ที่ความหน่วงและต้นทุนมีความสำคัญ
  • โมเดล 7B: ยังคงรักษาแนวโน้มที่สูงขึ้น ด้วยคะแนน 71.7% บน OALL ซึ่งแซงหน้าโมเดลทั้งหมดในกลุ่ม ~10B รวมถึง Fanar-9B, Allam-7B*, และ Qwen3-8B บน 3LM ทำคะแนนได้ประมาณ 92% (Native split) และ 85% (Synthetic split) คะแนน AraDice เพิ่มขึ้นเป็นกลางๆ 50% ในทุกภาษาถิ่น และผลลัพธ์ ArabCulture เข้าใกล้ 80% โมเดลนี้สร้างสมดุลที่สมบูรณ์แบบระหว่างความสามารถและการนำไปใช้งาน ทำให้เป็นตัวเลือกที่ใช้งานได้จริงที่สุดสำหรับ NLP ภาษาอาหรับทั่วไปในสภาพแวดล้อมการผลิต
  • โมเดล 34B: เป็นระบบเรือธงของเรา และสร้างมาตรฐานใหม่สำหรับโมเดลภาษาอาหรับ ทำคะแนนได้ประมาณ 75% บน OALL ซึ่งไม่เพียงแต่เหนือกว่าโมเดลขนาดใกล้เคียงกันเท่านั้น แต่ยังเหนือกว่าระบบที่ใหญ่กว่ามาก เช่น Llama-3.3-70B และ AceGPT2-32B อีกด้วย คะแนน 3LM อยู่ที่ประมาณ 96% (Native split) และ 94% (Synthetic split) บน ArabCulture ได้คะแนนเกือบ 80% และบน AraDice ได้ประมาณ 53% ในทุกภาษาถิ่น การที่โมเดลไฮบริดขนาด 34B มีประสิทธิภาพเหนือกว่า Transformer ขนาด 70B แสดงให้เห็นถึงประสิทธิภาพของสถาปัตยกรรม Falcon-H1 คุณภาพของข้อมูล และความแข็งแกร่งของกระบวนการฝึกอบรมหลังการฝึก

ผลลัพธ์ Benchmark เหล่านี้ยืนยันแนวทางของเรา แต่ยังเน้นย้ำถึงความเป็นจริงที่สำคัญ: ขอบเขตของการสร้างโมเดลภาษาอาหรับกำลังก้าวหน้าอย่างรวดเร็ว ทุกๆ เปอร์เซ็นต์ที่เพิ่มขึ้นบน Benchmark เหล่านี้ แสดงถึงความพยายามด้านวิศวกรรม การคัดสรรข้อมูลอย่างระมัดระวัง และการปรับปรุงสถาปัตยกรรมเป็นจำนวนมาก

การใช้งานจริง: จากอุปกรณ์พกพา สู่ระดับองค์กร 🏢

แต่ละโมเดลในตระกูล Falcon-H1-Arabic เหมาะสมกับการใช้งานที่แตกต่างกัน:

  • โมเดล 3B: ปรับให้เหมาะสมสำหรับความเร็ว ประสิทธิภาพด้านต้นทุน และระบบที่มีปริมาณงานสูง ทำให้เหมาะสำหรับ Workflow Agentic, แอปพลิเคชันบนอุปกรณ์, แชทที่มีความหน่วงต่ำ และสภาพแวดล้อมที่มีข้อจำกัดด้านทรัพยากร
  • โมเดล 7B: ทำหน้าที่เป็นโมเดลหลักทั่วไปสำหรับแอปพลิเคชันการผลิตส่วนใหญ่ ขับเคลื่อนระบบทำความเข้าใจเอกสาร, แชทบอท, ไปป์ไลน์สรุปความ และเครื่องมือสร้างเนื้อหา
  • โมเดล 34B: ออกแบบมาสำหรับโดเมนที่มีความสำคัญสูง ซึ่งความแม่นยำและการให้เหตุผลระยะยาวมีความสำคัญสูงสุด รวมถึงการวิเคราะห์ทางกฎหมาย การสรุปทางการแพทย์ งานวิจัยทางวิชาการ และระบบอัตโนมัติระดับองค์กรขนาดใหญ่ หน้าต่างบริบทที่ขยายออกไปทำให้มีความสามารถพิเศษในการวิเคราะห์เอกสารหลายร้อยหน้าในการประมวลผลครั้งเดียว โดยยังคงรักษาความสอดคล้องที่แม่นยำ

AI ที่มีความรับผิดชอบและข้อจำกัด ⚠️

เช่นเดียวกับโมเดลภาษาอื่นๆ Falcon-H1-Arabic อาจสะท้อนอคติจากข้อมูลการฝึก และอาจสร้างข้อมูลที่ถูกสร้างขึ้น (hallucinated information) ผลลัพธ์ของโมเดลไม่ควรใช้เป็นแหล่งอำนาจแต่เพียงผู้เดียวสำหรับการตัดสินใจทางการแพทย์ ก

ขอบคุณ แหล่งข้อมูล
https://huggingface.co/blog/tiiuae/falcon-h1-arabic

Falcon-H1-Arabic: ก้าวข้ามขีดจำกัด AI ภาษาอาหรับ ด้วยสถาปัตยกรรมไฮบริดสุดล้ำ 🚀การพัฒนาโมเดลภาษาอาหรับระดับโลกเป็นกระบวนการที่เต็มไปด้วยการเรียนรู้และปรับปรุงอย่างต่อเนื่อง วันนี้ เรามีความยินดีที่จะประกาศเปิดตัว Falcon-H1-Arabic ตระกูลโมเดลภาษาอาหรับที่ทันสมัยที่สุดของเรา ซึ่งแสดงถึงความก้าวหน้าครั้งสำคัญทั้งในด้านสถาปัตยกรรมและความสามารถ การเปิดตัวครั้งนี้เกิดจากการวิจัยหลายเดือน การรับฟังความคิดเห็นจากชุมชน และนวัตกรรมทางเทคนิค เพื่อสร้างสรรค์โมเดลทรงพลัง 3 แบบ ที่จะมากำหนดมาตรฐานใหม่สำหรับการประมวลผลภาษาธรรมชาติของภาษาอาหรับจาก Falcon-Arabic สู่ Falcon-H1-Arabic: การต่อยอดความสำเร็จเมื่อไม่กี่เดือนที่ผ่านมา การเปิดตัว Falcon-Arabic ได้รับการตอบรับอย่างอบอุ่นและให้ข้อคิดที่มีคุณค่าจากชุมชน นักพัฒนา นักวิจัย และนักศึกษาทั่วโลกอาหรับต่างนำโมเดลไปใช้ในสถานการณ์จริง ทำให้เราได้เรียนรู้ว่าโมเดลใดทำได้ดี และที่สำคัญกว่านั้นคือ โมเดลยังมีจุดที่ต้องปรับปรุง โดยเฉพาะอย่างยิ่งในด้านความเข้าใจบริบทที่ยาวนาน ความหลากหลายของภาษาถิ่น การให้เหตุผลเชิงคณิตศาสตร์ และความรู้เฉพาะทางเราไม่ได้ต้องการเพียงแค่การปรับปรุงเล็กๆ น้อยๆ แต่เราต้องการคิดทบทวนแนวทางของเราใหม่ทั้งหมด ผลลัพธ์คือ Falcon-H1-Arabic ตระกูลโมเดลที่ตอบสนองทุกข้อเสนอแนะที่เราได้รับ พร้อมทั้งนำเสนอการปรับปรุงสถาปัตยกรรมที่ไม่เคยมีมาก่อนในโมเดลภาษาอาหรับFalcon-H1-Arabic 3B, 7B, 34B: ประสิทธิภาพเหนือกว่าโมเดล SOTA ที่ขนาดใกล้เคียงกันสถาปัตยกรรมไฮบริด Mamba-Transformer: นวัตกรรมครั้งแรกสำหรับ NLP ภาษาอาหรับ 🌟Falcon-H1-Arabic สร้างขึ้นบนสถาปัตยกรรมไฮบริด Falcon-H1 ที่ผสานรวม State Space Models (Mamba) และ Transformer attention เข้าไว้ด้วยกันในทุกบล็อก ส่วนประกอบทั้งสองทำงานแบบขนาน และการแสดงผลจะถูกหลอมรวมก่อนส่งออก นี่คือการออกแบบที่ให้ความสามารถในการปรับขนาดเชิงเส้นของ Mamba สำหรับลำดับที่ยาวมาก ในขณะเดียวกันก็ยังคงความสามารถในการสร้างแบบจำลองระยะยาวที่แม่นยำของ attentionสำหรับภาษาอาหรับ ซึ่งมีโครงสร้างคำที่ซับซ้อนและโครงสร้างประโยคที่ยืดหยุ่น แนวทางนี้ช่วยเพิ่มความสอดคล้องและการให้เหตุผลตลอดข้อความที่ยาวได้อย่างมาก เราได้นำสถาปัตยกรรมนี้ไปใช้ในสามขนาด (3 พันล้าน, 7 พันล้าน, และ 34 พันล้านพารามิเตอร์) แต่ละขนาดจะมีความสมดุลระหว่างศักยภาพ ประสิทธิภาพ และความสามารถในการนำไปใช้งาน สำหรับกรณีการใช้งานที่หลากหลาย ตั้งแต่อุปกรณ์พกพาไปจนถึงแอปพลิเคชันระดับองค์กรทลายขีดจำกัดด้านบริบท: เข้าใจข้อความได้ยาวขึ้นกว่าเดิม 📚เราได้เพิ่มขีดความสามารถด้านบริบทอย่างมหาศาล จากขีดจำกัด 32K ของ Falcon-Arabic เป็น 128K tokens สำหรับโมเดล 3B และ 256K tokens สำหรับโมเดล 7B และ 34B ด้วยจำนวน 256K tokens (ประมาณ 200,000 คำ) โมเดลเหล่านี้สามารถประมวลผลนวนิยายหลายเล่ม หรือเอกสารทางเทคนิคหลายร้อยหน้า ทำให้สามารถใช้งานในการวิเคราะห์ทางกฎหมาย บันทึกทางการแพทย์ งานวิจัยทางวิชาการ และการสนทนาที่ยาวนาน ซึ่งก่อนหน้านี้ไม่สามารถทำได้การปรับแต่งหลังการฝึก (Post-training) ของเราได้แก้ไขปัญหา "หลงลืมกลางทาง" (lost in the middle) โดยเฉพาะ เพื่อให้แน่ใจว่าโมเดลสามารถใช้ประโยชน์จากช่วงบริบททั้งหมดได้อย่างมีประสิทธิภาพ ไม่ใช่เพียงแค่รับอินพุตที่ยาวเท่านั้นคุณภาพและความหลากหลายของข้อมูล: รากฐานแห่งความเป็นเลิศ 💎เราได้สร้างกระบวนการข้อมูลการฝึกเบื้องต้น (pre-training data pipeline) ใหม่ทั้งหมด เพื่อสะท้อนความซับซ้อนของภาษาอาหรับได้ดียิ่งขึ้น เริ่มต้นด้วยกระบวนการกรองคุณภาพหลายขั้นตอนที่ปรับแต่งมาเพื่อการสะกดคำ สัณฐานวิทยา การใส่เครื่องหมายสระ และรูปแบบประโยคของภาษาอาหรับ แทนที่จะใช้การกรองแบบฮิวริสติก เราใช้การวิเคราะห์เชิงลึกทางภาษาศาสตร์เพื่อแยกข้อความที่มีโครงสร้างดีและสอดคล้องกัน และกำจัดสัญญาณรบกวนที่มักพบในคลังข้อมูลบนเว็บแบบเปิด ผลลัพธ์คือชุดข้อมูลภาษาอาหรับที่สะอาดและมีสไตล์ที่สม่ำเสมอยิ่งขึ้นการครอบคลุมภาษาถิ่นเป็นอีกหนึ่งสิ่งสำคัญ ภาษาอาหรับไม่ได้มีรูปแบบเดียว ภาษาอาหรับมาตรฐานสมัยใหม่ (MSA) อยู่ร่วมกับภาษาถิ่นต่างๆ เช่น อียิปต์, เลแวนต์, กัลฟ์, และ มัฆริบ ซึ่งแต่ละภาษามีคำศัพท์และโครงสร้างไวยากรณ์ที่แตกต่างกัน เราได้ขยายแหล่งข้อมูลภาษาถิ่นอย่างมาก เพื่อให้โมเดลสามารถเข้าใจและสร้างภาษาอาหรับในชีวิตจริงได้อย่างเต็มสเปกตรัม แทนที่จะเอนเอียงไปทาง MSA มากเกินไปเพื่อให้คงไว้ซึ่งการให้เหตุผลทั่วโลกและความหลากหลายของโดเมน เรายังคงรักษาความสามารถหลายภาษาของ Falcon-H1 โดยการฝึกโมเดลภาษาอาหรับด้วยการผสมผสานระหว่างภาษาอาหรับ ภาษาอังกฤษ และเนื้อหาหลายภาษาในสัดส่วนที่เกือบเท่ากัน รวมทั้งหมดประมาณ 300 พันล้านโทเค็น สิ่งนี้ช่วยให้มั่นใจได้ถึงประสิทธิภาพที่แข็งแกร่งในด้านโค้ด STEM และการให้เหตุผลข้ามภาษาการฝึกอบรมหลังการฝึก (Post-Training): ปรับปรุงความสามารถโดยไม่ลดทอนประสิทธิภาพ 🛠️หลังจากการฝึกเบื้องต้น Falcon-H1-Arabic จะผ่านกระบวนการฝึกอบรมหลังการฝึก (post-training pipeline) ที่เน้นเฉพาะทาง ประกอบด้วยการปรับแต่งแบบมีผู้สอน (Supervised Fine-Tuning - SFT) ตามด้วยการปรับให้เหมาะสมตามความพึงพอใจโดยตรง (Direct Preference Optimization - DPO)SFT: เรานำเสนอโมเดลด้วยคำสั่งภาษาอาหรับคุณภาพสูง ตัวอย่างบริบทที่ยาวนานที่คัดสรรมา และงานการให้เหตุผลที่มีโครงสร้าง เพื่อสอนให้โมเดลปฏิบัติตามคำสั่ง รักษาความสอดคล้องในลำดับที่ยาว และอ้างอิงคำตอบจากข้อมูลที่เกี่ยวข้อง ขั้นตอนนี้มีความสำคัญเพื่อให้แน่ใจว่าโมเดลสามารถใช้ประโยชน์จากหน้าต่างบริบทขนาดใหญ่ได้อย่างแท้จริง ซึ่งไม่ได้เกิดขึ้นโดยอัตโนมัติจากสถาปัตยกรรมเพียงอย่างเดียวDPO: เราตามด้วยขั้นตอน DPO ที่ตรงเป้าหมายเพื่อปรับปรุงการจัดตำแหน่ง คุณภาพการสนทนา และความสอดคล้องของความพึงพอใจ DPO ช่วยให้โมเดลสร้างสมดุลระหว่างการให้เหตุผลในบริบทที่ยาวนานกับความสามารถทางภาษาทั่วไป ปรับปรุงความเป็นประโยชน์ และลดโหมดความล้มเหลวทั่วไป เช่น การหลงประเด็น การใช้บริบทมากเกินไป หรือการละเลยข้อมูลก่อนหน้าตลอดทั้งสองขั้นตอน เราจะคอยตรวจสอบการลืมที่อาจเกิดขึ้น (catastrophic forgetting) อย่างระมัดระวัง และรักษาหลักสูตรการเรียนรู้ที่มีการควบคุม เพื่อให้การปรับปรุงพฤติกรรมในบริบทที่ยาวนานไม่ส่งผลกระทบต่อการให้เหตุผลหลักหรือความถูกต้องของข้อเท็จจริง ผลลัพธ์คือตระกูลโมเดลที่สามารถจัดการกับเอกสารและการสนทนาที่ยาวนานได้อย่างง่ายดาย ในขณะเดียวกันก็รักษาประสิทธิภาพที่แข็งแกร่งในงานภาษาประจำวันกระบวนการฝึกอบรมหลังการฝึกของเรายังได้เสริมสร้างความแข็งแกร่งให้กับส่วนต่างๆ ที่การประเมินแบบดั้งเดิมไม่ได้วัดผลอย่างเต็มที่ เช่น ความน่าเชื่อถือในการสนทนา การจัดระเบียบวาทศิลป์ การติดตามผลที่มีโครงสร้าง และความสอดคล้องของวาทกรรม การปรับปรุงเหล่านี้ช่วยเพิ่มประโยชน์ใช้สอยจริงของโมเดล ทำให้ Falcon-H1-Arabic น่าเชื่อถือยิ่งขึ้นในการสนทนาหลายรอบในชีวิตจริง การดำเนินการตามคำสั่ง และการสนทนาในบริบทที่ยาวนานประสิทธิภาพบน Benchmark: กำหนดมาตรฐานใหม่ 📊ตัวเลขเป็นส่วนสำคัญของเรื่องราว บน Open Arabic LLM Leaderboard (OALL) ซึ่งเป็นการประเมินความเข้าใจภาษาอาหรับในหลากหลายงาน Falcon-H1-Arabic ได้ผลลัพธ์ที่เป็นมาตรฐานใหม่ (state-of-the-art) ในทุกขนาดที่เราทดสอบโมเดล 3B: มีประสิทธิภาพที่ยอดเยี่ยม ทำคะแนนได้ประมาณ 62% บน OALL ซึ่งเหนือกว่าโมเดลขนาดเล็กทั้งหมด รวมถึง Gemma-4B, Qwen3-4B, และ Phi-4-mini ประมาณ 10 จุด บน 3LM ซึ่งเป็น Benchmark STEM ภาษาอาหรับหลัก ทำคะแนนได้ประมาณ 82% (Native split) และ 73% (Synthetic split) นอกจากนี้ยังได้ประมาณ 62% บน ArabCulture และประมาณ 50% ในการประเมินภาษาถิ่น AraDice (อียิปต์, กัลฟ์, และ เลแวนต์) ทำให้ Falcon-H1-Arabic-3B เป็นโมเดลคุณภาพสูงและมีประสิทธิภาพสูง เหมาะสำหรับการใช้งานบนอุปกรณ์พกพา แอปพลิเคชันแบบเรียลไทม์ และระบบ Agentic ที่ความหน่วงและต้นทุนมีความสำคัญโมเดล 7B: ยังคงรักษาแนวโน้มที่สูงขึ้น ด้วยคะแนน 71.7% บน OALL ซึ่งแซงหน้าโมเดลทั้งหมดในกลุ่ม ~10B รวมถึง Fanar-9B, Allam-7B*, และ Qwen3-8B บน 3LM ทำคะแนนได้ประมาณ 92% (Native split) และ 85% (Synthetic split) คะแนน AraDice เพิ่มขึ้นเป็นกลางๆ 50% ในทุกภาษาถิ่น และผลลัพธ์ ArabCulture เข้าใกล้ 80% โมเดลนี้สร้างสมดุลที่สมบูรณ์แบบระหว่างความสามารถและการนำไปใช้งาน ทำให้เป็นตัวเลือกที่ใช้งานได้จริงที่สุดสำหรับ NLP ภาษาอาหรับทั่วไปในสภาพแวดล้อมการผลิตโมเดล 34B: เป็นระบบเรือธงของเรา และสร้างมาตรฐานใหม่สำหรับโมเดลภาษาอาหรับ ทำคะแนนได้ประมาณ 75% บน OALL ซึ่งไม่เพียงแต่เหนือกว่าโมเดลขนาดใกล้เคียงกันเท่านั้น แต่ยังเหนือกว่าระบบที่ใหญ่กว่ามาก เช่น Llama-3.3-70B และ AceGPT2-32B อีกด้วย คะแนน 3LM อยู่ที่ประมาณ 96% (Native split) และ 94% (Synthetic split) บน ArabCulture ได้คะแนนเกือบ 80% และบน AraDice ได้ประมาณ 53% ในทุกภาษาถิ่น การที่โมเดลไฮบริดขนาด 34B มีประสิทธิภาพเหนือกว่า Transformer ขนาด 70B แสดงให้เห็นถึงประสิทธิภาพของสถาปัตยกรรม Falcon-H1 คุณภาพของข้อมูล และความแข็งแกร่งของกระบวนการฝึกอบรมหลังการฝึกผลลัพธ์ Benchmark เหล่านี้ยืนยันแนวทางของเรา แต่ยังเน้นย้ำถึงความเป็นจริงที่สำคัญ: ขอบเขตของการสร้างโมเดลภาษาอาหรับกำลังก้าวหน้าอย่างรวดเร็ว ทุกๆ เปอร์เซ็นต์ที่เพิ่มขึ้นบน Benchmark เหล่านี้ แสดงถึงความพยายามด้านวิศวกรรม การคัดสรรข้อมูลอย่างระมัดระวัง และการปรับปรุงสถาปัตยกรรมเป็นจำนวนมากการใช้งานจริง: จากอุปกรณ์พกพา สู่ระดับองค์กร 🏢แต่ละโมเดลในตระกูล Falcon-H1-Arabic เหมาะสมกับการใช้งานที่แตกต่างกัน:โมเดล 3B: ปรับให้เหมาะสมสำหรับความเร็ว ประสิทธิภาพด้านต้นทุน และระบบที่มีปริมาณงานสูง ทำให้เหมาะสำหรับ Workflow Agentic, แอปพลิเคชันบนอุปกรณ์, แชทที่มีความหน่วงต่ำ และสภาพแวดล้อมที่มีข้อจำกัดด้านทรัพยากรโมเดล 7B: ทำหน้าที่เป็นโมเดลหลักทั่วไปสำหรับแอปพลิเคชันการผลิตส่วนใหญ่ ขับเคลื่อนระบบทำความเข้าใจเอกสาร, แชทบอท, ไปป์ไลน์สรุปความ และเครื่องมือสร้างเนื้อหาโมเดล 34B: ออกแบบมาสำหรับโดเมนที่มีความสำคัญสูง ซึ่งความแม่นยำและการให้เหตุผลระยะยาวมีความสำคัญสูงสุด รวมถึงการวิเคราะห์ทางกฎหมาย การสรุปทางการแพทย์ งานวิจัยทางวิชาการ และระบบอัตโนมัติระดับองค์กรขนาดใหญ่ หน้าต่างบริบทที่ขยายออกไปทำให้มีความสามารถพิเศษในการวิเคราะห์เอกสารหลายร้อยหน้าในการประมวลผลครั้งเดียว โดยยังคงรักษาความสอดคล้องที่แม่นยำAI ที่มีความรับผิดชอบและข้อจำกัด ⚠️เช่นเดียวกับโมเดลภาษาอื่นๆ Falcon-H1-Arabic อาจสะท้อนอคติจากข้อมูลการฝึก และอาจสร้างข้อมูลที่ถูกสร้างขึ้น (hallucinated information) ผลลัพธ์ของโมเดลไม่ควรใช้เป็นแหล่งอำนาจแต่เพียงผู้เดียวสำหรับการตัดสินใจทางการแพทย์ กhttps://huggingface.co/blog/tiiuae/falcon-h1-arabic
5 Commentarios 0 Acciones 321 Views 0 Vista previa