Alyah ⭐️: การประเมินความสามารถของภาษาถิ่นเอมิเรตส์ในโมเดลภาษาขนาดใหญ่ (LLM)

ภาษาอาหรับเป็นภาษาที่มีผู้พูดมากที่สุดภาษาหนึ่งของโลก โดยมีผู้พูดหลายร้อยล้านคนในกว่ายี่สิบประเทศ อย่างไรก็ตาม ภาษาอาหรับไม่ใช่ภาษาเดียวที่ตายตัว ภาษาอาหรับมาตรฐานสมัยใหม่ (Modern Standard Arabic - MSA) ดำรงอยู่ร่วมกับภาษาถิ่นหลากหลายรูปแบบ ซึ่งมีความแตกต่างกันอย่างมากในด้านคำศัพท์ ไวยากรณ์ การออกเสียง และรากฐานทางวัฒนธรรม ภาษาถิ่นเหล่านี้เป็นสื่อกลางหลักในการสื่อสารประจำวัน การเล่าเรื่อง การประพันธ์บทกวี และปฏิสัมพันธ์ทางสังคม แต่ส่วนใหญ่แล้ว การประเมินโมเดลภาษาขนาดใหญ่ (LLM) สำหรับภาษาอาหรับที่มีอยู่ มักจะเน้นไปที่ MSA เป็นหลัก ทำให้ภาษาถิ่นอาหรับยังคงขาดการประเมินและเป็นตัวแทนที่น้อยมาก

ช่องว่างนี้เป็นปัญหาอย่างยิ่ง เมื่อ LLM มีปฏิสัมพันธ์กับผู้ใช้ในบริบทที่ไม่เป็นทางการ มีรากฐานทางวัฒนธรรม และเป็นการสนทนามากขึ้น โมเดลที่ทำงานได้ดีกับข้อความข่าวที่เป็นทางการ อาจยังคงล้มเหลวในการทำความเข้าใจคำทักทาย สำนวน หรือเรื่องเล่าสั้นๆ ที่แสดงออกด้วยภาษาถิ่นในท้องถิ่น เพื่อแก้ไขข้อจำกัดนี้ ทีมวิจัยของเราได้เปิดตัว Alyah الياه (ซึ่งหมายถึง ดาวเหนือ ⭐️ ในภาษาถิ่นเอมิเรตส์) ซึ่งเป็นชุดประเมินที่เน้นภาษาถิ่นเอมิเรตส์โดยเฉพาะ ออกแบบมาเพื่อวัดว่า LLM ภาษาอาหรับสามารถจับแง่มุมทางภาษา วัฒนธรรม และการใช้งานภาษาถิ่นเอมิเรตส์ได้ดีเพียงใด

แรงจูงใจและขอบเขตของชุดประเมิน

ภาษาถิ่นเอมิเรตส์มีความเชื่อมโยงอย่างลึกซึ้งกับวัฒนธรรม มรดก และประวัติศาสตร์ท้องถิ่น ปรากฏในคำทักทายประจำวัน บทกวีที่เล่าด้วยปากเปล่า สุภาษิต นิทานพื้นบ้าน และสำนวนต่างๆ ที่ความหมายไม่สามารถอนุมานได้จากการแปลตรงตัวเพียงอย่างเดียว ชุดประเมินของเราได้รับการออกแบบมาโดยเจตนาเพื่อสำรวจความลึกซึ้งนี้ แทนที่จะทดสอบความรู้คำศัพท์ในระดับผิวเผิน ชุดประเมินนี้ท้าทายโมเดลในความสามารถในการตีความความหมายที่ฝังอยู่ในวัฒนธรรม การใช้งานเชิงปฏิบัติ และความแตกต่างเฉพาะของภาษาถิ่น

ชุดประเมินครอบคลุมเนื้อหาที่หลากหลาย รวมถึงสำนวนท้องถิ่นทั่วไปและไม่ธรรมดา คำทักทายที่มีรากฐานทางวัฒนธรรม เรื่องเล่าสั้นๆ คำถามเกี่ยวกับมรดก และการอ้างอิงถึงบทกวีของเอมิเรตส์ เป้าหมายไม่ใช่เพียงแค่การวัดความถูกต้องเท่านั้น แต่ยังรวมถึงการทำความเข้าใจว่าโมเดลประสบความสำเร็จหรือล้มเหลวอย่างเป็นระบบเมื่อเผชิญกับการใช้ภาษาเอมิเรตส์ที่แท้จริง

หลังจากพัฒนาและรวบรวมข้อมูลเพิ่มเติม ชุดประเมินได้รับการรวมเป็นชุดข้อมูลเดียวที่เรียกว่า Alyah ชุดประเมินสุดท้ายประกอบด้วย 1,173 ตัวอย่าง ซึ่งทั้งหมดรวบรวมด้วยตนเองจากเจ้าของภาษาเอมิเรตส์ เพื่อให้มั่นใจถึงความถูกต้องทางภาษาและรากฐานทางวัฒนธรรม ขั้นตอนการคัดสรรด้วยตนเองนี้มีความสำคัญอย่างยิ่งในการจับสำนวน ความหมาย และการใช้งานที่มักไม่ค่อยมีบันทึกในแหล่งข้อมูลที่เป็นลายลักษณ์อักษร และยากต่อการอนุมานจากภาษาอาหรับมาตรฐานสมัยใหม่เพียงอย่างเดียว

แต่ละตัวอย่างถูกสร้างขึ้นเป็นคำถามแบบเลือกตอบ โดยมีตัวเลือกสี่ข้อ ซึ่งมีเพียงข้อเดียวที่ถูกต้อง โมเดลภาษาขนาดใหญ่ถูกนำมาใช้เพื่อสร้างตัวเลือกที่ทำให้ไขว้เขลา (distractors) อย่างสังเคราะห์ จากนั้นจึงตรวจสอบเพื่อให้แน่ใจว่ามีความเป็นไปได้และความใกล้เคียงทางความหมายกับคำตอบที่ถูกต้อง เพื่อหลีกเลี่ยงอคติเชิงตำแหน่งระหว่างการประเมิน ดัชนีของคำตอบที่ถูกต้องจะมีการกระจายแบบสุ่มตลอดทั้งชุดข้อมูล

Alyah ครอบคลุมปรากฏการณ์ทางภาษาและวัฒนธรรมที่หลากหลายในภาษาถิ่นเอมิเรตส์ ตั้งแต่สำนวนในชีวิตประจำวันไปจนถึงภาษาที่ละเอียดอ่อนทางวัฒนธรรมและภาษาเชิงเปรียบเทียบ

ตัวอย่างหมวดหมู่:

  • คำทักทายและการแสดงออกในชีวิตประจำวัน: การทักทายทั่วไป สำนวนที่ใช้บ่อย
  • ภาษาและภาษาถิ่น: คำศัพท์และสำนวนเฉพาะถิ่น
  • บทกวีและงานสร้างสรรค์: การอ้างอิงถึงบทกวีและรูปแบบการเขียนเชิงสร้างสรรค์
  • มรดกและประวัติศาสตร์: คำถามเกี่ยวกับประวัติศาสตร์และมรดกทางวัฒนธรรม
  • มารยาทและค่านิยม: การแสดงออกที่เกี่ยวข้องกับบรรทัดฐานทางสังคมและค่านิยม
  • ภาพพจน์และความหมายเชิงเปรียบเทียบ: การตีความสำนวนหรือการใช้ภาษาที่ไม่ได้ตรงตัว

องค์ประกอบเหล่านี้ช่วยให้ Alyah สามารถประเมินความคล่องแคล่วในการสนทนาในระดับผิวเผิน ควบคู่ไปกับความเข้าใจเชิงวัฒนธรรม ความหมาย และการใช้งานเชิงปฏิบัติที่ลึกซึ้งยิ่งขึ้น โดยให้ความสำคัญเป็นพิเศษกับปรากฏการณ์ทางภาษาเฉพาะถิ่นที่ยังคงเป็นความท้าทายสำหรับโมเดลปัจจุบัน

การตั้งค่าการประเมินโมเดล

เราได้ประเมินโมเดลภาษาทั้งหมด 54 โมเดล ประกอบด้วยโมเดลพื้นฐาน 23 โมเดล และโมเดลที่ผ่านการปรับแต่งคำสั่ง (instruction-tuned) 31 โมเดล โดยครอบคลุมสถาปัตยกรรมและแนวทางการฝึกอบรมที่หลากหลาย ซึ่งรวมถึง LLM ที่เน้นภาษาอาหรับโดยเฉพาะ เช่น Jais และ Allam, โมเดลหลายภาษาที่มีการรองรับภาษาอาหรับที่ดี เช่น Qwen และ LLaMA, และโมเดลที่ปรับแต่งหรือเฉพาะภูมิภาค เช่น Fanar และ AceGPT สำหรับแต่ละตระกูล ทั้งรุ่นพื้นฐานและรุ่นที่ผ่านการปรับแต่งคำสั่งได้รับการประเมิน เพื่อทำความเข้าใจผลกระทบของการปรับแนว (alignment) และการปรับแต่งคำสั่งต่อประสิทธิภาพของภาษาถิ่น

โมเดลทั้งหมดได้รับการประเมินภายใต้โปรโตคอลการแจ้ง (prompting) และการให้คะแนนที่สอดคล้องกัน การตอบสนองได้รับการประเมินในด้านความถูกต้องทางความหมายและความเหมาะสมกับการใช้งานในเอมิเรตส์ มากกว่าการทับซ้อนของคำตอบกับคำตอบอ้างอิงโดยตรง ซึ่งมีความสำคัญอย่างยิ่งสำหรับการประเมินภาษาถิ่น ซึ่งอาจมีรูปแบบการใช้ที่ถูกต้องได้หลายแบบ

สำหรับแต่ละหมวดหมู่คำถาม เราได้ประมาณความยากโดยอาศัยประสิทธิภาพของโมเดล หมวดหมู่ที่โมเดลส่วนใหญ่ประสบปัญหาจะถูกระบุว่ายากกว่า ในขณะที่หมวดหมู่ที่ได้รับการตอบอย่างถูกต้องอย่างสม่ำเสมอในทุกตระกูลโมเดลจะถือว่าง่ายกว่า แนวทางนี้ช่วยให้ความยากปรากฏจากพฤติกรรมที่สังเกตได้ แทนที่จะมาจากการระบุด้วยการตัดสินใจส่วนบุคคลเพียงอย่างเดียว

ผลการประเมินบน Alyah (ภาษาถิ่นเอมิเรตส์)

เราได้ประเมินชุดโมเดลภาษาขนาดใหญ่สำหรับภาษาอาหรับและโมเดลหลายภาษาที่ทันสมัยจำนวนมากบน Alyah โดยใช้ความแม่นยำในคำถามแบบเลือกตอบเป็นตัวชี้วัดหลัก การประเมินครอบคลุมโมเดลทั้งหมด 53 โมเดล ได้แก่ โมเดลพื้นฐาน 22 โมเดล และโมเดลที่ผ่านการปรับแต่งคำสั่ง 31 โมเดล โดยครอบคลุมระบบที่เน้นภาษาอาหรับโดยเฉพาะ โมเดลหลายภาษา และระบบที่ปรับแต่งตามภูมิภาค

ผลลัพธ์เหล่านี้มีไว้เพื่อเป็น การวัดอ้างอิงภายในขอบเขตของ Alyah ไม่ใช่การจัดอันดับสัมบูรณ์ในชุดประเมินภาษาอาหรับทั้งหมด

โมเดลที่ผ่านการปรับแต่งคำสั่ง (Instruction-Tuned Models)

การวิเคราะห์และแนวโน้มที่สังเกตได้

มีแนวโน้มหลายประการที่ปรากฏจากการประเมิน โดยทั่วไปแล้ว โมเดลที่ผ่านการปรับแต่งคำสั่งจะทำงานได้ดีกว่าโมเดลพื้นฐานอย่างเห็นได้ชัด โดยเฉพาะอย่างยิ่งในคำถามที่เกี่ยวข้องกับบรรทัดฐานการสนทนาและการตอบสนองที่เหมาะสมทางวัฒนธรรม (เช่น หมวดมารยาทและค่านิยม) นอกจากนี้ยังเป็นกรณีสำหรับคำถามที่ทดสอบภาพพจน์และความหมายเชิงเปรียบเทียบ ซึ่งสามารถอธิบายได้ว่าโมเดลมีความสามารถดั้งเดิมที่แข็งแกร่งในการทำความเข้าใจภาพพจน์และความหมายเชิงเปรียบเทียบที่อิงจาก MSA โดยไม่คำนึงถึงภาษาถิ่น หมวดหมู่ที่ยากที่สุดสำหรับโมเดลโดยทั่วไปคือ "ภาษาและภาษาถิ่น" และ "คำทักทายและการแสดงออกในชีวิตประจำวัน" ในทุกขนาดของโมเดล ซึ่งสะท้อนให้เห็นถึงสถานะปัจจุบันของการปรากฏของภาษาถิ่นเอมิเรตส์ในสื่อที่เป็นลายลักษณ์อักษร เนื่องจากภาษาถิ่นส่วนใหญ่จะใช้พูดมากกว่าเขียน จึงอธิบายถึงความแปลกใหม่เมื่อเทียบกับโมเดลที่ประเมิน อย่างไรก็ตาม มีประโยชน์ที่ชัดเจนในการปรับแต่งโมเดลให้เข้าใจภาษาถิ่น (และหมวดหมู่อื่นๆ) เมื่อเทียบกับโมเดลคู่ขนาน โดยเฉพาะอย่างยิ่งในโมเดลขนาดเล็กและขนาดกลาง

แม้แต่โมเดลหลายภาษาที่แข็งแกร่งก็แสดงให้เห็นถึงความเสื่อมที่สังเกตได้ในคำถาม Alyah ที่ท้าทายที่สุด ซึ่งชี้ให้เห็นว่าความรู้ทางความหมายเฉพาะถิ่นนั้นไม่ได้ถูกเรียนรู้ได้ง่ายจากการฝึกอบรมหลายภาษาทั่วไปเพียงอย่างเดียว จำเป็นต้องมีการฝึกอบรมเฉพาะ แม้ว่าโมเดลที่เน้นภาษาอาหรับโดยเฉพาะมีแนวโน้มที่จะทำงานได้ดีขึ้นกับเนื้อหาที่มีรากฐานทางวัฒนธรรม แต่ประสิทธิภาพของโมเดลเหล่านี้ก็ไม่สม่ำเสมอในทุกหมวดหมู่ โดยเฉพาะอย่างยิ่งคำถามที่เกี่ยวข้องกับความหมายโดยนัยและสำนวนที่หายากยังคงเป็นเรื่องยากสำหรับโมเดลเกือบทั้งหมด สิ่งนี้เน้นย้ำถึงช่องว่างที่ยังคงอยู่ระหว่างความคุ้นเคยกับภาษาถิ่นในระดับผิวเผินและความเข้าใจทางวัฒนธรรมที่ลึกซึ้งยิ่งขึ้น ความแปรปรวนของประสิทธิภาพในหมวดหมู่ต่างๆ บ่งชี้ว่าความสามารถทางภาษาถิ่นนั้นมีหลายมิติและไม่สามารถวัดได้ด้วยคะแนนเดียว

บทสรุปและผลกระทบต่อชุมชน

ชุดประเมินนี้เป็นก้าวสำคัญสู่การประเมินโมเดลภาษาอาหรับที่สมจริงและมีรากฐานทางวัฒนธรรมมากขึ้น ด้วยการมุ่งเน้นไปที่ภาษาถิ่นเอมิเรตส์ เรามุ่งหวังที่จะสนับสนุนการพัฒนาโมเดลที่ให้บริการชุมชน สถาบัน และผู้ใช้ในสหรัฐอาหรับเอมิเรตส์ได้ดียิ่งขึ้น นอกเหนือจากการจัดอันดับโมเดลแล้ว ชุดประเมินนี้มีจุดประสงค์เพื่อเป็นเครื่องมือในการวินิจฉัยเพื่อชี้นำความพยายามในการรวบรวมข้อมูล การฝึกอบรม และการปรับใช้ในอนาคต

เราขอเชิญนักวิจัย ผู้ปฏิบัติงาน และชุมชนในวงกว้างให้ใช้ชุดประเมินนี้ สำรวจผลลัพธ์ และแบ่งปันข้อเสนอแนะ การมีส่วนร่วมของชุมชนจะเป็นสิ่งจำเป็นในการปรับปรุงชุดข้อมูล ขยายขอบเขตครอบคลุม และรับรองว่าภาษาถิ่นอาหรับจะได้รับความสนใจตามที่สมควรในการประเมินโมเดลภาษาขนาดใหญ่

#Alyah #ภาษาถิ่นอาหรับ #LLM #AI

ขอบคุณ แหล่งข้อมูล
https://huggingface.co/blog/tiiuae/emirati-benchmarks

Alyah ⭐️: การประเมินความสามารถของภาษาถิ่นเอมิเรตส์ในโมเดลภาษาขนาดใหญ่ (LLM)ภาษาอาหรับเป็นภาษาที่มีผู้พูดมากที่สุดภาษาหนึ่งของโลก โดยมีผู้พูดหลายร้อยล้านคนในกว่ายี่สิบประเทศ อย่างไรก็ตาม ภาษาอาหรับไม่ใช่ภาษาเดียวที่ตายตัว ภาษาอาหรับมาตรฐานสมัยใหม่ (Modern Standard Arabic - MSA) ดำรงอยู่ร่วมกับภาษาถิ่นหลากหลายรูปแบบ ซึ่งมีความแตกต่างกันอย่างมากในด้านคำศัพท์ ไวยากรณ์ การออกเสียง และรากฐานทางวัฒนธรรม ภาษาถิ่นเหล่านี้เป็นสื่อกลางหลักในการสื่อสารประจำวัน การเล่าเรื่อง การประพันธ์บทกวี และปฏิสัมพันธ์ทางสังคม แต่ส่วนใหญ่แล้ว การประเมินโมเดลภาษาขนาดใหญ่ (LLM) สำหรับภาษาอาหรับที่มีอยู่ มักจะเน้นไปที่ MSA เป็นหลัก ทำให้ภาษาถิ่นอาหรับยังคงขาดการประเมินและเป็นตัวแทนที่น้อยมากช่องว่างนี้เป็นปัญหาอย่างยิ่ง เมื่อ LLM มีปฏิสัมพันธ์กับผู้ใช้ในบริบทที่ไม่เป็นทางการ มีรากฐานทางวัฒนธรรม และเป็นการสนทนามากขึ้น โมเดลที่ทำงานได้ดีกับข้อความข่าวที่เป็นทางการ อาจยังคงล้มเหลวในการทำความเข้าใจคำทักทาย สำนวน หรือเรื่องเล่าสั้นๆ ที่แสดงออกด้วยภาษาถิ่นในท้องถิ่น เพื่อแก้ไขข้อจำกัดนี้ ทีมวิจัยของเราได้เปิดตัว Alyah الياه (ซึ่งหมายถึง ดาวเหนือ ⭐️ ในภาษาถิ่นเอมิเรตส์) ซึ่งเป็นชุดประเมินที่เน้นภาษาถิ่นเอมิเรตส์โดยเฉพาะ ออกแบบมาเพื่อวัดว่า LLM ภาษาอาหรับสามารถจับแง่มุมทางภาษา วัฒนธรรม และการใช้งานภาษาถิ่นเอมิเรตส์ได้ดีเพียงใดแรงจูงใจและขอบเขตของชุดประเมินภาษาถิ่นเอมิเรตส์มีความเชื่อมโยงอย่างลึกซึ้งกับวัฒนธรรม มรดก และประวัติศาสตร์ท้องถิ่น ปรากฏในคำทักทายประจำวัน บทกวีที่เล่าด้วยปากเปล่า สุภาษิต นิทานพื้นบ้าน และสำนวนต่างๆ ที่ความหมายไม่สามารถอนุมานได้จากการแปลตรงตัวเพียงอย่างเดียว ชุดประเมินของเราได้รับการออกแบบมาโดยเจตนาเพื่อสำรวจความลึกซึ้งนี้ แทนที่จะทดสอบความรู้คำศัพท์ในระดับผิวเผิน ชุดประเมินนี้ท้าทายโมเดลในความสามารถในการตีความความหมายที่ฝังอยู่ในวัฒนธรรม การใช้งานเชิงปฏิบัติ และความแตกต่างเฉพาะของภาษาถิ่นชุดประเมินครอบคลุมเนื้อหาที่หลากหลาย รวมถึงสำนวนท้องถิ่นทั่วไปและไม่ธรรมดา คำทักทายที่มีรากฐานทางวัฒนธรรม เรื่องเล่าสั้นๆ คำถามเกี่ยวกับมรดก และการอ้างอิงถึงบทกวีของเอมิเรตส์ เป้าหมายไม่ใช่เพียงแค่การวัดความถูกต้องเท่านั้น แต่ยังรวมถึงการทำความเข้าใจว่าโมเดลประสบความสำเร็จหรือล้มเหลวอย่างเป็นระบบเมื่อเผชิญกับการใช้ภาษาเอมิเรตส์ที่แท้จริงหลังจากพัฒนาและรวบรวมข้อมูลเพิ่มเติม ชุดประเมินได้รับการรวมเป็นชุดข้อมูลเดียวที่เรียกว่า Alyah ชุดประเมินสุดท้ายประกอบด้วย 1,173 ตัวอย่าง ซึ่งทั้งหมดรวบรวมด้วยตนเองจากเจ้าของภาษาเอมิเรตส์ เพื่อให้มั่นใจถึงความถูกต้องทางภาษาและรากฐานทางวัฒนธรรม ขั้นตอนการคัดสรรด้วยตนเองนี้มีความสำคัญอย่างยิ่งในการจับสำนวน ความหมาย และการใช้งานที่มักไม่ค่อยมีบันทึกในแหล่งข้อมูลที่เป็นลายลักษณ์อักษร และยากต่อการอนุมานจากภาษาอาหรับมาตรฐานสมัยใหม่เพียงอย่างเดียวแต่ละตัวอย่างถูกสร้างขึ้นเป็นคำถามแบบเลือกตอบ โดยมีตัวเลือกสี่ข้อ ซึ่งมีเพียงข้อเดียวที่ถูกต้อง โมเดลภาษาขนาดใหญ่ถูกนำมาใช้เพื่อสร้างตัวเลือกที่ทำให้ไขว้เขลา (distractors) อย่างสังเคราะห์ จากนั้นจึงตรวจสอบเพื่อให้แน่ใจว่ามีความเป็นไปได้และความใกล้เคียงทางความหมายกับคำตอบที่ถูกต้อง เพื่อหลีกเลี่ยงอคติเชิงตำแหน่งระหว่างการประเมิน ดัชนีของคำตอบที่ถูกต้องจะมีการกระจายแบบสุ่มตลอดทั้งชุดข้อมูลAlyah ครอบคลุมปรากฏการณ์ทางภาษาและวัฒนธรรมที่หลากหลายในภาษาถิ่นเอมิเรตส์ ตั้งแต่สำนวนในชีวิตประจำวันไปจนถึงภาษาที่ละเอียดอ่อนทางวัฒนธรรมและภาษาเชิงเปรียบเทียบตัวอย่างหมวดหมู่:คำทักทายและการแสดงออกในชีวิตประจำวัน: การทักทายทั่วไป สำนวนที่ใช้บ่อยภาษาและภาษาถิ่น: คำศัพท์และสำนวนเฉพาะถิ่นบทกวีและงานสร้างสรรค์: การอ้างอิงถึงบทกวีและรูปแบบการเขียนเชิงสร้างสรรค์มรดกและประวัติศาสตร์: คำถามเกี่ยวกับประวัติศาสตร์และมรดกทางวัฒนธรรมมารยาทและค่านิยม: การแสดงออกที่เกี่ยวข้องกับบรรทัดฐานทางสังคมและค่านิยมภาพพจน์และความหมายเชิงเปรียบเทียบ: การตีความสำนวนหรือการใช้ภาษาที่ไม่ได้ตรงตัวองค์ประกอบเหล่านี้ช่วยให้ Alyah สามารถประเมินความคล่องแคล่วในการสนทนาในระดับผิวเผิน ควบคู่ไปกับความเข้าใจเชิงวัฒนธรรม ความหมาย และการใช้งานเชิงปฏิบัติที่ลึกซึ้งยิ่งขึ้น โดยให้ความสำคัญเป็นพิเศษกับปรากฏการณ์ทางภาษาเฉพาะถิ่นที่ยังคงเป็นความท้าทายสำหรับโมเดลปัจจุบันการตั้งค่าการประเมินโมเดลเราได้ประเมินโมเดลภาษาทั้งหมด 54 โมเดล ประกอบด้วยโมเดลพื้นฐาน 23 โมเดล และโมเดลที่ผ่านการปรับแต่งคำสั่ง (instruction-tuned) 31 โมเดล โดยครอบคลุมสถาปัตยกรรมและแนวทางการฝึกอบรมที่หลากหลาย ซึ่งรวมถึง LLM ที่เน้นภาษาอาหรับโดยเฉพาะ เช่น Jais และ Allam, โมเดลหลายภาษาที่มีการรองรับภาษาอาหรับที่ดี เช่น Qwen และ LLaMA, และโมเดลที่ปรับแต่งหรือเฉพาะภูมิภาค เช่น Fanar และ AceGPT สำหรับแต่ละตระกูล ทั้งรุ่นพื้นฐานและรุ่นที่ผ่านการปรับแต่งคำสั่งได้รับการประเมิน เพื่อทำความเข้าใจผลกระทบของการปรับแนว (alignment) และการปรับแต่งคำสั่งต่อประสิทธิภาพของภาษาถิ่นโมเดลทั้งหมดได้รับการประเมินภายใต้โปรโตคอลการแจ้ง (prompting) และการให้คะแนนที่สอดคล้องกัน การตอบสนองได้รับการประเมินในด้านความถูกต้องทางความหมายและความเหมาะสมกับการใช้งานในเอมิเรตส์ มากกว่าการทับซ้อนของคำตอบกับคำตอบอ้างอิงโดยตรง ซึ่งมีความสำคัญอย่างยิ่งสำหรับการประเมินภาษาถิ่น ซึ่งอาจมีรูปแบบการใช้ที่ถูกต้องได้หลายแบบสำหรับแต่ละหมวดหมู่คำถาม เราได้ประมาณความยากโดยอาศัยประสิทธิภาพของโมเดล หมวดหมู่ที่โมเดลส่วนใหญ่ประสบปัญหาจะถูกระบุว่ายากกว่า ในขณะที่หมวดหมู่ที่ได้รับการตอบอย่างถูกต้องอย่างสม่ำเสมอในทุกตระกูลโมเดลจะถือว่าง่ายกว่า แนวทางนี้ช่วยให้ความยากปรากฏจากพฤติกรรมที่สังเกตได้ แทนที่จะมาจากการระบุด้วยการตัดสินใจส่วนบุคคลเพียงอย่างเดียวผลการประเมินบน Alyah (ภาษาถิ่นเอมิเรตส์)เราได้ประเมินชุดโมเดลภาษาขนาดใหญ่สำหรับภาษาอาหรับและโมเดลหลายภาษาที่ทันสมัยจำนวนมากบน Alyah โดยใช้ความแม่นยำในคำถามแบบเลือกตอบเป็นตัวชี้วัดหลัก การประเมินครอบคลุมโมเดลทั้งหมด 53 โมเดล ได้แก่ โมเดลพื้นฐาน 22 โมเดล และโมเดลที่ผ่านการปรับแต่งคำสั่ง 31 โมเดล โดยครอบคลุมระบบที่เน้นภาษาอาหรับโดยเฉพาะ โมเดลหลายภาษา และระบบที่ปรับแต่งตามภูมิภาคผลลัพธ์เหล่านี้มีไว้เพื่อเป็น การวัดอ้างอิงภายในขอบเขตของ Alyah ไม่ใช่การจัดอันดับสัมบูรณ์ในชุดประเมินภาษาอาหรับทั้งหมดโมเดลที่ผ่านการปรับแต่งคำสั่ง (Instruction-Tuned Models)การวิเคราะห์และแนวโน้มที่สังเกตได้มีแนวโน้มหลายประการที่ปรากฏจากการประเมิน โดยทั่วไปแล้ว โมเดลที่ผ่านการปรับแต่งคำสั่งจะทำงานได้ดีกว่าโมเดลพื้นฐานอย่างเห็นได้ชัด โดยเฉพาะอย่างยิ่งในคำถามที่เกี่ยวข้องกับบรรทัดฐานการสนทนาและการตอบสนองที่เหมาะสมทางวัฒนธรรม (เช่น หมวดมารยาทและค่านิยม) นอกจากนี้ยังเป็นกรณีสำหรับคำถามที่ทดสอบภาพพจน์และความหมายเชิงเปรียบเทียบ ซึ่งสามารถอธิบายได้ว่าโมเดลมีความสามารถดั้งเดิมที่แข็งแกร่งในการทำความเข้าใจภาพพจน์และความหมายเชิงเปรียบเทียบที่อิงจาก MSA โดยไม่คำนึงถึงภาษาถิ่น หมวดหมู่ที่ยากที่สุดสำหรับโมเดลโดยทั่วไปคือ "ภาษาและภาษาถิ่น" และ "คำทักทายและการแสดงออกในชีวิตประจำวัน" ในทุกขนาดของโมเดล ซึ่งสะท้อนให้เห็นถึงสถานะปัจจุบันของการปรากฏของภาษาถิ่นเอมิเรตส์ในสื่อที่เป็นลายลักษณ์อักษร เนื่องจากภาษาถิ่นส่วนใหญ่จะใช้พูดมากกว่าเขียน จึงอธิบายถึงความแปลกใหม่เมื่อเทียบกับโมเดลที่ประเมิน อย่างไรก็ตาม มีประโยชน์ที่ชัดเจนในการปรับแต่งโมเดลให้เข้าใจภาษาถิ่น (และหมวดหมู่อื่นๆ) เมื่อเทียบกับโมเดลคู่ขนาน โดยเฉพาะอย่างยิ่งในโมเดลขนาดเล็กและขนาดกลางแม้แต่โมเดลหลายภาษาที่แข็งแกร่งก็แสดงให้เห็นถึงความเสื่อมที่สังเกตได้ในคำถาม Alyah ที่ท้าทายที่สุด ซึ่งชี้ให้เห็นว่าความรู้ทางความหมายเฉพาะถิ่นนั้นไม่ได้ถูกเรียนรู้ได้ง่ายจากการฝึกอบรมหลายภาษาทั่วไปเพียงอย่างเดียว จำเป็นต้องมีการฝึกอบรมเฉพาะ แม้ว่าโมเดลที่เน้นภาษาอาหรับโดยเฉพาะมีแนวโน้มที่จะทำงานได้ดีขึ้นกับเนื้อหาที่มีรากฐานทางวัฒนธรรม แต่ประสิทธิภาพของโมเดลเหล่านี้ก็ไม่สม่ำเสมอในทุกหมวดหมู่ โดยเฉพาะอย่างยิ่งคำถามที่เกี่ยวข้องกับความหมายโดยนัยและสำนวนที่หายากยังคงเป็นเรื่องยากสำหรับโมเดลเกือบทั้งหมด สิ่งนี้เน้นย้ำถึงช่องว่างที่ยังคงอยู่ระหว่างความคุ้นเคยกับภาษาถิ่นในระดับผิวเผินและความเข้าใจทางวัฒนธรรมที่ลึกซึ้งยิ่งขึ้น ความแปรปรวนของประสิทธิภาพในหมวดหมู่ต่างๆ บ่งชี้ว่าความสามารถทางภาษาถิ่นนั้นมีหลายมิติและไม่สามารถวัดได้ด้วยคะแนนเดียวบทสรุปและผลกระทบต่อชุมชนชุดประเมินนี้เป็นก้าวสำคัญสู่การประเมินโมเดลภาษาอาหรับที่สมจริงและมีรากฐานทางวัฒนธรรมมากขึ้น ด้วยการมุ่งเน้นไปที่ภาษาถิ่นเอมิเรตส์ เรามุ่งหวังที่จะสนับสนุนการพัฒนาโมเดลที่ให้บริการชุมชน สถาบัน และผู้ใช้ในสหรัฐอาหรับเอมิเรตส์ได้ดียิ่งขึ้น นอกเหนือจากการจัดอันดับโมเดลแล้ว ชุดประเมินนี้มีจุดประสงค์เพื่อเป็นเครื่องมือในการวินิจฉัยเพื่อชี้นำความพยายามในการรวบรวมข้อมูล การฝึกอบรม และการปรับใช้ในอนาคตเราขอเชิญนักวิจัย ผู้ปฏิบัติงาน และชุมชนในวงกว้างให้ใช้ชุดประเมินนี้ สำรวจผลลัพธ์ และแบ่งปันข้อเสนอแนะ การมีส่วนร่วมของชุมชนจะเป็นสิ่งจำเป็นในการปรับปรุงชุดข้อมูล ขยายขอบเขตครอบคลุม และรับรองว่าภาษาถิ่นอาหรับจะได้รับความสนใจตามที่สมควรในการประเมินโมเดลภาษาขนาดใหญ่#Alyah #ภาษาถิ่นอาหรับ #LLM #AIhttps://huggingface.co/blog/tiiuae/emirati-benchmarks
4 Yorumlar 0 hisse senetleri 293 Views 0 önizleme