Open ASR Leaderboard: ยกระดับการประเมินโมเดลรู้จำเสียงพูดด้วยชุดข้อมูลส่วนตัว
การพัฒนาเทคโนโลยีการรู้จำเสียงพูดอัตโนมัติ (Automatic Speech Recognition - ASR) กำลังก้าวหน้าอย่างรวดเร็ว แต่การวัดประสิทธิภาพของโมเดลให้สะท้อนการใช้งานจริงได้อย่างแม่นยำนั้นเป็นความท้าทายสำคัญ Hugging Face ได้เปิดตัว Open ASR Leaderboard เพื่อเป็นเวทีกลางในการประเมินและเปรียบเทียบโมเดล ASR ต่างๆ โดยล่าสุดได้มีการเพิ่มชุดข้อมูลคุณภาพสูงที่ถูกเก็บเป็นส่วนตัว เพื่อยกระดับความน่าเชื่อถือและลดปัญหา "Benchmaxxing" หรือการปรับแต่งโมเดลให้ทำคะแนนได้ดีบนชุดข้อมูลทดสอบสาธารณะโดยเฉพาะ
ความสำคัญของ Open ASR Leaderboard
ตั้งแต่เปิดตัวในเดือนกันยายน 2566 Open ASR Leaderboard ได้รับความสนใจจากชุมชนนักพัฒนาและนักวิจัยเป็นอย่างมาก โดยมีผู้เข้าชมกว่า 710,000 ครั้ง สะท้อนถึงความต้องการเครื่องมือที่เป็นมาตรฐานในการประเมินโมเดล ASR หัวใจสำคัญของการรักษา Benchmark ที่มีคุณภาพประกอบด้วย:
- การสร้างมาตรฐาน (Standardization): โมเดลและชุดข้อมูล ASR มักมีรูปแบบการใช้งานและผลลัพธ์ที่แตกต่างกัน เช่น การมีหรือไม่มีเครื่องหมายวรรคตอนและตัวพิมพ์ใหญ่ การจัดระเบียบชุดข้อมูลทดสอบทั้งหมดให้อยู่ในรูปแบบเดียวกันบน Hugging Face Hub และการใช้ Normalizer เพื่อปรับผลลัพธ์ของโมเดลและข้อความถอดเสียงให้เป็นมาตรฐานเดียวกัน (เช่น การลบเครื่องหมายวรรคตอน ตัวพิมพ์ใหญ่ และใช้การสะกดแบบอเมริกัน) ช่วยให้การเปรียบเทียบมีความยุติธรรม
- ความเป็นอิสระ (Openness): การเปิดเผยซอร์สโค้ด UI และสคริปต์การประเมิน ช่วยให้ชุมชนสามารถเข้ามามีส่วนร่วมในการปรับปรุงคุณภาพกระบวนการประเมิน และเพิ่มโมเดลใหม่ๆ ได้อย่างต่อเนื่อง
รับมือกับ "Benchmaxxing" ด้วยชุดข้อมูลส่วนตัว
แม้ว่าความเป็นอิสระและการสร้างมาตรฐานจะเป็นสิ่งจำเป็น แต่ก็เปิดช่องให้เกิดการปรับแต่งโมเดลให้มีประสิทธิภาพเฉพาะบน Leaderboard โดยไม่สะท้อนความสามารถในการใช้งานจริง หรือที่เรียกว่า "Benchmaxxing" เพื่อแก้ไขปัญหานี้ Hugging Face ได้ร่วมมือกับ Appen Inc. และ DataoceanAI ในการจัดหาชุดข้อมูล ASR คุณภาพสูงเพิ่มเติม ซึ่งครอบคลุมทั้งเสียงพูดตามสคริปต์ (Scripted Speech) และเสียงพูดสนทนา (Conversational Speech) จากสำเนียงที่หลากหลาย
ทำไมต้องใช้ชุดข้อมูลส่วนตัว?
การใช้ชุดข้อมูลส่วนตัวอาจดูขัดแย้งกับหลักการ "Openness" แต่ Hugging Face เชื่อว่าการผนวกรวมชุดข้อมูลเหล่านี้จะช่วยเพิ่มความน่าเชื่อถือให้กับ Open ASR Leaderboard ได้อย่างมาก เนื่องจากมีโอกาสน้อยกว่าที่จะถูกนำไปใช้เพื่อการ Benchmaxxing ไม่ว่าจะเป็นโดยผู้พัฒนาโมเดลที่ใช้ชุดข้อมูลทดสอบสาธารณะโดยตรง หรือพยายามหาข้อมูลฝึกที่คล้ายคลึงกับชุดข้อมูลเฉพาะเพื่อเพิ่มคะแนน
นอกจากนี้ ชุดข้อมูลส่วนตัวยังช่วยให้สามารถวัดผลและระบุช่องว่างหรืออคติของโมเดลในสถานการณ์ที่แตกต่างกันได้อย่างชัดเจนยิ่งขึ้น เช่น การเปรียบเทียบระหว่างสภาวะที่ควบคุมได้ (Scripted, American accent) กับสภาวะที่ซับซ้อนกว่า (Conversational, non-American accents)
การวัดผลและตัวชี้วัดใหม่
Open ASR Leaderboard ได้เพิ่มแท็บ "Private data" เพื่อแสดงผลลัพธ์บนชุดข้อมูลส่วนตัว โดยมีการคำนวณตัวชี้วัดต่างๆ ดังนี้:
- Average WER: ค่าเฉลี่ยถ่วงน้ำหนักของชุดข้อมูลทั้งหมด (โดยค่าเริ่มต้นจะคำนวณจากชุดข้อมูลสาธารณะเท่านั้น)
- Avg Scripted: ค่าเฉลี่ยของชุดข้อมูลที่บันทึกตามสคริปต์ทั้งหมด
- Avg Conversational: ค่าเฉลี่ยของชุดข้อมูลเสียงพูดสนทนาทั้งหมด
- Avg US: ค่าเฉลี่ยของชุดข้อมูลที่มีสำเนียงอเมริกัน
- Avg non-US: ค่าเฉลี่ยของชุดข้อมูลที่มีสำเนียงนอกเหนือจากอเมริกัน
Hugging Face จงใจไม่แสดงคะแนนแยกตามผู้ให้บริการข้อมูลหรือสำเนียงแต่ละประเภท เพื่อป้องกันไม่ให้ผู้พัฒนามุ่งเน้นปรับปรุงประสิทธิภาพเฉพาะจุดใดจุดหนึ่ง
วิธีการส่งโมเดลเข้าร่วมประเมิน
หากต้องการนำโมเดล ASR ของคุณมาทดสอบบน Open ASR Leaderboard สามารถทำได้ผ่าน GitHub Repository ของ Leaderboard:
- เปิด Pull Request: พร้อมทั้งกรอกข้อมูลตาม Checklist ที่ปรากฏ
- รายงานผลบนชุดข้อมูลสาธารณะ: เช่น
ขอบคุณ แหล่งข้อมูล
https://huggingface.co/blog/open-asr-leaderboard-private-data