Open ASR Leaderboard: ยกระดับการประเมินโมเดลรู้จำเสียงพูดด้วยชุดข้อมูลส่วนตัว

การพัฒนาเทคโนโลยีการรู้จำเสียงพูดอัตโนมัติ (Automatic Speech Recognition - ASR) กำลังก้าวหน้าอย่างรวดเร็ว แต่การวัดประสิทธิภาพของโมเดลให้สะท้อนการใช้งานจริงได้อย่างแม่นยำนั้นเป็นความท้าทายสำคัญ Hugging Face ได้เปิดตัว Open ASR Leaderboard เพื่อเป็นเวทีกลางในการประเมินและเปรียบเทียบโมเดล ASR ต่างๆ โดยล่าสุดได้มีการเพิ่มชุดข้อมูลคุณภาพสูงที่ถูกเก็บเป็นส่วนตัว เพื่อยกระดับความน่าเชื่อถือและลดปัญหา "Benchmaxxing" หรือการปรับแต่งโมเดลให้ทำคะแนนได้ดีบนชุดข้อมูลทดสอบสาธารณะโดยเฉพาะ

ความสำคัญของ Open ASR Leaderboard

ตั้งแต่เปิดตัวในเดือนกันยายน 2566 Open ASR Leaderboard ได้รับความสนใจจากชุมชนนักพัฒนาและนักวิจัยเป็นอย่างมาก โดยมีผู้เข้าชมกว่า 710,000 ครั้ง สะท้อนถึงความต้องการเครื่องมือที่เป็นมาตรฐานในการประเมินโมเดล ASR หัวใจสำคัญของการรักษา Benchmark ที่มีคุณภาพประกอบด้วย:

  • การสร้างมาตรฐาน (Standardization): โมเดลและชุดข้อมูล ASR มักมีรูปแบบการใช้งานและผลลัพธ์ที่แตกต่างกัน เช่น การมีหรือไม่มีเครื่องหมายวรรคตอนและตัวพิมพ์ใหญ่ การจัดระเบียบชุดข้อมูลทดสอบทั้งหมดให้อยู่ในรูปแบบเดียวกันบน Hugging Face Hub และการใช้ Normalizer เพื่อปรับผลลัพธ์ของโมเดลและข้อความถอดเสียงให้เป็นมาตรฐานเดียวกัน (เช่น การลบเครื่องหมายวรรคตอน ตัวพิมพ์ใหญ่ และใช้การสะกดแบบอเมริกัน) ช่วยให้การเปรียบเทียบมีความยุติธรรม
  • ความเป็นอิสระ (Openness): การเปิดเผยซอร์สโค้ด UI และสคริปต์การประเมิน ช่วยให้ชุมชนสามารถเข้ามามีส่วนร่วมในการปรับปรุงคุณภาพกระบวนการประเมิน และเพิ่มโมเดลใหม่ๆ ได้อย่างต่อเนื่อง

รับมือกับ "Benchmaxxing" ด้วยชุดข้อมูลส่วนตัว

แม้ว่าความเป็นอิสระและการสร้างมาตรฐานจะเป็นสิ่งจำเป็น แต่ก็เปิดช่องให้เกิดการปรับแต่งโมเดลให้มีประสิทธิภาพเฉพาะบน Leaderboard โดยไม่สะท้อนความสามารถในการใช้งานจริง หรือที่เรียกว่า "Benchmaxxing" เพื่อแก้ไขปัญหานี้ Hugging Face ได้ร่วมมือกับ Appen Inc. และ DataoceanAI ในการจัดหาชุดข้อมูล ASR คุณภาพสูงเพิ่มเติม ซึ่งครอบคลุมทั้งเสียงพูดตามสคริปต์ (Scripted Speech) และเสียงพูดสนทนา (Conversational Speech) จากสำเนียงที่หลากหลาย

ทำไมต้องใช้ชุดข้อมูลส่วนตัว?

การใช้ชุดข้อมูลส่วนตัวอาจดูขัดแย้งกับหลักการ "Openness" แต่ Hugging Face เชื่อว่าการผนวกรวมชุดข้อมูลเหล่านี้จะช่วยเพิ่มความน่าเชื่อถือให้กับ Open ASR Leaderboard ได้อย่างมาก เนื่องจากมีโอกาสน้อยกว่าที่จะถูกนำไปใช้เพื่อการ Benchmaxxing ไม่ว่าจะเป็นโดยผู้พัฒนาโมเดลที่ใช้ชุดข้อมูลทดสอบสาธารณะโดยตรง หรือพยายามหาข้อมูลฝึกที่คล้ายคลึงกับชุดข้อมูลเฉพาะเพื่อเพิ่มคะแนน

นอกจากนี้ ชุดข้อมูลส่วนตัวยังช่วยให้สามารถวัดผลและระบุช่องว่างหรืออคติของโมเดลในสถานการณ์ที่แตกต่างกันได้อย่างชัดเจนยิ่งขึ้น เช่น การเปรียบเทียบระหว่างสภาวะที่ควบคุมได้ (Scripted, American accent) กับสภาวะที่ซับซ้อนกว่า (Conversational, non-American accents)

การวัดผลและตัวชี้วัดใหม่

Open ASR Leaderboard ได้เพิ่มแท็บ "Private data" เพื่อแสดงผลลัพธ์บนชุดข้อมูลส่วนตัว โดยมีการคำนวณตัวชี้วัดต่างๆ ดังนี้:

  • Average WER: ค่าเฉลี่ยถ่วงน้ำหนักของชุดข้อมูลทั้งหมด (โดยค่าเริ่มต้นจะคำนวณจากชุดข้อมูลสาธารณะเท่านั้น)
  • Avg Scripted: ค่าเฉลี่ยของชุดข้อมูลที่บันทึกตามสคริปต์ทั้งหมด
  • Avg Conversational: ค่าเฉลี่ยของชุดข้อมูลเสียงพูดสนทนาทั้งหมด
  • Avg US: ค่าเฉลี่ยของชุดข้อมูลที่มีสำเนียงอเมริกัน
  • Avg non-US: ค่าเฉลี่ยของชุดข้อมูลที่มีสำเนียงนอกเหนือจากอเมริกัน

Hugging Face จงใจไม่แสดงคะแนนแยกตามผู้ให้บริการข้อมูลหรือสำเนียงแต่ละประเภท เพื่อป้องกันไม่ให้ผู้พัฒนามุ่งเน้นปรับปรุงประสิทธิภาพเฉพาะจุดใดจุดหนึ่ง

วิธีการส่งโมเดลเข้าร่วมประเมิน

หากต้องการนำโมเดล ASR ของคุณมาทดสอบบน Open ASR Leaderboard สามารถทำได้ผ่าน GitHub Repository ของ Leaderboard:

  1. เปิด Pull Request: พร้อมทั้งกรอกข้อมูลตาม Checklist ที่ปรากฏ
  2. รายงานผลบนชุดข้อมูลสาธารณะ: เช่น

ขอบคุณ แหล่งข้อมูล
https://huggingface.co/blog/open-asr-leaderboard-private-data

Open ASR Leaderboard: ยกระดับการประเมินโมเดลรู้จำเสียงพูดด้วยชุดข้อมูลส่วนตัวการพัฒนาเทคโนโลยีการรู้จำเสียงพูดอัตโนมัติ (Automatic Speech Recognition - ASR) กำลังก้าวหน้าอย่างรวดเร็ว แต่การวัดประสิทธิภาพของโมเดลให้สะท้อนการใช้งานจริงได้อย่างแม่นยำนั้นเป็นความท้าทายสำคัญ Hugging Face ได้เปิดตัว Open ASR Leaderboard เพื่อเป็นเวทีกลางในการประเมินและเปรียบเทียบโมเดล ASR ต่างๆ โดยล่าสุดได้มีการเพิ่มชุดข้อมูลคุณภาพสูงที่ถูกเก็บเป็นส่วนตัว เพื่อยกระดับความน่าเชื่อถือและลดปัญหา "Benchmaxxing" หรือการปรับแต่งโมเดลให้ทำคะแนนได้ดีบนชุดข้อมูลทดสอบสาธารณะโดยเฉพาะความสำคัญของ Open ASR Leaderboardตั้งแต่เปิดตัวในเดือนกันยายน 2566 Open ASR Leaderboard ได้รับความสนใจจากชุมชนนักพัฒนาและนักวิจัยเป็นอย่างมาก โดยมีผู้เข้าชมกว่า 710,000 ครั้ง สะท้อนถึงความต้องการเครื่องมือที่เป็นมาตรฐานในการประเมินโมเดล ASR หัวใจสำคัญของการรักษา Benchmark ที่มีคุณภาพประกอบด้วย:การสร้างมาตรฐาน (Standardization): โมเดลและชุดข้อมูล ASR มักมีรูปแบบการใช้งานและผลลัพธ์ที่แตกต่างกัน เช่น การมีหรือไม่มีเครื่องหมายวรรคตอนและตัวพิมพ์ใหญ่ การจัดระเบียบชุดข้อมูลทดสอบทั้งหมดให้อยู่ในรูปแบบเดียวกันบน Hugging Face Hub และการใช้ Normalizer เพื่อปรับผลลัพธ์ของโมเดลและข้อความถอดเสียงให้เป็นมาตรฐานเดียวกัน (เช่น การลบเครื่องหมายวรรคตอน ตัวพิมพ์ใหญ่ และใช้การสะกดแบบอเมริกัน) ช่วยให้การเปรียบเทียบมีความยุติธรรมความเป็นอิสระ (Openness): การเปิดเผยซอร์สโค้ด UI และสคริปต์การประเมิน ช่วยให้ชุมชนสามารถเข้ามามีส่วนร่วมในการปรับปรุงคุณภาพกระบวนการประเมิน และเพิ่มโมเดลใหม่ๆ ได้อย่างต่อเนื่องรับมือกับ "Benchmaxxing" ด้วยชุดข้อมูลส่วนตัวแม้ว่าความเป็นอิสระและการสร้างมาตรฐานจะเป็นสิ่งจำเป็น แต่ก็เปิดช่องให้เกิดการปรับแต่งโมเดลให้มีประสิทธิภาพเฉพาะบน Leaderboard โดยไม่สะท้อนความสามารถในการใช้งานจริง หรือที่เรียกว่า "Benchmaxxing" เพื่อแก้ไขปัญหานี้ Hugging Face ได้ร่วมมือกับ Appen Inc. และ DataoceanAI ในการจัดหาชุดข้อมูล ASR คุณภาพสูงเพิ่มเติม ซึ่งครอบคลุมทั้งเสียงพูดตามสคริปต์ (Scripted Speech) และเสียงพูดสนทนา (Conversational Speech) จากสำเนียงที่หลากหลายทำไมต้องใช้ชุดข้อมูลส่วนตัว?การใช้ชุดข้อมูลส่วนตัวอาจดูขัดแย้งกับหลักการ "Openness" แต่ Hugging Face เชื่อว่าการผนวกรวมชุดข้อมูลเหล่านี้จะช่วยเพิ่มความน่าเชื่อถือให้กับ Open ASR Leaderboard ได้อย่างมาก เนื่องจากมีโอกาสน้อยกว่าที่จะถูกนำไปใช้เพื่อการ Benchmaxxing ไม่ว่าจะเป็นโดยผู้พัฒนาโมเดลที่ใช้ชุดข้อมูลทดสอบสาธารณะโดยตรง หรือพยายามหาข้อมูลฝึกที่คล้ายคลึงกับชุดข้อมูลเฉพาะเพื่อเพิ่มคะแนนนอกจากนี้ ชุดข้อมูลส่วนตัวยังช่วยให้สามารถวัดผลและระบุช่องว่างหรืออคติของโมเดลในสถานการณ์ที่แตกต่างกันได้อย่างชัดเจนยิ่งขึ้น เช่น การเปรียบเทียบระหว่างสภาวะที่ควบคุมได้ (Scripted, American accent) กับสภาวะที่ซับซ้อนกว่า (Conversational, non-American accents)การวัดผลและตัวชี้วัดใหม่Open ASR Leaderboard ได้เพิ่มแท็บ "Private data" เพื่อแสดงผลลัพธ์บนชุดข้อมูลส่วนตัว โดยมีการคำนวณตัวชี้วัดต่างๆ ดังนี้:Average WER: ค่าเฉลี่ยถ่วงน้ำหนักของชุดข้อมูลทั้งหมด (โดยค่าเริ่มต้นจะคำนวณจากชุดข้อมูลสาธารณะเท่านั้น)Avg Scripted: ค่าเฉลี่ยของชุดข้อมูลที่บันทึกตามสคริปต์ทั้งหมดAvg Conversational: ค่าเฉลี่ยของชุดข้อมูลเสียงพูดสนทนาทั้งหมดAvg US: ค่าเฉลี่ยของชุดข้อมูลที่มีสำเนียงอเมริกันAvg non-US: ค่าเฉลี่ยของชุดข้อมูลที่มีสำเนียงนอกเหนือจากอเมริกันHugging Face จงใจไม่แสดงคะแนนแยกตามผู้ให้บริการข้อมูลหรือสำเนียงแต่ละประเภท เพื่อป้องกันไม่ให้ผู้พัฒนามุ่งเน้นปรับปรุงประสิทธิภาพเฉพาะจุดใดจุดหนึ่งวิธีการส่งโมเดลเข้าร่วมประเมินหากต้องการนำโมเดล ASR ของคุณมาทดสอบบน Open ASR Leaderboard สามารถทำได้ผ่าน GitHub Repository ของ Leaderboard:เปิด Pull Request: พร้อมทั้งกรอกข้อมูลตาม Checklist ที่ปรากฏรายงานผลบนชุดข้อมูลสาธารณะ: เช่นhttps://huggingface.co/blog/open-asr-leaderboard-private-data
Shared content
HUGGINGFACE.CO
Adding Benchmaxxer Repellant to the Open ASR Leaderboard
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
2 Comments 0 Shares 322 Views 0 Reviews