Community Evals: เปิดมิติใหม่แห่งการประเมินผล AI โปร่งใส ตรวจสอบได้ โดยชุมชน

ในยุคที่ AI พัฒนาไปอย่างรวดเร็ว การวัดผลและเปรียบเทียบประสิทธิภาพของโมเดล AI กลายเป็นเรื่องท้าทายที่สำคัญ ยิ่งไปกว่านั้น ความน่าเชื่อถือของ "กระดานผู้นำ" (Leaderboards) ที่มักเป็นแบบกล่องดำ (Black-box) ก็ถูกตั้งคำถามอย่างต่อเนื่อง Hugging Face จึงได้เปิดตัว Community Evals เพื่อปฏิวัติวงการประเมินผล AI สู่ความโปร่งใส ตรวจสอบได้ และขับเคลื่อนโดยชุมชนผู้ใช้งานอย่างแท้จริง

ทำไมการประเมินผล AI แบบเดิมจึงมีปัญหา? ⚠️

ปัจจุบัน แม้ว่าโมเดล AI จะทำคะแนนได้สูงในชุดข้อมูลทดสอบมาตรฐาน (Benchmark datasets) เช่น MMLU, GSM8K หรือ HumanEval แต่ในโลกแห่งความเป็นจริง โมเดลเหล่านั้นกลับยังคงมีปัญหาในการทำงานที่ซับซ้อน เช่น การท่องเว็บ การเขียนโค้ดสำหรับใช้งานจริง หรือการจัดการงานที่ต้องทำหลายขั้นตอนโดยไม่เกิดอาการหลอน (Hallucination)

นอกจากนี้ ยังมีความไม่สอดคล้องกันของคะแนนที่รายงานจากแหล่งต่าง ๆ ทั้งใน Model Cards, เอกสารงานวิจัย (Papers) หรือแพลตฟอร์มประเมินผลอื่น ๆ ทำให้ชุมชนขาด "แหล่งความจริงเดียว" (Single source of truth) ที่เชื่อถือได้

Community Evals: ก้าวสู่การประเมินผล AI ที่กระจายศูนย์และโปร่งใส 🤝

Hugging Face Hub กำลังมุ่งหน้าสู่ทิศทางใหม่ในการจัดการการประเมินผล โดยการกระจายอำนาจการรายงานผลและเปิดโอกาสให้ชุมชนผู้ใช้งานสามารถรายงานคะแนนสำหรับ Benchmark ต่าง ๆ ได้อย่างเปิดเผย

สำหรับ Benchmark: Dataset Repos ที่กลายเป็นศูนย์กลาง 📊

  • Repository ของ Dataset สามารถลงทะเบียนเป็น Benchmark ได้แล้ว (เช่น MMLU-Pro, GPQA, HLE ที่พร้อมใช้งานแล้ว)
  • ระบบจะรวบรวมผลการประเมินที่รายงานจากทั่วทั้ง Hub โดยอัตโนมัติ และแสดงผลบนหน้า Dataset Card
  • Benchmark จะกำหนดสเปกการประเมินผ่านไฟล์ eval.yaml ตามรูปแบบ Inspect AI ทำให้ทุกคนสามารถทำการประเมินซ้ำได้ (Reproducible)
  • ผลการประเมินที่รายงานจะต้องสอดคล้องกับนิยามของ Task นั้น ๆ

สำหรับ Models: ผลคะแนนที่ฝังอยู่ใน Repository 💻

  • ผลคะแนนการประเมินจะถูกจัดเก็บในรูปแบบไฟล์ .eval_results/*.yaml ภายใน Model Repository
  • คะแนนเหล่านี้จะปรากฏบน Model Card และถูกส่งต่อไปยัง Dataset Repository ที่เป็น Benchmark
  • ทั้งผลคะแนนจากผู้พัฒนาโมเดลเอง และ Pull Requests (PR) สำหรับผลคะแนนจากชุมชน จะถูกรวบรวม
  • ผู้พัฒนาโมเดลสามารถเลือกปิด PR หรือซ่อนผลคะแนนบางส่วนได้

สำหรับชุมชน: การมีส่วนร่วมอย่างสร้างสรรค์ 🚀

  • ผู้ใช้งานทุกคนสามารถส่งผลการประเมินสำหรับโมเดลใดก็ได้ผ่าน Pull Request (PR)
  • ผลการประเมินจะถูกแสดงในสถานะ "community" โดยไม่ต้องรอให้ผู้พัฒนาโมเดลอนุมัติ (Merge) หรือปิด PR
  • ชุมชนสามารถอ้างอิงแหล่งที่มาของผลคะแนนได้ เช่น เอกสารงานวิจัย, Model Card, แพลตฟอร์มประเมินผลจากบุคคลที่สาม หรือ Log การประเมิน
  • สามารถพูดคุยถกเถียงเกี่ยวกับคะแนนได้เหมือนกับการรีวิว PR ทั่วไป
  • เนื่องจาก Hub ใช้ระบบ Git จึงมีประวัติการเพิ่มผลการประเมิน การเปลี่ยนแปลงต่าง ๆ ทำให้มีความโปร่งใส

ประโยชน์ที่คาดไม่ถึงจากการกระจายอำนาจการประเมินผล 💡

การกระจายอำนาจการประเมินผลนี้จะช่วยเปิดเผยคะแนนที่มีอยู่แล้วทั่วทั้งชุมชน ซึ่งเดิมอาจกระจายอยู่ในแหล่งต่าง ๆ เช่น Model Cards หรือเอกสารงานวิจัย การเปิดเผยนี้จะช่วยให้ชุมชนสามารถนำข้อมูลไปต่อยอดในการรวบรวม ติดตาม และทำความเข้าใจคะแนนของโมเดลต่าง ๆ ในภาพรวมได้

นอกจากนี้ คะแนนทั้งหมดจะสามารถเข้าถึงได้ผ่าน API ของ Hub ทำให้ง่ายต่อการสร้าง Leaderboards หรือ Dashboards ที่ปรับแต่งได้ตามต้องการ

Community Evals ไม่ได้แทนที่ แต่เสริมพลัง 🌟

Community Evals ไม่ได้มีเป้าหมายเพื่อทดแทน Benchmark เดิม หรือการประเมินผลแบบปิดที่มีผลลัพธ์เผยแพร่ (Closed evals with published results) แต่เป็นการเสริมพลังให้กับวงการด้วยผลการประเมินที่เปิดเผย (Open eval results) บนพื้นฐานของสเปกการประเมินที่สามารถทำซ้ำได้ (Reproducible eval specs)

ถึงแม้ว่าฟีเจอร์นี้อาจไม่สามารถแก้ปัญหา Benchmark Saturation หรือช่องว่างระหว่างคะแนน Benchmark กับประสิทธิภาพจริงได้โดยตรง และอาจไม่สามารถหยุดการเทรนโมเดลบนชุดข้อมูลทดสอบ (Training on test sets) ได้ แต่ก็ทำให้ "เกม" ที่เกิดขึ้นมีความชัดเจนมากขึ้น โดยการเปิดเผยว่าอะไรถูกประเมิน อย่างไร เมื่อไหร่ และโดยใคร

เป้าหมายหลักคือการทำให้ Hugging Face Hub เป็นพื้นที่ที่ทุกคนสามารถเข้ามาสร้างสรรค์และแบ่งปัน Benchmark ที่ทำซ้ำได้ โดยเฉพาะอย่างยิ่งสำหรับ Task และโดเมนใหม่ ๆ ที่ท้าทายโมเดล SOTA (State-of-the-art) มากยิ่งขึ้น


อยากเริ่มต้นใช้งาน?

  • อ่านเอกสารเพิ่มเติม: เรียนรู้เกี่ยวกับผลการประเมินได้ที่ [Docs](ขอบคุณ แหล่งข้อมูล
    https://huggingface.co/docs/hub/evals)
  • เพิ่มผลการประเมินของคุณ: เผยแพร่ผลการประเมินที่คุณได้ทำไว้ในรูปแบบไฟล์ YAML ในโฟลเดอร์ .eval_results/ บน Model Repository ใดก็ได้
  • ตรวจสอบคะแนน: ดูคะแนนบน Dataset ที่เป็น Benchmark ได้ที่ [Hugging Face Hub](ขอบคุณ แหล่งข้อมูล
    https://huggingface.co/datasets)
  • ลงทะเบียน Benchmark ใหม่: เพิ่มไฟล์ eval.yaml ใน Dataset Repository ของคุณ และติดต่อเราเพื่อเข้าร่วมในรายชื่อ Benchmark ที่รองรับ

ฟีเจอร์นี้ยังอยู่ในช่วง Beta เรากำลังพัฒนาอย่างเปิดเผย และยินดีรับฟังความคิดเห็นจากทุกท่าน!

#CommunityEvals #HuggingFace #AI #MachineLearning #OpenSource

ขอบคุณ แหล่งข้อมูล
https://huggingface.co/blog/community-evals

Community Evals: เปิดมิติใหม่แห่งการประเมินผล AI โปร่งใส ตรวจสอบได้ โดยชุมชนในยุคที่ AI พัฒนาไปอย่างรวดเร็ว การวัดผลและเปรียบเทียบประสิทธิภาพของโมเดล AI กลายเป็นเรื่องท้าทายที่สำคัญ ยิ่งไปกว่านั้น ความน่าเชื่อถือของ "กระดานผู้นำ" (Leaderboards) ที่มักเป็นแบบกล่องดำ (Black-box) ก็ถูกตั้งคำถามอย่างต่อเนื่อง Hugging Face จึงได้เปิดตัว Community Evals เพื่อปฏิวัติวงการประเมินผล AI สู่ความโปร่งใส ตรวจสอบได้ และขับเคลื่อนโดยชุมชนผู้ใช้งานอย่างแท้จริงทำไมการประเมินผล AI แบบเดิมจึงมีปัญหา? ⚠️ปัจจุบัน แม้ว่าโมเดล AI จะทำคะแนนได้สูงในชุดข้อมูลทดสอบมาตรฐาน (Benchmark datasets) เช่น MMLU, GSM8K หรือ HumanEval แต่ในโลกแห่งความเป็นจริง โมเดลเหล่านั้นกลับยังคงมีปัญหาในการทำงานที่ซับซ้อน เช่น การท่องเว็บ การเขียนโค้ดสำหรับใช้งานจริง หรือการจัดการงานที่ต้องทำหลายขั้นตอนโดยไม่เกิดอาการหลอน (Hallucination)นอกจากนี้ ยังมีความไม่สอดคล้องกันของคะแนนที่รายงานจากแหล่งต่าง ๆ ทั้งใน Model Cards, เอกสารงานวิจัย (Papers) หรือแพลตฟอร์มประเมินผลอื่น ๆ ทำให้ชุมชนขาด "แหล่งความจริงเดียว" (Single source of truth) ที่เชื่อถือได้Community Evals: ก้าวสู่การประเมินผล AI ที่กระจายศูนย์และโปร่งใส 🤝Hugging Face Hub กำลังมุ่งหน้าสู่ทิศทางใหม่ในการจัดการการประเมินผล โดยการกระจายอำนาจการรายงานผลและเปิดโอกาสให้ชุมชนผู้ใช้งานสามารถรายงานคะแนนสำหรับ Benchmark ต่าง ๆ ได้อย่างเปิดเผยสำหรับ Benchmark: Dataset Repos ที่กลายเป็นศูนย์กลาง 📊Repository ของ Dataset สามารถลงทะเบียนเป็น Benchmark ได้แล้ว (เช่น MMLU-Pro, GPQA, HLE ที่พร้อมใช้งานแล้ว)ระบบจะรวบรวมผลการประเมินที่รายงานจากทั่วทั้ง Hub โดยอัตโนมัติ และแสดงผลบนหน้า Dataset CardBenchmark จะกำหนดสเปกการประเมินผ่านไฟล์ eval.yaml ตามรูปแบบ Inspect AI ทำให้ทุกคนสามารถทำการประเมินซ้ำได้ (Reproducible)ผลการประเมินที่รายงานจะต้องสอดคล้องกับนิยามของ Task นั้น ๆสำหรับ Models: ผลคะแนนที่ฝังอยู่ใน Repository 💻ผลคะแนนการประเมินจะถูกจัดเก็บในรูปแบบไฟล์ .eval_results/*.yaml ภายใน Model Repositoryคะแนนเหล่านี้จะปรากฏบน Model Card และถูกส่งต่อไปยัง Dataset Repository ที่เป็น Benchmarkทั้งผลคะแนนจากผู้พัฒนาโมเดลเอง และ Pull Requests (PR) สำหรับผลคะแนนจากชุมชน จะถูกรวบรวมผู้พัฒนาโมเดลสามารถเลือกปิด PR หรือซ่อนผลคะแนนบางส่วนได้สำหรับชุมชน: การมีส่วนร่วมอย่างสร้างสรรค์ 🚀ผู้ใช้งานทุกคนสามารถส่งผลการประเมินสำหรับโมเดลใดก็ได้ผ่าน Pull Request (PR)ผลการประเมินจะถูกแสดงในสถานะ "community" โดยไม่ต้องรอให้ผู้พัฒนาโมเดลอนุมัติ (Merge) หรือปิด PRชุมชนสามารถอ้างอิงแหล่งที่มาของผลคะแนนได้ เช่น เอกสารงานวิจัย, Model Card, แพลตฟอร์มประเมินผลจากบุคคลที่สาม หรือ Log การประเมินสามารถพูดคุยถกเถียงเกี่ยวกับคะแนนได้เหมือนกับการรีวิว PR ทั่วไปเนื่องจาก Hub ใช้ระบบ Git จึงมีประวัติการเพิ่มผลการประเมิน การเปลี่ยนแปลงต่าง ๆ ทำให้มีความโปร่งใสประโยชน์ที่คาดไม่ถึงจากการกระจายอำนาจการประเมินผล 💡การกระจายอำนาจการประเมินผลนี้จะช่วยเปิดเผยคะแนนที่มีอยู่แล้วทั่วทั้งชุมชน ซึ่งเดิมอาจกระจายอยู่ในแหล่งต่าง ๆ เช่น Model Cards หรือเอกสารงานวิจัย การเปิดเผยนี้จะช่วยให้ชุมชนสามารถนำข้อมูลไปต่อยอดในการรวบรวม ติดตาม และทำความเข้าใจคะแนนของโมเดลต่าง ๆ ในภาพรวมได้นอกจากนี้ คะแนนทั้งหมดจะสามารถเข้าถึงได้ผ่าน API ของ Hub ทำให้ง่ายต่อการสร้าง Leaderboards หรือ Dashboards ที่ปรับแต่งได้ตามต้องการCommunity Evals ไม่ได้แทนที่ แต่เสริมพลัง 🌟Community Evals ไม่ได้มีเป้าหมายเพื่อทดแทน Benchmark เดิม หรือการประเมินผลแบบปิดที่มีผลลัพธ์เผยแพร่ (Closed evals with published results) แต่เป็นการเสริมพลังให้กับวงการด้วยผลการประเมินที่เปิดเผย (Open eval results) บนพื้นฐานของสเปกการประเมินที่สามารถทำซ้ำได้ (Reproducible eval specs)ถึงแม้ว่าฟีเจอร์นี้อาจไม่สามารถแก้ปัญหา Benchmark Saturation หรือช่องว่างระหว่างคะแนน Benchmark กับประสิทธิภาพจริงได้โดยตรง และอาจไม่สามารถหยุดการเทรนโมเดลบนชุดข้อมูลทดสอบ (Training on test sets) ได้ แต่ก็ทำให้ "เกม" ที่เกิดขึ้นมีความชัดเจนมากขึ้น โดยการเปิดเผยว่าอะไรถูกประเมิน อย่างไร เมื่อไหร่ และโดยใครเป้าหมายหลักคือการทำให้ Hugging Face Hub เป็นพื้นที่ที่ทุกคนสามารถเข้ามาสร้างสรรค์และแบ่งปัน Benchmark ที่ทำซ้ำได้ โดยเฉพาะอย่างยิ่งสำหรับ Task และโดเมนใหม่ ๆ ที่ท้าทายโมเดล SOTA (State-of-the-art) มากยิ่งขึ้นอยากเริ่มต้นใช้งาน?อ่านเอกสารเพิ่มเติม: เรียนรู้เกี่ยวกับผลการประเมินได้ที่ [Docs](https://huggingface.co/docs/hub/evals)เพิ่มผลการประเมินของคุณ: เผยแพร่ผลการประเมินที่คุณได้ทำไว้ในรูปแบบไฟล์ YAML ในโฟลเดอร์ .eval_results/ บน Model Repository ใดก็ได้ตรวจสอบคะแนน: ดูคะแนนบน Dataset ที่เป็น Benchmark ได้ที่ [Hugging Face Hub](https://huggingface.co/datasets)ลงทะเบียน Benchmark ใหม่: เพิ่มไฟล์ eval.yaml ใน Dataset Repository ของคุณ และติดต่อเราเพื่อเข้าร่วมในรายชื่อ Benchmark ที่รองรับฟีเจอร์นี้ยังอยู่ในช่วง Beta เรากำลังพัฒนาอย่างเปิดเผย และยินดีรับฟังความคิดเห็นจากทุกท่าน!#CommunityEvals #HuggingFace #AI #MachineLearning #OpenSourcehttps://huggingface.co/blog/community-evals
Shared content
HUGGINGFACE.CO
Community Evals: Because we're done trusting black-box leaderboards over the community
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
5 Comentários 0 Compartilhamentos 235 Visualizações 0 Anterior