ประเมินประสิทธิภาพ AI Agent ด้วย NVIDIA SkillEvaluator: วัดผลลัพธ์จริงที่จับต้องได้

ในยุคที่ AI Agent กำลังเข้ามามีบทบาทสำคัญในการทำงานและอำนวยความสะดวกให้กับผู้คน ประสิทธิภาพของ AI Agent จึงเป็นสิ่งที่เราให้ความสนใจอย่างมาก แม้จะมีโมเดลที่ทรงพลังและไลบรารีที่ยอดเยี่ยมจาก NVIDIA แต่บางครั้ง AI Agent ก็ยังต้องใช้เวลามากขึ้นในการค้นหาเครื่องมือที่เหมาะสม หรืออาจใช้ "โทเค็น" ไปกับการลองผิดลองถูกจนหมดเปลืองโดยเปล่าประโยชน์ ปัญหาเหล่านี้จะหมดไปเมื่อเรามี "Skills" ซึ่งเป็นส่วนที่รวบรวมคำแนะนำ ตัวอย่าง และแนวทางการใช้เครื่องมือต่าง ๆ เพื่อช่วยให้ AI Agent ทำงานได้รวดเร็วขึ้น ตั้งแต่การเข้าใจความต้องการไปจนถึงการแก้ปัญหา

เพื่อวัดผลว่า Skills เหล่านี้ช่วยปรับปรุงเส้นทางการทำงานและผลลัพธ์ของ Agent ได้จริงหรือไม่ NVIDIA ได้พัฒนา NVIDIA SkillEvaluator เครื่องมือประเมินแบบ Open Source ที่จะช่วยวัดผลกระทบของ Skills ที่ได้รับการยืนยัน (Verified Skills) ต่อประสิทธิภาพของ AI Agent

NVIDIA SkillEvaluator คืออะไร?

NVIDIA SkillEvaluator เป็นเครื่องมือ Open Source ที่ออกแบบมาเพื่อวัดว่า Skills ส่งผลต่อประสิทธิภาพของ Agent อย่างไร โดยใช้กระบวนการประเมินแบบ 3 ระดับ ประกอบด้วย:

  1. การตรวจสอบแบบคงที่ (Static Checks): ตรวจสอบความถูกต้องของ Schema, การจัดรูปแบบ (Frontmatter), การให้คะแนนคุณภาพ, การสแกนความปลอดภัยเพื่อป้องกัน Prompt Injection และการขโมยข้อมูล, การตรวจจับข้อมูลส่วนบุคคล (PII), การตรวจสอบ License และการตรวจสอบ Script Linting
  2. การวิเคราะห์ความแตกต่าง (Distinctiveness Analysis): ใช้การเปรียบเทียบความคล้ายคลึงของ Embedding เพื่อระบุคำแนะนำที่ซ้ำซ้อนกันภายใน Skill เดียวกัน หรือการครอบคลุมที่ทับซ้อนกันในแค็ตตาล็อก
  3. การทดสอบจริงในสภาพแวดล้อมจำลอง (Live Task Runs in Isolated Environments): รันการประเมินจริงกับ Agent ในสภาพแวดล้อม Sandbox ที่แยกออกมา โดยเปรียบเทียบผลลัพธ์ระหว่างการทำงาน "โดยมี Skill" และ "ไม่มี Skill" เพื่อวัดผลกระทบที่เกิดขึ้น

ก้าวแรกของการประเมิน: ผลลัพธ์จากกว่า 300 Verified Skills

NVIDIA ได้ทำการทดสอบและประเมิน Verified Skills กว่า 300 รายการ จากผลิตภัณฑ์ NVIDIA มากกว่า 30 รายการ โดยใช้ SkillEvaluator ผลการประเมินแสดงให้เห็นถึง "Skill Lift" หรือการเพิ่มขึ้นของประสิทธิภาพอย่างมีนัยสำคัญในด้าน ความถูกต้อง (Correctness), การค้นพบ (Discoverability), ประสิทธิผล (Effectiveness) และ ประสิทธิภาพ (Efficiency) โดยเฉลี่ยแล้วมีคะแนนเพิ่มขึ้นถึง 31 จุด (หากไม่รวมด้านความปลอดภัย จะเพิ่มขึ้นถึง 39 จุด)

ผลการวิเคราะห์ชี้ให้เห็นว่า ประเภทของผลิตภัณฑ์ (Product Domain) และการออกแบบการประเมิน (Evaluation Design) มีผลต่อ Skill Lift มากกว่าการเลือกใช้ Agent Harness (โครงสร้างพื้นฐานสำหรับรัน Agent) นอกจากนี้ การประหยัดโทเค็นหรือการประมวลผลนั้นแตกต่างกันไปในแต่ละ Skill ซึ่งบ่งชี้ถึงความจำเป็นในการปรับแต่งที่เฉพาะเจาะจงสำหรับแต่ละ Skill

วิธีการทำงานของการประเมินจริง (Tier 3 Live Evaluation)

การประเมินใน Tier 3 ใช้ Harbor ซึ่งเป็น Framework แบบ Open Source สำหรับการรันการประเมิน Agent ในสภาพแวดล้อมที่สามารถทำซ้ำได้และแยกออกจากกัน SkillEvaluator จะจัดการการตั้งค่า Harbor ให้ โดยแปลงกรณีการประเมินให้เป็น Task, รัน Agent ใน Sandbox, รวบรวมผลลัพธ์ และคำนวณผลกระทบของ Skill

ผลลัพธ์ทุกอย่างมาจากการเปรียบเทียบที่ควบคุมได้ สำหรับแต่ละกรณีการประเมิน Agent Harness จะถูกรันสองครั้ง: ครั้งแรก "โดยมี Skill" ติดตั้งอยู่ และครั้งที่สอง "โดยไม่มี Skill" การรันแต่ละครั้งจะเกิดขึ้นใน Sandbox ที่แยกจากกัน โดยใช้ Prompt, โมเดล, Input ของ Task และเกณฑ์การให้คะแนนเดียวกัน สิ่งเดียวที่แตกต่างกันในการทดลองนี้คือการติดตั้ง Skill หรือไม่

ผลลัพธ์จากการประเมินจริง

จากการประเมิน Verified Skills กว่า 300 รายการ พบว่า:

  • คะแนนพื้นฐาน (Without-Skill Baseline): ก่อนที่จะติดตั้ง Skill ประสิทธิภาพเฉลี่ยของ Agent ในด้านต่างๆ เช่น ความถูกต้อง, การค้นพบ, ประสิทธิผล และประสิทธิภาพ อยู่ในช่วง 39-46 คะแนน จาก 100 คะแนน ซึ่งแสดงให้เห็นว่ายังมีช่องว่างให้พัฒนาได้มาก ด้านความปลอดภัยมีคะแนนเฉลี่ยสูงถึง 97 คะแนน เนื่องจากวัตถุประสงค์หลักคือการตรวจสอบว่าการติดตั้ง Skill ไม่ทำให้เกิดปัญหาใหม่
  • ประสิทธิภาพหลังติดตั้ง Skill (With-Skill Scores): เมื่อติดตั้ง Verified Skills แล้ว คะแนนเฉลี่ยในทุกด้านเพิ่มขึ้นอย่างเห็นได้ชัด โดยเฉพาะอย่างยิ่งในด้านความถูกต้อง, การค้นพบ, ประสิทธิผล และประสิทธิภาพ ซึ่งมีคะแนนเพิ่มขึ้นถึง 39-41 จุด
  • Skill Lift: ค่า Skill Lift บ่งชี้ถึงการเพิ่มขึ้นของประสิทธิภาพเมื่อมี Skill เข้ามาช่วย โดยค่านี้วัดเป็น "คะแนน" ไม่ใช่เปอร์เซ็นต์การเปลี่ยนแปลง
  • การค้นพบและการใช้งาน (Discoverability & Efficiency): ค่า Skill Lift ในสองด้านนี้ (40 และ 35 จุด ตามลำดับ) แสดงให้เห็นว่า Agent สามารถค้นหาและใช้งาน Skill ที่เกี่ยวข้องได้อย่างถูกต้องเมื่อ Skill นั้นถูกติดตั้ง ซึ่งเป็นสิ่งสำคัญ เพราะ Skill ที่ไม่เกี่ยวข้องแต่ถูกเรียกใช้งาน อาจส่งผลเสียต่อประสิทธิภาพของ Agent ได้

การนำ SkillEvaluator ไปใช้งานจริง

  • OpenClaw: กำลังทดลองใช้ SkillEvaluator สำหรับองค์กรอย่างเป็นทางการบน ClawHub โดยมีการรวมการประเมิน Tier 3 และแสดงผลลัพธ์ทั้งแบบ "มี Skill" และ "ไม่มี Skill" เพื่อให้นักพัฒนาสามารถตรวจสอบสัญญาณการประเมินเมื่อค้นหาและนำ Skill ไปใช้งาน
  • Nous Research: ได้ทดสอบ SkillEvaluator ใน Hermes Agent โดยมีการสแกนเพิ่มเติมด้วย SkillSpector ในขั้นตอนการติดตั้ง Skill ซึ่งจะตรวจสอบปัญหา PII, Unicode smuggling, Script linting, License และความปลอดภัย โดยการสแกนแต่ละ Skill ใช้เวลาประมาณ 1.4-1.5 วินาที

ข้อค้นพบสำคัญสำหรับการพัฒนาและทดสอบ Agent Skills

  1. ชุดข้อมูลประเมินที่ดี = Skill ที่ดี: การกำหนด Task ที่สำคัญ, ผลลัพธ์ที่คาดหวัง และคำร้องขอที่อยู่นอกขอบเขตอย่างชัดเจน จะช่วยให้สัญญาณการประเมินแม่นยำขึ้น ยิ่งชุดข้อมูลประเมินมีความละเอียดมากเท่าไร การวัดผล Skill ก็จะยิ่งแม่นยำมากขึ้นเท่านั้น
  2. ผลิตภัณฑ์สำคัญกว่า Agent: Skill Lift มีความแตกต่างกันอย่างมากในแต่ละผลิตภัณฑ์ โดยแตกต่างกันระหว่าง Claude Code และ Codex เพียงประมาณ 5 จุด แต่ Skill Lift ต่อผลิตภัณฑ์นั้นแตกต่างกันตั้งแต่ +2 ถึง +46 จุด ซึ่งแสดงว่าโดเมนของ Task และการออกแบบการประเมินมีความสำคัญมากกว่า Agent Harness
  3. การประหยัดโทเค็นไม่ใช่เรื่องอัตโนมัติ: SkillEvaluator สามารถติดตามการใช้โทเค็นแยกต่างหากจาก Efficiency ได้ ตัวอย่างเช่น Skill "jetson-optimize-memory" สามารถลดการใช้โทเค็นลง 76.9% และเวลาประมวลผล 53.7% ในขณะที่ Skill "cuopt-install" กลับเพิ่มการใช้โทเค็นถึง 120.3% และเวลาประมวลผล 20.8% ซึ่งแสดงให้เห็นถึงโอกาสในการปรับปรุงเพิ่มเติม SkillEvaluator ช่วยให้เห็นว่า Skill นั้นช่วยประหยัดโทเค็นและเวลาจริงหรือไม่ หรือจำเป็นต้องได้รับการปรับปรุงเพิ่มเติม

หากต้องการเริ่มต้นใช้งาน สามารถเข้าไปดูเอกสารประกอบของ SkillEvaluator ได้ หรือตรวจสอบ Verified Skills จาก NVIDIA Verified Skills Catalog บน GitHub

#AI #Agent #NVIDIA #SkillEvaluator #MachineLearning

ขอบคุณ แหล่งข้อมูล
https://developer.nvidia.com/blog/evaluating-ai-agent-skill-performance-with-nvidia-skillevaluator/

ประเมินประสิทธิภาพ AI Agent ด้วย NVIDIA SkillEvaluator: วัดผลลัพธ์จริงที่จับต้องได้ในยุคที่ AI Agent กำลังเข้ามามีบทบาทสำคัญในการทำงานและอำนวยความสะดวกให้กับผู้คน ประสิทธิภาพของ AI Agent จึงเป็นสิ่งที่เราให้ความสนใจอย่างมาก แม้จะมีโมเดลที่ทรงพลังและไลบรารีที่ยอดเยี่ยมจาก NVIDIA แต่บางครั้ง AI Agent ก็ยังต้องใช้เวลามากขึ้นในการค้นหาเครื่องมือที่เหมาะสม หรืออาจใช้ "โทเค็น" ไปกับการลองผิดลองถูกจนหมดเปลืองโดยเปล่าประโยชน์ ปัญหาเหล่านี้จะหมดไปเมื่อเรามี "Skills" ซึ่งเป็นส่วนที่รวบรวมคำแนะนำ ตัวอย่าง และแนวทางการใช้เครื่องมือต่าง ๆ เพื่อช่วยให้ AI Agent ทำงานได้รวดเร็วขึ้น ตั้งแต่การเข้าใจความต้องการไปจนถึงการแก้ปัญหาเพื่อวัดผลว่า Skills เหล่านี้ช่วยปรับปรุงเส้นทางการทำงานและผลลัพธ์ของ Agent ได้จริงหรือไม่ NVIDIA ได้พัฒนา NVIDIA SkillEvaluator เครื่องมือประเมินแบบ Open Source ที่จะช่วยวัดผลกระทบของ Skills ที่ได้รับการยืนยัน (Verified Skills) ต่อประสิทธิภาพของ AI AgentNVIDIA SkillEvaluator คืออะไร?NVIDIA SkillEvaluator เป็นเครื่องมือ Open Source ที่ออกแบบมาเพื่อวัดว่า Skills ส่งผลต่อประสิทธิภาพของ Agent อย่างไร โดยใช้กระบวนการประเมินแบบ 3 ระดับ ประกอบด้วย:การตรวจสอบแบบคงที่ (Static Checks): ตรวจสอบความถูกต้องของ Schema, การจัดรูปแบบ (Frontmatter), การให้คะแนนคุณภาพ, การสแกนความปลอดภัยเพื่อป้องกัน Prompt Injection และการขโมยข้อมูล, การตรวจจับข้อมูลส่วนบุคคล (PII), การตรวจสอบ License และการตรวจสอบ Script Lintingการวิเคราะห์ความแตกต่าง (Distinctiveness Analysis): ใช้การเปรียบเทียบความคล้ายคลึงของ Embedding เพื่อระบุคำแนะนำที่ซ้ำซ้อนกันภายใน Skill เดียวกัน หรือการครอบคลุมที่ทับซ้อนกันในแค็ตตาล็อกการทดสอบจริงในสภาพแวดล้อมจำลอง (Live Task Runs in Isolated Environments): รันการประเมินจริงกับ Agent ในสภาพแวดล้อม Sandbox ที่แยกออกมา โดยเปรียบเทียบผลลัพธ์ระหว่างการทำงาน "โดยมี Skill" และ "ไม่มี Skill" เพื่อวัดผลกระทบที่เกิดขึ้นก้าวแรกของการประเมิน: ผลลัพธ์จากกว่า 300 Verified SkillsNVIDIA ได้ทำการทดสอบและประเมิน Verified Skills กว่า 300 รายการ จากผลิตภัณฑ์ NVIDIA มากกว่า 30 รายการ โดยใช้ SkillEvaluator ผลการประเมินแสดงให้เห็นถึง "Skill Lift" หรือการเพิ่มขึ้นของประสิทธิภาพอย่างมีนัยสำคัญในด้าน ความถูกต้อง (Correctness), การค้นพบ (Discoverability), ประสิทธิผล (Effectiveness) และ ประสิทธิภาพ (Efficiency) โดยเฉลี่ยแล้วมีคะแนนเพิ่มขึ้นถึง 31 จุด (หากไม่รวมด้านความปลอดภัย จะเพิ่มขึ้นถึง 39 จุด)ผลการวิเคราะห์ชี้ให้เห็นว่า ประเภทของผลิตภัณฑ์ (Product Domain) และการออกแบบการประเมิน (Evaluation Design) มีผลต่อ Skill Lift มากกว่าการเลือกใช้ Agent Harness (โครงสร้างพื้นฐานสำหรับรัน Agent) นอกจากนี้ การประหยัดโทเค็นหรือการประมวลผลนั้นแตกต่างกันไปในแต่ละ Skill ซึ่งบ่งชี้ถึงความจำเป็นในการปรับแต่งที่เฉพาะเจาะจงสำหรับแต่ละ Skillวิธีการทำงานของการประเมินจริง (Tier 3 Live Evaluation)การประเมินใน Tier 3 ใช้ Harbor ซึ่งเป็น Framework แบบ Open Source สำหรับการรันการประเมิน Agent ในสภาพแวดล้อมที่สามารถทำซ้ำได้และแยกออกจากกัน SkillEvaluator จะจัดการการตั้งค่า Harbor ให้ โดยแปลงกรณีการประเมินให้เป็น Task, รัน Agent ใน Sandbox, รวบรวมผลลัพธ์ และคำนวณผลกระทบของ Skillผลลัพธ์ทุกอย่างมาจากการเปรียบเทียบที่ควบคุมได้ สำหรับแต่ละกรณีการประเมิน Agent Harness จะถูกรันสองครั้ง: ครั้งแรก "โดยมี Skill" ติดตั้งอยู่ และครั้งที่สอง "โดยไม่มี Skill" การรันแต่ละครั้งจะเกิดขึ้นใน Sandbox ที่แยกจากกัน โดยใช้ Prompt, โมเดล, Input ของ Task และเกณฑ์การให้คะแนนเดียวกัน สิ่งเดียวที่แตกต่างกันในการทดลองนี้คือการติดตั้ง Skill หรือไม่ผลลัพธ์จากการประเมินจริงจากการประเมิน Verified Skills กว่า 300 รายการ พบว่า:คะแนนพื้นฐาน (Without-Skill Baseline): ก่อนที่จะติดตั้ง Skill ประสิทธิภาพเฉลี่ยของ Agent ในด้านต่างๆ เช่น ความถูกต้อง, การค้นพบ, ประสิทธิผล และประสิทธิภาพ อยู่ในช่วง 39-46 คะแนน จาก 100 คะแนน ซึ่งแสดงให้เห็นว่ายังมีช่องว่างให้พัฒนาได้มาก ด้านความปลอดภัยมีคะแนนเฉลี่ยสูงถึง 97 คะแนน เนื่องจากวัตถุประสงค์หลักคือการตรวจสอบว่าการติดตั้ง Skill ไม่ทำให้เกิดปัญหาใหม่ประสิทธิภาพหลังติดตั้ง Skill (With-Skill Scores): เมื่อติดตั้ง Verified Skills แล้ว คะแนนเฉลี่ยในทุกด้านเพิ่มขึ้นอย่างเห็นได้ชัด โดยเฉพาะอย่างยิ่งในด้านความถูกต้อง, การค้นพบ, ประสิทธิผล และประสิทธิภาพ ซึ่งมีคะแนนเพิ่มขึ้นถึง 39-41 จุดSkill Lift: ค่า Skill Lift บ่งชี้ถึงการเพิ่มขึ้นของประสิทธิภาพเมื่อมี Skill เข้ามาช่วย โดยค่านี้วัดเป็น "คะแนน" ไม่ใช่เปอร์เซ็นต์การเปลี่ยนแปลงการค้นพบและการใช้งาน (Discoverability & Efficiency): ค่า Skill Lift ในสองด้านนี้ (40 และ 35 จุด ตามลำดับ) แสดงให้เห็นว่า Agent สามารถค้นหาและใช้งาน Skill ที่เกี่ยวข้องได้อย่างถูกต้องเมื่อ Skill นั้นถูกติดตั้ง ซึ่งเป็นสิ่งสำคัญ เพราะ Skill ที่ไม่เกี่ยวข้องแต่ถูกเรียกใช้งาน อาจส่งผลเสียต่อประสิทธิภาพของ Agent ได้การนำ SkillEvaluator ไปใช้งานจริงOpenClaw: กำลังทดลองใช้ SkillEvaluator สำหรับองค์กรอย่างเป็นทางการบน ClawHub โดยมีการรวมการประเมิน Tier 3 และแสดงผลลัพธ์ทั้งแบบ "มี Skill" และ "ไม่มี Skill" เพื่อให้นักพัฒนาสามารถตรวจสอบสัญญาณการประเมินเมื่อค้นหาและนำ Skill ไปใช้งานNous Research: ได้ทดสอบ SkillEvaluator ใน Hermes Agent โดยมีการสแกนเพิ่มเติมด้วย SkillSpector ในขั้นตอนการติดตั้ง Skill ซึ่งจะตรวจสอบปัญหา PII, Unicode smuggling, Script linting, License และความปลอดภัย โดยการสแกนแต่ละ Skill ใช้เวลาประมาณ 1.4-1.5 วินาทีข้อค้นพบสำคัญสำหรับการพัฒนาและทดสอบ Agent Skillsชุดข้อมูลประเมินที่ดี = Skill ที่ดี: การกำหนด Task ที่สำคัญ, ผลลัพธ์ที่คาดหวัง และคำร้องขอที่อยู่นอกขอบเขตอย่างชัดเจน จะช่วยให้สัญญาณการประเมินแม่นยำขึ้น ยิ่งชุดข้อมูลประเมินมีความละเอียดมากเท่าไร การวัดผล Skill ก็จะยิ่งแม่นยำมากขึ้นเท่านั้นผลิตภัณฑ์สำคัญกว่า Agent: Skill Lift มีความแตกต่างกันอย่างมากในแต่ละผลิตภัณฑ์ โดยแตกต่างกันระหว่าง Claude Code และ Codex เพียงประมาณ 5 จุด แต่ Skill Lift ต่อผลิตภัณฑ์นั้นแตกต่างกันตั้งแต่ +2 ถึง +46 จุด ซึ่งแสดงว่าโดเมนของ Task และการออกแบบการประเมินมีความสำคัญมากกว่า Agent Harnessการประหยัดโทเค็นไม่ใช่เรื่องอัตโนมัติ: SkillEvaluator สามารถติดตามการใช้โทเค็นแยกต่างหากจาก Efficiency ได้ ตัวอย่างเช่น Skill "jetson-optimize-memory" สามารถลดการใช้โทเค็นลง 76.9% และเวลาประมวลผล 53.7% ในขณะที่ Skill "cuopt-install" กลับเพิ่มการใช้โทเค็นถึง 120.3% และเวลาประมวลผล 20.8% ซึ่งแสดงให้เห็นถึงโอกาสในการปรับปรุงเพิ่มเติม SkillEvaluator ช่วยให้เห็นว่า Skill นั้นช่วยประหยัดโทเค็นและเวลาจริงหรือไม่ หรือจำเป็นต้องได้รับการปรับปรุงเพิ่มเติมหากต้องการเริ่มต้นใช้งาน สามารถเข้าไปดูเอกสารประกอบของ SkillEvaluator ได้ หรือตรวจสอบ Verified Skills จาก NVIDIA Verified Skills Catalog บน GitHub#AI #Agent #NVIDIA #SkillEvaluator #MachineLearninghttps://developer.nvidia.com/blog/evaluating-ai-agent-skill-performance-with-nvidia-skillevaluator/
Shared content
DEVELOPER.NVIDIA.COM
Evaluating AI Agent Skill Performance with NVIDIA SkillEvaluator
AI agents are only as effective as the context they receive. Even with capable models and well-documented NVIDIA libraries, agents can spend extra steps finding the right tools, burn tokens on dead…
3 Comentários 0 Compartilhamentos 843 Visualizações 0 Anterior