Holo3.1: ตัวแทนใช้งานคอมพิวเตอร์ที่รวดเร็ว ทำงานได้บนเครื่องคุณเอง 🚀

ในยุคที่เทคโนโลยี AI ก้าวหน้าอย่างรวดเร็ว ผู้ใช้งานจำนวนมากต้องการความสามารถในการควบคุมคอมพิวเตอร์ที่เหมือนกัน ไม่ว่าจะใช้งานผ่านเดสก์ท็อปหรือมือถือ พร้อมกับการทำงานร่วมกับระบบ Agent Frameworks ต่างๆ ได้อย่างราบรื่น และที่สำคัญคือความยืดหยุ่นในการติดตั้งใช้งาน ตั้งแต่การประมวลผลบนคลาวด์ ไปจนถึงการทำงานแบบเต็มรูปแบบบนอุปกรณ์ของผู้ใช้งานโดยตรง

นี่คือเหตุผลที่เราภูมิใจนำเสนอ Holo3.1 ซึ่งเป็นตระกูลของ Agent ที่ได้รับการพัฒนาให้มีความเสถียรและแข็งแกร่งยิ่งขึ้นใน 3 มิติที่สำคัญสำหรับการใช้งานจริง ได้แก่ สภาพแวดล้อม (เว็บ, เดสก์ท็อป, มือถือ), Agent Frameworks และเป้าหมายการติดตั้งใช้งาน สำหรับครั้งแรก เราได้ปล่อยโมเดลแบบ Quantized Checkpoints ที่ปรับแต่งมาเพื่อการประมวลผลภายในเครื่อง (Local Inference) โดยเฉพาะ ทั้งในรูปแบบ FP8, Q4 GGUF และ NVFP4

Holo3.1 ถือเป็นก้าวสำคัญสู่การสร้าง Agent ที่ใช้งานคอมพิวเตอร์ได้อย่างครอบคลุม (Universal Computer-Use Agents) ระบบที่สามารถทำงานข้ามสภาพแวดล้อมต่างๆ ผสานรวมเข้ากับ Agent Stack ใดก็ได้ และทำงานได้ทุกที่ที่เวิร์กโฟลว์ต้องการ

การใช้งานคอมพิวเตอร์ข้ามสภาพแวดล้อม GUI และ Agent Harnesses

Holo3.1 พัฒนาต่อยอดมาจากตระกูล Qwen โดยมุ่งเน้นการเพิ่มความเสถียรในการทำงานข้ามสภาพแวดล้อมที่ Agent สำหรับใช้งานคอมพิวเตอร์ถูกติดตั้งใช้งานจริง พร้อมทั้งรักษาประสิทธิภาพระดับ State-of-the-Art ไว้

จากการที่ทีมของเราได้นำ Holo3 ไปใช้งานจริง เราพบความท้าทายที่เกิดขึ้นซ้ำๆ คือ ประสิทธิภาพที่ยอดเยี่ยมในสภาพแวดล้อมหนึ่ง อาจไม่สามารถถ่ายทอดไปยังอีกสภาพแวดล้อมหนึ่งได้เสมอไป ไม่ว่าจะเป็นอุปกรณ์มือถือ Agent Harnesss ทางเลือก หรือ Frameworks การประมวลผลที่แตกต่างกัน ล้วนมีปัจจัยที่ทำให้เกิดการเปลี่ยนแปลงของประสิทธิภาพ

Holo3.1 ได้ขยายขีดความสามารถของ Holo3 ให้เหนือกว่าการควบคุมเบราว์เซอร์และเดสก์ท็อป โดยมอบประสิทธิภาพที่เพิ่มขึ้นอย่างมากในสภาพแวดล้อมมือถือ ตัวอย่างเช่น โมเดล 35B-A3B ของเรามีประสิทธิภาพบน AndroidWorld เพิ่มขึ้นจาก 67% เป็น 79.3% ในขณะที่โมเดลขนาดเล็ก 4B และ 9B ก็มีประสิทธิภาพเพิ่มขึ้นจาก 58% เป็น 72%

ประสิทธิภาพข้าม Harnesss

เพื่อให้การรองรับทีมที่ติดตั้ง Holo ภายใน Agent Stack ของบุคคลที่สามดียิ่งขึ้น Holo3.1 จึงรองรับโปรโตคอล Function-Calling แบบ Native นอกเหนือจากเอาต์พุต JSON แบบมีโครงสร้างที่มีอยู่แล้วใน Holo3

เมื่อประเมินผลบน OSWorld และชุด Benchmark ภายในของเราที่ครอบคลุมเวิร์กโฟลว์ด้านอีคอมเมิร์ซ ซอฟต์แวร์ธุรกิจ และการทำงานร่วมกัน การใช้ Function-Calling และการประมวลผลแบบ Native สามารถทำประสิทธิภาพได้ใกล้เคียงกัน นอกจากนี้ Holo3.1 ยังมอบประสิทธิภาพที่เพิ่มขึ้นกว่า 25% เมื่อเทียบกับ Holo3 เมื่อประเมินผลภายใน Holotab product harness ของเรา

ขนาดที่เล็กลงเพื่อการแลกเปลี่ยนระหว่างต้นทุนและประสิทธิภาพ

เพื่อส่งเสริมการประมวลผลภายในเครื่อง (Local Inference) และบนอุปกรณ์ (On-device Inference) ให้มากยิ่งขึ้น เราได้เปิดตัวโมเดลขนาดใหม่ รวมถึงโมเดลขนาดเล็ก (0.8B, 4B, และ 9B) สำหรับการติดตั้งใช้งานที่คุ้มค่าและเป็นส่วนตัว นอกเหนือจากโมเดลขนาดใหญ่ 35B-A3B สำหรับประสิทธิภาพระดับ State-of-the-Art

(กราฟแสดงประสิทธิภาพเทียบกับต้นทุนของตระกูล Holo3.1 และ Qwen 3.5 โดยประสิทธิภาพโดยรวมคือค่าเฉลี่ยของ H Corporate benchmarks ทั้งสี่รายการ (เพื่อให้แต่ละตระกูลมีน้ำหนักเท่ากัน) จากนั้นจึงนำค่าเฉลี่ยของ OSWorld, AndroidWorld, H Corporate, ScreenSpot-Pro และ OSWorld-G)

การประมวลผลที่รวดเร็วและทำงานบนเครื่องคุณเอง ⚡

นี่คือการเปิดตัวครั้งแรกของเราที่มาพร้อมกับ Quantized Weights เราเริ่มต้นด้วย 35B-A3B Checkpoints ที่มีให้เลือกในรูปแบบ FP8, Q4 GGUF และ NVFP4

สำหรับ NVFP4 เราใช้ NVIDIA's Model Optimizer ในการกำหนดค่า W4A16 Checkpoints เหล่านี้ช่วยให้การประมวลผลภายในเครื่องสำหรับ Computer Use Agents ทำงานได้อย่างรวดเร็ว โดยแทบไม่มีการลดทอนประสิทธิภาพของโมเดล FP8 และ NVFP4 สามารถทำคะแนน OSWorld ได้เท่ากัน โดยมีคะแนนต่ำกว่า BF16 Checkpoint แบบ Full-precision เพียงเล็กน้อย

ความเร็วที่เพิ่มขึ้นนั้นมีนัยสำคัญ: บน DGX Spark, NVFP4 W4A16 สามารถทำ Throughput ของโทเค็นรวมได้เร็วกว่า FP8 ถึง 1.41 เท่า และเร็วกว่า BF16 ถึง 1.74 เท่า

สู่ Agents ทำงานบนเครื่องผู้บริโภค

เรายังได้ปล่อย Q4 GGUF Checkpoints ที่มุ่งเป้าสำหรับการติดตั้งบนเครื่องคอมพิวเตอร์ของผู้บริโภคทั่วไป

Agent จะทำงานบนเครื่อง Windows หรือ Mac ของคุณโดยตรง โดยโมเดลสามารถทำงานบนเครื่องเดียวกัน (เรามีตัวเลขอ้างอิงสำหรับ Apple Silicon) หรือทำงานบน DGX Spark ในเครือข่ายเดียวกันก็ได้ ในทั้งสองกรณี การประมวลผลจะยังคงเป็นส่วนตัวและทำงานภายในเครื่องทั้งหมด โดยไม่มีข้อมูลใดออกนอกเครือข่ายของผู้ใช้งาน

บน Spark การปรับปรุง Agent Harness ที่เราพัฒนาร่วมกับ NVIDIA ควบคู่ไปกับการทำ Quantization ด้วย NVFP4 ข้างต้น ส่งผลให้ความเร็วในการประมวลผลโดยรวมเพิ่มขึ้นประมาณ 2 เท่า เมื่อเทียบกับ FP8 baseline โดยลดเวลาเฉลี่ยต่อขั้นตอนจาก 6.8 วินาที เหลือ 3.3 วินาที

(กราฟแสดงอัตราการร้องขอ Agent ข้ามแพลตฟอร์มและความละเอียด บน DGX Spark, vLLM ที่ใช้ NVFP4 สามารถทำอัตราการร้องขอสูงสุดได้ในทั้งโหมด Default และ Fast ตามมาด้วย Q4 GGUF และ FP8 การปรับปรุงเหล่านี้และอื่นๆ อีกมากมายจะถูกนำไปใช้ใน Agent Harness สำหรับเดสก์ท็อปเวอร์ชันถัดไป)

Holo3.1 Family มีให้เลือก 4 ขนาด:

  • 0.8B
  • 4B
  • 9B
  • 35B-A3B

เรายังได้ปล่อย Optimized FP8, NVFP4, และ Q4 GGUF Checkpoints สำหรับการติดตั้งใช้งานภายในเครื่องและบน Edge Device ด้วย

เราหวังเป็นอย่างยิ่งว่าจะได้เห็นสิ่งใหม่ๆ ที่นักพัฒนาจะสร้างสรรค์ขึ้นด้วย Holo3.1


แหล่งข้อมูลเพิ่มเติม:

  • Meet HoloTab by HCompany. Your AI browser companion.
  • Holo3: Breaking the Computer Use Frontier

#Holo31 #AI #ComputerUseAgent #LocalInference

ขอบคุณ แหล่งข้อมูล
https://huggingface.co/blog/Hcompany/holo31

Holo3.1: ตัวแทนใช้งานคอมพิวเตอร์ที่รวดเร็ว ทำงานได้บนเครื่องคุณเอง 🚀ในยุคที่เทคโนโลยี AI ก้าวหน้าอย่างรวดเร็ว ผู้ใช้งานจำนวนมากต้องการความสามารถในการควบคุมคอมพิวเตอร์ที่เหมือนกัน ไม่ว่าจะใช้งานผ่านเดสก์ท็อปหรือมือถือ พร้อมกับการทำงานร่วมกับระบบ Agent Frameworks ต่างๆ ได้อย่างราบรื่น และที่สำคัญคือความยืดหยุ่นในการติดตั้งใช้งาน ตั้งแต่การประมวลผลบนคลาวด์ ไปจนถึงการทำงานแบบเต็มรูปแบบบนอุปกรณ์ของผู้ใช้งานโดยตรงนี่คือเหตุผลที่เราภูมิใจนำเสนอ Holo3.1 ซึ่งเป็นตระกูลของ Agent ที่ได้รับการพัฒนาให้มีความเสถียรและแข็งแกร่งยิ่งขึ้นใน 3 มิติที่สำคัญสำหรับการใช้งานจริง ได้แก่ สภาพแวดล้อม (เว็บ, เดสก์ท็อป, มือถือ), Agent Frameworks และเป้าหมายการติดตั้งใช้งาน สำหรับครั้งแรก เราได้ปล่อยโมเดลแบบ Quantized Checkpoints ที่ปรับแต่งมาเพื่อการประมวลผลภายในเครื่อง (Local Inference) โดยเฉพาะ ทั้งในรูปแบบ FP8, Q4 GGUF และ NVFP4Holo3.1 ถือเป็นก้าวสำคัญสู่การสร้าง Agent ที่ใช้งานคอมพิวเตอร์ได้อย่างครอบคลุม (Universal Computer-Use Agents) ระบบที่สามารถทำงานข้ามสภาพแวดล้อมต่างๆ ผสานรวมเข้ากับ Agent Stack ใดก็ได้ และทำงานได้ทุกที่ที่เวิร์กโฟลว์ต้องการการใช้งานคอมพิวเตอร์ข้ามสภาพแวดล้อม GUI และ Agent HarnessesHolo3.1 พัฒนาต่อยอดมาจากตระกูล Qwen โดยมุ่งเน้นการเพิ่มความเสถียรในการทำงานข้ามสภาพแวดล้อมที่ Agent สำหรับใช้งานคอมพิวเตอร์ถูกติดตั้งใช้งานจริง พร้อมทั้งรักษาประสิทธิภาพระดับ State-of-the-Art ไว้จากการที่ทีมของเราได้นำ Holo3 ไปใช้งานจริง เราพบความท้าทายที่เกิดขึ้นซ้ำๆ คือ ประสิทธิภาพที่ยอดเยี่ยมในสภาพแวดล้อมหนึ่ง อาจไม่สามารถถ่ายทอดไปยังอีกสภาพแวดล้อมหนึ่งได้เสมอไป ไม่ว่าจะเป็นอุปกรณ์มือถือ Agent Harnesss ทางเลือก หรือ Frameworks การประมวลผลที่แตกต่างกัน ล้วนมีปัจจัยที่ทำให้เกิดการเปลี่ยนแปลงของประสิทธิภาพHolo3.1 ได้ขยายขีดความสามารถของ Holo3 ให้เหนือกว่าการควบคุมเบราว์เซอร์และเดสก์ท็อป โดยมอบประสิทธิภาพที่เพิ่มขึ้นอย่างมากในสภาพแวดล้อมมือถือ ตัวอย่างเช่น โมเดล 35B-A3B ของเรามีประสิทธิภาพบน AndroidWorld เพิ่มขึ้นจาก 67% เป็น 79.3% ในขณะที่โมเดลขนาดเล็ก 4B และ 9B ก็มีประสิทธิภาพเพิ่มขึ้นจาก 58% เป็น 72%ประสิทธิภาพข้าม Harnesssเพื่อให้การรองรับทีมที่ติดตั้ง Holo ภายใน Agent Stack ของบุคคลที่สามดียิ่งขึ้น Holo3.1 จึงรองรับโปรโตคอล Function-Calling แบบ Native นอกเหนือจากเอาต์พุต JSON แบบมีโครงสร้างที่มีอยู่แล้วใน Holo3เมื่อประเมินผลบน OSWorld และชุด Benchmark ภายในของเราที่ครอบคลุมเวิร์กโฟลว์ด้านอีคอมเมิร์ซ ซอฟต์แวร์ธุรกิจ และการทำงานร่วมกัน การใช้ Function-Calling และการประมวลผลแบบ Native สามารถทำประสิทธิภาพได้ใกล้เคียงกัน นอกจากนี้ Holo3.1 ยังมอบประสิทธิภาพที่เพิ่มขึ้นกว่า 25% เมื่อเทียบกับ Holo3 เมื่อประเมินผลภายใน Holotab product harness ของเราขนาดที่เล็กลงเพื่อการแลกเปลี่ยนระหว่างต้นทุนและประสิทธิภาพเพื่อส่งเสริมการประมวลผลภายในเครื่อง (Local Inference) และบนอุปกรณ์ (On-device Inference) ให้มากยิ่งขึ้น เราได้เปิดตัวโมเดลขนาดใหม่ รวมถึงโมเดลขนาดเล็ก (0.8B, 4B, และ 9B) สำหรับการติดตั้งใช้งานที่คุ้มค่าและเป็นส่วนตัว นอกเหนือจากโมเดลขนาดใหญ่ 35B-A3B สำหรับประสิทธิภาพระดับ State-of-the-Art(กราฟแสดงประสิทธิภาพเทียบกับต้นทุนของตระกูล Holo3.1 และ Qwen 3.5 โดยประสิทธิภาพโดยรวมคือค่าเฉลี่ยของ H Corporate benchmarks ทั้งสี่รายการ (เพื่อให้แต่ละตระกูลมีน้ำหนักเท่ากัน) จากนั้นจึงนำค่าเฉลี่ยของ OSWorld, AndroidWorld, H Corporate, ScreenSpot-Pro และ OSWorld-G)การประมวลผลที่รวดเร็วและทำงานบนเครื่องคุณเอง ⚡นี่คือการเปิดตัวครั้งแรกของเราที่มาพร้อมกับ Quantized Weights เราเริ่มต้นด้วย 35B-A3B Checkpoints ที่มีให้เลือกในรูปแบบ FP8, Q4 GGUF และ NVFP4สำหรับ NVFP4 เราใช้ NVIDIA's Model Optimizer ในการกำหนดค่า W4A16 Checkpoints เหล่านี้ช่วยให้การประมวลผลภายในเครื่องสำหรับ Computer Use Agents ทำงานได้อย่างรวดเร็ว โดยแทบไม่มีการลดทอนประสิทธิภาพของโมเดล FP8 และ NVFP4 สามารถทำคะแนน OSWorld ได้เท่ากัน โดยมีคะแนนต่ำกว่า BF16 Checkpoint แบบ Full-precision เพียงเล็กน้อยความเร็วที่เพิ่มขึ้นนั้นมีนัยสำคัญ: บน DGX Spark, NVFP4 W4A16 สามารถทำ Throughput ของโทเค็นรวมได้เร็วกว่า FP8 ถึง 1.41 เท่า และเร็วกว่า BF16 ถึง 1.74 เท่าสู่ Agents ทำงานบนเครื่องผู้บริโภคเรายังได้ปล่อย Q4 GGUF Checkpoints ที่มุ่งเป้าสำหรับการติดตั้งบนเครื่องคอมพิวเตอร์ของผู้บริโภคทั่วไปAgent จะทำงานบนเครื่อง Windows หรือ Mac ของคุณโดยตรง โดยโมเดลสามารถทำงานบนเครื่องเดียวกัน (เรามีตัวเลขอ้างอิงสำหรับ Apple Silicon) หรือทำงานบน DGX Spark ในเครือข่ายเดียวกันก็ได้ ในทั้งสองกรณี การประมวลผลจะยังคงเป็นส่วนตัวและทำงานภายในเครื่องทั้งหมด โดยไม่มีข้อมูลใดออกนอกเครือข่ายของผู้ใช้งานบน Spark การปรับปรุง Agent Harness ที่เราพัฒนาร่วมกับ NVIDIA ควบคู่ไปกับการทำ Quantization ด้วย NVFP4 ข้างต้น ส่งผลให้ความเร็วในการประมวลผลโดยรวมเพิ่มขึ้นประมาณ 2 เท่า เมื่อเทียบกับ FP8 baseline โดยลดเวลาเฉลี่ยต่อขั้นตอนจาก 6.8 วินาที เหลือ 3.3 วินาที(กราฟแสดงอัตราการร้องขอ Agent ข้ามแพลตฟอร์มและความละเอียด บน DGX Spark, vLLM ที่ใช้ NVFP4 สามารถทำอัตราการร้องขอสูงสุดได้ในทั้งโหมด Default และ Fast ตามมาด้วย Q4 GGUF และ FP8 การปรับปรุงเหล่านี้และอื่นๆ อีกมากมายจะถูกนำไปใช้ใน Agent Harness สำหรับเดสก์ท็อปเวอร์ชันถัดไป)Holo3.1 Family มีให้เลือก 4 ขนาด:0.8B4B9B35B-A3Bเรายังได้ปล่อย Optimized FP8, NVFP4, และ Q4 GGUF Checkpoints สำหรับการติดตั้งใช้งานภายในเครื่องและบน Edge Device ด้วยHolo Models API: https://hcompany.ai/holo-models-apiHugging Face: https://huggingface.co/collections/Hcompany/holo31เราหวังเป็นอย่างยิ่งว่าจะได้เห็นสิ่งใหม่ๆ ที่นักพัฒนาจะสร้างสรรค์ขึ้นด้วย Holo3.1แหล่งข้อมูลเพิ่มเติม:Meet HoloTab by HCompany. Your AI browser companion.Holo3: Breaking the Computer Use Frontier#Holo31 #AI #ComputerUseAgent #LocalInferencehttps://huggingface.co/blog/Hcompany/holo31
Shared content
HUGGINGFACE.CO
Holo3.1: Fast & Local Computer Use Agents
A Blog post by H company on Hugging Face
4 Reacties 0 aandelen 217 Views 0 voorbeeld