NVIDIA Cosmos 3: พัฒนา AI ด้านกายภาพ ด้วยโมเดลพื้นฐานที่เข้าใจโลกและสร้างการกระทำ

ระบบ AI ด้านกายภาพ (Physical AI) จำเป็นต้องเข้าใจโลกแห่งความเป็นจริงก่อนที่จะสามารถลงมือทำสิ่งใดได้ หุ่นยนต์ ยานยนต์ไร้คนขับ และพื้นที่อัจฉริยะ (Smart Spaces) ล้วนต้องการความเข้าใจในสิ่งที่เกิดขึ้นรอบตัว เพื่อคาดการณ์เหตุการณ์ที่อาจเกิดขึ้น และสร้างการกระทำที่เหมาะสมกับสภาพแวดล้อม รูปร่าง และภารกิจที่ได้รับมอบหมาย

NVIDIA Cosmos 3 คือโมเดลพื้นฐาน (Foundation Model) ล้ำสมัยสำหรับ Physical AI ที่รวมเอาความสามารถในการให้เหตุผลเชิงกายภาพ (Physical Reasoning) การสร้างโลก (World Generation) และการสร้างการกระทำ (Action Generation) ไว้ในโมเดลเดียวแบบเปิด (Open Model)

NVIDIA ได้เปิดให้ใช้งานโมเดล Cosmos 3, สคริปต์การฝึกสอน, เครื่องมือสำหรับการนำไปใช้งาน (Deployment Tools) และชุดข้อมูล (Datasets) เพื่อส่งเสริมการพัฒนา Physical AI ให้มีความเปิดกว้างและสามารถทำซ้ำได้ บทความนี้จะพาไปทำความเข้าใจพื้นฐานของ Cosmos 3, เน้นแนวคิดสำคัญจากรายงานทางเทคนิค, แนะนำขั้นตอนการทำงานทางเทคนิค และแสดงให้เห็นว่าทีมที่กำลังพัฒนาระบบหุ่นยนต์, ยานยนต์ไร้คนขับ และโซลูชันตรวจสอบคลังสินค้า สามารถเริ่มต้นใช้งานได้อย่างไร

สิ่งที่น่าสนใจใน Cosmos 3

  • โมเดล Cosmos 3 Nano และ Cosmos 3 Super: พร้อมให้ใช้งานบน Hugging Face พร้อมโค้ดบน GitHub
  • ชุดข้อมูลแบบเปิด: สำหรับแอปพลิเคชัน Physical AI เช่น หุ่นยนต์ และการขับขี่อัตโนมัติ
  • สคริปต์หลังการฝึกสอนแบบเปิด: สำหรับปรับแต่ง Cosmos 3 ให้เข้ากับโดเมนของคุณ
  • NVIDIA NIM Microservices: สำหรับการนำไปใช้งานที่ง่ายและมีประสิทธิภาพบน NVIDIA GPUs

พัฒนาการใหม่ใน Cosmos 3

ในเวอร์ชันก่อนหน้า Cosmos ได้แยกความสามารถด้านการสร้างโลก, การทำความเข้าใจเชิงกายภาพ และการสร้างฉากควบคุม ออกเป็นโมเดลและขั้นตอนการทำงานที่แตกต่างกัน แต่ในเวอร์ชันนี้ Cosmos 3 ได้รวมความสามารถเหล่านั้นเข้าไว้ด้วยกัน โดยใช้สถาปัตยกรรม Mixture-of-Transformers (MoT) ที่ประกอบด้วย 2 ส่วนหลัก:

1. Reasoner Tower (หอคอยแห่งการให้เหตุผล)

เป็นโมเดล Vision-Language Model (VLM) ที่ทำหน้าที่ตีความข้อมูลจากการสังเกตแบบหลายรูปแบบ (Multimodal Observations) เช่น รูปภาพ วิดีโอ และข้อความ ส่วนนี้ใช้สถาปัตยกรรมแบบ Autoregressive เพื่อตีความอินพุตและทำความเข้าใจการเคลื่อนไหว การปฏิสัมพันธ์ระหว่างวัตถุ และบริบทเชิงกายภาพอื่นๆ เปรียบเสมือน "สมอง" ที่ให้เหตุผลเกี่ยวกับโลกก่อนที่จะมีการสร้างอะไรขึ้นมา

2. Generator Tower (หอคอยแห่งการสร้าง)

ทำหน้าที่สร้างข้อมูลจากการสังเกตในอนาคตและลำดับการกระทำ ส่วนนี้ใช้กระบวนการแบบ Diffusion เพื่อสร้างวิดีโอที่คำนึงถึงหลักฟิสิกส์และผลลัพธ์ของการกระทำ โดยอิงตามความเข้าใจของ Reasoner Tower โดย Reasoner สามารถถูกเรียกใช้งานแยกกันได้ แต่ Generator จะเปิดใช้งานทั้งสองหอคอยเสมอเพื่อการสร้างที่ได้รับการชี้นำ

สถาปัตยกรรมนี้ทำให้โมเดลเดียวสามารถทำงานทั้งด้านการให้เหตุผลและการสร้าง ช่วยลดความซับซ้อนในการพัฒนา โดยไม่ต้องจัดการการทำงานร่วมกันระหว่างโมเดลหลายตัวและไปป์ไลน์การอนุมาน (Inference Pipelines)

เลือกขนาดโมเดลให้เหมาะสม

ปัจจุบันมีโมเดล Cosmos 3 ให้เลือก 2 ขนาด:

  • Cosmos 3 Nano: เป็นเวอร์ชันกะทัดรัด มีพารามิเตอร์ 16 พันล้าน (16B) ถูกปรับให้เหมาะกับการอนุมานที่มีประสิทธิภาพ เหมาะสำหรับการใช้งานบนเวิร์กสเตชัน เช่น NVIDIA RTX PRO 6000 GPU สำหรับการอนุมานหุ่นยนต์แบบเรียลไทม์และแอปพลิเคชัน Physical AI
  • Cosmos 3 Super: เป็นโมเดลขนาด 64 พันล้านพารามิเตอร์ (64B) ออกแบบมาเพื่อคุณภาพและความสามารถสูงสุด ให้คะแนน Benchmark ที่สูงที่สุด เหมาะสำหรับการใช้งานใน Data Center บน NVIDIA Hopper และ NVIDIA Blackwell GPUs สำหรับการสร้างข้อมูลสังเคราะห์ (Synthetic Data Generation) ในสเกลใหญ่ และงาน Physical Reasoning ที่ซับซ้อน

รูปแบบข้อมูลที่รองรับ

Cosmos 3 รองรับรูปแบบข้อมูลอินพุตและเอาต์พุตผ่านสถาปัตยกรรมแบบรวมศูนย์:

  • ภาพ (Images)
  • วิดีโอ (Videos)
  • ข้อความ (Text)
  • การกระทำ (Actions)

ชุดข้อมูล Physical AI แบบเปิด

ด้วยการเปิดตัว Cosmos 3, NVIDIA ได้เปิดให้ใช้งานชุดข้อมูล Synthetic Data Generation (SDG) บน Hugging Face ซึ่งครอบคลุมถึง:

  • ฉากหุ่นยนต์ที่เกี่ยวกับการเคลื่อนไหว (Embodied robot scenes)
  • ฉากการปฏิสัมพันธ์เชิงกายภาพ (Physical interaction scenes)
  • ฉากมนุษย์ดิจิทัล (Digital human scenes)
  • สถานการณ์การขับขี่อัตโนมัติ (Autonomous driving scenarios)
  • ฉากการปฏิบัติงานในคลังสินค้า (Warehouse operations scenes)

ชุดข้อมูลเหล่านี้สามารถนำไปใช้สำหรับการฝึกสอนเพิ่มเติม (Post-training) Cosmos 3 และโมเดลอื่นๆ ได้

NVIDIA Cosmos Human Evaluation Benchmark

เฟรมเวิร์ก NVIDIA Cosmos Human Evaluation (HUE) ใช้สำหรับประเมินคุณภาพของ Generator ใน Cosmos 3 ในงานที่ครอบคลุมโดเมนต่างๆ

เนื่องจากโมเดลสร้างวิดีโอ SOTA (State-of-the-Art) ในปัจจุบันสามารถทำคะแนนบน Leaderboard อัตโนมัติได้สูงมาก ทำให้ความแตกต่างของคะแนนระหว่างเวอร์ชันต่างๆ อาจไม่มากพอสำหรับการเปรียบเทียบที่มีนัยสำคัญ HUE จึงเปลี่ยนจากการประเมินเชิงอัตนัย (Subjective Grading) ไปสู่การตรวจสอบข้อเท็จจริงเชิงวัตถุวิสัย (Objective Fact Verification) ทำให้สามารถเปรียบเทียบโมเดลชั้นนำได้อย่างละเอียด ผลลัพธ์ที่ได้คือสัญญาณคุณภาพที่น่าเชื่อถือยิ่งขึ้นสำหรับการปรับปรุงอย่างรวดเร็วและการตัดสินใจด้านการเปิดตัวผลิตภัณฑ์ที่เข้มงวด โดยได้รับการสนับสนุนจากการประเมินโดยมนุษย์อย่างเต็มรูปแบบ

HUE ประเมินคุณภาพการสร้างวิดีโอโดยใช้การตรวจสอบแบบ Binary ที่เป็นหน่วยย่อย แต่ละวิดีโอที่สร้างขึ้นจะถูกแบ่งเป็นคำถามแบบใช่/ไม่ใช่แบบข้อเท็จจริงเดียว ใน 4 มิติ ได้แก่: ความสอดคล้องเชิงความหมาย (Semantic Alignment), กฎทางฟิสิกส์ (Physical Laws), การให้เหตุผลเชิงเรขาคณิต (Geometric Reasoning) และความสมบูรณ์ของภาพ (Visual Integrity) ครอบคลุม 7 โดเมน Physical AI รวมถึงหุ่นยนต์ ยานยนต์ไร้คนขับ และฟิสิกส์ คำถามเหล่านี้ถูกสร้างขึ้นโดย VLM Pipeline, ปรับปรุงโดยผู้เชี่ยวชาญ และเปิดให้ใช้งานแบบ Open Source บน Hugging Face

Cosmos 3 ได้รับการประเมินในชุด Benchmark หลายชุดที่ครอบคลุมการให้เหตุผล Physical AI, คุณภาพการสร้าง และประสิทธิภาพเฉพาะโดเมน

Reasoning Benchmarks

Cosmos 3 Super และ Cosmos 3 Nano เป็นผู้นำใน VANTAGE-Bench ที่ระดับ 32B และ 8B ตามลำดับ:

  • VANTAGE-Bench: Benchmark สาธารณะแรกสำหรับประเมิน Vision-Language Models บนฟุตเทจกล้องคงที่ในโลกจริง ครอบคลุมคลังสินค้า การขนส่ง และพื้นที่อัจฉริยะ
  • Traffic Anomaly Reasoning (TAR): Leaderboard ใหม่สำหรับการตรวจจับและให้เหตุผลเกี่ยวกับเหตุการณ์ที่ผิดปกติในฟุตเทจการขนส่ง และเป็น Leaderboard อย่างเป็นทางการสำหรับ AI City Challenge 2026 Track 3

Generator Benchmarks

Cosmos 3 เป็น SOTA แบบ Open Source และเป็นผู้นำใน PAI-Bench, R-Bench Physics-IQ และ RoboLab บน Leaderboard สาธารณะ:

  • Artificial Analysis: แพลตฟอร์ม Benchmark ที่จัดอันดับ AI Models สำหรับการสร้างข้อความ รูปภาพ และวิดีโอ Cosmos 3 เป็นโมเดล Open Source ชั้นนำบน Leaderboard Text to Image และ Image to Video (ไม่มีเสียง)
  • R-Bench: Benchmark สำหรับประเมิน World Models ที่ใช้ VDO ในการสร้างวิดีโอสำหรับหุ่นยนต์ ประเมินความสำเร็จของงานและคุณภาพของภาพผ่านตัวชี้วัดย่อย เช่น ความสอดคล้องของโครงสร้าง, ความสมเหตุสมผลทางฟิสิกส์ และความสมบูรณ์ของการดำเนินการ
  • PAI-Bench: Benchmark แบบรวมศูนย์ที่ประเมิน Physical AI ทั้งการทำความเข้าใจวิดีโอและการสร้างวิดีโอ ครอบคลุมโดเมนต่างๆ เช่น หุ่นยนต์ ยานยนต์ไร้คนขับ และสามัญสำนึกทางฟิสิกส์
  • Physics-IQ: Benchmark ของวิดีโอในโลกจริงที่ทดสอบว่าโมเดลสร้างวิดีโอเข้าใจหลักการทางฟิสิกส์จริงหรือไม่ นอกเหนือจากการสร้างภาพที่สมจริง
  • RoboLab: Benchmark การจำลองสำหรับประเมินนโยบายหุ่นยนต์ที่ทำงานได้ทั่วไปในหลายๆ งาน

ปรับแต่ง Cosmos 3 ด้วยการฝึกสอนเพิ่มเติม (Post-training)

ส่วนประกอบสำคัญของ Cosmos 3 คือชุดสูตรการฝึกสอนที่เปิดให้ใช้งานทั้งหมด นอกเหนือจาก Model Checkpoints แล้ว การเปิดตัวครั้งนี้ยังมาพร้อมกับโค้ด, ไฟล์คอนฟิก (Configs) และขั้นตอนการทำงานสำหรับการปรับแต่ง Cosmos 3 ให้เข้ากับโดเมน, รูปร่าง (Embodiments) และชุดข้อมูลใหม่ๆ

Supervised Fine-Tuning (SFT)

SFT ช่วยให้นักพัฒนาสามารถปรับแต่งโมเดล Cosmos 3 ให้เข้ากับข้อมูลของตนเองได้ สูตรที่เปิดให้ใช้งานประกอบด้วยการฝึกสอนเพิ่มเติมสำหรับการสร้างภาพ (Vision Generation) สำหรับชุดข้อมูลวิดีโอที่กำหนดเอง รวมถึงสูตรที่เน้นการกระทำ (Action-oriented recipes) สำหรับเวิร์กโฟลว์หุ่นยนต์และ Physical AI นักพัฒนาสามารถปรับแต่ง Cosmos 3 สำหรับโดเมนเป้าหมายของตนเองได้ ไม่ว่าจะเป็นหุ่นยนต์, การขับขี่อัตโนมัติ หรือระบบอัตโนมัติในคลังสินค้า

โค้ดและ Configs สำหรับการฝึกสอนเพิ่มเติมสามารถดูได้บน GitHub

Action Post-training

การฝึกสอนเพิ่มเติมเกี่ยวกับการกระทำ (Action Post-training) จะปรับแต่ง Cosmos 3 สำหรับแอปพลิเคชัน Physical AI ที่คำนึงถึงการกระทำ (Action-aware) รวมถึง Forward Dynamics, Inverse Dynamics และการสร้าง Policy นักพัฒนาสามารถฝึกสอนเพิ่มเติม Cosmos 3 ด้วยข้อมูลที่มีป้ายกำกับการกระทำได้ สำหรับแอปพลิเคชันหุ่นยนต์ สิ่งนี้รวมถึงเวิร์กโฟลว์ที่สำคัญหลายอย่าง: การสร้างข้อมูลจากการสังเกตในอนาคตโดยอิงตามการกระทำของหุ่นยนต์, การอนุมานการกระทำเบื้องหลังการสาธิตที่สังเกตได้ และการคาดการณ์ลำดับการกระทำจากข้อมูลการสังเกตปัจจุบันและ Prompt ของงาน ทำให้ Cosmos 3 เป็นรากฐานที่แข็งแกร่งสำหรับการสร้างแบบจำลองการกระทำของโลก (World Action Modeling) และการเรียนรู้นโยบาย (Policy Learning)

นำไปใช้งานด้วย NVIDIA NIM Microservices

โมเดล Cosmos 3 ยังมีให้ใช้งานในรูปแบบ NVIDIA NIM Microservices เพื่อการนำไปใช้งานที่ปรับปรุงประสิทธิภาพและพร้อมสำหรับการผลิต NIM Microservices จะรวมโมเดลเข้ากับ Runtime การอนุมานที่ปรับปรุงแล้ว มอบประสิทธิภาพสูงโดยไม่จำเป็นต้องปรับแต่งโครงสร้างพื้นฐานการให้บริการด้วยตนเอง NIM Microservices ใช้งานง่ายกว่าสำหรับเวิร์กโฟลว์การอนุมาน เมื่อเทียบกับ Cosmos 3 repo บน GitHub ซึ่งเหมาะสำหรับเวิร์กโฟลว์การฝึกสอนเพิ่มเติมมากกว่า

Cosmos 3 Reasoner NIM พร้อมให้ใช้งานแล้ว มอบความสามารถในการให้เหตุผลของโมเดล Cosmos 3 โปรดติดตาม Cosmos 3 Generator NIM ซึ่งจะมอบความสามารถในการสร้างเต็มรูปแบบของโมเดล Cosmos 3

การปรับปรุงเพื่อเร่งความเร็วการอนุมาน

  • Quantization: Cosmos 3 NIM รองรับการเลือก Model Checkpoints ที่ถูก Quantized แบบ BF16, FP8 หรือ NVFP4 การ Quantize แบบ NVFP4 จะลดความแม่นยำเชิงตัวเลขของโมเดลจาก BF16 เป็น 4-bit floating point ทำให้ความเร็วในการอนุมานเพิ่มขึ้นสูงสุด 2 เท่า
  • vLLM: เป็น Inference Engine แบบ Open Source ที่ใช้เทคนิคต่างๆ เช่น Continuous Batching, Paged Attention และ Tensor Parallelism เพื่อให้บริการ LLMs อย่างมีประสิทธิภาพ Cosmos 3 Reasoner NIM Serving Stack สร้างขึ้นบน vLLM เพื่อให้ได้ Throughput ที่สูงกว่าแนวทางการให้บริการแบบดั้งเดิม Cosmos 3 Nano พร้อมใช้งานร่วมกับ vLLM-omni และ NVIDIA Dynamo เพื่อประสิทธิภาพสูงสุด
  • Efficient Video Sampling (EVS): เทคนิคนี้จะลดจำนวน Video Tokens ที่ป้อนเข้า VLM ระหว่างการอนุมาน ช่วยเร่งความเร็ว Cosmos 3 Reasoner NIM EVS ทำงานในระดับ Chunk โดยเก็บ Chunk ที่ไม่ซ้ำกันมากที่สุดของแต่ละเฟรม และตัดส่วนที่เหลือออก GPU ขนาดเล็กมักจะได้รับ

ขอบคุณ แหล่งข้อมูล
https://developer.nvidia.com/blog/develop-physical-ai-reasoning-world-and-action-models-with-nvidia-cosmos-3/

NVIDIA Cosmos 3: พัฒนา AI ด้านกายภาพ ด้วยโมเดลพื้นฐานที่เข้าใจโลกและสร้างการกระทำระบบ AI ด้านกายภาพ (Physical AI) จำเป็นต้องเข้าใจโลกแห่งความเป็นจริงก่อนที่จะสามารถลงมือทำสิ่งใดได้ หุ่นยนต์ ยานยนต์ไร้คนขับ และพื้นที่อัจฉริยะ (Smart Spaces) ล้วนต้องการความเข้าใจในสิ่งที่เกิดขึ้นรอบตัว เพื่อคาดการณ์เหตุการณ์ที่อาจเกิดขึ้น และสร้างการกระทำที่เหมาะสมกับสภาพแวดล้อม รูปร่าง และภารกิจที่ได้รับมอบหมายNVIDIA Cosmos 3 คือโมเดลพื้นฐาน (Foundation Model) ล้ำสมัยสำหรับ Physical AI ที่รวมเอาความสามารถในการให้เหตุผลเชิงกายภาพ (Physical Reasoning) การสร้างโลก (World Generation) และการสร้างการกระทำ (Action Generation) ไว้ในโมเดลเดียวแบบเปิด (Open Model)NVIDIA ได้เปิดให้ใช้งานโมเดล Cosmos 3, สคริปต์การฝึกสอน, เครื่องมือสำหรับการนำไปใช้งาน (Deployment Tools) และชุดข้อมูล (Datasets) เพื่อส่งเสริมการพัฒนา Physical AI ให้มีความเปิดกว้างและสามารถทำซ้ำได้ บทความนี้จะพาไปทำความเข้าใจพื้นฐานของ Cosmos 3, เน้นแนวคิดสำคัญจากรายงานทางเทคนิค, แนะนำขั้นตอนการทำงานทางเทคนิค และแสดงให้เห็นว่าทีมที่กำลังพัฒนาระบบหุ่นยนต์, ยานยนต์ไร้คนขับ และโซลูชันตรวจสอบคลังสินค้า สามารถเริ่มต้นใช้งานได้อย่างไรสิ่งที่น่าสนใจใน Cosmos 3โมเดล Cosmos 3 Nano และ Cosmos 3 Super: พร้อมให้ใช้งานบน Hugging Face พร้อมโค้ดบน GitHubชุดข้อมูลแบบเปิด: สำหรับแอปพลิเคชัน Physical AI เช่น หุ่นยนต์ และการขับขี่อัตโนมัติสคริปต์หลังการฝึกสอนแบบเปิด: สำหรับปรับแต่ง Cosmos 3 ให้เข้ากับโดเมนของคุณNVIDIA NIM Microservices: สำหรับการนำไปใช้งานที่ง่ายและมีประสิทธิภาพบน NVIDIA GPUsพัฒนาการใหม่ใน Cosmos 3ในเวอร์ชันก่อนหน้า Cosmos ได้แยกความสามารถด้านการสร้างโลก, การทำความเข้าใจเชิงกายภาพ และการสร้างฉากควบคุม ออกเป็นโมเดลและขั้นตอนการทำงานที่แตกต่างกัน แต่ในเวอร์ชันนี้ Cosmos 3 ได้รวมความสามารถเหล่านั้นเข้าไว้ด้วยกัน โดยใช้สถาปัตยกรรม Mixture-of-Transformers (MoT) ที่ประกอบด้วย 2 ส่วนหลัก:1. Reasoner Tower (หอคอยแห่งการให้เหตุผล)เป็นโมเดล Vision-Language Model (VLM) ที่ทำหน้าที่ตีความข้อมูลจากการสังเกตแบบหลายรูปแบบ (Multimodal Observations) เช่น รูปภาพ วิดีโอ และข้อความ ส่วนนี้ใช้สถาปัตยกรรมแบบ Autoregressive เพื่อตีความอินพุตและทำความเข้าใจการเคลื่อนไหว การปฏิสัมพันธ์ระหว่างวัตถุ และบริบทเชิงกายภาพอื่นๆ เปรียบเสมือน "สมอง" ที่ให้เหตุผลเกี่ยวกับโลกก่อนที่จะมีการสร้างอะไรขึ้นมา2. Generator Tower (หอคอยแห่งการสร้าง)ทำหน้าที่สร้างข้อมูลจากการสังเกตในอนาคตและลำดับการกระทำ ส่วนนี้ใช้กระบวนการแบบ Diffusion เพื่อสร้างวิดีโอที่คำนึงถึงหลักฟิสิกส์และผลลัพธ์ของการกระทำ โดยอิงตามความเข้าใจของ Reasoner Tower โดย Reasoner สามารถถูกเรียกใช้งานแยกกันได้ แต่ Generator จะเปิดใช้งานทั้งสองหอคอยเสมอเพื่อการสร้างที่ได้รับการชี้นำสถาปัตยกรรมนี้ทำให้โมเดลเดียวสามารถทำงานทั้งด้านการให้เหตุผลและการสร้าง ช่วยลดความซับซ้อนในการพัฒนา โดยไม่ต้องจัดการการทำงานร่วมกันระหว่างโมเดลหลายตัวและไปป์ไลน์การอนุมาน (Inference Pipelines)เลือกขนาดโมเดลให้เหมาะสมปัจจุบันมีโมเดล Cosmos 3 ให้เลือก 2 ขนาด:Cosmos 3 Nano: เป็นเวอร์ชันกะทัดรัด มีพารามิเตอร์ 16 พันล้าน (16B) ถูกปรับให้เหมาะกับการอนุมานที่มีประสิทธิภาพ เหมาะสำหรับการใช้งานบนเวิร์กสเตชัน เช่น NVIDIA RTX PRO 6000 GPU สำหรับการอนุมานหุ่นยนต์แบบเรียลไทม์และแอปพลิเคชัน Physical AICosmos 3 Super: เป็นโมเดลขนาด 64 พันล้านพารามิเตอร์ (64B) ออกแบบมาเพื่อคุณภาพและความสามารถสูงสุด ให้คะแนน Benchmark ที่สูงที่สุด เหมาะสำหรับการใช้งานใน Data Center บน NVIDIA Hopper และ NVIDIA Blackwell GPUs สำหรับการสร้างข้อมูลสังเคราะห์ (Synthetic Data Generation) ในสเกลใหญ่ และงาน Physical Reasoning ที่ซับซ้อนรูปแบบข้อมูลที่รองรับCosmos 3 รองรับรูปแบบข้อมูลอินพุตและเอาต์พุตผ่านสถาปัตยกรรมแบบรวมศูนย์:ภาพ (Images)วิดีโอ (Videos)ข้อความ (Text)การกระทำ (Actions)ชุดข้อมูล Physical AI แบบเปิดด้วยการเปิดตัว Cosmos 3, NVIDIA ได้เปิดให้ใช้งานชุดข้อมูล Synthetic Data Generation (SDG) บน Hugging Face ซึ่งครอบคลุมถึง:ฉากหุ่นยนต์ที่เกี่ยวกับการเคลื่อนไหว (Embodied robot scenes)ฉากการปฏิสัมพันธ์เชิงกายภาพ (Physical interaction scenes)ฉากมนุษย์ดิจิทัล (Digital human scenes)สถานการณ์การขับขี่อัตโนมัติ (Autonomous driving scenarios)ฉากการปฏิบัติงานในคลังสินค้า (Warehouse operations scenes)ชุดข้อมูลเหล่านี้สามารถนำไปใช้สำหรับการฝึกสอนเพิ่มเติม (Post-training) Cosmos 3 และโมเดลอื่นๆ ได้NVIDIA Cosmos Human Evaluation Benchmarkเฟรมเวิร์ก NVIDIA Cosmos Human Evaluation (HUE) ใช้สำหรับประเมินคุณภาพของ Generator ใน Cosmos 3 ในงานที่ครอบคลุมโดเมนต่างๆเนื่องจากโมเดลสร้างวิดีโอ SOTA (State-of-the-Art) ในปัจจุบันสามารถทำคะแนนบน Leaderboard อัตโนมัติได้สูงมาก ทำให้ความแตกต่างของคะแนนระหว่างเวอร์ชันต่างๆ อาจไม่มากพอสำหรับการเปรียบเทียบที่มีนัยสำคัญ HUE จึงเปลี่ยนจากการประเมินเชิงอัตนัย (Subjective Grading) ไปสู่การตรวจสอบข้อเท็จจริงเชิงวัตถุวิสัย (Objective Fact Verification) ทำให้สามารถเปรียบเทียบโมเดลชั้นนำได้อย่างละเอียด ผลลัพธ์ที่ได้คือสัญญาณคุณภาพที่น่าเชื่อถือยิ่งขึ้นสำหรับการปรับปรุงอย่างรวดเร็วและการตัดสินใจด้านการเปิดตัวผลิตภัณฑ์ที่เข้มงวด โดยได้รับการสนับสนุนจากการประเมินโดยมนุษย์อย่างเต็มรูปแบบHUE ประเมินคุณภาพการสร้างวิดีโอโดยใช้การตรวจสอบแบบ Binary ที่เป็นหน่วยย่อย แต่ละวิดีโอที่สร้างขึ้นจะถูกแบ่งเป็นคำถามแบบใช่/ไม่ใช่แบบข้อเท็จจริงเดียว ใน 4 มิติ ได้แก่: ความสอดคล้องเชิงความหมาย (Semantic Alignment), กฎทางฟิสิกส์ (Physical Laws), การให้เหตุผลเชิงเรขาคณิต (Geometric Reasoning) และความสมบูรณ์ของภาพ (Visual Integrity) ครอบคลุม 7 โดเมน Physical AI รวมถึงหุ่นยนต์ ยานยนต์ไร้คนขับ และฟิสิกส์ คำถามเหล่านี้ถูกสร้างขึ้นโดย VLM Pipeline, ปรับปรุงโดยผู้เชี่ยวชาญ และเปิดให้ใช้งานแบบ Open Source บน Hugging FaceCosmos 3 ได้รับการประเมินในชุด Benchmark หลายชุดที่ครอบคลุมการให้เหตุผล Physical AI, คุณภาพการสร้าง และประสิทธิภาพเฉพาะโดเมนReasoning BenchmarksCosmos 3 Super และ Cosmos 3 Nano เป็นผู้นำใน VANTAGE-Bench ที่ระดับ 32B และ 8B ตามลำดับ:VANTAGE-Bench: Benchmark สาธารณะแรกสำหรับประเมิน Vision-Language Models บนฟุตเทจกล้องคงที่ในโลกจริง ครอบคลุมคลังสินค้า การขนส่ง และพื้นที่อัจฉริยะTraffic Anomaly Reasoning (TAR): Leaderboard ใหม่สำหรับการตรวจจับและให้เหตุผลเกี่ยวกับเหตุการณ์ที่ผิดปกติในฟุตเทจการขนส่ง และเป็น Leaderboard อย่างเป็นทางการสำหรับ AI City Challenge 2026 Track 3Generator BenchmarksCosmos 3 เป็น SOTA แบบ Open Source และเป็นผู้นำใน PAI-Bench, R-Bench Physics-IQ และ RoboLab บน Leaderboard สาธารณะ:Artificial Analysis: แพลตฟอร์ม Benchmark ที่จัดอันดับ AI Models สำหรับการสร้างข้อความ รูปภาพ และวิดีโอ Cosmos 3 เป็นโมเดล Open Source ชั้นนำบน Leaderboard Text to Image และ Image to Video (ไม่มีเสียง)R-Bench: Benchmark สำหรับประเมิน World Models ที่ใช้ VDO ในการสร้างวิดีโอสำหรับหุ่นยนต์ ประเมินความสำเร็จของงานและคุณภาพของภาพผ่านตัวชี้วัดย่อย เช่น ความสอดคล้องของโครงสร้าง, ความสมเหตุสมผลทางฟิสิกส์ และความสมบูรณ์ของการดำเนินการPAI-Bench: Benchmark แบบรวมศูนย์ที่ประเมิน Physical AI ทั้งการทำความเข้าใจวิดีโอและการสร้างวิดีโอ ครอบคลุมโดเมนต่างๆ เช่น หุ่นยนต์ ยานยนต์ไร้คนขับ และสามัญสำนึกทางฟิสิกส์Physics-IQ: Benchmark ของวิดีโอในโลกจริงที่ทดสอบว่าโมเดลสร้างวิดีโอเข้าใจหลักการทางฟิสิกส์จริงหรือไม่ นอกเหนือจากการสร้างภาพที่สมจริงRoboLab: Benchmark การจำลองสำหรับประเมินนโยบายหุ่นยนต์ที่ทำงานได้ทั่วไปในหลายๆ งานปรับแต่ง Cosmos 3 ด้วยการฝึกสอนเพิ่มเติม (Post-training)ส่วนประกอบสำคัญของ Cosmos 3 คือชุดสูตรการฝึกสอนที่เปิดให้ใช้งานทั้งหมด นอกเหนือจาก Model Checkpoints แล้ว การเปิดตัวครั้งนี้ยังมาพร้อมกับโค้ด, ไฟล์คอนฟิก (Configs) และขั้นตอนการทำงานสำหรับการปรับแต่ง Cosmos 3 ให้เข้ากับโดเมน, รูปร่าง (Embodiments) และชุดข้อมูลใหม่ๆSupervised Fine-Tuning (SFT)SFT ช่วยให้นักพัฒนาสามารถปรับแต่งโมเดล Cosmos 3 ให้เข้ากับข้อมูลของตนเองได้ สูตรที่เปิดให้ใช้งานประกอบด้วยการฝึกสอนเพิ่มเติมสำหรับการสร้างภาพ (Vision Generation) สำหรับชุดข้อมูลวิดีโอที่กำหนดเอง รวมถึงสูตรที่เน้นการกระทำ (Action-oriented recipes) สำหรับเวิร์กโฟลว์หุ่นยนต์และ Physical AI นักพัฒนาสามารถปรับแต่ง Cosmos 3 สำหรับโดเมนเป้าหมายของตนเองได้ ไม่ว่าจะเป็นหุ่นยนต์, การขับขี่อัตโนมัติ หรือระบบอัตโนมัติในคลังสินค้าโค้ดและ Configs สำหรับการฝึกสอนเพิ่มเติมสามารถดูได้บน GitHubAction Post-trainingการฝึกสอนเพิ่มเติมเกี่ยวกับการกระทำ (Action Post-training) จะปรับแต่ง Cosmos 3 สำหรับแอปพลิเคชัน Physical AI ที่คำนึงถึงการกระทำ (Action-aware) รวมถึง Forward Dynamics, Inverse Dynamics และการสร้าง Policy นักพัฒนาสามารถฝึกสอนเพิ่มเติม Cosmos 3 ด้วยข้อมูลที่มีป้ายกำกับการกระทำได้ สำหรับแอปพลิเคชันหุ่นยนต์ สิ่งนี้รวมถึงเวิร์กโฟลว์ที่สำคัญหลายอย่าง: การสร้างข้อมูลจากการสังเกตในอนาคตโดยอิงตามการกระทำของหุ่นยนต์, การอนุมานการกระทำเบื้องหลังการสาธิตที่สังเกตได้ และการคาดการณ์ลำดับการกระทำจากข้อมูลการสังเกตปัจจุบันและ Prompt ของงาน ทำให้ Cosmos 3 เป็นรากฐานที่แข็งแกร่งสำหรับการสร้างแบบจำลองการกระทำของโลก (World Action Modeling) และการเรียนรู้นโยบาย (Policy Learning)นำไปใช้งานด้วย NVIDIA NIM Microservicesโมเดล Cosmos 3 ยังมีให้ใช้งานในรูปแบบ NVIDIA NIM Microservices เพื่อการนำไปใช้งานที่ปรับปรุงประสิทธิภาพและพร้อมสำหรับการผลิต NIM Microservices จะรวมโมเดลเข้ากับ Runtime การอนุมานที่ปรับปรุงแล้ว มอบประสิทธิภาพสูงโดยไม่จำเป็นต้องปรับแต่งโครงสร้างพื้นฐานการให้บริการด้วยตนเอง NIM Microservices ใช้งานง่ายกว่าสำหรับเวิร์กโฟลว์การอนุมาน เมื่อเทียบกับ Cosmos 3 repo บน GitHub ซึ่งเหมาะสำหรับเวิร์กโฟลว์การฝึกสอนเพิ่มเติมมากกว่าCosmos 3 Reasoner NIM พร้อมให้ใช้งานแล้ว มอบความสามารถในการให้เหตุผลของโมเดล Cosmos 3 โปรดติดตาม Cosmos 3 Generator NIM ซึ่งจะมอบความสามารถในการสร้างเต็มรูปแบบของโมเดล Cosmos 3การปรับปรุงเพื่อเร่งความเร็วการอนุมานQuantization: Cosmos 3 NIM รองรับการเลือก Model Checkpoints ที่ถูก Quantized แบบ BF16, FP8 หรือ NVFP4 การ Quantize แบบ NVFP4 จะลดความแม่นยำเชิงตัวเลขของโมเดลจาก BF16 เป็น 4-bit floating point ทำให้ความเร็วในการอนุมานเพิ่มขึ้นสูงสุด 2 เท่าvLLM: เป็น Inference Engine แบบ Open Source ที่ใช้เทคนิคต่างๆ เช่น Continuous Batching, Paged Attention และ Tensor Parallelism เพื่อให้บริการ LLMs อย่างมีประสิทธิภาพ Cosmos 3 Reasoner NIM Serving Stack สร้างขึ้นบน vLLM เพื่อให้ได้ Throughput ที่สูงกว่าแนวทางการให้บริการแบบดั้งเดิม Cosmos 3 Nano พร้อมใช้งานร่วมกับ vLLM-omni และ NVIDIA Dynamo เพื่อประสิทธิภาพสูงสุดEfficient Video Sampling (EVS): เทคนิคนี้จะลดจำนวน Video Tokens ที่ป้อนเข้า VLM ระหว่างการอนุมาน ช่วยเร่งความเร็ว Cosmos 3 Reasoner NIM EVS ทำงานในระดับ Chunk โดยเก็บ Chunk ที่ไม่ซ้ำกันมากที่สุดของแต่ละเฟรม และตัดส่วนที่เหลือออก GPU ขนาดเล็กมักจะได้รับhttps://developer.nvidia.com/blog/develop-physical-ai-reasoning-world-and-action-models-with-nvidia-cosmos-3/
Shared content
DEVELOPER.NVIDIA.COM
Develop Physical AI Reasoning, World, and Action Models with NVIDIA Cosmos 3
Physical AI systems must understand the real world before they can act within it. Robots, autonomous vehicles, and smart spaces need to understand what’s happening in their world…
2 Comments 0 Shares 153 Views 0 Reviews