FLUX 3: ก้าวข้ามขีดจำกัดสู่ปัญญาประดิษฐ์ด้านภาพแบบหลายรูปแบบ

ในโลกที่เทคโนโลยี AI พัฒนาไปอย่างก้าวกระโดด การสร้างสรรค์คอนเทนต์และการทำความเข้าใจโลกเสมือนจริงกำลังก้าวเข้าสู่ยุคใหม่ Black Forest Labs ได้เปิดตัว FLUX 3 โมเดล AI แบบหลายรูปแบบ (Multimodal Foundation Model) ที่จะมาพลิกโฉมอุตสาหกรรม AI ด้านภาพ ด้วยความสามารถในการเรียนรู้และประมวลผลข้อมูลจากหลายแหล่งพร้อมกัน ทั้งภาพ วิดีโอ และเสียง

FLUX 3 คืออะไร? ทำไมถึงแตกต่าง?

FLUX 3 ไม่ใช่เพียงโมเดล AI ทั่วไป แต่เป็น "แบบจำลองการไหลแบบหลายรูปแบบ" (Multimodal Flow Model) ที่ถูกออกแบบมาเพื่อสร้าง "การเป็นตัวแทนของโลก" (Representation of the World) ได้อย่างสมบูรณ์ แทนที่จะเรียนรู้แต่ละองค์ประกอบแยกกัน FLUX 3 จะประมวลผลข้อมูลจาก ภาพ วิดีโอ และเสียง ไปพร้อมๆ กันภายในสถาปัตยกรรมแบบรวมศูนย์ (Unified Architecture)

การเรียนรู้จากทุกมิติ

  • ภาพ: เก็บโครงสร้างเชิงพื้นที่และความสัมพันธ์ ณ ช่วงเวลาหนึ่ง
  • วิดีโอ: เพิ่มมิติเวลา เผยให้เห็นพลวัตเชิงเวลาและกฎทางฟิสิกส์
  • เสียง: เปิดเผยความสัมพันธ์เชิงสาเหตุระหว่างปรากฏการณ์ทางกลกับเสียงที่การมองเห็นเพียงอย่างเดียวไม่สามารถตรวจจับได้
  • ภาษา: เชื่อมโยงการรับรู้เหล่านี้เข้ากับเป้าหมาย นามธรรม และคำแนะนำ

เมื่อเรียนรู้จากทุกมิติพร้อมกัน ข้อจำกัดร่วมกันของแต่ละมิติจะช่วยให้เข้าใจความจริงพื้นฐานเดียวกันได้ลึกซึ้งยิ่งขึ้น เสียงต้องสอดคล้องกับการกระทบ การเคลื่อนไหวต้องเป็นไปตามมวล และอนาคตต้องสืบเนื่องจากอดีต

ความสามารถที่โดดเด่นของ FLUX 3

FLUX 3 สร้างขึ้นบนหลักการ Self-Flow ซึ่งเป็นแนวทางในการจัดแนวการสร้างและการทำความเข้าใจแบบหลายรูปแบบอย่างมีประสิทธิภาพภายในสถาปัตยกรรมเดียวกัน ด้วยการเพิ่มขีดความสามารถในการประมวลผลและทรัพยากรข้อมูล จึงทำให้ FLUX 3 สามารถเรียนรู้จากวิดีโอ ภาพ และเสียงไปพร้อมๆ กัน

สร้างสรรค์คอนเทนต์ได้หลากหลาย

FLUX 3 มีความสามารถในการผสมผสานรูปแบบข้อมูล และสร้าง ภาพและวิดีโอพร้อมเสียง ได้พร้อมกัน ทั้งจากข้อความ (Text Prompt) หรือการป้อนข้อมูลอ้างอิง เช่น รูปภาพและวิดีโอ

ความสามารถหลักที่น่าสนใจ:

  • Text-to-Video Generation: สร้างวิดีโอจากข้อความ พร้อมเสียงประกอบในตัว
  • Image-to-Video Generation: สร้างวิดีโอต่อเนื่องจากเฟรมเริ่มต้น (Animation) หรือใช้รูปภาพเป็นข้อมูลอ้างอิง
  • Video-to-Video Generation: สร้างวิดีโอใหม่จากคลิปต้นฉบับ โดยยังคงองค์ประกอบสำคัญ เช่น ตัวละครเดิม ไปยังฉากหรือบริบทใหม่
  • Generative Video-Audio Continuation: สร้างวิดีโอและเสียงต่อเนื่องจากวิดีโอและเสียงที่ป้อนเข้าไป
  • Keyframe-to-Video Generation: สร้างวิดีโอแบบควบคุมการเปลี่ยนผ่านระหว่างช่วงเวลาที่กำหนด
  • Multilingual Dialogue: รองรับบทสนทนาหลายภาษา
  • Visual Styles & Aspect Ratios: รองรับสไตล์ภาพและอัตราส่วนภาพที่หลากหลาย เกินกว่ารูปแบบภาพยนตร์ทั่วไป
  • Agentic Chaining: เชื่อมโยงคลิปต่างๆ เข้าด้วยกันเป็นลำดับที่ยาวขึ้นหลายช็อต
  • High Style Diversity: รองรับสไตล์ภาพได้หลากหลาย ตั้งแต่วิดีโอจากกล้องแคมคอร์เดอร์ ไปจนถึงแอนิเมชันและภาพยนตร์
  • Strong Typography & Animated Designs: สร้างตัวอักษรและดีไซน์เคลื่อนไหวได้อย่างแม่นยำ

การประเมินผลเบื้องต้น

จากการประเมินผลเบื้องต้น FLUX 3 แสดงให้เห็นถึงประสิทธิภาพที่น่าประทับใจ โดยเฉพาะอย่างยิ่งในการจับการแสดงออกทางสีหน้าของมนุษย์ การเชื่อมโยงเสียงเข้ากับเหตุการณ์ทางกายภาพ และความสามารถด้านภาษา นอกจากนี้ ยังสามารถรวมความสามารถเหล่านี้เข้าด้วยกันเพื่อสร้างลำดับที่ยาวนานหลายนาที โดยใช้ข้อมูลอ้างอิงภาพเพื่อให้แน่ใจว่าตัวละครจะมีความสอดคล้องกันตลอดทุกฉาก

FLUX 3 ได้รับการเปรียบเทียบกับโมเดลอื่น ๆ และมีผลลัพธ์ที่น่าพอใจเมื่อเทียบกับคู่แข่งหลายราย

FLUX 3 Image: การสังเคราะห์และแก้ไขภาพ

FLUX 3 ไม่ได้จำกัดอยู่แค่การสร้างวิดีโอ แต่ยังสามารถสังเคราะห์และแก้ไขภาพในสไตล์ อัตราส่วนภาพ และความละเอียดที่หลากหลาย แสดงให้เห็นถึงการพัฒนาที่ก้าวกระโดดจากเวอร์ชันก่อนหน้า โดยเฉพาะอย่างยิ่งในด้านการจัดการกับ Prompt ที่ซับซ้อนและการสร้างข้อความ

การคาดการณ์การเคลื่อนไหว (Action Prediction)

FLUX 3 ยังขยายขอบเขตความเข้าใจของโลกไปสู่การคาดการณ์การเคลื่อนไหว โดยได้ผนวกรวมการคาดการณ์การเคลื่อนไหวแบบ Native เข้าไปใน FLUX 3 โดยตรง และใช้ Backbone ของวิดีโอที่ผ่านการฝึกอบรมล่วงหน้าเป็นพื้นฐานที่ตระหนักถึงพลวัตสำหรับโมเดลการเคลื่อนไหวที่สามารถปรับแต่งได้ด้วยข้อมูลเฉพาะงานที่จำกัด

การเปิดตัวและการเข้าถึง

Black Forest Labs กำลังทยอยเปิดให้ใช้งานความสามารถต่างๆ ของ FLUX 3 ในช่วง Early Access เพื่อให้แน่ใจว่าการเปิดตัวจะเป็นไปอย่างราบรื่น รวบรวมข้อเสนอแนะ และดำเนินการทดสอบด้านความปลอดภัยอย่างเข้มงวด

ความสามารถที่จะเปิดตัว ได้แก่:

  • FLUX 3 Video: การสร้างและแก้ไขวิดีโอและเสียงผ่าน API และ Private Weight Access
  • FLUX-mimic และ FLUX 3 Action: การคาดการณ์การเคลื่อนไหวผ่านพันธมิตรด้านการวิจัยและเชิงพาณิชย์ที่เลือกสรร
  • FLUX 3 Image: การสังเคราะห์และแก้ไขภาพผ่าน API และ Private Weight Access
  • FLUX 3 Dev: การเข้าถึง Multimodal Backbone แบบ Open-weight สำหรับการสร้างคอนเทนต์ (วิดีโอ เสียง ภาพ) และการคาดการณ์การเคลื่อนไหว

อนาคตของปัญญาประดิษฐ์ด้านภาพ

FLUX 3 เป็นเพียงจุดเริ่มต้นของศักยภาพที่หลากหลายและทรงพลังของโมเดลแบบหลายรูปแบบที่รวมเป็นหนึ่งเดียว ซึ่งจะนำไปสู่การใช้งานที่หลากหลาย ตั้งแต่การแก้ไขภาพและวิดีโอแบบโต้ตอบ การจำลอง ไปจนถึงการใช้งานคอมพิวเตอร์ และ AI ทางกายภาพ (Physical AI)

Black Forest Labs กำลังพัฒนาโมเดลรุ่นต่อไปอย่างต่อเนื่อง โดยมีเป้าหมายเพื่อรวมการทำนายการรับรู้ (Perceptual Prediction) การเคลื่อนไหว (Action Prediction) และภาษา (Language Prediction) ไว้ในโมเดลแบบรวมศูนย์เดียวกัน

หากคุณสนใจที่จะสำรวจและสร้างสรรค์ด้วย FLUX 3 สามารถติดต่อ Black Forest Labs ได้ หรือหากต้องการร่วมเป็นส่วนหนึ่งในพันธกิจนี้ สามารถสมัครงานได้ที่ เยอรมนี และ สหรัฐอเมริกา


คำถามที่พบบ่อย

FLUX 3 แตกต่างจากโมเดล AI สร้างภาพทั่วไปอย่างไร?

FLUX 3 เป็นโมเดลแบบหลายรูปแบบ (Multimodal) ที่เรียนรู้จาก ภาพ วิดีโอ และเสียงพร้อมกัน เพื่อสร้าง "การเป็นตัวแทนของโลก" ได้อย่างสมบูรณ์ ต่างจากโมเดลทั่วไปที่อาจเน้นเพียงรูปแบบข้อมูลเดียว

FLUX 3 สามารถสร้างวิดีโอได้ยาวแค่ไหน?

FLUX 3 สามารถสร้างวิดีโอพร้อมเสียงที่มีความหลากหลายได้ยาวสูงสุด 20 วินาทีในการสร้างครั้งเดียว และสามารถเชื่อมโยงเป็นลำดับที่ยาวขึ้นได้

FLUX 3 มีข้อจำกัดอะไรบ้าง?

ขณะนี้ FLUX 3 ยังอยู่ในช่วง Early Access และผลการประเมินยังเป็นข้อมูลเบื้องต้น คาดว่าจะมีการปรับปรุงเพิ่มเติมในช่วงการพัฒนาต่อไป

ใครคือผู้พัฒนา FLUX 3?

FLUX 3 พัฒนาโดย Black Forest Labs

จะเข้าถึง FLUX 3 ได้อย่างไร?

สามารถขอเข้าถึงช่วง Early Access ได้ผ่านทางเว็บไซต์ของ Black Forest Labs

ขอบคุณ แหล่งข้อมูล
https://bfl.ai/blog/flux-3

FLUX 3: ก้าวข้ามขีดจำกัดสู่ปัญญาประดิษฐ์ด้านภาพแบบหลายรูปแบบในโลกที่เทคโนโลยี AI พัฒนาไปอย่างก้าวกระโดด การสร้างสรรค์คอนเทนต์และการทำความเข้าใจโลกเสมือนจริงกำลังก้าวเข้าสู่ยุคใหม่ Black Forest Labs ได้เปิดตัว FLUX 3 โมเดล AI แบบหลายรูปแบบ (Multimodal Foundation Model) ที่จะมาพลิกโฉมอุตสาหกรรม AI ด้านภาพ ด้วยความสามารถในการเรียนรู้และประมวลผลข้อมูลจากหลายแหล่งพร้อมกัน ทั้งภาพ วิดีโอ และเสียงFLUX 3 คืออะไร? ทำไมถึงแตกต่าง?FLUX 3 ไม่ใช่เพียงโมเดล AI ทั่วไป แต่เป็น "แบบจำลองการไหลแบบหลายรูปแบบ" (Multimodal Flow Model) ที่ถูกออกแบบมาเพื่อสร้าง "การเป็นตัวแทนของโลก" (Representation of the World) ได้อย่างสมบูรณ์ แทนที่จะเรียนรู้แต่ละองค์ประกอบแยกกัน FLUX 3 จะประมวลผลข้อมูลจาก ภาพ วิดีโอ และเสียง ไปพร้อมๆ กันภายในสถาปัตยกรรมแบบรวมศูนย์ (Unified Architecture)การเรียนรู้จากทุกมิติภาพ: เก็บโครงสร้างเชิงพื้นที่และความสัมพันธ์ ณ ช่วงเวลาหนึ่งวิดีโอ: เพิ่มมิติเวลา เผยให้เห็นพลวัตเชิงเวลาและกฎทางฟิสิกส์เสียง: เปิดเผยความสัมพันธ์เชิงสาเหตุระหว่างปรากฏการณ์ทางกลกับเสียงที่การมองเห็นเพียงอย่างเดียวไม่สามารถตรวจจับได้ภาษา: เชื่อมโยงการรับรู้เหล่านี้เข้ากับเป้าหมาย นามธรรม และคำแนะนำเมื่อเรียนรู้จากทุกมิติพร้อมกัน ข้อจำกัดร่วมกันของแต่ละมิติจะช่วยให้เข้าใจความจริงพื้นฐานเดียวกันได้ลึกซึ้งยิ่งขึ้น เสียงต้องสอดคล้องกับการกระทบ การเคลื่อนไหวต้องเป็นไปตามมวล และอนาคตต้องสืบเนื่องจากอดีตความสามารถที่โดดเด่นของ FLUX 3FLUX 3 สร้างขึ้นบนหลักการ Self-Flow ซึ่งเป็นแนวทางในการจัดแนวการสร้างและการทำความเข้าใจแบบหลายรูปแบบอย่างมีประสิทธิภาพภายในสถาปัตยกรรมเดียวกัน ด้วยการเพิ่มขีดความสามารถในการประมวลผลและทรัพยากรข้อมูล จึงทำให้ FLUX 3 สามารถเรียนรู้จากวิดีโอ ภาพ และเสียงไปพร้อมๆ กันสร้างสรรค์คอนเทนต์ได้หลากหลายFLUX 3 มีความสามารถในการผสมผสานรูปแบบข้อมูล และสร้าง ภาพและวิดีโอพร้อมเสียง ได้พร้อมกัน ทั้งจากข้อความ (Text Prompt) หรือการป้อนข้อมูลอ้างอิง เช่น รูปภาพและวิดีโอความสามารถหลักที่น่าสนใจ:Text-to-Video Generation: สร้างวิดีโอจากข้อความ พร้อมเสียงประกอบในตัวImage-to-Video Generation: สร้างวิดีโอต่อเนื่องจากเฟรมเริ่มต้น (Animation) หรือใช้รูปภาพเป็นข้อมูลอ้างอิงVideo-to-Video Generation: สร้างวิดีโอใหม่จากคลิปต้นฉบับ โดยยังคงองค์ประกอบสำคัญ เช่น ตัวละครเดิม ไปยังฉากหรือบริบทใหม่Generative Video-Audio Continuation: สร้างวิดีโอและเสียงต่อเนื่องจากวิดีโอและเสียงที่ป้อนเข้าไปKeyframe-to-Video Generation: สร้างวิดีโอแบบควบคุมการเปลี่ยนผ่านระหว่างช่วงเวลาที่กำหนดMultilingual Dialogue: รองรับบทสนทนาหลายภาษาVisual Styles & Aspect Ratios: รองรับสไตล์ภาพและอัตราส่วนภาพที่หลากหลาย เกินกว่ารูปแบบภาพยนตร์ทั่วไปAgentic Chaining: เชื่อมโยงคลิปต่างๆ เข้าด้วยกันเป็นลำดับที่ยาวขึ้นหลายช็อตHigh Style Diversity: รองรับสไตล์ภาพได้หลากหลาย ตั้งแต่วิดีโอจากกล้องแคมคอร์เดอร์ ไปจนถึงแอนิเมชันและภาพยนตร์Strong Typography & Animated Designs: สร้างตัวอักษรและดีไซน์เคลื่อนไหวได้อย่างแม่นยำการประเมินผลเบื้องต้นจากการประเมินผลเบื้องต้น FLUX 3 แสดงให้เห็นถึงประสิทธิภาพที่น่าประทับใจ โดยเฉพาะอย่างยิ่งในการจับการแสดงออกทางสีหน้าของมนุษย์ การเชื่อมโยงเสียงเข้ากับเหตุการณ์ทางกายภาพ และความสามารถด้านภาษา นอกจากนี้ ยังสามารถรวมความสามารถเหล่านี้เข้าด้วยกันเพื่อสร้างลำดับที่ยาวนานหลายนาที โดยใช้ข้อมูลอ้างอิงภาพเพื่อให้แน่ใจว่าตัวละครจะมีความสอดคล้องกันตลอดทุกฉากFLUX 3 ได้รับการเปรียบเทียบกับโมเดลอื่น ๆ และมีผลลัพธ์ที่น่าพอใจเมื่อเทียบกับคู่แข่งหลายรายFLUX 3 Image: การสังเคราะห์และแก้ไขภาพFLUX 3 ไม่ได้จำกัดอยู่แค่การสร้างวิดีโอ แต่ยังสามารถสังเคราะห์และแก้ไขภาพในสไตล์ อัตราส่วนภาพ และความละเอียดที่หลากหลาย แสดงให้เห็นถึงการพัฒนาที่ก้าวกระโดดจากเวอร์ชันก่อนหน้า โดยเฉพาะอย่างยิ่งในด้านการจัดการกับ Prompt ที่ซับซ้อนและการสร้างข้อความการคาดการณ์การเคลื่อนไหว (Action Prediction)FLUX 3 ยังขยายขอบเขตความเข้าใจของโลกไปสู่การคาดการณ์การเคลื่อนไหว โดยได้ผนวกรวมการคาดการณ์การเคลื่อนไหวแบบ Native เข้าไปใน FLUX 3 โดยตรง และใช้ Backbone ของวิดีโอที่ผ่านการฝึกอบรมล่วงหน้าเป็นพื้นฐานที่ตระหนักถึงพลวัตสำหรับโมเดลการเคลื่อนไหวที่สามารถปรับแต่งได้ด้วยข้อมูลเฉพาะงานที่จำกัดการเปิดตัวและการเข้าถึงBlack Forest Labs กำลังทยอยเปิดให้ใช้งานความสามารถต่างๆ ของ FLUX 3 ในช่วง Early Access เพื่อให้แน่ใจว่าการเปิดตัวจะเป็นไปอย่างราบรื่น รวบรวมข้อเสนอแนะ และดำเนินการทดสอบด้านความปลอดภัยอย่างเข้มงวดความสามารถที่จะเปิดตัว ได้แก่:FLUX 3 Video: การสร้างและแก้ไขวิดีโอและเสียงผ่าน API และ Private Weight AccessFLUX-mimic และ FLUX 3 Action: การคาดการณ์การเคลื่อนไหวผ่านพันธมิตรด้านการวิจัยและเชิงพาณิชย์ที่เลือกสรรFLUX 3 Image: การสังเคราะห์และแก้ไขภาพผ่าน API และ Private Weight AccessFLUX 3 Dev: การเข้าถึง Multimodal Backbone แบบ Open-weight สำหรับการสร้างคอนเทนต์ (วิดีโอ เสียง ภาพ) และการคาดการณ์การเคลื่อนไหวอนาคตของปัญญาประดิษฐ์ด้านภาพFLUX 3 เป็นเพียงจุดเริ่มต้นของศักยภาพที่หลากหลายและทรงพลังของโมเดลแบบหลายรูปแบบที่รวมเป็นหนึ่งเดียว ซึ่งจะนำไปสู่การใช้งานที่หลากหลาย ตั้งแต่การแก้ไขภาพและวิดีโอแบบโต้ตอบ การจำลอง ไปจนถึงการใช้งานคอมพิวเตอร์ และ AI ทางกายภาพ (Physical AI)Black Forest Labs กำลังพัฒนาโมเดลรุ่นต่อไปอย่างต่อเนื่อง โดยมีเป้าหมายเพื่อรวมการทำนายการรับรู้ (Perceptual Prediction) การเคลื่อนไหว (Action Prediction) และภาษา (Language Prediction) ไว้ในโมเดลแบบรวมศูนย์เดียวกันหากคุณสนใจที่จะสำรวจและสร้างสรรค์ด้วย FLUX 3 สามารถติดต่อ Black Forest Labs ได้ หรือหากต้องการร่วมเป็นส่วนหนึ่งในพันธกิจนี้ สามารถสมัครงานได้ที่ เยอรมนี และ สหรัฐอเมริกาคำถามที่พบบ่อยFLUX 3 แตกต่างจากโมเดล AI สร้างภาพทั่วไปอย่างไร?FLUX 3 เป็นโมเดลแบบหลายรูปแบบ (Multimodal) ที่เรียนรู้จาก ภาพ วิดีโอ และเสียงพร้อมกัน เพื่อสร้าง "การเป็นตัวแทนของโลก" ได้อย่างสมบูรณ์ ต่างจากโมเดลทั่วไปที่อาจเน้นเพียงรูปแบบข้อมูลเดียวFLUX 3 สามารถสร้างวิดีโอได้ยาวแค่ไหน?FLUX 3 สามารถสร้างวิดีโอพร้อมเสียงที่มีความหลากหลายได้ยาวสูงสุด 20 วินาทีในการสร้างครั้งเดียว และสามารถเชื่อมโยงเป็นลำดับที่ยาวขึ้นได้FLUX 3 มีข้อจำกัดอะไรบ้าง?ขณะนี้ FLUX 3 ยังอยู่ในช่วง Early Access และผลการประเมินยังเป็นข้อมูลเบื้องต้น คาดว่าจะมีการปรับปรุงเพิ่มเติมในช่วงการพัฒนาต่อไปใครคือผู้พัฒนา FLUX 3?FLUX 3 พัฒนาโดย Black Forest Labsจะเข้าถึง FLUX 3 ได้อย่างไร?สามารถขอเข้าถึงช่วง Early Access ได้ผ่านทางเว็บไซต์ของ Black Forest Labshttps://bfl.ai/blog/flux-3
Shared content
BFL.AI
FLUX 3 - Real World Models: Towards Multimodal Flow Models as the Backbone of Visual Intelligence.
FLUX 3, our new multimodal frontier model, jointly learns from images, video, and audio to build one representation of the world. Now available in Early Access.
2 Kommentare 0 Geteilt 358 Ansichten 0 Bewertungen