AMD ทุ่มซื้อ Taalas สตาร์ทอัพชิป AI เสริมประสิทธิภาพ Inference ด้วยการสลักโมเดลลงบนซิลิคอน

AMD เดินหน้าเสริมทัพเพื่อท้าชน Nvidia ในตลาดฮาร์ดแวร์ AI ด้วยการเข้าซื้อกิจการ Taalas บริษัทผู้ผลิตชิป AI ที่มีความสามารถในการฝังน้ำหนักโมเดล (model weights) ลงบนซิลิคอนโดยตรง ซึ่งมีเป้าหมายเพื่อเพิ่มประสิทธิภาพการอนุมาน (inference) ให้สูงขึ้นอย่างก้าวกระโดด

การประกาศซื้อขายครั้งนี้มีขึ้นในช่วงปลายสัปดาห์ และถูกมองว่าเป็นการเดินตามรอย Nvidia ที่เคยทำข้อตกลงด้านลิขสิทธิ์กับ Groq เมื่อเดือนธันวาคมปีก่อน เพื่อให้บริการ Inference ประสิทธิภาพสูงที่จำเป็นสำหรับ AI Agents เช่น ผู้ช่วยเขียนโค้ด ให้ทำงานได้เร็วขึ้นและมีต้นทุนต่ำลง แม้ AMD จะไม่ได้เปิดเผยมูลค่าของข้อตกลงนี้ แต่คาดว่าเป็นการเข้าซื้อกิจการจริงจัง ไม่ใช่แค่การซื้อตัวบุคลากร

Taalas ซึ่งก่อตั้งขึ้นในปี 2023 และมีสำนักงานใหญ่อยู่ที่เมืองโทรอนโต นำเสนอแนวทางการทำ Inference ที่แตกต่างจาก GPU ทั่วไป หรือสถาปัตยกรรม Dataflow ที่เป็นหัวใจของ LPU ของ Groq หรือเครื่องเร่งความเร็วแบบแผ่นเวเฟอร์ของ Cerebras

ชิปเฉพาะสำหรับแต่ละโมเดล (Model-Specific Integrated Circuits - MSICs)

แนวทางของ Taalas ไม่ได้อาศัยหน่วยความจำ HBM ในการจัดเก็บน้ำหนักโมเดล แต่เลือกที่จะสลักน้ำหนักโมเดลลงบนซิลิคอนโดยตรง ทำให้ชิปของ Taalas เปรียบเสมือน "ชิปเฉพาะสำหรับโมเดล" (MSICs)

สิ่งที่น่าสนใจคือ เทคโนโลยีของ Taalas ไม่ได้เป็นเพียงแนวคิด แต่ได้มีการสาธิตการทำงานจริงแล้ว โดยในเดือนกุมภาพันธ์ที่ผ่านมา บริษัทได้เปิดตัวชิปทดสอบตัวแรกที่ผลิตด้วยกระบวนการ 6nm ของ TSMC ซึ่งมีชื่อว่า HC1 จากผลการทดสอบเบื้องต้น ชิปนี้สามารถประมวลผล Meta Llama 3.1 8B ได้สูงถึง 16,960 โทเค็นต่อวินาที ซึ่งเมื่อเทียบกับช่วงเดือนกุมภาพันธ์นั้น เร็วกว่า GPU ของ Nvidia ถึง 48 เท่า และเร็วกว่าเครื่องเร่งความเร็วของ Cerebras ถึง 8.5 เท่า

แม้ Llama 3.1 จะถือว่าเก่าแล้วในปัจจุบัน เนื่องจากเปิดตัวช่วงกลางปี 2024 แต่ชิปตัวนี้มีเป้าหมายหลักเพื่อพิสูจน์แนวคิด

Taalas ปิดลับเกี่ยวกับรายละเอียดการทำงานของชิปอย่างมาก แต่คาดว่าโปรเซสเซอร์ของบริษัทประกอบด้วยสองส่วนหลัก คือ Mask-ROM recall fabric ที่ใช้สลักน้ำหนักโมเดล และ SRAM recall fabric ที่ใช้จัดเก็บ KV caches และ fine-tuning adapters

สำหรับชิปรุ่นที่สอง HC2 ที่มีกำหนดออกในช่วงฤดูร้อนนี้ Taalas ตั้งเป้าเพิ่มจำนวนพารามิเตอร์เป็น 2 หมื่นล้านพารามิเตอร์ ซึ่งอาจฟังดูไม่มากนัก แต่เช่นเดียวกับ GPU สำหรับโมเดลขนาดใหญ่ น้ำหนักโมเดลจะถูกกระจายไปทั่วหลายตัวเร่งความเร็วโดยใช้ Pipeline Parallelism

ด้วยจำนวน 2 หมื่นล้านพารามิเตอร์ต่อชิป จะต้องการตัวเร่งความเร็วเพียง 50 ตัวเท่านั้นในการรองรับโมเดลขนาด 1 ล้านล้านพารามิเตอร์ และ AMD ก็มีแพลตฟอร์มคอมพิวต์ระดับแร็ค (rack-scale compute platform) และทีมออกแบบระบบภายในที่สามารถรองรับการทำงานนี้ได้อย่างสบาย

ซึ่งถือว่ามีประสิทธิภาพด้านพื้นที่และพลังงานมากกว่าระบบ LPX ของ Nvidia ที่เพิ่งเปิดตัวไป ซึ่งต้องใช้ GPU หลายสิบตัวและ LPU ของ Groq อย่างน้อย 2,000 ตัว เพื่อให้บริการโมเดลเดียวกัน

จากการคาดการณ์ AMD มีแผนจะจับคู่ Instinct-based Helios racks ของตนเองกับชิปที่ใช้เทคโนโลยีของ Taalas ซึ่งจะนำไปสู่สถาปัตยกรรมแบบแยกส่วน (disaggregated architecture) โดยการประมวลผล Prompt ที่ต้องใช้พลังงานคอมพิวต์สูงจะทำบน GPU ขณะที่การสร้างโทเค็นจะถูกถ่ายโอนไปยังตัวเร่งความเร็วของ Taalas

นอกจากนี้ ยังมีความเป็นไปได้ที่ AMD อาจนำกลยุทธ์แบบ "tick-tock" มาใช้ โดยลูกค้าจะเริ่มใช้งานและตรวจสอบโมเดลบน Instinct accelerators ก่อน และเมื่อพอใจแล้ว จึงเปลี่ยนไปใช้ Taalas accelerators ซึ่งในส่วนนี้เป็นเพียงการคาดการณ์ แต่ Vamsi Boppana รองประธานอาวุโสฝ่าย AI ของ AMD กล่าวไว้ในแถลงการณ์ว่า:

"AMD กำลังสร้างแพลตฟอร์ม AI แบบ Full-stack ที่มอบความยืดหยุ่นให้ลูกค้าสามารถปรับใช้โซลูชันคอมพิวต์ที่เหมาะสมสำหรับทุกเวิร์กโหลด AI"

ข้อจำกัดที่ต้องใส่ใจ: เมื่อคุณต้องผูกติดกับโมเดลนั้นๆ

แม้เทคโนโลยีนี้จะมีความเร็วสูง แต่ก็มีข้อเสียที่สำคัญ นั่นคือ เมื่อชิปถูกติดตั้งแล้ว คุณจะผูกติดอยู่กับโมเดลนั้นๆ การเปลี่ยนแปลงใดๆ ที่ใหญ่กว่าการปรับเล็กน้อยด้วย LoRA Adapter จะต้องมีการออกแบบชิปใหม่ ซึ่งไม่เพียงแต่มีค่าใช้จ่ายสูง แต่ยังใช้เวลานานอีกด้วย

ในช่วงเวลาเกือบสี่ปีที่ AI บูม โมเดลใหม่ๆ ถูกปล่อยออกมาแทบทุกเดือน เพื่อให้ได้รับประโยชน์จากเทคโนโลยีของ Taalas ลูกค้าของ AMD จะต้องมั่นใจในการเลือกโมเดลของตนเองอย่างมาก ซึ่งอาจจะง่ายกว่าสำหรับบางราย

อย่างไรก็ตาม หากสิ่งที่บริษัทกล่าวอ้างเป็นจริง สถานการณ์อาจไม่เลวร้ายอย่างที่คิด แม้โมเดลใหม่จะต้องการการออกแบบชิปใหม่ แต่ก็ไม่จำเป็นต้องเริ่มใหม่ทั้งหมด เพียงแค่เปลี่ยนชั้นโลหะสองชั้นเท่านั้น ซึ่งถูกกว่าและใช้เวลาน้อยกว่ามาก

เทคโนโลยีนี้มีศักยภาพที่จะถูกนำไปใช้โดยนักพัฒนาโมเดล AI ผู้ให้บริการโครงสร้างพื้นฐาน และผู้ให้บริการ Inference บางราย ในการสัมภาษณ์เมื่อเดือนกุมภาพันธ์ บริษัทได้กล่าวว่า การสลักน้ำหนักโมเดลลงบนซิลิคอนนั้นมีค่าใช้จ่ายน้อยกว่าการฝึกโมเดล Frontier ถึง 100 เท่า

AMD อยู่ในตำแหน่งที่สามารถเจรจาข้อตกลงเหล่านี้ได้ OpenAI, Anthropic และ Meta ล้วนเป็นลูกค้า Instinct รายใหญ่ ด้วยความสัมพันธ์ที่ใกล้ชิดระหว่างผู้พัฒนาโมเดลและผู้ออกแบบชิป จึงไม่น่าแปลกใจหากจะได้เห็น GPT หรือ Claude ถูกนำไปใช้งานบนการผสมผสานระหว่าง Taalas และ Instinct accelerators

เทคโนโลยีนี้ยังส่งผลต่อการพัฒนาโมเดลด้วย วิธีหนึ่งที่นักพัฒนาใช้เพื่อลดการเกิด Hallucinations คือการแลกเวลาเพื่อความแม่นยำ เทคนิคที่เรียกว่า Test-time scaling นี้ค่อนข้างง่ายในการปฏิบัติ โดยให้โมเดล "คิด" นานขึ้นก่อนตอบ

ข้อเสียอย่างหนึ่งของ Test-time scaling คือ การใช้โทเค็นจำนวนมาก ทำให้มีค่าใช้จ่ายสูง และผู้ใช้ต้องรอการตอบสนองจาก Chatbot, Code Assistant หรือ Agent นานขึ้น หากการซื้อ Taalas ของ AMD สามารถลดต้นทุนต่อโทเค็นและเพิ่มความเร็วในการสร้างผลลัพธ์ได้ 10-20 เท่า นักพัฒนาโมเดลอาจเลือกที่จะยืดเวลาการให้เหตุผลให้นานขึ้นไปอีก

ไม่ว่าในกรณีใด เราอาจจะได้เห็น Taalas เข้ามามีบทบาทในวิสัยทัศน์ที่กว้างขึ้นของ AMD ในไม่ช้า โดยข้อตกลงนี้คาดว่าจะเสร็จสมบูรณ์ภายในไตรมาสที่สี่ หลังจากการอนุมัติจากหน่วยงานกำกับดูแล

#AMD #Taalas #AIChip #Inference #TechAcquisition

ขอบคุณ แหล่งข้อมูล
https://www.theregister.com/systems/2026/08/06/amd-acquires-ai-chip-startup-taalas-to-boost-inference-performance-by-etching-models-into-silicon/5284344

AMD ทุ่มซื้อ Taalas สตาร์ทอัพชิป AI เสริมประสิทธิภาพ Inference ด้วยการสลักโมเดลลงบนซิลิคอนAMD เดินหน้าเสริมทัพเพื่อท้าชน Nvidia ในตลาดฮาร์ดแวร์ AI ด้วยการเข้าซื้อกิจการ Taalas บริษัทผู้ผลิตชิป AI ที่มีความสามารถในการฝังน้ำหนักโมเดล (model weights) ลงบนซิลิคอนโดยตรง ซึ่งมีเป้าหมายเพื่อเพิ่มประสิทธิภาพการอนุมาน (inference) ให้สูงขึ้นอย่างก้าวกระโดดการประกาศซื้อขายครั้งนี้มีขึ้นในช่วงปลายสัปดาห์ และถูกมองว่าเป็นการเดินตามรอย Nvidia ที่เคยทำข้อตกลงด้านลิขสิทธิ์กับ Groq เมื่อเดือนธันวาคมปีก่อน เพื่อให้บริการ Inference ประสิทธิภาพสูงที่จำเป็นสำหรับ AI Agents เช่น ผู้ช่วยเขียนโค้ด ให้ทำงานได้เร็วขึ้นและมีต้นทุนต่ำลง แม้ AMD จะไม่ได้เปิดเผยมูลค่าของข้อตกลงนี้ แต่คาดว่าเป็นการเข้าซื้อกิจการจริงจัง ไม่ใช่แค่การซื้อตัวบุคลากรTaalas ซึ่งก่อตั้งขึ้นในปี 2023 และมีสำนักงานใหญ่อยู่ที่เมืองโทรอนโต นำเสนอแนวทางการทำ Inference ที่แตกต่างจาก GPU ทั่วไป หรือสถาปัตยกรรม Dataflow ที่เป็นหัวใจของ LPU ของ Groq หรือเครื่องเร่งความเร็วแบบแผ่นเวเฟอร์ของ Cerebrasชิปเฉพาะสำหรับแต่ละโมเดล (Model-Specific Integrated Circuits - MSICs)แนวทางของ Taalas ไม่ได้อาศัยหน่วยความจำ HBM ในการจัดเก็บน้ำหนักโมเดล แต่เลือกที่จะสลักน้ำหนักโมเดลลงบนซิลิคอนโดยตรง ทำให้ชิปของ Taalas เปรียบเสมือน "ชิปเฉพาะสำหรับโมเดล" (MSICs)สิ่งที่น่าสนใจคือ เทคโนโลยีของ Taalas ไม่ได้เป็นเพียงแนวคิด แต่ได้มีการสาธิตการทำงานจริงแล้ว โดยในเดือนกุมภาพันธ์ที่ผ่านมา บริษัทได้เปิดตัวชิปทดสอบตัวแรกที่ผลิตด้วยกระบวนการ 6nm ของ TSMC ซึ่งมีชื่อว่า HC1 จากผลการทดสอบเบื้องต้น ชิปนี้สามารถประมวลผล Meta Llama 3.1 8B ได้สูงถึง 16,960 โทเค็นต่อวินาที ซึ่งเมื่อเทียบกับช่วงเดือนกุมภาพันธ์นั้น เร็วกว่า GPU ของ Nvidia ถึง 48 เท่า และเร็วกว่าเครื่องเร่งความเร็วของ Cerebras ถึง 8.5 เท่าแม้ Llama 3.1 จะถือว่าเก่าแล้วในปัจจุบัน เนื่องจากเปิดตัวช่วงกลางปี 2024 แต่ชิปตัวนี้มีเป้าหมายหลักเพื่อพิสูจน์แนวคิดTaalas ปิดลับเกี่ยวกับรายละเอียดการทำงานของชิปอย่างมาก แต่คาดว่าโปรเซสเซอร์ของบริษัทประกอบด้วยสองส่วนหลัก คือ Mask-ROM recall fabric ที่ใช้สลักน้ำหนักโมเดล และ SRAM recall fabric ที่ใช้จัดเก็บ KV caches และ fine-tuning adaptersสำหรับชิปรุ่นที่สอง HC2 ที่มีกำหนดออกในช่วงฤดูร้อนนี้ Taalas ตั้งเป้าเพิ่มจำนวนพารามิเตอร์เป็น 2 หมื่นล้านพารามิเตอร์ ซึ่งอาจฟังดูไม่มากนัก แต่เช่นเดียวกับ GPU สำหรับโมเดลขนาดใหญ่ น้ำหนักโมเดลจะถูกกระจายไปทั่วหลายตัวเร่งความเร็วโดยใช้ Pipeline Parallelismด้วยจำนวน 2 หมื่นล้านพารามิเตอร์ต่อชิป จะต้องการตัวเร่งความเร็วเพียง 50 ตัวเท่านั้นในการรองรับโมเดลขนาด 1 ล้านล้านพารามิเตอร์ และ AMD ก็มีแพลตฟอร์มคอมพิวต์ระดับแร็ค (rack-scale compute platform) และทีมออกแบบระบบภายในที่สามารถรองรับการทำงานนี้ได้อย่างสบายซึ่งถือว่ามีประสิทธิภาพด้านพื้นที่และพลังงานมากกว่าระบบ LPX ของ Nvidia ที่เพิ่งเปิดตัวไป ซึ่งต้องใช้ GPU หลายสิบตัวและ LPU ของ Groq อย่างน้อย 2,000 ตัว เพื่อให้บริการโมเดลเดียวกันจากการคาดการณ์ AMD มีแผนจะจับคู่ Instinct-based Helios racks ของตนเองกับชิปที่ใช้เทคโนโลยีของ Taalas ซึ่งจะนำไปสู่สถาปัตยกรรมแบบแยกส่วน (disaggregated architecture) โดยการประมวลผล Prompt ที่ต้องใช้พลังงานคอมพิวต์สูงจะทำบน GPU ขณะที่การสร้างโทเค็นจะถูกถ่ายโอนไปยังตัวเร่งความเร็วของ Taalasนอกจากนี้ ยังมีความเป็นไปได้ที่ AMD อาจนำกลยุทธ์แบบ "tick-tock" มาใช้ โดยลูกค้าจะเริ่มใช้งานและตรวจสอบโมเดลบน Instinct accelerators ก่อน และเมื่อพอใจแล้ว จึงเปลี่ยนไปใช้ Taalas accelerators ซึ่งในส่วนนี้เป็นเพียงการคาดการณ์ แต่ Vamsi Boppana รองประธานอาวุโสฝ่าย AI ของ AMD กล่าวไว้ในแถลงการณ์ว่า:"AMD กำลังสร้างแพลตฟอร์ม AI แบบ Full-stack ที่มอบความยืดหยุ่นให้ลูกค้าสามารถปรับใช้โซลูชันคอมพิวต์ที่เหมาะสมสำหรับทุกเวิร์กโหลด AI"ข้อจำกัดที่ต้องใส่ใจ: เมื่อคุณต้องผูกติดกับโมเดลนั้นๆแม้เทคโนโลยีนี้จะมีความเร็วสูง แต่ก็มีข้อเสียที่สำคัญ นั่นคือ เมื่อชิปถูกติดตั้งแล้ว คุณจะผูกติดอยู่กับโมเดลนั้นๆ การเปลี่ยนแปลงใดๆ ที่ใหญ่กว่าการปรับเล็กน้อยด้วย LoRA Adapter จะต้องมีการออกแบบชิปใหม่ ซึ่งไม่เพียงแต่มีค่าใช้จ่ายสูง แต่ยังใช้เวลานานอีกด้วยในช่วงเวลาเกือบสี่ปีที่ AI บูม โมเดลใหม่ๆ ถูกปล่อยออกมาแทบทุกเดือน เพื่อให้ได้รับประโยชน์จากเทคโนโลยีของ Taalas ลูกค้าของ AMD จะต้องมั่นใจในการเลือกโมเดลของตนเองอย่างมาก ซึ่งอาจจะง่ายกว่าสำหรับบางรายอย่างไรก็ตาม หากสิ่งที่บริษัทกล่าวอ้างเป็นจริง สถานการณ์อาจไม่เลวร้ายอย่างที่คิด แม้โมเดลใหม่จะต้องการการออกแบบชิปใหม่ แต่ก็ไม่จำเป็นต้องเริ่มใหม่ทั้งหมด เพียงแค่เปลี่ยนชั้นโลหะสองชั้นเท่านั้น ซึ่งถูกกว่าและใช้เวลาน้อยกว่ามากเทคโนโลยีนี้มีศักยภาพที่จะถูกนำไปใช้โดยนักพัฒนาโมเดล AI ผู้ให้บริการโครงสร้างพื้นฐาน และผู้ให้บริการ Inference บางราย ในการสัมภาษณ์เมื่อเดือนกุมภาพันธ์ บริษัทได้กล่าวว่า การสลักน้ำหนักโมเดลลงบนซิลิคอนนั้นมีค่าใช้จ่ายน้อยกว่าการฝึกโมเดล Frontier ถึง 100 เท่าAMD อยู่ในตำแหน่งที่สามารถเจรจาข้อตกลงเหล่านี้ได้ OpenAI, Anthropic และ Meta ล้วนเป็นลูกค้า Instinct รายใหญ่ ด้วยความสัมพันธ์ที่ใกล้ชิดระหว่างผู้พัฒนาโมเดลและผู้ออกแบบชิป จึงไม่น่าแปลกใจหากจะได้เห็น GPT หรือ Claude ถูกนำไปใช้งานบนการผสมผสานระหว่าง Taalas และ Instinct acceleratorsเทคโนโลยีนี้ยังส่งผลต่อการพัฒนาโมเดลด้วย วิธีหนึ่งที่นักพัฒนาใช้เพื่อลดการเกิด Hallucinations คือการแลกเวลาเพื่อความแม่นยำ เทคนิคที่เรียกว่า Test-time scaling นี้ค่อนข้างง่ายในการปฏิบัติ โดยให้โมเดล "คิด" นานขึ้นก่อนตอบข้อเสียอย่างหนึ่งของ Test-time scaling คือ การใช้โทเค็นจำนวนมาก ทำให้มีค่าใช้จ่ายสูง และผู้ใช้ต้องรอการตอบสนองจาก Chatbot, Code Assistant หรือ Agent นานขึ้น หากการซื้อ Taalas ของ AMD สามารถลดต้นทุนต่อโทเค็นและเพิ่มความเร็วในการสร้างผลลัพธ์ได้ 10-20 เท่า นักพัฒนาโมเดลอาจเลือกที่จะยืดเวลาการให้เหตุผลให้นานขึ้นไปอีกไม่ว่าในกรณีใด เราอาจจะได้เห็น Taalas เข้ามามีบทบาทในวิสัยทัศน์ที่กว้างขึ้นของ AMD ในไม่ช้า โดยข้อตกลงนี้คาดว่าจะเสร็จสมบูรณ์ภายในไตรมาสที่สี่ หลังจากการอนุมัติจากหน่วยงานกำกับดูแล#AMD #Taalas #AIChip #Inference #TechAcquisitionhttps://www.theregister.com/systems/2026/08/06/amd-acquires-ai-chip-startup-taalas-to-boost-inference-performance-by-etching-models-into-silicon/5284344
Shared content
WWW.THEREGISTER.COM
AMD acquires AI chip startup Taalas to boost inference performance by etching models into silicon
Early tech demos show model-specific integrated circuits churning out up to 17,000 tokens a second
6 Reacties 0 aandelen 292 Views 0 voorbeeld