Cover Image

Apple พลิกเกม Local AI ชิป M5 Ultra ยัดแรม 512GB ท้าชน Nvidia - techhub

Apple ลุยตลาด Local AI เต็มตัว ส่ง ชิป M5 Ultra แรมสูงสุด 512GB และ M6 รันโมเดลภาษาขนาดใหญ่ได้จบในเครื่องเดียว ไม่ต้องง้อคลาวด์

ภาพจำเดิมที่ว่า Mac คือเครื่องมือหากินของช่างภาพและครีเอเตอร์สายตัดต่อ อาจกำลังถูก Apple รื้อทิ้งอย่างสิ้นเชิง

เพราะล่าสุดที่ Apple ได้เปิดตัวชิป M6 และ M5 Ultra มันกำลังสะท้อนทิศทางใหม่ที่ชัดเจนว่า Apple กำลังเบนเข็มสู่สมรภูมิ Local AI Workstation เพื่อตอบโจทย์กลุ่มนักพัฒนาและวิศวกร AI ที่กำลังดิ้นรนหาทางรอดจากค่าบริการ Cloud API ที่พุ่งสูงขึ้น

จุดเจ็บปวดที่สุดของสาย Local AI คือการรันโมเดลภาษาขนาดใหญ่ที่มักติดคอขวดที่ VRAM ของการ์ดจอระดับผู้บริโภคทั่วไป ซึ่งมักตันอยู่แค่ 16GB–32GB หากต้องการรันโมเดลระดับ 70B ขึ้นไป เราอาจต้องควักเงินหลักล้านซื้อเซิร์ฟเวอร์การ์ดจอระดับ Enterprise หรือยอมจ่ายค่า Token บนคลาวด์รายเดือน

Apple แก้โจทย์นี้ด้วยการขยายเพดาน Unified Memory บนชิป M5 Ultra สูงสุดถึง 512GB (ไม่ใช่ระดับกิกะไบต์สองหลักแบบเดิม) พร้อมแบนด์วิดท์มหาศาล 1.2 TB/s ทำให้สามารถยัดโมเดลระดับ 70B ไปจนถึง 405B ลงในหน่วยความจำของเครื่องเดี่ยวได้ทันที

ยิ่งไปกว่านั้น macOS รุ่นล่าสุดยังปลดล็อกระบบ Daisy-chaining ผ่านพอร์ต Thunderbolt 5 พร้อมเทคโนโลยี RDMA ช่วยให้ผู้ใช้นำ Mac Studio มาต่อพ่วงรวมแรมข้ามเครื่องกันได้ โดยการเชื่อมต่อ 4 เครื่องสามารถดัน Throughput การประมวลผล (Inference) ให้สูงขึ้นถึง 3 เท่า

ขุมพลังสถาปัตยกรรม M6 ชิป 2nm ตัวแรก และ M5 Ultra ร่างทอง Quad-Die

เบื้องหลังประสิทธิภาพระดับก้าวกระโดดนี้เกิดจากการแยกโครงสร้างชิปที่ตอบโจทย์คนละระดับอย่างชัดเจน

เลือกเครื่องแบบไหนให้ตอบโจทย์งบประมาณและการใช้งาน

แต่อย่าเพิ่งดูแคลนฝั่ง NVIDIA ไป

ในฝั่งของยักษ์ใหญ่สีเขียว Nvidia ก็ไม่ได้ปล่อยให้ Apple ครองตลาดนี้เพียงลำพัง โดยได้ส่ง DGX Spark เดสก์ท็อปซูเปอร์คอมพิวเตอร์สถาปัตยกรรม Grace Blackwell เข้ามาท้าชนโดยตรง แล้วผู้ใช้อย่างเราจะเลือกไปทางไหนดี

หมัดเด็ดของ Nvidia อยู่ที่ Ecosystem ฝั่งซอฟต์แวร์อย่าง CUDA, TensorRT และไลบรารี AI ระดับโปรดักชันทั่วโลกที่สร้างขึ้นมาเพื่อ Nvidia โดยเฉพาะ ไม่ต้องเสียเวลาแปลงโมเดลไปเป็นเฟรมเวิร์ก MLX

นอกจากนี้ สถาปัตยกรรม Blackwell ยังมาพร้อม Tensor Cores ยุคที่ 5 ที่ให้พลังคำนวณดิบระดับ 1 PetaFLOP บนฟอร์แมต FP4 เหมาะอย่างยิ่งสำหรับงาน Fine-tuning และการเทรนโมเดลที่ต้องการความเร็วแบบดิบเถื่อน

สงคราม AI บนเดสก์ท็อปรอบนี้จึงขึ้นอยู่กับลักษณะงานอย่างแท้จริง หากเป้าหมายคือการโหลดโมเดลขนาดใหญ่ที่สุดเท่าที่จะทำได้บนเครื่องที่เงียบและประหยัดพลังงาน Apple ถือไพ่เหนือกว่าด้วยพื้นที่แรมมหาศาล แต่ถ้าหัวใจของงานคือความเร็วในการประมวลผลระดับ FP4 และความเข้ากันได้แบบ 100% กับมาตรฐานองค์กรของโลก CUDA ฝั่ง Nvidia DGX Spark ก็ยังคงเป็นมาตรฐานหลักที่ยากจะหาใครมาแทนที่

ที่มา : techspot

Back To Top