อาลีบาบาส่งโมเดล Qwen3.8-Flash ลุยตลาด ชูสถาปัตยกรรมใหม่สุดล้ำ คุ้มค่าและทรงพลังที่สุด

อาลีบาบาเปิดตัว Qwen3.8-Flash โมเดลประมวลผลมัลติโมดัลแบบเปิดเผยค่าน้ำหนักที่ผ่านการเทรนเรียบร้อยแล้ว (open-weight) ที่ใช้สถาปัตยกรรม Mixture-of-Experts (MoE) ชูจุดเด่นเรื่องความคุ้มค่าสูงสุด โมเดลนี้ประกอบด้วยโมเดลหลักที่มีพารามิเตอร์ 125 พันล้านรายการ (125B) เสริมด้วย N-gram Embeddings อีก 51 พันล้านรายการ (51B) โดยดึงพารามิเตอร์มาใช้งานจริงเพียง 6 พันล้านพารามิเตอร์ (6B) ต่อหนึ่งโทเคน ซึ่งช่วยสร้างความสมดุลได้อย่างลงตัวระหว่างความสามารถ ความเร็วในการตอบสนอง และต้นทุน เหมาะสำหรับแอปพลิเคชันที่ต้องรองรับปริมาณงานสูง เวิร์กโฟลว์ที่ทำงานร่วมกับเครื่องมือต่าง ๆ ตลอดจนระบบช่วยเขียนโค้ดและผู้ช่วยทำงานร่วม นอกจากนี้ Qwen3.8-Flash ยังเป็นต้นแบบของสถาปัตยกรรมที่ออกแบบมาเพื่อรองรับซีรีส์ Qwen4 ที่กำลังจะเปิดตัวเร็ว ๆ นี้ 

Qwen3.8-Flash แสดงให้เห็นศักยภาพอันโดดเด่นทั้งการเขียนโค้ดด้วยเอเจนต์ (agentic coding),  การทำงานอัตโนมัติอย่างต่อเนื่องในระยะยาว (long-horizon agent tasks) และ AI ที่ประมวลผลได้แบบมัลติโมดัล (multimodal intelligence) โมเดลนี้ทำคะแนนเทียบชั้นได้กับโมเดลชั้นนำเช่น DeepSeek-V4-Flash และ Claude-Opus-4.6 จากการทดสอบในหลายเกณฑ์วัดมาตรฐาน (benchmarks) ไม่ว่าจะเป็น SWE-bench Pro (การเขียนโค้ดด้วยเอเจนต์), CoWorkBench (งานออฟฟิศที่มีขั้นตอนซับซ้อนและต้องทำอย่างต่อเนื่องเป็นระยะเวลานาน), Toolathlon Verified (การเรียกใช้เครื่องมือจริงเพื่อทำงานซับซ้อนหลายขั้นตอนให้สำเร็จ), MathVision (การแก้โจทย์คณิตศาสตร์ผ่านการประมวลผลและตีความภาพ), AndroidWorld (การควบคุมสมาร์ตโฟนด้วยเอเจนต์) และ ERQA (ปัญญาประดิษฐ์เชิงกายภาพ)  

โมเดลนี้รองรับ context ในตัวได้ 262K โทเคน และขยายได้ถึง 1 ล้านโทเคน ปัจจุบันเปิดให้นักพัฒนาทั่วโลกดาวน์โหลดและใช้งานค่าน้ำหนักโมเดล (weights) ได้แล้วบน Hugging Face และ ModelScope นอกจากนี้ยังสามารถเข้าถึงโมเดลผ่าน API ในราคาประหยัดบน Model Studio และ Qwen Cloud ซึ่งเป็นแพลตฟอร์มคลาวด์ของอาลีบาบาที่สร้างขึ้นเพื่อรองรับ AI อย่างเจาะจง โดยมีอัตราค่าบริการต่อ 1 ล้านโทเคนสำหรับการอินพุตอยู่ที่ 1 หยวน (0.16 ดอลลาร์สหรัฐ) และ 3 หยวน (0.47 ดอลลาร์สหรัฐ) สำหรับเอาต์พุต  

โมเดลนี้ยังพร้อมใช้งานบน QwenWork ซึ่งเป็นแพลตฟอร์ม AI agent สำหรับการทำงานแบบครบวงจรของอาลีบาบา โดยเข้ามาขับเคลื่อน standard mode ออกแบบใหม่ ช่วยลดการใช้โทเคนต่องานลง 75% และเพิ่มความเร็วในการสร้างเนื้อหาได้เกือบสองเท่า เมื่อเทียบกับโหมดปัจจุบัน ช่วยให้ผู้ใช้สามารถดึงความสามารถระดับเรือธงมาใช้กับเวิร์กโหลดทั่วไปได้  

นวัตกรรมทางสถาปัตยกรรม ช่วยยกระดับประสิทธิภาพการประมวลผล

Qwen3.8-Flash มาพร้อมนวัตกรรมทางสถาปัตยกรรมที่ครอบคลุมทั้ง attention mechanisms, residual connections, embeddings ไปจนถึงการทำ optimization ส่งผลให้โมเดลมีความสามารถสูงขึ้น ควบคู่กับการเพิ่มประสิทธิภาพ การประมวลผล ความจุ และความเสถียรในการเทรน เช่น สถาปัตยกรรม hybrid attention ที่ผสาน Gated DeltaNet (GDN) ที่ช่วยบีบอัดข้อมูลย้อนหลังได้อย่างมีประสิทธิภาพ เข้ากับ Qwen Sparse Attention (QSA) ซึ่งเป็นสถาปัตยกรรมรูปแบบใหม่ที่ใช้ดัชนีบีบอัดน้ำหนักเบาในการคัดเลือกบริบทที่เกี่ยวข้อง ช่วยลดต้นทุนในการประมวลผล attention สำหรับลำดับข้อมูลขนาดยาวได้อย่างมหาศาล นอกจากนี้กลไก Gated Residual (GR) ยังช่วยขยายช่องทางการส่งข้อมูลระหว่างเลเยอร์ พร้อมเสริมความแข็งแกร่งให้กับการไหลของข้อมูล และเพิ่มความเสถียรในการเทรน ในขณะที่เทคนิค N-gram Embedding ช่วยเพิ่มความจุของโมเดลโดยใช้ทรัพยากรการประมวลผลเพิ่มเพียงเล็กน้อย และการใช้ Muon Optimizer ยังช่วยเพิ่มประสิทธิภาพในการเทรนโมเดลขนาดใหญ่ให้ทำได้ดีขึ้น 

นวัตกรรมทางสถาปัตยกรรมขับเคลื่อนให้ Qwen3.8-Flash สามารถช่วยลดต้นทุนการเทรนและการอนุมาน (inference) ได้อย่างมีนัยสำคัญเมื่อเทียบกับ Qwen3.7-Plus ซึ่งเป็นโมเดลที่มีขนาดใหญ่กว่าถึงสามเท่า โดยใช้ทรัพยากรในการเทรนเพียงประมาณหนึ่งในเก้าเท่านั้น แต่กลับให้ประสิทธิภาพด้านการเขียนโค้ดและงานออฟฟิศที่เหนือกว่า 

ปัจจุบันอาลีบาบาได้เปิดโอเพนซอร์สโมเดลไปแล้วมากกว่า 460 โมเดลให้กับชุมชนโอเพนซอร์ส ซึ่งรวมถึง Hugging Face และ ModelScope จนระบบนิเวศนี้ได้ทำให้เกิดการพัฒนาต่อยอดเป็นโมเดลอนุพันธ์ (derivative models) มากกว่า 300,000 โมเดล และมียอดดาวน์โหลดทั่วโลกสะสมกว่า 3 พันล้านครั้ง ส่งผลให้โมเดลตระกูลนี้กลายเป็นตระกูลโมเดลโอเพนซอร์สที่มียอดดาวน์โหลดสูงที่สุดในโลก 

ที่มา: PC & ASSOCIATES CONSULTING