โดย Nokka (นก-กา) | 23 กันยายน 2569
Gander จาก Tencent: โมเดลเปิดที่คุยเสียงพร้อมทำงานทับซ้อน
บทความนี้เขียนโดย AI (โมเดล glm-5.3 ของผู้ให้บริการ ollama-cloud) ผ่าน Hermes Agent จาก Nous Research ตรวจสอบและเรียบเรียงโดย Nokka
ลองนึกภาพ: คุณกำลังคุยกับผู้ช่วย AI ด้วยเสียง กลางคันคุณขอให้มันไปหาข้อมูลเรื่องหนึ่ง แล้วคุยเรื่องอื่นต่อได้เลย ไม่ต้องรอ ไม่ต้องวางสาย งานที่สั่งไปค่อยทำเสร็จมาคุยแทรกในบทสนทนาทีหลัง
สิ่งนี้เองที่ Tencent ออกมาโชว์ต้นเดือนกันยายน กับโปรเจกต์วิจัยชื่อ Gander ที่มีข้อความโฆษณาเด็ด: AI Agent แบบเปิดที่คุยด้วยเสียง ดูภาพ และทำงานเบื้องหลังไปพร้อมกันโดยไม่ต้องหยุดบทสนทนา
ผมไปอ่านงานวิจัยฉบับเต็มบน arXiv กับ repository ทางการบน GitHub ของทีม Hunyuan Speech Team รวมถึงหน้าโปรเจกต์ที่ลงคลิปสาธิตไว้ [1] [3] [4] คำตอบคือแนวคิดนี้ทำงานจริงและเปิดน้ำหนักโมเดลจริง แต่มีรายละเอียดสองชั้นที่คนแชร์ข่าวไม่ค่อยพูดถึง
สถาปัตยกรรม Cerebellum-Brain: กลไกที่ทำให้คุยไปทำไปพร้อมกันได้
เหตุผลที่ผู้ช่วยเสียงทั่วไปต้องหยุดสนทนาตอนทำงานคือพวกมันใช้สมองก้อนเดียว ปากกับมือแยกกันไม่ได้
Gander แก้ด้วยการแยกระบบเป็นสองส่วนที่ทีมวิจัยตั้งชื่อตามสมองมนุษย์ [1] [3]
- Cerebellum หรือสมองน้อย: รับผิดชอบการสนทนาแบบเสียงทันทีทันใด ฟังคุณ ดูภาพที่คุณส่งมา และพูดตอบกลับแบบสตรีม จุดเด่นคือคุณขัดจังหวะกลางประโยคมันได้ แบบเดียวกับการคุยกับคนจริง
- Brain หรือสมองใหญ่: ทำงานหนักเบื้องหลังแบบไม่ต้องรีบ เช่น ไปค้นข้อมูล เขียนโค้ด หรือเรียกเครื่องมือภายนอก ตัวสมองนี้เสียบได้หลากหลาย ทีมงานใช้ตัวแทนโค้ดระดับสูงเป็นตัวทำงานหลักในการทดสอบ
ตัวเชื่อมทั้งสองส่วนคือตัวกลางที่จัดคิวงาน ดังนั้นตอนคุณสั่งงานหนัก สมองน้อยยังคุยกับคุณได้ต่อเรื่อย ๆ เมื่อสมองใหญ่ทำเสร็จค่อยรายงานแทรกเข้ามา
ของเปิดจริงแค่ไหน
ข้อนี้พิสูจน์ง่าย: license เป็น Apache 2.0 และน้ำหนักโมเดลปล่อยบน Hugging Face ให้โหลดได้จริง [2] ตัวฐานสร้างมาจากโมเดล MiniCPM-o 4.5 ที่เปิดอยู่แล้ว [2]
การใช้เชิงพาณิชย์แก้ไขต่อและแจกต่อได้ตามเงื่อนไข Apache ไม่ติดสิทธิ์แบบ license วิจัยของบางค่าย
แต่คำว่าใช้ได้ต้องแยกให้ชัด: ค่ายนี้ไม่มีบริการออนไลน์สาธารณะให้ลอง ไม่มีหน้าเดโมสด มีแต่คลิปสาธิต อยากใช้ต้องดาวน์โหลดมาตั้งเองทั้งระบบ
ต้นทุนตั้งเองที่ไม่มีใครพูด
การ์ดจอสามใบและหน่วยความจำ
นี่คือส่วนที่คนอ่านต้องรู้ก่อนหลับตาฝันถึงผู้ช่วยเสียงส่วนตัว
- การตั้งค่าเต็มรูปแบบต้องการการ์ดจอสามใบ: คู่มือทางการระบุตรง ๆ ว่าส่วนรับรู้เสียง ส่วนพูด และส่วนแปลงเสียงเป็นข้อความ วิ่งบนการ์ดคนละใบ [1]
- ความหิวหน่วยความจำสูง: โมเดลฐานมีพารามิเตอร์ราว 9.4 พันล้าน ซึ่งคำนวณจากน้ำหนักแล้วกินหน่วยความจำการ์ดราว 19 GB ในรูปแบบเต็มความละเอียด ถ้าบีบเป็นเวอร์ชันย่อสี่บิต ค่าความจำที่ต้องใช้ต่อการ์ดรวมการทำงานอยู่ราว 11 GB ตามที่หน้าโมเดลของตัวฐานรายงาน [3]
- สมองเบื้องหลังไม่รวมมา: ตัวทำงานหนักอย่างตัวแทนโค้ดไม่ได้ฝังอยู่ในน้ำหนักโมเดล ต้องหามาเสียบเอง ซึ่งมักมีค่าใช้จ่ายของตัวเอง
ความเห็นส่วนตัว: ตัวเลขสามการ์ดจอทำให้เห็นชัดว่าโปรเจกต์นี้ยังเป็นงานวิจัยมากกว่าสินค้า คนที่จะได้ประโยชน์จริงตอนนี้คือนักวิจัยและนักพัฒนาที่อยากแกะว่าระบบสองสมองทำงานกันยังไง ส่วนผู้ใช้ทั่วไปควรรอให้ชุมชนแปลงให้เบาลงก่อน
คะแนนที่ต้องอ่านก่อนตื่นเต้น
งานวิจัยของทีมเองรายงานผลอย่างตรงไปตรงมา ซึ่งน่าชื่นชมและน่ากลัวไปพร้อมกัน [3]
- การสนทนาทับซ้อนควบคุมได้ดี: ผ่านเกณฑ์ทดสอบการขัดจังหวะและคุยต่อได้จริง
- แต่ความแม่นยำของงานยังตามหลังคู่ปิด: คะแนนการทำงานสำเร็จบนชุดทดสอบเสียงทับซ้อนอยู่ที่ราว 40 เปอร์เซ็นต์ ขณะที่บริการเสียงสดของค่ายใหญ่อย่าง GPT-Realtime อยู่ที่ 60 เปอร์เซ็นต์ [3] [5]
- ความเข้าใจภาพและเสียงถดถอยจากตัวฐาน: การฝึกเพิ่มให้คุยได้ทันทีทำให้ความเข้าใจเนื้อหาบางชุดทดสอบแย่ลงกว่าโมเดลตั้งต้นที่ไม่ได้ฝึกเรื่องนี้
- ข้อมูลฝึกยังไม่เปิด: ชุดข้อมูลราวสองจุดเจ็ดล้านตัวอย่างรอเปิดในอนาคต ตอนนี้ตรวจซ้ำไม่ได้
สรุปมุมมอง
ข้อดีของการเปิดของแบบนี้ชัด: ใครก็ต่อยอดได้ ไม่มีค่าใช้จ่ายลิขสิทธิ์ และชุมชนสามารถลดต้นทุนการ์ดสามใบลงในอนาคต ส่วนข้อเสียคือความแม่นยำของงานที่ยังต่ำกว่าคู่ปิดและความยุ่งยากของการตั้งค่าเองทั้งระบบ
Gander คือก้าวสำคัญของโลกโมเดลเปิด: พิสูจน์แล้วว่าการคุยเสียงแบบทับซ้อนทำงานพร้อมกันเป็นไปได้โดยไม่ต้องพึ่งค่ายปิด และการเปิดน้ำหนักพร้อม license ที่ใช้พาณิชย์ได้ทำให้คนอื่นต่อยอดได้จริง
แต่วันนี้มันยังเป็นเครื่องยนต์ต้นแบบ ไม่ใช่รถที่ซื้อมาขับได้เลย ความแม่นยำของงานยังต่ำกว่าคู่แข่งเชิงพาณิชย์ชัดเจน และต้นทุนตั้งระบบเต็มสูงเกินคนทั่วไป
คนที่ควรตามคือนักพัฒนาที่อยากเรียนรู้สถาปัตยกรรมสองสมอง กับคนที่รอเห็นผู้ช่วยเสียงแบบทับซ้อนหลุดจากห้องแล็บสู่ตลาดจริง แนวนี้จะมาแน่ แต่อาจไม่ใช่ปีนี้
เขียนโดย Nokka (นก-กา) นักเขียนอิสระแกะรอยเทคโนโลยี สนใจเรื่องการทำคอนเทนต์ให้คนหาเจอมาตลอด ถ้าชอบบทความแนว local AI แบบอิงหลักฐานจริงทั้งสองฝั่ง ติดตามได้ที่ dev.to/sarantoon
อ้างอิง:
[1] Omni-Interaction-Gander. "Omni-Interaction-Agent repository." github.com, เปิดตัว 9 กันยายน 2026. https://github.com/Omni-Interaction-Gander/Omni-Interaction-Agent
[2] Gander-Omni. "Gander model card." huggingface.co, เข้าถึง 22 กันยายน 2026. https://huggingface.co/Gander-Omni/Gander
[3] Hunyuan Speech Team, Tencent. "Omni Interaction Agent Technical Report." arxiv.org, ส่ง 8 กันยายน 2026 ปรับปรุง 12 กันยายน 2026. https://arxiv.org/abs/2609.08977
[4] Hunyuan Speech Team, Tencent. "Gander project page." Omni-Interaction-Gander.github.io, 9 กันยายน 2026. https://Omni-Interaction-Gander.github.io/Omni-Interaction-Agent/
[5] The Decoder. "Tencent’s Gander aims to keep talking while it works in the background." the-decoder.com, กันยายน 2026. https://the-decoder.com/tencents-gander-aims-to-keep-talking-while-it-works-in-the-background

Top comments (0)