โต้แสร้งเป็น AI ฟังพร้อมพูดได้! Thinking Machines ท้าชน OpenAI

ในยุคที่ AI อย่าง ChatGPT หรือ Google Assistant ยังคงทำงานแบบ “ผลัดกันพูด” คล้ายการพิมพ์แชท Mira Murati อดีต CTO ของ OpenAI และผู้ก่อตั้ง John Schulman กลับชูแนวคิดใหม่ที่ท้าทายสถาบัน ด้วยสิ่งที่เรียกว่า “Interaction Model” ซึ่งไม่ใช่แค่โมเดลเสียงธรรมดา แต่เป็นระบบที่ AI สามารถฟังและพูดได้พร้อมกันราวกับคุยโทรศัพท์ การพัฒนานี้มีนัยยะสำคัญต่อธุรกิจ ไม่ใช่แค่ด้านประสบการณ์ผู้ใช้ แต่รวมถึงต้นทุนการดำเนินงาน ความเร็วในการให้บริการ และการสร้างแอปพลิเคชันที่ต้องการปฏิสัมพันธ์แบบเรียลไทม์อย่างแท้จริง
- Full Duplex คือหัวใจสำคัญ: การที่ AI สามารถ “ขัดจังหวะ” หรือพูดแทรกได้อย่างเป็นธรรมชาติ ไม่ใช่แค่ฟีเจอร์เก๋ๆ แต่ลดความล่าช้า (latency) ที่เป็นต้นทุนของเวลาในการสนทนาทางธุรกิจ เช่น การบริการลูกค้าหรือการสัมภาษณ์อัตโนมัติ
- สถาปัตยกรรมแบบ Dual-Model: การแยก Interaction Model (สำหรับพูด-ฟังแบบเรียลไทม์) ออกจาก Background Model (สำหรับคิดวิเคราะห์และค้นหาข้อมูล) ทำให้ระบบตอบสนองได้เร็วราว 0.40 วินาที โดยที่โมเดลหลักไม่ต้องรอการประมวลผลที่ช้า ซึ่งช่วยลด “การคิด” ที่เป็นภาระและประหยัดค่าใช้จ่ายด้านการคำนวณ
- ผลกระทบต่อการแข่งขัน: หากสำเร็จ การที่โมเดลนี้ถูกเทรนมาทั้งระบบ (ไม่ใช่แค่การห่อหุ้มโมเดลภาษาด้วยเทคนิคหลายชั้น) จะทำให้ Think Machines Lab ต่างจากคู่แข่งอย่าง OpenAI และ Google อย่างสิ้นเชิง โดยเฉพาะด้านการสนทนาที่ลื่นไหลและไม่สะดุด ซึ่งมีนัยต่อการสร้าง AI Contact Center หรือ AI Sales Agent ที่มีประสิทธิภาพเหนือชั้น
- การประยุกต์ใช้ในองค์กร: โมเดลที่ “ฟังขณะพูด” จะปฏิวัติการทำงานของ AI ในการเป็นพนักงานเสมือน (Virtual Agent) ไม่ว่าจะเป็นการเจรจาต่อรอง การให้คำปรึกษาแบบสด หรือการฝึกสอนพนักงาน ซึ่งต้องการจังหวะการสนทนาที่สมจริงมากกว่าการตอบโต้แบบหัวข้อต่อหัวข้อ
ข้อดีต่อธุรกิจ
– ลดเวลาการสนทนาลงได้มากถึง 30-40% เนื่องจากไม่ต้องรอจบประโยคก่อนตอบ
– เพิ่มความพึงพอใจของลูกค้าผ่านปฏิสัมพันธ์ที่เป็นธรรมชาติมากขึ้น
– โมเดลที่รองรับการทำงานแบบ Multi-stream ช่วยให้สามารถทำหลายอย่างพร้อมกันได้โดยไม่กระทบประสิทธิภาพ
ความท้าทาย
– การควบคุมให้ AI ขัดจังหวะอย่างเหมาะสมยังคงเป็นความท้าทายด้านจริยธรรมและ用户体验
– การปรับใช้ในสภาพแวดล้อมที่มีเสียงรบกวนหรือผู้ใช้หลายคนอาจต้องใช้การปรับแต่งเพิ่มเติม
– ต้นทุนการพัฒนาโมเดลแบบ Full Duplex สูงกว่าโมเดลแบบ Turn-based อย่างมาก
อัปเดตเทรนด์เทคโนโลยีล่าสุดก่อนใครที่ TechBizInsight.com นะคะ
Full English Translation: Thinking Machines wants to build an AI that actually listens while it talks! The AI startup founded by former OpenAI CTO Mira Murati challenges the industry with “Interaction Models.” Unlike ChatGPT or Google Assistant that work turn-based (you talk, it listens; it responds, you listen), this model operates in “full duplex” — it can listen and speak simultaneously, like a real phone call. The architecture splits conversation handling (Interaction Model) from slower reasoning (Background Model), achieving 0.40-second response time. This is a direct shot at OpenAI, Google, and Anthropic, who use a “bolted-on” approach for real-time voice. Business impact includes faster customer service, natural sales conversations, and cost savings through reduced latency and computational load.
Citations:
– https://techcrunch.com/2026/05/11/thinking-machines-wants-to-build-an-ai-that-actually-listens-while-it-talks/
