ตัวนี้คือตัวอะไร?
อักษรไทยไม่ใช่อักษรละติน สมมติฐานที่ยึดติดกับอักษรละตินเป็นหลักจึงใช้ไม่ได้ ทั้งใน tokenizer, ชุดข้อมูล, OCR และทุกอย่างที่สร้างต่อจากนั้น
งานวิจัย AI ระดับแนวหน้าสนใจอยู่ไม่กี่อย่าง และภาษาไทยไม่ใช่หนึ่งในนั้น
วายุคือองค์กรวิจัยที่ไม่แสวงผลกำไร ก่อตั้งโดยผู้สร้างโมเดล Typhoon เราเป็นกลุ่มคนที่พยายามหาคำตอบว่าทำไม โมเดล AI จึงอ่าน ฟัง และออกเสียงภาษาไทยผิด และเปิดเผยสิ่งที่เราพบเจอและเรียนรู้ เพื่อให้ภาษาอื่นๆที่เจอปัญหาเดียวกันได้นำไปใช้
ภาษาไทยมักถูกมองเป็นแค่ edge case เราเริ่มจากตรงนี้ เพราะเราเป็นคนไทย และมองว่าข้อจำกัดนั้นอาจส่งผลที่ใหญ่กว่า
อักษรไทยไม่ใช่อักษรละติน สมมติฐานที่ยึดติดกับอักษรละตินเป็นหลักจึงใช้ไม่ได้ ทั้งใน tokenizer, ชุดข้อมูล, OCR และทุกอย่างที่สร้างต่อจากนั้น
ใน Common Crawl ที่ทุกเจ้าใช้ เนื้อหาภาษาไทยมีเพียง 0.4% ของเว็บ และ 30% ในนั้นเป็นเว็บคาสิโน นี่ไม่ใช่อินเทอร์เน็ตที่คนไทยใช้ แต่มันเป็นสิ่งที่โมเดลเอาไปเรียนรู้
ในชีวิตประจำวัน เราใช้ภาษาไทยปนภาษาต่างชาติและปนภาษาประจำถิ่น แต่โมเดลที่ฝึกจากภาษาไทยในตำรา กลับเรียนรู้ภาษาไทยเฉยๆที่ไม่มีใครใช้จริง
อะไรคือจุดอ่อน
เราหาว่าอะไรคือสิ่งที่ทำกันในระดับ global แต่มันไม่เข้ากับคนไทย ทั้ง tokenization, ข้อมูล และการวัดผล
วัดผลก่อน เข้าใจการทำงาน แล้วค่อยแก้ปัญหา
เราเชื่อในการวัดผล และการเข้าใจ หลังจากนั้น ก็คือสิ่งที่เป็นไปได้
เราเปิดเผยทุกอย่างที่เรารู้ เพื่อชีวิตทุกคนที่ดีขึ้น
เรานำสิ่งที่เราเจอมาเผยแพร่ให้ทุกคนได้นำไปต่อยอด
ใช้โมเดลโคลนเสียงขนาดใหญ่เป็นเครื่องมือผลิตข้อมูล แปลงเสียงอ้างอิง 15 วินาทีเป็นโมเดล 82M พารามิเตอร์ ที่เทรนด้วยเสียงสังเคราะห์ทั้งหมด และรัน Thai TTS บนอุปกรณ์ได้เอง
แยกความสมจริงของข้อมูลสังเคราะห์ออกทีละส่วน สิ่งที่ถ่ายทอดได้คือความหลากหลายของชุดตัวอักษร โครงสร้างสองมิติ และลายมือจริง ปรับ Wayu-Paxa-OCR-Zero ได้โดยไม่ใช้ป้ายกำกับจากหน้าจริง
วายุเป็นองค์กรวิจัยที่ไม่แสวงผลกำไร ไม่มีใครเข้าใจภาษาไทยเท่าคนไทย และไม่มีใครที่จะเข้ามาทำงานนี้แทนเรา เราจึงทดลองและแลกเปลี่ยนสิ่งที่พบเจอและเรียนรู้ ให้ทุกทีม ไม่ว่าจะทำงานกับภาษาไหน ก็นำไปใช้เพื่อให้แข่งขันได้
ส่งโจทย์ที่คุณเจอมา หรือร่วมเป็นพาร์ตเนอร์งานวิจัยกับเรา