โมเดลภาษา (Language Model) คือหัวใจสำคัญของ AI ที่ช่วยให้ระบบสามารถทำนายคำถัดไปในประโยคจากข้อความที่ได้รับ โมเดลเหล่านี้ถูกพัฒนาขึ้นมาเพื่อให้เข้าใจและสร้างข้อความที่เหมาะสมกับบริบท โดยมีการเทรนด้วยข้อมูลจำนวนมหาศาลจากอินเทอร์เน็ต หนังสือ และแหล่งข้อมูลสาธารณะต่าง ๆ เพื่อให้มีความรู้รอบด้านและสามารถตอบสนองคำถามหรือคำสั่งที่ได้รับได้อย่างแม่นยำ

THE BREAKDOWN

SECTION 01

การเทรนโมเดลภาษา: ขั้นตอน Pre-Training และ Post-Training

การเทรนโมเดลภาษาแบ่งออกเป็นสองขั้นตอนหลัก คือ

  • Pre-Training: โมเดลได้รับการเทรนด้วยข้อมูลจำนวนมากเพื่อเรียนรู้การทำนายคำถัดไปในข้อความ (Next Token Prediction) โดยใช้เทคนิคการเรียนรู้แบบไม่มีผู้ดูแล (Unsupervised Learning) ทำให้โมเดลมีความรู้กว้างขวางเกี่ยวกับภาษาและความหมาย

  • Post-Training: หลังจาก Pre-Training โมเดลจะถูกปรับแต่งเพิ่มเติมเพื่อให้ตอบสนองต่อคำสั่งหรือคำถามได้ดีขึ้น โดยการเทรนนี้ใช้ข้อมูลที่มีโครงสร้างเฉพาะ เช่น ชุดข้อมูลคำสั่งและคำตอบที่เหมาะสม และยังใช้เทคนิค Reinforcement Learning with Human Feedback (RLHF) เพื่อให้โมเดลเรียนรู้จากความชอบของมนุษย์และมีการตอบสนองที่เป็นประโยชน์มากขึ้น