ชิ้นส่วนของข้อความ อาจเป็นคำ ส่วนของคำ เครื่องหมาย หรืออักขระ
ข้อความกลายเป็น Token ID และ Embedding ได้อย่างไร
AI อ่านคำว่า “แมว” ไม่เหมือนเรา ระบบจะแบ่งข้อความเป็นชิ้นเล็ก ๆ ติดหมายเลขให้แต่ละชิ้น แล้วเปลี่ยนหมายเลขนั้นเป็นชุดตัวเลขที่โมเดลนำไปคำนวณต่อได้
หมายเลขประจำ Token ในสมุดคำศัพท์ของโมเดล ไม่ใช่คะแนนความหมาย
เวกเตอร์ หรือชุดตัวเลขหลายมิติ ที่โมเดลเรียนรู้เพื่อใช้แทน Token
LEARNING OBJECTIVES
เมื่อจบกิจกรรมนี้ ผู้เรียนจะสามารถ…
ใช้เป้าหมายสามข้อนี้เป็นคำถามนำก่อนเริ่ม และกลับมาตรวจความเข้าใจอีกครั้งเมื่อจบกิจกรรม
อธิบายลำดับการแปลงข้อความ
เล่าได้ว่า AI แบ่งข้อความเป็น Token กำหนด Token ID แล้วใช้ ID ไปค้นหา Embedding อย่างไร
แยกหน้าที่ของแต่ละคำให้ถูก
บอกได้ว่า Token คือชิ้นข้อความ ID คือป้ายอ้างอิง และ Embedding คือชุดตัวเลขที่ใช้คำนวณ
สังเกตผลเมื่อเปลี่ยนข้อความ
ทดลองเปลี่ยนคำหรือวิธีแบ่งข้อความ แล้วอธิบายได้ว่าทำไม Token, ID และเวกเตอร์จึงเปลี่ยนตาม
TRY IT YOURSELF
ลองส่งข้อความผ่านสายพานของ AI
พิมพ์ข้อความหรือเลือกตัวอย่าง แล้วกด Token เพื่อดู ID และเวกเตอร์ของชิ้นนั้น
-
STEP 1
รับข้อความ
-
STEP 2
แบ่งเป็น Token
-
STEP 3
แทนด้วย Token ID
Token ที่เลือก
ID 1847เวกเตอร์สาธิตมี 4 มิติเพื่อให้มองเห็นง่าย โมเดลจริงมักมีหลายร้อยหรือหลายพันมิติ
STEP 4 · แปลง ID เป็น Embedding
ลองกด Token อื่น จะเห็นว่าชุดตัวเลขเปลี่ยนไป เลข ID ที่ใกล้กันไม่ได้แปลว่าความหมายใกล้กัน
SENTENCE EMBEDDING
เมื่อรวมหลาย Token เราได้ภาพแทนของทั้งประโยค
ตัวอย่างนี้เฉลี่ยเวกเตอร์ของ Token ทุกชิ้น แล้ววัดความคล้ายด้วย Cosine Similarity ยิ่งใกล้ 1 ทิศทางของเวกเตอร์ยิ่งคล้ายกัน
ประโยค A
แมวกินปลา
กำลังคำนวณความคล้าย
WHAT TO REMEMBER
สามเรื่องที่มักเข้าใจสลับกัน
ID เป็นป้ายชื่อ ไม่ใช่ความหมาย
Token ID 1847 ไม่ได้ “มากกว่า” ID 732 ในเชิงความหมาย มันเป็นเพียงตำแหน่งอ้างอิงใน Vocabulary
Embedding คือจุดเริ่ม ไม่ใช่คำตอบสุดท้าย
หลังได้ Embedding แล้ว โมเดลยังปรับข้อมูลด้วยตำแหน่งและบริบทผ่านหลายชั้น ก่อนสร้างคำตอบ
Token ไม่จำเป็นต้องเท่ากับหนึ่งคำ
คำเดียวอาจถูกแบ่งหลาย Token และ Token หนึ่งชิ้นอาจเป็นเพียงส่วนของคำหรือเครื่องหมายก็ได้
SUMMARY
ข้อสรุป: AI ต้องเปลี่ยนภาษาให้เป็นตัวเลขก่อนคำนวณ
ภาพใหญ่มีเพียงสี่จังหวะ ข้อความถูกแบ่งเป็นชิ้น แต่ละชิ้นมีหมายเลขอ้างอิง จากนั้นหมายเลขจะพาไปหาเวกเตอร์ที่โมเดลใช้คำนวณต่อ
สิ่งที่ควรจำคือ ID ไม่ได้บอกความหมาย และ Embedding ไม่ใช่คำตอบสำเร็จรูป โมเดลยังต้องนำเวกเตอร์ไปประมวลผลร่วมกับตำแหน่งและบริบทอีกหลายขั้น ส่วนตัวเลขในห้องทดลองนี้มีไว้ช่วยให้มองเห็นกลไก โมเดลจริงอาจแบ่ง Token และสร้างเวกเตอร์ต่างออกไป
