ข้อความกลายเป็น Token ID และ Embedding ได้อย่างไร

AIKO อธิบายการแปลงข้อความเป็น Token ID และ Embedding ในห้องทดลอง AI

AI อ่านคำว่า “แมว” ไม่เหมือนเรา ระบบจะแบ่งข้อความเป็นชิ้นเล็ก ๆ ติดหมายเลขให้แต่ละชิ้น แล้วเปลี่ยนหมายเลขนั้นเป็นชุดตัวเลขที่โมเดลนำไปคำนวณต่อได้

Token

ชิ้นส่วนของข้อความ อาจเป็นคำ ส่วนของคำ เครื่องหมาย หรืออักขระ

Token ID

หมายเลขประจำ Token ในสมุดคำศัพท์ของโมเดล ไม่ใช่คะแนนความหมาย

Embedding

เวกเตอร์ หรือชุดตัวเลขหลายมิติ ที่โมเดลเรียนรู้เพื่อใช้แทน Token

LEARNING OBJECTIVES

เมื่อจบกิจกรรมนี้ ผู้เรียนจะสามารถ…

ใช้เป้าหมายสามข้อนี้เป็นคำถามนำก่อนเริ่ม และกลับมาตรวจความเข้าใจอีกครั้งเมื่อจบกิจกรรม

1

อธิบายลำดับการแปลงข้อความ

เล่าได้ว่า AI แบ่งข้อความเป็น Token กำหนด Token ID แล้วใช้ ID ไปค้นหา Embedding อย่างไร

2

แยกหน้าที่ของแต่ละคำให้ถูก

บอกได้ว่า Token คือชิ้นข้อความ ID คือป้ายอ้างอิง และ Embedding คือชุดตัวเลขที่ใช้คำนวณ

3

สังเกตผลเมื่อเปลี่ยนข้อความ

ทดลองเปลี่ยนคำหรือวิธีแบ่งข้อความ แล้วอธิบายได้ว่าทำไม Token, ID และเวกเตอร์จึงเปลี่ยนตาม

TRY IT YOURSELF

ลองส่งข้อความผ่านสายพานของ AI

พิมพ์ข้อความหรือเลือกตัวอย่าง แล้วกด Token เพื่อดู ID และเวกเตอร์ของชิ้นนั้น

  1. STEP 1

    รับข้อความ

  2. STEP 2

    แบ่งเป็น Token

  3. STEP 3

    แทนด้วย Token ID

Token ที่เลือก

แมวID 1847

เวกเตอร์สาธิตมี 4 มิติเพื่อให้มองเห็นง่าย โมเดลจริงมักมีหลายร้อยหรือหลายพันมิติ

STEP 4 · แปลง ID เป็น Embedding

ลองกด Token อื่น จะเห็นว่าชุดตัวเลขเปลี่ยนไป เลข ID ที่ใกล้กันไม่ได้แปลว่าความหมายใกล้กัน

SENTENCE EMBEDDING

เมื่อรวมหลาย Token เราได้ภาพแทนของทั้งประโยค

ตัวอย่างนี้เฉลี่ยเวกเตอร์ของ Token ทุกชิ้น แล้ววัดความคล้ายด้วย Cosine Similarity ยิ่งใกล้ 1 ทิศทางของเวกเตอร์ยิ่งคล้ายกัน

ประโยค A

แมวกินปลา

0.00

กำลังคำนวณความคล้าย

WHAT TO REMEMBER

สามเรื่องที่มักเข้าใจสลับกัน

01

ID เป็นป้ายชื่อ ไม่ใช่ความหมาย

Token ID 1847 ไม่ได้ “มากกว่า” ID 732 ในเชิงความหมาย มันเป็นเพียงตำแหน่งอ้างอิงใน Vocabulary

02

Embedding คือจุดเริ่ม ไม่ใช่คำตอบสุดท้าย

หลังได้ Embedding แล้ว โมเดลยังปรับข้อมูลด้วยตำแหน่งและบริบทผ่านหลายชั้น ก่อนสร้างคำตอบ

03

Token ไม่จำเป็นต้องเท่ากับหนึ่งคำ

คำเดียวอาจถูกแบ่งหลาย Token และ Token หนึ่งชิ้นอาจเป็นเพียงส่วนของคำหรือเครื่องหมายก็ได้

SUMMARY

ข้อสรุป: AI ต้องเปลี่ยนภาษาให้เป็นตัวเลขก่อนคำนวณ

ภาพใหญ่มีเพียงสี่จังหวะ ข้อความถูกแบ่งเป็นชิ้น แต่ละชิ้นมีหมายเลขอ้างอิง จากนั้นหมายเลขจะพาไปหาเวกเตอร์ที่โมเดลใช้คำนวณต่อ

ข้อความ Token Token ID Embedding

สิ่งที่ควรจำคือ ID ไม่ได้บอกความหมาย และ Embedding ไม่ใช่คำตอบสำเร็จรูป โมเดลยังต้องนำเวกเตอร์ไปประมวลผลร่วมกับตำแหน่งและบริบทอีกหลายขั้น ส่วนตัวเลขในห้องทดลองนี้มีไว้ช่วยให้มองเห็นกลไก โมเดลจริงอาจแบ่ง Token และสร้างเวกเตอร์ต่างออกไป

Insightful AI World · เข้าใจโลกของ AI อย่างถ่องแท้ ผ่านคำอธิบายที่ง่ายและนำไปใช้ได้จริง