DEV Community

Nokka
Nokka

Posted on AI-assisted

อยากเข้าใจว่า LLM ทำงานยังไงจริง ๆ? คอร์ส Stanford ที่เปิดฟรี อาจเป็นจุดเริ่มที่ดีที่สุด

อยากเข้าใจว่า LLM ทำงานยังไงจริง ๆ? คอร์ส Stanford ที่เปิดฟรี อาจเป็นจุดเริ่มที่ดีที่สุด

โดย Nokka (นก-กา) | 9 ตุลาคม 2026

บทความนี้เขียนโดย AI (deepseek-v4.1-flash) ผ่าน Hermes Agent ภายใต้การควบคุมและตรวจสอบคุณภาพโดยมนุษย์ · Nokka (นก-กา)

ทุกวันนี้เราคุยกับแชตบอตทุกวัน แต่มีกี่คนที่ตอบได้ว่ามันทำงานยังไงจริง ๆ?

ไม่ใช่คำตอบระดับที่ว่า "มันเดาคำถัดไป" แบบที่ใครก็พูดได้ แต่ต้องรู้ว่าทำไมมันเดาได้ และทำไมบางทีนึกไม่ออก

ถ้าคำถามนี้ค้างอยู่ในหัวคุณ มีคอร์สหนึ่งที่ตั้งใจตอบคำถามนี้ทั้งชุด และเปิดให้ดูฟรี

คอร์สนี้คืออะไร และใครสอน

Stanford เปิดสอนรายวิชา CME 295: Transformers & Large Language Models โดยบันทึกทุกคาบขึ้น YouTube ให้ดูฟรี[1]

คาบแรกของรุ่น Autumn 2026 ยาว 1 ชั่วโมง 44 นาที และมียอดดูเกิน 372,000 ครั้งแล้ว ณ วันที่เขียนบทความนี้[2]

ชื่อวิชาในหลักสูตร CME ย่อมาจาก Computational and Mathematical Engineering ซึ่งเป็นสายวิศวกรรมเชิงคำนวณของมหาวิทยาลัย

ผู้สอนคือสองแฝดที่ผ่านเส้นทางเดียวกัน

ผู้สอนคือ Afshine Amidi และ Shervine Amidi สองพี่น้องฝาแฝดที่เรียนด้วยกันมาตลอดทาง

ทั้งคู่จบจาก Ecole Centrale Paris ในฝรั่งเศส แล้วแยกกันไปเรียนต่อระดับปริญญาโทที่อเมริกา โดย Afshine ไป MIT ส่วน Shervine ไป Stanford[3]

หลังจากนั้นทั้งคู่เข้า Uber แล้วไป Google ก่อนจะย้ายมาอยู่ Netflix ด้วยกันทั้งสองคน[2]

พวกเขาสอนเนื้อหานี้มาตั้งแต่ปี 2021 ในหลายรูปแบบ ก่อนจะยกระดับเป็นวิชาจริงของ Stanford เมื่อปีที่แล้ว และรุ่นนี้เป็นรุ่นที่สามตามที่ผู้สอนกล่าวไว้ในคลิป[2]

ไม่มี homework แต่มีข้อสอบสองครั้ง

จุดที่ต่างจากวิชามหาวิทยาลัยทั่วไปคือคอร์สนี้ ไม่มีการบ้านเลย คะแนนมาจากการสอบสองครั้ง คือ midterm กับ final[2]

midterm จะออกเนื้อหาสี่คาบแรก และจัดวันที่ 23 ตุลาคม 2026 ส่วน final จะออกเนื้อหาห้าคาบหลัง และจัดวันที่ 9 ธันวาคม 2026 รวมทั้งหมดเก้าคาบ[4]

คาบเรียนจัดทุกวันศุกร์ เวลา 15.30 ถึง 17.20 น. แต่ถ้าอยู่ต่างประเทศหรือเวลาไม่สะดวก ก็ดูย้อนหลังได้ทั้งหมด[1]

สไลด์ถูกโพสต์ล่วงหน้าหนึ่งวันก่อนคาบเรียน เพื่อให้ผู้เรียนพิมพ์จดบนสไลด์ได้ตามที่อาจารย์บอกว่าเป็นคำขอจากผู้เรียนรุ่นก่อน[2]

เส้นทางจาก RNN สู่ Transformer ที่คอร์สอธิบาย

คาบแรกใช้เวลาส่วนใหญ่ไปกับการตอบคำถามข้อหนึ่ง คือทำไมเรามาถึงจุดนี้

ผู้สอนย้อนไปเมื่อราวสิบปีก่อน ตอนที่วงการนี้ยังไม่มีโมเดลเดียวที่ทำได้ทุกอย่าง แต่มีโมเดลแยกกันตามงาน งานวิเคราะห์อารมณ์ก็มีโมเดลหนึ่ง งานแปลก็มีอีกโมเดล งานหาชื่อคนและสถานที่ก็มีอีกโมเดล[2]

โมเดลที่ครองวงการตอนนั้นคือ RNN หรือโครงข่ายประสาทแบบวนซ้ำ ซึ่งเรียนรู้จากลำดับของคำทีละคำ

แล้วทุกอย่างก็เปลี่ยนในปี 2017

กระดาษแผ่นเดียวที่เปลี่ยนทิศทางวงการ

ปี 2017 มีบทความวิจัยชื่อ Attention Is All You Need ที่เสนอสถาปัตยกรรมใหม่ชื่อ Transformer และกลายเป็นจุดเปลี่ยนของทั้งวงการ[5]

เหตุผลที่มันเปลี่ยนเกมไม่ได้อยู่ที่ผลลัพธ์ที่ดีขึ้นเท่านั้น แต่เพราะมัน ปรับขนาดได้

คำว่าปรับขนาดได้ในที่นี้หมายถึง ถ้าเราเพิ่มข้อมูล เพิ่มพลังประมวลผล และเพิ่มขนาดโมเดล ผลลัพธ์ที่ได้จะดีขึ้นในอัตราที่สูงกว่าเดิมมาก ซึ่งเป็นคุณสมบัติที่สถาปัตยกรรมก่อนหน้าไม่มี[2]

จากโครงสร้างนั้น วงการก็ขยายมันขึ้นเรื่อย ๆ ทั้งขนาดโมเดลและปริมาณข้อมูลที่ใช้ฝึก จนกลายเป็นโมเดลภาษาขนาดใหญ่ที่เรารู้จักทุกวันนี้

ผู้สอนไล่ไทม์ไลน์ต่อว่าเดือนพฤศจิกายน 2022 มีการเปิดตัว ChatGPT ซึ่งเป็นจุดเปลี่ยนอีกชั้นในมุมของผลิตภัณฑ์ เพราะเป็นครั้งแรกที่คนทั่วไปได้คุยกับแชตบอตจริง ๆ[2]

และมาถึงปี 2026 นี้ ผู้สอนคาดว่าผู้เรียนเกือบทุกคนใช้ coding agent เกือบทุกวัน ซึ่งเป็นคำถามที่คอร์สจะตอบในครึ่งหลังว่าจากผู้ช่วยคุยเล่น กลายเป็นเอเจนต์ที่ลงมือทำงานได้ยังไง[2]

สี่แนวคิดหลักที่คอร์สสอนในคาบแรก

Tokenization คือจุดเริ่มของทุกอย่าง

โมเดลไม่เข้าใจตัวอักษร มันเข้าใจตัวเลข

ดังนั้นขั้นแรกคือการแบ่งข้อความออกเป็นหน่วยย่อยที่เรียกว่า โทเคน แล้วแทนแต่ละหน่วยด้วยตัวเลขที่เรียกว่าเวกเตอร์[2]

คอร์สยกตัวอย่างง่าย ๆ ว่า ประโยค "a cute teddy bear is reading" อาจถูกแบ่งเป็นหกโทเคน โดยที่คำว่า teddy bear รวมกันเป็นหนึ่งหน่วย

แล้วทั้งชุดโทเคนที่โมเดลรู้จักก็เรียกรวมกันว่า vocabulary ซึ่งในโมเดลสมัยใหม่มีขนาดหลักแสน โดยผู้สอนบอกว่าอยู่ราว 200,000 โทเคน[2]

สามวิธีแบ่งคำ ที่มีข้อดีข้อเสียต่างกัน

แบ่งตามคำ ง่ายและอธิบายได้ แต่มีปัญหาสามข้อ คือคำที่แปรรูปเยอะทำให้ vocabulary บวม, คำที่มีรากเดียวกันไม่ได้ใช้ความรู้ร่วมกัน เช่น bear กับ bears, และเสี่ยงเจอคำที่ไม่เคยเห็นตอนฝึก[2]

แบ่งตามตัวอักษร แก้ปัญหาไม่รู้จักคำได้ เพราะตัวอักษรมีจำกัด แต่ลำดับจะยาวขึ้นมาก ทำให้ประมวลผลช้าลง และเวกเตอร์ที่ได้ก็ตีความยากกว่า[2]

แบ่งตามหน่วยย่อยของคำ (subword) เป็นวิธีที่ครองวงการตอนนี้ เพราะได้ทั้งรากคำและขนาดที่สมดุล[2]

วิธีที่นิยมที่สุดในกลุ่มนี้คือ BPE หรือ Byte Pair Encoding ซึ่งเริ่มจากชุดโทเคนตั้งต้น แล้วนับคู่ที่ปรากฏบ่อยที่สุดมาหลอมรวมเป็นโทเคนใหม่ ทำซ้ำไปเรื่อย ๆ จนได้ขนาด vocabulary ตามที่ต้องการ[2]

ผู้สอนย้ำว่าถ้าทำงานหลายภาษา ต้องมั่นใจว่าคลังข้อความที่ใช้ฝึก tokenizer มีทุกภาษาที่เราสนใจ

เวกเตอร์ของคำที่เรียนรู้ความหมาย

เมื่อได้โทเคนแล้ว คำถามต่อไปคือจะแทนมันด้วยอะไร

วิธีที่ตรงไปตรงมาที่สุดคือ one-hot encoding คือให้แต่ละโทเคนเป็นเวกเตอร์ที่มีเลขหนึ่งตัวเป็น 1 และที่เหลือเป็น 0

แต่ผู้สอนชี้ว่าวิธีนี้ไม่ดี เพราะเวกเตอร์ทุกตัวจะตั้งฉากกันหมด มันไม่บอกอะไรเลยว่าโทเคนไหนใกล้เคียงกัน[2]

เราต้องการเวกเตอร์ที่บอกได้ว่า teddy bear ใกล้เคียงกับ soft เพราะหมีนุ่ม แต่ book ไม่เกี่ยว

แนวคิดนี้ถูกทำให้จริงด้วยวิธีชื่อ word2vec ซึ่งเรียนรู้ผ่านงานตัวแทน ไม่ใช่งานที่เราต้องการโดยตรง งานตัวแทนในเวอร์ชัน CBOW คือการเดาคำที่อยู่ตรงกลางจากคำรอบข้าง ส่วนเวอร์ชัน skip-gram คือการเดาคำรอบข้างจากคำตรงกลาง[2]

ผลลัพธ์ที่ได้น่าสนใจกว่าที่คิด เพราะชั้นกลางของโครงข่ายที่เรียนรู้ขึ้นมา กลับจับความสัมพันธ์เชิงความหมายได้จริง อย่างความสัมพันธ์แบบ ปารีสคือกับฝรั่งเศส เหมือนที่เบอร์ลินคือกับเยอรมนี[2]

ข้อจำกัดของ word2vec ที่ต้องมีอย่างอื่นมาแก้

ผู้เรียนในห้องช่วยกันตอบข้อจำกัดของวิธีนี้ และได้คำตอบที่ตรงประเด็นสามข้อ

ข้อแรกคือคำที่ต่างความหมายแต่สะกดเหมือนกันจะได้เวกเตอร์เดียวกัน ตัวอย่างคลาสสิกที่ผู้สอนยกคือ bank ที่แปลว่าธนาคารกับตลิ่งริมแม่น้ำ[2]

ข้อสองคือลำดับคำไม่มีความหมาย ประโยค "เด็กกอดหมี" กับ "หมีกอดเด็ก" ใช้คำชุดเดียวกันแต่ความหมายต่างกัน วิธีนี้ให้ผลเท่ากัน[2]

และข้อสามคือคำที่ไม่เคยเจอตอนฝึกจะไม่มีเวกเตอร์ให้ใช้

นี่คือเหตุผลที่ทำให้ต้องมี RNN เข้ามา ซึ่งเพิ่มสถานะซ่อนที่จำความหมายของประโยคที่อ่านมาแล้ว เพื่อให้ลำดับคำมีความหมาย[2]

แต่ RNN ก็มีข้อจำกัดของตัวเอง นั่นคือจำคำที่อยู่ไกลเกินไปไม่ได้ ซึ่งผู้สอนอธิบายว่ามาจากปัญหาเชิงลึกที่เรียกว่า vanishing gradient[2] และถึงแม้จะมีการพัฒนาต่อเป็น LSTM ที่เพิ่มหน่วยความจำอีกชั้น ก็ยังแก้ปัญหาได้ไม่หมด[2]

หัวใจของ Transformer อยู่ที่สูตรเดียว

ทางออกของปัญหาข้างต้นคือแนวคิดที่เรียกว่า attention หรือการให้ความสนใจ

แทนที่จะให้โมเดลพึ่งสถานะซ่อนเพียงอย่างเดียวเพื่อจำอดีต แนวคิดใหม่คือให้โทเคนแต่ละตัวเชื่อมตรงไปยังโทเคนก่อนหน้าได้เลย แล้วให้โมเดลเรียนรู้เองว่าโทเคนไหนสำคัญกับโทเคนไหน[2]

พอรวมแนวคิดนี้เข้ากับการให้โทเคนทุกตัวปฏิสัมพันธ์กันทั้งหมด เราได้สิ่งที่เรียกว่า self-attention ซึ่งเป็นแกนของ Transformer

Query, Key และ Value

การอธิบายกลไกนี้ใช้คำสามคำที่ฟังดูแปลกตอนแรก

Query คือสิ่งที่โทเคนหนึ่งกำลังถามว่า "ฉันควรสนใจใคร" ส่วน Key คือป้ายที่โทเคนแต่ละตัวติดไว้เพื่อให้คนอื่นเทียบ และ Value คือเนื้อหาจริงที่จะถูกดึงมาผสมกัน

ผู้สอนยกตัวอย่างว่าถ้าเราอยากรู้ว่าอะไรอธิบายหมีตัวนี้ได้ดี query ของ teddy bear จะเทียบกับ key ของทุกโทเคน แล้วพบว่า cute ใกล้เคียงที่สุด ดังนั้น representation ของ teddy bear จะขึ้นกับ cute เป็นหลัก[2]

ทั้งหมดนี้เขียนเป็นสูตรได้กระชับมาก

import math

def self_attention(Q, K, V):
    # เทียบ query ทุกตัวกับ key ทุกตัว ด้วย dot product
    scores = Q @ K.T / math.sqrt(K.shape[-1])
    # แปลงเป็นน้ำหนักที่รวมกันได้ 1
    weights = softmax(scores)
    # ถ่วงน้ำหนัก value แล้วรวม
    return weights @ V
Enter fullscreen mode Exit fullscreen mode

ผู้สอนบอกตรง ๆ ในคลิปว่า นี่คือสูตรที่สำคัญที่สุดของ Transformer และใบ้ด้วยว่ามันเคยออกข้อสอบ midterm มาก่อน[2]

จุดที่ต้องเข้าใจคือการหารด้วยรากที่สองของมิติ key เพราะถ้าไม่หาร ค่าที่ได้จะแปรปรวนเกินไปตามขนาดมิติ ทำให้การกระจายน้ำหนักไม่ดี[2]

ส่วนประกอบที่เหลือในสถาปัตยกรรม

คอร์สไล่องค์ประกอบที่เหลือของ Transformer ต่อ โดยเริ่มจาก position embedding ที่บวกเข้าไปกับ embedding ของโทเคน เพื่อให้โมเดลรู้ว่าคำไหนอยู่ตำแหน่งไหน[2]

ผู้สอนอธิบายว่าการแทนตำแหน่งมีสองแนวทาง คือเรียนรู้จากข้อมูล กับใช้ฟังก์ชันคณิตศาสตร์อย่างไซน์และโคไซน์ที่ความถี่ต่างกัน

แนวทางหลังมีคุณสมบัติที่ดีคือ ตำแหน่งที่ใกล้กันจะได้ค่าใกล้กัน และไม่มีข้อจำกัดเรื่องความยาวข้อความเหมือนแบบที่เรียนรู้[2]

ผู้สอนเปรียบเทียบให้เห็นภาพว่ามันเหมือนเข็มนาฬิกาที่หมุนด้วยความถี่ต่างกัน ทั้งชั่วโมง นาที และวินาที เมื่อรวมกันแล้วเรารู้เวลาได้แม่น[2]

ส่วนประกอบอื่นที่คอร์สพูดถึง ได้แก่ encoder ที่สร้าง representation ของข้อความต้นทาง, decoder ที่สร้างข้อความปลายทางทีละโทเคน, residual connection ที่ช่วยให้โมเดลลึก ๆ เรียนรู้ได้ดีขึ้น, layer normalization ที่ช่วยให้ลู่เข้าเร็วขึ้น, การปิดบังบางการเชื่อมต่อใน decoder เพื่อไม่ให้โมเดลแอบเห็นคำที่ยังไม่ควรเห็น, multi-head attention ที่ทำการเทียบนี้พร้อมกันแปดชุดย่อย โดยแต่ละชุดมี Q/K/V ของตัวเอง เพื่อให้โมเดลมองได้หลายมุม และเทคนิคอย่าง dropout ที่กันไม่ให้โมเดลพึ่งพาฟีเจอร์ใดฟีเจอร์หนึ่งมากเกินไป กับ label smoothing ที่ลดความมั่นใจเกินของคำตอบ ทั้งคู่ช่วยให้โมเดลทำงานกับข้อมูลใหม่ได้ดีขึ้น[2]

จุดที่ผู้สอนเน้นเป็นพิเศษคือ feed forward network เพราะที่นั่นเก็บพารามิเตอร์ส่วนใหญ่ของโมเดลไว้ ถ้าถามว่าความจุของโมเดลอยู่ตรงไหน คำตอบคือตรงนั้น[2]

Syllabus ที่บอกอนาคตมากกว่าเนื้อหา

ส่วนที่ผมคิดว่ามีค่าที่สุดของคอร์สนี้ ไม่ใช่คาบแรก แต่คือรายชื่อหัวข้อทั้งเก้าคาบบนหน้า syllabus[4]

เพราะมันเรียงลำดับสิ่งที่วงการ AI กำลังให้ความสำคัญในปี 2026 เอาไว้ตรง ๆ

  • คาบ 2: โมเดลภาษา ครอบคลุม Mixture of Experts, ความต่างของ MHA กับ MQA และ GQA, position embedding แบบ RoPE, ความยาวบริบท, อุณหภูมิ และกลยุทธ์การสุ่มคำ
  • คาบ 3: การฝึกโมเดล ตั้งแต่ pretraining, การสอนแบบมีผู้สอน, LoRA, การปรับด้วยความชอบของมนุษย์, การใช้เหตุผล และ on-policy distillation
  • คาบ 4: การเรียนรู้แบบเสริมกำลัง ครอบคลุมการออกแบบรางวัล, policy gradient, PPO, GRPO และ on-policy distillation อีกครั้ง
  • คาบ 5: ระบบของ LLM ครอบคลุมการฝึกแบบกระจาย, การเพิ่มประสิทธิภาพการอนุมาน, KV caching, speculative decoding, Flash Attention และการแลกเปลี่ยนของฮาร์ดแวร์
  • คาบ 6: เอเจนต์ AI ครอบคลุมการเรียกใช้เครื่องมือ, MCP, หน่วยความจำ, การค้นคืน, การย่อบริบท, การปรับ harness, coding agent รวมถึง skills และ plugins
  • คาบ 7: การประเมิน LLM ครอบคลุมการให้ AI เป็นผู้ตัดสิน, อคติและกับดัก, การประเมินเอเจนต์ และ benchmark
  • คาบ 8: Diffusion LLM ครอบคลุมการแพร่แบบต่อเนื่อง แบบไม่ต่อเนื่อง และแบบปิดบัง
  • คาบ 9: หัวข้อมาแรง ปิดท้ายด้วยมุมมองหลายรูปแบบ

ถ้าอ่านรายการนี้ดี ๆ จะเห็นว่าครึ่งหลังของคอร์สไม่ได้พูดเรื่องทฤษฎีอย่างเดียว แต่พูดถึงสิ่งที่คนทำงานจริงกำลังเจออยู่ทุกวัน

คำว่า context compaction กับ harness optimization ในคาบ 6 ผมมองว่าไม่ใช่ศัพท์วิชาการ แต่เป็นปัญหาที่คนใช้เอเจนต์เจอจริงเวลาบทสนทนายาวขึ้นเรื่อย ๆ

ในรายชื่อหัวข้อของคาบ 6 มีทั้ง Context compaction และ Harness optimization อยู่ตรง ๆ[4]

Cheat sheet แปลไทยแล้วด้วย

คอร์สนี้มีเอกสารสรุปที่เรียกว่า cheat sheet ซึ่งผู้สอนบอกว่าเพิ่งอัปเดตเมื่อไม่กี่สัปดาห์ก่อน และตั้งใจให้ทันสมัยที่สุด เพื่อใช้ทบทวนก่อนสอบ[2]

จุดที่น่าสนใจคือมันถูกแปลเป็นหลายภาษา และในคลิปผู้สอนบอกว่าตอนนี้มีราว 15 ภาษา รวมภาษาอังกฤษ[2] ตัวเอกสารรุ่นล่าสุดเปิดให้ดาวน์โหลดได้จากหน้า cheatsheet ของคอร์สโดยตรง[9]

ถ้าเข้าไปดูในที่เก็บโค้ดของคอร์ส จะเห็นโฟลเดอร์แยกตามรหัสภาษา และมีโฟลเดอร์ th ซึ่งเป็นเวอร์ชันภาษาไทยอยู่จริง มีไฟล์ชื่อ cheatsheet-transformers-large-language-models.pdf[6][7]

ส่วนตำราเรียนของคอร์สมีชื่อว่า Super Study Guide: Transformers & Large Language Models ซึ่งหอสมุด Stanford มีให้ยืม และมีขายออนไลน์ด้วย[1][8]

ถ้าจะเริ่ม ควรเริ่มยังไง

คอร์สนี้บอกไว้เองว่าผู้เรียนที่เหมาะไม่จำเป็นต้องเป็นนักวิจัย

ผู้สอนระบุกลุ่มเป้าหมายกว้าง ๆ สามกลุ่ม คือคนที่อยากเป็นนักวิจัยและต้องการเห็นเทคนิคที่ใช้จริง กลุ่มที่อยากทำโปรเจกต์ส่วนตัวและควรรู้ว่าตัวช่วยเขียนโค้ดทำอะไรได้กับทำอะไรไม่ได้ และกลุ่มสุดท้ายคือคนทำงานตำแหน่งใดก็ตามที่ต้องมีความรู้เรื่อง AI เพราะผู้สอนมองว่าการเข้าใจเครื่องมือเหล่านี้กำลังกลายเป็นเรื่องจำเป็น[2]

ก่อนเข้าเรียนควรมีพื้นฐานพีชคณิตเชิงเส้น เช่นรู้จักเมทริกซ์และการคูณเมทริกซ์ กับพื้นฐานแมชชีนเลิร์นนิง เช่นรู้จักฟังก์ชันสูญเสีย โครงข่ายประสาท และ embedding[2]

ถ้าพื้นฐานยังไม่แน่น ผู้สอนก็บอกว่าคอร์สจะอธิบายเรื่อง embedding ให้อยู่แล้ว แค่มีพื้นฐานมาก่อนจะช่วยให้ตามทันง่ายขึ้น

ในทางปฏิบัติ ผมแนะนำว่าเริ่มจากดูคาบแรกให้จบก่อน แล้วค่อยเปิด cheat sheet ประกอบ เพราะคาบแรกเป็นคาบที่แน่นที่สุดตามที่ผู้สอนยอมรับเองว่าเป็นคาบที่ยากที่สุดในแง่จำนวนแนวคิด[2]

หลังจากนั้นค่อยเลือกว่าจะดูคาบไหนต่อตามความสนใจ ถ้าอยากเข้าใจว่าทำไมแชตบอตตอบแปลก ๆ ให้ดูคาบ 2 ถ้าสนใจว่าจะทำให้โมเดลเก่งขึ้นทำยังไง ให้ดูคาบ 3 และ 4 ถ้าอยากเข้าใจว่าทำไมรันโมเดลใหญ่ ๆ ได้บนเครื่องเล็ก ไปคาบ 5

และถ้าสนใจเรื่องเอเจนต์โดยตรง คาบ 6 คือคาบที่ควรจับตาไว้

ทั้งหมดนี้ฟรี ไม่ต้องสมัคร ไม่ต้องใช้บัตรเครดิต เปิดดูได้เลยจากบ้านหรือที่ไหนก็ได้

แล้วคุณล่ะ

คำถามที่ผมอยากฝากไว้คือ เวลาคุณใช้ AI ช่วยทำงาน คุณอยากเข้าใจมันลึกแค่ไหน

แค่ใช้เป็น กับเข้าใจว่ามันทำอะไรอยู่ข้างใน สองอย่างนี้ให้ผลต่างกันมากเวลางานมีปัญหา

ถ้าคุณเคยดูคอร์สนี้ หรือมีคอร์สอื่นที่ช่วยให้เข้าใจ LLM ได้ดี เล่าให้ฟังได้ว่าตัวไหนคุ้มค่าที่สุด

แหล่งอ้างอิง

[1] Stanford University, "CME 295 - Transformers & Large Language Models", cme295.stanford.edu, 2026. https://cme295.stanford.edu/

[2] Afshine Amidi และ Shervine Amidi, "Stanford CME295 Transformers & LLMs | Autumn 2026 | Lecture 1 - Transformers", Stanford Online (YouTube), 28 กันยายน 2026. https://www.youtube.com/watch?v=114i2Kz-LZA

[3] Stanford University, "CME 295 Course staff", cme295.stanford.edu, 2026. https://cme295.stanford.edu/#course-staff

[4] Stanford University, "Syllabus", cme295.stanford.edu, 2026. https://cme295.stanford.edu/syllabus/

[5] Ashish Vaswani และคณะ, "Attention Is All You Need", arXiv, 2017. https://arxiv.org/abs/1706.03762

[6] Afshine Amidi และ Shervine Amidi, "stanford-cme-295-transformers-large-language-models", GitHub, 2026. https://github.com/afshinea/stanford-cme-295-transformers-large-language-models

[7] Afshine Amidi และ Shervine Amidi, "สรุปเนื้อหาเรื่องตัวแปลงและแบบจำลองภาษาขนาดใหญ่ สำหรับรายวิชา CME 295 ม.สแตนฟอร์ด", GitHub (โฟลเดอร์ th), 2025. https://github.com/afshinea/stanford-cme-295-transformers-large-language-models/tree/main/th

[8] Afshine Amidi และ Shervine Amidi, "Super Study Guide: Transformers & Large Language Models", superstudy.guide, 2024. https://superstudy.guide/transformers-large-language-models/

[9] Stanford University, "Cheatsheet", cme295.stanford.edu, 2026. https://cme295.stanford.edu/cheatsheet

Top comments (0)