DEV Community

Nokka
Nokka

Posted on

จักรวาล AI Agent บทที่ 7: Observability & Governance, กล้องวงจรปิดที่เฝ้าดู agent และรู้ว่ามันผิดตรงไหน

จักรวาล AI Agent บทที่ 7: Observability & Governance, กล้องวงจรปิดที่เฝ้าดู agent และรู้ว่ามันผิดตรงไหน

โดย Nokka (นก-กา) | 22 สิงหาคม 2026

Observability & Governance

นี่คือบทความสุดท้ายของซีรีส์ "จักรวาล AI Agent", ซีรีส์ที่แกะ "จักรวาล AI" ออกเป็น 7 ชั้น

บทความนี้จะลงลึกที่ ชั้นที่ 7: Observability & Governance, ชั้นที่เป็น "กล้องวงจรปิด + รปภ." ที่เฝ้าดูและควบคุม agent

ถ้ายังไม่ได้อ่านบทที่ 1-6 แนะนำให้อ่านก่อน: จักรวาล AI Agent บทที่ 1

ชั้นนี้คืออะไร

Observability & Governance คือ "เครื่องมือ" ที่ตรวจสอบและควบคุม agent, ดูว่า agent ทำงานยังไง และกันไม่ให้ทำสิ่งที่ไม่ควรทำ

เมื่อ agent ทำงานซับซ้อน (หลายขั้น, หลายเครื่องมือ) ปัญหาใหญ่คือ "มันผิดตรงไหน?"

ชั้น 7 แก้ปัญหานี้ด้วยการ "บันทึกทุกอย่าง"

อุปมา: ชั้นนี้คือ "กล้องวงจรปิด + รปภ.", เฝ้าดูและควบคุม

ปัญหาที่ชั้นนี้แก้

ปัญหา: agent ผิดแล้ว "ไม่รู้ว่าผิดตรงไหน"

agent ทำงานหลายขั้น, เรียกโมเดล, เรียก tool, วน loop หลายรอบ

ถ้า agent "ตอบผิด" คำถามคือ "ผิดตรงไหน?"

  • Context ผิด? (ส่งข้อมูลผิดให้โมเดล)
  • Tool call ผิด? (เรียกเครื่องมือผิดตัว)
  • เลือกโมเดลผิด? (ใช้โมเดลเล็กเกินไปสำหรับงานยาก)
  • Sub-agent พลาด? (agent ลูกทำงานผิด)

ถ้าไม่มี observability คุณจะ "เดา" ว่าผิดตรงไหน, ซึ่งเสียเวลามหาศาล

การทำงานภายใน: 3 หน้าที่ของชั้น 7

1. Monitoring (บันทึกทุกขั้น)

Monitoring บันทึกทุกขั้นตอนของ agent [1]:

  • agent เห็น context อะไร
  • เรียก tool ตัวไหน
  • ได้ผลอะไร
  • ใช้ token เท่าไหร่
  • ใช้เวลานานแค่ไหน

เครื่องมือ: LangSmith, Langfuse [3]

2. Evaluation (วัดคุณภาพ)

Evaluation วัดว่า agent "เก่งแค่ไหน":

  • ตอบถูกกี่ %
  • ใช้ token เท่าไหร่ (ต้นทุน)
  • ใช้เวลานานแค่ไหน (ความเร็ว)
  • ตรงตามที่ผู้ใช้ต้องการไหม

เครื่องมือ: LangSmith (eval), Braintrust

3. Guardrails (กันทำสิ่งไม่ควรทำ)

Guardrails กัน agent ทำสิ่งที่ไม่ควรทำ:

  • บล็อกคำสั่งอันตราย
  • ตรวจ output ก่อนส่งให้ผู้ใช้
  • กันข้อมูล sensitive หลุด

เครื่องมือ: Guardrails AI, NeMo Guardrails

ตารางสรุป: 3 หน้าที่ของชั้น 7

หน้าที่ ทำอะไร เครื่องมือ
Monitoring บันทึกทุกขั้น LangSmith, Langfuse
Evaluation วัดคุณภาพ Braintrust, LangSmith
Guardrails กันทำผิด Guardrails AI, NeMo

องค์ประกอบหลัก (ผู้เล่นในชั้นนี้)

Monitoring Tools

  • LangSmith, monitoring + evaluation (จาก LangChain)
  • Langfuse, open-source observability

Evaluation Tools

  • Braintrust, evaluation platform
  • LangSmith, eval suite

Guardrail Tools

  • Guardrails AI, validate output
  • NeMo Guardrails, จาก NVIDIA

ตัวอย่างจริง: agent ตอบผิด → หาว่าผิดตรงไหน

ขอเล่า "การทำงานจริง" ของ observability ผ่านตัวอย่าง [2]:

สมมติ agent "เขียนบทความ" แล้วผลออกมา "ผิดหัวข้อ"

ไม่มี observability: คุณเดาว่า "โมเดลไม่เก่ง" → เปลี่ยนโมเดล → ยังผิด → เสียเวลา

มี observability (LangSmith): คุณดู trajectory แล้วพบว่า:

  1. agent เรียก tool "ค้นข้อมูล" ด้วย query ผิด (พิมพ์ผิด)
  2. ได้ผลลัพธ์ผิดหัวข้อ
  3. โมเดลเขียนตามผลลัพธ์ที่ผิด

สรุป: ปัญหาไม่ใช่ "โมเดลไม่เก่ง" แต่เป็น "query ผิด", แก้ query ก็จบ

นี่คือ "พลัง" ของ observability, เปลี่ยน "เดา" เป็น "รู้"

สถานะ + แนวโน้ม

สถานะปัจจุบัน

  • สำคัญขึ้นเรื่อยๆ, เมื่อ agent ทำงานอัตโนมัติ การ "เฝ้าดู" จำเป็น
  • LangSmith นำ, เป็นที่นิยมสุด (เพราะผูกกับ LangChain)
  • Langfuse ตามมา, open-source ทางเลือก

แนวโน้ม

  1. Observability กำลังเป็น "ต้องมี", ไม่ใช่ "มีก็ดี" อีกต่อไป
  2. Guardrails กำลังสำคัญ, เมื่อ agent "ลงมือทำ" ได้ (ชั้น 1) การ "กันทำผิด" ยิ่งสำคัญ
  3. "Trust" กำลังเป็นตัวชี้ขาด, บริษัทจะใช้ agent ก็ต่อเมื่อ "ตรวจสอบได้"

มุมสมดุล: สิ่งที่ต้องรู้

  1. Observability มีต้นทุน, บันทึกทุกขั้น = ใช้ storage + ต้นทุนเพิ่ม
  2. ไม่ใช่ "ตั้งแล้วจบ", ต้องมีคน "ดู" ข้อมูลที่บันทึกไว้ ไม่งั้นบันทึกไปก็เปล่า
  3. Guardrails ไม่ใช่ 100%, กันได้แค่ "สิ่งที่รู้" ไม่ได้กัน "สิ่งที่ไม่คาดคิด"
  4. Privacy ต้องระวัง, บันทึกทุกขั้น = ข้อมูล sensitive อาจถูกบันทึกด้วย

สรุป

Observability & Governance คือ "กล้องวงจรปิด + รปภ." ที่เฝ้าดูและควบคุม agent, บันทึกทุกขั้น (monitoring), วัดคุณภาพ (evaluation), กันทำผิด (guardrails)

ชั้นนี้คือ "ความเชื่อใจ", บริษัทจะใช้ agent ก็ต่อเมื่อ "ตรวจสอบได้"


สรุปมุมมองของผม (และสรุปทั้งซีรีส์)

ผมมองว่า observability เป็นชั้นที่ "สำคัญที่สุดแต่ถูกมองข้ามที่สุด", เพราะทุกคนอยาก "สร้าง agent" แต่ไม่ค่อยมีใครอยาก "เฝ้าดู agent"

และผมเชื่อว่า "trust" จะเป็นตัวชี้ขาดว่า agent จะ "ไปได้ไกลแค่ไหน", เพราะบริษัทจะไม่ปล่อยให้ agent "ทำงานอัตโนมัติ" ถ้า "ตรวจสอบไม่ได้"

สรุปทั้ง 7 ชั้น

ชั้น 7  Observability & Governance   กล้องวงจรปิด + รปภ.
ชั้น 6  Applications                 รถทั้งคัน (สิ่งที่คุณใช้)
ชั้น 1  Tooling & Enrichment         แขนขา (ทำอะไรได้)
ชั้น 5  Orchestration                วาทยกร (ประสานงาน)
ชั้น 2  Protocol & Interoperability  ปลั๊ก USB-C (ภาษากลาง)
ชั้น 4  Agent Runtime                เครื่องยนต์ (ลงมือทำ)
ชั้น 3  Foundation Models            โรงไฟฟ้า (สมอง)
Enter fullscreen mode Exit fullscreen mode

ขอบคุณที่อ่านซีรีส์ "จักรวาล AI Agent" ครบทั้ง 7 บท, หวังว่าตอนนี้คุณจะเห็น "ภาพรวม" ของวงการ AI ชัดขึ้น

คุณสนใจชั้นไหนที่สุด? คอมเมนต์บอกผมได้ครับ

ลองคิดตาม

ถ้าคุณใช้ LangChain อยู่แล้ว ลองเปิด LangSmith (ฟรี tier) แล้วรัน agent 1 ตัว, แล้วดู "trace" ที่บันทึกทุกขั้นตอน

แล้วลอง "จงใจ" ทำให้ agent ผิด (เช่น ใส่ query ผิด) แล้วดูว่า trace ช่วยให้คุณ "เห็น" ว่าผิดตรงไหน, นี่คือ "พลัง" ของ observability

แหล่งอ้างอิง

[1] AIMultiple. "The 7 Layers of Agentic AI Stack". 2026. https://aimultiple.com/agentic-ai-stack

[2] O'Reilly. "The AI Agents Stack (2026 Edition)". 2026. https://www.oreilly.com/radar/the-ai-agents-stack-2026-edition/

[3] LangChain. "LangSmith Documentation". 2026. https://docs.smith.langchain.com/


บทความนี้เป็นส่วนหนึ่งของซีรีส์ "จักรวาล AI Agent" ข้อมูล ณ 22 สิงหาคม 2026 Nokka

บทความนี้เขียนโดย AI (DeepSeek V4 Pro ผ่าน Ollama Cloud) ภายใต้การดูแลของ Nokka

Top comments (0)