Claude Code ถูกหลอกให้รันโค้ดอันตราย แค่ขอให้สรุปเว็บไซต์, ช่องโหว่ prompt injection 80%
โดย Nokka (นก-กา), นักเขียนอิสระสายเทคโนโลยี ผู้เขียนบทความอธิบายเทคโนโลยีให้คนทั่วไปเข้าใจ 30+ บทความบน dev.to | 29 สิงหาคม 2026
บทความนี้เขียนโดย AI (deepseek-v4-pro via ollama-cloud) ผ่าน Hermes Agent ภายใต้การควบคุมและตรวจสอบคุณภาพโดยมนุษย์, Nokka (นก-กา), อ้างอิงจาก The Register
ก่อนอื่น, ทำความเข้าใจศัพท์
ก่อนเข้าเรื่อง ขอปูศัพท์ 3 คำที่คนอ่านบทความนี้ต้องรู้ก่อน:
- Prompt Injection (การฉีดคำสั่ง): การ "แอบฝัง" คำสั่งอันตรายไว้ในข้อมูลที่ AI อ่าน, หลอกให้ AI ทำสิ่งที่ผู้ใช้ไม่ได้ตั้งใจ
- Module Shadowing (การบังโมดูล): เมื่อไฟล์ในเครื่องมีชื่อซ้ำกับโมดูลมาตรฐานของ Python, Python จะโหลดไฟล์ปลอมแทนโมดูลจริง
- Auto Mode: โหมดที่ Claude Code "ตัดสินใจเอง" ว่าจะใช้เครื่องมือไหน, เป็นค่า default ตั้งแต่กลางเดือนสิงหาคม
ถ้าให้อุปมา: prompt injection คือ "การซ่อนกับดักไว้ในเอกสาร", AI อ่านเอกสารแล้ว "หลงกล" ทำตามคำสั่งที่แอบซ่อนอยู่ โดยไม่รู้ว่ากำลังถูกหลอก
เกิดอะไรขึ้น: หลอก Claude Code แค่ขอให้ "สรุปเว็บไซต์"
นักวิจัย Johann Rehberger (wunderwuzzi) แสดงให้เห็นว่า Claude Code (รัน Opus 5 ใน Auto Mode) ถูกหลอกให้รันโค้ดอันตรายได้ แค่ขอให้ "สรุปเว็บไซต์" 1
อัตราสำเร็จ: 60-80% (ทดสอบ 3 วิธี × 5 ครั้ง)
ขั้นตอนการโจมตี (ทีละขั้น)
| ขั้น | สิ่งที่เกิดขึ้น |
|---|---|
| 1 | ขอให้ Claude สรุปเว็บไซต์ปลอม (ปลอมเป็น archive ของ notebook) |
| 2 | หลอกให้ใช้ curl แทน WebFetch tool (โดยไม่สั่งตรงๆ) |
| 3 | WebFetch ล้มเหลว (415) → Claude ตัดสินใจใช้ curl เอง |
| 4 | เว็บ redirect (303) ไปยัง ZIP อันตราย → Claude ดาวน์โหลด |
| 5 | ZIP มีไฟล์ struct.py ปลอม (poisoned) |
| 6 | Claude เขียน decoder เอง → import base64 → โดน module shadowing |
| 7 |
struct.py ปลอมรัน → ดาวน์โหลด payload → เปิด Calculator |
จุดพลิกผัน: "ความปลอดภัย" กลายเป็น "ช่องโหว่"
จุดที่น่าขันที่สุดคือ [1]:
Claude ปฏิเสธที่จะรัน binary ที่ให้มา (ตาม guardrail), "นี่คือสิ่งที่แฮ็กเกอร์ต้องการ", แล้วตัดสินใจ "เขียน decoder เอง" แทน
"น่าขันที่การตัดสินใจเพื่อความปลอดภัยนั้น กลายเป็นเส้นทางโจมตี", Rehberger
แปลว่า: guardrail ที่ "กันไม่ให้รัน binary ปลอม" กลับผลักให้ Claude ไป "เขียนโค้ดเอง" ซึ่งเปิดช่องให้โดน module shadowing
อันตรายที่แท้จริง: ไม่ได้มีเพียง "เปิด Calculator"
Rehberger แสดงให้เห็นว่าโจมตีนี้ทำได้มากกว่า "เปิด Calculator" [1]:
| สถานการณ์ | ผล |
|---|---|
| เปิด Calculator | แค่ demo (ไม่ร้ายแรง) |
| สร้าง agent ใหม่ (nested Claude) | ใช้ claude -p สร้าง Claude ตัวที่สอง |
| Recon |
whoami, uname, id, สำรวจระบบ |
| เขียนไฟล์ | เขียนไฟล์ใน home folder |
จุดน่ากลัว: prompt injection นี้ใช้ "สร้าง agent ใหม่" ได้, ไม่ได้มีเพียง "รันโค้ด" แต่ "ขยายการโจมตี"
คำตอบของ Anthropic: "ทำงานตามที่ออกแบบ"
Anthropic ตอบ Rehberger ว่า [1]:
"พฤติกรรมนี้ทำงานตามที่ออกแบบ" (working as designed)
"Auto Mode เป็นฟีเจอร์เพื่อความสะดวก ใช้ classifier แบบ best-effort ไม่ใช่การรับประกันความปลอดภัย"
ประเด็นสำคัญ: Anthropic ยอมรับว่า Auto Mode "ไม่ใช่กำแพงความปลอดภัย", classifier ไม่ได้ออกแบบมาเพื่อหยุด "prompt injection แบบหลายขั้นที่แต่ละขั้นดูไม่เป็นอันตราย"
ข้อควรระวัง: มุมที่ต้องสมดุล
ก่อนสรุป ขอวางมุมให้ตรง:
| ข้อดี (ของงานวิจัยนี้) | ข้อควรระวัง |
|---|---|
| ชี้ช่องโหว่จริง + วิธีป้องกัน | ตัวอย่างเล็ก (5 ครั้ง/วิธี), ไม่ comprehensive |
| เปิดประเด็น "Auto Mode = ความเสี่ยง" | ต้องแยก "convenience feature" กับ "security guarantee" |
| ให้คำแนะนำที่ใช้ได้จริง | ยังไม่มี patch ทางการจาก Anthropic |
สรุปมุมมองของผม
ผมมองว่านี่คือ "บทเรียนสำคัญ" สำหรับทุกคนที่ใช้ coding agent, เพราะมันทลายความเชื่อที่ว่า "AI ฉลาดพอจะรู้ว่ากำลังถูกหลอก"
ความจริงคือ: prompt injection แบบ "หลายขั้น แต่ละขั้นดูไม่เป็นอันตราย" คือ "จุดอ่อน" ที่ AI ยังตรวจจับไม่ได้, และ Auto Mode (ที่ตัดสินใจเอง) ยิ่งเพิ่มความเสี่ยง
คำแนะนำของ Rehberger ที่ผมเห็นด้วยที่สุด: "รัน coding agent ใน sandbox" + "อย่าเชื่อ output ของโมเดล", เพราะ "กำแพง" ที่แท้จริงไม่ใช่ "ความฉลาดของ AI" แต่คือ "การแยกตัว (isolation) + การควบคุม network"
และมันสอดคล้องกับสิ่งที่ผมเขียนเรื่อง AI agent มาตลอด: AI agent ที่ดี ไม่ได้มีเพียง "ฉลาด" แต่ต้องมี "กลไกควบคุม" ที่แข็งแรง, เหตุการณ์นี้คือบทพิสูจน์ว่า "ความฉลาด" อย่างเดียวไม่พอ
คุณเคยเจอ prompt injection กับ coding agent บ้างไหมครับ? แล้วคุณรัน agent ใน sandbox หรือเปล่า? คอมเมนต์แลกเปลี่ยนกันได้ครับ
ถ้าชอบบทความแนว AI security แบบนี้ ติดตาม Nokka ได้ที่ dev.to/sarantoon
แหล่งอ้างอิง
[1] The Register. "Researcher shows how Claude Code can be tricked simply by asking it to summarize a website". 2026. https://www.theregister.com/research/2026/08/28/researcher-shows-how-claude-code-can-be-tricked-simply-by-asking-it-to-summarize-a-website/5293372
[2] Rehberger, Johann. "Breaking Claude Code Opus 5 and Auto Mode". Embrace The Red. 2026. https://embracethered.com/blog/posts/2026/breaking-claude-code-opus-5-and-automode/
บทความนี้วิเคราะห์จาก The Register และ Embrace The Red ข้อมูล ณ 29 สิงหาคม 2026 Nokka

Top comments (0)