DEV Community

Nokka
Nokka

Posted on AI-assisted

GitHub AI Repos ประจำสัปดาห์: สัปดาห์ที่ agent มีด่านตรวจของตัวเอง (7 ต.ค. 2026)

GitHub AI Repos ประจำสัปดาห์: สัปดาห์ที่ agent มีด่านตรวจของตัวเอง (7 ต.ค. 2026)

โดย Nokka (นก-กา) | 7 ตุลาคม 2026

หน้าอันดับสัปดาห์นี้ไม่มีโมเดลใหม่มาแย่งที่เลย ของที่พุ่งแรงที่สุดกลับเป็นชั้นโครงสร้างรอบตัว AI agent ทั้งกรงที่สร้างจากตัวเคอร์เนลของระบบปฏิบัติการ ด่านตรวจที่ให้คะแนน agent เป็นเกรด A ถึง F และตลาดปลั๊กอินของค่ายใหญ่สองค่ายที่ดันขึ้นหน้าอันดับพร้อมกันในสัปดาห์เดียว [1]

คำถามของวงการขยับไปหนึ่งขั้น จากที่เคยถามว่า agent ทำอะไรได้บ้าง มาเป็นใครคุม agent อยู่ และเรารู้ได้ยังไงว่ามันทำตามที่สั่งจริง [3] ตัวเลขที่บ่งชี้ชัดคือ NVIDIA เปิดตัวรันไทม์ความปลอดภัยสำหรับฝูง agent ขึ้นมาเป็นอันดับหนึ่งของหน้าอันดับสาย Rust ด้วยการกวาดไป 5,228 ดาวในเจ็ดวัน ขณะที่ iFixAi เครื่องมือตรวจสอบ agent ได้ 5,445 ดาวในลิสต์สาย Python [1][2]

ผมคัดมา 8 โปรเจกต์ที่เล่าเรื่องนี้ได้ดีที่สุด

โปรเจกต์ Stars พุ่งในรอบล่าสุด หมวด
NVIDIA/OpenShell 15.1K 5,228/สัปดาห์ รันไทม์ความปลอดภัย
ifixai-ai/iFixAi 21.6K 5,445/สัปดาห์ ตรวจสอบ agent
mvschwarz/openrig 5.5K 3,327/สัปดาห์ จัดการทีม agent
JuliusBrussee/caveman 110.2K 2,004/สัปดาห์ บีบโทเคน
VectifyAI/PageIndex 38.8K 2,079/สัปดาห์ ค้นคืนข้อมูล
cursor/plugins 10.1K 1,106/สัปดาห์ ตลาดปลั๊กอิน
anthropics/knowledge-work-plugins 26.4K 2,444/เดือน ปลั๊กอินงานสำนักงาน
headroomlabs-ai/headroom 74.5K ไม่ติดอันดับสัปดาห์นี้ บีบ context

อ่านตารางนี้ให้ดีจะเห็นแกนหนึ่ง ห้าโปรเจกต์แรกในลิสต์ไม่ได้ทำให้ agent ฉลาดขึ้นแม้แต่นิดเดียว ทั้งห้าตัวเป็นได้แค่กรง ประตู และใบตรวจสุขภาพ สัปดาห์ที่คนเลือกของแบบนี้มากกว่าของที่ทำให้โมเดลเก่งขึ้น บอกอะไรบางอย่างเกี่ยวกับจุดที่วงการยืนอยู่ตอนนี้ [1]

1. NVIDIA/OpenShell, กรงที่สร้างจากตัวเคอร์เนล

15,135 stars (พุ่ง 5,228 ดาวในสัปดาห์เดียว) | Rust | Apache-2.0

โจทย์ที่ NVIDIA ตั้งไว้ตรงไปตรงมา agent จะมีประโยชน์ก็ตอนที่มันอ่านไฟล์ ติดตั้งแพ็กเกจ เรียก API และใช้คีย์ได้ แต่การให้ความสามารถนั้นมาพร้อมสิทธิ์เต็มระบบเสมอ [4]

OpenShell แก้ด้วยกลไกสองชั้น ชั้นแรกบังคับนโยบายที่ระดับเคอร์เนล ทุกการเข้าถึงไฟล์ ทุกการเรียกซิสเต็มคอล และทุกการเชื่อมต่อเครือข่ายผ่านการตรวจก่อนออกจากกรง และ agent จะไม่เคยเห็นคีย์จริง ระบบจะเติมคีย์ให้เฉพาะคำขอที่ปลายทางได้รับอนุญาตแล้วเท่านั้น ชั้นที่สองคือส่วนที่ผมสะดุดตาที่สุด เมื่อจะเปลี่ยนนโยบาย ระบบใช้การพิสูจน์เชิงรูปแบบตรวจก่อนว่า การเปลี่ยนครั้งนั้นจะเปิดสิทธิ์อะไรขึ้นมาใหม่ ถ้าพบว่ามีการแตะโฮสต์ใหม่พร้อมคีย์หรือเรียกเมธอด API ใหม่ การเปลี่ยนนั้นจะรอคนเข้ามาดู [4]

ผมเคยเห็นคำว่า formal verification ในเอกสารความปลอดภัยหลายฉบับ แต่ส่วนใหญ่ใช้กับการพิสูจน์โปรโตคอลที่นิ่งแล้ว การเอาแนวทางนี้มาใช้กับนโยบายที่เปลี่ยนทุกวันคือคนละระดับของปัญหา และนั่นน่าจะเป็นเหตุผลที่โปรเจกต์นี้พุ่งแรงในสัปดาห์ที่คนเริ่มกังวลว่า agent ที่รันข้ามคืนกำลังแตะอะไรอยู่

ฝั่งการใช้งานต้องมี Linux, macOS บน Apple Silicon หรือ Windows ผ่าน WSL 2 พร้อม Docker, Podman หรือ host virtualization ติดตั้งผ่านสคริปต์ตัวช่วยบรรทัดเดียวแล้วสร้างกรงแรกด้วยอีกคำสั่งหนึ่ง และมี SDK แยกสำหรับ Python, TypeScript, Go และ Rust [4][5] รุ่นล่าสุดคือ v0.1.2 ออกเมื่อ 28 กันยายน มี 531 issue ที่ยังเปิดอยู่ ซึ่งบอกว่ายังอยู่ช่วงเก็บงาน แต่จังหวะออกรุ่นเริ่มเป็นระบบ [6]

2. ifixai-ai/iFixAi, คำถามที่เครื่องมือวัดผลเดิมตอบไม่ได้

21,643 stars (พุ่ง 5,445 ดาวในสัปดาห์เดียว) | Python | Apache-2.0

ทีม iFixAi เปิดฉากด้วยข้อสังเกตที่ตรงและเจ็บ เครื่องมือ eval, red-teaming และ observability ที่มีอยู่ประเมิน agent ตามความสามารถเชิงเทคนิค ทั้งความสิ้นเปลืองโทเคน เวลาตอบสนอง และความทนทานต่อ prompt injection แต่ไม่มีตัวไหนตอบคำถามที่สำคัญที่สุดได้ว่า agent กำลังทำงานที่ควรทำตามตัวชี้วัดธุรกิจและโครงสร้างองค์กรหรือเปล่า [7]

คำตอบที่ได้คือเกรด A ถึง F จากห้าด้านที่ถ่วงน้ำหนักต่างกัน ด้านการชักจูงกินน้ำหนักมากที่สุดที่ 0.35 ด้านการกุข้อมูล 0.20 ส่วนความหลอกลวง ความคาดเดาไม่ได้ และความทึบแสงได้ด้านละ 0.15 ในการรันหลักมี 32 การตรวจ และมีอีก 28 การตรวจจาก 20 หมวดพรีเมียมที่ถูกให้คะแนนแยกออกไป ไม่ปนกับเกรด เพื่อให้เทียบข้าม agent ที่เปิดความสามารถไม่เท่ากันได้อย่างยุติธรรม [7]

จุดที่ผมคิดว่าออกแบบได้เฉียบคือการตั้งเงื่อนไขว่าคะแนนจะอ้างอิงได้เฉพาะเมื่อมีผู้ให้บริการรายอื่นเป็นกรรมการตัดสิน ไม่ใช่ให้ agent ตรวจตัวเอง พร้อมเพดานบังคับอีกชั้น ถ้าตกข้อบังคับข้อใดข้อหนึ่งจากสามข้อ คะแนนรวมจะถูกจำกัดไว้ที่ 60 เปอร์เซ็นต์ทันที กระบวนการทั้งหมดใช้เวลาไม่ถึง 120 วินาที และรันได้สามทาง ทั้งตัวช่วยตั้งค่าทีละขั้น การส่งแฟล็กเองแบบเขียนสคริปต์ได้ และการติดตั้งเป็นปลั๊กอินหรือสกิลให้ agent ใช้งานเอง [7]

ในคลังมีกรณีศึกษาสองชิ้นที่สร้างใหม่จากรายงานสาธารณะ ทั้งคู่ได้เกรด F ทีมระบุชัดว่ากรณีเหล่านี้ไม่ใช่การทดสอบระบบจริงของบริษัทใด และ repo เปิดทุกอย่างแบบ Apache 2.0 รวมส่วนที่เรียกว่าพรีเมียม [7]

3. mvschwarz/openrig, บริษัทที่เขียนด้วย YAML

5,510 stars (พุ่ง 3,327 ดาวในสัปดาห์เดียว) | TypeScript | Apache-2.0

อันดับหนึ่งของหน้าอันดับประจำสัปดาห์อธิบายตัวเองไว้สั้นและคมว่า harness ครอบโมเดล ส่วน rig ครอบ harness ของคุณ [8]

แนวคิดคือการยกระดับเซสชันเทอร์มินัลที่กระจัดกระจายให้กลายเป็นทีมถาวรที่มีบทบาทชัดเจน มีบริบทใช้ร่วมกัน และมีงานที่มีเจ้าภาพชัดเจน ทุกอย่างนิยามด้วยไฟล์ YAML แล้วปลุกทั้งทีมด้วยคำสั่งเดียว มีทีมสำเร็จรูปสามแบบให้เลือก ทีมเริ่มต้นมีสองตัวคือคนสร้างกับคนรีวิว ทีมสำหรับงานต่อเนื่องมีสี่ตัวคือหัวหน้า คนสร้าง QA และคนรีวิว ส่วนทีมสำหรับงานผลิตภัณฑ์เต็มรูปแบบมีเจ็ดตัวโดยแบ่งเป็นคนรีวิวอิสระสองคนที่แยกจากกัน [8]

หน้าจอหลักแสดงที่นั่งแต่ละตัวเป็นกราฟและเป็นตารางที่บอกว่าใช้รันไทม์อะไร โมเดลอะไร เหลือบริบทเท่าไร และอยู่ในสถานะไหน งานทั้งหมดวิ่งผ่านคิวที่มีร่องรอย และมีโอเปอเรเตอร์ประจำเคอร์เนลคอยช่วยเลือกทีมให้เหมาะกับงาน [8]

ส่วนที่ผมอยากให้ทุกคนอ่านก่อนติดตั้งไม่ใช่ฟีเจอร์ แต่เป็นตารางใน README ที่ชื่อว่า OpenRig เปลี่ยนอะไรในเครื่องของคุณบ้าง repo นี้เขียนละเอียดว่า trust setting และ executable hook ถูกเขียนไว้ตรงไหน ติดตั้งสกิลไว้ที่ใด และเพิ่มไฟล์ที่สร้างเองเข้าไปใน git exclude ของโปรเจกต์อย่างไร ผมยังไม่เห็นโปรเจกต์อื่นในลิสต์นี้ที่อธิบายเรื่องนี้ครบเท่า [8]

ข้อจำกัดที่ควรรู้คือต้องใช้ Node.js 22 หรือ 24 คู่กับ tmux บน macOS หรือ Linux เท่านั้น Windows แบบเนทีฟยังไม่รองรับ และ WSL2 ยังไม่ถูกทดสอบ รุ่นล่าสุดคือ v0.6.5 ออกเมื่อ 4 ตุลาคม มี 149 issue ที่ยังเปิดอยู่ [8][9]

4. cursor/plugins, สเปกปลั๊กอินจากเจ้าของ IDE

10,105 stars (พุ่ง 1,106 ดาวในสัปดาห์เดียว) | TypeScript

Cursor เปิด repo นี้เมื่อมกราคมปีนี้ แต่เพิ่งติดหน้าอันดับประจำสัปดาห์คราวนี้ ตอนนี้รวมปลั๊กอินไว้ 89 ตัว โดย 71 ตัวอยู่ในโฟลเดอร์ third_party ที่เป็นงานจากพันธมิตร [10]

ของที่ Cursor ทำเองมีหลายตัวที่อ่านชื่อแล้วอยากลอง thermos ตรวจสาขาแบบโหด ทั้งตรวจความปลอดภัยและความถูกต้องเชิงตรรกะ ใช้ rubric คุณภาพโค้ดที่เข้ม และยิง subagent ขนานกัน orchestrate กระจายงานก้อนใหญ่ไปยัง cloud agent หลายตัวพร้อมกันโดยแบ่งเป็น planner, worker และ verifier ที่ส่งงานต่อกันเป็นทอด ส่วน advisor คือสกิลที่บังคับให้ agent ปรึกษาโมเดลที่แรงกว่าก่อนตัดสินใจเรื่องใหญ่ ก่อนติดตอนแก้ และก่อนประกาศว่างานเสร็จ [10]

ฝั่ง third_party ครอบเครื่องมือที่คนทำงานจริงใช้อยู่แล้ว ทั้ง Gmail, Google Drive, ปฏิทิน, Salesforce, HubSpot, GitHub, Playwright และเครื่องมือวิจัยคำค้นอย่าง Semrush กับ Ahrefs [10]

ข้อสังเกตเชิงปฏิบัติคือ repo นี้ไม่ประกาศสัญญาอนุญาตไว้ใน API ของ GitHub ต่างจากทุกตัวอื่นในลิสต์นี้ที่เลือกสัญญาไว้ชัดเจน แม้ README จะระบุไว้ท้ายไฟล์ว่า MIT และปลั๊กอินบางตัวมีไฟล์สัญญาของตัวเองอยู่ในโฟลเดอร์ ถ้าจะดึงโค้ดไปใช้ต่อในเชิงพาณิชย์ควรเปิดไฟล์สัญญาของปลั๊กอินตัวนั้นโดยตรงก่อน [10]

5. anthropics/knowledge-work-plugins, ปลั๊กอินตามบทบาท

26,392 stars (พุ่ง 2,444 ดาวในเดือนนี้) | Python | Apache-2.0

ในสัปดาห์เดียวกัน Anthropic ก็ดันตลาดปลั๊กอินของตัวเองขึ้นหน้าอันดับด้วย แต่เลือกโจทย์คนละแบบ ไม่ได้เจาะคนเขียนโค้ด แต่เจาะคนทำงานสำนักงาน [11]

ชุดนี้มี 11 ปลั๊กอินแยกตามบทบาท ทั้งงานส่วนตัว การขาย ฝ่ายสนับสนุนลูกค้า การจัดการผลิตภัณฑ์ การตลาด กฎหมาย การเงิน ข้อมูล การค้นหาภายในองค์กร งานวิจัยชีวการแพทย์ และตัวช่วยสร้างปลั๊กอินใหม่ แต่ละตัวแพ็กสกิล คอนเนกเตอร์ คำสั่งลัด และ subagent เฉพาะทางของบทบาทนั้นไว้ด้วยกัน [11]

สิ่งที่ผมคิดว่าน่าสนใจกว่ารายชื่อคือรูปแบบไฟล์ ทุกปลั๊กอินประกอบจาก markdown กับ JSON ล้วน ไม่มีโค้ด ไม่มีขั้นตอน build ไม่มีโครงสร้างพื้นฐานให้ดูแล การเชื่อมกับเครื่องมือภายนอกทำผ่าน MCP ทั้งหมด [11]

ประโยคที่ทีมเขียนไว้และผมเห็นด้วยที่สุดคือของจริงจะเกิดตอนที่คุณปรับปลั๊กอินเข้ากับเครื่องมือ ศัพท์ และกระบวนการของบริษัทตัวเอง ปลั๊กอินสำเร็จรูปคือจุดตั้งต้นที่ประหยัดเวลาช่วงแรก ไม่ใช่คำตอบสุดท้าย [11]

เมื่อวางข้อ 4 กับข้อ 5 ไว้ข้างกันจะเห็นว่าเจ้าของ IDE กับเจ้าของโมเดลเดินเส้นทางเดียวกัน ทั้งคู่เปิดสเปกปลั๊กอินของตัวเองให้ชุมชนสร้างของเพิ่ม และทั้งคู่ก็เพิ่งถูกดันขึ้นหน้าอันดับพร้อมกันในสัปดาห์เดียวกัน โครงไฟล์ยังไม่เป็นมาตรฐานกลางเดียวกัน แต่ทิศทางมาทางเดียวกันชัดเจน [10][11]

6. JuliusBrussee/caveman, ตัวเลขที่ยอมให้คนอื่นตรวจ

110,214 stars (พุ่ง 2,004 ดาวในสัปดาห์เดียว) | Go | Apache-2.0

ไอเดียของโปรเจกต์นี้เขียนไว้ในรีจิสตรีของตัวเองว่า ทำไมต้องใช้หลายโทเคนในเมื่อใช้ไม่กี่โทเคนก็ทำงานสำเร็จ [12]

ตัวนี้ทำงานสองส่วน ส่วนแรกเป็นสกิลเปลี่ยนวิธีพูดของ agent ให้ตอบสั้นและตัดคำเกริ่นทั้งหมด โดยที่โค้ด คำสั่ง เส้นทางไฟล์ และข้อความ error ไม่ถูกแตะแม้แต่ตัวอักษร ส่วนที่สองเป็นพร็อกซีที่บีบสิ่งที่ agent อ่าน ทั้งไฟล์ CSV log YAML JSON และผลทดสอบ ตัวเลขที่ทีมรายงานคือไฟล์กลุ่มนี้เล็กลง 98.5 ถึง 99.1 เปอร์เซ็นต์ และทั้งเซสชันใช้โทเคนขาเข้าลดลง 33.2 เปอร์เซ็นต์ โดยตอบถูก 18 จาก 18 ข้อ [12]

ส่วนที่ทำให้ผมเชื่อมากกว่าตัวเลขของทีมเองคือการที่ทีมเอาผลจากห้องแลปอื่นมาแสดงข้างกัน งานวิจัยของ Adobe บน arXiv เลขที่ 2606.24083 ทดสอบแปดโมเดลบนห้าชุดข้อมูลแล้วพบว่าการบีบขาออกลดต้นทุนจริง 1.4 ถึง 2.4 เท่า สูงสุด 3 เท่า แต่การบีบขาเข้าให้ผลตรงข้าม คือแพงขึ้นราว 1.15 เท่า เพราะโมเดลตอบยาวขึ้นชดเชยจนความแม่นยำถอย [12][13] เหตุผลที่ caveman ไม่แตะพรอมป์ของคุณเลยมาจากข้อสรุปนี้

ส่วน JetBrains ทดสอบแบบ A/B บนงานจริง 86 งาน แล้วได้ข้อสรุปที่ทีม caveman เอามาแปะไว้เองใน README ว่าลดโทเคนขาออกได้ 8.5 เปอร์เซ็นต์ ไม่ใช่ 65 เปอร์เซ็นต์อย่างที่โฆษณา และคุณภาพงานไม่ต่างกันในทางสถิติ [12][14]

การที่โปรเจกต์หนึ่งยอมแสดงตัวเลขที่แย่กว่าคำโฆษณาของตัวเองไว้บรรทัดติดกัน คือสิ่งที่ผมอยากเห็นใน README ของทุกโปรเจกต์ที่ขายเรื่องการประหยัด [12]

7. headroomlabs-ai/headroom, บีบก่อนโมเดลได้อ่าน

74,524 stars | Python | Apache-2.0

โปรเจกต์นี้ไม่ได้ติดหน้าอันดับประจำสัปดาห์นี้ แต่ผมใส่ไว้เพราะ caveman อ้างถึง headroom ในผลทดสอบของตัวเองว่า บนชุดทดสอบเดียวกัน headroom ตอบถูก 15 จาก 18 ข้อ และใช้โทเคนน้อยลง 6.7 เปอร์เซ็นต์ใน 15 ข้อนั้น [12] เมื่อคู่แข่งอ้างถึงกันแบบนี้ ผมคิดว่าควรอ่านทั้งคู่

headroom เป็นชั้นบีบก่อนข้อมูลไปถึงโมเดล ใช้ได้สี่แบบ ทั้งเป็นไลบรารีเรียกในโค้ด เป็นพร็อกซีที่วางขวางโดยไม่ต้องแก้โค้ดเดิม เป็นตัวห่อ agent ที่รองรับเครื่องมือยอดนิยม 15 ตัว และเป็น MCP server ให้ไคลเอนต์ใดก็ได้เรียกใช้ พร้อมความจำที่ใช้ร่วมกันข้าม agent [15]

ตัวเลขของ headroom มาจากฉากทดสอบสี่แบบที่สร้างจากรูปแบบผลลัพธ์จริงของ MCP server ทั้งการค้นโค้ดที่ประหยัดได้ 21 เปอร์เซ็นต์ การแก้เหตุขัดข้องของ SRE ที่ 57 เปอร์เซ็นต์ การสำรวจโค้ดเบสที่ 42 เปอร์เซ็นต์ และการคัดแยก issue บน GitHub ที่ 30 เปอร์เซ็นต์ เวลาบีบอยู่ที่ 0.21 มิลลิวินาทีที่ 10,000 โทเคน จึงไม่ปรากฏในเวลาตอบสนองของ agent [15]

ส่วนที่ผมให้เครดิตคือหน้าผลวัดความแม่นยำ บน TruthfulQA ตัวเลขขยับจาก 0.530 เป็น 0.560 แต่ทีมเขียนกำกับไว้เองว่าที่จำนวน 100 ตัวอย่าง ค่าคลาดเคลื่อน 0.03 ยังอยู่ในช่วงความเชื่อมั่น ดังนั้นที่เห็นคือตรวจไม่พบความต่าง ไม่ใช่ดีขึ้น การแยกสองเรื่องนี้ออกจากกันเป็นรายละเอียดที่คนทำผลวัดมักข้าม [15]

ข้อควรระวังคือ repo นี้มี issue เปิดอยู่ 407 รายการ ซึ่งเป็นอันดับสองในลิสต์นี้รองจาก OpenShell ที่มี 531 ถ้าจะเอาไปวางขวางท่อส่งข้อมูลของทีม ควรทดสอบกับทราฟฟิกจริงของตัวเองก่อน เพราะการบีบได้มากหรือน้อยขึ้นอยู่กับว่าข้อมูลของคุณซ้ำซากแค่ไหน [15]

8. VectifyAI/PageIndex, ค้นเอกสารโดยไม่ใช้เวกเตอร์

38,790 stars (พุ่ง 2,079 ดาวในสัปดาห์เดียว) | Python | MIT

โปรเจกต์นี้ตั้งคำถามกับวิธีค้นเอกสารที่วงการใช้งานกันอยู่ การค้นด้วยเวกเตอร์หาของที่คล้ายกันเชิงความหมาย แต่ความคล้ายไม่เท่ากับความเกี่ยวข้อง และความเกี่ยวข้องต้องอาศัยการให้เหตุผล ในเอกสารวิชาชีพยาวๆ ที่ต้องเข้าใจบริบท การค้นแบบความคล้ายจึงพลาดของที่เกี่ยวข้องแต่ไม่คล้าย และหยิบของที่คล้ายแต่ไม่เกี่ยวข้องขึ้นมาแทน [16]

PageIndex จึงทิ้งดัชนีเวกเตอร์แล้วสร้างดัชนีแบบต้นไม้แทน จากนั้นให้โมเดลไล่ค้นบนต้นไม้นั้นด้วยการให้เหตุผล เหมือนผู้เชี่ยวชาญที่เปิดรายงานยาวแล้วเดินไปยังหัวข้อที่ถูกต้องโดยตรง ขั้นตอนมีสองท่อนคือสร้างดัชนีต้นไม้ แล้วค้นบนต้นไม้นั้น และทีมระบุว่าแนวคิดนี้ได้แรงบันดาลใจจาก AlphaGo [16]

จุดที่ได้เพิ่มมาคือคำตอบที่อ้างกลับไปยังตำแหน่งจริงในเอกสารได้ ไม่ใช่คำตอบที่บอกว่าน่าจะอยู่แถวนี้ เอกสารที่ทีมแนะนำให้ใช้คือรายงานการเงิน เอกสารกฎหมาย เอกสารยื่นหน่วยงานกำกับ คู่มือเทคนิค ตำราเรียน และเอกสารวิชาชีพยาวๆ ทั่วไป [16]

ฝั่งการใช้งาน ติดตั้งผ่าน pip แล้วรันในเครื่องด้วยคีย์โมเดลของคุณเอง หรือชี้ไปที่คลาวด์ของทีมก็ได้ รุ่นล่าสุดคือ v0.2.21 ออกเมื่อ 1 ตุลาคม และมีวิธีสร้างดัชนีแบบเร็วสำหรับ PDF ที่เป็นข้อความอยู่แล้ว พร้อมเลเยอร์ระบบไฟล์ที่รองรับคลังเอกสารระดับล้านชิ้น [16][17]

อ่านทั้งแปดโปรเจกต์แล้วเห็นเทรนด์สามข้อ

เทรนด์ที่ 1, ด่านตรวจกำลังกลายเป็นหมวดสินค้า

สี่โปรเจกต์ในลิสต์นี้ตอบคำถามเดียวกันคนละท่อน OpenShell บังคับนโยบายที่ตัวเคอร์เนลและพิสูจน์ก่อนอนุมัติ iFixAi ให้เกรด A ถึง F กับตัว agent เอง openrig บันทึกทุกการตัดสินใจลงคิวที่มีร่องรอย และ thermos ในตลาดของ Cursor ตรวจสาขาโค้ดแบบโหด [4][7][8][10]

จุดที่ต่างจากสัปดาห์ก่อนคือของพวกนี้ไม่ใช่ปลั๊กอินที่ใครต่อท้ายเอา แต่มาเป็นระบบเต็มรูปที่มีเอกสาร มีเงื่อนไขการใช้งาน และมีข้อจำกัดที่เขียนไว้ให้อ่านก่อนติดตั้ง สัปดาห์ที่คนยอมเสียพื้นที่บนหน้าอันดับให้ของแบบนี้ แปลว่าปัญหาเรื่องความไว้ใจกลายเป็นเรื่องที่คนยอมลงมือแก้จริง

เทรนด์ที่ 2, ค่ายใหญ่เดินเส้นทางปลั๊กอินเดียวกัน

Cursor กับ Anthropic เลือกเส้นทางเดียวกันในสัปดาห์เดียว ทั้งคู่เปิดสเปกให้คนอื่นเขียนปลั๊กอินป้อนให้แพลตฟอร์มของตัวเอง แล้วลงมือเขียนของตัวอย่างให้ดูเป็นแบบ [10][11]

จุดที่น่าสนใจกว่าจำนวนปลั๊กอินคือรูปแบบไฟล์ที่ทั้งคู่บังคับ ทั้งสองฝั่งใช้ markdown กับ JSON ล้วน ไม่มีโค้ด ไม่มีขั้นตอน build และใช้ MCP เป็นท่อเชื่อมเครื่องมือภายนอก แม้จะยังไม่มีมาตรฐานกลางร่วมกัน แต่โครงที่ออกมาใกล้กันมากจนย้ายข้ามฝั่งได้ไม่ยาก นี่คือสัญญาณว่ากำลังมีฉันทามติเกิดขึ้นเองจากฝั่งผู้ใช้งาน

เทรนด์ที่ 3, สงครามตัวเลขการบีบโทเคนย้ายออกจากคำโฆษณา

สองโปรเจกต์ที่แข่งกันเรื่องเดียวกันในลิสต์นี้เป็นตัวอย่างที่ผมชอบ caveman เอาผลของ JetBrains ที่บอกว่าลดได้เพียง 8.5 เปอร์เซ็นต์มาแสดงข้างตัวเลข 33.2 เปอร์เซ็นต์ของตัวเอง [12] และ headroom เขียนกำกับหน้าผลวัดความแม่นยำของตัวเองว่า ค่าที่ขยับขึ้นเล็กน้อยยังอยู่ในช่วงความเชื่อมั่น จึงบอกได้แค่ว่าตรวจไม่พบความต่าง [15]

มีงานวิจัยอิสระยืนยันว่าการบีบขาเข้าให้ผลตรงข้ามกับการบีบขาออก และ caveman ก็เอาข้อสรุปนั้นมาเป็นเหตุผลว่าทำไม caveman จึงไม่แตะพรอมป์ของผู้ใช้เลย วิธีวัดที่ยอมให้คนอื่นตรวจแบบนี้มีค่ากับวงการมากกว่าตัวเลขเดี่ยวๆ ที่ไม่มีใครทำซ้ำได้

อ่านสามเทรนด์รวมกันจะเห็นเส้นเดียว ทุกโปรเจกต์ที่พุ่งแรงสัปดาห์นี้ขายความสงบ ไม่ได้ขายความสามารถ ชั้นโครงสร้างที่คนอยากได้ตอนนี้คือชั้นที่ทำให้เขาเห็นว่า agent กำลังทำอะไร มีกรงที่กั้นขอบเขตไว้จริง ใบตรวจที่บอกได้ว่าใครผิด และตัวเลขที่คนอื่นเอาไปวัดซ้ำได้ งานพวกนี้ไม่ทำให้ agent ฉลาดขึ้นแม้แต่นิด แต่ทำให้คนกล้าปล่อยให้ agent ทำงานต่อได้

แล้วคุณล่ะ สัปดาห์นี้มีโปรเจกต์ไหนที่อยากลอง หรือมี repo น่าสนใจที่ผมพลาดไป พิมพ์บอกกันได้เลยครับ ใครอยากตามบทความชุดนี้ทุกสัปดาห์ กด Follow ที่โปรไฟล์ของผมได้ที่ dev.to/sarantoon

บทความนี้เขียนโดย AI (deepseek-v4.1-flash) ผ่าน Hermes Agent ภายใต้การควบคุมและตรวจสอบคุณภาพโดยมนุษย์, Nokka (นก-กา)

เอกสารอ้างอิง

[1] GitHub Trending, weekly, 2026, https://github.com/trending?since=weekly
[2] GitHub Trending, รายภาษา (Go, Python, TypeScript) weekly และ monthly, 2026, https://github.com/trending/go?since=weekly
[3] GitHub Ranking AI, Top 100 AI Agents, 2026, https://raw.githubusercontent.com/yuxiaopeng/Github-Ranking-AI/main/Top100/AI%20Agents.md
[4] NVIDIA/OpenShell, README, 2026, https://github.com/NVIDIA/OpenShell
[5] NVIDIA OpenShell documentation, 2026, https://docs.nvidia.com/openshell/latest/index.html
[6] NVIDIA/OpenShell, releases, v0.1.2, 28 กันยายน 2026, https://github.com/NVIDIA/OpenShell/releases
[7] ifixai-ai/iFixAi, README, 2026, https://github.com/ifixai-ai/iFixAi
[8] mvschwarz/openrig, README, 2026, https://github.com/mvschwarz/openrig
[9] mvschwarz/openrig, releases, v0.6.5, 4 ตุลาคม 2026, https://github.com/mvschwarz/openrig/releases
[10] cursor/plugins, README, 2026, https://github.com/cursor/plugins
[11] anthropics/knowledge-work-plugins, README, 2026, https://github.com/anthropics/knowledge-work-plugins
[12] JuliusBrussee/caveman, README, 2026, https://github.com/JuliusBrussee/caveman
[13] Adeyemi, M. D., Rossi, R. A., Dernoncourt, F., "CAVEWOMAN: How Large Language Models Behave Under Linguistic Input and Output Compression", arXiv 2606.24083, 2026, https://arxiv.org/abs/2606.24083
[14] Shiryaev, D., "Does Speaking to Agents Like Cavemen Really Save 65% of Tokens? We Test", JetBrains AI Blog, 2026, https://blog.jetbrains.com/ai/2026/07/speak-to-ai-agents-like-cavemen-tosave-tokens/
[15] headroomlabs-ai/headroom, README, 2026, https://github.com/headroomlabs-ai/headroom
[16] VectifyAI/PageIndex, README, 2026, https://github.com/VectifyAI/PageIndex
[17] VectifyAI/PageIndex, releases, v0.2.21, 1 ตุลาคม 2026, https://github.com/VectifyAI/PageIndex/releases

Top comments (0)