โดย Nokka (นก-กา) | 23 กันยายน 2569
Qwen-Image-2.1 โมเดลสร้างภาพ 7B: ทดสอบข้อเท็จจริงกับแหล่งทางการ
บทความนี้เขียนโดย AI (โมเดล glm-5.3 ของผู้ให้บริการ ollama-cloud) ผ่าน Hermes Agent จาก Nous Research ตรวจสอบและเรียบเรียงโดย Nokka
สัปดาห์กลางเดือนกันยายน 2569 ฟีด AI ทั้งหลายพากันแชร์ข่าวเดียวกัน: Alibaba ปล่อยโมเดลสร้างและแก้ภาพชื่อ Qwen-Image-2.1 ขนาด 7B แบบ open source
ข้อเด่นตามโพสต์: รับ reference สูงสุด 10 ภาพ แก้เฉพาะจุดได้ สร้าง PNG พื้นหลังโปร่งใสได้ ฟังดูเหมือนของฟรีที่ใช้แทน Photoshop ได้เลย
ผมเลยเปิด model card ทางการบน Hugging Face กับ repository บน GitHub ของทีม QwenLM เอง [1] [2] คำตอบคือเกือบทั้งหมดจริง ยกเว้นคำเดียวที่อาจทำให้คนใช้งานเชิงธุรกิจเดือดเนื้อด้าน
ของจริงที่โพสต์ไวรัลพูดถูกต้อง
ทุกข้อที่โพสต์อ้าง ผมตรวจเทียบกับ model card ทางการแล้วตรงกันหมด
- ขนาด 7B จริง แต่ต้องเข้าใจให้ถูก: ตัวเลข 7B ทางการหมายถึงส่วนสร้างภาพ (visual generation component) ที่เป็น Diffusion Transformer 32 ชั้นเท่านั้น ตัว pipeline จริงยังมี text encoder ฝั่ง Qwen3-VL ขนาด 8B รวมอยู่ด้วย [1] ใครจะโหลดมารันต้องเผื่อพื้นที่ทั้งชุด ไม่ใช่ก้อน 7B ก้อนเดียว
- Reference 10 ภาพจริง: model card ระบุชัดว่ารองรับ reference images สูงสุด 10 ภาพต่อการสร้างงานหนึ่งครั้ง [1] แปลว่าจะส่งภาพสินค้าหลายมุม ภาพตัวละครหลายท่า แล้วให้โมเดลรวมเป็นงานเดียวได้
- แก้เฉพาะจุดได้จริง: ระบุขอบเขตการแก้ได้ 3 แบบ คือวาดวงกลมลงบนภาพ ทำ annotation ด้วยสี หรือส่ง mask แยกเข้าไปเลย ใช้แก้เฉพาะจุดโดยไม่ให้ส่วนอื่นขยับ [1]
- PNG โปร่งใสได้จริง: ทางการเรียกฟีเจอร์นี้ว่า Native Transparency สร้างภาพ RGBA พื้นหลังโปร่งใสจากข้อความได้ในโมเดลเดียว ไม่ต้องไล่ลบพื้นหลังด้วยเครื่องมืออื่นทีหลัง [1]
ข้อเท็จจริงอีกอย่างที่น่าสนใจคือความสามารถเรื่องตัวอักษรในภาพ ทีมงานอ้างว่า typography ภาษาอังกฤษและจีนทำได้ดีเป็นพิเศษ ซึ่งเป็นจุดที่โมเดลสร้างภาพรุ่นก่อน ๆ มักพังเสมอ
จุดที่โพสต์ไม่ได้บอก: คำว่า open source มีเงื่อนไขซ่อนอยู่
จุดนี้เองที่ทำให้ผมต้องหยุดอ่าน license ถี่ถ้วนก่อนแนะนำใคร
license ของโมเดลนี้ไม่ใช่ Apache หรือ MIT แบบที่หลายคนเข้าใจ แต่เป็น Qwen Research License Agreement ที่ระบุเป๊ะ ๆ ว่าใช้เพื่อการวิจัยและประเมินผลเท่านั้น [3]
ตัวอักษรในไฟล์ LICENSE เขียนชัดกว่านั้นซ้ำสองว่าห้ามใช้เพื่อการค้าโดยเด็ดขาดถ้าไม่ได้รับอนุญาต ผู้ที่อยากใช้ทำงานลูกค้า ขายภาพ หรือเสียบเข้าระบบผลิตเชิงธุรกิจ ต้องติดต่อขอสิทธิ์ก่อน ราคาเท่าไรไม่มีการเปิดเผย
ขณะเดียวกัน การเลือกออก license แบบวิจัยเท่านั้นเป็นสิทธิ์ทางธุรกิจที่ชอบธรรมของ Alibaba แลกกับการเปิดให้คนทั่วโลกทดลองเครื่องมือได้ฟรี ซึ่งเป็นแนวทางเดียวกับที่ค่ายโมเดลหลายรายใช้กับรุ่นทดลองก่อนเปิดสิทธิ์เชิงพาณิชย์ในภายหลัง
ข้อควรรู้อีกสองอย่างสำหรับคนอยากลองรันเอง
- ไฟล์ทางการหนักกว่าที่คิด: รวมทั้งชุดประมาณ 33 GB [4] แยกเป็นตัวสร้างภาพราว 14 GB, text encoder ราว 17 GB และ VAE อีก 1 GB กว่า คนที่มีการ์ดจอเล็กต้องพึ่งตัวช่วย offload ลง CPU ซึ่งก็แลกกับความเร็ว
- ทางการไม่ระบุ VRAM ขั้นต่ำ: ใครบอกตัวเลขไปแล้วนั่นเป็นการวัดของชุมชนที่ทดลองเอง ไม่ใช่ตัวเลขทางการ ถ้าเครื่องไม่มี VRAM มาก README แนะนำให้เปิด CPU offload เลย แต่ไม่ได้รับประกันความเร็ว
ใช้จริงต้องเริ่มจากตรงไหน
3 ทางเข้าถึงของคนทั่วไป
คนทั่วไปอยากลองมี 3 ทาง
- โหลด weights จาก Hugging Face ตรง ๆ: หน้า Qwen/Qwen-Image-2.1 พร้อมโค้ดตัวอย่างทั้งการสร้างภาพ การแก้ภาพ และการสร้างภาพโปร่งใส วิธีนี้คุมของครบที่สุดแต่ต้องมีเครื่องแรงพอ
- ตัวแปลง GGUF ของชุมชน: มีคนแปลงไฟล์เป็น GGUF ให้ใช้กับเครื่องมืออื่นแล้ว ยอดดาวน์โหลดสูงกว่าตัวทางการเสียอีก แต่ต้องจำไว้ว่าไม่ใช่ของทีม Qwen เอง และเงื่อนไข license วิจัยก็ยังตามไปกับไฟล์เหล่านั้นด้วย
- รอบริการออนไลน์: ช่วงนี้ยังไม่มี API ทางการจาก Alibaba สำหรับรุ่นนี้ ถ้าเห็นเว็บไหนให้ใช้แล้วเก็บเงิน ให้ตรวจก่อนว่าเขาถือสิทธิ์อะไรไว้บ้าง
ความเห็นส่วนตัว: ถ้าเป้าหมายคืองานอดิเรก งานวิจัย หรือทดลองไอเดีย โมเดลนี้คุ้มค่าที่จะลองมาก ของฟรีระดับนี้หาไม่ได้ง่าย แต่ถ้าคิดจะใช้ทำเงิน ให้อ่านข้อความสำคัญใน license ก่อนสักนาที มันอาจช่วยเงินเดือนคุณไว้ได้
เทียบกับ SDXL และ Flux ที่คนใช้กันอยู่
เทียบกับ SDXL และ Flux ที่คนทำงานภาพคุ้นเคย จุดต่างที่แหล่งทางการอ้างคือ Qwen-Image-2.1 รวมการสร้างภาพโปร่งใสไว้ในตัวโดยไม่ต้องประกอบเครื่องมือหลายชั้น รับ reference ได้ถึง 10 ภาพ และตัวสร้างภาพเล็กกว่า Flux ที่อยู่ราว 12B [5] ส่วน SDXL ใช้สถาปัตยกรรม U-Net รุ่นเก่ากว่า
ข้อควรระวังในการอ่านตาราง benchmark คือตัวเลขความสามารถที่เด่น ๆ ตอนนี้มาจากการวัดของทีม Qwen เองเป็นหลัก ยังไม่มีการทดสอบอิสระที่ตรวจสอบกันออกมาเท่าไร ถ้างานคุณเลือกโมเดลเพื่อใช้จริงจัง แนะนำให้ทดสอบกับงานของตัวเองก่อนตัดสินใจ
สรุปมุมมอง
Qwen-Image-2.1 คือโมเดลที่น่าสนใจเกินกระแสชั่วคราว ความสามารถระดับสร้างภาพโปร่งใสในตัว แก้ภาพเฉพาะจุด และรับ reference 10 ภาพ ล้วนเป็นของที่คนทำงานภาพอยากได้ และตัวเลข 7B ทำให้มันเข้าถึงเครื่องธรรมดาได้มากกว่าโมเดลใหญ่หลายเท่า
แต่คำว่า open source ในกระแสข่าวกับคำว่า research license ในไฟล์ LICENSE เป็นคนละเรื่องกัน ใครใช้เพื่อเรียนรู้ได้เต็มที่ ใครใช้เพื่อพาณิชย์ต้องขอสิทธิ์ก่อน ความแตกต่างประโยคเดียวนี้แหละที่แชร์กันมักตัดทิ้ง
เขียนโดย Nokka (นก-กา) นักเขียนอิสระแกะรอยเทคโนโลยี สนใจเรื่องการทำคอนเทนต์ให้คนหาเจอมาตลอด ถ้าชอบบทความแนว local AI แบบอิงหลักฐานจริงทั้งสองฝั่ง ติดตามได้ที่ dev.to/sarantoon
อ้างอิง:
[1] Qwen. "Qwen-Image-2.1 model card." huggingface.co, เข้าถึง 22 กันยายน 2026. https://huggingface.co/Qwen/Qwen-Image-2.1
[2] QwenLM. "Qwen-Image-2.1 repository." github.com, เข้าถึง 22 กันยายน 2026. https://github.com/QwenLM/Qwen-Image-2.1
[3] Qwen. "Qwen Research License Agreement · ไฟล์ LICENSE." huggingface.co, เข้าถึง 22 กันยายน 2026. https://huggingface.co/Qwen/Qwen-Image-2.1/blob/main/LICENSE
[4] Ground Truth. "Qwen-Image-2.1 weights & research license analysis." groundtruth.day, 21 กันยายน 2026. https://groundtruth.day/news/qwen-image-2-1-weights-research-license.html
[5] MarkTechPost. "Alibaba Qwen releases Qwen-Image-2.1." marktechpost.com, 21 กันยายน 2026. https://www.marktechpost.com/2026/09/21/alibaba-qwen-releases-qwen-image-2-1/

Top comments (0)