DEV Community

Cover image for Gemini Omni 1.1 Flash: มีอะไรใหม่ในโมเดล AI วิดีโอ GA ของ Google
Thanawat Wongchai
Thanawat Wongchai

Posted on Originally published at apidog.com

Gemini Omni 1.1 Flash: มีอะไรใหม่ในโมเดล AI วิดีโอ GA ของ Google

Gemini Omni 1.1 Flash: สิ่งที่นักพัฒนาต้องรู้ก่อนย้ายจาก Preview

Google เปิดให้ใช้งานโมเดลวิดีโอสนทนาเป็นการทั่วไปเมื่อวันที่ 27 สิงหาคม 2026 ในชื่อ gemini-omni-1.1-flash โมเดลนี้จะมาแทนที่เอนด์พอยต์ gemini-omni-flash-preview ซึ่งเปิดตัวแบบพรีวิวเมื่อวันที่ 30 มิถุนายน โดย Google จะปิดใช้งานเอนด์พอยต์พรีวิวในวันที่ 30 กันยายน 2026

ลองใช้ Apidog วันนี้

การเปิดตัวครั้งนี้ไม่ได้เปลี่ยนแค่ชื่อโมเดล แต่เพิ่มความสามารถสำคัญ 4 อย่าง:

  • ขยายฉากได้นานสูงสุด 40 วินาที
  • ควบคุมเฟรมแรกและเฟรมสุดท้าย
  • สร้างร่างความละเอียด 360p ในราคาประหยัด
  • อัปสเกลวิดีโอเป็น 4K

บทความนี้สรุปความสามารถ ราคา ช่องทางการใช้งาน ข้อจำกัด และขั้นตอนย้ายจาก Preview ไปยัง GA

หากต้องการทำความเข้าใจภาพรวมของตระกูล Omni และแนวคิดเบื้องหลังโมเดลวิดีโอที่เน้นการให้เหตุผล โปรดอ่าน Gemini Omni คืออะไร ก่อน

Gemini Omni 1.1 Flash ทำอะไรได้บ้าง

Omni 1.1 Flash รับข้อความ รูปภาพ และวิดีโอเป็นอินพุต แล้วส่งคืนวิดีโอ โดยทำงานผ่าน Interactions API แทน generateContent

จุดเด่นของ Interactions API คือการรักษาสถานะแบบหลายเทิร์น คุณสามารถสร้างคลิป แล้วส่งคำขอถัดไปเพื่อแก้ไขคลิปเดิมได้โดยไม่ต้องอัปโหลดซ้ำ

รูปแบบงานที่รองรับมี 5 แบบ:

  • ข้อความเป็นวิดีโอ: ป้อนข้อความแจ้งเพื่อสร้างคลิป
  • รูปภาพเป็นวิดีโอ: ใช้รูปภาพเป็นเฟรมเปิดหรือเป็นแนวทางด้านสไตล์
  • วิดีโออ้างอิงเป็นวิดีโอ: ใช้คลิปอ้างอิงสูงสุด 3 คลิป คลิปละ 3 วินาที เพื่อถ่ายทอดการเคลื่อนไหว รูปลักษณ์ และความสอดคล้องของตัวละคร
  • การแก้ไข: เปลี่ยนแปลงองค์ประกอบในวิดีโอที่สร้างไว้แล้วระหว่างการสนทนา
  • การขยาย: เพิ่มวิดีโอต่อท้ายครั้งละ 10 วินาที

เสียงในคลิปอ้างอิงจะถูกละเว้น โมเดลใช้คลิปเหล่านั้นเพื่อวิเคราะห์การเคลื่อนไหวและรูปลักษณ์เท่านั้น

ขยายฉากได้สูงสุด 40 วินาที

โมเดล Preview ใช้เพียงวินาทีสุดท้ายของคลิปเป็นบริบท ทำให้สีอาจต่อเนื่อง แต่ตัวละครอาจเคลื่อนออกจากตำแหน่งเดิม และการเคลื่อนกล้องอาจถูกรีเซ็ต ผลลัพธ์จึงเป็นเพียงการ “ต่อวิดีโอ” ไม่ใช่การต่อฉากอย่างต่อเนื่อง

Omni 1.1 วิเคราะห์บริบทก่อนหน้าได้สูงสุด 10 วินาที ทำให้ ความสอดคล้องทางภาพดีขึ้นและการเล่าเรื่องต่อเนื่องมากขึ้น คุณสามารถขยายคลิปครั้งละ 10 วินาทีจนมีความยาวรวม 40 วินาที

ข้อจำกัดที่ต้องวางแผนไว้:

  • ขยายได้เฉพาะส่วนท้ายของคลิป ไม่สามารถเพิ่มฟุตเทจด้านหน้า หรือแทรกตรงกลางได้
  • วิดีโอที่อัปโหลดมีความยาวอินพุตสูงสุด 10 วินาที เว้นแต่จะทำงานต่อใน Interaction แบบหลายเทิร์นที่โมเดลเก็บสถานะเดิมไว้

ดูตัวอย่างรูปแบบคำขอและตำแหน่งรอยต่อได้ที่ คำแนะนำการขยายฉาก 40 วินาที

ควบคุมเฟรมแรกและเฟรมสุดท้าย

คุณสามารถระบุเฟรมแรก เฟรมสุดท้าย และข้อความแจ้งที่อธิบายการเคลื่อนไหวระหว่างสองเฟรม โมเดลจะสร้างวิดีโอเพื่อเชื่อมโยงทั้งสองเฟรมเข้าด้วยกัน

กรณีใช้งานที่เหมาะสม ได้แก่:

  • การเคลื่อนกล้องแบบวงโคจร
  • การเปลี่ยนฉากแบบซูม
  • คลิปแบบวนซ้ำ

สำหรับการสร้างเครื่องมือวิดีโอ ความสามารถนี้ช่วยให้ผลลัพธ์คาดเดาได้มากกว่าการสร้างจากข้อความเพียงอย่างเดียว เพราะคุณกำหนดจุดเริ่มต้นและจุดสิ้นสุดไว้ แล้วให้โมเดลสร้างเฉพาะส่วนตรงกลาง

ร่างที่ 360p เพื่อลดต้นทุน

Omni 1.1 สร้างวิดีโอ 360p ได้เร็วกว่า 720p สูงสุด 60% และมีค่าใช้จ่ายเพียงหนึ่งในสาม โดยเวิร์กโฟลว์ที่ Google แนะนำคือ:

  1. ร่างวิดีโอที่ 360p จนกว่าข้อความแจ้งจะถูกต้อง
  2. เรนเดอร์เวอร์ชันสุดท้ายที่ 720p, 1080p หรือ 4K

การสร้างวิดีโอมีต้นทุนสูงต่อวินาที และวิดีโอจำนวนมากจากการทดลองพรอมต์จะถูกทิ้ง โหมด 360p จึงช่วยให้คุณทดลองได้มากขึ้นโดยไม่เพิ่มงบประมาณ

ดู รายละเอียดราคาต่อวินาที

ความละเอียดจะกำหนดในรูปแบบการตอบกลับ โดย 1080p และ 4k เป็นการอัปสเกลเฟรมที่สร้างขึ้น ไม่ใช่การเรนเดอร์แบบเนทีฟ

ใช้งานได้ที่ไหน

Omni 1.1 Flash ใช้งานได้ผ่าน:

  • Gemini API ใน Google AI Studio
  • Gemini Enterprise Agent Platform API สำหรับองค์กร
  • Google Flow สำหรับสมาชิก AI Plus, Pro และ Ultra
  • แอป Gemini ซึ่งสมาชิกสามารถใช้การขยายฉากได้

พันธมิตรเปิดตัวที่ประกาศว่ารันโมเดลนี้ภายในผลิตภัณฑ์ ได้แก่ Adobe Firefly, Figma Weave, Runway และ GMI Cloud

ไม่มี Free Tier บน API

ต่างจากโมเดลข้อความ Flash ที่ AI Studio มีการใช้งานฟรีแบบจำกัดอัตรา ทุกวินาทีของเอาต์พุต Omni จะถูกคิดค่าบริการตั้งแต่คำขอแรก

โมเดลนี้ใช้งานได้ฟรีบน YouTube Shorts และ YouTube Create แต่เป็นผลิตภัณฑ์คนละประเภทและมีข้อจำกัดต่างกัน ดู สรุปช่องทางการใช้งานฟรี

ข้อจำกัดที่ต้องรู้ก่อนออกแบบฟีเจอร์

  • ตัวเลือกพรอมต์มีจำกัด: ไม่รองรับ system instruction, temperature, top_p, stop sequence หรือ negative prompt หากต้องการกำหนดข้อยกเว้น ให้เขียนไว้ในพรอมต์ปกติ
  • ข้อจำกัดด้านภูมิภาค: การอัปโหลดและแก้ไขวิดีโอไม่รองรับในเขตเศรษฐกิจยุโรป สวิตเซอร์แลนด์ และสหราชอาณาจักร เช่นเดียวกับการแก้ไขรูปภาพที่มีผู้เยาว์ วิดีโอที่สร้างโดยโมเดลยังสามารถแก้ไขได้ในภูมิภาคเหล่านี้
  • บุคคลที่ระบุตัวตนได้: การแก้ไขบุคคลที่สามารถระบุตัวตนได้บางรายอาจถูกบล็อก
  • บทสนทนาในวิดีโอที่อัปโหลด: คุณสามารถขยายคลิปที่อัปโหลดแบบไม่มีเสียง หรือทำงานต่อแบบหลายเทิร์นได้ แต่ไม่สามารถเพิ่มบทสนทนาขณะขยายไฟล์ที่ผู้อื่นอัปโหลด
  • การให้เหตุผลข้ามวิดีโอ: โมเดลไม่รองรับการให้เหตุผลข้ามวิดีโออินพุตหลายรายการ
  • ภาษา: ปัจจุบันภาษาอังกฤษได้รับการสนับสนุนเต็มรูปแบบ ส่วนภาษาอื่นยังไม่ได้รับการทดสอบอย่างเป็นทางการ
  • ลายน้ำ: เอาต์พุตทุกชิ้นมี ลายน้ำ SynthID ที่มองไม่เห็นด้วยตา แต่ตรวจจับได้ด้วยโปรแกรม

หากผลิตภัณฑ์ของคุณต้องมีการยืนยันแหล่งกำเนิดของสื่อ ควรวางแผนรองรับ SynthID ตั้งแต่ต้น

Omni 1.1 Flash หรือ Veo 3.1?

Google มีโมเดลสร้างวิดีโอ 2 ตระกูลที่ใช้ API key เดียวกัน:

โมเดล จุดเด่น
Veo 3.1 เรนเดอร์ภาพยนตร์พร้อมเสียงในตัว
Omni 1.1 Flash โมเดลวิดีโอแบบสนทนา รองรับการแก้ไขหลายเทิร์น

วิดีโอ Omni ความละเอียด 720p มีราคาประมาณหนึ่งในสี่ของ Veo 3.1 มาตรฐาน และ Veo ไม่มีความสามารถแก้ไขแบบวนซ้ำหลายเทิร์น

อ่าน การเปรียบเทียบแบบเคียงข้างกัน เพื่อเลือกโมเดลให้เหมาะกับงาน หากคุณมีการผสานรวมกับ Veo อยู่แล้ว คู่มือ Veo 3.1 API ยังคงใช้งานได้ การเปิดตัว Omni 1.1 ไม่ได้ทำให้ Veo 3.1 เลิกใช้งาน

ย้ายออกจากเอนด์พอยต์ Preview

คำขอที่ใช้ gemini-omni-flash-preview จะหยุดทำงานหลังวันที่ 30 กันยายน 2026 การย้ายอาจเปลี่ยนเพียงสตริงโมเดลหนึ่งบรรทัด แต่ควรตรวจสอบอีก 2 เรื่อง:

1. ค่าเริ่มต้นของความละเอียด

ตอนนี้ 720p เป็นค่าดีฟอลต์ และ 360p กับ 4K เป็นตัวเลือกใหม่ หากโค้ดของคุณคาดการณ์ขนาดเอาต์พุตตายตัว ให้ตรวจสอบขนาดที่ได้รับจริง

2. รูปแบบการตอบกลับ

วิดีโอที่มีขนาดเกิน 4MB จะถูกส่งคืนเป็น URI แทน base64 แบบอินไลน์ หากโค้ดอ่านเฉพาะ output_video.data วิดีโอความละเอียดสูงอาจส่งคืนค่าว่างโดยไม่แสดงข้อผิดพลาด

เวิร์กโฟลว์ที่แนะนำ:

  1. บันทึกคำขอเดียวกันในไคลเอนต์ API
  2. เก็บรหัสโมเดลไว้ในตัวแปรสภาพแวดล้อม
  3. รันคำขอด้วยรหัส Preview
  4. สลับเป็นรหัส GA แล้วรันซ้ำ
  5. เปรียบเทียบความละเอียดและรูปแบบการตอบกลับ

Apidog ช่วยจัดการขั้นตอนนี้ได้ โดยเก็บรหัสโมเดลไว้ใน environment บันทึกคำขอหนึ่งรายการ แล้วสลับ environment เพื่อเปรียบเทียบผลลัพธ์ ดู คู่มือการใช้ Gemini Omni 1.1 Flash API

คำถามที่พบบ่อย

รหัสโมเดลของ Gemini Omni 1.1 Flash คืออะไร?

gemini-omni-1.1-flash ส่วนรหัส Preview ที่กำลังเลิกใช้งานคือ gemini-omni-flash-preview

Gemini Omni 1.1 Flash เปิดตัวเมื่อใด?

เวอร์ชัน GA เปิดตัววันที่ 27 สิงหาคม 2026 ส่วนเวอร์ชัน Preview เปิดตัววันที่ 30 มิถุนายน 2026

Gemini Omni 1.1 Flash ใช้งานฟรีหรือไม่?

ไม่ฟรี ไม่มี Free Tier สำหรับ Omni ทุกการสร้างจึงมีค่าใช้จ่าย โมเดลข้อความอย่าง Gemini 3.6 Flash ยังคงมีช่องทางใช้งานฟรีใน AI Studio แต่ Omni ไม่มี

วิดีโอ Gemini Omni ยาวได้เท่าใด?

คลิปเริ่มต้นมีความยาว 10 วินาที และขยายฉากได้สูงสุด 40 วินาที โดยเพิ่มครั้งละ 10 วินาที

Gemini Omni สร้างเสียงได้หรือไม่?

เอกสารของ Omni ครอบคลุมเอาต์พุตวิดีโอ และละเว้นเสียงในคลิปอ้างอิง หากต้องการเสียงในตัว ให้ใช้ Veo 3.1 API

สามารถแก้ไขวิดีโอที่ถ่ายเองได้หรือไม่?

ได้ โดยรองรับอินพุตสูงสุด 10 วินาที และไม่รองรับในเขตเศรษฐกิจยุโรป สวิตเซอร์แลนด์ และสหราชอาณาจักร ให้อัปโหลดไฟล์ผ่าน Files API แล้วส่ง URI เป็นอินพุต

สรุป

Omni 1.1 Flash เป็นเวอร์ชันแรกที่เหมาะกับการนำไปใช้งานจริงมากขึ้น ด้วย:

  • การขยายฉากที่รักษาความต่อเนื่องได้นานสูงสุด 40 วินาที
  • การควบคุมเฟรมแรกและเฟรมสุดท้าย
  • โหมดร่าง 360p ที่ลดต้นทุนการทดลอง
  • การอัปสเกลสูงสุด 4K

ก่อนสิ้นเดือนกันยายน ให้เชื่อมคำขอที่บันทึกไว้กับรหัสโมเดล GA ตรวจสอบรูปแบบการตอบกลับในทุกความละเอียดที่คุณใช้งาน และย้ายออกจากเอนด์พอยต์ Preview

ดาวน์โหลด Apidog เพื่อบันทึกและตรวจสอบการย้ายข้อมูลก่อนถึงกำหนดเวลา

Top comments (0)