กลับไปที่บล็อก
BananaBanana Teamnewsvideoomni-flashapi

รีวิว Gemini Omni Flash API: ฟีเจอร์เวอร์ชัน Preview ทำอะไรได้จริงบ้าง

รีวิวการใช้งานจริง Gemini Omni Flash API: gemini-omni-flash-preview รองรับอะไรบ้าง อะไรที่ยังเอ็กซ์คลูซีฟเฉพาะ Flow และต้นทุนต่อคลิปที่แท้จริง

รีวิว Gemini Omni Flash API: ฟีเจอร์เวอร์ชัน Preview ทำอะไรได้จริงบ้าง

Gemini Omni Flash คือโมเดล Multimodal แบบ "any-to-any" รุ่นแรกของ Google ที่สร้างวิดีโอได้: คุณส่งข้อความ รูปภาพ หรือผลลัพธ์ก่อนหน้าเข้าไป แล้วโมเดลจะส่งคืนคลิปสั้นความละเอียด 720p พร้อมเสียง ซึ่งคุณสามารถแก้ไขต่อได้ด้วยการอธิบายการเปลี่ยนแปลงเป็นภาษาพูด Google เปิดตัวในรูปแบบ Preview สาธารณะเมื่อวันที่ 30 มิถุนายน 2026 พร้อมกับ Nano Banana 2 Lite โดยมี API Model ID คือ gemini-omni-flash-preview

คำตอบแบบสรุปสั้นหากคุณต้องการข้อมูลสำคัญทันที: Gemini Omni Flash API รองรับการสร้างวิดีโอจากข้อความ (text-to-video), จากรูปภาพ (image-to-video), จากรูปอ้างอิง (reference-to-video) สูงสุด 10 ภาพวัตถุ (ซึ่งสามารถรวมเข้ากับเฟรมเริ่มต้นได้), การแก้ไขแบบโต้ตอบ (conversational editing) และการแก้ไขแบบวิดีโอเป็นวิดีโอ (video-to-video) จากคลิปที่คุณป้อนเข้าไป โมเดลไม่รองรับความละเอียด 1080p, ค่า seed, พารามิเตอร์ negative prompt, การขยายความยาววิดีโอ (extension) หรือการปิดเสียง การควบคุมความยาววิดีโอก็ไม่มีในเอกสารอย่างเป็นทางการเช่นกัน แต่ฟิลด์นี้มีอยู่และใช้งานได้จริง — อ่านรายละเอียดเพิ่มเติมด้านล่าง หากคุณเคยเห็นตัวอย่าง Omni Flash ใน Google Flow แล้วคาดหวังชุดเครื่องมือแบบเดียวกันจาก API คุณจะต้องผิดหวัง เราได้รวมโมเดลนี้เข้ากับ เครื่องมือเจนภาพ/วิดีโอของเรา ตั้งแต่สัปดาห์แรกที่เปิดตัว ดังนั้นรีวิวนี้จึงอิงจากสิ่งที่ Endpoint ส่งคืนจริง ไม่ใช่หน้าเว็บการตลาด

สิ่งที่ Gemini Omni Flash API ให้คุณอย่างแท้จริง

API นำเสนอ Omni Flash ผ่าน Interactions API (interactions.create) ไม่ใช่ผ่าน Endpoint generateVideos ที่ Veo ใช้งาน รายละเอียดนี้มีความสำคัญเนื่องจาก Interactions มีการบันทึกสถานะ (stateful) ทุกคำตอบจะได้รับ ID ที่คุณสามารถใช้อ้างอิงในภายหลังได้

ตาม เอกสาร Omni ของ Google รวมถึงการทดสอบ Endpoint เป็นเวลาหนึ่งสัปดาห์ ปัจจุบันมี 5 งานที่ใช้งานได้:

  • Text-to-video. ใส่ Prompt ได้คลิป 720p ออกมา พร้อมเสียงประกอบในตัว
  • Image-to-video. รูปภาพของคุณจะกลายเป็นเฟรมเปิด และ Prompt จะอธิบายการเคลื่อนไหว
  • Reference-to-video. ภาพวัตถุช่วยรักษาความต่อเนื่องของตัวละครหรือสินค้าในฉากใหม่ — คำขอรองรับได้สูงสุด 10 ภาพ และไม่เหมือน Veo ตรงที่สามารถรวมเข้ากับเฟรมเริ่มต้นได้
  • การแก้ไขแบบโต้ตอบ. ส่ง previous_interaction_id พร้อมคำสั่งสั้นๆ โมเดลจะปรับเปลี่ยนคลิปโดยรักษา ส่วนที่เหลือไว้ดังเดิม
  • การแก้ไขแบบวิดีโอเป็นวิดีโอ. ส่งวิดีโอจริงเป็นเนื้อหาพร้อม task: "edit" แล้ววิดีโอจะถูกปรับสไตล์ใหม่กลับมา — โดยไม่ต้องใช้ Interaction ID จึงใช้ได้กับคลิปที่โมเดลไม่เคยสร้างมาก่อน (รวมถึงคลิปจาก Veo และวิดีโอจากโทรศัพท์) ข้อจำกัด: ผลลัพธ์จะมีความยาวเท่ากับอินพุตเสมอ และอินพุตจำกัดสูงสุดที่ 10 วินาที

คลิปด้านบนส่งตรงมาจาก gemini-omni-flash-preview ผ่านระบบของเราเอง คุณจึงกำลังชมตัวอย่างจริง ไม่ใช่สื่อโปรโมต เพียง Prompt ข้อความเดียว: เรือกระดาษลอยอยู่บนหมึกที่หก คำว่า "single continuous scene" เพื่อป้องกันไม่ให้โมเดลตัดสลับฉาก และบรรทัด "Audio:" ที่ขอเสียงกระดาษและเสียงระลอกน้ำ เราขอความยาวเต็ม 10 วินาที ลองเปิดเสียงดู เสียงนี้สร้างโดย AI เช่นกัน

ทุกคลิปมีความยาว 3 ถึง 10 วินาที ที่ 24 fps เอกสารประกอบไม่ได้ระบุพารามิเตอร์ความยาวไว้ และตอนเปิดตัวเราสมมติว่าโมเดลสุ่มเลือกเอง ปรากฏว่ารูปแบบคำขอยอมรับความยาวอย่างเงียบๆ และตรงตามที่กำหนดอย่างแม่นยำ: ขอ 3 วินาที ได้ 3.008 วินาที คิดราคา 3 วินาที นี่คือสิ่งที่เราแสดงในเครื่องมือเจนวิดีโอ ดังนั้นการตัดต่อวิดีโอตามจังหวะเพลงจึงไม่ใช่เรื่องดวงอีกต่อไป

Prompt ยังทำหน้าที่เป็นแผงควบคุมสำหรับทุกสิ่งที่ API ไม่ได้แสดงออกมา หากปล่อยไว้โมเดลมักจะตัดสลับหลายมุมกล้อง คำว่า "single unbroken shot, no cuts" จึงอยู่ใน Prompt ส่วนใหญ่ ช่วงไทม์โค้ดอย่าง [0-3s] ... [3-6s] ... ถูกปฏิบัติตามจริง และข้อความในเครื่องหมายคำพูดจะถูกแสดงบนหน้าจออย่างแม่นยำ เครื่องมือเจนของเราเสนอสิ่งเหล่านี้เป็นปุ่มคลิกเดียว

เสียงคือความประหลาดใจอย่างที่สอง และน่าพึงพอใจ ทุกการสร้างมาพร้อมกับเสียง: เสียงบรรยากาศ เอฟเฟกต์ บางครั้งมีเสียงพูดหากขอ อย่างไรก็ตามคุณไม่สามารถปิดเสียงได้ การควบคุมเดียวที่คุณมีคือข้อความ เราจึงเพิ่มบรรทัด "Audio: ..." ต่อท้าย Prompt และมันทำงานได้ดีทีเดียว

Flow มีอะไรที่ API ไม่มี?

Google Flow เป็นเครื่องมือการผลิตแบบครบวงจรที่ครอบโมเดลหลายตัวไว้ และส่วนครอบนั้นคือสิ่งที่ API ดิบขาดหายไป Flow มี Scene Builder สำหรับลำดับหลายมุมกล้องและการควบคุมกล้องล่วงหน้า (ประเภทช็อต มุมกล้อง การเคลื่อนไหว) ข้อเท็จจริงอย่างหนึ่งเรื่องความละเอียดที่คนมักเข้าใจผิด: Flow เรนเดอร์ที่ 720p เป็นค่าเริ่มต้นเช่นกัน เวอร์ชัน 1080p และ 4K จะปรากฏในขั้นตอนดาวน์โหลด เป็นตัวเลือกการส่งออกบนผลลัพธ์ของ Veo ไม่ใช่โหมดการสร้างที่แตกต่างกัน ไม่มีเครื่องมือเหล่านั้นใน gemini-omni-flash-preview

นี่คือการเปรียบเทียบตามจริงหลังจากทดสอบทั้งสองแบบเป็นเวลาหนึ่งสัปดาห์:

ความสามารถFlow / แอป GeminiGemini Omni Flash API
ความละเอียดเรนเดอร์ 720p; มี 1080p / 4K ตอนดาวน์โหลด720p เท่านั้น, 24 fps
ความยาวคลิปScene Builder เชื่อมต่อฉาก3–10 วินาที, แม่นยำ
การควบคุมกล้องมีพรีเซ็ตประเภทช็อต มุม การเคลื่อนไหวผ่าน Prompt ข้อความเท่านั้น
การขยายความยาววิดีโอทำได้ (ผ่าน Veo)ไม่รองรับ
แก้ไขวิดีโอที่มีอยู่Remix ภายในแอปแบบโต้ตอบ หรือ วิดีโอเป็นวิดีโอบนคลิปใดก็ได้
เสียงเปิดอยู่ มีปุ่มควบคุมบน UIเปิดเสมอ ควบคุมผ่าน Prompt เท่านั้น
Seed / Negative promptถูกซ่อนจากผู้ใช้อยู่แล้วไม่รองรับ
จำนวนคลิปต่อคำขอทีละคลิปหนึ่งคลิปต่อ Interaction ไม่มี sampleCount

เอกสารระบุไว้อย่างชัดเจนเกี่ยวกับเรื่องนี้ เอกสารของ Google ระบุว่าการขยายวิดีโอและการแทรกเฟรม "ไม่รองรับ" เช่นเดียวกับ System Instructions, Temperature และพารามิเตอร์ Negative prompt (พวกเขาแนะนำให้เขียนสิ่งที่ ไม่ต้องการลงใน Prompt ปกติ ซึ่งจากประสบการณ์ของผมได้ผลประมาณครึ่งหนึ่ง) อ้างอิงวิดีโอมีระบุใน Schema ของ API โดยจำกัดไว้ที่ 3 วินาที แต่เอกสารยอมรับว่าโมเดลยังประมวลผลได้ไม่ถูกต้อง

ดังนั้น API เวอร์ชัน Preview จึงเป็นเพียงส่วนเล็กๆ ของสิ่งที่โมเดลทำได้บนอินเทอร์เฟซของ Google เอง นั่นเป็นเรื่องปกติสำหรับ Preview แต่มันยังคงน่าเสียดายเมื่อลูกค้าขอไฟล์ส่งออก 1080p แต่เพดานสูงสุดอยู่ที่ 720p

ภาพประกอบเปรียบเทียบแผงควบคุมผู้กำกับแบบเต็มรูปแบบกับรีโมทขนาดเล็ก แสดงเปรียบเทียบระหว่าง Flow กับ Omni Flash API

การแก้ไขแบบโต้ตอบคือฟีเจอร์ที่ใช้งานได้จริงอย่างยอดเยี่ยม

การแก้ไขคือจุดที่ Omni Flash ทำได้โดดเด่น คุณเจนคลิปขึ้นมา ดูผลลัพธ์ แล้วส่งคำสั่งตามหลังเช่น "เปลี่ยนเสื้อแจ็กเก็ตเป็นสีแดงและชะลอกล้องลง" โดยแนบ previous_interaction_id ของผลลัพธ์แรก โมเดลจะสร้างวิดีโอขึ้นมาใหม่โดยปรับใช้การเปลี่ยนแปลงและรักษาเนื้อหาเดิมส่วนใหญ่ไว้ ไม่ต้องอัปโหลดใหม่ ไม่ต้องทำมาร์สก์ ไม่ต้องมีไทม์ไลน์

เอกสาร Gemini Enterprise ของ Google ระบุว่าคุณสามารถแก้ไขต่อเนื่องได้สูงสุด 3 ครั้งตราบใดที่เซสชันยังคงบริบทไว้ ในทางปฏิบัติการแก้ไขแต่ละครั้งคือการเรนเดอร์ 720p ใหม่ ดังนั้นความต่อเนื่องจะเพี้ยนไปเล็กน้อยในแต่ละขั้นตอน ใบหน้าจะคงเดิมได้ดีกว่าข้อความบนป้าย การเคลื่อนไหวที่ซับซ้อนบางครั้งอาจเปลี่ยนไปแม้ว่าคุณจะขอแค่อย่างเดียวคือเปลี่ยนสีก็ตาม

ข้อควรระวังที่เราพบในการใช้งานจริง: Interaction หลักจะหมดอายุในฝั่ง Google หากพยายามแก้ไขคลิปที่สร้างไว้เมื่อนานมาแล้ว API อาจส่งคืนข้อผิดพลาด 404 บน BananaBanana เราจะแสดงว่าวิดีโอหมดอายุและคืนเงินสำหรับความพยายามนั้น แต่หากคุณพัฒนาบน API ดิบ ควรวางแผนรับมือเรื่องนี้ไว้ด้วย

บทสนทนาแชทที่แต่ละกล่องข้อความแสดงเฟรมวิดีโอเดียวกันพร้อมการเปลี่ยนแปลงเล็กน้อย แสดงถึงการแก้ไขวิดีโอแบบโต้ตอบ

Gemini Omni Flash ราคาเท่าไหร่?

ประกาศเปิดตัว ของ Google กำหนดราคา Omni Flash ไว้ที่ $0.10 ต่อวินาทีของวิดีโอผลลัพธ์: คลิป 3 วินาทีมีราคา $0.30 และคลิป 10 วินาทีมีราคา $1.00

บน BananaBanana เราใช้อัตรานั้นโดยตรง: $0.10 ต่อวินาที ดังนั้นคุณสามารถเลือก 3 วินาทีในราคา $0.30 หรือเต็ม 10 วินาทีในราคา $1.00 และการแก้ไขมีราคาเท่าเดิมเนื่องจากเป็นการเรนเดอร์ใหม่ทั้งหมด (และได้ความยาวเท่ากับต้นฉบับเดิม — โมเดลไม่สามารถยืดหรือตัดทอนได้) Nano Banana 2 Lite ซึ่งเปิดตัววันเดียวกัน มีราคา $0.03 ต่อภาพที่นี่ (ราคา API ของ Google คือ $0.034 สำหรับภาพ 1K) ดูรายการราคาเต็มได้ที่ ส่วนราคา

ราคา 10 เซนต์ต่อวินาทีคุ้มค่าหรือไม่? สำหรับฉบับร่างพร้อมเสียงที่หากไม่ทำแบบนี้จะต้องใช้ขั้นตอนการสร้างวิดีโอและการทำเสียงแยกต่างหาก ถือว่าคุ้มค่า — และการทดสอบ 3 วินาทีมีราคาถูกกว่าคลิป Veo สำหรับวิดีโอประกอบแบบไม่มีเสียง ถือว่าไม่คุ้ม Veo 3.1 Fast สร้างคลิปไม่มีเสียงได้ถูกกว่าและได้ความละเอียดสูงกว่า

คุณควรใช้ Omni Flash หรือ Veo 3.1?

สรุปสั้นๆ: ทั้งสองแบ่งงานกันทำ แต่ไม่ได้แบ่งตามเส้น "ฉบับร่าง vs งานจริง" อย่างที่คุณคิด

สิ่งหนึ่งที่ต้องรู้ก่อนเลือก: ช่องว่างคุณภาพระหว่างทั้งสองไม่ได้อยู่ที่ความละเอียดอย่างเดียว Veo 3.1 เรนเดอร์การเคลื่อนไหวและฟิสิกส์ได้สมจริงกว่ามาก น้ำไหลอย่างเป็นธรรมชาติ ผ้าพับเป็นรอยในจุดที่ควรเป็น วัตถุชนกันแทนที่จะทะลุผ่านกันเหมือนผี Omni Flash ทำถูกต้องบ่อยครั้ง แต่ไม่สม่ำเสมอ และในบางคลิปคุณจะสังเกตเห็นได้ทันที

เลือก Veo 3.1 เมื่อคุณต้องการไฟล์ส่งออก 4K จริง, ความยาวคลิปที่แน่นอน (กำหนดเป็นวินาทีเต็ม 4 ถึง 8 วินาที ไม่มีเศษวินาที), วิดีโอไม่มีเสียง, การขยายความยาวในภายหลัง หรือการควบคุมทั้งเฟรมแรกและเฟรมสุดท้าย ฟีเจอร์หลังนี้มักถูกมองข้าม: ป้อนภาพเดียวกันเป็นเฟรมแรกและเฟรมสุดท้าย แล้วคุณจะได้วิดีโอวนลูปไร้รอยต่อ ซึ่งเป็นเทคนิคทั้งหมดเบื้องหลังวิดีโอพื้นหลังแบบวนลูป มันคือเครื่องมือการผลิตสำหรับงานจอกว้างหรืองานที่เน้นฟิสิกส์

เลือก Omni Flash เมื่อจุดหมายปลายทางคือหน้าจอโทรศัพท์ สำหรับ TikTok, Shorts หรือ Reels ความละเอียด 720p คือทั้งหมดที่แพลตฟอร์มรักษาไว้หลังจากการบีบอัดของตัวเอง เสียงถูกสร้างมาในขั้นตอนเดียวกัน และการแก้ไขแบบโต้ตอบก็เหนือกว่าการพิมพ์ Prompt ใหม่ตั้งแต่ต้น ในกลุ่มนี้ มันไม่ใช่เครื่องมือร่างภาพ แต่มันคือตัวเลือกที่ดีกว่า

เวิร์กโฟลว์ส่วนตัวของผมหลังจากทดสอบสองวัน: สำหรับงานจอกว้างของลูกค้า ผมยังคงร่างคอนเซปต์ใน Omni Flash — ถ่ายแบบสามวินาทีที่ $0.30 — จากนั้นนำเวอร์ชันที่เลือกไปทำใหม่ใน Veo ที่คุณภาพสุดท้าย สำหรับคลิปแนวตั้งที่จะลงโซเชียลมีเดียโดยตรง คลิปจาก Omni มักจะส่งใช้งานได้ทันที

โดรนกล้องสองตัวที่มีขนาดต่างกันบินคู่กันเหนือหุบเขาสีพาสเทล เป็นตัวแทนของการเลือกระหว่าง Omni Flash และ Veo 3.1

ทั้งสองโมเดลเปิดใช้งานแล้วใน เครื่องมือเจนของ BananaBanana คุณจึงสามารถเปรียบเทียบโมเดลด้วย Prompt เดียวกันได้โดยไม่ต้องเขียนโค้ดหรือตั้งค่าโปรเจกต์ Google Cloud และหากคุณต้องการเวอร์ชันสรุปของรีวิวนี้ — ความสามารถ ข้อจำกัด และราคาในหน้าเดียว สามารถดูได้ที่ หน้า Gemini Omni

FAQ

gemini-omni-flash-preview คืออะไร?

เป็น API Model ID สำหรับ Gemini Omni Flash โมเดลสร้างวิดีโอแบบโต้ตอบของ Google ที่เปิดตัวในรูปแบบ Preview สาธารณะเมื่อวันที่ 30 มิถุนายน 2026 โดยสร้างและแก้ไขคลิป 720p ความยาว 3–10 วินาทีพร้อมเสียงผ่าน Interactions API

Gemini Omni Flash สามารถสร้างวิดีโอ 1080p หรือ 4K ได้หรือไม่?

ไม่ได้ API ส่งออกความละเอียด 720p ที่ 24 fps เท่านั้น Google Flow ก็เรนเดอร์ที่ 720p เป็นค่าเริ่มต้นเช่นกัน เวอร์ชัน 1080p และ 4K จะมีให้เลือกในขั้นตอนดาวน์โหลดสำหรับ Veo เท่านั้น หากคุณต้องการไฟล์ส่งออกความละเอียดสูงจริง ให้ใช้ Veo 3.1

ฉันสามารถตั้งความยาววิดีโอใน Omni Flash API ได้หรือไม่?

ได้ แม้ว่าคุณจะหาไม่เจอในเอกสารก็ตาม รูปแบบการตอบรับยอมรับความยาว และผลลัพธ์ก็ตรงตามเฟรม: ขอ 3 วินาที ได้ 3.008 วินาที คิดราคา 3 วินาที เราแสดงสิ่งนี้เป็นตัวเลือก 3–10 วินาทีในเครื่องมือเจน ยกเว้นการแก้ไข — คลิปที่แก้ไขแล้วจะสืบทอดความยาวของวิดีโอต้นฉบับเสมอ

Omni Flash สร้างเสียงเสมอหรือไม่?

ใช่ ทุกคลิปมาพร้อมกับเสียงประกอบที่ถูกสร้างขึ้น และไม่มีแฟล็กสำหรับปิดเสียง อธิบายเสียงที่คุณต้องการ (หรือขอ "quiet ambient room tone") ลงใน Prompt โดยตรง

Omni Flash สามารถขยายความยาวหรือแทรกเฟรมวิดีโอที่มีอยู่ได้หรือไม่?

ไม่สามารถทำให้ยาวขึ้นได้: การขยายความยาวและการแทรกเฟรมไม่รองรับ และงาน extend ใน Schema จะตอบว่า "this model does not support video extension" การแก้ไขคือสิ่งที่โมเดลทำแทน — ไม่ว่าจะแบบโต้ตอบบนคลิปที่สร้างขึ้น หรือแบบวิดีโอเป็นวิดีโอบนวิดีโอที่เสร็จแล้วที่คุณป้อนเข้าไป รวมถึงวิดีโอจาก Veo หรือไฟล์ที่คุณอัปโหลดเอง ผลลัพธ์จะรักษาความยาวของอินพุตไว้

newsvideoomni-flashapi