Quay lại blog
BananaBanana Teamnewsvideoomni-flashapi

Đánh giá Gemini Omni Flash API: Những gì bản Preview thực sự hỗ trợ

Đánh giá thực tế Gemini Omni Flash API: gemini-omni-flash-preview hỗ trợ những gì, tính năng nào độc quyền cho Flow và chi phí thực tế cho từng clip.

Đánh giá Gemini Omni Flash API: Những gì bản Preview thực sự hỗ trợ

Gemini Omni Flash là mô hình đa thức "any-to-any" đầu tiên của Google có khả năng xuất video: bạn gửi văn bản, hình ảnh hoặc kết quả trước đó, và nó trả về một đoạn clip ngắn 720p kèm âm thanh mà bạn có thể tiếp tục chỉnh sửa bằng cách mô tả yêu cầu bằng ngôn ngữ tự nhiên. Google đã phát hành bản preview công khai vào ngày 30 tháng 6 năm 2026 cùng với Nano Banana 2 Lite, và ID mô hình API là gemini-omni-flash-preview.

Câu trả lời nhanh nếu bạn chỉ cần thông tin cốt lõi: Gemini Omni Flash API hỗ trợ text-to-video, image-to-video, reference-to-video tối đa 10 ảnh đối tượng (có thể kết hợp với khung hình bắt đầu), chỉnh sửa dạng hội thoại và chỉnh sửa video-sang-video cho clip bạn tải lên. Nó không hỗ trợ 1080p, seed, tham số negative prompt, mở rộng video (extension) hay tắt âm thanh. Việc kiểm soát thời lượng cũng không có trong tài liệu chính thức, nhưng trường này tồn tại và hoạt động tốt — chi tiết bên dưới. Nếu bạn đã xem các bản demo Omni Flash trong Google Flow và kỳ vọng bộ công cụ tương tự từ API, bạn sẽ thất vọng. Chúng tôi đã tích hợp nó vào giao diện tạo video ngay trong tuần ra mắt, vì vậy bài đánh giá này dựa trên những gì endpoint thực sự trả về chứ không phải quảng cáo.

Gemini Omni Flash API thực sự mang lại những gì?

API cung cấp Omni Flash thông qua Interactions API (interactions.create), chứ không phải qua endpoint generateVideos mà Veo sử dụng. Chi tiết này rất quan trọng vì các tương tác có lưu trạng thái (stateful). Mỗi phản hồi mang một id để bạn tham chiếu sau này.

Theo tài liệu Omni của Google cùng một tuần thử nghiệm endpoint, hiện có 5 tác vụ hoạt động:

  • Text-to-video. Nhập prompt, xuất clip 720p bao gồm cả âm thanh.
  • Image-to-video. Hình ảnh của bạn trở thành khung hình mở đầu và prompt mô tả chuyển động.
  • Reference-to-video. Ảnh đối tượng giúp giữ tính nhất quán của nhân vật hoặc sản phẩm trong cảnh mới — yêu cầu nhận tối đa 10 ảnh và khác với Veo, chúng có thể kết hợp với khung hình bắt đầu.
  • Chỉnh sửa dạng hội thoại. Truyền previous_interaction_id kèm hướng dẫn ngắn, mô hình sẽ thay đổi clip trong khi giữ nguyên phần còn lại.
  • Chỉnh sửa video-sang-video. Gửi video thực tế làm nội dung với task: "edit" và nó sẽ trả về video được đổi phong cách — không cần id tương tác, vì vậy nó hoạt động trên cả các clip mà mô hình chưa từng tạo (bao gồm bản render từ Veo hoặc video quay bằng điện thoại). Điểm cần lưu ý: đầu ra luôn có độ dài chính xác bằng đầu vào, và đầu vào bị giới hạn tối đa 10 giây.

Đoạn clip trên được xuất trực tiếp từ gemini-omni-flash-preview qua hệ thống của chúng tôi, vì vậy bạn đang xem một ví dụ thực tế chứ không phải tài liệu truyền thông. Chỉ với một prompt văn bản: chiếc thuyền giấy trôi trên vết mực loang, cụm từ "single continuous scene" để ngăn mô hình cắt cảnh, và dòng "Audio:" yêu cầu tiếng sột soạt của giấy và tiếng nước chảy. Chúng tôi đã yêu cầu tối đa 10 giây. Bật âm thanh lên; phần tiếng cũng được tạo bởi AI.

Mỗi clip chạy từ 3 đến 10 giây ở tốc độ 24 fps. Tài liệu không liệt kê tham số thời lượng, và lúc ra mắt chúng tôi tưởng mô hình tự quyết định. Hóa ra định dạng yêu cầu âm thầm chấp nhận độ dài và rất chính xác: yêu cầu 3 giây bạn sẽ nhận được 3.008 giây, tính phí 3 giây. Đó là tính năng chúng tôi đưa vào công cụ tạo video, giúp việc dựng phim theo nhịp nhạc không còn là trò may rủi.

Prompt cũng đóng vai trò là bảng điều khiển cho mọi thứ mà API không cung cấp. Nếu để mặc định, mô hình có xu hướng cắt giữa nhiều góc quay, vì vậy cụm từ "single unbroken shot, no cuts" xuất hiện trong hầu hết các prompt; khoảng thời gian như [0-3s] ... [3-6s] ... được tuân thủ tốt; và văn bản trong dấu ngoặc kép được hiển thị lên màn hình với độ chính xác kinh ngạc. Trình tạo của chúng tôi cung cấp sẵn các mẫu này chỉ bằng một cú nhấp chuột.

Âm thanh là bất ngờ thứ hai, và rất dễ chịu. Mỗi lần tạo đều đi kèm âm thanh: tiếng ồn môi trường, hiệu ứng, đôi khi cả giọng nói nếu bạn yêu cầu. Tuy nhiên, bạn không thể tắt nó. Cách kiểm soát duy nhất bạn có là văn bản, vì vậy chúng tôi thường thêm dòng "Audio: ..." vào cuối prompt và nó hoạt động khá tốt.

Flow có những gì mà API không có?

Google Flow là một công cụ sản xuất hoàn chỉnh xoay quanh nhiều mô hình, và sự hoàn thiện đó chính là điều API thô còn thiếu. Flow cung cấp Scene Builder cho các chuỗi nhiều góc quay và các điều khiển máy ảnh có sẵn (góc máy, tiêu cự, chuyển động). Một chi tiết mọi người hay hiểu sai về độ phân giải: Flow cũng render ở 720p theo mặc định. Các phiên bản 1080p và 4K xuất hiện ở bước tải xuống, như một tùy chọn xuất trên bản render của Veo chứ không phải chế độ tạo video khác. Không có công cụ nào trong số đó tồn tại trong gemini-omni-flash-preview.

Dưới đây là so sánh thực tế sau một tuần thử nghiệm cả hai:

Tính năngFlow / Ứng dụng GeminiGemini Omni Flash API
Độ phân giảiRender 720p; Tùy chọn 1080p / 4K khi tải xuốngChỉ 720p, 24 fps
Độ dài clipScene Builder chuỗi nhiều cảnh3–10 giây, chính xác
Điều khiển máy ảnhĐặt sẵn góc máy, tiêu cự, chuyển độngChỉ qua prompt văn bản
Mở rộng videoCó (qua Veo)Không hỗ trợ
Chỉnh sửa video có sẵnRemix trong ứng dụngHội thoại, hoặc video-sang-video cho mọi clip
Âm thanhBật, có điều khiển trên UILuôn bật, chỉ điều khiển qua prompt
Seed / Negative promptDù sao cũng ẩn với người dùngKhông hỗ trợ
Số clip mỗi yêu cầuTừng clip mộtMột clip mỗi tương tác, không có sampleCount

Tài liệu rất minh bạch về một số điểm này. Tài liệu của Google tuyên bố rằng việc mở rộng và nội suy video "không được hỗ trợ", và điều tương tự cũng áp dụng cho hướng dẫn hệ thống, temperature và các tham số negative prompt (họ gợi ý viết những điều không muốn vào prompt thường, nhưng theo kinh nghiệm của tôi chỉ hiệu quả một nửa số lần). Tham chiếu video được liệt kê trong schema của API với giới hạn 3 giây, nhưng tài liệu thừa nhận mô hình chưa xử lý chính xác.

Vì vậy, bản preview API là một phần nhỏ trong những gì mô hình có thể làm trên các nền tảng của chính Google. Điều đó bình thường đối với bản thử nghiệm. Tuy nhiên vẫn khá hụt hẫng khi khách hàng yêu cầu xuất 1080p mà giới hạn chỉ dừng ở 720p.

Hình ảnh so sánh bảng điều khiển đạo diễn đầy đủ với một chiếc điều khiển từ xa nhỏ, ẩn dụ cho Flow so với Omni Flash API

Chỉnh sửa dạng hội thoại là tính năng thực sự đáng giá

Chỉnh sửa là nơi Omni Flash khẳng định vị thế. Bạn tạo một clip, xem xét, sau đó gửi yêu cầu tiếp theo như "đổi áo chiếc áo măng tô thành màu đỏ và di chuyển máy ảnh chậm lại" kèm theo previous_interaction_id của kết quả đầu tiên. Mô hình sẽ dựng lại video với thay đổi của bạn và giữ lại hầu hết bản gốc. Không cần tải lại tệp, không cần mask, không cần timeline.

Tài liệu Gemini Enterprise của Google cho biết bạn có thể thực hiện tối đa 3 lần chỉnh sửa liên tiếp trong khi phiên làm việc vẫn giữ bối cảnh. Trên thực tế, mỗi lần chỉnh sửa là một bản render 720p mới, vì vậy độ nhất quán sẽ giảm nhẹ qua từng bước. Khuôn mặt giữ tốt hơn chữ trên biển hiệu. Chuyển động phức tạp đôi khi thay đổi ngay cả khi bạn chỉ yêu cầu đổi màu.

Một lưu ý chúng tôi gặp phải khi vận hành: các tương tác gốc sẽ hết hạn phía Google. Nếu thử chỉnh sửa một clip được tạo từ lâu, API có thể trả về lỗi 404. Trên BananaBanana, chúng tôi hiển thị đây là video hết hạn và hoàn tiền cho lượt thử, nhưng nếu bạn tự phát triển trên API thô, hãy chuẩn bị cho trường hợp này.

Đoạn chat mà mỗi bong bóng phản hồi hiển thị cùng một khung hình video với một thay đổi nhỏ, minh họa cho việc chỉnh sửa video dạng hội thoại

Giá của Gemini Omni Flash là bao nhiêu?

Thông báo ra mắt của Google tính giá Omni Flash là $0.10 cho mỗi giây video đầu ra: kết quả 3 giây tốn $0.30, và 10 giây tốn $1.00.

Trên BananaBanana, chúng tôi áp dụng đúng mức giá đó: $0.10 mỗi giây, vì vậy bạn chọn 3 giây với giá $0.30 hoặc trọn vẹn 10 giây với giá $1.00, và mỗi lần chỉnh sửa có giá tương đương vì đó là một bản render lại hoàn chỉnh (nó cũng trả về độ dài chính xác bằng video gốc — mô hình không thể kéo dài hay cắt ngắn). Nano Banana 2 Lite ra mắt cùng ngày có giá $0.03 mỗi ảnh tại đây (mức giá API của Google là $0.034 cho ảnh 1K). Bảng giá đầy đủ có tại mục bảng giá.

Mức giá 10 cent một giây có xứng đáng? Đối với một bản nháp có âm thanh mà nếu không bạn sẽ phải mất một lượt tạo video cộng với công đoạn làm tiếng riêng, thì câu trả lời là có — và lượt thử 3 giây rẻ hơn một clip Veo. Đối với cảnh quay b-roll không tiếng thì không. Veo 3.1 Fast tạo clip không tiếng rẻ hơn ở độ phân giải cao hơn.

Bạn nên dùng Omni Flash hay Veo 3.1?

Tóm tắt: chúng chia sẻ công việc, nhưng không theo ranh giới "bản nháp vs bản chính" như bạn nghĩ.

Một điều cần biết trước khi chọn: khoảng cách chất lượng giữa chúng không chỉ nằm ở độ phân giải. Veo 3.1 xử lý chuyển động và vật lý thuyết phục hơn nhiều. Nước chảy tự nhiên, vải gấp nếp đúng chỗ, các vật thể va chạm thay vì xuyên qua nhau như bóng ma. Omni Flash thường làm đúng, nhưng không liên tục, và ở một số clip bạn sẽ nhận ra ngay mà không cần soi kỹ.

Chọn Veo 3.1 khi bạn cần bản xuất 4K thực sự, độ dài clip chính xác (bạn đặt số giây nguyên từ 4 đến 8; không có số lẻ), đầu ra không tiếng, khả năng mở rộng sau này, hoặc kiểm soát cả khung hình đầu và khung hình cuối. Tính năng cuối cùng này rất đáng giá: cung cấp cùng một hình ảnh làm khung hình đầu và cuối, bạn sẽ nhận được một vòng lặp vô tận hoàn hảo, đây là bí quyết đằng sau các video nền lặp lại. Đây là công cụ sản xuất cho bất kỳ dự án màn hình rộng hoặc đòi hỏi tính vật lý cao.

Chọn Omni Flash khi điểm đến là màn hình điện thoại. Đối với TikTok, Shorts hoặc Reels, 720p thực sự là tất cả những gì nền tảng giữ lại sau khi nén, âm thanh được tích hợp sẵn trong cùng một lượt, và việc chỉnh sửa dạng hội thoại tốt hơn nhiều so với việc viết lại prompt từ đầu. Trong phân khúc đó, nó không phải công cụ phác thảo: nó đơn giản là lựa chọn tốt hơn.

Quy trình làm việc cá nhân của tôi sau hai ngày thử nghiệm: đối với công việc màn hình rộng cho khách hàng, tôi vẫn phác thảo ý tưởng trong Omni Flash — các đoạn 3 giây với giá $0.30 — sau đó làm lại đoạn ưng ý bằng Veo ở chất lượng cuối cùng. Đối với clip dọc đăng trực tiếp lên mạng xã hội, bản quay từ Omni thường được xuất bản ngay lập tức.

Hai drone quay phim kích thước khác nhau bay cạnh nhau trên thung lũng màu pastel, đại diện cho sự lựa chọn giữa Omni Flash và Veo 3.1

Cả hai mô hình đều có sẵn trên giao diện BananaBanana, vì vậy bạn có thể so sánh chúng trên cùng một prompt mà không cần viết dòng code nào hay thiết lập dự án Google Cloud. Và nếu bạn muốn bản tóm tắt của bài đánh giá này — tính năng, giới hạn và giá cả trên một trang — hãy truy cập trang Gemini Omni.

FAQ

gemini-omni-flash-preview là gì?

Đây là ID mô hình API của Gemini Omni Flash, mô hình tạo video dạng hội thoại của Google được phát hành dưới dạng preview công khai vào ngày 30 tháng 6 năm 2026. Nó tạo và chỉnh sửa các clip 720p dài 3–10 giây kèm âm thanh thông qua Interactions API.

Gemini Omni Flash có thể tạo video 1080p hoặc 4K không?

Không. API chỉ xuất ra độ phân giải 720p ở tốc độ 24 fps. Google Flow cũng render ở 720p theo mặc định; các phiên bản 1080p và 4K chỉ được cung cấp ở bước tải xuống cho bản render Veo. Nếu bạn cần bản xuất độ phân giải cao thực sự, hãy dùng Veo 3.1.

Tôi có thể đặt thời lượng video trong Omni Flash API không?

Có, mặc dù bạn sẽ không thấy nó trong tài liệu. Định dạng phản hồi chấp nhận thời lượng và kết quả khớp chính xác theo khung hình: yêu cầu 3 giây, nhận 3.008 giây, tính phí 3 giây. Chúng tôi cung cấp thanh chọn 3–10 giây trong công cụ tạo. Ngoại lệ là chỉnh sửa — một clip được chỉnh sửa luôn thừa hưởng độ dài của video gốc.

Omni Flash có luôn tạo âm thanh không?

Có, mỗi clip đều bao gồm âm thanh được tạo tự động và không có cờ nào để tắt nó. Hãy mô tả âm thanh bạn muốn (hoặc yêu cầu "quiet ambient room tone") trực tiếp trong prompt.

Omni Flash có thể mở rộng hoặc nội suy các video hiện có không?

Nó không thể làm chúng dài hơn: mở rộng (extension) và nội suy (interpolation) không được hỗ trợ, và tác vụ extend trong schema trả về câu trả lời "this model does not support video extension." Chỉnh sửa là tính năng thay thế — thực hiện dạng hội thoại trên clip do nó tạo ra, hoặc video-sang-video trên bất kỳ video hoàn chỉnh nào bạn cung cấp, bao gồm bản render từ Veo hoặc video bạn tự quay. Đầu ra sẽ giữ nguyên độ dài của đầu vào.

newsvideoomni-flashapi