Một góc sản phẩm tử tế
Một tấm chụp thẳng, sáng đều hơn hẳn năm tấm chụp vội. Lóa sáng, nhòe rung và bàn tay che nửa nhãn đều bị mô hình dựng lại bằng tưởng tượng.
Trường hợp sử dụng · Video UGC bằng AI
Quảng cáo UGC là cảnh ai đó nói vào camera điện thoại với sản phẩm của bạn trên tay. Ở đây nó không được quay mà được tạo ra: bạn đưa vào một ảnh sản phẩm và một ảnh người, mô hình dựng khung hình mở đầu rồi làm nó chuyển động cùng giọng nói và tiếng phòng trong cùng một lượt. Một clip tốn $0.30–$1.00 trên Gemini Omni Flash và tối đa $3.00 trên Veo 3.1 có tiếng, khung hình tốn $0.11, và không có khoản thuê bao nào.
Video UGC bằng AI là một quảng cáo ngắn theo định dạng nội dung người dùng — một người nói vào camera điện thoại, cầm sản phẩm, trong bếp hay phòng khách thay vì trường quay — nhưng được tạo bởi mô hình video chứ không phải quay cùng creator. Quy trình gồm ba lệnh gọi: ảnh tham chiếu của sản phẩm và của người, một khung hình tĩnh chốt lại ai xuất hiện và cầm gì, rồi mô hình video làm khung hình đó chuyển động kèm lời thoại khớp miệng. Ở đây có hai mô hình. Gemini Omni Flash là bản rẻ hơn và mới hơn: model card của Google xếp mô phỏng vật lý đời thực vào nhóm khả năng, còn chuyển động phức tạp vào nhóm điểm yếu còn lại — đúng như tôi thấy: thao tác thông thường phần lớn trót lọt, thao tác cầu kỳ thì hên xui. Veo 3.1 là thứ bạn lấy ra khi cả cảnh phụ thuộc vào việc một vật thể phải hành xử đúng. Một clip là $0.30–$1.00 trên Omni Flash, $1.00 trên Veo 3.1 Fast và $3.00 trên Veo 3.1 đầy đủ cho tám giây có tiếng, lên tới $4.40 ở 4K. Và nó render trong vài phút thay vì hai đến bốn tuần mà một bản brief cho creator thường ngốn mất.
Hóa đơn của clip ở trên, không làm tròn: $0.11 cho ảnh tham chiếu sản phẩm, $0.11 cho người, $0.11 cho khung hình mở đầu ghép cả hai, và $0.80 cho tám giây Omni Flash — tổng cộng $1.13. Bản dọc sáu giây ở phía dưới tốn $0.60. Thu lại giọng riêng có giá $0.01 cho mỗi 200 ký tự kịch bản, khoảng một xu một câu. Tài khoản mới được tặng $0.20, đủ cho một ảnh tham chiếu và một khung hình mở đầu — đủ để xem nhân vật có ăn hình không trước khi trả tiền cho video.
Đó là con số của lần take đầu, mà lần take đầu thì không phải là kế hoạch. Có clip ra ngay lần đầu; rất nhiều clip cần hai ba lần, vì câu thoại nhạt, bàn tay làm điều gì đó kỳ quặc, hoặc mô hình từ chối bộ trang phục. Rồi còn điều nữa chẳng ai đưa vào bảng giá: một quảng cáo hiếm khi chỉ là một clip. Spot 20–30 giây thường là ba bốn take ghép lại — câu mở, sản phẩm trên tay, cận cảnh, câu chốt — nên hóa đơn thực tế cho một quảng cáo hoàn chỉnh là vài đô la, không phải vài xu, và nó tăng nhanh nếu những cảnh nhiều chuyển động được quay trên Veo 3.1 đầy đủ với $3.00 mỗi clip. Phần ghép nối thì miễn phí: ffmpeg cắt, nối và chồng âm thanh lên video ngay từ dòng lệnh, không cần phần mềm dựng phim.
Một ảnh sản phẩm sạch sẽ và một ảnh của người. Bất cứ thứ gì mờ, bị cắt cụt hay sai sáng ở đầu vào đều quay lại trong video với mức độ nhân lên.
Tạo một ảnh tĩnh chứa cả hai tham chiếu — người cầm sản phẩm, bố cục đúng như cách quảng cáo mở màn. $0.11 với Nano Banana Pro, và bạn có thể làm lại đến khi ưng.
Gửi ảnh tĩnh làm khung hình đầu tiên và mô tả chuyển động cùng câu thoại. Omni Flash tính $0.10 mỗi giây 720p kèm tiếng; Veo 3.1 đắt hơn và là lựa chọn nên thử khi một take phải gánh vài hành động liên tiếp.



Đây là bước người ta hay bỏ qua, và cũng là bước quyết định kết quả. Mô hình nhận một tấm ảnh điện thoại mờ chụp lọ ở góc ba phần tư sẽ không báo lỗi ầm ĩ — nó lặng lẽ bịa ra mặt mà nó không thấy, và chính mặt bịa đó nằm tám giây trên màn hình. Hãy đưa một ảnh chụp thẳng, sáng đều, nhãn quay về phía ống kính, và cũng chính lọ đó sẽ sống sót qua bước dựng khung, bước video và cả bước dựng phim sau đó.
Với con người cũng vậy. Tài liệu Veo của Google nói thẳng: chọn ảnh sắc nét, đủ sáng, cho thấy chủ thể ở đúng góc bạn muốn, và giữ nguyên cách mô tả ống kính cùng ánh sáng giữa các cảnh. Kinh nghiệm của tôi sau vài chục clip kiểu này: nếu ảnh chân dung tham chiếu và cảnh dự định bất đồng về hướng ánh sáng, khuôn mặt sẽ trôi về đâu đó ở giữa và không còn giống cùng một người nữa.
Một tấm chụp thẳng, sáng đều hơn hẳn năm tấm chụp vội. Lóa sáng, nhòe rung và bàn tay che nửa nhãn đều bị mô hình dựng lại bằng tưởng tượng.
Giữ nguyên kiểu tóc, trang phục và lớp trang điểm trên mọi ảnh tham chiếu. Vẻ ngoài trộn lẫn sẽ bị trung bình hóa thành một gương mặt chẳng giống ai.
Ảnh chân dung đánh đèn flash ghép vào căn bếp ánh sáng dịu sẽ lộ như ảnh cắt ghép. Hãy chọn trong tham chiếu đúng thứ ánh sáng mà quảng cáo sẽ có.
Nano Banana Pro giữ được chữ ngắn trên nhãn; một danh sách thành phần dày đặc sẽ biến thành vân nhiễu. Nếu kiểu chữ quan trọng, hãy tính một cảnh cận với bao bì thật.
Ảnh tham chiếu không cần được bố cục như một quảng cáo. Bố cục là việc của khung hình mở đầu — đó mới là chỗ bạn tranh luận với mô hình.
Một mẩu ảnh 300 pixel lấy từ trang bán hàng gần như chẳng để lại gì cho mô hình. Luôn dùng ảnh gốc ở độ phân giải đầy đủ.
Cả hai đường đều chạy được: bạn có thể đưa ảnh tham chiếu cho mô hình video và để nó tự dựng cảnh, hoặc tạo một ảnh tĩnh trước rồi làm ảnh đó chuyển động. Trong thực tế cách thứ hai tốt hơn, và lý do rất tầm thường — mô hình bị bắt tự nghĩ bố cục sẽ nghĩ lại ở từng khung hình, còn mô hình được đưa sẵn một ảnh thì chỉ phải viết tiếp. Trên Gemini Omni Flash, khoảng cách đủ lớn để tôi bỏ hẳn cách chỉ dùng tham chiếu cho các cảnh có sản phẩm.
Hai clip bên dưới: cùng prompt, cùng tham chiếu, mỗi clip sáu giây, $0.60 một clip. Khác biệt duy nhất là có đưa vào một khung hình đã duyệt hay không. Không đổi gì thêm và không clip nào được tạo lại.
Chỉ ảnh tham chiếu
Từ khung hình đầu đã duyệt
Bản trung thực: cách chỉ dùng ảnh tham chiếu không hề hỏng — gương mặt giữ tốt, và với cảnh không cầm sản phẩm thì thường là đủ. Thậm chí ánh sáng ở bản đó còn đẹp hơn: mềm hơn trên khuôn mặt, ít tương phản cửa sổ hơn, vì mô hình tự dựng căn phòng nó thích thay vì tiếp nối căn phòng của chúng ta. Một lưu ý đáng nói vì nó đổi cách đọc kết quả: nhân vật của chúng tôi là người được tạo ra, không phải ảnh chụp người thật, nên mô hình có chỗ để đánh sáng lại cho cô ấy. Một bức chân dung thật sẽ ghim ánh sáng và làn da chặt hơn nhiều, và hướng chỉ-dùng-tham-chiếu ít tự do tô vẽ hơn. Thứ bạn mua ở đây là quyền kiểm soát, không phải chất lượng. Trên Veo 3.1 thì lựa chọn đã được quyết hộ: API của Google nhận hoặc một khung hình đầu, hoặc tối đa ba ảnh tham chiếu, không bao giờ cả hai trong cùng một yêu cầu, và ảnh tham chiếu bắt buộc độ dài tám giây.
Omni Flash rất giỏi đúng cái định dạng mà UGC đang sống: một người nói vào ống kính. Phỏng vấn, kiểu podcast, founder giải thích sản phẩm, ai đó cầm một hũ kem và kể về nó. Nó dựng khẩu hình, vi chuyển động và tiếng phòng trong một lượt, và đó là cách rẻ nhất để lấy giọng nói khớp miệng từ một mô hình video. Đây cũng là mô hình mới hơn trong hai cái, và Google bán nó chính bằng vật lý: bản công bố nói về khả năng cảm nhận trực giác với trọng lực, động năng và động lực học chất lỏng, còn model card liệt kê mô phỏng vật lý đời thực như một năng lực, đồng thời gọi chuyển động phức tạp là điểm yếu đã biết. Cả hai nửa đều đúng trong thực tế. Đồ vật rơi, chất lỏng chảy, trọng lượng đọc ra hợp lý — cho tới khi cảnh quay đòi hỏi một chuỗi thao tác chính xác với một vật thể.
Vậy nên ranh giới không phải là «người nói chuyện» so với «chuyển động», mà là một take phải gánh bao nhiêu biên đạo. Bài thử dưới đây nằm ở đầu khó của thang đó, không phải phán quyết về mô hình nào: cùng khung hình mở đầu, cùng prompt, mỗi mô hình một clip — mở nắp lọ, bóp ống nhỏ giọt, hai giọt vào lòng bàn tay đang mở, tất cả trong tám giây.
Gemini Omni Flash · 8 giây · $0.80
Veo 3.1 Fast · 8 giây có tiếng · $1.00
Khẩu hình, tiếng phòng và lời nói đến cùng nhau, $0.10 mỗi giây. Với một bài review, một lời chứng thực hay đoạn đối thoại hai người, đây là lựa chọn hiển nhiên.
Một chuyển động thì Omni kham được; bốn cái liên tiếp là lúc các take bắt đầu đánh rơi hành động. Phần so sánh của chúng tôi dùng Veo 3.1 Fast với $1.00 cho tám giây có tiếng, còn Veo 3.1 đầy đủ là $3.00 — tạo trên cả hai rồi giữ bản nào chạy được.
Bộ lọc an toàn của Omni khắt khe hơn hẳn về quần áo: một creator mảng fitness mặc áo bra thể thao bị từ chối ở đó nhiều hơn hẳn so với Veo 3.1, cùng prompt, cùng tham chiếu. Hoặc tính trước trang phục, hoặc tính trước mô hình.
Omni Flash là 720p và 3–10 giây, đúng bằng số giây bạn trả tiền. Veo 3.1 cho 4, 6 hoặc 8 giây, lên tới 4K, và clip của nó có thể kéo dài quá bản cắt đầu tiên.
Mọi clip Omni đều có tiếng, dù bạn có xin hay không. Trên Veo, âm thanh là một công tắc, và bản render câm rẻ hơn — điều đó đáng kể khi giọng nói dù sao cũng sẽ đến từ chỗ khác.
Một lượt tạo bị chặn sẽ được hoàn tiền tự động trên cả hai mô hình. Cái đắt của một lần từ chối là bốn phút, không phải một đô la.
Omni Flash viết lời thoại trong cùng lượt với hình ảnh, và với tiếng Anh đời thường thì thường ổn. Nó vấp ở tên riêng: tên sản phẩm bịa ra, từ nước ngoài, mã model — bất cứ thứ gì mà người bản ngữ cũng phải được chỉ cách đọc. Nhưng phiên bản lớn hơn của vấn đề này là các ngôn ngữ ngoài tiếng Anh, và mô hình video nào cũng dính: những người nói tiếng Nga thử Seedance 2.5 mô tả một câu thoại mở đầu nghe được rồi rã dần trên đường đi — nguyên âm không trọng âm bị giảm sai, trọng âm rơi nhầm âm tiết, và đến cuối một cảnh mười lăm giây thì chất giọng gần với một thứ lai Slav hơn là tiếng Nga, bởi tiếng Nga, Ukraina và Belarus đủ gần để mô hình trộn lẫn chúng. Vài từ ra sạch sẽ, từ kế tiếp làm lộ cả take. Nếu kịch bản của bạn không phải tiếng Anh, hãy nghe hết trước khi duyệt.
Cách chữa là thôi đòi giọng nói ở mô hình video và tạo nó riêng. Gemini 3.1 Flash TTS (gemini-3.1-flash-tts-preview) chạy trên cùng số dư qua máy chủ MCP của chúng tôi: $0.01 cho mỗi 200 ký tự kịch bản, 30 giọng, một người đọc hoặc hội thoại hai người, đầu ra WAV 24 kHz. Chỉ đạo viết bằng ngôn ngữ thường — tính cách, nhịp, chất giọng vùng miền, và cách ghi phiên âm cho bất cứ từ nào cần đọc cho đúng. Sau đó đặt track lên clip trong bất kỳ phần mềm dựng nào. Hãy giữ câu viết lại dài xấp xỉ take gốc thì khẩu hình vẫn khớp tàm tạm; chỗ nào không khớp thì cắt sang sản phẩm.
Giọng đọc do AI tạo · $0.01
Ghép quảng cáo lại cũng chẳng cần phần mềm dựng. ffmpeg nối các take, cắt đúng nửa giây bàn tay làm điều kỳ quặc, thay âm thanh do mô hình tạo bằng bản TTS của bạn, chèn crossfade và xuất bản 9:16 — tất cả từ một dòng lệnh, miễn phí, trên bất kỳ máy nào. Cú pháp của nó nổi tiếng khó ưa, và chính vì thế nó hợp với một mô hình: mô tả bản dựng bạn muốn cho Claude hay bất kỳ LLM nào, nhận lại câu lệnh, chạy. Với một spot UGC ba clip, đó là toàn bộ khâu hậu kỳ — và cũng là lý do các con số trên trang này dừng ở chi phí tạo sinh, không cộng thêm thuê bao nào.
| Mô hình | Giá | Đơn vị | Âm thanh |
|---|---|---|---|
| Nano Banana Protham chiếu & khung hình đầu | $0.11 | ảnh 1K–2K | — |
| Nano Banana 2bản nháp và biến thể | $0.03–$0.13 | ảnh 512px–4K | — |
| Gemini Omni Flash$0.10 mỗi giây | $0.30–$1.00 | 3–10 giây, 720p | luôn bật |
| Veo 3.1 Fastcó tiếng | $0.50–$1.00 | 4–8 giây, 720p/1080p | tùy chọn |
| Veo 3.1 Litevideo rẻ nhất | $0.10–$0.36 | 4–8 giây, 720p | tùy chọn |
| Gemini 3.1 Flash TTSchỉ qua MCP | $0.01 | mỗi 200 ký tự | chỉ giọng nói |
Giá Veo áp dụng cho 720p và 1080p; 4K đắt hơn. Omni Flash tính $0.10 cho mỗi giây đầu ra, nên độ dài clip chính là mức giá. Bảng đầy đủ nằm ở trang giá.
Mọi mô hình và độ phân giải đều được liệt kê ở trang giá đầy đủ, còn trang Gemini Omni Flash nói rõ mô hình đó làm được gì và không làm được gì.
Cách hoạt động của việc làm chuyển động từ khung hình đầu, viết gì trong prompt chuyển động, và nó vỡ ở đâu.
Đọc hướng dẫnLàm sao để sản phẩm sống sót từ ảnh tham chiếu tới khung hình hoàn chỉnh, kèm prompt thật.
Đọc hướng dẫnThực chiến với API bản preview: nó hỗ trợ gì, từ chối gì, và mỗi clip thực sự tốn bao nhiêu.
Đọc hướng dẫnKhông. Chính creator cũng có thể được tạo ra — tất cả những người bạn thấy trên trang này đều sinh ra từ một prompt và chưa từng tồn tại. Nếu bạn dùng gương mặt của người thật, bạn cần sự cho phép của họ: quy định về hình ảnh cá nhân áp dụng cho video do AI tạo y như với một buổi quay, và chính sách của các nền tảng về bản sao tổng hợp còn chặt hơn nhiều người tưởng.
Có, miễn là bạn giữ nguyên ảnh tham chiếu và dùng lại đúng khung hình mở đầu. Tạo lại khung hình từ cùng bộ tham chiếu sẽ rất gần nhưng không giống từng pixel — thói quen an toàn nhất là lưu mọi khung hình mở đầu đã duyệt rồi làm nó chuyển động lại, thay vì dựng lại từ đầu.
Trên TikTok thì có: chính sách quảng cáo về nội dung chỉnh sửa và nội dung do AI tạo yêu cầu hoặc nhãn AIGC trong Ads Manager, hoặc dòng ghi chú hiển thị do chính bạn đặt lên nội dung. Meta tự động gắn nhãn AI của họ lên những quảng cáo bị nhận diện là do AI tạo. Cả hai chính sách đều thay đổi trong năm 2026, nên hãy kiểm tra bản hiện hành trước một chiến dịch lớn thay vì tin một bài blog — kể cả bài này.
Hãy bắt đầu với Gemini Omni Flash, $0.10 mỗi giây đã gồm tiếng: với cảnh một người nói vào camera, nó vừa rẻ nhất vừa ít khó tính nhất, lại là mô hình mới hơn với phần vật lý được Google quảng bá hẳn hoi. Đừng đọc thành «Omni không làm được chuyển động»: nó rót, nó thả rơi, nó truyền được trọng lượng. Thứ nó đánh rơi là những chuỗi thao tác chính xác kéo dài trong một take — ở bài thử ống nhỏ giọt bốn hành động của chúng tôi, nó làm mất cái lọ trong khi Veo 3.1 Fast giữ được. Vậy nên với câu mở hay lời chứng thực, chọn Omni. Với cảnh dựng trên biên đạo, hãy tạo trên cả hai và giữ bản chạy được; bản hỏng chỉ tốn vài xu.
Được, tối đa 10 giây. Tải clip của bạn lên và Omni Flash sẽ chỉnh nó theo kiểu video sang video — đổi ánh sáng, phông nền, thứ mà nhân vật đang cầm — trong khi vẫn giữ nguyên cú quay. Nguồn dài hơn sẽ bị cắt về giới hạn của mô hình trước khi tạo.
Số dư được hoàn tự động, trên cả Omni Flash lẫn Veo. Các lần từ chối tập trung quanh trang phục, trẻ vị thành niên và người thật có thể nhận ra; quy tắc trang phục ở phần chọn mô hình phía trên là thứ tiết kiệm nhiều lần làm lại nhất.
Được — cùng những mô hình đó được mở qua máy chủ MCP của chúng tôi, kể cả mô hình giọng nói vốn không hề có giao diện web. Ảnh tham chiếu và khung hình đầu có thể truyền dưới dạng job ID, URL công khai hoặc base64 nội tuyến, nên cả một loạt UGC có thể được script hóa từ một agent.
Hãy đếm take, đừng đếm clip. Spot 20–30 giây thường là ba đến bốn clip ghép lại, và mỗi clip tốn vài lần thử mới dùng được: câu thoại nhạt, bàn tay kỳ quặc, một lần bị từ chối. Với $0.80 cho tám giây Omni Flash, một quảng cáo hoàn chỉnh nằm ở mức vài đô la; quay những cảnh nhiều chuyển động trên Veo 3.1 đầy đủ với $3.00 mỗi clip sẽ đẩy nó lên hàng chục đô. Khâu dựng không thêm gì: ffmpeg nối các take, cắt gọn và chồng lời đọc lên trên ngay từ dòng lệnh, còn câu lệnh thì một LLM có thể viết hộ bạn.
Đăng ký miễn phí với $0.20 trong số dư, nạp bằng crypto từ $1. Khung hình đầu chừng một phút, clip đầu tiên năm phút.