Trường hợp sử dụng · Video UGC bằng AI

Quảng cáo UGC bằng AI từ hai tấm ảnh

Quảng cáo UGC là cảnh ai đó nói vào camera điện thoại với sản phẩm của bạn trên tay. Ở đây nó không được quay mà được tạo ra: bạn đưa vào một ảnh sản phẩm và một ảnh người, mô hình dựng khung hình mở đầu rồi làm nó chuyển động cùng giọng nói và tiếng phòng trong cùng một lượt. Một clip tốn $0.30–$1.00 trên Gemini Omni Flash và tối đa $3.00 trên Veo 3.1 có tiếng, khung hình tốn $0.11, và không có khoản thuê bao nào.

Làm riêng cho trang này, từ đầu đến cuối: hai ảnh tham chiếu → khung hình mở đầu bằng Nano Banana Pro → tám giây Gemini Omni Flash, lời thoại và tiếng phòng được tạo cùng hình ảnh. $1.13 cho đúng bản take bạn đang xem. Nhớ bật tiếng.
01Đây là gì

Video UGC bằng AI là gì?

Video UGC bằng AI là một quảng cáo ngắn theo định dạng nội dung người dùng — một người nói vào camera điện thoại, cầm sản phẩm, trong bếp hay phòng khách thay vì trường quay — nhưng được tạo bởi mô hình video chứ không phải quay cùng creator. Quy trình gồm ba lệnh gọi: ảnh tham chiếu của sản phẩm và của người, một khung hình tĩnh chốt lại ai xuất hiện và cầm gì, rồi mô hình video làm khung hình đó chuyển động kèm lời thoại khớp miệng. Ở đây có hai mô hình. Gemini Omni Flash là bản rẻ hơn và mới hơn: model card của Google xếp mô phỏng vật lý đời thực vào nhóm khả năng, còn chuyển động phức tạp vào nhóm điểm yếu còn lại — đúng như tôi thấy: thao tác thông thường phần lớn trót lọt, thao tác cầu kỳ thì hên xui. Veo 3.1 là thứ bạn lấy ra khi cả cảnh phụ thuộc vào việc một vật thể phải hành xử đúng. Một clip là $0.30–$1.00 trên Omni Flash, $1.00 trên Veo 3.1 Fast và $3.00 trên Veo 3.1 đầy đủ cho tám giây có tiếng, lên tới $4.40 ở 4K. Và nó render trong vài phút thay vì hai đến bốn tuần mà một bản brief cho creator thường ngốn mất.

Một clip thực sự tốn bao nhiêu?

Hóa đơn của clip ở trên, không làm tròn: $0.11 cho ảnh tham chiếu sản phẩm, $0.11 cho người, $0.11 cho khung hình mở đầu ghép cả hai, và $0.80 cho tám giây Omni Flash — tổng cộng $1.13. Bản dọc sáu giây ở phía dưới tốn $0.60. Thu lại giọng riêng có giá $0.01 cho mỗi 200 ký tự kịch bản, khoảng một xu một câu. Tài khoản mới được tặng $0.20, đủ cho một ảnh tham chiếu và một khung hình mở đầu — đủ để xem nhân vật có ăn hình không trước khi trả tiền cho video.

Đó là con số của lần take đầu, mà lần take đầu thì không phải là kế hoạch. Có clip ra ngay lần đầu; rất nhiều clip cần hai ba lần, vì câu thoại nhạt, bàn tay làm điều gì đó kỳ quặc, hoặc mô hình từ chối bộ trang phục. Rồi còn điều nữa chẳng ai đưa vào bảng giá: một quảng cáo hiếm khi chỉ là một clip. Spot 20–30 giây thường là ba bốn take ghép lại — câu mở, sản phẩm trên tay, cận cảnh, câu chốt — nên hóa đơn thực tế cho một quảng cáo hoàn chỉnh là vài đô la, không phải vài xu, và nó tăng nhanh nếu những cảnh nhiều chuyển động được quay trên Veo 3.1 đầy đủ với $3.00 mỗi clip. Phần ghép nối thì miễn phí: ffmpeg cắt, nối và chồng âm thanh lên video ngay từ dòng lệnh, không cần phần mềm dựng phim.

02Quy trình

Hai tấm ảnh vào, một quảng cáo ra

  1. Mang ảnh tham chiếu thật

    Một ảnh sản phẩm sạch sẽ và một ảnh của người. Bất cứ thứ gì mờ, bị cắt cụt hay sai sáng ở đầu vào đều quay lại trong video với mức độ nhân lên.

  2. Dựng khung hình mở đầu

    Tạo một ảnh tĩnh chứa cả hai tham chiếu — người cầm sản phẩm, bố cục đúng như cách quảng cáo mở màn. $0.11 với Nano Banana Pro, và bạn có thể làm lại đến khi ưng.

  3. Làm khung hình đó chuyển động

    Gửi ảnh tĩnh làm khung hình đầu tiên và mô tả chuyển động cùng câu thoại. Omni Flash tính $0.10 mỗi giây 720p kèm tiếng; Veo 3.1 đắt hơn và là lựa chọn nên thử khi một take phải gánh vài hành động liên tiếp.

Ảnh tham chiếu sản phẩm do AI tạo: lọ nhỏ giọt thủy tinh hổ phách không nhãn hiệu với nắp gốm màu kem đặt trên vải lanh sáng
Tham chiếu 1 — sản phẩm, một góc sạch, ánh sáng đều. Nano Banana Pro, $0.11.
Ảnh chân dung tham chiếu do AI tạo: một phụ nữ mặc áo len dệt kim màu kem ngồi trong phòng khách sáng sủa
Tham chiếu 2 — con người. Cùng ánh sáng và cùng trang phục mà bạn muốn có trong quảng cáo.
Khung hình UGC mở đầu do AI tạo: người phụ nữ trong ảnh chân dung tham chiếu cầm lọ hổ phách bên vai, bố cục kiểu quay bằng điện thoại
Khung hình mở đầu, được tạo từ cả hai tham chiếu cùng lúc — chính ảnh này là thứ mô hình video viết tiếp.
03Tham chiếu

Mọi thứ phía sau chỉ tốt ngang thứ bạn đưa vào

Đây là bước người ta hay bỏ qua, và cũng là bước quyết định kết quả. Mô hình nhận một tấm ảnh điện thoại mờ chụp lọ ở góc ba phần tư sẽ không báo lỗi ầm ĩ — nó lặng lẽ bịa ra mặt mà nó không thấy, và chính mặt bịa đó nằm tám giây trên màn hình. Hãy đưa một ảnh chụp thẳng, sáng đều, nhãn quay về phía ống kính, và cũng chính lọ đó sẽ sống sót qua bước dựng khung, bước video và cả bước dựng phim sau đó.

Với con người cũng vậy. Tài liệu Veo của Google nói thẳng: chọn ảnh sắc nét, đủ sáng, cho thấy chủ thể ở đúng góc bạn muốn, và giữ nguyên cách mô tả ống kính cùng ánh sáng giữa các cảnh. Kinh nghiệm của tôi sau vài chục clip kiểu này: nếu ảnh chân dung tham chiếu và cảnh dự định bất đồng về hướng ánh sáng, khuôn mặt sẽ trôi về đâu đó ở giữa và không còn giống cùng một người nữa.

Một góc sản phẩm tử tế

Một tấm chụp thẳng, sáng đều hơn hẳn năm tấm chụp vội. Lóa sáng, nhòe rung và bàn tay che nửa nhãn đều bị mô hình dựng lại bằng tưởng tượng.

Cùng một người, cùng một vẻ ngoài

Giữ nguyên kiểu tóc, trang phục và lớp trang điểm trên mọi ảnh tham chiếu. Vẻ ngoài trộn lẫn sẽ bị trung bình hóa thành một gương mặt chẳng giống ai.

Khớp ánh sáng

Ảnh chân dung đánh đèn flash ghép vào căn bếp ánh sáng dịu sẽ lộ như ảnh cắt ghép. Hãy chọn trong tham chiếu đúng thứ ánh sáng mà quảng cáo sẽ có.

Coi chừng chữ nhỏ

Nano Banana Pro giữ được chữ ngắn trên nhãn; một danh sách thành phần dày đặc sẽ biến thành vân nhiễu. Nếu kiểu chữ quan trọng, hãy tính một cảnh cận với bao bì thật.

Bố cục để sau

Ảnh tham chiếu không cần được bố cục như một quảng cáo. Bố cục là việc của khung hình mở đầu — đó mới là chỗ bạn tranh luận với mô hình.

Đừng đưa ảnh cắt vụn

Một mẩu ảnh 300 pixel lấy từ trang bán hàng gần như chẳng để lại gì cho mô hình. Luôn dùng ảnh gốc ở độ phân giải đầy đủ.

04Khung hình đầu

Vì sao khung hình mở đầu thắng ảnh tham chiếu trần

Cả hai đường đều chạy được: bạn có thể đưa ảnh tham chiếu cho mô hình video và để nó tự dựng cảnh, hoặc tạo một ảnh tĩnh trước rồi làm ảnh đó chuyển động. Trong thực tế cách thứ hai tốt hơn, và lý do rất tầm thường — mô hình bị bắt tự nghĩ bố cục sẽ nghĩ lại ở từng khung hình, còn mô hình được đưa sẵn một ảnh thì chỉ phải viết tiếp. Trên Gemini Omni Flash, khoảng cách đủ lớn để tôi bỏ hẳn cách chỉ dùng tham chiếu cho các cảnh có sản phẩm.

Hai clip bên dưới: cùng prompt, cùng tham chiếu, mỗi clip sáu giây, $0.60 một clip. Khác biệt duy nhất là có đưa vào một khung hình đã duyệt hay không. Không đổi gì thêm và không clip nào được tạo lại.

Chỉ ảnh tham chiếu

Không có khung hình mở đầu. Nắp màu kem biến mất ngay giây đầu tiên, lọ đổi thành một lọ sẫm màu khác, và đến cuối thì trôi hẳn ra ngoài khung. Gương mặt vẫn ổn — ánh sáng trên đó thậm chí có thể coi là đẹp hơn bản bên cạnh. Thứ vỡ ra chính là sản phẩm.

Từ khung hình đầu đã duyệt

Cùng prompt, nhưng khởi đi từ một ảnh mà chúng tôi đã xem trước. Nắp, thủy tinh, bố cục và khoảng cách tới máy quay giữ nguyên suốt sáu giây, vì mô hình chỉ phải viết tiếp một khung hình thay vì đoán ra nó.

Bản trung thực: cách chỉ dùng ảnh tham chiếu không hề hỏng — gương mặt giữ tốt, và với cảnh không cầm sản phẩm thì thường là đủ. Thậm chí ánh sáng ở bản đó còn đẹp hơn: mềm hơn trên khuôn mặt, ít tương phản cửa sổ hơn, vì mô hình tự dựng căn phòng nó thích thay vì tiếp nối căn phòng của chúng ta. Một lưu ý đáng nói vì nó đổi cách đọc kết quả: nhân vật của chúng tôi là người được tạo ra, không phải ảnh chụp người thật, nên mô hình có chỗ để đánh sáng lại cho cô ấy. Một bức chân dung thật sẽ ghim ánh sáng và làn da chặt hơn nhiều, và hướng chỉ-dùng-tham-chiếu ít tự do tô vẽ hơn. Thứ bạn mua ở đây là quyền kiểm soát, không phải chất lượng. Trên Veo 3.1 thì lựa chọn đã được quyết hộ: API của Google nhận hoặc một khung hình đầu, hoặc tối đa ba ảnh tham chiếu, không bao giờ cả hai trong cùng một yêu cầu, và ảnh tham chiếu bắt buộc độ dài tám giây.

05Chọn mô hình

Chọn cảnh hợp với mô hình

Omni Flash rất giỏi đúng cái định dạng mà UGC đang sống: một người nói vào ống kính. Phỏng vấn, kiểu podcast, founder giải thích sản phẩm, ai đó cầm một hũ kem và kể về nó. Nó dựng khẩu hình, vi chuyển động và tiếng phòng trong một lượt, và đó là cách rẻ nhất để lấy giọng nói khớp miệng từ một mô hình video. Đây cũng là mô hình mới hơn trong hai cái, và Google bán nó chính bằng vật lý: bản công bố nói về khả năng cảm nhận trực giác với trọng lực, động năng và động lực học chất lỏng, còn model card liệt kê mô phỏng vật lý đời thực như một năng lực, đồng thời gọi chuyển động phức tạp là điểm yếu đã biết. Cả hai nửa đều đúng trong thực tế. Đồ vật rơi, chất lỏng chảy, trọng lượng đọc ra hợp lý — cho tới khi cảnh quay đòi hỏi một chuỗi thao tác chính xác với một vật thể.

Vậy nên ranh giới không phải là «người nói chuyện» so với «chuyển động», mà là một take phải gánh bao nhiêu biên đạo. Bài thử dưới đây nằm ở đầu khó của thang đó, không phải phán quyết về mô hình nào: cùng khung hình mở đầu, cùng prompt, mỗi mô hình một clip — mở nắp lọ, bóp ống nhỏ giọt, hai giọt vào lòng bàn tay đang mở, tất cả trong tám giây.

Gemini Omni Flash · 8 giây · $0.80

Động tác mở nắp thuyết phục, ống nhỏ giọt rút ra gọn gàng, và những giọt serum thật sự rơi xuống lòng bàn tay — phần chất lỏng ổn. Phần vật thể thì không: cái lọ biến mất khỏi bàn tay dưới đúng lúc lòng bàn tay mở ra, quay lại để được đậy nắp, rồi clip kết thúc với hai bàn tay trống không. Một trong bốn hành động đã rơi mất.

Veo 3.1 Fast · 8 giây có tiếng · $1.00

Cùng prompt, cùng khung hình đầu — và lưu ý đây là Veo 3.1 Fast, bậc rẻ chứ không phải mô hình đầy đủ. Nó giữ được cái lọ suốt cả bốn hành động. Có nửa giây một bàn tay thứ ba hiện mờ xuyên qua khung, nên bản này cũng không sạch artefact; nó chỉ giữ được cả chuỗi hành động.

Nói vào máy quay → Omni Flash

Khẩu hình, tiếng phòng và lời nói đến cùng nhau, $0.10 mỗi giây. Với một bài review, một lời chứng thực hay đoạn đối thoại hai người, đây là lựa chọn hiển nhiên.

Chuỗi hành động dài → thử cả Veo

Một chuyển động thì Omni kham được; bốn cái liên tiếp là lúc các take bắt đầu đánh rơi hành động. Phần so sánh của chúng tôi dùng Veo 3.1 Fast với $1.00 cho tám giây có tiếng, còn Veo 3.1 đầy đủ là $3.00 — tạo trên cả hai rồi giữ bản nào chạy được.

Trang phục đổi phán quyết

Bộ lọc an toàn của Omni khắt khe hơn hẳn về quần áo: một creator mảng fitness mặc áo bra thể thao bị từ chối ở đó nhiều hơn hẳn so với Veo 3.1, cùng prompt, cùng tham chiếu. Hoặc tính trước trang phục, hoặc tính trước mô hình.

Thời lượng và độ phân giải

Omni Flash là 720p và 3–10 giây, đúng bằng số giây bạn trả tiền. Veo 3.1 cho 4, 6 hoặc 8 giây, lên tới 4K, và clip của nó có thể kéo dài quá bản cắt đầu tiên.

Âm thanh: luôn có hay tùy chọn

Mọi clip Omni đều có tiếng, dù bạn có xin hay không. Trên Veo, âm thanh là một công tắc, và bản render câm rẻ hơn — điều đó đáng kể khi giọng nói dù sao cũng sẽ đến từ chỗ khác.

Bị từ chối không mất gì

Một lượt tạo bị chặn sẽ được hoàn tiền tự động trên cả hai mô hình. Cái đắt của một lần từ chối là bốn phút, không phải một đô la.

06Giọng nói & dựng

Khi giọng nói cần một cú take nữa

Omni Flash viết lời thoại trong cùng lượt với hình ảnh, và với tiếng Anh đời thường thì thường ổn. Nó vấp ở tên riêng: tên sản phẩm bịa ra, từ nước ngoài, mã model — bất cứ thứ gì mà người bản ngữ cũng phải được chỉ cách đọc. Nhưng phiên bản lớn hơn của vấn đề này là các ngôn ngữ ngoài tiếng Anh, và mô hình video nào cũng dính: những người nói tiếng Nga thử Seedance 2.5 mô tả một câu thoại mở đầu nghe được rồi rã dần trên đường đi — nguyên âm không trọng âm bị giảm sai, trọng âm rơi nhầm âm tiết, và đến cuối một cảnh mười lăm giây thì chất giọng gần với một thứ lai Slav hơn là tiếng Nga, bởi tiếng Nga, Ukraina và Belarus đủ gần để mô hình trộn lẫn chúng. Vài từ ra sạch sẽ, từ kế tiếp làm lộ cả take. Nếu kịch bản của bạn không phải tiếng Anh, hãy nghe hết trước khi duyệt.

Cách chữa là thôi đòi giọng nói ở mô hình video và tạo nó riêng. Gemini 3.1 Flash TTS (gemini-3.1-flash-tts-preview) chạy trên cùng số dư qua máy chủ MCP của chúng tôi: $0.01 cho mỗi 200 ký tự kịch bản, 30 giọng, một người đọc hoặc hội thoại hai người, đầu ra WAV 24 kHz. Chỉ đạo viết bằng ngôn ngữ thường — tính cách, nhịp, chất giọng vùng miền, và cách ghi phiên âm cho bất cứ từ nào cần đọc cho đúng. Sau đó đặt track lên clip trong bất kỳ phần mềm dựng nào. Hãy giữ câu viết lại dài xấp xỉ take gốc thì khẩu hình vẫn khớp tàm tạm; chỗ nào không khớp thì cắt sang sản phẩm.

Giọng đọc do AI tạo · $0.01

Một kịch bản 200 ký tự do Gemini 3.1 Flash TTS đọc với đúng một dòng chỉ đạo: phụ nữ trẻ thân thiện, quay review bằng điện thoại trong bếp, hơi nhanh, và đọc tên thương hiệu bịa theo kiểu Pháp. Mười ba giây âm thanh, một xu, không dính dáng gì tới mô hình video.

Ghép quảng cáo lại cũng chẳng cần phần mềm dựng. ffmpeg nối các take, cắt đúng nửa giây bàn tay làm điều kỳ quặc, thay âm thanh do mô hình tạo bằng bản TTS của bạn, chèn crossfade và xuất bản 9:16 — tất cả từ một dòng lệnh, miễn phí, trên bất kỳ máy nào. Cú pháp của nó nổi tiếng khó ưa, và chính vì thế nó hợp với một mô hình: mô tả bản dựng bạn muốn cho Claude hay bất kỳ LLM nào, nhận lại câu lệnh, chạy. Với một spot UGC ba clip, đó là toàn bộ khâu hậu kỳ — và cũng là lý do các con số trên trang này dừng ở chi phí tạo sinh, không cộng thêm thuê bao nào.

07Giá

Ở đây một quảng cáo UGC bằng AI tốn bao nhiêu

Giá theo đơn vị của các mô hình dùng trong quy trình video UGC bằng AI
Mô hìnhGiáĐơn vịÂm thanh
Nano Banana Protham chiếu & khung hình đầu$0.11ảnh 1K–2K
Nano Banana 2bản nháp và biến thể$0.03–$0.13ảnh 512px–4K
Gemini Omni Flash$0.10 mỗi giây$0.30–$1.003–10 giây, 720pluôn bật
Veo 3.1 Fastcó tiếng$0.50–$1.004–8 giây, 720p/1080ptùy chọn
Veo 3.1 Litevideo rẻ nhất$0.10–$0.364–8 giây, 720ptùy chọn
Gemini 3.1 Flash TTSchỉ qua MCP$0.01mỗi 200 ký tựchỉ giọng nói

Giá Veo áp dụng cho 720p và 1080p; 4K đắt hơn. Omni Flash tính $0.10 cho mỗi giây đầu ra, nên độ dài clip chính là mức giá. Bảng đầy đủ nằm ở trang giá.

Nạp tiền bằng crypto, từ $1. Nạp từ $50 được cộng 5%, từ $100 được 10%, và một mã khuyến mãi đang kích hoạt cộng thêm 10% của chính khoản nạp đó — nên $100 kèm mã sẽ vào số dư thành $120. Với $1.13 cho một clip tám giây, đó là khoảng một trăm lần take — tức chừng hai mươi lăm đến ba mươi quảng cáo hoàn chỉnh nếu tính cả làm lại và ghép nhiều clip.

Mọi mô hình và độ phân giải đều được liệt kê ở trang giá đầy đủ, còn trang Gemini Omni Flash nói rõ mô hình đó làm được gì và không làm được gì.

08Tìm hiểu thêm

Hướng dẫn từ blog

09FAQ

Những câu hỏi người ta thật sự hỏi

Tôi có cần người thật để làm video UGC bằng AI không?

Không. Chính creator cũng có thể được tạo ra — tất cả những người bạn thấy trên trang này đều sinh ra từ một prompt và chưa từng tồn tại. Nếu bạn dùng gương mặt của người thật, bạn cần sự cho phép của họ: quy định về hình ảnh cá nhân áp dụng cho video do AI tạo y như với một buổi quay, và chính sách của các nền tảng về bản sao tổng hợp còn chặt hơn nhiều người tưởng.

Gương mặt đó có quay lại trong quảng cáo tiếp theo không?

Có, miễn là bạn giữ nguyên ảnh tham chiếu và dùng lại đúng khung hình mở đầu. Tạo lại khung hình từ cùng bộ tham chiếu sẽ rất gần nhưng không giống từng pixel — thói quen an toàn nhất là lưu mọi khung hình mở đầu đã duyệt rồi làm nó chuyển động lại, thay vì dựng lại từ đầu.

Tôi có phải công bố quảng cáo do AI tạo không?

Trên TikTok thì có: chính sách quảng cáo về nội dung chỉnh sửa và nội dung do AI tạo yêu cầu hoặc nhãn AIGC trong Ads Manager, hoặc dòng ghi chú hiển thị do chính bạn đặt lên nội dung. Meta tự động gắn nhãn AI của họ lên những quảng cáo bị nhận diện là do AI tạo. Cả hai chính sách đều thay đổi trong năm 2026, nên hãy kiểm tra bản hiện hành trước một chiến dịch lớn thay vì tin một bài blog — kể cả bài này.

Nên dùng mô hình nào cho quảng cáo UGC kiểu nói vào máy quay?

Hãy bắt đầu với Gemini Omni Flash, $0.10 mỗi giây đã gồm tiếng: với cảnh một người nói vào camera, nó vừa rẻ nhất vừa ít khó tính nhất, lại là mô hình mới hơn với phần vật lý được Google quảng bá hẳn hoi. Đừng đọc thành «Omni không làm được chuyển động»: nó rót, nó thả rơi, nó truyền được trọng lượng. Thứ nó đánh rơi là những chuỗi thao tác chính xác kéo dài trong một take — ở bài thử ống nhỏ giọt bốn hành động của chúng tôi, nó làm mất cái lọ trong khi Veo 3.1 Fast giữ được. Vậy nên với câu mở hay lời chứng thực, chọn Omni. Với cảnh dựng trên biên đạo, hãy tạo trên cả hai và giữ bản chạy được; bản hỏng chỉ tốn vài xu.

Tôi dùng được cảnh quay do chính mình quay không?

Được, tối đa 10 giây. Tải clip của bạn lên và Omni Flash sẽ chỉnh nó theo kiểu video sang video — đổi ánh sáng, phông nền, thứ mà nhân vật đang cầm — trong khi vẫn giữ nguyên cú quay. Nguồn dài hơn sẽ bị cắt về giới hạn của mô hình trước khi tạo.

Nếu một lượt tạo bị từ chối thì sao?

Số dư được hoàn tự động, trên cả Omni Flash lẫn Veo. Các lần từ chối tập trung quanh trang phục, trẻ vị thành niên và người thật có thể nhận ra; quy tắc trang phục ở phần chọn mô hình phía trên là thứ tiết kiệm nhiều lần làm lại nhất.

Tôi chạy quy trình này từ Claude, Cursor hay script của mình được không?

Được — cùng những mô hình đó được mở qua máy chủ MCP của chúng tôi, kể cả mô hình giọng nói vốn không hề có giao diện web. Ảnh tham chiếu và khung hình đầu có thể truyền dưới dạng job ID, URL công khai hoặc base64 nội tuyến, nên cả một loạt UGC có thể được script hóa từ một agent.

Cả quảng cáo 30 giây tốn bao nhiêu, chứ không phải một clip?

Hãy đếm take, đừng đếm clip. Spot 20–30 giây thường là ba đến bốn clip ghép lại, và mỗi clip tốn vài lần thử mới dùng được: câu thoại nhạt, bàn tay kỳ quặc, một lần bị từ chối. Với $0.80 cho tám giây Omni Flash, một quảng cáo hoàn chỉnh nằm ở mức vài đô la; quay những cảnh nhiều chuyển động trên Veo 3.1 đầy đủ với $3.00 mỗi clip sẽ đẩy nó lên hàng chục đô. Khâu dựng không thêm gì: ffmpeg nối các take, cắt gọn và chồng lời đọc lên trên ngay từ dòng lệnh, còn câu lệnh thì một LLM có thể viết hộ bạn.

Hai tấm ảnh và vài đô la

Đăng ký miễn phí với $0.20 trong số dư, nạp bằng crypto từ $1. Khung hình đầu chừng một phút, clip đầu tiên năm phút.