Quay lại blog
BananaBanana Teamtutorialvideoimage-to-video

AI Image to Video: Chuyển ảnh tĩnh thành video động

Cách chuyển ảnh thành video bằng AI, chọn Veo 3.1 hay Omni Flash, giá từ $0.10/clip, cách viết câu lệnh chuyển động, tạo vòng lặp và chuỗi video 148 giây.

AI Image to Video: Chuyển ảnh tĩnh thành video động

Chuyển ảnh thành video bằng AI là một kỹ thuật tạo nội dung, trong đó mô hình nhận một bức ảnh tĩnh, coi nó là khung hình đầu tiên của clip và tự "hình dung" ra mọi thứ diễn ra tiếp theo: chuyển động, góc máy, thay đổi ánh sáng và đôi khi là cả âm thanh. Bạn chỉ cần tải lên một bức ảnh và viết mô tả ngắn về những gì sẽ chuyển động. Mô hình sẽ trả về một video ngắn, thường từ 4 đến 10 giây, giúp bức ảnh gốc của bạn sống động hơn bao giờ hết.

Nói một cách ngắn gọn nếu bạn đang vội: hãy tải ảnh lên trình tạo BananaBanana, mô tả chuyển động và chờ khoảng 2–5 phút. Một clip không tiếng dài 4 giây tạo từ ảnh của bạn có giá từ $0.10 trên Veo 3.1 Lite, nếu thêm âm thanh sẽ là $0.18. Còn Gemini Omni Flash sẽ tạo chuyển động cho ảnh kèm nhạc nền từ $0.30 (tính $0.10 mỗi giây). Tài khoản mới sẽ được tặng ngay $0.20 miễn phí, đủ cho hai clip chạy thử không tiếng.

Hiện tại chúng tôi đang vận hành bốn mô hình video trong môi trường production, vì vậy hướng dẫn này được đúc kết từ chính lịch sử tạo video thực tế của người dùng chứ không phải từ những trang quảng cáo hoa mỹ. Bao gồm cả những ca thất bại nữa. Mà đôi khi, xem mấy ca thất bại đó lại học được nhiều điều hơn là những lần thành công mỹ mãn.

Tính năng chuyển ảnh thành video bằng AI hoạt động thế nào?

Về bản chất, bức ảnh tĩnh được đưa vào mô hình dưới dạng một khung hình điều kiện (conditioning frame). Tài liệu Gemini API video của Google mô tả Veo 3.1 hỗ trợ "image-based direction" (định hướng bằng hình ảnh) và "frame-specific generation" (tạo khung hình cụ thể). Nói một cách dễ hiểu, bức ảnh của bạn sẽ dẫn dắt toàn bộ clip và bạn có thể ghim chính xác các khung hình mong muốn. Mô hình sẽ phân tích bối cảnh, tự suy đoán tính vật lý của môi trường (nước trong ảnh sẽ gợn sóng thế nào, tóc sẽ bay trong gió ra sao) rồi dựng từng khung hình tiếp theo từ điểm xuất phát đó.

Hệ quả thực tế là: khung hình đầu tiên của video đầu ra chính là ảnh gốc của bạn, giống đến từng pixel. Mọi thứ sau đó đều là do AI tự biên tự diễn. Vì vậy, một câu lệnh (prompt) tốt nên tập trung mô tả những gì sẽ diễn ra, thay vì mô tả lại những chi tiết đã hiển thị rõ ràng trên bức ảnh.

Phương pháp này hiệu quả đến kinh ngạc đối với các bối cảnh chứa sẵn chuyển động tiềm năng. Một bức ảnh chân dung biết thở và nháy mắt. Làn khói bốc lên từ ly cà phê nóng. Một chiếc xe đang đỗ bắt đầu lăn bánh. Ngược lại, nó sẽ kém hiệu quả nếu bức ảnh gốc hoàn toàn không có yếu tố chuyển động thực tế nào: ví dụ, nếu bạn đưa vào một ảnh render sản phẩm trên nền trắng tinh và không ghi hướng dẫn chuyển động nào trong prompt, kết quả thường chỉ là một cú zoom chậm, hơi giật cục. Không hẳn là lỗi, chỉ là trông rất chán.

Một bức ảnh cổ điển được giữ bằng hai tay với cảnh vật bên trong bắt đầu gợn sóng và chuyển động, minh họa tính năng tạo video từ ảnh bằng AI

Mô hình nào chuyển ảnh thành video tốt nhất?

Cả bốn mô hình video trên nền tảng của chúng tôi đều hỗ trợ lấy ảnh làm khung hình đầu tiên. Điểm khác biệt nằm ở giới hạn công nghệ và mức chi phí bạn bỏ ra.

Veo 3.1Veo 3.1 FastVeo 3.1 LiteGemini Omni Flash
Giá (4 giây, không tiếng)$0.70$0.35$0.10
Giá (4 giây, kèm âm thanh)$1.50$0.50$0.18$0.40 ($0.10 mỗi giây)
Độ phân giải tối đa4K4K1080pchỉ hỗ trợ 720p
Thời lượngđúng 4/6/7/8 giâyđúng 4/6/7/8 giâyđúng 4/6/7/8 giâybất kỳ độ dài nào từ 3–10 giây
Âm thanhtùy chọn bật/tắttùy chọn bật/tắttùy chọn bật/tắtluôn bật
Khung hình cuối + vòng lặpkhông
Kéo dài đến 148 giâykhôngkhông, thay bằng chỉnh sửa dạng hội thoại

Lựa chọn ưu tiên của tôi thường là Veo 3.1 Fast. Mô hình này giữ lại toàn bộ các tính năng kiểm soát hữu ích (thời lượng chính xác, tùy chọn khung hình cuối, tính năng kéo dài video) nhưng giá chỉ bằng một nửa so với bản cao cấp nhất. Với các video đăng mạng xã hội, hầu như bạn sẽ không nhận thấy sự khác biệt về chất lượng so với bản Veo 3.1 đầy đủ. Phiên bản Lite với giá $0.10 là nơi lý tưởng để tôi chạy thử xem một ý tưởng có chuyển động mượt mà không trước khi rút ví chi tiền thật. Bản Veo 3.1 đầy đủ sẽ thực sự đáng tiền khi video có các chi tiết phức tạp như nước, vải vóc, va chạm vật lý, hoặc khi yêu cầu kỹ thuật bắt buộc phải là 4K. Còn Omni Flash sẽ là lựa chọn hàng đầu nếu phần âm thanh quan trọng không kém gì phần hình ảnh. Chúng tôi đã phân tích chi tiết trong bài đánh giá Gemini Omni Flash API nếu bạn muốn tìm hiểu kỹ hơn, bao gồm cả việc giới hạn ở độ phân giải 720p — một điểm trừ khá đau nếu xem trên toàn màn hình.

Clip ở trên được tạo bằng Veo 3.1 Fast trực tiếp từ hệ thống của chúng tôi để phục vụ cho bài viết này: một bức ảnh đóng khung đặt trên bàn làm việc chụp một chiếc thuyền buồm, và câu lệnh yêu cầu mặt biển bên trong khung tranh bắt đầu gợn sóng khi camera từ từ tiến lại gần. Chỉ tạo đúng một lần duy nhất, không hề chỉnh sửa, và chúng tôi chủ động chọn không tiếng (gói không tiếng của bản Fast là lựa chọn hoàn hảo khi làm nháp). Hiệu ứng "bức ảnh thức tỉnh" đó chính là những gì mô hình sẽ thực hiện trên tấm hình bạn tải lên.

Hướng dẫn từng bước chuyển ảnh thành video bằng AI

Toàn bộ quy trình trên trình tạo chỉ tốn của bạn khoảng một phút thiết lập cộng thêm thời gian chờ kết xuất video.

  1. Chuyển trình tạo sang chế độ video và chọn một mô hình. Với lần thử đầu tiên, Veo 3.1 Lite với giá $0.10 là phương án tiết kiệm nhất để làm quen.
  2. Tải ảnh của bạn lên làm khung hình đầu tiên. Ảnh định dạng JPG hoặc PNG sẽ được cắt theo tỷ lệ khung hình của video, vì vậy hãy kiểm tra kỹ các góc cạnh trước khi nhấn tạo.
  3. Chọn tỷ lệ 16:9 hoặc 9:16. Định dạng dọc hoạt động rất tốt trên TikTok và Reels; mô hình xử lý khung hình dọc cực kỳ mượt mà.
  4. Viết câu lệnh chuyển động (xem phần tiếp theo) và có thể thêm câu lệnh phủ định (negative prompt) lên tới 1,000 ký tự để loại bỏ những chi tiết không mong muốn.
  5. Chọn thời lượng và quyết định có bật âm thanh hay không. Với các dòng Veo, đây là các cài đặt chính xác; trên Omni Flash, bạn có thể chọn bất kỳ độ dài nào từ 3 đến 10 giây và âm thanh luôn được bật.
  6. Nhấn tạo. Quá trình tạo video mất khoảng 2–5 phút. Bạn hoàn toàn có thể đóng tab trình duyệt; kết quả sẽ được lưu trong phần lịch sử của bạn suốt 30 ngày.

Tài khoản của bạn chỉ bị trừ tiền khi video được tạo thành công. Các lượt tạo lỗi sẽ được tự động hoàn tiền. Điều này cực kỳ quan trọng đối với video vì bạn sẽ cần thử nghiệm và tinh chỉnh nhiều lần hơn so với khi tạo ảnh tĩnh.

Bảng phân cảnh gồm ba khung hình minh họa cảnh một bàn tay đang tải ảnh lên, bảng cài đặt và trình phát video hoàn thiện, mô tả quy trình chuyển ảnh thành video

Cách viết câu lệnh chuyển động khi chuyển ảnh thành video

Nguyên tắc cốt lõi: hãy tả chuyển động, đừng tả lại bối cảnh. Vì bối cảnh đã có sẵn trong ảnh rồi. Viết câu lệnh kiểu "Một người phụ nữ mặc áo khoác đỏ đứng trên cầu" chỉ tổ lãng phí ký tự vì mô hình đã tự thấy điều đó. Thay vào đó, một câu lệnh có cùng độ dài nhưng chứa đầy thông tin hữu ích sẽ là: "Cô ấy quay đầu về phía camera và mỉm cười khi gió nhẹ làm bay làn tóc, camera từ từ tiến lại gần (slow dolly-in)".

Các thuật ngữ điện ảnh của camera hoạt động cực kỳ hiệu quả với Veo. Dolly in (tiến máy), orbit (quay quanh chủ thể), handheld (quay cầm tay), static tripod shot (quay cố định trên chân máy), slow pan left (lia máy chậm sang trái). Các mô hình này rõ ràng được huấn luyện trên kho dữ liệu mô tả cảnh quay chuyên nghiệp, nên chúng hiểu thuật ngữ điện ảnh tốt hơn nhiều so với những từ chung chung kiểu "làm cho sinh động lên" (make it dynamic). Lời khuyên chân thành là hãy tránh hoàn toàn từ "sinh động" hay "năng động" — chẳng ai thống nhất được định nghĩa của nó cả, kể cả mô hình AI.

Chúng tôi đã rút ra một bài học đắt giá bằng tiền mặt khi sản xuất các clip demo cho blog này: các mô hình thường giữ nguyên trạng thái đang diễn ra ở khung hình đầu tiên và âm thầm phớt lờ những hành động được lên lịch xuất hiện muộn hơn. Có lần chúng tôi yêu cầu Omni Flash lật chiếc bánh pancake "vào khoảng giữa clip" và nhận về mười giây chiếc bánh nằm im thin thít. Thử ba lần liên tiếp, bay đứt ba đô la. Nhưng khi sửa lại câu lệnh để hành động ở trạng thái đang diễn ra, chúng tôi đã thành công ngay từ lần thử đầu tiên. Công thức là: viết "si rô đang rưới lên chồng bánh" thay vì "si rô bắt đầu rưới sau hai giây". Đặc biệt khi chuyển ảnh thành video, hãy chọn bức ảnh gốc mô tả một khoảnh khắc mà hành động bạn muốn tạo trông có vẻ hợp lý khi đang diễn ra dang dở.

Dưới đây là một vài công thức câu lệnh luôn mang lại hiệu quả cao:

  • Ảnh chân dung (Portraits): "subtle breathing, a slow blink, then a small smile; camera locked" (thở nhẹ nhàng, nháy mắt chậm, sau đó mỉm cười nhẹ; camera giữ cố định). Công thức này giúp bức ảnh sống động tự nhiên mà không bị biến dạng kỳ dị do các chuyển động quá mạnh gây ra.
  • Ảnh sản phẩm (Products): "slow 180-degree orbit around the object, studio lighting stays constant" (camera quay chậm 180 độ quanh vật thể, ánh sáng studio giữ nguyên). Đây là công thức kinh điển. Hãy nhớ giữ cho phần nền của ảnh gốc thật tối giản.
  • Ảnh phong cảnh (Landscapes): Hãy gọi tên cụ thể các yếu tố chuyển động: "clouds drift right, grass sways, light shifts warmer" (mây trôi về bên phải, cỏ lay động, ánh sáng chuyển dần sang tông ấm áp), nếu không mô hình sẽ tự động kích hoạt chế độ "zoom giật cục" mặc định khi bí ý tưởng.

Bảng đóng máy của đạo diễn đặt cạnh các ghi chú câu lệnh viết tay kèm mũi tên phác thảo chuyển động của camera trên một bức ảnh, minh họa cách viết câu lệnh chuyển động

Vòng lặp, khung hình cuối và chuỗi video dài 148 giây

Các mô hình Veo 3.1 cho phép bạn tùy chọn cả khung hình cuối lẫn khung hình đầu tiên. Nếu bạn đưa vào hai bức ảnh khác nhau, mô hình sẽ tự tạo cảnh chuyển tiếp (transition) mượt mà giữa chúng, giúp bạn dễ dàng biến một cảnh ban ngày thành ban đêm hoặc một bức phác thảo thành sản phẩm hoàn thiện. Còn nếu bạn chọn cùng một bức ảnh cho cả hai vị trí, bạn sẽ có ngay một clip kết thúc đúng tại điểm bắt đầu: một vòng lặp hoàn hảo (loop), cực kỳ thích hợp làm video nền cho website hoặc các bài đăng dạng ảnh động vô tận (cinemagraph). Đây chính là tính năng bị bỏ quên mà tôi yêu thích nhất trên nền tảng.

Tính năng kéo dài video (Extension) là một thủ thuật cực đỉnh khác của dòng Veo. Một clip sau khi hoàn thành có thể được nối dài thêm 7 giây bằng một câu lệnh mới, và chuỗi này có thể kéo dài tối đa tới 148 giây mà vẫn đảm bảo tính nhất quán hoàn hảo về mặt hình ảnh (chỉ áp dụng cho Veo 3.1 và Fast; bản Lite và Omni Flash không hỗ trợ tính năng này). Việc bắt đầu một chuỗi video dài từ chính bức ảnh của bạn là trải nghiệm gần nhất với việc làm phim không cần bảng phân cảnh (storyboard) mà các API hiện tại có thể mang lại. Tuy nhiên, chi phí cũng sẽ cộng dồn theo từng lượt nối dài, vì vậy hãy cân nhắc ngân sách thật kỹ trước khi quá say mê ý tưởng này.

Mô hình Omni Flash thay thế tính năng kéo dài bằng tính năng chỉnh sửa dạng hội thoại: bạn chỉ cần mô tả thay đổi mong muốn đối với clip đã hoàn thành (ví dụ: "chuyển cảnh sang lúc hoàng hôn, giữ nguyên mọi thứ khác") và trả tiền cho số giây của nó một lần nữa — mô hình cũng chấp nhận các video không phải do nó tạo ra, bao gồm cả các video bạn tự tải lên, và trả về chúng với độ dài tương tự. Hai triết lý hoàn toàn khác biệt: Chỉnh sửa là tinh chỉnh một khoảnh khắc; còn Kéo dài là phát triển cả một dòng thời gian.

Một dải phim uốn cong thành một vòng tròn hoàn hảo trên nền màu pastel, minh họa một video AI lặp lại kết thúc ngay tại điểm bắt đầu

Câu hỏi thường gặp (FAQ)

Tôi có thể chuyển ảnh thành video miễn phí không?

Gần như là được. Khi đăng ký tài khoản BananaBanana mới, bạn sẽ được tặng ngay $0.20 vào số dư mà không yêu cầu liên kết thẻ. Số tiền này đủ để bạn tạo hai clip không tiếng dài 4 giây bằng Veo 3.1 Lite từ bức ảnh của mình. Sau lượt thử đó, chi phí sẽ được tính trên mỗi lượt tạo, bắt đầu từ mức $0.10.

Lựa chọn API chuyển ảnh thành video rẻ nhất là gì?

Trên BananaBanana, đó là Veo 3.1 Lite: chỉ $0.10 cho một clip không tiếng dài 4 giây ở độ phân giải 720p, hoặc $0.18 nếu kèm âm thanh. Chi phí này chỉ tính trên mỗi lượt tạo thành công, tự động hoàn tiền nếu lỗi, hoàn toàn không yêu cầu đăng ký thuê bao tháng hay thiết lập Google Cloud phức tạp.

Video được tạo từ ảnh có thể kèm âm thanh không?

Hoàn toàn có thể. Các mô hình Veo 3.1 có tùy chọn bật/tắt âm thanh (bao gồm lời thoại, hiệu ứng tiếng động và âm thanh môi trường được mô tả trong prompt của bạn), còn Gemini Omni Flash thì luôn tạo âm thanh, đã bao gồm trong mức giá $0.10 mỗi giây của nó.

Tôi có thể tạo chuyển động cho ảnh dọc để đăng TikTok hoặc Reels không?

Được chứ, cả bốn mô hình đều hỗ trợ tỷ lệ dọc 9:16. Bạn chỉ cần tải ảnh lên, chọn tỷ lệ 9:16. Hãy lưu ý rằng ảnh gốc sẽ bị cắt bớt để khớp với tỷ lệ này, vì vậy hãy chừa lại khoảng trống ở phía trên và các cạnh của bức ảnh gốc nhé.

Video AI tạo từ ảnh có thể dài tối đa bao lâu?

Mỗi clip lẻ thường dài từ 4–8 giây đối với các dòng Veo (trên Omni Flash, bạn có thể chọn độ dài từ 3–10 giây). Tuy nhiên, các clip tạo bằng Veo 3.1 và Veo 3.1 Fast có thể được nối dài liên tục theo các bước 7 giây để đạt tổng thời lượng lên tới 148 giây, trong khi vẫn giữ nguyên tính nhất quán về mặt hình ảnh từ bức ảnh gốc của bạn.

tutorialvideoimage-to-video