Khung hình đầu tiên là ảnh của bạn
Chúng tôi chuyển các đơn có khung hình đầu tiên tới endpoint image-to-video gốc của xAI và đã kiểm tra kết quả từng khung hình: khung hình mở đầu chính là ảnh đầu vào, không phải một bản diễn giải lại.
Mô hình · xAI Grok Imagine Video 1.5
Mô hình video của xAI, và điều nó làm tốt hơn mọi thứ khác ở đây: mở đầu bằng bức ảnh của bạn và nói câu thoại của bạn. Đưa cho nó một bức chân dung và một câu trong ngoặc kép, khung hình đầu tiên của clip chính là bức chân dung đó, câu thoại được nói thành tiếng và khớp môi. Clip dài từ 4 đến 15 giây với bất kỳ số giây nguyên nào, ở 720p hoặc 1080p, trong năm tỷ lệ khung hình. Bạn trả tiền theo giây — $0.14 ở 720p, $0.25 ở 1080p — đúng mức giá xAI niêm yết cho API của chính họ. Crypto hoặc thẻ, không thuê bao.
Grok Imagine Video 1.5 là mô hình tạo video của xAI — mô hình đứng sau mảng video của Grok Imagine — và nó biến một prompt, hoặc một ảnh tĩnh kèm prompt, thành clip dài tối đa 15 giây với âm thanh được tạo trong cùng một lượt. Nó có trên API của xAI từ tháng 6 năm 2026 và trên BananaBanana từ ngày 16 tháng 9 năm 2026, thanh toán từ cùng số dư với mọi mô hình khác. Chúng tôi tính đúng mức giá theo giây của xAI, $0.14 ở 720p và $0.25 ở 1080p, và không chuyển sang bạn khoản phí xAI cộng thêm cho mỗi ảnh đầu vào.
Lời thoại và khung hình đầu tiên. Một câu viết trong ngoặc kép sẽ được nói ra, khớp môi và mix ở mức âm lượng trò chuyện, đúng thứ một quảng cáo kiểu nhà sáng tạo cần. Và khi bạn đưa một bức ảnh làm khung hình đầu tiên, clip mở đầu bằng chính bức ảnh đó — cùng người, cùng căn phòng, cùng họa tiết trên áo len — chứ không phải một bản na ná được dàn dựng lại. Prompt chỉ có chữ cũng chạy được, và khổ dọc là thật: một đơn 9:16 ở 1080p trả về tệp 1088×1920, không phải bản render ngang bị cắt.
Chúng tôi chuyển các đơn có khung hình đầu tiên tới endpoint image-to-video gốc của xAI và đã kiểm tra kết quả từng khung hình: khung hình mở đầu chính là ảnh đầu vào, không phải một bản diễn giải lại.
Đặt câu vào ngoặc kép và mô hình sẽ nói. Âm thanh luôn bật và luôn gồm trong giá; không có gói không tiếng và không phải trả thêm gì cho âm thanh.
Không phải thực đơn ba mức thời lượng: mọi giây nguyên trong khoảng đó. Bảy giây cho một câu thoại, mười một giây cho hai câu, và bạn trả đúng chừng đó.
16:9, 9:16, 1:1, 3:2 và 2:3. Vuông và 3:2 là những định dạng mà các mô hình video khác ở đây hoàn toàn không tạo.
Ảnh tham chiếu định hướng chủ thể và bối cảnh, còn mô hình tự dàn cảnh. Chúng là phương án thay cho khung hình đầu tiên, không phải phần bổ sung — hãy gửi một trong hai.
$0.14 mỗi giây ở 720p, $0.25 ở 1080p. Hoàn thiện prompt ở 720p, rồi render bản text-to-video cần giữ ở 1080p đúng một lần.
Ở đây, clip bắt đầu từ một ảnh chạy ở 720p. xAI giới hạn video dẫn hướng bằng tham chiếu ở 720p, và tuyến khung hình đầu tiên mà chúng tôi dùng được hiện chưa nhận 1080p, nên 1080p dành cho text-to-video. Thay vì tính bạn giá 1080p rồi giao một tệp nhỏ hơn, chúng tôi từ chối tổ hợp đó trước khi trừ bất cứ khoản nào; trong studio, các ô ảnh đơn giản là tắt đi kèm ghi chú khi bạn chọn 1080p. Không thể kết hợp khung hình đầu tiên với ảnh tham chiếu. Không có khung hình cuối, không seed, không negative prompt và không có đầu vào video.
15 giây là bản render đơn dài nhất, và sau đó không có extend hay chỉnh sửa — một quảng cáo bốn mươi giây là ba clip và một lần dựng. Âm thanh mạnh ở lời nói và ở các sự kiện âm thanh được gọi tên, yếu ở không khí nền mơ hồ: "soft ambient kitchen sounds" trả về ở khoảng −50 dB, tức là im lặng. Hãy gọi tên một âm thanh ("a kettle starting to whistle off-screen") hoặc thêm tiếng nền phòng khi dựng. Prompt tối đa 2048 ký tự. Nếu bạn cần nửa phút trong một cảnh quay, clip tham chiếu hoặc seed, Wan 3.0 đáp ứng những thứ đó; nếu bạn muốn thay đổi một clip đã xong bằng cách mô tả thay đổi, đó là Gemini Omni Flash.
Một bức chân dung, sản phẩm trên tay, căn phòng phía sau. Tạo ngay tại đây hoặc tải ảnh của bạn lên. Thứ gì có trong ảnh thì clip bắt đầu bằng thứ đó, nên hãy chỉnh cho xong khung hình trước khi trả tiền cho chuyển động.
Mô tả ai có trong khung hình, đặt câu thoại vào ngoặc kép, rồi nói máy quay chuyển động thế nào. "Natural handheld motion, quiet room tone" là đủ. Giữ dưới 2048 ký tự.
Bốn giây ở 720p là $0.56. Số dư bị trừ khi tác vụ bắt đầu và được hoàn tự động nếu thất bại hoặc bị bộ lọc từ chối. Nạp bằng crypto hoặc thẻ; không có phí hằng tháng.
| Mô hình | 4 giây | 8 giây | 15 giây | Âm thanh |
|---|---|---|---|---|
| Grok Imagine Video 1.5 · 720p$0.14/giây — khung hình đầu tiên, tham chiếu, bản nháp | $0.56 | $1.12 | $2.10 | Luôn bật, đã gồm |
| Grok Imagine Video 1.5 · 1080p$0.25/giây — chỉ text-to-video | $1.00 | $2.00 | $3.75 | Luôn bật, đã gồm |
| Wan 3.0 · 720pMô hình của Alibaba, tới 30 giây | $0.40 | $0.80 | $1.50 | Có sẵn, miễn phí |
| Veo 3.1 Fast · 720pMô hình của Google, chỉ 4–8 giây | $0.35 | $0.70 | — | Tính thêm tiền |
| Gemini Omni Flash · 720pMô hình của Google, tính theo giây, 3–10 giây | $0.40 | $0.80 | — | Luôn bật |
Giá tính cho mỗi clip hoàn chỉnh và đã gồm track âm thanh. Ảnh đầu vào miễn phí. Dấu gạch nghĩa là mô hình không thể render độ dài đó trong một lần chạy. Nạp $50 cộng thêm 5% vào số dư và $100 cộng thêm 10%; mã khuyến mãi đang hoạt động cộng thêm 10% nữa trên cùng khoản nạp.
Bảng đầy đủ cho mọi mô hình nằm ở trang bảng giá.
Khung mở đầu, khung kết thúc và vòng lặp thực sự hoạt động ra sao, kèm những lời nhắc đã tạo ra chúng.
Đọc hướng dẫnNgôn ngữ máy quay, ánh sáng, chuyển động. Viết cho Veo, nhưng cấu trúc chuyển sang Wan gần như không cần đổi.
Đọc hướng dẫnMô hình để tìm đến khi bạn cần sửa một clip bằng cách nói chuyện với nó thay vì viết lại lời nhắc.
Đọc hướng dẫnCó, luôn luôn. Lời thoại viết trong ngoặc kép được nói ra và khớp môi, các hiệu ứng âm thanh được gọi tên đều được tạo. Yêu cầu không khí nền mơ hồ thường trả về gần như im lặng, nên hãy gọi tên một âm thanh cụ thể nếu bạn cần. Âm thanh đã gồm trong giá.
Bạn trả theo giây: $0.14 ở 720p và $0.25 ở 1080p, đúng mức giá xAI tính trên API của chính họ. Vậy bốn giây ở 720p là $0.56, tám giây là $1.12 hoặc $2.00 tùy độ phân giải, và mức tối đa — 15 giây ở 1080p — là $3.75. Ở đây ảnh đầu vào không tốn thêm gì.
Đọc câu trả lời đầy đủHiện tại thì chưa. Clip bắt đầu từ khung hình đầu tiên hoặc dùng ảnh tham chiếu đều là 720p: xAI giới hạn video dẫn hướng bằng tham chiếu ở 720p, và tuyến khung hình đầu tiên gốc mà chúng tôi truy cập được chưa nhận 1080p. Chúng tôi từ chối đơn 1080p có ảnh trước khi trừ tiền, thay vì giao tệp nhỏ hơn với giá cao hơn. 1080p dùng được cho text-to-video.
Với mô hình này thì không. Hãy render tối đa 15 giây mỗi clip rồi dựng nối các phần dài hơn, hoặc dùng Wan 3.0 cho một cảnh quay tới 30 giây, hoặc Gemini Omni Flash, mô hình kéo dài chính clip của nó tới 40 giây.
Không. Nó nhận một khung hình đầu tiên hoặc tối đa 7 ảnh tham chiếu, chỉ vậy. Để kiểm soát cả khung hình đầu và cuối, dùng Veo 3.1, Omni hoặc Wan 3.0; cần seed thì dùng Veo hoặc Wan.
Toàn bộ số tiền tự động quay về số dư của bạn, kể cả khi bị bộ lọc nội dung từ chối. Quy tắc này giống nhau với mọi mô hình trên nền tảng.
Đọc câu trả lời đầy đủCó. Thứ bạn tạo ra là của bạn để sử dụng, kể cả trong công việc cho khách hàng và mục đích thương mại, trong khuôn khổ các quy định về nội dung trong điều khoản của chúng tôi. Kết quả không có watermark và không phải mua giấy phép riêng nào.
Tài khoản mới bắt đầu với $0.20 trong số dư — đủ để tạo khung hình đầu tiên. Clip từ $0.56, không thuê bao, không ràng buộc.