ユースケース · AI UGC動画

写真2枚から作るAI UGC広告

UGC広告とは、あなたの商品を手に持った人がスマホのカメラに向かって話す動画のこと。ここではそれを撮影せずに生成します。商品の写真と人物の写真を用意すれば、モデルが最初の1枚を組み立て、声と部屋の環境音まで同じ処理で動かします。1本のクリップは Gemini Omni Flash で $0.30〜$1.00、音声つきの Veo 3.1 なら最大 $3.00、最初のカットは $0.11。サブスクは一切ありません。

このページのために最初から最後まで制作: 参照写真2枚 → Nano Banana Pro の最初のカット → Gemini Omni Flash で8秒、セリフも部屋の音も映像と同時に生成。いま見ているテイクで $1.13。音を出して再生してください。
01概要

AI UGC動画とは?

AI UGC動画とは、ユーザー生成コンテンツ形式の短い広告のことです。スタジオではなくキッチンやリビングで、商品を手にした人がスマホのカメラに話しかける——それをクリエイターと撮影する代わりに、動画モデルで生成します。制作は3回の呼び出しだけ。商品と人物の参照写真、画面に誰がいて何を持っているかを固定する静止画1枚、そしてその静止画を同期した音声つきで動かす動画モデル。ここで使うモデルは2つです。Gemini Omni Flash は安いほうで、かつ新しいほう。Google のモデルカードは現実世界の物理シミュレーションを能力として挙げ、複雑なモーションを残された弱点として挙げていますが、実感とも一致します。ふつうの手の動きはたいてい通り、凝った動作は五分五分。Veo 3.1 は、カット全体が「モノが正しく振る舞うこと」に懸かっているときに持ち出すモデルです。1本あたり Omni Flash で $0.30〜$1.00、Veo 3.1 Fast で $1.00、音声つき8秒のフル Veo 3.1 で $3.00、4Kなら最大 $4.40。しかもレンダリングは数分で、クリエイターへの依頼が普通に食う2〜4週間とは比べものになりません。

1本の実際の費用は?

上のクリップの内訳を四捨五入なしで。商品の参照に$0.11、人物に$0.11、両者をまとめる冒頭の1コマに$0.11、Omni Flash 8秒に$0.80——合計$1.13です。下にある縦型6秒版は$0.60でした。音声だけ録り直す場合は台本200文字あたり$0.01、だいたい1文で1セント。新規アカウントには$0.20が付くので、参照写真と冒頭の1コマ分はまかなえます。動画にお金を出す前にキャラクターが成立するか確かめるには十分です。

ただしそれは「1テイク目」の金額であって、1テイク目は計画とは言えません。一発で決まるクリップもありますが、2回3回かかるものも珍しくない。セリフが平板だったり、手が妙な動きをしたり、服装がフィルタに弾かれたり。そして誰も価格表に書かないもう一つの事実——広告が1クリップで済むことはめったにありません。20〜30秒のスポットなら普通は3〜4テイクをつないだもの(フック、商品を手に、寄り、締め)。だから完成した広告の現実的な請求額は数セントではなく数ドルで、動きの多いカットをフル Veo 3.1(1本 $3.00)で撮ればさらに一気に上がります。つなぐ作業だけは無料です。ffmpeg ならコマンドラインで切って、つないで、映像に音を重ねられます。編集ソフトは要りません。

02手順

写真2枚を入れて、広告が1本出る

  1. 本物の参照を用意する

    きれいな商品写真と人物の写真。入力段階でぼけている・切れている・光が変なものは、動画では倍になって返ってきます。

  2. 冒頭の1コマを作る

    2枚の参照を同時に使って静止画を1枚生成します。広告の出だしにしたい構図で、人物が商品を持っている絵です。Nano Banana Proで$0.11、納得いくまで作り直せます。

  3. その1コマを動かす

    その静止画を最初のフレームとして送り、動きとセリフを書きます。Omni Flash は音声つき720pで1秒 $0.10。Veo 3.1 は高くなりますが、1テイクで複数の動作を続けて成立させたいときに試す価値があるのはこちらです。

AI生成の商品参照写真:淡い色のリネンの上に置かれた、クリーム色のセラミックキャップ付き無印の琥珀色ガラス製スポイトボトル
参照1——商品。角度はひとつ、光は均一に。Nano Banana Pro、$0.11。
AI生成の参照ポートレート:明るいリビングに座る、クリーム色のニットを着た女性
参照2——人物。広告で使いたいのと同じ光、同じ服装で。
AI生成のUGC冒頭フレーム:参照ポートレートの女性が琥珀色のボトルを肩の横に持つ、スマホ撮影風の構図
2枚の参照から同時に生成した冒頭の1コマ。動画モデルが続きを描くのはこの静止画です。
03参照素材

この先の出来は入力の質そのもの

たいてい飛ばされる工程ですが、結果を決めるのはここです。斜め45度のぶれたスマホ写真を渡されたモデルは、派手に失敗したりしません。見えていない面を静かに捏造し、その捏造された面が8秒間画面に残ります。ラベルをカメラに向けた、平坦で均一に照らされた写真を渡せば、同じボトルが静止画の工程も、動画の工程も、その後の編集も生き延びます。

人物も同じです。GoogleのVeoドキュメントははっきり書いています——被写体を狙った角度から写した、鮮明でよく照らされた画像を選び、カットをまたいでレンズと光の言葉を揃えること。数十本作ってきた経験則としては、参照ポートレートと想定シーンで光の向きが食い違うと、顔はその中間あたりに流れて同一人物に見えなくなります。

商品は良い角度を1枚

平坦で均一に照らされた1枚が、雑な5枚に勝ります。反射、ぶれ、ラベルを半分隠す手は、すべて捏造で補完されます。

同じ人物、同じ見た目

参照写真ごとに髪型・服・メイクを揃えてください。バラバラだと、どれにも似ていない平均顔になります。

光を合わせる

ストロボのポートレートを柔らかい日差しのキッチンに入れると合成に見えます。広告で実際に使う光を、参照の段階で選んでください。

小さな文字に注意

Nano Banana Proは短いラベル文字なら保てますが、細かい成分表示は模様になります。書体が重要なら、実物パッケージの寄りカットを別に用意してください。

構図は後の工程

参照写真を広告のように構図する必要はありません。構図は冒頭の1コマの仕事で、モデルと交渉するのもそこです。

切り抜きを渡さない

マーケットプレイスの商品ページから取った300ピクセルの切り抜きでは、モデルに残る情報がほぼありません。毎回フル解像度の元データを。

04冒頭の1コマ

冒頭の1コマが参照写真だけに勝つ理由

どちらの経路も動きます。参照写真を動画モデルに渡して構図を任せることもできますし、先に静止画を1枚作ってそれを動かすこともできます。実際には後者が優れていて、理由はごく地味です——構図を考えろと言われたモデルは毎フレーム考え直しますが、静止画を渡されたモデルはそれを続けるだけで済みます。Gemini Omni Flashではその差が大きく、商品が写るカットで参照のみを使うのはやめました。

以下は2本のクリップ。プロンプトも参照も同じ、各6秒、1本$0.60。違いは承認済みの1コマを入れたかどうかだけ。ほかは何も変えず、どちらも生成し直していません。

参照写真のみ

最初のカットなし。クリーム色のキャップは1秒目で消え、ボトルは別の黒っぽいボトルに変わり、最後にはフレームの外へ流れていきます。顔は問題なし——むしろ光は隣のテイクより良いくらい。壊れるのは商品のほうです。

承認済みの1コマから

同じプロンプトでも、先に確認した静止画からスタート。キャップ、ガラス、構図、カメラとの距離が6秒間そのまま。モデルは1コマを推測するのではなく、続けるだけで済んだからです。

正直に言えば、参照画像だけの経路が壊れているわけではありません。顔はきちんと保たれるし、商品を手に持たないシーンならそれで足りることも多い。むしろ光はそちらのテイクのほうが良いくらいです。顔に当たる光は柔らかく、窓のコントラストも弱い——モデルが私たちの部屋を引き継ぐのではなく、自分の好きな部屋を組み立てたからです。読み方が変わるので断っておくと、このクリエイターは生成された人物であって実在の人の写真ではありません。つまりモデルには彼女をライティングし直す余地がありました。実在の人物のポートレートは光も肌もずっと強く固定するので、参照画像だけの経路が見栄えを良くする自由は小さくなります。ここで買っているのは品質ではなく制御です。Veo 3.1 では選択の余地すらありません。Google の API は最初のフレームか、最大3枚の参照画像のどちらか一方しか受け取らず、同じリクエストで両方は不可。しかも参照画像を使うと長さは8秒に固定されます。

05モデル選び

カットをモデルに合わせる

Omni Flash は、UGCが実際に生きている形式——レンズに向かって話す人——がとても得意です。インタビュー、ポッドキャスト風の映像、創業者が製品を説明する動画、瓶を手に取って語る動画。口元も微細な動きも部屋の音も1回の処理で生成され、動画モデルから同期した声を得る方法としては最安です。しかも2つのうち新しいほうで、Google はまさに物理を売りにしています。発表では重力・運動エネルギー・流体力学の直感的な理解に触れ、モデルカードは現実世界の物理シミュレーションを能力として挙げつつ、複雑なモーションを既知の弱点として名指ししています。実際にはその両方が本当です。モノは落ちるし、液体は流れるし、重さも正しく見える——カットが「1つの物体を使った精密な動作の連鎖」を要求し始めるまでは。

つまり境界線は「しゃべる人 対 動き」ではなく、1テイクがどれだけの振り付けを抱えられるかです。以下のテストはそのスケールの難しい端であって、どちらのモデルへの判決でもありません。同じ最初のカット、同じプロンプト、モデルごとに1本——ボトルの蓋を開け、スポイトを押し、開いた手のひらに2滴。それを8秒で。

Gemini Omni Flash · 8秒 · $0.80

蓋を開ける動作は説得力があり、スポイトもきれいに抜け、しずくもちゃんと手のひらに落ちます——液体の部分は問題ありません。問題は物体のほう。手のひらが開いた瞬間に下の手からボトルが消え、蓋を閉めるときだけ戻ってきて、クリップは両手が空のまま終わります。4つの動作のうち1つが抜け落ちました。

Veo 3.1 Fast · 音声つき8秒 · $1.00

プロンプトも最初のカットも同一。そしてこれは Veo 3.1 Fast、つまり安いほうのグレードであってフルモデルではない点に注意してください。ボトルは4つの動作を通して保たれます。半秒ほど3本目の手がフレームを透けて横切るので、こちらもアーティファクトなしではありません。ただ、動作の連なりは崩れませんでした。

カメラに向かって話す → Omni Flash

口の動き、部屋の空気音、音声が同時に出てきて1秒$0.10。レビュー、推薦の声、2人の掛け合いなら選択は明白です。

長い動作の連鎖 → Veo も試す

動作が1つなら Omni で足ります。4つ続くあたりから、テイクが動作を取りこぼし始めます。今回の比較で使ったのは音声つき8秒 $1.00 の Veo 3.1 Fast、フルの Veo 3.1 は $3.00。両方で生成して、成立したテイクを残してください。

服装が判定を変える

Omniの安全フィルターは服装に明確に厳しく、スポーツブラ姿のフィットネス系クリエイターは、同じプロンプト・同じ参照でもVeo 3.1よりはるかに高い頻度で弾かれます。衣装を設計するか、モデルを選び直すかです。

長さと解像度

Omni Flashは720pで3〜10秒、支払った秒数ぴったり。Veo 3.1は4・6・8秒で最大4K、しかも最初のカットの先へ延長できます。

音:常時かオプションか

Omniのクリップは頼まなくても必ず音が付きます。Veoでは音はスイッチで、無音レンダーの方が安い——声を別で用意する場合はここが効いてきます。

拒否されても費用はゼロ

ブロックされた生成は両モデルとも自動で返金されます。拒否で高くつくのは1ドルではなく、4分です。

06音声と編集

声にもう1テイク要るとき

Omni Flash はセリフを映像と同じ処理で書き込みます。会話調の英語ならたいてい問題ありません。つまずくのは名前です。作った商品名、外国語、型番——ネイティブでも読み方を教わる必要があるようなもの。ただしこの問題の大きい版は「英語以外の言語」で、どの動画モデルも抱えています。Seedance 2.5 をロシア語で試した人たちは、最初は聞けるのに途中から崩れていくセリフを報告しています。無強勢母音の弱化がおかしくなり、アクセントが違う音節に乗り、15秒のシーンが終わるころにはロシア語というよりスラブ系の混成という響きになる——ロシア語・ウクライナ語・ベラルーシ語はモデルが混ぜてしまうほど近いからです。ある単語はきれいに出て、次の単語がテイク全体を台無しにする。台本が英語でないなら、最後まで聞いてから承認してください。

対処は単純で、声を動画モデルに求めるのをやめて別に生成することです。Gemini 3.1 Flash TTSgemini-3.1-flash-tts-preview)は同じ残高からMCPサーバー経由で使えます。台本200文字あたり$0.01、30種類の声、1人読みか2人の対話、出力は24kHzのWAV。演出は普通の文章で指定します——人物像、テンポ、アクセント、正しく読ませたい語の発音表記。あとは好きな編集ソフトでクリップに重ねるだけ。書き直したセリフを元テイクとだいたい同じ長さに保てば口の動きはおおむね合いますし、合わない箇所は商品のカットに逃がしてください。

生成したナレーション · $0.01

Gemini 3.1 Flash TTSが1行の演出指示だけで読み上げた200文字の台本:親しみやすい若い女性、自宅キッチンでのスマホレビュー、少し早口、造語のブランド名はフランス語風に。音声13秒、1セント、動画モデルは一切使っていません。

広告を組み立てるのにも編集ソフトは要りません。ffmpeg はテイクを端から端までつなぎ、手が妙な動きをした0.5秒を落とし、生成された音声をあなたのTTS音源に差し替え、クロスフェードを入れ、9:16版を書き出します——すべて1行のコマンドで、無料で、どのマシンでも。構文が有名なほど不親切なのは事実で、だからこそモデルと相性がいい。欲しいつなぎ方を Claude なり任意のLLMなりに説明して、コマンドを受け取り、実行するだけです。3クリップのUGCスポットなら、それがポストプロダクションの全工程。このページの数字が「生成コストのまま」で、上にサブスクが乗らない理由でもあります。

07料金

ここでのAI UGC広告の費用

AI UGC動画の制作フローで使うモデルの単価
モデル価格単位音声
Nano Banana Pro参照と冒頭の1コマ$0.111K〜2K画像
Nano Banana 2下書きとバリエーション$0.03–$0.13512px〜4K画像
Gemini Omni Flash1秒$0.10$0.30–$1.003〜10秒、720p常時オン
Veo 3.1 Fast音声つき$0.50–$1.004〜8秒、720p/1080p任意
Veo 3.1 Lite最安の動画$0.10–$0.364〜8秒、720p任意
Gemini 3.1 Flash TTSMCP経由のみ$0.01200文字ごと音声のみ

Veoの価格は720pと1080pのもので、4Kはより高くなります。Omni Flashは出力1秒ごとに$0.10なので、クリップの長さがそのまま価格です。全表は料金ページに。

入金は暗号資産で $1 から。$50 以上の入金で5%、$100 以上で10%が加算され、有効なプロモコードがあればさらに同じ入金額の10%——つまりコードつきの $100 は残高に $120 として入ります。8秒のクリップが $1.13 なら、およそ100テイク分。撮り直しと複数クリップの編集を勘定に入れれば、完成した広告で25〜30本というところです。

全モデルと解像度は料金ページに一覧があります。Gemini Omni Flashのページでは、このモデルにできること・できないことを説明しています。

08もっと読む

ブログのガイド

09FAQ

実際によく来る質問

AI UGC動画に実在の人物は必要ですか?

不要です。出演者そのものを生成できます——このページに出てくる人物はすべてテキストプロンプトから生まれた、実在しない人です。実在する人の顔を使う場合は本人の許可が必要です。肖像に関するルールは撮影と同様に生成動画にも及びますし、合成された「そっくりさん」に関する各プラットフォームの規約は、多くの人が思うより厳格です。

次の広告でも同じ顔は戻ってきますか?

同じ参照写真を保管し、同じ冒頭フレームを使い回すかぎり戻ってきます。同じ参照から1コマを作り直すと近くはなりますが、ピクセル単位で同一にはなりません。最も安全なのは、承認した冒頭フレームをすべて保存し、作り直さずにもう一度動かす習慣です。

AI生成だと表示する義務はありますか?

TikTokでは必要です。編集済みメディアとAI生成コンテンツに関する広告ポリシーが、Ads ManagerのAIGCラベルか、クリエイティブ上に自前の明示的な注記を求めています。Metaは生成と判定した広告に自社のAIラベルを自動で付けます。どちらのポリシーも2026年中に変更されているので、大きな配信の前にはブログ記事——この記事も含めて——ではなく最新版を確認してください。

人が話すUGC広告にはどのモデルを使うべき?

まずは Gemini Omni Flash から。音声込みで1秒 $0.10、カメラに向かって話す人物なら最も安く、最も手がかかりません。しかも新しいモデルで、Google 自身が物理性能を前面に出しています。ただしこれを「Omni はモーションが苦手」と読まないでください。液体は注げるし、モノは落ちるし、重さも伝わります。取りこぼすのは、1テイクに詰め込まれた長く精密な動作の連鎖です。4動作のスポイトのテストでは Omni がボトルを見失い、Veo 3.1 Fast は保ちました。だからフックや推薦コメントなら Omni。振り付けで成り立つカットなら両方で生成して、成立したテイクを残す。失敗したほうは数セントです。

自分で撮った素材は使えますか?

使えます、10秒まで。クリップをアップロードすればOmni Flashが動画から動画への編集を行い、テイクを保ったまま光や背景、手に持っている物を差し替えます。長い素材は生成前にモデルの上限まで切り詰められます。

生成が拒否されたらどうなりますか?

Omni FlashでもVeoでも残高は自動的に返金されます。拒否は服装、未成年、識別可能な実在人物のあたりに集中します。再試行を最も減らせるのは、モデル選びの章にある衣装のルールです。

Claude、Cursor、自作スクリプトから実行できますか?

できます——同じモデル群を当社のMCPサーバーで公開しており、ウェブUIが存在しない音声モデルも含まれます。参照画像や冒頭フレームはジョブID、公開URL、インラインのbase64のいずれでも渡せるので、UGCのバッチ制作をエージェントからスクリプト化できます。

1本のクリップではなく、30秒の広告全体ではいくらかかりますか?

クリップではなくテイクで数えてください。20〜30秒のスポットは普通3〜4クリップをつないだもので、それぞれ使える状態になるまで数回かかります。平板な読み、変な手、フィルタによる拒否。Omni Flash の8秒が $0.80 なら、完成した広告は数ドルの範囲。動きの多いカットをフル Veo 3.1(1本 $3.00)で撮れば数十ドルになります。編集は何も足しません。ffmpeg がテイクをつなぎ、切り詰め、ナレーションを重ねる——すべてコマンドラインで、そのコマンドはLLMに書かせられます。

写真2枚と数ドル

無料登録で残高に$0.20、入金は暗号資産で$1から。冒頭の1コマは約1分、最初のクリップは5分ほどで。