เคสการใช้งาน · วิดีโอ UGC ด้วย AI

โฆษณาวิดีโอ UGC ด้วย AI จากรูปสองใบ

โฆษณาแบบ UGC ก็คือคนคนหนึ่งพูดกับกล้องมือถือโดยถือสินค้าของคุณอยู่ในมือ ที่นี่มันไม่ได้ถ่ายแต่ถูกสร้างขึ้น คุณเตรียมรูปสินค้าและรูปคนมา โมเดลจะประกอบเฟรมเปิดเรื่องให้ก่อน แล้วทำให้มันขยับพร้อมเสียงพูดและเสียงห้องในรอบเดียวกัน คลิปหนึ่งราคา $0.30–$1.00 บน Gemini Omni Flash และสูงสุด $3.00 บน Veo 3.1 แบบมีเสียง ส่วนเฟรมเปิดอยู่ที่ $0.11 และไม่มีค่าสมาชิกรายเดือนสักบาท

ทำขึ้นเพื่อหน้านี้ตั้งแต่ต้นจนจบ: ภาพอ้างอิงสองรูป → เฟรมเปิดจาก Nano Banana Pro → แปดวินาทีจาก Gemini Omni Flash โดยเสียงพูดและเสียงห้องถูกสร้างมาพร้อมภาพ เทกที่คุณกำลังดูอยู่นี้ราคา $1.13 เปิดเสียงดูด้วย
01มันคืออะไร

วิดีโอ UGC ด้วย AI คืออะไร?

วิดีโอ UGC ด้วย AI คือโฆษณาสั้นในรูปแบบคอนเทนต์ของผู้ใช้ — คนพูดกับกล้องมือถือ ถือสินค้าไว้ อยู่ในครัวหรือห้องนั่งเล่นแทนที่จะเป็นสตูดิโอ — เพียงแต่ถูกสร้างด้วยโมเดลวิดีโอ ไม่ได้ถ่ายกับครีเอเตอร์จริง กระบวนการมีแค่สามคำสั่ง: ภาพอ้างอิงของสินค้าและของคน, ภาพนิ่งหนึ่งเฟรมที่ล็อกว่าใครอยู่ในจอและถืออะไร แล้วจึงให้โมเดลวิดีโอทำให้เฟรมนั้นขยับพร้อมเสียงพูดที่ตรงปาก ที่นี่ใช้สองโมเดล Gemini Omni Flash เป็นตัวที่ถูกกว่าและใหม่กว่า โมเดลการ์ดของ Google ระบุการจำลองฟิสิกส์ของโลกจริงไว้ในความสามารถ และระบุการเคลื่อนไหวซับซ้อนไว้ในจุดอ่อนที่ยังเหลืออยู่ ซึ่งตรงกับที่ผมเห็น: การหยิบจับธรรมดามักผ่าน ส่วนการหยิบจับที่ซับซ้อนคือครึ่งต่อครึ่ง ส่วน Veo 3.1 คือตัวที่หยิบมาใช้เมื่อทั้งช็อตขึ้นอยู่กับว่าวัตถุจะทำตัวถูกต้องไหม คลิปหนึ่งอยู่ที่ $0.30–$1.00 บน Omni Flash, $1.00 บน Veo 3.1 Fast และ $3.00 บน Veo 3.1 ตัวเต็มสำหรับแปดวินาทีพร้อมเสียง สูงสุด $4.40 ที่ 4K แถมเรนเดอร์เสร็จในไม่กี่นาที แทนที่จะเป็นสองถึงสี่สัปดาห์ที่บรีฟกับครีเอเตอร์มักกินไป

จริง ๆ แล้วคลิปหนึ่งราคาเท่าไหร่?

บิลของคลิปข้างบนนี้ แบบไม่ปัดเศษ: $0.11 สำหรับรูปอ้างอิงสินค้า, $0.11 สำหรับรูปคน, $0.11 สำหรับเฟรมเปิดที่เอาสองอย่างมารวมกัน, $0.80 สำหรับ Omni Flash แปดวินาที — รวม $1.13 ส่วนคลิปแนวตั้งหกวินาทีที่อยู่ถัดลงไปข้างล่างราคา $0.60 ถ้าอยากอัดเสียงใหม่แยกต่างหากคิด $0.01 ต่อสคริปต์ 200 ตัวอักษร ตกประโยคละราวหนึ่งเซ็นต์ บัญชีใหม่ได้ $0.20 ฟรี ซึ่งพอสำหรับรูปอ้างอิงหนึ่งใบกับเฟรมแรกหนึ่งเฟรม — พอให้เห็นว่าตัวละครใช้ได้ไหมก่อนจะควักเงินจ่ายค่าวิดีโอ

นั่นคือราคาของเทกแรก และเทกแรกยังไม่ใช่แผนงาน บางคลิปออกมาดีตั้งแต่ครั้งเดียว แต่อีกหลายคลิปต้องสองสามครั้ง เพราะประโยคออกมาเรียบไป มือทำอะไรแปลก ๆ หรือโมเดลปฏิเสธเสื้อผ้า แล้วยังมีอีกเรื่องที่ไม่มีใครใส่ไว้ในราคา: โฆษณาหนึ่งชิ้นแทบไม่เคยมีแค่คลิปเดียว สปอต 20–30 วินาทีมักเป็นสามหรือสี่เทกตัดต่อกัน — ฮุก, สินค้าในมือ, ภาพใกล้, ปิดท้าย ดังนั้นบิลจริงของโฆษณาที่เสร็จแล้วคือไม่กี่ดอลลาร์ ไม่ใช่ไม่กี่เซนต์ และมันขึ้นเร็วมากถ้าช็อตที่มีการเคลื่อนไหวเยอะไปถ่ายด้วย Veo 3.1 ตัวเต็มคลิปละ $3.00 ส่วนการตัดต่อกลับเป็นของฟรี: ffmpeg ตัด ต่อ และวางเสียงทับวิดีโอได้จากบรรทัดคำสั่ง ไม่ต้องใช้โปรแกรมตัดต่อเลย

02ขั้นตอนการทำงาน

รูปสองใบเข้า โฆษณาหนึ่งชิ้นออก

  1. เอารูปอ้างอิงของจริงมา

    รูปสินค้าที่สะอาดตาหนึ่งใบ กับรูปของคนหนึ่งใบ อะไรที่เบลอ ถูกครอป หรือแสงแปลก ๆ ตั้งแต่ขาเข้า จะกลับมาในวิดีโอแบบทวีคูณ

  2. ปั้นเฟรมเปิด

    เจนภาพนิ่งหนึ่งใบโดยถือรูปอ้างอิงทั้งสองไว้ — คนกับสินค้า จัดเฟรมแบบที่อยากให้โฆษณาเปิดตัว $0.11 บน Nano Banana Pro และทำใหม่ได้เรื่อย ๆ จนกว่าจะถูกใจ

  3. ทำให้เฟรมนั้นขยับ

    ส่งภาพนิ่งเข้าไปเป็นเฟรมแรก แล้วอธิบายการเคลื่อนไหวกับประโยคที่เธอพูด Omni Flash คิด $0.10 ต่อวินาทีของ 720p พร้อมเสียง ส่วน Veo 3.1 แพงกว่า และเป็นตัวที่ควรลองเมื่อเทกเดียวต้องแบกหลายการกระทำต่อเนื่องกัน

รูปอ้างอิงสินค้าที่เจนด้วย AI: ขวดหยดเซรั่มแก้วสีอำพันไม่มีแบรนด์ ฝาเซรามิกสีครีม วางบนผ้าลินินสีอ่อน
รูปอ้างอิงที่ 1 — ตัวสินค้า มุมเดียวที่สะอาด แสงสม่ำเสมอ Nano Banana Pro, $0.11
รูปพอร์ตเทรตครีเอเตอร์ที่เจนด้วย AI: ผู้หญิงใส่เสื้อไหมพรมสีครีมนั่งอยู่ในห้องนั่งเล่นที่สว่าง
รูปอ้างอิงที่ 2 — ตัวคน แสงเดียวกันและเสื้อผ้าชุดเดียวกับที่อยากให้อยู่ในโฆษณา
เฟรมเปิดของ UGC ที่เจนด้วย AI: ผู้หญิงจากรูปพอร์ตเทรตอ้างอิงถือขวดเซรั่มสีอำพันไว้ข้างไหล่ จัดเฟรมแบบกล้องมือถือ
เฟรมเปิด เจนจากรูปอ้างอิงทั้งสองใบพร้อมกัน — ภาพนิ่งใบนี้แหละคือสิ่งที่โมเดลวิดีโอจะเล่นต่อ
03รูปอ้างอิง

ทุกอย่างที่ตามมาดีได้เท่าที่คุณป้อนเข้าไป

นี่คือขั้นตอนที่คนชอบข้าม และเป็นขั้นตอนที่ตัดสินผลลัพธ์จริง ๆ โมเดลที่ได้รูปขวดถ่ายมือถือมุมสามส่วนสี่แบบเบลอ ๆ ไปจะไม่พังแบบเสียงดัง — มันจะแอบสร้างด้านที่มันมองไม่เห็นขึ้นมาเงียบ ๆ แล้วด้านที่มันแต่งเองนั่นแหละที่จะไปอยู่บนจอตลอดแปดวินาที แต่ถ้าให้รูปสินค้าที่แบน แสงสม่ำเสมอ ฉลากหันเข้ากล้อง ขวดใบเดิมจะรอดผ่านทั้งขั้นตอนทำเฟรม ขั้นตอนวิดีโอ และการตัดต่อหลังจากนั้น

เรื่องตัวคนก็เหมือนกันเป๊ะ เอกสาร Veo ของ Google พูดไว้ตรง ๆ ว่า: เลือกภาพที่คมชัด แสงดี และเห็นตัวแบบจากมุมที่คุณต้องการ แล้วใช้ภาษาบรรยายเลนส์กับแสงให้เหมือนกันทุกช็อต กฎประจำตัวผมหลังจากทำมาหลายสิบชิ้น: ถ้ารูปพอร์ตเทรตอ้างอิงกับฉากที่ตั้งใจไว้เถียงกันเรื่องแสงมาจากทางไหน หน้าคนจะลอยไปอยู่ตรงกลางระหว่างสองอย่างและเลิกดูเหมือนคนคนเดิม

มุมสินค้าดี ๆ มุมเดียว

ช็อตแบน ๆ แสงสม่ำเสมอใบเดียวชนะรูปถ่ายเล่น ๆ ห้าใบ แสงสะท้อน ภาพสั่น และมือที่บังฉลากไปครึ่งหนึ่ง ล้วนถูกโมเดลแต่งขึ้นใหม่ทั้งนั้น

คนเดิม ลุคเดิม

รักษาทรงผม เสื้อผ้า และการแต่งหน้าให้เหมือนกันในทุกรูปอ้างอิง ลุคที่ปนกันจะถูกเฉลี่ยจนได้หน้าที่ไม่เหมือนอันไหนเลย

แสงต้องเข้ากัน

พอร์ตเทรตถ่ายด้วยแฟลชแล้วโยนเข้าไปในฉากครัวแสงธรรมชาตินุ่ม ๆ จะดูเหมือนภาพตัดแปะทันที เลือกแสงในรูปอ้างอิงให้ตรงกับแสงที่โฆษณาจะมีจริง

ระวังตัวอักษรเล็ก ๆ

Nano Banana Pro เก็บข้อความสั้น ๆ บนฉลากได้ แต่รายการส่วนผสมยาว ๆ จะกลายเป็นแค่พื้นผิวมั่ว ๆ ถ้าตัวอักษรสำคัญจริง วางแผนถ่ายโคลสอัปด้วยแพ็กเกจจิ้งของจริงแทนดีกว่า

การจัดองค์ประกอบเอาไว้ทีหลัง

รูปอ้างอิงไม่จำเป็นต้องจัดองค์ประกอบเหมือนโฆษณา การจัดองค์ประกอบเป็นหน้าที่ของเฟรมเปิด — ขั้นตอนนั้นแหละคือที่ที่คุณจะได้เถียงกับโมเดล

อย่ายื่นรูปครอปให้มัน

รูปครอป 300 พิกเซลที่ดึงมาจากหน้าร้านมาร์เก็ตเพลสแทบไม่เหลืออะไรให้โมเดลรักษาไว้เลย ใช้ไฟล์ต้นฉบับความละเอียดเต็มทุกครั้ง

04เฟรมแรก

ทำไมเฟรมเปิดถึงชนะรูปอ้างอิงดิบ ๆ

ทั้งสองทางใช้ได้: คุณจะยื่นรูปอ้างอิงให้โมเดลวิดีโอแล้วปล่อยให้มันจัดฉากเองก็ได้ หรือจะเจนภาพนิ่งหนึ่งใบก่อนแล้วค่อยทำให้มันขยับก็ได้ ในทางปฏิบัติทางที่สองดีกว่า และเหตุผลก็ธรรมดามาก — โมเดลวิดีโอที่ถูกสั่งให้คิดองค์ประกอบเองจะคิดใหม่ทุกเฟรม ส่วนโมเดลที่ได้ภาพนิ่งไปแค่ต้องเล่นต่อจากมัน บน Gemini Omni Flash ช่องว่างตรงนี้ห่างพอที่ผมเลิกใช้แบบรูปอ้างอิงล้วนกับช็อตสินค้าไปเลย

สองคลิปข้างล่างนี้ prompt เดียวกัน รูปอ้างอิงชุดเดียวกัน ยาวหกวินาทีเท่ากัน ราคา $0.60 เท่ากัน ต่างกันแค่ว่ามีภาพนิ่งที่ผ่านการอนุมัติแล้วส่งเข้าไปเป็นเฟรมแรกหรือเปล่า ไม่ได้เปลี่ยนอย่างอื่นเลย และไม่มีคลิปไหนถูกเจนซ้ำ

รูปอ้างอิงล้วน

ไม่มีเฟรมเปิด ฝาสีครีมหายไปตั้งแต่วินาทีแรก ขวดกลายเป็นขวดสีเข้มอีกใบ และสุดท้ายก็ลอยหลุดออกนอกเฟรม ใบหน้ายังดีอยู่ — แสงบนใบหน้าอาจจะดีกว่าเทกข้าง ๆ ด้วยซ้ำ สิ่งที่พังคือตัวสินค้า

เริ่มจากเฟรมแรกที่ผ่านการอนุมัติ

prompt เดียวกัน แต่เริ่มจากภาพนิ่งที่เราดูก่อนแล้ว ฝา เนื้อแก้ว การจัดเฟรม และระยะกล้อง อยู่ครบตลอดหกวินาที เพราะโมเดลกำลังเล่นต่อจากเฟรม ไม่ใช่เดาเอาเอง

เวอร์ชันตรงไปตรงมา: ทางที่ใช้แต่ภาพอ้างอิงไม่ได้พังเสียทีเดียว — ใบหน้ายังอยู่ครบ และสำหรับฉากที่ไม่ต้องถือสินค้า มันมักจะพอ ยิ่งกว่านั้น แสงในเทกนั้นสวยกว่าด้วยซ้ำ: นวลกว่าบนใบหน้า คอนทราสต์จากหน้าต่างน้อยกว่า เพราะโมเดลกำลังจัดห้องที่มันชอบเอง แทนที่จะเดินต่อจากห้องของเรา มีข้อแม้หนึ่งที่ควรพูดเพราะมันเปลี่ยนวิธีอ่านผล: ครีเอเตอร์ของเราถูกสร้างขึ้น ไม่ใช่ภาพถ่ายของคนจริง โมเดลจึงมีที่ว่างให้จัดแสงเธอใหม่ ภาพพอร์ตเทรตของคนจริงจะตรึงทั้งแสงและผิวไว้แน่นกว่ามาก และทางที่ใช้แต่ภาพอ้างอิงก็มีอิสระในการแต่งเติมน้อยลง สิ่งที่คุณซื้อตรงนี้คือการควบคุม ไม่ใช่คุณภาพ ส่วนบน Veo 3.1 เขาเลือกให้คุณแล้ว: API ของ Google รับได้อย่างใดอย่างหนึ่ง — เฟรมแรก หรือภาพอ้างอิงไม่เกินสามภาพ — ไม่เคยรับทั้งสองอย่างในคำขอเดียว และการใช้ภาพอ้างอิงบังคับความยาวแปดวินาที

05การเลือกโมเดล

จับช็อตให้ตรงกับโมเดล

Omni Flash เก่งมากในรูปแบบที่ UGC อยู่จริง ๆ นั่นคือคนพูดใส่เลนส์ สัมภาษณ์ คลิปสไตล์พอดแคสต์ ผู้ก่อตั้งอธิบายสินค้า หรือใครสักคนถือกระปุกแล้วเล่าถึงมัน มันเรนเดอร์ปาก การขยับเล็ก ๆ และเสียงห้องในรอบเดียว และเป็นวิธีที่ถูกที่สุดในการได้เสียงที่ตรงปากจากโมเดลวิดีโอ อีกทั้งยังเป็นโมเดลที่ใหม่กว่าในสองตัว และ Google ก็ขายมันด้วยเรื่องฟิสิกส์นี่แหละ: ประกาศเปิดตัวพูดถึงความเข้าใจเชิงสัญชาตญาณต่อแรงโน้มถ่วง พลังงานจลน์ และพลศาสตร์ของไหล ส่วนโมเดลการ์ดก็ระบุการจำลองฟิสิกส์ของโลกจริงเป็นความสามารถ พร้อมกับชี้ว่าการเคลื่อนไหวซับซ้อนคือจุดอ่อนที่รู้กันอยู่ ทั้งสองครึ่งนี้จริงในทางปฏิบัติ ของตกลงพื้น ของเหลวไหล น้ำหนักอ่านออกถูกต้อง — จนกระทั่งช็อตนั้นเรียกร้องลูกโซ่ของการกระทำที่แม่นยำกับวัตถุชิ้นหนึ่ง

เส้นแบ่งจึงไม่ใช่ «คนพูด ปะทะ การเคลื่อนไหว» แต่คือเทกเดียวต้องแบกการจัดท่าทางมากแค่ไหน การทดสอบด้านล่างอยู่ที่ปลายยากของสเกลนั้น ไม่ใช่คำตัดสินของโมเดลใด: เฟรมเปิดเดียวกัน พรอมป์เดียวกัน โมเดลละหนึ่งคลิป — เปิดฝาขวด บีบหลอดหยด สองหยดลงฝ่ามือที่แบออก ทั้งหมดภายในแปดวินาที

Gemini Omni Flash · 8 วิ · $0.80

การเปิดฝาดูน่าเชื่อ หลอดหยดถูกดึงออกมาอย่างสะอาด และหยดเซรั่มก็ตกลงฝ่ามือจริง ๆ — ส่วนของเหลวไม่มีปัญหา ที่มีปัญหาคือตัววัตถุ: ขวดหายไปจากมือข้างล่างพอดีตอนที่ฝ่ามือแบออก แล้วกลับมาอีกทีตอนจะปิดฝา และคลิปจบลงด้วยมือเปล่า หนึ่งในสี่การกระทำหลุดหายไป

Veo 3.1 Fast · 8 วิ พร้อมเสียง · $1.00

พรอมป์เดียวกันและเฟรมแรกเดียวกัน — และสังเกตว่านี่คือ Veo 3.1 Fast ซึ่งเป็นรุ่นราคาถูก ไม่ใช่ตัวเต็ม มันถือขวดไว้ได้ตลอดทั้งสี่การกระทำ มีอยู่ครึ่งวินาทีที่มือที่สามโปร่ง ๆ พาดผ่านเฟรม ฉะนั้นมันก็ไม่ได้ปลอดอาร์ติแฟกต์เหมือนกัน เพียงแต่มันร้อยลำดับการกระทำไว้ได้ครบ

พูดใส่กล้อง → Omni Flash

การขยับปาก เสียงห้อง และคำพูดมาพร้อมกันหมด ที่ $0.10 ต่อวินาที สำหรับรีวิว เทสติโมเนียล หรือบทสนทนาสองคน นี่คือตัวเลือกที่ชัดเจน

ลูกโซ่การกระทำยาว ๆ → ลอง Veo ด้วย

การเคลื่อนไหวเดียว Omni เอาอยู่ แต่พอสี่อย่างต่อกัน เทกก็เริ่มทำการกระทำหล่นหาย การเปรียบเทียบของเราใช้ Veo 3.1 Fast ที่ $1.00 ต่อแปดวินาทีพร้อมเสียง ส่วน Veo 3.1 ตัวเต็มอยู่ที่ $3.00 — สร้างทั้งสองตัวแล้วเก็บเทกที่ใช้ได้

เสื้อผ้าเปลี่ยนคำตัดสิน

ตัวกรองความปลอดภัยของ Omni เข้มกับเรื่องเสื้อผ้ามากกว่าอย่างเห็นได้ชัด: ครีเอเตอร์สายฟิตเนสใส่สปอร์ตบราจะโดนปฏิเสธที่นั่นบ่อยกว่าบน Veo 3.1 มาก ทั้งที่ prompt เดียวกัน รูปอ้างอิงเดียวกัน วางแผนเรื่องเสื้อผ้า ไม่ก็วางแผนเรื่องโมเดล

ความยาวกับความละเอียด

Omni Flash ได้ 720p และ 3–10 วินาที ยาวเท่าที่จ่ายเป๊ะ ๆ ส่วน Veo 3.1 ทำได้ 4, 6 หรือ 8 วินาที สูงสุดถึง 4K และคลิปยังต่อความยาวออกไปหลังจากตัดครั้งแรกได้ด้วย

เสียง: มีตลอด vs เลือกได้

คลิป Omni ทุกคลิปมีเสียงไม่ว่าคุณจะขอหรือไม่ก็ตาม ส่วนบน Veo เสียงเป็นสวิตช์ให้เลือก เรนเดอร์แบบเงียบถูกกว่า ซึ่งสำคัญตอนที่ยังไงเสียงก็จะมาจากที่อื่นอยู่แล้ว

โดนปฏิเสธไม่เสียเงิน

งานที่ถูกบล็อกจะได้เงินคืนอัตโนมัติทั้งสองโมเดล ส่วนที่แพงของการโดนปฏิเสธคือสี่นาทีที่เสียไป ไม่ใช่เงินหนึ่งดอลลาร์

06เสียงและตัดต่อ

เมื่อเสียงพูดต้องอัดเทคสอง

Omni Flash เขียนเสียงพูดลงไปในรอบเดียวกับภาพ และสำหรับภาษาอังกฤษแบบพูดคุยก็มักจะโอเค ที่มันสะดุดคือชื่อ: ชื่อสินค้าที่แต่งขึ้น คำต่างประเทศ รหัสรุ่น — อะไรก็ตามที่แม้แต่เจ้าของภาษายังต้องถามว่าออกเสียงยังไง แต่ปัญหาเวอร์ชันใหญ่คือภาษาอื่นที่ไม่ใช่อังกฤษ และโมเดลวิดีโอทุกตัวก็เป็น: ผู้ทดสอบที่พูดภาษารัสเซียกับ Seedance 2.5 เล่าถึงประโยคที่เริ่มต้นพอฟังได้แล้วค่อย ๆ พังกลางทาง — สระไม่ลงเสียงหนักถูกลดรูปผิด เสียงหนักตกผิดพยางค์ และพอจบฉากสิบห้าวินาที สำเนียงก็ใกล้กับลูกผสมสลาฟมากกว่าภาษารัสเซีย เพราะรัสเซีย ยูเครน และเบลารุสใกล้กันพอที่โมเดลจะปนกันได้ บางคำออกมาสะอาด คำถัดไปทำทั้งเทกเสียหมด ถ้าสคริปต์ของคุณไม่ใช่ภาษาอังกฤษ ฟังให้จบก่อนค่อยอนุมัติ

ทางแก้คือเลิกขอเสียงจากโมเดลวิดีโอ แล้วไปเจนแยกต่างหาก Gemini 3.1 Flash TTS (gemini-3.1-flash-tts-preview) รันบนยอดเงินก้อนเดียวกันผ่านเซิร์ฟเวอร์ MCPของเรา: $0.01 ต่อสคริปต์ 200 ตัวอักษร มี 30 เสียง เลือกได้ทั้งคนพูดคนเดียวหรือบทสนทนาสองคน ได้ไฟล์ WAV 24 kHz ออกมา การกำกับก็เขียนเป็นภาษาอังกฤษธรรมดา — บุคลิก จังหวะ สำเนียง และการสะกดเชิงเสียงของคำที่ต้องออกเสียงให้ถูก จากนั้นวางแทร็กทับคลิปในโปรแกรมตัดต่ออะไรก็ได้ เขียนประโยคใหม่ให้ยาวใกล้เคียงกับเทคเดิม แล้วปากจะยังพอไปด้วยกันได้ ตรงไหนที่ไม่เข้ากันก็ตัดไปที่ตัวสินค้าซะ

เสียงพากย์ที่เจนขึ้นมา · $0.01

สคริปต์ 200 ตัวอักษรที่อ่านโดย Gemini 3.1 Flash TTS ด้วยคำกำกับบรรทัดเดียว: ผู้หญิงสาวน้ำเสียงเป็นมิตร รีวิวผ่านมือถือในครัวของตัวเอง พูดเร็วนิดหน่อย และออกเสียงชื่อแบรนด์ที่แต่งขึ้นแบบฝรั่งเศส ได้เสียงมาสิบสามวินาที ราคาหนึ่งเซ็นต์ ไม่ต้องพึ่งโมเดลวิดีโอเลย

การประกอบโฆษณาก็ไม่ต้องใช้โปรแกรมตัดต่อเช่นกัน ffmpeg ต่อเทกเข้าด้วยกัน ตัดครึ่งวินาทีที่มือทำอะไรแปลก ๆ ทิ้ง สลับเสียงที่โมเดลสร้างเป็นแทร็ก TTS ของคุณ ใส่ครอสเฟด แล้วส่งออกเวอร์ชัน 9:16 — ทั้งหมดจากบรรทัดคำสั่งเดียว ฟรี และรันได้ทุกเครื่อง ไวยากรณ์ของมันขึ้นชื่อเรื่องไม่เป็นมิตร ซึ่งพอดีเป๊ะกับการจับคู่กับโมเดล: อธิบายการตัดที่ต้องการให้ Claude หรือ LLM ตัวไหนก็ได้ รับคำสั่งกลับมา แล้วรัน สำหรับสปอต UGC สามคลิป นี่คือขั้นตอนโพสต์โปรดักชันทั้งหมด — และเป็นเหตุผลที่ตัวเลขบนหน้านี้ยังคงเป็นแค่ค่าเจนเนอเรต ไม่มีค่าสมาชิกมาบวกทับ

07ราคา

โฆษณา UGC ด้วย AI ที่นี่ราคาเท่าไหร่

ราคาต่อหน่วยของโมเดลที่ใช้ในขั้นตอนทำวิดีโอ UGC ด้วย AI
โมเดลราคาหน่วยเสียง
Nano Banana Proรูปอ้างอิงและเฟรมแรก$0.11ภาพ 1K–2K
Nano Banana 2ดราฟต์และเวอร์ชันทดลอง$0.03–$0.13ภาพ 512px–4K
Gemini Omni Flash$0.10 ต่อวินาที$0.30–$1.003–10 วิ, 720pเปิดตลอด
Veo 3.1 Fastพร้อมเสียง$0.50–$1.004–8 วิ, 720p/1080pเลือกได้
Veo 3.1 Liteวิดีโอที่ถูกที่สุด$0.10–$0.364–8 วิ, 720pเลือกได้
Gemini 3.1 Flash TTSผ่าน MCP เท่านั้น$0.01ต่อ 200 ตัวอักษรเสียงอย่างเดียว

ราคา Veo เป็นราคาสำหรับ 720p และ 1080p ส่วน 4K แพงกว่า Omni Flash คิดเงิน $0.10 ทุกวินาทีของผลลัพธ์ ดังนั้นความยาวคลิปก็คือราคา ตารางเต็มอยู่ในหน้าราคา

เติมเงินด้วยคริปโต เริ่มที่ $1 ฝากตั้งแต่ $50 ขึ้นไปได้เพิ่ม 5%, ตั้งแต่ $100 ขึ้นไปได้ 10% และโค้ดโปรโมชันที่เปิดใช้อยู่เพิ่มให้อีก 10% ของยอดเดิม — ดังนั้น $100 พร้อมโค้ดจะเข้าเป็น $120 ในยอดคงเหลือ ที่ $1.13 ต่อคลิปแปดวินาที นั่นคือราวหนึ่งร้อยเทก — หรือประมาณยี่สิบห้าถึงสามสิบโฆษณาที่เสร็จสมบูรณ์ เมื่อรวมการถ่ายซ้ำและการตัดต่อหลายคลิปเข้าไปแล้ว

ทุกโมเดลและทุกความละเอียดมีระบุไว้ในหน้าราคาฉบับเต็ม ส่วนหน้า Gemini Omni Flashอธิบายว่าโมเดลนั้นทำอะไรได้และทำอะไรไม่ได้

08อ่านเพิ่มเติม

คู่มือจากบล็อก

09คำถามที่พบบ่อย

คำถามที่คนถามกันจริง ๆ

ต้องมีคนจริง ๆ ถึงจะทำวิดีโอ UGC ด้วย AI ได้ไหม?

ไม่ต้อง ตัวครีเอเตอร์ก็เจนขึ้นมาได้เหมือนกัน — ทุกคนที่คุณเห็นในหน้านี้ออกมาจาก prompt ข้อความและไม่เคยมีตัวตนจริง แต่ถ้าคุณจะใช้ใบหน้าของคนจริง คุณต้องได้รับอนุญาตจากเขา: กฎเรื่องสิทธิในภาพลักษณ์ใช้กับวิดีโอที่เจนขึ้นมาเหมือนกับที่ใช้กับการถ่ายจริง และนโยบายของแพลตฟอร์มเรื่องภาพลักษณ์สังเคราะห์ก็เข้มกว่าที่คนส่วนใหญ่คิด

ใบหน้าเดิมจะกลับมาในโฆษณาชิ้นถัดไปไหม?

กลับมา ตราบใดที่คุณใช้รูปอ้างอิงชุดเดิมและใช้เฟรมเปิดอันเดิมซ้ำ การเจนเฟรมใหม่จากรูปอ้างอิงชุดเดิมจะได้ผลใกล้เคียง แต่ไม่เหมือนกันในระดับพิกเซล — นิสัยที่ปลอดภัยที่สุดคือเก็บเฟรมแรกที่ผ่านการอนุมัติไว้ทุกอัน แล้วเอามาทำให้ขยับใหม่ แทนที่จะไปสร้างมันขึ้นมาใหม่

ต้องแจ้งไหมว่าโฆษณานี้สร้างด้วย AI?

บน TikTok ต้องแจ้ง: นโยบายโฆษณาเรื่องสื่อที่ผ่านการตัดต่อและเนื้อหาที่สร้างด้วย AI กำหนดให้ต้องติดป้าย AIGC จาก Ads Manager หรือใส่คำชี้แจงที่มองเห็นได้บนตัวครีเอทีฟเอง ส่วน Meta ติดป้าย AI ของตัวเองอัตโนมัติกับโฆษณาที่มันตรวจพบว่าเป็นงานเจน ทั้งสองนโยบายมีการเปลี่ยนแปลงระหว่างปี 2026 ดังนั้นก่อนจะยิงแคมเปญใหญ่ ควรไปเช็กเวอร์ชันล่าสุดเอง อย่าไปเชื่อบล็อกโพสต์ — รวมถึงหน้านี้ด้วย

ควรใช้โมเดลไหนกับโฆษณา UGC แบบคนพูดใส่กล้อง?

เริ่มที่ Gemini Omni Flash ก่อน ที่ $0.10 ต่อวินาทีรวมเสียงแล้ว: สำหรับคนพูดใส่กล้อง มันทั้งถูกที่สุดและเรื่องมากน้อยที่สุด แถมยังเป็นโมเดลที่ใหม่กว่า ซึ่ง Google โฆษณาเรื่องฟิสิกส์ของมันเองด้วยซ้ำ แต่อย่าอ่านว่า «Omni ทำการเคลื่อนไหวไม่ได้»: มันเทได้ ทำของตกได้ ถ่ายทอดน้ำหนักได้ สิ่งที่มันทำหล่นคือลูกโซ่การหยิบจับที่แม่นยำและยาวในเทกเดียว — ในการทดสอบหลอดหยดสี่การกระทำของเรา มันทำขวดหาย ส่วน Veo 3.1 Fast ถือไว้ได้ ดังนั้นสำหรับฮุกหรือรีวิว ใช้ Omni ส่วนช็อตที่สร้างบนการจัดท่าทาง ให้สร้างทั้งสองตัวแล้วเก็บเทกที่ใช้ได้ เทกที่พลาดก็เสียแค่ไม่กี่เซนต์

ใช้ฟุตเทจที่ผมถ่ายเองได้ไหม?

ได้ ยาวไม่เกิน 10 วินาที อัปโหลดคลิปของคุณขึ้นมาแล้ว Omni Flash จะแก้ไขให้แบบ video-to-video — เปลี่ยนแสง เปลี่ยนฉากหลัง เปลี่ยนสิ่งที่คนในคลิปถืออยู่ — โดยยังคงเทคเดิมไว้ ไฟล์ต้นฉบับที่ยาวกว่านั้นจะถูกตัดให้เท่ากับลิมิตของโมเดลก่อนเจน

ถ้างานเจนถูกปฏิเสธจะเกิดอะไรขึ้น?

ยอดเงินจะถูกคืนอัตโนมัติ ทั้งบน Omni Flash และ Veo การถูกปฏิเสธมักกระจุกอยู่ที่เรื่องเสื้อผ้า ผู้เยาว์ และบุคคลจริงที่จำหน้าได้ กฎเรื่องเสื้อผ้าในหัวข้อการเลือกโมเดลข้างบนคือกฎที่ช่วยประหยัดการเจนซ้ำได้มากที่สุด

รันจาก Claude, Cursor หรือสคริปต์ของผมเองได้ไหม?

ได้ — โมเดลชุดเดียวกันเปิดให้ใช้ผ่านเซิร์ฟเวอร์ MCP ของเรา รวมถึงโมเดลเสียงพูดที่ไม่มีหน้าเว็บให้ใช้เลยด้วยซ้ำ รูปอ้างอิงและเฟรมแรกส่งเข้าไปได้ทั้งแบบ job ID, URL สาธารณะ หรือ base64 แบบ inline ดังนั้นงาน UGC ทั้งชุดจึงสั่งรันเป็นสคริปต์จากเอเจนต์ได้

โฆษณาทั้งชิ้นความยาว 30 วินาที ไม่ใช่คลิปเดียว ราคาเท่าไหร่?

ให้นับเป็นเทก ไม่ใช่คลิป สปอต 20–30 วินาทีตามปกติคือสามถึงสี่คลิปตัดต่อกัน และแต่ละคลิปต้องลองสองสามครั้งกว่าจะใช้ได้: อ่านบทเรียบไป มือทำท่าประหลาด หรือถูกปฏิเสธ ที่ $0.80 ต่อแปดวินาทีของ Omni Flash โฆษณาที่เสร็จแล้วจะอยู่ในหลักไม่กี่ดอลลาร์ แต่ถ้าถ่ายช็อตที่เคลื่อนไหวเยอะด้วย Veo 3.1 ตัวเต็มคลิปละ $3.00 ก็ขยับไปหลักสิบ ส่วนการตัดต่อไม่บวกเพิ่มเลย: ffmpeg ต่อเทก ตัดให้สั้นลง และวางเสียงบรรยายทับ ทั้งหมดจากบรรทัดคำสั่ง และ LLM ก็เขียนคำสั่งพวกนั้นให้คุณได้

รูปสองใบกับเงินไม่กี่ดอลลาร์

สมัครฟรีพร้อม $0.20 ในยอดเงิน เติมด้วยคริปโตเริ่มต้นที่ $1 ได้เฟรมแรกในราวหนึ่งนาที ได้คลิปแรกในห้านาที