กลับไปที่บล็อก
BananaBanana Teamtutorialvideoveoprompts

คู่มือเขียน Prompt สำหรับ Veo 3.1: เขียน Prompt ให้ใช้งานได้จริง

คู่มือใช้งาน Veo 3.1 ฉบับปฏิบัติ: โครงสร้าง 7 ส่วน, คำศัพท์การเคลื่อนกล้อง, สัญญาณเสียง และคลิปก่อน-หลังจริง เริ่มต้นเพียง $0.10 ต่อวิดีโอ

คู่มือเขียน Prompt สำหรับ Veo 3.1: เขียน Prompt ให้ใช้งานได้จริง

Prompt สำหรับ Veo 3.1 คือคำอธิบายฉากสั้นๆ ที่บอกโมเดลวิดีโอของ Google ว่าจะถ่ายอะไรและถ่ายอย่างไร โมเดลจะปฏิบัติกับข้อความของคุณเหมือนเป็นบรีฟของผู้กำกับ โดยจะวิเคราะห์จากตัวแบบ, การกระทำ, สไตล์, งานกล้อง, องค์ประกอบภาพ, การเลือกเลนส์ และแสงไฟ จากนั้นจะเติมเต็มส่วนที่ไม่ได้ระบุด้วยการคาดเดาของโมเดลเอง การเขียน prompt ที่ดีจึงเป็นการลดส่วนที่โมเดลต้องคาดเดาให้น้อยที่สุด

สรุปสั้นๆ หากคุณต้องการอ่านเพียงย่อเดียว: อธิบายตัวแบบหนึ่งตัวที่กำลังทำกิจกรรมหนึ่งอย่าง จากนั้นใส่รายละเอียดกล้องเข้าไป เทมเพลตที่ใช้งานได้จริงคือ "[ประเภทการถ่ายภาพ] ของ [ตัวแบบ] [กำลังทำกิจกรรม] ใน [สถานที่], [การเคลื่อนกล้อง], [เลนส์หรือโฟกัส], [แสงไฟและอารมณ์ของภาพ]" พฤติกรรมง่ายๆ เพียงข้อเดียวนี้ คือการเพิ่มกล้องและแสงไฟ จะช่วยเปลี่ยนคลิปที่น่าเบื่อให้กลายเป็นคลิปที่นำไปใช้งานได้จริง ข้อมูลด้านล่างนี้คือรายละเอียดและตัวอย่างพิสูจน์

ผมได้ใช้งาน Veo 3.1 บน BananaBanana ทุกวันตั้งแต่วันที่เราเปิดตัวฟีเจอร์สร้างวิดีโอ และความแตกต่างระหว่าง prompt ที่เขียนแบบลวกๆ กับ prompt ที่มีโครงสร้างชัดเจนนั้น มีความแตกต่างในโมเดลนี้มากกว่าโมเดลรูปภาพทั่วไปที่ผมเคยใช้ ภาพนิ่งอาจจะยกเว้นให้ความกำกวมได้ แต่วิดีโอจะลงโทษความกำกวมนั้นเป็นสองเท่า ทั้งในเฟรมภาพและในความเคลื่อนไหว

อะไรที่ทำให้ prompt ของ Veo 3.1 มีคุณภาพดี?

อ้างอิงจาก เอกสารประกอบการใช้งาน Veo ของ Google prompt ที่ทรงพลังจะครอบคลุม 7 องค์ประกอบ ได้แก่: ตัวแบบ, การกระทำ, สไตล์, ตำแหน่งกล้อง, องค์ประกอบภาพ, เอฟเฟกต์โฟกัสและเลนส์ และบรรยากาศรอบๆ คุณไม่จำเป็นต้องใส่ครบทั้ง 7 อย่างทุกครั้ง แต่คุณต้องรู้ว่าคุณกำลังข้ามข้อใดไป เนื่องจากโมเดลจะสุ่มคิดส่วนที่เหลือขึ้นมาเอง

องค์ประกอบสิ่งที่ควบคุมตัวอย่างวลี
ตัวแบบใครหรืออะไรที่อยู่บนหน้าจอ"ช่างปั้นหม้อสูงวัยที่มีคราบดินเหนียวเปื้อนมือ"
การกระทำเกิดอะไรขึ้นในคลิปวิดีโอ"กำลังปั้นชามบนแป้นหมุน"
สไตล์รูปลักษณ์โดยรวม"สไตล์สารคดีภาพยนตร์"
กล้องตำแหน่งและการเคลื่อนกล้อง"เลื่อนกล้องเข้าช้าๆ (slow dolly-in) ในระดับสายตา"
องค์ประกอบภาพการจัดกรอบภาพ"ภาพโคลสอัพ"
เลนส์ / โฟกัสลักษณะทางออปติคอล"ระยะชัดตื้น (shallow depth of field)"
บรรยากาศแสงและโทนสี"แสงหน้าต่างที่อบอุ่น, ฝุ่นปลิวในอากาศ"

ลำดับคำมีความสำคัญน้อยกว่าที่คิด โดยปกติผมจะใส่ตัวแบบและการกระทำไว้ข้างหน้าสุดเนื่องจากเป็นสิ่งที่โมเดลจะยึดหลักไว้ แล้วค่อยใส่เรื่องกล้องและแสงไว้ท้ายสุด สิ่งที่สำคัญกว่าคือความเฉพาะเจาะจง: คำว่า "ม้า" จะทำให้โมเดลต้องสุ่มเลือกระหว่างสายพันธุ์ม้ากว่า 40 สายพันธุ์ แต่คำว่า "ม้าอาหรับสีน้ำตาลเกาลัด" จะเจาะจงได้ทันที

ข้อควรระวังประการหนึ่งคือ ในฝั่งของ Google นั้น Veo 3.1 จะมีระบบเขียน prompt ใหม่ (prompt rewriter) ที่จะช่วยขยายความ prompt สั้นๆ ก่อนทำการสร้างวิดีโอ ซึ่งคุณไม่สามารถเห็นได้ทั้งหมดว่าระบบเติมอะไรลงไปบ้าง บางครั้ง prompt สั้นๆ จึงได้ผลลัพธ์ที่มีรายละเอียดที่คุณไม่ได้ต้องการ การเขียนรายละเอียดด้วยตัวเองจึงเป็นวิธีดึงสิทธิ์การตัดสินใจนั้นกลับมาจากระบบเขียนใหม่

โครงสร้างของ prompt Veo 3.1 แบ่งออกเป็น 7 ส่วนที่มีป้ายกำกับ: ตัวแบบ, การกระทำ, สไตล์, กล้อง, องค์ประกอบภาพ, เลนส์ และบรรยากาศ

วิธีควบคุมกล้องใน Veo 3.1 ทำอย่างไร?

ภาษาทางกล้องเป็นส่วนที่มีอิทธิพลมากที่สุดใน prompt ของ Veo 3.1 และเป็นส่วนที่คนส่วนใหญ่มักจะข้ามไป ตัวแบบเข้าใจคำศัพท์ภาพยนตร์มาตรฐาน ดังนั้นโปรดระบุคำศัพท์เหล่านั้นตรงๆ

สำหรับตำแหน่งกล้อง: มุมมองจากมุมสูง (aerial view), ระดับสายตา (eye-level), ภาพมุมต่ำ (low-angle shot), ภาพจากบนลงล่าง (top-down shot), ภาพข้ามไหล่ (over-the-shoulder) สำหรับการเคลื่อนกล้อง: เลื่อนกล้องเข้าหรือออก (dolly in or out), ถ่ายตามตัวแบบ (tracking shot), แพนซ้ายหรือขวา (pan left or right), เงยกล้องขึ้น (tilt up), ซูมช้าๆ (slow zoom), ภาพแทนสายตา (POV shot) สำหรับการจัดเฟรมภาพ: ภาพโคลสอัพขั้นสุด (extreme close-up), ภาพโคลสอัพ (close-up), ภาพระยะปานกลาง (medium shot), ภาพมุมกว้าง (wide shot), ภาพสร้างสถานการณ์ (establishing shot) สำหรับเลนส์: โฟกัสชัดตื้น (shallow focus), โฟกัสชัดลึก (deep focus), เลนส์มาโคร (macro lens), เลนส์มุมกว้าง (wide-angle lens), โฟกัสแบบซอฟต์ (soft focus)

กฎปฏิบัติสองข้อจากการทดลองสร้างของเรา: ข้อแรก กำหนดการเคลื่อนกล้องเพียงอย่างเดียวต่อคลิป prompt ที่ระบุว่า "แพนกล้องแล้วเปลี่ยนเป็นเลื่อนกล้องเข้าจากนั้นเงยกล้องขึ้น" มักจะทำให้คุณได้ผลลัพธ์เพียงอย่างใดอย่างหนึ่งจากสามอย่างนี้แบบสุ่ม หรือได้แบบผสมปนเปกัน คลิปมีความยาว 4 ถึง 8 วินาที ซึ่งมีเวลาเพียงพอสำหรับการเคลื่อนกล้องแบบเดียวที่ทำออกมาได้ดี ข้อสอง เมื่อเกิดการขัดแย้งกัน คำกริยาที่แสดงความเคลื่อนไหวจะชนะคำนามทางกล้อง หากตัวแบบของคุณ "วิ่งสุดฝีเท้า" แต่กล้องตั้งค่าเป็น "static wide shot" (ภาพมุมกว้างแบบนิ่ง) โมเดลจะให้ความสำคัญกับการวิ่งเป็นอันดับแรกและทำให้กล้องขยับอยู่ดี ดังนั้นจงเขียนให้สอดคล้องกัน

เรื่องแสงไฟก็ใช้หลักการเดียวกันคือ ระบุชื่อแสงแบบที่ผู้กำกับภาพใช้กัน เช่น "Golden hour backlight" (แสงย้อนยุคสีทอง), "cool blue moonlight" (แสงจันทร์สีน้ำเงินโทนเย็น), "harsh overhead fluorescent" (แสงฟลูออเรสเซนต์จากด้านบนที่สว่างจ้า), "flickering torchlight" (แสงคบเพลิงระยิบระยับ) คำเหล่านี้สามารถทำความเข้าใจได้ง่าย ส่วนคำอธิบายอารมณ์ที่คลุมเครืออย่างเช่น "beautiful lighting" (แสงสวยงาม) จะไม่มีผลใดๆ เลย

คำศัพท์กล้องภาพยนตร์สำหรับ prompt Veo 3.1 แสดงเป็นสตอรี่บอร์ดของตำแหน่งกล้อง dolly, pan, low-angle และ aerial รอบตัวแบบเดียว

ก่อนและหลัง: แนวคิดเดียวกัน แต่เขียนคนละ prompt

พูดไปก็ไม่มีประโยชน์ มาดูผลลัพธ์จริงดีกว่า นี่คือฉากเดียวกันที่สร้างขึ้นสองครั้งด้วย Veo 3.1 Fast บน BananaBanana แบบไม่มีเสียง ความยาว 6 วินาที ความละเอียด 720p ค่าใช้จ่ายทั้งหมดสำหรับทั้งสองตัวอย่างนี้: ประมาณ $1

อันแรกคือ prompt ที่ทุกคนมักจะเขียนในวันแรกที่เริ่มใช้งาน แค่ระบุว่า "A horse running on a beach":

ผลลัพธ์ที่ได้ก็พอใช้ได้ สังเกตว่าโมเดลเลือกฉากพระอาทิตย์ตกดินขึ้นมาเอง นั่นเป็นเพราะระบบเขียน prompt ใหม่เลือกให้คุณ เฟรมภาพยังคงเป็นภาพมุมกว้างระยะไกล กล้องไม่มีการเคลื่อนไหวที่ชัดเจน และไม่มีส่วนใดเลยที่คุณเลือกเอง คราวนี้ลองมาเขียนแนวคิดเดียวกันใหม่ด้วยโครงสร้าง 7 ส่วน: "A chestnut Arabian horse gallops along wet sand at golden hour, kicking up spray of seawater with its hooves, low-angle tracking shot moving alongside the horse, shallow depth of field, warm backlit rim light from the setting sun":

ตัวแบบเดียวกัน โมเดลเดียวกัน ในราคาเท่ากัน คลิปที่สองมีการเคลื่อนกล้องที่ตั้งใจ ทิศทางแสงที่สอดคล้อง และละอองน้ำที่สะท้อนแสงย้อน ซึ่งทั้งหมดนี้เกิดจากคำที่ระบุใน prompt ไม่ใช่ความบังเอิญ

บทเรียนหนึ่งจากการสร้างตัวอย่างนี้ทำให้ผมต้องสร้างใหม่ถึงสองครั้ง: เวอร์ชันก่อนหน้าของ prompt นั้นลงท้ายด้วยคำว่า "cinematic 35mm look" และ Veo ตีความอ้างอิงภาพยนตร์นั้นตรงตัว โดยแสดงแถบสีดำขอบบนล่าง (letterbox) ฝังลงในเฟรมภาพเลย ถึงสองครั้ง คำระบุสไตล์อย่าง "35mm", "anamorphic" หรือ "cinematic film look" สามารถดึงรูปแบบการนำเสนอแบบจอกว้างทั้งหมดเข้ามา รวมถึงแถบสีดำด้วย หากคุณต้องการอารมณ์ของภาพโดยไม่มีแถบสีดำ ให้ระบุพฤติกรรมแสงและเลนส์โดยตรง และข้ามคำศัพท์เกี่ยวกับฟิล์มไป

หากคุณเริ่มต้นจากรูปภาพแทนที่จะเป็นข้อความ หลักการจะเปลี่ยนไปเล็กน้อย (รูปภาพของคุณจะล็อกเฟรมแรกไว้ และ prompt จะอธิบายเฉพาะความเคลื่อนไหวเท่านั้น) เราได้เขียนอธิบายกระบวนการทำงานดังกล่าวแยกไว้ต่างหากใน คู่มือการแปลงรูปภาพเป็นวิดีโอ

วิธีการเขียน prompt สำหรับเสียงใน Veo 3.1 ทำอย่างไร?

Veo 3.1 สามารถสร้างเสียงในตัวได้ และอ้างอิงตามเอกสารประกอบของ Google เสียงจะถูกเปิดใช้งานเสมอใน API: บทสนทนา, เอฟเฟกต์เสียง และเสียงบรรยากาศรอบข้าง ซึ่งซิงค์เข้ากับภาพวิดีโอ คุณสามารถควบคุมแต่ละอย่างได้ด้วยข้อกำหนดการเขียนข้อความที่แตกต่างกัน

  • บทสนทนาจะใส่ไว้ในเครื่องหมายคำพูด โดยระบุตัวผู้พูดด้วย: ชายคนหนึ่งพึมพำว่า "This must be it." (ต้องใช่ที่นี่แน่ๆ)
  • เอฟเฟกต์เสียงจะระบุเป็นเหตุการณ์: "tires screeching" (เสียงเบรกยางรถยนต์), "waves crashing against rocks" (เสียงคลื่นซัดโขดหิน)
  • เสียงบรรยากาศจะระบุเป็นสภาพแวดล้อม: "faint hum of fluorescent lights" (เสียงหึ่งๆ เบาๆ ของหลอดไฟฟลูออเรสเซนต์), "distant seagulls" (เสียงนกนางนวลในระยะไกล)

ตัวอย่าง prompt ของ Google แสดงรูปแบบดังนี้: "A close up of two people staring at a cryptic drawing on a wall, torchlight flickering. A man murmurs, 'This must be it.'" เครื่องหมายคำพูดสำหรับบทสนทนาจะช่วยสร้างเสียงพูดที่ซิงค์กับริมฝีปาก (lip-sync) ส่วนคำว่า "flickering" (ระยิบระยับ) และ "torchlight" (แสงคบเพลิง) จะเป็นตัวสร้างโทนเสียงในห้อง

โปรดรักษาประโยคพูดให้สั้น จากการทดสอบของเรา ข้อความใดๆ ที่ยาวเกินประมาณ 12 คำต่อประโยค มีความเสี่ยงที่ส่วนท้ายจะถูกตัดออกหรือถูกพูดอย่างเร่งรีบภายในคลิปยาว 8 วินาที และจงเขียนบทสนทนาสำหรับผู้พูดเพียงหนึ่งหรือสองคนเท่านั้น ไม่ใช่กลุ่มคน เสียงที่ทับซ้อนกันจะทำให้ฟังไม่รู้เรื่อง

บน BananaBanana คุณสามารถเลือกเปิดหรือปิดเสียงได้ และมีการคิดราคาแยกต่างหากเนื่องจาก Google คิดค่าบริการแยกกัน: คลิป Veo 3.1 Fast ความยาว 8 วินาที มีราคา $0.70 สำหรับแบบไม่มีเสียง หรือ $1.00 สำหรับแบบมีเสียงที่ความละเอียด 720p หรือ 1080p วิดีโอตัวอย่างด้านบนนี้ตั้งใจให้ไม่มีเสียง ซึ่งเป็นตัวเลือกที่ประหยัดงบได้จริงเมื่อคลิปวิดีโอถูกตั้งค่าให้เล่นอัตโนมัติแบบปิดเสียงอยู่แล้ว (หากคุณต้องการให้มีเสียงในทุกคลิปโดยค่าเริ่มต้น โมเดล Omni Flash จะใช้วิธีตรงกันข้ามคือ: เปิดเสียงเสมอในราคาวินาทีละ $0.10)

คลื่นเสียง, บอลลูนคำพูดบทสนทนา และสัญลักษณ์เสียงบรรยากาศที่ไหลเข้าสู่เฟรมภาพยนตร์ แสดงโครงสร้างของ prompt สำหรับเสียงใน Veo 3.1

Prompt ด้านลบ (negative prompts), ความยาว และราคาค่าบริการของ Veo 3.1

สถานการณ์เกี่ยวกับการเขียน prompt ด้านลบนั้นน่าสับสนจริงๆ ดังนั้นนี่คือข้อมูลที่เราพบจากฝั่ง API: เอกสารประกอบของ Gemini API สำหรับ Veo 3.1 ไม่ได้ระบุพารามิเตอร์ prompt ด้านลบเอาไว้ แต่ Vertex AI endpoint ซึ่งเป็นระบบที่ BananaBanana ใช้งานอยู่นั้น ยอมรับพารามิเตอร์ negativePrompt และวัดผลได้จริงว่าช่วยปรับปรุงผลลัพธ์ในคลิปวิดีโอที่เราสร้างขึ้น ดังนั้นช่องกรอกนี้จึงมีอยู่ในระบบสร้างของเราและใช้งานได้จริง เพียงแต่อย่าคาดหวังว่ามันจะทำหน้าที่เป็นตัวกรองที่เข้มงวด

การเขียน prompt ด้านลบมีกฎข้อหนึ่งที่อาจขัดกับความรู้สึกทั่วไปจาก แนวทางแนะนำการเขียน prompt ของ Google: อย่าเขียนคำว่า "no" หรือ "don't" ในช่องกรอกค่าด้านลบ ให้แสดงรายการสิ่งที่ไม่ต้องการในรูปแบบคำนามธรรมดา เช่น "Cartoon, low quality, text overlay, watermark" จะใช้งานได้จริง แต่การระบุว่า "no cartoons" อาจส่งผลตรงกันข้ามเนื่องจากคำว่า "cartoon" ยังคงถูกประมวลผลอยู่

ความยาวและรูปแบบวิดีโอ อ้างอิงตามเอกสารประกอบของ Google และการตั้งค่าระบบของเรา: คลิปมีความยาว 4, 6, 7 หรือ 8 วินาที ที่อัตราส่วน 16:9หรือ 9:16 ด้วยความละเอียดแบบ 720p, 1080p และ 4K โดยจำเป็นต้องใช้ความยาว 8 วินาที สำหรับความละเอียด 1080p, 4K, รูปภาพอ้างอิง และการขยายความยาววิดีโอ (extension) การขยายความยาววิดีโอเป็นฟีเจอร์เด็ดของ Veo: คำขอแต่ละครั้งจะเพิ่มความยาววิดีโอได้อีก 7 วินาที ได้สูงสุดถึง 20 ครั้ง ซึ่งทำให้คุณสามารถสร้างวิดีโอที่มีความยาวเกินสองนาทีจากห่วงโซ่ prompt เดียวกันได้

ราคาค่าบริการปัจจุบันของ BananaBanana สำหรับคลิป 720p ความยาว 8 วินาที:

โมเดลไม่มีเสียงมีเสียง
Veo 3.1 Lite$0.20$0.36
Veo 3.1 Fast$0.70$1.00
Veo 3.1$1.40$3.00

คลิป Lite แบบไม่มีเสียงความยาว 4 วินาที มีราคาเพียง $0.10 และยอดคงเหลือฟรีที่ทุกบัญชีใหม่ได้รับนั้นเพียงพอสำหรับคลิปแบบนี้สองคลิป ดังนั้นวิดีโอ Veo แรกของคุณจึงไม่มีค่าใช้จ่าย และหากพูดตามตรง รุ่น Lite ที่ความละเอียด 720p ก็ดีเพียงพอสำหรับการเรียนรู้โครงสร้าง prompt ก่อนที่คุณจะใช้เงินจริงกับรุ่น Fast หรือรุ่นตัวเต็ม ตารางราคาเต็มสามารถดูได้ที่ หน้าแสดงราคา

ขั้นตอนการทำงานเริ่มต้นของผมคือ: ร่าง prompt บนรุ่น Lite ปรับแต่งจนกระทั่งความเคลื่อนไหวและเฟรมภาพนิ่งได้ที่ จากนั้นนำ prompt สุดท้ายมารันอีกครั้งในรุ่น Fast หรือ Veo 3.1 คุณภาพของ prompt สามารถส่งต่อไปยังรุ่นต่างๆ ได้เกือบทั้งหมด สิ่งที่คุณจ่ายเพิ่มคือคุณภาพการประมวลผลภาพ (render) เท่านั้น

คำถามที่พบบ่อย (FAQ)

โครงสร้าง prompt ที่ดีที่สุดสำหรับ Veo 3.1 คืออะไร?

ตัวแบบ, การกระทำ, สไตล์, กล้อง, องค์ประกอบภาพ, เลนส์, บรรยากาศ โดยเรียงลำดับตามนี้ เทมเพลตแบบย่อคือ: "[ประเภทการถ่ายภาพ] ของ [ตัวแบบ] [การกระทำ] ใน [สถานที่], [การเคลื่อนกล้อง], [เลนส์], [แสงไฟ]" คำนามที่เฉพาะเจาะจงจะดีกว่าคำคุณศัพท์ และการระบุการเคลื่อนกล้องเพียงอย่างเดียวต่อคลิปจะดีกว่าการใส่สามอย่างพร้อมกัน

Veo 3.1 รองรับการเขียน prompt ด้านลบหรือไม่?

บน Vertex AI รองรับ: พารามิเตอร์ negativePrompt ได้รับการยอมรับและใช้งานได้จริง แม้ว่าเอกสารประกอบของ Gemini API จะไม่ได้ระบุไว้สำหรับ Veo 3.1 ก็ตาม ให้เขียนคำด้านลบในรูปแบบคำนามธรรมดา ("cartoon, blurry, watermark") อย่าเขียนเป็นประโยคปฏิเสธเช่น "no X"

ฉันจะทำให้ Veo 3.1 สร้างเสียงพูดได้อย่างไร?

ใส่ข้อความคำพูดไว้ในเครื่องหมายคำพูดและระบุตัวผู้พูดใน prompt เช่น หญิงคนหนึ่งกระซิบว่า "We're not alone." โมเดล Veo จะซิงค์ปากกับประโยคสั้นๆ ได้ดี โปรดรักษาบทสนทนาให้สั้นกว่าประมาณ 12 คำต่อคลิป

วิดีโอของ Veo 3.1 สามารถมีความยาวได้สูงสุดเท่าใด?

คลิปเริ่มต้นมีความยาว 4 ถึง 8 วินาที ด้วยการขยายความยาววิดีโอ (เพิ่ม 7 วินาทีต่อคำขอ ขยายได้สูงสุด 20 ครั้ง อ้างอิงตามเอกสารประกอบของ Google) ห่วงโซ่เดียวสามารถทำความยาวได้สูงสุดถึง 148 วินาทีที่ความละเอียด 720p

วิดีโอของ Veo 3.1 หนึ่งคลิปมีราคาเท่าใด?

บน BananaBanana ราคาเริ่มต้นตั้งแต่ $0.10 (วิดีโอ Veo 3.1 Lite แบบไม่มีเสียง ความยาว 4 วินาที ความละเอียด 720p) ไปจนถึง $4.40 (วิดีโอ Veo 3.1 แบบมีเสียง ความยาว 8 วินาที ความละเอียด 4K) ตัวเลือกมาตรฐานระดับกลางคือ คลิป Fast แบบไม่มีเสียง ความยาว 8 วินาที มีราคา $0.70

tutorialvideoveoprompts