社区共学课件:OpenClaw 搭建短视频创作工作流· 第 6 / 7 页

Step 3:脚本撰写(含台词)

分镜确认后,让 OpenClaw 为每个镜头配套台词。指令中需要明确语言风格(口语化、有网感)、字数限制(每段控制在 15-25 字以内)、以及特殊要求(镜头 1 的台词要能留住观众,镜头 6 要有明确的 CTA)。

AI 生成的台词通常需要微调。常见的调整指令包括“台词再口语化一点”“钩子不够强,换一个反问句式”“结尾加上限时促销的紧迫感”。台词的好坏直接影响完播率,值得花时间打磨。

Step 4:生成文生视频提示词

提示词是 AI 视频生成的核心——它的质量直接决定视频效果。让 OpenClaw 将每个分镜的画面描述转化为视频生成模型能理解的英文提示词。一条好的提示词需要包含五个要素:主体描述、场景环境、镜头运动、视觉风格和技术参数。

举个例子,镜头 1 的提示词可能是:“A sleek white portable fan slowly emerges from darkness, soft volumetric light reveals its minimalist design, cinematic, 4K, shallow depth of field, slow push in”。如果你对英文不熟悉,完全不用担心——你只需要用中文描述画面,AI 会自动翻译成专业的英文提示词。

Step 5:视频合成与输出

提示词确认后,进入最后一步。你可以选择两种方式生成视频:一是使用视频大模型一次性生成完整视频(更简单),二是用大模型模型逐镜头生成片段后再用剪辑工具拼接成片(更可控)。

视频生成后,检查效果。如果某个镜头不满意,可以只重新生成那一个片段,不需要全部重来。这就是分步可控的优势——哪不好改哪,而不是推倒重做。

效果对比:传统方式 vs 自动化流程

对比维度 传统方式 OpenClaw 自动化
时间 拍摄半天 + 剪辑半天 20 分钟全流程
成本 外包一条 500+ 元 API 调用成本几元
批量能力 一天最多 2-3 条 一天可出 10-15 条
质量稳定性 受人员状态影响 AI 输出质量恒定
可复用性 每次从零开始 模板复用,换图即出新片

回顾整个流程:从一张白底图出发,经过产品识别、分镜设计、脚本撰写、提示词生成、视频合成五个步骤,最终输出一条可以直接发布的电商产品视频。每一步都可以暂停、修改、确认,你始终掌握着主动权。

这套流程的真正力量不在于“做一条视频”,而在于它可以无限复用。你有 50 个产品需要做视频?换张白底图,同样的流程再走一遍。需要横版和竖版两个版本?改一下尺寸参数就行。要定期更新内容?让 OpenClaw 的 Heartbeat 功能定时执行,它会在你睡觉的时候帮你把视频做好。

你学会的不是一个技巧,而是一套可以持续运转的生产系统。


相关资料

更多