ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

AI微短剧制作全流程解析:从剧本生成到常态化管线

AI微短剧制作全流程解析:从剧本生成到常态化管线 如果你这一两年有关注微短剧市场应该已经感觉到一个新变化AI 生成的微短剧越来越多。2026 年第一季度国内新增微短剧里有超过 95% 在制作链路中使用了 AI 生成能力这个比例即使存在统计口径差异也已经说明一个很直接的结论——AI 微短剧不是小众尝鲜而是成了内容供给的主力。对于编剧、剪辑、MCN 运营和工具开发者来说现在值得认真研究一整套可复现的 AI 微短剧制作流程。我先把一个判断放在前面AI 生成比例高不等于全自动。所谓“超过 95%”统计的通常是有 AI 参与主要环节比如剧本初稿、人物设计、画面生成、配音或者后期剪辑真能把项目长期跑起来的团队反而会把 AI 流程设计得非常克制只在合适的环节让 AI 接管。这篇文章不讲行业叙事按生产者视角从环境、流程、参数、验收、排查一路拆到常态化管线。1. 先弄懂这波“AI 微短剧”到底在涨什么1.1 这不是简单的工具升级而是生产方式更换传统微短剧剧组要解决人的问题演员档期、服装化妆、场地租用、灯光摄影、后期剪辑。AI 微短剧把其中很大一部分变成了“提示词、参考图、生成模型和批量任务”。同样做一个三分钟单集传统剧组最少要几天AI 流水线可以压缩到以小时计前提是人已经把流程摸熟。它并不是让所有人都不需要创作能力而是让创作能力的重心从“组织现场”转向“定义输入和判断输出”。你要能写清楚人物、场景、情绪、镜头也要能判断生成结果能不能用。这个能力和传统编剧、剪辑经验相关但又不完全一样。从行业现象来看AI 微短剧并不只是出现在低成本供给端。现在很多专业团队、短剧平台、MCN 机构也在用 AI 做前期概念片、批量测试选题、多语言版本甚至直接做完整剧集。市场节奏越来越快一周内要测试十个题材方向过去很难做到AI 让“先快速生成再看数据”成为可能。1.2 超过 95% 这个数字怎么读如果你看到“95% 的新微短剧由 AI 生成”先不要理解成“95% 的内容已经完全不需要人”。在行业统计里这个数字一般包括“AI 参与生成”。例如剧本由大模型产出初稿、人物和场景图由 AI 生成、后期配音由 TTS 完成、字幕和素材辅助由 AI 做只要某个关键环节用了 AI都可能被归入这个比例。现实中全自动生成的短剧还很难做到。多数团队的做法是AI 提供海量初稿和中间素材人工负责选题、审核、修改、拼接和发布。比例高说明 AI 的渗透率已经足够高不代表每个环节都无人值守。这里我想提醒两点。第一对外宣传时要分清“AI 参与”和“完全 AI 生成”不要把口径当成能力承诺。第二内容平台对 AI 生成内容的展示和审核要求正在收紧实际投放前要把规则看明白否则制作效率再高也过不了发布这一关。1.3 谁最应该现在开始研究第一类是编导和编剧。需要高频产出内容创意AI 能帮他们把“点子”快速拆成分场剧本。第二类是剪辑和后期。过去要等拍摄素材现在可以直接参与生成式工作流可以在素材还没有“拍”出来之前就开始设计节奏和叙事。第三类是 MCN 和内容运营。短剧本质是内容产品必须用数据快速试错AI 让试错成本明显下降。第四类是工具开发者。由于需求快速增长很多团队想要内部交付流水线你可以把这套流程接口化、队列化、产品化。2. 从“能出片”到“能稳定更新”先确认你的运行条件2.1 本地、云端和在线平台怎么选先想清楚自己是“学习验证”还是“批量生产”。如果是学习验证优先用在线平台。不需要本地显卡只要注册账号、准备提示词、上传参考图就能生成。缺点是排队和价格不适合大量重试。如果是本地部署用途偏向探索可控性和隐私。常见图像生成模型在 12GB 以上显存可以跑但要留有性能余量如果机器只有 8GB 甚至更低可以跑但要把分辨率降下来使用精简模型速度会比较慢。视频生成模型对硬件要求更高本地搭建前要确认显存、内存、磁盘和模型依赖不要只看模型下载大小。如果是批量生产建议使用云端 GPU 或在线平台的批量接口。云端的好处是可以弹性开多卡缺点是网络传输、任务监控和成本跟踪都要额外做。不要一上来就开八卡并发先用一张卡跑通再逐步加。我自己的经验是第一批测试用在线平台最省事。把剧本、分镜、参考图全部准备好再考虑要不要投入本地基建。先解决“能不能出片”再解决“能不能规模化”。2.2 软件栈和模型组合AI 微短剧不是某一个模型完成的而是由一条模型链完成。生产环节输入常见工具/模型类型输出剧本题材、人物、剧情走向大语言模型分集剧本、台词、分场表分镜剧本片段大语言模型 / 表格工具镜头列表角色与场景人物设定卡、场景描述文生图模型角色参考图、场景参考图视频片段参考图 动作提示词文生视频、图生视频模型5-10 秒视频片段配音台词文本TTS 语音合成对白音频后期视频、音频、字幕剪辑软件 / 合成工具成片这里不固定推荐某个具体模型因为演进非常快。常见实践是用大语言模型处理文本用图像模型设计角色和场景用视频模型生成动态画面再用传统剪辑工具合成。只要每个环节能输出标准文件就可以替换内部组件。反过来如果某个平台把文本、图画、视频、配音全部封闭在一个界面里也更方便新手起步只是批量化和定制化能力通常会弱一些。2.3 数据和素材准备先建好人物设定卡和场景设定卡很多人生成出来的角色第一集和第三集长得不一样原因是提示词根本没有做到“受控”。要解决这个问题建议先建立结构化的设定卡。人物设定卡至少要有这些字段角色名林然 年龄28 外貌黑色长发五官立体眼神犀利 服装灰色风衣黑色内搭金色耳环 习惯动作说话时习惯双手交叉放在桌面 场景风格现代都市职场办公室 统一参考词林然_职场_灰衣场景设定卡也需要单独维护场景ID林然办公室_白天 画面描述现代简约办公室落地窗窗边有城市天际线 光线自然光偏冷色调 道具黑色办公桌笔记本电脑蓝色文件夹 统一参考词办公室_白天_城市远景这些设定卡是给人类看的也是给 AI 用的。你在文生图和视频生成时把对应的设定卡作为参考描述写进提示词人物一致性会比随手写一段描述稳定得多。批量任务尤其需要结构化否则几百集素材最后根本没法管理和复用。3. 一套最小可复现的 AI 微短剧制作流程3.1 用大语言模型搭剧本和分集结构微短剧单集通常在 1-3 分钟目标是快速抓住注意力。AI 写剧本能写很快但你需要给它足够明确的约束否则会得到一堆空泛对话。我给大模型的提示词一般包含这些元素题材类型、主角和目标、集数、单集时长、节奏要求、结尾钩子。下面是一个可用的示例请帮我写一部面向短视频平台的现代都市情感微短剧共6集每集约60秒台词控制在300-500字。 主角是28岁女性林然职场管理层性格冷静但家庭关系复杂。配角包括她的助手小周和前同事陈默。 要求 1. 每一集要有独立冲突。 2. 前10秒必须有悬念。 3. 每集结尾留一个钩子。 4. 输出格式为分场脚本包含场景、角色、动作、对白、镜头提示。 先从第1集开始。模型输出后不要直接进入素材生成。先做三件事检查角色说话口吻是否一致删除可能引发平台审核问题的内容把较长的对白拆短因为视频生成模型很难处理长台词。改完初稿后再把每一场拆成镜头。3.2 把剧本拆成分镜表分镜表是素材生成的“施工图”。一个 60 秒的单集建议拆成 8-12 个镜头每个镜头用一句话描述画面和动作。例如镜头1中景林然坐在办公室桌前抬头表情冷淡交代办公环境。 镜头2近景林然拿起手机看到一条消息眼神变化。 镜头3特写手机屏幕上出现“项目终止”四个字。 镜头4侧面镜头林然站起来走往窗边停顿背影。镜头数量不是越多越好太长会增加生成成本太短会显得画面碎。我一般每个镜头控制在 4-8 秒方便后续剪辑时重排。拆完分镜后手动给每个镜头补充镜头运动、光线和情绪例如“缓慢推近”“手持晃动”“逆光”“从平静到紧张”。3.3 生成角色参考图和场景参考图生成分镜前先要有稳定的角色参考图。常见做法是用文生图模型生成一张“标准正面照”再基于这张图生成不同角度的形象最后把统一参考图固定在提示词里。提示词模板可以先这样写正面女性28岁黑色长发灰色风衣黑色内搭金色耳环现代职场浅景深电影感4K。 负面变形手指多余肢体模糊水印文字。生成后检查服装、发型、脸型是否稳定。如果差异大不要继续往下跑视频先调整参考图。很多视频模型支持“图生视频”你可以把角色参考图作为第一帧再描述镜头动作。这样能减少从零生成的随机性。场景图也一样同一场景只保留一张基座图后续镜头都围绕它变化角度和光线。批量生成时确保每张图都写上场景 ID不然后期很混乱。3.4 生成视频片段视频生成是成本和失败率最高的环节它的操作逻辑是输入参考图 动作提示词输出一段短视频。这里需要注意时长不要一次生成太长。通常 5-8 秒效果更稳超过 10 秒后人物变形、画面闪烁的概率会明显增加。动作描述要单一。一个镜头只做一件事例如“林然从椅子上站起来转身看向窗外”而不是“林然站起来、抱怨、再拿电话”。用固定 seed 做回放。如果你发现有某个镜头的画面构图不错只是动作不自然尽量在同一个参数附近重跑不要每次都换随机种子。生成候选片段要留下记录。同一镜头可以生成 2-3 条候选选择动作最自然的一条其余删掉或归档避免素材堆积。我一般会先用 5-6 个镜头做小批量测试确认质量后再继续。不要一次性提交 50 个镜头然后看天吃饭。3.5 配音、音效和字幕配音用 TTS生成对白时注意标点和停顿。很多 TTS 对长句处理不好建议在台词里使用短句。例如“方案是什么时候改的”比“你能不能告诉我这次方案到底是在什么时间节点改的”更容易被 TTS 读得自然。字幕建议单独生成 SRT 文件并在剪辑软件里叠加不要在提示词里要求生成文字水印。模型生成的文字经常乱码后期叠字幕反而更可控。背景音乐和音效可以来自版权明确的素材库或者在合规前提下用 AI 生成配乐。如果平台要求提供授权信息要保留使用记录。3.6 剪辑合成和发布验证剪辑阶段和传统短剧差不多先按叙事顺序排列镜头前 3 秒放冲突或悬念把节奏拖沓的长镜头剪掉配音和画面要对齐字幕不能超出安全区域。输出建议用 H.264 编码的 MP4分辨率按平台要求调整常见是 1080p。发布前做一次完整目检重点看人脸是否出现突变、场景信息是否符合剧情、字幕是否有错字、有没有生成出莫名水印。如果平台有 AI 生成内容标识要求按平台提示完成标注。这是合规问题不要抱有侥幸心理。4. 关键参数和验收标准别只看“能跑”4.1 常用参数怎么调有几个参数最容易影响结果分辨率先 1280x720 测试最后交付再用 1080p。不要在测试阶段把分辨率拉满消耗资源且不利于快速迭代。帧率短剧一般 24fps 或 30fps。24fps 更有电影感30fps 更适合竖屏资讯流。片段时长5-8 秒。越短越容易控制质量。Seed固定 seed 可以在相似画面间保持一致性也方便后期重跑。负面提示词包含“变形手指、多余肢体、模糊、文字、水印”等常见问题描述。这些参数通常不需要每个人都理解底层原理但建议把当前参数记录在素材管理表里知道哪张图是用哪套参数生成的。否则遇到质量问题你很难回滚或重做。4.2 验收标准素材能不能进入下一环节应该有一套明确标准。我这里整理一份自用的验收清单人物和参考图相比面部、服装、发型没有明显变化。画面中不存在手指崩坏、肢体多余或场景穿插。动作符合镜头描述没有出现平移闪烁。单个视频片段能循环播放、不出现明显跳帧。配音语速正常情绪和台词内容匹配。字幕文字准确没有多余空格和错字。如果第一条不过不要继续生成先回到角色设定卡和参考图。如果第二条不过可以考虑降低片段时长或重跑。如果多数片段都不过可能要考虑更换当前使用的模型或换一种镜头描述方式。4.3 成本和吞吐量估算做一个 3 分钟短剧假设每个镜头 8 秒大约需要 22-23 个可用镜头。由于视频生成有失败率按 50% 的通过率估算实际生成量会到 40-50 条。把算力成本、时间成本和人工筛选成本都放进预算才不会出现“生成几小时最后没有一条能用的局面”。越往批量走越要关注任务队列和并发。不要无限制提高并发因为在线平台有账号和排队限制云端 GPU 也会出现显存或带宽瓶颈。建议先跑 10 条任务看平均耗时和成功率再决定是否加并发。4.4 内容审核和平台合规检查AI 生成内容不是天然安全。台词、画面、角色形象都可能有风险。我的习惯是在 TTS 生成前先做台词敏感词过滤在视频生成后做画面抽帧检查。如果生成的人物与真实人物高度相似需要更换参考图或提示词。未经授权使用真实人物肖像、知名品牌、受版权保护的音乐都可能成为发布环节的雷。平台规则也在变化发布前要查看每个平台对时长、清晰度、AI 标识、广告推广内容的要求。不是所有平台都能接受
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进