外观
AI 短剧制作全流程(外部收录)
收录说明:本文是一篇 AI 短剧(真人写实风)从 0 到 1 的实战教程,与本站教授的 AI 漫剧工作流在「剧本 → 分镜拆分 → 角色锁定 → 图生视频 → 配音 → 剪辑出片」主干上高度一致,收录于此作为旁证与补充参考。文中图片已全部转存本地;示例视频仍为外部源文件。文中工具价格与参数为发布时(2026-08)口径,过期请按信息验证与持续追踪的官方渠道复核。收录时对个别明显笔误做了修正,其余保持原文。另请注意:原文两处数字关系并不自洽("60 秒短剧、15-20 个镜头"与"每镜头 5-10 秒"相乘为 75~200 秒;"高潮 10-15 秒"与"20 秒动作高潮"并存),收录保持原样不做辩护——镜头数请按成片时长倒推(60 秒 ÷ 3~6 秒/镜 ≈ 10~20 镜,与本站甜区一致),"每镜 5~10 秒"属写实短剧的长镜头打法,与本站漫剧口径的差异见下方警告框。
与本站口径的四处差异(对照阅读前必看)
- 镜头时长:本文按写实短剧写"每镜头 5~10 秒";本站漫剧管线以 3~6 秒为甜区(时长越长漂移越不可控)。
- 外貌复述:本文坑 1 的解法是"提示词原样复制角色外貌",适用于未挂参考图的场景;本站漫剧管线默认已挂角色参考图/LoRA,提示词不复述外貌(复述会与图像条件打架,见角色一致性)。
- 音频路线:本文以音画一体(视频内同步生成对白)为主线;本站主线为独立三轨(配音/音效/配乐分轨制作),音画一体仅作效率补充。补注(2026-09):平台新增的"音频驱动"能力(上传自制配音、生成端同步口型)部分缓解了收录文工艺的可控性短板,但不改变分轨制作的根本理由(返修粒度/成本结构/混音分轨)——定位与理由见配音 / 音效 / 配乐。
- 目标函数:本文是"单人剧组、批量生产"的走量打法(铺集数赌爆款);本站主线为精品漫剧路线——质量优于数量,单作打磨优先于集数产能。两路线的成本结构与验收标准不可直接互套,其工艺演示仍有参考价值。
打开红果短剧的热播总榜,排名前五的作品里,AI 短剧占了四席。《万妖图录传》连续十一季连播,成为现象级作品,背后的光宇团队不到 20 人。
另一部 AI 短剧《都重生了,谁还装富二代啊》做到第九季,20 人团队,三天出一季,九季共 729 集。《一枕山河踏月来》一人 7 天,上线 24 小时播放量突破 1700 万,登顶抖音短剧榜新剧分类榜第一名,3 天全网播放量破亿。
单人剧组,批量生产,千万热度,普通人也能分蛋糕。
下面我们把完整的 AI 短剧制作流程展开,从剧本到成片,每一步用什么工具、怎么写提示词、花多少钱,全部说清楚。
▲ 原文示例视频(AI 生成,外部源文件)

第一步:用 DeepSeek/ChatGPT 生成剧本
AI 短剧看是短剧,不是 AI。短剧的流量密码就两个字:钩子。前 15 秒抓不住人,后面拍得再好也白搭。AI 短剧能在榜单上碾压真人剧,就是反复堆积爽感,每集都有打脸和逆袭。
剧本提示词
text
请写一部3分钟以内的重生逆袭类短剧剧本,格式如下:
【剧名】:(3-5个字,带钩子)
【题材】:重生/逆袭/打脸
【核心爽点】:一句话说清楚"观众为什么会爽"
【人物】:
- 主角:[姓名],[年龄],[核心身份],[性格标签],[重生前的困境]
- 反派:[姓名],[年龄],[核心身份],[性格标签]
【剧本正文】:
场景一:[地点][时间]
(画面描述:谁在哪儿、在做什么、情绪状态)
[角色名]:[台词]
【分镜要求】:
- 全剧控制在15-25个镜头
- 每个镜头时长5-10秒
- 前3个镜头必须出现:身份反差、冲突预告、情绪钩子
- 每3-5个镜头设置一个小反转小技巧:学习剧本创作最好的方法是模仿,先让 AI 拆解一个爆款的剧情套路,再创作新的剧本,慢慢熟能生巧。

第二步:拆分时间线
自 Seedance 2.5 推出后,本人的一个省钱小经验。
很多人做 AI 短剧有一个误区,所有镜头都用最新的 Seedance 2.5 生成,积分烧快,成本控不住。
正确的做法是,按镜头类型拆分,不同难度用不同版本,先用 Seedance 2.0 廉价建立角色与环境,再以上一段视频作为参考,让 Seedance 2.5 生成复杂高潮。
| 镜头类型 | 推荐工具 | 原因 |
|---|---|---|
| 建立镜头/简单运镜(15-20 秒) | Seedance 2.0 | 基础推拉摇移、建立环境,2.0 足够用,价格便宜得多 |
| 高潮/复杂动作/叙事核心(10-15 秒) | Seedance 2.5 | 只在关键段落用 2.5,物理更稳定、动作更连贯 |
这样故事更完整、物理更稳定、积分大幅节省。
为什么这样更省?很多人担心拆分会更费积分,但忽略了失败率。一次复杂生成失败 = 全部积分白费。拆分后成功率和可控性大幅提升,反而更省。
环境、角色入场、情绪铺垫用 2.0;冲突酝酿、对话推进用 2.0;20 秒动作高潮:打斗、爆发、反转用 2.5。

第三步:GPT Image/即梦锁定角色三视图与场景参考图
角色一致性是 AI 短剧最大的坑,同一个角色,上个镜头长这样,下个镜头就换人了,差评不断,我们必须在生成视频之前先把角色锁死。

角色三视图提示词
用 GPT Image 或即梦生成角色的正面、侧面、3/4 侧三视图。多角度角色参考图(正面、侧面、背面加上面部特写)锁定为参考图像,然后将其输入到每一次图生视频生成中:
text
生成一张电影级角色设定板,浅灰中性背景,非对称拼接排版:
中央:角色全身立像
周边:全身多角度转面图(正面、3/4侧、正侧、背面)
侧边:头部细节研究组图(正面、3/4、正侧、低头、抬头)
局部:服装与配件拆解说明,带材质标注引线
角色:[填写名字],[填写外貌特征],身穿[填写服装]。
风格:写实电影质感,自然抓拍感,拒绝摆拍。全角度五官、发型、身形比例严格一致。这张图会作为后续所有视频生成的锚点,每个镜头的提示词都要引用它。
场景参考图同理,为每个主要场景生成 2-3 张参考图,标注空间方位关系(如南侧入口、北侧后院、中间庭院等),后续生成时保持空间逻辑一致。

第四步:Seedance 2.5/可灵做图生视频,批量生成片段

图生视频比文生视频稳定得多,用角色三视图作为参考,模型就锁定了"这个人长什么样",提示词只需要告诉它"这个人接下来做什么动作"。
公式(来自 Seedance 官方提示词指南):
主体 + 动作或事件 + 场景与环境(可选)+ 视觉风格(可选)+ 运镜或切镜(可选)+ 声音(可选)
写提示词时,先说清楚想生成什么,再按需要写明参考素材、事件过程、视觉表达和声音。
完整案例:《武馆挑战》
这套提示词来自一位专业 AI 短剧创作者的实际工作流,他先用 GPT Image 生成角色与场景参考图(@Image 1~8),分别定义武馆的完整地理(街道、正门、前院、内门、高门槛、主院、侧廊、后练功厅)、咏春与洪拳弟子的服装、两位师父的形象,再写极详细的分段提示词。

Part 1 提示词(30 秒入场,使用 Seedance 2.0):
text
[参考资料]
@图像1确立了武馆的整体空间布局:街道、正门、入口庭院、内门、高门槛、主庭院、侧廊以及后方练武厅。
@图像2呈现了雨后湿润的街面立面、花岗岩台阶、木质大门。
@图像3确立了从正门通往后方练武厅的连贯轴线。须保留所有的门、地面高差及行进动线。
@图像4呈现了主庭院、后厅、校名牌匾、廊道、石板铺地及光影效果。
@图像5仅呈现咏春拳学员的暖灰色上衣、黑色长裤及黑布鞋。
@图像6仅呈现洪拳学员的靛炭色练功服及牛血红腰带。
@图像7呈现咏春拳师父的身份特征、精瘦体格及象牙白服饰。
@图像8呈现洪拳挑战者的身份特征、魁梧体格、炭色服饰及深红腰带。
[目标]
制作一部香港历史背景功夫片短片(共两部分,总时长60秒)的第一部分。
这30秒的片段旨在构建武馆场景,引出挑战事件,并在格斗即将开始前戛然而止。
对白语言:地道的香港粤语。语音与画面自然同步。不加字幕、标题、书法或图形文字。
[空间布局与调度]
正门位于南侧入口处。门后紧接着是第一个室外练武场。
洪拳挑战者停留在南侧入口附近(正门内侧),未越过内门槛深入。
咏春拳师父位于相对的另一端——北侧后方练武厅的深处。
主庭院与高门槛将两人隔开。
全程保持这种南北方位的空间关系。不得出现瞬间移动或出入口方位错乱的情况。
[0–6秒 — 逼近]
以高角度广角全景镜头开场。画面上半部分展示武馆立面;前景处是雨后湿润的街道。
来自@Image8的洪拳挑战者正沿街走向武馆。他的三名弟子紧随其后,保持着严整的三角形阵型。
挑战者右手持一封封口的红色战书,目光始终锁定武馆入口。
保持广角镜头,交代上方的武馆、下方逼近的队伍以及连接两者的花岗岩台阶。
当挑战者抵达台阶时,镜头开始缓慢下降并横向移动,跟随他向大门走去。
他穿过正门。
[6–11秒 — 闯入]
切至第一个练武场内的广角镜头,回望正门方向。
挑战者进入并在门内三步处停下。三名弟子在其身后呈浅纵深队形停步。
他必须停留在入口附近,不得跨过内侧较高的门槛。
在更深处练功的三名咏春弟子察觉到来者,随即停下动作。
挑战者将封口的红信放在入口旁的木架上,随后透过敞开的内门望向远处的武馆牌匾。
大师兄认出了这份正式战书,目光在信件与挑战者之间游移,随后转身走向后堂。
[11–16秒 — 警示]
从后方跟拍大师兄,他正快速穿过主庭院,向后方练武堂走去。
他的行进路线须沿用@Image3确立的中轴线。
后堂内,咏春宗师站在一张木制练功台旁,侧身背对入口。
弟子在恭敬的距离处停步,行抱拳礼,语气急促而克制地说道:
{师父,外面有人来踢馆。}
宗师的手停在了正在整理的物件上。他先转头望向庭院,随后才转身。
[16–21秒 — 师父登场]
师父从后堂走出,大弟子紧随其后,落后半步距离。
采用正面中远景镜头,在他们步入庭院的过程中进行后退跟拍。
咏春弟子们移至左侧廊下,腾出中央的切磋场地。
画面切至沿庭院中轴线拍摄的对称长镜头。
师父在内侧门槛的北面站定。
挑战者则停留在靠近正门南面一侧。
两人隔着庭院相对而立。Part 2 提示词(30 秒对打高潮,用 Seedance 2.5 + 上一段视频):
text
[参考角色]
@视频1为后续扩展的源视频。它定义了完整的前情提要,包括人物身份、服装、武馆布局、物品位置、灯光、音效环境、镜头方向以及最终对峙场景。
@视频1控制扩展边界和开口合成。
[向前延伸]
@视频1是向前延伸的源视频。
向前扩展@视频1。扩展片段的第一帧直接从@视频1的最后一帧继续。
保持两位大师准确姿势、方向、目光和距离的连续性;学生的立场;红色挑战信;固定的学校牌匾;门槛;庭院建筑;背景和空间关系;锁定的相机位置和构图;潮湿阴暗的灯光;以及@视频1结尾处建立的无声紧张气氛。
[动作段落概要]
挑战者率先出手,洪拳刚猛直进,拳风破空。
咏春师父以寸劲接招,连消带打,在方寸之间化解三记重拳。
挑战者变招为扫腿,师父提膝格挡,顺势进马,一记摊打正中挑战者胸口。
挑战者后退三步,卸力重整,两人拉开距离。
第二回合:挑战者双拳齐出,师父以问路手探其虚实,随即转膀手破开中路,连消带打迫其后退。
挑战者被逼至内门附近,师父停手,示意点到为止。
挑战者低头抱拳,转身离去。红色战书仍留在原处。
师父目送其离开,转身回到后堂。
第五步:配音与音效
配音在图生视频时已经可以一并生成,Seedance 2.5 支持多语言台词生成和口型同步,你只需要在提示词里写清楚谁在什么时候说什么话。

台词嵌入写法
在视频提示词中加入台词指令,格式为 {角色名:台词}:
text
参考@图1中角色的外貌。角色站在画面中央,面无表情,嘴唇微动说出台词:
{师父,外面有人来踢馆。}
口型与台词同步,自然的粤语发音,语气急促而克制。
无背景音乐,保留环境音。对白语言可以指定为地道的香港粤语、日语、韩语等,语音与画面自然同步。
音效独立处理
如果对 AI 生成的音效不满意,可以用剪映或讯飞配音单独处理:
- 从生成的视频中截取音频片段作为配音参考
- 用剪映的文本转语音或讯飞配音生成纯净人声
- 导出为 48kHz WAV 格式,导入剪辑软件对齐
声音设计原则
- 环境音比 BGM 重要:车流声、脚步声、开关门声,这些才是建立真实感的关键
- 无 BGM 有时比有 BGM 更高级:全程依靠真实的环境音(车流、引擎、急刹)、动作音效(撞击、拔枪)以及人物原声对白
- 台词单独导出:每句台词生成独立音频文件,剪辑时灵活性更高

第六步:剪映拼接、调色、字幕、导出
剪辑顺序
- 先铺画面:把所有选中的视频片段按分镜顺序拖入时间线
- 再对音频:把配音和音效文件对齐到对应画面
- 最后调色:统一所有片段的色温和对比度

统一调色
AI 生成的视频片段之间色温往往不一致。用剪映的色温和色调工具,把全部片段调到同一个基准线上,再统一套一个 LUT 或滤镜。
自动字幕
剪映的识别字幕功能可以自动从音频生成字幕,生成后手动检查断句和标点。
导出设置:H.264 编码,1080p 分辨率,24fps 帧率。

完整成本对比
以一部 60 秒短剧、约 15-20 个镜头为例:
| 成本项 | AI 单人剧组 | 传统微剧组 |
|---|---|---|
| 剧本 | DeepSeek/ChatGPT(免费-20 元/月) | 编剧费 500-2000 元 |
| 分镜 | AI 自动生成(0 元) | 分镜师 300-1000 元 |
| 角色设计 | GPT Image/即梦(约 50-80 元) | 造型师+服装 500-3000 元 |
| 视频生成 | Seedance 2.0+2.5 混合(约 200-400 元) | 摄影+器材 2000-10000 元 |
| 配音 | AI 生成(含在视频生成中) | 配音演员 300-2000 元 |
| 剪辑 | 剪映免费版(0 元) | 剪辑师 500-3000 元 |
| 总计 | 约 250-500 元 | 约 4000-20000 元 |

2026 工具推荐表
| 环节 | 推荐工具 | 特点 | 费用 |
|---|---|---|---|
| 剧本/分镜 | DeepSeek / Claude | 免费额度充足,支持长上下文 | 免费-20 元/月 |
| 角色图 | GPT Image / 即梦 | 角色一致性控制强 | 按量计费 |
| 视频生成(建立/运镜) | Seedance 2.0 | 基础推拉摇移,价格便宜 | 约 0.07 美元/秒 |
| 视频生成(高潮/动作) | Seedance 2.5 | 单次 30 秒,物理稳定,动作连贯 | 约 2.7 元/秒(1080P) |
| 视频生成(备选) | 可灵 3.0 | 图生视频+主体参考,角色锁定强 | 按量计费 |
| 配音 | Seedance 2.5 内置 / 剪映 AI | 口型同步,多语言支持 | 含在视频生成中 |
| 音效 | 剪映 AI / 讯飞配音 | 环境音、脚步声、开关门声 | 免费-少量付费 |
| 剪辑/调色/字幕 | 剪映 | 自动字幕、调色、导出一站式 | 免费版够用 |
注:上表"Seedance 2.0 约 0.07 美元/秒"与调研报告 §4.1 的"约 1 元/秒"为不同计费口径(API 刊例价 vs 平台积分/档位价),横向比价前先对齐前提。

三大踩坑与解决方案
坑 1:人脸漂移
解决方案:
- 用图生视频而非文生视频,以角色三视图为首帧锚定
- 每个镜头的提示词原样复制角色外貌描述
- 如果连续生成多次后出现漂移,使用原始参考图而非已生成帧来重新锚定
- 可灵 3.0 的"图生视频+主体参考"技术可以锁定面部结构跨镜头一致
坑 2:光影不统一
解决方案:
- 同一场景的所有镜头集中生成,保持光照条件一致
- 剪辑时先统一调色再套风格 LUT
- 在提示词中明确光影方向
坑 3:空间逻辑混乱
解决方案:
- 在提示词中明确空间方位关系(南侧入口、北侧后院、中间庭院)
- 标注关键地标(门槛、牌匾、廊道)
- 规定人物移动路线,禁止瞬间移动

写在最后
AI 短剧能不能爆,跟 AI 做关系不大,重要是内容,要让观众有代入感。
第一,开篇钩子。身份反差、冲突预告、情绪钩子,不要觉得别人写过,这些都是被验证过的公式。
第二,角色锁定。观众认不认得这个角色,比画面精不精美重要得多。人脸漂移一次,观众出戏一次。三视图+图生视频+提示词复用,这三件事做扎实了,角色就稳了。
第三,节奏把控。5-10 秒一个镜头,每 3-5 个镜头一个小反转,全程不留气口让观众划走。
用 2.0 建立环境和简单运镜,只在关键高潮段落用 2.5,既保证了质量,又把积分花在刀刃上。一部 60 秒的短剧,15-20 个镜头,混合使用 2.0 和 2.5,总成本可以控制在几百元以内。
工具在变,成本还会降,但内容本身的规律没变,谁会讲故事,谁就能拿到流量。把上面的模板复制过去,跑一遍流程,你就知道了。