外观
术语表
阅读中遇到不懂的术语先查本页:每条一句话定义,并链接到它的"首讲"章节。定义口径以首讲章节为准,本页只做索引。
作品形态
- 漫剧:以漫画/二次元画风呈现、制作上以"图生视频"为核心环节的剧集形态,含竖屏与横屏两种形态,是本教程的主攻管线。首讲:前言
- 精品漫剧:本教程的产品定位——质量优先于产量的路线:画质以高清精致为目标、剧本与制作全链路打磨;预算是约束不是目标,精品 = 把预算与时间花在刀刃上。首讲:前言
- 形态决策:选题期对作品形态的一次性联动选择——竖屏(红果/抖音)或横屏(B 站/YouTube);平台、变现、单集时长、构图体系随之确定,定版后全剧不切换。首讲:全流程总览
- 短剧:写实真人风格的竖屏剧集形态;当前 AI 在表演、口型、多镜头一致性上短板明显,教程中仅作对比/进阶内容。首讲:前言
- 恐怖谷:仿真形象越接近真人,观众对其瑕疵越敏感的心理效应——写实 AI 短剧当前不可行、漫剧得以免疫的核心原因。首讲:缺陷与优势
- 全流程:漫剧制作的七个环节——剧本 → 分镜/美术设定 → 图像资产 → 视频生成 → 配音/音效 → 剪辑成片 → 发布运营。首讲:全流程总览
- 结业作品:路线图的验收标准——学习者独立完成一部按所选形态定版的漫剧并发布到至少一个平台(竖屏 3~5 集 × 每集 1~2 分钟;横屏 2~3 集 × 每集 4~8 分钟),另设两个中间里程碑。首讲:学习路线图
- 创作语言:产出物的美学/叙事知识(构图、光影、色彩、镜头语言、混音、配音表演等),决定产出物好不好看/好听——以"概念基线"小节嵌入实战各章,不进附录。首讲:全流程总览
- 媒介工程基础:产出物(图像/音频/视频)作为数字文件的底层知识(格式、参数、编码、色彩空间、采样率、帧率、码率等),决定产出物能否被下游正确消费。首讲:数字媒介基础
画风与风格
- 赛璐璐:硬边缘阴影的平涂二次元技法——色块分区明确、线条清晰,是 AI 出图中一致性最容易锁定的画风,新手练手首选。首讲:画风图谱与挑选指南
- 厚涂写实:以电影级光影与材质感呈现的画风谱系(区别于仿真人路线),内拆两子档——2D 厚涂(绘画感)与 CG 厚涂(渲染感)。首讲:画风图谱与挑选指南
- CG 厚涂:厚涂写实谱系的渲染感子档(都市拟真向)——人物为写实比例 CG 美型(禁照片级写实词,与仿真人以「人景分轨判据」划界),场景为仿真实景且与人物同光源同色调;本站主线示例画风。首讲:画风图谱与挑选指南
- 3D CG 级:精致美型建模 + 写实材质渲染 + 全局光照的 3D 精品档位(三维动画电影/游戏 CG 水准),与"3D 卡通"是同一谱系的不同品质档次。首讲:画风图谱与挑选指南
- 画风定版:选定谱系 → 选参考图锚定全剧风格 → 测试模型能否稳定复现 → 画风段存入固定模板全剧复用的流程。首讲:分镜与美术设定(画风菜单见画风图谱)
- 光环境模板:把光影/色调描述固化为可复用提示词段的做法——同场景写死光源方向、色温、强度,抑制跨镜头光影漂移。首讲:画风图谱与挑选指南
- 三距离审图法:判断画面执行质量的审图方法——远观(剪影/构图/色调大关系)→ 中观(光影立体/色彩和谐)→ 近观(细节瑕疵/完成度),三遍各有独立修复路径。首讲:画风图谱与挑选指南
视频生成技术
- 文生视频(T2V):只以文字提示词为条件生成视频,画面的全部约束都来自文字;构图与角色可控性低,漫剧管线中只用于灵感探索与空镜。首讲:图生视频 vs 文生视频
- 图生视频(I2V):在文字条件之外注入首帧图像条件,模型只回答"从这帧画面出发,接下来怎么动"——漫剧管线的核心环节。首讲:图生视频 vs 文生视频
- 甜区(生成甜区):视频模型稳定生成的时长区间(约 3~6 秒)——短于下限信息量不足、长于上限翻车率陡增;分镜时长设计的基本约束。首讲:分镜与美术设定(成本纪律见视频生成)
- 首尾帧(FLF2V):I2V 的加强版——首帧与尾帧两端的潜变量都锁定,模型只补中间运动,用于姿态控制与镜头衔接。首讲:图生视频 vs 文生视频
- 参考生视频:不限于首帧,把角色/物体的多张参考图特征注入生成过程,用于跨镜头的主体一致性。首讲:图生视频 vs 文生视频(深入见角色一致性)
- LoRA:低秩微调——不改动原模型权重,只训练一对低秩增量矩阵(产出几 MB~几百 MB 的小权重文件),之后用触发词精确召回角色。首讲:角色一致性技术路线
- IP-Adapter:参考图特征经解耦交叉注意力注入模型的免训练方案,是各平台"参考图绑定/主体绑定"功能的技术原型。首讲:角色一致性技术路线
- 元素绑定:可灵的角色/元素一致性能力——多角度角色图或一段参考视频建"元素",社区口径多参考一致性约 95%【社区】。首讲:视频生成
- 主体库:Vidu 的角色绑定功能——上传 1~7 张参考图建主体库(参考生视频最多 7 图),动漫画风镜头常用。首讲:角色一致性技术路线
- DiT:用 Transformer 做扩散模型的去噪主干——视频潜变量被切成时空 patch 当 token 处理,是主流视频模型的架构基础。首讲:视频生成模型如何工作
- 潜空间:VAE 把视频压缩进的低维表示空间;扩散去噪全程在其中进行,最后再解码回像素——算力可行性的关键。首讲:视频生成模型如何工作
- 蒸馏:让小模型模仿大模型的采样结果以换取速度的技术;各平台"极速/标准/高品质"档位的本质。首讲:视频生成模型如何工作
- 抽卡:每次生成从随机噪声出发、采样路径有随机性,同一提示词需多次生成直到验收通过——是必然成本,不是你没写好提示词。首讲:视频生成模型如何工作(控本纪律见视频生成)
- CFG(无分类器引导):每步去噪对"有提示词/无提示词"各预测一次、把差值放大 s 倍的条件强化机制——s 就是工具里"引导强度/创意度"滑块;负面提示词的本质是把无条件一路替换为负方向。首讲:视频生成模型如何工作
- 流匹配(flow matching):扩散模型的现代训练范式——不再预测噪声,而是学习"从噪声直线流向数据"的速度场,轨迹更直、所需步数更少;Wan2.x/HunyuanVideo/Seedance 等现役模型均以此训练,ε-预测可视为其特例。首讲:视频生成模型如何工作
- 调度器(sampler)与采样步数:控制去噪迭代轨迹与步数的组件——DDIM 等改进把原版约 1000 步压到数十步,蒸馏再压到几步;平台"极速/高品质档"的本质差异。首讲:视频生成模型如何工作
- VAE(变分自编码器):把视频压缩进潜空间再解码回像素的编解码器——空间约 8×8 压缩,小字与细密纹理等高频细节在压缩中丢失、靠脑补还原。首讲:视频生成模型如何工作
- 时空 patch:视频潜变量被切成的小块——一个小块同时覆盖几帧画面的一小片区域,整段视频由此变成一串 token 交给 Transformer 去噪。首讲:视频生成模型如何工作
- MoE(混合专家):把网络拆成多个"专家"、每步只激活其中部分的架构——Wan2.2 高噪专家管布局、低噪专家管细节,容量上去而单步成本不增。首讲:视频生成模型如何工作
- 交叉注意力:文本条件注入 DiT 的通道——画面 patch 作 Query 向文本 token 的 Key/Value"提问",每个词点亮画面的对应区域。首讲:图生视频 vs 文生视频(注意力映射示意见提示词工程)
- channel-concat:图生视频中首帧图像潜变量先置于时间轴起点、再与噪声沿通道维拼接的注入方式——比交叉注意力约束更强(硬接线 vs 被参考)。首讲:图生视频 vs 文生视频
- tokenizer:文本编码器第一步的切词组件——常见词是完整 token,生造词被切碎成无意义片段;故 LoRA 触发词需专门训练才有语义。首讲:提示词工程
- CLIP:用"图文配对对比学习"训练的文本编码器家族——文本与图像向量空间被对齐,是提示词"在训练分布中定位"的原理基础。首讲:提示词工程
- 注意力图:交叉注意力权重在画面上的热力分布——解释关键词被忽略(权重稀释)、顺序敏感(前重后轻)、属性污染(区域重叠渗漏)三类现象。首讲:提示词工程
- 权重语法:
(词:1.2)式写法,直接缩放该词的条件向量(embedding)、经交叉注意力等效于注意力加权——是放大器不是新词,词本身无效时加权救不回来。首讲:提示词工程 - 属性污染:多主体同框时注意力区域重叠导致特征互串(黑发染到白发老者头上)——工程解法是拆单人镜头。首讲:提示词工程(规避见图像资产·多人镜头)
- 静帧化:放弃视频生成、直接用关键帧图进剪辑并以关键帧动画模拟运镜的保底手法——抽卡决策树的最后一级。首讲:视频生成(操作见剪辑与成片)
- 统一多模态模型:把文生图与图像编辑统一进一个模型的图像生成新范式(GPT-4o 图像/Gemini 图像/Seedream 系)——多轮对话修图、多图参考;参考图被拼进上下文序列(in-context)。首讲:文生图模型如何工作
- 重绘幅度(denoising strength):图生图时给原图注入噪声的比例——0 = 与原图相同、1 ≈ 重新生成;0.3 改细节、0.75+ 换内容;局部修图(如修手)经验甜区 0.4~0.6。首讲:文生图模型如何工作
- 指令编辑:用自然语言下达修改命令的图像编辑方式(FLUX Kontext/Qwen-Image-Edit 类)——"听得懂话"是靠几十万对"指令 + 前后对照图"样本监督训练出来的;指令三要素:动作明确、数值量化、一次一个。首讲:文生图模型如何工作(实操见图像资产)
- 参考强度:平台参考图功能中"文本 vs 参考图"两路条件的权重滑块(与 CFG 引导强度不是一回事)——甜区 70%~90%,漂移往高调、僵硬往低调。首讲:图像资产生产(原理见文生图模型如何工作)
一致性与资产
- 锚定图:角色的定妆照(正面、全身、纯色背景、均匀打光、标准姿势),是全剧的"角色基因库",选定后全剧不换。首讲:图像资产生产
- 角色设定包:角色说明书 + 三视图 + 表情差分 + 姿势差分的合称(一致性四件套),角色一致性的工程地基。首讲:图像资产生产
- 关键帧:分镜表中每一镜产出的定稿图,即图生视频的首帧。首讲:图像资产生产
- 局部重绘:只修改图像局部区域(如眼、嘴、手)而不动其余部分的修图方式——表情差分与修手部崩坏的关键手法。首讲:图像资产生产
- 剪影辨识度:把角色涂成纯黑剪影仍能认出是谁的设计准则——发型轮廓与体型差异是根基,剪影差异大也直接降低跨图串脸率。首讲:图像资产生产
- 明暗基调:画面明暗的整体倾向——高调(明亮浅影)= 明快日常,低调(大暗部局部强光)= 悬疑危险。首讲:图像资产生产
- 三点布光:主光 + 辅光 + 轮廓光的经典布光框架——轮廓光从侧后方勾边,把主体从背景里"揭"出来;AI 管线认知即可,提示词只需写清光的方向与强弱。首讲:图像资产生产
- 全局光照(GI):直接光 + 经环境反弹的光(间接光)的总和——背光面有没有"环境反弹的细节"是 AI 图假不假的分水岭;提示词显式写反弹光即可引导。首讲:图像资产生产
- 色彩三属性(色相/明度/饱和度):描述颜色的三个维度——色相是颜色的名字、明度有多亮、饱和度有多艳;调色与配色问题拆到最后都是这三个维度。首讲:图像资产生产
- 互补色(与 60-30-10 配比):色环对角的颜色对(蓝×橙),对比最强、是冷暖焦点的理论根;60-30-10 是画面配色的稳态结构(基调 60% / 主色 30% / 强调 10%),画面"花"多半是强调色超编。首讲:图像资产生产
- 低秩(秩 r):LoRA 增量矩阵 B·A 的中间维度——r ≪ d 使增量参数量降到全量的 1% 以下;r 过小欠拟合、过大易过拟合。首讲:角色一致性技术路线
- 过拟合:LoRA 训练过度的症状——角色只会摆训练素材里的姿势,换构图就崩、画风被素材焊死;对策是降 r、减步数、补素材重训。首讲:角色一致性技术路线
- 打标(captioning):LoRA 训练前为素材图配文字描述的过程——规则:写进打标的特征成为"可变属性",不写的被烙进触发词;固有特征(发色/配饰)不要写。首讲:角色一致性技术路线
- 触发词:召回 LoRA 角色的独占词(如
hero_guchen)——须为无意义新词以避免撞词典,其语义靠训练灌入。首讲:角色一致性技术路线 - 灾难性遗忘:全量微调时模型学会新任务却忘掉原有能力的现象——LoRA 冻结底模权重的根本动机。首讲:角色一致性技术路线
- 出图准确率:出图一次通过验收的比率,按失败原因分四层——语义符合、资产一致、无瑕疵、工程达标,各有独立提升杠杆;记账时给失败图标注所在层,复盘按层分账。首讲:图像资产生产
表演
- 表演(四载体):把角色内心状态传递给观众的手段总和——面部表情、肢体动作、声音、镜头代偿四个载体;AI 漫剧的表演是跨环节分配情绪信息的设计工作,不是"让模型演出来"。首讲:表演设计
- 代偿:表演分配的第一原则——让每个载体只做它擅长的事,短板绕开、长板用足(微表情是短板就把情绪交给声音和镜头)。首讲:表演设计
- 台词情绪标注:剧本阶段给台词标注表演信息的做法——情绪与强度、重音、气口、走向四类;画面与声音共用同一份标注,是跨环节表演不打架的工程手段。首讲:表演设计
镜头语言
- 运镜:镜头的运动方式——推/拉/摇/移/跟/固定;视频提示词的核心控制维度之一,单镜只写一个运镜。首讲:提示词工程(实操见视频生成)
- 景别:画面里装多少内容的分级——远景/全景/中景/近景/特写;同时决定观众与角色的心理距离,特写是配给制。首讲:分镜与美术设定
- 镜头角度:机位的高低与倾斜——平视/俯拍/仰拍/倾斜(荷兰角);机位高低本身就是态度:俯拍显弱、仰拍显强。首讲:分镜与美术设定
- 景深:画面中清晰的纵深范围——浅景深(背景虚化)聚焦视线、顺带掩盖背景生成瑕疵;深景深(前后皆清)用于交代空间关系。首讲:分镜与美术设定
- 正反打:对话双方在两个机位之间交替拍摄的对话镜头手法;合并同场景对话镜头的省预算利器。首讲:分镜与美术设定
- 过肩镜头:从一方肩后拍向另一方的对话构图——既确立对话双方的位置关系,也天然规避对口型。首讲:分镜与美术设定(对口型规避见配音 / 音效 / 配乐)
- 轴线(180° 规则):以对话双方连线为轴,所有机位待在轴线同侧半圆内;越轴会让两人在画面里的左右位置瞬间互换、观众出戏。首讲:分镜与美术设定
- 空镜:没有人格化主体的环境镜头(城市夜景、雨天窗边),不存在一致性问题,用于转场与节奏缓冲。首讲:图生视频 vs 文生视频
- 定场镜头:场景开场交代环境全貌的镜头(多为远景/全景);省预算口径下每场景保留 1 个即可。首讲:分镜与美术设定
- 反应镜头(听者反应镜头):不拍"说/做的一方",而拍接收方反应的镜头——台词给信息、反应给情绪;同时打破连续正反打的单调、天然规避口型与多人同框。首讲:分镜与美术设定
- POV 镜头(主观镜头):画面 = 角色所见的镜头——观众与角色同步获得信息,是揭示型钩子的标准拍法。首讲:分镜与美术设定
- 跳切:省略中间过程直接切换镜头的剪辑方式;AI 漫剧中相邻镜头的突兀跳变也称"跳切感",用首尾帧衔接或空镜过渡消除。首讲:角色一致性(剪辑处理见剪辑与成片)
- 连续性剪辑:让剪辑点"隐形"的组接原则——动作匹配、视线匹配、方向匹配三件套。首讲:剪辑与成片
- J-cut / L-cut:声音与画面不同时切换的剪法——J 是声音先进画面后进,L 是画面先切声音延续;零成本的对话戏高级感。首讲:剪辑与成片
- 叠化:前一画面渐隐、后一画面渐显并短暂重叠的转场——语义为回忆、关联、时间过渡,一集 ≤1 次。首讲:剪辑与成片
- 蒙太奇:镜头并置产生单个镜头没有的第三层含义——平行/交叉/对比三种形态;漫剧最常用"危机逼近 × 主角备战"的交叉结构收尾。首讲:剪辑与成片
- 运动轴线:角色持续移动(赶路/追逐)时机位应待在路径同侧的规则——越轴会让相邻镜头移动方向反转,观众误以为角色折返。首讲:分镜与美术设定
- 信息镜头:承载文字信息的镜头(系统面板/聊天记录/手机消息)——画面只生成背景,文字内容剪辑阶段贴图叠加(小字渲染是模型已知缺陷)。首讲:分镜与美术设定
- 焦段:镜头的焦距档位——广角(24~35mm)拉伸空间、背景又远又全;长焦(85mm+)压缩空间、背景拉近放大;不改变主体,只改变空间的"弯法"(透视)。AI 出图默认偏手机广角感,"画面平"的头号根因之一。首讲:分镜与美术设定
- 30° 规则:拍摄同一主体的相邻两镜,机位绕主体夹角至少 30°(或景别跳一档)——否则两镜太像,剪在一起像跳帧。首讲:分镜与美术设定
- 镜头句子:一场戏内部景别的推进模板——前进式(全→中→特)、后退式(特→全,悬念揭晓)、循环式(全→特→中);与节奏表分属"场级镜序"与"集级密度"两级。首讲:分镜与美术设定
- 场面调度:角色在场景空间里的位置与运动安排(谁坐谁站、从哪里入画)——分镜表"画面描述"列写明位置与朝向,同场各镜以场景多机位概念图为统一基准。首讲:分镜与美术设定
- 运动模糊:快门开启期间物体移动留下的方向性拖影——电影 24fps 天然带有,AI 视频默认缺失(快动作"贴纸平移"塑料感的根因之一);提示词可引导,后期可轻度补偿。首讲:视频生成
- 视觉引导:让观众第一眼落点成为设计结果的构图手法——一镜一个主焦点(光影焦点/色彩焦点/构图焦点三选一),焦点必须落在本镜主体上。首讲:分镜与美术设定
- 色彩分级与 LUT:分级(grading)是校正之上的创作层——给全片统一推一个风格方向;LUT 是把分级参数打包成"输入颜色→输出颜色"对照表的文件,可一键复用。首讲:剪辑与成片
美术设计
- 造型设计:角色视觉形象的设计知识与决策——服装体系、妆造、体型与年龄,统摄方法论为"性格→视觉翻译";决定"角色该长什么样",是角色设定包生产的上游依据。首讲:造型与场景设计
- 性格→视觉翻译:把角色关键词(身份/性格/处境/弧光)逐一落到可见载体(颜色/款式/发型/配饰/体态)、再用角色视觉三原则过滤的造型设计三步法。首讲:造型与场景设计
- 场景设计:场景空间的视觉设计知识与决策——空间陈设、时代世界观、色彩脚本,统摄方法论为"场景即叙事";决定"场景该长什么样、替戏说什么"。首讲:造型与场景设计
- 场景即叙事:场景不只装戏、也参与叙事的设计观——领地意识(谁的主场谁占优)、场景是人物的外化(陈设=人物小传视觉版)、场景功能三问(在哪/谁的/暴露什么)。首讲:造型与场景设计
- 生活痕迹:场景里"有人住过"的视觉证据——磨损/杂物/使用感/私人物品四类,按主人生活状态配量;治"样板间病"(AI 场景功能齐全但没人味)的直接药。首讲:造型与场景设计
- 世界观元素白名单:从题材考据出的场景元素清单(古风的灯笼木格窗、末世的锈蚀封窗板)——全剧场景只从白名单取材,是视觉层面的一致性工具。首讲:造型与场景设计
- 色彩脚本:全剧各集/各场景色彩走向的规划表——对齐剧本情绪曲线(日常暖稳、危机转冷降饱和、决战拉对比),定稿后翻译进各场景光环境模板锁定。首讲:造型与场景设计
创作与验收
- 优秀线(两档量规):各创作维度验收标准的上档(下档为合格线=既有验收清单)——判据必须可操作、可对照打勾,配"常见做法 vs 更好做法"正反对照。首讲:剧本与故事(各章量规散见实战篇与表演设计章)
剧本与叙事
- 拉片:逐镜记录并分析成片(镜头数/时长/转场/钩子写法)的学习方法——建立"镜头感"的最快路径,也是选题的直接输入。首讲:剧本与故事
- 钩子:开头 3 秒抓住观众的冲突/悬念设计;每集结尾的悬念钩子则驱动追更(人均播放集数)。首讲:剧本与故事
- 好奇缺口:钩子的底层机制——让观众意识到"有件事我不知道答案,且答案马上揭晓";按挖法分为信息差/危机/反常/揭示四型。首讲:剧本与故事
- 爽点:观众积压的情绪被一次性释放的快感时刻;机制为"蓄能(虐点压制)→ 释放(翻盘)"循环,常见五型:打脸/逆袭/揭秘/复仇/甜宠。首讲:剧本与故事
- 场标(场景头):剧本行首的
地点 · 子地点 · 时间 · 内/外四段标注——分镜与资产环节按它统计场景清单,每多一个场景 = 一套场景资产成本。首讲:剧本与故事 - 独白 / 旁白:角色内心声音的画外音叙述——漫剧表演上限低,叙事负担从表演转移到独白,是漫剧的主要叙事载体(台词时长估算:字数 ÷ 5)。首讲:剧本与故事
- 潜台词:人物嘴上说的与心里想的不一致时产生的张力;漫剧表演上限低,主要靠独白外化(表面一句 + 心里一句成对设计)。首讲:剧本与故事
音频
- 情绪垫:无人声或弱人声、节奏稳定的背景配乐形态,音量压至不盖台词。首讲:配音 / 音效 / 配乐
- whoosh:转场或快速动作处的"呼啸"拟声音效,转场点缀层的常客。首讲:配音 / 音效 / 配乐
- 音画一体:视频模型在生成端联合生成画面与音频(对白、口型、音效)的路线——音频由模型现场生成,以可控性让渡换效率;音色参考可半锁定音色(采样级一致)。本站主线仍为独立三轨,定位效率补充。首讲:配音 / 音效 / 配乐
- 独立三轨:人声(TTS 配音)/ 音效 / 配乐分轨制作、剪辑期混音的音频主线——配音逐条产出、全剧锁死,口型同步经后期对口型或音频驱动实现。首讲:配音 / 音效 / 配乐
- 音频驱动:把外部已锁死的音频(TTS 配音、音乐)作为生成条件输入视频模型,生成端原生产出同步画面与口型——与音画一体的区别在音频来源(锁死资产 vs 模型现场发挥),与后期对口型的区别在口型位置(生成端 vs 事后)。首讲:配音 / 音效 / 配乐
- 音色参考:音画一体的子玩法——上传声音样本约束模型现场发挥的音色;一致性好于纯即兴、弱于 TTS 音色 ID 的工程级锁死,且只在当次生成内有效(不同于可复用的声音克隆)。首讲:配音 / 音效 / 配乐
- 主题动机(leitmotif):给主要角色固定的一段旋律片段,人物出场即响——连载剧的记忆点工程。首讲:配音 / 音效 / 配乐
- 闪避(ducking):人声出现时自动压低配乐、人声停歇时恢复的动态混音手法;剪映"自动压低背景音乐"类功能即此原理。首讲:配音 / 音效 / 配乐
- TTS(文本转语音):文本前端(消歧/韵律)→ 声学模型(梅尔频谱)→ 声码器(波形)的三段管线——多音字读错发生在前端消歧环节,改写文本即可修复。首讲:音频与口型生成原理
- 说话人嵌入:把人声压缩成几百维向量的"声纹指纹"——声音克隆的核心:参考音频提取嵌入注入 TTS,噪声与混响会被一并克隆,故素材要求"干净"而非"长"。首讲:音频与口型生成原理
- 梅尔频谱:声音的"乐谱"——横轴时间、纵轴频率、深浅为能量的中间表示,是 TTS 声学模型的输出与对口型模型的输入。首讲:音频与口型生成原理
- 声码器:把梅尔频谱还原为可播放波形的组件(HiFi-GAN 类)——决定合成音"电不电、糊不糊"。首讲:音频与口型生成原理
- 后期对口型(lip-sync):对已生成视频 + 外部音频做事后嘴部区域条件再生成的路线(Wav2Lip 类)——局部二次生成、其余画面照搬原帧;同步判别器在正脸数据上训练,故侧脸失真、遮挡失效、需短分段。与音频驱动对举时它是"事后派",批量纯面部场景成本最优。首讲:音频与口型生成原理(实操见配音 / 音效 / 配乐)
- 响度(LUFS):感知响度的标准单位——平台参考约 -14 LUFS(社区经验口径);导出端以"两设备测试"(外放听清字、耳机不轰头)为准即可。首讲:配音 / 音效 / 配乐
- 声像(panning):把声音放在左右声道之间某位置的手法——对话跟随画面方位、环境音床拉宽度;手机外放几乎不可闻,属耳机观众的加分项。首讲:配音 / 音效 / 配乐
媒介工程基础
- 像素与分辨率:图像的最小单位(一个颜色格)与格子阵列的尺寸标注(横×纵格数)——像素总数是细节的物理上限,放大不会让细节长回来。首讲:数字媒介基础
- 宽高比:画面宽与高的比值(9:16 竖屏 / 16:9 横屏)——与平台形态不一致会被加黑边或裁切。首讲:数字媒介基础
- 色彩空间(sRGB):规定"数字显示成什么颜色"的坐标系——sRGB 是网络与手机屏幕默认;错配表现为发灰或过饱和,全链路 sRGB 即可免疫。首讲:数字媒介基础
- 代际损失:有损格式(JPG/MP3)每转存一次质量再降一档的现象——母图存档用无损 PNG,中间文件不反复转码。首讲:数字媒介基础
- 采样率与位深:声波数字化的"每秒测量次数"(视频行业 48kHz)与"每次测量精度"(16bit)——制作链路统一 48kHz/16bit。首讲:数字媒介基础
- 声道:声音信号的通道数——单声道(TTS 配音常态,人声居中)与立体声(配乐音效常态,营造方位与宽度)。首讲:数字媒介基础
- 帧率(fps):视频每秒闪过的静帧数——24 电影感 / 30 平台常见 / 60 丝滑;全集素材帧率必须统一,混帧率剪辑会丢帧补帧。首讲:数字媒介基础
- 码率(Mbps):每秒画面的数据预算——同分辨率下越高细节越多;导出宁高勿低(平台上传后会二次压缩)。首讲:数字媒介基础
- 编码器(codec):视频的压缩语言——H.264 兼容性之王(漫剧导出选它);H.265 同画质省约一半码率但兼容性弱。首讲:数字媒介基础
- 容器(container):把视频流+音频流+字幕打包的盒子(MP4/MOV)——.mp4 不是编码,"MP4 播不了"多半是里面的编码播放器不认。首讲:数字媒介基础
成本与运营
- 重抽率:总生成次数 ÷ 验收通过条数——你的核心效率指标,直接决定单集成本。首讲:视频生成(核算方法见工具清单与预算表)
- IAA:免费看剧 + 广告分账的变现模式(红果为主战场)。首讲:发布与运营
- IAP:用户付费解锁剧集的变现模式。首讲:发布与运营
- 投流:付费购买平台流量推广作品;头部漫剧投流成本约占总流水收入的 70%~80%(口径与来源见与传统工作流对比),个人新手先靠自然流量测试。首讲:与传统工作流对比
- 分账:平台按有效播放时长或收益与创作者结算分成的模式,IAA/IAP 是两类典型。首讲:发布与运营
- 万播收益:每万次播放的分账收益(元/万播),变现效率核心指标——2026 年已跌至 30~50 元、部分平台低至 5~10 元。首讲:发布与运营
- 剧场号/合集:平台内连载剧集的容器形态(账号剧场/合集页),漫剧发布与追更的基本单位。首讲:发布与运营
- 5 秒留存:观看超过 5 秒的观众比例——信息流生死线,低则改开头钩子与封面。首讲:发布与运营
- 完播率:完整看完整集的观众比例;低则压单集时长、删拖沓段。首讲:发布与运营
- 人均播放集数:同一观众平均观看的集数——连载粘性指标,靠结尾悬念钩子驱动。首讲:发布与运营