外观
环节 3:图像资产生产
本章是漫剧管线的地基环节:视频阶段的角色一致性,80% 在这里就已经决定了(原理见角色一致性技术路线)。图像阶段多花一小时,视频阶段少抽十次卡。
1. 工具选择
主力:即梦 AI(Seedream 5,2026-02 发布【官方】;以即梦站内可用版本为准)——中文圈漫剧出图的事实标准之一(截至 2026 年 9 月):
- 文生图 + 参考图生图 + 自然语言修图一体化,中文理解最好;Seedream 5 的指令遵循与跨图角色一致性较前代明显增强【官方】;
- 2K 直出、AI 增强至 4K,支持 9:16 竖版比例;多图参考上限提升(API 版最多 14 张参考图【官方】),新增笔刷局部编辑(涂抹选中区域精确修改);
- 免费用户每日有基础积分,会员 69 元/月起(价格随官方调整,以官网为准)。
进阶:LiblibAI / 吐司 TusiArt——需要跨集长线一致性时,用于训练角色图片 LoRA(流程与成本见角色一致性·路线二)。
认知即可:Midjourney Niji 7(动漫风格上限高,但需海外网络与外币支付)、NovelAI(纯二次元立绘,英文提示词)——了解其存在,预算和网络条件到位前不必投入。
工具收敛原则
一部剧只用一个出图工具、一个画风模板。 混用工具是风格不统一的第一大来源。画风怎么选、各谱系提示词段见画风图谱与挑选指南。进阶 LoRA 也建议用主力工具的图作为训练素材,保持生态内一致。
输入素材的版权边界
发布侧的内容红线见发布与运营,输入侧同样要守:定妆照参考图、画风锚点图、LoRA 训练素材请使用自产图或确认授权的素材——直接拿网图/他人作品做参考图生图或训练素材,侵权风险会传导至下游全部作品(判例与"模型原罪"传导逻辑见调研报告 §8.2)。
2. 出图参数基线
- 比例:按形态决策定——竖屏 9:16(红果/抖音)或横屏 16:9(B 站/YouTube);定版后全剧统一,不中途切换。
- 分辨率:短边 ≥1080(竖屏 1080×1920 / 横屏 1920×1080)。视频模型输入不需要 4K,但高分辨率图在局部重绘时有更大余量;生成角色设定包等需要反复取用的"母图"建议 2K 以上。
- 质量档位:探索期用快速档,定稿图用高品质档(积分差异大,养成习惯)。
参数背后的概念——像素与分辨率、宽高比、文件格式(为什么存档用 PNG)、色彩空间——见附录数字媒介基础·图像。
3. 角色设定包:一致性四件套
设计先行:角色视觉三原则
定妆照不是"抽一张好看的图"——它要服役全剧几百次引用。写提示词之前,先用三条原则检查角色设计:
- 剪影辨识度:把角色涂成纯黑剪影,观众还能认出是谁吗?发型轮廓与体型差异是辨识度的根基——长发及腰与齐耳短发的剪影差异,远大于瞳色差异。AI 管线的现实意义:同剧角色的剪影差异越大,跨图串脸、认错的概率越低。
- 配色定角色:每人一个主色 + 一个辅色,全剧 2~4 个角色主色互不重叠(主角藏青、反派暗红、配角米白)。色彩是观众记忆角色的第一钩子,也是提示词里"区别性特征"的核心字段。
- 一个记忆点:一个标志性配饰或特征(银框眼镜、左脸伤疤、异色瞳)——观众靠它认人,模型靠它锁人:它在定妆照、三视图、每张关键帧的提示词里反复出现,成为跨图一致性的锚点。
三条原则服务同一件事:几十集、几百张图之后,观众和模型都还认得这是谁。
三原则是"设计过没过安检"的判据;再上游一步——角色该设计成什么样(性格怎么翻译成服装、妆造、体型),见造型与场景设计§2~§5,定妆照定版前先过它的设计量规。
设计定稿后进入生产——每个出场角色按此流程出四件套(定妆照/三视图/表情差分/姿势差分,社区主流工作流):
第一步:定妆照(锚定图)
正面、全身、纯色背景、均匀打光、标准姿势——信息完整、没有遮挡。这张图是全剧的"角色基因库",选定后全剧不换。用图像提示词模板生成,多抽几组直到完全满意(这里值得花积分,它将被引用几百次)。
第二步:三视图
以定妆照为参考图,生成正面/侧面/背面三视图:
text
提示词要点:character turnaround sheet / 角色三视图,同一角色的正面、侧面、
背面并排站立,保持与参考图完全一致的发型、服装与配色,白色背景。复杂角色(多层服装、大量配饰)追加到 6~7 张:俯仰视角、半身特写。
第三步:表情差分
用局部重绘只改眼、嘴区域,从定妆照派生出喜/怒/悲/惊 4~6 个表情——脸型、发型、配色完全不动,这是表情一致性的关键手法。
第四步:姿势差分(标志性姿势)
表情之外,角色的标志性姿势同样要预先进库(如顾辰说明书中锁定的"摘镜擦拭"标志性动作)——流程与表情差分同构:
- 从剧本与分镜列高频姿势清单(标准站姿、摘镜动作、坐姿、背影等 3~5 个);
- 以定妆照为参考图逐一出图:提示词只改姿势与构图段,画风、光影、外貌字段一律不动;
- 按
pose/glasses-off.png式命名入角色目录,关键帧出图需要该姿势时直接挂载参考。
姿势差分的价值与表情差分相同:把"反复要的图"做成"一次到位、全剧引用"的资产。
收尾:角色说明书
为每个角色写一份文档:开头先写"设计依据"段(三句话性格→视觉翻译稿——他是谁→关键词→落在造型上的决策,方法见造型与场景设计§2),再锁定 6 个易失控变量:表情、动作、镜头、光影、穿搭、画风。描述要量化——"眼裂长宽比约 1:1.2"优于"大眼睛"。说明书 + 三视图 + 表情差分 + 姿势差分,合称角色设定包,存入资产库。
角色说明书完整实例
一份填好的说明书长这样(顾辰·都市重生逆袭男主,与本章示例图同一角色):
text
# 角色说明书:顾辰(char/01-guchen/)
- 设计依据:AI 科研天才、隐婚弃夫、从幕后到名震全球——关键词"高智、隐忍克制、蛰伏六年"→ 造型决策:一丝不苟的三七分+银色细框眼镜(高智)、扣到顶的黑色高领内搭(克制)、质地好但款式略旧的深灰西装(蛰伏)
- 表情:默认冷静少表情,情绪上限为"眼神变锐利";大笑易崩,全剧不用
- 动作:站姿端正、肩线平;思考或反击前摘眼镜缓缓擦拭(标志性动作)
- 镜头:正面 / 45° 侧面成功率最高;大仰角翻车率高,分镜阶段规避
- 光影:默认均匀柔光;对峙场景允许侧光(右脸受光)
- 穿搭:深灰戗驳领西装外套 + 黑色高领内搭 + 银色细框眼镜——全剧不变,无换装计划
- 画风:CG 厚涂(3D CG 渲染风格、写实比例美型、次表面散射肤质——画风词段见附录《提示词模板速查》)
- 量化锚点:28 岁,黑色短发三七分;眼裂长宽比约 1:1.2;发色 #1A1A1A 系;西装为深灰两粒扣戗驳领用法:出图与抽卡验收时逐条对照——任何与说明书冲突的图直接判不合格,不"将就用"。说明书随生产迭代(发现新翻车点就补一条),它是活文档。
换装与造型变体:说明书实例里"全剧不变、无换装计划"是最省心的形态;剧情确需换装时(居家服 → 高定西装、日常 → 礼服),做法是以定妆照派生"服装变体"——发型、标志配饰、配色锚点一律不动,只改服装段提示词,按姿势差分的同流程单独建档(如 char/01-guchen/costume-formal/),并在说明书中注明"第 X 集起启用"。每个新变体都相当于一次小型定版:先测复现稳定性再进量产,别在量产中途临时换装。
进阶:角色图片 LoRA 训练 SOP(LiblibAI 实操)
确认量产长篇连载后再做(决策时机见角色一致性·路线二与路线图 W9~W10;原理与"三个旋钮"见训练质量的三个旋钮,平台界面以当前版本为准):
- 备素材:12~20 张,从角色设定包派生——定妆照 1 + 三视图 3 + 表情差分 4 + 关键帧定稿 4~8 张(计 12~16 张);全部出自同一画风模板(混画风 = 训出一个四不像)。注意设定包派生的素材里面部特写只有定妆照 1 张,达不到原理篇"面部特写 4~6 张多角度"的配比要求(见训练质量的三个旋钮)——不足时追加 3~5 张多角度面部图(可用 §7 指令修图从定妆照派生,追加后总量不超过 20 张),否则召回测试易翻车;
- 建数据集打标:上传 LiblibAI → 自动打标后人工校对——删掉固有特征词(黑发三七分/银框眼镜/深灰西装:让它们烙进触发词),保留可变属性词(表情/姿势/服装状态:保持可控);
- 设触发词:
hero_guchen式的无意义独占词,不与词典既有词撞车; - 选底模与参数:FLUX 或 SDXL 底模(按画风选系——二次元角色选动漫系,CG 厚涂角色选写实 CG 系);秩 r 与步数先用平台默认(通常 r=16~32);
- 提交训练:约 30 分钟~2 小时(成本口径见角色一致性·路线二);
- 验收三测:① 召回测试——
hero_guchen+ 极简描述出 4 图,像不像本人;② 泛化测试——换姿势/换景别出图,若只会摆训练素材里的姿势 = 过拟合;③ 画风兼容测试——挂全剧画风模板出图,风格是否被素材焊死; - 迭代:召回弱 → 补面部特写素材重训;过拟合 → 降 r、减步数重训。
验收不过的 LoRA 不如不训——继续用平台参考图(路线一)顶着,别带病进入量产。
4. 场景与道具资产
资产分级:不是每个元素都配建档
四件套是主角待遇,不是所有出场元素的默认配置。按出场频率与剧情分量分级,资产清单才不膨胀:
| 级别 | 对象 | 资产配置 |
|---|---|---|
| 主角 / 核心反派 | 全剧高频出场 | 完整设定包:定妆照 + 三视图 + 表情/姿势差分 + 说明书(§3 全流程) |
| 重要配角 | 出场多集、有关键对手戏(主角的盟友/仇敌) | 简化包:定妆照 + 2~3 个表情差分(局部重绘派生即可) |
| 一次性角色 | 只出场 1~2 镜(店员、路人、反派手下) | 不建档——随场景图或关键帧直接生成;日后偶尔复用时补单张定妆即可 |
道具同理(见下文"关键道具"的叙事道具/氛围道具之分)。分级的标准只有一条:它被观众记住、被剧情反复需要的程度,回不回得了一本它的资产成本——分级清单从分镜表汇总时顺手标注(见分镜·美术设定)。
- 场景概念图:每个场景出 1 张基准图 + 必要的光线变体(日/夜、晴/雨)。提示词复用全剧画风模板,结构要点:无人出镜(避免角色在场景图里漂移)、写明光源与时间("夜晚,窗外冷光透入")、写明透视与构图("广角平视,纵深构图");日/夜变体只改光影段,其余字段不动。
- 同场景多机位清单:一个高频场景在分镜里通常出现 3~5 个机位(全景定场位、中景对话位、特写道具位)——为这类场景出 2~3 张不同机位的概念图(同画风、同光影模板,只改透视与景别)。关键帧出图时挂对应机位的场景参考图,空间一致性远好于"一张场景图走天下"。
- 关键道具:推动剧情的道具(手机、合同、信物)单独出图,特写镜头直接引用,避免每次生成道具形态漂移。注意分级管理:只有叙事道具(丢了它剧情就走不下去的)才配单独建档;只起丰富画面作用的氛围道具(桌上的茶杯、墙上的挂画)随场景图一起生成即可,不单独管理——资产清单不膨胀。
本节是"怎么生产";场景该设计成什么样——陈设放什么、生活痕迹怎么配、时代元素怎么统一——见造型与场景设计§7~§9:那边的设计量规过了,再回这里按生产要点出图。
光影与色调:情绪的一半来自光
同一个房间,灯全开是日常、只留一盏台灯是悬疑——光影是给画面"定情绪"的工具。三组概念覆盖漫剧九成用光:
- 明暗基调:高调(画面整体明亮、阴影浅淡)= 明快、日常、甜宠;低调(大面积暗部、只留局部强光)= 悬疑、压抑、危险。
- 色温冷暖:暖色(橙黄)= 安全、回忆、温情;冷色(蓝青)= 孤独、紧张、末世与科技感。冷暖对比是焦点发生器:冷环境里一束暖光打在主角脸上,观众视线避无可避——成本最低的"高级感镜头",提示词直接可写("冷色调房间,窗外暖光打在角色侧脸")。
- 光源方向:顺光(正面上光,平而清楚)= 客观陈述;侧光(明暗分割脸部)= 矛盾、心事;逆光(人物成剪影或镶一圈轮廓光)= 神秘、登场高光、情绪顶点;顶光(眼窝压出深影)= 压迫、反派专属。
专业布光把方向组合成三点布光框架:主光(造型的核心光源)+ 辅光(柔化主光投下的阴影)+ 轮廓光(从侧后方勾出人物边缘,把主体从背景里"揭"出来)——认知即可:AI 管线里不需要布灯,只需在提示词里写清光的方向与强弱(上文四方向 + 明暗基调已够覆盖)。
再进一步:全局光照——"假图"与"真图"的分水岭。三点布光是"人主动布了几盏灯"的框架,而真实世界里光不止来自灯:阳光照进房间,地板被照亮后又把光弹到墙上、墙面再弹到人物背光面——这种经过一次或多次反弹的光叫间接光(反弹光),直接来自光源的叫直接光,两者合起来的整体光照效果就是全局光照(GI)。判断一张 AI 图光影假不假,最快的办法就是看背光面:只有直接光的画面,背光面是死黑的(像贴纸);有反弹光的画面,背光面里能读出环境的颜色与细节(地板的暖色弹到角色下巴上)——这是"照片感/电影感"的物理来源,也是 3D CG 级画风真实感的核心(见画风图谱)。
AI 管线落地:不需要你计算光路,在提示词里显式写出反弹光即可引导——"阳光从窗外射入,地板反射的暖光打在角色侧脸""暗部有环境反光",比只写"侧光"的立体感明显更强;反过来,画面发"平"发"假"时,先检查提示词是不是只写了光源方向、没给环境反弹的信息。
色彩三属性与配色框架:上文"色温冷暖"其实只是色彩的一个维度。完整的色彩三属性是——色相(颜色的名字:红橙黄绿蓝紫)、明度(有多亮)、饱和度(有多艳)。剪辑面板里的调色滑块、穿搭撞色、"画面太灰"的抱怨,拆到最后都是这三个维度的问题。配色有两条可直接套用的框架:
- 互补色(色环对角,如蓝×橙、红×绿):对比最强,是"冷暖对比焦点发生器"的理论根——橙黄的暖光打在蓝青的冷环境里之所以抓眼,正因为橙与蓝互为互补色。用法:一帧画面里只留一对互补对抗,主体占小头(两强相争画面会"吵")。
- 类似色(色环相邻 2~3 格,如蓝×青×绿):天然和谐,适合同场景的氛围统一——同场景资产(概念图、关键帧)共用一段类似色区间,跨图色彩漂移会明显减小。
- 60-30-10 配比:画面配色的稳态结构——约 60% 基调色(环境/背景)、30% 主角色(角色主色,呼应 §3"配色定角色")、10% 强调色(记忆点配饰、视线焦点)。画面"花""乱"十有八九是强调色超了 10%——数数发色、配饰、道具里跳出来的高饱和色块有几个。
落地三条:① 分镜表的画面描述列带上光影意图(如"低调、侧逆光"),出图时翻译成提示词的光影氛围段;② 同场景所有镜头共用同一段光影词(光源方向、色温、强度写死)——这就是画风图谱里"光环境模板"的用法,也是压跨图光影漂移的第一手段;③ 角色与场景配色按 60-30-10 自检——强调色超编先砍(高发源头:配饰、道具、发色里跳出来的高饱和色块)。
以上是单帧的光影与色彩;跨集、跨场景的时间维度(全剧色彩跟着情绪曲线走)见造型与场景设计 §10 色彩脚本。
5. 关键帧批量生产(衔接分镜表)
分镜表中的每一镜,在这里产出一张"关键帧图"(即图生视频的首帧)。量产之前,先把"出图准确率"这个词拆开——它是本节所有手法的统一目标。
出图准确率:四层诊断地图
出图准确率 = 出图一次通过验收的比率。 感觉上的"最近出图老不准",拆到最后只有四层失败原因——各层有各自的提升杠杆,对症下药才不浪费积分:
| 层 | 失败表现 | 提升杠杆 | 出处 |
|---|---|---|---|
| ① 语义符合 | 画的不是要的:主体/动作/构图/画风跑偏 | 提示词工程(模板 + 单变量调试) | 提示词工程;本节翻译规则与自查清单 |
| ② 资产一致 | 角色不像:脸型/发型/配饰漂移 | 参考图 + 设定包 + 参考强度 | §3 设定包;本节参考强度调参 |
| ③ 无瑕疵 | 画的是要的、也像,但手崩/字乱/结构歪 | 一图一难点 + 构图规避 + 局部重绘 | 本节调试实录与决策树;§7 修图;§9 瑕疵图谱 |
| ④ 工程达标 | 图能用但规格错:比例/分辨率/未入库 | 参数基线 + 命名规范 | §2、§8 |
四层对应四个返工方向:哪层丢分回哪层补课,别用同一招(改提示词)治所有病。记账时给每张失败图标注所在层(见本节成本演算的分账统计),一周后你会精确知道自己卡在哪一层。
从分镜表到提示词:翻译规则
分镜表是"拍什么的规格书",提示词是"画什么的指令"——两列字段按下表逐段翻译(模板结构本身见图像提示词模板):
| 分镜表列 | 进入提示词哪一段 | 翻译要点 |
|---|---|---|
| 景别·运镜 | 构图/镜头段 | 景别直写("近景""特写");运镜不写给图像模型——但运镜意图影响构图("推近至特写"→ 直接按特写构图出图) |
| 画面描述 | 主体与外观段 + 动作/表情段 + 场景段 | 角色外貌不写(参考图锁定),只写本镜的动作、表情、位置关系 |
| 光影意图(备注) | 光影氛围段 | 直接落成光环境模板词("低调、侧逆光") |
| 资产列 | 不进提示词——进参考图 | 角色挂定妆照/差分参考,场景挂概念图,道具挂道具图 |
| 台词 | 原则上不进 | 仅当台词决定表情时,翻译成表情词进动作/表情段("怒吼"→"张嘴大喊") |
写完按要素自查清单过一遍(对应七段模板,缺段即补):
text
□ 画风段(句首,全剧模板复用) □ 主体与外观(只写区别性特征,挂参考图则不写外貌)
□ 动作/表情(本镜一个主动作) □ 场景(环境一句话,不抢戏)
□ 构图/镜头(景别 + 角度 + 焦段意图) □ 光影氛围(光环境模板词)
□ 质量词(段尾固定)量产四步:
- 按上方翻译规则写提示词(画风段复用模板);
- 挂上角色参考图(即梦智能参考 / LoRA 触发词)——参考强度按场景调参(见下表);
- 提示词只写动作、表情、构图、光影,不复述角色外貌(避免与参考图打架);
- 逐镜过图像阶段验收清单——不合格在这里改图,不要留到视频阶段:
参考强度调参场景表(默认值之外的调参依据,社区经验口径):
| 场景 | 调参方向 | 原因 |
|---|---|---|
| 默认起点 | 70%~90% 区间中段 | 甜区(原理见角色一致性·路线一) |
| 角色漂移(换脸/换装/配饰消失) | 往高调(→90%) | 锁不住时加约束力 |
| 姿势僵硬、构图雷同 | 往低调(→70%) | 约束过强压死了多样性 |
| 大动作/大角度镜头 | 往低调 + 换对应姿势差分作参考 | 高参考强度下大姿势变化最易崩 |
| 多图参考组合 | 主参考(定妆照)锁身份 + 辅参考(三视图/对应表情差分)锁视角与情绪 | 各图分工,提示词用 @图N 指代(语法见 §6) |
text
□ 角色与锚定图可辨认一致(脸型/发型/配色/标志配饰)
□ 构图符合分镜表的景别与运镜意图
□ 无手部崩坏、面部畸形、乱入文字等瑕疵
□ 风格与画风定版模板一致,无跨图漂移
□ 画幅与形态决策一致(9:16 或 16:9)、短边 ≥1080
□ 已按命名规范入库,消耗记入记账表调试实录:一张关键帧从初稿到定稿
分镜表镜 12("拉开抽屉底层,摸出旧 U 盘",来自分镜表实例)的出图过程——方法论照提示词工程·单变量修改:
| 轮 | 改动(单变量) | 结果 | 判定 |
|---|---|---|---|
| v1 | 初稿:男性拉开抽屉,神情凝重 | 手崩(6 指) | ✗ 手部崩坏 |
| v2 | 构图改"俯拍过肩"(手在画面中占比缩小) | 手正常了,但抽屉消失 | ✗ 关键道具丢失 |
| v3 | 提示词补"木质抽屉半开" | 抽屉回来了,U 盘的形态怪异 | ✗ 道具崩坏 |
| v4 | 删掉 U 盘的描写,只留"手探向抽屉深处" | 全项过检 | ✓ 定稿;U 盘交给特写镜 13 单独出图 |
核心教训:AI 出图"一图一难点"——同时要求"手 + 抽屉 + U 盘"三个精细物件,翻车率近似相乘。分镜表里镜 13(U 盘特写)本就独立存在,让镜 12 只承担"探手"一个难点即可。这是分镜与出图联动的典型决策:改提示词不如改任务分配——遇到多难点镜头,先回分镜表看难点能不能拆到别的镜里,再决定抽不抽。
图像版抽卡决策树:第 N 次失败后改什么
与视频章同构(见视频生成·抽卡决策树),连续失败时按层级逐级处理,不要原地硬抽:
text
第 1~2 次失败 → 改提示词(零成本)
单变量修改;先判失败所在层:语义层改措辞,一致层检查是否复述了外貌
第 3~4 次失败 → 换生成条件(低成本)
调参考强度、换参考图组合、换种子(有该功能的工具)、快速档 ↔ 高品质档互换
第 5 次失败 → 降级画面方案(内容损失)
简化构图(裁掉难点)、换角度(正脸 → 侧脸)、把难点拆给其他镜
仍不过 → 回分镜改任务分配(最贵/保底)
该镜难点重新拆分(见上方调试实录);或改走信息镜头贴图路线(见[剪辑与成片](/workflow/editing))批量与种子的两条工程经验:
- 探索期 4 选 1,定稿期逐张精调:探索构图与措辞时一次出 4 张选优,同价下命中率显著高于逐张单抽;但定稿母图(定妆照等要被引用几百次的图)建议逐张精调,别把母图交给手气;
- 种子是"换一条采样路径"的零成本换法:调好结构后固定 seed 微调措辞可复现对比(方法见提示词工程·迭代方法论);提示词与条件都不动、只换 seed,就是决策树第 3 级里最便宜的一手。
出图成本演算:单集 20 元怎么来的
本章是预算表"图像资产约 20 元/集"(见工具清单与预算表)的产生现场。把这笔账拆开(以分镜表实例的 16 镜单集为例):
text
关键帧:单集 16 镜 ≈ 16 张(含 3 个信息镜头的静帧底图,也在这里出)
设定图摊销:定妆照/三视图/表情与姿势差分/场景/道具,按集摊销 ≈ 4 张当量
出图总量 ≈ 20 张/集
单集出图成本 ≈ 20 张 × 平均抽约 2.5 次 × 约 0.4 元/张 ≈ 20 元/集0.4 元/张是即梦快速/高品质混合档位的经验口径(随档位与积分包浮动,仅作算法演示,以你的记账表实测为准)。三个杠杆各自对应本章的一节纪律:
- 压张数:设定图一次到位、全剧复用(§3),道具分级管理(§4)——资产清单不膨胀;
- 压重抽率:出图重抽率目标 ≤2.5 次/张——定妆照等母图允许多抽(要被引用几百次,值得),关键帧靠"参考图锁角色 + 一图一难点"(上方调试实录)把重抽压下来;连抽不过按上方决策树逐级降级,别原地硬抽;
- 压单价:探索用快速档、定稿才用高品质档(§2 参数基线)。
重抽率按层分账:记账表加一列"失败层"(①语义 ②一致 ③瑕疵 ④工程),每张失败图标注丢在哪一层。周复盘看分布——某一层占比明显偏高,下周就回那一层对应的章节精读补课:语义层回提示词工程,一致层回 §3 与角色一致性,瑕疵层重读本节决策树与 §9 瑕疵图谱。混在一起的"重抽率 2.5"只是平均数,分账后的数字才是诊断。
出图环节省下的每一元,都在给视频阶段的抽卡留预算——视频生成单集红线 80 元(见视频生成·控本纪律),图像环节的纪律是它在源头上的第一道保险。
6. 多人镜头处理
漫剧 2~4 个角色、对话戏为主——多人镜头是刚需,但"一图多人"是当前出图工具的高发翻车区(串脸、动作张冠李戴)。处理优先级:规避 > 平台多人参考 > 合成。
路径一(首选):规避——把多人戏拆成单人镜头
- 对话与多人戏尽量拆成单人镜头:正反打(对话双方交替单人出镜)、过肩镜头、听者反应镜头——概念与机位布置见分镜与美术设定的"对话镜头:正反打与轴线"与"反应镜头:戏在听者脸上"两节。
- 一图一人时,每个角色由各自的参考图/LoRA 单独锁定,一致性成功率最高;剪辑阶段交替组接,观众感知仍是"两人在对话"。
- 规避不是妥协,是漫剧行业的通行做法:竖屏小画幅本就不适合多人同框,主流漫剧的对话戏几乎都是单人镜头组接出来的。
路径二(次选):平台多人参考功能
必须同框时(拥抱、打斗、群像海报),用平台的多参考能力(能力口径见角色一致性技术路线;截至 2026 年 9 月,功能上限随版本变化,以官方文档为准):
- 即梦多图参考:同时上传各角色定妆照(图 1、图 2……),提示词用
@图1、@图2分别指定各自动作,如"@图1 摘下眼镜逼近 @图2,@图2 后退一步"; - 可灵元素:为每个角色建独立"元素",提示词中 @元素名 调用。
预期管理:成功率明显低于单角色,串脸仍会偶发;成本按"翻倍"做预算(每个同框镜头预留 2 倍抽卡次数);先用极速/快速档探路确认构图,满意后再换高品质档定稿。
路径三(门槛明示):分别生成再合成
各自生成单人立绘,再抠图合成到同一背景——效果上限最高,但需要抠图/PS 类工具基础,无美术基础的读者零基础阶段直接绕开此项。最低门槛替代:剪映"智能抠像"可做静态合成(导入背景图 → 画中画叠加人物图 → 智能抠像去底),能应付简单的双人同框静帧;精细合成(光影匹配、透视统一)留待有基础后再学。
一句话结论:日常多人戏走路径一;必须同框的镜头走路径二;路径三等你需要海报级画面时再回头补。
7. 局部重绘与指令修图
出图不可能一步到位,修图是日常。主流工具的指令修图对比(截至 2026 年 9 月,社区横评口径):
- 即梦智能画布:中文自然语言修图体验最好,免费额度可用;复杂场景指令稳定性欠佳。
- FLUX Kontext(可经 LiblibAI/RunningHub 云端调用):综合质量最均衡、角色一致性编辑强;需英文指令。
- Midjourney Editor:精修与扩图能力强;需订阅与海外网络。
修图指令三要素:动作明确("把左手改为拿咖啡"而非"改一下手")、数值可量化("上移约 20%")、优先级清晰(一次只下一个指令)。漫剧高频修图场景:手部崩坏、表情微调、去掉乱入文字、局部元素替换。
8. 资产库管理(开发者的主场)
像管理代码仓库一样管理美术资产:
text
project/
├─ char/01-guchen/ # 示例剧男主:W2 练手包沿用至结业(说明书实例见 §3)
├─ char/02-jiangxinyu/ # 示例剧女主(对立线·前妻):定妆照/三视图/表情/姿势/说明书.md
├─ char/03-lumingxuan/ # 白月光反派
├─ scene/apartment-night/ # 场景:基准图+变体
├─ prop/usb-drive/ # 道具
├─ keyframe/ep01/001.png # 关键帧:按集+镜号命名(环节 3 产出)
├─ video/ep01/001-take3.mp4 # 镜头素材:镜号+抽卡序号(环节 4 产出,"入库"即入此层)
├─ audio/ep01/ # 配音逐条/音效/配乐(环节 5 产出)
├─ project/ # 剪辑工程文件(环节 6 产出,版权证据链之一,见发布章合规清单)
├─ export/ # 成片导出与发布物料(封面/预告)
└─ prompts/ # 提示词模板库(画风段/质量词段)命名规范 + 提示词版本记录,让你在 3 个月后仍能复现任何一张图、任何一条镜头的生成条件——这套目录同时覆盖环节 3~6 的全部产出物。三视图、场景概念图、修图指令等提示词的可复制成品已汇总至提示词模板速查,可直接复制进你的 prompts/ 库按需改造。
9. 常见问题与对策
高频瑕疵按类型整理成图谱——能出图前规避的别留到出图后修(规避零成本,修复要积分):
| 瑕疵类型 | 典型表现 | 出图前规避 | 出图后修复 |
|---|---|---|---|
| 手部崩坏 | 多指、关节反折 | 构图裁手(插兜/背手/遮挡)、缩小手部画面占比 | 局部重绘(§7) |
| 乱入文字 | 招牌/小字乱码 | 提示词避免文字元素;必要文字留后期 | 局部重绘抹除;剪辑阶段贴图覆盖 |
| 多人串脸 | 同框特征互染 | 首选拆单人镜头(§6 路径一) | 平台多人参考(路径二);合成(路径三) |
| 透视/结构崩坏 | 建筑歪斜、物件结构不成立 | 避免极端角度;复杂结构拆镜 | 换角度重出,别硬修 |
| 光影假(贴纸感) | 背光面死黑、无环境反弹 | 提示词显式写反弹光(§4 光影与色调) | 指令修图补环境光 |
| 跨图风格漂移 | 批次间画风不一 | 同一工具 + 同一模板 + 同一模型版本(§1 工具收敛) | 排查生成条件差异后重出 |
| 设定图像、关键帧不像 | 参考没锁住 | 参考强度调高(§5 调参表);删提示词里与参考冲突的外貌描述 | 换更接近的差分参考图重出 |
10. 动手练习
完成 1 个角色的完整设定包 + 3 张场景概念图 + 5 张关键帧图。
这是 W2 跑通管线的练手包(建议沿用示例角色顾辰,§3 的说明书实例可对照;也可换成你自己故事的主角),不是结业剧资产;结业剧(顾辰·《名震全球后,前妻追妻火葬场》)资产将在第 1 集分镜表定稿后按同一 SOP 重做。
- 定妆照 → 三视图 → 4 个表情差分 → 3~5 个姿势差分 → 角色说明书;
- 场景图含 1 个日夜变体;
- 为你的练手小故事列出 5 个关键画面(一句话分镜即可),逐张出图并按 §5 的图像阶段验收清单过检;
- 全部入库并按规范命名。该资产包将直接用于第 4 环节的视频生成。