Appearance
用 Codex 制作 AI 漫剧与短片
嘿,朋友们!小枫同学来啦。
最近我在折腾一件挺有意思的事:用 AI 做一条 45 秒的竖屏漫剧短片。说实话,一开始我天真地以为就是「输入提示词 → 出图 → 出视频 → 拼起来」这么简单。结果第一条片子翻车翻得彻底——主角第一镜是黑发,第二镜变棕发,第三镜发夹直接消失了,手表也从左手跳到右手。观众看的时候估计满脑子问号:这到底几个人?
踩完这个坑我明白了:AI 生成单张图可以靠运气,但连续十几二十个镜头还能保持一致,靠的是一套约束系统。本页就是我总结的一套可重复流程,从设定角色到最终导出 mp4,每一步都有明确的检查点。核心思路就是——先把规则写死,再让 AI 在规则里发挥。
不会写代码也能玩
这一章的内容,代码部分完全可选。普通创作者用 ChatGPT Work 整理角色设定、脚本和分镜,用自己习惯的授权图像/视频工具生成素材,最后扔进剪映或 CapCut 里手动组装就行。角色圣经和分镜表存成 Word、Excel 或者普通表格都可以,不用非得 Markdown。
Remotion、React、批量脚本这些东西,只是当你需要一口气产出几十个镜头时的效率工具。第一条作品建议控制在 30–45 秒、2 个角色、1 个场景,逐镜头走一遍验收,比追求全自动生成整集靠谱得多。
开始前推荐先看看这两篇:普通人的任务说明法 和 隐私、权限与审批。
第一步:写项目圣经
别被「圣经」这个词吓到,说白了就是一张项目约束卡。我每次开新项目第一件事就是写这个,因为后面所有决策——镜头比例、色调、节奏——都从这里派生。
project-bible.md:
md
# 项目
- 类型:轻科幻悬疑漫剧
- 时长:45 秒
- 画幅:9:16,1080x1920
- 平台:短视频信息流
- 受众:18+,不含血腥和惊吓特写
- 画面:二维赛璐璐 + 克制霓虹
- 节奏:前 3 秒给异常,30 秒反转,最后 5 秒悬念
- 交付:mp4、srt、封面、分镜表、素材清单同时把版权边界也写进去:原创角色、不模仿在世艺术家独特风格、不使用无授权音乐、Logo、人物肖像和影视角色。
我自己的教训:第一次做的时候没写「画面风格」这一条,结果不同镜头生成了不同画风——有的是厚涂,有的是平涂,拼在一起违和感拉满。现在这一条我永远放在最前面。
第二步:建立角色与场景圣经
每个角色固定这些信息:
- 年龄段、体型、脸型、发型;
- 服装、颜色、配件;
- 不可变化特征;
- 常用表情和动作;
- 正面、侧面、背面参考;
- 配音音色和语速;
- 禁止出现的元素。
示例:
md
## 林岚
- 25 岁,短黑发,左侧银色发夹
- 深灰连帽外套,内搭橙色 T 恤
- 右手戴黑色运动手表
- 不可变化:发夹在左侧、外套无 Logo、瞳色棕色这里有个关键操作:先生成角色设定图,人工选定。后续每个镜头都用这张已批准的参考图,不要在每个镜头里重新发明角色长什么样。我踩坑之后养成一个习惯:把选定的人物参考图直接贴在角色圣经里,每次提示都引用同一张图。
好,有了项目约束和角色设定,接下来就是把故事变成能拍的东西。
第三步:把故事写成可拍脚本
text
根据 project-bible.md 写一条 45 秒竖屏漫剧脚本。
要求:
- 前 3 秒出现可见异常;
- 只用 2 个角色、1 个主要场景;
- 台词总字数控制在适合 45 秒配音的范围;
- 每句台词推动信息或冲突;
- 不依赖旁白解释画面中看不到的关键事件;
- 结尾留下一个明确悬念;
- 先输出节拍表,再输出对白稿。拿到脚本后,人工检查故事逻辑、节奏、平台规则和内容风险,都确认没问题了再冻结为 script-v1.md。冻结的意思是——后面改分镜可以微调,但故事骨架不再动了。我试过边拍边改故事,结果就是镜头越改越多、逻辑越改越乱,最后整条片子推倒重来。
第四步:生成结构化分镜表
让 Codex 输出 CSV 或表格,每个镜头至少包含这些字段:
- shot_id;
- 时长;
- 景别和机位;
- 角色、动作、表情;
- 场景和光线;
- 台词/旁白;
- 音效/音乐;
- 开始状态与结束状态;
- 图像提示;
- 视频运动提示;
- 参考资产;
- 验收点。
提示:
text
把 script-v1.md 拆成 8-12 个镜头。每个镜头必须写清上一镜头结束状态和本镜头开始状态,以保证人物位置、视线、道具和光线连续。动作强度按"静止/轻微/明显"标记,不要用空泛的"电影感"。「开始状态」和「结束状态」这两列是我后来特意加的——之前翻车就是因为镜头之间没有状态交接,上一个镜头角色看着右边,下一个镜头突然看左边,观众根本跟不上空间关系。
第五步:先做关键帧,不直接批量视频
这个顺序是我用无数次翻车换来的:
- 每个镜头先生成一张关键帧;
- 检查角色、服装、道具、空间和构图;
- 锁定通过的关键帧;
- 再用关键帧作为视频参考;
- 失败镜头单独重做,不整集重生成。
图像提示应包含固定角色块:
text
[角色固定描述]
[场景固定描述]
镜头:中近景,手机屏幕冷光照亮左脸,角色看向画面右侧门口。
保持银色发夹在左侧、灰色无 Logo 外套、黑色手表在右手。不要出现文字、水印、额外人物和额外手指。为什么要强调「不要出现额外手指」?因为我有一次生成的画面里角色凭空多了一只手,当时没仔细检查就过了,剪进成片后才被朋友指出来,社死现场。现在每个关键帧我都会放大看手。
使用 ImageGen、Fal 或其他工具时,以当前可用 Plugin/Skill 和服务条款为准。
第六步:控制镜头连续性
建立一个 continuity-ledger.csv:
text
shot_id,character_position,gaze,prop,lighting,wardrobe,start_state,end_state,approved_asset每次生成下一镜头前,让 Codex 读取上一镜头的记录。人工重点检查这些:
- 左右方位和视线;
- 手中道具与开关状态;
- 衣服、发型和配件;
- 场景时间和光线;
- 人物伤痕、污渍或情绪;
- 动作能否从上镜头自然接续。
这个台账看着像流水账,但它是连续性的最后防线。我的经验是:不写台账的片子,到第五个镜头一定会出 bug;写了台账认真核对的,十个镜头也能稳稳接上。
第七步:生成视频镜头
视频提示描述变化,不重复整张画面:
text
基于已批准关键帧。镜头保持固定,角色先静止 0.5 秒,然后缓慢转头看向右侧门口,表情从疑惑变为警觉。只有头部和视线移动,衣服、发夹、手表和背景保持不变。不要推拉镜头,不要增加人物。动作越复杂,越应该拆成多个镜头。不要指望一个 8 秒镜头同时完成走路、开门、变装、镜头环绕和爆炸——我试过,出来的东西就是一团浆糊。
第八步:配音、字幕和声音
先锁定对白再生成音频。记录这些信息:角色、文本、音色、语速、情绪、文件名和授权来源。
要求 Codex:
text
根据最终对白生成配音任务表和 SRT 初稿。字幕每条不超过两行,按真实音频时间对齐,不根据文字长度猜时间。专有名词保持 project-bible.md 写法。使用 HeyGen、语音服务或第三方音乐前,确认肖像、声音克隆、商业使用和平台授权。未经本人明确同意不要克隆真实人物声音或形象——这是红线,不是建议。
我在这一步踩过一个坑:先做了字幕再配音,结果字幕时间全是按字数估算的,和实际音频完全对不上,最后全部重做。正确的顺序永远是先锁音频、再配字幕。
第九步:程序化剪辑
Remotion Plugin 适合用 React 组织镜头、字幕、转场、音频和批量导出。当然,用现有剪辑软件或受控脚本也完全没问题。
text
使用 Remotion 按 shots.csv 组装 1080x1920、30fps 的 45 秒短片。镜头切换以硬切和短溶解为主,不增加随机特效。加载最终配音和 SRT,保证字幕安全区。输出预览版,不发布。程序化时间线必须以最终音频时长为准,不能只按预估秒数拼接。我犯过这个错:预估每个镜头 4 秒、12 个镜头刚好 48 秒,结果配音出来是 52 秒,最后两秒黑屏,尴尬。
第十步:逐层验收
内容
- 故事能在静音和只听声音两种情况下理解;
- 前 3 秒有明确钩子;
- 反转有前置线索;
- 没有事实、版权或平台风险。
连续性
- 角色、服装、道具、方位、光线连续;
- 动作起止能衔接;
- 没有突然出现/消失元素。
技术
- 分辨率、帧率、编码、时长正确;
- 无黑帧、花屏、音爆和字幕裁切;
- 音量稳定,台词可懂;
- 封面在小尺寸可读。
文件
master.mp4、captions.srt、封面、素材 manifest、脚本和分镜齐全;- 每个外部资产有来源和授权记录;
- 草稿与最终版命名清楚。
我现在的习惯是建一个验收 checklist,每个镜头逐条打勾。虽然慢一点,但比导出后发现 bug 再回头改要省时间得多。
常见失败(我都踩过)
角色每镜头变脸
先做角色圣经和批准参考图;提示中只强调不可变化特征;每镜头记录资产。
镜头单独好看,合起来不连贯
分镜表增加 start/end state,维护连续性台账。
台词和字幕错位
先锁音频,再按真实波形/时长生成时间码。
一次生成整集无法修
按镜头生成和验收,失败只重做单镜头。
这些坑每一个我都实打实摔过。尤其是「一次生成整集」那个——当时想着省事,让 AI 一口气出 10 个镜头,结果第 3 个镜头角色就变样了,后面 7 个全废。现在老老实实逐镜头走,反而更快。
完成门槛
- [ ] 项目、角色、场景和版权圣经已冻结。
- [ ] 分镜含开始/结束状态和验收点。
- [ ] 关键帧先于视频生成并逐镜头批准。
- [ ] 连续性台账完整。
- [ ] 配音、音乐、肖像和素材有授权。
- [ ] 成片经过内容、连续性、技术和文件验收。
- [ ] 未经人工批准没有发布。
好了,以上就是我折腾 AI 漫剧总结下来的完整流程。核心就一句话:规则写死、逐镜头验收、不跳步。希望能帮你少踩几个坑。有任何问题欢迎来交流,小枫同学在评论区等你。
相关 Skill
查看 官方创作类 Plugin 推荐 和 社区创作 Skill 推荐。