Skip to content

用 Codex 制作 AI 漫剧与短片

嘿,朋友们!小枫同学来啦。

最近我在折腾一件挺有意思的事:用 AI 做一条 45 秒的竖屏漫剧短片。说实话,一开始我天真地以为就是「输入提示词 → 出图 → 出视频 → 拼起来」这么简单。结果第一条片子翻车翻得彻底——主角第一镜是黑发,第二镜变棕发,第三镜发夹直接消失了,手表也从左手跳到右手。观众看的时候估计满脑子问号:这到底几个人?

踩完这个坑我明白了:AI 生成单张图可以靠运气,但连续十几二十个镜头还能保持一致,靠的是一套约束系统。本页就是我总结的一套可重复流程,从设定角色到最终导出 mp4,每一步都有明确的检查点。核心思路就是——先把规则写死,再让 AI 在规则里发挥

不会写代码也能玩

这一章的内容,代码部分完全可选。普通创作者用 ChatGPT Work 整理角色设定、脚本和分镜,用自己习惯的授权图像/视频工具生成素材,最后扔进剪映或 CapCut 里手动组装就行。角色圣经和分镜表存成 Word、Excel 或者普通表格都可以,不用非得 Markdown。

Remotion、React、批量脚本这些东西,只是当你需要一口气产出几十个镜头时的效率工具。第一条作品建议控制在 30–45 秒、2 个角色、1 个场景,逐镜头走一遍验收,比追求全自动生成整集靠谱得多。

开始前推荐先看看这两篇:普通人的任务说明法隐私、权限与审批

第一步:写项目圣经

别被「圣经」这个词吓到,说白了就是一张项目约束卡。我每次开新项目第一件事就是写这个,因为后面所有决策——镜头比例、色调、节奏——都从这里派生。

project-bible.md

md
# 项目

- 类型:轻科幻悬疑漫剧
- 时长:45 秒
- 画幅:9:16,1080x1920
- 平台:短视频信息流
- 受众:18+,不含血腥和惊吓特写
- 画面:二维赛璐璐 + 克制霓虹
- 节奏:前 3 秒给异常,30 秒反转,最后 5 秒悬念
- 交付:mp4、srt、封面、分镜表、素材清单

同时把版权边界也写进去:原创角色、不模仿在世艺术家独特风格、不使用无授权音乐、Logo、人物肖像和影视角色。

我自己的教训:第一次做的时候没写「画面风格」这一条,结果不同镜头生成了不同画风——有的是厚涂,有的是平涂,拼在一起违和感拉满。现在这一条我永远放在最前面。

第二步:建立角色与场景圣经

每个角色固定这些信息:

  • 年龄段、体型、脸型、发型;
  • 服装、颜色、配件;
  • 不可变化特征;
  • 常用表情和动作;
  • 正面、侧面、背面参考;
  • 配音音色和语速;
  • 禁止出现的元素。

示例:

md
## 林岚

- 25 岁,短黑发,左侧银色发夹
- 深灰连帽外套,内搭橙色 T 恤
- 右手戴黑色运动手表
- 不可变化:发夹在左侧、外套无 Logo、瞳色棕色

这里有个关键操作:先生成角色设定图,人工选定。后续每个镜头都用这张已批准的参考图,不要在每个镜头里重新发明角色长什么样。我踩坑之后养成一个习惯:把选定的人物参考图直接贴在角色圣经里,每次提示都引用同一张图。

好,有了项目约束和角色设定,接下来就是把故事变成能拍的东西。

第三步:把故事写成可拍脚本

text
根据 project-bible.md 写一条 45 秒竖屏漫剧脚本。

要求:
- 前 3 秒出现可见异常;
- 只用 2 个角色、1 个主要场景;
- 台词总字数控制在适合 45 秒配音的范围;
- 每句台词推动信息或冲突;
- 不依赖旁白解释画面中看不到的关键事件;
- 结尾留下一个明确悬念;
- 先输出节拍表,再输出对白稿。

拿到脚本后,人工检查故事逻辑、节奏、平台规则和内容风险,都确认没问题了再冻结为 script-v1.md。冻结的意思是——后面改分镜可以微调,但故事骨架不再动了。我试过边拍边改故事,结果就是镜头越改越多、逻辑越改越乱,最后整条片子推倒重来。

第四步:生成结构化分镜表

让 Codex 输出 CSV 或表格,每个镜头至少包含这些字段:

  • shot_id;
  • 时长;
  • 景别和机位;
  • 角色、动作、表情;
  • 场景和光线;
  • 台词/旁白;
  • 音效/音乐;
  • 开始状态与结束状态;
  • 图像提示;
  • 视频运动提示;
  • 参考资产;
  • 验收点。

提示:

text
把 script-v1.md 拆成 8-12 个镜头。每个镜头必须写清上一镜头结束状态和本镜头开始状态,以保证人物位置、视线、道具和光线连续。动作强度按"静止/轻微/明显"标记,不要用空泛的"电影感"。

「开始状态」和「结束状态」这两列是我后来特意加的——之前翻车就是因为镜头之间没有状态交接,上一个镜头角色看着右边,下一个镜头突然看左边,观众根本跟不上空间关系。

第五步:先做关键帧,不直接批量视频

这个顺序是我用无数次翻车换来的:

  1. 每个镜头先生成一张关键帧;
  2. 检查角色、服装、道具、空间和构图;
  3. 锁定通过的关键帧;
  4. 再用关键帧作为视频参考;
  5. 失败镜头单独重做,不整集重生成。

图像提示应包含固定角色块:

text
[角色固定描述]
[场景固定描述]
镜头:中近景,手机屏幕冷光照亮左脸,角色看向画面右侧门口。
保持银色发夹在左侧、灰色无 Logo 外套、黑色手表在右手。不要出现文字、水印、额外人物和额外手指。

为什么要强调「不要出现额外手指」?因为我有一次生成的画面里角色凭空多了一只手,当时没仔细检查就过了,剪进成片后才被朋友指出来,社死现场。现在每个关键帧我都会放大看手。

使用 ImageGen、Fal 或其他工具时,以当前可用 Plugin/Skill 和服务条款为准。

第六步:控制镜头连续性

建立一个 continuity-ledger.csv

text
shot_id,character_position,gaze,prop,lighting,wardrobe,start_state,end_state,approved_asset

每次生成下一镜头前,让 Codex 读取上一镜头的记录。人工重点检查这些:

  • 左右方位和视线;
  • 手中道具与开关状态;
  • 衣服、发型和配件;
  • 场景时间和光线;
  • 人物伤痕、污渍或情绪;
  • 动作能否从上镜头自然接续。

这个台账看着像流水账,但它是连续性的最后防线。我的经验是:不写台账的片子,到第五个镜头一定会出 bug;写了台账认真核对的,十个镜头也能稳稳接上。

第七步:生成视频镜头

视频提示描述变化,不重复整张画面:

text
基于已批准关键帧。镜头保持固定,角色先静止 0.5 秒,然后缓慢转头看向右侧门口,表情从疑惑变为警觉。只有头部和视线移动,衣服、发夹、手表和背景保持不变。不要推拉镜头,不要增加人物。

动作越复杂,越应该拆成多个镜头。不要指望一个 8 秒镜头同时完成走路、开门、变装、镜头环绕和爆炸——我试过,出来的东西就是一团浆糊。

第八步:配音、字幕和声音

先锁定对白再生成音频。记录这些信息:角色、文本、音色、语速、情绪、文件名和授权来源。

要求 Codex:

text
根据最终对白生成配音任务表和 SRT 初稿。字幕每条不超过两行,按真实音频时间对齐,不根据文字长度猜时间。专有名词保持 project-bible.md 写法。

使用 HeyGen、语音服务或第三方音乐前,确认肖像、声音克隆、商业使用和平台授权。未经本人明确同意不要克隆真实人物声音或形象——这是红线,不是建议。

我在这一步踩过一个坑:先做了字幕再配音,结果字幕时间全是按字数估算的,和实际音频完全对不上,最后全部重做。正确的顺序永远是先锁音频、再配字幕。

第九步:程序化剪辑

Remotion Plugin 适合用 React 组织镜头、字幕、转场、音频和批量导出。当然,用现有剪辑软件或受控脚本也完全没问题。

text
使用 Remotion 按 shots.csv 组装 1080x1920、30fps 的 45 秒短片。镜头切换以硬切和短溶解为主,不增加随机特效。加载最终配音和 SRT,保证字幕安全区。输出预览版,不发布。

程序化时间线必须以最终音频时长为准,不能只按预估秒数拼接。我犯过这个错:预估每个镜头 4 秒、12 个镜头刚好 48 秒,结果配音出来是 52 秒,最后两秒黑屏,尴尬。

第十步:逐层验收

内容

  • 故事能在静音和只听声音两种情况下理解;
  • 前 3 秒有明确钩子;
  • 反转有前置线索;
  • 没有事实、版权或平台风险。

连续性

  • 角色、服装、道具、方位、光线连续;
  • 动作起止能衔接;
  • 没有突然出现/消失元素。

技术

  • 分辨率、帧率、编码、时长正确;
  • 无黑帧、花屏、音爆和字幕裁切;
  • 音量稳定,台词可懂;
  • 封面在小尺寸可读。

文件

  • master.mp4captions.srt、封面、素材 manifest、脚本和分镜齐全;
  • 每个外部资产有来源和授权记录;
  • 草稿与最终版命名清楚。

我现在的习惯是建一个验收 checklist,每个镜头逐条打勾。虽然慢一点,但比导出后发现 bug 再回头改要省时间得多。

常见失败(我都踩过)

角色每镜头变脸

先做角色圣经和批准参考图;提示中只强调不可变化特征;每镜头记录资产。

镜头单独好看,合起来不连贯

分镜表增加 start/end state,维护连续性台账。

台词和字幕错位

先锁音频,再按真实波形/时长生成时间码。

一次生成整集无法修

按镜头生成和验收,失败只重做单镜头。

这些坑每一个我都实打实摔过。尤其是「一次生成整集」那个——当时想着省事,让 AI 一口气出 10 个镜头,结果第 3 个镜头角色就变样了,后面 7 个全废。现在老老实实逐镜头走,反而更快。

完成门槛

  • [ ] 项目、角色、场景和版权圣经已冻结。
  • [ ] 分镜含开始/结束状态和验收点。
  • [ ] 关键帧先于视频生成并逐镜头批准。
  • [ ] 连续性台账完整。
  • [ ] 配音、音乐、肖像和素材有授权。
  • [ ] 成片经过内容、连续性、技术和文件验收。
  • [ ] 未经人工批准没有发布。

好了,以上就是我折腾 AI 漫剧总结下来的完整流程。核心就一句话:规则写死、逐镜头验收、不跳步。希望能帮你少踩几个坑。有任何问题欢迎来交流,小枫同学在评论区等你。

相关 Skill

查看 官方创作类 Plugin 推荐社区创作 Skill 推荐

参考