跳转至

Codex 自动化剪辑带货视频

把一条爆款视频交给 Codex(一个能帮你干活的 AI 命令行帮手)。

它照着爆款的结构,用你的素材,自动剪出新视频。

最后给你一份剪映草稿。打开检查、微调,就能发。

原作者实测:以前一天最多剪 6 条,现在能出 30 条。

这页能帮你做什么

  • 搭一套自动剪辑流程:参考视频进,剪映草稿出。
  • 全程用现成提示词,复制粘贴就能跑。
  • 跑通后封装成 Skill,以后一句话出片。

适合什么视频

  • 电商和广告素材。比如抖音千川素材、硬广视频。
  • 无人出镜的带货视频。比如图书带货。
  • 混剪类娱乐视频或 Vlog。效果会一般,AI 不太懂情绪点。

想做讲究镜头语言的精品原创,这套流程不适合。

开始前准备

按清单备齐。缺一样,后面会卡住。

  • Codex:整套流程靠它执行。
  • FFmpeg:处理视频的免费工具。拆分、合成都靠它。
  • Python:一种编程环境。版本要 3.8 以上。
  • 剪映专业版:电脑版剪映。最后的草稿在这里打开。
  • 配音工具:二选一,看下面的对比。

付费但稳定,是剪映同源的 AI 配音。

1 分钟左右的视频,配音约 0.4 到 0.8 元人民币(原作者实测,以页面显示为准)。

免费开源,能克隆自己或别人的声音。

在 GitHub 上能找到。把链接发给 Codex,让它安装。

不确定环境装没装好?把这段话复制发给 Codex:

请帮我检查视频自动化剪辑需要的环境:

1. 检查 FFmpeg 是否已安装,如果没有请帮我安装
2. 检查 Python 版本是否 >= 3.8,如果没有请帮我安装或升级
3. 检查是否安装了剪映专业版,如果没有请告诉我下载链接
4. 安装 Python 依赖包:opencv-python, numpy, pillow

检查完之后,告诉我哪些已经装好了,哪些需要我手动处理。

照着做

第一步:建项目文件夹

  1. 在电脑上建一个项目文件夹。
  2. 在里面照这个结构建子文件夹:

    项目文件夹/
      assets/           # 你的素材库
      work/             # 工作区,每次剪辑在这里建一个日期文件夹
      final/            # 最终成品
      AGENTS.md         # 项目配置文件
    
  3. 把素材放进 assets/

素材可以是 AI 生成的,也可以是实拍的。

放进去前,先人工筛一遍,只留能用的。

可以按外观、功能、场景分类存放。素材质量越稳,成片越稳。

第二步:写 AGENTS.md

AGENTS.md 是项目配置文件(就是写给 Codex 看的说明书)。

它记录项目目标、输出规格、验收标准。Codex 靠它理解你的要求。

把下面的模板存成 AGENTS.md,放在项目文件夹里。

AGENTS.md 模板全文(点开复制)
# AGENTS.md

## 目标

一句话说明这个项目要完成什么。

## 目录

项目根目录只保留稳定结构,单次剪辑产生的过程文件放进当日工作文件夹。

- AGENTS.md:项目长期上下文,记录目标、目录、流程、输出和验收标准。
- assets/:提前准备好的产品素材、场景素材、人物素材、AI 片段和其他可复用素材。剪辑时只从这里复制素材,不移动或破坏原文件。
- work/:正在制作或待审核的视频项目。每次剪辑在这里创建一个当日工作文件夹。
- final/:已经完成并确认通过的视频,从 work/ 迁移到这里,避免工作区文件过多。

每次剪辑时,在 work/ 下创建一个当日工作文件夹:

work/
  YYYY-MM-DD/
    reference-YYYY-MM-DD.mp4
    video_clips/
    script.txt
    material/
      fragment01/
      fragment02/
    voice/
    jianying_draft/

当日工作文件夹说明:

- reference-YYYY-MM-DD.mp4:用户提供的完整参考视频,作为整体顺序、节奏、时长、音频和拆解依据。若同一天有多个任务,可在日期后追加短标题或序号。
- video_clips/:自动拆解参考视频后得到的画面片段和参考帧,用作视觉顺序和素材匹配依据。
- script.txt:从参考视频、用户文案、口播稿或配音文件整理出的口播/字幕/配音文本;没有文案时可为空或不创建。
- material/fragmentNN/:从 assets/ 筛选并复制过来的当前片段候选素材或已批准素材。
- voice/:按片段生成的配音、清理后人声、分段语音和拼接后的成品音频。
- jianying_draft/:当前样稿对应的剪映草稿、草稿检查报告和必要备份。只在需要生成剪映草稿时创建。

关键来源规则:

- 完整参考视频是音频、整体顺序和总时长的依据。
- video_clips/ 是视觉顺序和视觉匹配的依据。
- material/fragmentNN/ 是审校通过后的生产素材来源。
- 使用生成配音时,以每段真实完成语音时长作为画面和字幕时长依据。
- recipe.json 和 matches.json 是核心自动化流程的机器可读依据。

## 流程

流程路径:

读取参考视频 → 拆分参考画面 → 提取文案/配音文本 → 筛选原始素材 → 生成配音 → 生成样稿和剪映草稿

1. 读取参考视频:在 work/YYYY-MM-DD/ 下创建当日工作文件夹,将用户提供的参考视频保存为 reference-YYYY-MM-DD.mp4。
2. 拆分参考画面:使用自动镜头切分和关键帧抽取拆解参考视频,片段和参考帧保存到 video_clips/,结构数据保存在当日工作文件夹。
3. 提取文案/配音文本:从参考音频、用户文案或配音文件中整理口播文本,保存为 script.txt。
4. 筛选原始素材:读取 assets/,用参考帧和素材抽帧做视觉匹配,候选结果保存到当日工作文件夹,通过的素材复制到 material/fragmentNN/。
5. 生成配音:默认使用豆包语音模型生成新配音,分段语音和合成音频保存到 voice/。
6. 生成样稿和剪映草稿:用筛选素材和新配音生成样稿,并创建剪映草稿保存到 jianying_draft/,供用户打开审核。

## 输出

保存通用输出配置;单次特殊要求以用户当前指令和 skill 执行结果为准。

- 视频比例:9:16 竖屏。
- 分辨率:1080x1920。
- 帧率:60fps。
- 文件命名规则:YYMMDD-platform-product-序号.mp4,英文缩写优先,避免文件名过长或乱码。
- 默认音频:不保留原参考音频,使用新配音。
- 默认审核方式:生成剪映草稿,供用户打开审核。
- 默认归档方式:用户确认通过后,从 work/ 迁移到 final/。

## 验收

视频合格标准:

- 每个视觉片段都有可用素材;缺素材和低置信度片段必须明确暴露。
- 不用无关素材硬凑数量。
- 素材画面和产品、场景、动作、景别、角度、光线、产品可见度和构图基本匹配。
- 文件名和文件夹名只能作为线索,最终要看画面。
- 复制素材,不移动或破坏原始素材。
- 用内容指纹识别重复素材,不能把不同文件名当成不同内容。
- 三个连续镜头范围内尽量避免同一来源文件夹重复出现。
- 相邻片段避免明显重复的房间、构图或语义场景。
- 有关联的 AI 片段或同一角色片段要保持身份连续。
- 成片视觉速度保持 1.00x,除非用户明确要求变速;短素材可定格补足,不通过变速硬拉。
- 成片比例、分辨率和帧率符合本文件的通用配置;时长和数量符合用户当前要求或本次任务设置。
- 成片时长和参考或本次目标时长的偏差应在可接受范围内,明显偏差要说明。
- 字幕必须在所属片段内,按语义断句,不机械凑字数。
- 字幕不遮挡产品主体、关键动作或重要信息。
- 如果使用配音,以真实成品配音时长为画面和字幕依据。
- 配音要检查开头、中间边界、最长停顿、最紧字幕边界和结尾。
- 不声称完成 ASR、TTS、声音克隆或剪映草稿,除非对应工具真实运行并产出可验证文件。
- 如生成剪映草稿,必须是新建可编辑草稿,不能覆盖原生或加密缓存。
- 剪映草稿的内容 ID、元数据 ID 和根索引 ID 必须一致,批量草稿 ID 不能重复。
- 剪映草稿的素材路径必须存在,媒体源范围不能超过真实时长。

模板里的输出规格(比例、分辨率、帧率)按你的平台改。

第三步:拆解参考视频

  1. 找一条你想模仿的爆款视频。自己剪过的好片也行。
  2. 把它下载到电脑。
  3. 存进 work/ 里的日期文件夹,起个好认的文件名。
  4. 把这段话复制发给 Codex:

    我需要拆解一个参考视频。
    
    参考视频位置在@(输入你的文件名,Codex会自动搜索)
    
    请帮我完成这几件事:
    1. 用 FFmpeg 识别视频的镜头切换点(通过帧间差异分析)
    2. 为每个镜头提取关键帧,保存为图片
    3. 提取视频的音轨,单独保存
    4. 生成一个 recipe.json 文件,记录每个镜头的开始时间、结束时间、时长、关键帧路径
    5. 如有文案,根据音频生成一个配音文本,按镜头分段,文案需要精校,避免出错
    
    完成后按照AGENTS.md要求,保存到对应文件夹,并告诉我识别了多少个镜头,让我确认切分是否合理。
    
  5. 等它跑完,打开文件夹看拆出的小片段和截图。

  6. 检查镜头切得对不对。切错了就让 Codex 调整。

这一步会生成 recipe.json(记录每个镜头结构的文件)。

后面的素材匹配、配音、草稿,都以它为依据。

第四步:匹配素材

这一步让 Codex 从素材库里,给每个镜头自动挑素材。

把这段话复制发给 Codex:

我需要从素材库中匹配替换素材。

项目信息:
- recipe.json 路径:(上一步的拆解路径)/recipe.json
- 素材库路径:assets/
- 输出路径:work/(你的保存路径)

匹配要求:
1. 读取 recipe.json 中每个镜头的关键帧
2. 遍历素材库,为每个素材提取关键帧
3. 通过颜色、亮度、构图等视觉推荐最匹配的素材(给出置信度得分)
4. 应用这些规则:
   - 避免连续3个镜头都用同一来源的素材
   - 避免相邻镜头出现明显重复的房间或构图
5. 生成 fragment_plan.json 和 matches.json
6. 把选中的素材复制(不是移动)到 material/fragment01/, fragment02/ 等文件夹

重要原则:如果某个镜头的匹配置信度低于 0.6,标记为"缺素材",不要用无关素材硬凑。

完成后,告诉我匹配结果,并列出哪些镜头缺素材需要人工补充。

两条底线

  • 一定强调「复制,不是移动」。不然 Codex 可能弄乱你的原始素材库。
  • 宁可标「缺素材」,不用无关素材硬凑。硬凑的视频一眼假。

跑完检查匹配结果。不满意的镜头,让 Codex 重新换,或自己手动换。

第五步:生成配音

  1. 先检查第三步提取的文案。AI 识别可能有错字。
  2. 改好后,把这段话复制发给 Codex:

    我需要为视频生成配音。配音文本是@(你的文案.txt)
    
    要求:
    1. 调用豆包 TTS 接口,为每个镜头生成独立的语音文件
    2. 读取每个生成的语音文件的实际时长
    3. 如果配音时长和参考视频的镜头时长不一致,记录时长差异
    4. 将所有片段拼接成完整的配音文件:final_voice.mp3
    5. 更新 recipe.json,记录真实的配音时长
    
    完成后,让我试听一遍,确认语音自然度和语速。
    
  3. 生成后试听一遍。听语速自然不自然。

配音比镜头长时,Codex 会把画面拉长对齐,不用你操心。

第六步:生成剪映草稿

把这段话复制发给 Codex:

我需要生成最终的视频和剪映草稿。

输入信息:
- recipe.json:work/recipe.json
- matches.json:work/matches.json
- 素材路径:work/material/
- 配音文件(可选):work/voice/final_voice.mp3
- 字幕文本(可选):work/script.txt

输出:
1. 渲染预览视频:work/remix.mp4
2. 字幕文件:work/captions.srt
3. 剪映草稿:work/jianying_draft/

要求:
1. 按照 recipe.json 和 matches.json,把素材按顺序拼接
2. 如果有配音,用配音的时长作为基准;否则用参考视频的时长
3. 生成 .srt 格式的字幕文件
4. 生成剪映可以打开的草稿格式,注意:
   - 内容 ID、元数据 ID、根索引 ID 必须一致且唯一
   - 素材路径必须是绝对路径且文件真实存在
   - 所有素材先复制到项目文件夹,避免路径失效

直接生成剪映草稿,完成后提醒我审核和确认。

第一次生成比较久,大概十几分钟。

完成后打开剪映,按这个清单检查:

  • 草稿能不能正常打开。
  • 素材是不是都正常显示。
  • 时间轴对不对,镜头时长和顺序是否和预期一致。
  • 字幕对不对,有没有遮挡关键内容。
  • 配音和画面是不是同步。

有问题就回到前面对应步骤,让 Codex 逐一修。

第七步:封装成 Skill

整套流程跑通后,直接跟 Codex 说:帮我把工作流封装成 Skill。

以后出片,只要调用 Skill、给参考视频位置就行。

刚封装的 Skill 会有问题,正常。多用,发现问题让 Codex 修,反复几轮就稳了。

常见问题

剪映草稿打不开,或打开报错

多半是草稿格式问题。检查三点:

  • 内容 ID、元数据 ID、根索引 ID 要一致,且不和旧草稿重复。
  • 素材路径必须是绝对路径,文件必须真实存在。
  • 生成草稿后,别移动素材文件。移动了草稿就失效。
有些镜头标了缺素材

这是设计好的行为,不是出错。

说明素材库里没有合适的。自己补拍或用 AI 生成,放进对应文件夹。

成片看着僵硬,一眼像机器拼的
  • 检查匹配提示词里的规则有没有带上。
  • 最后花 10 分钟人工细化:加 BGM、音效、强调花字。
  • 细化后的片子,别人基本看不出是 AI 生成的。

需要人工帮助

照上面步骤仍未解决,点击页面右下角的人工按钮,在线说明来意。

来源:https://my.feishu.cn/docx/KkNcd3z9DogsuAx4ihWcY9kgn7g(整理于 2026-07-28)