做短视频最磨人的,其实不是想选题。
真正耗时间的是后面那一串小活:写口播、拆镜头、找画面、配音、加字幕、配 BGM、导出多个平台版本。每一件都不大,但连起来很磨人,磨着磨着就不想做了。
现在用 Codex 这类编程 Agent,可以把这套流程跑成一条可复用的生产线。今天这篇文章,把从「脚本」到「成片」的两条主路线、以及 6 款能当「赛道」的开源工具一次讲清楚。
一、先说清一个误区:Codex 本身不会剪视频
很多人装完 Codex 就以为能直接出片,事实很残酷——Codex 是编程助手,不是剪辑软件。它不会自动帮你拼接素材、加转场、配音乐。
但换个思路:Codex + 正确的开源工具 / 平台 CLI = 全自动剪辑流水线。
就像你买了台跑车,还得有赛道才能发挥。Codex 是那台跑车,下面这些工具就是赛道。
二、路线 A:脚本驱动型(知识类 / 口播类最稳)
适合科普、资讯、知识分享这类「内容结构清晰」的视频。核心心法是:先把一条视频从 0 到 1 跑通,后面每天只换选题和脚本,文件夹、参数、分镜格式全部复用。
1. 建项目文件夹,别一开始就乱
固定 6 个文件夹,文件名用英文和数字:
script/:口播脚本,如 main_v1.txt
storyboard/:分镜,如 storyboard_v1.json
pic/:画面素材, 001.png~012.png
audio/:配音 voice.wav
bgm/:背景音乐 main.mp3
output/:成片 final_1080x1920.mp4
2. 先把参数定死(避免反复返工)
项目 | 建议参数 | 备注 |
比例 | 9:16 | 竖屏短视频通用 |
分辨率 | 1080 × 1920 | 别先做 720P,容易显糊 |
帧率 | 30 FPS | 知识类够用 |
时长 | 测试 30s,正式 60s | 新流程先用 30s 练手 |
码率 | 6000–8000 kbps | 清楚且文件不夸张 |
格式 | MP4 / H.264 / AAC | 平台兼容性最好 |
字幕 | 底部居中,离底 180px,字号 52–64px | 避开平台按钮区 |
3. 让 Codex 写口播脚本
60 秒视频,口播控制在 180–220 字。给它的要求示例:
我要做一条 60 秒竖屏短视频,平台是抖音和小红书。目标用户:想用 AI 做自媒体的新手。主题:一个人怎么用 Codex 做短视频。要求:①开头 3 秒直接讲痛点;②全文 180–220 字;③口语化,不要「首先、其次、综上所述」;④每 8–12 秒一个信息点;⑤结尾给明确行动。输出格式:时间轴 + 口播正文。
4. 把口播拆成分镜(用 JSON,后续最稳)
60 秒拆 12–15 个镜头,每个 3–5 秒,转场 0.3–0.5 秒。单个镜头字段:
关键:12 个镜头时长加起来必须正好 60 秒,不然后面配音和画面会对不上。
5. 批量生成画面 + 配音
读取分镜里的 image_prompt
配音参数:自然音色、语速 1.05 倍、句间停顿 0.25–0.4 秒、采样率 44100Hz;BGM 音量比人声低 30%,首尾各 1 秒淡入淡出。
6. 用 HyperFrames 合成成片
HyperFrames 的定位是「Write HTML. Render video. Built for agents.」——你描述视频结构,Codex 生成 HTML,它渲染成视频。合成参数:画布 1080×1920、30FPS、字幕 58px 白字黑底、图片 4% 缓慢推拉、转场 0.4 秒淡入淡出,导出 H.264 MP4。
7. 预览时只改 4 类问题
第一版出来别凭感觉乱改,就盯这 4 类:字幕太小(58→64px)、BGM 太大(降 20%)、画面太静(加 4% 推拉)、时长不对(按 voice.wav 重新对齐)。建议一条视频改不超过 3 轮。
三、路线 B:即梦 CLI 驱动型(AI 生成类 / 短剧类)
适合 AI 短剧、广电商素材、AI 带货这类「要从 0 生成画面」的视频。核心是用平台开放的 CLI,让 Agent 直接调即梦(Dreamina)批量生成视频。
1. 装即梦 CLI(三步)
。注意:即梦 CLI 需要**高级会员(maestro vip,599/月)**才开放权限,标准会员会报
current account is not maestro vip2. 用「文资视剪」框架组织生产
- 文
:剧本 / 分镜脚本。先做成 90 秒左右的第一集开场,把世界观和主角立住。
- 资
:角色四视图、场景氛围图、世界设定概念板(主要角色、核心场景、关键道具、氛围关键词),给整体定调。
- 视
:用资产 + 导演级提示词生成视频。多图参考时,提示词里务必写清 @图片1负责角色、@图片2负责首帧构图、@图片3负责场景,否则角色和场景会乱。
- 剪
:本地装好 ffmpeg 即可自动合成;需要剪映草稿就让 AI 生成草稿片段。
3. 把经验沉淀成 Skill
生成过程需要不断抽卡微调。好的做法是:把「字幕正确、人物一致、空间逻辑」等经验写成 Skill,每次大版本迭代就更新,让 AI 越做越准。还可以开子智能体分别处理不同任务,并行提速。
四、你的 6 款开源「赛道」工具
工具 | 干什么 | 适合谁 |
HyperFrames | 用 HTML 写视频,Codex 生成 HTML 出片 | 知识类 / 科普类,内容结构清晰 |
Remotion | 用 React 写视频,时间轴即 state | 会前端、做数据可视化视频 |
Video-Use | 一句话全自动:丢素材 → 说「剪成发布视频」→ 等完成 | 不想写代码、批量口播 |
Auto-Editor | 自动删停顿 / 语气词(「嗯啊这个那个」) | 口播博主、课程录制、播客 |
MoviePy | Python 剪辑瑞士军刀,加字幕 / 水印 / 片头片尾 | 愿写脚本、要高度自定义 |
FFmpeg-Batch | 命令行批量转码 / 裁剪 / 加水印 | 大量素材批处理、技术型用户 |
选择建议:完全不想写代码 → Video-Use / Auto-Editor;会点 React → Remotion / HyperFrames;愿写 Python → MoviePy;批量处理 → FFmpeg-Batch + Codex。
五、效率对比与结语
以一条 3 分钟科普视频为例:
- 传统流程
:写脚本 2h + 录素材 1h + PR 剪辑 3–4h + 字幕调色导出 1h ≈ 7–8 小时
- Codex + 开源工具
:脚本辅助 1h + 录素材 1h + 自动剪辑 0.5h + 微调导出 0.5h ≈ 3 小时
省下的 5 小时,够你再做一条了。
最后说句实在话:AI 剪辑工具不是来取代剪辑师的,它们是来干掉重复劳动的——删气口、加字幕、批量导出、格式转换。这些活本来就不该占用你的创造力。工具只是放大器,你对内容的理解、对节奏的把控,才是核心。
