做过 AI 视频的人,或多或少都经历过这种崩溃时刻:
上一镜女主还是齐刘海长发,下一镜她变成了短发大波浪;同一个客厅场景,镜头一切光从左边打过来变成了右边;桌上摆的茶杯,第一帧是青花的,第三帧变白瓷了。
你盯着屏幕看了半天,开始怀疑人生——这到底是同一部剧,还是平行宇宙的番外篇?
圈内管这叫"抽卡式生产"。
生成三五次才出一张能用的,运气好了拼出一集,运气不好一整天卡在一个镜头上。个人的时间成本、团队的算力成本,全消耗在这种开盲盒的循环里。
大厂们早把这套工业化能力锁在自己的围墙里了。普通创作者想入局短剧赛道,要么花大价钱买闭源云服务,要么拿一堆零散工具东拼西凑(缝缝补补又一天)。
但近期在 GitHub 上发现一个叫 DramaClaw 的项目——它没有发明什么革命性的新模型,但它把漫剧工业化生产的整套流水线,完整地、免费地、可自托管地,交到了每个创作者手里。

DramaClaw 是什么?
DramaClaw 是成都新飞翔科技团队自研的工业级 AIGC 视频制作工具,基于自研的"灵山"AI 编导大模型,提供从剧本导入到成片输出的全链路流水线。

它面向 AI 短剧、漫剧、小说推文、解说剧等多类型视频创作场景,主打一个核心理念:确定性生产。
项目 README 里有一句话写得特别直白:
"这不是 demo。不是玩具。不是阉割版。这是一条我们团队自己每天在跑的漫剧工业化生产线。"
这话不是吹牛。他们用这条流水线已经产出了多部完整商业级短剧,全部挂在 README 里可以直接点开看:《归灵司》《鲁班》《师兄你怎么不舔了》《天命不可欺》《乌龙仙途》,还有非遗主题的《㑇舞》宣传片。

随便点开一集,角色跨镜头的稳定性、场景的空间连贯性、配音的情绪贴合度,都甩开"抽卡式 AI 视频"好几条街。
更关键的是,这条流水线不局限于漫剧。同样的架构——角色管理、资产库、脚本、分镜、配音、合成——稍加调整就能用来做短视频广告、电商带货视频、甚至乙女互动游戏的素材生产。
核心创新
DramaClaw 和其他 AI 视频工具最本质的区别,就两个字:确定性。
资产先行,锁定身份锚点
大多数 AI 视频工具的逻辑是"给描述 → 出视频",每次生成都是独立事件,角色和场景的身份没法稳定传承。
DramaClaw 反其道而行——先建资产库,再做内容生产。
它的"虾塘"资产库会把整个故事里出现的所有元素结构化提取:
• 角色:每个角色生成独立肖像、造型变体(日常/战斗/古装)、配置专属声线 • 场景:核心场景生成正面图、背面图、甚至 360° 全景图 • 道具:武器、法宝、日常用品独立管理,避免重复生成 • 声线:支持 IndexTTS2 等多家配音,每个角色固定专属音色
有了这些"锚点",后面不管生成多少集、多少镜头,角色和场景的身份都是稳的。第1集和第100集,就是同一个人、同一个场景。
导演世界(3GS),建立空间坐标系
这是 DramaClaw 最硬核的设计。
穿帮的本质,是模型没有"世界的记忆"。上一镜女主在客厅左边,下一镜跑到了右边;光源方向莫名翻转——这些不是概率问题,是空间逻辑没建起来。
DramaClaw 给核心场景构建了一个虚拟三维片场,锁定空间结构、人物站位和镜头机位。就像真实影视拍摄一样,导演喊"机位拉到左前方45度,女主上前一步",出来的画面是连贯的、空间逻辑自洽的。长篇连载做到二三十集,这层"稳"的差距就出来了。
线稿先行
这是个很朴素但很多 AI 产品不肯低头的工程思路。
DramaClaw 不是直接跳去生成高清图,而是先出线稿草图让创作者确认构图、角色位置、镜头意图。确认构图没问题后,再生成最终渲染图。
做过 AI 视频的都懂,一遍遍抽卡、每次都全尺寸精渲染,算力烧的、时间耗的,才是真痛。
线稿这层等于把返工成本卡在了最便宜的阶段——构图错了改线稿,几秒钟的事;渲染错了重跑,那是真金白银的算力。
功能全景
DramaClaw 的功能模块都有很可爱的中文名,统一姓"虾"——Claw 是爪,爪谐音虾,项目 Logo 就是个龙虾爪。
01 | 虾料:小说解析与故事图谱
第一步"吃原料"。上传小说文件或粘贴剧本文本,系统自动解析章节结构,构建一张可查询的故事图谱——角色关系、事件时间线、出场频次、情绪变化曲线全在里面。后面的所有环节都基于这张图谱,不是瞎生成。
剧本生成还给了三种模式:
• 改编模式:适合小说转剧本,自动提炼戏剧冲突 • 直译模式:忠实原稿台词 • 分镜稿模式:直接输出可拍摄的分镜文本
每种模式后面都有审校和修复循环,避免 AI "写嗨了"偏离主线。
02 | 虾塘:资产库与身份一致性
整个系统的"地基"。角色、场景、道具、声线四类核心资产统一管理,多集连载最头疼的"跨集身份一致性"问题,在这里从工程层面被锁死。
03 | 虾镜:分镜与首帧生成
按节拍点生成风格化分镜图,支持网格切分和图像池选优。核心是"先线稿后渲染"的两段式流程,返工成本直接砍掉一大半。
04 | 配音合成
支持多服务商切换,核心是情绪感知——不是冷冰冰读台词,而是根据上下文判断角色当下该愤怒、悲伤还是欣喜,语气重音跟着走。
05 | 虾画:无限画布(Freezone)
这是最有"创作感"的功能。主线生产是按部就班的流水线,但创作很多时候需要"玩一下"。
无限画布是一个节点式可视化工作台,把虾塘里的资产拖进去自由组合生成图片/视频/音频,看到满意的结果一键"晋升"回主线项目。
主线流水线 + 画布探索双轨并行,既有工业稳定性,又保留创作自由度。
画布里调完的镜头还能同步回批量主线,不是两套割裂的系统——这个衔接才是关键,很多工具的通病就是量产和精修两条线分家,最后合成一堆麻烦。
06 | 虾导:AI 导演助理
对话式 AI 助手,但不是只会说"好的"的聊天机器人。它能查项目进度、推进具体任务、检查交付完整性、给出下一步建议。接的是灵山编导大模型,可以用自然语言下指令——"镜头往后拉一点,情绪压一压"这种话,模型自动匹配分镜、人物表演和光影调整。

做 AI 视频最耗人的从来不是创意,是脑子里画面清楚、手上却在翻文档调参数试插件。这块能省的心力,用过的自然有感觉。
07 | 视频合成与导出
最后一步:把分镜画面、配音、字幕组装成完整视频,支持导出视频文件 + SRT 字幕文件 + 整套素材包。也可以导进专业剪辑软件做精修。
快速上手
方法一:Docker 一键部署(最推荐)
# 1. 克隆代码
git clone https://github.com/dramaclaw/dramaclaw.git
cd dramaclaw
# 2. 准备配置文件
cp .env.example .env
# 打开 .env,至少把 PROMPT_EXPORT_PASSWORD 改成非默认值
# 3. 启动(第一次构建镜像会慢一点)
docker compose up -d --build启动完成后:
• 网页 UI:http://localhost:8080 • REST API:http://localhost:8780
方法二:免构建跑法
GitHub Release 发布了 amd64/arm64 多架构镜像,直接拉镜像不用本地构建:
curl -LO https://raw.githubusercontent.com/dramaclaw/dramaclaw/main/docker-compose.release.yml
docker compose -f docker-compose.release.yml up -d
# 想固定版本号
DRAMACLAW_VERSION=1.0.1 docker compose -f docker-compose.release.yml up -d方法三:本地开发模式(适合二开)
git clone https://github.com/dramaclaw/dramaclaw.git
cd dramaclaw
# 需要 Python 3.11-3.12 + uv + ffmpeg
uv sync
cp .env.example .env
# 编辑 .env 配置
# 启动 REST API
uv run novelvideo api --port 8780本地开发模式下任务依然进程内内联执行,不需要 Ray、Redis、Celery 这些重型组件。
写在最后
当前很多 AI 内容生产仍像是'抽卡',三五次生成才能得到一个可用结果,这不叫工业化,
这叫概率游戏。
真正的工业化,核心是'确定性'——系统能稳定产出符合叙事与视觉标准的成片,实现'生产即交付'。
过去两年,AI 视频赛道热闹非凡,模型一轮比一轮强,效果一轮比一轮炸。但真正做过内容的人都清楚:单点效果再炫,如果不能稳定量产、不能跨镜头一致、不能控制成本,那就永远停留在"玩具"阶段。
DramaClaw 做的事,不是去卷模型参数,而是把散落在十几个工具里的短剧生产流程,用一套工业化框架串起来——资产先行锁身份、导演世界稳空间、线稿先行控成本、双轨工作流保灵活。
然后免费、开源、可自托管地交到每个创作者手里。
GitHub:https://github.com/dramaclaw/dramaclaw
官方主页:https://dramaclaw.ai

如果本文对您有帮助,也请帮忙点个 赞? + 在看 哈!❤️

