导语:凌晨两点,我把十段视频拖进剪映,点了导出。60 秒后成片出来了,但我看完第一遍就愣住了——画面能看,声音却像换了三个演员,字幕把“辐射计”翻成了“柜台”。这次最值钱的东西不是视频,是我终于知道“跑通工具”和“做出作品”之间差了什么。
一、先把结果放出来
上周我被朋友安利了一个叫 LibTV 的 AI 视频工作台,说是能把角色、场景、分镜、提示词和视频生成放在同一张画布上。我好奇心上来,决定用 60 秒废土短片做一次完整实战。
今天凌晨,我真的跑完了整条链路:
• 主角 Elias Ward 的角色定妆、三视图、近景和情绪参考;
• 地表废土、地下走廊、竖井、人工绿洲、水边五个场景;
• 辐射检测仪、门禁终端、圆形舱门三个道具;
• 10 个镜头、60 秒导演表;
• 10 段视频、剪映合并、导出 1920×1080 的 MP4。
从技术角度看,链路通了。但从作品角度看,这条片子不能发。
原因很直接:我自己都说不清它到底在讲什么,而且同一个人物的声音在十个镜头里变了样。
下面是本次完整样片。它只用于失败复盘,不代表最终作品质量。
? 视频占位:01_BELOW_THE_SILENCE_60秒失败样片_DO_NOT_PUBLISH.mp4
二、LibTV 到底是什么
先简单说一下工具,免得你们被名字唬住。
LibTV 不是剪辑软件,也不是一个单独的 AI 模型。它是 LiblibAI 出的浏览器端工作台,核心是一块无限画布。
你可以在上面放角色图、场景图、道具图、文本、脚本和视频节点,然后用连线把她们串起来。最有用的是它的 Script V2 / 脚本节点,能把镜头信息整理成最终提示词,再调用 Seedance 2.0 这类模型去批量生成视频。

LibTV 把角色、场景、道具、脚本和生成节点放在同一张画布上。

无限画布不是时间线,而是节点式的生产管理台。
说白了,它擅长组织和执行,但没办法替你判断剧本好不好看、声音统不统一、观众能不能看懂。
这点我后面会深有体会。
---
三、我实际做了什么
我定了一个末世废土 + 地下绿洲的 60 秒概念片,主角叫 Elias Ward,一个中年工程师幸存者。
第一步是给主角定妆。不是只画一张好看的脸,而是要有全身、正面、侧面、背面、近景和表情参考。因为 AI 视频最大的坑就是“换个镜头就换张脸”。

角色一致性不能只靠名字,正侧背、近景和表情都需要先锁定。

多角度参考是为了约束模型在不同镜头里别把人画走样。
第二步做场景资产。地表废土、地下走廊、竖井、绿洲全景、水边区域,全部按 16:9 画幅准备。

先做环境资产,再进入镜头,能减少每个镜头重新描述世界观。


绿洲是视觉高潮,但场景漂亮不等于故事清楚。
第三步做道具:辐射检测仪、门禁终端、圆形舱门。
第四步就是填十镜头导演表。我把 60 秒拆成 10 个 Meaning Units,每个镜头写时长、画面、景别、光影、对白、音效和运镜。

一分钟被拆成十个镜头,每个镜头都有独立的叙事任务。
第五步,把角色、场景、道具绑定到脚本节点里。

准备资产阶段不是整理相册,而是在给后续镜头建立可引用的视觉主数据。
第六步,生成每镜的最终提示词。提示词里用 `@角色/@场景/@道具` 引用固定资产,同时写清楚画面和运动。

最终提示词应引用固定资产,并同时描述画面和运动。
第七步,先做了第一镜 canary,确认画面能生成,再批量生成十镜。

单镜 canary 用来检查人物一致性、动作、运镜和成本,不等于整片验收。

批量按钮很方便,但只有 canary 通过后才应该点击。
最后导入剪映合并,加了字幕,导出成片。

成功导出只代表技术完成,不代表故事、声音和字幕合格。
---
四、哪些地方确实有效
虽然成片失败了,但有几个地方我必须承认它是对的:
1. 资产组织。把角色、场景、道具都摊在一张画布上,确实比我在 ChatGPT、Midjourney、Runway 之间来回倒腾要清楚。
2. @资产引用。在提示词里写 `@Elias_Ward @Wasteland_Surface @Radiation_Meter`,模型真的能识别出角色和场景,比纯文本描述稳定。
3. 十镜头表。把故事拆成 10 个可执行单元,比直接写一大段提示词要可控。
4. 批量生成。10 段视频按顺序生成,最后能拼出一条 60 秒成片,这是以前靠单条 prompt 很难做到的事。
5. 输出规格。最终确实是 1920×1080、30fps、60.674 秒,技术链路没问题。
所以问题不在 LibTV 能不能跑通,而在于我把跑通当成了成功。
---
五、成片为什么失败
我总结了四个硬伤,按严重程度排:
1. 剧本信息不闭环
原本想讲的故事是:工程师在废土发现辐射计归零,找到地下设施,发现人工绿洲,意识到可能还有其他幸存者。
但成片里观众看到的是:一个男人走路、下井、开门、看水、说一句“我不是一个人”。
为什么辐射计归零是反常?绿洲为什么重要?最后凭什么判断还有人?这三个因果全都没拍出来。 观众看完只会觉得“画面还行,但不知道在讲什么”。
2. 角色太单一
全片几乎只有 Elias 一个人。没有第二个可见角色,没有明确冲突,没有真实关系。所有的信息都靠旁白解释,但旁白本身也讲不清楚。
3. 声音不统一
这是我最意外的一点。每个镜头的声音都是 Seedance 2.0 原生生成的,结果十个镜头像换了三个演员。
后来我复盘才明白:文字描述“48 岁低沉沙哑男声”不等于固定的 voice ID。 每个镜头重新生成,模型就会重新“选演员、选录音棚、选情绪”。所以同一个人物的声音在不同镜头里变了。
4. 字幕误识别和误译
剪映自动识别的字幕暴露了一堆问题:
• `counter` 被翻成“柜台”(其实是 Geiger counter / 辐射计)
• `honest reading` 被翻成“诚实的阅读”(其实是仪表读数)
• `spring` 被翻成“春天”(其实指泉水,但上下文里也不清楚)
• 还识别出 `scromed` 这种错词

画面能成立,但九个关键帧仍无法说明“为什么出发、遇到什么、最后凭什么判断还有人”。
这些问题不是靠“超清画质”“补帧”或继续堆提示词能解决的。它们是剧本、声音和导演判断的问题。
---
六、下一次我会怎么改
如果还有下一轮,我不会再打开 LibTV 就生成。我会先把流程改成:
最终剧本 → 角色声音母带 → Whisper 对齐 → Meaning Unit → Visual Director → 角色/场景/道具资产 → 无声分镜 → 三镜 canary → 批量生成 → 剪辑与五项 QA几个关键改变:
1. 剧本先锁定,再进画布。
一句话故事必须能说清:主角是谁、想要什么、遇到什么、发现什么、结尾发生什么。然后做桌读、静音故事板测试,能看懂才生成。
2. 声音先固定为一条主轨。
同一角色的所有台词用同一个 voice ID、同一参考音频一次生成完整 MP3,再用 Whisper 做时间对齐。视频镜头默认只生成画面,后期铺已锁定的声音。
3. 三镜不过,不批量。
只生成开头、中段、结尾三镜,检查同一角色音色、脸、口型、轴线、光线和节奏。任何核心项失败,停止批量生成。
4. 结尾台词必须有画面证据。
如果最后说“我不是一个人”,画面至少要有新鲜脚印、人影、杯子、呼吸声等可见或可听的证据。没有证据就删掉台词。
---
七、结尾
这次最大的收获不是做出了什么作品,而是让我看清楚了一件事:
AI 已经把“一个人做出镜头”变成现实,但“一个人做出观众愿意看完的电影”,仍然需要编剧、导演、声音和剪辑四道判断。
LibTV 帮我跑通了生产线,这次失败则帮我找到了生产线前面缺失的门禁。
如果你也在尝试用 AI 做短片,建议先把剧本和声音这两道门锁好,再点批量生成。否则画面越漂亮,最后只会越可惜。
如果需要我把本次十镜头表、提示词结构、资产清单和完整 SOP 整理成可复制版本,可在后台回复:LibTV SOP。
---
素材来源说明
• 本次操作截图、视频、字幕:来自 2026-07-25 实际制作过程
• LibTV 与 Seedance 2.0 公开信息:来自 LiblibAI 与字节跳动官方页面
• 具体模型、积分、价格和权益以生成当天平台页面为准
