AI WORKFLOW
用n8n搭AI播客生产线,最难的根本不是把文字变成声音
n8n 不负责让播客变得好听,它负责把选题、资料、脚本、配音、合成、审核和发布接成一条可追踪的生产线。
假设你要做一档 10 分钟的双人 AI 科普播客。
一位主播负责把问题问得像普通人,另一位“嘉宾”负责解释。每周更新三期,不追热点,专门把一个技术概念讲明白。
乍看之下,这件事已经很简单了。
找个大模型写脚本,再找一个 TTS 工具配音,不就完了?
真做一遍就知道,文字变成声音只占了很小一段。更麻烦的是前后那一长串脏活:选题从哪里来,资料有没有出处,两个角色会不会说串台词,某一段配音失败后要不要整期重做,背景音乐能不能用,最后是谁点头让它发布。
如果这些问题没处理好,你得到的不是播客生产线,只是一台会批量制造音频垃圾的机器。
n8n 真正能做的,也不是“替你做出一档好听的节目”。
它负责把选题、资料、脚本、配音、合成、审核、发布和数据回流接起来,让每一期节目都知道自己走到了哪一步,哪里失败了,下一步该找谁。
一、先把分工说清楚:谁写,谁配,谁负责不出事
做 AI 播客,最容易犯的错,是把所有东西都叫成“AI 自动生成”。
这句话听起来省事,落地时特别容易乱。
一条相对靠谱的生产线,至少要分成三层。
第一层是内容决策层。
人来决定这期讲什么,哪些资料能用,哪些观点还没有被证实,两个角色分别承担什么功能,以及最终成片能不能公开发布。节目好不好听、立场是否合适、事实是否经得起追问,这些不能甩给工作流。
第二层是音频生成层。
大模型可以整理资料、生成提纲、改写口语脚本;TTS 服务负责把台词变成声音;音频工具负责拼接、加停顿、统一响度、插入片头片尾和背景音乐。
第三层才是 n8n 编排层。
它接收选题,调用模型,把脚本拆成一句句台词,给不同角色绑定固定声音,轮询配音任务状态,把成功和失败的片段分别记录,再触发审核、合成、通知与归档。
n8n 官方模板库里已经能看到几种简化版本:有工作流会读取 RSS,调用大模型改写,再用 ElevenLabs 生成声音并发送到 Telegram;也有模板把 PDF 文本提取出来,用 Gemini 生成对话脚本,再转换成 WAV 文件。
这些模板证明“资料进来,音频出去”是能接通的。
但接通,不等于能长期生产。
公开模板通常演示的是一条最短路径。真正要做成周更节目,还得补上内容核验、角色管理、失败重试、人工试听、版权检查和版本归档。
二、拿一档 10 分钟节目举例,整条线到底怎么跑
下面用一个明确的假设场景来拆。
节目暂时叫《AI 这事别急》。每期 8 到 12 分钟,角色固定:主播“小安”负责追问,嘉宾“小奇”负责解释。第一期的题目是:RAG 为什么不能只看回答像不像真的?
整条工作流可以压成六个主要阶段。
1. 选题进入队列,但不立刻开写
选题可以来自 Notion、飞书表格、Airtable、Google Sheets,也可以来自读者留言、RSS 或内部选题库。
每条选题至少要有几个字段:
- episode_id:这一期的唯一编号
- topic:选题
- audience:讲给谁听
- target_duration:目标时长
- source_urls:资料链接
- status:当前状态
- owner:谁负责审核
当状态从“想法”改成“待研究”,n8n 才启动后续流程。
这一步看着麻烦,却能挡住一种常见浪费:脑子一热想到一个题,模型已经写完八千字,最后才发现它不适合做播客。
2. 搜集资料,但把“事实”和“观点”分开
工作流读取已有链接、RSS、PDF 或知识库,把资料统一保存,再让模型做摘要。
这里不能只保留一段“总结”。最好同时保存原始链接、原文片段、发布日期和引用位置。模型可以帮你找矛盾、列证据、标出待核实项,但不能因为它写得顺,就把一句推测当成事实。
比如节目里要说“多数 RAG 项目没有评估集”,如果手里没有可靠调查,就不要硬塞一个比例。可以改成:“行业里经常能看到只凭几次手测判断效果的项目。”
听起来没那么炸,但经得起追问。
资料整理完成后,先做一次来源检查。
审核者能看到这期准备回答什么问题、用了哪些来源、还有哪些内容没核实。来源不清就退回,不进入脚本生成。它更像编辑的日常核对,后面三道正式闸门留给脚本、声音样片和最终成片。
3. 脚本不是一整块文本,而是一张台词表
很多人让大模型一次性输出完整对话,然后直接丢给 TTS。
这么做最省步骤,也最容易翻车。
长脚本里只要有一个角色名写错、一个英文缩写读歪,后面就得重新切分。更稳的办法,是让模型按结构化格式输出:
- segment_id
- speaker
- text
- emotion
- pause_after_ms
- pronunciation_note
- source_ref
每一句台词都知道是谁说的、说完停多久、哪个术语需要特殊读法、事实来自哪里。
“小安”不负责假装懂技术,她的任务是追问:“这句话普通人该怎么理解?”
“小奇”也不能连续讲五分钟。每隔一两段就要被打断、举例或者回到问题。
这才像对谈。把两段百科摘要轮流朗读,不叫双人播客。
脚本完成后进入第一道人工作业闸门:脚本批准。
人要重点看三件事:有没有事实错误,有没有嘴上根本说不出来的句子,两个角色的功能有没有混在一起。
4. 多角色配音,先做试听样片
脚本通过后,n8n 按 speaker 分流。
“小安”的台词调用 Voice A,“小奇”的台词调用 Voice B。每段音频保存自己的文件地址、时长、生成次数、费用和状态。
别一上来就生成整期。
先从开头、中段和结尾各抽一小段,合成 30 到 60 秒试听样片。这就是第二道人工作业闸门。人确认语速、音色、角色区分和术语读音后,再批量生成剩余台词。
这一步能省掉很多冤枉钱。声音模型参数不对时,整期重做远比三段试听贵。
如果某一段失败,n8n 只重试这一段,不重新生成已经成功的 80 段。连续失败超过阈值,就停下来通知人,而不是无限重试把额度烧光。
声音克隆也要在这里设死规矩:只使用自有声音、获得明确授权的声音,或者平台提供的合法预设音色。不要默认模仿真人、嘉宾或公众人物的声音。声音像谁,从来不是一个纯技术问题。
5. 合成不是把 MP3 首尾相接
所有台词生成后,工作流进入音频合成。
最基础的处理包括:
- 按台词顺序拼接
- 插入自然停顿
- 统一采样率和音量
- 处理过长静音与爆音
- 加入片头、片尾和转场
- 导出节目文件与试听版
如果还要加背景音乐,必须提前维护可用素材库和授权信息。音乐文件不能只记录一个地址,还要记录来源、许可范围和到期时间。
n8n 可以负责挑选“已授权且适合科技栏目”的音乐,不能替你判断一段音乐用了会不会侵权。
成片出来后进入第三道人工作业闸门:最终音频批准。
审核者最好真的戴耳机从头听一遍。文字审核通过,不代表音频就没问题。重复台词、错位停顿、角色串音、英文读音和突然变大的背景音乐,只有听的时候才暴露。
6. 先生成发布草稿,再让数据回来
最终批准后,工作流可以自动生成:
- 节目标题
- Show Notes
- 时间轴
- 引用资料
- 封面文案
- 平台简介
- 社交媒体预告
但我不建议默认全自动公开发布。
更稳的做法,是先把音频、标题和简介写入播客托管平台的草稿,或者存进云盘并通知负责人。人最后检查一次,再点发布。
发布后,播放量、完播率、跳出位置、收藏、评论和订阅变化可以定期回流到选题表。
下一期不需要机械复制“播放最高的题”。你更该看:听众在哪一段离开,是开头太慢,还是解释太绕;哪类问题留言最多,说明哪里还没讲透。
数据回流不是给模型发奖状,是帮编辑决定下一期怎么改。
三、n8n 在里面最值钱的,是让失败有地方可去
内容工作流真正折磨人的,通常不是主流程,而是异常。
TTS 接口超时了怎么办?
某句台词超过接口长度限制怎么办?
音频生成成功了,但返回地址半小时后失效怎么办?
审核者两天没回复,这一期要继续等还是自动提醒?
节目已经合成,才发现第 37 段引用错了,是整期重做,还是只替换这一段?
这些事大模型不会主动替你收拾。
n8n 可以给每一期节目维护一张状态表:
- research_pending
- outline_review
- script_review
- voice_sample_review
- tts_generating
- audio_composing
- final_review
- draft_ready
- published
- failed
每个环节只处理符合条件的任务。失败时记录最后一个节点、错误信息、重试次数和关联文件,再把通知发给对应的人。
n8n 官方文档也提供错误工作流:主工作流执行失败后,可以触发单独的 Error Trigger 流程,把失败节点、错误信息和执行记录发到邮件或 Slack。此前成功的执行数据还能被重新载入,用来定位问题。
如果工作流里用了 AI Agent,n8n 还支持在特定工具执行前暂停,发送审批请求。审核者可以批准,也可以拒绝。公开发送、修改记录、删除数据、购买和发布这类动作,本来就应该多一道闸门。
自动化的价值,不是永远不出错。
是出错以后,你知道错在哪,不用从头翻聊天记录、文件夹和十几个平台找尸体。
四、这条生产线最容易踩的五个坑
第一个坑,是把文章摘要直接当播客。
书面文字可以密,耳朵接不住。脚本必须有追问、重复、例子和停顿。读起来顺,不等于听起来顺。
第二个坑,是让两个角色说同一种话。
如果主持人和嘉宾都在输出完整答案,多角色只剩下两个音色。角色的差异应该先写进任务,再写进声音。
第三个坑,是先追求全自动发布。
刚搭好流程时,最该自动化的是搬运、拆分、状态记录和失败提醒。审核不应该第一个被删掉。
第四个坑,是忽略成本阈值。
长脚本、多角色、反复重试都会吃掉 TTS 额度。每一期、每一段都要记录生成次数和费用。达到阈值就暂停,别让一个标点错误触发十轮重做。
第五个坑,是把声音和音乐当免费素材。
声音克隆需要授权,嘉宾身份不能伪造,背景音乐也有许可范围。工作流里应该保留素材来源和授权记录,而不是等平台下架后再补课。
五、真要开始,先做一条 3 分钟的半自动样片
别先画一张 80 个节点的流程图。
第一版只做六件事:
1. 手动填一个选题和三条可靠资料。
2. 让模型生成两人对话台词表。
3. 人工批准脚本。
4. 用两个合法音色生成 3 分钟音频。
5. 人工试听后合成最终文件。
6. 把成片和 Show Notes 存进一个固定文件夹。
先看这 3 分钟到底好不好听,再决定要不要加 RSS、自动搜集、平台草稿、数据回流和多渠道分发。
很多自动化项目死掉,不是节点不够多,而是第一版就想把所有人赶出流程。
播客尤其不适合这么干。
机器可以把资料搬得很快,把台词拆得很细,把声音生成得越来越像真人。可节目有没有判断,哪些话该停一下,哪句解释听着像在背说明书,最后还是要有人听。
n8n 负责把这群人和工具接起来。
至于节目值不值得听,别让工作流替你回答。
以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~
谢谢你看我的文章,我们,下次再见。
参考资料
n8n Workflow:AI podcast generator with RSS feed & ElevenLabs voice https://n8n.io/workflows/5084
n8n Workflow:Convert PDF documents to AI podcasts with Google Gemini and Text-to-Speech https://www.n8n.io/workflows/4883-convert-pdf-documents-to-ai-podcasts-with-google-gemini-and-text-to-speech/
n8n Docs:Human-in-the-loop for tools https://docs.n8n.io/advanced-ai/human-in-the-loop-tools/
n8n Docs:Handle errors gracefully https://docs.n8n.io/flow-logic/error-handling/
如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连。我们下篇见。
