使用 Video Agent Voice 做视频旁白时,如何处理语气、台词和时间轴
很多口播问题,不是声音不够自然,而是台词和画面没有时间关系。PromptHub 里的 Video Agent Voice,做法就是先把逐字稿切成能读、能停、能对上的段落,再去生成配音和字幕。
使用 Video Agent Voice 做视频旁白时,如何处理语气、台词和时间轴
PromptHub 里这条旁白线,关键是先按句切开
很多口播问题,不是声音不够自然,而是台词和画面没有时间关系。PromptHub 里的 Video Agent Voice,做法就是先把逐字稿切成能读、能停、能对上的段落,再去生成配音和字幕。
它会把 script.md 变成 audio/voiceover.mp3、audio/subtitles.srt,必要时还会输出 audio/voice-direction.md。
先决定怎么读,再生成声音
这个 Skill 的工作顺序很清楚:
- 提取纯文本,去掉标题、出处、场景提示和分隔线
- 如果有
storyboard.md,先生成情绪映射 - 再按情绪去控制语速、停顿和语气
- 最后生成语音、字幕和配音指导表
如果是自录音模式,指导表会直接告诉你每段怎么读;如果是 TTS 模式,它也能作为质检参考。
不同场景可以用不同引擎
中文正式发布通常优先 MiniMax Speech-02,草稿可以用 Edge-TTS,英文内容可以考虑 ElevenLabs,自录音则最自由。
这个选择不是花活,而是为了让声音成本、质量和语言适配更平衡。
一个具体示例
假设你在做课程广告旁白,开头是追问,中段是解释,结尾是召唤行动。
你可以把开头那句设成快一点、带追问感;把中间的解释句放正常语速;把结尾的 CTA 说得更稳一点,给观众一个明确停顿。这样声音和画面才是一套,而不是各自跑各自的。
它适合什么场景
它适合广告旁白、产品讲解、数字人、课程视频和短视频口播。
它不负责改稿,也不负责画面设计。脚本要回到 Writer,镜头要回到 Storyboarder。
使用边界与失败排查
如果配音读出了标题或出处,先检查纯文本提取。
如果语气太平,确认有没有情绪标注;没有的话,就补 storyboard 或手动写配音指导。
如果要正式上线,语言、发音、情绪、肖像和声音授权都要一起核对。
更多说明可以看 Video Agent Voice 的 PromptHub 页面 和 GitHub 原始 Skill 文件。
结论
Video Agent Voice 的价值,是把逐字稿变成可控的语音和字幕。
它适合把旁白正式接进视频制作流程。