Video Agent Voice 根据分镜情绪生成配音和字幕
在 PromptHub 的 Skill 目录里,Video Agent Voice 是视频团队里的配音师。它把 script.md 转成 audio/voiceover.mp3 和 audio/subtitles.srt,还会生成 audio/voice-direction.md 配音指导表。
Video Agent Voice 根据分镜情绪生成配音和字幕
Video Agent Voice 是什么
在 PromptHub 的 Skill 目录里,Video Agent Voice 是视频团队里的配音师。它把 script.md 转成 audio/voiceover.mp3 和 audio/subtitles.srt,还会生成 audio/voice-direction.md 配音指导表。
它可以根据 storyboard.md 的情绪标注调整语速和情感,而不是用同一种语气读完整条片。
它先提取真正要读的文字
这个 Skill 会用脚本从 Markdown 逐字稿里提取纯文本,去掉场景提示、出处、标题、元数据和分隔线,只保留正文段落。
这一步很关键。很多 TTS 失败不是声音问题,而是把“## 案例一”“【出处】”这类不该朗读的内容也念了出来。
它把情绪映射到语速
如果存在 storyboard.md,Video Agent Voice 会构建 emotion-map.json。焦虑、压迫、快切会提高语速;震惊、冲击会放慢并停顿;权威、可信保持正常;温暖、日常稍慢。
它还会为自录音模式生成指导表。即使不用 TTS,创作者也能知道每段该怎么读。
一个具体示例
假设稿子开头是“你有没有想过,为什么效率工具越多,你越累?”分镜情绪标为焦虑、快切。Voice 会建议语速偏快,像在追问观众。
到了数据句“一天 8 小时,真正深度工作的时间可能不到 2 小时”,它会让“2 小时”前有停顿,并把重音落在数字上。字幕也会按音频时间生成。
适合什么场景
它适合中文知识视频、口播配音、自动字幕、自录音指导、草稿 TTS 和视频团队中的声音环节。
如果要改稿,应回到 Writer;如果要做音乐或复杂混音,它只负责旁白和字幕基础交付。
使用边界与失败排查
如果配音读出了标题或出处,检查纯文本提取规则是否生效。
如果语气太平,确认 storyboard.md 是否有情绪标注;没有分镜时,它只能使用默认语速。
更多说明可以看 Video Agent Voice 的 PromptHub 页面 和 GitHub 原始 Skill 文件。
结论
Video Agent Voice 的价值,是把逐字稿、情绪节奏、语音和字幕连起来。
它让配音不再是机械朗读,而是跟随分镜情绪变化的声音轨道。