使用 Text to Speech:先整理台词,再选择声音风格
在 PromptHub 使用 Text to Speech 时,不要只粘一整段文案。GitHub 原文的提示很具体:要写 voice style、gender、speed、emotion、pronunciation hints,并用自然标点控制停顿。
使用 Text to Speech:先整理台词,再选择声音风格
好的 TTS 输入像一份配音指导
在 PromptHub 使用 Text to Speech 时,不要只粘一整段文案。GitHub 原文的提示很具体:要写 voice style、gender、speed、emotion、pronunciation hints,并用自然标点控制停顿。
我建议先把台词按镜头或段落拆开,再为每段写声音目标。比如开头要 energetic,解释部分要 warm and patient,结尾 CTA 要 confident but not pushy。这样生成的声音更容易放进视频时间线。
一个具体示例
示例:给 20 秒产品广告配音,可以输入:“Convert to speech in Chinese Mandarin with an energetic but trustworthy female voice. Fast opening, then slightly slower for product benefit. Read API as A-P-I. Text: 今天的客户问题,不该散落在十几个群里。用 FlowDesk,把咨询、跟进和复盘放进同一个工作台。现在预约演示,10 分钟看懂你的团队漏在哪一步。”
生成后检查三件事:品牌词是否读对、节奏是否能贴合画面、尾句 CTA 是否清楚。如果要和数字人口型同步,还要把句子切得更短。
与视频声音层怎么配合
TTS 是人声主层,Music Generation 是音乐床,Sound Effects 是动作事件。PromptHub 把这些 skill 分开,是为了让你排查时能知道问题在台词、音乐还是音效,而不是把所有声音写进一个大 prompt。
边界与失败排查
它不支持文本里夹大量代码或特殊符号直接朗读,也不适合超长无分段文章。失败时排查语言是否明确、数字是否要写成中文读法、缩写是否给出发音、语气是否过多互相冲突、段落是否太长。GitHub 来源见 Text to Speech 的 SKILL.md。