直接回答
整篇作品应只设一个主音色和一组基准语速、音高、音量。AI先判断场景与段落意图,再在支持范围内小幅调整风格和节奏。避免相邻句使用跨度过大的风格,也不要为每句重建独立voice上下文,否则听感容易像换人。
SSML分别解决什么问题
| 控制 | 适用目的 | 风险 |
|---|---|---|
| break / 标点 | 章节、转折、强调前后的停顿 | 停顿过多会割裂语气 |
| prosody | 小范围语速、音高和音量变化 | 跨度过大造成角色不一致 |
| express-as | 服务支持的情感或说话风格 | 音色不支持时可能被忽略或报错 |
| sub / phoneme | 缩写、品牌名、专业词读音 | 必须验证目标语言与音素集 |
为什么“同一个音色”仍可能听起来不像一个人
音色代码相同,不代表合成上下文相同。相邻段落若从诗意朗读突然切到强烈同理心,或语速、音高、风格强度同时改变,声学表现会出现明显跳变。更稳定的方案是保留连续的voice范围,只在真实语义转折处改变一个主要维度,并把风格强度控制在可审听的窄范围。
连续性优先
先锁定音色、基准语速和总体叙述身份,再设计段落变化。情感标签是修饰,不是换角色。旁白、课程和品牌内容尤其应把“同一个人在说”放在戏剧性之前。
语速可以时快时慢,但要跟随语义
信息密集、数字、免责声明和关键结论应稍慢;过渡句、轻快描述和已知背景可以略快;问题抛出后、章节切换前和关键结论后可以增加停顿。变化应以段落或语义短语为单位,避免每个句子都随机改变百分比。
智能编排怎样判断段落情感
先判断内容类型与叙述身份,再分析每段的语义功能:开场建立注意、事实说明保持中性、故事冲突增强张力、温情回忆降低速度、行动号召提高能量。模型输出必须限制在所选音色真实支持的风格列表内,未知标签要在生成前删除或回退到自然风格。
SSML生成前必须做的校验
- 把正文作为文本节点转义,不能让“&、<、>”破坏XML。
- 只保留白名单元素、属性和值,禁止模型自造标签。
- 确保speak、voice和风格标签正确闭合,语言与音色区域匹配。
- 不支持的风格自动回退,禁止因为一个段落让整篇合成失败。
- 长文按安全边界分段,但保持同一音色、参数和顺序合并。
为什么试听和生成要保留版本
“重新生成”并不一定复现完全相同的韵律。每次试听应记录生成时间、正文快照、SSML快照、音色、区域、场景和费用信息;用户可以播放、比较、下载或标记采用版本。这样修改某一段时不会覆盖上一份可用成品。
发布前审听清单
- 相邻段落是否仍像同一个人在叙述;
- 品牌、姓名、缩写、数字和单位是否正确;
- 情绪变化是否有语义依据,是否过度表演;
- 语速与停顿是否适合目标平台和字幕节奏;
- 下载文件、正文和SSML是否对应同一版本。
AI VOICE STUDIO
查看有声内容创作把正文、编排和每次试听放进同一个项目
在Windows客户端选择音色、生成SSML、试听比较并保留可下载版本。