语音合成(TTS)(2026.08.25)
概念编号:090
一句话理解
TTS 就是让模型把文字“读出来”,生成具有语速、音色、停顿和情绪的语音。
具体解释
语音合成系统可以控制语言、音色、语速、音高和表达风格。它经常与 ASR 组成语音对话链路:ASR 把人声变成文字,模型处理文字,TTS 再把回答读出来。
边界与易混淆概念
- TTS 不等于 ASR:TTS 是文字转语音,ASR 是语音转文字。
- 声音像真人不等于真人授权:音色克隆涉及身份、同意和版权风险。
- 语音自然不等于内容正确:TTS 只负责表达,不验证文本事实。
例子
把文章转换成播客音频,或让客服 Agent 用指定音色回答用户,都是 TTS。
相关概念
来源
概念卡更新日志
- 2026.08.25|创建概念卡:复用已有 ASR 概念入口,补齐语音生成链路,登记为 090。
🔐 GitHub 评论(Giscus)
正在连接 GitHub 评论…