选择 AngeVoice 模型
先按使用场景选模型,再考虑参数。没有一个模型在所有设备和任务上都最好。
模型对比
| 模型 | 适合场景 | 优点 | 需要注意 |
|---|---|---|---|
| Kokoro | 日常中文朗读、Agent 对话、低延迟合成 | 轻量、预置音色、默认推荐 | 不支持参考音频克隆 |
| ZipVoice | 自定义音色、长文本和高质量克隆 | 可保存 Voice Profile,支持参考文本 | 冷启动和推理成本更高;参考音频应短且清晰 |
| MOSS-TTS-Nano | 参考音频克隆、需要不同语音风格的任务 | 支持临时或默认参考音频 | 更依赖参考音频质量和运行参数,资源占用更高 |
按目标选择
| 你的目标 | 先选 |
|---|---|
| 阅读器、通知、实时 Agent 语音 | Kokoro |
| 复刻一段短参考音频的音色 | ZipVoice 或 MOSS |
| 长文本旁白并希望保留自定义音色 | 先测试 ZipVoice,再比较 MOSS |
| 低功耗 NAS | Kokoro;克隆任务按需加载 |
| 显存有限的 GPU | 只加载当前使用的模型,允许其他模型回退 CPU |
参考音频和 Voice Profile
- 参考音频应单人、清晰、无背景音乐和混响。
- ZipVoice 官方建议使用较短参考音频;AngeVoice 接受更长输入,但不会自动替你判断质量。
- 保存 Voice Profile 时同时保存参考 WAV 和对应文本,后续调用只需使用 Profile ID。
- 浏览器录音需要 HTTPS 或
localhost。
切换模型后如何确认
curl http://127.0.0.1:8100/v1/models
curl http://127.0.0.1:8100/v1/models/current
查看实际 Provider、是否发生 CPU 回退和模型状态。第一次加载较慢不一定是故障;后续热请求更能反映日常速度。
内存和显存
默认只保留当前需要的模型,并允许空闲卸载。频繁切换模型会产生重新加载等待;同时常驻多个模型则会增加 RAM/VRAM 占用。个人部署通常不需要把三个模型全部预载。