调优 MOSS 音质
先保证参考音频和默认设置可靠,再一次只调整一个参数。不要用提高增益掩盖源音频问题。
先检查参考音频
- 单人说话,背景安静,无音乐、混响和明显削波。
- 优先使用 3–8 秒清晰语音;过长参考音频会增加延迟和显存压力。
- 参考文本必须与实际朗读内容一致。
- 先用 WAV 验证,再考虑其他容器或编码格式。
稳定默认值
MOSS_PROMPT_AUDIO_MAX_SECONDS=8
MOSS_SAMPLE_MODE=fixed
MOSS_SEED=1234
MOSS_SEGMENT_LENGTH=120
MOSS_STREAM_CHUNK_SECONDS=0.40
MOSS_STREAM_PREBUFFER_SECONDS=0.75
MOSS_MAX_SILENCE_MS=480
MOSS_CROSSFADE_MS=12
MOSS_OUTPUT_TARGET_PEAK=0.86
MOSS_OUTPUT_GAIN=0.94
MOSS_OUTPUT_EDGE_FADE_MS=1.5
MOSS_REALTIME_STREAMING_DECODE=true
按场景微调
| 场景 | 建议 |
|---|---|
| NAS 稳定优先 | 保持 120 左右分段、固定采样、较短参考音频 |
| 中文长文本旁白 | 逐步提高分段长度,先试听段落连接和尾音 |
| 中英混排长文本 | 减少单段过长,确认英文处理策略符合内容 |
| 低延迟对话 | 缩短流式块;如果卡顿,增加预缓冲而不是盲目提高并发 |
按症状处理
| 现象 | 优先处理 |
|---|---|
| 爆音或削波 | 降低输入增益,保持目标峰值 0.86,检查参考音频是否已削波 |
| 边界有电流声 | 保持边缘淡入淡出和短 crossfade;必要时关闭实时逐帧解码对比 |
| 长静音 | 缩短最大静音,检查分段和参考音频尾部 |
| 重复读或尾部漂移 | 减小分段长度,降低单次文本复杂度 |
| 克隆 OOM | 先缩短参考音频,再降低并发或切换 CPU 验证 |
不要只凭波形判断
python scripts/analyze_audio_quality.py output.wav
最终仍要人工试听。没有爆音不等于语气自然;参数调整也应使用同一文本和参考音频做 A/B 对比。