Docs/AngeVoice

调优 MOSS 音质

先保证参考音频和默认设置可靠,再一次只调整一个参数。不要用提高增益掩盖源音频问题。

MOSS参考音频音质

先检查参考音频

稳定默认值

MOSS_PROMPT_AUDIO_MAX_SECONDS=8
MOSS_SAMPLE_MODE=fixed
MOSS_SEED=1234
MOSS_SEGMENT_LENGTH=120
MOSS_STREAM_CHUNK_SECONDS=0.40
MOSS_STREAM_PREBUFFER_SECONDS=0.75
MOSS_MAX_SILENCE_MS=480
MOSS_CROSSFADE_MS=12
MOSS_OUTPUT_TARGET_PEAK=0.86
MOSS_OUTPUT_GAIN=0.94
MOSS_OUTPUT_EDGE_FADE_MS=1.5
MOSS_REALTIME_STREAMING_DECODE=true

按场景微调

场景建议
NAS 稳定优先保持 120 左右分段、固定采样、较短参考音频
中文长文本旁白逐步提高分段长度,先试听段落连接和尾音
中英混排长文本减少单段过长,确认英文处理策略符合内容
低延迟对话缩短流式块;如果卡顿,增加预缓冲而不是盲目提高并发

按症状处理

现象优先处理
爆音或削波降低输入增益,保持目标峰值 0.86,检查参考音频是否已削波
边界有电流声保持边缘淡入淡出和短 crossfade;必要时关闭实时逐帧解码对比
长静音缩短最大静音,检查分段和参考音频尾部
重复读或尾部漂移减小分段长度,降低单次文本复杂度
克隆 OOM先缩短参考音频,再降低并发或切换 CPU 验证

不要只凭波形判断

python scripts/analyze_audio_quality.py output.wav

最终仍要人工试听。没有爆音不等于语气自然;参数调整也应使用同一文本和参考音频做 A/B 对比。