1. 没有办法通过一个字段控制音量,只能是提示词控制,不是很方便,如果第一次不理想,第二次也不理想,它没有记忆,音量稍微大一点儿和再大一点这个尺度不好拿捏,最好有个字段,是现在参考音频的音量的几倍,如3x,-1x等。 2. 同一段文案,同一个参考音频,多次克隆有的时候太离谱,不是很理想,有的语速很快,有的时候音色根本和原音频一点不像,最好还有参数可以调整