我使用codex写了一个html页面,能正常连接服务,使用A100机器跑,实时率超过1,所以回复很慢,说话语音上传推理的速度大于模型推理的速度,所以导致我一段话说完了,模型还在推理上几秒的内容,导致反应很慢,这种应该怎么解决呢
我使用codex写了一个html页面,能正常连接服务,使用A100机器跑,实时率超过1,所以回复很慢,说话语音上传推理的速度大于模型推理的速度,所以导致我一段话说完了,模型还在推理上几秒的内容,导致反应很慢,这种应该怎么解决呢