很棒的工作!想请教一下作者该GRPO框架中的关于批量推理和梯度裁剪的问题。 1. 目前看到作者把梯度累计开到了128,但是rollout推理似乎都是串行推理的,这样训练速度会很慢,请问作者有尝试过batch 推理吗? 2. 还有就是框架中的设置应该没有进行梯度裁剪?训了一下发现grad_norm有一点高,reward不是很收敛,请问作者之前有关于梯度裁剪的实验吗? <img width="672" height="394" alt="Image" src="https://github.com/user-attachments/assets/93d3e7ac-549a-4e70-9f23-936ae3fee4c2" /> <img width="679" height="392" alt="Image" src="https://github.com/user-attachments/assets/c0b3d55e-1594-44e8-844f-4ad77858b1ae" />
很棒的工作!想请教一下作者该GRPO框架中的关于批量推理和梯度裁剪的问题。