Skip to content

关于批量推理和梯度裁剪 #1

Description

@lyd-2022

很棒的工作!想请教一下作者该GRPO框架中的关于批量推理和梯度裁剪的问题。

  1. 目前看到作者把梯度累计开到了128,但是rollout推理似乎都是串行推理的,这样训练速度会很慢,请问作者有尝试过batch 推理吗?
  2. 还有就是框架中的设置应该没有进行梯度裁剪?训了一下发现grad_norm有一点高,reward不是很收敛,请问作者之前有关于梯度裁剪的实验吗?
Image Image

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions