我发现在GRPO训练的中后期,在采样生成过程中,有时会生成许多无关的内容直到达到最大生成token的数量,这就是所谓的reward hacking吗?这种现象应该在奖励函数上继续进行调整吗?有没有什么办法可以解决呢?强化小白,期待大家的回复!
我发现在GRPO训练的中后期,在采样生成过程中,有时会生成许多无关的内容直到达到最大生成token的数量,这就是所谓的reward hacking吗?这种现象应该在奖励函数上继续进行调整吗?有没有什么办法可以解决呢?强化小白,期待大家的回复!