【Bug已解决】[Bug] Zero-std reward groups produce spurious KL gradients when beta > 0 in GRPO/RLOO 解决方案
【Bug已解决】[Bug] Zero-std reward groups produce spurious KL gradients when beta > 0 in GRPO/RLOO 解决方案
一、现象长什么样
在 GRPO / RLOO 里开了 KL 正则(beta > 0)后,我们发现一个反直觉的现象:有些样本组明明…
2026/7/22 10:59:00