【Bug已解决】DAPO loss is not normalized by gradient_accumulation_steps 解决方案
【Bug已解决】DAPO loss is not normalized by gradient_accumulation_steps 解决方案
一、现象长什么样
用 DAPO(Dynamic Sampling Policy Optimization)训练时,我们观察到:调大 gradient_accumulation_steps 后,训练…
2026/7/22 14:03:19