【Bug已解决】TPOTrainer.evaluate() returns NaN eval_loss while training loss is finite 解决方案
【Bug已解决】TPOTrainer.evaluate() returns NaN eval_loss while training loss is finite 解决方案
一、现象长什么样
用 TPOTrainer(Token-level Policy Optimization)训练时,训练 loss 一直在合理的有限值附近波动,但调用 tr…
2026/7/21 23:44:06